EQVPS

Tự host một LLM cục bộ trên một VPS với Ollama — cái gì thực sự hoạt động

14 thg 6, 2026 · 4 phút đọc · EQVPS Team

Gửi mọi prompt tới API của người khác thì ổn — cho tới khi không ổn. Có thể dữ liệu nhạy cảm và bạn thà nó không bao giờ rời máy chủ của bạn. Có thể bạn chán giới hạn tần suất, hoặc một phiên bản mô hình thay đổi dưới chân bạn, hoặc một đồng hồ theo-token tích tắc trong khi bạn thí nghiệm. Ở một điểm nào đó "nếu tôi chỉ tự chạy?" ngừng là một thí nghiệm tư duy.

Ollama làm điều đó thực sự dễ. Câu hỏi khó hơn là cái gì vừa một VPS — và ở đây câu trả lời trung thực quan trọng hơn sự thổi phồng.

Cái bạn thực sự có thể chạy trên CPU

Không GPU? Vậy bạn đang làm suy luận CPU, và kích cỡ mô hình là tất cả. Lượng tử hóa (bóp các trọng số xuống 4-bit) là cái làm điều này thực tế — bạn mất một mảnh chất lượng và tiết kiệm một đống bộ nhớ.

Các con số đại khái, những cái quan trọng:

Tốc độ, một cách trung thực: trên vài vCPU bạn sẽ thấy một nhúm token mỗi giây. Hoàn toàn ổn cho một chatbot hoặc một trợ lý lập trình nơi bạn đọc khi nó gõ. Không ổn cho xử lý-theo-lô một triệu tài liệu — đó là một việc GPU, và chúng tôi không giả vờ khác đi. Chúng tôi không cung cấp các instance GPU. Nếu kế hoạch của bạn cần một mô hình 70B hoặc thông lượng nặng, một VPS CPU — của chúng tôi hay của bất kỳ ai — là công cụ sai, và bạn nên biết điều đó trước khi bạn chi một xu.

Nhưng một 7B riêng tư trả lời các câu hỏi của bạn và không bao giờ gọi về nhà? Cái đó chạy thoải mái trên một cỗ máy 6 GB.

Cài đặt — ba lệnh

Dựng lên máy chủ, SSH vào, và:

curl -fsSL https://ollama.com/install.sh | sh   # cài Ollama
ollama run llama3.2:3b                            # kéo + chạy một mô hình 3B

Đó là tất cả — bạn đang chat trong terminal. Để dùng nó từ mã của riêng bạn, Ollama đã phục vụ một API HTTP trên cổng 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Một điểm bắt đáng biết trước: mặc định API đó gắn vào localhost. Giữ nó như vậy và tunnel qua SSH, nếu không nó phơi ra internet. Nếu bạn muốn nó tới được, đặt nó sau xác thực — đừng để một endpoint mô hình mở trên một IP công khai.

Chọn cỗ máy

Khớp gói với mô hình, không phải ngược lại:

Bạn muốn chạyRAM bạn cầnGói hợp lý
Mô hình 3B, dùng nhẹ~3 GBSmall (4 GB)
Mô hình 7B, thoải mái~5-6 GBMedium (6 GB)
Lớn hơn / thông lượng caolãnh địa GPUkhông phải một VPS CPU

Cho hầu hết những người tự host, Medium (6 GB) là khuyến nghị trung thực — đủ dư địa cho một mô hình 7B cộng ứng dụng của bạn và OS. Small (4 GB) hoạt động nếu bạn bám 3B. Bất cứ gì dưới đó là quá sát một khi OS và ngữ cảnh ăn vào.

Vì sao làm nó ở đây

Nếu bạn tự host một LLM, quyền riêng tư thường là một nửa lý do — nên sẽ lạ khi giao giấy tờ của bạn để thuê cỗ máy. Bạn không phải: bạn có thể thanh toán bằng USDC hoặc USDT (hoặc một thẻ qua on-ramp), không KYC, và máy chủ là của bạn trong khoảng một phút. Crypto-native, thân thiện agent, và dữ liệu ở lại trên một cỗ máy bạn kiểm soát.

Đánh đổi là cái chúng tôi đã trung thực: chỉ CPU, một trần 6 GB, các mô hình nhỏ. Trong đó, tự host tuyệt. Ngoài nó, đừng để ai bán bạn một cỗ máy CPU cho một việc cần một GPU.

Sẵn sàng thử? Chọn một gói, thanh toán, và bạn sẽ có root trong khoảng 60 giây — rồi ba lệnh tới mô hình riêng tư của riêng bạn.

FAQ

Tôi có thể chạy một LLM mà không có GPU không?

Có, cho các mô hình nhỏ. Một mô hình 3B hoặc 7B ở lượng tử hóa 4-bit chạy trên CPU và trả lời ở tốc độ đọc được — ổn cho một chatbot, một trợ lý lập trình, hoặc các nhiệm vụ nền nơi bạn không canh con trỏ. Cái bạn không thể làm trên CPU là phục vụ một mô hình lớn (13B trở lên) hoặc đẩy thông lượng cao; đó là nơi một GPU ngừng là tùy chọn.

Tôi cần bao nhiêu RAM cho Llama 7B?

Khoảng 5 GB cho một mô hình 7B 4-bit một khi bạn thêm cửa sổ ngữ cảnh và OS — nên một cỗ máy 6 GB là mức sàn thoải mái. Một mô hình 3B vừa trong khoảng 3 GB. Lượng tử hóa nhỏ hơn (Q4) đánh đổi một chút chất lượng cho ít bộ nhớ hơn nhiều, vốn là đánh đổi đúng trên một VPS.

Tự host một LLM có rẻ hơn một API không?

Tùy khối lượng. Một API được host tính theo token và không tốn gì khi nhàn rỗi; một VPS là một hóa đơn hàng tháng cố định dù bạn dùng nó hay không. Nếu bạn chạy một dòng yêu cầu đều đặn, hoặc bạn chủ yếu quan tâm quyền riêng tư và không giới hạn tần suất, tự host thắng. Cho các prompt một lần thỉnh thoảng, một API đo lường rẻ hơn.

Vì sao tự host thay vì dùng một API cloud?

Ba lý do người ta thực sự làm: dữ liệu không bao giờ rời máy chủ của bạn (thật cho pháp lý, y tế, hoặc chỉ ghi chú riêng tư), không giới hạn tần suất hay đồng hồ theo-token, và mô hình sẽ không thay đổi hay bị ngừng dưới bạn. Chi phí là bạn quản lý cỗ máy và sống trong phần cứng của nó.

Mô hình lớn nhất tôi thực tế có thể chạy trên một VPS CPU là gì?

Một mô hình 7B ở 4-bit là điểm ngọt trên một cỗ máy 6 GB. Bạn về kỹ thuật có thể nạp một 13B với đủ RAM, nhưng trên CPU nó chậm đủ để bạn cảm nhận. Quá đó bạn muốn một GPU, vốn là một loại host khác.

← Quay lại blogXem gói & giá →

Bình luận

Chưa có bình luận nào. Hãy là người đầu tiên.

Để lại bình luận

Bình luận được kiểm duyệt trước khi hiển thị.