Gửi mọi prompt tới API của người khác thì ổn — cho tới khi không ổn. Có thể dữ liệu nhạy cảm và bạn thà nó không bao giờ rời máy chủ của bạn. Có thể bạn chán giới hạn tần suất, hoặc một phiên bản mô hình thay đổi dưới chân bạn, hoặc một đồng hồ theo-token tích tắc trong khi bạn thí nghiệm. Ở một điểm nào đó "nếu tôi chỉ tự chạy?" ngừng là một thí nghiệm tư duy.
Ollama làm điều đó thực sự dễ. Câu hỏi khó hơn là cái gì vừa một VPS — và ở đây câu trả lời trung thực quan trọng hơn sự thổi phồng.
Cái bạn thực sự có thể chạy trên CPU
Không GPU? Vậy bạn đang làm suy luận CPU, và kích cỡ mô hình là tất cả. Lượng tử hóa (bóp các trọng số xuống 4-bit) là cái làm điều này thực tế — bạn mất một mảnh chất lượng và tiết kiệm một đống bộ nhớ.
Các con số đại khái, những cái quan trọng:
- Mô hình 3B, 4-bit — ~3 GB RAM. Đủ nhanh nhẹn cho chat và các nhiệm vụ đơn giản.
- Mô hình 7B, 4-bit — ~5 GB RAM. Điểm ngọt: thông minh hơn đáng kể, vẫn chạy ở tốc độ đọc được.
- 13B trở lên — 8-10 GB+ và chậm trên CPU. Về kỹ thuật khả thi, thực tế phiền.
Tốc độ, một cách trung thực: trên vài vCPU bạn sẽ thấy một nhúm token mỗi giây. Hoàn toàn ổn cho một chatbot hoặc một trợ lý lập trình nơi bạn đọc khi nó gõ. Không ổn cho xử lý-theo-lô một triệu tài liệu — đó là một việc GPU, và chúng tôi không giả vờ khác đi. Chúng tôi không cung cấp các instance GPU. Nếu kế hoạch của bạn cần một mô hình 70B hoặc thông lượng nặng, một VPS CPU — của chúng tôi hay của bất kỳ ai — là công cụ sai, và bạn nên biết điều đó trước khi bạn chi một xu.
Nhưng một 7B riêng tư trả lời các câu hỏi của bạn và không bao giờ gọi về nhà? Cái đó chạy thoải mái trên một cỗ máy 6 GB.
Cài đặt — ba lệnh
Dựng lên máy chủ, SSH vào, và:
curl -fsSL https://ollama.com/install.sh | sh # cài Ollama
ollama run llama3.2:3b # kéo + chạy một mô hình 3B
Đó là tất cả — bạn đang chat trong terminal. Để dùng nó từ mã của riêng bạn, Ollama đã phục vụ một API HTTP trên cổng 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Một điểm bắt đáng biết trước: mặc định API đó gắn vào localhost. Giữ nó như vậy và tunnel qua SSH, nếu không nó phơi ra internet. Nếu bạn muốn nó tới được, đặt nó sau xác thực — đừng để một endpoint mô hình mở trên một IP công khai.
Chọn cỗ máy
Khớp gói với mô hình, không phải ngược lại:
| Bạn muốn chạy | RAM bạn cần | Gói hợp lý |
|---|---|---|
| Mô hình 3B, dùng nhẹ | ~3 GB | Small (4 GB) |
| Mô hình 7B, thoải mái | ~5-6 GB | Medium (6 GB) |
| Lớn hơn / thông lượng cao | lãnh địa GPU | không phải một VPS CPU |
Cho hầu hết những người tự host, Medium (6 GB) là khuyến nghị trung thực — đủ dư địa cho một mô hình 7B cộng ứng dụng của bạn và OS. Small (4 GB) hoạt động nếu bạn bám 3B. Bất cứ gì dưới đó là quá sát một khi OS và ngữ cảnh ăn vào.
Vì sao làm nó ở đây
Nếu bạn tự host một LLM, quyền riêng tư thường là một nửa lý do — nên sẽ lạ khi giao giấy tờ của bạn để thuê cỗ máy. Bạn không phải: bạn có thể thanh toán bằng USDC hoặc USDT (hoặc một thẻ qua on-ramp), không KYC, và máy chủ là của bạn trong khoảng một phút. Crypto-native, thân thiện agent, và dữ liệu ở lại trên một cỗ máy bạn kiểm soát.
Đánh đổi là cái chúng tôi đã trung thực: chỉ CPU, một trần 6 GB, các mô hình nhỏ. Trong đó, tự host tuyệt. Ngoài nó, đừng để ai bán bạn một cỗ máy CPU cho một việc cần một GPU.
Sẵn sàng thử? Chọn một gói, thanh toán, và bạn sẽ có root trong khoảng 60 giây — rồi ba lệnh tới mô hình riêng tư của riêng bạn.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.