Hãy xử lý phần đáng thất vọng trước, vì internet đầy những trang không làm vậy.
Máy chủ của chúng tôi chỉ có CPU. Chúng tôi không cung cấp GPU. Điều đó nghĩa là công việc LLM cục bộ ở đây có một trần cứng, và giả vờ khác đi chỉ phí tiền của bạn.
Cái gì thực sự hoạt động trên CPU
Với tối đa 6 vCPU và 6 GB RAM (gói Medium — $12/tháng của chúng tôi), bạn ở trong dải các mô hình lượng tử hóa nhỏ:
- Mô hình 1B–3B (Q4): thực sự dùng được. Đủ nhanh cho phân loại, gắn thẻ, định tuyến, và trích xuất có cấu trúc đơn giản.
- Mô hình 7B–8B (Q4): chạy được, nhưng hãy trông đợi vài token mỗi giây. Ổn cho một hàng đợi nhai qua tài liệu qua đêm. Đau đớn như một cửa sổ chat.
- Mô hình embedding: vừa xuất sắc. Chúng nhỏ, nhanh trên CPU, và đây có lẽ là lý do đơn tốt nhất để chạy Ollama trên một cỗ máy như của chúng tôi.
- 13B trở lên: đừng. Bạn sẽ swap và chờ đợi.
Nếu bạn cần một cuộc chat 70B tương tác, nhanh, bạn cần một host GPU — đó là một sản phẩm khác từ một nhà cung cấp khác, và chúng tôi thà nói với bạn còn hơn lấy $12 của bạn.
Nơi một cỗ máy CPU thực sự thắng
Quyền riêng tư. Tài liệu của bạn, prompt của bạn, embedding của bạn — không bao giờ rời một cỗ máy bạn kiểm soát, không bao giờ trở thành dữ liệu huấn luyện của ai đó. Với nhiều người đó là toàn bộ mục đích, và vài token mỗi giây là một đánh đổi chấp nhận được.
Chi phí dự đoán được. Không có hóa đơn theo token. Một pipeline phân loại năm mươi nghìn bản ghi tốn bằng một cái phân loại năm mươi: $12.
Công việc bất đồng bộ. Hầu hết công việc LLM hữu ích không phải một cửa sổ chat. Nó là một hàng đợi: tóm tắt cái này, gắn thẻ cái kia, embed corpus này. Một cỗ máy CPU nghiền qua một tồn đọng qua đêm hoàn toàn tốt ở việc đó.
Thiết lập
# Ubuntu 24.04 — khuyến nghị gói Medium
curl -fsSL https://ollama.com/install.sh | sh
# Bắt đầu với thứ gì đó nhỏ và tự xem cho mình
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embedding — điểm ngọt cho CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama phục vụ một API HTTP trên localhost:11434. Giữ nó ở đó. Nếu bạn cần tới nó từ nơi khác, đặt nó sau một reverse proxy có xác thực trên một gói IP riêng — đừng bao giờ phơi một endpoint mô hình không xác thực ra internet mở.
Ghép nó với một cơ sở dữ liệu vector (Qdrant hoặc pgvector trong Docker) và bạn có một stack RAG riêng tư hoàn chỉnh trên một cỗ máy $12. Sự kết hợp đó — embedding cục bộ nhỏ, vector store cục bộ, API bên ngoài chỉ cho bước sinh nặng — là thiết lập thực sự hợp lý trên phần cứng như thế này.
Chọn một gói
| Dùng | Gói | Giá |
|---|---|---|
| Embedding, mô hình 1–3B, pipeline RAG | Medium | $12/tháng |
| Cùng thế, cộng một endpoint công khai sau xác thực | Medium-IP | $20/tháng |
| Chỉ kiểm thử các mô hình nhỏ | Small | $8/tháng |
Chỉ CPU, tối đa 6 vCPU và 6 GB RAM. Lưu trữ NVMe, lưu lượng không đo lường, Đức hoặc Phần Lan. Thanh toán crypto, không KYC. Thanh toán theo năm là một giao dịch thay vì mười hai.
Đọc liên quan
- Host một vector DB cho bộ nhớ AI — nửa còn lại của một stack RAG riêng tư
- VPS cho AI agent — điều phối trên cùng cỗ máy
Sẵn sàng chưa? Triển khai một máy chủ → — hoạt động trong khoảng một phút, thanh toán bằng crypto, không cần giấy tờ.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.