EQVPS

VPS cho Ollama và LLM cục bộ

Tự host các mô hình ngôn ngữ nhỏ trên một máy chủ CPU — riêng tư, không đo lường, thanh toán bằng crypto. Trung thực về điều suy luận CPU có thể và không thể làm. Từ $12/tháng.

Hãy xử lý phần đáng thất vọng trước, vì internet đầy những trang không làm vậy.

Máy chủ của chúng tôi chỉ có CPU. Chúng tôi không cung cấp GPU. Điều đó nghĩa là công việc LLM cục bộ ở đây có một trần cứng, và giả vờ khác đi chỉ phí tiền của bạn.

Cái gì thực sự hoạt động trên CPU

Với tối đa 6 vCPU và 6 GB RAM (gói Medium — $12/tháng của chúng tôi), bạn ở trong dải các mô hình lượng tử hóa nhỏ:

Nếu bạn cần một cuộc chat 70B tương tác, nhanh, bạn cần một host GPU — đó là một sản phẩm khác từ một nhà cung cấp khác, và chúng tôi thà nói với bạn còn hơn lấy $12 của bạn.

Nơi một cỗ máy CPU thực sự thắng

Quyền riêng tư. Tài liệu của bạn, prompt của bạn, embedding của bạn — không bao giờ rời một cỗ máy bạn kiểm soát, không bao giờ trở thành dữ liệu huấn luyện của ai đó. Với nhiều người đó là toàn bộ mục đích, và vài token mỗi giây là một đánh đổi chấp nhận được.

Chi phí dự đoán được. Không có hóa đơn theo token. Một pipeline phân loại năm mươi nghìn bản ghi tốn bằng một cái phân loại năm mươi: $12.

Công việc bất đồng bộ. Hầu hết công việc LLM hữu ích không phải một cửa sổ chat. Nó là một hàng đợi: tóm tắt cái này, gắn thẻ cái kia, embed corpus này. Một cỗ máy CPU nghiền qua một tồn đọng qua đêm hoàn toàn tốt ở việc đó.

Thiết lập

# Ubuntu 24.04 — khuyến nghị gói Medium
curl -fsSL https://ollama.com/install.sh | sh

# Bắt đầu với thứ gì đó nhỏ và tự xem cho mình
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embedding — điểm ngọt cho CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama phục vụ một API HTTP trên localhost:11434. Giữ nó ở đó. Nếu bạn cần tới nó từ nơi khác, đặt nó sau một reverse proxy có xác thực trên một gói IP riêng — đừng bao giờ phơi một endpoint mô hình không xác thực ra internet mở.

Ghép nó với một cơ sở dữ liệu vector (Qdrant hoặc pgvector trong Docker) và bạn có một stack RAG riêng tư hoàn chỉnh trên một cỗ máy $12. Sự kết hợp đó — embedding cục bộ nhỏ, vector store cục bộ, API bên ngoài chỉ cho bước sinh nặng — là thiết lập thực sự hợp lý trên phần cứng như thế này.

Chọn một gói

DùngGóiGiá
Embedding, mô hình 1–3B, pipeline RAGMedium$12/tháng
Cùng thế, cộng một endpoint công khai sau xác thựcMedium-IP$20/tháng
Chỉ kiểm thử các mô hình nhỏSmall$8/tháng

Chỉ CPU, tối đa 6 vCPU và 6 GB RAM. Lưu trữ NVMe, lưu lượng không đo lường, Đức hoặc Phần Lan. Thanh toán crypto, không KYC. Thanh toán theo năm là một giao dịch thay vì mười hai.

Đọc liên quan


Sẵn sàng chưa? Triển khai một máy chủ → — hoạt động trong khoảng một phút, thanh toán bằng crypto, không cần giấy tờ.

Sẵn sàng triển khai? Thanh toán bằng crypto, không KYC — trực tuyến trong khoảng một phút.

Triển khai ngay →

FAQ

Tôi có thể chạy Llama 70B trên cái này không?

Không. Các gói của chúng tôi chỉ có CPU với tối đa 6 GB RAM — đó là dải các mô hình lượng tử hóa nhỏ (khoảng 1B–8B ở 4-bit). Một mô hình 70B cần một GPU và nhiều bộ nhớ hơn nhiều. Chúng tôi không cung cấp GPU, và chúng tôi thà nói vậy còn hơn bán cho bạn một sự thất vọng.

Suy luận CPU nhanh đến đâu, thực sự?

Hãy trông đợi vài token mỗi giây trên một mô hình 7–8B ở lượng tử hóa 4-bit, và tốt hơn đáng kể trên các mô hình 1–3B. Điều đó ổn cho các công việc nền, embedding, phân loại, và các pipeline bất đồng bộ. Nó không ổn cho một cuộc chat tương tác nhanh nhẹn.

Vậy cái này thực sự tốt cho gì?

Embedding riêng tư, phân loại, hàng đợi tóm tắt, các pipeline RAG nơi độ trễ không quan trọng, và giữ dữ liệu khỏi các API bên thứ ba. Ngoài ra: học, kiểm thử, và tạo mẫu trước khi bạn thuê một GPU ở đâu đó.

Bạn có hỏi giấy tờ không?

Không. Email để đăng ký, USDC hoặc USDT để thanh toán. Vốn thường là lý do người ta muốn một mô hình riêng tư ngay từ đầu.

Bình luận

Chưa có bình luận nào. Hãy là người đầu tiên.

Để lại bình luận

Bình luận được kiểm duyệt trước khi hiển thị.