EQVPS

Cách cài Ollama trên VPS (và gọi API của nó)

Cài Ollama trên VPS, kéo một mô hình nhỏ, và gọi API HTTP của nó — kèm lưu ý thành thật rằng đây là máy CPU, nên hãy bám vào các mô hình lượng tử hóa nhỏ và embedding. Lệnh sao chép-dán, và cách phơi bày nó an toàn.

Ollama biến việc chạy một mô hình cục bộ thành một cài đặt một dòng. Đây là hướng dẫn; để có bức tranh thành thật về những gì suy luận CPU làm được và không làm được (và điểm ngọt của RAG), xem ca sử dụng VPS cho Ollamatự lưu trữ Ollama.

1. Cài Ollama

curl -fsSL https://ollama.com/install.sh | sh

Việc đó cài Ollama và khởi động nó như một dịch vụ systemd lắng nghe tại localhost:11434.

2. Kéo và chạy một mô hình nhỏ

Trên máy CPU, bắt đầu nhỏ:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Mô hình 3B thực sự dùng được trên CPU; 7–8B chạy ở vài token/giây (ổn cho batch, khổ cho chat); 13B+ sẽ swap và bò — đừng.

3. Gọi API HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embedding là điểm ngọt của CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Giữ ở localhost — phơi bày an toàn nếu cần

Ollama mặc định gắn vào 127.0.0.1:11434. Cứ để nó ở đó. Nếu bạn cần tiếp cận từ máy khác, đặt phía trước một reverse proxy có xác thực trên gói IP riêng (hướng dẫn nginx + HTTPS) hoặc dùng một đường hầm SSH — đừng bao giờ phơi bày công khai một endpoint mô hình không xác thực.

Phần thành thật

Đây là các instance chỉ CPU (không GPU). Mô hình lượng tử hóa nhỏ và embedding chạy tốt; loại lớn thì không. Ghép Ollama với một cơ sở dữ liệu vector cho một ngăn xếp RAG riêng tư — embedding cục bộ nhỏ cộng với một kho vector cục bộ là thiết lập thực sự tỏa sáng ở đây. Medium (12 $/tháng, 6 GB) là gói thoải mái. Root trong khoảng một phút, không KYC, thanh toán bằng crypto.

FAQ

Làm sao cài Ollama trên VPS?

Một lệnh: curl -fsSL https://ollama.com/install.sh | sh. Rồi ollama pull một mô hình nhỏ và ollama run, hoặc gọi API HTTP tại localhost:11434. Các bước ở dưới. Trên VPS CPU hãy bám vào các mô hình lượng tử hóa nhỏ (1B–8B) và embedding — mô hình lớn cần GPU.

Mô hình có nhanh trên VPS CPU không?

Nhỏ thì có, lớn thì không. Kỳ vọng vài token mỗi giây trên mô hình 7–8B ở lượng tử hóa 4-bit, và hiệu năng thực sự nhanh nhẹn trên mô hình 1–3B và mô hình embedding. Tuyệt cho job nền, phân loại và pipeline RAG — không phải cho chat tương tác nhanh trên mô hình lớn.

Tôi có nên phơi bày API của Ollama ra internet không?

Không. Giữ nó ở localhost:11434. Nếu cần truy cập từ xa, đặt nó sau một reverse proxy có xác thực trên gói IP riêng, hoặc tiếp cận qua một đường hầm SSH. Đừng bao giờ phơi bày một endpoint mô hình không xác thực ra internet mở.

Tôi cần gói nào?

Medium của chúng tôi (12 $/tháng, 6 GB) phù hợp thoải mái với mô hình nhỏ và embedding; Small (8 $) dùng để thử mô hình 1–3B. Đây là các instance chỉ CPU — không GPU — nên hãy chọn kích thước theo dấu chân RAM của mô hình, không phải mong tốc độ.

Bạn có yêu cầu giấy tờ hay thẻ không?

Không. Một email để đăng ký, thanh toán bằng USDC hoặc USDT — không giấy tờ, không thẻ.

Bình luận

Chưa có bình luận nào. Hãy là người đầu tiên.

Để lại bình luận

Bình luận được kiểm duyệt trước khi hiển thị.