Ollama biến việc chạy một mô hình cục bộ thành một cài đặt một dòng. Đây là hướng dẫn; để có bức tranh thành thật về những gì suy luận CPU làm được và không làm được (và điểm ngọt của RAG), xem ca sử dụng VPS cho Ollama và tự lưu trữ Ollama.
1. Cài Ollama
curl -fsSL https://ollama.com/install.sh | sh
Việc đó cài Ollama và khởi động nó như một dịch vụ systemd lắng nghe tại localhost:11434.
2. Kéo và chạy một mô hình nhỏ
Trên máy CPU, bắt đầu nhỏ:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Mô hình 3B thực sự dùng được trên CPU; 7–8B chạy ở vài token/giây (ổn cho batch, khổ cho chat); 13B+ sẽ swap và bò — đừng.
3. Gọi API HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embedding là điểm ngọt của CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Giữ ở localhost — phơi bày an toàn nếu cần
Ollama mặc định gắn vào 127.0.0.1:11434. Cứ để nó ở đó. Nếu bạn cần tiếp cận từ máy khác, đặt phía trước một reverse proxy có xác thực trên gói IP riêng (hướng dẫn nginx + HTTPS) hoặc dùng một đường hầm SSH — đừng bao giờ phơi bày công khai một endpoint mô hình không xác thực.
Phần thành thật
Đây là các instance chỉ CPU (không GPU). Mô hình lượng tử hóa nhỏ và embedding chạy tốt; loại lớn thì không. Ghép Ollama với một cơ sở dữ liệu vector cho một ngăn xếp RAG riêng tư — embedding cục bộ nhỏ cộng với một kho vector cục bộ là thiết lập thực sự tỏa sáng ở đây. Medium (12 $/tháng, 6 GB) là gói thoải mái. Root trong khoảng một phút, không KYC, thanh toán bằng crypto.
Bình luận
Chưa có bình luận nào. Hãy là người đầu tiên.