Ollama ทำให้การรันโมเดลในเครื่องกลายเป็นการติดตั้งบรรทัดเดียว นี่คือคู่มือ; สำหรับภาพตรงไปตรงมาว่าการอนุมานบน CPU ทำอะไรได้และไม่ได้ (และจุดหวานของ RAG) ดู กรณีใช้งาน VPS สำหรับ Ollama และ self-host Ollama
1. ติดตั้ง Ollama
curl -fsSL https://ollama.com/install.sh | sh
นั่นติดตั้ง Ollama และเริ่มมันเป็นเซอร์วิส systemd ที่ฟังอยู่ที่ localhost:11434
2. ดึงและรันโมเดลเล็ก
บนเครื่อง CPU เริ่มจากเล็ก:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
โมเดล 3B ใช้งานได้จริงบน CPU; 7–8B รันที่ไม่กี่ token/วินาที (โอเคสำหรับ batch, ทรมานสำหรับแชท); 13B+ จะ swap และคลานช้า — อย่าเลย
3. เรียก HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
embedding คือจุดหวานของ CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. เก็บไว้ที่ localhost — เปิดเผยอย่างปลอดภัยหากจำเป็น
Ollama ผูกกับ 127.0.0.1:11434 โดยค่าเริ่มต้น ปล่อยไว้ตรงนั้น ถ้าต้องเข้าถึงจากอีกเครื่อง ให้วาง reverse proxy ที่มีการยืนยันตัวตนไว้ด้านหน้าบน แพ็กเกจ IP เฉพาะ (คู่มือ nginx + HTTPS) หรือใช้อุโมงค์ SSH — อย่าเปิดเผย endpoint ของโมเดลที่ไม่มีการยืนยันตัวตนสู่สาธารณะเด็ดขาด
ส่วนที่ตรงไปตรงมา
เหล่านี้เป็นอินสแตนซ์ CPU ล้วน (ไม่มี GPU) โมเดล quantized ขนาดเล็กและ embedding รันได้ดี; ตัวใหญ่ไม่ จับคู่ Ollama กับ ฐานข้อมูลเวกเตอร์สำหรับสแตก RAG ส่วนตัว — embedding ในเครื่องขนาดเล็กบวกที่เก็บเวกเตอร์ในเครื่องคือการตั้งค่าที่โดดเด่นจริงตรงนี้ Medium ($12/เดือน, 6 GB) คือแพ็กเกจที่สบาย root ในราวหนึ่งนาที ไม่ต้อง KYC จ่ายด้วยคริปโต
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ