EQVPS

วิธีติดตั้ง Ollama บน VPS (และเรียก API ของมัน)

ติดตั้ง Ollama บน VPS, ดึงโมเดลเล็ก, และเรียก HTTP API ของมัน — พร้อมหมายเหตุตรงไปตรงมาว่านี่คือเครื่อง CPU จึงควรอยู่กับโมเดล quantized ขนาดเล็กและ embedding คำสั่งคัดลอก-วาง และวิธีเปิดเผยมันอย่างปลอดภัย

Ollama ทำให้การรันโมเดลในเครื่องกลายเป็นการติดตั้งบรรทัดเดียว นี่คือคู่มือ; สำหรับภาพตรงไปตรงมาว่าการอนุมานบน CPU ทำอะไรได้และไม่ได้ (และจุดหวานของ RAG) ดู กรณีใช้งาน VPS สำหรับ Ollama และ self-host Ollama

1. ติดตั้ง Ollama

curl -fsSL https://ollama.com/install.sh | sh

นั่นติดตั้ง Ollama และเริ่มมันเป็นเซอร์วิส systemd ที่ฟังอยู่ที่ localhost:11434

2. ดึงและรันโมเดลเล็ก

บนเครื่อง CPU เริ่มจากเล็ก:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

โมเดล 3B ใช้งานได้จริงบน CPU; 7–8B รันที่ไม่กี่ token/วินาที (โอเคสำหรับ batch, ทรมานสำหรับแชท); 13B+ จะ swap และคลานช้า — อย่าเลย

3. เรียก HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

embedding คือจุดหวานของ CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. เก็บไว้ที่ localhost — เปิดเผยอย่างปลอดภัยหากจำเป็น

Ollama ผูกกับ 127.0.0.1:11434 โดยค่าเริ่มต้น ปล่อยไว้ตรงนั้น ถ้าต้องเข้าถึงจากอีกเครื่อง ให้วาง reverse proxy ที่มีการยืนยันตัวตนไว้ด้านหน้าบน แพ็กเกจ IP เฉพาะ (คู่มือ nginx + HTTPS) หรือใช้อุโมงค์ SSH — อย่าเปิดเผย endpoint ของโมเดลที่ไม่มีการยืนยันตัวตนสู่สาธารณะเด็ดขาด

ส่วนที่ตรงไปตรงมา

เหล่านี้เป็นอินสแตนซ์ CPU ล้วน (ไม่มี GPU) โมเดล quantized ขนาดเล็กและ embedding รันได้ดี; ตัวใหญ่ไม่ จับคู่ Ollama กับ ฐานข้อมูลเวกเตอร์สำหรับสแตก RAG ส่วนตัว — embedding ในเครื่องขนาดเล็กบวกที่เก็บเวกเตอร์ในเครื่องคือการตั้งค่าที่โดดเด่นจริงตรงนี้ Medium ($12/เดือน, 6 GB) คือแพ็กเกจที่สบาย root ในราวหนึ่งนาที ไม่ต้อง KYC จ่ายด้วยคริปโต

คำถามที่พบบ่อย

จะติดตั้ง Ollama บน VPS อย่างไร?

คำสั่งเดียว: curl -fsSL https://ollama.com/install.sh | sh จากนั้น ollama pull โมเดลเล็กและ ollama run หรือเรียก HTTP API ที่ localhost:11434 ขั้นตอนอยู่ด้านล่าง บน VPS CPU ให้อยู่กับโมเดล quantized ขนาดเล็ก (1B–8B) และ embedding — โมเดลใหญ่ต้องใช้ GPU

โมเดลจะเร็วบน VPS CPU ไหม?

เล็กใช่ ใหญ่ไม่ คาดหวังไม่กี่ token ต่อวินาทีบนโมเดล 7–8B ที่ quantization 4 บิต และประสิทธิภาพฉับไวจริง ๆ บนโมเดล 1–3B และโมเดล embedding เยี่ยมสำหรับงานเบื้องหลัง การจัดหมวด และไปป์ไลน์ RAG — ไม่ใช่สำหรับแชทโต้ตอบเร็วบนโมเดลใหญ่

ควรเปิด API ของ Ollama สู่อินเทอร์เน็ตไหม?

ไม่ เก็บไว้ที่ localhost:11434 ถ้าต้องการเข้าถึงระยะไกล ให้วางไว้หลัง reverse proxy ที่มีการยืนยันตัวตนบนแพ็กเกจ IP เฉพาะ หรือเข้าถึงผ่านอุโมงค์ SSH อย่าเปิดเผย endpoint ของโมเดลที่ไม่มีการยืนยันตัวตนสู่อินเทอร์เน็ตเปิดเด็ดขาด

ฉันต้องใช้แพ็กเกจไหน?

Medium ของเรา ($12/เดือน, 6 GB) เหมาะสบายกับโมเดลเล็กและ embedding; Small ($8) ใช้ทดสอบโมเดล 1–3B ได้ เหล่านี้เป็นอินสแตนซ์ CPU ล้วน — ไม่มี GPU — จึงกำหนดขนาดตามการใช้ RAM ของโมเดล ไม่ใช่หวังความเร็ว

คุณขอบัตรประชาชนหรือบัตรเครดิตไหม?

ไม่ อีเมลเพื่อสมัคร จ่ายด้วย USDC หรือ USDT — ไม่มีเอกสาร ไม่มีบัตร

ความคิดเห็น

ยังไม่มีความคิดเห็น เป็นคนแรกสิ

แสดงความคิดเห็น

ความคิดเห็นจะถูกตรวจสอบก่อนแสดง