มาจัดการส่วนที่น่าผิดหวังก่อน เพราะอินเทอร์เน็ตเต็มไปด้วยหน้าที่ไม่ทำ
เซิร์ฟเวอร์ของเราเป็น CPU-only เราไม่มี GPU นั่นหมายความว่างาน LLM ในเครื่องที่นี่มีเพดานตายตัว และการแสร้งเป็นอย่างอื่นก็แค่เสียเงินคุณ
สิ่งที่ทำงานได้จริงบน CPU
ด้วย vCPU สูงสุด 6 ตัวและ RAM 6 GB (แพ็กเกจ Medium — $12/เดือน ของเรา) คุณอยู่ในช่วงของ โมเดล quantized เล็ก:
- โมเดล 1B–3B (Q4): ใช้งานได้จริง เร็วพอสำหรับการจำแนก การติดแท็ก การกำหนดเส้นทาง และการสกัดแบบมีโครงสร้างง่าย ๆ
- โมเดล 7B–8B (Q4): รันได้ แต่คาดหวังไม่กี่โทเคนต่อวินาที โอเคสำหรับคิวที่เคี้ยวเอกสารข้ามคืน เจ็บปวดในฐานะหน้าต่างแชท
- โมเดล embedding: เหมาะดี พวกมันเล็ก เร็วบน CPU และนี่น่าจะเป็นเหตุผลเดียวที่ดีที่สุดในการรัน Ollama บนเครื่องอย่างของเรา
- 13B ขึ้นไป: อย่า คุณจะ swap และรอ
หากคุณต้องการแชท 70B โต้ตอบเร็ว คุณต้องการโฮสต์ GPU — นั่นเป็นผลิตภัณฑ์ต่างจากผู้ให้บริการต่าง และเราขอบอกคุณดีกว่ารับ $12 ของคุณ
ที่ที่เครื่อง CPU ชนะอย่างแท้จริง
ความเป็นส่วนตัว เอกสารของคุณ พรอมต์ของคุณ embeddings ของคุณ — ไม่เคยออกจากเครื่องที่คุณควบคุม ไม่เคยกลายเป็นข้อมูลฝึกของใคร สำหรับคนจำนวนมากนั่นคือจุดประสงค์ทั้งหมด และไม่กี่โทเคนต่อวินาทีคือการแลกเปลี่ยนที่ยอมรับได้
ต้นทุนที่คาดเดาได้ ไม่มีบิลต่อโทเคน ไปป์ไลน์ที่จำแนกห้าหมื่นระเบียนราคาเท่ากับตัวที่จำแนกห้าสิบ: $12
งาน async งาน LLM ที่มีประโยชน์ส่วนใหญ่ไม่ใช่หน้าต่างแชท มันคือคิว: สรุปพวกนี้ ติดแท็กพวกนั้น embed corpus นี้ เครื่อง CPU ที่บดงานค้างข้ามคืนดีกับสิ่งนั้นอย่างสมบูรณ์
การตั้งค่า
# Ubuntu 24.04 — แนะนำแพ็กเกจ Medium
curl -fsSL https://ollama.com/install.sh | sh
# เริ่มด้วยอะไรเล็ก ๆ และดูด้วยตัวเอง
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — จุดที่ลงตัวสำหรับ CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama ให้บริการ HTTP API บน localhost:11434 เก็บมันไว้ที่นั่น หากคุณต้องเข้าถึงจากที่อื่น วางมันหลัง reverse proxy พร้อมการยืนยันตัวตนบน แพ็กเกจ dedicated-IP — ไม่เคยเปิด endpoint โมเดลที่ไม่มีการยืนยันตัวตนต่ออินเทอร์เน็ตเปิด
จับคู่กับ vector database (Qdrant หรือ pgvector ใน Docker) แล้วคุณมีสแตก RAG ส่วนตัวครบบนเครื่อง $12 เดียว การผสมนั้น — embeddings เล็กในเครื่อง, vector store ในเครื่อง, API ภายนอกเฉพาะขั้นการสร้างหนัก — คือการตั้งค่าที่สมเหตุสมผลจริงบนฮาร์ดแวร์อย่างนี้
เลือกแพ็กเกจ
| การใช้ | แพ็กเกจ | ราคา |
|---|---|---|
| Embeddings, โมเดล 1–3B, ไปป์ไลน์ RAG | Medium | $12/เดือน |
| เหมือนกัน บวก endpoint สาธารณะหลัง auth | Medium-IP | $20/เดือน |
| แค่ทดสอบโมเดลเล็ก | Small | $8/เดือน |
CPU-only, vCPU สูงสุด 6 ตัวและ RAM 6 GB พื้นที่ NVMe ทราฟฟิกไม่จำกัด เยอรมนีหรือฟินแลนด์ จ่ายด้วยคริปโต ไม่ต้อง KYC การเรียกเก็บรายปีคือการโอนครั้งเดียวแทนสิบสองครั้ง
อ่านที่เกี่ยวข้อง
- โฮสต์ vector DB สำหรับหน่วยความจำ AI — อีกครึ่งของสแตก RAG ส่วนตัว
- VPS สำหรับ AI agent — การประสานงานบนเครื่องเดียวกัน
พร้อมไหม? ติดตั้งเซิร์ฟเวอร์ → — ออนไลน์ในเวลาประมาณหนึ่งนาที จ่ายด้วยคริปโต ไม่ต้องใช้ ID
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ