การส่งทุกพรอมต์ไปยัง API ของคนอื่นโอเค — จนกว่ามันจะไม่ บางทีข้อมูลละเอียดอ่อนและคุณอยากให้มันไม่เคยออกจากเซิร์ฟเวอร์ของคุณ บางทีคุณเบื่อการจำกัดอัตรา หรือเวอร์ชันโมเดลเปลี่ยนใต้เท้าคุณ หรือ meter ต่อโทเคน tick ขณะคุณทดลอง ณ จุดหนึ่ง "จะเป็นอย่างไรถ้าฉันแค่รันของตัวเอง?" หยุดเป็นการทดลองความคิด
Ollama ทำให้นั่นง่ายจริง คำถามยากกว่าคืออะไรพอดี VPS — และที่นี่คำตอบตรงไปตรงมาสำคัญกว่าการโฆษณา
สิ่งที่คุณรันได้จริงบน CPU
ไม่มี GPU? งั้นคุณกำลังทำการอนุมาน CPU และขนาดโมเดลคือทุกอย่าง Quantization (บีบ weights ลงเป็น 4-bit) คือสิ่งที่ทำให้นี่ปฏิบัติได้ — คุณเสียคุณภาพนิดและประหยัดหน่วยความจำกอง
ตัวเลขคร่าว ๆ ตัวที่สำคัญ:
- โมเดล 3B, 4-bit — ~3 GB RAM ฉับไวพอสำหรับแชทและงานง่าย
- โมเดล 7B, 4-bit — ~5 GB RAM จุดที่ลงตัว: ฉลาดขึ้นอย่างสังเกตได้ ยังรันในความเร็วที่อ่านได้
- 13B ขึ้นไป — 8-10 GB+ และช้าบน CPU ทำได้ทางเทคนิค น่ารำคาญในทางปฏิบัติ
ความเร็ว อย่างตรงไปตรงมา: บน vCPU ไม่กี่ตัวคุณจะเห็นไม่กี่โทเคนต่อวินาที โอเคสมบูรณ์สำหรับแชทบอทหรือตัวช่วยเขียนโค้ดที่คุณอ่านขณะมันพิมพ์ ไม่โอเคสำหรับการ batch-process เอกสารล้านชิ้น — นั่นคืองาน GPU และเราไม่แสร้งเป็นอย่างอื่น เราไม่มีอินสแตนซ์ GPU หากแผนของคุณต้องการโมเดล 70B หรือ throughput หนัก CPU VPS — ของเราหรือของใคร — เป็นเครื่องมือผิด และคุณควรรู้ก่อนใช้เงินสักเซนต์
แต่ 7B ส่วนตัวที่ตอบคำถามคุณและไม่เคยโทรกลับบ้าน? นั่นรันได้สบายบนเครื่อง 6 GB
การติดตั้ง — สามคำสั่ง
สร้างเซิร์ฟเวอร์ SSH เข้า และ:
curl -fsSL https://ollama.com/install.sh | sh # ติดตั้ง Ollama
ollama run llama3.2:3b # ดึง + รันโมเดล 3B
แค่นั้น — คุณกำลังแชทใน terminal เพื่อใช้จากโค้ดของคุณเอง Ollama ให้บริการ HTTP API บนพอร์ต 11434 อยู่แล้ว:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
ข้อควรระวังหนึ่งที่ควรรู้ก่อน: โดยค่าเริ่มต้น API นั้นผูกกับ localhost เก็บมันไว้แบบนั้นและ tunnel ผ่าน SSH ไม่งั้นมันเปิดต่ออินเทอร์เน็ต หากคุณต้องการให้มันเข้าถึงได้ วางมันหลัง auth — อย่าปล่อย endpoint โมเดลเปิดบน IP สาธารณะ
เลือกเครื่อง
จับคู่แพ็กเกจกับโมเดล ไม่ใช่ทางกลับ:
| คุณอยากรัน | RAM ที่ต้องการ | แพ็กเกจสมเหตุสมผล |
|---|---|---|
| โมเดล 3B ใช้เบา | ~3 GB | Small (4 GB) |
| โมเดล 7B สบาย | ~5-6 GB | Medium (6 GB) |
| ใหญ่กว่า / throughput สูง | ดินแดน GPU | ไม่ใช่ CPU VPS |
สำหรับผู้โฮสต์เองส่วนใหญ่ Medium (6 GB) คือคำแนะนำตรงไปตรงมา — พื้นที่เหลือพอสำหรับโมเดล 7B บวกแอปและ OS ของคุณ Small (4 GB) ทำงานหากคุณยึด 3B อะไรต่ำกว่านั้นแน่นเกินเมื่อ OS และ context กินเข้า
ทำไมทำที่นี่
หากคุณโฮสต์ LLM เอง ความเป็นส่วนตัวมักเป็นครึ่งเหตุผล — ดังนั้นมันแปลกที่จะมอบ ID เพื่อเช่าเครื่อง คุณไม่ต้อง: คุณจ่ายด้วย USDC หรือ USDT ได้ (หรือบัตรผ่าน on-ramp) ไม่ต้อง KYC และเซิร์ฟเวอร์เป็นของคุณในเวลาประมาณหนึ่งนาที Crypto-native เป็นมิตรกับ agent และข้อมูลอยู่บนเครื่องที่คุณควบคุม
การแลกเปลี่ยนคืออันที่เราตรงไปตรงมา: CPU เท่านั้น เพดาน 6 GB โมเดลเล็ก ภายในนั้น การโฮสต์เองเยี่ยม นอกมัน อย่าให้ใครขายเครื่อง CPU ให้คุณสำหรับงานที่ต้องการ GPU
พร้อมลองไหม? เลือกแพ็กเกจ จ่าย และคุณจะมี root ในเวลาประมาณ 60 วินาที — จากนั้นสามคำสั่งสู่โมเดลส่วนตัวของคุณเอง
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ