EQVPS

การโฮสต์ LLM ในเครื่องบน VPS ด้วย Ollama — อะไรที่ทำงานได้จริง

Jun 14, 2026 · 2 นาทีในการอ่าน · EQVPS Team

การส่งทุกพรอมต์ไปยัง API ของคนอื่นโอเค — จนกว่ามันจะไม่ บางทีข้อมูลละเอียดอ่อนและคุณอยากให้มันไม่เคยออกจากเซิร์ฟเวอร์ของคุณ บางทีคุณเบื่อการจำกัดอัตรา หรือเวอร์ชันโมเดลเปลี่ยนใต้เท้าคุณ หรือ meter ต่อโทเคน tick ขณะคุณทดลอง ณ จุดหนึ่ง "จะเป็นอย่างไรถ้าฉันแค่รันของตัวเอง?" หยุดเป็นการทดลองความคิด

Ollama ทำให้นั่นง่ายจริง คำถามยากกว่าคืออะไรพอดี VPS — และที่นี่คำตอบตรงไปตรงมาสำคัญกว่าการโฆษณา

สิ่งที่คุณรันได้จริงบน CPU

ไม่มี GPU? งั้นคุณกำลังทำการอนุมาน CPU และขนาดโมเดลคือทุกอย่าง Quantization (บีบ weights ลงเป็น 4-bit) คือสิ่งที่ทำให้นี่ปฏิบัติได้ — คุณเสียคุณภาพนิดและประหยัดหน่วยความจำกอง

ตัวเลขคร่าว ๆ ตัวที่สำคัญ:

ความเร็ว อย่างตรงไปตรงมา: บน vCPU ไม่กี่ตัวคุณจะเห็นไม่กี่โทเคนต่อวินาที โอเคสมบูรณ์สำหรับแชทบอทหรือตัวช่วยเขียนโค้ดที่คุณอ่านขณะมันพิมพ์ ไม่โอเคสำหรับการ batch-process เอกสารล้านชิ้น — นั่นคืองาน GPU และเราไม่แสร้งเป็นอย่างอื่น เราไม่มีอินสแตนซ์ GPU หากแผนของคุณต้องการโมเดล 70B หรือ throughput หนัก CPU VPS — ของเราหรือของใคร — เป็นเครื่องมือผิด และคุณควรรู้ก่อนใช้เงินสักเซนต์

แต่ 7B ส่วนตัวที่ตอบคำถามคุณและไม่เคยโทรกลับบ้าน? นั่นรันได้สบายบนเครื่อง 6 GB

การติดตั้ง — สามคำสั่ง

สร้างเซิร์ฟเวอร์ SSH เข้า และ:

curl -fsSL https://ollama.com/install.sh | sh   # ติดตั้ง Ollama
ollama run llama3.2:3b                            # ดึง + รันโมเดล 3B

แค่นั้น — คุณกำลังแชทใน terminal เพื่อใช้จากโค้ดของคุณเอง Ollama ให้บริการ HTTP API บนพอร์ต 11434 อยู่แล้ว:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

ข้อควรระวังหนึ่งที่ควรรู้ก่อน: โดยค่าเริ่มต้น API นั้นผูกกับ localhost เก็บมันไว้แบบนั้นและ tunnel ผ่าน SSH ไม่งั้นมันเปิดต่ออินเทอร์เน็ต หากคุณต้องการให้มันเข้าถึงได้ วางมันหลัง auth — อย่าปล่อย endpoint โมเดลเปิดบน IP สาธารณะ

เลือกเครื่อง

จับคู่แพ็กเกจกับโมเดล ไม่ใช่ทางกลับ:

คุณอยากรันRAM ที่ต้องการแพ็กเกจสมเหตุสมผล
โมเดล 3B ใช้เบา~3 GBSmall (4 GB)
โมเดล 7B สบาย~5-6 GBMedium (6 GB)
ใหญ่กว่า / throughput สูงดินแดน GPUไม่ใช่ CPU VPS

สำหรับผู้โฮสต์เองส่วนใหญ่ Medium (6 GB) คือคำแนะนำตรงไปตรงมา — พื้นที่เหลือพอสำหรับโมเดล 7B บวกแอปและ OS ของคุณ Small (4 GB) ทำงานหากคุณยึด 3B อะไรต่ำกว่านั้นแน่นเกินเมื่อ OS และ context กินเข้า

ทำไมทำที่นี่

หากคุณโฮสต์ LLM เอง ความเป็นส่วนตัวมักเป็นครึ่งเหตุผล — ดังนั้นมันแปลกที่จะมอบ ID เพื่อเช่าเครื่อง คุณไม่ต้อง: คุณจ่ายด้วย USDC หรือ USDT ได้ (หรือบัตรผ่าน on-ramp) ไม่ต้อง KYC และเซิร์ฟเวอร์เป็นของคุณในเวลาประมาณหนึ่งนาที Crypto-native เป็นมิตรกับ agent และข้อมูลอยู่บนเครื่องที่คุณควบคุม

การแลกเปลี่ยนคืออันที่เราตรงไปตรงมา: CPU เท่านั้น เพดาน 6 GB โมเดลเล็ก ภายในนั้น การโฮสต์เองเยี่ยม นอกมัน อย่าให้ใครขายเครื่อง CPU ให้คุณสำหรับงานที่ต้องการ GPU

พร้อมลองไหม? เลือกแพ็กเกจ จ่าย และคุณจะมี root ในเวลาประมาณ 60 วินาที — จากนั้นสามคำสั่งสู่โมเดลส่วนตัวของคุณเอง

FAQ

ฉันรัน LLM โดยไม่มี GPU ได้ไหม?

ได้ สำหรับโมเดลเล็ก โมเดล 3B หรือ 7B ใน quantization 4-bit รันบน CPU และตอบในความเร็วที่อ่านได้ — โอเคสำหรับแชทบอท ตัวช่วยเขียนโค้ด หรืองานพื้นหลังที่คุณไม่เฝ้าดูเคอร์เซอร์ สิ่งที่คุณทำบน CPU ไม่ได้คือให้บริการโมเดลใหญ่ (13B ขึ้นไป) หรือดัน throughput สูง นั่นคือที่ที่ GPU หยุดเป็นทางเลือก

ฉันต้องการ RAM เท่าไรสำหรับ Llama 7B?

ราว 5 GB สำหรับโมเดล 7B 4-bit เมื่อคุณเพิ่ม context window และ OS — ดังนั้นเครื่อง 6 GB คือพื้นที่สบาย โมเดล 3B พอดีในราว 3 GB quant เล็กกว่า (Q4) แลกคุณภาพนิดกับหน่วยความจำน้อยกว่ามาก ซึ่งเป็นการแลกเปลี่ยนที่ถูกต้องบน VPS

การโฮสต์ LLM เองถูกกว่า API ไหม?

ขึ้นอยู่กับปริมาณ API ที่โฮสต์คิดต่อโทเคนและราคาศูนย์เมื่อว่าง VPS คือบิลรายเดือนคงที่ไม่ว่าคุณใช้หรือไม่ หากคุณรันสตรีมคำขอสม่ำเสมอ หรือคุณสนใจความเป็นส่วนตัวและไม่มีการจำกัดอัตราเป็นหลัก การโฮสต์เองชนะ สำหรับพรอมต์ครั้งเดียวนาน ๆ ครั้ง API แบบวัดถูกกว่า

ทำไมโฮสต์เองแทนใช้ cloud API?

สามเหตุผลที่คนทำจริง: ข้อมูลไม่เคยออกจากเซิร์ฟเวอร์ของคุณ (จริงสำหรับกฎหมาย การแพทย์ หรือแค่บันทึกส่วนตัว) ไม่มีการจำกัดอัตราหรือ meter ต่อโทเคน และโมเดลจะไม่เปลี่ยนหรือถูกเลิกใช้ใต้คุณ ต้นทุนคือคุณจัดการเครื่องและอยู่ในฮาร์ดแวร์ของมัน

โมเดลใหญ่ที่สุดที่ฉันรันได้จริงบน CPU VPS คืออะไร?

โมเดล 7B ใน 4-bit คือจุดที่ลงตัวบนเครื่อง 6 GB คุณโหลด 13B ได้ทางเทคนิคด้วย RAM พอ แต่บน CPU มันช้าพอที่คุณจะรู้สึก เกินนั้นคุณต้องการ GPU ซึ่งเป็นโฮสต์อีกชนิด

← กลับไปบล็อกดูแพ็กเกจและราคา →

ความคิดเห็น

ยังไม่มีความคิดเห็น เป็นคนแรกสิ

แสดงความคิดเห็น

ความคิดเห็นจะถูกตรวจสอบก่อนแสดง