คำตอบตรงไปตรงมาต่อ "เซิร์ฟเวอร์เท่าไรที่ AI agent ของฉันต้องการ?" คือ: น้อยกว่าที่คุณคิด — จนถึงตอนที่มันไม่ใช่ทันที เคล็ดลับคือการรู้ว่างานของคุณนั่งด้านใดของเส้นนั้น ดังนั้นแทนการเดา นี่คือสิ่งที่ agent แต่ละชนิดใช้จริง
คำถามเดียวที่ตัดสินทุกอย่าง
โมเดลรันบนเซิร์ฟเวอร์ของคุณ หรือ agent ของคุณเรียกโมเดลผ่าน API?
หาก agent ของคุณคุยกับ LLM ที่โฮสต์ (กรณีทั่วไป) ส่วนที่ฉลาดและแพงเกิดบนฮาร์ดแวร์ของคนอื่น เครื่องของคุณแค่รันลูปการประสานงาน: รับอินพุต เรียก API parse ผลลัพธ์ อาจ hit ฐานข้อมูล ทำซ้ำ นั่นเบา เบาจริง — เครื่อง 1 GB ทำมันได้โดยไม่เหงื่อออก
หากคุณรันโมเดลในเครื่อง ทุกอย่างเปลี่ยน: ตอนนี้ RAM ถูกครอบงำโดย weights โมเดล และคุณต้องการทุกคอร์ที่หาได้ คนส่วนใหญ่ไม่ต้องการนี่ คนที่ต้องมักรู้แน่ว่าทำไม (ความเป็นส่วนตัว ไม่มีการจำกัดอัตรา ออฟไลน์) หากนั่นคือคุณ เราเขียนคู่มือแยกเรื่องการโฮสต์ LLM ในเครื่อง
กำหนดขนาดตามงาน
ตัวเลขจริง ชนิดที่คุณลงมือทำได้:
| งาน | RAM | vCPU | ดิสก์ | หมายเหตุ |
|---|---|---|---|---|
| chat / agent ผู้ช่วย (ผูก API) | 1 GB | 2 | 15 GB | ลูปจิ๋ว โมเดลอยู่ระยะไกล |
| scraper / data agent | 2 GB | 2 | 25 GB | พื้นที่เหลือสำหรับ parse + ข้อมูลที่ scrape |
| บอทเทรด | 1–2 GB | 2 | 15–25 GB | ความหน่วงสำคัญกว่าขนาด — ดูคู่มือบอทเทรด |
| หลาย agent ขนาน | 4 GB | 4 | 35 GB | แต่ละ agent ถูก concurrency สะสม |
| LLM ในเครื่อง 3B–7B (quantized) | 4–6 GB | 4–6 | 25–45 GB | CPU-only รันในความเร็วที่อ่านได้ ไม่ใช่ปริมาณมาก |
รูปแบบ: agent ผูก API จิ๋ว โมเดลในเครื่องเป็นอย่างเดียวที่หนัก
ที่ที่เครื่อง CPU หยุด
พูดตรงเรื่องเพดาน: แพ็กเกจของเราสูงสุด 6 GB RAM และ 6 คอร์ CPU-only — ไม่มี GPU นั่นครอบคลุมทุกอย่างในตารางข้างต้น รวมถึงโมเดล 7B ในเครื่องสำหรับการใช้ส่วนตัว สิ่งที่มันไม่ครอบคลุม: โมเดล 13B+ การอนุมานในเครื่อง throughput สูง หรืออะไรที่ต้องการ GPU จริง หากนั่นคืองานของคุณ CPU VPS — ของเราหรือของใคร — เป็นเครื่องมือผิด และดีกว่าที่จะรู้ตอนนี้กว่าหลังคุณ deploy
สำหรับ 95% ของ agent ที่เรียก API ไม่มีอะไรในนี้เป็นปัญหา พวกมันมีความสุขบนเครื่องเล็กที่สุด
หลักการเชิงปฏิบัติ
- แค่ agent ที่เรียก API? เริ่มที่ 1 GB / 2 คอร์ คุณปรับขนาดภายหลังได้
- scrape หรือเก็บข้อมูล? 2 GB และดิสก์ใหญ่กว่า
- รันหลาย agent หรือโมเดลในเครื่องเล็ก? 4–6 GB และ 4+ คอร์
- ต้องการ GPU? หมวดต่าง — อย่าฝืนมันลง CPU
อย่า over-provision ด้วยความประหม่า agent เบาโดยธรรมชาติ ต้นทุนของเครื่องเล็กเกินคือการปรับขนาดหนึ่งครั้ง ขณะที่ต้นทุนของเครื่องใหญ่เกินคือการจ่าย RAM ว่างทุกเดือน
เมื่อคุณเลือกขนาดแล้ว agent เช่าเครื่องเองได้ผ่าน MCP หรือคุณสั่งซื้อมันในหนึ่งนาทีบนเว็บ ไม่ว่าทางไหน เริ่มเล็ก — คุณเกือบแน่นอนต้องการน้อยกว่าที่คาด
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ