พูดตรง ๆ ก่อน: หากคุณต้องการการสร้างที่เร็ว ถูก คุณภาพสูง ให้เรียก API CPU VPS จะไม่เอาชนะดาต้าเซ็นเตอร์ที่เต็มไปด้วย GPU และใครที่บอกคุณเป็นอย่างอื่นกำลังขายอะไรบางอย่าง
แล้วทำไมโฮสต์การอนุมานเองเลย? เหตุผลเดียว และเป็นเหตุผลที่ดี: โมเดลบนเซิร์ฟเวอร์ของคุณไม่เคยส่งพรอมต์ของคุณไปที่ไหน
การอนุมาน CPU ดูเป็นอย่างไรจริง ๆ
คุณรันโมเดลจริงบน CPU ได้ด้วย RAM พอ โมเดล 7–8B ที่ quantize เป็น 4-bit ทำงาน 13B ทำงาน คุณดันโมเดลระดับ 30B ได้ด้วยซ้ำหากมีหน่วยความจำ สิ่งที่คุณทำไม่ได้คือทำให้มันเร็ว — ผลลัพธ์มาที่ไม่กี่โทเคนต่อวินาที ไม่ใช่สตรีมทันทีที่ API ให้
นั่นคือการแลกเปลี่ยนที่ตรงไปตรงมา สำหรับแชทโต้ตอบมันน่าหงุดหงิด สำหรับงานพื้นหลัง — สรุปเอกสารข้ามคืน จำแนกคิว เสริมข้อมูลตามกำหนดเวลา — ไม่กี่โทเคนต่อวินาทีโอเคสมบูรณ์ และไม่มีใครเฝ้าดูนาฬิกา
คณิตศาสตร์ RAM
โมเดลต้องนั่งในหน่วยความจำ quantized หรือไม่ก็ตาม บวก overhead สำหรับ context และ runtime:
- 7–8B, 4-bit — ราว 6–8 GB รันบนแพ็กเกจกลาง
- 13B, 4-bit — ราว 10–16 GB
- ระดับ 30B, quantized — 24–48 GB ขึ้นอยู่กับ quantization
- ใหญ่กว่าหรือความแม่นยำสูงกว่า — คุณเข้าสู่ 64–80 GB เร็ว — และเกิน 80 GB ไม่มีเครื่อง Pro เดียวพอดี ยังคง CPU-ช้า
นี่คือเหตุผลที่ "รันโมเดลในเครื่อง" กลายเป็นคำถามหน่วยความจำสูงอย่างเงียบ ๆ โมเดลคือรอยเท้าหน่วยความจำ เพิ่มดัชนี RAGหรือagentบนเครื่องเดียวกันแล้วตัวเลขซ้อนกัน
Ollama กับ vLLM โดยย่อ
Ollama คือประตูที่ง่าย — ติดตั้ง ollama run เสร็จ มันคือเครื่องมือที่ถูกต้องสำหรับการตั้งค่าส่วนตัวผู้ใช้เดียวที่คุณแค่อยากให้โมเดลพร้อมใช้ vLLM สร้างมาเพื่อ throughput การให้บริการ: ตั้งค่ามากกว่า ดีกว่าภายใต้โหลดพร้อมกัน คุ้มเมื่อคุณจัดการปริมาณจริง เริ่มด้วย Ollama คว้า vLLM เมื่อคุณให้บริการทราฟฟิกจริง
ที่ที่ private-first ชนะจริง
กรณีสำหรับการอนุมานที่โฮสต์เองไม่ใช่ความเร็วหรือต้นทุน — มันคือข้อมูลบางอย่างออกไปไหนไม่ได้ เอกสารกฎหมาย เวชระเบียน โค้ดที่เป็นกรรมสิทธิ์ อะไรที่การส่งพรอมต์ไปยัง API บุคคลที่สามเป็นไปไม่ได้ด้วยเหตุผลนโยบายหรือความไว้วางใจ โมเดลที่ช้ากว่าที่รันทั้งหมดบนเครื่องของคุณชนะตัวที่เร็วที่ log ทุกอย่างที่คุณส่ง
และหากข้อมูลละเอียดอ่อนขนาดนั้น การชำระเงินก็ควรเป็นส่วนตัวด้วย การเช่าเครื่องด้วยคริปโตและไม่ต้อง KYCทำให้ทั้งห่วงโซ่ — เซิร์ฟเวอร์ โมเดล พรอมต์ การเรียกเก็บเงิน — พ้นจากบันทึกตัวตนของใคร นั่นคือข้อเสนอจริง: ไม่ใช่ "การอนุมานที่ถูกกว่า" แต่ "การอนุมานที่ไม่มีใครอื่นเห็น"
บรรทัดสุดท้าย
สำหรับความเร็วและคุณภาพ ใช้ API — ไม่มีอะไรน่าอาย โฮสต์เองเมื่อความเป็นส่วนตัวเป็นข้อกำหนดและช้ากว่ายอมรับได้ กำหนดขนาดสำหรับโมเดลบวก context บวกอะไรที่แชร์เครื่อง และอย่าคาดหวังความเร็ว GPU จาก CPU
เมื่อโมเดลต้องการหน่วยความจำจริง สาย Pro รัน 32 ถึง 80 GB พร้อม dedicated IP และการสำรองรายคืน — พอที่จะถือโมเดล quantized จริงจังพร้อมพื้นที่สำหรับ context รอบมัน
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ