เรามีหน้าแยกสำหรับ Ollama และโมเดลเล็ก — นั่นคือเครื่อง CPU $12 ที่รัน 1B–8B และ embeddings หน้านี้คืออีกปลาย: โมเดลที่ใหญ่พอที่ RAM ไม่ใช่ CPU คือสิ่งที่หยุดคุณ
พูดตรง ๆ ก่อน เหมือนทุกที่: เซิร์ฟเวอร์ของเราเป็น CPU-only ไม่มี GPU โมเดลใหญ่ที่นี่รันช้า หากคุณต้องการแชทโต้ตอบเร็วบนโมเดล 30B คุณต้องการโฮสต์ GPU — ผลิตภัณฑ์ต่าง ผู้ให้บริการต่าง สิ่งที่เครื่อง CPU หน่วยความจำสูงทำได้ดีคือรันโมเดล quantized ใหญ่เป็นส่วนตัวสำหรับงานที่ไม่ใช่หน้าต่างแชท
คณิตศาสตร์ RAM
โมเดลนั่งในหน่วยความจำ quantized หรือไม่ก็ตาม บวก overhead สำหรับ context และ runtime:
- 13B, 4-bit — ราว 10–16 GB รันบนแพ็กเกจกลางได้แล้ว
- ระดับ 30B, quantized — 24–48 GB ขึ้นอยู่กับ quantization นี่คือดินแดน Pro-32 ถึง Pro-64
- ใหญ่กว่าหรือความแม่นยำสูงกว่า — 64–80 GB และเกิน 80 GB ไม่มีเครื่องเดียวของเราพอดี Pro-80 คือเพดานที่นี่
นั่นคือเหตุผลที่ "รันโมเดลในเครื่องที่ใหญ่กว่า" จริง ๆ เป็นคำถามหน่วยความจำสูง โมเดลคือรอยเท้าหน่วยความจำ เพิ่มดัชนี RAGบนโฮสต์เดียวกันแล้วตัวเลขซ้อนกัน
ที่ที่ private-first ชนะอย่างแท้จริง
กรณีไม่ใช่ความเร็วและไม่ใช่ต้นทุน — มันคือข้อมูลบางอย่างออกไปไหนไม่ได้ เอกสารกฎหมาย เวชระเบียน โค้ดที่เป็นกรรมสิทธิ์ อะไรก็ตามที่การส่งพรอมต์ไปยัง API บุคคลที่สามเป็นไปไม่ได้ โมเดลที่ช้ากว่าที่รันทั้งหมดบนเครื่องของคุณชนะตัวที่เร็วที่ log ทุกอย่างที่คุณส่ง เราเขียนภาพเต็มไว้ที่นี่
และหากข้อมูลละเอียดอ่อนขนาดนั้น การชำระเงินก็ควรเป็นส่วนตัวด้วย การเช่าเครื่องด้วยคริปโตและไม่ต้อง KYCทำให้ทั้งห่วงโซ่ — เซิร์ฟเวอร์ โมเดล พรอมต์ การเรียกเก็บเงิน — พ้นจากบันทึกตัวตนของใคร นั่นคือข้อเสนอ: ไม่ใช่การอนุมานที่ถูกกว่า แต่การอนุมานที่ไม่มีใครอื่นเห็น
เลือกอะไร
สำหรับโมเดลระดับ 30B พร้อมพื้นที่สำหรับ context, Pro-64 (64 GB) คือทางเลือกที่สบาย quantization ที่แน่นกว่าพอดี Pro-32 หรือ Pro-48 อันใหญ่กว่าไป Pro-80 โหลดโมเดลก่อน ดูหน่วยความจำที่ใช้จริง กำหนดขนาดจากสิ่งที่คุณวัด และตั้งความคาดหวัง: นี่คือการอนุมาน batch ส่วนตัว ไม่ใช่หน้าต่างแชทเร็ว
ความคิดเห็น
ยังไม่มีความคิดเห็น เป็นคนแรกสิ