EQVPS

VPS สำหรับการอนุมาน LLM ส่วนตัวหน่วยความจำสูง

โมเดล quantized ที่ใหญ่กว่าต้องการ RAM จริง ไม่ใช่ GPU ที่คุณไม่มี ที่ที่เครื่อง CPU หน่วยความจำสูงรันโมเดลระดับ 30B เป็นส่วนตัว อะไรที่เป็นจริง และที่ที่ไม่เป็น เริ่มต้น $70/เดือน

เรามีหน้าแยกสำหรับ Ollama และโมเดลเล็ก — นั่นคือเครื่อง CPU $12 ที่รัน 1B–8B และ embeddings หน้านี้คืออีกปลาย: โมเดลที่ใหญ่พอที่ RAM ไม่ใช่ CPU คือสิ่งที่หยุดคุณ

พูดตรง ๆ ก่อน เหมือนทุกที่: เซิร์ฟเวอร์ของเราเป็น CPU-only ไม่มี GPU โมเดลใหญ่ที่นี่รันช้า หากคุณต้องการแชทโต้ตอบเร็วบนโมเดล 30B คุณต้องการโฮสต์ GPU — ผลิตภัณฑ์ต่าง ผู้ให้บริการต่าง สิ่งที่เครื่อง CPU หน่วยความจำสูงทำได้ดีคือรันโมเดล quantized ใหญ่เป็นส่วนตัวสำหรับงานที่ไม่ใช่หน้าต่างแชท

คณิตศาสตร์ RAM

โมเดลนั่งในหน่วยความจำ quantized หรือไม่ก็ตาม บวก overhead สำหรับ context และ runtime:

นั่นคือเหตุผลที่ "รันโมเดลในเครื่องที่ใหญ่กว่า" จริง ๆ เป็นคำถามหน่วยความจำสูง โมเดลคือรอยเท้าหน่วยความจำ เพิ่มดัชนี RAGบนโฮสต์เดียวกันแล้วตัวเลขซ้อนกัน

ที่ที่ private-first ชนะอย่างแท้จริง

กรณีไม่ใช่ความเร็วและไม่ใช่ต้นทุน — มันคือข้อมูลบางอย่างออกไปไหนไม่ได้ เอกสารกฎหมาย เวชระเบียน โค้ดที่เป็นกรรมสิทธิ์ อะไรก็ตามที่การส่งพรอมต์ไปยัง API บุคคลที่สามเป็นไปไม่ได้ โมเดลที่ช้ากว่าที่รันทั้งหมดบนเครื่องของคุณชนะตัวที่เร็วที่ log ทุกอย่างที่คุณส่ง เราเขียนภาพเต็มไว้ที่นี่

และหากข้อมูลละเอียดอ่อนขนาดนั้น การชำระเงินก็ควรเป็นส่วนตัวด้วย การเช่าเครื่องด้วยคริปโตและไม่ต้อง KYCทำให้ทั้งห่วงโซ่ — เซิร์ฟเวอร์ โมเดล พรอมต์ การเรียกเก็บเงิน — พ้นจากบันทึกตัวตนของใคร นั่นคือข้อเสนอ: ไม่ใช่การอนุมานที่ถูกกว่า แต่การอนุมานที่ไม่มีใครอื่นเห็น

เลือกอะไร

สำหรับโมเดลระดับ 30B พร้อมพื้นที่สำหรับ context, Pro-64 (64 GB) คือทางเลือกที่สบาย quantization ที่แน่นกว่าพอดี Pro-32 หรือ Pro-48 อันใหญ่กว่าไป Pro-80 โหลดโมเดลก่อน ดูหน่วยความจำที่ใช้จริง กำหนดขนาดจากสิ่งที่คุณวัด และตั้งความคาดหวัง: นี่คือการอนุมาน batch ส่วนตัว ไม่ใช่หน้าต่างแชทเร็ว

พร้อม deploy แล้วหรือยัง? จ่ายด้วยคริปโต ไม่ต้อง KYC — ใช้งานได้ในราวหนึ่งนาที

Deploy เลย →

FAQ

สิ่งนี้ต่างจาก use-case Ollama ของคุณอย่างไร?

หน้า Ollama เกี่ยวกับโมเดลเล็กบนเครื่อง CPU $12 — 1B–8B, embeddings, งานเบา นี่คือปลายหน่วยความจำสูง: โมเดล quantized ระดับ 13B ถึง 30B ที่ต้องการ 24–48 GB ขึ้นไปเพียงเพื่อโหลด ความจริง CPU-only เดียวกัน รอยเท้าหน่วยความจำใหญ่กว่ามาก แพ็กเกจต่างกัน

RAM เท่าไรสำหรับโมเดลหนึ่ง?

โมเดลต้องพอดีในหน่วยความจำบวก overhead โมเดล 13B 4-bit ต้องการ ~10–16 GB, ระดับ 30B quantized ดัน 24–48 GB, ใหญ่กว่าหรือความแม่นยำสูงกว่าคุณเข้าสู่ 64–80 GB — เกินนั้นไม่มีเครื่องเดียวของเราพอดี เพิ่มพื้นที่สำหรับ context ด้านบน

มันจะเร็วไหม?

ไม่ — ตรงไปตรงมากับตัวเองตรงนี้ การอนุมาน CPU บนโมเดลใหญ่คือไม่กี่โทเคนต่อวินาที ไม่ใช่สตรีมโต้ตอบ มันโอเคสำหรับงาน batch และพื้นหลัง (สรุปข้ามคืน จำแนกคิว) สำหรับแชทเรียลไทม์บนโมเดลใหญ่คุณต้องการ GPU ซึ่งเราไม่มี

ทำไมรันที่นี่แทน API?

ความเป็นส่วนตัว พรอมต์และผลลัพธ์ของคุณไม่เคยแตะเซิร์ฟเวอร์หรือ log ของผู้ให้บริการ สำหรับข้อมูลละเอียดอ่อน — กฎหมาย การแพทย์ โค้ดภายใน — โมเดลส่วนตัวที่ช้ากว่าชนะตัวที่เร็วที่เห็นทุกอย่าง จับคู่กับการจ่ายคริปโตไม่ต้อง KYC แล้วทั้งห่วงโซ่ยังเป็นของคุณ

ความคิดเห็น

ยังไม่มีความคิดเห็น เป็นคนแรกสิ

แสดงความคิดเห็น

ความคิดเห็นจะถูกตรวจสอบก่อนแสดง