EQVPS

VPS สำหรับ RAG ที่โฮสต์เองในขนาดใหญ่

Retrieval-augmented generation หยุดเป็นเดโมบนแล็ปท็อปเมื่อ corpus เป็นของจริง ดัชนี vector ต้องการ RAM และ embeddings ของคุณคือข้อมูลส่วนตัว นี่คือคณิตศาสตร์การกำหนดขนาดและทำไมโฮสติงหน่วยความจำสูงไม่ต้อง KYC เข้ากัน เริ่มต้น $55/เดือน

เดโม RAG บนแล็ปท็อปกับเอกสารสองร้อยชิ้นรู้สึกไม่ต้องออกแรง จากนั้นคุณชี้มันไปที่ corpus จริง — เอกสารของบริษัท ทิกเก็ตหลายปี ฐานความรู้จริง — และทั้งเรื่องกลายเป็นปัญหาหน่วยความจำ ไม่ใช่ปัญหา CPU ปัญหาหน่วยความจำ

นี่คือส่วนที่หน้าโฮสติงส่วนใหญ่ข้าม: การดึงข้อมูลที่รวดเร็วต้องการดัชนีใน RAM ทุก chunk ของข้อความกลายเป็น embedding — vector กว้างไม่กี่ร้อยถึงสองสามพันตัวเลข — และการค้นหาหมายถึงการเปรียบเทียบ query ของคุณกับทั้งหมดอย่างรวดเร็ว บนดิสก์ก็ทำงานได้ แต่ทุก query จ่ายภาษีความหน่วง และการดึงข้อมูลความหน่วงต่ำคือเหตุผลที่คุณโฮสต์เองตั้งแต่แรก

คณิตศาสตร์การกำหนดขนาด อย่างตรงไปตรงมา

วัด corpus ของคุณเอง — มิติและชนิดดัชนีแกว่งสิ่งนี้มาก — แต่เป็นความรู้สึกเริ่มต้น:

เราเขียนเส้นโค้ง RAM ฉบับเต็มไว้ที่นี่ หากคุณต้องการรายละเอียด

ทำไมหน่วยความจำสูง และ ไม่ KYC ด้วยกัน

การเช่า RAM 48 GB นั้นง่าย การเช่ามันด้วยคริปโตและไม่ตรวจตัวตนนั้นไม่ — โฮสต์ส่วนใหญ่ที่ขายหน่วยความจำจริงจังราคาถูกทำมันหลังบัตรและฟอร์ม KYC embeddings ของคุณไม่ใช่ตัวเลขนามธรรม มันเข้ารหัสข้อความที่มันมา เอกสารของคุณ เนื้อหาลูกค้าของคุณ กลายเป็น vector หากข้อมูลนั้นละเอียดอ่อนพอที่คุณจ่ายเป็นส่วนตัว vector cloud ที่จัดการให้ทำลายจุดประสงค์ทั้งหมด — และโฮสต์ที่ผูกเซิร์ฟเวอร์กับตัวตนของคุณก็เช่นกัน

การผสมนั้น — หน่วยความจำสูง, dedicated IP, คริปโต, ไม่ต้อง KYC, สำรองข้อมูลรายคืน — คือสิ่งที่สาย Pro มีไว้ มันไม่ใช่ที่ถูกที่สุดต่อกิกะไบต์ และหากคุณไม่ต้องการความเป็นส่วนตัว คุณหา RAM ถูกกว่าที่อื่นได้ แต่หากดัชนีคือผลิตภัณฑ์ของคุณและมันออกไปไหนไม่ได้ นี่คือรูปแบบที่เหมาะ

เริ่มที่ไหน

เลือกแพ็กเกจที่มีพื้นที่เหลือสำหรับดัชนีบวกทุกอย่างรอบ ๆ — แอป, client โมเดล, ที่ให้โต สำหรับ corpus จริงส่วนใหญ่นั่นคือ Pro-48 (48 GB) อันใหญ่ไปที่ Pro-64 หรือ Pro-80 โหลดตัวอย่างก่อน ดูหน่วยความจำ กำหนดขนาดจากตัวเลขที่คุณวัด — ไม่ใช่ตัวที่คุณกลัว

หากการดึงข้อมูลของคุณเป็นส่วนหนึ่งของระบบ agent ที่ใหญ่กว่า เครื่องเดียวกันมักถือกองทัพ agent ด้วย — นั่นคือวิธีที่แพ็กเกจ 48 GB กลายเป็น 64 GB อย่างเงียบ ๆ

พร้อม deploy แล้วหรือยัง? จ่ายด้วยคริปโต ไม่ต้อง KYC — ใช้งานได้ในราวหนึ่งนาที

Deploy เลย →

FAQ

การตั้งค่า RAG ของฉันต้องการ RAM เท่าไรจริง ๆ?

มันปรับตามจำนวน embedding และความกว้างของ vector สองสามแสน chunk พอดีใน 2–4 GB หลักล้านต้น ๆ พร้อมแอปและ OS รอบ ๆ มาลงที่ 16–32 GB หลักสิบล้านดัน 48 GB ขึ้นไป วัดตัวอย่าง ดูหน่วยความจำที่ใช้จริง คาดการณ์ต่อ — อย่าเดาสูง คุณจะจ่ายเกินเปล่า ๆ

ทำไมไม่ใช้บริการ vector ที่จัดการให้?

สองเหตุผลที่คนโฮสต์เองจริง ๆ: embeddings ของคุณเข้ารหัสข้อมูลส่วนตัว (เอกสาร บันทึก เนื้อหาลูกค้า) ดังนั้นการเก็บไว้บนเครื่องที่คุณควบคุมจึงสำคัญ และต้นทุนคงที่ — บริการที่จัดการให้คิดตาม vector และ query, VPS คือตัวเลขรายเดือนเดียวที่คุณกระหน่ำใช้ได้เต็มที่

pgvector หรือเอนจินเฉพาะ?

หากคุณรัน Postgres อยู่แล้ว pgvector คือเส้นทางที่ใช้แรงน้อยที่สุด — extension เดียว สำหรับ vector หลายล้านพร้อมการกรองหนัก เอนจินที่สร้างมาเฉพาะอย่าง Qdrant คุ้มค่ากับบริการของตัวเอง เริ่มด้วยสิ่งที่คุณดำเนินการอยู่ แยกออกเมื่อการค้นหาช้าลง ไม่ใช่ก่อนหน้า

ฉันต้องมี GPU สำหรับ RAG ไหม?

ไม่ การดึงข้อมูลคืองาน CPU + RAM — เปรียบเทียบ vector ไม่ใช่สร้างข้อความ ขั้นการสร้างเรียก LLM ของคุณ (API หรือโฮสต์โมเดลแยก) เครื่อง CPU หน่วยความจำสูงคือรูปแบบที่ถูกต้องพอดีสำหรับครึ่งการดึงข้อมูล

ความคิดเห็น

ยังไม่มีความคิดเห็น เป็นคนแรกสิ

แสดงความคิดเห็น

ความคิดเห็นจะถูกตรวจสอบก่อนแสดง