እያንዳንዱ RAG tutorial ጥቂት መቶ documents ባለው laptop ላይ ይሮጣል፣ እና ሳይታክት ይሰማል። ከዚያ ወደ እውነተኛ corpus ይምሩት — የኩባንያ docs፣ ዓመታት tickets፣ knowledge base — እና በድንገት memory ሙሉው ውይይት ነው።
RAG በCPU አይመዘንም። በRAM ይመዘናል።
index ለምን memory እንደሚፈልግ
Retrieval እያንዳንዱን የtext chunk ወደ embedding በመቀየር ይሠራል — vector፣ ጥቂት መቶ እስከ ጥቂት ሺህ ቁጥሮች ርዝመት። Search የquery vectorዎን ከሁሉም ጋር ማነጻጸር ማለት ነው፣ በፍጥነት። "ፈጣን" ወሳኙ ቃል ነው: ለዝቅተኛ latency index በRAM ውስጥ መኖር አለበት። በdisk ላይ ይሠራል፣ ግን እያንዳንዱ query ቅጣት ይከፍላል፣ እና ዝቅተኛ-latency retrieval በመጀመሪያ የself-hosting ነጥብ ነበር።
ስለዚህ የmemory bill በሁለት ነገሮች ይመዘናል: ስንት chunks እንዳለዎት፣ እና እያንዳንዱ vector ምን ያህል ስፋት እንዳለው።
እውነተኛ ቁጥሮች፣ በግምት
የራስዎን ይለኩ — dimension እና index type ይህን ብዙ ያንቀሳቅሳሉ — ግን እንደ መነሻ ስሜት:
- ጥቂት መቶ ሺህ embeddings — በ2–4 GB ውስጥ ምቹ። የግል knowledge base፣ የአንድ product docs።
- ዝቅተኛ ሚሊዮኖች — ከapp፣ model client፣ እና OS ጋር በዙሪያው፣ ለ16–32 GB ያቅዱ። ይህ ከባድ የኩባንያ knowledge base ወይም multi-source RAG ነው።
- አስር ሚሊዮኖች፣ ወይም ከፍተኛ-dimension vectors — አሁን በ48–80 GB ላይ ነዎት፣ ከዚያ በላይ በበርካታ boxes ላይ። ትላልቅ document estates፣ multi-tenant retrieval፣ ወይም በአንድ ጊዜ በርካታ indexes ሞቅ አድርገው ይይዛሉ።
ትልቅ index ደግሞ የሚይዝ multi-agent system ሁለቱንም costs በአንድ box ላይ ይደረድራል — 32 GB plan ጸጥ ብሎ ወደ 64 GB የሚቀየረው እንደዚያ ነው።
የengine ምርጫ፣ በአጭሩ
አስቀድሞ Postgres ካሄዱ፣ pgvector አነስተኛ-ጥረት አማራጭ ነው — extension ነው፣ ለመንከባከብ አዲስ service አይደለም። ሚሊዮኖች vectors ሲኖርዎ እና ፈጣን filtered search ሲፈልጉ፣ እንደ Qdrant ወይም Weaviate ያለ dedicated engine የተለየ processን ያገኛል። በመጀመሪያው ቀን over-engineer አያድርጉት፤ አስቀድሞ የሚያንቀሳቅሱትን ያሂዱ እና search በእውነት ሲዘገይ ይከፋፍሉት።
self-host ስለምን ማድረግ
ሰዎች ይህን በእውነት የሚያደርጉበት ሁለት ምክንያቶች፣ እና አንዳቸውም "ጥቂት ዶላር ለመቆጠብ" አይደሉም:
Privacy። Embeddings abstract አይደሉም — የመጡበትን text ይኮድ ያደርጋሉ። docsዎ፣ የደንበኞችዎ content፣ internal notesዎ፣ ወደ vectors ተቀይረው ወደ third party servers ተልከዋል። Self-hosting ያንን በሚቆጣጠሩት machine ላይ ያቆያል። data በቂ ሚስጥራዊ ከሆነ ደግሞ በcrypto ያለKYC እየከፈሉ ከሆኑ፣ managed vector cloud ሙሉ ነጥቡን ያፈርሳል።
Flat cost። Managed vector services በተከማቸ vector እና በሚሮጥ query ይከፍላሉ። VPS አንድ ወርሃዊ ቁጥር ነው እና እንደፈለጉ ማስቸገር ይችላሉ። በskale፣ ሊገመት የሚችል ከሚለካ ይበልጣል።
ይህ ለsizing ምን ማለት ነው
corpusዎን በመለካት ይጀምሩ፣ በመገመት አይደለም። embedding countዎን እና dimension ያግኙ፣ sample ይጫኑ፣ resident memoryን ይመልከቱ፣ extrapolate ያድርጉ። ከዚያ ለindex ከዙሪያው ሁሉ ጋር ቦታ ያለው plan ይምረጡ — app፣ model client፣ ለማደግ ቦታ።
በግል የተያዙ ከጥቂት ሚሊዮን vectors ለሚያልፍ ማንኛውም፣ Pro መስመር 32 እስከ 80 GB ከdedicated IP እና የሌሊት backups ጋር ይሮጣል፣ ይህም index ራሱ product ሲሆን እና ማጣት ሲጎዳ ያስፈልጋል።
አስተያየቶች
እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።