Kila RAG tutorial huendesha kwenye laptop na nyaraka mia chache, nayo huhisi bila juhudi. Kisha unaielekeza kwenye corpus halisi — nyaraka za kampuni, miaka ya tickets, knowledge base — na ghafla kumbukumbu ni gumzo lote.
RAG haiscale kwa CPU. Inascale kwa RAM.
Kwa nini index inataka kumbukumbu
Retrieval hufanya kazi kwa kugeuza kila chunk ya maandishi kuwa embedding — vector, mamia machache hadi elfu kadhaa za nambari ndefu. Search maana yake kulinganisha query vector yako dhidi ya zote, haraka. "Haraka" ni neno la uendeshaji: kwa latency ya chini index inahitaji kuishi kwenye RAM. Kwenye disk inafanya kazi, lakini kila query hulipa adhabu, na retrieval ya latency-ya-chini ndio nukta ya kujihifadhi kwanza.
Hivyo bili ya kumbukumbu inascale na vitu viwili: chunks ngapi unazo, na kila vector ni pana kiasi gani.
Namba halisi, kwa jumla
Pima yako — dimension na aina ya index huihamisha sana — lakini kama hisia ya kuanza:
- Embeddings laki chache — starehe katika 2–4 GB. Knowledge base ya binafsi, docs za product moja.
- Mamilioni ya chini — na app, model client, na OS kuzunguka, panga kwa 16–32 GB. Hii ni knowledge base serious ya kampuni au RAG ya multi-source.
- Makumi ya mamilioni, au vectors za dimension ya juu — sasa uko kwenye 48–80 GB, na zaidi ya hapo katika masanduku kadhaa. Estates kubwa za nyaraka, retrieval ya multi-tenant, au unaweka indexes kadhaa moto kwa wakati mmoja.
Mfumo wa multi-agent unaoshikilia pia index kubwa hurundika gharama zote kwenye sanduku lilelile — hivyo ndivyo mpango wa 32 GB unavyokuwa wa 64 GB kimya.
Chaguo la engine, kwa ufupi
Kama tayari unaendesha Postgres, pgvector ni chaguo la kazi ndogo — ni extension, si service mpya ya kulea. Unapokuwa na mamilioni ya vectors na kutaka filtered search ya haraka, engine ya kujitolea kama Qdrant au Weaviate inakama process tofauti. Usi-over-engineer siku ya kwanza; endesha unayoendesha tayari na uitenge search inapochelewa dhati.
Kwa nini kusumbuka kujihifadhi
Sababu mbili watu hufanya hivi dhati, na wala si "kuokoa dola chache":
Faragha. Embeddings si za kufikirika — hu-encode maandishi yaliyotoka. Docs zako, content ya wateja wako, notes zako za ndani, zimegeuzwa kuwa vectors na kusafirishwa kwa seva za mtu wa tatu. Kujihifadhi huiweka kwenye mashine unayoidhibiti. Kama data ni nyeti ya kutosha kiasi kwamba pia unalipa kwa crypto bila KYC, managed vector cloud hupindua nukta yote.
Flat cost. Managed vector services hulipa kwa vectors zilizohifadhiwa na queries zilizoendeshwa. VPS ni namba moja ya kila mwezi nawe unaweza kuipiga kadiri upendavyo. Kwa kiwango kikubwa, inayotabirika humzidi metered.
Hii inamaanisha nini kwa sizing
Anza kwa kupima corpus yako, si kwa kukisia. Pata idadi yako ya embedding na dimension, pakia sampuli, angalia resident memory, extrapolate. Kisha chagua mpango wenye nafasi kwa index plus kila kitu kuzunguka — app, model client, nafasi ya kukua.
Kwa chochote zaidi ya mamilioni kadhaa ya vectors zilizoshikiliwa kwa faragha, mstari wa Pro huendesha 32 hadi 80 GB na dedicated IP na nightly backups, ambako kunahusika wakati index ndiyo product na kuipoteza kunauma.
Maoni
Bado hakuna maoni. Kuwa wa kwanza.