Setiap tutorial RAG berjalan di laptop dengan beberapa ratus dokumen, dan terasa tanpa usaha. Lalu Anda mengarahkannya ke korpus nyata — dokumen sebuah perusahaan, tiket bertahun-tahun, basis pengetahuan — dan tiba-tiba memori adalah seluruh percakapan.
RAG tidak menskala dengan CPU. Ia menskala dengan RAM.
Mengapa indeks mau memori
Retrieval bekerja dengan mengubah setiap fragmen teks menjadi embedding — vektor, beberapa ratus hingga beberapa ribu angka panjangnya. Pencarian berarti membandingkan vektor kueri Anda terhadap semuanya, dengan cepat. "Cepat" adalah kata operatifnya: untuk latensi rendah indeks perlu berada di RAM. Di disk ia bekerja, tapi setiap kueri membayar penalti, dan retrieval berlatensi-rendah adalah inti swa-hosting sejak awal.
Jadi tagihan memori menskala dengan dua hal: berapa banyak fragmen yang Anda punya, dan seberapa lebar tiap vektor.
Angka nyata, kira-kira
Ukur milik Anda sendiri — dimensi dan tipe indeks memindahkan ini banyak — tapi sebagai rasa awal:
- Beberapa ratus ribu embedding — nyaman di 2–4 GB. Basis pengetahuan pribadi, dokumen satu produk.
- Jutaan rendah — dengan app, klien model, dan OS di sekitarnya, rencanakan 16–32 GB. Ini basis pengetahuan perusahaan serius atau RAG multi-sumber.
- Puluhan juta, atau vektor dimensi-tinggi — kini Anda di 48–80 GB, dan melewati itu antar beberapa mesin. Kumpulan dokumen besar, retrieval multipenyewa, atau Anda menjaga beberapa indeks panas sekaligus.
Sistem multi-agen yang juga menahan indeks besar menumpuk kedua biaya di mesin yang sama — begitulah paket 32 GB berubah menjadi 64 GB diam-diam.
Pilihan mesin, singkatnya
Jika Anda sudah menjalankan Postgres, pgvector adalah opsi paling ringan-usaha — ia ekstensi, bukan layanan baru untuk diasuh. Saat Anda punya jutaan vektor dan ingin pencarian tersaring cepat, mesin khusus seperti Qdrant atau Weaviate membenarkan proses terpisah. Jangan terlalu-merekayasa di hari pertama; jalankan yang sudah Anda operasikan dan pisahkan saat pencarian benar-benar melambat.
Mengapa repot swa-hosting
Dua alasan orang sebenarnya melakukan ini, dan tidak satu pun "untuk menghemat beberapa dolar":
Privasi. Embedding tidak abstrak — mereka menyandi teks asal mereka. Dokumen Anda, konten pelanggan Anda, catatan internal Anda, diubah menjadi vektor dan dikirim ke server pihak ketiga. Swa-hosting menjaga itu di mesin yang Anda kendalikan. Jika data cukup sensitif hingga Anda juga membayar dengan kripto tanpa KYC, sebuah cloud vektor terkelola menggagalkan seluruh intinya.
Biaya tetap. Layanan vektor terkelola menagih menurut vektor yang disimpan dan kueri yang dijalankan. VPS adalah satu angka bulanan dan Anda bisa menghantamnya sekeras yang Anda suka. Pada skala, dapat-diprediksi mengalahkan terukur.
Apa artinya ini untuk penentuan ukuran
Mulai dengan mengukur korpus Anda, bukan dengan menebak. Dapatkan jumlah embedding dan dimensi Anda, muat sampel, awasi memori residen, ekstrapolasi. Lalu pilih paket dengan margin untuk indeks plus semua di sekitarnya — app, klien model, ruang untuk tumbuh.
Untuk apa pun melewati beberapa juta vektor yang ditahan secara privat, lini Pro menjalankan 32 hingga 80 GB dengan IP khusus dan cadangan malam, yang penting saat indeks adalah produknya dan kehilangannya menyakitkan.
Komentar
Belum ada komentar. Jadilah yang pertama.