Panas musim panas — semuanya meleleh, bahkan harga kami.−25%−25% pada setiap paket tahunan, hingga 31 AgustusLihat paket
EQVPS
Mulai

RAG swa-hosting pada skala: berapa RAM yang benar-benar dimakan indeks vektor

9 Agu 2026 · 2 mnt baca · EQVPS Team

Setiap tutorial RAG berjalan di laptop dengan beberapa ratus dokumen, dan terasa tanpa usaha. Lalu Anda mengarahkannya ke korpus nyata — dokumen sebuah perusahaan, tiket bertahun-tahun, basis pengetahuan — dan tiba-tiba memori adalah seluruh percakapan.

RAG tidak menskala dengan CPU. Ia menskala dengan RAM.

Mengapa indeks mau memori

Retrieval bekerja dengan mengubah setiap fragmen teks menjadi embedding — vektor, beberapa ratus hingga beberapa ribu angka panjangnya. Pencarian berarti membandingkan vektor kueri Anda terhadap semuanya, dengan cepat. "Cepat" adalah kata operatifnya: untuk latensi rendah indeks perlu berada di RAM. Di disk ia bekerja, tapi setiap kueri membayar penalti, dan retrieval berlatensi-rendah adalah inti swa-hosting sejak awal.

Jadi tagihan memori menskala dengan dua hal: berapa banyak fragmen yang Anda punya, dan seberapa lebar tiap vektor.

Angka nyata, kira-kira

Ukur milik Anda sendiri — dimensi dan tipe indeks memindahkan ini banyak — tapi sebagai rasa awal:

Sistem multi-agen yang juga menahan indeks besar menumpuk kedua biaya di mesin yang sama — begitulah paket 32 GB berubah menjadi 64 GB diam-diam.

Pilihan mesin, singkatnya

Jika Anda sudah menjalankan Postgres, pgvector adalah opsi paling ringan-usaha — ia ekstensi, bukan layanan baru untuk diasuh. Saat Anda punya jutaan vektor dan ingin pencarian tersaring cepat, mesin khusus seperti Qdrant atau Weaviate membenarkan proses terpisah. Jangan terlalu-merekayasa di hari pertama; jalankan yang sudah Anda operasikan dan pisahkan saat pencarian benar-benar melambat.

Mengapa repot swa-hosting

Dua alasan orang sebenarnya melakukan ini, dan tidak satu pun "untuk menghemat beberapa dolar":

Privasi. Embedding tidak abstrak — mereka menyandi teks asal mereka. Dokumen Anda, konten pelanggan Anda, catatan internal Anda, diubah menjadi vektor dan dikirim ke server pihak ketiga. Swa-hosting menjaga itu di mesin yang Anda kendalikan. Jika data cukup sensitif hingga Anda juga membayar dengan kripto tanpa KYC, sebuah cloud vektor terkelola menggagalkan seluruh intinya.

Biaya tetap. Layanan vektor terkelola menagih menurut vektor yang disimpan dan kueri yang dijalankan. VPS adalah satu angka bulanan dan Anda bisa menghantamnya sekeras yang Anda suka. Pada skala, dapat-diprediksi mengalahkan terukur.

Apa artinya ini untuk penentuan ukuran

Mulai dengan mengukur korpus Anda, bukan dengan menebak. Dapatkan jumlah embedding dan dimensi Anda, muat sampel, awasi memori residen, ekstrapolasi. Lalu pilih paket dengan margin untuk indeks plus semua di sekitarnya — app, klien model, ruang untuk tumbuh.

Untuk apa pun melewati beberapa juta vektor yang ditahan secara privat, lini Pro menjalankan 32 hingga 80 GB dengan IP khusus dan cadangan malam, yang penting saat indeks adalah produknya dan kehilangannya menyakitkan.

Pertanyaan umum

Mengapa RAG butuh RAM sebanyak itu?

Pencarian vektor cepat mau indeks berada di memori. Setiap fragmen dokumen menjadi embedding — vektor beberapa ratus hingga beberapa ribu float — dan pada jutaan fragmen itu menumpuk. Dorong indeks ke disk dan latensi pencarian melonjak; menjaga seluruh alasan Anda swa-hosting (kecepatan + kendali) berarti menjaganya di RAM.

Berapa RAM untuk korpus tertentu?

Rasa kasar: beberapa ratus ribu embedding muat baik di 2–4 GB. Jutaan rendah, dengan app dan OS di sekitarnya, dan Anda di 16–32 GB. Puluhan juta atau vektor dimensi-tinggi dan Anda masuk 48–80 GB, dan melewati itu Anda memecah antar server. Dimensi dan tipe indeks mengayun ini banyak, jadi ukur milik Anda sendiri.

pgvector atau mesin khusus seperti Qdrant?

Jika Anda sudah menjalankan Postgres, pgvector adalah jalur paling ringan-usaha — satu ekstensi, satu basis data. Untuk jutaan vektor dengan penyaringan berat, mesin yang dibangun-khusus membenarkan layanan terpisahnya. Mulai dengan yang sudah Anda operasikan; pindah hanya saat pencarian menjadi lambat.

Mengapa swa-hosting alih-alih layanan vektor terkelola?

Dua alasan nyata: embedding Anda sering menyandi data privat (dokumen, catatan, konten pelanggan), dan swa-hosting menjaga itu di server yang Anda kendalikan. Dan itu biaya tetap — layanan terkelola mengukur menurut vektor dan kueri, VPS adalah satu angka bulanan tanpa tagihan per-kueri.

← Kembali ke blogLihat paket dan harga →

Komentar

Belum ada komentar. Jadilah yang pertama.

Tinggalkan komentar

Komentar dimoderasi sebelum muncul.