Agen AI tanpa memori terjebak memperkenalkan diri lagi setiap percakapan. Perbaikannya adalah basis data vektor — ia menyimpan embedding dokumen, catatan atau chat lampau Anda agar agen bisa mengingat bagian yang relevan sesuai permintaan (itulah "R" dalam RAG). Anda bisa menyewanya sebagai layanan terkelola, atau menjalankannya sendiri di VPS dan menjaga data Anda — yang sering data privat Anda — di mesin yang Anda kendalikan. Berikut caranya, dan berapa biayanya sebenarnya dalam RAM.
Dua opsi bagus
Anda tidak butuh apa pun yang eksotis. Dua jalur menutupi hampir semua orang:
pgvector — ekstensi Postgres. Jika Anda sudah menjalankan Postgres (atau senang melakukannya), ini menambahkan pencarian vektor ke basis data yang sudah Anda punya. Satu layanan, satu cadangan, SQL yang Anda tahu. Mulai paling ringan-usaha dengan selisih lebar.
Qdrant — mesin vektor yang dibangun-khusus. Raih saat Anda punya banyak vektor (jutaan rendah+) atau ingin penyaringan metadata cepat dan API khusus. Ini layanan terpisah untuk dijalankan, tapi dibangun persis untuk tugas ini.
Untuk kebanyakan agen yang menemukan pijakannya, pgvector adalah jawaban pertama yang tepat. Pindah ke Qdrant saat Anda sudah melampauinya, bukan sebelumnya.
Realitas RAM (ini bagian yang orang remehkan)
Pencarian vektor cepat karena indeks berada di memori — jadi RAM, bukan disk, adalah kendala nyata Anda. Panduan kasar:
- Beberapa ratus ribu embedding — nyaman di 2 GB.
- Jutaan rendah — rencanakan 4 GB+ dan setel indeksnya.
- Disk adalah bagian mudah: sejuta embedding hanya beberapa GB, jadi 25–45 GB menutupi penyimpanan serius.
Jadi tentukan ukuran untuk indeks, bukan berkas. (Logika yang sama seperti panduan penentuan ukuran umum — hal beratnya tidak jelas sampai Anda mengukur.)
Mulai cepat: pgvector
Pada mesin dengan Postgres (Docker paling mudah — pola yang sama seperti swa-hosting n8n):
CREATE EXTENSION IF NOT EXISTS vector;
CREATE TABLE memory (
id bigserial PRIMARY KEY,
content text,
embedding vector(1536) -- cocokkan dengan dimensi model embedding Anda
);
-- setelah Anda punya data, bangun indeks untuk pencarian cepat:
CREATE INDEX ON memory USING hnsw (embedding vector_cosine_ops);
Agen Anda menyisipkan content + embedding-nya, lalu mengueri dengan ORDER BY embedding <=> $query_embedding LIMIT 5 untuk menarik memori terdekat. Itulah seluruh lingkarannya.
Lebih suka Qdrant? Ia adalah satu kontainer Docker yang mengekspos API HTTP/gRPC; Anda membuat koleksi dengan ukuran vektor Anda dan meng-upsert titik. Ide yang sama, mesin khusus.
Bisakah berbagi mesin dengan agen?
Ya — untuk penyimpanan memori kecil-ke-menengah, jalankan BD vektor di VPS yang sama dengan agen. Lebih sederhana dan latensinya pada dasarnya nol. Pisahkan ke server terpisah hanya saat satu mulai mendesak yang lain keluar dari RAM. Itu keputusan nanti, masalah-menyenangkan-untuk-dimiliki, bukan hari-pertama.
Peringatan jujur
- RAM adalah tembok, dan ia diam. Pencarian tetap cepat sampai indeks tidak lagi muat di memori, lalu ia memburuk. Awasi memori dan ubah ukuran sebelum ia menggigit — jangan tunggu kueri lambat memberi tahu Anda.
- Embedding memakan token untuk dibuat. Setiap dokumen yang Anda embed adalah panggilan API ke model embedding. Penyimpanan murah untuk di-host; menghasilkan vektor adalah biaya berulang — relevan dengan berapa biaya menjalankan agen sebenarnya.
- Cadangkan. Memori agen Anda adalah data seperti yang lain. Jika penting, snapshot.
Dalam itu, penyimpanan vektor swa-hosting adalah cara bersih memberi agen memori tahan-lama tanpa menyerahkan data privat Anda ke pihak ketiga. Mulai dengan pgvector pada mesin 2 GB, awasi RAM, dan tumbuh ke Qdrant atau paket lebih besar hanya saat angka memberitahu Anda.
Komentar
Belum ada komentar. Jadilah yang pertama.