Un agent IA sans mémoire est coincé à se réintroduire à chaque conversation. La solution est une base de données vectorielle — elle stocke des embeddings de vos documents, notes ou anciens chats pour que l'agent puisse rappeler les bribes pertinentes à la demande (c'est le « R » de RAG). Vous pouvez louer cela comme service managé, ou vous pouvez le faire tourner vous-même sur un VPS et garder vos données — qui sont souvent vos données privées — sur une machine que vous contrôlez. Voici comment, et ce que cela coûte réellement en RAM.
Deux bonnes options
Vous n'avez besoin de rien d'exotique. Deux voies couvrent presque tout le monde :
pgvector — une extension Postgres. Si vous faites déjà tourner Postgres (ou êtes prêt à le faire), cela ajoute la recherche vectorielle à la base de données que vous avez déjà. Un service, une sauvegarde, du SQL que vous connaissez. Le départ le moins coûteux, de loin.
Qdrant — un moteur vectoriel dédié. Passez-y quand vous avez beaucoup de vecteurs (quelques millions+) ou voulez un filtrage rapide par métadonnées et une API dédiée. C'est un service séparé à faire tourner, mais il est bâti exactement pour ce travail.
Pour la plupart des agents qui trouvent leurs marques, pgvector est la bonne première réponse. Passez à Qdrant quand vous l'avez dépassé, pas avant.
La réalité de la RAM (c'est la partie que les gens sous-estiment)
La recherche vectorielle est rapide parce que l'index vit en mémoire — donc la RAM, pas le disque, est votre vraie contrainte. Un guide approximatif :
- Quelques centaines de milliers d'embeddings — confortable dans 2 Go.
- Quelques millions — prévoyez 4 Go+ et réglez l'index.
- Le disque est la partie facile : un million d'embeddings fait seulement quelques Go, donc 25–45 Go couvrent un stockage sérieux.
Dimensionnez donc pour l'index, pas pour le fichier. (Même logique que le guide de dimensionnement général — la chose lourde n'est pas évidente tant que vous ne mesurez pas.)
Démarrage rapide : pgvector
Sur une machine avec Postgres (Docker est le plus simple — même schéma que l'auto-hébergement de n8n) :
CREATE EXTENSION IF NOT EXISTS vector;
CREATE TABLE memory (
id bigserial PRIMARY KEY,
content text,
embedding vector(1536) -- match your embedding model's dimensions
);
-- after you have data, build an index for fast search:
CREATE INDEX ON memory USING hnsw (embedding vector_cosine_ops);
Votre agent insère content + son embedding, puis interroge avec ORDER BY embedding <=> $query_embedding LIMIT 5 pour tirer les mémoires les plus proches. C'est toute la boucle.
Vous préférez Qdrant ? C'est un unique conteneur Docker exposant une API HTTP/gRPC ; vous créez une collection avec votre taille de vecteur et faites un upsert des points. Même idée, moteur dédié.
Peut-elle partager une machine avec l'agent ?
Oui — pour les stockages de mémoire petits à moyens, faites tourner la base vectorielle sur le même VPS que l'agent. C'est plus simple et la latence est quasiment nulle. Ne les séparez sur des serveurs distincts que quand l'un commence à évincer l'autre de la RAM. C'est une décision ultérieure, un beau problème à avoir, pas une décision du premier jour.
Réserves honnêtes
- La RAM est le mur, et il est silencieux. La recherche reste rapide jusqu'à ce que l'index ne tienne plus en mémoire, puis elle se dégrade. Surveillez la mémoire et redimensionnez avant que ça morde — n'attendez pas que des requêtes lentes vous le disent.
- Les embeddings coûtent des tokens à créer. Chaque document que vous encodez est un appel d'API à un modèle d'embeddings. Le stockage est bon marché à héberger ; générer les vecteurs est le coût récurrent — pertinent pour ce que coûte réellement de faire tourner un agent.
- Sauvegardez-la. La mémoire de votre agent est une donnée comme une autre. Si elle compte, faites-en un snapshot.
Dans ce cadre, un stockage vectoriel auto-hébergé est une façon propre de donner à un agent une mémoire durable sans remettre vos données privées à un tiers. Commencez avec pgvector sur une machine de 2 Go, gardez un œil sur la RAM, et grandissez vers Qdrant ou une offre plus grande seulement quand les chiffres vous le disent.
Commentaires
Pas encore de commentaires. Soyez le premier.