EQVPS

Self-hosted RAG σε κλίμακα: πόση RAM τρώει πραγματικά ένα vector index

Aug 9, 2026 · 3 λεπτά ανάγνωσης · EQVPS Team

Κάθε tutorial RAG τρέχει σε ένα laptop με μερικές εκατοντάδες έγγραφα, και νιώθει αβίαστο. Μετά το στρέφετε σε ένα πραγματικό corpus — τα docs μιας εταιρείας, χρόνια tickets, μια βάση γνώσης — και ξαφνικά η μνήμη είναι όλη η συζήτηση.

Το RAG δεν κλιμακώνεται με CPU. Κλιμακώνεται με RAM.

Γιατί το index θέλει μνήμη

Το retrieval λειτουργεί μετατρέποντας κάθε chunk κειμένου σε ένα embedding — ένα vector, μερικές εκατοντάδες έως μερικές χιλιάδες αριθμούς μακρύ. Η αναζήτηση σημαίνει σύγκριση του query vector σας με όλα τους, γρήγορα. Το «γρήγορα» είναι η λέξη-κλειδί: για χαμηλό latency το index πρέπει να ζει στη RAM. Στον δίσκο λειτουργεί, αλλά κάθε query πληρώνει μια ποινή, και το χαμηλού-latency retrieval ήταν το νόημα του self-hosting εξαρχής.

Οπότε ο λογαριασμός μνήμης κλιμακώνεται με δύο πράγματα: πόσα chunks έχετε, και πόσο πλατύ είναι κάθε vector.

Πραγματικά νούμερα, χοντρικά

Μετρήστε το δικό σας — η διάσταση και ο τύπος index το κινούν πολύ — αλλά ως σημείο εκκίνησης:

Ένα σύστημα πολλαπλών πρακτόρων που κρατά επίσης ένα μεγάλο index στοιβάζει και τα δύο κόστη στο ίδιο box — έτσι ένα πακέτο 32 GB μετατρέπεται ήσυχα σε ένα των 64 GB.

Η επιλογή engine, σύντομα

Αν ήδη τρέχετε Postgres, το pgvector είναι η επιλογή ελάχιστης προσπάθειας — είναι ένα extension, όχι μια νέα υπηρεσία να κάνετε νταντά. Όταν έχετε εκατομμύρια vectors και θέλετε γρήγορη φιλτραρισμένη αναζήτηση, ένα dedicated engine όπως το Qdrant ή το Weaviate κερδίζει τη ξεχωριστή διεργασία. Μην το υπερ-μηχανεύεστε την πρώτη μέρα· τρέξτε αυτό που ήδη χειρίζεστε και χωρίστε το όταν η αναζήτηση πραγματικά επιβραδυνθεί.

Γιατί να μπείτε στον κόπο του self-hosting

Δύο λόγοι για τους οποίους οι άνθρωποι πραγματικά το κάνουν, και κανένας δεν είναι «για να γλιτώσω μερικά δολάρια»:

Ιδιωτικότητα. Τα embeddings δεν είναι αφηρημένα — κωδικοποιούν το κείμενο από το οποίο προήλθαν. Τα docs σας, το περιεχόμενο των πελατών σας, οι εσωτερικές σας σημειώσεις, μετατραπέντα σε vectors και σταλμένα στους servers ενός τρίτου μέρους. Το self-hosting τα κρατά σε μια μηχανή που ελέγχετε. Αν τα δεδομένα είναι αρκετά ευαίσθητα ώστε να πληρώνετε επίσης με crypto χωρίς KYC, ένα managed vector cloud αναιρεί όλο το νόημα.

Σταθερό κόστος. Οι managed vector υπηρεσίες χρεώνουν ανά vectors αποθηκευμένα και queries που τρέχουν. Ένα VPS είναι ένας μηνιαίος αριθμός και μπορείτε να το χτυπάτε όσο σκληρά θέλετε. Σε κλίμακα, το προβλέψιμο νικά το μετρημένο.

Τι σημαίνει αυτό για το μέγεθος

Ξεκινήστε μετρώντας το corpus σας, όχι μαντεύοντας. Πάρτε τον αριθμό embeddings και τη διάστασή σας, φορτώστε ένα δείγμα, παρακολουθήστε τη resident μνήμη, κάντε extrapolate. Μετά επιλέξτε ένα πακέτο με περιθώριο για το index συν όλα γύρω του — την εφαρμογή, τον client μοντέλου, χώρο να μεγαλώσει.

Για οτιδήποτε πέρα από μερικά εκατομμύρια vectors που κρατιούνται ιδιωτικά, η γραμμή Pro τρέχει 32 έως 80 GB με αποκλειστικό IP και νυχτερινά backups, που μετρά όταν το index είναι το προϊόν και το να το χάσετε πονά.

Συχνές ερωτήσεις

Γιατί το RAG χρειάζεται τόση RAM;

Η γρήγορη vector search θέλει το index resident στη μνήμη. Κάθε chunk εγγράφου γίνεται ένα embedding — ένα vector μερικών εκατοντάδων έως μερικών χιλιάδων floats — και στα εκατομμύρια chunks αυτό αθροίζεται. Σπρώξτε το index στον δίσκο και το latency αναζήτησης εκτοξεύεται· η διατήρηση όλου του λόγου που κάνατε self-host (ταχύτητα + έλεγχος) σημαίνει να το κρατάτε στη RAM.

Πόση RAM για ένα δεδομένο corpus;

Πρόχειρη αίσθηση: μερικές εκατοντάδες χιλιάδες embeddings κάθονται μια χαρά σε 2–4 GB. Χαμηλά εκατομμύρια, με την εφαρμογή και το OS γύρω τους, και είστε στα 16–32 GB. Δεκάδες εκατομμύρια ή vectors υψηλής διάστασης και είστε στα 48–80 GB, και πέρα από αυτό χωρίζετε σε servers. Η διάσταση και ο τύπος index το επηρεάζουν πολύ, οπότε μετρήστε το δικό σας.

pgvector ή ένα dedicated engine όπως το Qdrant;

Αν ήδη τρέχετε Postgres, το pgvector είναι η διαδρομή ελάχιστης προσπάθειας — ένα extension, μία βάση δεδομένων. Για εκατομμύρια vectors με βαρύ filtering, ένα ειδικά χτισμένο engine κερδίζει την ξεχωριστή υπηρεσία του. Ξεκινήστε με αυτό που ήδη χειρίζεστε· μετακινηθείτε μόνο όταν η αναζήτηση γίνει αργή.

Γιατί self-host αντί για managed vector υπηρεσία;

Δύο πραγματικοί λόγοι: τα embeddings σας συχνά κωδικοποιούν ιδιωτικά δεδομένα (docs, σημειώσεις, περιεχόμενο πελατών), και το self-hosting τα κρατά σε έναν server που ελέγχετε. Και είναι σταθερό κόστος — οι managed υπηρεσίες μετρούν ανά vectors και queries, ένα VPS είναι ένας μηνιαίος αριθμός χωρίς λογαριασμό ανά query.

← Πίσω στο BlogΔείτε πακέτα & τιμές →

Σχόλια

Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.

Αφήστε ένα σχόλιο

Τα σχόλια ελέγχονται πριν εμφανιστούν.