EQVPS

VPS για self-hosted RAG σε κλίμακα

Το retrieval-augmented generation παύει να είναι demo laptop μόλις το corpus γίνει πραγματικό. Ένα vector index θέλει RAM, και τα embeddings σας είναι τα ιδιωτικά σας δεδομένα. Δείτε τα μαθηματικά μεγέθους και γιατί ταιριάζει το high-memory, no-KYC hosting. Από $55/μήνα.

Ένα demo RAG σε laptop με διακόσια έγγραφα νιώθει αβίαστο. Μετά το στρέφετε σε ένα πραγματικό corpus — τα docs μιας εταιρείας, χρόνια tickets, μια πραγματική βάση γνώσης — και όλο το πράγμα γίνεται πρόβλημα μνήμης. Όχι πρόβλημα CPU. Μνήμης.

Δείτε το μέρος που οι περισσότερες σελίδες hosting παραλείπουν: το γρήγορο retrieval θέλει το index στη RAM. Κάθε chunk κειμένου γίνεται ένα embedding — ένα vector μερικές εκατοντάδες έως μερικές χιλιάδες αριθμούς πλατύ — και η αναζήτηση σημαίνει σύγκριση του query σας με όλα τους, γρήγορα. Στον δίσκο λειτουργεί, αλλά κάθε query πληρώνει έναν φόρο latency, και το χαμηλού-latency retrieval ήταν ο λόγος που κάνατε self-host εξαρχής.

Τα μαθηματικά μεγέθους, έντιμα

Μετρήστε το δικό σας corpus — η διάσταση και ο τύπος index το επηρεάζουν πολύ — αλλά ως σημείο εκκίνησης:

Γράψαμε την πλήρη καμπύλη RAM εδώ αν θέλετε τις λεπτομέρειες.

Γιατί high-memory και no-KYC μαζί

Η νοικίαση 48 GB RAM είναι εύκολη. Η νοικίασή της με crypto και χωρίς έλεγχο ταυτότητας δεν είναι — οι περισσότεροι hosts που πουλούν σοβαρή μνήμη φθηνά το κάνουν πίσω από μια κάρτα και μια φόρμα KYC. Τα embeddings σας δεν είναι αφηρημένοι αριθμοί· κωδικοποιούν το κείμενο από το οποίο προήλθαν. Τα docs σας, το περιεχόμενο των πελατών σας, μετατραπέντα σε vectors. Αν αυτά τα δεδομένα είναι αρκετά ευαίσθητα ώστε να πληρώνετε ιδιωτικά, ένα managed vector cloud αναιρεί όλο το νόημα — και το ίδιο κάνει ένας host που δένει τον server με την ταυτότητά σας.

Αυτός ο συνδυασμός — υψηλή μνήμη, αποκλειστικό IP, crypto, χωρίς KYC, νυχτερινά backups — είναι αυτό για το οποίο υπάρχει η γραμμή Pro. Δεν είναι το φθηνότερο ανά gigabyte, και αν δεν χρειάζεστε ιδιωτικότητα μπορείτε να βρείτε RAM φθηνότερα αλλού. Αλλά αν το index είναι το προϊόν σας και δεν μπορεί να φύγει, αυτό είναι το σχήμα που ταιριάζει.

Πού να ξεκινήσετε

Επιλέξτε ένα πακέτο με περιθώριο για το index συν όλα γύρω του — την εφαρμογή, τον client μοντέλου, χώρο να μεγαλώσει. Για τα περισσότερα πραγματικά corpora αυτό είναι το Pro-48 (48 GB)· ένα μεγάλο πάει στο Pro-64 ή Pro-80. Φορτώστε ένα δείγμα πρώτα, παρακολουθήστε τη μνήμη, ορίστε το μέγεθος από τον αριθμό που μετρήσατε — όχι αυτόν που φοβηθήκατε.

Αν το retrieval σας είναι μέρος ενός μεγαλύτερου συστήματος πρακτόρων, το ίδιο box συχνά κρατά και τον στόλο πρακτόρων — έτσι ένα πακέτο 48 GB γίνεται αθόρυβα ένα των 64 GB.

Έτοιμοι για ανάπτυξη; Πληρωμή με crypto, χωρίς KYC — έτοιμο σε περίπου ένα λεπτό.

Ανάπτυξη τώρα →

Συχνές ερωτήσεις

Πόση RAM χρειάζεται πραγματικά η εγκατάσταση RAG μου;

Κλιμακώνεται με τον αριθμό embeddings και το πλάτος των vectors. Μερικές εκατοντάδες χιλιάδες chunks χωρούν σε 2–4 GB· χαμηλά εκατομμύρια, με την εφαρμογή και το OS γύρω τους, προσγειώνονται στα 16–32 GB· δεκάδες εκατομμύρια σπρώχνουν στα 48 GB και πάνω. Μετρήστε ένα δείγμα, παρακολουθήστε τη resident μνήμη, κάντε extrapolate — μη μαντεύετε ψηλά, απλώς θα πληρώσετε παραπάνω.

Γιατί να μη χρησιμοποιήσω μια managed vector υπηρεσία;

Δύο λόγοι για τους οποίους οι άνθρωποι πραγματικά κάνουν self-host: τα embeddings σας κωδικοποιούν ιδιωτικά δεδομένα (docs, σημειώσεις, περιεχόμενο πελατών), οπότε το να τα κρατάτε σε μια μηχανή που ελέγχετε έχει σημασία· και το κόστος είναι σταθερό — μια managed υπηρεσία μετρά ανά vectors και queries, ένα VPS είναι ένας μηνιαίος αριθμός που μπορείτε να χτυπάτε όσο σκληρά θέλετε.

pgvector ή ένα dedicated engine;

Αν ήδη τρέχετε Postgres, το pgvector είναι η διαδρομή ελάχιστης προσπάθειας — ένα extension. Για εκατομμύρια vectors με βαρύ filtering, ένα ειδικά χτισμένο engine όπως το Qdrant κερδίζει τη δική του υπηρεσία. Ξεκινήστε με αυτό που χειρίζεστε· χωρίστε το όταν η αναζήτηση επιβραδυνθεί, όχι πριν.

Χρειάζομαι GPU για RAG;

Όχι. Το retrieval είναι δουλειά CPU + RAM — σύγκριση vectors, όχι παραγωγή κειμένου. Το βήμα generation καλεί το LLM σας (ένα API, ή έναν ξεχωριστό host μοντέλου). Ένα high-memory CPU box είναι ακριβώς το σωστό σχήμα για το μισό του retrieval.

Σχόλια

Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.

Αφήστε ένα σχόλιο

Τα σχόλια ελέγχονται πριν εμφανιστούν.