EQVPS

VPS για ιδιωτικό high-memory LLM inference

Τα μεγαλύτερα quantized μοντέλα χρειάζονται πραγματική RAM, όχι μια GPU που δεν έχετε. Πού ένα high-memory CPU box τρέχει μοντέλα κλάσης 30B ιδιωτικά, τι είναι ρεαλιστικό, και πού δεν είναι. Από $70/μήνα.

Έχουμε μια ξεχωριστή σελίδα για το Ollama και τα μικρά μοντέλα — αυτό είναι το CPU box $12 που τρέχει 1B–8B και embeddings. Αυτή η σελίδα είναι το άλλο άκρο: τα μοντέλα αρκετά μεγάλα ώστε η RAM, όχι η CPU, να είναι αυτό που σας σταματά.

Ας είμαστε ειλικρινείς εξαρχής, όπως παντού: οι servers μας είναι μόνο CPU, χωρίς GPU. Ένα μεγάλο μοντέλο εδώ τρέχει αργά. Αν θέλετε γρήγορο διαδραστικό chat σε μοντέλο 30B, χρειάζεστε έναν GPU host — διαφορετικό προϊόν, διαφορετικός πάροχος. Αυτό που κάνει καλά ένα high-memory CPU box είναι να τρέχει ένα μεγάλο quantized μοντέλο ιδιωτικά για δουλειά που δεν είναι παράθυρο chat.

Τα μαθηματικά της RAM

Το μοντέλο κάθεται στη μνήμη, quantized ή όχι, συν overhead για context και το runtime:

Γι' αυτό το «τρέξε ένα μεγαλύτερο τοπικό μοντέλο» είναι πραγματικά ένα ζήτημα υψηλής μνήμης. Το μοντέλο είναι το αποτύπωμα μνήμης. Προσθέστε ένα RAG index στον ίδιο host και τα νούμερα στοιβάζονται.

Πού κερδίζει γνήσια το private-first

Η υπόθεση δεν είναι η ταχύτητα και δεν είναι το κόστος — είναι ότι κάποια δεδομένα δεν μπορούν να φύγουν. Νομικά έγγραφα. Ιατρικά αρχεία. Ιδιόκτητος κώδικας. Οτιδήποτε όπου η αποστολή του prompt σε ένα third-party API είναι εκτός συζήτησης. Ένα πιο αργό μοντέλο που τρέχει εξ ολοκλήρου στη μηχανή σας νικά ένα γρήγορο που καταγράφει ό,τι του στέλνετε. Γράψαμε την πλήρη εικόνα εδώ.

Και αν τα δεδομένα είναι τόσο ευαίσθητα, η πληρωμή πιθανώς θα έπρεπε να είναι ιδιωτική επίσης. Η νοικίαση του box με crypto και χωρίς KYC κρατά όλη την αλυσίδα — server, μοντέλο, prompts, χρέωση — μακριά από τα αρχεία ταυτότητας οποιουδήποτε. Αυτό είναι το pitch: όχι φθηνότερο inference, αλλά inference που κανείς άλλος δεν μπορεί να δει.

Τι να επιλέξετε

Για ένα μοντέλο κλάσης 30B με χώρο για context, το Pro-64 (64 GB) είναι η άνετη επιλογή· ένα σφιχτότερο quantization χωρά σε Pro-32 ή Pro-48, ένα μεγαλύτερο πάει στο Pro-80. Φορτώστε πρώτα το μοντέλο, παρακολουθήστε τη resident μνήμη, ορίστε το μέγεθος από αυτό που μετρήσατε. Και ορίστε προσδοκίες: αυτό είναι ιδιωτικό batch inference, όχι ένα γρήγορο παράθυρο chat.

Έτοιμοι για ανάπτυξη; Πληρωμή με crypto, χωρίς KYC — έτοιμο σε περίπου ένα λεπτό.

Ανάπτυξη τώρα →

Συχνές ερωτήσεις

Σε τι διαφέρει αυτό από την περίπτωση χρήσης Ollama σας;

Η σελίδα Ollama αφορά μικρά μοντέλα σε ένα CPU box $12 — 1B–8B, embeddings, ελαφριά δουλειά. Αυτό είναι το high-memory άκρο: quantized μοντέλα κλάσης 13B έως 30B που χρειάζονται 24–48 GB ή περισσότερα για να φορτώσουν καν. Ίδια μόνο-CPU πραγματικότητα, πολύ μεγαλύτερο αποτύπωμα μνήμης, διαφορετικό πακέτο.

Πόση RAM για ένα δεδομένο μοντέλο;

Το μοντέλο πρέπει να χωρά στη μνήμη συν το overhead. Ένα μοντέλο 13B 4-bit θέλει ~10–16 GB· τα quantized κλάσης 30B σπρώχνουν στα 24–48 GB· πηγαίνετε μεγαλύτερα ή υψηλότερης ακρίβειας και είστε στα 64–80 GB — πέρα από αυτό, κανένα μεμονωμένο box μας δεν χωρά. Προσθέστε χώρο για context από πάνω.

Θα είναι γρήγορο;

Όχι — να είστε ειλικρινείς με τον εαυτό σας εδώ. Το CPU inference σε ένα μεγάλο μοντέλο είναι μερικά tokens το δευτερόλεπτο, όχι ένα διαδραστικό stream. Είναι εντάξει για batch και εργασία παρασκηνίου (σύνοψη όλη νύχτα, ταξινόμηση μιας ουράς). Για real-time chat σε μεγάλο μοντέλο χρειάζεστε GPU, που δεν προσφέρουμε.

Γιατί να το τρέξω εδώ αντί για ένα API;

Ιδιωτικότητα. Τα prompts και οι έξοδοί σας δεν αγγίζουν ποτέ τους servers ή τα logs ενός παρόχου. Για ευαίσθητα δεδομένα — νομικά, ιατρικά, εσωτερικό κώδικα — ένα πιο αργό ιδιωτικό μοντέλο νικά ένα γρήγορο που βλέπει τα πάντα. Συνδυάστε το με πληρωμή crypto no-KYC και όλη η αλυσίδα παραμένει δική σας.

Σχόλια

Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.

Αφήστε ένα σχόλιο

Τα σχόλια ελέγχονται πριν εμφανιστούν.