Έχουμε μια ξεχωριστή σελίδα για το Ollama και τα μικρά μοντέλα — αυτό είναι το CPU box $12 που τρέχει 1B–8B και embeddings. Αυτή η σελίδα είναι το άλλο άκρο: τα μοντέλα αρκετά μεγάλα ώστε η RAM, όχι η CPU, να είναι αυτό που σας σταματά.
Ας είμαστε ειλικρινείς εξαρχής, όπως παντού: οι servers μας είναι μόνο CPU, χωρίς GPU. Ένα μεγάλο μοντέλο εδώ τρέχει αργά. Αν θέλετε γρήγορο διαδραστικό chat σε μοντέλο 30B, χρειάζεστε έναν GPU host — διαφορετικό προϊόν, διαφορετικός πάροχος. Αυτό που κάνει καλά ένα high-memory CPU box είναι να τρέχει ένα μεγάλο quantized μοντέλο ιδιωτικά για δουλειά που δεν είναι παράθυρο chat.
Τα μαθηματικά της RAM
Το μοντέλο κάθεται στη μνήμη, quantized ή όχι, συν overhead για context και το runtime:
- 13B, 4-bit — περίπου 10–16 GB. Τρέχει ήδη σε ένα μεσαίο πακέτο.
- Κλάσης 30B, quantized — 24–48 GB ανάλογα με το quantization. Αυτό είναι περιοχή Pro-32 έως Pro-64.
- Μεγαλύτερα ή υψηλότερης ακρίβειας — 64–80 GB, και πέρα από τα 80 GB κανένα μεμονωμένο box μας δεν χωρά. Το Pro-80 είναι το ταβάνι εδώ.
Γι' αυτό το «τρέξε ένα μεγαλύτερο τοπικό μοντέλο» είναι πραγματικά ένα ζήτημα υψηλής μνήμης. Το μοντέλο είναι το αποτύπωμα μνήμης. Προσθέστε ένα RAG index στον ίδιο host και τα νούμερα στοιβάζονται.
Πού κερδίζει γνήσια το private-first
Η υπόθεση δεν είναι η ταχύτητα και δεν είναι το κόστος — είναι ότι κάποια δεδομένα δεν μπορούν να φύγουν. Νομικά έγγραφα. Ιατρικά αρχεία. Ιδιόκτητος κώδικας. Οτιδήποτε όπου η αποστολή του prompt σε ένα third-party API είναι εκτός συζήτησης. Ένα πιο αργό μοντέλο που τρέχει εξ ολοκλήρου στη μηχανή σας νικά ένα γρήγορο που καταγράφει ό,τι του στέλνετε. Γράψαμε την πλήρη εικόνα εδώ.
Και αν τα δεδομένα είναι τόσο ευαίσθητα, η πληρωμή πιθανώς θα έπρεπε να είναι ιδιωτική επίσης. Η νοικίαση του box με crypto και χωρίς KYC κρατά όλη την αλυσίδα — server, μοντέλο, prompts, χρέωση — μακριά από τα αρχεία ταυτότητας οποιουδήποτε. Αυτό είναι το pitch: όχι φθηνότερο inference, αλλά inference που κανείς άλλος δεν μπορεί να δει.
Τι να επιλέξετε
Για ένα μοντέλο κλάσης 30B με χώρο για context, το Pro-64 (64 GB) είναι η άνετη επιλογή· ένα σφιχτότερο quantization χωρά σε Pro-32 ή Pro-48, ένα μεγαλύτερο πάει στο Pro-80. Φορτώστε πρώτα το μοντέλο, παρακολουθήστε τη resident μνήμη, ορίστε το μέγεθος από αυτό που μετρήσατε. Και ορίστε προσδοκίες: αυτό είναι ιδιωτικό batch inference, όχι ένα γρήγορο παράθυρο chat.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.