Ας είμαστε ειλικρινείς εξαρχής: αν θέλετε γρήγορη, φθηνή, υψηλής ποιότητας παραγωγή, καλέστε ένα API. Ένα CPU VPS δεν θα νικήσει ένα datacenter γεμάτο GPUs, και όποιος σας λέει το αντίθετο πουλά κάτι.
Οπότε γιατί self-host inference καθόλου; Έναν λόγο, και είναι καλός: το μοντέλο στον server σας δεν στέλνει ποτέ τα prompts σας πουθενά.
Πώς μοιάζει πραγματικά το CPU inference
Μπορείτε να τρέξετε πραγματικά μοντέλα σε CPU με αρκετή RAM. Ένα μοντέλο 7–8B quantized σε 4-bit λειτουργεί. Ένα 13B λειτουργεί. Μπορείτε ακόμη να σπρώξετε ένα μοντέλο κλάσης 30B αν έχετε τη μνήμη. Αυτό που δεν μπορείτε να κάνετε είναι να το κάνετε γρήγορο — η έξοδος έρχεται σε μερικά tokens το δευτερόλεπτο, όχι το άμεσο stream που δίνει ένα API.
Αυτή είναι η έντιμη ανταλλαγή. Για διαδραστικό chat είναι εκνευριστική. Για δουλειά παρασκηνίου — σύνοψη εγγράφων όλη νύχτα, ταξινόμηση μιας ουράς, εμπλουτισμός δεδομένων σε πρόγραμμα — τα μερικά tokens το δευτερόλεπτο είναι εντελώς εντάξει, και κανείς δεν κοιτά το ρολόι.
Τα μαθηματικά της RAM
Το μοντέλο πρέπει να κάθεται στη μνήμη, quantized ή όχι, συν overhead για context και το runtime:
- 7–8B, 4-bit — γύρω στα 6–8 GB. Τρέχει σε ένα μεσαίο πακέτο.
- 13B, 4-bit — περίπου 10–16 GB.
- Κλάσης 30B, quantized — 24–48 GB, ανάλογα με το quantization.
- Μεγαλύτερα, ή υψηλότερης ακρίβειας — είστε στα 64–80 GB γρήγορα — και πέρα από τα 80 GB κανένα μεμονωμένο box Pro δεν χωρά, ακόμη CPU-αργό.
Γι' αυτό το «τρέξε ένα τοπικό μοντέλο» γίνεται ήσυχα ένα ζήτημα υψηλής μνήμης. Το μοντέλο είναι το αποτύπωμα μνήμης. Προσθέστε ένα RAG index ή πράκτορες στο ίδιο box και τα νούμερα στοιβάζονται.
Ollama vs vLLM, σύντομα
Το Ollama είναι η εύκολη πόρτα — install, ollama run, τελείωσε. Είναι το σωστό εργαλείο για μια ιδιωτική single-user εγκατάσταση όπου θέλετε απλώς το μοντέλο διαθέσιμο. Το vLLM είναι φτιαγμένο για serving throughput: περισσότερη εγκατάσταση, καλύτερο υπό ταυτόχρονο φορτίο, αξίζει όταν πραγματικά χειρίζεστε όγκο. Ξεκινήστε με Ollama· στραφείτε στο vLLM όταν εξυπηρετείτε πραγματική κίνηση.
Πού κερδίζει γνήσια το private-first
Η υπόθεση για self-hosted inference δεν είναι η ταχύτητα ή το κόστος — είναι ότι κάποια δεδομένα δεν μπορούν να φύγουν. Νομικά έγγραφα. Ιατρικά αρχεία. Ιδιόκτητος κώδικας. Οτιδήποτε όπου η αποστολή του prompt σε ένα third-party API είναι εκτός συζήτησης για λόγους πολιτικής ή εμπιστοσύνης. Ένα πιο αργό μοντέλο που τρέχει εξ ολοκλήρου στη μηχανή σας νικά ένα γρήγορο που καταγράφει ό,τι του στέλνετε.
Και αν τα δεδομένα είναι τόσο ευαίσθητα, η πληρωμή πιθανώς θα έπρεπε να είναι ιδιωτική επίσης. Η νοικίαση του box με crypto και χωρίς KYC κρατά όλη την αλυσίδα — server, μοντέλο, prompts, χρέωση — μακριά από τα αρχεία ταυτότητας οποιουδήποτε. Αυτό είναι το πραγματικό pitch: όχι «φθηνότερο inference», αλλά «inference που κανείς άλλος δεν μπορεί να δει».
Κατακλείδα
Για ταχύτητα και ποιότητα, χρησιμοποιήστε ένα API — καμία ντροπή σε αυτό. Self-host όταν η ιδιωτικότητα είναι η απαίτηση και το πιο αργό είναι αποδεκτό. Ορίστε το μέγεθος για το μοντέλο συν το context του συν οτιδήποτε άλλο μοιράζεται το box, και μην περιμένετε ταχύτητα GPU από CPU.
Όταν το μοντέλο χρειάζεται πραγματική μνήμη, η γραμμή Pro τρέχει 32 έως 80 GB με αποκλειστικό IP και νυχτερινά backups — αρκετά για να κρατήσετε ένα σοβαρό quantized μοντέλο με χώρο για context γύρω του.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.