Ας βγάλουμε το απογοητευτικό μέρος από τη μέση, γιατί το διαδίκτυο είναι γεμάτο σελίδες που δεν το κάνουν.
Οι servers μας είναι μόνο CPU. Δεν προσφέρουμε GPUs. Αυτό σημαίνει ότι η δουλειά τοπικού LLM εδώ έχει ένα σκληρό ταβάνι, και το να προσποιηθούμε το αντίθετο απλώς θα σπαταλούσε τα χρήματά σας.
Τι λειτουργεί πραγματικά σε CPU
Με έως 6 vCPU και 6 GB RAM (το πακέτο Medium μας — $12/μήνα), είστε στο εύρος μικρών quantized μοντέλων:
- Μοντέλα 1B–3B (Q4): γνήσια χρησιμοποιήσιμα. Αρκετά γρήγορα για ταξινόμηση, tagging, δρομολόγηση και απλή δομημένη εξαγωγή.
- Μοντέλα 7B–8B (Q4): τρέχουν, αλλά περιμένετε μερικά tokens το δευτερόλεπτο. Εντάξει για μια ουρά που μασάει έγγραφα όλη νύχτα. Επώδυνο ως παράθυρο chat.
- Μοντέλα embedding: εξαιρετικό ταίρι. Είναι μικρά, γρήγορα σε CPU, και αυτός είναι πιθανώς ο μοναδικός καλύτερος λόγος να τρέξετε Ollama σε ένα box σαν το δικό μας.
- 13B και πάνω: μην. Θα κάνετε swap και θα περιμένετε.
Αν χρειάζεστε ένα γρήγορο, διαδραστικό chat 70B, χρειάζεστε έναν GPU host — αυτό είναι διαφορετικό προϊόν από διαφορετικό πάροχο, και προτιμάμε να σας το πούμε παρά να πάρουμε τα $12 σας.
Πού κερδίζει γνήσια ένα CPU box
Ιδιωτικότητα. Τα έγγραφά σας, τα prompts σας, τα embeddings σας — να μη φεύγουν ποτέ από μια μηχανή που ελέγχετε, να μη γίνονται ποτέ δεδομένα εκπαίδευσης κάποιου. Για πολλούς αυτό είναι όλο το νόημα, και τα μερικά tokens το δευτερόλεπτο είναι μια αποδεκτή ανταλλαγή.
Προβλεψιμότητα κόστους. Χωρίς λογαριασμό ανά token. Ένα pipeline που ταξινομεί πενήντα χιλιάδες εγγραφές κοστίζει το ίδιο με ένα που ταξινομεί πενήντα: $12.
Ασύγχρονη δουλειά. Η πιο χρήσιμη δουλειά LLM δεν είναι ένα παράθυρο chat. Είναι μια ουρά: σύνοψε αυτά, tag-άρισε εκείνα, κάνε embed αυτό το corpus. Ένα CPU box που μασάει ένα backlog όλη νύχτα είναι απόλυτα καλό σε αυτό.
Εγκατάσταση
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Το Ollama εξυπηρετεί ένα HTTP API στο localhost:11434. Κρατήστε το εκεί. Αν χρειάζεται να το φτάσετε από αλλού, βάλτε το πίσω από ένα reverse proxy με έλεγχο ταυτότητας σε ένα πακέτο αποκλειστικού IP — ποτέ μην εκθέτετε ένα endpoint μοντέλου χωρίς έλεγχο ταυτότητας στο ανοιχτό διαδίκτυο.
Συνδυάστε το με μια vector database (Qdrant ή pgvector σε Docker) και έχετε ένα πλήρες ιδιωτικό RAG stack σε ένα box $12. Αυτός ο συνδυασμός — μικρά τοπικά embeddings, τοπικό vector store, εξωτερικό API μόνο για το βαρύ βήμα generation — είναι η εγκατάσταση που πραγματικά βγάζει νόημα σε hardware σαν αυτό.
Επιλογή πακέτου
| Χρήση | Πακέτο | Τιμή |
|---|---|---|
| Embeddings, μοντέλα 1–3B, RAG pipeline | Medium | $12/μήνα |
| Το ίδιο, συν ένα δημόσιο endpoint πίσω από auth | Medium-IP | $20/μήνα |
| Απλώς δοκιμή μικρών μοντέλων | Small | $8/μήνα |
Μόνο CPU, έως 6 vCPU και 6 GB RAM. Αποθήκευση NVMe, αμέτρητη κίνηση, Γερμανία ή Φινλανδία. Πληρωμή με crypto, χωρίς KYC. Η ετήσια χρέωση είναι μία μεταφορά αντί για δώδεκα.
Σχετική ανάγνωση
- Φιλοξενήστε μια vector DB για μνήμη AI — το άλλο μισό ενός ιδιωτικού RAG stack
- VPS για AI πράκτορες — ενορχήστρωση στο ίδιο box
Έτοιμοι; Αναπτύξτε έναν server → — ζωντανός σε περίπου ένα λεπτό, πληρωμένος με crypto, χωρίς απαίτηση ID.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.