Το να στέλνετε κάθε prompt στο API κάποιου άλλου είναι εντάξει — μέχρι που δεν είναι. Ίσως τα δεδομένα είναι ευαίσθητα και προτιμάτε να μη φεύγουν ποτέ από τον server σας. Ίσως βαρεθήκατε τα rate limits, ή μια έκδοση μοντέλου που αλλάζει κάτω από τα πόδια σας, ή έναν μετρητή ανά token που χτυπά όσο πειραματίζεστε. Σε κάποιο σημείο το «τι θα γινόταν αν έτρεχα το δικό μου;» παύει να είναι νοητικό πείραμα.
Το Ollama το κάνει γνήσια εύκολο. Η πιο δύσκολη ερώτηση είναι τι χωρά σε VPS — και εδώ η έντιμη απάντηση μετρά περισσότερο από την υπερβολή.
Τι μπορείτε πραγματικά να τρέξετε σε CPU
Χωρίς GPU; Τότε κάνετε CPU inference, και το μέγεθος μοντέλου είναι τα πάντα. Το quantization (συμπίεση των weights σε 4-bit) είναι αυτό που το κάνει πρακτικό — χάνετε ένα ψίχουλο ποιότητας και σώζετε έναν σωρό μνήμη.
Πρόχειρα νούμερα, αυτά που μετρούν:
- Μοντέλο 3B, 4-bit — ~3 GB RAM. Αρκετά γρήγορο για chat και απλές εργασίες.
- Μοντέλο 7B, 4-bit — ~5 GB RAM. Το ιδανικό σημείο: αισθητά εξυπνότερο, ακόμη τρέχει σε αναγνώσιμο ρυθμό.
- 13B και πάνω — 8-10 GB+ και αργό σε CPU. Τεχνικά δυνατό, πρακτικά εκνευριστικό.
Ταχύτητα, έντιμα: σε μερικά vCPUs θα δείτε μια χούφτα tokens το δευτερόλεπτο. Απόλυτα εντάξει για ένα chatbot ή έναν coding assistant όπου διαβάζετε καθώς πληκτρολογεί. Όχι εντάξει για batch-processing ενός εκατομμυρίου εγγράφων — αυτό είναι δουλειά GPU, και δεν προσποιούμαστε το αντίθετο. Δεν προσφέρουμε GPU instances. Αν το σχέδιό σας χρειάζεται ένα μοντέλο 70B ή βαρύ throughput, ένα CPU VPS — δικό μας ή οποιουδήποτε — είναι το λάθος εργαλείο, και θα πρέπει να το ξέρετε πριν ξοδέψετε ένα σεντ.
Αλλά ένα ιδιωτικό 7B που απαντά στις ερωτήσεις σας και δεν τηλεφωνεί ποτέ σπίτι; Αυτό τρέχει άνετα σε ένα box 6 GB.
Η εγκατάσταση — τρεις εντολές
Στήστε τον server, συνδεθείτε με SSH, και:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
Αυτό είναι — κάνετε chat στο terminal. Για να το χρησιμοποιήσετε από τον δικό σας κώδικα, το Ollama ήδη εξυπηρετεί ένα HTTP API στο port 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
Ένα gotcha που αξίζει να ξέρετε εξαρχής: εξ ορισμού αυτό το API δένεται στο localhost. Κρατήστε το έτσι και κάντε tunnel μέσω SSH, αλλιώς είναι εκτεθειμένο στο διαδίκτυο. Αν το θέλετε προσβάσιμο, βάλτε το πίσω από auth — μην αφήνετε ένα ανοιχτό endpoint μοντέλου σε ένα δημόσιο IP.
Επιλέγοντας το box
Ταιριάξτε το πακέτο με το μοντέλο, όχι το αντίστροφο:
| Θέλετε να τρέξετε | RAM που χρειάζεστε | Λογικό πακέτο |
|---|---|---|
| Μοντέλο 3B, ελαφριά χρήση | ~3 GB | Small (4 GB) |
| Μοντέλο 7B, άνετα | ~5-6 GB | Medium (6 GB) |
| Μεγαλύτερο / υψηλό throughput | περιοχή GPU | όχι CPU VPS |
Για τους περισσότερους self-hosters, το Medium (6 GB) είναι η έντιμη σύσταση — αρκετό περιθώριο για ένα μοντέλο 7B συν την εφαρμογή σας και το OS. Το Small (4 GB) λειτουργεί αν μείνετε σε 3B. Οτιδήποτε κάτω από αυτό είναι πολύ στενό μόλις το OS και το context φάνε μέσα.
Γιατί να το κάνετε εδώ
Αν κάνετε self-host ένα LLM, η ιδιωτικότητα είναι συνήθως ο μισός λόγος — οπότε θα ήταν περίεργο να παραδώσετε το ID σας για να νοικιάσετε το box. Δεν χρειάζεται: μπορείτε να πληρώσετε σε USDC ή USDT (ή μια κάρτα μέσω του on-ramp), χωρίς KYC, και ο server είναι δικός σας σε περίπου ένα λεπτό. Crypto-native, agent-friendly, και τα δεδομένα μένουν σε μια μηχανή που ελέγχετε.
Το trade-off είναι αυτό για το οποίο ήμασταν έντιμοι: μόνο CPU, ένα ταβάνι 6 GB, μικρά μοντέλα. Μέσα σε αυτό, το self-hosting είναι υπέροχο. Έξω από αυτό, μην αφήσετε κανέναν να σας πουλήσει ένα CPU box για μια δουλειά που χρειάζεται GPU.
Έτοιμοι να δοκιμάσετε; Επιλέξτε ένα πακέτο, πληρώστε, και θα έχετε root σε περίπου 60 δευτερόλεπτα — μετά είναι τρεις εντολές μέχρι το δικό σας ιδιωτικό μοντέλο.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.