EQVPS

Self-hosting ενός τοπικού LLM σε VPS με Ollama — τι πραγματικά λειτουργεί

Jun 14, 2026 · 3 λεπτά ανάγνωσης · EQVPS Team

Το να στέλνετε κάθε prompt στο API κάποιου άλλου είναι εντάξει — μέχρι που δεν είναι. Ίσως τα δεδομένα είναι ευαίσθητα και προτιμάτε να μη φεύγουν ποτέ από τον server σας. Ίσως βαρεθήκατε τα rate limits, ή μια έκδοση μοντέλου που αλλάζει κάτω από τα πόδια σας, ή έναν μετρητή ανά token που χτυπά όσο πειραματίζεστε. Σε κάποιο σημείο το «τι θα γινόταν αν έτρεχα το δικό μου;» παύει να είναι νοητικό πείραμα.

Το Ollama το κάνει γνήσια εύκολο. Η πιο δύσκολη ερώτηση είναι τι χωρά σε VPS — και εδώ η έντιμη απάντηση μετρά περισσότερο από την υπερβολή.

Τι μπορείτε πραγματικά να τρέξετε σε CPU

Χωρίς GPU; Τότε κάνετε CPU inference, και το μέγεθος μοντέλου είναι τα πάντα. Το quantization (συμπίεση των weights σε 4-bit) είναι αυτό που το κάνει πρακτικό — χάνετε ένα ψίχουλο ποιότητας και σώζετε έναν σωρό μνήμη.

Πρόχειρα νούμερα, αυτά που μετρούν:

Ταχύτητα, έντιμα: σε μερικά vCPUs θα δείτε μια χούφτα tokens το δευτερόλεπτο. Απόλυτα εντάξει για ένα chatbot ή έναν coding assistant όπου διαβάζετε καθώς πληκτρολογεί. Όχι εντάξει για batch-processing ενός εκατομμυρίου εγγράφων — αυτό είναι δουλειά GPU, και δεν προσποιούμαστε το αντίθετο. Δεν προσφέρουμε GPU instances. Αν το σχέδιό σας χρειάζεται ένα μοντέλο 70B ή βαρύ throughput, ένα CPU VPS — δικό μας ή οποιουδήποτε — είναι το λάθος εργαλείο, και θα πρέπει να το ξέρετε πριν ξοδέψετε ένα σεντ.

Αλλά ένα ιδιωτικό 7B που απαντά στις ερωτήσεις σας και δεν τηλεφωνεί ποτέ σπίτι; Αυτό τρέχει άνετα σε ένα box 6 GB.

Η εγκατάσταση — τρεις εντολές

Στήστε τον server, συνδεθείτε με SSH, και:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

Αυτό είναι — κάνετε chat στο terminal. Για να το χρησιμοποιήσετε από τον δικό σας κώδικα, το Ollama ήδη εξυπηρετεί ένα HTTP API στο port 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Ένα gotcha που αξίζει να ξέρετε εξαρχής: εξ ορισμού αυτό το API δένεται στο localhost. Κρατήστε το έτσι και κάντε tunnel μέσω SSH, αλλιώς είναι εκτεθειμένο στο διαδίκτυο. Αν το θέλετε προσβάσιμο, βάλτε το πίσω από auth — μην αφήνετε ένα ανοιχτό endpoint μοντέλου σε ένα δημόσιο IP.

Επιλέγοντας το box

Ταιριάξτε το πακέτο με το μοντέλο, όχι το αντίστροφο:

Θέλετε να τρέξετεRAM που χρειάζεστεΛογικό πακέτο
Μοντέλο 3B, ελαφριά χρήση~3 GBSmall (4 GB)
Μοντέλο 7B, άνετα~5-6 GBMedium (6 GB)
Μεγαλύτερο / υψηλό throughputπεριοχή GPUόχι CPU VPS

Για τους περισσότερους self-hosters, το Medium (6 GB) είναι η έντιμη σύσταση — αρκετό περιθώριο για ένα μοντέλο 7B συν την εφαρμογή σας και το OS. Το Small (4 GB) λειτουργεί αν μείνετε σε 3B. Οτιδήποτε κάτω από αυτό είναι πολύ στενό μόλις το OS και το context φάνε μέσα.

Γιατί να το κάνετε εδώ

Αν κάνετε self-host ένα LLM, η ιδιωτικότητα είναι συνήθως ο μισός λόγος — οπότε θα ήταν περίεργο να παραδώσετε το ID σας για να νοικιάσετε το box. Δεν χρειάζεται: μπορείτε να πληρώσετε σε USDC ή USDT (ή μια κάρτα μέσω του on-ramp), χωρίς KYC, και ο server είναι δικός σας σε περίπου ένα λεπτό. Crypto-native, agent-friendly, και τα δεδομένα μένουν σε μια μηχανή που ελέγχετε.

Το trade-off είναι αυτό για το οποίο ήμασταν έντιμοι: μόνο CPU, ένα ταβάνι 6 GB, μικρά μοντέλα. Μέσα σε αυτό, το self-hosting είναι υπέροχο. Έξω από αυτό, μην αφήσετε κανέναν να σας πουλήσει ένα CPU box για μια δουλειά που χρειάζεται GPU.

Έτοιμοι να δοκιμάσετε; Επιλέξτε ένα πακέτο, πληρώστε, και θα έχετε root σε περίπου 60 δευτερόλεπτα — μετά είναι τρεις εντολές μέχρι το δικό σας ιδιωτικό μοντέλο.

Συχνές ερωτήσεις

Μπορώ να τρέξω ένα LLM χωρίς GPU;

Ναι, για μικρά μοντέλα. Ένα μοντέλο 3B ή 7B σε 4-bit quantization τρέχει σε CPU και απαντά σε αναγνώσιμο ρυθμό — εντάξει για ένα chatbot, έναν coding helper, ή εργασίες παρασκηνίου όπου δεν κοιτάτε τον κέρσορα. Αυτό που δεν μπορείτε να κάνετε σε CPU είναι να εξυπηρετήσετε ένα μεγάλο μοντέλο (13B και πάνω) ή να σπρώξετε υψηλό throughput· εκεί το GPU παύει να είναι προαιρετικό.

Πόση RAM χρειάζομαι για το Llama 7B;

Γύρω στα 5 GB για ένα 4-bit 7B μοντέλο μόλις προσθέσετε το context window και το OS — οπότε ένα box 6 GB είναι το άνετο κατώφλι. Ένα μοντέλο 3B χωρά σε περίπου 3 GB. Το μικρότερο quant (Q4) ανταλλάσσει λίγη ποιότητα για πολύ λιγότερη μνήμη, που είναι η σωστή ανταλλαγή σε VPS.

Είναι το self-hosting ενός LLM φθηνότερο από ένα API;

Εξαρτάται από τον όγκο. Ένα hosted API χρεώνει ανά token και δεν κοστίζει τίποτα όταν είναι αδρανές· ένα VPS είναι ένας σταθερός μηνιαίος λογαριασμός είτε το χρησιμοποιείτε είτε όχι. Αν τρέχετε μια σταθερή ροή αιτημάτων, ή νοιάζεστε κυρίως για ιδιωτικότητα και χωρίς rate limits, το self-hosting κερδίζει. Για περιστασιακά μεμονωμένα prompts, ένα μετρημένο API είναι φθηνότερο.

Γιατί self-host αντί να χρησιμοποιώ ένα cloud API;

Τρεις λόγοι για τους οποίους οι άνθρωποι πραγματικά το κάνουν: τα δεδομένα δεν φεύγουν ποτέ από τον server σας (πραγματικό για νομικά, ιατρικά, ή απλώς ιδιωτικές σημειώσεις), δεν υπάρχουν rate limits ή μετρητής ανά token, και το μοντέλο δεν θα αλλάξει ή θα καταργηθεί κάτω από τα πόδια σας. Το κόστος είναι ότι διαχειρίζεστε το box και ζείτε εντός του hardware του.

Ποιο είναι το μεγαλύτερο μοντέλο που μπορώ ρεαλιστικά να τρέξω σε CPU VPS;

Ένα μοντέλο 7B σε 4-bit είναι το ιδανικό σημείο σε ένα box 6 GB. Μπορείτε τεχνικά να φορτώσετε ένα 13B με αρκετή RAM, αλλά σε CPU γίνεται αρκετά αργό ώστε να το νιώσετε. Πέρα από αυτό θέλετε GPU, που είναι διαφορετικό είδος host.

← Πίσω στο BlogΔείτε πακέτα & τιμές →

Σχόλια

Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.

Αφήστε ένα σχόλιο

Τα σχόλια ελέγχονται πριν εμφανιστούν.