EQVPS

Πώς να εγκαταστήσετε το Ollama σε ένα VPS (και να καλέσετε το API του)

Εγκατέστησε το Ollama σε ένα VPS, κατέβασε ένα μικρό μοντέλο και κάλεσε το HTTP API του — με την ειλικρινή σημείωση ότι αυτά είναι μηχανήματα CPU, οπότε μείνε σε μικρά κβαντισμένα μοντέλα και embeddings. Εντολές copy-paste, και πώς να το εκθέσεις με ασφάλεια.

Το Ollama κάνει το τρέξιμο ενός τοπικού μοντέλου εγκατάσταση μιας γραμμής. Αυτός είναι ο οδηγός· για την ειλικρινή εικόνα του τι μπορεί και τι δεν μπορεί η CPU inference (και το ιδανικό σημείο του RAG), δες το use-case VPS για Ollama και self-host Ollama.

1. Εγκατέστησε το Ollama

curl -fsSL https://ollama.com/install.sh | sh

Αυτό εγκαθιστά το Ollama και το ξεκινά ως υπηρεσία systemd που ακούει στο localhost:11434.

2. Κατέβασε και τρέξε ένα μικρό μοντέλο

Σε ένα μηχάνημα CPU, ξεκίνα μικρά:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Τα μοντέλα 3B είναι πραγματικά χρησιμοποιήσιμα σε CPU· τα 7–8B τρέχουν με λίγα tokens/sec (εντάξει για batch, βασανιστικά για chat)· τα 13B+ θα κάνουν swap και θα σέρνονται — μην το κάνεις.

3. Κάλεσε το HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Τα embeddings είναι το ιδανικό σημείο της CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Κράτα το στο localhost — έκθεσέ το με ασφάλεια αν χρειαστεί

Το Ollama δένεται στο 127.0.0.1:11434 εξ ορισμού. Άφησέ το εκεί. Αν χρειαστεί να το φτάσεις από άλλο μηχάνημα, βάλε μπροστά έναν reverse proxy με auth σε πλάνο με αποκλειστική IP (οδηγός nginx + HTTPS) ή χρησιμοποίησε σήραγγα SSH — ποτέ μην εκθέτεις δημόσια ένα endpoint μοντέλου χωρίς αυθεντικοποίηση.

Το ειλικρινές κομμάτι

Αυτά είναι instances μόνο με CPU (χωρίς GPU). Τα μικρά κβαντισμένα μοντέλα και τα embeddings τρέχουν καλά· τα μεγάλα όχι. Συνδύασε το Ollama με μια βάση δεδομένων διανυσμάτων για μια ιδιωτική στοίβα RAG — μικρά τοπικά embeddings μαζί με έναν τοπικό vector store είναι το setup που λάμπει πραγματικά εδώ. Το Medium ($12/μήνα, 6 GB) είναι το άνετο πλάνο. Root σε περίπου ένα λεπτό, χωρίς KYC, πληρωμή σε crypto.

Συχνές ερωτήσεις

Πώς εγκαθιστώ το Ollama σε ένα VPS;

Μία εντολή: curl -fsSL https://ollama.com/install.sh | sh. Μετά ollama pull ένα μικρό μοντέλο και ollama run, ή κάλεσε το HTTP API στο localhost:11434. Τα βήματα είναι παρακάτω. Σε ένα VPS με CPU μείνε σε μικρά κβαντισμένα μοντέλα (1B–8B) και embeddings — τα μεγάλα μοντέλα χρειάζονται GPU.

Θα είναι γρήγορα τα μοντέλα σε ένα VPS με CPU;

Τα μικρά ναι, τα μεγάλα όχι. Περίμενε λίγα tokens ανά δευτερόλεπτο σε ένα μοντέλο 7–8B με κβαντισμό 4-bit, και πραγματικά γρήγορη απόδοση σε μοντέλα 1–3B και μοντέλα embeddings. Ιδανικό για jobs στο παρασκήνιο, ταξινόμηση και pipelines RAG — όχι για ένα γρήγορο διαδραστικό chat σε μεγάλο μοντέλο.

Να εκθέσω το API του Ollama στο διαδίκτυο;

Όχι. Κράτησέ το στο localhost:11434. Αν χρειάζεσαι απομακρυσμένη πρόσβαση, βάλ' το πίσω από έναν reverse proxy με αυθεντικοποίηση σε πλάνο με αποκλειστική IP, ή φτάσε το μέσω σήραγγας SSH. Ποτέ μην εκθέτεις ένα endpoint μοντέλου χωρίς αυθεντικοποίηση στο ανοιχτό διαδίκτυο.

Ποιο πλάνο χρειάζομαι;

Το Medium μας ($12/μήνα, 6 GB) ταιριάζει άνετα σε μικρά μοντέλα και embeddings· το Small ($8) κάνει για δοκιμή μοντέλων 1–3B. Αυτά είναι instances μόνο με CPU — χωρίς GPU — οπότε διαστασιολόγησε βάσει του αποτυπώματος RAM του μοντέλου, όχι ελπίζοντας για ταχύτητα.

Ζητάτε ταυτότητα ή κάρτα;

Όχι. Ένα email για εγγραφή, πληρωμή σε USDC ή USDT — χωρίς έγγραφα, χωρίς κάρτα.

Σχόλια

Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.

Αφήστε ένα σχόλιο

Τα σχόλια ελέγχονται πριν εμφανιστούν.