Το Ollama κάνει το τρέξιμο ενός τοπικού μοντέλου εγκατάσταση μιας γραμμής. Αυτός είναι ο οδηγός· για την ειλικρινή εικόνα του τι μπορεί και τι δεν μπορεί η CPU inference (και το ιδανικό σημείο του RAG), δες το use-case VPS για Ollama και self-host Ollama.
1. Εγκατέστησε το Ollama
curl -fsSL https://ollama.com/install.sh | sh
Αυτό εγκαθιστά το Ollama και το ξεκινά ως υπηρεσία systemd που ακούει στο localhost:11434.
2. Κατέβασε και τρέξε ένα μικρό μοντέλο
Σε ένα μηχάνημα CPU, ξεκίνα μικρά:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Τα μοντέλα 3B είναι πραγματικά χρησιμοποιήσιμα σε CPU· τα 7–8B τρέχουν με λίγα tokens/sec (εντάξει για batch, βασανιστικά για chat)· τα 13B+ θα κάνουν swap και θα σέρνονται — μην το κάνεις.
3. Κάλεσε το HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Τα embeddings είναι το ιδανικό σημείο της CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Κράτα το στο localhost — έκθεσέ το με ασφάλεια αν χρειαστεί
Το Ollama δένεται στο 127.0.0.1:11434 εξ ορισμού. Άφησέ το εκεί. Αν χρειαστεί να το φτάσεις από άλλο μηχάνημα, βάλε μπροστά έναν reverse proxy με auth σε πλάνο με αποκλειστική IP (οδηγός nginx + HTTPS) ή χρησιμοποίησε σήραγγα SSH — ποτέ μην εκθέτεις δημόσια ένα endpoint μοντέλου χωρίς αυθεντικοποίηση.
Το ειλικρινές κομμάτι
Αυτά είναι instances μόνο με CPU (χωρίς GPU). Τα μικρά κβαντισμένα μοντέλα και τα embeddings τρέχουν καλά· τα μεγάλα όχι. Συνδύασε το Ollama με μια βάση δεδομένων διανυσμάτων για μια ιδιωτική στοίβα RAG — μικρά τοπικά embeddings μαζί με έναν τοπικό vector store είναι το setup που λάμπει πραγματικά εδώ. Το Medium ($12/μήνα, 6 GB) είναι το άνετο πλάνο. Root σε περίπου ένα λεπτό, χωρίς KYC, πληρωμή σε crypto.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.