EQVPS

VPS για Ollama και Τοπικά LLMs

Self-host μικρά γλωσσικά μοντέλα σε έναν CPU server — ιδιωτικά, αμέτρητα, πληρωμένα με crypto. Έντιμοι για το τι μπορεί και τι δεν μπορεί το CPU inference. Από $12/μήνα.

Ας βγάλουμε το απογοητευτικό μέρος από τη μέση, γιατί το διαδίκτυο είναι γεμάτο σελίδες που δεν το κάνουν.

Οι servers μας είναι μόνο CPU. Δεν προσφέρουμε GPUs. Αυτό σημαίνει ότι η δουλειά τοπικού LLM εδώ έχει ένα σκληρό ταβάνι, και το να προσποιηθούμε το αντίθετο απλώς θα σπαταλούσε τα χρήματά σας.

Τι λειτουργεί πραγματικά σε CPU

Με έως 6 vCPU και 6 GB RAM (το πακέτο Medium μας — $12/μήνα), είστε στο εύρος μικρών quantized μοντέλων:

Αν χρειάζεστε ένα γρήγορο, διαδραστικό chat 70B, χρειάζεστε έναν GPU host — αυτό είναι διαφορετικό προϊόν από διαφορετικό πάροχο, και προτιμάμε να σας το πούμε παρά να πάρουμε τα $12 σας.

Πού κερδίζει γνήσια ένα CPU box

Ιδιωτικότητα. Τα έγγραφά σας, τα prompts σας, τα embeddings σας — να μη φεύγουν ποτέ από μια μηχανή που ελέγχετε, να μη γίνονται ποτέ δεδομένα εκπαίδευσης κάποιου. Για πολλούς αυτό είναι όλο το νόημα, και τα μερικά tokens το δευτερόλεπτο είναι μια αποδεκτή ανταλλαγή.

Προβλεψιμότητα κόστους. Χωρίς λογαριασμό ανά token. Ένα pipeline που ταξινομεί πενήντα χιλιάδες εγγραφές κοστίζει το ίδιο με ένα που ταξινομεί πενήντα: $12.

Ασύγχρονη δουλειά. Η πιο χρήσιμη δουλειά LLM δεν είναι ένα παράθυρο chat. Είναι μια ουρά: σύνοψε αυτά, tag-άρισε εκείνα, κάνε embed αυτό το corpus. Ένα CPU box που μασάει ένα backlog όλη νύχτα είναι απόλυτα καλό σε αυτό.

Εγκατάσταση

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Το Ollama εξυπηρετεί ένα HTTP API στο localhost:11434. Κρατήστε το εκεί. Αν χρειάζεται να το φτάσετε από αλλού, βάλτε το πίσω από ένα reverse proxy με έλεγχο ταυτότητας σε ένα πακέτο αποκλειστικού IP — ποτέ μην εκθέτετε ένα endpoint μοντέλου χωρίς έλεγχο ταυτότητας στο ανοιχτό διαδίκτυο.

Συνδυάστε το με μια vector database (Qdrant ή pgvector σε Docker) και έχετε ένα πλήρες ιδιωτικό RAG stack σε ένα box $12. Αυτός ο συνδυασμός — μικρά τοπικά embeddings, τοπικό vector store, εξωτερικό API μόνο για το βαρύ βήμα generation — είναι η εγκατάσταση που πραγματικά βγάζει νόημα σε hardware σαν αυτό.

Επιλογή πακέτου

ΧρήσηΠακέτοΤιμή
Embeddings, μοντέλα 1–3B, RAG pipelineMedium$12/μήνα
Το ίδιο, συν ένα δημόσιο endpoint πίσω από authMedium-IP$20/μήνα
Απλώς δοκιμή μικρών μοντέλωνSmall$8/μήνα

Μόνο CPU, έως 6 vCPU και 6 GB RAM. Αποθήκευση NVMe, αμέτρητη κίνηση, Γερμανία ή Φινλανδία. Πληρωμή με crypto, χωρίς KYC. Η ετήσια χρέωση είναι μία μεταφορά αντί για δώδεκα.

Σχετική ανάγνωση


Έτοιμοι; Αναπτύξτε έναν server → — ζωντανός σε περίπου ένα λεπτό, πληρωμένος με crypto, χωρίς απαίτηση ID.

Έτοιμοι για ανάπτυξη; Πληρωμή με crypto, χωρίς KYC — έτοιμο σε περίπου ένα λεπτό.

Ανάπτυξη τώρα →

Συχνές ερωτήσεις

Μπορώ να τρέξω το Llama 70B σε αυτό;

Όχι. Τα πακέτα μας είναι μόνο CPU με έως 6 GB RAM — αυτό είναι το εύρος μικρών quantized μοντέλων (περίπου 1B–8B σε 4-bit). Ένα μοντέλο 70B χρειάζεται GPU και πολύ περισσότερη μνήμη. Δεν προσφέρουμε GPUs, και προτιμάμε να το πούμε παρά να σας πουλήσουμε μια απογοήτευση.

Πόσο γρήγορο είναι το CPU inference, πραγματικά;

Περιμένετε μερικά tokens το δευτερόλεπτο σε ένα μοντέλο 7–8B σε 4-bit quantization, και αισθητά καλύτερα σε μοντέλα 1–3B. Αυτό είναι εντάξει για εργασίες παρασκηνίου, embeddings, ταξινόμηση και ασύγχρονα pipelines. Δεν είναι εντάξει για ένα γρήγορο διαδραστικό chat.

Άρα για τι είναι πραγματικά καλό αυτό;

Ιδιωτικά embeddings, ταξινόμηση, ουρές σύνοψης, RAG pipelines όπου το latency δεν έχει σημασία, και κράτημα δεδομένων μακριά από third-party APIs. Επίσης: μάθηση, δοκιμές και prototyping πριν νοικιάσετε GPU κάπου.

Ζητάτε ID;

Όχι. Email για εγγραφή, USDC ή USDT για πληρωμή. Που είναι συχνά ο λόγος που οι άνθρωποι θέλουν ένα ιδιωτικό μοντέλο εξαρχής.

Σχόλια

Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.

Αφήστε ένα σχόλιο

Τα σχόλια ελέγχονται πριν εμφανιστούν.