Η έντιμη απάντηση στο «πόσο server χρειάζεται ο AI πράκτοράς μου;» είναι: λιγότερο απ' όσο νομίζετε — μέχρι που ξαφνικά δεν είναι. Το κόλπο είναι να ξέρετε σε ποια πλευρά αυτής της γραμμής κάθεται το workload σας. Οπότε αντί να μαντεύετε, ιδού τι χρησιμοποιεί πραγματικά κάθε είδος πράκτορα.
Η μία ερώτηση που αποφασίζει τα πάντα
Τρέχει το μοντέλο στον server σας, ή ο πράκτοράς σας καλεί ένα μοντέλο μέσω ενός API;
Αν ο πράκτοράς σας μιλά σε ένα φιλοξενούμενο LLM (η κοινή περίπτωση), το έξυπνο, ακριβό μέρος συμβαίνει στο hardware κάποιου άλλου. Το box σας απλώς τρέχει ένα orchestration loop: πάρε input, κάλεσε το API, ανάλυσε το αποτέλεσμα, ίσως χτύπα μια βάση δεδομένων, επανάλαβε. Αυτό είναι ελαφρύ. Πραγματικά ελαφρύ — ένα 1 GB box το κάνει χωρίς να ιδρώσει.
Αν τρέχετε το μοντέλο τοπικά, όλα αλλάζουν: τώρα η RAM κυριαρχείται από τα βάρη του μοντέλου, και θα θέλετε κάθε core που μπορείτε να πάρετε. Οι περισσότεροι δεν το χρειάζονται αυτό. Αυτοί που το χρειάζονται συνήθως ξέρουν ακριβώς γιατί (ιδιωτικότητα, χωρίς rate limits, offline). Αν αυτός είστε εσείς, γράψαμε έναν ξεχωριστό οδηγό για self-hosting ενός τοπικού LLM.
Sizing ανά workload
Πραγματικοί αριθμοί, το είδος στο οποίο μπορείτε να δράσετε:
| Workload | RAM | vCPU | Δίσκος | Σημειώσεις |
|---|---|---|---|---|
| Chat / assistant πράκτορας (API-backed) | 1 GB | 2 | 15 GB | Το loop είναι μικροσκοπικό· το μοντέλο είναι απομακρυσμένο |
| Scraper / πράκτορας δεδομένων | 2 GB | 2 | 25 GB | Περιθώριο για parsing + scraped δεδομένα |
| Trading bot | 1–2 GB | 2 | 15–25 GB | Το latency μετρά περισσότερο από το μέγεθος — δείτε τον οδηγό trading bot |
| Αρκετοί πράκτορες παράλληλα | 4 GB | 4 | 35 GB | Κάθε πράκτορας είναι φθηνός· το concurrency συσσωρεύεται |
| Τοπικό LLM, 3B–7B (quantized) | 4–6 GB | 4–6 | 25–45 GB | Μόνο-CPU, τρέχει σε αναγνώσιμο ρυθμό, όχι μαζικά |
Το μοτίβο: οι API-backed πράκτορες είναι μικροσκοπικοί· τα τοπικά μοντέλα είναι το μόνο πράγμα που είναι βαρύ.
Πού σταματά ένα CPU box
Ίσια για την οροφή: τα πακέτα μας φτάνουν στο μέγιστο στα 6 GB RAM και 6 cores, μόνο-CPU — χωρίς GPU. Αυτό καλύπτει τα πάντα στον πίνακα παραπάνω, συμπεριλαμβανομένου ενός 7B τοπικού μοντέλου για προσωπική χρήση. Αυτό που δεν καλύπτει: 13B+ μοντέλα, τοπική inference υψηλού-throughput, ή οτιδήποτε πραγματικά χρειάζεται ένα GPU. Αν αυτό είναι το workload σας, ένα CPU VPS — το δικό μας ή οποιουδήποτε — είναι το λάθος εργαλείο, και είναι καλύτερα να το ξέρετε τώρα παρά αφού το έχετε αναπτύξει.
Για το 95% των πρακτόρων που καλούν ένα API, τίποτα από αυτά δεν είναι πρόβλημα. Είναι χαρούμενοι στο μικρότερο box.
Ένας πρακτικός εμπειρικός κανόνας
- Απλώς ένας πράκτορας που καλεί ένα API; Ξεκινήστε στο 1 GB / 2 cores. Μπορείτε να το αλλάξετε μέγεθος αργότερα.
- Scraping ή αποθήκευση δεδομένων; 2 GB και έναν μεγαλύτερο δίσκο.
- Τρέχετε αρκετούς πράκτορες, ή ένα μικρό τοπικό μοντέλο; 4–6 GB και 4+ cores.
- Χρειάζεται GPU; Διαφορετική κατηγορία — μην το ζορίζετε πάνω σε CPU.
Μην κάνετε over-provision από νευρικότητα. Οι πράκτορες είναι ελαφρείς από τη φύση τους· το κόστος ενός πολύ-μικρού box είναι ένα resize, ενώ το κόστος ενός πολύ-μεγάλου box είναι να πληρώνετε για αδρανή RAM κάθε μήνα.
Όταν έχετε επιλέξει ένα μέγεθος, ένας πράκτορας μπορεί να νοικιάσει το box μόνος του μέσω MCP, ή μπορείτε να το παραγγείλετε σε ένα λεπτό στο site. Όπως και να 'χει, ξεκινήστε μικρά — σχεδόν σίγουρα θα χρειαστείτε λιγότερα απ' όσο περιμένατε.
Σχόλια
Δεν υπάρχουν ακόμη σχόλια. Γίνετε ο πρώτος.