Het eerlijke antwoord op "hoeveel server heeft mijn AI-agent nodig?" is: minder dan je denkt — precies tot het opeens niet zo is. De truc is weten aan welke kant van die lijn je workload zit. Dus in plaats van te gokken, hier is wat elk soort agent werkelijk gebruikt.
De ene vraag die alles bepaalt
Draait het model op je server, of roept je agent een model over een API aan?
Als je agent met een gehoste LLM praat (het gebruikelijke geval), gebeurt het slimme, dure deel op iemand anders' hardware. Je box draait gewoon een orkestratie-lus: input nemen, de API aanroepen, het resultaat parsen, misschien een database raken, herhalen. Dat is licht. Werkelijk licht — een 1 GB-box doet het zonder moeite.
Als je het model lokaal draait, verandert alles: nu wordt RAM gedomineerd door de model-gewichten, en wil je elke core die je kunt krijgen. De meeste mensen hebben dit niet nodig. Degenen die het wel nodig hebben weten meestal precies waarom (privacy, geen rate limits, offline). Als dat jij bent, schreven we een aparte gids over het zelf hosten van een lokale LLM.
Sizing per workload
Echte getallen, het soort waar je op kunt handelen:
| Workload | RAM | vCPU | Schijf | Noten |
|---|---|---|---|---|
| Chat / assistent-agent (API-backed) | 1 GB | 2 | 15 GB | De lus is klein; het model is remote |
| Scraper / data-agent | 2 GB | 2 | 25 GB | Ruimte voor parsing + gescrapte data |
| Trading bot | 1–2 GB | 2 | 15–25 GB | Latency telt meer dan grootte — zie de trading bot-gids |
| Meerdere agents parallel | 4 GB | 4 | 35 GB | Elke agent is goedkoop; concurrency telt op |
| Lokale LLM, 3B–7B (gekwantiseerd) | 4–6 GB | 4–6 | 25–45 GB | CPU-only, draait op een leesbaar tempo, geen bulk |
Het patroon: API-backed agents zijn klein; lokale modellen zijn het enige dat zwaar is.
Waar een CPU-box ophoudt
Recht voor zijn raap over het plafond: onze plannen gaan tot maximaal 6 GB RAM en 6 cores, CPU-only — geen GPU. Dat dekt alles in de tabel hierboven, inclusief een 7B lokaal model voor persoonlijk gebruik. Wat het niet dekt: 13B+ modellen, high-throughput lokale inference, of iets dat werkelijk een GPU nodig heeft. Als dat je workload is, is een CPU-VPS — de onze of die van wie dan ook — het verkeerde gereedschap, en het is beter dat nu te weten dan nadat je hebt gedeployed.
Voor de 95% van de agents die een API aanroepen is niets hiervan een probleem. Ze zijn blij op de kleinste box.
Een praktische vuistregel
- Gewoon een agent die een API aanroept? Begin bij 1 GB / 2 cores. Je kunt later resizen.
- Scrapen of data opslaan? 2 GB en een grotere schijf.
- Meerdere agents draaien, of een klein lokaal model? 4–6 GB en 4+ cores.
- Heb je een GPU nodig? Andere categorie — forceer het niet op CPU.
Over-provisioneer niet uit nervositeit. Agents zijn van nature lichtgewicht; de kosten van een te-kleine box zijn één resize, terwijl de kosten van een te-grote box zijn dat je elke maand voor inactief RAM betaalt.
Als je een grootte hebt gekozen, kan een agent de box zelf huren over MCP, of je kunt het in een minuut bestellen op de site. Hoe dan ook, begin klein — je hebt vrijwel zeker minder nodig dan je verwachtte.
Reacties
Nog geen reacties. Wees de eerste.