De fout die ik het vaakst zie bij agent-hosting is dimensioneren voor het verkeerde ding. Iemand draait één agent, hij gebruikt 400 MB, en ze concluderen dat agents goedkoop te hosten zijn. Dan schalen ze op naar een echte crew en de box begint te swappen om 3 uur 's nachts.
Eén agent is goedkoop. Dat is niet het interessante geval.
Waar het geheugen eigenlijk heen gaat
Een agent die alleen API-calls op een model afvuurt is licht — hij wacht meestal op het netwerk. Je zou er een dozijn van kunnen draaien op een klein plan en het nooit merken.
Het RAM verdwijnt wanneer agents state beginnen vast te houden. Gespreksgeschiedenis die elke beurt groeit. Een working set die meerdere agents lezen en schrijven. Een vector store voor langetermijngeheugen in hetzelfde proces. Op het moment dat je architectuur ophoudt "roep API aan, vergeet" te zijn en "onthoud, coördineer, draag over" wordt, wordt geheugen de constraint, niet CPU.
CrewAI, LangGraph, AutoGPT-achtige loops — ze neigen allemaal deze kant op naarmate ze serieuzer worden. Het framework eet het RAM niet op; de state doet dat.
Ruwe dimensionering, eerlijk
Ik doe niet alsof er een formule is, want die is er niet — het hangt volledig af van hoeveel elke agent bijhoudt. Maar een praktische indruk uit het draaien hiervan:
- Lichte, API-gebonden agents — je hebt hier helemaal geen Pro nodig; een NAT- of dedicated-IP-plan ($3–20) handelt het af. Pro verdient zijn plek zodra gedeelde state je voorbij ~32 GB duwt.
- 32 GB — de sweet spot voor een echt multi-agent systeem: 5–10 agents met gedeeld geheugen plus een vector-database die daadwerkelijk nuttig is. De meeste mensen landen hier.
- 64 GB — grotere vloten, langere histories, een memory-index in de miljoenen vectoren, of meerdere co-located diensten. Dit is waar één box de drie kleinere vervangt die je anders zou jongleren.
- 80 GB — zwaar, memory-gebonden werk: grote in-memory datasets, veel gelijktijdige agents, of agents plus lokale model-inferentie op dezelfde host.
Begin onder waar je denkt te moeten zijn. Kijk een dag naar htop. Herschaal omhoog wanneer je swap ziet, niet eerder — hoog gokken verspilt gewoon geld.
Het deel dat moeilijk te kopen is
Hier is het ding dat dit lastig maakt: 64 GB RAM huren is makkelijk. 64 GB huren met crypto en geen identiteitscontrole niet. De meeste hosts die serieus geheugen goedkoop verkopen doen het achter een kaart en een KYC-formulier.
Als je agent zijn eigen server provisioneert, of de workload data raakt die je liever niet aan een naam koppelt, is die combinatie — high memory, crypto, geen KYC, en bestelbaar door de agent zelf via MCP — het daadwerkelijke product. Het is niet goedkoper per gigabyte, en ik heb apart geschreven over waarom die vergelijking misleidt. Het is beschikbaar op voorwaarden die bijna niemand biedt.
Dus wat doe je
Als je agents licht en API-gebonden zijn, denk er niet te veel over na — een klein NAT- of dedicated-IP-plan is ruim voldoende, sla de hele high-memory-vraag over. Als je een echte vloot draait die state vasthoudt, dimensioneer op wat er daadwerkelijk in het geheugen zit, begin bij 32 GB, en ga omhoog wanneer de grafiek je dat vertelt.
Wanneer je er bent, dekt de Pro-lijn 32 tot 80 GB met een dedicated IP en nachtelijke back-ups. Kies de tier die past bij je working set, niet je ambities.
Reacties
Nog geen reacties. Wees de eerste.