Der Fehler, den ich beim Agenten-Hosting am häufigsten sehe, ist, für das Falsche zu dimensionieren. Jemand betreibt einen Agenten, er nutzt 400 MB, und man schließt daraus, dass Agenten günstig zu hosten sind. Dann skaliert man auf eine echte Crew, und die Maschine fängt um 3 Uhr morgens an zu swappen.
Ein Agent ist günstig. Das ist nicht der interessante Fall.
Wohin der Speicher wirklich geht
Ein Agent, der nur API-Aufrufe an ein Modell abfeuert, ist leicht — er wartet meist auf das Netzwerk. Du könntest ein Dutzend davon auf einem kleinen Plan betreiben und es nie bemerken.
Der RAM verschwindet, wenn Agenten anfangen, Zustand zu halten. Gesprächsverlauf, der mit jeder Runde wächst. Ein Arbeitssatz, den mehrere Agenten lesen und schreiben. Ein Vektorspeicher für das Langzeitgedächtnis, der im selben Prozess sitzt. In dem Moment, in dem deine Architektur aufhört, „API aufrufen, vergessen“ zu sein, und zu „erinnern, koordinieren, übergeben“ wird, wird der Speicher zur Einschränkung, nicht die CPU.
CrewAI, LangGraph, AutoGPT-artige Schleifen — sie tendieren alle in diese Richtung, wenn es ernst wird. Das Framework frisst den RAM nicht; der Zustand tut es.
Grobe Dimensionierung, ehrlich
Ich tue nicht so, als gäbe es eine Formel, denn die gibt es nicht — es hängt völlig davon ab, wie viel jeder Agent behält. Aber ein praktisches Gefühl aus dem Betrieb:
- Leichte, API-gebundene Agenten — hier brauchst du Pro überhaupt nicht; ein NAT- oder dedizierte-IP-Plan (3–20 $) bewältigt es. Pro verdient seinen Platz, sobald gemeinsamer Zustand dich über ~32 GB treibt.
- 32 GB — der Sweet Spot für ein echtes Multi-Agenten-System: 5–10 Agenten mit gemeinsamem Speicher plus eine Vektordatenbank, die tatsächlich nützlich ist. Hier landen die meisten.
- 64 GB — größere Flotten, längere Verläufe, ein Speicherindex in Millionen von Vektoren oder mehrere co-lokalisierte Dienste. Hier ersetzt eine Maschine die drei kleineren, die du sonst jonglieren würdest.
- 80 GB — schwere, speichergebundene Arbeit: große In-Memory-Datensätze, viele gleichzeitige Agenten oder Agenten plus lokale Modell-Inferenz auf demselben Host.
Starte unter dem, wo du glaubst sein zu müssen. Beobachte einen Tag lang htop. Skaliere hoch, wenn du Swap siehst, nicht vorher — hoch zu raten verschwendet nur Geld.
Der Teil, der schwer zu kaufen ist
Hier ist das, was es unangenehm macht: 64 GB RAM zu mieten ist einfach. 64 GB mit Krypto und ohne Identitätsprüfung zu mieten nicht. Die meisten Hoster, die ernsthaften Speicher günstig verkaufen, tun es hinter einer Karte und einem KYC-Formular.
Wenn dein Agent seinen eigenen Server bereitstellt oder die Workload Daten berührt, die du lieber nicht an einen Namen bindest, ist diese Kombination — viel Arbeitsspeicher, Krypto, kein KYC und vom Agenten selbst über MCP bestellbar — das eigentliche Produkt. Es ist nicht günstiger pro Gigabyte, und ich habe separat darüber geschrieben, warum dieser Vergleich in die Irre führt. Es ist zu Bedingungen verfügbar, die fast niemand anbietet.
Also was tust du
Wenn deine Agenten leicht und API-gebunden sind, denk nicht zu viel nach — ein kleiner NAT- oder dedizierte-IP-Plan reicht reichlich, überspring die ganze Frage nach viel Arbeitsspeicher. Wenn du eine echte Flotte betreibst, die Zustand hält, dimensioniere nach dem, was tatsächlich im Speicher ist, starte mit 32 GB und geh hoch, wenn der Graph es dir sagt.
Wenn du dort bist, deckt die Pro-Linie 32 bis 80 GB mit einer dedizierten IP und nächtlichen Backups ab. Wähle die Stufe, die zu deinem Arbeitssatz passt, nicht zu deinen Ambitionen.
Kommentare
Noch keine Kommentare. Sei der Erste.