Eine RAG-Demo auf einem Laptop mit zweihundert Dokumenten fühlt sich mühelos an. Dann richtest du sie auf einen echten Korpus — die Docs eines Unternehmens, Jahre von Tickets, eine tatsächliche Wissensbasis — und das Ganze wird ein Speicherproblem. Kein CPU-Problem. Ein Speicher-Problem.
Hier ist der Teil, den die meisten Hosting-Seiten überspringen: schnelles Retrieval will den Index im RAM. Jeder Text-Chunk wird zu einem Embedding — einem Vektor, ein paar hundert bis ein paar tausend Zahlen breit — und Suchen bedeutet, deine Abfrage gegen sie alle zu vergleichen, schnell. Auf der Festplatte funktioniert es, aber jede Abfrage zahlt eine Latenz-Steuer, und niedriglatente Retrieval war überhaupt der Grund, warum du selbst gehostet hast.
Die Dimensionierungs-Mathematik, ehrlich
Miss deinen eigenen Korpus — Dimension und Indextyp schwingen das stark — aber als Ausgangsgefühl:
- Ein paar hunderttausend Embeddings — 2–4 GB. Eine persönliche Wissensbasis. Du brauchst dafür kein Pro; ein kleinerer Plan ist gut.
- Niedrige Millionen — mit der App, dem Modell-Client und dem OS drumherum, plane für 16–32 GB. Eine ernsthafte Unternehmens-Wissensbasis. Hier fängt Pro-32 oder Pro-48 an, Sinn zu ergeben.
- Zehnmillionen oder hochdimensionale Vektoren — 48 GB und aufwärts, und über ~80 GB splittest du den Index über Server. Große Dokumentenbestände, mandantenfähiges Retrieval, mehrere Indizes gleichzeitig warm.
Wir haben hier die vollständige RAM-Kurve ausgeschrieben, wenn du die Details willst.
Warum High-Memory und ohne KYC zusammen
48 GB RAM zu mieten ist einfach. Es mit Krypto und ohne Identitätsprüfung zu mieten ist es nicht — die meisten Hoster, die ernsthaften Speicher günstig verkaufen, tun es hinter einer Karte und einem KYC-Formular. Deine Embeddings sind keine abstrakten Zahlen; sie kodieren den Text, aus dem sie kamen. Deine Docs, die Inhalte deiner Kunden, in Vektoren verwandelt. Wenn diese Daten sensibel genug sind, dass du privat zahlst, macht eine verwaltete Vektor-Cloud den ganzen Sinn zunichte — und so auch ein Hoster, der den Server an deine Identität bindet.
Diese Kombination — viel Speicher, dedizierte IP, Krypto, kein KYC, nächtliche Backups — ist, wofür die Pro-Linie da ist. Sie ist nicht die günstigste pro Gigabyte, und wenn du keine Privatsphäre brauchst, findest du RAM anderswo günstiger. Aber wenn der Index dein Produkt ist und er nicht weg darf, ist das die Form, die passt.
Wo man beginnt
Wähle einen Plan mit Spielraum für den Index plus alles drumherum — die App, den Modell-Client, Platz zum Wachsen. Für die meisten echten Korpora ist das Pro-48 (48 GB); ein großer geht auf Pro-64 oder Pro-80. Lade zuerst eine Stichprobe, beobachte den Speicher, dimensioniere nach der Zahl, die du gemessen hast — nicht der, die du befürchtet hast.
Wenn dein Retrieval Teil eines größeren Agent-Systems ist, hält dieselbe Maschine oft auch die Agent-Flotte — so wird ein 48-GB-Plan still zu einem 64-GB.
Kommentare
Noch keine Kommentare. Sei der Erste.