Sommerhitze — alles schmilzt, sogar unsere Preise.−25%−25 % auf jeden Jahresplan, bis 31. Aug.Pläne ansehen
EQVPS
Loslegen

VPS für selbst gehostetes RAG im großen Maßstab

Retrieval-Augmented Generation hört auf, eine Laptop-Demo zu sein, sobald der Korpus echt ist. Ein Vektorindex will RAM, und deine Embeddings sind deine privaten Daten. Hier ist die Dimensionierungs-Mathematik und warum High-Memory-Hosting ohne KYC passt. Ab 55 $/Mon.

Eine RAG-Demo auf einem Laptop mit zweihundert Dokumenten fühlt sich mühelos an. Dann richtest du sie auf einen echten Korpus — die Docs eines Unternehmens, Jahre von Tickets, eine tatsächliche Wissensbasis — und das Ganze wird ein Speicherproblem. Kein CPU-Problem. Ein Speicher-Problem.

Hier ist der Teil, den die meisten Hosting-Seiten überspringen: schnelles Retrieval will den Index im RAM. Jeder Text-Chunk wird zu einem Embedding — einem Vektor, ein paar hundert bis ein paar tausend Zahlen breit — und Suchen bedeutet, deine Abfrage gegen sie alle zu vergleichen, schnell. Auf der Festplatte funktioniert es, aber jede Abfrage zahlt eine Latenz-Steuer, und niedriglatente Retrieval war überhaupt der Grund, warum du selbst gehostet hast.

Die Dimensionierungs-Mathematik, ehrlich

Miss deinen eigenen Korpus — Dimension und Indextyp schwingen das stark — aber als Ausgangsgefühl:

Wir haben hier die vollständige RAM-Kurve ausgeschrieben, wenn du die Details willst.

Warum High-Memory und ohne KYC zusammen

48 GB RAM zu mieten ist einfach. Es mit Krypto und ohne Identitätsprüfung zu mieten ist es nicht — die meisten Hoster, die ernsthaften Speicher günstig verkaufen, tun es hinter einer Karte und einem KYC-Formular. Deine Embeddings sind keine abstrakten Zahlen; sie kodieren den Text, aus dem sie kamen. Deine Docs, die Inhalte deiner Kunden, in Vektoren verwandelt. Wenn diese Daten sensibel genug sind, dass du privat zahlst, macht eine verwaltete Vektor-Cloud den ganzen Sinn zunichte — und so auch ein Hoster, der den Server an deine Identität bindet.

Diese Kombination — viel Speicher, dedizierte IP, Krypto, kein KYC, nächtliche Backups — ist, wofür die Pro-Linie da ist. Sie ist nicht die günstigste pro Gigabyte, und wenn du keine Privatsphäre brauchst, findest du RAM anderswo günstiger. Aber wenn der Index dein Produkt ist und er nicht weg darf, ist das die Form, die passt.

Wo man beginnt

Wähle einen Plan mit Spielraum für den Index plus alles drumherum — die App, den Modell-Client, Platz zum Wachsen. Für die meisten echten Korpora ist das Pro-48 (48 GB); ein großer geht auf Pro-64 oder Pro-80. Lade zuerst eine Stichprobe, beobachte den Speicher, dimensioniere nach der Zahl, die du gemessen hast — nicht der, die du befürchtet hast.

Wenn dein Retrieval Teil eines größeren Agent-Systems ist, hält dieselbe Maschine oft auch die Agent-Flotte — so wird ein 48-GB-Plan still zu einem 64-GB.

Bereit zum Bereitstellen? Zahle in Krypto, ohne KYC — online in etwa einer Minute.

Bereitstellen →

FAQ

Wie viel RAM braucht mein RAG-Setup tatsächlich?

Es skaliert mit der Embedding-Anzahl und Vektorbreite. Ein paar hunderttausend Chunks passen in 2–4 GB; niedrige Millionen, mit der App und dem OS drumherum, landen bei 16–32 GB; Zehnmillionen drücken 48 GB und darüber hinaus. Miss eine Stichprobe, beobachte den residenten Speicher, extrapoliere — rate nicht hoch, du zahlst nur zu viel.

Warum keinen verwalteten Vektordienst nutzen?

Zwei Gründe, aus denen Leute tatsächlich selbst hosten: deine Embeddings kodieren private Daten (Docs, Notizen, Kundeninhalte), also zählt es, sie auf einer Maschine zu behalten, die du kontrollierst; und die Kosten sind flach — ein verwalteter Dienst rechnet nach Vektoren und Abfragen ab, ein VPS ist eine monatliche Zahl, die du so hart hämmern kannst, wie du willst.

pgvector oder eine dedizierte Engine?

Wenn du bereits Postgres betreibst, ist pgvector der Weg mit dem geringsten Aufwand — eine Erweiterung. Für Millionen von Vektoren mit schwerem Filtern verdient eine zweckgebaute Engine wie Qdrant ihren eigenen Dienst. Beginne mit dem, was du betreibst; splitte es aus, wenn die Suche langsamer wird, nicht vorher.

Brauche ich eine GPU für RAG?

Nein. Retrieval ist CPU- + RAM-Arbeit — Vektoren vergleichen, nicht Text generieren. Der Generierungsschritt ruft deinen LLM auf (eine API oder einen separaten Modell-Host). Eine High-Memory-CPU-Maschine ist genau die richtige Form für die Retrieval-Hälfte.

Kommentare

Noch keine Kommentare. Sei der Erste.

Kommentar hinterlassen

Kommentare werden vor der Anzeige moderiert.