Letni upał — wszystko się topi, nawet nasze ceny.−25%−25% na każdy plan roczny, do 31 sierpniaZobacz plany
EQVPS
Zacznij

VPS pod prywatną inferencję LLM z dużą pamięcią

Większe skwantyzowane modele potrzebują prawdziwego RAM, nie GPU, którego nie masz. Gdzie maszyna CPU z dużą pamięcią uruchamia prywatnie modele klasy 30B, co jest realistyczne, a gdzie nie. Od 70 $/mies.

Mamy osobną stronę dla Ollama i małych modeli — to maszyna CPU za 12 $ uruchamiająca 1B–8B i osadzenia. Ta strona to drugi koniec: modele na tyle duże, że RAM, a nie CPU, jest tym, co Cię zatrzymuje.

Bądźmy szczerzy na wstępie, jak wszędzie: nasze serwery są tylko CPU, bez GPU. Duży model działa tutaj wolno. Jeśli chcesz szybkiego interaktywnego czatu na modelu 30B, potrzebujesz hosta z GPU — inny produkt, inny dostawca. Co maszyna CPU z dużą pamięcią robi dobrze, to uruchamianie dużego skwantyzowanego modelu prywatnie do pracy, która nie jest oknem czatu.

Matematyka RAM

Model siedzi w pamięci, skwantyzowany czy nie, plus narzut na kontekst i środowisko uruchomieniowe:

Dlatego „uruchom większy lokalny model” to naprawdę pytanie o dużą pamięć. Model jest śladem pamięci. Dodaj indeks RAG na tym samym hoście, a liczby się piętrzą.

Gdzie podejście „najpierw prywatność” naprawdę wygrywa

Argumentem nie jest szybkość i nie jest koszt — chodzi o to, że niektóre dane nie mogą wyjść. Dokumenty prawne. Dokumentacja medyczna. Zastrzeżony kod. Wszystko, gdzie wysłanie promptu do API osoby trzeciej odpada. Wolniejszy model działający w całości na Twojej maszynie bije szybki, który loguje wszystko, co mu wysyłasz. Napisaliśmy pełny obraz tutaj.

A jeśli dane są aż tak wrażliwe, płatność prawdopodobnie też powinna być prywatna. Wynajęcie maszyny za krypto i bez KYC utrzymuje cały łańcuch — serwer, model, prompty, rozliczenia — poza czyimikolwiek aktami tożsamości. To jest oferta: nie tańsza inferencja, ale inferencja, której nikt inny nie widzi.

Co wybrać

Dla modelu klasy 30B z miejscem na kontekst Pro-64 (64 GB) to wygodny wybór; ciaśniejsza kwantyzacja mieści się w Pro-32 lub Pro-48, większa idzie do Pro-80. Załaduj najpierw model, obserwuj pamięć rezydentną, dobierz rozmiar z tego, co zmierzyłeś. I ustaw oczekiwania: to prywatna inferencja wsadowa, nie szybkie okno czatu.

Gotowy na wdrożenie? Płać kryptowalutą, bez KYC — online w około minutę.

Wdróż teraz →

FAQ

Czym to się różni od waszego zastosowania Ollama?

Strona Ollama jest o małych modelach na maszynie CPU za 12 $ — 1B–8B, osadzenia, lekka praca. To koniec z dużą pamięcią: skwantyzowane modele klasy 13B do 30B, które potrzebują 24–48 GB lub więcej, by się w ogóle załadować. Ta sama rzeczywistość tylko CPU, znacznie większy ślad pamięci, inny plan.

Ile RAM na dany model?

Model musi zmieścić się w pamięci plus narzut. Model 13B 4-bitowy chce ~10–16 GB; klasa 30B skwantyzowana dobija 24–48 GB; idź większy lub o wyższej precyzji, a jesteś w 64–80 GB — poza tym żadna nasza pojedyncza maszyna nie zmieści. Dodaj miejsce na kontekst na wierzchu.

Czy będzie szybkie?

Nie — bądź tu ze sobą szczery. Inferencja CPU na dużym modelu to kilka tokenów na sekundę, nie interaktywny strumień. W porządku do pracy wsadowej i w tle (streść przez noc, sklasyfikuj kolejkę). Do czatu w czasie rzeczywistym na dużym modelu potrzebujesz GPU, którego nie oferujemy.

Dlaczego uruchamiać to tutaj zamiast API?

Prywatność. Twoje prompty i wyniki nigdy nie dotykają serwerów ani logów dostawcy. Dla wrażliwych danych — prawnych, medycznych, wewnętrznego kodu — wolniejszy prywatny model bije szybki, który widzi wszystko. Sparuj to z płatnością krypto bez KYC, a cały łańcuch pozostaje Twój.

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.