Letni upał — wszystko się topi, nawet nasze ceny.−25%−25% na każdy plan roczny, do 31 sierpniaZobacz plany
EQVPS
Zacznij

VPS dla Ollama i lokalnych LLM

Hostuj samodzielnie małe modele językowe na serwerze CPU — prywatnie, nielimitowanie, płatność kryptowalutą. Uczciwie o tym, co inferencja na CPU może, a czego nie. Od 12 $/mies.

Załatwmy najpierw część rozczarowującą, bo internet jest pełen stron, które tego nie robią.

Nasze serwery są tylko CPU. Nie oferujemy GPU. To oznacza, że lokalna praca z LLM ma tutaj twardy sufit, a udawanie inaczej po prostu zmarnowałoby Twoje pieniądze.

Co faktycznie działa na CPU

Przy maksymalnie 6 vCPU i 6 GB RAM (nasz plan Medium — 12 $/mies.) jesteś w zakresie małych skwantyzowanych modeli:

Jeśli potrzebujesz szybkiego, interaktywnego czatu 70B, potrzebujesz hosta z GPU — to inny produkt od innego dostawcy, i wolimy Ci to powiedzieć, niż wziąć Twoje 12 $.

Gdzie maszyna CPU naprawdę wygrywa

Prywatność. Twoje dokumenty, Twoje prompty, Twoje osadzenia — nigdy nie opuszczające maszyny, którą kontrolujesz, nigdy nie stające się czyimiś danymi treningowymi. Dla wielu ludzi to cały sens, a kilka tokenów na sekundę to akceptowalna wymiana.

Przewidywalność kosztów. Bez rachunku za token. Pipeline klasyfikujący pięćdziesiąt tysięcy rekordów kosztuje tyle samo, co ten klasyfikujący pięćdziesiąt: 12 $.

Praca asynchroniczna. Większość użytecznej pracy z LLM to nie okno czatu. To kolejka: streść te, otaguj tamte, osadź ten korpus. Maszyna CPU mieląca zaległości przez noc jest w tym doskonale dobra.

Konfiguracja

# Ubuntu 24.04 — zalecany plan Medium
curl -fsSL https://ollama.com/install.sh | sh

# Zacznij od czegoś małego i przekonaj się sam
ollama pull llama3.2:3b
ollama run llama3.2:3b "Streść to w jednym zdaniu: ..."

# Osadzenia — wygodny wybór dla CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama serwuje API HTTP na localhost:11434. Trzymaj to tam. Jeśli musisz sięgnąć do niego skądinąd, postaw je za reverse proxy z uwierzytelnianiem na planie z dedykowanym IP — nigdy nie wystawiaj nieuwierzytelnionego punktu końcowego modelu do otwartego internetu.

Sparuj to z bazą wektorową (Qdrant lub pgvector w Dockerze), a masz kompletny prywatny stos RAG na jednej maszynie za 12 $. Ta kombinacja — małe lokalne osadzenia, lokalny magazyn wektorowy, zewnętrzne API tylko do ciężkiego kroku generacji — to konfiguracja, która faktycznie ma sens na sprzęcie takim jak ten.

Wybór planu

UżyciePlanCena
Osadzenia, modele 1–3B, pipeline RAGMedium12 $/mies.
To samo, plus publiczny punkt końcowy za uwierzytelnianiemMedium-IP20 $/mies.
Tylko testowanie małych modeliSmall8 $/mies.

Tylko CPU, do 6 vCPU i 6 GB RAM. Dysk NVMe, nielimitowany ruch, Niemcy lub Finlandia. Płatność kryptowalutą, bez KYC. Rozliczenie roczne to jeden przelew zamiast dwunastu.

Powiązane lektury


Gotowy? Wdróż serwer → — online w około minutę, płatność kryptowalutą, bez wymogu dokumentu.

Gotowy na wdrożenie? Płać kryptowalutą, bez KYC — online w około minutę.

Wdróż teraz →

FAQ

Czy mogę uruchomić na tym Llama 70B?

Nie. Nasze plany są tylko CPU z maksymalnie 6 GB RAM — to zakres małych skwantyzowanych modeli (mniej więcej 1B–8B na 4 bitach). Model 70B potrzebuje GPU i znacznie więcej pamięci. Nie oferujemy GPU i wolimy to powiedzieć, niż sprzedać Ci rozczarowanie.

Jak szybka jest naprawdę inferencja na CPU?

Spodziewaj się kilku tokenów na sekundę na modelu 7–8B przy kwantyzacji 4-bitowej i zauważalnie lepiej na modelach 1–3B. To w porządku do zadań w tle, osadzeń, klasyfikacji i asynchronicznych pipeline'ów. To nie jest w porządku do sprawnego interaktywnego czatu.

Więc do czego to faktycznie się nadaje?

Prywatne osadzenia, klasyfikacja, kolejki streszczeń, pipeline'y RAG, gdzie latencja nie ma znaczenia, i trzymanie danych z dala od API osób trzecich. Także: nauka, testowanie i prototypowanie, zanim wynajmiesz gdzieś GPU.

Czy prosicie o dokument tożsamości?

Nie. E-mail do rejestracji, USDC lub USDT do zapłaty. Co często jest powodem, dla którego ludzie w ogóle chcą prywatnego modelu.

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.