Letni upał — wszystko się topi, nawet nasze ceny.−25%−25% na każdy plan roczny, do 31 sierpniaZobacz plany
EQVPS
Zacznij

Samodzielne hostowanie lokalnego LLM na VPS z Ollamą — co faktycznie działa

14 cze 2026 · 3 min czytania · Zespół EQVPS

Wysyłanie każdego promptu do czyjegoś API jest w porządku — dopóki nie przestanie być. Może dane są wrażliwe i wolałbyś, by nigdy nie opuszczały Twojego serwera. Może masz dość limitów zapytań albo wersji modelu zmieniającej się pod Twoimi stopami, albo licznika za token tykającego, gdy eksperymentujesz. W pewnym momencie „a gdybym po prostu uruchomił własny?” przestaje być eksperymentem myślowym.

Ollama czyni to naprawdę łatwym. Trudniejszym pytaniem jest co mieści się na VPS — i tu uczciwa odpowiedź ma większe znaczenie niż ściema.

Co faktycznie możesz uruchomić na CPU

Bez GPU? Wtedy robisz inferencję CPU, a rozmiar modelu to wszystko. Kwantyzacja (ściśnięcie wag do 4 bitów) jest tym, co czyni to praktycznym — tracisz odrobinę jakości i oszczędzasz stos pamięci.

Zgrubne liczby, te, które mają znaczenie:

Szybkość, uczciwie: na kilku vCPU zobaczysz garstkę tokenów na sekundę. Doskonale w porządku dla chatbota lub asystenta kodowania, gdzie czytasz, jak pisze. Nie w porządku do przetwarzania wsadowego miliona dokumentów — to zadanie GPU, i nie udajemy inaczej. Nie oferujemy instancji GPU. Jeśli Twój plan potrzebuje modelu 70B lub ciężkiej przepustowości, VPS CPU — nasz czy kogokolwiek — jest złym narzędziem, i powinieneś to wiedzieć, zanim wydasz grosz.

Ale prywatny 7B, który odpowiada na Twoje pytania i nigdy nie dzwoni do domu? To działa wygodnie na maszynie 6 GB.

Instalacja — trzy polecenia

Uruchom serwer, zaloguj się przez SSH i:

curl -fsSL https://ollama.com/install.sh | sh   # instaluje Ollamę
ollama run llama3.2:3b                            # pobiera + uruchamia model 3B

To tyle — czatujesz w terminalu. By użyć go z własnego kodu, Ollama już serwuje API HTTP na porcie 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Streść ten changelog w dwóch liniach: ...",
  "stream": false
}'

Jeden haczyk warty poznania z góry: domyślnie to API wiąże się z localhost. Trzymaj tak i tuneluj przez SSH, inaczej jest wystawione na internet. Jeśli chcesz, by było osiągalne, postaw je za uwierzytelnianiem — nie zostawiaj otwartego punktu końcowego modelu na publicznym IP.

Wybór maszyny

Dopasuj plan do modelu, nie na odwrót:

Chcesz uruchomićRAM, który potrzebujeszRozsądny plan
Model 3B, lekkie użycie~3 GBSmall (4 GB)
Model 7B, wygodnie~5–6 GBMedium (6 GB)
Większy / wysoka przepustowośćteren GPUnie VPS CPU

Dla większości samodzielnych hostujących Medium (6 GB) to uczciwa rekomendacja — dość zapasu na model 7B plus Twoją aplikację i system. Small (4 GB) działa, jeśli trzymasz się 3B. Cokolwiek poniżej tego jest za ciasne, gdy system i kontekst wgryzą się.

Po co robić to tutaj

Jeśli hostujesz samodzielnie LLM, prywatność jest zwykle połową powodu — więc dziwne byłoby wręczać dokument, by wynająć maszynę. Nie musisz: możesz płacić w USDC lub USDT (albo kartą przez on-ramp), bez KYC, a serwer jest Twój w około minutę. Natywnie kryptowalutowy, przyjazny agentom, a dane pozostają na maszynie, którą kontrolujesz.

Kompromisem jest ten, co do którego byliśmy uczciwi: tylko CPU, sufit 6 GB, małe modele. W tych granicach samodzielny hosting jest świetny. Poza nimi nie pozwól, by ktoś sprzedał Ci maszynę CPU do zadania, które potrzebuje GPU.

Gotowy spróbować? Wybierz plan, zapłać, a będziesz miał root w około 60 sekund — potem to trzy polecenia do Twojego własnego prywatnego modelu.

FAQ

Czy mogę uruchomić LLM bez GPU?

Tak, dla małych modeli. Model 3B lub 7B w kwantyzacji 4-bitowej działa na CPU i odpowiada w czytelnym tempie — w porządku dla chatbota, pomocnika kodowania lub zadań w tle, gdzie nie patrzysz na kursor. Czego nie możesz na CPU, to serwować dużego modelu (13B wzwyż) ani pchać wysokiej przepustowości; tam GPU przestaje być opcjonalne.

Ile RAM potrzebuję dla Llama 7B?

Około 5 GB dla modelu 7B 4-bitowego, gdy dodasz okno kontekstu i system — więc maszyna 6 GB to wygodna dolna granica. Model 3B mieści się w około 3 GB. Mniejsza kwantyzacja (Q4) wymienia odrobinę jakości za znacznie mniej pamięci, co jest właściwą wymianą na VPS.

Czy samodzielny hosting LLM jest tańszy niż API?

Zależy od wolumenu. Hostowane API liczy za token i nie kosztuje nic w bezczynności; VPS to stały miesięczny rachunek, czy go używasz, czy nie. Jeśli uruchamiasz stały strumień żądań lub głównie dbasz o prywatność i brak limitów zapytań, samodzielny hosting wygrywa. Do sporadycznych jednorazowych promptów rozliczane API jest tańsze.

Dlaczego hostować samodzielnie zamiast używać API w chmurze?

Trzy powody, dla których ludzie to robią: dane nigdy nie opuszczają Twojego serwera (realne dla prawnych, medycznych lub po prostu prywatnych notatek), nie ma limitów zapytań ani licznika za token, a model nie zmieni się ani nie zostanie wycofany pod Tobą. Kosztem jest to, że Ty zarządzasz maszyną i żyjesz w granicach jej sprzętu.

Jaki największy model mogę realistycznie uruchomić na VPS CPU?

Model 7B w 4-bitach to wygodny wybór na maszynie 6 GB. Możesz technicznie załadować 13B przy wystarczającym RAM, ale na CPU staje się dość wolny, byś to poczuł. Poza tym chcesz GPU, co jest innym rodzajem hosta.

← Powrót do blogaZobacz plany i ceny →

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.