Wysyłanie każdego promptu do czyjegoś API jest w porządku — dopóki nie przestanie być. Może dane są wrażliwe i wolałbyś, by nigdy nie opuszczały Twojego serwera. Może masz dość limitów zapytań albo wersji modelu zmieniającej się pod Twoimi stopami, albo licznika za token tykającego, gdy eksperymentujesz. W pewnym momencie „a gdybym po prostu uruchomił własny?” przestaje być eksperymentem myślowym.
Ollama czyni to naprawdę łatwym. Trudniejszym pytaniem jest co mieści się na VPS — i tu uczciwa odpowiedź ma większe znaczenie niż ściema.
Co faktycznie możesz uruchomić na CPU
Bez GPU? Wtedy robisz inferencję CPU, a rozmiar modelu to wszystko. Kwantyzacja (ściśnięcie wag do 4 bitów) jest tym, co czyni to praktycznym — tracisz odrobinę jakości i oszczędzasz stos pamięci.
Zgrubne liczby, te, które mają znaczenie:
- Model 3B, 4-bit — ~3 GB RAM. Wystarczająco sprawny do czatu i prostych zadań.
- Model 7B, 4-bit — ~5 GB RAM. Wygodny wybór: zauważalnie mądrzejszy, wciąż działa w czytelnym tempie.
- 13B wzwyż — 8–10 GB+ i wolno na CPU. Technicznie możliwe, praktycznie irytujące.
Szybkość, uczciwie: na kilku vCPU zobaczysz garstkę tokenów na sekundę. Doskonale w porządku dla chatbota lub asystenta kodowania, gdzie czytasz, jak pisze. Nie w porządku do przetwarzania wsadowego miliona dokumentów — to zadanie GPU, i nie udajemy inaczej. Nie oferujemy instancji GPU. Jeśli Twój plan potrzebuje modelu 70B lub ciężkiej przepustowości, VPS CPU — nasz czy kogokolwiek — jest złym narzędziem, i powinieneś to wiedzieć, zanim wydasz grosz.
Ale prywatny 7B, który odpowiada na Twoje pytania i nigdy nie dzwoni do domu? To działa wygodnie na maszynie 6 GB.
Instalacja — trzy polecenia
Uruchom serwer, zaloguj się przez SSH i:
curl -fsSL https://ollama.com/install.sh | sh # instaluje Ollamę
ollama run llama3.2:3b # pobiera + uruchamia model 3B
To tyle — czatujesz w terminalu. By użyć go z własnego kodu, Ollama już serwuje API HTTP na porcie 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Streść ten changelog w dwóch liniach: ...",
"stream": false
}'
Jeden haczyk warty poznania z góry: domyślnie to API wiąże się z localhost. Trzymaj tak i tuneluj przez SSH, inaczej jest wystawione na internet. Jeśli chcesz, by było osiągalne, postaw je za uwierzytelnianiem — nie zostawiaj otwartego punktu końcowego modelu na publicznym IP.
Wybór maszyny
Dopasuj plan do modelu, nie na odwrót:
| Chcesz uruchomić | RAM, który potrzebujesz | Rozsądny plan |
|---|---|---|
| Model 3B, lekkie użycie | ~3 GB | Small (4 GB) |
| Model 7B, wygodnie | ~5–6 GB | Medium (6 GB) |
| Większy / wysoka przepustowość | teren GPU | nie VPS CPU |
Dla większości samodzielnych hostujących Medium (6 GB) to uczciwa rekomendacja — dość zapasu na model 7B plus Twoją aplikację i system. Small (4 GB) działa, jeśli trzymasz się 3B. Cokolwiek poniżej tego jest za ciasne, gdy system i kontekst wgryzą się.
Po co robić to tutaj
Jeśli hostujesz samodzielnie LLM, prywatność jest zwykle połową powodu — więc dziwne byłoby wręczać dokument, by wynająć maszynę. Nie musisz: możesz płacić w USDC lub USDT (albo kartą przez on-ramp), bez KYC, a serwer jest Twój w około minutę. Natywnie kryptowalutowy, przyjazny agentom, a dane pozostają na maszynie, którą kontrolujesz.
Kompromisem jest ten, co do którego byliśmy uczciwi: tylko CPU, sufit 6 GB, małe modele. W tych granicach samodzielny hosting jest świetny. Poza nimi nie pozwól, by ktoś sprzedał Ci maszynę CPU do zadania, które potrzebuje GPU.
Gotowy spróbować? Wybierz plan, zapłać, a będziesz miał root w około 60 sekund — potem to trzy polecenia do Twojego własnego prywatnego modelu.
Komentarze
Brak komentarzy. Bądź pierwszy.