Letni upał — wszystko się topi, nawet nasze ceny.−25%−25% na każdy plan roczny, do 31 sierpniaZobacz plany
EQVPS
Zacznij

Prywatne hostowanie lokalnej inferencji LLM: co maszyna CPU VPS może, a czego nie

9 sie 2026 · 2 min czytania · Zespół EQVPS

Bądźmy szczerzy na wstępie: jeśli chcesz szybkiej, taniej, wysokiej jakości generacji, zawołaj API. Maszyna CPU VPS nie pobije centrum danych pełnego GPU, a każdy, kto mówi Ci inaczej, coś sprzedaje.

Więc po co w ogóle hostować inferencję samodzielnie? Jeden powód, i to dobry: model na Twoim serwerze nigdy nie wysyła Twoich promptów nigdzie.

Jak faktycznie wygląda inferencja CPU

Możesz uruchamiać prawdziwe modele na CPU przy wystarczającym RAM. Model 7–8B skwantyzowany do 4 bitów działa. 13B działa. Możesz nawet pchnąć model klasy 30B, jeśli masz pamięć. Czego nie możesz, to uczynić go szybkim — wyjście przychodzi z prędkością kilku tokenów na sekundę, nie natychmiastowego strumienia, jaki daje API.

To uczciwa wymiana. Do interaktywnego czatu jest frustrująca. Do pracy w tle — streszczania dokumentów przez noc, klasyfikowania kolejki, wzbogacania danych według harmonogramu — kilka tokenów na sekundę jest całkowicie w porządku, a nikt nie patrzy na zegar.

Matematyka RAM

Model musi siedzieć w pamięci, skwantyzowany czy nie, plus narzut na kontekst i środowisko uruchomieniowe:

Dlatego „uruchom lokalny model” po cichu staje się pytaniem o dużą pamięć. Model jest śladem pamięci. Dodaj indeks RAG lub agentów na tej samej maszynie, a liczby się piętrzą.

Ollama vs vLLM, krótko

Ollama to łatwe drzwi do środka — zainstaluj, ollama run, gotowe. To właściwe narzędzie dla prywatnej konfiguracji jednego użytkownika, gdzie po prostu chcesz mieć model dostępny. vLLM jest zbudowany pod przepustowość serwowania: więcej konfiguracji, lepszy pod jednoczesnym obciążeniem, wart tego, gdy faktycznie obsługujesz wolumen. Zacznij od Ollama; sięgnij po vLLM, gdy serwujesz prawdziwy ruch.

Gdzie podejście najpierw-prywatność naprawdę wygrywa

Argumentem za samodzielną inferencją nie jest szybkość ani koszt — chodzi o to, że niektóre dane nie mogą wyjść. Dokumenty prawne. Dokumentacja medyczna. Zastrzeżony kod. Wszystko, gdzie wysłanie promptu do API osoby trzeciej odpada z powodów polityki lub zaufania. Wolniejszy model działający w całości na Twojej maszynie bije szybki, który loguje wszystko, co mu wysyłasz.

A jeśli dane są aż tak wrażliwe, płatność prawdopodobnie też powinna być prywatna. Wynajęcie maszyny za krypto i bez KYC utrzymuje cały łańcuch — serwer, model, prompty, rozliczenia — poza czyimikolwiek aktami tożsamości. To jest faktyczna oferta: nie „tańsza inferencja”, ale „inferencja, której nikt inny nie widzi”.

Konkluzja

Dla szybkości i jakości użyj API — nie ma w tym wstydu. Hostuj samodzielnie, gdy prywatność jest wymogiem, a wolniejsze jest akceptowalne. Dobierz rozmiar pod model plus jego kontekst plus cokolwiek innego dzielącego maszynę i nie oczekuj prędkości GPU od CPU.

Gdy model potrzebuje prawdziwej pamięci, linia Pro obejmuje 32 do 80 GB z dedykowanym IP i nocnymi kopiami zapasowymi — dość, by trzymać poważny skwantyzowany model z miejscem na kontekst wokół.

FAQ

Czy mogę uruchomić LLM bez GPU?

Małe skwantyzowane modele — tak, i wolno. Model 7–8B skwantyzowany do 4 bitów działa na CPU przy wystarczającym RAM, ale wyjście będziesz mierzył w kilku tokenach na sekundę, nie sprawnym strumieniu z API. W porządku do zadań wsadowych i w tle, bolesne do interaktywnego czatu.

Ile RAM na lokalną inferencję?

Model musi zmieścić się w pamięci plus narzut. Model 7–8B 4-bitowy chce ~6–8 GB; 13B około 10–16 GB; modele klasy 30B dobijają 24–48 GB skwantyzowane. Dodaj miejsce na kontekst i cokolwiek innego na maszynie. Dlatego lokalna inferencja szybko ląduje w terenie dużej pamięci.

Ollama czy vLLM?

Ollama to łatwe wejście — jedno polecenie, model pobrany, działa. vLLM jest do przepustowości i serwowania, więcej konfiguracji, lepszy pod obciążeniem. Dla prywatnej maszyny jednego użytkownika Ollama jest zwykle właściwym wyborem; vLLM, gdy faktycznie serwujesz żądania na wolumenie.

Po co w ogóle hostować inferencję samodzielnie, skoro jest wolniejsza?

Prywatność. Twoje prompty i wyniki nigdy nie dotykają serwerów ani logów dostawcy. Dla wrażliwych danych — prawnych, medycznych, wewnętrznego kodu, czegokolwiek, czego nie możesz wysłać osobie trzeciej — wolniejszy prywatny model bije szybki, który widzi wszystko. Sparuj to z płatnością krypto bez KYC, a cały łańcuch pozostaje Twój.

← Powrót do blogaZobacz plany i ceny →

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.