Bądźmy szczerzy na wstępie: jeśli chcesz szybkiej, taniej, wysokiej jakości generacji, zawołaj API. Maszyna CPU VPS nie pobije centrum danych pełnego GPU, a każdy, kto mówi Ci inaczej, coś sprzedaje.
Więc po co w ogóle hostować inferencję samodzielnie? Jeden powód, i to dobry: model na Twoim serwerze nigdy nie wysyła Twoich promptów nigdzie.
Jak faktycznie wygląda inferencja CPU
Możesz uruchamiać prawdziwe modele na CPU przy wystarczającym RAM. Model 7–8B skwantyzowany do 4 bitów działa. 13B działa. Możesz nawet pchnąć model klasy 30B, jeśli masz pamięć. Czego nie możesz, to uczynić go szybkim — wyjście przychodzi z prędkością kilku tokenów na sekundę, nie natychmiastowego strumienia, jaki daje API.
To uczciwa wymiana. Do interaktywnego czatu jest frustrująca. Do pracy w tle — streszczania dokumentów przez noc, klasyfikowania kolejki, wzbogacania danych według harmonogramu — kilka tokenów na sekundę jest całkowicie w porządku, a nikt nie patrzy na zegar.
Matematyka RAM
Model musi siedzieć w pamięci, skwantyzowany czy nie, plus narzut na kontekst i środowisko uruchomieniowe:
- 7–8B, 4-bit — około 6–8 GB. Działa na średnim planie.
- 13B, 4-bit — mniej więcej 10–16 GB.
- Klasa 30B, skwantyzowana — 24–48 GB, w zależności od kwantyzacji.
- Większe lub o wyższej precyzji — jesteś szybko w 64–80 GB — a poza 80 GB żadna pojedyncza maszyna Pro nie zmieści, wciąż wolna na CPU.
Dlatego „uruchom lokalny model” po cichu staje się pytaniem o dużą pamięć. Model jest śladem pamięci. Dodaj indeks RAG lub agentów na tej samej maszynie, a liczby się piętrzą.
Ollama vs vLLM, krótko
Ollama to łatwe drzwi do środka — zainstaluj, ollama run, gotowe. To właściwe narzędzie dla prywatnej konfiguracji jednego użytkownika, gdzie po prostu chcesz mieć model dostępny. vLLM jest zbudowany pod przepustowość serwowania: więcej konfiguracji, lepszy pod jednoczesnym obciążeniem, wart tego, gdy faktycznie obsługujesz wolumen. Zacznij od Ollama; sięgnij po vLLM, gdy serwujesz prawdziwy ruch.
Gdzie podejście najpierw-prywatność naprawdę wygrywa
Argumentem za samodzielną inferencją nie jest szybkość ani koszt — chodzi o to, że niektóre dane nie mogą wyjść. Dokumenty prawne. Dokumentacja medyczna. Zastrzeżony kod. Wszystko, gdzie wysłanie promptu do API osoby trzeciej odpada z powodów polityki lub zaufania. Wolniejszy model działający w całości na Twojej maszynie bije szybki, który loguje wszystko, co mu wysyłasz.
A jeśli dane są aż tak wrażliwe, płatność prawdopodobnie też powinna być prywatna. Wynajęcie maszyny za krypto i bez KYC utrzymuje cały łańcuch — serwer, model, prompty, rozliczenia — poza czyimikolwiek aktami tożsamości. To jest faktyczna oferta: nie „tańsza inferencja”, ale „inferencja, której nikt inny nie widzi”.
Konkluzja
Dla szybkości i jakości użyj API — nie ma w tym wstydu. Hostuj samodzielnie, gdy prywatność jest wymogiem, a wolniejsze jest akceptowalne. Dobierz rozmiar pod model plus jego kontekst plus cokolwiek innego dzielącego maszynę i nie oczekuj prędkości GPU od CPU.
Gdy model potrzebuje prawdziwej pamięci, linia Pro obejmuje 32 do 80 GB z dedykowanym IP i nocnymi kopiami zapasowymi — dość, by trzymać poważny skwantyzowany model z miejscem na kontekst wokół.
Komentarze
Brak komentarzy. Bądź pierwszy.