Załatwmy najpierw część rozczarowującą, bo internet jest pełen stron, które tego nie robią.
Nasze serwery są tylko CPU. Nie oferujemy GPU. To oznacza, że lokalna praca z LLM ma tutaj twardy sufit, a udawanie inaczej po prostu zmarnowałoby Twoje pieniądze.
Co faktycznie działa na CPU
Przy maksymalnie 6 vCPU i 6 GB RAM (nasz plan Medium — 12 $/mies.) jesteś w zakresie małych skwantyzowanych modeli:
- Modele 1B–3B (Q4): naprawdę użyteczne. Wystarczająco szybkie do klasyfikacji, tagowania, routingu i prostej ustrukturyzowanej ekstrakcji.
- Modele 7B–8B (Q4): działają, ale spodziewaj się kilku tokenów na sekundę. W porządku dla kolejki przeżuwającej dokumenty przez noc. Bolesne jako okno czatu.
- Modele osadzeń: świetne dopasowanie. Są małe, szybkie na CPU, i to prawdopodobnie pojedynczy najlepszy powód, by uruchamiać Ollamę na maszynie jak nasza.
- 13B i wyżej: nie. Będziesz swapował i czekał.
Jeśli potrzebujesz szybkiego, interaktywnego czatu 70B, potrzebujesz hosta z GPU — to inny produkt od innego dostawcy, i wolimy Ci to powiedzieć, niż wziąć Twoje 12 $.
Gdzie maszyna CPU naprawdę wygrywa
Prywatność. Twoje dokumenty, Twoje prompty, Twoje osadzenia — nigdy nie opuszczające maszyny, którą kontrolujesz, nigdy nie stające się czyimiś danymi treningowymi. Dla wielu ludzi to cały sens, a kilka tokenów na sekundę to akceptowalna wymiana.
Przewidywalność kosztów. Bez rachunku za token. Pipeline klasyfikujący pięćdziesiąt tysięcy rekordów kosztuje tyle samo, co ten klasyfikujący pięćdziesiąt: 12 $.
Praca asynchroniczna. Większość użytecznej pracy z LLM to nie okno czatu. To kolejka: streść te, otaguj tamte, osadź ten korpus. Maszyna CPU mieląca zaległości przez noc jest w tym doskonale dobra.
Konfiguracja
# Ubuntu 24.04 — zalecany plan Medium
curl -fsSL https://ollama.com/install.sh | sh
# Zacznij od czegoś małego i przekonaj się sam
ollama pull llama3.2:3b
ollama run llama3.2:3b "Streść to w jednym zdaniu: ..."
# Osadzenia — wygodny wybór dla CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama serwuje API HTTP na localhost:11434. Trzymaj to tam. Jeśli musisz sięgnąć do niego skądinąd, postaw je za reverse proxy z uwierzytelnianiem na planie z dedykowanym IP — nigdy nie wystawiaj nieuwierzytelnionego punktu końcowego modelu do otwartego internetu.
Sparuj to z bazą wektorową (Qdrant lub pgvector w Dockerze), a masz kompletny prywatny stos RAG na jednej maszynie za 12 $. Ta kombinacja — małe lokalne osadzenia, lokalny magazyn wektorowy, zewnętrzne API tylko do ciężkiego kroku generacji — to konfiguracja, która faktycznie ma sens na sprzęcie takim jak ten.
Wybór planu
| Użycie | Plan | Cena |
|---|---|---|
| Osadzenia, modele 1–3B, pipeline RAG | Medium | 12 $/mies. |
| To samo, plus publiczny punkt końcowy za uwierzytelnianiem | Medium-IP | 20 $/mies. |
| Tylko testowanie małych modeli | Small | 8 $/mies. |
Tylko CPU, do 6 vCPU i 6 GB RAM. Dysk NVMe, nielimitowany ruch, Niemcy lub Finlandia. Płatność kryptowalutą, bez KYC. Rozliczenie roczne to jeden przelew zamiast dwunastu.
Powiązane lektury
- Hostuj bazę wektorową dla pamięci AI — druga połowa prywatnego stosu RAG
- VPS dla agentów AI — orkiestracja na tej samej maszynie
Gotowy? Wdróż serwer → — online w około minutę, płatność kryptowalutą, bez wymogu dokumentu.
Komentarze
Brak komentarzy. Bądź pierwszy.