Ollama sprawia, że uruchomienie lokalnego modelu to instalacja w jednej linii. Oto poradnik; po uczciwy obraz tego, co inferencja na CPU może, a czego nie (oraz punkt idealny RAG), zajrzyj do przypadku użycia VPS dla Ollamy i self-host Ollamy.
1. Zainstaluj Ollamę
curl -fsSL https://ollama.com/install.sh | sh
To instaluje Ollamę i uruchamia ją jako usługę systemd nasłuchującą na localhost:11434.
2. Pobierz i uruchom mały model
Na maszynie CPU zacznij od małego:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Modele 3B są naprawdę używalne na CPU; 7–8B działają z kilkoma tokenami/s (ok do batcha, męka do czatu); 13B+ będą swapować i pełzać — nie rób tego.
3. Wywołaj API HTTP
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddingi to punkt idealny CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Trzymaj na localhost — wystaw bezpiecznie, jeśli trzeba
Ollama domyślnie wiąże się z 127.0.0.1:11434. Zostaw ją tam. Jeśli musisz dotrzeć do niej z innej maszyny, ustaw przed nią reverse proxy z uwierzytelnianiem na planie z dedykowanym IP (przewodnik nginx + HTTPS) albo użyj tunelu SSH — nigdy nie wystawiaj publicznie nieuwierzytelnionego endpointu modelu.
Uczciwy fragment
To instancje wyłącznie CPU (bez GPU). Małe skwantyzowane modele i embeddingi działają dobrze; duże nie. Połącz Ollamę z bazą wektorową dla prywatnego stosu RAG — małe lokalne embeddingi plus lokalny magazyn wektorowy to zestaw, który naprawdę tu błyszczy. Medium (12 $/mies., 6 GB) to wygodny plan. Root w około minutę, bez KYC, płatność w krypto.
Komentarze
Brak komentarzy. Bądź pierwszy.