EQVPS

Jak zainstalować Ollamę na VPS (i wywołać jej API)

Zainstaluj Ollamę na VPS, pobierz mały model i wywołaj jego API HTTP — z uczciwą uwagą, że to maszyny CPU, więc trzymaj się małych skwantyzowanych modeli i embeddingów. Polecenia kopiuj-wklej i jak bezpiecznie je wystawić.

Ollama sprawia, że uruchomienie lokalnego modelu to instalacja w jednej linii. Oto poradnik; po uczciwy obraz tego, co inferencja na CPU może, a czego nie (oraz punkt idealny RAG), zajrzyj do przypadku użycia VPS dla Ollamy i self-host Ollamy.

1. Zainstaluj Ollamę

curl -fsSL https://ollama.com/install.sh | sh

To instaluje Ollamę i uruchamia ją jako usługę systemd nasłuchującą na localhost:11434.

2. Pobierz i uruchom mały model

Na maszynie CPU zacznij od małego:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Modele 3B są naprawdę używalne na CPU; 7–8B działają z kilkoma tokenami/s (ok do batcha, męka do czatu); 13B+ będą swapować i pełzać — nie rób tego.

3. Wywołaj API HTTP

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddingi to punkt idealny CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Trzymaj na localhost — wystaw bezpiecznie, jeśli trzeba

Ollama domyślnie wiąże się z 127.0.0.1:11434. Zostaw ją tam. Jeśli musisz dotrzeć do niej z innej maszyny, ustaw przed nią reverse proxy z uwierzytelnianiem na planie z dedykowanym IP (przewodnik nginx + HTTPS) albo użyj tunelu SSH — nigdy nie wystawiaj publicznie nieuwierzytelnionego endpointu modelu.

Uczciwy fragment

To instancje wyłącznie CPU (bez GPU). Małe skwantyzowane modele i embeddingi działają dobrze; duże nie. Połącz Ollamę z bazą wektorową dla prywatnego stosu RAG — małe lokalne embeddingi plus lokalny magazyn wektorowy to zestaw, który naprawdę tu błyszczy. Medium (12 $/mies., 6 GB) to wygodny plan. Root w około minutę, bez KYC, płatność w krypto.

FAQ

Jak zainstalować Ollamę na VPS?

Jedno polecenie: curl -fsSL https://ollama.com/install.sh | sh. Następnie ollama pull małego modelu i ollama run, albo wywołaj API HTTP na localhost:11434. Kroki poniżej. Na VPS z CPU trzymaj się małych skwantyzowanych modeli (1B–8B) i embeddingów — duże modele wymagają GPU.

Czy modele będą szybkie na VPS z CPU?

Małe tak, duże nie. Spodziewaj się kilku tokenów na sekundę na modelu 7–8B przy kwantyzacji 4-bitowej i naprawdę żwawej wydajności na modelach 1–3B oraz modelach embeddingów. Świetne do zadań w tle, klasyfikacji i pipeline'ów RAG — nie do szybkiego interaktywnego czatu na dużym modelu.

Czy wystawiać API Ollamy do internetu?

Nie. Trzymaj je na localhost:11434. Jeśli potrzebujesz zdalnego dostępu, umieść je za reverse proxy z uwierzytelnianiem na planie z dedykowanym IP, albo dotrzyj przez tunel SSH. Nigdy nie wystawiaj nieuwierzytelnionego endpointu modelu do otwartego internetu.

Jakiego planu potrzebuję?

Nasz Medium (12 $/mies., 6 GB) wygodnie pasuje do małych modeli i embeddingów; Small (8 $) sprawdza się do testowania modeli 1–3B. To instancje wyłącznie CPU — bez GPU — więc dobieraj rozmiar według zapotrzebowania modelu na RAM, a nie w nadziei na prędkość.

Czy wymagacie dokumentu lub karty?

Nie. E-mail do rejestracji, płatność w USDC lub USDT — bez dokumentów, bez karty.

Komentarze

Brak komentarzy. Bądź pierwszy.

Zostaw komentarz

Komentarze są moderowane przed pojawieniem się.