EQVPS

Как да инсталирате Ollama на VPS (и да извикате API-то ѝ)

Инсталирайте Ollama на VPS, изтеглете малък модел и извикайте HTTP API-то ѝ — с честната бележка, че това са CPU машини, затова се придържайте към малки квантувани модели и embeddings. Команди за копиране-поставяне и как да я изложите безопасно.

Ollama прави пускането на локален модел инсталация от един ред. Това е ръководството; за честната картина какво може и какво не може CPU инференсът (и сладката точка на RAG) виж случая на употреба VPS за Ollama и self-host Ollama.

1. Инсталирай Ollama

curl -fsSL https://ollama.com/install.sh | sh

Това инсталира Ollama и я стартира като systemd услуга, слушаща на localhost:11434.

2. Изтегли и пусни малък модел

На CPU машина започни с малко:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Моделите 3B са наистина използваеми на CPU; 7–8B работят при няколко токена/сек (окей за пакетна работа, мъчително за чат); 13B+ ще суапват и ще пълзят — недей.

3. Извикай HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Embeddings са сладката точка на CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Дръж я на localhost — изложи безопасно при нужда

Ollama се свързва към 127.0.0.1:11434 по подразбиране. Остави я там. Ако трябва да я достигаш от друга машина, сложи отпред reverse proxy с автентикация на план със специален IP (ръководство nginx + HTTPS) или използвай SSH тунел — никога не излагай публично неавтентикиран endpoint на модел.

Честната част

Това са инстанции само с CPU (без GPU). Малките квантувани модели и embeddings работят добре; големите — не. Съчетай Ollama с векторна база данни за частен RAG стек — малки локални embeddings плюс локално векторно хранилище е настройката, която наистина блести тук. Medium ($12/мес, 6 GB) е удобният план. Root за около минута, без KYC, плащане в крипто.

Въпроси

Как да инсталирам Ollama на VPS?

Една команда: curl -fsSL https://ollama.com/install.sh | sh. После ollama pull на малък модел и ollama run, или извикай HTTP API на localhost:11434. Стъпките са по-долу. На CPU VPS се придържай към малки квантувани модели (1B–8B) и embeddings — големите модели изискват GPU.

Ще бъдат ли моделите бързи на CPU VPS?

Малките да, големите не. Очаквай няколко токена в секунда на модел 7–8B при 4-битово квантуване и наистина пъргава производителност на модели 1–3B и embedding модели. Чудесно за фонови задачи, класификация и RAG пайплайни — не за бърз интерактивен чат на голям модел.

Да изложа ли API-то на Ollama в интернет?

Не. Дръж го на localhost:11434. Ако ти трябва отдалечен достъп, сложи го зад reverse proxy с автентикация на план със специален IP, или го достигай през SSH тунел. Никога не излагай неавтентикиран endpoint на модел в отворения интернет.

Какъв план ми трябва?

Нашият Medium ($12/мес, 6 GB) пасва удобно за малки модели и embeddings; Small ($8) става за тестване на модели 1–3B. Това са инстанции само с CPU — без GPU — затова оразмерявай по отпечатъка на RAM на модела, а не с надежда за скорост.

Искате ли документ за самоличност или карта?

Не. Имейл за регистрация, плащане в USDC или USDT — без документи, без карта.

Коментари

Още няма коментари. Бъди първият.

Остави коментар

Коментарите се модерират преди да се появят.