EQVPS

Self-hosting на локален LLM на VPS с Ollama — какво реално работи

14.06.2026 г. · 3 мин четене · EQVPS Team

Изпращането на всеки промпт към API на някой друг е наред — докато не е. Може данните да са чувствителни и да предпочиташ никога да не напускат сървъра ти. Може да си уморен от rate limits, или от версия на модел, променяща се под краката ти, или от брояч на токен, тиктакащ, докато експериментираш. В някакъв момент „ами ако просто пусна свой?“ спира да е мисловен експеримент.

Ollama прави това генуинно лесно. По-трудният въпрос е какво се събира на VPS — и тук честният отговор има повече значение от хайпа.

Какво реално можеш да пуснеш на CPU

Няма GPU? Тогава правиш CPU inference, а размерът на модела е всичко. Квантизацията (смачкване на теглата до 4-bit) е това, което прави това практично — губиш частица качество и спестяваш купчина памет.

Груби числа, тези, които имат значение:

Скорост, честно: на няколко vCPU ще виждаш шепа токени в секунда. Напълно наред за chatbot или помощник за код, където четеш, докато той пише. Не наред за batch-обработка на милион документа — това е GPU работа, и не се преструваме иначе. Не предлагаме GPU инстанции. Ако планът ти се нуждае от модел 70B или тежък throughput, CPU VPS — нашият или на когото и да е — е грешният инструмент, и трябва да го знаеш, преди да похарчиш и стотинка.

Но частен 7B, който отговаря на въпросите ти и никога не звъни вкъщи? Той работи комфортно на машина от 6 GB.

Инсталацията — три команди

Вдигни сървъра, влез по SSH, и:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

Това е — чатиш в терминала. За да го използваш от собствения си код, Ollama вече сервира HTTP API на порт 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

Един капан, който си струва да знаеш предварително: по подразбиране това API се връзва към localhost. Дръж го така и тунелирай през SSH, или е изложено на интернет. Ако искаш да е достъпно, сложи го зад auth — не оставяй отворен endpoint на модел на публичен IP.

Избиране на машината

Съответствай плана на модела, не обратното:

Искаш да пуснешRAM, който ти трябваРазумен план
3B модел, лека употреба~3 GBSmall (4 GB)
7B модел, комфортно~5-6 GBMedium (6 GB)
По-голям / висок throughputGPU територияне CPU VPS

За повечето self-hosters, Medium (6 GB) е честната препоръка — достатъчно запас за 7B модел плюс приложението ти и OS-а. Small (4 GB) работи, ако се придържаш към 3B. Всичко под това е твърде тясно, щом OS-ът и контекстът изядат вътре.

Защо да го правиш тук

Ако хостваш сам LLM, поверителността обикновено е половината причина — така че би било странно да предадеш документа си, за да наемеш машината. Не се налага: можеш да платиш в USDC или USDT (или карта през on-ramp), без KYC, и сървърът е твой за около минута. Crypto-native, agent-friendly, а данните остават на машина, която контролираш.

Компромисът е този, за който бяхме честни: само CPU, таван от 6 GB, малки модели. В рамките на това self-hosting-ът е чудесен. Извън него, не оставяй никого да ти продаде CPU машина за работа, която се нуждае от GPU.

Готов да опиташ? Избери план, плати, и ще имаш root за около 60 секунди — после са три команди до собствения ти частен модел.

Въпроси

Мога ли да пусна LLM без GPU?

Да, за малки модели. Модел 3B или 7B в 4-bit квантизация работи на CPU и отговаря с четимо темпо — наред за chatbot, помощник за код или фонови задачи, където не гледаш курсора. Това, което не можеш на CPU, е да сервираш голям модел (13B и нагоре) или да буташ висок throughput; там GPU спира да е незадължителен.

Колко RAM ми трябва за Llama 7B?

Около 5 GB за 4-bit 7B модел, щом добавиш контекстния прозорец и OS-а — така че машина от 6 GB е комфортният под. Модел 3B се събира в около 3 GB. По-малка квантизация (Q4) разменя малко качество за много по-малко памет, което е правилната размяна на VPS.

По-евтин ли е self-hosting на LLM от API?

Зависи от обема. Хостнато API таксува на токен и не струва нищо в покой; VPS е плоска месечна сметка, независимо дали го използваш. Ако пускаш стабилен поток заявки, или основно те интересува поверителност и без rate limits, self-hosting-ът печели. За случайни еднократни промптове, измервано API е по-евтино.

Защо да хоствам сам вместо да използвам облачно API?

Три причини, поради които хората реално го правят: данните никога не напускат сървъра ти (реално за правно, медицинско или просто частни бележки), няма rate limits или брояч на токен, и моделът няма да се промени или да бъде остарен под теб. Разходът е, че управляваш машината и живееш в хардуера ѝ.

Кой е най-големият модел, който реалистично мога да пусна на CPU VPS?

Модел 7B на 4-bit е сладката точка на машина от 6 GB. Технически можеш да заредиш 13B с достатъчно RAM, но на CPU става достатъчно бавен, че ще го усетиш. Отвъд това искаш GPU, което е различен вид хост.

← Обратно към блогаВиж планове и цени →

Коментари

Още няма коментари. Бъди първият.

Остави коментар

Коментарите се модерират преди да се появят.