EQVPS

VPS за Ollama и локални LLM-и

Хоствай сам малки езикови модели на CPU сървър — частно, неизмерено, платено в crypto. Честно за това какво CPU inference може и не може. От $12/месец.

Нека махнем разочароващата част от пътя, защото интернет е пълен със страници, които не го правят.

Сървърите ни са само-CPU. Не предлагаме GPU-та. Това значи, че работата с локални LLM тук има твърд таван, и преструването иначе просто би хабило парите ти.

Какво реално работи на CPU

С до 6 vCPU и 6 GB RAM (нашият Medium план — $12/месец), си в обхвата на малки quantized модели:

Ако се нуждаеш от бърз, интерактивен 70B чат, се нуждаеш от GPU хост — това е различен продукт от различен доставчик, и предпочитаме да ти кажем, отколкото да вземем $12-те ти.

Къде CPU машина генуинно печели

Поверителност. Документите ти, промптовете ти, embeddings-ите ти — никога не напускат машина, която контролираш, никога не стават нечии данни за обучение. За много хора това е целият смисъл, и няколко токена в секунда е приемлива размяна.

Предвидимост на разхода. Без per-token сметка. Pipeline, който класифицира петдесет хиляди записа, струва същото като този, който класифицира петдесет: $12.

Async работа. Повечето полезна LLM работа не е чат прозорец. Тя е опашка: обобщи тези, тагни онези, embed-ни този корпус. CPU машина, дъвчеща backlog през нощта, е перфектно добра в това.

Настройка

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama обслужва HTTP API на localhost:11434. Дръж го там. Ако трябва да го достигнеш отдругаде, сложи го зад reverse proxy с автентикация на план с dedicated IP — никога не излагай неавтентикиран model endpoint към отворения интернет.

Съчетай го с vector база данни (Qdrant или pgvector в Docker) и имаш пълен частен RAG стек на една машина за $12. Тази комбинация — малки локални embeddings, локален vector store, външно API само за тежката генерираща стъпка — е настройката, която реално има смисъл на хардуер като този.

Избор на план

УпотребаПланЦена
Embeddings, 1–3B модели, RAG pipelineMedium$12/месец
Същото, плюс публичен endpoint зад authMedium-IP$20/месец
Само тестване на малки моделиSmall$8/месец

Само-CPU, до 6 vCPU и 6 GB RAM. NVMe съхранение, неизмерен трафик, Германия или Финландия. Плащане в crypto, без KYC. Годишното фактуриране е един превод вместо дванайсет.

Свързано четиво


Готов? Deploy-ни сървър → — live за около минута, платено в crypto, без нужда от документ.

Готов за deploy? Плати в crypto, без KYC — онлайн за около минута.

Deploy-ни сега →

Въпроси

Мога ли да пусна Llama 70B на това?

Не. Плановете ни са само-CPU с до 6 GB RAM — това е обхватът на малки quantized модели (грубо 1B–8B на 4-bit). 70B модел се нуждае от GPU и далеч повече памет. Не предлагаме GPU-та, и предпочитаме да го кажем, отколкото да ти продадем разочарование.

Колко бърз е CPU inference, реално?

Очаквай няколко токена в секунда на 7–8B модел на 4-bit quantization, и забележимо по-добре на 1–3B модели. Това е наред за фонови задачи, embeddings, класификация и async pipelines. Не е наред за бърз интерактивен чат.

Тогава за какво реално е добро това?

Частни embeddings, класификация, опашки за резюмиране, RAG pipelines, където латентността няма значение, и държане на данни извън API-та на трети страни. Също: учене, тестване и прототипиране преди да наемеш GPU някъде.

Искате ли документ?

Не. Имейл за регистрация, USDC или USDT за плащане. Което често е причината хората да искат частен модел на първо място.

Коментари

Още няма коментари. Бъди първият.

Остави коментар

Коментарите се модерират преди да се появят.