Нека махнем разочароващата част от пътя, защото интернет е пълен със страници, които не го правят.
Сървърите ни са само-CPU. Не предлагаме GPU-та. Това значи, че работата с локални LLM тук има твърд таван, и преструването иначе просто би хабило парите ти.
Какво реално работи на CPU
С до 6 vCPU и 6 GB RAM (нашият Medium план — $12/месец), си в обхвата на малки quantized модели:
- 1B–3B модели (Q4): генуинно използваеми. Достатъчно бързи за класификация, tagging, routing, и просто структурирано извличане.
- 7B–8B модели (Q4): работят, но очаквай няколко токена в секунда. Наред за опашка, която дъвче документи през нощта. Мъчителни като чат прозорец.
- Embedding модели: отлично приляга. Те са малки, бързи на CPU, и това вероятно е единичната най-добра причина да пуснеш Ollama на машина като нашата.
- 13B и нагоре: недей. Ще swap-ваш и ще чакаш.
Ако се нуждаеш от бърз, интерактивен 70B чат, се нуждаеш от GPU хост — това е различен продукт от различен доставчик, и предпочитаме да ти кажем, отколкото да вземем $12-те ти.
Къде CPU машина генуинно печели
Поверителност. Документите ти, промптовете ти, embeddings-ите ти — никога не напускат машина, която контролираш, никога не стават нечии данни за обучение. За много хора това е целият смисъл, и няколко токена в секунда е приемлива размяна.
Предвидимост на разхода. Без per-token сметка. Pipeline, който класифицира петдесет хиляди записа, струва същото като този, който класифицира петдесет: $12.
Async работа. Повечето полезна LLM работа не е чат прозорец. Тя е опашка: обобщи тези, тагни онези, embed-ни този корпус. CPU машина, дъвчеща backlog през нощта, е перфектно добра в това.
Настройка
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama обслужва HTTP API на localhost:11434. Дръж го там. Ако трябва да го достигнеш отдругаде, сложи го зад reverse proxy с автентикация на план с dedicated IP — никога не излагай неавтентикиран model endpoint към отворения интернет.
Съчетай го с vector база данни (Qdrant или pgvector в Docker) и имаш пълен частен RAG стек на една машина за $12. Тази комбинация — малки локални embeddings, локален vector store, външно API само за тежката генерираща стъпка — е настройката, която реално има смисъл на хардуер като този.
Избор на план
| Употреба | План | Цена |
|---|---|---|
| Embeddings, 1–3B модели, RAG pipeline | Medium | $12/месец |
| Същото, плюс публичен endpoint зад auth | Medium-IP | $20/месец |
| Само тестване на малки модели | Small | $8/месец |
Само-CPU, до 6 vCPU и 6 GB RAM. NVMe съхранение, неизмерен трафик, Германия или Финландия. Плащане в crypto, без KYC. Годишното фактуриране е един превод вместо дванайсет.
Свързано четиво
- Хоствай vector DB за AI памет — другата половина на частен RAG стек
- VPS за AI агенти — оркестрация на същата машина
Готов? Deploy-ни сървър → — live за около минута, платено в crypto, без нужда от документ.
Коментари
Още няма коментари. Бъди първият.