Ollama перетворює запуск локальної моделі на встановлення в один рядок. Це інструкція; за чесною картиною того, що CPU-інференс може й чого не може (і про «солодку точку» RAG), дивіться кейс VPS для Ollama та self-host Ollama.
1. Встановіть Ollama
curl -fsSL https://ollama.com/install.sh | sh
Це встановлює Ollama й запускає її як systemd-сервіс, що слухає на localhost:11434.
2. Завантажте й запустіть невелику модель
На CPU-машині починайте з малого:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Моделі 3B по-справжньому придатні на CPU; 7–8B працюють зі швидкістю кілька токенів/сек (нормально для батчу, болісно для чату); 13B+ будуть свопитися й повзти — не треба.
3. Викличте HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Ембеддинги — «солодка точка» CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Тримайте на localhost — відкривайте безпечно, якщо потрібно
Ollama за замовчуванням слухає на 127.0.0.1:11434. Тримайте її там. Якщо потрібно доступатися з іншої машини, поставте перед нею reverse proxy з автентифікацією на тарифі з виділеним IP (гайд по nginx + HTTPS) або використовуйте SSH-тунель — ніколи не відкривайте ендпоінт моделі без автентифікації публічно.
Чесна частина
Це інстанси лише на CPU (без GPU). Невеликі квантовані моделі та ембеддинги працюють добре; великі — ні. Поєднайте Ollama з векторною БД для приватного RAG-стека — невеликі локальні ембеддинги плюс локальне векторне сховище — це зв'язка, яка справді блищить тут. Medium ($12/міс, 6 ГБ) — комфортний тариф. Root приблизно за хвилину, без KYC, оплата в крипті.
Коментарі
Поки немає коментарів. Будьте першим.