Ollama превращает запуск локальной модели в установку в одну строку. Это инструкция; за честной картиной того, что CPU-инференс может и чего не может (и о «сладкой точке» RAG), смотрите кейс VPS для Ollama и self-host Ollama.
1. Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh
Это устанавливает Ollama и запускает её как systemd-сервис, слушающий на localhost:11434.
2. Скачайте и запустите небольшую модель
На CPU-машине начинайте с малого:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Модели 3B по-настоящему пригодны на CPU; 7–8B работают со скоростью несколько токенов/сек (нормально для батча, мучительно для чата); 13B+ будут свопиться и ползти — не надо.
3. Вызовите HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Эмбеддинги — «сладкая точка» CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Держите на localhost — открывайте безопасно, если нужно
Ollama по умолчанию слушает на 127.0.0.1:11434. Держите её там. Если нужно доступаться с другой машины, поставьте перед ней reverse proxy с аутентификацией на тарифе с выделенным IP (гайд по nginx + HTTPS) или используйте SSH-туннель — никогда не открывайте эндпоинт модели без аутентификации публично.
Честная часть
Это инстансы только на CPU (без GPU). Небольшие квантованные модели и эмбеддинги работают хорошо; крупные — нет. Соедините Ollama с векторной БД для приватного RAG-стека — небольшие локальные эмбеддинги плюс локальное векторное хранилище — это связка, которая действительно блестит здесь. Medium ($12/мес, 6 ГБ) — комфортный тариф. Root примерно за минуту, без KYC, оплата в крипте.
Комментарии
Пока нет комментариев. Будьте первым.