EQVPS

Как установить Ollama на VPS (и вызывать её API)

Установите Ollama на VPS, скачайте небольшую модель и вызывайте её HTTP API — с честной оговоркой, что это CPU-машины, поэтому придерживайтесь небольших квантованных моделей и эмбеддингов. Копируемые команды и как безопасно её открыть.

Ollama превращает запуск локальной модели в установку в одну строку. Это инструкция; за честной картиной того, что CPU-инференс может и чего не может (и о «сладкой точке» RAG), смотрите кейс VPS для Ollama и self-host Ollama.

1. Установите Ollama

curl -fsSL https://ollama.com/install.sh | sh

Это устанавливает Ollama и запускает её как systemd-сервис, слушающий на localhost:11434.

2. Скачайте и запустите небольшую модель

На CPU-машине начинайте с малого:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Модели 3B по-настоящему пригодны на CPU; 7–8B работают со скоростью несколько токенов/сек (нормально для батча, мучительно для чата); 13B+ будут свопиться и ползти — не надо.

3. Вызовите HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Эмбеддинги — «сладкая точка» CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Держите на localhost — открывайте безопасно, если нужно

Ollama по умолчанию слушает на 127.0.0.1:11434. Держите её там. Если нужно доступаться с другой машины, поставьте перед ней reverse proxy с аутентификацией на тарифе с выделенным IP (гайд по nginx + HTTPS) или используйте SSH-туннель — никогда не открывайте эндпоинт модели без аутентификации публично.

Честная часть

Это инстансы только на CPU (без GPU). Небольшие квантованные модели и эмбеддинги работают хорошо; крупные — нет. Соедините Ollama с векторной БД для приватного RAG-стека — небольшие локальные эмбеддинги плюс локальное векторное хранилище — это связка, которая действительно блестит здесь. Medium ($12/мес, 6 ГБ) — комфортный тариф. Root примерно за минуту, без KYC, оплата в крипте.

Частые вопросы

Как установить Ollama на VPS?

Одна команда: curl -fsSL https://ollama.com/install.sh | sh. Затем ollama pull небольшой модели и ollama run её, либо вызывайте HTTP API на localhost:11434. Шаги ниже. На CPU-VPS придерживайтесь небольших квантованных моделей (1B–8B) и эмбеддингов — крупным моделям нужен GPU.

Будут ли модели быстрыми на CPU-VPS?

Небольшие — да; крупные — нет. Ожидайте несколько токенов в секунду на модели 7–8B при 4-битной квантизации и по-настоящему бодрую работу на моделях 1–3B и моделях эмбеддингов. Отлично для фоновых задач, классификации и RAG-конвейеров — не для быстрого интерактивного чата на большой модели.

Стоит ли открывать API Ollama в интернет?

Нет. Держите его на localhost:11434. Если нужен удалённый доступ, поставьте его за reverse proxy с аутентификацией на тарифе с выделенным IP или доступайтесь через SSH-туннель. Никогда не открывайте эндпоинт модели без аутентификации в открытый интернет.

Какой тариф мне нужен?

Наш Medium ($12/мес, 6 ГБ) комфортно подходит для небольших моделей и эмбеддингов; Small ($8) годится для тестирования моделей 1–3B. Это инстансы только на CPU — без GPU — поэтому выбирайте размер по объёму RAM модели, а не в надежде на скорость.

Вы просите документы или карту?

Нет. Email для регистрации, оплата в USDC или USDT — без документов, без карты.

Комментарии

Пока нет комментариев. Будьте первым.

Оставить комментарий

Комментарии проходят модерацию перед публикацией.