EQVPS

Як встановити Ollama на VPS (і викликати її API)

Встановіть Ollama на VPS, завантажте невелику модель і викликайте її HTTP API — з чесним застереженням, що це CPU-машини, тож тримайтеся невеликих квантованих моделей та ембеддингів. Копійовані команди й як безпечно її відкрити.

Ollama перетворює запуск локальної моделі на встановлення в один рядок. Це інструкція; за чесною картиною того, що CPU-інференс може й чого не може (і про «солодку точку» RAG), дивіться кейс VPS для Ollama та self-host Ollama.

1. Встановіть Ollama

curl -fsSL https://ollama.com/install.sh | sh

Це встановлює Ollama й запускає її як systemd-сервіс, що слухає на localhost:11434.

2. Завантажте й запустіть невелику модель

На CPU-машині починайте з малого:

ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

Моделі 3B по-справжньому придатні на CPU; 7–8B працюють зі швидкістю кілька токенів/сек (нормально для батчу, болісно для чату); 13B+ будуть свопитися й повзти — не треба.

3. Викличте HTTP API

curl http://localhost:11434/api/generate \
  -d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'

Ембеддинги — «солодка точка» CPU:

ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

4. Тримайте на localhost — відкривайте безпечно, якщо потрібно

Ollama за замовчуванням слухає на 127.0.0.1:11434. Тримайте її там. Якщо потрібно доступатися з іншої машини, поставте перед нею reverse proxy з автентифікацією на тарифі з виділеним IP (гайд по nginx + HTTPS) або використовуйте SSH-тунель — ніколи не відкривайте ендпоінт моделі без автентифікації публічно.

Чесна частина

Це інстанси лише на CPU (без GPU). Невеликі квантовані моделі та ембеддинги працюють добре; великі — ні. Поєднайте Ollama з векторною БД для приватного RAG-стека — невеликі локальні ембеддинги плюс локальне векторне сховище — це зв'язка, яка справді блищить тут. Medium ($12/міс, 6 ГБ) — комфортний тариф. Root приблизно за хвилину, без KYC, оплата в крипті.

Часті питання

Як встановити Ollama на VPS?

Одна команда: curl -fsSL https://ollama.com/install.sh | sh. Потім ollama pull невеликої моделі та ollama run її, або викликайте HTTP API на localhost:11434. Кроки нижче. На CPU-VPS тримайтеся невеликих квантованих моделей (1B–8B) та ембеддингів — великим моделям потрібен GPU.

Чи будуть моделі швидкими на CPU-VPS?

Невеликі — так; великі — ні. Очікуйте кілька токенів на секунду на моделі 7–8B при 4-бітній квантизації та по-справжньому жваву роботу на моделях 1–3B та моделях ембеддингів. Чудово для фонових задач, класифікації та RAG-конвеєрів — не для швидкого інтерактивного чату на великій моделі.

Чи варто відкривати API Ollama в інтернет?

Ні. Тримайте його на localhost:11434. Якщо потрібен віддалений доступ, поставте його за reverse proxy з автентифікацією на тарифі з виділеним IP або доступайтеся через SSH-тунель. Ніколи не відкривайте ендпоінт моделі без автентифікації у відкритий інтернет.

Який тариф мені потрібен?

Наш Medium ($12/міс, 6 ГБ) комфортно підходить для невеликих моделей та ембеддингів; Small ($8) годиться для тестування моделей 1–3B. Це інстанси лише на CPU — без GPU — тож обирайте розмір за обсягом RAM моделі, а не в надії на швидкість.

Ви просите документи чи картку?

Ні. Email для реєстрації, оплата в USDC або USDT — без документів, без картки.

Коментарі

Поки немає коментарів. Будьте першим.

Залишити коментар

Коментарі проходять модерацію перед публікацією.