Ollama прави пускането на локален модел инсталация от един ред. Това е ръководството; за честната картина какво може и какво не може CPU инференсът (и сладката точка на RAG) виж случая на употреба VPS за Ollama и self-host Ollama.
1. Инсталирай Ollama
curl -fsSL https://ollama.com/install.sh | sh
Това инсталира Ollama и я стартира като systemd услуга, слушаща на localhost:11434.
2. Изтегли и пусни малък модел
На CPU машина започни с малко:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
Моделите 3B са наистина използваеми на CPU; 7–8B работят при няколко токена/сек (окей за пакетна работа, мъчително за чат); 13B+ ще суапват и ще пълзят — недей.
3. Извикай HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
Embeddings са сладката точка на CPU:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. Дръж я на localhost — изложи безопасно при нужда
Ollama се свързва към 127.0.0.1:11434 по подразбиране. Остави я там. Ако трябва да я достигаш от друга машина, сложи отпред reverse proxy с автентикация на план със специален IP (ръководство nginx + HTTPS) или използвай SSH тунел — никога не излагай публично неавтентикиран endpoint на модел.
Честната част
Това са инстанции само с CPU (без GPU). Малките квантувани модели и embeddings работят добре; големите — не. Съчетай Ollama с векторна база данни за частен RAG стек — малки локални embeddings плюс локално векторно хранилище е настройката, която наистина блести тук. Medium ($12/мес, 6 GB) е удобният план. Root за около минута, без KYC, плащане в крипто.
Коментари
Още няма коментари. Бъди първият.