Ollama ლოკალური მოდელის გაშვებას ერთ-ხაზიან ინსტალაციად აქცევს. ეს არის how-to; გულახდილი სურათისთვის, თუ რას შეუძლია და რას არ შეუძლია CPU ინფერენსს (და RAG-ის ტკბილი წერტილი) იხ. VPS Ollama-სთვის გამოყენების ქეისი და Ollama-ს self-host.
1. დააინსტალე Ollama
curl -fsSL https://ollama.com/install.sh | sh
ეს აინსტალებს Ollama-ს და უშვებს მას როგორც systemd სერვისს, რომელიც უსმენს localhost:11434-ზე.
2. ჩამოწიე და გაუშვი პატარა მოდელი
CPU მანქანაზე პატარადან დაიწყე:
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
3B მოდელები მართლა გამოსადეგია CPU-ზე; 7–8B რამდენიმე ტოკენი/წამში მუშაობს (კარგია batch-ისთვის, მტკივნეული ჩატისთვის); 13B+ swap-ს გააკეთებს და დაცოცავს — ნუ გააკეთებ.
3. გამოიძახე HTTP API
curl http://localhost:11434/api/generate \
-d '{"model":"llama3.2:3b","prompt":"ping","stream":false}'
embeddings არის CPU-ს ტკბილი წერტილი:
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
4. დატოვე localhost-ზე — საჭიროებისას გამოამჟღავნე უსაფრთხოდ
Ollama ნაგულისხმევად უკავშირდება 127.0.0.1:11434-ს. დატოვე იქ. თუ სხვა მანქანიდან მისვლა გჭირდება, დააყენე autь-ის მქონე reverse proxy მის წინ გამოყოფილი-IP გეგმაზე (nginx + HTTPS გზამკვლევი) ან გამოიყენე SSH გვირაბი — არასდროს გამოამჟღავნო აუთენტიფიკაციის გარეშე მოდელის endpoint საჯაროდ.
გულახდილი ნაწილი
ესენი მხოლოდ-CPU ინსტანსებია (GPU არა). პატარა კვანტიზებული მოდელები და embeddings კარგად მუშაობს; დიდები არა. დააწყვილე Ollama პირადი RAG სტეკისთვის vector DB-სთან — პატარა ლოკალური embeddings პლუს ლოკალური vector store არის კონფიგურაცია, რომელიც აქ მართლა ბრწყინავს. Medium ($12/თვე, 6 GB) კომფორტული გეგმაა. root დაახლოებით ერთ წუთში, KYC-ის გარეშე, გადახდა კრიპტოთი.
კომენტარები
ჯერ არ არის კომენტარები. იყავით პირველი.