EQVPS

ლოკალური LLM-ის თვით-ჰოსტინგი VPS-ზე Ollama-ით — რა მუშაობს რეალურად

Jun 14, 2026 · 3 წთ კითხვა · EQVPS Team

ყოველი prompt-ის სხვისი API-ზე გაგზავნა კარგია — სანამ არ არის. შესაძლოა მონაცემი მგრძნობიარეა და გირჩევნიათ, ის არასოდეს დატოვოს თქვენი სერვერი. შესაძლოა მოგბეზრდათ rate limit-ები, ან მოდელის ვერსია, რომელიც თქვენს ქვეშ იცვლება, ან per-token meter, რომელიც ტკტკებს, სანამ ექსპერიმენტებთ. რაღაც წერტილში „რა იქნება, თუ უბრალოდ ჩემსას გავუშვებ?“ წყვეტს აზრობრივ ექსპერიმენტად ყოფნას.

Ollama ამას ჭეშმარიტად ადვილს ხდის. უფრო რთული კითხვა არის რა ჯდება VPS-ზე — და აქ გულწრფელ პასუხს მეტი მნიშვნელობა აქვს, ვიდრე hype-ს.

რა შეგიძლიათ გაუშვათ რეალურად CPU-ზე

არ გაქვთ GPU? მაშინ CPU inference-ს აკეთებთ, და მოდელის ზომა ყველაფერია. Quantization (წონების 4-bit-მდე შეკუმშვა) ის არის, რაც ამას პრაქტიკულს ხდის — კარგავთ ხარისხის ნაწილს და ზოგავთ მეხსიერების გროვას.

უხეში რიცხვები, ის, რასაც მნიშვნელობა აქვს:

სიჩქარე, გულწრფელად: რამდენიმე vCPU-ზე ნახავთ რამდენიმე token-ს წამში. სრულყოფილად კარგი chatbot-ისთვის ან კოდირების ასისტენტისთვის, სადაც კითხულობთ, როგორც ის აკრიფავს. არა კარგი მილიონი დოკუმენტის batch-დამუშავებისთვის — ეს GPU სამუშაოა, და საწინააღმდეგოს არ ვამბობთ. ჩვენ GPU ინსტანსებს არ ვთავაზობთ. თუ თქვენს გეგმას სჭირდება 70B მოდელი ან მძიმე გამტარიანობა, CPU VPS — ჩვენი ან ვინმეს — არასწორი ხელსაწყოა, და უნდა იცოდეთ ეს, სანამ ერთ სენტს დახარჯავთ.

მაგრამ პირადი 7B, რომელიც თქვენს კითხვებს პასუხობს და არასოდეს რეკავს სახლში? ის კომფორტულად მუშაობს 6 GB box-ზე.

ინსტალაცია — სამი ბრძანება

გაუშვით სერვერი, შედით SSH-ით და:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

ეს არის — ტერმინალში ესაუბრებით. თქვენი საკუთარი კოდიდან გამოსაყენებლად, Ollama უკვე ემსახურება HTTP API-ს პორტ 11434-ზე:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

ერთი ხაფანგი ღირს წინასწარ ცოდნა: ნაგულისხმევად ის API მიბმულია localhost-ზე. შეინახეთ ის ასე და tunnel-ით გაატარეთ SSH-ით, თორემ ის გამოაშკარავებულია ინტერნეტზე. თუ გინდათ ის მიწვდომადი, დააყენეთ ის auth-ის უკან — ნუ დატოვებთ ღია მოდელის endpoint-ს საჯარო IP-ზე.

Box-ის არჩევა

შეუსაბამეთ ტარიფი მოდელს, არა პირიქით:

რის გაშვება გინდათRAM, რომელიც გჭირდებათგონივრული ტარიფი
3B მოდელი, მსუბუქი გამოყენება~3 GBSmall (4 GB)
7B მოდელი, კომფორტულად~5-6 GBMedium (6 GB)
უფრო დიდი / მაღალი გამტარიანობაGPU ტერიტორიაარა CPU VPS

უმეტესი თვით-ჰოსტერისთვის Medium (6 GB) გულწრფელი რეკომენდაციაა — საკმარისი სივრცე 7B მოდელისთვის პლუს თქვენი აპლიკაცია და OS. Small (4 GB) მუშაობს, თუ 3B-ს ჩერდებით. ამის ქვემოთ ყველაფერი ძალიან მჭიდროა, როგორც კი OS და კონტექსტი ჭამენ.

რატომ გავაკეთოთ ეს აქ

თუ LLM-ს თვით-ჰოსტინგებთ, კონფიდენციალურობა ჩვეულებრივ ნახევარი მიზეზია — ასე რომ უცნაური იქნებოდა თქვენი ID-ის გადაცემა box-ის დასაქირავებლად. არ გიწევთ: შეგიძლიათ გადაიხადოთ USDC-ით ან USDT-ით (ან ბარათით on-ramp-ით), no KYC, და სერვერი თქვენია დაახლოებით წუთში. Crypto-native, agent-friendly და მონაცემი რჩება მანქანაზე, რომელსაც აკონტროლებთ.

გაცვლა ის არის, რომელზეც გულწრფელი ვიყავით: მხოლოდ CPU, 6 GB ჭერი, პატარა მოდელები. ამის ფარგლებში, თვით-ჰოსტინგი შესანიშნავია. მის გარეთ, ნუ დაგაჯერებთ ვინმე CPU box-ს იმ სამუშაოსთვის, რომელსაც GPU სჭირდება.

მზად ხართ სცადოთ? აირჩიეთ ტარიფი, გადაიხადეთ და გექნებათ root დაახლოებით 60 წამში — შემდეგ ეს სამი ბრძანებაა თქვენს საკუთარ პირად მოდელამდე.

ხდკ

შემიძლია LLM-ის გაშვება GPU-ის გარეშე?

დიახ, პატარა მოდელებისთვის. 3B ან 7B მოდელი 4-bit quantization-ში მუშაობს CPU-ზე და პასუხობს წაკითხვად ტემპში — კარგია chatbot-ისთვის, კოდირების დამხმარისთვის ან ფონური ამოცანებისთვის, სადაც კურსორს არ უყურებთ. რასაც ვერ აკეთებთ CPU-ზე, არის დიდი მოდელის (13B და მეტი) მომსახურება ან მაღალი გამტარიანობის უბიძგება; სწორედ იქ წყვეტს GPU არასავალდებულო ყოფნას.

რამდენი RAM მჭირდება Llama 7B-სთვის?

დაახლოებით 5 GB 4-bit 7B მოდელისთვის, როგორც კი კონტექსტის ფანჯარასა და OS-ს დაამატებთ — ასე რომ 6 GB box კომფორტული ფსკერია. 3B მოდელი ჯდება დაახლოებით 3 GB-ში. უფრო პატარა quant (Q4) ცვლის ცოტა ხარისხს ბევრად ნაკლებ მეხსიერებაში, რაც სწორი გაცვლაა VPS-ზე.

უფრო იაფია LLM-ის თვით-ჰოსტინგი, ვიდრე API?

დამოკიდებულია მოცულობაზე. ჰოსტინგ API ახდევინებს per token და არაფერი ჯდება უმოქმედოდ; VPS ფიქსირებული თვიური ანგარიშია, იყენებთ თუ არა. თუ მოთხოვნების მდგრად ნაკადს უშვებთ, ან ძირითადად კონფიდენციალურობა და rate limit-ების გარეშე გაინტერესებთ, თვით-ჰოსტინგი იმარჯვებს. შემთხვევითი ერთჯერადი prompt-ებისთვის გაზომილი API უფრო იაფია.

რატომ ვჰოსტინგო თავად cloud API-ის გამოყენების ნაცვლად?

სამი მიზეზი, რის გამოც ხალხი რეალურად აკეთებს ამას: მონაცემი არასოდეს ტოვებს თქვენს სერვერს (ნამდვილი იურიდიული, სამედიცინო ან უბრალოდ პირადი შენიშვნებისთვის), არ არის rate limit-ები ან per-token meter, და მოდელი არ შეიცვლება ან არ ამოირთვება თქვენს ქვეშ. ღირებულება ის არის, რომ თქვენ მართავთ box-ს და ცხოვრობთ მისი აპარატურის ფარგლებში.

რა არის ყველაზე დიდი მოდელი, რომლის გაშვებაც რეალურად შემიძლია CPU VPS-ზე?

7B მოდელი 4-bit-ში ტკბილი წერტილია 6 GB box-ზე. ტექნიკურად შეგიძლიათ 13B-ის ჩატვირთვა საკმარისი RAM-ით, მაგრამ CPU-ზე ის საკმარისად ნელი ხდება, რომ იგრძნობთ. ამის მიღმა GPU გინდათ, რაც განსხვავებული ტიპის ჰოსტია.

← ბლოგზე დაბრუნებატარიფებისა და ფასების ნახვა →

კომენტარები

ჯერ არ არის კომენტარები. იყავით პირველი.

დატოვეთ კომენტარი

კომენტარები მოდერირდება გამოჩენამდე.