EQVPS

ლოკალური LLM inference-ის პირადად ჰოსტინგი: რა შეუძლია და რა არ შეუძლია CPU VPS-ს

Aug 9, 2026 · 2 წთ კითხვა · EQVPS Team

მოდი გულწრფელი ვიყოთ წინასწარ: თუ სწრაფი, იაფი, მაღალი-ხარისხის გენერაცია გინდათ, გამოიძახეთ API. CPU VPS ვერ სძლევს GPU-ებით სავსე დატაცენტრს, და ვინც სხვას გეუბნებათ, რაღაცას ყიდის.

მაშ, რატომ ვჰოსტინგოთ inference საერთოდ? ერთი მიზეზი, და ის კარგია: მოდელი თქვენს სერვერზე არასოდეს აგზავნის თქვენს prompt-ებს არსად.

როგორ გამოიყურება CPU inference რეალურად

შეგიძლიათ ნამდვილი მოდელების გაშვება CPU-ზე საკმარისი RAM-ით. 7–8B მოდელი quantized 4-bit-ზე მუშაობს. 13B მუშაობს. 30B-კლასის მოდელსაც კი უბიძგებთ, თუ მეხსიერება გაქვთ. რასაც ვერ აკეთებთ, არის მისი სწრაფად გახდომა — output მოდის რამდენიმე token-ში წამში, არა მყისიერ stream-ში, რომელსაც API გაძლევთ.

ეს არის გულწრფელი გაცვლა. ინტერაქტიული chat-ისთვის ის იმედგამაცრუებელია. ფონური სამუშაოსთვის — დოკუმენტების summarize ღამით, რიგის კლასიფიცირება, მონაცემების გამდიდრება გრაფიკზე — რამდენიმე token წამში სრულიად კარგია და არავინ უყურებს საათს.

RAM მათემატიკა

მოდელი უნდა ჯდებოდეს მეხსიერებაში, quantized თუ არა, პლუს overhead კონტექსტისა და runtime-ისთვის:

სწორედ ამიტომ ხდება „ლოკალური მოდელის გაშვება“ ჩუმად მაღალი-მეხსიერების საკითხი. მოდელი არის მეხსიერების კვალი. დაამატეთ RAG ინდექსი ან აგენტები იმავე box-ზე და რიცხვები იზრდება.

Ollama vs vLLM, მოკლედ

Ollama ადვილი კარია — install, ollama run, მზადაა. ის სწორი ხელსაწყოა პირადი ერთ-მომხმარებლიანი დაყენებისთვის, სადაც უბრალოდ გინდათ მოდელი ხელმისაწვდომი. vLLM აგებულია მომსახურების გამტარიანობისთვის: მეტი დაყენება, უკეთესი ერთდროული დატვირთვის ქვეშ, ღირს, როცა რეალურად ამუშავებთ მოცულობას. დაიწყეთ Ollama-ით; მიწვდით vLLM-ს, როცა ნამდვილ ტრაფიკს ემსახურებით.

სად იგებს პირადი-პირველ ჭეშმარიტად

თვით-ჰოსტინგ inference-ის შემთხვევა არ არის სიჩქარე ან ღირებულება — ის არის, რომ ზოგიერთ მონაცემს ვერ დატოვებს. იურიდიული დოკუმენტები. სამედიცინო ჩანაწერები. საკუთრებრივი კოდი. ყველაფერი, სადაც prompt-ის მესამე-მხარის API-ზე გაგზავნა გამორიცხულია პოლიტიკის ან ნდობის მიზეზებით. უფრო ნელი მოდელი, რომელიც მთლიანად თქვენს მანქანაზე მუშაობს, სჯობს სწრაფს, რომელიც log-ავს ყველაფერს, რასაც უგზავნით.

და თუ მონაცემი ასეთი მგრძნობიარეა, გადახდაც ალბათ პირადი უნდა იყოს. box-ის დაქირავება კრიპტოთი და no KYC-ით ინახავს მთელ ჯაჭვს — სერვერი, მოდელი, prompt-ები, ბილინგი — ვინმეს ვინაობის ჩანაწერებისგან შორს. ეს არის ნამდვილი შეთავაზება: არა „უფრო იაფი inference“, არამედ „inference, რომელსაც სხვა ვერავინ ხედავს“.

დასკვნა

სიჩქარისა და ხარისხისთვის გამოიყენეთ API — სირცხვილი არ არის. თვით-ჰოსტინგი, როცა კონფიდენციალურობა მოთხოვნაა და უფრო ნელი მისაღებია. ზომა განსაზღვრეთ მოდელისთვის პლუს მისი კონტექსტი პლუს ყველაფერი, რაც box-ს იზიარებს, და ნუ მოელოდებით GPU სიჩქარეს CPU-სგან.

როცა მოდელს ნამდვილი მეხსიერება სჭირდება, Pro ხაზი უშვებს 32-დან 80 GB-მდე გამოყოფილი IP-ითა და ღამის სარეზერვო ასლებით — საკმარისი სერიოზული quantized მოდელის შესანახად კონტექსტის ადგილით მის გარშემო.

ხდკ

შემიძლია LLM-ის გაშვება GPU-ის გარეშე?

პატარა quantized მოდელები — კი, და ნელა. 7–8B მოდელი quantized 4-bit-ზე მუშაობს CPU-ზე საკმარისი RAM-ით, მაგრამ output-ს გაზომავთ რამდენიმე token-ში წამში, არა სწრაფ stream-ში, რომელსაც API-სგან იღებთ. კარგია batch job-ებისა და ფონური ამოცანებისთვის, მტკივნეული ინტერაქტიული chat-ისთვის.

რამდენი RAM ლოკალური inference-ისთვის?

მოდელი უნდა ჩაჯდეს მეხსიერებაში პლუს overhead. 7–8B 4-bit მოდელს სჭირდება ~6–8 GB; 13B დაახლოებით 10–16 GB; 30B-კლასის მოდელები უბიძგებენ 24–48 GB-ს quantized. დაამატეთ ადგილი კონტექსტისა და ყველაფრისთვის box-ზე. სწორედ ამიტომ ხვდება ლოკალური inference მაღალი-მეხსიერების ტერიტორიაზე სწრაფად.

Ollama თუ vLLM?

Ollama ადვილი შესასვლელია — ერთი ბრძანება, მოდელი გადმოწეული, გაშვებული. vLLM არის გამტარიანობისა და მომსახურებისთვის, მეტი დაყენება, უკეთესი დატვირთვის ქვეშ. პირადი ერთ-მომხმარებლიანი box-ისთვის Ollama ჩვეულებრივ სწორი არჩევანია; vLLM, როცა რეალურად ემსახურებით მოთხოვნებს მოცულობით.

რატომ ვჰოსტინგო inference საერთოდ, თუ ის უფრო ნელია?

კონფიდენციალურობა. თქვენი prompt-ები და output-ები არასოდეს ეხება პროვაიდერის სერვერებს ან log-ებს. მგრძნობიარე მონაცემებისთვის — იურიდიული, სამედიცინო, შიდა კოდი, ყველაფერი, რასაც მესამე მხარეს ვერ გაუგზავნით — უფრო ნელი პირადი მოდელი სჯობს სწრაფს, რომელიც ყველაფერს ხედავს. დააწყვილეთ ის no-KYC კრიპტო გადახდასთან და მთელი ჯაჭვი თქვენი რჩება.

← ბლოგზე დაბრუნებატარიფებისა და ფასების ნახვა →

კომენტარები

ჯერ არ არის კომენტარები. იყავით პირველი.

დატოვეთ კომენტარი

კომენტარები მოდერირდება გამოჩენამდე.