მოდი გულწრფელი ვიყოთ წინასწარ: თუ სწრაფი, იაფი, მაღალი-ხარისხის გენერაცია გინდათ, გამოიძახეთ API. CPU VPS ვერ სძლევს GPU-ებით სავსე დატაცენტრს, და ვინც სხვას გეუბნებათ, რაღაცას ყიდის.
მაშ, რატომ ვჰოსტინგოთ inference საერთოდ? ერთი მიზეზი, და ის კარგია: მოდელი თქვენს სერვერზე არასოდეს აგზავნის თქვენს prompt-ებს არსად.
როგორ გამოიყურება CPU inference რეალურად
შეგიძლიათ ნამდვილი მოდელების გაშვება CPU-ზე საკმარისი RAM-ით. 7–8B მოდელი quantized 4-bit-ზე მუშაობს. 13B მუშაობს. 30B-კლასის მოდელსაც კი უბიძგებთ, თუ მეხსიერება გაქვთ. რასაც ვერ აკეთებთ, არის მისი სწრაფად გახდომა — output მოდის რამდენიმე token-ში წამში, არა მყისიერ stream-ში, რომელსაც API გაძლევთ.
ეს არის გულწრფელი გაცვლა. ინტერაქტიული chat-ისთვის ის იმედგამაცრუებელია. ფონური სამუშაოსთვის — დოკუმენტების summarize ღამით, რიგის კლასიფიცირება, მონაცემების გამდიდრება გრაფიკზე — რამდენიმე token წამში სრულიად კარგია და არავინ უყურებს საათს.
RAM მათემატიკა
მოდელი უნდა ჯდებოდეს მეხსიერებაში, quantized თუ არა, პლუს overhead კონტექსტისა და runtime-ისთვის:
- 7–8B, 4-bit — დაახლოებით 6–8 GB. მუშაობს საშუალო ტარიფზე.
- 13B, 4-bit — დაახლოებით 10–16 GB.
- 30B-კლასი, quantized — 24–48 GB, quantization-ის მიხედვით.
- უფრო დიდი, ან უფრო მაღალი სიზუსტე — 64–80 GB-ში ხართ სწრაფად — და 80 GB-ის მიღმა არცერთი ერთი Pro box არ ჯდება, მაინც CPU-ნელი.
სწორედ ამიტომ ხდება „ლოკალური მოდელის გაშვება“ ჩუმად მაღალი-მეხსიერების საკითხი. მოდელი არის მეხსიერების კვალი. დაამატეთ RAG ინდექსი ან აგენტები იმავე box-ზე და რიცხვები იზრდება.
Ollama vs vLLM, მოკლედ
Ollama ადვილი კარია — install, ollama run, მზადაა. ის სწორი ხელსაწყოა პირადი ერთ-მომხმარებლიანი დაყენებისთვის, სადაც უბრალოდ გინდათ მოდელი ხელმისაწვდომი. vLLM აგებულია მომსახურების გამტარიანობისთვის: მეტი დაყენება, უკეთესი ერთდროული დატვირთვის ქვეშ, ღირს, როცა რეალურად ამუშავებთ მოცულობას. დაიწყეთ Ollama-ით; მიწვდით vLLM-ს, როცა ნამდვილ ტრაფიკს ემსახურებით.
სად იგებს პირადი-პირველ ჭეშმარიტად
თვით-ჰოსტინგ inference-ის შემთხვევა არ არის სიჩქარე ან ღირებულება — ის არის, რომ ზოგიერთ მონაცემს ვერ დატოვებს. იურიდიული დოკუმენტები. სამედიცინო ჩანაწერები. საკუთრებრივი კოდი. ყველაფერი, სადაც prompt-ის მესამე-მხარის API-ზე გაგზავნა გამორიცხულია პოლიტიკის ან ნდობის მიზეზებით. უფრო ნელი მოდელი, რომელიც მთლიანად თქვენს მანქანაზე მუშაობს, სჯობს სწრაფს, რომელიც log-ავს ყველაფერს, რასაც უგზავნით.
და თუ მონაცემი ასეთი მგრძნობიარეა, გადახდაც ალბათ პირადი უნდა იყოს. box-ის დაქირავება კრიპტოთი და no KYC-ით ინახავს მთელ ჯაჭვს — სერვერი, მოდელი, prompt-ები, ბილინგი — ვინმეს ვინაობის ჩანაწერებისგან შორს. ეს არის ნამდვილი შეთავაზება: არა „უფრო იაფი inference“, არამედ „inference, რომელსაც სხვა ვერავინ ხედავს“.
დასკვნა
სიჩქარისა და ხარისხისთვის გამოიყენეთ API — სირცხვილი არ არის. თვით-ჰოსტინგი, როცა კონფიდენციალურობა მოთხოვნაა და უფრო ნელი მისაღებია. ზომა განსაზღვრეთ მოდელისთვის პლუს მისი კონტექსტი პლუს ყველაფერი, რაც box-ს იზიარებს, და ნუ მოელოდებით GPU სიჩქარეს CPU-სგან.
როცა მოდელს ნამდვილი მეხსიერება სჭირდება, Pro ხაზი უშვებს 32-დან 80 GB-მდე გამოყოფილი IP-ითა და ღამის სარეზერვო ასლებით — საკმარისი სერიოზული quantized მოდელის შესანახად კონტექსტის ადგილით მის გარშემო.
კომენტარები
ჯერ არ არის კომენტარები. იყავით პირველი.