EQVPS

VPS პირადი მაღალი-მეხსიერების LLM inference-ისთვის

უფრო დიდ quantized მოდელებს სჭირდებათ ნამდვილი RAM, არა GPU, რომელიც არ გაქვთ. სად უშვებს მაღალი-მეხსიერების CPU box 30B-კლასის მოდელებს პირადად, რა არის რეალისტური და სად არა. $70/თვე-დან.

გვაქვს ცალკე გვერდი Ollama-სა და პატარა მოდელებისთვის — ეს არის $12 CPU box, რომელიც უშვებს 1B–8B-ს და embedding-ებს. ეს გვერდი მეორე ბოლოა: მოდელები საკმარისად დიდი, რომ RAM-მა, არა CPU-მ, გაგაჩეროთ.

ვიყოთ გულწრფელი წინასწარ, ისევე როგორც ყველგან: ჩვენი სერვერები CPU-only-ია, GPU-ს გარეშე. დიდი მოდელი აქ ნელა მუშაობს. თუ გინდათ სწრაფი ინტერაქტიული chat 30B მოდელზე, გჭირდებათ GPU ჰოსტი — განსხვავებული პროდუქტი, განსხვავებული პროვაიდერი. რას აკეთებს კარგად მაღალი-მეხსიერების CPU box — უშვებს დიდ quantized მოდელს პირადად სამუშაოსთვის, რომელიც chat ფანჯარა არ არის.

RAM მათემატიკა

მოდელი ზის მეხსიერებაში, quantized თუ არა, პლუს overhead კონტექსტისა და runtime-ისთვის:

სწორედ ამიტომ არის „უფრო დიდი ლოკალური მოდელის გაშვება“ რეალურად მაღალი-მეხსიერების საკითხი. მოდელი არის მეხსიერების კვალი. დაამატეთ RAG ინდექსი იმავე ჰოსტზე და რიცხვები იზრდება.

სად იგებს პირადი-პირველ ჭეშმარიტად

საქმე არ არის სიჩქარე და არ არის ღირებულება — არამედ ის, რომ ზოგიერთ მონაცემს ვერ დატოვებს. იურიდიული დოკუმენტები. სამედიცინო ჩანაწერები. საკუთრებრივი კოდი. ყველაფერი, სადაც prompt-ის მესამე-მხარის API-ზე გაგზავნა გამორიცხულია. უფრო ნელი მოდელი, რომელიც მთლიანად თქვენს მანქანაზე მუშაობს, სჯობს სწრაფს, რომელიც log-ავს ყველაფერს, რასაც უგზავნით. ჩვენ დავწერეთ სრული სურათი აქ.

და თუ მონაცემები ასეთი მგრძნობიარეა, გადახდაც ალბათ პირადი უნდა იყოს. box-ის დაქირავება კრიპტოთი და no KYC-ით ინახავს მთელ ჯაჭვს — სერვერი, მოდელი, prompt-ები, ბილინგი — ვინმეს ვინაობის ჩანაწერებისგან შორს. ეს არის შეთავაზება: არა უფრო იაფი inference, არამედ inference, რომელსაც სხვა ვერავინ ხედავს.

რა ავირჩიოთ

30B-კლასის მოდელისთვის კონტექსტის ადგილით, Pro-64 (64 GB) კომფორტული არჩევანია; უფრო მჭიდრო quantization ჯდება Pro-32-ში ან Pro-48-ში, უფრო დიდი მიდის Pro-80-ზე. ჩატვირთეთ მოდელი ჯერ, უყურეთ resident მეხსიერებას, ზომა განსაზღვრეთ იმით, რაც გაზომეთ. და დააყენეთ მოლოდინები: ეს პირადი batch inference-ია, არა სწრაფი chat ფანჯარა.

მზად ხართ განთავსებისთვის? გადაიხადეთ კრიპტოთი, KYC-ის გარეშე — ჩართული დაახლოებით წუთში.

განათავსეთ ახლა →

ხდკ

რით განსხვავდება ეს თქვენი Ollama use-case-ისგან?

Ollama გვერდი პატარა მოდელებზეა $12 CPU box-ზე — 1B–8B, embedding-ები, მსუბუქი სამუშაო. ეს მაღალი-მეხსიერების ბოლოა: 13B-დან 30B-კლასის quantized მოდელებამდე, რომლებსაც სჭირდებათ 24–48 GB ან მეტი უბრალოდ ჩასატვირთად. იგივე CPU-only რეალობა, გაცილებით დიდი მეხსიერების კვალი, განსხვავებული ტარიფი.

რამდენი RAM მოცემული მოდელისთვის?

მოდელი უნდა ჩაჯდეს მეხსიერებაში პლუს overhead. 13B 4-bit მოდელს სჭირდება ~10–16 GB; 30B-კლასის quantized უბიძგებს 24–48 GB-ს; წადით უფრო დიდ ან უფრო-მაღალ-სიზუსტეზე და 64–80 GB-ში ხართ — ამის მიღმა, ჩვენი არცერთი ერთი box არ ჯდება. დაამატეთ ადგილი კონტექსტისთვის ზემოდან.

იქნება ის სწრაფი?

არა — იყავით გულწრფელი საკუთარ თავთან აქ. CPU inference დიდ მოდელზე არის რამდენიმე token წამში, არა ინტერაქტიული stream. ის კარგია batch და ფონური სამუშაოსთვის (შეაჯამე ღამით, კლასიფიცირე რიგი). რეალურ-დროის chat-ისთვის დიდ მოდელზე გჭირდებათ GPU, რომელსაც არ ვთავაზობთ.

რატომ გავუშვა ეს აქ API-ის ნაცვლად?

კონფიდენციალურობა. თქვენი prompt-ები და შედეგები არასოდეს ეხება პროვაიდერის სერვერებს ან log-ებს. მგრძნობიარე მონაცემებისთვის — იურიდიული, სამედიცინო, შიდა კოდი — უფრო ნელი პირადი მოდელი სჯობს სწრაფს, რომელიც ყველაფერს ხედავს. დააწყვილეთ ის no-KYC კრიპტო გადახდასთან და მთელი ჯაჭვი თქვენი რჩება.

კომენტარები

ჯერ არ არის კომენტარები. იყავით პირველი.

დატოვეთ კომენტარი

კომენტარები მოდერირდება გამოჩენამდე.