გვაქვს ცალკე გვერდი Ollama-სა და პატარა მოდელებისთვის — ეს არის $12 CPU box, რომელიც უშვებს 1B–8B-ს და embedding-ებს. ეს გვერდი მეორე ბოლოა: მოდელები საკმარისად დიდი, რომ RAM-მა, არა CPU-მ, გაგაჩეროთ.
ვიყოთ გულწრფელი წინასწარ, ისევე როგორც ყველგან: ჩვენი სერვერები CPU-only-ია, GPU-ს გარეშე. დიდი მოდელი აქ ნელა მუშაობს. თუ გინდათ სწრაფი ინტერაქტიული chat 30B მოდელზე, გჭირდებათ GPU ჰოსტი — განსხვავებული პროდუქტი, განსხვავებული პროვაიდერი. რას აკეთებს კარგად მაღალი-მეხსიერების CPU box — უშვებს დიდ quantized მოდელს პირადად სამუშაოსთვის, რომელიც chat ფანჯარა არ არის.
RAM მათემატიკა
მოდელი ზის მეხსიერებაში, quantized თუ არა, პლუს overhead კონტექსტისა და runtime-ისთვის:
- 13B, 4-bit — დაახლოებით 10–16 GB. უკვე მუშაობს საშუალო ტარიფზე.
- 30B-კლასი, quantized — 24–48 GB quantization-ის მიხედვით. ეს Pro-32-დან Pro-64-მდე ტერიტორიაა.
- უფრო დიდი ან უფრო მაღალი სიზუსტე — 64–80 GB, და 80 GB-ის მიღმა ჩვენი არცერთი ერთი box არ ჯდება. Pro-80 არის ჭერი აქ.
სწორედ ამიტომ არის „უფრო დიდი ლოკალური მოდელის გაშვება“ რეალურად მაღალი-მეხსიერების საკითხი. მოდელი არის მეხსიერების კვალი. დაამატეთ RAG ინდექსი იმავე ჰოსტზე და რიცხვები იზრდება.
სად იგებს პირადი-პირველ ჭეშმარიტად
საქმე არ არის სიჩქარე და არ არის ღირებულება — არამედ ის, რომ ზოგიერთ მონაცემს ვერ დატოვებს. იურიდიული დოკუმენტები. სამედიცინო ჩანაწერები. საკუთრებრივი კოდი. ყველაფერი, სადაც prompt-ის მესამე-მხარის API-ზე გაგზავნა გამორიცხულია. უფრო ნელი მოდელი, რომელიც მთლიანად თქვენს მანქანაზე მუშაობს, სჯობს სწრაფს, რომელიც log-ავს ყველაფერს, რასაც უგზავნით. ჩვენ დავწერეთ სრული სურათი აქ.
და თუ მონაცემები ასეთი მგრძნობიარეა, გადახდაც ალბათ პირადი უნდა იყოს. box-ის დაქირავება კრიპტოთი და no KYC-ით ინახავს მთელ ჯაჭვს — სერვერი, მოდელი, prompt-ები, ბილინგი — ვინმეს ვინაობის ჩანაწერებისგან შორს. ეს არის შეთავაზება: არა უფრო იაფი inference, არამედ inference, რომელსაც სხვა ვერავინ ხედავს.
რა ავირჩიოთ
30B-კლასის მოდელისთვის კონტექსტის ადგილით, Pro-64 (64 GB) კომფორტული არჩევანია; უფრო მჭიდრო quantization ჯდება Pro-32-ში ან Pro-48-ში, უფრო დიდი მიდის Pro-80-ზე. ჩატვირთეთ მოდელი ჯერ, უყურეთ resident მეხსიერებას, ზომა განსაზღვრეთ იმით, რაც გაზომეთ. და დააყენეთ მოლოდინები: ეს პირადი batch inference-ია, არა სწრაფი chat ფანჯარა.
კომენტარები
ჯერ არ არის კომენტარები. იყავით პირველი.