RAG დემო laptop-ზე ორასი დოკუმენტით უძალო გრძნობს თავს. შემდეგ მიმართავთ ნამდვილ corpus-ზე — კომპანიის docs, წლების ტიკეტები, ნამდვილი ცოდნის ბაზა — და მთელი საქმე ხდება მეხსიერების პრობლემა. არა CPU პრობლემა. მეხსიერების.
აი ნაწილი, რომელსაც უმეტესი ჰოსტინგ გვერდი გამოტოვებს: სწრაფ retrieval-ს სჭირდება ინდექსი RAM-ში. ტექსტის ყოველი chunk ხდება embedding — vector რამდენიმე ასეულიდან ორ ათასამდე რიცხვის სიგანით — და ძებნა ნიშნავს თქვენი query-ის შედარებას ყველა მათგანთან, სწრაფად. დისკზე ის მუშაობს, მაგრამ ყოველი query იხდის შეყოვნების გადასახადს, და დაბალ-შეყოვნების retrieval იყო მიზეზი, რის გამოც თავიდან თვით-ჰოსტინგი აირჩიეთ.
ზომის მათემატიკა, გულწრფელად
გაზომეთ თქვენი საკუთარი corpus — dimension და ინდექსის ტიპი ამას ბევრს ცვლის — მაგრამ საწყისი შეგრძნებისთვის:
- რამდენიმე ასეული ათასი embedding — 2–4 GB. პირადი ცოდნის ბაზა. ამისთვის Pro არ გჭირდებათ; უფრო პატარა ტარიფი კარგია.
- დაბალი მილიონები — აპლიკაციით, მოდელის client-ითა და OS-ით მის გარშემო, დაგეგმეთ 16–32 GB. სერიოზული კომპანიის ცოდნის ბაზა. სწორედ აქ იწყებს Pro-32 ან Pro-48 აზრის მიღებას.
- ათეული მილიონი, ან მაღალ-dimension vector-ები — 48 GB და მეტი, და ~80 GB-ის მიღმა ინდექსს სერვერებზე ყოფთ. დიდი დოკუმენტთა მასივები, multi-tenant retrieval, რამდენიმე ინდექსი ერთდროულად თბილი.
ჩვენ დავწერეთ სრული RAM მრუდი აქ, თუ დეტალები გინდათ.
რატომ მაღალი-მეხსიერება და no-KYC ერთად
48 GB RAM-ის დაქირავება ადვილია. მისი დაქირავება კრიპტოთი და ვინაობის შემოწმების გარეშე — არა. უმეტესი ჰოსტი, რომელიც სერიოზულ მეხსიერებას იაფად ყიდის, ამას აკეთებს ბარათისა და KYC ფორმის უკან. თქვენი embedding-ები აბსტრაქტული რიცხვები არ არის; ისინი კოდირებენ ტექსტს, საიდანაც მოვიდნენ. თქვენი docs, თქვენი კლიენტების კონტენტი, vector-ებად ქცეული. თუ ის მონაცემი საკმარისად მგრძნობიარეა, რომ პირადად იხდით, managed vector cloud აუქმებს მთელ აზრს — და ისეც ჰოსტი, რომელიც სერვერს თქვენს ვინაობაზე აბამს.
ის კომბინაცია — მაღალი მეხსიერება, გამოყოფილი IP, კრიპტო, no KYC, ღამის სარეზერვო ასლები — არის ის, რისთვისაც Pro ხაზია. ის არ არის ყველაზე იაფი გიგაბაიტზე, და თუ კონფიდენციალურობა არ გჭირდებათ, RAM-ს იაფად სხვაგან იპოვით. მაგრამ თუ ინდექსი არის თქვენი პროდუქტი და მას ვერ დატოვებს, ეს ის ფორმაა, რომელიც ჯდება.
საიდან დაიწყოთ
აირჩიეთ ტარიფი ინდექსისა და ყველაფრის ადგილით მის გარშემო — აპლიკაცია, მოდელის client, ზრდის ადგილი. უმეტესი ნამდვილი corpus-ისთვის ეს არის Pro-48 (48 GB); დიდი მიდის Pro-64-ზე ან Pro-80-ზე. ჩატვირთეთ ნიმუში ჯერ, უყურეთ მეხსიერებას, ზომა განსაზღვრეთ იმ რიცხვიდან, რომელიც გაზომეთ — არა იმ, რომლისაც გეშინოდათ.
თუ თქვენი retrieval უფრო დიდი აგენტის სისტემის ნაწილია, იგივე box ხშირად აგენტების ფლოტსაც ინახავს — ასე ხდება 48 GB ტარიფი ჩუმად 64 GB.
კომენტარები
ჯერ არ არის კომენტარები. იყავით პირველი.