ყოველი prompt-ის სხვისი API-ზე გაგზავნა კარგია — სანამ არ არის. შესაძლოა მონაცემი მგრძნობიარეა და გირჩევნიათ, ის არასოდეს დატოვოს თქვენი სერვერი. შესაძლოა მოგბეზრდათ rate limit-ები, ან მოდელის ვერსია, რომელიც თქვენს ქვეშ იცვლება, ან per-token meter, რომელიც ტკტკებს, სანამ ექსპერიმენტებთ. რაღაც წერტილში „რა იქნება, თუ უბრალოდ ჩემსას გავუშვებ?“ წყვეტს აზრობრივ ექსპერიმენტად ყოფნას.
Ollama ამას ჭეშმარიტად ადვილს ხდის. უფრო რთული კითხვა არის რა ჯდება VPS-ზე — და აქ გულწრფელ პასუხს მეტი მნიშვნელობა აქვს, ვიდრე hype-ს.
რა შეგიძლიათ გაუშვათ რეალურად CPU-ზე
არ გაქვთ GPU? მაშინ CPU inference-ს აკეთებთ, და მოდელის ზომა ყველაფერია. Quantization (წონების 4-bit-მდე შეკუმშვა) ის არის, რაც ამას პრაქტიკულს ხდის — კარგავთ ხარისხის ნაწილს და ზოგავთ მეხსიერების გროვას.
უხეში რიცხვები, ის, რასაც მნიშვნელობა აქვს:
- 3B მოდელი, 4-bit — ~3 GB RAM. საკმარისად სწრაფი chat-ისა და მარტივი ამოცანებისთვის.
- 7B მოდელი, 4-bit — ~5 GB RAM. ტკბილი წერტილი: შესამჩნევად ჭკვიანი, მაინც მუშაობს წაკითხვად ტემპში.
- 13B და მეტი — 8-10 GB+ და ნელი CPU-ზე. ტექნიკურად შესაძლებელი, პრაქტიკულად გამაღიზიანებელი.
სიჩქარე, გულწრფელად: რამდენიმე vCPU-ზე ნახავთ რამდენიმე token-ს წამში. სრულყოფილად კარგი chatbot-ისთვის ან კოდირების ასისტენტისთვის, სადაც კითხულობთ, როგორც ის აკრიფავს. არა კარგი მილიონი დოკუმენტის batch-დამუშავებისთვის — ეს GPU სამუშაოა, და საწინააღმდეგოს არ ვამბობთ. ჩვენ GPU ინსტანსებს არ ვთავაზობთ. თუ თქვენს გეგმას სჭირდება 70B მოდელი ან მძიმე გამტარიანობა, CPU VPS — ჩვენი ან ვინმეს — არასწორი ხელსაწყოა, და უნდა იცოდეთ ეს, სანამ ერთ სენტს დახარჯავთ.
მაგრამ პირადი 7B, რომელიც თქვენს კითხვებს პასუხობს და არასოდეს რეკავს სახლში? ის კომფორტულად მუშაობს 6 GB box-ზე.
ინსტალაცია — სამი ბრძანება
გაუშვით სერვერი, შედით SSH-ით და:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
ეს არის — ტერმინალში ესაუბრებით. თქვენი საკუთარი კოდიდან გამოსაყენებლად, Ollama უკვე ემსახურება HTTP API-ს პორტ 11434-ზე:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
ერთი ხაფანგი ღირს წინასწარ ცოდნა: ნაგულისხმევად ის API მიბმულია localhost-ზე. შეინახეთ ის ასე და tunnel-ით გაატარეთ SSH-ით, თორემ ის გამოაშკარავებულია ინტერნეტზე. თუ გინდათ ის მიწვდომადი, დააყენეთ ის auth-ის უკან — ნუ დატოვებთ ღია მოდელის endpoint-ს საჯარო IP-ზე.
Box-ის არჩევა
შეუსაბამეთ ტარიფი მოდელს, არა პირიქით:
| რის გაშვება გინდათ | RAM, რომელიც გჭირდებათ | გონივრული ტარიფი |
|---|---|---|
| 3B მოდელი, მსუბუქი გამოყენება | ~3 GB | Small (4 GB) |
| 7B მოდელი, კომფორტულად | ~5-6 GB | Medium (6 GB) |
| უფრო დიდი / მაღალი გამტარიანობა | GPU ტერიტორია | არა CPU VPS |
უმეტესი თვით-ჰოსტერისთვის Medium (6 GB) გულწრფელი რეკომენდაციაა — საკმარისი სივრცე 7B მოდელისთვის პლუს თქვენი აპლიკაცია და OS. Small (4 GB) მუშაობს, თუ 3B-ს ჩერდებით. ამის ქვემოთ ყველაფერი ძალიან მჭიდროა, როგორც კი OS და კონტექსტი ჭამენ.
რატომ გავაკეთოთ ეს აქ
თუ LLM-ს თვით-ჰოსტინგებთ, კონფიდენციალურობა ჩვეულებრივ ნახევარი მიზეზია — ასე რომ უცნაური იქნებოდა თქვენი ID-ის გადაცემა box-ის დასაქირავებლად. არ გიწევთ: შეგიძლიათ გადაიხადოთ USDC-ით ან USDT-ით (ან ბარათით on-ramp-ით), no KYC, და სერვერი თქვენია დაახლოებით წუთში. Crypto-native, agent-friendly და მონაცემი რჩება მანქანაზე, რომელსაც აკონტროლებთ.
გაცვლა ის არის, რომელზეც გულწრფელი ვიყავით: მხოლოდ CPU, 6 GB ჭერი, პატარა მოდელები. ამის ფარგლებში, თვით-ჰოსტინგი შესანიშნავია. მის გარეთ, ნუ დაგაჯერებთ ვინმე CPU box-ს იმ სამუშაოსთვის, რომელსაც GPU სჭირდება.
მზად ხართ სცადოთ? აირჩიეთ ტარიფი, გადაიხადეთ და გექნებათ root დაახლოებით 60 წამში — შემდეგ ეს სამი ბრძანებაა თქვენს საკუთარ პირად მოდელამდე.
კომენტარები
ჯერ არ არის კომენტარები. იყავით პირველი.