მოდი გავათავისუფლოთ იმედგამაცრუებელი ნაწილი, რადგან ინტერნეტი სავსეა გვერდებით, რომლებიც არ აკეთებენ ამას.
ჩვენი სერვერები CPU-only-ია. ჩვენ GPU-ებს არ ვთავაზობთ. ეს ნიშნავს, რომ ლოკალურ LLM სამუშაოს აქ აქვს მკაცრი ჭერი, და საწინააღმდეგოს მოჩვენება უბრალოდ თქვენს ფულს დახარჯავს.
რა მუშაობს რეალურად CPU-ზე
6 vCPU-მდე და 6 GB RAM-ით (ჩვენი Medium ტარიფი — $12/თვე), პატარა quantized მოდელების დიაპაზონში ხართ:
- 1B–3B მოდელები (Q4): ჭეშმარიტად გამოსაყენებელი. საკმარისად სწრაფი კლასიფიკაციის, tagging-ის, routing-ისა და მარტივი სტრუქტურული ამოღებისთვის.
- 7B–8B მოდელები (Q4): მუშაობს, მაგრამ მოელოდეთ რამდენიმე token-ს წამში. კარგია რიგისთვის, რომელიც ღამით ღეჭავს დოკუმენტებს. მტკივნეული chat ფანჯრად.
- Embedding მოდელები: შესანიშნავი შესატყვისი. ისინი პატარაა, სწრაფი CPU-ზე, და ეს ალბათ ერთადერთი საუკეთესო მიზეზია Ollama-ს გასაშვებად ჩვენს მსგავს box-ზე.
- 13B და მეტი: ნუ. swap-ს გააკეთებთ და დაელოდებით.
თუ გჭირდებათ სწრაფი, ინტერაქტიული 70B chat, გჭირდებათ GPU ჰოსტი — ეს განსხვავებული პროდუქტია განსხვავებული პროვაიდერისგან, და გირჩევნიათ ამის თქმა, ვიდრე თქვენი $12-ის აღება.
სად იგებს CPU box ჭეშმარიტად
კონფიდენციალურობა. თქვენი დოკუმენტები, თქვენი prompt-ები, თქვენი embedding-ები — არასოდეს ტოვებენ მანქანას, რომელსაც აკონტროლებთ, არასოდეს ხდებიან ვინმეს სასწავლო მონაცემები. ბევრი ადამიანისთვის ეს მთელი აზრია, და რამდენიმე token წამში მისაღები გაცვლაა.
ღირებულების პროგნოზირებადობა. არავითარი per-token ანგარიში. pipeline, რომელიც ორმოცდაათი ათას ჩანაწერს კლასიფიცირებს, იმდენივე ჯდება, რამდენიც ორმოცდაათს: $12.
Async სამუშაო. უმეტესი სასარგებლო LLM სამუშაო არ არის chat ფანჯარა. ეს რიგია: შეაჯამე ესენი, tag გაუკეთე იმათ, embed გააკეთე ამ corpus-ს. CPU box, რომელიც ღამით backlog-ს ღეჭავს, სრულყოფილად კარგია ამაში.
დაყენება
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama ემსახურება HTTP API-ს localhost:11434-ზე. შეინახეთ ის იქ. თუ გჭირდებათ მისი მიწვდომა სხვაგნიდან, დააყენეთ ის reverse proxy-ის უკან ავთენტიფიკაციით dedicated-IP ტარიფზე — არასოდეს გამოაშკარაოთ არა-ავთენტიფიცირებული მოდელის endpoint ღია ინტერნეტზე.
დააწყვილეთ ის vector მონაცემთა ბაზასთან (Qdrant ან pgvector Docker-ში) და გაქვთ სრული პირადი RAG stack ერთ $12 box-ზე. ის კომბინაცია — პატარა ლოკალური embedding-ები, ლოკალური vector store, გარე API მხოლოდ მძიმე გენერაციის ნაბიჯისთვის — არის დაყენება, რომელსაც რეალურად აქვს აზრი ამ მსგავს აპარატურაზე.
ტარიფის არჩევა
| გამოყენება | ტარიფი | ფასი |
|---|---|---|
| Embedding-ები, 1–3B მოდელები, RAG pipeline | Medium | $12/თვე |
| იგივე, პლუს საჯარო endpoint auth-ის უკან | Medium-IP | $20/თვე |
| უბრალოდ პატარა მოდელების ტესტირება | Small | $8/თვე |
CPU-only, 6 vCPU-მდე და 6 GB RAM. NVMe საცავი, გაუზომავი ტრაფიკი, გერმანია ან ფინეთი. კრიპტო გადახდა, no KYC. წლიური ბილინგი არის ერთი გადარიცხვა თორმეტის ნაცვლად.
დაკავშირებული საკითხავი
- განათავსეთ vector DB AI მეხსიერებისთვის — პირადი RAG stack-ის მეორე ნახევარი
- VPS AI აგენტებისთვის — ორკესტრაცია იმავე box-ზე
მზად ხართ? განათავსეთ სერვერი → — ცოცხალი დაახლოებით წუთში, გადახდილი კრიპტოთი, ID საჭირო არ არის.
კომენტარები
ჯერ არ არის კომენტარები. იყავით პირველი.