EQVPS

VPS Ollama-სა და ლოკალური LLM-ებისთვის

თვით-ჰოსტინგი პატარა ენობრივი მოდელები CPU სერვერზე — პირადი, გაუზომავი, გადახდილი კრიპტოთი. გულწრფელი იმაზე, რა შეუძლია და რა არ შეუძლია CPU inference-ს. $12/თვე-დან.

მოდი გავათავისუფლოთ იმედგამაცრუებელი ნაწილი, რადგან ინტერნეტი სავსეა გვერდებით, რომლებიც არ აკეთებენ ამას.

ჩვენი სერვერები CPU-only-ია. ჩვენ GPU-ებს არ ვთავაზობთ. ეს ნიშნავს, რომ ლოკალურ LLM სამუშაოს აქ აქვს მკაცრი ჭერი, და საწინააღმდეგოს მოჩვენება უბრალოდ თქვენს ფულს დახარჯავს.

რა მუშაობს რეალურად CPU-ზე

6 vCPU-მდე და 6 GB RAM-ით (ჩვენი Medium ტარიფი — $12/თვე), პატარა quantized მოდელების დიაპაზონში ხართ:

თუ გჭირდებათ სწრაფი, ინტერაქტიული 70B chat, გჭირდებათ GPU ჰოსტი — ეს განსხვავებული პროდუქტია განსხვავებული პროვაიდერისგან, და გირჩევნიათ ამის თქმა, ვიდრე თქვენი $12-ის აღება.

სად იგებს CPU box ჭეშმარიტად

კონფიდენციალურობა. თქვენი დოკუმენტები, თქვენი prompt-ები, თქვენი embedding-ები — არასოდეს ტოვებენ მანქანას, რომელსაც აკონტროლებთ, არასოდეს ხდებიან ვინმეს სასწავლო მონაცემები. ბევრი ადამიანისთვის ეს მთელი აზრია, და რამდენიმე token წამში მისაღები გაცვლაა.

ღირებულების პროგნოზირებადობა. არავითარი per-token ანგარიში. pipeline, რომელიც ორმოცდაათი ათას ჩანაწერს კლასიფიცირებს, იმდენივე ჯდება, რამდენიც ორმოცდაათს: $12.

Async სამუშაო. უმეტესი სასარგებლო LLM სამუშაო არ არის chat ფანჯარა. ეს რიგია: შეაჯამე ესენი, tag გაუკეთე იმათ, embed გააკეთე ამ corpus-ს. CPU box, რომელიც ღამით backlog-ს ღეჭავს, სრულყოფილად კარგია ამაში.

დაყენება

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama ემსახურება HTTP API-ს localhost:11434-ზე. შეინახეთ ის იქ. თუ გჭირდებათ მისი მიწვდომა სხვაგნიდან, დააყენეთ ის reverse proxy-ის უკან ავთენტიფიკაციით dedicated-IP ტარიფზე — არასოდეს გამოაშკარაოთ არა-ავთენტიფიცირებული მოდელის endpoint ღია ინტერნეტზე.

დააწყვილეთ ის vector მონაცემთა ბაზასთან (Qdrant ან pgvector Docker-ში) და გაქვთ სრული პირადი RAG stack ერთ $12 box-ზე. ის კომბინაცია — პატარა ლოკალური embedding-ები, ლოკალური vector store, გარე API მხოლოდ მძიმე გენერაციის ნაბიჯისთვის — არის დაყენება, რომელსაც რეალურად აქვს აზრი ამ მსგავს აპარატურაზე.

ტარიფის არჩევა

გამოყენებატარიფიფასი
Embedding-ები, 1–3B მოდელები, RAG pipelineMedium$12/თვე
იგივე, პლუს საჯარო endpoint auth-ის უკანMedium-IP$20/თვე
უბრალოდ პატარა მოდელების ტესტირებაSmall$8/თვე

CPU-only, 6 vCPU-მდე და 6 GB RAM. NVMe საცავი, გაუზომავი ტრაფიკი, გერმანია ან ფინეთი. კრიპტო გადახდა, no KYC. წლიური ბილინგი არის ერთი გადარიცხვა თორმეტის ნაცვლად.

დაკავშირებული საკითხავი


მზად ხართ? განათავსეთ სერვერი → — ცოცხალი დაახლოებით წუთში, გადახდილი კრიპტოთი, ID საჭირო არ არის.

მზად ხართ განთავსებისთვის? გადაიხადეთ კრიპტოთი, KYC-ის გარეშე — ჩართული დაახლოებით წუთში.

განათავსეთ ახლა →

ხდკ

შემიძლია Llama 70B-ის გაშვება ამაზე?

არა. ჩვენი ტარიფები CPU-only-ია 6 GB RAM-მდე — ეს არის პატარა quantized მოდელების დიაპაზონი (დაახლოებით 1B–8B 4-bit-ზე). 70B მოდელს სჭირდება GPU და გაცილებით მეტი მეხსიერება. ჩვენ GPU-ებს არ ვთავაზობთ, და გირჩევნიათ ამის თქმა, ვიდრე იმედგაცრუებას გაგყიდით.

რამდენად სწრაფია CPU inference სინამდვილეში?

მოელოდეთ რამდენიმე token-ს წამში 7–8B მოდელზე 4-bit quantization-ით, და შესამჩნევად უკეთესი 1–3B მოდელებზე. ეს კარგია ფონური სამუშაოებისთვის, embedding-ებისთვის, კლასიფიკაციისა და async pipeline-ებისთვის. ეს არ არის კარგი სწრაფი ინტერაქტიული chat-ისთვის.

მაშ, რისთვისაა ეს რეალურად კარგი?

პირადი embedding-ები, კლასიფიკაცია, summarization რიგები, RAG pipeline-ები, სადაც შეყოვნებას მნიშვნელობა არ აქვს, და მონაცემების მესამე-მხარის API-ებისგან შორს შენახვა. ასევე: სწავლა, ტესტირება და პროტოტიპირება, სანამ სადმე GPU-ს დაიქირავებთ.

ითხოვთ ID-ს?

არა. ელფოსტა რეგისტრაციისთვის, USDC ან USDT გადასახდელად. რაც ხშირად არის მიზეზი, რის გამოც ხალხს პირადი მოდელი უნდა.

კომენტარები

ჯერ არ არის კომენტარები. იყავით პირველი.

დატოვეთ კომენტარი

კომენტარები მოდერირდება გამოჩენამდე.