EQVPS

ለOllama እና local LLMs VPS

ትንንሽ የቋንቋ models በCPU server ላይ ራስ-ያስተናግዱ — የግል፣ ያልተለካ፣ በክሪፕቶ የተከፈለ። CPU inference ምን ማድረግ እንደሚችል እና እንደማይችል ታማኝ። ከ$12/ወር።

የሚያሳዝነውን ክፍል በቅድሚያ እናስወግድ፣ ምክንያቱም internet ይህን በማያደርጉ ገጾች ተሞልቷል።

ሰርቨሮቻችን CPU-only ናቸው። GPUs አናቀርብም። ይህ ማለት እዚህ local LLM ስራ ጠንካራ ጣሪያ አለው፣ እና ያለበለዚያ ማስመሰል ገንዘብዎን ብቻ ያባክናል።

በCPU ላይ በእውነት የሚሠራው

እስከ 6 vCPU እና 6 GB RAM ጋር (የእኛ Medium plan — $12/ወር)፣ በትንንሽ quantized models ክልል ውስጥ ነዎት:

ፈጣን፣ interactive 70B chat ከፈለጉ፣ GPU host ያስፈልግዎታል — ያ ከሌላ provider የተለየ product ነው፣ እና $12ዎን ከመውሰድ ይልቅ እንነግርዎታለን።

CPU box በእውነት የሚያሸንፍበት

ግላዊነት። documentsዎ፣ promptsዎ፣ embeddingsዎ — የሚቆጣጠሩትን ማሽን በጭራሽ አይለቁም፣ በጭራሽ የማንም training data አይሆኑም። ለብዙ ሰዎች ያ ሙሉ ነጥቡ ነው፣ እና በሰከንድ ጥቂት tokens ተቀባይነት ያለው ልውውጥ ነው።

የወጪ ሊተነበይነት። በtoken ሂሳብ የለም። ሃምሳ ሺህ records የሚclassify pipeline ሃምሳ ከሚclassify ተመሳሳይ ያስከፍላል: $12።

Async ስራ። አብዛኛው ጠቃሚ የLLM ስራ chat window አይደለም። ወረፋ ነው: እነዚህን summarize አድርግ፣ እነዚያን tag አድርግ፣ ይህን corpus embed አድርግ። በሌሊት backlog የሚያኝክ CPU box በዚያ ላይ ፍጹም ጥሩ ነው።

Setup

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama በlocalhost:11434 ላይ HTTP API ያገለግላል። እዚያ ያቆዩት። ከሌላ ቦታ መድረስ ካስፈለገዎ፣ በdedicated-IP ዕቅድ ላይ ከauthentication ጋር ከreverse proxy በስተጀርባ ያስቀምጡት — ያልተረጋገጠ model endpoint ለክፍት internet በጭራሽ አያጋልጡ።

ከvector database ጋር ያጣምሩት (Qdrant ወይም pgvector በDocker) እና በአንድ $12 box ላይ ሙሉ የግል RAG stack አለዎት። ያ ጥምረት — ትንንሽ local embeddings፣ local vector store፣ ለከባዱ generation ደረጃ ብቻ external API — በዚህ ዓይነት hardware ላይ በእውነት ትርጉም ያለው setup ነው።

ዕቅድ መምረጥ

አጠቃቀምዕቅድዋጋ
Embeddings፣ 1–3B models፣ RAG pipelineMedium$12/ወር
ተመሳሳይ፣ እና ከauth በስተጀርባ ሕዝባዊ endpointMedium-IP$20/ወር
ትንንሽ models መሞከር ብቻSmall$8/ወር

CPU-only፣ እስከ 6 vCPU እና 6 GB RAM። NVMe ማከማቻ፣ ያልተለካ ትራፊክ፣ ጀርመን ወይም ፊንላንድ። የክሪፕቶ ክፍያ፣ KYC የለም። ዓመታዊ ክፍያ ከአስራ ሁለት ይልቅ አንድ ዝውውር ነው።

ተዛማጅ ንባብ


ዝግጁ ኖት? server ያሰማሩ → — በአንድ ደቂቃ ገደማ ቀጥታ፣ በክሪፕቶ የተከፈለ፣ ID አያስፈልግም።

ለማሰማራት ዝግጁ ኖት? በክሪፕቶ ይክፈሉ፣ KYC የለም — በአንድ ደቂቃ ገደማ ቀጥታ።

አሁን ያሰማሩ →

FAQ

Llama 70Bን በዚህ ላይ ማሄድ እችላለሁ?

አይ። ዕቅዶቻችን CPU-only ናቸው እስከ 6 GB RAM — ያ የትንንሽ quantized models ክልል ነው (በግምት 1B–8B በ4-bit)። 70B model GPU እና በጣም ብዙ memory ይፈልጋል። GPUs አናቀርብም፣ እና ብስጭት ከመሸጥ ይልቅ እንዲህ መንገር እንመርጣለን።

CPU inference በእውነት ምን ያህል ፈጣን ነው?

በ4-bit quantization በ7–8B model ላይ በሰከንድ ጥቂት tokens ይጠብቁ፣ እና በ1–3B models ላይ በጉልህ የተሻለ። ያ ለbackground jobs፣ embeddings፣ classification እና async pipelines ጥሩ ነው። ለፈጣን interactive chat ጥሩ አይደለም።

ታዲያ ይህ በእውነት ለምንድን ነው የሚጠቅም?

የግል embeddings፣ classification፣ የsummarization ወረፋዎች፣ latency የማይጠቅምባቸው RAG pipelines፣ እና ውሂብን ከthird-party APIs ማራቅ። እንዲሁም: መማር፣ መሞከር፣ እና የትም GPU ከመከራየትዎ በፊት prototyping።

ID ትጠይቃላችሁ?

አይ። ለመመዝገብ ኢሜይል፣ ለመክፈል USDC ወይም USDT። ይህም ብዙ ጊዜ ሰዎች የግል model በመጀመሪያ ደረጃ የሚፈልጉበት ምክንያት ነው።

አስተያየቶች

እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።

አስተያየት ይተዉ

አስተያየቶች ከመታየታቸው በፊት ይጣራሉ።