EQVPS

local LLM በVPS ላይ በOllama self-host ማድረግ — በእውነት የሚሠራው

ጁን 14 2026 · 3 ደቂቃ ንባብ · EQVPS Team

እያንዳንዱን prompt ወደ ሌላ ሰው API መላክ ጥሩ ነው — እስከማይሆን ድረስ። ምናልባት data ሚስጥራዊ ነው እና ፈጽሞ serverዎን እንዲተው ባይፈልጉ። ምናልባት ከrate limits፣ ወይም ከእግርዎ በታች ከሚለወጥ model version፣ ወይም እየሞከሩ ሳለ ከሚtick per-token meter ሰልችተዋል። በአንድ ወቅት "የራሴን ብቻ ባሄድስ?" የሀሳብ ሙከራ መሆኑን ያቆማል።

Ollama ያንን በእውነት ቀላል ያደርገዋል። ከባዱ ጥያቄ በVPS ላይ ምን እንደሚገጥም ነው — እና እዚህ ግልጹ መልስ ከhype የበለጠ ያስፈልጋል።

በCPU ላይ በእውነት ማሄድ የሚችሉት

GPU የለም? ከዚያ CPU inference እያደረጉ ነው፣ እና model size ሁሉም ነገር ነው። Quantization (weightsን ወደ 4-bit መጭመቅ) ይህን ተግባራዊ የሚያደርገው ነው — ትንሽ quality ያጣሉ እና ክምር memory ይቆጥባሉ።

ግምታዊ ቁጥሮች፣ የሚያስፈልጉት:

ፍጥነት፣ በሐቀኝነት: በጥቂት vCPUs ላይ በሰከንድ ጥቂት tokens ያያሉ። እየተየበ ሳለ ለሚያነቡበት chatbot ወይም coding assistant ፍጹም ጥሩ። አንድ ሚሊዮን documents ለbatch-processing ጥሩ አይደለም — ያ GPU job ነው፣ እና ሌላ አናስመስልም። GPU instances አናቀርብም። planዎ 70B model ወይም ከባድ throughput ከፈለገ፣ CPU VPS — የእኛ ወይም የማንም — የተሳሳተ መሣሪያ ነው፣ እና cent ከማውጣትዎ በፊት ማወቅ አለብዎ።

ግን ጥያቄዎችዎን የሚመልስ እና ፈጽሞ ወደ ቤት የማይደውል private 7B? ያ በ6 GB box ላይ በምቾት ይሮጣል።

install — ሦስት commands

serverን ያስነሱ፣ SSH ያድርጉ፣ እና:

curl -fsSL https://ollama.com/install.sh | sh   # installs Ollama
ollama run llama3.2:3b                            # pulls + runs a 3B model

ያ ነው — በterminal ውስጥ እየተወያዩ ነው። ከራስዎ code ለመጠቀም፣ Ollama አስቀድሞ HTTP API በport 11434 ላይ ያገለግላል:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

አስቀድሞ ማወቅ የሚገባ አንድ gotcha: በdefault ያ API ወደ localhost ይያዛል። እንዲሁ ያቆዩት እና በSSH tunnel ያድርጉ፣ አለበለዚያ ወደ internet ተጋልጧል። ተደራሽ እንዲሆን ከፈለጉ፣ ከauth በስተጀርባ ያስቀምጡት — በpublic IP ላይ ክፍት model endpoint አይተዉ።

boxን መምረጥ

planን ከmodel ጋር ያዛምዱ፣ በተቃራኒው አይደለም:

ማሄድ የሚፈልጉትየሚፈልጉት RAMምክንያታዊ plan
3B model, ቀላል አጠቃቀም~3 GBSmall (4 GB)
7B model, በምቾት~5-6 GBMedium (6 GB)
ትልቅ / ከፍተኛ throughputGPU territoryCPU VPS አይደለም

ለአብዛኞቹ self-hosters፣ Medium (6 GB) ግልጹ ምክር ነው — ለ7B model ከappዎ እና OS ጋር በቂ ቦታ። Small (4 GB) በ3B ላይ ከቀጠሉ ይሠራል። ከዚያ በታች ማንኛውም OS እና context ሲበሉ በጣም ጠባብ ነው።

ለምን እዚህ ማድረግ

LLM self-host እያደረጉ ከሆነ፣ privacy ብዙ ጊዜ የምክንያቱ ግማሽ ነው — ስለዚህ boxን ለመከራየት IDዎን ማስረከብ እንግዳ ይሆናል። ማድረግ የለብዎም: በUSDC ወይም USDT (ወይም በon-ramp card) መክፈል ይችላሉ፣ KYC የለም፣ እና server በአንድ ደቂቃ አካባቢ የእርስዎ ነው። Crypto-native፣ agent-friendly፣ እና data በሚቆጣጠሩት machine ላይ ይቆያል።

ልውውጡ ግልጽ የሆንንበት ነው: CPU ብቻ፣ 6 GB ጣሪያ፣ ትንንሽ models። በዚያ ውስጥ self-hosting ግሩም ነው። ከዚያ ውጭ፣ ማንም GPU ለሚፈልግ job CPU box እንዲሸጥዎ አይፍቀዱ።

ለመሞከር ዝግጁ ነዎት? plan ይምረጡ፣ ይክፈሉ፣ እና በ60 ሰከንድ አካባቢ root ይኖርዎታል — ከዚያ ወደ የራስዎ private model ሦስት commands ነው።

FAQ

ያለGPU LLM ማሄድ እችላለሁ?

አዎ፣ ለትንንሽ models። 3B ወይም 7B model በ4-bit quantization በCPU ላይ ይሮጣል እና በሚነበብ ፍጥነት ይመልሳል — ለchatbot፣ coding helper፣ ወይም cursorን ለማይመለከቱባቸው background tasks ጥሩ። በCPU ላይ ማድረግ የማይችሉት ትልቅ model (13B እና ከዚያ በላይ) ማገልገል ወይም ከፍተኛ throughput መግፋት ነው፤ GPU አማራጭ መሆኑ የሚያቆመው እዚያ ነው።

ለLlama 7B ስንት RAM ያስፈልገኛል?

context window እና OSን ካከሉ በኋላ ለ4-bit 7B model 5 GB አካባቢ — ስለዚህ 6 GB box ምቹ ወለል ነው። 3B model በ3 GB አካባቢ ይገጥማል። ትንሽ quant (Q4) ትንሽ quality ለብዙ ያነሰ memory ይለውጣል፣ ይህም በVPS ላይ ትክክለኛው ልውውጥ ነው።

LLM self-host ማድረግ ከAPI ርካሽ ነው?

በvolume ላይ ይወሰናል። hosted API በtoken ይከፍላል እና idle ሲሆን ምንም አያስከፍልም፤ VPS ይጠቀሙም አይጠቀሙም flat ወርሃዊ bill ነው። የተረጋጋ የrequests ፍሰት ካሄዱ፣ ወይም በዋናነት ስለprivacy እና ስለrate limits አለመኖር የሚያስቡ ከሆኑ፣ self-hosting ያሸንፋል። ለአልፎ አልፎ one-off prompts፣ የሚለካ API ርካሽ ነው።

cloud API ከመጠቀም ይልቅ ለምን self-host?

ሰዎች በእውነት የሚያደርጉት ሦስት ምክንያቶች: data ፈጽሞ serverዎን አይተውም (ለሕጋዊ፣ ሕክምና፣ ወይም private notes እውነተኛ)፣ rate limits ወይም per-token meter የለም፣ እና model አይለወጥም ወይም ከእርስዎ በታች deprecated አይሆንም። ወጪው boxን ማስተዳደር እና በhardwareው ውስጥ መኖር ነው።

በCPU VPS ላይ በተጨባጭ ማሄድ የምችለው ትልቁ model ምንድን ነው?

7B model በ4-bit በ6 GB box ላይ sweet spot ነው። በበቂ RAM 13B በtechnically መጫን ይችላሉ፣ ግን በCPU ላይ የሚሰማዎት ያህል ዝግ ይሆናል። ከዚያ በላይ GPU ይፈልጋሉ፣ ይህም የተለየ አይነት host ነው።

← ወደ ብሎግ ተመለስዕቅዶች & ዋጋዎች ይመልከቱ →

አስተያየቶች

እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።

አስተያየት ይተዉ

አስተያየቶች ከመታየታቸው በፊት ይጣራሉ።