እያንዳንዱን prompt ወደ ሌላ ሰው API መላክ ጥሩ ነው — እስከማይሆን ድረስ። ምናልባት data ሚስጥራዊ ነው እና ፈጽሞ serverዎን እንዲተው ባይፈልጉ። ምናልባት ከrate limits፣ ወይም ከእግርዎ በታች ከሚለወጥ model version፣ ወይም እየሞከሩ ሳለ ከሚtick per-token meter ሰልችተዋል። በአንድ ወቅት "የራሴን ብቻ ባሄድስ?" የሀሳብ ሙከራ መሆኑን ያቆማል።
Ollama ያንን በእውነት ቀላል ያደርገዋል። ከባዱ ጥያቄ በVPS ላይ ምን እንደሚገጥም ነው — እና እዚህ ግልጹ መልስ ከhype የበለጠ ያስፈልጋል።
በCPU ላይ በእውነት ማሄድ የሚችሉት
GPU የለም? ከዚያ CPU inference እያደረጉ ነው፣ እና model size ሁሉም ነገር ነው። Quantization (weightsን ወደ 4-bit መጭመቅ) ይህን ተግባራዊ የሚያደርገው ነው — ትንሽ quality ያጣሉ እና ክምር memory ይቆጥባሉ።
ግምታዊ ቁጥሮች፣ የሚያስፈልጉት:
- 3B model, 4-bit — ~3 GB RAM። ለchat እና ቀላል tasks በቂ ፈጣን።
- 7B model, 4-bit — ~5 GB RAM። sweet spot: በሚታይ የበለጠ ብልህ፣ አሁንም በሚነበብ ፍጥነት ይሮጣል።
- 13B እና ከዚያ በላይ — 8-10 GB+ እና በCPU ላይ ዝግ። በtechnically የሚቻል፣ በተግባር የሚያበሳጭ።
ፍጥነት፣ በሐቀኝነት: በጥቂት vCPUs ላይ በሰከንድ ጥቂት tokens ያያሉ። እየተየበ ሳለ ለሚያነቡበት chatbot ወይም coding assistant ፍጹም ጥሩ። አንድ ሚሊዮን documents ለbatch-processing ጥሩ አይደለም — ያ GPU job ነው፣ እና ሌላ አናስመስልም። GPU instances አናቀርብም። planዎ 70B model ወይም ከባድ throughput ከፈለገ፣ CPU VPS — የእኛ ወይም የማንም — የተሳሳተ መሣሪያ ነው፣ እና cent ከማውጣትዎ በፊት ማወቅ አለብዎ።
ግን ጥያቄዎችዎን የሚመልስ እና ፈጽሞ ወደ ቤት የማይደውል private 7B? ያ በ6 GB box ላይ በምቾት ይሮጣል።
install — ሦስት commands
serverን ያስነሱ፣ SSH ያድርጉ፣ እና:
curl -fsSL https://ollama.com/install.sh | sh # installs Ollama
ollama run llama3.2:3b # pulls + runs a 3B model
ያ ነው — በterminal ውስጥ እየተወያዩ ነው። ከራስዎ code ለመጠቀም፣ Ollama አስቀድሞ HTTP API በport 11434 ላይ ያገለግላል:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "Summarize this changelog in two lines: ...",
"stream": false
}'
አስቀድሞ ማወቅ የሚገባ አንድ gotcha: በdefault ያ API ወደ localhost ይያዛል። እንዲሁ ያቆዩት እና በSSH tunnel ያድርጉ፣ አለበለዚያ ወደ internet ተጋልጧል። ተደራሽ እንዲሆን ከፈለጉ፣ ከauth በስተጀርባ ያስቀምጡት — በpublic IP ላይ ክፍት model endpoint አይተዉ።
boxን መምረጥ
planን ከmodel ጋር ያዛምዱ፣ በተቃራኒው አይደለም:
| ማሄድ የሚፈልጉት | የሚፈልጉት RAM | ምክንያታዊ plan |
|---|---|---|
| 3B model, ቀላል አጠቃቀም | ~3 GB | Small (4 GB) |
| 7B model, በምቾት | ~5-6 GB | Medium (6 GB) |
| ትልቅ / ከፍተኛ throughput | GPU territory | CPU VPS አይደለም |
ለአብዛኞቹ self-hosters፣ Medium (6 GB) ግልጹ ምክር ነው — ለ7B model ከappዎ እና OS ጋር በቂ ቦታ። Small (4 GB) በ3B ላይ ከቀጠሉ ይሠራል። ከዚያ በታች ማንኛውም OS እና context ሲበሉ በጣም ጠባብ ነው።
ለምን እዚህ ማድረግ
LLM self-host እያደረጉ ከሆነ፣ privacy ብዙ ጊዜ የምክንያቱ ግማሽ ነው — ስለዚህ boxን ለመከራየት IDዎን ማስረከብ እንግዳ ይሆናል። ማድረግ የለብዎም: በUSDC ወይም USDT (ወይም በon-ramp card) መክፈል ይችላሉ፣ KYC የለም፣ እና server በአንድ ደቂቃ አካባቢ የእርስዎ ነው። Crypto-native፣ agent-friendly፣ እና data በሚቆጣጠሩት machine ላይ ይቆያል።
ልውውጡ ግልጽ የሆንንበት ነው: CPU ብቻ፣ 6 GB ጣሪያ፣ ትንንሽ models። በዚያ ውስጥ self-hosting ግሩም ነው። ከዚያ ውጭ፣ ማንም GPU ለሚፈልግ job CPU box እንዲሸጥዎ አይፍቀዱ።
ለመሞከር ዝግጁ ነዎት? plan ይምረጡ፣ ይክፈሉ፣ እና በ60 ሰከንድ አካባቢ root ይኖርዎታል — ከዚያ ወደ የራስዎ private model ሦስት commands ነው።
አስተያየቶች
እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።