መጀመሪያ ግልጽ እንሁን: ፈጣን፣ ርካሽ፣ ከፍተኛ-ጥራት generation ከፈለጉ፣ API ይጥሩ። CPU VPS በGPUs የተሞላ datacenter አያሸንፍም፣ እና ሌላ የሚነግርዎ ማንኛውም ሰው የሆነ ነገር እየሸጠ ነው።
ታዲያ inference ለምን self-host ማድረግ? አንድ ምክንያት፣ እና ጥሩ ነው: በserverዎ ላይ ያለው model promptsዎን ፈጽሞ ወደ የትም አይልክም።
CPU inference በእውነት እንዴት እንደሚመስል
እውነተኛ models በበቂ RAM በCPU ላይ ማሄድ ይችላሉ። 7–8B model ወደ 4-bit quantized ይሠራል። 13B ይሠራል። memory ካለዎት 30B-class model እንኳን መግፋት ይችላሉ። ማድረግ የማይችሉት ፈጣን ማድረግ ነው — output በሰከንድ ጥቂት tokens ይመጣል፣ API የሚሰጠው ፈጣን stream አይደለም።
ያ ግልጹ ልውውጥ ነው። ለinteractive chat የሚያበሳጭ ነው። ለbackground work — documents በሌሊት ማጠቃለል፣ queue መከፋፈል፣ data በschedule ማበልጸግ — በሰከንድ ጥቂት tokens ሙሉ በሙሉ ጥሩ ነው፣ እና ማንም ሰዓቱን አይመለከትም።
የRAM ስሌት
model በmemory ውስጥ መቀመጥ አለበት፣ quantized ወይም አይደለም፣ ከcontext እና runtime overhead ጋር:
- 7–8B, 4-bit — 6–8 GB አካባቢ። በmid plan ላይ ይሮጣል።
- 13B, 4-bit — በግምት 10–16 GB።
- 30B-class, quantized — 24–48 GB፣ በquantization ላይ በመመስረት።
- ትልቅ፣ ወይም ከፍ ያለ precision — በፍጥነት ወደ 64–80 GB ነዎት — እና ከ80 GB በላይ ምንም single Pro box አይገጥምም፣ አሁንም CPU-ዝግ።
ለዚህ ነው "local model ማሄድ" ጸጥ ብሎ የhigh-memory ጥያቄ የሚሆነው። model ራሱ የmemory footprint ነው። በተመሳሳይ box ላይ RAG index ወይም agents ያክሉ እና ቁጥሮቹ ይደራረባሉ።
Ollama vs vLLM፣ በአጭሩ
Ollama ቀላሉ በር ወደ ውስጥ ነው — install ያድርጉ፣ ollama run፣ ተጠናቀቀ። model ብቻ እንዲገኝ ለሚፈልጉበት private single-user setup ትክክለኛ መሣሪያ ነው። vLLM ለserving throughput የተሠራ ነው: ተጨማሪ setup፣ በተመሳሳይ load ስር የተሻለ፣ በእውነት volume ሲያስተናግዱ ዋጋ አለው። በOllama ይጀምሩ፤ በእውነት traffic ሲያገለግሉ ወደ vLLM ይድረሱ።
privacy-first በእውነት የት እንደሚያሸንፍ
ለself-hosted inference ያለው ክርክር ፍጥነት ወይም ወጪ አይደለም — አንዳንድ data መውጣት አይችልም ማለት ነው። ሕጋዊ documents። የሕክምና records። Proprietary code። promptን ወደ third-party API መላክ በpolicy ወይም trust ምክንያት ከጠረጴዛ ውጭ የሆነ ማንኛውም። ሙሉ በሙሉ በmachineዎ ላይ የሚሮጥ ዝግ model የሚልኩትን ሁሉ የሚlog ፈጣንን ይበልጣል።
እና data ያን ያህል ሚስጥራዊ ከሆነ፣ ክፍያውም ምናልባት private መሆን አለበት። boxን በcrypto እና no KYC መከራየት ሙሉ chainን — server፣ model፣ prompts፣ billing — ከማንም identity records ያርቃል። ያ ትክክለኛው pitch ነው: "ርካሽ inference" አይደለም፣ ግን "ማንም ሌላ ማየት የማይችለው inference።"
ማጠቃለያ
ለፍጥነት እና ጥራት፣ API ይጠቀሙ — ምንም እፍረት የለም። privacy መስፈርት ሲሆን እና ዝግ ተቀባይነት ሲኖረው self-host ያድርጉ። ለmodel ከcontext ጋር እና box የሚጋራ ማንኛውም ሌላ ጋር ይመዘኑ፣ እና ከCPU የGPU ፍጥነት አይጠብቁ።
model እውነተኛ memory ሲፈልግ፣ Pro መስመር 32 እስከ 80 GB ከdedicated IP እና የሌሊት backups ጋር ይሮጣል — ከበቂ context ቦታ ጋር ከባድ quantized model ለመያዝ በቂ።
አስተያየቶች
እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።