የሚያሳዝነውን ክፍል በቅድሚያ እናስወግድ፣ ምክንያቱም internet ይህን በማያደርጉ ገጾች ተሞልቷል።
ሰርቨሮቻችን CPU-only ናቸው። GPUs አናቀርብም። ይህ ማለት እዚህ local LLM ስራ ጠንካራ ጣሪያ አለው፣ እና ያለበለዚያ ማስመሰል ገንዘብዎን ብቻ ያባክናል።
በCPU ላይ በእውነት የሚሠራው
እስከ 6 vCPU እና 6 GB RAM ጋር (የእኛ Medium plan — $12/ወር)፣ በትንንሽ quantized models ክልል ውስጥ ነዎት:
- 1B–3B models (Q4): በእውነት ጠቃሚ። ለclassification፣ tagging፣ routing እና ቀላል structured extraction በቂ ፈጣን።
- 7B–8B models (Q4): ይሄዳሉ፣ ግን በሰከንድ ጥቂት tokens ይጠብቁ። በሌሊት documents ለሚያኝክ ወረፋ ጥሩ። እንደ chat window ማም ያለው።
- Embedding models: በጣም ጥሩ ተስማሚ። ትንንሽ ናቸው፣ በCPU ፈጣን፣ እና ይህ ምናልባት Ollamaን እንደ የእኛ ባለ box ላይ ለማሄድ ብቸኛው ምርጥ ምክንያት ነው።
- 13B እና በላይ: አታድርጉ። swap እያደረጉ እየጠበቁ ይሆናሉ።
ፈጣን፣ interactive 70B chat ከፈለጉ፣ GPU host ያስፈልግዎታል — ያ ከሌላ provider የተለየ product ነው፣ እና $12ዎን ከመውሰድ ይልቅ እንነግርዎታለን።
CPU box በእውነት የሚያሸንፍበት
ግላዊነት። documentsዎ፣ promptsዎ፣ embeddingsዎ — የሚቆጣጠሩትን ማሽን በጭራሽ አይለቁም፣ በጭራሽ የማንም training data አይሆኑም። ለብዙ ሰዎች ያ ሙሉ ነጥቡ ነው፣ እና በሰከንድ ጥቂት tokens ተቀባይነት ያለው ልውውጥ ነው።
የወጪ ሊተነበይነት። በtoken ሂሳብ የለም። ሃምሳ ሺህ records የሚclassify pipeline ሃምሳ ከሚclassify ተመሳሳይ ያስከፍላል: $12።
Async ስራ። አብዛኛው ጠቃሚ የLLM ስራ chat window አይደለም። ወረፋ ነው: እነዚህን summarize አድርግ፣ እነዚያን tag አድርግ፣ ይህን corpus embed አድርግ። በሌሊት backlog የሚያኝክ CPU box በዚያ ላይ ፍጹም ጥሩ ነው።
Setup
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama በlocalhost:11434 ላይ HTTP API ያገለግላል። እዚያ ያቆዩት። ከሌላ ቦታ መድረስ ካስፈለገዎ፣ በdedicated-IP ዕቅድ ላይ ከauthentication ጋር ከreverse proxy በስተጀርባ ያስቀምጡት — ያልተረጋገጠ model endpoint ለክፍት internet በጭራሽ አያጋልጡ።
ከvector database ጋር ያጣምሩት (Qdrant ወይም pgvector በDocker) እና በአንድ $12 box ላይ ሙሉ የግል RAG stack አለዎት። ያ ጥምረት — ትንንሽ local embeddings፣ local vector store፣ ለከባዱ generation ደረጃ ብቻ external API — በዚህ ዓይነት hardware ላይ በእውነት ትርጉም ያለው setup ነው።
ዕቅድ መምረጥ
| አጠቃቀም | ዕቅድ | ዋጋ |
|---|---|---|
| Embeddings፣ 1–3B models፣ RAG pipeline | Medium | $12/ወር |
| ተመሳሳይ፣ እና ከauth በስተጀርባ ሕዝባዊ endpoint | Medium-IP | $20/ወር |
| ትንንሽ models መሞከር ብቻ | Small | $8/ወር |
CPU-only፣ እስከ 6 vCPU እና 6 GB RAM። NVMe ማከማቻ፣ ያልተለካ ትራፊክ፣ ጀርመን ወይም ፊንላንድ። የክሪፕቶ ክፍያ፣ KYC የለም። ዓመታዊ ክፍያ ከአስራ ሁለት ይልቅ አንድ ዝውውር ነው።
ተዛማጅ ንባብ
- ለAI memory vector DB ማስተናገድ — የግል RAG stack ሌላኛው ግማሽ
- ለAI agents VPS — በተመሳሳይ box ላይ orchestration
ዝግጁ ኖት? server ያሰማሩ → — በአንድ ደቂቃ ገደማ ቀጥታ፣ በክሪፕቶ የተከፈለ፣ ID አያስፈልግም።
አስተያየቶች
እስካሁን አስተያየቶች የሉም። መጀመሪያ ይሁኑ።