راځئ چې نااميدوونکې برخه له لارې لرې کړو، ځکه چې انټرنیټ د هغو پاڼو ډک دی چې نه یې کوي.
زموږ سرورونه یوازې-CPU دي. موږ GPUونه نه وړاندې کوو. دا پدې معنی چې محلي LLM کار دلته یو سخت سقف لري، او بل ډول ښودل به یوازې ستاسو پیسې ضایع کړي.
په CPU څه واقعاً کار کوي
د تر ۶ vCPU او ۶ GB RAM سره (زموږ Medium پلان — $12/میاشت)، تاسو د کوچنیو quantized مودلونو سلسله کې یاست:
- 1B–3B مودلونه (Q4): په ریښتیا د کارونې وړ. د طبقهبندۍ، نښه کولو، لارښود، او ساده جوړښتلرونکي استخراج لپاره کافي ګړندي.
- 7B–8B مودلونه (Q4): چلیږي، خو یو څو tokenونه په ثانیه کې تمه وکړئ. د یوې قطارې لپاره سم چې د شپې سندونه ژوي. د یوې چټ کړکۍ په توګه دردناک.
- Embedding مودلونه: عالي سمون. دوی کوچني دي، په CPU ګړندي دي، او دا شاید د زموږ په څیر یوه box باندې د Ollama چلولو ترټولو ښه دلیل وي.
- 13B او پورته: مه. تاسو به swapping او انتظار کوئ.
که تاسو یو ګړندی، تعاملي 70B چټ ته اړتیا لرئ، تاسو یو GPU کوربه ته اړتیا لرئ — دا د یوه مختلف چمتوکوونکي مختلف محصول دی، او موږ غواړو دا درته ووایو نه دا چې ستاسو $12 واخلو.
چیرته یو CPU box واقعاً ګټي
محرمیت. ستاسو سندونه، ستاسو پرامپټونه، ستاسو embeddingونه — هیڅکله له یوه ماشین چې تاسو یې کنټرولوئ نه وځي، هیڅکله د چا د روزنې ډیټا نه کیږي. د ډیری خلکو لپاره دا ټوله موخه ده، او یو څو tokenونه په ثانیه کې د منلو وړ تجارت دی.
د لګښت وړاندوینه. د-هرې-token بل نشته. یو pipeline چې پنځوس زره ریکارډونه طبقهبندي کوي دقیقاً د یوه په څیر لګښت لري چې پنځوس یې کوي: $12.
Async کار. ډیری ګټور LLM کار د یوې چټ کړکۍ نه دی. دا یوه قطار ده: دا لنډیز کړه، هغه نښه کړه، دا corpus embed کړه. یو CPU box چې د شپې یو backlog ژوي په دې کې بشپړ ښه دی.
تنظیم
# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh
# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
Ollama په localhost:11434 یو HTTP API خدمت کوي. هلته یې وساتئ. که تاسو ورته له بل ځای رسیدو ته اړتیا لرئ، په یوه dedicated-IP پلان د تصدیق سره یې د یوه reverse proxy تر شا کیږدئ — هیڅکله یو بې-تصدیق مودل endpoint خلاص انټرنیټ ته مه څرګندوئ.
د یوه vector ډیټابیس سره یې جوړ کړئ (Qdrant یا pgvector په Docker کې) او تاسو په یوه $12 box یو بشپړ خصوصي RAG stack لرئ. هغه ترکیب — کوچني محلي embeddingونه، محلي vector store، یوازې د درنه تولید ګام لپاره بهرنی API — هغه تنظیم دی چې واقعاً د دې په څیر هارډویر باندې معنی لري.
پلان ټاکل
| کارونه | پلان | بیه |
|---|---|---|
| Embeddingونه، 1–3B مودلونه، RAG pipeline | Medium | $12/میاشت |
| همدا، سربیره یو عامه endpoint د auth تر شا | Medium-IP | $20/میاشت |
| یوازې د کوچنیو مودلونو ازموینه | Small | $8/میاشت |
یوازې-CPU، تر ۶ vCPU او ۶ GB RAM. NVMe ذخیره، بېشمیره ترافیک، جرمني یا فنلینډ. د crypto تادیه، بې KYC. کلنۍ بلینګ د دولسو پر ځای یو انتقال دی.
اړوند لوستل
- د AI حافظې لپاره یو vector DB کوربه کړئ — د یوه خصوصي RAG stack بله نیمایي
- VPS د AI اجنټانو لپاره — په همدې box همغږي
چمتو یاست؟ یو سرور ځای پرځای کړئ → — شاوخوا یوه دقیقه کې ژوندی، په crypto تادیه شوی، هیڅ ID ته اړتیا نشته.
تبصرې
لا تبصرې نشته. لومړی اوسئ.