EQVPS

VPS د Ollama او محلي LLMونو لپاره

کوچني ژبني مودلونه په یوه CPU سرور ځان-کوربه کړئ — خصوصي، بې‌شمیره، په crypto تادیه شوي. ریښتینی د دې په اړه چې CPU inference څه کولی شي او څه نه. له $12/میاشت.

راځئ چې نااميدوونکې برخه له لارې لرې کړو، ځکه چې انټرنیټ د هغو پاڼو ډک دی چې نه یې کوي.

زموږ سرورونه یوازې-CPU دي. موږ GPUونه نه وړاندې کوو. دا پدې معنی چې محلي LLM کار دلته یو سخت سقف لري، او بل ډول ښودل به یوازې ستاسو پیسې ضایع کړي.

په CPU څه واقعاً کار کوي

د تر ۶ vCPU او ۶ GB RAM سره (زموږ Medium پلان — $12/میاشت)، تاسو د کوچنیو quantized مودلونو سلسله کې یاست:

که تاسو یو ګړندی، تعاملي 70B چټ ته اړتیا لرئ، تاسو یو GPU کوربه ته اړتیا لرئ — دا د یوه مختلف چمتوکوونکي مختلف محصول دی، او موږ غواړو دا درته ووایو نه دا چې ستاسو $12 واخلو.

چیرته یو CPU box واقعاً ګټي

محرمیت. ستاسو سندونه، ستاسو پرامپټونه، ستاسو embeddingونه — هیڅکله له یوه ماشین چې تاسو یې کنټرولوئ نه وځي، هیڅکله د چا د روزنې ډیټا نه کیږي. د ډیری خلکو لپاره دا ټوله موخه ده، او یو څو tokenونه په ثانیه کې د منلو وړ تجارت دی.

د لګښت وړاندوینه. د-هرې-token بل نشته. یو pipeline چې پنځوس زره ریکارډونه طبقه‌بندي کوي دقیقاً د یوه په څیر لګښت لري چې پنځوس یې کوي: $12.

Async کار. ډیری ګټور LLM کار د یوې چټ کړکۍ نه دی. دا یوه قطار ده: دا لنډیز کړه، هغه نښه کړه، دا corpus embed کړه. یو CPU box چې د شپې یو backlog ژوي په دې کې بشپړ ښه دی.

تنظیم

# Ubuntu 24.04 — Medium plan recommended
curl -fsSL https://ollama.com/install.sh | sh

# Start with something small and see for yourself
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."

# Embeddings — the sweet spot for CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
  -d '{"model":"nomic-embed-text","prompt":"hello world"}'

Ollama په localhost:11434 یو HTTP API خدمت کوي. هلته یې وساتئ. که تاسو ورته له بل ځای رسیدو ته اړتیا لرئ، په یوه dedicated-IP پلان د تصدیق سره یې د یوه reverse proxy تر شا کیږدئ — هیڅکله یو بې-تصدیق مودل endpoint خلاص انټرنیټ ته مه څرګندوئ.

د یوه vector ډیټابیس سره یې جوړ کړئ (Qdrant یا pgvector په Docker کې) او تاسو په یوه $12 box یو بشپړ خصوصي RAG stack لرئ. هغه ترکیب — کوچني محلي embeddingونه، محلي vector store، یوازې د درنه تولید ګام لپاره بهرنی API — هغه تنظیم دی چې واقعاً د دې په څیر هارډویر باندې معنی لري.

پلان ټاکل

کارونهپلانبیه
Embeddingونه، 1–3B مودلونه، RAG pipelineMedium$12/میاشت
همدا، سربیره یو عامه endpoint د auth تر شاMedium-IP$20/میاشت
یوازې د کوچنیو مودلونو ازموینهSmall$8/میاشت

یوازې-CPU، تر ۶ vCPU او ۶ GB RAM. NVMe ذخیره، بې‌شمیره ترافیک، جرمني یا فنلینډ. د crypto تادیه، بې KYC. کلنۍ بلینګ د دولسو پر ځای یو انتقال دی.

اړوند لوستل


چمتو یاست؟ یو سرور ځای پرځای کړئ → — شاوخوا یوه دقیقه کې ژوندی، په crypto تادیه شوی، هیڅ ID ته اړتیا نشته.

د ځای پرځای کولو لپاره چمتو یاست؟ په crypto تادیه، بې KYC — شاوخوا یوه دقیقه کې چمتو.

اوس ځای پرځای کړئ →

پوښتنې

ایا زه پرې Llama 70B چلولی شم؟

نه. زموږ پلانونه یوازې-CPU دي د تر ۶ GB RAM سره — دا د کوچنیو quantized مودلونو سلسله ده (نږدې 1B–8B په 4-bit). یو 70B مودل یو GPU او ډیره ډیره حافظه غواړي. موږ GPUونه نه وړاندې کوو، او موږ غواړو دا ووایو نه دا چې تاسو ته نااميدي وپلورو.

CPU inference واقعاً څومره ګړندی دی؟

په یوه 7–8B مودل په 4-bit quantization یو څو tokenونه په ثانیه کې تمه وکړئ، او په 1–3B مودلونو د پام وړ ښه. دا د شاليد دندو، embeddingونو، طبقه‌بندۍ، او async pipelineونو لپاره سم دی. دا د یوه ژر تعاملي چټ لپاره سم نه دی.

نو دا واقعاً د څه لپاره ښه دی؟

خصوصي embeddingونه، طبقه‌بندي، لنډیز کول، RAG pipelineونه چیرته چې latency مهم نه دی، او د دریمې-ډلې APIونو څخه د ډیټا لرې ساتل. همدارنګه: زده‌کړه، ازموینه، او prototyping مخکې له دې چې یو GPU کوم ځای کرایه کړئ.

ایا تاسو ID غواړئ؟

نه. راجستر لپاره بریښنالیک، تادیې لپاره USDC یا USDT. چې ډیری وخت هغه دلیل دی چې خلک په لومړي سر کې یو خصوصي مودل غواړي.

تبصرې

لا تبصرې نشته. لومړی اوسئ.

یوه تبصره پریږدئ

تبصرې د ښکاره کیدو مخکې اعتدال کیږي.