لنُنهِ الجزء المخيّب أولًا، لأن الإنترنت مليء بصفحات لا تفعل.
خوادمنا بمعالج فقط. لا نوفّر GPU. يعني ذلك أن عمل LLM المحلي هنا له سقف صارم، والتظاهر بخلافه سيهدر مالك فقط.
ما يعمل فعلًا على CPU
مع ما يصل إلى 6 vCPU و6 GB من الذاكرة (خطة Medium — 12$ شهريًا)، أنت في نطاق النماذج المكمّمة الصغيرة:
- نماذج 1B–3B (Q4): قابلة للاستخدام فعلًا. سريعة بما يكفي للتصنيف والوسم والتوجيه والاستخراج البنيوي البسيط.
- نماذج 7B–8B (Q4): تعمل، لكن توقّع بضع رموز في الثانية. مناسبة لطابور يمضغ المستندات ليلًا. مؤلمة كنافذة دردشة.
- نماذج التضمين: مناسبة ممتازة. صغيرة، سريعة على CPU، وهذا على الأرجح أفضل سبب منفرد لتشغيل Ollama على خادم كخوادمنا.
- 13B وأكثر: لا تفعل. ستكون في swap وانتظار.
إن احتجت دردشة 70B تفاعلية سريعة، تحتاج مضيف GPU — ذلك منتج مختلف من مزوّد مختلف، ونفضّل إخبارك على أخذ 12$ منك.
أين يفوز خادم CPU فعلًا
الخصوصية. مستنداتك، مطالباتك، تضميناتك — لا تغادر جهازًا تتحكم به، ولا تصبح بيانات تدريب لأحد. للكثيرين هذا هو الهدف كله، وبضع رموز في الثانية مقايضة مقبولة.
تنبّؤ التكلفة. لا فاتورة لكل رمز. خط يصنّف خمسين ألف سجل يكلّف مثل واحد يصنّف خمسين: 12$.
العمل غير المتزامن. معظم عمل LLM المفيد ليس نافذة دردشة. إنه طابور: لخّص هذه، وسِم تلك، ضمّن هذا المتن. خادم CPU يطحن تراكمًا ليلًا جيّد تمامًا في ذلك.
الإعداد
# Ubuntu 24.04 — خطة Medium موصى بها
curl -fsSL https://ollama.com/install.sh | sh
# ابدأ بشيء صغير وارَ بنفسك
ollama pull llama3.2:3b
ollama run llama3.2:3b "Summarize this in one sentence: ..."
# التضمينات — النقطة المثالية لـ CPU
ollama pull nomic-embed-text
curl http://localhost:11434/api/embeddings \
-d '{"model":"nomic-embed-text","prompt":"hello world"}'
يخدم Ollama واجهة HTTP على localhost:11434. أبقِها هناك. إن احتجت الوصول إليها من مكان آخر، ضعها خلف وكيل عكسي بمصادقة على خطة بـ IP مخصّص — لا تكشف نقطة نموذج دون مصادقة للإنترنت المفتوح أبدًا.
اقرنها بقاعدة بيانات متجهية (Qdrant أو pgvector في Docker) ولديك حزمة RAG خاصة كاملة على خادم واحد بـ 12$. ذلك المزيج — تضمينات محلية صغيرة، مخزن متجهي محلي، API خارجي فقط لخطوة التوليد الثقيلة — هو الإعداد المنطقي فعلًا على عتاد كهذا.
اختيار الخطة
| الاستخدام | الخطة | السعر |
|---|---|---|
| تضمينات، نماذج 1–3B، خط RAG | Medium | 12$ شهريًا |
| نفسه، إضافة إلى نقطة عامة خلف مصادقة | Medium-IP | 20$ شهريًا |
| مجرد اختبار نماذج صغيرة | Small | 8$ شهريًا |
بمعالج فقط، حتى 6 vCPU و6 GB RAM. تخزين NVMe، حركة بيانات دون قياس، ألمانيا أو فنلندا. دفع بالعملات المشفّرة، بدون KYC. الفوترة السنوية تحويل واحد بدل اثني عشر.
قراءات ذات صلة
- استضافة قاعدة بيانات متجهية لذاكرة الذكاء الاصطناعي — النصف الآخر من حزمة RAG خاصة
- VPS لوكلاء الذكاء الاصطناعي — التنسيق على الخادم نفسه
مستعدّ؟ انشر خادمًا ← — يعمل خلال دقيقة تقريبًا، مدفوع بالعملات المشفّرة، دون هوية.
التعليقات
لا تعليقات بعد. كن الأول.