حرّ الصيف — كل شيء يذوب، حتى أسعارنا.−25%−25% على كل خطة سنوية، حتى 31 أغسطسعرض الخطط
EQVPS

استضافة LLM محلي ذاتيًا على VPS بـ Ollama — ما الذي يعمل فعلًا

14 يونيو 2026 · 3 دقيقة قراءة · EQVPS Team

إرسال كل مطالبة إلى API شخص آخر جيّد — حتى لا يكون كذلك. ربما البيانات حسّاسة وتفضّل ألّا تغادر خادمك أبدًا. ربما سئمت حدود المعدّل، أو تغيّر إصدار نموذج تحت قدميك، أو عدّاد لكل رمز يدقّ بينما تجرّب. عند نقطة ما يكفّ «ماذا لو شغّلت نموذجي الخاص؟» عن كونه تجربة فكرية.

Ollama يجعل ذلك سهلًا حقًا. السؤال الأصعب هو ما الذي يسع على VPS — وهنا الإجابة الصادقة تهمّ أكثر من الضجيج.

ما تستطيع تشغيله فعلًا على المعالج

لا GPU؟ إذن أنت تُجري استدلالًا على المعالج، وحجم النموذج هو كل شيء. التكميم (عصر الأوزان إلى 4-بت) هو ما يجعل هذا عمليًا — تفقد شظية من الجودة وتوفّر كومة من الذاكرة.

أرقام تقريبية، التي تهمّ:

السرعة، بصراحة: على بضعة vCPUs سترى حفنة رموز في الثانية. جيّد تمامًا لبوت دردشة أو مساعد برمجة تقرأ بينما يكتب. ليس جيّدًا لمعالجة مليون مستند دفعةً — ذلك عمل GPU، ولا نتظاهر بغير ذلك. لا نقدّم مثيلات GPU. إن احتاجت خطّتك نموذج 70B أو إنتاجية ثقيلة، فـ VPS معالج — لدينا أو لدى أي أحد — هو الأداة الخطأ، وينبغي أن تعرف ذلك قبل أن تنفق قرشًا.

لكن 7B خاص يجيب أسئلتك ولا يتّصل بالبيت أبدًا؟ ذلك يعمل بأريحية على صندوق 6 GB.

التثبيت — ثلاثة أوامر

أنشئ الخادم، ادخل عبر SSH، ثم:

curl -fsSL https://ollama.com/install.sh | sh   # يثبّت Ollama
ollama run llama3.2:3b                            # يسحب + يُشغّل نموذج 3B

هذا كل شيء — أنت تدردش في الطرفية. لاستخدامه من شيفرتك الخاصة، يخدم Ollama أصلًا API عبر HTTP على المنفذ 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2:3b",
  "prompt": "Summarize this changelog in two lines: ...",
  "stream": false
}'

مأخذ واحد يجدر معرفته سلفًا: افتراضيًا يرتبط ذلك API بـ localhost. أبقِه كذلك وانفذ عبر SSH، وإلا فهو مكشوف للإنترنت. إن أردته في المتناول، ضعه خلف مصادقة — لا تترك نقطة نموذج مفتوحة على IP عامّ.

اختيار الصندوق

طابق الخطة مع النموذج، لا العكس:

تريد تشغيلالذاكرة التي تحتاجهاخطة معقولة
نموذج 3B، استخدام خفيف~3 GBSmall (4 GB)
نموذج 7B، بأريحية~5-6 GBMedium (6 GB)
أكبر / إنتاجية عاليةمنطقة GPUليس VPS معالج

لمعظم المستضيفين ذاتيًا، Medium (6 GB) هو التوصية الصادقة — متّسع كافٍ لنموذج 7B زائد تطبيقك ونظام التشغيل. Small (4 GB) يعمل إن التزمت بـ 3B. أي شيء دون ذلك ضيّق جدًا حالما يأكل نظام التشغيل والسياق.

لماذا هنا

إن كنت تستضيف LLM ذاتيًا، فالخصوصية عادةً نصف السبب — فسيكون غريبًا أن تسلّم هويتك لاستئجار الصندوق. لست مضطرًا: يمكنك الدفع بـ USDC أو USDT (أو ببطاقة عبر البوّابة)، بلا KYC، والخادم لك في نحو دقيقة. أصيل بالعملات المشفّرة، صديق للوكلاء، والبيانات تبقى على آلة تتحكّم فيها.

المقايضة هي التي صدقنا بشأنها: معالج فقط، سقف 6 GB، نماذج صغيرة. ضمن ذلك، الاستضافة الذاتية رائعة. خارجه، لا تدع أحدًا يبيعك صندوق معالج لعمل يحتاج GPU.

مستعدّ للتجربة؟ اختر خطة، ادفع، وسيكون لديك root في نحو 60 ثانية — ثم ثلاثة أوامر إلى نموذجك الخاص الخاصّ.

الأسئلة الشائعة

هل يمكنني تشغيل LLM بلا GPU؟

نعم، للنماذج الصغيرة. نموذج 3B أو 7B بتكميم 4-بت يعمل على المعالج ويجيب بوتيرة مقروءة — جيّد لبوت دردشة، أو مساعد برمجة، أو مهامّ خلفية لا تراقب فيها المؤشّر. ما لا تستطيع فعله على المعالج هو خدمة نموذج كبير (13B فصاعدًا) أو دفع إنتاجية عالية؛ هناك يتوقّف GPU عن كونه اختياريًا.

كم من الذاكرة أحتاج لـ Llama 7B؟

نحو 5 GB لنموذج 7B بـ 4-بت حالما تضيف نافذة السياق ونظام التشغيل — فصندوق 6 GB هو الأرضية المريحة. نموذج 3B يسع في نحو 3 GB. التكميم الأصغر (Q4) يقايض قليلًا من الجودة بذاكرة أقلّ كثيرًا، وهي المقايضة الصحيحة على VPS.

هل استضافة LLM ذاتيًا أرخص من API؟

حسب الحجم. API مستضاف يُحاسب لكل رمز ولا يكلّف شيئًا وهو عاطل؛ VPS فاتورة شهرية ثابتة استخدمته أم لا. إن شغّلت تدفّقًا ثابتًا من الطلبات، أو كنت تهتمّ أساسًا بالخصوصية وبلا حدود معدّل، تفوز الاستضافة الذاتية. للمطالبات العرضية لمرة واحدة، API مقيس أرخص.

لماذا أستضيف ذاتيًا بدل استخدام API سحابي؟

ثلاثة أسباب يفعله الناس لأجلها فعلًا: البيانات لا تغادر خادمك أبدًا (حقيقي للقانوني والطبّي أو مجرّد ملاحظات خاصة)، لا حدود معدّل ولا عدّاد لكل رمز، والنموذج لن يتغيّر أو يُهجَر تحتك. الكلفة أنك تُدير الصندوق وتعيش ضمن عتاده.

ما أكبر نموذج يمكنني تشغيله واقعيًا على VPS معالج؟

نموذج 7B بـ 4-بت هو النقطة المثلى على صندوق 6 GB. تستطيع تقنيًا تحميل 13B بذاكرة كافية، لكن على المعالج يصير بطيئًا بما يكفي لتشعر به. بعد ذلك تريد GPU، وهو نوع مختلف من المضيفين.

← العودة إلى المدوّنة← الخطط والأسعار

التعليقات

لا تعليقات بعد. كن الأول.

اترك تعليقًا

تُراجَع التعليقات قبل ظهورها.