لنكن صادقين من البداية: إن أردت توليدًا سريعًا رخيصًا عالي الجودة، استدعِ API. VPS بمعالج لن يتفوّق على مركز بيانات مليء بوحدات GPU، ومن يخبرك بخلاف ذلك يبيع شيئًا.
فلماذا استضافة الاستدلال ذاتيًا أصلًا؟ سبب واحد، وهو جيد: النموذج على خادمك لا يرسل مطالباتك إلى أي مكان.
كيف يبدو استدلال المعالج فعلًا
يمكنك تشغيل نماذج حقيقية على المعالج بذاكرة كافية. نموذج 7–8B مكمّم إلى 4-bit يعمل. 13B يعمل. يمكنك حتى دفع نموذج فئة 30B إن كانت لديك الذاكرة. ما لا يمكنك فعله هو جعله سريعًا — المخرجات تأتي ببضع رموز في الثانية، لا البثّ الفوري الذي يمنحه API.
تلك المقايضة الصادقة. للدردشة التفاعلية محبطة. للعمل الخلفي — تلخيص المستندات ليلًا، تصنيف طابور، إثراء بيانات بجدول — بضع رموز في الثانية مناسبة تمامًا، ولا أحد يراقب الساعة.
حسبة الذاكرة
يجب أن يجلس النموذج في الذاكرة، مكمّمًا أو لا، إضافة إلى عبء للسياق وبيئة التشغيل:
- 7–8B، 4-bit — نحو 6–8 GB. يعمل على خطة متوسطة.
- 13B، 4-bit — نحو 10–16 GB.
- فئة 30B، مكمّم — 24–48 GB، حسب التكميم.
- أكبر، أو دقة أعلى — تصل إلى 64–80 GB سريعًا — وبعد 80 GB لا يتّسع أي خادم Pro واحد، ولا يزال بطيئًا على المعالج.
لهذا يصبح «تشغيل نموذج محلي» بهدوء سؤال ذاكرة عالية. النموذج هو بصمة الذاكرة. أضف فهرس RAG أو وكلاء على الخادم نفسه وتتراكم الأرقام.
Ollama مقابل vLLM، باختصار
Ollama الباب السهل — ثبّت، ollama run، انتهيت. الأداة الصحيحة لإعداد خاص لمستخدم واحد تريد فيه النموذج متاحًا فحسب. vLLM مبني لإنتاجية الخدمة: إعداد أكثر، أفضل تحت الحمل المتزامن، يستحقّ حين تعالج حجمًا فعلًا. ابدأ بـ Ollama؛ الجأ إلى vLLM حين تخدم حركة حقيقية.
أين تفوز الخصوصية-أولًا فعلًا
قضية الاستدلال المُستضاف ذاتيًا ليست السرعة أو التكلفة — بل أن بعض البيانات لا يمكنها المغادرة. مستندات قانونية. سجلات طبية. شيفرة خاصة. أي شيء يكون فيه إرسال المطالبة إلى API خارجي مستبعدًا لأسباب سياسة أو ثقة. نموذج أبطأ يعمل كليًا على جهازك يتفوّق على سريع يسجّل كل ما ترسله إليه.
وإن كانت البيانات بهذه الحساسية، فالدفع على الأرجح يجب أن يكون خاصًا أيضًا. استئجار الخادم بـالعملات المشفّرة وبدون KYC يُبقي السلسلة كلها — الخادم، النموذج، المطالبات، الفوترة — خارج سجلات هوية أي أحد. هذا هو العرض الفعلي: لا «استدلال أرخص»، بل «استدلال لا يستطيع أحد سواك رؤيته».
الخلاصة
للسرعة والجودة، استخدم API — لا عيب في ذلك. استضِف ذاتيًا حين تكون الخصوصية المتطلّب والأبطأ مقبولًا. حدّد الحجم للنموذج إضافة إلى سياقه إضافة إلى أي شيء آخر يشارك الخادم، ولا تتوقّع سرعة GPU من المعالج.
حين يحتاج النموذج ذاكرة حقيقية، يشغّل خط Pro من 32 إلى 80 GB بـ IP مخصّص ونسخ احتياطي ليلي — يكفي لاحتواء نموذج مكمّم جادّ مع مساحة للسياق حوله.
التعليقات
لا تعليقات بعد. كن الأول.