لدينا صفحة منفصلة لـ Ollama والنماذج الصغيرة — ذلك خادم CPU بـ 12$ يشغّل 1B–8B والتضمينات. هذه الصفحة هي الطرف الآخر: النماذج الكبيرة بما يكفي لأن تكون الذاكرة، لا المعالج، هي ما يوقفك.
لنكن صادقين من البداية، كما في كل مكان: خوادمنا بمعالج فقط، دون GPU. نموذج كبير هنا يعمل ببطء. إن أردت دردشة تفاعلية سريعة على نموذج 30B، تحتاج مضيف GPU — منتج مختلف، مزوّد مختلف. ما يجيده خادم CPU عالي الذاكرة هو تشغيل نموذج مكمّم كبير بخصوصية لعمل ليس نافذة دردشة.
حسبة الذاكرة
يجلس النموذج في الذاكرة، مكمّمًا أو لا، إضافة إلى عبء للسياق وبيئة التشغيل:
- 13B، 4-bit — نحو 10–16 GB. يعمل على خطة متوسطة بالفعل.
- فئة 30B، مكمّم — 24–48 GB حسب التكميم. هذه منطقة Pro-32 إلى Pro-64.
- أكبر أو أعلى دقة — 64–80 GB، وبعد 80 GB لا يتّسع أي خادم واحد لدينا. Pro-80 هو السقف هنا.
لهذا «تشغيل نموذج محلي أكبر» هو حقًا سؤال ذاكرة عالية. النموذج هو بصمة الذاكرة. أضف فهرس RAG على نفس الخادم وتتراكم الأرقام.
أين تفوز الخصوصية-أولًا فعلًا
القضية ليست السرعة ولا التكلفة — بل أن بعض البيانات لا يمكنها المغادرة. مستندات قانونية. سجلات طبية. شيفرة خاصة. أي شيء يكون فيه إرسال المطالبة إلى API خارجي مستبعدًا. نموذج أبطأ يعمل كليًا على جهازك يتفوّق على سريع يسجّل كل ما ترسله إليه. كتبنا الصورة الكاملة هنا.
وإن كانت البيانات بهذه الحساسية، فالدفع على الأرجح يجب أن يكون خاصًا أيضًا. استئجار الخادم بـالعملات المشفّرة وبدون KYC يُبقي السلسلة كلها — الخادم، النموذج، المطالبات، الفوترة — خارج سجلات هوية أي أحد. هذا هو العرض: لا استدلال أرخص، بل استدلال لا يستطيع أحد سواك رؤيته.
ماذا تختار
لنموذج من فئة 30B مع مساحة للسياق، Pro-64 (64 GB) هو الخيار المريح؛ تكميم أضيق يتّسع في Pro-32 أو Pro-48، وأكبر يذهب إلى Pro-80. حمّل النموذج أولًا، راقب الذاكرة المقيمة، وحدّد الحجم مما قِسته. واضبط التوقعات: هذا استدلال دفعي خاص، لا نافذة دردشة سريعة.
التعليقات
لا تعليقات بعد. كن الأول.