حرّ الصيف — كل شيء يذوب، حتى أسعارنا.−25%−25% على كل خطة سنوية، حتى 31 أغسطسعرض الخطط
EQVPS

VPS للاستدلال الخاص بنماذج LLM عالية الذاكرة

النماذج المكمّمة الأكبر تحتاج ذاكرة حقيقية، لا GPU لا تملكه. أين يشغّل خادم CPU عالي الذاكرة نماذج من فئة 30B بخصوصية، وما الواقعي، وأين لا. من 70$ شهريًا.

لدينا صفحة منفصلة لـ Ollama والنماذج الصغيرة — ذلك خادم CPU بـ 12$ يشغّل 1B–8B والتضمينات. هذه الصفحة هي الطرف الآخر: النماذج الكبيرة بما يكفي لأن تكون الذاكرة، لا المعالج، هي ما يوقفك.

لنكن صادقين من البداية، كما في كل مكان: خوادمنا بمعالج فقط، دون GPU. نموذج كبير هنا يعمل ببطء. إن أردت دردشة تفاعلية سريعة على نموذج 30B، تحتاج مضيف GPU — منتج مختلف، مزوّد مختلف. ما يجيده خادم CPU عالي الذاكرة هو تشغيل نموذج مكمّم كبير بخصوصية لعمل ليس نافذة دردشة.

حسبة الذاكرة

يجلس النموذج في الذاكرة، مكمّمًا أو لا، إضافة إلى عبء للسياق وبيئة التشغيل:

لهذا «تشغيل نموذج محلي أكبر» هو حقًا سؤال ذاكرة عالية. النموذج هو بصمة الذاكرة. أضف فهرس RAG على نفس الخادم وتتراكم الأرقام.

أين تفوز الخصوصية-أولًا فعلًا

القضية ليست السرعة ولا التكلفة — بل أن بعض البيانات لا يمكنها المغادرة. مستندات قانونية. سجلات طبية. شيفرة خاصة. أي شيء يكون فيه إرسال المطالبة إلى API خارجي مستبعدًا. نموذج أبطأ يعمل كليًا على جهازك يتفوّق على سريع يسجّل كل ما ترسله إليه. كتبنا الصورة الكاملة هنا.

وإن كانت البيانات بهذه الحساسية، فالدفع على الأرجح يجب أن يكون خاصًا أيضًا. استئجار الخادم بـالعملات المشفّرة وبدون KYC يُبقي السلسلة كلها — الخادم، النموذج، المطالبات، الفوترة — خارج سجلات هوية أي أحد. هذا هو العرض: لا استدلال أرخص، بل استدلال لا يستطيع أحد سواك رؤيته.

ماذا تختار

لنموذج من فئة 30B مع مساحة للسياق، Pro-64 (64 GB) هو الخيار المريح؛ تكميم أضيق يتّسع في Pro-32 أو Pro-48، وأكبر يذهب إلى Pro-80. حمّل النموذج أولًا، راقب الذاكرة المقيمة، وحدّد الحجم مما قِسته. واضبط التوقعات: هذا استدلال دفعي خاص، لا نافذة دردشة سريعة.

Ready to deploy? Pay with crypto, no KYC — live in about a minute.

Deploy now →

FAQ

كيف يختلف هذا عن حالة استخدام Ollama لديكم؟

صفحة Ollama عن النماذج الصغيرة على خادم CPU بـ 12$ — 1B–8B، تضمينات، عمل خفيف. هذا هو الطرف عالي الذاكرة: نماذج مكمّمة من 13B إلى فئة 30B تحتاج 24–48 GB أو أكثر لمجرد التحميل. نفس واقع الـ CPU فقط، بصمة ذاكرة أكبر بكثير، خطة مختلفة.

كم من الذاكرة لنموذج معيّن؟

يجب أن يتّسع النموذج في الذاكرة إضافة إلى العبء. نموذج 13B بدقة 4-bit يريد ~10–16 GB؛ فئة 30B المكمّمة تدفع 24–48 GB؛ أكبر أو أعلى دقة وتصل إلى 64–80 GB — بعد ذلك لا يتّسع أي خادم واحد لدينا. أضف مساحة للسياق فوق ذلك.

هل سيكون سريعًا؟

لا — كن صادقًا مع نفسك هنا. الاستدلال على CPU لنموذج كبير بضع رموز في الثانية، لا بثًا تفاعليًا. مناسب للعمل الدفعي والخلفي (تلخيص ليلي، تصنيف طابور). للدردشة الفورية على نموذج كبير تحتاج GPU، ولا نوفّره.

لماذا تشغيله هنا بدل API؟

الخصوصية. مطالباتك ومخرجاتك لا تلمس خوادم أو سجلات مزوّد أبدًا. للبيانات الحساسة — قانونية، طبية، شيفرة داخلية — نموذج خاص أبطأ يتفوّق على سريع يرى كل شيء. اقرنه بدفع مشفّر بدون KYC وتبقى السلسلة كلها ملكك.

التعليقات

لا تعليقات بعد. كن الأول.

اترك تعليقًا

تُراجَع التعليقات قبل ظهورها.