بطاقة عنوان رئيسية للمقارنة 'MiniCPM5-2B-DSpark مقابل Qwen3-8B' مع العنوان الفرعي 'حزمة 2.5B الجديدة العاملة على الجهاز مقابل الحصان العامل بالأوزان المفتوحة'، تُظهر مخطط هاتف على اليسار يحتوي على رقاقة صغيرة موسومة بـ'2.5B + المسودة' ورفّ خوادم على اليمين موسومًا بـ'8B حصان العمل'، مع مقياس لعرض النطاق الترددي للذاكرة بينهما، وشعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

MiniCPM5-2B-DSpark مقابل Qwen3-8B: المكدس الجديد للتشغيل على الجهاز بحجم 2.5 مليار في مواجهة حصان العمل مفتوح الأوزان

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

كل مقارنة بين النماذج تُخفي خلفها سؤالًا عن العتاد، والمقارنة بين MiniCPM5-2B-DSpark وQwen3-8B هي هذا السؤال بعينه متقمصًا زي معايير الأداء. أما Qwen3-8B فهو نموذج Alibaba مفتوح الأوزان الذي صدر في أبريل 2025، وكان الحصان العامل المُعتمد في هذا المجال — نحو 8.2 مليار معامل كثيف، و119 لغة، وسياق أصلي من 32 ألف رمز قابلًا للتوسعة إلى 131 ألفًا، وأوضاع تفكير هجينة، وستة عشر شهرًا من الأدلة المجتمعية المتراكمة خلفه. أما MiniCPM5-2B-DSpark فليس نموذجًا مستقلًا يوضع إلى جوار ما سبق؛ بل هو نقطة تفتيش المسودة DSpark ذات 323.8 مليون معامل، التي نشرتها OpenBMB بهدوء على Hugging Face في السادس من سبتمبر 2026 لتسريع MiniCPM5-2B، النموذج المحلي الكثيف البالغ 2.52 مليار معامل، الذي أعلنت عنه ModelBest خلال WAIC في التاسع عشر من يوليو 2026. وعند الجمع بين الاثنين يطفو السؤال الحقيقي على السطح: هل ينبغي لعبء العمل الذي يعمل اليوم على نموذج من فئة 8B أن يُشغَّل على عتاد لا يتسع سوى لنموذج من فئة 2B؟ وهل يكفي نموذج من فئة 2.5B مع مسودة مجانية ليكون الانتقال إليه قرارًا صائبًا؟

الإجابة المختصرة هي: ليس بعد بالنسبة لمعظم أعباء العمل، لكن الأسباب أضيق مما توحي به فجوة الحجم، وهناك فئة واحدة من النشر لا تملك فيها نسخة 8B أي إجابة على الإطلاق. كل ما هو كمّي في هذه المقالة مُعلَن من البائعين أنفسهم — أرقام MiniCPM هي أرقام ModelBest الخاصة غير المعاد إنتاجها؛ وأرقام Qwen3-8B هي أرقام Alibaba التي طالما عُرضت لاستخدام المجتمع — لذلك التسميات أهم من الأرقام.

نموذجان في نقاط مختلفة على منحنى الذاكرة

MiniCPM5-2B هو نموذج تحويل سببي كثيف بحجم ثلث نموذج 8B — 42 طبقة، انتباه استعلامات مجمّعة، رخصة Apache-2.0 — صُمّم لفئة من الأجهزة لا يستطيع النموذج الكبير الوصول إليها: الهواتف، وقمرات القيادة الذكية، وصناديق الحافة الصغيرة حيث تختنق ناقلة الذاكرة أمام ثمانية مليارات وزن. تضع مواد إطلاقه التركيز على العمل الوكيل والسياق الطويل بدلًا من الاتساع الخام: سياق أصلي بطول 128K، وادعاء ModelBest أن النموذج يحقق متوسط 53.9 على مجموعة تقييمها الخاصة — وهو أفضل نموذج مفتوح المصدر من فئة 2B وفقًا للبائع، بما في ذلك نتيجة 46.4 يديرها البائع على SWE-bench Verified، وهي نتيجة ستكون لافتة لنموذج 2B إذا صمدت أمام الاختبار المستقل. مسودة DSpark هي الإجابة على الإنتاجية للاعتراض الواضح بأن النموذج الكثيف الصغير سريع التحميل لكنه بطيء في التوليد، لأن كل رمز يسحب أوزانه عبر ناقلة الذاكرة. تقترح المسودة ما يصل إلى سبعة رموز في وقت واحد ليتحقق منها الهدف، ويذكر المستودع قبولًا جشعًا بمعدل 5.52 رمزًا لكل خطوة تحقق في الإجمالي — و6.11 على الكود. هذا الرقم هو جودة المسودة؛ أما تسارعها فلم يُقس بعد، ولم يُنشر أي رقم لرموز في الثانية.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

بطاقة openbmb/MiniCPM5-2B-DSpark أعلاه تمثّل كامل السطح العام لإصدار 6 سبتمبر الصامت: وهي ملحق تقديم (serving) يُبلِّغ عن طول القبول، دون أي إعلان ودون أي تسريع في زمن التنفيذ الفعلي (wall-clock).

Qwen3-8B هو نفس العائلة المعمارية لكن بحجم أكبر بثلاث مرات وأقدم بستة عشر شهرًا. وهو محول سببي كثيف مع انتباه مجمّع الاستعلامات، مُدرَّب على مجموعة نصوص متعددة اللغات تحتوي 36 تريليون رمزًا، ومرخّص بموجب Apache-2.0، ويُعد أحد أكثر نماذج 8B استضافة ذاتية وخدمةً في عالم الأوزان المفتوحة. بصمته هي وضع التفكير الهجين Qwen3 — تشغيل التفكير أو إيقافه عند كل طلب — وملفّه العام واسع عمدًا: MMLU في السبعينات العالية، ونتائج قوية في GSM8K والبرمجة، و119 لغة. يتطلب وحدة معالجة رسومية حقيقية أو جهازًا طرفيًا قويًا: عند التكميم العملي يعمل في نطاق بضعة غيغابايتات، بشكل مريح على بطاقة متوسطة المدى، وليس على هاتف.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

بطاقة نموذج Alibaba لـ Qwen3-8B أعلاه هي وجه المنافس القائم: ستة عشر شهرًا من السلوك الموثق والمُختبَر من قبل المجتمع في 119 لغة.

حيث ما زال 8B يتفوق

عندما تنتقل إلى فئة وزن أقل، فإنك تتخلى عن ثلاثة أمور ملموسة. أولاً، اللغات: يغطي Qwen3-8B 119 لغة؛ بينما بطاقة بيانات MiniCPM5-2B ومجموعات بياناته تتمحور حول الإنجليزية والصينية، ولا يُدّعى أي اتساع متعدد اللغات. بالنسبة لمنتج يخدم ذيلًا طويلًا من اللغات، فهذا جدار صلب، وليس ناعمًا. ثانيًا، الأدلة: أرقام Qwen3-8B تم اختبارها وتكميمها وضبطها وخدمتها على نطاق واسع لمدة ستة عشر شهرًا؛ أنماط فشله معروفة، وتكميماته موجودة، ونظامه البيئي في كل مكان. أما MiniCPM5-2B فهو إصدار يوليو 2026 مع لوحة نتائج يديرها البائع ولا استنساخ مستقل، والمسودة عمرها يوم واحد. ثالثًا، حزمة الخدمة: كل ما يتواصل بالفعل مع Qwen3-8B — vLLM وSGLang وllama.cpp وآلاف عمليات الضبط الدقيق — يتواصل مع هدف ناضج، بينما تتطلب مسودة MiniCPM بناء محرك فك ترميز تخميني (خوارزمية DSPARK من SGLang) يوثقها المستودع لكن النظام البيئي الأوسع لم يستوعبها بعد.

حيث يكون 2B Stack هو الخيار الوحيد

لا شيء من ذلك يهم في فئة الأجهزة التي لا يتّسع فيها نموذج 8B ببساطة. فهاتف أو لوحة طرفية (edge board) بذاكرة DRAM تبلغ بضعة غيغابايتات، لا ينافس Qwen3-8B نموذج MiniCPM5-2B — بل إنه غير قابل للنشر بسرعة مفيدة إطلاقًا. هذا هو السبب الكامل لوجود حزمة 2B، وهو أيضًا سبب كون المسودة هي العنصر الحامل للعبء في هذا الإصدار لا مجرد زينة. فك الترميز التخميني (speculative decoding) يحقق أقصى فعاليته بالضبط في النظام الكثيف المقيّد بالذاكرة الذي يحتضن نموذجًا صغيرًا على شريحة صغيرة: تقترح مسودة مدمجة كتلة، ويتحقق النموذج المستهدف منها في تمريرة واحدة، وتُدفع تكلفة تحميل الأوزان مرة واحدة لكل كتلة بدلاً من مرة واحدة لكل رمز (token). صُمّمت طريقة DSpark ذات الأصل من DeepSeek (arXiv 2607.05147) لأنظمة خدمة عالية التزامن، لكن آليتها — وأرقام القبول في هذا المستودع — هي العتلة المناسبة لنموذج 2B الذي يجب أن يبدو تفاعليًا على أجهزة محدودة الموارد. فقط أبقِ التحفّظ الصادق نصب عينيك: قاس OpenBMB قبول المسودة، لا تسارعها، لذا فإن الزيادة الفعلية في الرموز لكل ثانية على جهازك المستهدف لا تزال مهمة تقع على عاتقك لقياسها.

لوحة النتائج، الموسومة بصدق

• الإصدار — MiniCPM5-2B: 19 يوليو 2026 (مُعلن عنه)؛ MiniCPM5-2B-DSpark: 6 سبتمبر 2026، صدر بهدوء. Qwen3-8B: أبريل 2025، مُعلن عنه.

• الحجم — MiniCPM5-2B: 2.52 مليار كثيف، بالإضافة إلى 324 مليون مسودة. Qwen3-8B: ~8.2 مليار كثيف.

• السياق — MiniCPM5-2B: 128K أصلي. Qwen3-8B: 32K أصلي، 131K عبر YaRN.

• اللغات — MiniCPM5-2B: تركيز على الإنجليزية/الصينية. Qwen3-8B: 119.

• الاستدلال — MiniCPM5-2B: أوضاع هجينة سريعة/مدروسة وفقًا لمواد الإطلاق. Qwen3-8B: تشغيل التفكير أو إيقافه حسب الطلب.

• الأدلة — أرقام MiniCPM هي ادعاءات بطاقة ModelBest (متوسط 53.9 على مجموعتها الخاصة؛ دون تشغيل مستقل). أرقام Qwen3-8B هي ما أبلغت عنه Alibaba، ومعروضة على المجتمع منذ ستة عشر شهرًا.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

لوحة النتائج أعلاه توضح التباين بصدق: الأعمدة تختلف في كل شيء تقريبًا باستثناء الترخيص المفتوح Apache-2.0، وفئة الجهاز الذي تشحن إليه هي التي تحدد أي عمود يُسمح لك باختياره.

حقيقة التوجيه

لا يوجد أيٌّ من النموذجين ضمن كتالوجٍ مستضافٍ على OrcaRouter اليوم، لذا تجري هذه المقارنة بالكامل في بيئة الاستضافة الذاتية — وهذا هو بالضبط المكان الذي تبرّر فيه طبقة التوجيه وجودها. Qwen3-8B يُقدَّم من مورّده ومن عدة منصّات خارجية؛ أمّا MiniCPM5-2B ونموذج الدرافت الخاص به فهما نموذجان تديرهما بنفسك. عندما يريد فريق اختبار ما إذا كانت حزمة بحجم 2.5B قادرة على تحمّل جزء من عبء عمل بحجم 8B، فإن الإجراء القابل للعكس هو توجيه مسار اختباري إلى نسخة SGLang مستضافة ذاتيًا تضم MiniCPM5-2B مع الدرافت عبر واجهة برمجة تطبيقات واحدة وخاصية التحويل التلقائي عند الفشل — فتبقى بيئة الإنتاج على الحلّ الحالي، ويمكن للحزمة الجديدة أن تتعثّر من دون أن تصيب أيّ شيء بالتعطّل، وتمرّ أسعار المزوّدين المعلنة عبر المقارنة كاملةً بهامش ربح 0%، لذا فإن اختبار A/B رخيص وقابل للعكس، وليس رهانًا. لا تستضيف الطبقة أيًّا من النموذجين؛ بل تجعل التجربة آمنةً للتنفيذ.

من الذي يجب أن يتحرك، ومن الذي يجب أن ينتظر؟

ابقَ على Qwen3-8B لكل ما يتعلق بالتعددية اللغوية، أو أي شيء يحتاج إلى ستة عشر شهرًا من السلوك المعروف، أو أي عبء عمل يُقدَّم بالفعل على عتاد يشغّل 8B بشكل مريح — فالفجوة في الحجم ليست سببًا للترحيل، وفجوة الأدلة تُرجّح كفّة البقاء. اختبر جديًا حزمة MiniCPM5-2B مع مسودتها DSpark فقط إذا كان جهازك المستهدف لا يستطيع تشغيل 8B إطلاقًا، أو إذا كان طراز 2.5B القادر على مواكبة الأعمال الوكيلية والسياقات الطويلة سيتيح لك خفض الذاكرة والطاقة على عتاد تشحنه بالفعل. وقبل أن تلتزم بالمسودة، نفّذ القياس الذي لم تنشره OpenBMB: طول القبول ليس زمن الاستجابة، ومكسب الرموز في الثانية على جهازك هو الرقم الذي يقرر فعلًا ما إذا كان checkpoint الصغير الهادئ على Hugging Face يستحق التنزيل.