
MiniCPM5-2B ضد Gemma 4 12B: متصدر تصنيفات الفئة دون 4 مليارات معلمة في مواجهة نموذج جوجل العام بـ12 مليار معلمة
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
تحتوي المواد الإطلاقية لنموذج MiniCPM5-2B على جملة واحدة تبدو وكأنها تحسم كل جدل قبل أن يبدأ: في المؤتمر العالمي للذكاء الاصطناعي في 19 يوليو، وصف كل من ModelBest وOpenBMB النموذج بأنه الأعلى ترتيبًا بين النماذج التي تقل معاملاتها عن 4 مليارات على لوحة صدارة Artificial Analysis، وقد أصبحت أوزانه المفتوحة الآن متاحة بهدوء على Hugging Face. أما Gemma 4 12B فهو إجابة Google من فئة أوزان مختلفة تمامًا — نموذج عام متعدد الوسائط كثيف بمعاملات 11.95 مليار، خالٍ من المشفر، صدر في 3 يونيو، ويقبل النصوص والصور والصوت والفيديو كمدخلات، وخلفه أشهر من النشر المجتمعي. المقارنة بينهما ليست مجرد تمرين على أوراق المواصفات؛ بل قرار حول الجهاز الذي تستهدفه بمنتجك، لأن النموذج الذي يتصدر فئته الحجمية والنموذج الذي هو أكبر ببساطة يجيبان عن سؤالين مختلفين يتعلقان بالعتاد.
التوقيت هو السبب في وجود هذه المواجهة أصلًا. ظهر MiniCPM5-2B في WAIC في يوليو كمنتج — قصة رقاقات بقدر ما هي قصة نموذج، مع تسعة شركاء سيليكون من اليوم الأول من مجتمع FlagOS — ووُعد بالأوزان "في المستقبل القريب". بعد سبعة أسابيع، ظهر مستودع openbmb/MiniCPM5-2B على Hugging Face (سجل تغييرات OpenBMB يؤرّخ الإصدار في 7 سبتمبر)، بترخيص Apache-2.0، دون بوابات، مع نقطة فحص BF16، وGGUF، وMLX، وGPTQ، ونقاط فحص الأساس وSFT، ومجموعات بيانات التدريب، كلها في نفس المجموعة. لا بيان صحفي، لا حدث إطلاق. حتى لحظة كتابة هذا النص، بطاقة النموذج هي الإعلان نفسه، ولم يُنشر أي تشغيل معايير مستقل بعد — كل ما هو كمّي بشأن الإصدار 2B أدناه إما إعادة إنتاج من ModelBest نفسها أو مستخلص من لقطة Artificial Analysis التي تستشهد بها. Gemma 4 12B، على النقيض، أُطلق عبر الآلية الطبيعية من Google وحُمّل ملايين المرات. تلك الفجوة في الأدلة جزء من المقارنة، وليست حاشية لها.
ما الذي تغير للتو في كل جانب؟
MiniCPM5-2B هو النموذج الثاني في سلسلة MiniCPM5، بعد النموذج MiniCPM5-1B الذي أصدرته OpenBMB مفتوح المصدر في 19 مايو. تصف البطاقة محولًا كثيفًا بإجمالي 2,516,756,480 معلمة (منها 1,981,982,720 معلمة خارج التضمين — وهو الرقم الذي يستحق وسم "فئة 2B")، وبـ42 طبقة بحجم خفي 2048، وانتباه مجمّع للاستعلامات (GQA) يضم 16 رأس استعلام ورأسَي KV فقط، ومفردات بحجم 130,560. وهو بنية LlamaForCausalLM عادية — والبطاقة صريحة في أنه لا حاجة إلى أي نوى مخصّصة ولا إلى نسخة معدّلة من كود النموذج — ويُشحن checkpoint بالكامل في قطعة safetensors واحدة بصيغة BF16. الاختيار التصميمي اللافت يقع في مرحلة ما بعد التدريب: ضبط موجَّه (SFT) على 400 مليار رمز من بيانات التفكير العميق، ثم تقطير على السياسة (On-Policy Distillation) يدمج ستة عشر نموذج خبير قائم على التعلم المعزّز، خمسة منها ذات طابع وكيلي، في شبكة كثيفة صغيرة واحدة. تنسب البطاقة إلى RL + OPD مكسبًا متوسطًا قدره 10.96 نقطة في مهام الاستدلال والمهام العامة، و6.96 نقطة في المهام الوكيلية — وهي فروق داخلية، لكنها تفسّر شكل هذا النموذج: نموذج بحجم 2B صُمّم ليكون وكيلًا يعمل داخل الجهاز، يصدر استدعاءات الأدوات بنمط XML بشكل أصيل.

تتموضع Gemma 4 12B في موضع مختلف ضمن تشكيلة Google؛ فهي الابن الأوسط لعائلة Gemma 4 — فوق نموذجي E2B وE4B الموجّهَين للحواف، وتحت نموذجي 26B MoE والنموذج الحدودي 31B — وهي العضو الوحيد المبني على تصميم بلا مُشفِّر: حيث تُسقَط رقع الصور الخام والأشكال الموجية الصوتية مباشرةً إلى فضاء الرموز، فيتولّى نموذج كثيف واحد معالجة مدخلات النصوص والصور والصوت والفيديو دون الحاجة إلى برج مُشفِّر منفصل. كما يوفّر نافذة سياق بطول 256K، واستدعاء أدوات جاهزًا خارج الصندوق، وتمريرة استدلال اختيارية، ومسودّات تنبؤ متعدد الرموز تسرّع فك الترميز من داخل نقطة التحقق. وهو مرخّص بموجب Apache-2.0، وعملي على أجهزة فئة 16GB (نحو 8GB عند دقة 4-bit)، وتعرض صفحته على Hugging Face ملايين التنزيلات شهريًا.

ادعاء الترتيب، وفئة الحجم التي يستثنيها
العنوان الرئيسي لشركة ModelBest حول MiniCPM5-2B هو حصولها على مؤشر الذكاء من Artificial Analysis بقيمة 17، لتحتل بذلك المرتبة الأولى بين النماذج التي تقل معاملاتها عن 4 مليارات عند الإطلاق. وينبغي أن يُذكر بجانبه تحفظان. فالنتيجة تعكس لقطة الإصدار v4.1 من منصة AA، وليست قابلة للمقارنة المباشرة بقيم المؤشر من اللقطات السابقة، كما أنها رقم وقت الإطلاق استشهد به البائع قبل أي إعادة تشغيل مستقلة. القراءة الصادقة أضيق نطاقًا لكنها تظل مثيرة للإعجاب: عند إطلاقه، ووفقًا لمنهجية AA في ذلك الوقت، تصدّر هذا النموذج ذو الـ2.5 مليار معامل فئته الحجمية بأكملها. أما Gemma 4 12B فلا يظهر ضمن تلك الفئة، وعلى صفحات Artificial Analysis نفسها اليوم يحقق مؤشرًا أعلى — نحو 22 للنسخة الاستدلالية و13 للنسخة التعليمية غير الاستدلالية، وكلاهما "أعلى بكثير من المتوسط" ضمن فئتهما. مؤشرات اللقطات المختلفة لا تتطابق بدقة، لذا تعامل مع ذلك كاتجاه لا كقيمة مضبوطة: نموذج الـ12B العام يظهر في الاختبارات كنموذج أكثر قدرة، بينما يظهر نموذج الـ2B كنموذج الأكثر قدرة ضمن حجمه. هذان ادعاءان مختلفان، ويمكن أن يكون كلاهما صحيحًا.
لوحة النتائج، الموسومة بصدق
اقرأ هذه الصفوف مع أخذ المصادر بعين الاعتبار — أرقام MiniCPM5-2B هي ادعاءات من بطاقة ModelBest، عمرها أسبوع واحد ولم يتم التحقق منها؛ أما أرقام Gemma 4 12B فهي معلنة من Google وقد تعرضت لاستخدام مجتمعي واسع منذ فترة طويلة:
• الحجم — MiniCPM5-2B: 2.52B إجمالي / 1.98B غير تضميني، كثيف. Gemma 4 12B: 11.95B، كثيف.
• النمط — MiniCPM5-2B: نص فقط. Gemma 4 12B: إدخال نص وصورة وصوت وفيديو، بدون مشفِّر.
• السياق — MiniCPM5-2B: 131,072 رمزًا في الإعداد المُرفَق. يدعم Gemma 4 12B نافذة سياق أصلية تبلغ 256K (بعض إعدادات الخدمة تثبّتها عند 128K).
• اللغات — MiniCPM5-2B: بطاقة وبيانات مركّزة على الإنجليزية والصينية. Gemma 4 12B: 140+ لغة.
• الإصدار — MiniCPM5-2B: أُعلن عنه في 19 يوليو 2026؛ الأوزان متاحة في الفترة من 6 إلى 7 سبتمبر، بهدوء. Gemma 4 12B: أُطلق في 3 يونيو 2026، مع تقييمات إطلاق كاملة.
• {{1}}الأدلة{{/1}} — {{2}}MiniCPM5-2B{{/2}}: بطاقة البائع بالإضافة إلى AA v4.1 (الفهرس 17، #1 ضمن فئة دون 4B)؛ لا يوجد تشغيل مستقل بعد. {{3}}Gemma 4 12B{{/3}}: تقييمات الإطلاق بالإضافة إلى أشهر من النشر المجتمعي وحوالي 3.3 مليون عملية تنزيل شهريًا.

لوحة النتائج أعلاه هي نفس الصورة في ستة صفوف: النموذجان يختلفان في كل بُعد تقريبًا، والأعمدة التي تحسم الاختيار — الوسيط، اللغات، فئة الجهاز — هي تلك التي لا يلتقطها أي متوسط معياري.
أين يتفوّق 12B: أشياء لا يمكن لـ 2B النصّي فقط تزييفها
ابدأ بالنمطية. يتعامل Gemma 4 12B مع الصوت والصور والفيديو بشكل أصليّ؛ بينما MiniCPM5-2B نصّي فقط. أي منتج ينسخ الصوت إلى نصّ، أو ينظر إلى شاشة، أو يشاهد فيديو، يحتاج إلى خطّ معالجة ثانٍ إلى جانب نموذج 2B، وعند تلك النقطة تتبخّر ميزة "النموذج الصغير" جزئيًا. أمّا اللغات فهي الجدار الثاني: أكثر من 140 لغة مقابل إصدار يتمحور حول الإنجليزية والصينية. بالنسبة لمنتج يخدم لغات الذيل الطويل، فإن نموذج 2B ليس مرشّحًا إطلاقًا. ثم هناك الأدلّة. لقد تم تنزيل Gemma 4 12B ملايين المرّات، وتم تكميمه وضبطه بدقّة وتشغيله في بيئات الإنتاج لمدّة ثلاثة أشهر؛ وأنماط فشله موثّقة، ويمتدّ نظامه البيئي على llama.cpp وOllama وLM Studio وMLX وvLLM وSGLang. أمّا MiniCPM5-2B فهو مستودع عمره أسبوع واحد، وأرقامه البارزة — بما في ذلك نتيجة 46.4 التي أدّاها البائع على SWE-bench Verified، وهي نتيجة ستكون لافتة لنموذج كثيف بحجم 2.5B إذا صمدت أمام الاختبار المستقلّ — لم يمسّها أحد خارج المختبر. من حيث النضج وحده، الاختيار ليس متقاربًا.
حيث أن 2B هو الخيار الوحيد
لا شيء من ذلك يهمّ في فئة الأجهزة التي لا يتّسع لنموذج 12B فيها أصلًا. فالهاتف، أو لوحة المقصورة الذكية، أو صندوق الحافة الصغير المزوّد ببضعة جيجابايتات من ذاكرة DRAM، لا يستطيع نقل أوزان نموذج بحجم 11.95B عبر ناقل الذاكرة بسرعةٍ مجدية — وهذا هو بالضبط عنق الزجاجة الذي من شأنه أن يخنقه. صُمم MiniCPM5-2B لذلك العالم: أوزانٌ تتّسع لذاكرة الجهاز، ونافذة سياق بطول 128K لجلسات الوكلاء الطويلة، واستدعاء أدواتٍ أصلي مصمَّم للعمل التفاعلي، وتكيّفٌ منذ اليوم الأول مع تسع عائلات من الرقائق إضافةً إلى ARM. فإذا كان هدفك وحدة معالجة عصبية (NPU) من فئة الهواتف أو لوحةً مدمجة، فإن Gemma 4 12B لا ينافس MiniCPM5-2B؛ فهو غير قابل للنشر هناك إطلاقًا. وإذا كان جهازك المستهدف قادرًا على استيعاب 12B لكن بالكاد فقط — مثل كمبيوتر محمول بسعة 16 جيجابايت — فإن نسخة 2B تمنحك هامشًا للتوسّع: زمن استجابة أقصر لكل توكن، واستهلاكًا أقل للطاقة، وإمكانية تشغيل نموذج ثانٍ في مساحة الذاكرة نفسها.
كيفية معرفة أي المطالبات تبقى سارية
بما أن كلًا من الطرفين نموذجٌ مفتوح الأوزان وقابلٌ للاستضافة الذاتية، فإن الخطوة الصادقة التالية هي القياس على عتادك الخاص بدلًا من إعادة قراءة بطاقات النماذج. وإذا كنت تفاضل بين MiniCPM5-2B وGemma 4 12B على عبء عمل تخدمه بالفعل، فهنا أيضًا تبرّر طبقة التوجيه وجودها: إذ إن توجيه مسار الاختبار إلى نقطة تفتيش جديدة مستضافة ذاتيًا عبر واجهة برمجة تطبيقات واحدة تتضمّن تبديلًا تلقائيًا عند الفشل يعني أن حزمة تقنية غير مجرّبة قد تتوقف أو تدخل في حلقة تكرار دون أن تعطّل بيئة الإنتاج، في حين تمر أسعار المزوّدين المعلنة — مهما كان ما تقارنه — دون أي هامش ربح (0٪). أما النموذج نفسه فمستودعه لم يتجاوز عمره يومًا واحدًا، لذا فإن الافتراضي هو التعامل معه بوصفه تجربة — لكن إجراء التجربة زهيد التكلفة، والساعتان اللازمتان لإعادة إنتاج SWE-bench أو جزءٍ من مجموعة التقييم الخاصة بك على نسخة 2B تشكّلان بالضبط الدليل الذي تنقصه هذه المقارنة.
الحكم
اختر Gemma 4 12B عندما يتوفر لدى عتادك هامش كافٍ وتتجاوز مهامك النصوص فقط — منتج متعدد الوسائط، أو جمهور متعدد اللغات، أو أي حالة تكون فيها ثلاثة أشهر من السلوك المُثبت مجتمعيًا أهم من التاج في الترتيب. اختر MiniCPM5-2B عندما لا يستطيع جهازك تحميل نموذج 12B إطلاقًا، أو عندما يتيح لك نموذج 2.5B قادر على النصوص وموجّه للوكلاء على شريحة بمستوى الهواتف إطلاق منتج يجعل النموذج الأكبر تحقيقه مستحيلًا. {{1}}إن تصدّر نموذج دون مستوى 4B معايير الترتيب هو إنجاز حقيقي، وإصداره بأوزان مفتوحة يجعله قابلًا للاختبار اليوم؛ لكنه، استنادًا إلى الأدلة المتاحة، ليس بديلًا عن نموذج 12B متعدد الاستخدامات في أي بيئة يستطيع فيها نموذج 12B التشغيل فعليًا.{{/1}}
