بطاقة العنوان الرئيسية لـ 'MiniCPM5-2B مقابل Granite 4.2 3B'، مع العنوان الفرعي 'نموذج 2.5B مُدرَّب على مهام الوكلاء يتصدى لنموذج IBM المتخصص في الاستدلال بحجم 3B'، وثلاث شارات نصها 'حزمة الوكيل مقابل المُستدِل' و'Apache-2.0 على الجانبين' و'الأوزان متاحة في 6-7 سبتمبر'، وشريط علوي 'مواجهة الأوزان المفتوحة · سبتمبر 2026'
Guides & Insights

MiniCPM5-2B مقابل Granite 4.2 3B: متخصص الاستدلال بحجم 3B مقابل حزمة العوامل الجديدة بحجم 2.5B

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

وضعت ModelBest نموذج Granite 4.2 3B على لوحة نتائج MiniCPM5-2B الخاصة قبل أن يطلب منها أحدٌ ذلك. تُدرج بطاقة نموذج MiniCPM5-2B التي نشرتها OpenBMB عندما أصبحت الأوزان متاحة بهدوء على Hugging Face أصغر نموذج استدلال من IBM ضمن خطوط الأساس للمقارنة، وتُظهر في تلك المجموعة أن MiniCPM5-2B يحقق متوسط 53.9 مقابل 42.7 لنموذج Granite 4.2 3B. وهذا هو الرقم الوحيد للمواجهة المباشرة الذي نشرته أيٌّ من الجهتين لهذا الثنائي، ما يجعله المكان الطبيعي للبدء — والمكان الطبيعي لتوخي الحذر. النموذجان صغيران ومرخّصان بموجب Apache-2.0، ويأتيان كإصدارين مفتوحَي الأوزان للاستضافة الذاتية يستهدفان المهمة نفسها في أواخر عام 2026؛ لكنهما يقتربان منها من طرفين متعاكسين: أحدهما مدرَّب على الاستدلال والآخر على الفعل.

الإصداران يتشابهان أكثر مما يوحي به تسويق مورديهما. تم الكشف عن MiniCPM5-2B في المؤتمر العالمي للذكاء الاصطناعي في 19 يوليو باعتباره الرائد المخصص للأجهزة من ModelBest وOpenBMB — نموذج كثيف من فئة 2B يُقدَّم كقاعدة وكيل للهواتف والحواسيب الشخصية ومقصورات القيادة الذكية — وظهرت أوزانه في 6 و7 سبتمبر دون أي حدث إطلاق، بموجب ترخيص Apache-2.0، إلى جانب نقاط تفتيش GGUF وMLX وGPTQ والأساسية وSFT والمسودة وبيانات التدريب المرتبطة بها. أما Granite 4.2 3B فهو نموذج التفكير بحجم الحاسوب المحمول من IBM، وقد وصلت أوزانه إلى Hugging Face في أوائل أغسطس، بينما صدرت بطاقة النموذج والمدونة التقنية في 25 أغسطس. لم يخضع أي منهما بعد لمعيار مستقل، وهذا هو السبب في أن تصنيفات المصادر أدناه أهم من الأرقام.

إصداران متناغمان

غرانيت 4.2 3B هو نموذج استدلال كثيف مستقل، تم تدريبه لاحقًا من Granite-4.1-3B-Base. يمتلك 40 طبقة مع انتباه استعلام مجمّع، وسياقًا أصليًا يبلغ 128 ألفًا تقوم IBM بتمديده إلى 512 ألفًا في مرحلة تدريب خامسة، وثلاثة أوضاع تفكير لكل استعلام — التفكير الكامل افتراضيًا، ووضع منخفض الجهد، ومسار بدون تفكير. بطاقة النموذج صريحة بشأن ما ليس عليه: على عكس شقيقيه Granite 4.2 بنسختي 8B و30B، فإن نسخة 3B تخطّت عمدًا كتلة التعلم التعزيزي الوكيلية المتخصصة التي دُرّبت في بيئات SWE-agent والطرفية والبحث، لذا لا تذكر IBM أي نتيجة SWE-bench وتصنف النموذج كمتخصص في الاستدلال وليس وكيلًا. يعمل عبر vLLM وSGLang وTransformers وGGUF وOllama (granite4.2:3b)، ويشغّل ما يقارب 6-8 جيجابايت بصيغة bfloat16 أو أقل من 2 جيجابايت عند التكميم، ولا يملك واجهة برمجة تطبيقات مستضافة. أرقامه الرئيسية — AIME 2025 عند 78.33، وGPQA عند 54.80، وLiveCodeBench v6 عند 69.71، وMMLU-Pro عند 67.84 — هي من تقارير IBM ولم يُتحقق منها حتى اليوم.

Screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the model summary table — developer Granite Team, IBM, 'Decoder-only Dense Transformer (Reasoning)', base model Granite-4.1-3B-Base, 3B parameters, context 'Natively Supports 128K (Long-context extension to 512K)', bfloat16 precision, tested languages, built-in think chain-of-thought — and the Apache-2.0 license tag (captured September 7, 2026).

MiniCPM5-2B هو نموذج مكتمل موجّه نحو الوكلاء بدلاً من ذلك. تصف البطاقة محولًا كثيفًا بإجمالي 2.52 مليار معامل (1.98 مليار خارج التضمين)، و42 طبقة بحجم خفي 2048، وانتباه استعلام مجمّع بعدد 16 رأس استعلام ورأسَي KV، وهندسة LlamaForCausalLM قياسية بدون نوى مخصصة. ركّز العرض التقديمي على القدرة الوكيلية — تدريبًا وكيليًا متوسطًا على نطاق 200 مليار، ومجموعة SFT وكيلية كبيرة، ومواءمة RL للوكلاء، تنتهي بتقطير On-Policy الذي يعيد طيّ ستة عشر نموذج خبير RL في شبكة كثيفة صغيرة واحدة — بالإضافة إلى سياق طويل أصلي وأوضاع استجابة هجينة سريعة/مدروسة. يضبط إعدادها المُصدَّر نافذة سياق تبلغ 131,072 رمزًا (مواد يوليو روّجت لـ512K؛ الإعداد المُصدَّر لا يحتوي ذلك)، وتدّعي البطاقة دعم أدوات بنمط XML مع محلل SGLang مدمج. في جدول تقييمها الخاص، تُبلغ عن متوسط داخلي قدره 53.9 عبر مجموعة المقارنة التي اختارها البائع، و86.5 في AIME 2025/2026، و94.6 في MATH-500، و46.4 بتشغيل البائع على SWE-bench Verified، وهو رقم سيكون لافتًا لنموذج كثيف بحجم 2.5 مليار إذا نجح في اختبارات مستقلة.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

المواجهة المباشرة التي طبَعها شخص ما بالفعل

نظرًا إلى أن لوحات المقارنة بين البائعين المختلفين غالبًا ما تكون مقارنةً بين أضداد لا يجمعها قياسٌ واحد، فإن أكثر ما يفيد في هذه المواجهة هو ما نشرته ModelBest بنفسها: بطاقة MiniCPM5-2B تُدرج granite-4.2-3B ضمن خطوطها الأساسية، وتذكر أن MiniCPM5-2B حقّق متوسط 53.9 مقابل 42.7 لـ Granite على تلك المجموعة. اقرأها على حقيقتها تمامًا — بائع واحد يشغّل النموذجين على مجموعة اختبار اختارها هو، من دون أي تحقق مستقل، ولديه كل حافز لكي يفوز نموذجه. إنها ليست حكمًا. الذي تخبرك به فعلًا هو أن ModelBest كانت واثقة بما يكفي لتضع نموذج 3B من منافس على بطاقتها، وأن الفجوة التي تدّعيها أكبر ما تكون تحديدًا في المجالات التي استثمر فيها تدريبُها: بنود المهام الوكيلية والسياق الطويل. تعاملْ معها كادعاء توجيهي، وازن بينها وبين ادعاءات بطاقة IBM المستقلة قبل أن تبني عليها أي قرار.

لوحة النتائج، الموسومة بصدق

• الإصدار — MiniCPM5-2B: أُعلن عنه في 19 يوليو 2026؛ الأوزان أصبحت متاحة في 6-7 سبتمبر، بهدوء. Granite 4.2 3B: الأوزان صدرت في أوائل أغسطس؛ بطاقة النموذج والمدونة التقنية بتاريخ 25 أغسطس 2026.

• الدور — MiniCPM5-2B: وكيل على الجهاز مع تركيز على استخدام الأدوات، بحسب ModelBest. Granite 4.2 3B: متخصص في الاستدلال، وغير موجَّه للوكلاء عمدًا، بحسب IBM.

• الحجم — MiniCPM5-2B: 2.52B إجمالي / 1.98B غير التضمين، 42 طبقة. Granite 4.2 3B: ~3B كثيف، 40 طبقة.

• السياق — MiniCPM5-2B: 131,072 رمزًا في الإعداد المُرفق. Granite 4.2 3B: 128K أصلي، مع التمديد حتى 512K.

• ما بعد التدريب — MiniCPM5-2B: SFT للتفكير العميق، تعلّم معزّز متخصص، تقطير داخل السياسة. Granite 4.2 3B: SFT للاستدلال، تعلّم معزّز GRPO وRLHF؛ بلا وحدة تعلّم معزّز وكيل.

• الأدلة — MiniCPM5-2B: ادعاءات بطاقة ModelBest، دون تشغيل مستقل. Granite 4.2 3B: ادعاءات بطاقة IBM غير معاد إنتاجها؛ AIME 2025 78.33، GPQA 54.80، LiveCodeBench v6 69.71.

A comparison scoreboard titled 'MiniCPM5-2B vs Granite 4.2 3B — the scoreboard', with left column rows 'What it is: Agent-tuned 2.5B for on-device', 'Params: 2.52B total · 42 layers', 'Context: 128K in shipped config', 'Post-training: Deep-thinking SFT + RL + OPD', 'Card headline: Internal avg 53.9 on own suite', 'Release: Announced Jul 19 · weights Sep 6-7', and right column rows 'What it is: IBM's smallest reasoning 3B', 'Params: ~3B dense · 40 layers', 'Context: 128K native → 512K ext', 'Post-training: Reasoning SFT + GRPO + RLHF', 'Card headline: AIME '25 78.33 · GPQA 54.80', 'Release: Weights Aug · card Aug 25', with a footer reading 'Both vendor-reported and unreproduced; the 53.9-vs-42.7 head-to-head is on ModelBest's own card.'

لوحة النتائج أعلاه تحمل نفس مصدر المعلومات المذكور في النص: كل رقم فيها مبلّغ عنه من البائع، والمقارنة الوحيدة ضمن نفس المجموعة التي نشرها أي من البائعين هي تلك الموجودة على بطاقة ModelBest الخاصة.

أخصائي الاستدلال مقابل حزمة الوكلاء

قبل النظر إلى النتائج، حدد نوع النموذج الصغير الذي يحتاجه عبء عملك، لأن هذين النموذجين يجيبان عن سؤالين مختلفين. صُمم Granite 4.2 3B للاستدلال والسياق الطويل على أجهزة محدودة الإمكانات: نافذة سياق أصلية بسعة 128K تمتد إلى 512K، وثلاثة أوضاع للتفكير، وبصمة تناسب حاسوبًا محمولًا، وقرار صريح بتخطي التدريب على السلوك الوكيل. إذا كانت مهمتك تحليل مستندات طويلة، أو سياقًا على نطاق المستودع، أو استدلالًا موثوقًا متعدد الخطوات على حاسوب صغير، فهذا النموذج ملاءمة متسقة لاحتياجك، وقرار IBM بإبقاء ادعاءات السلوك الوكيل خارج نموذج 3B هو سبب للثقة في بطاقته لا فجوةٍ فيها. أما MiniCPM5-2B فهو مبني على التركيز المعاكس: السلوك الوكيل واستخدام الأدوات على الجهاز — إذ يبدو خط أنابيب التدريب أشبه بقائمة الأشياء التي استبعدها Granite 4.2 3B عمدًا. إذا كانت مهمتك حلقة وكيل على الجهاز تستدعي الأدوات، وتُجري محادثات طويلة، وتتنقل بين استجابات سريعة وأخرى متأنية، فتلك هي الحزمة الموجَّهة إليك، مع ما تحمله من عدم يقين إضافي لأنها نقطة تحقق عمرها أسبوع واحد وبطاقة غير مؤكَّدة.

البيانات التي أتاحتها OpenBMB لم تُتِحها IBM

الاختلاف الأقلّ إبهارًا هو الأكثر أهميةً للفرق التي تريد الضبط الدقيق. {{1}}أصدرت OpenBMB مدوّنات تدريب النموذج MiniCPM5-2B إلى جانب أوزانه — أي عائلة UltraData التي تشمل Ultra-FineWeb وUltraX وUltraData-Code وUltraData-Math ومجموعتي SFT وRL الخاصتين بالوكيل — وجميعها متاحة بموجب ترخيص Apache-2.0.{{/1}} وهذه الخطوة تحوّل النموذج 2B من صندوق أسود إلى وصفة قابلة لإعادة الإنتاج؛ إذ يمكنك الاطلاع على الأسس التي بُني عليها التدريب اللاحق للوكيل ومتابعة العمل عليها في مجالك الخاص. {{2}}أصدرت IBM أوزان نموذج Granite 4.2 3B كمصدرٍ مفتوح وقدّمت شرحًا تقنيًا مفصّلًا لطريقة بنائه، لكنها لم تشارك بيانات التدريب.{{/2}} وبالنسبة إلى مؤسسة تريد امتلاك النموذج بدلًا من استئجاره، فإن هذا التفاوت حقيقي. {{3}}كما يأتي MiniCPM5-2B بقدرات نشر لا يوازيها Granite عند هذا الحجم: تكيّف من اليوم الأول عبر تسع عائلات من الرقاقات من خلال مجتمع FlagOS التابع لـ ModelBest، من Huawei Ascend إلى NVIDIA وصولًا إلى مجموعة من المسرّعات المحلية، إضافةً إلى ARM{{/3}} — وهي إشارة إلى أن ModelBest تتوقّع أن يعمل النموذج 2B على منصاتٍ تتجاوز معالجات NVIDIA.

حقيقة التوجيه

لا يوجد أي من النموذجين اليوم في كتالوج مستضاف، لذا تعيش هذه المقارنة في عالم الاستضافة الذاتية — لكن هذا هو بالضبط المكان الذي تظل فيه طبقة التوجيه تؤدي دورها كشبكة أمان وليس كآلية توصيل. عندما يريد فريق اختبار نموذج وكيل بحجم 2B عمره أسبوع واحد أمام نموذج استدلال بحجم 3B على عبء عمل يخدمه بالفعل، فإن الخطوة القابلة للعكس هي توجيه مسار اختبار إلى نسخة مستضافة ذاتيًا من MiniCPM5-2B عبر واجهة API واحدة مع تجاوز تلقائي للأعطال، بينما يبقى الإنتاج على النموذج المُثبَت؛ فالمكدس الجديد قد يتعطل دون إسقاط أي شيء، وأسعار المزود المدرجة للنماذج المستضافة التي تقارن بها تمرّ بهامش ربح 0%، لذا يظل اختبار A/B رخيصًا. هذه الطبقة لا تستضيف أيًّا من النموذجين؛ إنها فقط تجعل التجربة آمنة للتشغيل وسهلة التراجع.

أي نموذج صغير يجب عليك تشغيله فعليًا؟

شغّل Granite 4.2 3B إذا كانت مهامك تقتضي استدلالًا بسياقات طويلة على جهاز من فئة الحواسيب المحمولة، وتريد ثلاثة أوضاع للتفكير، وسقفًا يبلغ 512 ألف رمز، وبطاقة تعريف صادقة تخبرك بدقة بما لم يُدرَّب عليه نموذج 3B. وشغّل MiniCPM5-2B إذا كانت مهامك وكيلًا تفاعليًا يعمل على الجهاز نفسه ويستدعي الأدوات، حيث يناسب حجم 2.5B ميزانية ذاكرتك — لكن خصّص وقتًا كافيًا لإعادة إنتاج أرقامه المعلنة قبل أن تثق بها، فمتوسط 53.9 وادعاء تسجيل 46.4 في SWE-bench مصدرهما البائع ولم يؤكدهما أحد غيره بعد. أمران سيحسمان هذه المواجهة أسرع من أي رأي: تشغيل مستقل لـ MiniCPM5-2B يؤكد ادعاءات القدرات الوكيلة أو يدحضها، وصمود أرقام IBM في الاستدلال عند إعادة إنتاجها من المجتمع. وحتى يتحقق أحد هذين الأمرين، يظل Granite 4.2 3B النموذج الصغير الأكثر أمانًا والأفضل توثيقًا اليوم، بينما يمثل MiniCPM5-2B الرهان الأكثر إثارة للاهتمام.