
Intern-Decision-2B مقابل MiniCPM5-2B: نقطتا تحقق بحجم 2B، يفصل بينهما عشرون يومًا، وطريقتان متعارضتان لإنفاق المعاملات
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 584 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 187 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
internlm/Intern-Decision-2B وopenbmb/MiniCPM5-2B بحجم واحد، صدرا بفارق عشرين يومًا، ورُخّصا بالطريقة نفسها، لكنهما بُنيا لوظيفتين لا تتشابهان إطلاقًا. نقطة تفتيش InternLM هي 2,213,241,664 معاملًا لمُقيّم قرارات: تأخذ حالة وأسئلة مصنّفة حسب النوع، وتُجري تمريرة أمامية واحدة، وتعيد احتمالات معايَرة دون توليد رمز واحد، وترفض أي إدخال يتجاوز 8,192 رمزًا. أما نقطة OpenBMB فهي 2,516,756,480 معاملًا لنموذج عام كثيف: نموذج Llama ذو 42 طبقة مشتق من وصفة MiniCPM5، يستوعب 131,072 رمزًا من السياق، ويكتب الشيفرة، ويستدعي الأدوات، ويقوم بالرياضيات، مع مؤشر الذكاء Artificial Analysis Intelligence Index بقيمة 12.5 و726,518 تنزيلًا الشهر الماضي. تكلفة تنزيلهما واحدة، لكنهما تشتريان شيئين مختلفين تمامًا.
الجزء المثير في هذه المزاوجة ليس فجوة المعيار المرجعي — فبالكاد يوجد معيار مشترك يمكن المقارنة به. بل هو ما يمكن أن تُنفق عليه ميزانية 2.2 مليار معامل و2.5 مليار معامل في كل حالة، وما يخبرك به هذا الاختيار عن أيهما قد اكتمل. MiniCPM5-2B هو النموذج الثاني في سلسلته، بعد MiniCPM5-1B من مايو، وقد وصل بمنظومة إصدار كاملة. أما Intern-Decision-2B فهو الحجم الأوسط من ثلاثة أحجام دفعتها InternLM إلى Hugging Face في 05:36 UTC يوم 26 سبتمبر 2026 دون أي إعلان، ولم تصبح منظومة إصداره — قاعدة شفرات تدريب، وحزمة تقييم مُتحقَّق منها بالهاش، ومعيار معايرة من 96 حالة — علنية إلا هذا الصباح في 08:58 UTC.
إلى أين ذهبت الميزانيتان
كلا النموذجين نسختان مضبوطتان بدقة من معمارية شخص آخر، ويحتوي كل منهما على نحو 2.5 مليار معلمة. عند هذه النقطة ينتهي التشابه.

MiniCPM5-2B هو نموذج Transformer كثيف يضم 42 طبقة، وحجم مخفي 2,048، و16 رأس انتباه، وحجم وسيط 6,144، ومفردات من 130,560 رمزًا، وسياق من 131,072 رمزًا، دُرِّب على مزيج من المجموعات المفتوحة التي نشرتها OpenBMB إلى جانبه: UltraX للتدريب المسبق على الويب، وUltraData-Code مع إدارة شيفرة متدرجة L0–L3، وUltraData-Math، و500,000 عينة SFT للوكلاء مع أكثر من 80,000 عينة RL في UltraData-RL-2609. يشغّل تدريبه اللاحق SFT، ثم معلمي RL متخصصين في الرياضيات والبرمجة والمهام الوكيلية، ثم التقطير على السياسة عائدًا إلى نموذج واحد. إنه نموذج للأغراض العامة تُعرض ميزانية معاملاته بالكامل كقدرة يمكنك توجيه المطالبات إليها.
Intern-Decision-2B هو Qwen3_5ForConditionalGeneration ذو 24 طبقة — نمط متكرر من ثلاث طبقات انتباه خطي إلى طبقة انتباه كامل واحدة — بحجم مخفي 2,048، و8 رؤوس استعلام مقابل رأسي مفتاح-قيمة، وبُعد رأس 256، وطبقة محتفَظ بها للتنبؤ متعدد الرموز، وسقف تضمين المواضع عند 262,144 موضعًا. ويأتي مزوّدًا ببرج رؤية بحجم 612.5 ميغابايت ومُسقِط بحجم 50.3 ميغابايت. ولا يكاد أي من تلك الميزانية يتاح لك كموجّه: فالنموذج يجيب وفق مخطط ثابت من الأسئلة، وبنينيته هي آلية إيصال softmax، وليست مولّد نصوص.
ثمة تفصيل واحد من مستودع InternLM المنشور حديثًا يستحق الإبراز، لأنه يعيد تأطير وسم الوسائط المتعددة على بطاقة النموذج. إن ضبط القرار "يضبط بدقة العمود الفقري اللغوي لـ Qwen3.5 مع تجميد برج الرؤية والمُسقِط." كلا نقطتي التحقق للقرار 2B و4B تحملان شريحة رؤية بحجم 612,517,440 بايت بالضبط — الحجم نفسه في كليهما — وهو ما يتسق مع كون هذين المكوّنين موروثين من قاعدة Qwen بدلًا من تدريبهما. مسار الصور حقيقي وقابل للاستخدام، لكنه ليس ما أنفقت عليه عملية ضبط القرار لدى InternLM جهدها. إذا كان عبء عملك مقتصرًا على تقييم القرار النصي، فإن نحو 660 ميغابايت من ذلك التنزيل البالغ 4.46 غيغابايت لا يقدّم لك شيئًا.
لوحة النتائج

• المعاملات — Intern-Decision-2B 2,213,241,664 بصيغة BF16 بالإضافة إلى حوالي 660 ميغابايت من برج الرؤية والمِسقاط، ونحو 4.46 غيغابايت من المستودع؛ MiniCPM5-2B 2,516,756,480 بصيغة BF16، وملف safetensors واحد بحجم 5.03 غيغابايت.
• السياق — 8,192 توكن لـ Intern-Decision-2B، ويُرفض ما يتجاوز ذلك دون اقتصاص؛ 131,072 توكن لـ MiniCPM5-2B.
• المُخرَج — توزيع معاير بالإضافة إلى argmax لكل حقل، بلا نص على الإطلاق؛ نص مُولَّد، رمزًا تلو الآخر.
• التدريب — ضبط اتخاذ القرار لنموذج أساسي Qwen3.5-2B مع تجميد برج الرؤية، وبيانات التدريب غير معلنة؛ تمريرة تدريب مسبق كامل، وتدريب متوسط، وتمريرة SFT للتفكير العميق بـ400 مليار توكن، تليها RL وتقطير على السياسة، مع نشر المجموعات النصية إلى جانب ذلك.
• الأدلة المنشورة — جدول مورد من سبع مجموعات بمتوسط 84.68 مع Brier 0.437 وECE 0.100، لم يُعِد إنتاجه أي طرف ثالث، وإعجاب واحد وصفر تنزيلات؛ وبطاقة OpenBMB بمتوسط 53.9 ضمن مجموعة المقارنة الخاصة بها ومؤشر Artificial Analysis Intelligence Index المستقل البالغ 12.5، مع 726,518 تنزيلًا في الشهر الماضي.
• الترخيص — Apache-2.0 مع الحفاظ على شروط Qwen الأصلية كما هي تحت اسم LICENSE-QWEN، وعدم ذكر أي ترخيص على الإطلاق في مستودع الشيفرة؛ Apache-2.0 في كل شيء، بما في ذلك الشيفرة.
ما الذي يتفوق فيه كل واحد منهما فعليًا، والفرق ليس بسيطًا.
المقارنة غير متناظرة إلى حدّ يُعدّ خطأً في التصنيف، لذا من الأجدى تسمية الوظائف.
يتفوق MiniCPM5-2B في كل ما يتعلق بإنتاج إجابة بدلاً من اختيار واحدة. فهو يكتب الشيفرة؛ بينما لا يملك Intern-Decision-2B أي مسار برمجي. ويتعامل مع سياق من 131,072 رمزاً؛ أما Intern-Decision-2B فيتوقف عند 8,192 ويفشل بصوت عالٍ. ويستدعي الأدوات، بدرجة 66.6 في BFCL v4 على جدول OpenBMB نفسه، ويقوم بالرياضيات، بدرجة 94.6 في MATH-500 و70.2 في GPQA-Diamond — أرقام من بطاقة المورّد، مع احتواء صف GPQA على حاشية تقدمها البطاقة نفسها. ويسجل 70.8 في MMLU-Pro و84.7 في MMLU-Redux. ويعمل في llama.cpp وMLX، ويتوفر في إصدارات GGUF وGPTQ وDSpark، وله Space تجريبي عام على Hub، بخلاف 401 الذي تشير إليه بطاقة Intern-Decision.
يفوز Intern-Decision-2B بشيئين بالضبط، وهما سبب وجوده. أولاً، قرار بمجموعة مغلقة مع مخطط تكتبه أنت يعيد احتمالاً يمكنك تطبيق عتبة عليه، في تمريرة أمامية واحدة، خلال نحو 33 مللي ثانية، دون مُحلّل ودون أخذ عينات — وهو شكل لا يستطيع MiniCPM5-2B إنتاجه إلا بتوليد نص والأمل في أن يكون الرقم داخله حسن السلوك. ثانياً، إنه أثر قابل لإعادة الإنتاج: فالمستودع يحمل الآن هدف التدريب، ومجموعات الدقة السبع مع تجزئات SHA-256 وأعداد الصفوف لكل مجموعة، وشيفرة التقييم، ونصوص ضبط الحرارة وإعادة التشغيل، ومعيار معايرة توزيع من 96 حالة مع مولّده ومقيّمه دون اتصال. يشير دليل التقييم الخاص بـ InternLM إلى أن الإعدادات المسبقة الصادرة مرتبطة بواجهة XTuner الخلفية، وأن نتائج HF ينبغي الإبلاغ عنها كإعداد تنفيذ مختلف — وهو بالضبط نوع التحذير الذي توجد عدة إعادة الإنتاج لجعله قابلاً للتحقق.

من يجب أن ينزّل ماذا
إذا كانت لديك مهمة تتضمن قراءة شيء طويل، أو كتابة شيء ما، أو الإجابة عن سؤال لم تُعدّد خياراته مسبقًا، فإن MiniCPM5-2B هو النموذج ولا يوجد قرار يجب اتخاذه. إنه نموذج عام مكتمل من فئة 2B يتمتع بمنظومة حقيقية، وبيانات مفتوحة خلفه، وقائمة تقييم مستقلة، ولا يكلف شيئًا لتجربته — فبنيات GGUF وMLX متاحة بالفعل على Hub.
إذا كانت لديك مهمة هي في جوهرها اختيار من بين إجابات معروفة — توجيه تذكرة، أو تصنيف بريد دعم، أو وسم مرشّح، أو تقييم نية على مقياس ترتيبي — فإن نموذج التوليد هو الأداة الخطأ، و{{Intern-Decision-2B}} هو الأكثر إثارة للاهتمام بين الاثنين حتى وإن لم يُشغّله أحد تقريبًا. إن احتمالًا يمكنك تطبيق عتبة عليه أرخص في التشغيل، وأسهل في التدقيق، ويستحيل أن يختلق، وكون نقطة التحقق وصلت مع عدة إعادة إنتاج بدلًا من منشور على لوحة صدارة يجعله الأفضل توثيقًا بين الاثنين على المحور الذي يهم عندما يتعين عليك الدفاع عن الاختيار.
لا يوجد أي من النموذجين على OrcaRouter. صفحة النموذج الخاصة بنا لـ Intern-Decision-2B تُرجع 404 ولا يوجد مسار MiniCPM5-2B؛ لا شيء هنا يُعدّ ادّعاءً بالتوفر، وكلاهما يعني تشغيل الاستدلال بنفسك. وحيث يوجد البديل العملي فهو في نماذج القرار المستضافة: Jev 1.13 من TypeSafe، النموذج الذي قارنت InternLM عائلتها بأكملها مقابلَه، موجود في الكتالوج بسعر 0.042 دولار لكل مليون رمز إدخال مع سياق 65K وزمن P50 للوصول إلى أول رمز يبلغ 178 مللي ثانية. وإذا كان ما تحتاجه فعلاً هو نموذج عام في فئة الحجم نفسها مثل MiniCPM5-2B دون العمل التشغيلي، فإن أصغر مسار Qwen مستضاف لدينا أكبر بعدة مرات لكنه مفتاح واحد ضمن أكثر من 200 نموذج، عند سعر قائمة المزوّد مُمرَّرًا دون أي هامش ربح والتحويل التلقائي عند الفشل خلفه.
الرقم الوحيد الذي يحسم الأمر
ليس الأمر 84.68 مقابل 53.9. هذان المتوسطان يأتيان من مجموعتين مختلفتين، قاستهما مختبرات مختلفة، وفي إحدى الحالات مختبر لم تُفحص أرقامه قط. الرقم الذي يحسم الأمر هو 8,192. إذا كانت حالتك تتسع داخل ثمانية آلاف توكن وإجابتك هي بالفعل قائمة، فإن Intern-Decision-2B أداة دقيقة مزودة بطقم إعادة إنتاج وشذوذ في المعايرة يجب أن تكون على دراية به — خطأ المعايرة المتوقع الخاص به 0.100 هو الأسوأ بين الأحجام الثلاثة التي نشرتها InternLM، مقابل 0.066 للنموذج الذي يساوي نصف حجمه، لذا اضبط درجة الحرارة الخاصة بك قبل الوثوق بقيمة ثقة. إذا كانت حالتك لا تتسع، فقد انتهى السؤال قبل أن تبدأ المعايير، وMiniCPM5-2B هو الجواب.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
