بطاقة عنوان مُولَّدة لـ Microsoft-Decision-1 مقابل Intern-Decision-4B، بعنوان فرعي 'مُقيِّمان، أحدهما بأرقام والآخر بدونها'، مع شرائح تقرأ 9B مقابل 4B، واجهة API مستضافة مقابل أوزان مفتوحة، لا معايير منشورة مقابل Brier 0.347 وECE 0.065، وتذييل مصادر يشير إلى أن أرقام Microsoft غير مُعاد إنتاجها وأن أرقام InternLM مُبلَّغ عنها من المورّد.
Guides & Insights

Microsoft-Decision-1 مقابل Intern-Decision-4B: أحدهما ينشر معايرته، والآخر ينشر منهجيته

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Microsoft-Decision-1 بجانب Intern-Decision-4Bوستحصل على مقارنة يحسمها ليس مقدار القدرة بقدر ما يحسمها ما كان كل بائع مستعدًا لنشره. وصل نموذج Microsoft إلى التوفر العام على Microsoft Foundry في 8 أكتوبر 2026: قاعدة Qwen3.5-9B، مُدرَّب لاحقًا بواسطة Microsoft، نصي فقط، بسياق من 32,768 رمزًا، والأوزان غير موزَّعة، ومنهجية تقييم تصف الدقة وخطأ المعايرة والاختبارات الإحصائية المزدوجة — ولا نتيجة واحدة. أما Intern-Decision-4B من InternLM فقد طُرح على Hugging Face في 26 سبتمبر 2026 عند 05:36:37 UTC دون أي إعلان خلفه، وهو مُضبَّط بدقة انطلاقًا من Qwen3.5-4B، ويقبل الصور فضلًا عن النص، ويعمل خلال 44 ميلي ثانية على بطاقة RTX 4090 واحدة، ويطبع جدولًا كاملًا لأرقام Brier وخطأ المعايرة المتوقع. كلاهما يعيد توزيعًا احتماليًا على الخيارات التي تقدمها. وواحد فقط منهما يخبرك بمدى جودته في ذلك.

هذا الانقلاب — كون النموذج الأكبر والأفضل تمويلًا هو الغامض — هو كامل شكل هذه المواجهة، وهو يحسم الاختيار لمعظم الفرق أسرع من أي سطر مواصفات.

الرقم الوحيد الذي يفصل بينهما

يذكر InternLM أن Brier يساوي 0.347 وECE يساوي 0.065 بالنسبة إلى Intern-Decision-4B عبر مجموعة اختباراته المعيارية، بمتوسط درجات يبلغ 90.02 على Jevbench-Easy (100.00)، وJevbench-Original (98.61)، وJevbench-Hard (73.87)، وTyped Decision (80.55)، وToolACE (96.45)، وAG News (90.82)، وWildJailBreak (89.86). هذه أرقام أبلغ عنها البائع على منصة الاختبار الخاصة بالبائع نفسه، وصفوف Jevbench تحديدًا هي عائلة المعايير الخاصة بالمشروع نفسه — اقرأها كتقييم ذاتي، لا كتحقق مستقل. لكنها أرقام لها مقياس معلن، وECE تحديدًا هو الرقم الذي يخبرك ما إذا كانت قيمة مُعادة مثل 0.8 تستحق التصرف بناءً عليها.

لا تنشر Microsoft أي ما يعادله. تصف علامة التبويب "Benchmarks" في صفحة كتالوج Microsoft-Decision-1 ما جرى قياسه، وتزعم أن النموذج "يؤدي على قدم المساواة مع نماذج القرار الرائدة ويتقدم على نماذج القرار المفتوحة الأخرى التي جرى تقييمها بالمنهجية نفسها"، مع تسمية أقوى المجالات بأنها الاستدلال وتطبيق القواعد ومتانة تنسيق المطالبات، وأضعفها بأنها المعرفة المتخصصة بالمجال. لا Brier، ولا ECE، ولا جدول دقة. إذا كان قرار التبني لديك يحتاج إلى رقم معايرة قبل أن تتمكن من تحديد حجم عتبة التصعيد، فإن أحد هذين النموذجين يمنحك إياه، والآخر يطلب منك قياسه بنفسك.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

أين يختلف العقدان فعليًا

في الظاهر، تتلقى هذه النماذج الاستدعاء نفسه. أنت تزوّدها بحالة، ومخطط من أسئلة مسماة، ومجموعة ثابتة من الخيارات؛ فتحصل مقابل ذلك على احتمال لكل خيار دون أي رمز من نص مُولَّد. تظهر الفروق عند حدود ذلك العقد.

• الوسائط — Microsoft-Decision-1 نصي فقط بشكل صريح، ولا يقبل أو ينتج محتوى من الصور أو الصوت أو الفيديو. يقبل Intern-Decision-4B صورًا اختيارية إلى جانب الحالة، حتى ثماني صور لكل استدعاء، وهذا ما يجعله مرشحًا لفرز لقطات الشاشة، وفحوصات تخطيط المستندات، وتوجيه ضمان الجودة البصري.

• عدد الأسئلة — توثّق InternLM من سؤال واحد إلى 16 سؤالًا في كل استدعاء، بما يصل إلى 62 خيارًا لكل منها، عبر ثلاثة أنواع من الحقول (choice، score، noul). توثّق Microsoft التنسيقات — نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، وسلّم التقدير — واستدعاءً واحدًا على ما يصل إلى 32 ألف رمز، لكن ليس حدًا أقصى لعدد الأسئلة لكل استدعاء.

• السياق — تشير Microsoft إلى 32,768 توكنًا. وتذكر بطاقة Intern-Decision-4B حدودها بعدد الأسئلة والخيارات والصور بدلًا من رقم سياق واحد، لذا لا يمكنك المقارنة بينهما باستخدام رقم واحد.

• التوزيع — Microsoft-Decision-1 هو واجهة برمجة تطبيقات Foundry مستضافة؛ لا تُوزَّع أوزان النموذج ولا يوجد تنزيل. Intern-Decision-4B هو Apache-2.0 على Hugging Face مع الحفاظ على ترخيص Qwen الأصلي باسم LICENSE-QWEN، ما يعني الاحتفاظ بذلك الترخيص وإشعارات المصدر الأصلي إذا أعدت التوزيع.

• بنية التكلفة — لا تكلّف أوزان InternLM شيئًا عند التشغيل، وهي مُقاسة عند 44.16 مللي ثانية للمتوسط، و44.60 مللي ثانية للمئين 95، على بطاقة RTX 4090 واحدة. أما سعر مايكروسوفت لكل رمز فغير مطبوع على صفحة النموذج إطلاقًا.

• الحوكمة — تقدم Microsoft تقييمًا للذكاء الاصطناعي المسؤول، وممارسات نشر موثقة، واستثناءات صريحة (غير مخصص لتوليد النصوص، أو الأسئلة والأجوبة المفتوحة، أو المحادثة، أو الترجمة أو التلخيص؛ وألا يكون صانع القرار الآلي الوحيد في القرارات المصيرية المتعلقة بالأشخاص). تقدم InternLM بطاقة نموذج صريحة بشأن المصدر — أوزان "معدّلة بضبط القرار" — ولا شيء يشبه حزمة الامتثال.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

هناك سببان مختلفان جدًا يجعلان أرقام زمن الاستجابة صعبة المقارنة

لا تنشر Microsoft-Decision-1 أي رقم للكمون، لذا لا يوجد ما يُوضع إلى جانب متوسط InternLM البالغ 44.16 ms. وليس هذا إغفالاً هيّناً بالنسبة لعبء العمل هذا. فهذه النماذج موجودة لتُستدعى مرات عديدة داخل خط معالجة — مرة لكل مستند مسترجَع، ومرة لكل استدعاء أداة مقترَح، ومرة لكل استجابة قيد التقييم — والفرق بين أربعة قرارات في الثانية وأربعين قراراً هو الفرق بين تقييم عيّنة وتقييم كل شيء. رقم InternLM قابل للتحقيق اليوم على عتاد يمكنك استئجاره بالساعة؛ أما رقم Microsoft فيجب قياسه عبر نشر Foundry الخاص بك، وشكل النشر الذي تختاره (بلا خادم بالدفع حسب الاستخدام مقابل الإنتاجية المخصّصة) سيغيّره أكثر مما سيغيّره النموذج.

هنا أيضًا يصبح نصف OrcaRouter من هذا النمط ذا صلة، وهو النصف التوليدي فقط. نحن لا نستضيف Microsoft-Decision-1 أو Intern-Decision-4B — فالنموذج الذي يعيد احتمالات بدلًا من النص ليس شيئًا توجّه إليه إكمالات الدردشة، ولا يظهر أي منهما في كتالوجنا. ما يقف خلف مفتاحنا الواحد المتوافق مع OpenAI هو مجموعة تضم أكثر من 200 نموذج تتولى الكتابة: موجّه الحكم الذي يصوغه أحد النماذج، والإجابات المرشحة التي ينتجها نموذجان آخران، واستدعاء الأداة الذي يُقيَّم قبل تنفيذه. يُمرَّر سعر قائمة المزوّد بهامش ربح 0%، لذا يكون أي تخفيض سعر على نموذج توليدي ساريًا من جانبنا في اليوم نفسه، ويحافظ التحويل التلقائي عند الفشل على بقاء الجانب التوليدي في حلقة التقييم حيًّا عندما يتدهور مزوّد واحد — وهو أمر يهم أكثر من المعتاد هنا، لأن خط أنابيب يقيّم كل ما يراه لا يملك هامشًا لإعادة محاولة استدعاء متعطل.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

من ينبغي أن يأخذ أيًّا؟

اختر Intern-Decision-4B إذا كان أي مما يلي صحيحًا: تحتاج إلى تقييم الصور بالإضافة إلى النص، أو تحتاج إلى رقم معايرة قبل أن تتمكن من الشحن، أو تريد خيار تشغيل النموذج على عتادك الخاص داخل نطاق تتحكم به، أو تريد ضبطه الدقيق. النقطة الأخيرة تستحق التشديد — فمُقيِّم مفتوح الأوزان بحجم 4B مع غلاف موثّق هو نموذج يمكنك تكييفه مع تسمياتك الخاصة، بينما Microsoft-Decision-1 هو واجهة برمجة تطبيقات مستضافة بلا مسار للضبط الدقيق وبلا أوزان يمكن تكييفها.

اختر Microsoft-Decision-1 إذا كان العائق هو التوريد وليس الأداء: فأنت بحاجة إلى مصادقة Azure، وفوترة موحّدة، وحوكمة، وتقييم من المورّد للذكاء الاصطناعي المسؤول قبل أن يصل أي شيء إلى الإنتاج، وتحتاج إلى سياق بحجم 32K للمستندات الطويلة التي تُعقّدها حدود 4B لكل استدعاء. إنّ افتقاره إلى معايير مرجعية موسومة يُعد كلفة، لكنها كلفة يمكنك التخلص منها عبر تمرير مجموعتك الموسومة الخاصة بكلا الطرازين وECE — وهو ما ستفعله على أي حال عند مقارنة جدول أي من البائعين.

الإجابة غير المريحة هي أن كليهما رخيصان بما يكفي لاختبارهما لدرجة أن الجدال بالكاد يستحق العناء. يحتاج Intern-Decision-4B إلى GPU من المحتمل أنك تملكه بالفعل. يحتاج Microsoft-Decision-1 إلى نشر على Foundry وعينة من قراراتك الموسومة. مرّر بياناتك عبر كليهما، واحسب المعايرة على المجموعة الفرعية التي تهمك، ودع الأرقام تقرر — وهو، على نحو مناسب، بالضبط ما وُجدت هذه النماذج من أجله.