
Microsoft-Decision-1 مقابل Intern-Decision-4B: أحدهما ينشر معايرته، والآخر ينشر منهجيته
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
ضع Microsoft-Decision-1 بجانب Intern-Decision-4Bوستحصل على مقارنة يحسمها ليس مقدار القدرة بقدر ما يحسمها ما كان كل بائع مستعدًا لنشره. وصل نموذج Microsoft إلى التوفر العام على Microsoft Foundry في 8 أكتوبر 2026: قاعدة Qwen3.5-9B، مُدرَّب لاحقًا بواسطة Microsoft، نصي فقط، بسياق من 32,768 رمزًا، والأوزان غير موزَّعة، ومنهجية تقييم تصف الدقة وخطأ المعايرة والاختبارات الإحصائية المزدوجة — ولا نتيجة واحدة. أما Intern-Decision-4B من InternLM فقد طُرح على Hugging Face في 26 سبتمبر 2026 عند 05:36:37 UTC دون أي إعلان خلفه، وهو مُضبَّط بدقة انطلاقًا من Qwen3.5-4B، ويقبل الصور فضلًا عن النص، ويعمل خلال 44 ميلي ثانية على بطاقة RTX 4090 واحدة، ويطبع جدولًا كاملًا لأرقام Brier وخطأ المعايرة المتوقع. كلاهما يعيد توزيعًا احتماليًا على الخيارات التي تقدمها. وواحد فقط منهما يخبرك بمدى جودته في ذلك.
هذا الانقلاب — كون النموذج الأكبر والأفضل تمويلًا هو الغامض — هو كامل شكل هذه المواجهة، وهو يحسم الاختيار لمعظم الفرق أسرع من أي سطر مواصفات.
الرقم الوحيد الذي يفصل بينهما
يذكر InternLM أن Brier يساوي 0.347 وECE يساوي 0.065 بالنسبة إلى Intern-Decision-4B عبر مجموعة اختباراته المعيارية، بمتوسط درجات يبلغ 90.02 على Jevbench-Easy (100.00)، وJevbench-Original (98.61)، وJevbench-Hard (73.87)، وTyped Decision (80.55)، وToolACE (96.45)، وAG News (90.82)، وWildJailBreak (89.86). هذه أرقام أبلغ عنها البائع على منصة الاختبار الخاصة بالبائع نفسه، وصفوف Jevbench تحديدًا هي عائلة المعايير الخاصة بالمشروع نفسه — اقرأها كتقييم ذاتي، لا كتحقق مستقل. لكنها أرقام لها مقياس معلن، وECE تحديدًا هو الرقم الذي يخبرك ما إذا كانت قيمة مُعادة مثل 0.8 تستحق التصرف بناءً عليها.
لا تنشر Microsoft أي ما يعادله. تصف علامة التبويب "Benchmarks" في صفحة كتالوج Microsoft-Decision-1 ما جرى قياسه، وتزعم أن النموذج "يؤدي على قدم المساواة مع نماذج القرار الرائدة ويتقدم على نماذج القرار المفتوحة الأخرى التي جرى تقييمها بالمنهجية نفسها"، مع تسمية أقوى المجالات بأنها الاستدلال وتطبيق القواعد ومتانة تنسيق المطالبات، وأضعفها بأنها المعرفة المتخصصة بالمجال. لا Brier، ولا ECE، ولا جدول دقة. إذا كان قرار التبني لديك يحتاج إلى رقم معايرة قبل أن تتمكن من تحديد حجم عتبة التصعيد، فإن أحد هذين النموذجين يمنحك إياه، والآخر يطلب منك قياسه بنفسك.

أين يختلف العقدان فعليًا
في الظاهر، تتلقى هذه النماذج الاستدعاء نفسه. أنت تزوّدها بحالة، ومخطط من أسئلة مسماة، ومجموعة ثابتة من الخيارات؛ فتحصل مقابل ذلك على احتمال لكل خيار دون أي رمز من نص مُولَّد. تظهر الفروق عند حدود ذلك العقد.
• الوسائط — Microsoft-Decision-1 نصي فقط بشكل صريح، ولا يقبل أو ينتج محتوى من الصور أو الصوت أو الفيديو. يقبل Intern-Decision-4B صورًا اختيارية إلى جانب الحالة، حتى ثماني صور لكل استدعاء، وهذا ما يجعله مرشحًا لفرز لقطات الشاشة، وفحوصات تخطيط المستندات، وتوجيه ضمان الجودة البصري.
• عدد الأسئلة — توثّق InternLM من سؤال واحد إلى 16 سؤالًا في كل استدعاء، بما يصل إلى 62 خيارًا لكل منها، عبر ثلاثة أنواع من الحقول (choice، score، noul). توثّق Microsoft التنسيقات — نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، وسلّم التقدير — واستدعاءً واحدًا على ما يصل إلى 32 ألف رمز، لكن ليس حدًا أقصى لعدد الأسئلة لكل استدعاء.
• السياق — تشير Microsoft إلى 32,768 توكنًا. وتذكر بطاقة Intern-Decision-4B حدودها بعدد الأسئلة والخيارات والصور بدلًا من رقم سياق واحد، لذا لا يمكنك المقارنة بينهما باستخدام رقم واحد.
• التوزيع — Microsoft-Decision-1 هو واجهة برمجة تطبيقات Foundry مستضافة؛ لا تُوزَّع أوزان النموذج ولا يوجد تنزيل. Intern-Decision-4B هو Apache-2.0 على Hugging Face مع الحفاظ على ترخيص Qwen الأصلي باسم LICENSE-QWEN، ما يعني الاحتفاظ بذلك الترخيص وإشعارات المصدر الأصلي إذا أعدت التوزيع.
• بنية التكلفة — لا تكلّف أوزان InternLM شيئًا عند التشغيل، وهي مُقاسة عند 44.16 مللي ثانية للمتوسط، و44.60 مللي ثانية للمئين 95، على بطاقة RTX 4090 واحدة. أما سعر مايكروسوفت لكل رمز فغير مطبوع على صفحة النموذج إطلاقًا.
• الحوكمة — تقدم Microsoft تقييمًا للذكاء الاصطناعي المسؤول، وممارسات نشر موثقة، واستثناءات صريحة (غير مخصص لتوليد النصوص، أو الأسئلة والأجوبة المفتوحة، أو المحادثة، أو الترجمة أو التلخيص؛ وألا يكون صانع القرار الآلي الوحيد في القرارات المصيرية المتعلقة بالأشخاص). تقدم InternLM بطاقة نموذج صريحة بشأن المصدر — أوزان "معدّلة بضبط القرار" — ولا شيء يشبه حزمة الامتثال.

هناك سببان مختلفان جدًا يجعلان أرقام زمن الاستجابة صعبة المقارنة
لا تنشر Microsoft-Decision-1 أي رقم للكمون، لذا لا يوجد ما يُوضع إلى جانب متوسط InternLM البالغ 44.16 ms. وليس هذا إغفالاً هيّناً بالنسبة لعبء العمل هذا. فهذه النماذج موجودة لتُستدعى مرات عديدة داخل خط معالجة — مرة لكل مستند مسترجَع، ومرة لكل استدعاء أداة مقترَح، ومرة لكل استجابة قيد التقييم — والفرق بين أربعة قرارات في الثانية وأربعين قراراً هو الفرق بين تقييم عيّنة وتقييم كل شيء. رقم InternLM قابل للتحقيق اليوم على عتاد يمكنك استئجاره بالساعة؛ أما رقم Microsoft فيجب قياسه عبر نشر Foundry الخاص بك، وشكل النشر الذي تختاره (بلا خادم بالدفع حسب الاستخدام مقابل الإنتاجية المخصّصة) سيغيّره أكثر مما سيغيّره النموذج.
هنا أيضًا يصبح نصف OrcaRouter من هذا النمط ذا صلة، وهو النصف التوليدي فقط. نحن لا نستضيف Microsoft-Decision-1 أو Intern-Decision-4B — فالنموذج الذي يعيد احتمالات بدلًا من النص ليس شيئًا توجّه إليه إكمالات الدردشة، ولا يظهر أي منهما في كتالوجنا. ما يقف خلف مفتاحنا الواحد المتوافق مع OpenAI هو مجموعة تضم أكثر من 200 نموذج تتولى الكتابة: موجّه الحكم الذي يصوغه أحد النماذج، والإجابات المرشحة التي ينتجها نموذجان آخران، واستدعاء الأداة الذي يُقيَّم قبل تنفيذه. يُمرَّر سعر قائمة المزوّد بهامش ربح 0%، لذا يكون أي تخفيض سعر على نموذج توليدي ساريًا من جانبنا في اليوم نفسه، ويحافظ التحويل التلقائي عند الفشل على بقاء الجانب التوليدي في حلقة التقييم حيًّا عندما يتدهور مزوّد واحد — وهو أمر يهم أكثر من المعتاد هنا، لأن خط أنابيب يقيّم كل ما يراه لا يملك هامشًا لإعادة محاولة استدعاء متعطل.

من ينبغي أن يأخذ أيًّا؟
اختر Intern-Decision-4B إذا كان أي مما يلي صحيحًا: تحتاج إلى تقييم الصور بالإضافة إلى النص، أو تحتاج إلى رقم معايرة قبل أن تتمكن من الشحن، أو تريد خيار تشغيل النموذج على عتادك الخاص داخل نطاق تتحكم به، أو تريد ضبطه الدقيق. النقطة الأخيرة تستحق التشديد — فمُقيِّم مفتوح الأوزان بحجم 4B مع غلاف موثّق هو نموذج يمكنك تكييفه مع تسمياتك الخاصة، بينما Microsoft-Decision-1 هو واجهة برمجة تطبيقات مستضافة بلا مسار للضبط الدقيق وبلا أوزان يمكن تكييفها.
اختر Microsoft-Decision-1 إذا كان العائق هو التوريد وليس الأداء: فأنت بحاجة إلى مصادقة Azure، وفوترة موحّدة، وحوكمة، وتقييم من المورّد للذكاء الاصطناعي المسؤول قبل أن يصل أي شيء إلى الإنتاج، وتحتاج إلى سياق بحجم 32K للمستندات الطويلة التي تُعقّدها حدود 4B لكل استدعاء. إنّ افتقاره إلى معايير مرجعية موسومة يُعد كلفة، لكنها كلفة يمكنك التخلص منها عبر تمرير مجموعتك الموسومة الخاصة بكلا الطرازين وECE — وهو ما ستفعله على أي حال عند مقارنة جدول أي من البائعين.
الإجابة غير المريحة هي أن كليهما رخيصان بما يكفي لاختبارهما لدرجة أن الجدال بالكاد يستحق العناء. يحتاج Intern-Decision-4B إلى GPU من المحتمل أنك تملكه بالفعل. يحتاج Microsoft-Decision-1 إلى نشر على Foundry وعينة من قراراتك الموسومة. مرّر بياناتك عبر كليهما، واحسب المعايرة على المجموعة الفرعية التي تهمك، ودع الأرقام تقرر — وهو، على نحو مناسب، بالضبط ما وُجدت هذه النماذج من أجله.
