بطاقة عنوان مولّدة لـ Microsoft-Decision-1 مقابل Intern-Decision-2B، بعنوان فرعي 'نقطة التحقق الوسطى الأسرع في الإجابة والأسوأ في التعبير عن مدى ثقتها'، مع شرائح تعرض 2,213,241,664 معلمة، ودرجة حرارة 2.100509348278، وECE 0.100، و33.28 ms على 4090، وسقف 8,192 رمزًا.
Engineering & Research

Microsoft-Decision-1 مقابل Intern-Decision-2B: أسرع بتسع مللي ثانية وأسوأ معايرةً بشكل قابل للقياس

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يوجد رقم في جدول InternLM نفسه لا ينبغي أن يكون موجودًا، وهو السبب في أن هذه المقارنة تستحق أكثر من ورقة المواصفات. Intern-Decision-2B — 2,213,241,664 معاملًا، مُضبوط بدقة من Qwen/Qwen3.5-2B، ورُفع إلى Hugging Face في 26 سبتمبر 2026 الساعة 05:36:19 UTC دون إعلان — يسجل 33.28 مللي ثانية كمتوسط لزمن الاستجابة لكل استعلام على بطاقة RTX 4090 واحدة، وهو أسرع بفارق ضئيل من نظيره البالغ 852 مليون معامل عند 33.98 مللي ثانية. كما يسجل أسوأ معايرة في عائلتها: خطأ معايرة متوقع قدره 0.100 مقابل 0.066 لدى 0.8B، مع درجة حرارة مُلاءَمة قدرها 2.100509348278 مقابل 2.747760550703 لدى 0.8B. في المقابل، Microsoft-Decision-1، المتاح عمومًا على Microsoft Foundry منذ 8 أكتوبر 2026، لا ينشر أي رقم لزمن الاستجابة ولا أي خطأ معايرة على الإطلاق — فقط فقرة منهجية تصف كيف تم قياس كليهما. لذا فالسؤال الذي تطرحه هذه المواجهة حقًا ليس أيهما أفضل. بل ما الذي تشتريه عندما تشتري الحجم الأوسط من أي شيء.

كلا النموذجين مُقيّمان للقرارات: إدخال الحالة، وإدخال مجموعة أسئلة محددة، وإخراج احتمالات مُعايَرة، دون نص مُولَّد ودون رموز (tokens) لتحليلها. هذا العقد المشترك هو ما يجعل الفروق واضحة. Microsoft-Decision-1 هو واجهة برمجة تطبيقات Foundry مستضافة، نصية فقط، على أساس Qwen3.5-9B بنافذة سياق تبلغ 32,768 رمزًا، دون أوزان موزعة ودون مسار ضبط دقيق. Intern-Decision-2B هو نقطة حفظ Apache-2.0 مع الحفاظ على ترخيص Qwen الأصلي باسم LICENSE-QWEN، بحجم مستودع يقارب 4.46 GB، وكود استدلال مخصص، ودون أي نقطة نهاية مستضافة في أي مكان.

ما الغرض الفعلي من الحجم الأوسط

أطلقت ‏InternLM ثلاث نقاط حفظ في أربعين ثانية: نموذج ‏0.8B في 05:35:57، وهذا النموذج في 05:36:19، ونموذج ‏4B في 05:36:37. وعلى متوسط المجموعات السبع الخاص بالمورّد نفسه، تتدرّج العائلة بالترتيب الذي تأمله — 79.38، و84.68، و90.02 — وهو الموضع الوحيد الذي يبدو فيه نموذج ‏2B كخيار شراء معقول. أما في كل ما عدا ذلك، فيبدو كالحجم الذي ما كان أحد ليختاره عن قصد.

تهيمن معالجة المطالبة (prompt) على نداء القرار، وهذا هو التفسير الميكانيكي لانقلاب زمن الوصول لا لغز. يقوم المُقيِّم بتمريرة أمامية واحدة بالضبط عبر مطالبة يحدد طولها كل من الحالة والمخطط وأوصاف الخيارات — لا يحدده أبداً أي شيء يكتبه النموذج، لأنه لا يكتب شيئاً. في هذا النظام يكون عدد المعاملات تكلفة من الدرجة الثانية، لذا لا ينطبق السبب المعتاد للجوء إلى أصغر نقطة تحقق (checkpoint): فأنت لا توفر الوقت، بل توفر الذاكرة. يبلغ مستودع 0.8B بالكامل نحو 1.73 GB مقابل 4.46 GB لهذا النموذج، وهذا هو السبب الصادق لتفضيله. أما ادعاء 2B الحقيقي الوحيد فهو أنه يصادف أنه الأسرع بين السريعات، بفارق صغير بما يكفي ليكون ضجيجاً.

إذا وُضع في مقابل Microsoft-Decision-1، فذلك الادعاء يكاد يكون غير ذي صلة، لأن النموذجين ليسا في نظام زمن الوصول نفسه. سرعة نقطة النهاية المستضافة دالة على شكل النشر لديك — بلا خادم مقابل إنتاجية مخصصة على SKU القياسي نفسه — قبل أن تكون دالة على النموذج، ولا تنشر Microsoft أي رقم لكل استدعاء للمقارنة به. ما تنشره Microsoft هو قيد تشغيلي صارم يسير في الاتجاه المعاكس: الاستدلال الدفعي معطّل. لا توجد قناة دون اتصال لتوزيع تكلفة تشغيل تقييم جماعي عبرها، لذا تدفع منظومة Microsoft-Decision-1 التكلفة التفاعلية لكل قرار، بينما تدفع نقطة حفظ مستضافة ذاتيًا بساعات GPU سواء كانت تقوم بالتقييم أم لا.

عمود المعايرة، حيث يخسر الوسط

اقرأ بطاقات Intern-Decision الثلاث معًا، عندها تتوقف العائلة عن التصرف على نحو متوقع. الدقة رتيبة بدلالة الحجم؛ أما المعايرة فليست كذلك. تحمل فئة 2B قيمة ECE مقدارها 0.100 — وهي الأضعف بين الثلاث — ودرجة حرارة مُلائمة مقدارها 2.100509348278، أدنى بكثير من 2.747760550703 لدى فئة 0.8B. تُرشدك البطاقة إلى استخدام وحدة الاستدلال المرفقة مع الحجم الذي نزّلته، لأن المعايرات الافتراضية خاصة بكل نقطة حفظ (checkpoint)؛ وأي شخص ينسخ مغلّفًا من نظير إلى آخر يطبّق بصمت درجة الحرارة الخاطئة.

يستحق التحويل نفسه أن يُفهَم قبل أن تعتبر قيمة 0.100 تلك حكمًا على الأوزان. فهو softmax على logits المرشحة للحقل، يتبعه softmax ثانٍ على لوغاريتم ذلك التوزيع مقسومًا على درجة الحرارة. ولأنه يُنفَّذ بعد softmax الأول ويحافظ على الترتيب، فإنه لا يستطيع تغيير argmax إطلاقًا. إنه يحرّك الثقة، واحتمال الإجابة بنعم، والقيمة المتوقعة لسؤال تقييم، ويترك الوسم كما هو تمامًا. إذا كان مسارك يقرأ الوسوم، فإن درجة الحرارة بلا أثر، وECE مجرد فضول. وإذا كان مسارك يقرأ الاحتمالات — يضع لها عتبات، ويرتب حسبها، ويغذّيها في حساب قيمة متوقعة — فإن ECE بقيمة 0.100 هي الفرق بين عتبة تعني ما كتبته وأخرى لا تعنيه. والاستجابة الصحيحة هي أن تُلائم درجة حرارتك الخاصة على حالاتك الموسومة الخاصة، لا أن تستنتج أن الأوزان سيئة.

يطلب Microsoft-Decision-1 العمل نفسه بالضبط، لكن بنقطة انطلاق أقل. تذكر علامة التبويب Benchmarks الخاصة به أنه تم قياس الدقة، وخطأ المعايرة، واستدعاء السلامة، ومعدلات الإيجابية الكاذبة، واتساق العدالة على معايير قرارات عامة ومجتمعية، إضافة إلى مجموعات اختبار داخلية محجوزة، وأن ترتيب الخيارات تم تنويعه، وأنه طُبقت اختبارات إحصائية مقترنة، وأن النموذج "يؤدي على قدم المساواة مع نماذج القرار الرائدة ومتقدمًا على نماذج القرار المفتوحة الأخرى التي قُيّمت بالمنهجية نفسها". لا ECE. لا Brier. لا معامل درجة حرارة. لا جدول دقة. النموذج الذي تكون كل قيمة عرضه احتمالًا موثوقًا هو نفسه النموذج في هذه المقارنة الذي لا يملك أي رقم معايرة منشور على الإطلاق.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-2B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; context 32,768 tokens; modalities text only; batch inference disabled; calibration error not published; latency not published. Right column Intern-Decision-2B rows read: availability uploaded September 26, 2026; context 8,192 tokens with oversize input rejected; modalities text plus up to eight images; batch inference not applicable, self-hosted; ECE 0.100, the worst of its three siblings; 33.28 ms mean on a single RTX 4090, the fastest of the three. A footer line reads that the InternLM figures are vendor-reported and the 2B's fitted temperature is 2.100509348278.

حدود العقد: أربعة أشياء لن يفعلها النموذج المستضاف

يتعامل النموذجان مع ما يبدو أنه النداء نفسه، وتقع الاختلافات عند أطرافه.

• الوسائط — إن Microsoft-Decision-1 نصّي فقط بشكل صريح ولا يقبل أي صورة أو صوت أو فيديو. ويقبل Intern-Decision-2B ما يصل إلى ثماني صور إلى جانب الحالة، مما يجعله مرشحًا لفرز لقطات الشاشة وفحوصات التخطيط التي لا تستطيع واجهة API المستضافة تقديمها بأي دقة.

• سقف المدخلات ونمط الفشل — يشغّل Microsoft-Decision-1 استدعاءً واحدًا على ما يصل إلى 32,768 رمزًا. يعرّف Intern-Decision-2B DecisionEngine(max_length=8192) ويرفض المدخلات المفرطة الحجم بدلًا من اقتطاعها، وهو السلوك الصحيح لمقيّم، وهو أيضًا حائط صلب، لأن الحالة والمخطط والهيكل يجب أن تكون جميعها حاضرة في تمريرة واحدة؛ ولا تحافظ أي استراتيجية تقطيع على العقد.

• شكل الأسئلة — يوثّق InternLM من سؤال واحد إلى ستة عشر سؤالًا في كل استدعاء، بما يصل إلى 62 خيارًا لكل سؤال، عبر ثلاثة أنواع من الحقول (choice، score، noul)، حيث noul نوع ثنائي نعم/لا يُعيد احتمالًا، وscore يُعيد قيمة متوقعة مرجّحة بالاحتمال على مقياس تحدّده أنت. وتوثّق Microsoft الصيغ — نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، وسلّم التقدير — إضافةً إلى خيار امتناع مدعوم صراحةً مثل «لا يمكن الجزم» عندما تكون الأدلة غير كافية، وهو السطر الأكثر فائدة في الصفحة لأي شخص يكتب منطق التصعيد.

• السعر — لا تعرض صفحة طراز Microsoft-Decision-1 أي سعر؛ إذ تنتقل روابط التسعير إلى واجهة التسعير الخاصة بـ Microsoft، لذا فإن تكلفة كل قرار شيء تقرؤه من Azure أو من فاتورة، مع كون 0% منها قابلة للنسبة إلى رموز الإخراج لأنه لا توجد أي رموز إخراج. لا يكلّف Intern-Decision-2B شيئًا لكل نداء وكل شيء من حيث زمن GPU، وليس له مزوّد استضافة. تبلغ سعته التخزينية نحو 4.46 GB موزعة على شريحة لغوية بحجم 3.76 GB، وبرج رؤية بحجم 612.5 MB، ومُسقِط بحجم 50.3 MB.

ما هو المؤكَّد، وما هو مجرد كلام المورّد؟

إن الحفاظ على هاتين الفئتين منفصلتين هو كل الانضباط في هذه العائلة. يتم التأكيد من خلال قائمة ملفات أو استجابة HTTP: عدد المعاملات، خريطة الشظايا، زوج الترخيص، النموذج الأساسي، البنية الكامنة — Qwen3_5ForConditionalGeneration بـ 24 طبقة، وحجم مخفي 2,048، و8 رؤوس استعلام مقابل 2 رؤوس مفتاح-قيمة، وبُعد رأس 256، ونمط متكرر من ثلاث طبقات انتباه خطي إلى طبقة انتباه كامل واحدة، وطبقة واحدة محتفظ بها للتنبؤ متعدد الرموز، وسقف تضمين يبلغ 262,144 موضعًا يجعله سقف المحرك البالغ 8,192 رمزًا غير ذي أهمية عمليًا.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

مُبلَّغ عنها من المورّد وغير قابلة لإعادة الإنتاج: كل رقم دقة، وكل رقم كمون، ودرجة الحرارة. لا توجد ورقة بحثية، ولا مُدخَل على arXiv، ولا منشور إطلاق، ولا سجل تغييرات، ولا تقييم مستقل. ومساحة العرض التوضيحي تُرجع 401، ما يعني أنها ليست عامة لا أنها معطّلة. أما مستودع GitHub الذي ظهر بعد النموذج — ثلاث إيداعات، وشيفرة تدريب، وواجهتا استدلال خلفيتان، وحزمة تقييم تضم 10,751 صف اختبار، ومعيار معايرة من 96 حالة، ودليل إعادة إنتاج — فهو توثيق أكثر مما تحصل عليه معظم الإصدارات الهادئة، وهو لا يشحن أي أوزان، ولا بيانات تدريب، ولا ترخيص للشيفرة. ومايكروسوفت في موضع مختلف لكن مجاور: منهجيتها حقيقية وادّعاؤها نوعي، ولا أي من الشركتين في وضع يسمح حاليًا بأن يتحقق أحد من صلب ادّعائها غيرك أنت.

أين يقع OrcaRouter في مسار كهذا

لا يوجد أي من النموذجين في كتالوجنا، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بتوفرهما. النموذج الذي يعيد احتمالات بدلًا من نص ليس شيئًا تُوجَّه إليه إكمالات الدردشة، وهذا ينطبق على كليهما. ما نوفره فعلًا هو النصف التوليدي من الحلقة التي وُجدت تلك المُقيِّمات لخدمتها: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI، تكتب معيار التقييم، وتصوغ الإجابات المرشحة، وتُصدر استدعاء الأداة الذي يقيّمه مُقيِّم بعد ذلك قبل تنفيذه. يُمرَّر سعر القائمة الخاص بالمزوّد بهامش ربح 0%، لذا يصبح أي تخفيض سعر من المورّد على جانب التوليد ساريًا لدينا في اليوم نفسه، وإذا كنت تفضّل ألا تراهن على عتبتك بحَكَم واحد، فإن لغة النطاق (DSL) الخاصة بالتوجيه تجمع عدة نماذج في استدعاء واحد، ويُبلِغ دمج النماذج عن مدى اتفاقها كحقل يمكنك تقييمه. يحافظ التحويل التلقائي عند الفشل على بقاء ذلك الجانب حيًّا عندما يتدهور مزوّد واحد، وهذا يهم أكثر في حلقة تقيّم كل ما تراه مما يهم في حلقة تجيب مستخدمًا بين حين وآخر.

A screenshot of OrcaRouter's own model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 per million input tokens and $0.38 per million output tokens, and a P50 time to first token figure.

الخلاصة

أصبح Microsoft-Decision-1 متاحًا بشكل عام على Microsoft Foundry منذ 8 أكتوبر 2026: مستضاف، نصي فقط، 32,768 رمزًا، قاعدة Qwen3.5-9B مُدرَّبة لاحقًا بواسطة Microsoft، بلا أوزان موزعة، وقسم قياس أداء يوثّق منهجيته دون نشر رقم — بما في ذلك عدم وجود زمن استجابة، مع إيقاف الاستدلال الدفعي. Intern-Decision-2B هو نقطة تحقق Apache-2.0 بعدد معاملات 2,213,241,664 من 26 سبتمبر 2026، وهو الأسرع بين أشقائه الثلاثة عند 33.28 مللي ثانية على 4090 والأسوأ معايرة عند ECE قدره 0.100، مع درجة حرارة ملائمة مقدارها 2.100509348278 لا يمكنها تغيير تصنيف ولكنها ستغيّر كل ثقة تضع عليها عتبة. إذا كنت تريد الحجم الأوسط، فإن الحجة الصادقة لصالحه ضعيفة: ادفع 2.7 غيغابايت الإضافية مقابل دقة 4B أو اقبل بصمة 0.8B، وفي كلتا الحالتين اضبط معايرتك الخاصة قبل أن تقترب أي عتبة من الإنتاج.

ما نحملُه نحن هو النصف التوليدي من الحلقة التي وُجد هؤلاء المُقيّمون لخدمتها: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI التي تكتب معايير التقييم، وتصوغ الإجابات المرشحة، وتُصدر استدعاء الأداة الذي يُقيّمه المُقيّم بعد ذلك قبل تنفيذه.