بطاقة عنوان مُولَّدة لـ Microsoft-Decision-1 مقابل Intern-Decision-0.8B، بعنوان فرعي «مقيّم مستضاف بلا أرقام مقابل نقطة حفظ بحجم 1.73 GB تحمل رقمًا غير مُجْمِل»، مع شرائح تعرض: نقطة نهاية Foundry مقابل 852,985,920 معاملًا، وفقرة منهجية مقابل نتيجة WildJailBreak البالغة 64.48، و32,768 توكنًا مقابل سقف 8,192.
Guides & Insights

Microsoft-Decision-1 مقابل Intern-Decision-0.8B: نصف أونصة من متاعب الجيلبريك في مواجهة فراغ مُستضاف

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ابدأ بالعمود الذي كان منشور إطلاق سيغفله. Intern-Decision-0.8B — نموذج القرار الخاص بـ InternLM البالغ 852,985,920 معلمة، والمضبوط بدقة من Qwen3.5-0.8B والمرفوع إلى Hugging Face في 26 سبتمبر 2026 دون أي إعلان، ولا ورقة بحثية، ورابط GitHub لا يزال يعطي خطأ 404 — يُقاس عند 64.48 على WildJailBreak مقابل مرجع قدره 96.29 لـ Jev 1.13 من TypeSafe. هذا ليس فرقًا في التقريب. إنه انهيار في متانة الرفض لدى نموذج تتمثل مهمته كلها في الحكم على المدخلات، منشور على بطاقة المورّد نفسه، في جدول يعود معياره إلى منافس. ضع ذلك بجانب Microsoft-Decision-1، الذي أصبح متاحًا عمومًا على Microsoft Foundry في 8 أكتوبر 2026 كمُقيّم نصي فقط دُرِّب تدريبًا لاحقًا على Qwen3.5-9B بمنهجية تقييم موثّقة ولا نتيجة واحدة مطبوعة تحته، وستحصل على الشكل الحقيقي لهذه المواجهة. أحد هذين النموذجين سيخبرك برقم يجعله يبدو سيئًا. والآخر يخبرك بالمقاييس التي كان سيستخدمها.

هذا الانقلاب أكثر قيمة من ورقة المواصفات. كلا النموذجين يأخذ حالة ومجموعة أسئلة محدودة ويعيد احتمالات على خياراتك — لا يولّد أيٌّ منهما نصًا، وعلى هذا المحور هما من النوع نفسه من الأدوات. الاختلافات المهمة هي مَن يشغّله، وما حجمه، ومقدار ما يمكنك التحقق منه، وعمود سلامة واحد اختار النموذج الأصغر والأكثر هدوءًا والقابل للتنزيل بالكامل أن ينشره على أي حال.

ما الذي يعيده كل واحد منها فعليًا

Microsoft-Decision-1 واجهة برمجة تطبيقات مستضافة، وهذا هو الفرق البنيوي الأول. لا يتم توزيع الأوزان — فلا تنزيل، ولا مستودع، ولا مسار ضبط دقيق — والتكامل يعني نشر Foundry مع مصادقة Azure والفوترة والحوكمة المرتبطة. يشغّل تمريرة واحدة على ما يصل إلى 32,768 رمزًا، ويدعم أسئلة نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، والأسئلة ذات شكل معايير التقييم، وهو نصي فقط كمدخل ورقمي كمخرج. يدعم صراحةً خيار الامتناع مثل "لا يمكن الجزم" عندما تكون الأدلة غير كافية، وهذا ما يجعل للعتبة معنى.

إن Intern-Decision-0.8B هو الترتيب المعاكس. فهو أوزان Apache 2.0 مع الاحتفاظ بترخيص Qwen الأصلي إلى جانبها باسم LICENSE-QWEN، بنحو 1.73 GB من المستودع موزعة على ثلاثة أجزاء — جزء لغوي بحجم 1.50 GB، وجزء رؤية بحجم 176 MB، ومُسقِّط بحجم 25 MB — وهو ما يتّسع على وحدة GPU استهلاكية واحدة أو حاسوب محمول جيد التجهيز. وهو يقبل حالة، ومخططًا من سؤال واحد إلى ستة عشر سؤالًا مُسمّى مع ما يصل إلى 62 خيارًا لكل سؤال، واختياريًا ما يصل إلى ثماني صور، كما يوثّق ملف inference.py المرفق معه العقد بتفصيل أكبر مما تتكبد عناءه معظم النماذج المطروحة: تُعيَّن الخيارات على رموز أحادية الوحدة A–Z، ثم a–z، ثم 0–9؛ وتُقرأ logits عند الموضع الذي يسبق مباشرة كل <decision>عنصر نائب في هيكل مُصيَّر مسبقًا؛ ويُحسب softmax على المرشّحات القانونية لذلك الحقل فقط؛ وتُطبَّق درجة حرارة مُعايَرة.

الرخصتان ليستا الشراء نفسه. تمنحك Microsoft-Decision-1 نقطة نهاية مُدارة ولا تمنحك أي أصل تملكه. أما Intern-Decision-0.8B فتمنحك أصلًا تملكه، دون نقطة نهاية، ودون عقد دعم، ودون وثائق تتجاوز المستودع نفسه.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

السقف، والمعايرة التي يمكنك تدقيقها

رقمان يحددان معظم عمليات التكامل الحقيقية، وكلاهما ينتمي إلى النموذج الصغير.

الأول هو 8,192 رمزًا. محرك الاستدلال الخاص بـ Intern-Decision-0.8B يرفض المدخلات المفرطة الحجم بدلاً من قطعها، وهو السلوك الصحيح لأداة التقييم وكذلك جدار صلب: لا توجد استراتيجية تقسيم تحافظ على العقد، لأن الحالة والمخطط والهيكل جميعها يجب أن تكون في تمريرة واحدة. الحد الأقصى لـ Microsoft-Decision-1 أعلى بأربع مرات عند 32,768، وهو حد مستضاف يمكنك رفعه من خلال التزويد بشكل مختلف بدلاً من كونه ثابتًا في ملف Python.

الثاني هو المعايرة، وهنا ينعكس الاتجاه. تنشر InternLM درجة حرارة مُلائمة تبلغ 2.747760550703 للنموذج 0.8B، مُختارة عن طريق تقليل NLL على 1,728 حالة معايرة مُخصصة مع الاحتفاظ بـ 1,693 للتحقق، مع توضيح البطاقة أن تسميات مجموعة الاختبار لم تُستخدم لاختيارها. التحويل المُطبق هو softmax على logits المرشحة للحقل يليه softmax ثانٍ على لوغاريتم ذلك التوزيع مقسومًا على درجة الحرارة. لأن التحويل يعمل بعد softmax الأول ويحافظ على الترتيب، فإنه لا يمكن أن يغيّر argmax على الإطلاق — إنه يحرّك الثقة، واحتمال نعم، والقيمة المتوقعة لسؤال الدرجة، ويترك التسمية كما هي. إذا كان خط أنابيبك يقرأ التسمية، فإن درجة الحرارة لا تأثير لها. إذا كان يقرأ الاحتمال، أو يضع عتبة له، أو يغذيه في حساب القيمة المتوقعة، فإن درجة الحرارة هي الفرق بين رقم له معنى ورقم لا معنى له. تمرير temperature=1 يعيد التوزيع غير المُعاير إذا كنت تفضّل ملاءمة توزيعك الخاص.

لا يوجد لـ Microsoft-Decision-1 مستند مكافئ. تنص علامة التبويب المقاييس الخاصة به على أن الدقة، وخطأ المعايرة، واستدعاء الأمان، ومعدلات الإيجابيات الكاذبة، واتساق العدالة تم قياسها على معايير قرارات عامة ومجتمعية بالإضافة إلى مجموعات اختبار داخلية محجوزة، وأن ترتيب الخيارات تم تغييره، وأن اختبارات إحصائية مقترنة تم تطبيقها، وأن النموذج "يؤدي على قدم المساواة مع نماذج القرارات الرائدة ومتقدمًا على نماذج القرارات المفتوحة الأخرى التي تم تقييمها بنفس المنهجية." لا يوجد خطأ معايرة مطبوع، ولا درجة حرارة، ولا درجة حرارة مطبوعة. الخاصية الوحيدة التي تجعل الاحتمال مفيدًا — ما إذا كان 0.8 يعني 0.8 — يتم التأكيد عليها دون قياس كمي.

اقرأ هاتين الفقرتين إحداهما في مقابل الأخرى، فيكفّ المقارنة عن أن تكون عن الحجم. فنسخة محفوظة بمعاملات 0.8 مليار يمكنك فحص معايرتها وتشغيل برمجياتها هي، بالنسبة لفريق تقييم، كائنٌ أقوى من واجهة برمجية مستضافة تكون معايرتها مجرد جملة واحدة. كما أن النموذج الصغير له رقم زمن الاستجابة مسجّل — 33.98 مللي ثانية للمتوسط، و33.44 مللي ثانية للوسيط، و37.50 مللي ثانية للمئين 95 لكل استعلام على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، وفق قياس InternLM نفسه — في حين أن رقم Microsoft هو شيء تقيسه أنت عبر نشرك الخاص، حيث سيكون أثر الاختيار بين بلا خادم والإنتاجية المخصّصة على الرقم أكبر من أثر النموذج نفسه.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

حيث يخسر النموذج الصغير

لا شيء مما سبق يجعل Intern-Decision-0.8B الخيار الآمن، والجدول المنشور نفسه يوضح السبب. WildJailBreak عند 64.48 مقابل 96.29 لدى Jev، وهو ما يعني فجوة في متانة الرفض تبلغ ثلاثين نقطة في الفئة نفسها التي يواجه فيها المُقيّم مدخلات غير موثوقة. غالبًا ما يكون نموذج القرار هو المكوّن الذي يقرر ما إذا كان إجراء مقترح مسموحًا به؛ ومن السهل تجاوزه لفظيًا فيكون عبئًا في هذا المقعد. أما إن كان العجز راجعًا إلى قاعدة Qwen3.5-0.8B، أو إلى هدف ضبط القرار، أو إلى قلة عدد المعاملات، فهذا ليس ما يخبرك به المستودع، ولا توجد ورقة بحثية ولا وصفة تدريب ولا إفصاح عن البيانات يمكنها أن توضح ذلك.

باقي جدول InternLM الخاص أكثر تملقًا من ذلك العمود، ولا يزال متواضعًا. المتوسط عبر سبع مجموعات اختبار هو 79.38 للـ0.8B مقابل 84.68 لنظيره 2B الخاص به و90.02 للـ4B — العائلة تصعد بحدّة مع الحجم، وهي إشارة خفيفة إلى أن الجدول لم يُهندَس عكسيًا لتمجيد الطراز الرائد. يستقر AG News عند 88.61 مقابل 89.57 لدى Jev، أي متعادل فعليًا في تصنيف الموضوعات رباعي الفئات. وفيما يتعلق بالمعايرة، يُبلّغ الـ0.8B عن Brier قدره 0.530 وخطأ معايرة متوقع قدره 0.066، مقابل 0.358 و0.095 لدى Jev — ECE أفضل، ودقة أسوأ بدرجة معتبرة. هذا مظهر معقول لنموذج صغير بدرجة حرارة مُلاءَمة عمدًا، وهو ليس مزيجًا يمكن لفريق تسويق أن ينشره عن طريق الخطأ.

كذلك لا يوجد تاريخ إصدار، ولا إعلان، ولا مجموعة تجمع نقاط الحفظ الثلاث، ولا نقطة نهاية مستضافة في أي مكان، ولا أي تقييم مستقل من أي نوع. إن Space التجريبية ترد بالرمز 401. الوصف الصحيح لـ Intern-Decision-0.8B هو نقطة حفظ مُصدَرة ذات ادعاءات غير مُدققة — وهو وضع أفضل من واجهة برمجة تطبيقات مُدرجة في قائمة انتظار، لأنه يمكنك قياسه في فترة ما بعد الظهر، لكنه يعني أن عبء التحقق يقع عليك بالكامل.

الاختيار، وأين يقع OrcaRouter

خذ Microsoft-Decision-1 إذا كان العائق هو الشراء أو التوسع: فأنت تحتاج إلى مصادقة Azure، وفوترة موحّدة، وتقييم للذكاء الاصطناعي المسؤول قبل أن يصل أي شيء إلى الإنتاج؛ وتحتاج إلى سياق 32K؛ وتحتاج إلى نقطة نهاية لا تديرها بنفسك؛ أو تحتاج إلى مسار الامتناع مصمّمًا من الأساس بدل أن يكون مُصنّعًا يدويًا. واقبل في المقابل أنك لا تستطيع تشغيله، ولا ضبطه الدقيق، ولا فحص معايرته، وأنك ستقيس بنفسك ادعاءه الجوهري.

اختر Intern-Decision-0.8B إذا كان العائق هو التكلفة أو الذاكرة أو التحكم: فأنت تريد مقيّمًا بترخيص Apache-2.0 يتسع في 1.73 جيجابايت، ويعمل على أجهزة تملكها بالفعل، وينتج نفس التسمية في كل مرة، ويمكن استبداله بنظيره 2B أو 4B بتغيير مسار نقطة التحقق. اقبل في المقابل جدار الـ 8,192 رمزًا، وعمود WildJailBreak، وحقيقة أن لا أحد خارج InternLM قد أعاد إنتاج أي شيء على البطاقة.

التوصية الصادقة هي القيام بكليهما، لأنهما رخيصان بما يكفي لدرجة أن الجدال حولهما لا يستحق العناء تقريبًا. استدعاء التقييم نفسه ليس شيئًا نوجّهه — النموذج الذي يُرجع احتمالات بدلاً من نص ليس إكمال محادثة، ولا أياً من هذين موجود في كتالوجنا. ما يحمله OrcaRouter هو النصف الآخر من الحلقة: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI التي تصوغ معايير التقييم، أو تولّد الإجابات المرشحة، أو تصدر استدعاء الأداة الذي سيقيّمه المُقيِّم الخاص بك، بسعر قائمة المزوّد الممرر مع 0% هامش ربح، لذا فإن تخفيض سعر المورّد على أي مُولِّد يكون ساريًا من جانبنا في نفس اليوم. التبديل التلقائي عند الفشل يهم أكثر من المعتاد هنا، لأن خط الأنابيب الذي يقيّم كل ما يراه ليس لديه مجال لإعادة محاولة استدعاء متعثر، ولغة التوجيه DSL تتيح لك إرسال مطالبة حكم واحدة إلى عدة كُتّاب ودمج توافقهم بدلاً من الثقة بواحد فقط.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

الخلاصة

أصبح Microsoft-Decision-1 متاحًا عمومًا على Microsoft Foundry في 8 أكتوبر 2026: مستضاف، نصي فقط، 32,768 رمزًا، مبني على Qwen3.5-9B، مع فقرة منهجية بدلًا من جدول قياسات أداء. إن Intern-Decision-0.8B هو نقطة تحقق بحجم 1.73 GB بترخيص Apache-2.0 رُفعت في 26 سبتمبر 2026، وتنشر Brier بقيمة 0.530، وECE بقيمة 0.066، ودرجة حرارة ملائمة قدرها 2.747760550703، و33.98 ms على 4090 — ودرجة WildJailBreak مقدارها 64.48 لم يطلب أحد منها طباعتها. إذا كان بإمكانك التحقق من شيء واحد فقط قبل تبنّي أي منهما، فتحقق من المعايرة على حالاتك الموسومة بنفسك؛ فهذا هو الرقم الذي تركه لك كلا المزوّدين لتجده.