
Microsoft-Decision-1 مقابل Intern-Decision-0.8B: نصف أونصة من متاعب الجيلبريك في مواجهة فراغ مُستضاف
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 55 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
ابدأ بالعمود الذي كان منشور إطلاق سيغفله. Intern-Decision-0.8B — نموذج القرار الخاص بـ InternLM البالغ 852,985,920 معلمة، والمضبوط بدقة من Qwen3.5-0.8B والمرفوع إلى Hugging Face في 26 سبتمبر 2026 دون أي إعلان، ولا ورقة بحثية، ورابط GitHub لا يزال يعطي خطأ 404 — يُقاس عند 64.48 على WildJailBreak مقابل مرجع قدره 96.29 لـ Jev 1.13 من TypeSafe. هذا ليس فرقًا في التقريب. إنه انهيار في متانة الرفض لدى نموذج تتمثل مهمته كلها في الحكم على المدخلات، منشور على بطاقة المورّد نفسه، في جدول يعود معياره إلى منافس. ضع ذلك بجانب Microsoft-Decision-1، الذي أصبح متاحًا عمومًا على Microsoft Foundry في 8 أكتوبر 2026 كمُقيّم نصي فقط دُرِّب تدريبًا لاحقًا على Qwen3.5-9B بمنهجية تقييم موثّقة ولا نتيجة واحدة مطبوعة تحته، وستحصل على الشكل الحقيقي لهذه المواجهة. أحد هذين النموذجين سيخبرك برقم يجعله يبدو سيئًا. والآخر يخبرك بالمقاييس التي كان سيستخدمها.
هذا الانقلاب أكثر قيمة من ورقة المواصفات. كلا النموذجين يأخذ حالة ومجموعة أسئلة محدودة ويعيد احتمالات على خياراتك — لا يولّد أيٌّ منهما نصًا، وعلى هذا المحور هما من النوع نفسه من الأدوات. الاختلافات المهمة هي مَن يشغّله، وما حجمه، ومقدار ما يمكنك التحقق منه، وعمود سلامة واحد اختار النموذج الأصغر والأكثر هدوءًا والقابل للتنزيل بالكامل أن ينشره على أي حال.
ما الذي يعيده كل واحد منها فعليًا
Microsoft-Decision-1 واجهة برمجة تطبيقات مستضافة، وهذا هو الفرق البنيوي الأول. لا يتم توزيع الأوزان — فلا تنزيل، ولا مستودع، ولا مسار ضبط دقيق — والتكامل يعني نشر Foundry مع مصادقة Azure والفوترة والحوكمة المرتبطة. يشغّل تمريرة واحدة على ما يصل إلى 32,768 رمزًا، ويدعم أسئلة نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، والأسئلة ذات شكل معايير التقييم، وهو نصي فقط كمدخل ورقمي كمخرج. يدعم صراحةً خيار الامتناع مثل "لا يمكن الجزم" عندما تكون الأدلة غير كافية، وهذا ما يجعل للعتبة معنى.
إن Intern-Decision-0.8B هو الترتيب المعاكس. فهو أوزان Apache 2.0 مع الاحتفاظ بترخيص Qwen الأصلي إلى جانبها باسم LICENSE-QWEN، بنحو 1.73 GB من المستودع موزعة على ثلاثة أجزاء — جزء لغوي بحجم 1.50 GB، وجزء رؤية بحجم 176 MB، ومُسقِّط بحجم 25 MB — وهو ما يتّسع على وحدة GPU استهلاكية واحدة أو حاسوب محمول جيد التجهيز. وهو يقبل حالة، ومخططًا من سؤال واحد إلى ستة عشر سؤالًا مُسمّى مع ما يصل إلى 62 خيارًا لكل سؤال، واختياريًا ما يصل إلى ثماني صور، كما يوثّق ملف inference.py المرفق معه العقد بتفصيل أكبر مما تتكبد عناءه معظم النماذج المطروحة: تُعيَّن الخيارات على رموز أحادية الوحدة A–Z، ثم a–z، ثم 0–9؛ وتُقرأ logits عند الموضع الذي يسبق مباشرة كل <decision>عنصر نائب في هيكل مُصيَّر مسبقًا؛ ويُحسب softmax على المرشّحات القانونية لذلك الحقل فقط؛ وتُطبَّق درجة حرارة مُعايَرة.
الرخصتان ليستا الشراء نفسه. تمنحك Microsoft-Decision-1 نقطة نهاية مُدارة ولا تمنحك أي أصل تملكه. أما Intern-Decision-0.8B فتمنحك أصلًا تملكه، دون نقطة نهاية، ودون عقد دعم، ودون وثائق تتجاوز المستودع نفسه.

السقف، والمعايرة التي يمكنك تدقيقها
رقمان يحددان معظم عمليات التكامل الحقيقية، وكلاهما ينتمي إلى النموذج الصغير.
الأول هو 8,192 رمزًا. محرك الاستدلال الخاص بـ Intern-Decision-0.8B يرفض المدخلات المفرطة الحجم بدلاً من قطعها، وهو السلوك الصحيح لأداة التقييم وكذلك جدار صلب: لا توجد استراتيجية تقسيم تحافظ على العقد، لأن الحالة والمخطط والهيكل جميعها يجب أن تكون في تمريرة واحدة. الحد الأقصى لـ Microsoft-Decision-1 أعلى بأربع مرات عند 32,768، وهو حد مستضاف يمكنك رفعه من خلال التزويد بشكل مختلف بدلاً من كونه ثابتًا في ملف Python.
الثاني هو المعايرة، وهنا ينعكس الاتجاه. تنشر InternLM درجة حرارة مُلائمة تبلغ 2.747760550703 للنموذج 0.8B، مُختارة عن طريق تقليل NLL على 1,728 حالة معايرة مُخصصة مع الاحتفاظ بـ 1,693 للتحقق، مع توضيح البطاقة أن تسميات مجموعة الاختبار لم تُستخدم لاختيارها. التحويل المُطبق هو softmax على logits المرشحة للحقل يليه softmax ثانٍ على لوغاريتم ذلك التوزيع مقسومًا على درجة الحرارة. لأن التحويل يعمل بعد softmax الأول ويحافظ على الترتيب، فإنه لا يمكن أن يغيّر argmax على الإطلاق — إنه يحرّك الثقة، واحتمال نعم، والقيمة المتوقعة لسؤال الدرجة، ويترك التسمية كما هي. إذا كان خط أنابيبك يقرأ التسمية، فإن درجة الحرارة لا تأثير لها. إذا كان يقرأ الاحتمال، أو يضع عتبة له، أو يغذيه في حساب القيمة المتوقعة، فإن درجة الحرارة هي الفرق بين رقم له معنى ورقم لا معنى له. تمرير temperature=1 يعيد التوزيع غير المُعاير إذا كنت تفضّل ملاءمة توزيعك الخاص.
لا يوجد لـ Microsoft-Decision-1 مستند مكافئ. تنص علامة التبويب المقاييس الخاصة به على أن الدقة، وخطأ المعايرة، واستدعاء الأمان، ومعدلات الإيجابيات الكاذبة، واتساق العدالة تم قياسها على معايير قرارات عامة ومجتمعية بالإضافة إلى مجموعات اختبار داخلية محجوزة، وأن ترتيب الخيارات تم تغييره، وأن اختبارات إحصائية مقترنة تم تطبيقها، وأن النموذج "يؤدي على قدم المساواة مع نماذج القرارات الرائدة ومتقدمًا على نماذج القرارات المفتوحة الأخرى التي تم تقييمها بنفس المنهجية." لا يوجد خطأ معايرة مطبوع، ولا درجة حرارة، ولا درجة حرارة مطبوعة. الخاصية الوحيدة التي تجعل الاحتمال مفيدًا — ما إذا كان 0.8 يعني 0.8 — يتم التأكيد عليها دون قياس كمي.
اقرأ هاتين الفقرتين إحداهما في مقابل الأخرى، فيكفّ المقارنة عن أن تكون عن الحجم. فنسخة محفوظة بمعاملات 0.8 مليار يمكنك فحص معايرتها وتشغيل برمجياتها هي، بالنسبة لفريق تقييم، كائنٌ أقوى من واجهة برمجية مستضافة تكون معايرتها مجرد جملة واحدة. كما أن النموذج الصغير له رقم زمن الاستجابة مسجّل — 33.98 مللي ثانية للمتوسط، و33.44 مللي ثانية للوسيط، و37.50 مللي ثانية للمئين 95 لكل استعلام على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، وفق قياس InternLM نفسه — في حين أن رقم Microsoft هو شيء تقيسه أنت عبر نشرك الخاص، حيث سيكون أثر الاختيار بين بلا خادم والإنتاجية المخصّصة على الرقم أكبر من أثر النموذج نفسه.

حيث يخسر النموذج الصغير
لا شيء مما سبق يجعل Intern-Decision-0.8B الخيار الآمن، والجدول المنشور نفسه يوضح السبب. WildJailBreak عند 64.48 مقابل 96.29 لدى Jev، وهو ما يعني فجوة في متانة الرفض تبلغ ثلاثين نقطة في الفئة نفسها التي يواجه فيها المُقيّم مدخلات غير موثوقة. غالبًا ما يكون نموذج القرار هو المكوّن الذي يقرر ما إذا كان إجراء مقترح مسموحًا به؛ ومن السهل تجاوزه لفظيًا فيكون عبئًا في هذا المقعد. أما إن كان العجز راجعًا إلى قاعدة Qwen3.5-0.8B، أو إلى هدف ضبط القرار، أو إلى قلة عدد المعاملات، فهذا ليس ما يخبرك به المستودع، ولا توجد ورقة بحثية ولا وصفة تدريب ولا إفصاح عن البيانات يمكنها أن توضح ذلك.
باقي جدول InternLM الخاص أكثر تملقًا من ذلك العمود، ولا يزال متواضعًا. المتوسط عبر سبع مجموعات اختبار هو 79.38 للـ0.8B مقابل 84.68 لنظيره 2B الخاص به و90.02 للـ4B — العائلة تصعد بحدّة مع الحجم، وهي إشارة خفيفة إلى أن الجدول لم يُهندَس عكسيًا لتمجيد الطراز الرائد. يستقر AG News عند 88.61 مقابل 89.57 لدى Jev، أي متعادل فعليًا في تصنيف الموضوعات رباعي الفئات. وفيما يتعلق بالمعايرة، يُبلّغ الـ0.8B عن Brier قدره 0.530 وخطأ معايرة متوقع قدره 0.066، مقابل 0.358 و0.095 لدى Jev — ECE أفضل، ودقة أسوأ بدرجة معتبرة. هذا مظهر معقول لنموذج صغير بدرجة حرارة مُلاءَمة عمدًا، وهو ليس مزيجًا يمكن لفريق تسويق أن ينشره عن طريق الخطأ.
كذلك لا يوجد تاريخ إصدار، ولا إعلان، ولا مجموعة تجمع نقاط الحفظ الثلاث، ولا نقطة نهاية مستضافة في أي مكان، ولا أي تقييم مستقل من أي نوع. إن Space التجريبية ترد بالرمز 401. الوصف الصحيح لـ Intern-Decision-0.8B هو نقطة حفظ مُصدَرة ذات ادعاءات غير مُدققة — وهو وضع أفضل من واجهة برمجة تطبيقات مُدرجة في قائمة انتظار، لأنه يمكنك قياسه في فترة ما بعد الظهر، لكنه يعني أن عبء التحقق يقع عليك بالكامل.
الاختيار، وأين يقع OrcaRouter
خذ Microsoft-Decision-1 إذا كان العائق هو الشراء أو التوسع: فأنت تحتاج إلى مصادقة Azure، وفوترة موحّدة، وتقييم للذكاء الاصطناعي المسؤول قبل أن يصل أي شيء إلى الإنتاج؛ وتحتاج إلى سياق 32K؛ وتحتاج إلى نقطة نهاية لا تديرها بنفسك؛ أو تحتاج إلى مسار الامتناع مصمّمًا من الأساس بدل أن يكون مُصنّعًا يدويًا. واقبل في المقابل أنك لا تستطيع تشغيله، ولا ضبطه الدقيق، ولا فحص معايرته، وأنك ستقيس بنفسك ادعاءه الجوهري.
اختر Intern-Decision-0.8B إذا كان العائق هو التكلفة أو الذاكرة أو التحكم: فأنت تريد مقيّمًا بترخيص Apache-2.0 يتسع في 1.73 جيجابايت، ويعمل على أجهزة تملكها بالفعل، وينتج نفس التسمية في كل مرة، ويمكن استبداله بنظيره 2B أو 4B بتغيير مسار نقطة التحقق. اقبل في المقابل جدار الـ 8,192 رمزًا، وعمود WildJailBreak، وحقيقة أن لا أحد خارج InternLM قد أعاد إنتاج أي شيء على البطاقة.
التوصية الصادقة هي القيام بكليهما، لأنهما رخيصان بما يكفي لدرجة أن الجدال حولهما لا يستحق العناء تقريبًا. استدعاء التقييم نفسه ليس شيئًا نوجّهه — النموذج الذي يُرجع احتمالات بدلاً من نص ليس إكمال محادثة، ولا أياً من هذين موجود في كتالوجنا. ما يحمله OrcaRouter هو النصف الآخر من الحلقة: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI التي تصوغ معايير التقييم، أو تولّد الإجابات المرشحة، أو تصدر استدعاء الأداة الذي سيقيّمه المُقيِّم الخاص بك، بسعر قائمة المزوّد الممرر مع 0% هامش ربح، لذا فإن تخفيض سعر المورّد على أي مُولِّد يكون ساريًا من جانبنا في نفس اليوم. التبديل التلقائي عند الفشل يهم أكثر من المعتاد هنا، لأن خط الأنابيب الذي يقيّم كل ما يراه ليس لديه مجال لإعادة محاولة استدعاء متعثر، ولغة التوجيه DSL تتيح لك إرسال مطالبة حكم واحدة إلى عدة كُتّاب ودمج توافقهم بدلاً من الثقة بواحد فقط.

الخلاصة
أصبح Microsoft-Decision-1 متاحًا عمومًا على Microsoft Foundry في 8 أكتوبر 2026: مستضاف، نصي فقط، 32,768 رمزًا، مبني على Qwen3.5-9B، مع فقرة منهجية بدلًا من جدول قياسات أداء. إن Intern-Decision-0.8B هو نقطة تحقق بحجم 1.73 GB بترخيص Apache-2.0 رُفعت في 26 سبتمبر 2026، وتنشر Brier بقيمة 0.530، وECE بقيمة 0.066، ودرجة حرارة ملائمة قدرها 2.747760550703، و33.98 ms على 4090 — ودرجة WildJailBreak مقدارها 64.48 لم يطلب أحد منها طباعتها. إذا كان بإمكانك التحقق من شيء واحد فقط قبل تبنّي أي منهما، فتحقق من المعايرة على حالاتك الموسومة بنفسك؛ فهذا هو الرقم الذي تركه لك كلا المزوّدين لتجده.
