
Microsoft-Decision-1: نموذج Microsoft الذي يجيب برقم بدلاً من جملة
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 74 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
يحتوي Microsoft-Decision-1 على سطر في بطاقة نموذجه لم يحمله أي نموذج Microsoft آخر على الإطلاق: غير مصمم لتوليد النصوص. أصبح النموذج متاحًا بشكل عام على Microsoft Foundry في 8 أكتوبر 2026، وهو تضييق متعمد لما صُمم له نموذج اللغة. تعطيه موقفًا وسؤالًا مع قائمة ثابتة من الإجابات — نعم/لا، مجموعة اختيار من متعدد، مقياس تقييم، أو معيار تقييم — فيعيد احتمالًا معايرًا لكل خيار. لا نثر. لا شرح. لا حقل مبررات. الناتج أرقام JSON ولا شيء آخر. وهو مبني على النموذج مفتوح الأوزان Qwen3.5-9B، ودرّبته Microsoft تدريبًا لاحقًا، وتقول Microsoft إنها ستُعيد تأسيس النموذج على هياكل أساسية أخرى لاحقًا، وتذكر MAI ونماذج شركاء أخرى.
هذا منتج أغرب مما يبدو للوهلة الأولى. يستند موقع مايكروسوفت التنافسي في 2026 إلى نماذج الدردشة المتقدمة وإلى Copilot، وMicrosoft-Decision-1 نقيض كليهما: مُقيِّم متوسط الحجم أحادي الغرض، مهمته كلها أن يخبر تطبيقًا أيًّا من خياراتك أنت الأرجح أن يكون صحيحًا، وما مدى ثقته في ذلك. السؤال المثير ليس ما إذا كان جيدًا في الكتابة — فهو سيئ فيها صراحةً ولا يحاول أن يكون غير ذلك — بل ما إذا كان توزيع احتمالي على الخيارات عنصرًا أوليًا أكثر فائدة لأعباء العمل التي تشغّلها المؤسسات فعليًا من نموذج آخر عام الغرض مزود بوضع JSON.
ما الذي يفعله، على وجه الدقة
العقد هو: استدعاء واحد للداخل، وتوزيع واحد للخارج. تسرد Microsoft صيغ الأسئلة المدعومة على أنها نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، والمستندة إلى معايير التقييم. كل خيار يحصل على درجة. يعمل النموذج في استدعاء واحد على مدخلات تصل إلى 32 ألف رمز — و32,768 هي نافذة السياق المعلنة — والحد العملي الأقصى هو المدخلات بالإضافة إلى مجموعة الخيارات، وليس ميزانية توليد، لأنه لا يوجد توليد.
حالات الاستخدام المنشورة هي تلك التي سيتعرّف عليها فريق المنصة فورًا:
• تقييم مخرجات الذكاء الاصطناعي — قيّم استجابةً مولّدة وفق معيار تقييم مُقدَّم، أو قرّر ما إذا كانت مستندةً إلى الأدلة التي أُعطيت لها.
• التصنيف والتوجيه — تصنيف الطلب، والحكم على مدى صلته، وفرز قائمة الانتظار، واختيار فرع سير العمل.
• ضوابط أمان الوكيل — قيّم استدعاء أداة أو إجراء وكيل مُقترحًا قبل أن يسمح تطبيق التكامل بتنفيذه.
• فحص سلامة المحتوى — وضع علامة على المحتوى وفقًا للحدود التي يحددها التطبيق، بدلًا من سياسة ثابتة من المورّد.
• البحث ومدى صلة المستند — احكم على ما إذا كان المستند المسترجع يجيب عن سؤال مقدم.
• الأتمتة القائمة على الثقة — القبول التلقائي للنتائج ذات الثقة العالية وتصعيد الباقي إلى إنسان.
خيار الامتناع هو التفصيل الجدير بالملاحظة. يدعم Microsoft صراحةً خيارات مثل «لا يمكن الجزم» عندما تكون الأدلة المقدَّمة غير كافية، وهذا هو الفرق بين مُقيِّم معاير ومُقيِّم واثق فحسب. ولأن الدرجات تعود كأرقام، فإن عتبة التصعيد قرار تملكه أنت — أنت تحدد متى يُرسل 0.7 شيئًا إلى شخص بينما 0.95 لا يفعل ذلك.
ما الذي لن يفعله
Microsoft صريحة بشكل غير عادي بشأن الاستثناءات، وهي أكثر أهمية من قائمة الميزات لأي شخص يقيس هذا لخط أنابيب حقيقي. Microsoft-Decision-1 ليس مصممًا لتوليد النص، أو الإجابة على الأسئلة المفتوحة، أو المحادثة، أو الترجمة، أو التلخيص. وهو غير مخصص للمهام التي لا تحتوي على سؤال مغلق ومجموعة محددة من خيارات الإجابة، أو للمهام التي تتطلب معرفة غائبة عن المدخلات. وهو نصي فقط: لا صور أو صوت أو فيديو في المدخلات، ولا شيء في المخرجات. وهو لا يقدم أي تفسيرات أو مبررات.
اقرأ تلك معًا، فيظهر حدّ يسهل التعثر به. هذا ليس روبوت محادثة يمكنك أن تطلب منه أن يصنّف الأشياء أيضًا، وليس مُلخِّصًا يمكنك أن تربط به درجة. إنها دالة تقييم ذات ميزانية رموز. وصياغة الفريق نفسها — بأنه لا ينبغي أن يكون صانع القرار الآلي الوحيد في القرارات المصيرية المتعلقة بالأشخاص، ولا ينبغي أن يكون الأساس الوحيد للقرارات التي تشمل الائتمان، والتوظيف، والإسكان، والتأمين، والتعليم، والرعاية الصحية، والحقوق القانونية «أو مجالات مصيرية مماثلة» — تشير في الاتجاه نفسه. وقد صُممت لتقف إلى جانب القرار، لا لتكون هي القرار.

وضع المعايير المرجعية هو القصة التي لا يريد أحد نشرها
لا توجد أرقام. تحتوي صفحة كتالوج Microsoft Foundry الخاصة بـ Microsoft-Decision-1 على علامة تبويب Benchmarks، وهي خالية من الأرقام. وما تحتوي عليه بدلاً من ذلك هو فقرة منهجية وادعاء نوعي: فقد جرى «تقييم النموذج على معايير قرارات عامة ومجتمعية وعلى مجموعات اختبار داخلية محجوزة لم تُستخدم في التدريب»، وتفيد Microsoft بأنه «يؤدي على قدم المساواة مع نماذج القرار الرائدة ومتقدماً على نماذج القرار المفتوحة الأخرى التي قُيّمت بالمنهجية نفسها»، وكانت المقاييس المستخدمة هي الدقة، وخطأ المعايرة، واستدعاء السلامة، ومعدلات الإيجابيات الكاذبة، واتساق العدالة، مع تغيير ترتيب الخيارات وتطبيق اختبارات إحصائية مقترنة.

هذا وصف منهجي جاد مرفق بصفر نتائج منشورة. وهو يعني أن كل ادعاء أداء بشأن Microsoft-Decision-1 اليوم مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه، وأن الموقف الصادق لأي شخص يقيّمه هو أن المعايرة — الخاصية الوحيدة التي تجعل الاحتمال مفيدًا على الإطلاق — غير مُتحقَّق منها خارج Microsoft. صحيح أن الشركة تحدد حيث تعتقد أن النموذج هو الأقوى والأضعف، وهو أكثر فائدة من درجة رئيسية واحدة: الأقوى في الاستدلال وتطبيق القواعد والمتانة تجاه تنسيق المطالبات؛ ومنافس في التصنيف والاسترجاع والعدالة واستخدام الأدوات ومعظم المهام متعددة اللغات؛ وأضعف في مهام المعرفة المتخصصة بالمجال.
تجدر قراءة القيود المبلَّغ عنها ذاتيًا قبل قائمة الميزات. يمكن أن تتغير الدرجات مع الصياغة وترتيب الخيارات، والسؤال المصاغ بشكل سيئ يظل يُعيد درجة. تكون المعايرة في أقوى حالاتها مع أنواع المهام المألوفة. وقد تعتمد على معرفة قديمة، ولا تقدم أي تفسيرات. فيما يتعلق بالتغطية متعددة اللغات: تُدرَج 25 لغة كمدعومة، بما في ذلك اليابانية والكورية والعربية والفيتنامية والتايلاندية والتركية والهندية والبنغالية والسواحيلية والعبرية والفارسية والأوكرانية، لكن مايكروسوفت تذكر أن التغطية والجودة والمعايرة "قد تتفاوت حسب اللغة"، وتُدرج اللغات غير الإنجليزية — لا سيما اللغات ذات الموارد الأقل — كمجال لأداء أقل من المطلوب. يدعم Qwen3.5-9B الأساسي أكثر من 200 لغة؛ بينما يدعم النموذج المدرَّب لاحقًا ربع هذا العدد.
كيف تحصل عليه، وكم يكلف
يتم توزيع Microsoft-Decision-1 كواجهة برمجة تطبيقات مستضافة في Microsoft Foundry ضمن محفظة "Direct from Azure". لا يتم توزيع أوزان النموذج — هذا ليس إصدارًا مفتوح الأوزان، ولا يوجد مستودع Hugging Face لتنزيله. أي تطبيق يمكنه إرسال طلبات HTTPS يمكنه التكامل باستخدام نقاط نهاية Foundry ومصادقة Azure القياسية. تُظهر قائمة النشر خيارات بلا خادم ونقاط نهاية موحدة على أساس الدفع حسب الاستخدام أو الإنتاجية المخصصة المحجوزة، SKU قياسي، مع تعطيل الاستدلال المجمع، ويفيد الإفصاح عن التدريب أن مجموعة بيانات التدريب استُخدمت لأول مرة في سبتمبر 2026 مع استمرار الجمع.
لا يُنشر التسعير على صفحة النموذج. فحقل التسعير في الكتالوج يحيل إلى صفحة تسعير النماذج لدى Microsoft بدلاً من إدراج سعر الإدخال وسعر الإخراج، لذا فإن التكلفة لكل توكن لاستدعاء Decision-1 أمرٌ عليك البحث عنه في واجهة تسعير Azure أو قراءته من الفاتورة. وهذه فجوة حقيقية لأي شخص يحاول نمذجة التكلفة لكل قرار عند الحجم الكبير، ويستحق قولها بصراحة بدلاً من تقديرها. هناك أمران يستحقان المعرفة عند تسعيره: تمثل توكنات الإخراج 0% من التكلفة، لأنه لا توجد أي منها، والاستدلال بالدفعات معطّل، لذا لا يمكنك توزيع تكلفة تشغيل تقييم بالجملة عبر قناة الدفعات كما تفعل مع نموذج توليدي.
أما موقع OrcaRouter من هذا فهو على الجانب الآخر من الاستدعاء. نحن لا نستضيف Microsoft-Decision-1، وهو ليس في كتالوجنا — فالنموذج الذي يُعيد احتمالات بدلاً من نص ليس نموذجًا تُوجّه إليه إكمالات الدردشة. ما نقدّمه فعلاً هو النصف من النمط الذي يُولّد: النماذج التي تكتب معيار التقييم، أو تصوغ الردود المرشّحة، أو تُنتج استدعاء الأداة الذي يقيّمه Decision-1 بعد ذلك. تلك تعمل خلف مفتاح واحد متوافق مع OpenAI يحمل أكثر من 200 نموذج، وبسعر قائمة المزوّد مُمرَّر كما هو مع هامش ربح 0%، لذا فإن أي تخفيض سعري من مورّد على نموذج حَكَم يصبح ساريًا لدينا في اليوم نفسه. إذا كنت تبني حلقة تقييم حيث يكتب نموذج ويقيّم آخر، فإن استدعاء التقييم يذهب إلى Microsoft، أما استدعاء التوليد فيمكن أن يذهب إلى أي مكان — بما في ذلك عبر لغة التوجيه DSL، التي تجمع عدة نماذج في استدعاء واحد عندما تريد هيئة تحكيم بدلاً من حَكَم واحد.

لماذا يختلف الرهان على مُقيِّم عن الرهان على روبوت دردشة أفضل
النمط الذي تبيعه مايكروسوفت هنا موجود بالفعل في المصادر المفتوحة. إن Intern-Decision-4B من InternLM، وd1-3B من Liquid AI، وLaya من Convai Innovations، وعائلة Kev من Jared Palmer، كلها تعيد توزيعات معايرة على الخيارات المقدمة دون توليد نص، ومعظمها أوزان Apache-2.0 يمكنك تشغيلها على عتادك الخاص مجانًا. تختلف مشاركة مايكروسوفت في ثلاث نواحٍ لا تعتمد على المعايير القياسية: فهي واجهة برمجة تطبيقات مُدارة مع مصادقة Azure والفوترة والحوكمة المرتبطة بها، لذا تتناسب مع مسار الشراء المؤسسي الذي لا يتناسب معه تنزيل من Hugging Face؛ وقاعدتها نموذج 9B، أكبر من معظم ذلك المجال؛ وتأتي مع تقييم Responsible AI ومنهجية تقييم موثقة، والتي غالبًا ما تكون متطلب البوابة الفعلي لنشر منظم.
ما لا يأتي معه هو رقم. في مقابل منافسين مفتوحين ينشرون درجات Brier وخطأ المعايرة المتوقع — وهما الرقمان اللذان يخبرانك ما إذا كانت 0.8 تعني 0.8 — نشرت Microsoft منهجية ولا نتائج. وإلى أن يتوفر اختبار معايرة مستقل، فإن الطريقة القابلة للدفاع عنها لاستخدام Microsoft-Decision-1 هي الطريقة التي توصي بها وثائقه الخاصة: تحقق على بيانات تمثل حالة استخدامك، وحدد العتبات بناءً على تكلفة أخطائك، وأدرج دائمًا خيار الامتناع، واجعل ترتيب الخيارات عشوائيًا حيث قد يحيّز الترتيب الإجابة، وأبقِ إنسانًا في حلقة القرار في أي أمر ذي عواقب. هذه نصيحة جيدة لأي أداة تقييم. وهي نصيحة جيدة بشكل خاص لأداة لم يقس أحد خارج الشركة معايرتها.
