
Microsoft-Decision-1 متاح الآن على Foundry. تبويب المقاييس المرجعية الخاص به فارغ.
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 55 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
أكثر ما يثير الاهتمام في إصدار مايكروسوفت هذا الأسبوع ليس ما Microsoft-Decision-1يستطيع فعله. بل ما اختارت مايكروسوفت عدم طبعه عنه. النموذج متاح الآن: أصبح متاحًا للعموم على Microsoft Foundry في 8 أكتوبر 2026، قبل يومين من كتابة هذا. إنه نموذج لتقييم القرارات — تُعطيه حالة وسؤالًا له مجموعة ثابتة من الإجابات، فيعيد احتمالًا معايرًا لكل إجابة — دربته مايكروسوفت لاحقًا على النموذج مفتوح الأوزان Qwen3.5-9B، ويُجري تمريرة واحدة على ما يصل إلى 32,768 رمزًا ويُصدر صفر رموز إخراج لأنه لا يولّد أي شيء على الإطلاق. تحتوي صفحة الكتالوج على تبويب المعايير. وهي تضم فقرة منهجية ولا تضم أي أرقام.
تلك الفجوة هي القصة، وهي أكثر فائدة من خبر آخر من نوع «Microsoft تطلق نموذجًا». كل سؤال جدي حول مُقيِّم هو سؤال معايرة — هل القيمة 0.8 المُعادة تعني 0.8 — وإطلاق يصل دون درجة براير واحدة أو رقم لخطأ المعايرة المتوقع يترك الرقم الوحيد الذي يهم ليُقاس من قبل من يتبناه. ما يلي هو ما توثقه صفحة Foundry فعليًا، وما تُغفله بشكل لافت، وما يمكن لفريق تقييم أن يفعله حيال ذلك هذا الأسبوع.
ما الذي تم إصداره، بالتحديد؟
Microsoft-Decision-1 هو واجهة برمجة تطبيقات مستضافة. العقد هو استدعاء واحد يدخل، وتوزيع واحد يخرج، مع عدم وجود حلقة فك ترميز في أي مكان من المسار: يحمل الطلب المادة المطلوب الحكم عليها بالإضافة إلى سؤال له مجموعة إجابات محدودة، وتحمل الاستجابة احتمالاً لكل خيار. تُدرج Microsoft أشكال الأسئلة المدعومة على أنها نعم/لا، واختيار من متعدد، وتقييم، وتصنيف، وقائمة على معايير تقييم، وكلها ضمن استدعاء واحد يصل إلى 32 ألف توكن. وهو نصي فقط — لا إدخال صور أو صوت أو فيديو، ولا يخرج منه سوى أرقام.
الاستثناءات مذكورة بوضوح كما هي الميزات، ويستحق قراءتها قبل أي شيء آخر: غير مصمم لتوليد النصوص، أو الإجابة على الأسئلة المفتوحة، أو المحادثة، أو الترجمة أو التلخيص، وليس مخصصًا للمهام التي تتطلب معرفة غير موجودة في المدخلات. وهو لا ينتج أي مبررات. حالات الاستخدام المنشورة كلها مواضع يكون لدى فريق المنصة فيها قرار موسوم بالفعل يتعين اتخاذه — تقييم إجابة مولّدة وفق معيار، أو الحكم على ملاءمة الاسترجاع، أو فرز قائمة انتظار، أو تقييد استدعاء أداة وكيل مقترح، أو فحص المحتوى وفق عتبات يحددها التطبيق بدلًا من سياسة ثابتة من المورّد، والقبول التلقائي للنتائج عالية الثقة مع تصعيد ما تبقى.
هناك تفصيلان تشغيليان يبرزان من قائمة النشر. الأول هو أن Microsoft تدعم صراحةً خيار الامتناع مثل «لا يمكن الجزم» عندما تكون الأدلة المقدمة غير كافية — وهذا هو الفرق بين مُقيِّم معايَر وآخر واثق فحسب، وهو ما يجعل تطبيق العتبات ناجحًا. والثاني هو أن الاستدلال بالدفعات معطّل. لا يمكنك توزيع تكلفة تشغيل تقييم كبير عبر قناة الدفعات كما تفعل مع نموذج توليدي، لذا فإن زمن الاستجابة لكل استدعاء هو زمن خط أنابيبك، وليس مشكلة مهمة غير متصلة.
التوزيع عبر Foundry فقط، ضمن محفظة "Direct from Azure" كعملية نشر بلا خادم أو بنقطة نهاية موحّدة على SKU القياسي — الدفع حسب الاستخدام أو الإنتاجية المُخصّصة المحجوزة. لا يتم توزيع الأوزان. لا يوجد مستودع Hugging Face، ولا تنزيل، ولا مسار ضبط دقيق، ولا خيار استضافة ذاتية. تتكامل التطبيقات عبر HTTPS مع مصادقة Azure القياسية. يفيد الإفصاح الخاص بالتدريب بأن مجموعة البيانات استُخدمت لأول مرة في سبتمبر 2026 مع استمرار الجمع، وهو أقصر مدى ممكن بين بيانات التدريب وتاريخ الإتاحة العامة، وهو أمر طبيعي لتدريب لاحق على أساس سبق إصداره من جهة أخرى.
علامة تبويب المعايير، مقتبسة بالكامل
إليك كامل ما نشرته Microsoft حول مدى جودة أداء النموذج. استخدم التقييم "معايير قياس أداء عامة ومجتمعية خاصة بالقرار، ومجموعات اختبار داخلية محجوزة لم تُستخدم في التدريب". وكانت المقاييس هي الدقة، وخطأ المعايرة، واستدعاء الأمان، ومعدلات الإيجابيات الكاذبة، واتساق العدالة. تم تنويع ترتيب الخيارات. وطُبقت اختبارات إحصائية مقترنة. والادعاء نوعي: Microsoft-Decision-1 "يؤدي على قدم المساواة مع نماذج القرار الرائدة، ويتقدم على نماذج القرار المفتوحة الأخرى التي جرى تقييمها بالمنهجية نفسها."

هذا تصميم تقييم متقن وُصف من دون نتيجة. وليس في الإشارة إلى ذلك اتهام — ففقرة منهجية بلا جدول هي خيار محدد وقابل للتحقق، وهو خيار يختلف عن الخيار الذي اتخذته بقية هذه الفئة الصغيرة. إن نماذج القرار المفتوحة التي تقارن بها مايكروسوفت ضمنيًا تنشر أرقامها: فعائلة Intern-Decision من InternLM تطبع قيم Brier وخطأ المعايرة المتوقع على بطاقات نماذجها، وJev من TypeSafe تنشر كليهما، وسلسلة d1 من Liquid AI تُصدر جداول دقة مع أوزانها. ومايكروسوفت هي أكبر شركة في هذه المجموعة والوحيدة التي تطلب أن يُؤخذ كلامها على الثقة.
تقول الشركة بالفعل أين تعتقد أن النموذج قوي وأين هو ضعيف، وهو أمر أكثر قابلية للتنفيذ من درجة رئيسية. الأقوى: الاستدلال، وتطبيق القواعد، والمتانة أمام تنسيق المطالبات. المنافس: التصنيف، والاسترجاع، والإنصاف، واستخدام الأدوات، ومعظم المهام متعددة اللغات. الأضعف: المعرفة المتخصصة بالمجال. القيود المعلنة ذاتيًا صريحة بالطريقة نفسها — يمكن أن تتغير الدرجات مع الصياغة وترتيب الخيارات، والسؤال المصاغ بشكل سيئ لا يزال يعيد درجة، والمعايرة تكون في أقوى حالاتها مع أنواع المهام المألوفة، ولا توجد تفسيرات لتدقيقها عندما تبدو إجابة ما خاطئة.
تحمل التغطية اللغوية النوع نفسه من التحذير. 25 لغة مُدرجة كمدعومة، تشمل اليابانية والكورية والعربية والفيتنامية والتايلاندية والتركية والهندية والبنغالية والسواحيلية والعبرية والفارسية والأوكرانية وغيرها، مع تحذير صريح بأن التغطية والجودة والمعايرة "قد تتفاوت حسب اللغة"، وأن اللغات غير الإنجليزية، لا سيما ذات الموارد المحدودة، تمثل مجالاً للأداء دون المستوى. تدعم قاعدة Qwen3.5-9B أكثر من 200 لغة بكثير. أبقى التدريب اللاحق نحو ربع ذلك، وهذا الربع هو حيث جرى ضبط المعايرة.

لا يوجد سعر على الصفحة أيضًا
لا يعرض حقل التسعير في الكتالوج سعرًا. بل يربط خارجيًا إلى واجهة تسعير النماذج الخاصة بـ Microsoft، لذا فإن التكلفة لكل قرار شيء تقرأه من Azure أو من فاتورة بدلًا من بطاقة النموذج. بالنسبة لأي شخص يقوم بنمذجة التكلفة لكل قرار على نطاق واسع، تعد هذه فجوة حقيقية، ويجدر ذكرها بوضوح بدلًا من تقديرها. وهناك أمران ينبعان من البنية ويستحقان تضمينهما في ذلك التقدير: 0% من تكلفة الاستدعاء هي رموز المخرجات، لأنه لا توجد أي منها، ومجموعة الخيارات جزء من المدخلات، لذا فإن سؤالًا يحتوي على اثنين وستين خيارًا وصفياً يكلف أكثر لكل استدعاء من سؤال بنعم/لا — أنت تدفع مقابل معيار التقييم الذي كتبته، وليس مقابل الإجابة.
لماذا يُعد هذا الشكل من الإصدار هو الجزء المثير للاهتمام
مُقيّم القرار هو رهان على أن ما تحتاجه المؤسسات البدائية فعلاً ليس كاتبًا أفضل بل حَكَمًا أرخص وأكثر موثوقية. هذا الرهان لا يُجدي إلا إذا كان الاحتمال موثوقًا، لأن كل ما يلي المُقيّم هو عتبة: 0.7 يُصعّد إلى شخص، 0.95 يقبل تلقائيًا، وتكلفة الخطأ في هذا الخط تُدفع في قرارات آلية سيئة بدلاً من الرموز. البائع الذي يطرح المُقيّم دون جدول المعايرة يطلب من كل عميل إعادة اشتقاقه على بياناته الخاصة.
توصي وثائق مايكروسوفت نفسها بذلك بالضبط، وهو ما يخفّف من حدّة الانتقاد ويشحذ الاستنتاج العملي في الوقت نفسه. تحقّق من الأداء على بيانات ممثّلة لحالة استخدامك. حدِّد العتبات انطلاقًا من تكلفة أخطائك لا من قيمة افتراضية. أدرِج دائمًا خيار الامتناع عن الإجابة. عشوِّ ترتيب الخيارات حينما يمكن أن يفضي الترتيب إلى تحيّز الإجابة. أبقِ الإنسان في حلقة القرار في كل أمر ذي تبعات. تلك نصيحة سديدة لأي مُقيِّم. وهي النصيحة الوحيدة المتاحة لهذا المُقيِّم.
أجربه هذا الأسبوع دون الالتزام
أرخص تقييم هو أن تختار قرارًا تتخذه بالفعل يدويًا، وأن تجمع مئتي حالة موسومة مع مجموعات الإجابات التي سيوفرها تطبيقك فعليًا، وتُمرّرها عبر نشر Foundry. احسب خطأ المعايرة المتوقع على المخرجات وستعرف عن Microsoft-Decision-1 أكثر مما نشرته Microsoft عنه، لأنك ستكون قد قِسته على توزيعك بدلًا من مجموعة اختبار داخلية محجوزة. هذا عمل بعد ظهر واحد، وهو يُحيل مسألة المعيار المرجعي بأكملها إلى التقاعد.
إن موضع OrcaRouter هو في النصف الآخر من حلقة تقييم، وهو النصف الذي يولّد. نحن لا نستضيف Microsoft-Decision-1 وليس في فهرسنا — فالنموذج الذي يعيد احتمالات بدلًا من نص ليس شيئًا تُوجّه إليه إكمالات المحادثة، ولا ينبغي قراءة أي شيء هنا بوصفه ادعاء توافر. ما يقف خلف مفتاحنا الواحد المتوافق مع OpenAI هو مجموعة أكثر من 200 نموذج التي تقوم بالكتابة: النموذج الذي يصوغ معيار التقييم، والنموذجان اللذان ينتجان إجابات مرشحة، والنموذج الذي يُصدر استدعاء الأداة Decision-1 ثم يقيّم قبل تشغيله. سعر قائمة المزوّد يُمرَّر بهامش ربح 0%، لذا فإن تخفيض السعر على جانب المولّد يسري لدينا في اليوم نفسه، ويُبقي التحويل التلقائي عند الفشل مسار التوليد حيًّا عندما يتدهور مزوّد واحد — وهذا يهم أكثر في خط معالجة يقيّم كل ما يراه مما يهم في خط يجيب مستخدمًا من حين لآخر. إذا كنت تفضّل ألا تختار قاضيًا واحدًا، فإن لغة التوجيه DSL تدمج عدة نماذج في استدعاء واحد، ويُبلّغ دمج النماذج عن توافقها كحقل مُقيَّم بدلًا من نص نثري عليك قراءته.

ما الذي سيغيّر هذه المقالة هو جدول. انشروا درجات Brier وECE، أو دعوا تشغيلًا مستقلًا يصل إلى لوحة متصدرين، فيصبح التقييم الوارد أعلاه تأكيدًا بدلًا من كونه الدليل الوحيد الموجود. وحتى ذلك الحين، فإن الوصف الدقيق لـ Microsoft-Decision-1 ضيّق: الأوزان حقيقية، والعقد موثّق على نحو أفضل مما تنجح في تحقيقه معظم الإصدارات المستضافة، وخيار الامتناع مصمّم في الأصل لا مضافًا لاحقًا، وادعاء الأداء جملة — جملة مكتوبة بإتقان، وغير مرفقة بأي أرقام على الإطلاق.
الخلاصة
أصبح Microsoft-Decision-1 متاحًا للعموم على Microsoft Foundry في 8 أكتوبر 2026 كمقيّم قرارات نصي فقط بطول 32,768 رمزًا، مبني على Qwen3.5-9B، ويعيد احتمالات معايَرة على مجموعات الخيارات الخاصة بك بصفر رموز إخراج ودون أوزان لتنزيلها. تكمن نقاط قوته في عقد نظيف بتمريرة واحدة، ومسار امتناع مدمج بالتصميم، ومصادقة Azure والفوترة والحوكمة المرتبطة به؛ أما نقطة ضعفه فهي أنه لا أحد خارج Microsoft لديه رقم منشور عن مدى جودة معايرته، بما في ذلك Microsoft. تعامل مع الإطلاق باعتباره API أصبحت متاحة، لا باعتباره قدرة يجري تثبيتها، ومرّر حالاتك الموسومة الخاصة عبره قبل أن يعتمد أي شيء لاحق على عتبة ما.
