
Decision 3.0 مقابل Microsoft-Decision-1: أحدهما تنزيل، والآخر SKU
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز · 71 tok/s
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
فئة 9B من Decision 3.0 و Microsoft-Decision-1 هما، على الورق، نفس المنتج. كلاهما يقومان بتدريب لاحق لـ Qwen3.5-9B ليصبح مقيّماً يجيب على مجموعة ثابتة من الإجابات المرشحة باحتمال معاير لكل منها، دون توليد أي رمز. كلاهما يستهدفان نفس المهام — توجيه طلب، تقييم مخرجات مقابل معيار، التحكم في إجراء وكيل، فرز قائمة انتظار. كلاهما صدرا خلال أسبوع من الآخر: أصبح Microsoft-Decision-1 متاحاً بشكل عام على Microsoft Foundry في 8 أكتوبر 2026 وأُعلن عنه في اليوم التالي، و d3-flash تم رفعها إلى Hugging Face في 17:23 UTC في 10 أكتوبر 2026.
الفرق ليس في النموذج. بل في ما يُسمح لك بفعله به. d3-flash هو نقطة حفظ (checkpoint) بترخيص Apache-2.0 تضم 8.39 مليار معامل، تقوم بتنزيلها وتشغيلها، ويحتل المرتبة الثالثة في عائلة تبدأ من 0.59 مليار وتبلغ حدها الأقصى عند 26.09 مليار. أما Microsoft-Decision-1 فهو نقطة نهاية مستضافة على Foundry، بأوزان لا تُوزَّع على الإطلاق، ضمن خط تقول مايكروسوفت إنها ستُعيد تأسيسه على نماذج MAI الخاصة بها لاحقًا. أحدهما مُخرَج برمجي؛ والآخر خدمة. تكاد كل مسألة عملية حول هذين الاثنين تنبع من تلك الحقيقة الواحدة، بما في ذلك المسائل التي تبدو وكأنها تتعلق بمقاييس الأداء.
قراران بشأن الغرض من نموذج القرار
منشور Microsoft صريح بشأن النطاق على نحوٍ نادرًا ما تكون بطاقات النماذج صريحة به. أشكال الأسئلة المدعومة هي: نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، والتصحيح القائم على معايير التقييم. والاستثناءات مذكورة بوضوح مماثل: غير مصمم لتوليد النص، أو الإجابة عن الأسئلة المفتوحة، أو المحادثة، أو الترجمة، أو التلخيص، وغير مخصص للمهام التي تتطلب معرفة غير موجودة في المدخل. فهو ينفذ تمريرة واحدة على ما يصل إلى 32,768 رمزًا، ويصدر صفرًا من رموز الإخراج لعدم وجود حلقة فك ترميز. كما تدعم Microsoft خيار الامتناع مثل «لا يمكن الجزم» عندما تكون الأدلة المقدمة غير كافية، وهو التفصيل الذي يجعل تطبيق عتبة على المخرجات ذا معنى من الأساس.
يقع d3-flash داخل الإطار المفاهيمي نفسه — أسئلة Choice وNoul (نعم/لا) وScore، تمريرة أمامية واحدة لكل سؤال، واحتمال لكل خيار، دون توليد — ثم يوسّع جانب الإدخال. وبينما صُمم Microsoft-Decision-1 ليكون نصيًا فقط، يقبل d3-flash النص أو JSON، وعدة صور في الطلب الواحد بحد أقصى 1.6 ميغابكسل لكل صورة، وعدة فيديوهات تُقرأ بمعدل إطارين في الثانية. كل سؤال في الطلب يرى كل صورة وكل فيديو مرفقين به. إنه نموذج أصغر يفعل المزيد بما يُمنح له من مدخلات.
هذا هو أول انقسام حقيقي، وهو ليس مسألة ذوق. إذا كان القرار الذي تحتاج إلى اتخاذه يتعلق بلقطة شاشة، أو إيصال، أو مخطط بياني، أو مقطع من كاميرا، فلا يستطيع Microsoft-Decision-1 اتخاذه. هذا حدّ قدرات، وليس فجوة جودة، ولا يمكن لأي قدر من العمل على الدقة أن يسدّه.
ما الذي ينشره كل واحد، وكيف
هنا يقدّم الإصداران نوعين مختلفين حقًا من الإثبات، ويستحق الأمر الفصل بينهما بدلًا من وضع الأرقام في صف واحد.
أجرت مايكروسوفت مقارنة من 36 معيارًا شملت ما يقرب من 150,000 سؤال تم حجبها عن التدريب، وتغطي التوجيه والترتيب والسياق الطويل والمهام متعددة اللغات والمهام خارج التوزيع والاستدلال والسلامة، وتقول إن نموذجها جاء الأفضل عبر تلك المجموعات. وهي تبلغ عن زمن الاستجابة كنسبة وليس كرقم — p50 أسرع بنحو 35 مرة من GPT-6 Sol، وأسرع 2.5 مرة من H2O-Lightning-4B v1.1، الذي تسميه الوصيف. وتوثق المتانة كإجراء: نفس الطلب يُشوَّش بثماني طرق، ومعدل انقلاب القرار المتوسط 1.3%، وصفر انقلابات عندما تُعاد صياغة أوصاف الخيارات أو تُعكس الخيارات أو تُخلط. واختبرت السلامة على 5,250 طلبًا عبر 11 معيارًا تغطي المحتوى الضار والتهرب من الحماية وحقن الأوامر. وتذكر معيار المعايرة الذي تلتزم به — توقع بنسبة 90% يجب أن يكون صحيحًا نحو تسع مرات من أصل عشر في الحالات التمثيلية.
قام vLLM-SR بنشر مؤشر. يضع Jev Decision Index 0.3.1 الإصدار d3 عند 64.7 مع d3-flash عند public-suite 57.79، بزيادة مُدّعاة قدرها 11.0 عن نموذج 9B الخاص بـ Decision 2.0 عند 46.76. كما يدّعي أن جميع الطلبات العامة البالغ عددها 140,178 قد تمت الإجابة عليها دون أي طلب غير مدعوم، وهو تصريح تغطية وليس تصريح دقة. تكشف البطاقة أن صف d3 نفسه هو تقييم داخلي بينما صفوف المقارنة المجاورة له — Perplexity Decider v1.1، Fastino GLiDE، Jev، Torchcast Decision 27B — هي بيانات لوحة مباشرة. وعلى الجانب متعدد الوسائط، تُبلغ نماذج عائلة d3 عن درجات Perception Test على جميع أسئلة التحقق البالغ عددها 19,140، مع d3-flash عند 73.3 مقابل الحد الأدنى للتخمين لثلاثة خيارات عند 33.3.
إذن: تنشر Microsoft ادعاءً بالاتساع مع منهج موثّق ورقم متانة، ولا تنشر أي رقم معايرة لكل نقطة تحقق. وتنشر vLLM-SR موضعًا في لوحة الصدارة مع فجوة إسناد معلنة بين صفّها وصفوف الآخرين، إضافة إلى نتيجة فيديو، ولا رقم معايرة أيضًا. ولا تحمل أي من البطاقتين درجة Brier أو رقم خطأ المعايرة المتوقّع للنموذج الذي تصفه. وبالنسبة لمنتجين تكون قيمتهما المقترحة كلها في أن الرقم المُعاد يعني شيئًا، فهذه هي الفجوة المشتركة، وهي الشيء الأكثر فائدة الذي يمكن لأي من المورّدين أن يطلقه تاليًا.

التوزيع يحسم أكثر مما تفعله ورقة المواصفات
هنا لم تعد المقارنة تدور حول النماذج.
مع d3-flash تحصل على الأوزان، وملف decision_config.json يثبّت المراجعة الأساسية، وبيان SHA-256 لكل ملف، وكود نمذجة مخصص، ورأس قراءة، ومجموعة تبعيات موثّقة تتضمن transformers==5.17.0 وحزمة نواة CUDA اختيارية لطبقات الانتباه الخطي. يمكنك تشغيله على عتادك الخاص، وضبطه الدقيق، وتكميمه، وعزله هوائياً. أنت أيضاً تتحمّل العمل التشغيلي: ففئة Python ليست نقطة نهاية، ولا تذكر البطاقة ميزانية رموز للحالة زائد الأسئلة زائد أوصاف المرشحين — max_length يساوي null في الإعدادات المُصدَرة، لذا فإن ذلك السقف متروك لك لاكتشافه.
مع Microsoft-Decision-1 تحصل على نقطة نهاية داخل حساب سحابي موجود، مع المصادقة والتوافر الإقليمي وضوابط التزويد التي تأتي معه، ولا تحصل على أي من العمل التشغيلي. كذلك لا تحصل على أي من التحكم. لا يوجد مستودع لتنزيله، ولا مسار للضبط الدقيق، ولا خيار للاستضافة الذاتية؛ فدورة حياة النموذج ملكٌ لشركة Microsoft، لا لك، وإشعار الإهمال أو إعادة الأساس على عمود فقري مختلف تغيير تستوعبه بدل أن تجدوله. قالت Microsoft إن إعادة أساس إلى نماذج MAI الخاصة بها قادمة، وهو مسار معقول لنموذج كل هدفه هو التقييم السريع بتمريرة واحدة، ويعني أيضًا أن نقطة التحقق المحددة التي قست أداءها ليست بالضرورة تلك التي ستستدعيها بعد عام.
قصة زمن الاستجابة هي الأخرى تحتاج إلى قراءة متأنية. الرقم الرئيسي الذي تعلنه Microsoft هو نسبة مقابل نموذج عام الأغراض أكبر بكثير، وهي المقارنة الصحيحة لحجّتها — فمهمة نموذج القرار هي استبدال استدعاء توليدي مكلف باستدعاء تقييم رخيص، و35x مقابل GPT-6 Sol عند p50 هو ما تبدو عليه هذه الحجة عندما تنجح. أما أرقام vLLM-SR فهي مطلقة، لطلب واحد وبوحدة معالجة رسوميات واحدة، وهي تُظهر ضريبة الوسائط بوضوح: على وحدة AMD Instinct MI325X واحدة، يستغرق طلب نصي إلى d3-flash وسيطًا قدره 19.1 ms، ويستغرق الطلب نفسه مع صورة 149.4 ms، ومع فيديو مدته عشر ثوانٍ 407.6 ms. كلتا المجموعتين مُبلَّغ عنهما من المورّد، على عتاد مختلف، ولم يُعَد إنتاج أيٍّ منهما خارج المختبر الذي أنتجهما.

كيفية الاختيار
قاعدة القرار قصيرة، وهذا مؤشر جيد على أن المنتجين لا يتنافسان فعليًا على الخانة نفسها.
اختر Microsoft-Decision-1إذا كان القرار نصيًا فقط، وإذا كنت تعمل بالفعل على Foundry، وإذا كانت الفكرة كلها هي كونها استدعاءً وليس نشرًا — لا حاجة لشراء GPU، ولا لتشغيل حاوية، ولا لامتلاك دورة حياة النموذج. كما أن المواد الداعمة من Microsoft هي الأكثر قابلية للاستخدام بين الاثنين لفريق المنصة: الاضطرابات، وأعداد اختبارات السلامة، والبيان بأن خيار الامتناع مدعوم، هي الأشياء التي تحتاجها لكتابة سياسة عتبة، والحد الأقصى البالغ 32,768 رمزًا مذكور بدلاً من تركه فارغًا.
اختر Decision 3.0 — عملياً d3-flash أو d3-mini — إذا كان أي جزء من القرار يعتمد على صورة أو مقطع، أو إذا احتجت إلى تشغيله في مكان لا يمكن لواجهة برمجة تطبيقات مستضافة الوصول إليه، أو إذا رغبت في ضبط نموذج التقييم بدقة على حالاتك الموسومة الخاصة. ترخيص Apache-2.0 وبيان التجزئة على مستوى الملفات يجعلان ذلك خياراً حقيقياً لا نظرياً. ما تقبله في المقابل هو ميزانية إدخال غير معلنة، ولا معايرة منشورة، وأن العائلة عمرها أيام مع عدم وجود استخدام خارجي تقريباً خلفها.
إذا كنت بحاجة إلى كليهما — مُقيِّم مستضاف لمسار النصوص الاعتيادي، ومُقيِّم مستضاف ذاتيًا لحالات الوسائط المتعددة أو الحالات المعزولة عن الشبكة، يُستدعى كلاهما عبر الواجهة نفسها — فإن الموقف الصادق هو أنه لا يوفّر لك أي مورّد ذلك حاليًا، وأن الطلبين متقاربان بما يكفي لتوحيدهما لكنهما ليسا متطابقين.
أين يقع OrcaRouter، وأين لا يقع
typesafe/jev-1.13 هو نموذج القرار في كتالوجنا، ويُقدَّم عبر POST /v1/systemone بالعقد نفسه القائم على الحالة والأسئلة المسمّاة الذي يطبقه كلا النموذجين أعلاه: نصّ داخل، وJSON منظم خارج، حتى نحو 64K رمز إدخال، غير متدفق، $0.042 لكل مليون رمز إدخال دون رسوم إكمال لأنه لا ينتج أي إكمال. والجدير بالذكر أن سؤال ميزانية الرموز بنمط أندرويد، الذي لم تجب عنه أي من البطاقتين أعلاه بالكامل، تتم الإجابة عنه هنا.
نحن لا نوفر أيًا من النموذجين في هذه المقارنة. نقاط التحقق الخاصة بـ Decision 3.0 تُشحن كمسار استدلال محلي في مستودع Hugging Face بدلاً من نقطة نهاية قابلة للتوجيه، و Microsoft-Decision-1 يتم توزيعه عبر منصة Microsoft الخاصة وعدة منصات تابعة لجهات خارجية — وليس عبرنا. لا ينبغي قراءة أي شيء هنا كادعاء توفر لأي منهما.
ما تستحقه طبقة التوجيه فعليًا في هذا القرار يقع في النصف الآخر من الحلقة. إن أداة التقييم رخيصة بحكم تصميمها؛ أما النموذج الذي يتصرف بناءً على مخرجاتها فليس كذلك، والجمع بين نموذج قرار ونموذج توليدي يعني عادةً تكاملين وعلاقتي فوترة ونمطي فشل. استدعاء كليهما عبر مفتاح واحد عبر أكثر من 200 نموذج — مع تجاوز فشل تلقائي عندما يتعثر مزوّد، وسعر القائمة من المزوّد يُمرَّر دون أي هامش ربح بنسبة 0% بحيث يصبح تغيير سعر البائع ساريًا في اليوم نفسه — يعني أنه يمكنك تبديل أداة التقييم دون لمس موقع الاستدعاء. وهذا يهم أكثر من المعتاد هنا، لأن كلا هذين النموذجين في مرحلة مبكرة بما يكفي بحيث يكون القرار الذي تتخذه هذا الأسبوع قرارًا ينبغي أن تكون قادرًا على عكسه الشهر المقبل.

السؤال الذي سيحسم هذا في غضون ستة أشهر
قام فريقان بتدريب لاحق على نقطة التحقق الأساسية نفسها وتحويلها إلى المنتج نفسه من حيث الشكل في الأسبوع نفسه، وتوصلا إلى استنتاجين متعارضين حول الطريقة التي ينبغي أن يصل بها المنتج إلى العميل. هذا ليس مصادفة في التوقيت بقدر ما هو انشعاب في طريقة بيع هذه الفئة: كأوزان أو كخدمة، كشيء تملكه أو كشيء تستدعيه.
راقب ثلاث إشارات. ما إذا كانت إعادة تأسيس Microsoft على MAI أو على نماذجها الخاصة تغيّر سلوك الدقة وزمن الاستجابة الذي تبيعه حاليًا — ومقدار الإشعار المسبق الذي يحصل عليه العملاء. وما إذا كانت vLLM-SR تنشر ميزانية إدخال ورقم معايرة لـ Decision 3.0، ما يسدّ الفجوة التي تمنع مؤشرها من أن يكون قابلًا للتنفيذ. وما إذا كان أي شخص خارج أي من المختبرين يشغّل المجموعة العامة على أوزان d3 الصادرة، لأن الرقم الوحيد الذي سيحسم هذه المقارنة في الوقت الحالي هو رقم لم ينتجه أي من المورّدين.
