
Microsoft-Decision-1 مقابل Kev: شراء نتيجة، أو امتلاك الوصفة التي تنتجها
- OrcaجديدOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 لكل مليون رمز
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
وضع جاريد بالمر إيصالًا بجانب نموذجه. عائلة Kev — Kev-0.8B وKev-4B وKev-9B، المبنية على نقاط تفتيش أساسية مجمّدة ومفتوحة الأوزان مع محوّل LoRA برتبة 16 ورأس مؤشر صغير — طُرحت في 24 سبتمبر 2026 مع وصفة تدريبها وأعداد بياناتها مرحلة بمرحلة وأرقام تقييمها، كلها منشورة، والخلاصة الصادقة لأي شخص يقارنه بـMicrosoft-Decision-1 هي أن Kev يخبرك أكثر بكثير عن كيفية إعادة إنتاجه. أصبحت أداة التقييم من Microsoft متاحة عمومًا على Microsoft Foundry في 8 أكتوبر 2026: قاعدة Qwen3.5-9B خضعت لتدريب لاحق من Microsoft، سياق من 32,768 رمزًا، نصية فقط، الأوزان غير موزعة، منهجية تقييم منشورة ولا نتائج منشورة. كلاهما يأخذان حالة ومجموعة من الأسئلة ذات الأنواع ويعيدان توزيعًا معايرًا بدلًا من نص مُولَّد. أحدهما خدمة، والآخر شيء يمكنك تشغيله في دفتر ملاحظات الليلة.
السبب في أن هذا التمييز هو ما يحسم هذه المواجهة وليس القدرة: يُبلِغ Kev-4B عن ECE 0.017 في اختباره المقفل خارج النطاق، بينما لا يُبلِغ Microsoft-Decision-1 عن أي شيء، لذا فإن حجة المعايرة التي تحسم عادةً مقارنة بين مُقيِّم وآخر ليس فيها سوى طرف واحد يعلن موقفه.
ما الذي ينشره كيف فعليًا
بطاقة Kev-4B محدَّدة بشكل غير معتاد، والتحديد هو المقصد. العمود الفقري هو Qwen3.5-4B-Base، مجمَّد عند مراجعة مسمّاة، مع 24 طبقة انتباه خطي Gated DeltaNet و8 طبقات انتباه كامل بحجم مخفي 2,560. وفوقه يوجد مهايئ LoRA من الرتبة 16 — 33.8 مليون معامل قابل للتدريب، مطبَّق على إسقاطات الانتباه وMLP وDeltaNet — ورأس مؤشّر يمنح درجة للرمز الختامي لكل خيار مقابل الرمز النهائي للسؤال ثم يطبّق softmax. تُخزَّن قيمة حرارة واحدة، T = 2.41، في ملف الرأس وتُطبَّق عند التحميل، وتعطي البطاقة القيمة المقدَّرة وتجزئة الملف. جرى التدريب على مراحل بأعداد سجلات منشورة: وصفة أساسية من 12,576 سجلًا، و1,425 للتواريخ والأدلة المفقودة، و5,219 رواية شكوى حقيقية من CFPB، و6,000 سجل مهارات و5,320 سجل أدوات تطوير، مع إعادة المراحل اللاحقة تشغيل المراحل السابقة. تشير البطاقة أيضًا إلى ما لم يُستخدم: «لم تُستخدم أي مخرجات من Jev (نموذج القرار المستضاف لدى TypeSafe).»
يُذكر جدول القياس في الصفحة نفسها، ويأتي مرفقًا بحالات الفشل، وهو أندر من حالات النجاح. اختبار Transfer-v4 المقفل خارج النطاق: الدقة 0.838، وBrier 0.224، وECE 0.017. Breadth-v1 على 14 مجموعة بيانات محتجزة و3,089 سؤالًا: دقة 0.690، وECE 0.029. اختبار Hard-v1: 0.803. اختبار Documents-v1: 0.903. MMLU-Pro بعشرة خيارات: 0.565. حساب التواريخ: 0.65، ووصفه المؤلف بأنه أضعف مجال، مع علامة معالج مسبق قُدّمت كإصلاح جزئي وملاحظة صريحة بأنه لم يُعَد قياسه. يضيف قسم القيود أن المعايرة درجة حرارة واحدة ضمن التوزيع، لذا تتدهور التغطية خارج النطاق، وأن ترتيب الخيارات قد يقلب الإجابة، وأن الأطوال التي تتجاوز 8,192 رمزًا تُقدَّم لكن دون تحقق. نُشرت أرقام الخدمة أيضًا: 18.1 ms لستة أسئلة على حالة قصيرة على H100، و12.9 ms مخزّنة مؤقتًا، و14.3 GB ذاكرة GPU مقيمة.

ماذا تنشر مايكروسوفت بدلاً من ذلك
تغطي Microsoft-Decision-1 معظم النقاط نفسها بأسلوب مختلف. إنها تقيّم أسئلة نعم/لا، والاختيار من متعدد، والتقييم، والتصنيف، ومعايير التقييم، وتدعم خيارات الامتناع الصريح مثل "لا يمكن تحديد"، وتعيد احتمالات JSON، وتعمل في استدعاء واحد على ما يصل إلى 32 ألف رمز — أي أربعة أضعاف السياق الذي يتحقق منه Kev. يتم توزيعه كواجهة برمجة تطبيقات مستضافة في Microsoft Foundry ضمن محفظة Direct from Azure، مع نشر بلا خادم (serverless) ونقطة نهاية موحدة، وSKU قياسي، ومصادقة Azure، ومسار فوترة موحد. الاستدلال الدفعي معطّل، ولا يوجد تنزيل للأوزان ولا مسار ضبط دقيق.
يصف قسم التقييم معايير قرار عامة ومجتمعية إضافة إلى مجموعات داخلية محجوزة، ومقاييس تشمل الدقة وخطأ المعايرة، مع تغيير ترتيب الخيارات، واختبارات إحصائية مقترنة، وادعاء بأن النموذج "يؤدي على قدم المساواة مع نماذج القرار الرائدة ويتقدّم على نماذج قرار مفتوحة أخرى جرى تقييمها بالمنهجية نفسها". لا يوجد جدول. تذكر بطاقة النموذج حدودها هي بصدق — تتغيّر الدرجات مع الصياغة وترتيب الخيارات، وتكون المعايرة أقوى في أنواع المهام المألوفة، ولا تُنتج أي تفسيرات، وتكون التغطية للغات غير الإنجليزية هي الأضعف — لكن قائمة القيود ليست قياساً للمعايرة. أي شخص يضبط عتبة قبول تلقائي عند 0.9 على Microsoft-Decision-1 إنما يضبطها على أساس الإيمان ويعدّلها في الإنتاج.

الجزء من المقارنة الذي يكلّف المال
اقتصاديات Kev هي السبب في أن هذه المواجهة متقاربة حقًا. الوصفة عبارة عن قاعدة مجمدة بالإضافة إلى محول بحجم 33.8 مليون، مما يعني أن النموذج الإضافي الذي تدرّبه يستهلك حوسبة بحجم محول، وليس حوسبة بحجم نموذج أساسي. يمكنك الاحتفاظ بالقاعدة في الذاكرة مرة واحدة وتحميل عدة محولات — واحد لكل مجال قرار — وهو نمط نشر لا تستطيع واجهة برمجة التطبيقات المستضافة من مايكروسوفت التعبير عنه على الإطلاق. إذا اختلفت قواعد التوجيه الخاصة بك عن قواعد مُقيّم عام، فإن Kev يتيح لك تدريب الاختلاف؛ بينما يتيح لك Microsoft-Decision-1 كتابة مطالبة أفضل والأمل.
في مقابل ذلك، لا تحمل واجهة برمجة التطبيقات المستضافة أي سطح تشغيلي. فلا وجود لمحوّل يجب تتبعه، ولا لمنظومة خدمة يجب إبقاؤها جاهزة، ولا لفجوة سياق بين ما تم التحقق منه وما يتم تقديمه للتعامل معها، ولا لخطر أن تتصرف درجة حرارة مُلاءمة على مجموعة بيانات معينة بشكل مختلف على مجموعتك. وبالنسبة لفريق يبلغ حجم قراراته حدًا متواضعًا، فإن الخدمة هي الخيار الأرخص من حيث ساعات الهندسة حتى لو كانت الرموز تكلّف مالًا؛ أما الفريق الذي يقيّم ملايين العناصر يوميًا، فإن المحوّل المستضاف ذاتيًا يتفوق من حيث تكلفة الوحدة بمجرد سداد تكلفة وحدة معالجة الرسومات.
ثمة مسار ثالث لا يستخدم أيًّا من النموذجين في الجزء الذي يكون فيه أضعف، وهو الموضع الذي يقع فيه OrcaRouter. نحن لا نستضيف Microsoft-Decision-1 ولا Kev — فمُقيِّم يُعيد الاحتمالات ليس هدفًا لـ chat-completions، ولا يوجد أي من النموذجين في كتالوجنا. النصف التوليدي من خط اتخاذ القرار هو ما نوفّره: النموذج الذي يصوغ الإجابة المرشَّحة، أو يكتب معايير التقييم، أو يُصدر استدعاء الأداة الذي يخضع للتقييم. كل ذلك خلف مفتاح واحد متوافق مع OpenAI يضم أكثر من 200 نموذج بسعر قائمة المزوّد مُمرَّرًا بهامش 0%، لذا فإن أي تغيير في سعر المورّد يسري على جانبنا في اليوم نفسه. إذا كنت تبني حلقة تقييم أو فرز، فإن استدعاء الكتابة قابل للتوجيه أما استدعاء التقييم فليس كذلك، والحفاظ على هذا الحد واضحًا هو ما يمنع خط تقييم من أن يتحوّل بهدوء إلى خط محادثة.

كيف تقرر
اختر Kev عندما تحتاج إلى أرقام قبل الإطلاق، أو عندما تريد الضبط الدقيق على تسميات قراراتك الخاصة، أو عندما تريد تشغيل التقييم داخل حدودك الخاصة بتكلفة حدية صفرية، أو عندما تريد عدة مجالات قرار تتشارك نموذجًا أساسيًا مقيمًا واحدًا. لا تزال أرقام ECE المنشورة له قياسات أجراها المؤلف نفسه على أدوات الاختبار الخاصة بالمؤلف — فتعامل معها كتقييم ذاتي موثوق، لا كنتيجة مدققة من طرف ثالث — لكنها على الأقل مقياس معلن يمكنك محاولة إعادة إنتاجه، والوصفة موجودة هناك لإعادة إنتاجها.
اختر Microsoft-Decision-1 عندما يكون المعيار هو المشتريات أو طول السياق: نقطة نهاية Azure مُدارة مع فوترة موحدة وحزمة Responsible AI، و32K من المدخلات للمستندات الطويلة، ومورّد يمكن التصعيد إليه. غياب جدول القياس المرجعي الخاص به ليس فضيحة — فالعديد من النماذج المستضافة تُطلق دون واحد — لكنه يعني أن أول منحنى معايرة لهذا النموذج سيرسمه مستخدموه، ويجب أن تخطط لتكون واحداً منهم، على بياناتك الموسومة الخاصة، قبل أن توجّه عتبة إنتاجية نحوه.
