بطاقة عنوان مُولّدة لـ Microsoft-Decision-1 مقابل Laya، بعنوان فرعي «تغطية اللغات مقابل طول السياق»، مع شرائح تقول 25 لغة مدعومة مقابل أكثر من 100 لغة، وسياق من 32,768 رمزًا مقابل نافذة من 1,024 رمزًا، وواجهة برمجة تطبيقات مستضافة فقط مقابل أوزان Apache-2.0، وتذييل يشير إلى أن أرقام كلا المورّدين مُبلّغ عنها ذاتيًا.
Engineering & Research

Microsoft-Decision-1 مقابل Laya: 25 لغة عبر واجهة API، وأكثر من 100 لغة عبر تنزيل بحجم 322 ميغابايت

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إذا عددنا اللغات، تبدو المقارنة محسومة. Microsoft-Decision-1، المتاح عمومًا على Microsoft Foundry منذ 8 أكتوبر 2026، يدرج 25 لغة مدعومة ويصرّح بصراحة بأن التغطية والجودة والمعايرة "قد تتفاوت حسب اللغة"، ويسمّي اللغات غير الإنجليزية، وخصوصًا محدودة الموارد، مجالًا لأداء دون المستوى. Laya، الذي نشرته Convai Innovations في 18 سبتمبر 2026 بموجب Apache 2.0، يصف نفسه بأنه متعدد اللغات عبر أكثر من 100 لغة، ويفيد بأن 45 من 51 لغة مُختبرة تظل قابلة للاستخدام مع التوجيه، مقابل 23 من 51 لنظيره الإنجليزي فقط. أحدهما نموذج بحجم 9B خلف نقطة نهاية Azure بسياق يبلغ 32,768 رمزًا؛ والآخر مصنّف بـ 421 مليون معامل يعمل عند 32.8 مللي ثانية لكل قرار على جهاز Tesla T4 واحد مجانًا. كلاهما يرفض كتابة أي رمز، وكلاهما يعيد احتمالات فوق الخيارات التي تحددها.

لكن اقرأ بطاقتي النموذج بالكامل، فيتوقف عدد اللغات عن كونه الرقم المثير. إنها قصة المعايرة الكامنة وراءه، ويحكي المشروعان تلك القصة في اتجاهين متعاكسين.

لاية تنشر الرقم الذي يُحرج تسويقها الخاص

تنص بطاقة نموذج Laya، في قسم الحدود الخاص بها، على أن نقاط التفتيش الأساسية تحقق 0.362 في وضع zero-shot على معيار typed-decisions — أقل من خط الأساس 0.461 لفئة الأغلبية. هذه بطاقة تخبرك أن نموذجها أسوأ من التخمين "الإجابة الأكثر شيوعاً" في ذلك الاختبار. كما تنص على أن نقاط التفتيش الأساسية قريبة من الصدفة في zero-shot، وأن رقم 0.766 الرئيسي للقرارات المصنفة يتطلب ضبطاً دقيقاً على تقسيم ذلك المعيار نفسه، وأن الترتيبية الدرجة الأسئلة هي الأضعف بدائياً (SST-5 0.372)، وأن أسئلة الاختيار ذات العدد الكبير من الفئات تعاني لأن 77 خياراً يترك حوالي ثلاثة أو أربعة رموز لكل منها، وأن noul يمكن أن يتبع تسمياته الخاصة، وأن action.act_probability حقل "لا يحمل أي إشارة قابلة للاستخدام بعد" عند AUROC 0.30. جملة ملخص Convai الخاصة هي التي يجب حملها إلى أي تقييم: Laya هي قاعدة سريعة للتخصص، وليست محرك قرارات في وضع zero-shot.

تلك الصراحة أثمن مما تبدو، لأنها تخبرك بالضبط ما الغرض من Laya. إنه مُرمِّز تضبطه ضبطًا دقيقًا على تسمياتك الخاصة — فالمعمارية بأكملها مبنية بحيث لا تحتاج المخططات الجديدة إلى إعادة تدريب، لكن الأداء الجيد في مهمة ما يتطلب إعادة التدريب. وعند استخدامه بهذه الطريقة، تكون الأرقام المنشورة قوية: 0.766 مقابل 0.727 لدى Jev في القرارات المحدَّدة النوع بعد الضبط الدقيق، وAG News 0.950 مقابل 0.910، وDAIR Emotion 0.595 مقابل 0.480، وECE 0.081 مقابل 0.246 لدى Jev — مع الملاحظة الصادقة بأنه يُشحن وهو مفرط الثقة ويحتاج إلى إعادة ضبط درجة الحرارة، وهو ما ينقل متوسط ECE من 0.466 إلى 0.081.

Microsoft تنشر المنهجية وتحجب النتائج

تسير صفحة Foundry الخاصة بـ Microsoft-Decision-1 في الاتجاه المعاكس في التمرين نفسه. فهي تصف التقييم بالتفصيل — معايير قرار عامة ومجتمعية إضافة إلى مجموعات داخلية محتفظ بها، ومقاييس تشمل الدقة وخطأ المعايرة، مع تنويع ترتيب الخيارات، واختبارات إحصائية مقترنة، وإطار تقييم متطابق للنماذج المقارَن بها — وتُفيد بأن النموذج «يؤدي على قدم المساواة مع نماذج القرار الرائدة، ومتقدمًا على نماذج القرار المفتوحة الأخرى التي جرى تقييمها بالمنهجية نفسها». وتسمّي مجالات قوته (الاستدلال، وتطبيق القواعد، والمتانة أمام تنسيق المطالبات) ومجالات ضعفه (المعرفة المتخصصة بالمجال، وغير الإنجليزية).

ثم لا يطبع شيئًا. لا رقم دقة، ولا خطأ معايرة، ولا جدول لكل معيار. القيود المُعلنة ذاتيًا حقيقية ومفيدة — تتغير الدرجات مع الصياغة وترتيب الخيارات، والسؤال سيئ الصياغة يظل يعيد درجة، والمعايرة تكون أقوى في أنواع المهام المألوفة، ولا تُنتَج تفسيرات — لكن قائمة القيود ليست قياسًا. لذا فالمقايضة نظيفة بشكل غير معتاد: يمنحك Laya أرقامًا يمكنك أن تحاول دحضها على بياناتك الخاصة، وتمنحك Microsoft وضعية امتثال وسياقًا بحجم 32K يمكنك أن تضع فيه مستندًا طويلًا.

A generated two-column scoreboard for Microsoft-Decision-1 and Laya across six shared dimensions: architecture a 9B dense decoder post-trained by Microsoft versus a 421M ModernBERT-large with a from-scratch decision head; languages 25 supported with coverage caveats versus 100+ with 45 of 51 usable; context 32,768 tokens versus a 512-token English checkpoint and a 1,024-token multilingual one; published calibration none versus vendor-reported ECE 0.081 after temperature refitting; fine-tuning not available versus a documented specialisation path; and cost a Foundry per-token rate versus zero on your own hardware. A footer notes both sides are vendor-reported and neither is independently audited.

ما الذي يجلبه فارق الحجم فعليًا

صِغر Laya ليس تنازلًا هنا، بل هو التصميم نفسه. فولأن كل خيار يُقيَّم عند الرمز [MASK] الخاص به ويُمرَّر عبر softmax على خيارات ذلك السؤال، يُجمَّع فضاء الإجابات وقت الطلب بدلًا من أن يكون مضمَّنًا في رأس المفردات — ولهذا فإن مخططًا تبتكره بعد ظهر اليوم لا يحتاج إلى أي إعادة تدريب، ولهذا أيضًا يستوعب النموذج ما بين 322 و421 مليون معلمة. وتعمل النسخة متعددة اللغات أسرع بنحو 2.2 مرة من النسخة الإنجليزية، ويكتشف الموجِّه الكتابة في أقل من نصف ميلي ثانية، ويصل معدل الإنتاجية المجمَّعة إلى 103 إلى 332 سؤالًا في الثانية على بطاقة T4 واحدة. وبالنسبة لعبء عمل يقيّم كل تذكرة، وكل مستند مُسترجَع، وكل إجراء مقترَح، فإن معدل الإنتاجية هذا هو الميزة، لا عدد المعلمات.

تكاليف ذلك التصميم محددة بالقدر نفسه وتستحق الذكر مقابل بديل Microsoft. تأخذ نقطة التفتيش الإنجليزية نافذة من 512 رمزًا؛ وتأخذ متعددة اللغات 1,024، قابلة للتوسعة نحو 8K. يأخذ Microsoft-Decision-1 عدد 32,768. لا يتسع خيط دعم طويل أو عقد كامل أو مستند سياسة متعدد الصفحات في نافذة Laya على الإطلاق، ولا تعوّض أي سرعة عن الاقتطاع. تجيب Laya على مجموعة أسئلة واحدة لكل تمرير أمامي بميزانية رموز موثقة لكل خيار؛ وتوثق Microsoft استدعاءً واحدًا يصل إلى 32K رمزًا دون سقف لكل سؤال. ومن الجدير معرفته أن نقطة ضعف Laya التنافسية كمصنّف: فهي تسجل 0.425 في Banking77 مقابل 0.870 لـ Jev، وهو نوع مشكلة النوايا دقيقة التفصيل وعالية التعدد حيث تكون تمريرة التخصص أهم ما يكون.

A screenshot of the Laya model card on Hugging Face, read 10 October 2026, showing the convaiinnovations organisation, a TextClassification pipeline tag, Transformers and Safetensors badges, and the Laya and system-one tags on the model page.

مقارنة التكلفة التي ليست لكل رمز

Laya مجاني عند نقطة الاستخدام — مستضاف ذاتيًا، Apache 2.0، مُدرَج بتكلفة استضافة ذاتية قدرها "$0" — وثمنه الحقيقي هو عملية الضبط الدقيق التي يتعين عليك إجراؤها له قبل أن يصبح جيدًا في مهمتك. Microsoft-Decision-1 هو واجهة برمجة تطبيقات Foundry مستضافة بسعر لكل توكن غير مذكور في صفحة الطراز، ولا أوزان لتنزيلها، ولا مسار للضبط الدقيق، والاستدلال بالدفعات معطّل. أحدهما مشروع لوسم البيانات مقدمًا، والآخر استدعاء محاسَب بالاستهلاك. وأيّهما أرخص يعتمد كليًا على حجم الاستخدام، ونقطة التعادل مرتفعة: مشفّر بـ421 مليون معامل يقيّم 300 عنصر في الثانية على T4 مستأجرة يصعب جدًا التغلّب عليه على مستوى كل قرار بعد تدريبه.

هنا يستحق OrcaRouter مكانه في خط معالجة مبني على أي من النموذجين، وهو الجانب التوليدي فقط. نحن لا نستضيف Microsoft-Decision-1 ولا Laya: فكلاهما يعيد احتمالات لا نصًا، وليس أي منهما في كتالوجنا، ونقطة نهاية التقييم ليست هدفًا من نوع chat-completions. ما نوفره فعلًا هو النموذج الذي ينتج الشيء الذي يُقيَّم — مسودة الرد، واستدعاء الأداة المقترح، والإجابة المرشحة التي يحكم عليها بعد ذلك الرأس المُضبط بدقة لدى Laya. هذا أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI بسعر قائمة المزوّد الممرَّر دون هامش ربح بنسبة 0%، مع تحويل احتياطي تلقائي عند تدهور أحد مسارات التقديم. في حلقة تُقيِّم كل ما تولّده، يكون استدعاء التوليد هو الجزء الذي قد يتعطل، والتحويل الاحتياطي هو ما يضمن استمرار تغذية طابور التقييم.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Laya nor Microsoft-Decision-1 appears.

أي واحدة تختار؟

خذ Laya إذا كانت قراراتك تصل بلغات متعددة، وإذا كان حجمك مرتفعًا بما يكفي ليكون التسعير لكل رمز مهمًا، وإذا كانت لديك تسميات وأسبوع للضبط الدقيق، أو إذا كنت بحاجة إلى تشغيل التقييم على عتاد داخل حدودك الخاصة. تقبّل نافذة من 512 إلى 1,024 رمزًا وحقيقة أن نقطة التحقق الأساسية ستكون قريبة من الصدفة حتى تخصصها، وستحصل على نموذج قرار صادق في كونه نقطة بداية.

اختر Microsoft-Decision-1 إذا كانت مدخلاتك مستندات طويلة بدلًا من التذاكر، وإذا كانت بوابة النشر لديك هي مصادقة Azure والفوترة الموحّدة وحزمة الذكاء الاصطناعي المسؤول بدلًا من التنزيل، وإذا كانت 25 لغة تغطي حركة المرور لديك، أو إذا كنت تفضّل ألّا تمتلك النموذج على الإطلاق. تقبّل أنك سترسم أول منحنى معايرة له بنفسك، وخصّص فترة بعد الظهر لعيّنة موسومة للقيام بذلك — لأنه، على عكس Laya، لن يسلّمك رقم ECE لتجادل بشأنه.