بطاقة عنوان مُنشأة لمقارنة Laya مقابل von، تحمل العنوان الفرعي الخاص بهذا المقال نفسه، مع سطر تذييل يوضّح أيّ الجانبين أرقامه مُبلَّغ عنها من المورّد وأيّها من طرف ثالث.
Engineering & Research

Laya مقابل von: عندما لا ينتقل معيار البائع

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

مهمة تصنيف نوع الالتزام بستة تسميات محتملة، حيث يمنحك التخمين 8.3% وتحصل von على 26.7%. مهمة توجيه الملفات حيث يحصل النموذج نفسه على 8.8%، بالكاد فوق مستوى الصدفة. مهمة ثنائية لاتساع التغيير بمساحة تحت المنحنى (AUC) تبلغ 0.513، وهي أشبه برمية عملة معدنية. تأتي هذه الأرقام من تقييم طرف ثالث لـ von — نموذج System One مفتوح المصدر من wfzyx، وهو مُرمِّز ModernBERT-Large بحجم 395M صدر بموجب Apache 2.0 في 18 سبتمبر 2026، في نفس اليوم الذي صدرت فيه Laya من Convai Innovations. على معيار jabr v2 الخاص بـ von، الصورة معاكسة: دقة ماكرو 71.5% عبر 49 مهمة و869 حالة، وتوجيه الاختيار عند 83.4%، ونتيجة ViZDoom بمتوسط 9.38 قتلة عند أقل من 18ms مقابل Jev من TypeSafe AI عند 5.62 قتلة وحوالي 115ms. مجموعتا الأرقام حقيقيتان. المسافة بينهما هي أكثر شيء مفيد نشره أي شخص عن هذه الفئة من النماذج، وهي تنطبق على Laya أيضًا.

نموذجان، عمودان فقريان، ونمط فشل مشترك واحد

إن von و Laya جاران متقاربان معمارياً، ولهذا فإن مسألة النقل هي العدسة المناسبة لمقارنتهما. كلاهما مُرمِّزان غير انحداريين ذاتيين مبنيان على ModernBERT: von بـ 395 مليون معلمة، ونقطة تفتيش Laya الإنجليزية عند 421 مليون. كلاهما يعرضان البدائيات الثلاث نفسها — choice من قائمة مقدمة، score على معيار تقييم مرتب، noul كاحتمال معاير لـ"نعم" — وكلاهما يطبّق /v1/systemone تنسيق الإرسال بحيث يمكن لعميل مكتوب من أجل Jev التابع لـ TypeSafe أن يتوجه إلى خادم محلي بدلاً من ذلك. كلاهما Apache 2.0. كلاهما يعيدان الاحتمالات بدلاً من النص، ولا يمتلك أيٌّ منهما حلقة فك ترميز ليهلوس فيها.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

الاختلافات تكمن في قصة التدريب. تم تدريب von مسبقًا على 2 تريليون رمز من نصوص الويب العامة والأدبيات التقنية والشيفرة، ثم تم ضبطه بدقة على مجموعة بيانات متوازنة متعددة المجالات تضم حوالي 290,000 مثال، تشمل سير العمل التشغيلي والمؤسسي، والأمن و DevOps، والسلامة والإشراف على السياسات، واللغويات، والفرز، والاستدلال الخصومي. استخدم التدريب اللاحق التعلم المعزز مع توزيع المعايرة، مع تقليل مركب من الإنتروبيا المتقاطعة ودرجة برير مع لامدا عند 0.5، وتقارب مقياس درجة الحرارة عند T=1.1692. نقطة التحقق الإنجليزية لدى Laya هي ModernBERT-large المضبوطة بدقة لشكل القرار المحدد، بنافذة 512 رمزًا، إلى جانب نقطة تحقق متعددة اللغات mmBERT-base بحجم 322M تغطي أكثر من 100 لغة خلف موجه، و32.8ms p50 منشورة لكل قرار على Tesla T4.

نمط الفشل المشترك هو أن كليهما مشفّران مدرَّبان على إنتاج قراءة، وليسا مُستدِلَّين. ويوضّح ملف README الخاص بـ von نفسه أنه يستهدف خطوط معالجة حساسة للزمن حيث تُدخل النماذج الانحدارية الذاتية تأخيرًا مقداره 500–2,000ms وأخطاءً غير حتمية في تحليل المخطط. يخبرك هذا التأطير بما هو مخصّص له: تصنيف سريع وحتمي ومعايَر إحصائيًا. لكنه لا يخبرك بأنه سينجح في تصنيفك أنت، والمعيار المستقل هو ما يحدث عندما يتحقق شخص من ذلك.

قراءة معيار فون الخاص به بصدق

نتائج jabr v2 منشورة من المالك ولم تخضع لتدقيق مستقل، وشكل المعيار لا يقل أهمية عن الدرجة. تسعٌ وأربعون مهمة و869 حالة تمثل اتساعًا معقولًا لتقييم نموذج قرار، ودقة ماكرو بنسبة 71.5% رقم قوي لمشفّر بحجم 395M. التفصيل حسب المجال هو حيث يصبح الأمر مفيدًا: فرز الأعراض بنسبة 100.0%، والخدمات المنزلية بنسبة 95.7%، وتوجيه المدن بنسبة 94.7%، وتوجيه الاختيار إجمالًا بنسبة 83.4%. هذه هي المهام التي بُنيت حولها مجموعة بيانات التدريب — يصف README بيانات الضبط الدقيق بأنها سير عمل تشغيلية ومؤسسية، والأمن و DevOps، والسلامة والإشراف على السياسات، واللغويات، والفرز والاستدلال الخصومي. الدرجة العالية في فرز الأعراض هي بيان بأن النموذج تعلّم مجال الفرز، وليس أنه تعلّم التصنيف.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

نتيجة ViZDoom هي الأكثر اقتباسًا، وهي تستحق قراءة متأنية. 9.38 متوسط القتلات في "Defend the Center"، عبر ثماني بذور، وبأسلوب zero-shot من نص مشهد مُهيكل، بزمن استجابة أقل من 18 مللي ثانية، مقابل 5.62 قتلة لدى Jev عند نحو 115 مللي ثانية — أي تحسّن بنسبة +66.9%. إنها نتيجة لافتة، وهي أيضًا بيئة لعبة تُحرّكها نصوص مُهيكلة حيث تكون السياسة الانعكاسية السريعة هي الشكل الملائم تمامًا. وتأطير المشروع لنموذج System One — انعكاسي، ومتوازٍ، وحتمي، ومعاير إحصائيًا — هو وصف منصف لما تكافئه تلك المهمة.

ثم أجرى التقييم الخارجي اختبار von على تصنيف نوع الالتزام، وتوجيه الملفات، واكتشاف الميزات، وتقييم نطاق التغيير، وخسر أمام خطوط الأساس القائمة على الكلمات المفتاحية والتعبيرات النمطية في بعضها. إن قيمة AUC البالغة 0.513 في المهمة الثنائية هي الرقم الأكثر حدة: رمي عملة معدنية، من نموذج ضُبطت معايرته على T=1.1692 ويدّعي ملف README الخاص به خطأ معايرة متوقعًا شبه مثالي. يمكن أن يكون كلا الأمرين صحيحًا. يمكن أن يكون النموذج جيد المعايرة على التوزيع الذي دُرّب عليه وعديم الفائدة على توزيع لم يره من قبل — بل إن المعايرة الجيدة على التوزيع الخاطئ أسوأ من المعايرة السيئة الواضحة، لأن أرقام الثقة تبدو موثوقة.

نفس الاختبار المُطبَّق على Laya

لقد تلقّت Laya نسخة من هذا التقييم، والنتائج متوافقة مع نتائج von. في معيار typed-decisions من TypeSafe، سجّلت Laya 0.362 في اختبار zero-shot مقابل 0.318 للعشوائي و0.461 لخط الأساس للفئة الأكثرية — أقرب إلى الصدفة من الإجابة التافهة. تذكر بطاقة النموذج الخاصة بها الاستنتاج: «Laya هي قاعدة سريعة للتخصص، وليست محرك قرارات zero-shot». بعد حوالي عشرين خيارًا، تتدهور بشكل حاد، حيث تسجّل 0.425 في Banking77 مقابل 0.870 لـ Jev. في اختبار طرف ثالث، على 100 رسالة استعجال من Mars-base، سجّل Jev 100/100 وسجّلت Laya 53/100. في معيار وكيل المتصفح، أكملت 0 من 50 مهمة، وأعلنت الإكمال قبل الأوان في 33 محاولة، 17 منها قبل اتخاذ أي إجراء — رغم أن مؤلفي المعيار يلاحظون أنها دُرّبت على أعمال الحكم مثل تذاكر الدعم والفواتير، وليس التنقل، وهو بيان نطاق وليس حكمًا.

يكمن اختلاف Laya عن von في ما تدّعيه لنفسها. نشرت Convai الرقم غير المُجمّل لـ zero-shot وخطأ المعايرة المتوقّع البالغ 0.466 على البطاقة، إلى جانب 0.081 الذي تنتجه إعادة ملاءمة درجة الحرارة حسب نوع السؤال. وينشر README الخاص بـ von رقم jabr v2 المُجمّل وفوز ViZDoom. كلا المشروعين صادقان بشأن ما فعلاه؛ لكن واحدًا منهما فقط يبدأ بمعيار أداء يبلو فيه النموذج بلاءً سيئًا. تلك ملاحظة عن المصادر، وليست اتهامًا — لكن إن كنت تختار بينهما بناءً على الأدلة المنشورة، فلاحظ أنك تقارن مشروعًا أظهر لك رقمه الضعيف بمشروع كان عليك أن تجد رقمه الضعيف في مكان آخر.

تباين المواصفات، بُعدًا بُعدًا

• العمود الفقري — Laya: ModernBERT-large 421M الإنجليزية، mmBERT-base 322M متعددة اللغات. من: ModernBERT-Large 395M.

• اللغات — Laya: أكثر من 100 عبر نقطة التحقق متعددة اللغات وموجّه. von: الإنجليزية، دون نشر أي نقطة تحقق متعددة اللغات.

• نافذة السياق — Laya: ‏512 رمزًا بالإنجليزية، و1,024 متعدد اللغات. von: لم تُنشر بالشروط نفسها؛ حالات jabr v2 هي قرارات قصيرة منظمة.

• زمن الاستجابة — Laya: 32.8ms عند p50 على T4، و7.2ms لكل سؤال عند الدفعة 10. von: يدّعي أقل من 15ms إلى أقل من 25ms، وأقل من 18ms في تشغيل ViZDoom.

• الدقة المُبلَّغ عنها — Laya: 0.362 في الوضع الصفري، و0.766 بعد الضبط الدقيق على التقسيم الخاص بالمعيار نفسه، و0.425 على Banking77. von: 71.5% ماكرو عبر مهام jabr v2 الـ49، و83.4% في توجيه الاختيار، و26.7% على نوع الالتزام في اختبار مستقل.

• المعايرة — Laya: ECE 0.466 عند الإطلاق، و0.081 بعد إعادة ضبط درجة الحرارة حسب نوع السؤال. von: تم ضبط درجة الحرارة على T=1.1692 خلال التدريب اللاحق RLCD، مع ادعاء تحقيق ECE شبه مثالي على توزيعه الخاص.

• التقديم — Laya: pip install laya، بالإضافة إلى منافذ مجتمعية على ONNX وGo وApple MLX. von: مجموعتا تطوير برمجيات بلغتي Python وTypeScript، وخادم HTTP عبر von serve، وإعدادات مسبقة جاهزة لفرز التذاكر، وأمن البريد الإلكتروني، والإشراف على المحتوى، وفرز أحداث الأمان.

• الأجهزة — Laya: وحدة المعالجة المركزية، وCUDA وApple MPS. من: NVIDIA CUDA وAMD ROCm وApple Silicon MPS ووحدة معالجة مركزية متعددة الخيوط.

• الترخيص — Apache 2.0 لكليهما.

الجزء من von الذي يتّسم بالتميّز الحقيقي

إن الأنماط القابلة للتركيب في von هي أكثر ما يُغفل الحديث عنه في مستودعه. بوابات الثقة، وتوزيع المسارات، والتقييم المركّب، والتوجيه على مرحلتين تُشحن كأنماط مُسمّاة إلى جانب الإعدادات المسبقة — فرز التذاكر، وأمن البريد الإلكتروني، والإشراف، وفرز أحداث الأمن — وهي تُجسّد البنية التي يحتاجها نموذج القرار فعلاً في الإنتاج. استدعاء واحد choice نادرًا ما يكون النظام بأكمله؛ الشكل المفيد هو موجّه منخفض التكلفة في المرحلة الأولى يوزّع إلى مرحلة ثانية متخصصة، مع بوابة ثقة تُصعّد الحالات غير المؤكدة. يشحن von ذلك كنمط موثّق بدلاً من تركه لك.

وهذا ينطبق انطباقًا تامًا على ما يفعله OrcaRouter في الجانب التوليدي، ويستحق قوله بوضوح لأن نصفَي هذا النمط يُبنى كل منهما عادةً بواسطة فرق مختلفة. لا يتم استضافة von ولا Laya على OrcaRouter — فكلاهما أوزان تقوم بتنزيلها وتشغيلها — ولا ينبغي أن يُقرأ أي شيء هنا على أنه ادعاء بأننا نقدمهما. ما يقع في قائمتنا هو النصف الآخر: أكثر من 200 نموذج توليدي خلف مفتاح واحد متوافق مع OpenAI عند سعر قائمة المزوّد يُمرَّر بهامش ربح 0%، بحيث يصل أي تخفيض سعري من المزوّد إلى فاتورتك في اليوم نفسه بدلًا من موعد التجديد. إذا قررت بوابة الثقة لدى von أن 4% من الطلبات تحتاج إلى نموذج رائد، فإن لغة التوجيه DSL هي التي تدمج هذا القرار في استدعاء واحد بدلًا من عقدين وSDKين، والتحويل التلقائي عند الفشل هو ما يمنع الفرع المكلف من أن يكون نقطة فشل واحدة.

ما العمل مع نموذجين يفشلان كلاهما خارج توزيع تدريبهما

الاستنتاج العملي من تقييم von ليس أن von نموذج سيئ. بل إن الدقة المنشورة لأي نموذج قرار هي ادعاء بشأن توزيع بيانات تدريبه، والسبيل الوحيد لمعرفة ما إذا كانت مشكلتك تقع داخل ذلك التوزيع هو اختباره. جدول المعايير في README الخاص بـ von نفسه يقارن نفسه بـ GLiNER2، وQwen3.5 4B المضبوط ضبطًا دقيقًا، وLaya، وJev من TypeSafe من حيث الحجم والدقة وزمن الاستجابة والاستضافة — وهو جدول مفيد، وكذلك جدول تأتي فيه كل مدخلات الدقة باستثناء واحد من أداة الاختبار الخاصة بالمؤلف.

بين الاثنين: اختر von إذا أردت مجموعة أوسع من النطاقات المنشورة، وبصمة أصغر قليلاً، وأنماط تقديم جاهزة للفرز والإشراف، ودليل ViZDoom على أنه يتعامل جيدًا مع قرارات النصوص المنظمة السريعة. اختر Laya إذا كنت بحاجة إلى إدخال متعدد اللغات — فلا يمتلك von نقطة تفتيش متعددة اللغات، ويغطي متغير mmBERT بحجم 322M لدى Laya أكثر من 100 لغة — أو إذا كان رقم 32.8 مللي ثانية على T4 ونافذة إنجليزية بحجم 512 رمزًا يناسبان عبء عملك. لا تختر أيًا منهما دون قضاء فترة بعد الظهر في وسم بضع مئات من الأمثلة من حركة المرور الخاصة بك وتشغيل كليهما عليها. توجهك وثائق كلا المشروعين نفسها إلى تلك التجربة، ونتيجة von من طرف ثالث هي ما يحدث عندما لا يجريها أحد.

الشيء الوحيد الذي قد يغيّر هذه المقارنة هو تقييم مقترن على مدخلات متطابقة مع مخطط موثوقية لكل نموذج. وهو غير موجود. وإلى أن يوجد، فإن الترتيب الأمين يكون وفق جودة الأدلة لا وفق الدرجة: فقد نشرت Laya أسوأ رقم لديها، ونشر von أفضل رقم لديه، والاختبار المستقل لـ von هو أقرب ما لدى أي منهما إلى تحقق خارجي.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."