بطاقة عنوان مُنشأة لمقارنة Laya مقابل Nimble، تحمل العنوان الفرعي لهذا المقال وسطر تذييل يوضّح أي الجانبين أرقامه مُبلَّغ عنها من المورّد وأيّها من طرف ثالث.
Engineering & Research

Laya مقابل Nimble: بيانات تقابلية في مقابل مُرمِّز أسرع

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Laya وNimble هما نموذجا القرار مفتوحا الأوزان اللذان بذل مؤلفوهما أكبر جهد في شرح كيفية بنائهما، وتفسيراتهما تختلف حول موضع الصعوبة. أصدرت Convai Innovations نموذج Laya في 18 سبتمبر 2026 بموجب Apache 2.0 — نقطة حفظ ModernBERT-large إنجليزية بحجم 421M، ونقطة حفظ mmBERT-base متعددة اللغات بحجم 322M تغطي أكثر من 100 لغة، وموجّه بينهما بزمن دون الملي ثانية، وزمن p50 منشور يبلغ 32.8 مللي ثانية لكل قرار على Tesla T4. بنت Bespoke Labs نموذج Nimble بوصفه ضبطًا دقيقًا بطريقة LoRA على Qwen3.5-9B، بموجب Apache 2.0، وتصفه بأنه "Jev مفتوح المصدر" — مستوحى من Jev الخاص بـ TypeSafe AI لكنه لا يستخدم أوزانه ولا بنيته ولا تقطيرًا لمخرجاته. جواب Convai لمشكلة الدقة هو السرعة وقاعدة قابلة للضبط الدقيق. أما جواب Bespoke فهو بيانات التدريب. هذا الفرق يستحق اهتمامًا أكبر من فجوة الدقة البالغة ثلاث نقاط التي تظهر في الجداول الرئيسية.

الادعاء الذي يقدّمه كل مشروع في الواقع

ادعاء Laya معماري. إنه غير انحداري ذاتي بالمعنى الدقيق — مُشفّر ثنائي الاتجاه، لا حلقة فك تشفير، لا JSON لتحليله، لا مساحة لإصدار نص خارج النوع المعلن. هذا الضمان البنيوي هو نفسه الذي يقدمه Jev، وقد تم التوصل إليه من اتجاه مختلف، وهو قيّم حقاً لأي شخص كتب منطق إعادة المحاولة حول نموذج ينسى أحياناً إغلاق قوس. التكلفة هي أن مُشفّراً بحجم 421M بنافذة 512 رمز وبدون تدريب مسبق توليدي خلفه لا يعرف الكثير. تقول Convai ذلك في بطاقة النموذج: "Laya قاعدة سريعة للتخصص، وليست محرك قرارات بدون أمثلة."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Nimble repository on GitHub, showing the description "Local typed decisions, contrastive data curation, and model evaluation", the README heading "Bespoke Nimble - Data, Model, Recipe for an open Jev", the contrastive example where changing one fact flips the correct answer, and the 2,676-example training split against the frozen 324 held-out set.

ادعاء Nimble يدور حول البيانات. منهج Bespoke هو التنظيم التقابلي، مقتبسًا من عمل الفريق السابق Bespoke-MiniCheck: اكتب مثالين متطابقين تقريبًا يختلفان في "حقيقة محورية" واحدة، بحيث تنقلب التسمية الصحيحة. تتضمن خط الأنابيب أربع خطوات معلنة — التحقق من أن قواعد القرار يمكن أن تؤدي فعلاً إلى إجابات مختلفة، وبناء الزوج بتغيير ثماني كلمات على الأكثر، والتحقق من كلا المثالين عبر نداءات نموذج منفصلة إضافة إلى فحص إزالة كل جملة، وتوليد التسميات في الشيفرة مع الاحتفاظ فقط بالأزواج التي تختلف تسمياتها فعليًا. الهدف ليس المزيد من الأمثلة بل أمثلة أكثر حدة: إجبار النموذج على تعلم الأدلة التي ينبغي أن تغيّر القرار. هذه نظرية مختلفة حول سبب فشل نماذج القرار الصغيرة، وهي أكثر إثارة للاهتمام من نقطة دقة أخرى.

ما تدعمه الأرقام المنشورة فعليًا

يُبلغ Nimble عن توافق بنسبة 90.12% مع التسميات المرجعية على 324 عينة محجوزة، مقابل 93.21% لـ Jev، و66.36% لـ Qwen3.5-9B القاعدي غير المضبوط، و84.88% لـ Qwen3.8 27B غير المضبوط. ويُبلغ عن وسيط يبلغ نحو 106ms على H100 و444ms على M5 Pro بذاكرة 64GB. تلك هي أرقام منصة الاختبار الخاصة بـ Bespoke. مجموعة التقييم المكونة من 324 عينة هي الجزء الذي يجب وزنه بعناية، ويوضح المشروع السبب بنفسه: تمتد العينات عبر ست من أصل عشر عائلات من المصادر التدريبية، وقد وُلِّدت وتحقق منها نماذج دون مراجعة بشرية، وبالتالي فإن التعميم على فئات غير مرئية غير مُثبَت. عندما يُدرَّب نموذج بطريقة لتنسيق البيانات ثم يُقيَّم على تقسيم محجوز من نفس التوزيع المنسق، فإن رقم الدقة هو بيان حول الاتساق الداخلي للطريقة، وليس حول حركة المرور الخاصة بك.

أرقام Laya تأتي من الطرف الآخر. في معيار typed-decisions التابع لـTypeSafe، تسجل 0.362 في وضع zero-shot — والعشوائي 0.318، وخط أساس فئة الأغلبية 0.461 — و0.766 عند ضبطها الدقيق على قسم التدريب الخاص بالمعيار نفسه. في Banking77، البالغ 77 تصنيفًا، تسجل 0.425 مقابل 0.870 لـJev، وهو أوضح مثال على سقفها عند تعدد الخيارات. في AG News بأربعة تصنيفات تسجل 0.950 مقابل 0.910 لـJev؛ وفي DAIR Emotion بستة تصنيفات، 0.595 مقابل 0.480. ويبلغ خطأ المعايرة لديها 0.466 وينخفض إلى 0.081 بعد إعادة ضبط درجة الحرارة حسب نوع السؤال. في اختبار طرف ثالث واحد على 100 رسالة استعجال من Mars-base، كان Jev عند 100/100 وLaya عند 53/100. وفي تقييم مستقل لاستدعاء أدوات الوكيل، حققت Laya معدل استدعاء رفض بنسبة 100% على الاستدعاءات الخطرة، لكن فقط عبر وسم كل شيء، وهو فشل في الدقة متنكّر في ثوب انتصار سلامة.

ضع مجموعتي الأرقام جنبًا إلى جنب، والقراءة الصادقة هي أنهما قِيستا على شيئين مختلفين. نسبة Nimble البالغة 90.12% هي توافق مع تسمياتها المرجعية المُنسَّقة الخاصة بها. أما 0.362 الخاصة بـ Laya فهي معيار قياس لم تبنه هي. ولا يمكن تعميم أي من الرقمين.

المعايرة: المكان الوحيد الذي يتحلى فيه كلا المشروعين بصراحة غير معتادة

هنا يتقارب المشروعان إلى أقصى حد في الروح، ويتباعدان إلى أقصى حد في النتيجة.

يحذّر README الخاص بـ Bespoke صراحةً من أن احتمالات Nimble هي لوجيتات مُطبَّعة بـ softmax على المرشّحين المقدَّمين، وليست معدلات صحة مُعايَرة — فقيمة 0.9 لا تعني صحة بنسبة 90%. ويوصي بإضافة خيار "لا شيء مما سبق"، لأنه إذا لم يكن الجواب الصحيح ضمن المرشّحين فسيظل أحدهم يفوز. وفي تقييم أحدث من 3,880 سجلاً يشمل 13 مجموعة فرعية، كان لدى Jev خطأ معايرة مُبلَّغ عنه أقل في 11 من 13 مجموعة فرعية، ودرجة Brier أقل في 10 من 13. لذا، فإن تشابه توافق الوسوم لا يعني ضمنًا تشابه جودة الاحتمالات، وهذا ما يقوله Bespoke.

إفصاح Convai هو الصورة المعكوسة: خطأ المعايرة المتوقع البالغ 0.466 موجود على البطاقة، بجانب 0.081 الذي ينتجه إعادة ملاءمة درجة الحرارة حسب نوع السؤال. لا يقدّم أي من المشروعين نموذجًا يمكنك التصرّف بناءً على ثقته دون عمل. وكلاهما يخبرك بذلك كتابةً. إذا كنت تبني عتبة ثقة — إصدار تلقائي فوق 0.95، وتصعيد دون 0.7 — فإن الوثائق من كلا المؤلفين تخبرك بالشيء نفسه: اضبط العتبة على بياناتك الموسومة أولًا.

المقارنة، بُعدًا بُعدًا

• العمود الفقري — Laya: مُشفِّر ModernBERT-large بحجم 421 مليون، ثنائي الاتجاه، بدون تدريب توليدي مسبق. Nimble: Qwen3.5-9B مع ضبط دقيق LoRA، مع الاحتفاظ بالأساس التوليدي.

• اللغات — Laya: أكثر من 100 عبر نقطة التحقق متعددة اللغات 322M. Nimble: الإنجليزية.

• ميزانية المُوجِّه — Laya: 512 رمزًا بالإنجليزية، 1,024 متعدد اللغات. Nimble: 2,048 رمزًا كحدٍّ أقصى لكل مُوجِّه، مخططات مسطّحة فقط، والتعدادات محدودة بـ 26 خيارًا لكل حقل.

• السرعة — Laya: 32.8 مللي ثانية p50 على T4، 7.2 مللي ثانية لكل سؤال عند تجميع 10 أسئلة. Nimble: حوالي 106 مللي ثانية وسيط على H100، 444 مللي ثانية على M5 Pro 64GB.

• العتاد — Laya: وحدة المعالجة المركزية CPU وCUDA وApple MPS؛ بذاكرة مقيمة تقل عن غيغابايت على منفذ MLX. Nimble: وحدة معالجة رسومات CUDA بدقة BF16 لتحقيق الأرقام المذكورة، مع دعم مساري MLX وCUDA.

• الدقة المُبلَّغ عنها — Laya: 0.362 في التصنيف دون أمثلة، 0.766 بعد الضبط الدقيق، 0.425 على Banking77. Nimble: 90.12% على 324 عيّنة مُنتقاة محجوزة مقابل 93.21% لـ Jev.

• المنهج — Laya: البنية أولاً، ثم الضبط الدقيق لكل عملية نشر. Nimble: تنظيم البيانات التقابلي، منشور كوصفة.

• الترخيص — Apache 2.0 لكليهما.

هناك قيدان في تلك القائمة يستحقان القراءة مرتين قبل أن تلتزم. حد Nimble البالغ 26 خيارًا لكل تعداد وسقف المطالبة البالغ 2,048 رمزًا هما حدان صارمان للمخطط، وليسا تدهورًا في الأداء — إذا كان تصنيفك يحتوي على أربعين تسمية أو كانت مطالبتك تحمل مستندًا طويلًا، فإن Nimble هو الأداة الخاطئة بغض النظر عن دقتها. كما أن Nimble يقيّم كل حقل بشكل مستقل، لذا فإن أي قاعدة اتساق بين الحقول — "إذا كان A صحيحًا فيجب أن يكون B خاطئًا" — يجب أن تكون في الكود الخاص بك، وليس في النموذج.

لماذا تُعد وصفة البيانات الأثر الأكثر قابلية للنقل؟

إليك الحجة لصالح Nimble التي تغفلها جداول الدقة. نشرت Bespoke خط أنابيب التنسيق، وليس الأوزان فقط. إذا كانت مشكلة قرارك ذات تصنيف ثابت ويمكنك كتابة القواعد، فإن الطريقة التباينية شيء يمكنك تشغيله على بياناتك الخاصة مع حقائق التركيز الخاصة بك، فوق أي نموذج أساسي تفضله. إن 9B LoRA برهان على الطريقة بقدر ما هو منتج.

قابلية النقل لدى Laya مختلفة ومكمّلة. لأنها صغيرة، ولأنها تعمل على وحدة المعالجة المركزية (CPU)، ولأن نسخ ONNX و MLX موجودة، فإن Laya هي النموذج الذي يمكنك وضعه داخل عملية لا تحتوي على وحدة معالجة رسومات (GPU) ولا شبكة. في اختبار أداء لوكيل متصفح من طرف ثالث، أكملت Laya 0 من 50 مهمة وأعلنت الإكمال قبل الأوان في 33 محاولة — لكن مؤلفي الاختبار يشيرون إلى أنها دُرّبت على أعمال تقديرية مثل تذاكر الدعم والفواتير ومراجعة تتبّع الوكيل، وليس التنقل. اقرأ تلك النتيجة كبيان نطاق وليس كحكم، وهي متسقة مع تأطير كلا المشروعين: هذه مكوّنات لفئة محددة من القرارات، وليست وكلاء عامين.

لا Laya ولا Nimble نموذج مستضاف على OrcaRouter. كلاهما أوزان تشغّلها بنفسك، ولا ينبغي قراءة أي شيء في هذا المقال كزعم بأننا نقدّمهما. سبب ظهور منتج التوجيه على الإطلاق هو السبب نفسه الذي يجعله يظهر في أي معمارية لنموذج قرار: نموذج القرار يجيب عن نداء واحد، بينما لا يزال التطبيق المحيط به بحاجة إلى نص مكتوب. إن خط المعالجة الذي يستخدم Nimble لتقييم مدى توافق المسودة وLaya لتوجيه الاستثناء سيظل بحاجة إلى نموذج توليدي لكتابة المسودة. إن إبقاء هذا النصف التوليدي على نقطة نهاية واحدة متوافقة مع OpenAI — أكثر من 200 نموذج، سعر قائمة المزوّد يُمرَّر كما هو بهامش ربح 0% بحيث يصبح أي تخفيض سعري من المزوّد ساريًا في اليوم نفسه، مع تجاوز تلقائي للفشل بين المزوّدين — يعني أن طبقة القرار يمكن استبدالها دون المساس بعقد الطبقة التوليدية.

الحكم، والتجربة التي من شأنها أن تغيّره

اختر Nimble إذا كانت تصنيفاتك ثابتة وضيقة، ومدخلاتك بالإنجليزية وقصيرة، ولديك GPU، وتريد وصفة البيانات بقدر ما تريد النموذج. اختر Laya إذا كنت بحاجة إلى مدخلات متعددة اللغات، أو ميزانية أقل من 40 مللي ثانية، أو عملية بدون GPU على الإطلاق — واحسب تكلفة الضبط الدقيق منذ البداية، لأن نقطة التفتيش للتصنيف الصفري أقل من خط الأساس التافه، وبطاقة النموذج تقول ذلك.

التجربة التي من شأنها أن تحسم الأمر هي تقييم مزدوج على حركة مرور حقيقية: نفس المدخلات، ونفس مجموعات الخيارات، ونفس عتبات الثقة، مُقيَّمة مقابل تسميات بشرية، مع مخطط موثوقية لكل منها. تحذّر وثائق Nimble الخاصة من أن احتمالاتها ليست معدلات صحة، ويذكر بطاقة Laya خطأ معايرة قدره 0.466 قبل إعادة الملاءمة، لذا فإن هذا المخطط هو الأداة التي ستخبرك فعليًا أي نموذج يجب أن تضعه أمام الإنتاج. لم ينشر أي من المشروعين مخططًا، ولم ينشر أي منهما مخطط الآخر. ابنِه على بياناتك الخاصة قبل أن تحدد عتبة.

A generated two-column scoreboard comparing Laya and Nimble across backbone, languages, prompt budget, label agreement, latency and licence, with a footer reading "Nimble's 90.12% is agreement with its own curated labels; Laya figures per its model card."