بطاقة عنوان مُولّدة تحمل نص «Jev vs Laya» فوق عنوان فرعي «33 مللي ثانية على T4، وخط أساس عشوائي»، تقارن بين Jev (مغلق، مستضاف، محرك قرار بلا أمثلة، 0.727) وLaya (Apache 2.0، ModernBERT بحجم 421M، يعمل محليًا، 0.362 بلا أمثلة).
Engineering & Research

جيف مقابل لايا: 33 مللي ثانية على T4، وخط أساس عشوائي

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

تحتوي بطاقة نموذج Laya على الجملة التي تحسم هذه المقارنة، وقد كتبها الأشخاص الذين صنعوا Laya. "Laya قاعدة سريعة للتخصص، وليست محرك قرارات zero-shot." أطلقت Convai Innovations نموذج Laya في 18 سبتمبر 2026، بعد ثلاثة أيام من إطلاق TypeSafe AI لنموذج Jev، بموجب Apache 2.0، مع أوزان على Hugging Face و pip install laya كنقطة دخول. يجيب عن أسئلة مُنمّطة في تمريرة أمامية واحدة دون فك ترميز رمزًا برمز، وهو الرهان المعماري نفسه الذي يقدمه Jev. الادعاء الرئيسي هو زمن استجابة p50 يبلغ 32.8 مللي ثانية لكل قرار على Tesla T4، ويُصاغ على أنه أسرع بنحو 7.8 أضعاف من زمن p50 المنشور لـ Jev والبالغ 236–276 مللي ثانية عبر واجهة API المستضافة الخاصة به. الادعاء حقيقي، وهو أيضًا يقيس شيئين مختلفين — وحدة معالجة رسومات محلية مقابل استدعاء عبر الشبكة — وصورة الدقة الكامنة تحته هي الجزء الذي ينبغي أن يحدد ما إذا كنت ستنزّله. في وضع zero-shot، سجّل Laya 0.362 على معيار القرارات المُنمّطة الخاص بـ TypeSafe. التخمين العشوائي يسجل 0.318. خط أساس الفئة الأغلبية يسجل 0.461. Laya، خارج الصندوق، أقرب إلى العشوائي منه إلى خط الأساس التافه.

ما هي Laya في الواقع

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, the calibrated probability per answer, free output, and the roughly 32,000-token request budget.

تُشحن Laya كنقطتي تحقق خلف موجّه مدمج يوزّع كل مُدخل إلى النقطة الصحيحة. نقطة التحقق الإنجليزية هي ModernBERT-large بـ421 مليون معامل وسياق من 512 رمزًا. أما النسخة متعددة اللغات فهي mmBERT-base بـ322 مليون معامل ونافذة من 1,024 رمزًا عبر أكثر من 100 لغة. كلاهما غير تلقائي الانحدار: تمريرة أمامية واحدة تُعيد الإجابة، لذا لا توجد حلقة فك ترميز، ولا JSON لتحليله، ولا مجال لإخراج نص خارج النوع المُعلن. هذه الخصيصة الأخيرة هي نفس الضمان البنيوي الذي يقدمه Jev، لكنها مُتوصَّل إليها من اتجاه مختلف، وهي قيّمة حقًا لأي شخص كتب منطق إعادة المحاولة حول نموذج ينسى أحيانًا إغلاق قوس.

Jev هو النظير المغلق: أول نموذج System One من TypeSafe AI، أُطلق في 15 سبتمبر 2026، ومستضاف ومتاح بوصول مبكر، مع ثلاث بدائيات مُنمّطة — Choice من قائمة تقدّمها، وScore وفق معيار مُرتّب، وNoul، وهو ادعاء بنعم/لا مع احتمال مُعاير. تُقيَّم جميع الأسئلة على التوازي مقابل قراءة مشتركة واحدة للحالة، ويكون الإخراج مجانيًا لأنه لا توجد توكنات إخراج، بينما الإدخال 0.042 دولار لكل مليون توكن. معمارية النموذج وعدد معلماته وحوسبة تدريبه غير معلنة، وقد قالت TypeSafe إن التفاصيل تُبقى طي الكتمان مع احتمال صدور ورقة بحثية لاحقًا.

ادعاء زمن الاستجابة، عند قياسه بشكل صحيح

إن رقم 32.8ms عند الوسيط (p50) الذي تحققه Laya على T4 رقم حقيقي وجيد. أما مقارنة الـ 7.8x مع أرقام Jev البالغة 236–276ms فهي الموضع الذي يلزم فيه الحذر، وبطاقة Laya نفسها صادقة بشكل غير معتاد بشأن السبب: فأرقام Jev هي أرقام منشورة من طرف ثالث لم تقِسها Convai بنفسها قط، كما أن المقارنة تُحاكي تمريرة أمامية محلية على GPU مقابل نداء API مستضاف يتضمن زمن الذهاب والإياب عبر الشبكة والانتظار في الطوابير. وإذا استبعدنا الشبكة من المعادلة، تصبح المقارنة المعمارية بين نموذجين بتمريرة واحدة، أحدهما بـ 421M معامل والآخر بحجم غير معلن لم تنشره TypeSafe قط.

هناك أيضًا رقم تجميع يستحق معرفته: بحجم دفعة من عشرة، تُبلغ Laya عن 7.2 مللي ثانية لكل سؤال. هذا هو شكل المنتج. صُممت Laya لتُشغَّل محليًا وعلى نطاق واسع، والنسخ المجتمعية المُنقولة للعمل على الجهاز مثل laya-mlx توسّع ذلك لتشمل Apple Silicon. الادعاءات المنتشرة بأنه «أسرع من Jev بمقدار 50 ضعفًا» لا تدعمها اختبارات الأداء التي نشرها المشروع بنفسه، والتوصيف الصادق هو وجود فجوة كبيرة بين المحلي والسحابي، جزء منها معماري وجزء منها مجرد الفرق بين وحدة معالجة الرسومات لديك وواجهة API الخاصة بشخص آخر.

ما تقوله أرقام الدقة، بالترتيب

هنا تتوقف المقارنة عن كونها مُجامِلة، ويجدر عرض الأمر بالتسلسل لأن الترتيب يهم.

• بدون أمثلة على معيار typed-decisions الخاص بـ TypeSafe — Laya ‏0.362، والعشوائي ‏0.318، وفئة الأغلبية ‏0.461، وJev ‏0.727. Laya أعلى من الصدفة وأدنى من خط الأساس البديهي.

• ضُبطت ضبطًا دقيقًا على قسم التدريب الخاص بالمقياس المرجعي نفسه — Laya بنتيجة 0.766 مقابل 0.727 لـ Jev. تفوز Laya، ويأتي الفوز من نقطة تحقق اطّلعت على بيانات تدريب المقياس المرجعي، وهو ما يجعله تصريحًا بشأن الضبط الدقيق، لا بشأن النموذج الأساسي.

• تصنيف نوايا Banking77، حيث تكون مجموعة الخيارات كبيرة — Laya 0.425 مقابل Jev 0.870. تتدهور Laya بحدّة بعد نحو 20 خيارًا، وحقول Choice لدى Jev موثّقة لتتعامل مع ما يصل إلى 255 قبل الحاجة إلى نمط التقييم ثنائي المراحل.

• المعايرة — تأتي Laya بخطأ معايرة متوقع متوسط قدره 0.466، ولا يتحسن إلى 0.081 إلا بعد إعادة ضبط درجة الحرارة حسب نوع السؤال. ويُدرَّب Jev بطريقة تسميها TypeSafe باسم RLCD، أي التعلم المعزز للقرارات المعايرة، ويصدر كل إجابة مصحوبة بتوزيع احتمالي — مع أن TypeSafe تنصح المستخدمين أيضًا بالتحقق من العتبات على بياناتهم الموسومة الخاصة، ووجد تدقيق مستقل واحد أن معايرة Jev تتفاوت بحدة حسب المهمة.

النمط لا لبس فيه. Laya قاعدة قوية للضبط الدقيق ومحرك قرار ضعيف في التعلم الصفري، وهي تقول ذلك بنفسها. Jev محرك قرار قوي في التعلم الصفري لا تزال معايرته بحاجة إلى التحقق لكل عملية نشر. هذان منتجان مختلفان ببنيتي تسعير مختلفتين، والاختيار بينهما هو في الغالب مسألة ما إذا كانت لديك بيانات موسومة وحلقة تدريب.

ليس حساب التكلفة على الشكل نفسه الذي عليه حساب جيف.

Jev يكلف 0.042 دولار لكل مليون رمز إدخال، مع إخراج مجاني، أي 42 دولارًا لكل مليار، كما أن استدعاءً بالحجم الأقصى ضمن ميزانية الطلب الموثّقة البالغة نحو 32,000 رمز يكلّف أقل بكثير من سنت واحد. وقد بلغت تكلفة اختبار Every المستقل الذي شمل 777 حكمًا عبر 37 مستندًا نحو ربع سنت.

تكلفة Laya لكل استدعاء هي صفر على الهامش وغير صفرية إجمالاً، والإجمالي ليس صغيراً. نموذج بـ 421 مليون معامل على T4 رخيص التشغيل ولا يزال يكلفك وحدة معالجة رسومات، وخطوة الضبط الدقيق التي تجعل Laya منافسة هي حيث يقع الإنفاق الحقيقي — وسم البيانات، وجولة التدريب، وأداة التقييم، وإعادة ضبط درجة الحرارة لكل نوع سؤال التي تخفض خطأ المعايرة من 0.466 إلى 0.081. بالنسبة لتصنيف ثابت لا يتغير أبداً، هذه تكلفة لمرة واحدة تسترد تكلفتها عند الحجم. أما بالنسبة لتصنيف متغير، فهي تكلفة متكررة، ويصبح خط الأساس للتعلم الصفري لدى Jev البالغ 0.727 صفقة أفضل بكثير.

هناك تكلفة ثالثة يسهل تفويتها: نقطة التحقق الإنجليزية لدى Laya لها نافذة سياق من 512 رمزًا. هذا ليس نموذج قرار بميزانية سياق صغيرة — بل نموذج قرار بحجم فقرة. أما ميزانية الطلب لدى Jev، التي تبلغ نحو 32,000 رمز، فهي أكبر بستين مرة، وحتى هي أقل بمرتبة قدر عن النماذج التوليدية التي يُسعَّر كلاهما بالمقارنة معها. إذا كانت حالتك سلسلة دعم كاملة بدلًا من رسالة دعم واحدة، فإن نافذة أي من النموذجين ليست القيد الذي ينبغي أن تحسّن أداءك بناءً عليه.

مسألة النشر هي الفرق الحقيقي

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window and the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 on a T4, and the pip install entry point.

أقوى حجة لدى Laya ليست زمن الاستجابة، بل إن أوزان Apache 2.0 على Hugging Face تعني أن القرار لا يغادر بنيتك التحتية أبدًا، وأن نقطة النهاية لا تفرض أبدًا حدًا لمعدل الطلبات. وبالنسبة لقرار توجيه يُتخذ بناءً على سجل طبي أو مستند قانوني أو سجل حساب عميل، فهذا ليس تفضيلًا — بل هو العامل الحاسم، ولا توجد نقطة نهاية مستضافة بأي سعر تكسب هذه الحجة. إن Jev من TypeSafe في مرحلة وصول مبكر مع قائمة انتظار، وتشير وثائقه الخاصة إلى أن حدود معدل الطلبات قد تتغير دون إشعار.

الحجة المضادة هي ما تتخلى عنه. إن المعمارية الأكبر غير المُعلنة لدى Jev تقوم بالعمل الذي لا تستطيع معلمات Laya البالغة 421M فعله: فجوة التعلم الصفري البالغة 0.727 مقابل 0.362 وفجوة Banking77 البالغة 0.870 مقابل 0.425 كلتاهما مقياسان لمقدار المعرفة الكامنة داخل النموذج قبل أن تدرّبه. جواب Laya هو أنك توفّر تلك المعرفة بنفسك من خلال الضبط الدقيق، وعلى مجال ضيق ثابت ينجح ذلك الجواب — ونتيجة الضبط الدقيق 0.766 هي الدليل.

أين تقع طبقة القرار في مكدّس حقيقي

لا ينتج أي من النموذجين نصًا، لذا لا يمثل أي منهما كامل أي سير عمل. النمط المصمم له كلاهما هو نموذجان: طبقة قرار تقوم بالاستدعاء المُنمّط، ونموذج توليدي يتعامل مع الجزء الذي يحتاج نثرًا أو كودًا أو شرحًا. لا يقدّم OrcaRouter خدمة Jev أو Laya — فـ Jev هو نقطة نهاية الوصول المبكر الخاصة بـ TypeSafe وLaya هي أوزان تشغّلها بنفسك — لكن النصف التوليدي من ذلك النمط هو بالضبط ما نغطيه: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI عند سعر قائمة المزوّد مُمرَّرًا كما هو بهامش ربح 0%، لذا يصبح تغيير سعر المورّد ساريًا على جانبنا في اليوم نفسه. البنية ذات النموذجين قابلة للاختبار دون عقد مورّد ثانٍ، ومع تجاوز الفشل التلقائي لا يصبح المسار التوليدي نقطة فشل واحدة بينما تقرر ما إذا كانت طبقة القرار الرخيصة معايرة جيدًا بما يكفي للأتمتة عليها.

الحكم

إذا كانت لديك تصنيفية ثابتة وضيقة، وأمثلة موسومة، ومتطلّب للخصوصية أو زمن الاستجابة يستبعد استخدام واجهة برمجية مستضافة، فإن Laya هي الخيار الأكثر قابلية للدفاع عنه، والأرقام الناتجة عن الضبط الدقيق تدعم ذلك. أما إذا كنت تحتاج إلى أن يعمل القرار جاهزًا من دون إعداد، أو إذا تجاوزت مجموعات خياراتك عشرين فئة، أو إذا كانت الحالة أطول من فقرة، فإن بطاقة نموذج Laya نفسها تخبرك بأنه ليس المنتج المناسب لتلك المهمة — ونتيجة zero-shot البالغة 0.362 مقابل خط أساس للأغلبية قدره 0.461 هي الرقم الذي ينبغي أن تبقيه نصب عينيك عندما يستشهد أحدهم أمامك برقم زمن الاستجابة 7.8x.

القاسم المشترك بينهما أنفع مما يفصلهما. كلاهما يُزيل صنف الأخطاء الناشئ عن تنسيق المخرجات، ولا يفعل شيئًا حيال الصنف الناشئ عن الحكم والتقدير. كلاهما يقدّم الاحتمالات، ولا يملك أيٌّ منهما مخطط موثوقية منشورًا يمكنك الوثوق به دون التحقق منه. اختبر المعايرة على حالاتك الموسومة بنفسك قبل أن تعتمد الأتمتة على أيٍّ منهما — فزمن الاستجابة صار سلعة رخيصة، وقيمة الثقة هي الجزء الذي لا بد أن يُكتسب في كل عملية نشر.

A generated two-column scoreboard comparing Jev and Laya across the same six labelled dimensions, with a footer reading "Laya zero-shot vs random 0.318 and majority baseline 0.461; per Laya's own model card."