بطاقة عنوان مُولَّدة تحمل النص "Laya Explained" فوق عنوان فرعي نصه "نموذج قرار يُجيب دون كتابة رمز واحد"، مع تذييل نصه "جميع الأرقام وفق بطاقة نموذج Laya ما لم يُذكر خلاف ذلك."
Engineering & Research

شرح لايا: نموذج قرار يُجيب دون كتابة توكن واحد

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أكثر ما يثير الاهتمام في Laya ليس سرعتها. بل إن كل خيار تقدّمه لها يُقيَّم عند [MASK] token الخاص به، ثم تُمرَّر الاحتمالات عبر softmax على خيارات ذلك السؤال الواحد. نشرت Convai Innovations أوزان Laya على Hugging Face في 18 سبتمبر 2026، بموجب Apache 2.0 — ثلاث نقاط تفتيش، ومستودع واحد، و421 مليون معامل للنموذج الإنجليزي. لا توجد رموز إخراج. لا توجد حلقة فك ترميز، ولا JSON لتحليله، ولا قوس يمكن أن تنسى إغلاقه. أنت تسلّمها حالة ومجموعة أسئلة مُنمّطة، وبعد تمريرة أمامية واحدة تحصل على اختيار من بين خيارات مسمّاة، أو درجة ترتيبية مع مستوى متوقّع، أو احتمال أن تكون عبارة صحيحة. لهذا التصميم نتيجة يغفلها الناس: لأن فضاء الإجابات يُجمَّع حسب كل طلب بدلًا من أن يكون مضمّنًا في رأس مفردات، فإن مخططًا تبتكره بعد ظهر اليوم لا يحتاج إلى إعادة تدريب. وله أيضًا حدّ، ويذكره المشروع بوضوح على بطاقة نموذجه: تسجّل نقاط التفتيش الأساسية 0.362 في معيار القرارات المُنمّطة، مقابل 0.318 للتخمين العشوائي و0.461 للإجابة دائمًا بالفئة الأغلبية. وجملة Convai نفسها هي التي ينبغي أن تُبقيها في ذهنك — "Laya قاعدة سريعة للتخصيص، وليست محرّك قرارات بلا أمثلة." نقطة المقارنة الواضحة هي Jev من TypeSafe AI، وهو نموذج System One مستضاف بلا أوزان منشورة، ولا عدد معاملات منشور، ولا نموذج أساس منشور. وLaya هي الإجابة مفتوحة الأوزان عنه. وما إذا كانت هذه الإجابة مفيدة لك يعتمد تقريبًا كليًا على أي نصف من خط الأنابيب تحاول استبداله.

ما هي Laya فعليًا، وما ليست عليه

ابدأ بالجانب السلبي، لأنه حيث تخطئ معظم الكتابات. لايا ليست LLM. إنها غير ذاتية الانحدار: تمريرة أمامية واحدة تنتج الإجابة، والنموذج لا يصدر نصًا أبدًا. مقارنة زمن وصولها بعدد الرموز في الثانية لنموذج محادثة هي مقارنة بين عمليتين مختلفتين — إحداهما تصنّف، والأخرى تولّد. إذا كنت بحاجة إلى فقرة، أو ملخص، أو خطة، أو سلسلة استدلال، فلا يمكن لـ Laya أن تقدم لك واحدة وليست تحاول ذلك.

ما هو: مشفّر ثنائي الاتجاه مع رأس قرار مثبّت في الأعلى. نقطة التحقق الإنجليزية هي ModernBERT-large — 395 مليون معلمة، مضبوطة بدقة كاملة — بالإضافة إلى رأس مُدرَّب من الصفر مكوّن من طبقتي محوّل، ومقيّم علامات الخيارات، ورأس act/escalate، ليصبح المجموع 421 مليون. تستبدل نقطة التحقق متعددة اللغات العمود الفقري بـ mmBERT-base، بـ 22 طبقة ومفردات 256 ألف، بمجموع 322 مليون. تُشحن ثلاث نقاط تحقق في مستودع واحد، ويتم تنزيل النقطة التي تطلبها فقط:

convaiinnovations/laya — ModernBERT-large، 421 مليون معامل، سياق من 512 رمزًا، الإنجليزية، حوالي 808 ميغابايت على القرص.

convaiinnovations/laya-multilingual — mmBERT-base، 322 مليون معامل، سياق من 1,024 رمزاً (يدعم المُشفّر ما يصل إلى 8,192 باستخدام RoPE)، أكثر من 100 لغة، أسرع بنحو 2.2 مرة، حوالي 647 ميغابايت.

convaiinnovations/laya-typed-decisions — ModernBERT-large، 421 مليون معلمة، سياق من 1,024 توكن، وهو الوحيد من بين الثلاثة الذي يحمل رقم 0.766 الذي ستراه مقتبسًا في كل مكان.

موجه يجلس في المقدمة ويختار نقطة التفتيش لكل طلب عن طريق اكتشاف نظام الكتابة واللغة في أقل من نصف مللي ثانية، بلغة بايثون الصرفة، قبل حدوث أي تمرير أمامي. هذه ليست ميزة تسهيلية. إنها ميزة صحة، وأدلة المشروع نفسها توضح السبب: نقطة التفتيش الإنجليزية تحقق دقة 0.000 على الخميرية بينما تبلغ عن ثقة 0.952. النموذج الذي يظل واثقًا بينما يكون مخطئًا تمامًا هو بالضبط الحالة التي لا يمكن لبوابة الثقة أن تنقذك فيها، لذا يجب اتخاذ قرار التوجيه قبل أن يرى النموذج المدخلات. عبر مسح لـ 51 لغة، جعل الموجه 45 من 51 لغة قابلة للاستخدام — المعرّفة على أنها تتفوق على العشوائية بثلاث مرات — مقابل 23 من 51 لنقطة التفتيش الإنجليزية وحدها.

A screenshot of the Laya model card on Hugging Face, showing the three checkpoints (convaiinnovations/laya, laya-multilingual and laya-typed-decisions) with their parameter counts and context windows, the choice, score and noul primitives, the Apache 2.0 licence, and the zero-shot and fine-tuned accuracy figures.

الحقيقة التصميمية الجديرة بالفهم: رمز [MASK] واحد لكل خيار

إذا أخذت شيئًا واحدًا من هذا المقال، فخذ هذا. في رأس تصنيف عادي، تكون مجموعة التسميات ثابتة وقت التدريب: الطبقة النهائية لها مخرج واحد لكل فئة، وإضافة فئة تعني إعادة التدريب. لا تفعل Laya ذلك. إنها تعرض كل خيار كنص مع علامة، ويقرأ مُقيّم علامة الخيار درجةً من المملوك لذلك الخيار الذي هو موضع [MASK]. ثم تُطبّق softmax على الخيارات التي تنتمي إلى ذلك السؤال.

لذلك يُعرَّف فضاء الإجابة عند وقت الطلب. أنت تكتب الخيارات، والنموذج يقيّمها. لا يحتاج المخطط الجديد إلى إعادة تدريب ولا ضبط دقيق، لأنه لا يوجد في الأوزان ما يشفّر "الفوترة" أو "التقني" كفئة — فقط الآلية لمقارنة خيار مُصاغ بآخر في سياق الحالة.

ثمّتان من الميزانيات تحكمان مدى جودة ذلك، وهما مشتركتان. تنقسم كل تسلسل إلى ميزانية للمُطالبات الخيارية (head_max_len، 192 رمزًا في نقطة التحقق الإنجليزية و256 في النقطتين الأخريين) وميزانية للمستند (ما يتبقى من max_len). يُجاب عن كل سؤال في نداء واحد في المرور الأمامي الواحد نفسه، لذا فإن نداءً يحتوي على ستة أسئلة ليس ستّ استدعاءات للنموذج. لكن الخيارات تتقاسم ميزانية الخيارات، ولهذا فإن سؤالًا بـ77 خيارًا مثل Banking77 يخصص نحو ثلاثة إلى أربعة رموز لكل تصنيف، وتنهار الدقة انهيارًا حادًا — 0.425 مقابل 0.870 المنشورة لدى Jev. الإصلاح موثَّق لا مخفي: ارفع head_max_len وmax_len، أو قسّم مجموعة خيارات كبيرة إلى اختيار تدريجي من الخشن إلى الدقيق على خطوتين.

البدائيات الثلاث

كل ما تقوم به Laya هو أحد ثلاثة أنواع من الأسئلة، وكل نوع يُعيد شكلًا مختلفًا:

اختيار — احتمال لكل خيار مُسمّى، بالإضافة إلى التصنيف الأعلى ودرجة ثقة. هذا هو العنصر الأساسي للتوجيه وتصنيف النوايا.

النتيجة — توزيع على مقياس مرتّب بالإضافة إلى مستوى متوقّع. هذا هو الأساس الترتيبي: الإلحاح، الإحباط، الخطورة.

noul — احتمال مُعايَر لصحّة عبارة ما، من 0.0 إلى 1.0. التصيّد الاحتيالي، خطر فقدان العملاء، حقن التوجيهات.

الأنواع صارمة على نحو يهمّ من الناحية التشغيلية. فلا يمكن لسؤال اختيار أن يُعيد خيارًا لم تقدّمه، لأن الخيارات الوحيدة التي يمكنه تقييمها هي تلك التي عرضتها. وهذا يزيل فئة كاملة من أعطال الإنتاج — قيمة التعداد المُختلقة، وJSON المقطوع، وحلقة إعادة المحاولة حول أي مُحلِّل. لكنه لا يزيل الخطأ الدلالي. والنموذج الذي يُعيد الفوترة: 0.94 لتذكرة كان ينبغي أن تُحوَّل إلى الدعم الفني مخطئ، وهو مخطئ بثقة تامة. المخرجات المُنمَّطة تضمن شكل الإجابة، لا صحتها قط.

RLCD، أو لماذا يُفترض أن تعني الاحتمالات شيئًا

معظم المصنّفات مدرَّبة لتكون صحيحة. أما Laya فمدرَّبة لتكون صادقة بشأن مدى صوابها، ووصفة التدريب هي مصدر ذلك.

تُسمى الطريقة RLCD — التعلم المعزّز للقرارات المعايَرة. تُصدر السياسة توزيعًا بدلًا من argmax؛ ويضيف الاستكشاف ضجيجًا غاوسيًا بمتوسط صفري إلى اللوجيتات؛ والمكافأة هي قاعدة تسجيل ملائمة تمامًا — لوغاريتمية زائد كروية، مع إضافة درجة احتمال مرتّبة للأسئلة الترتيبية. كلمة «ملائمة» هي التي تقوم بالعمل. لا تُعظَّم قاعدة تسجيل ملائمة تمامًا في التوقع إلا بالإبلاغ عن معتقداتك الحقيقية، لذا فإن التحوّط أو المبالغة في الادعاء يخسر المكافأة بحكم البناء لا بحكم التعليمات. التحديثات هي REINFORCE مع خط أساس لمتوسط المجموعة، بأسلوب GRPO، والمحادثات متعددة الأدوار تستخدم TD(λ=1.0) عبر شرائح البادئة.

النتيجة العملية هي أن عتبة الثقة شيء ذو معنى لبناء منطق التطبيق عليه — وهو ادعاء لا يمكنك تقديمه عن softmax صادر عن مصنف مُدرَّب بالانتروبيا المتقاطعة. وهو أيضًا ادعاء مصحوب بتحذير يصرّح به المشروع بصراحة: نقاط التحقق المُصدَرة مفرطة في الثقة، ويُتوقع منك إعادة ضبط معامل حرارة على بياناتك الخاصة قبل الوثوق بالأرقام. أدت إعادة ضبط معامل حرارة واحد لكل نوع سؤال وعدد خيارات إلى تغيير متوسط ECE من 0.466 إلى 0.081 على نقطة التحقق الإنجليزية ومن 0.314 إلى 0.106 على نقطة التحقق متعددة اللغات. عتبة البداية المقترحة من المشروع للموافقة التلقائية مقابل المراجعة البشرية هي حوالي 0.85.

ما هي تكلفة التشغيل

أرقام زمن الاستجابة خاصة بالمشروع نفسه، مقيسة على Tesla T4، مع كل نقطة تحقق تجيب على أسئلة متطابقة بايتًا ببايت في التشغيل نفسه:

• سؤال واحد — 39.5 ms على laya، و32.8 ms على laya-multilingual.

• خمسة أسئلة — 84.5 مللي ثانية و40.1 مللي ثانية.

• عشرة أسئلة مجمّعة — 158.6 مللي ثانية (15.9 مللي ثانية لكل سؤال) و72.3 مللي ثانية (7.2 مللي ثانية لكل سؤال).

• خمسون سؤالًا — 771 مللي ثانية و337 مللي ثانية، أو 6.8 مللي ثانية لكل سؤال على نقطة التحقق متعددة اللغات.

• الإنتاجية المُجمَّعة على وحدة T4 واحدة — من 103 إلى 332 سؤالًا في الثانية.

إذا رأيت ادعاءً منتشرًا بأنه "أسرع بـ50x من Jev"، فهو ليس رقم المشروع، كما أن مقياس الأداء الخاص بالمشروع نفسه لا يدعمه. المقارنة المنشورة من Convai هي 7.8x في زمن الاستجابة p50 لسؤال واحد: 32.8 ms مقابل 236–276 ms. وهذه المقارنة أيضًا هي التي ينبغي قراءتها بعناية، لأن بطاقة Laya تصنّف جانب Jev على أنه أرقام منشورة من طرف ثالث لم تقم Convai بقياسها — فلا تملك وصولًا إلى TypeSafe API — ولأنها تضع تمريرة أمامية على GPU محلي في مقابل استدعاء API مستضاف يتضمن الذهاب والإياب عبر الشبكة والانتظار في الطابور. الجزء المعماري من تلك الفجوة حقيقي. أما الجزء المتعلق بالبنية التحتية منها فليس خاصية من خصائص النموذج.

من حيث الذاكرة، تبلغ البصمة بضع مئات من الميغابايت لكل نقطة تحقق، ومن المفيد معرفة جدول النشر قبل تحديد حجم المضيف. يحتفظ الإعداد الافتراضي الكسول بنقطتي تحقق مقيمتين (الإنجليزية ومتعددة اللغات، وهما الوحيدتان اللتان يختار بينهما الموجّه تلقائيًا)، لذا بعد التحميل الأول لكل لغة لا تكلّف عملية التبديل سوى الكشف. يقوم Router(max_loaded=1) على جهاز محدود الذاكرة بإعادة التحميل عند كل تبديل لغة، وقد قيس بمتوسط وسيط قدره 7.4 ثوانٍ على CPU و10.3 ثوانٍ على T4. يُعد Router(preload=True) هو إعداد الخادم: لا يُعاد تحميل أي شيء، وزمن الاستجابة لكل طلب هو رقم 32.8 ms على GPU أو 193–464 ms على CPU.

النصف الصادق

هنا تُثبت القطعة أنها تستحق مكانها، لأن السطح المحيط بـ Laya صاخب والقيود محددة.

أولاً، الرقم الرئيسي هو رقم مُضبوط بدقة. دقة 0.766 تعود إلى laya-typed-decisions، نقطة التحقق المُضبوطة بدقة على تقسيم التدريب الخاص بذلك المعيار نفسه. تسجل نقاط التحقق الأساسية 0.362 و0.342 في وضع zero-shot مقابل خط أساس عشوائي قدره 0.318 وخط أساس فئة الأغلبية قدره 0.461 — أي أقل من خط الأساس التافه، بعبارة أخرى. يذكر المشروع ذلك في قائمة القيود الخاصة به بدلاً من إخفائه، ونقطة التحقق المُضبوطة بدقة تتجاوز سقف 0.735 للاتفاق الذاتي للمعلّم، وهي نتيجة قوية حقًا لمُرمِّز بحجم 421 مليون على أربعة مسارات عمل ضيقة (معالجة الفواتير 0.804، الحوادث الأمنية 0.766، خدمة العملاء 0.764، قابلية مراقبة تتبع الوكيل 0.730). لكنها نتيجة تتعلق بالتخصص، وليس بالنموذج الأساسي، وأي شخص يستشهد بـ 0.766 كقدرة عامة فإنه يسيء قراءة بطاقة النموذج.

ثانيًا، البدائيات ليست جميعها على نفس الدرجة من الجودة. وفقًا للدقة على نقطة التحقق المضبوطة: noul 0.857، choice 0.733، score 0.723. ويسمي المشروع البدائية الترتيبية score "البدائية الأضعف" صراحةً، مع SST-5 عند 0.372. إذا كان سطح قرارك تقييم شدة من 1 إلى 5، فهذه هي البدائية التي لديك أقل سبب للثقة بها افتراضيًا.

ثالثًا، هناك سلوكان موثقان كأخطاء في متتبع المشكلات الخاص بالمشروع، وكلاهما سيحرقك في بيئة الإنتاج إذا لم تقرأهما. action.act_probability لا يحمل أي إشارة قابلة للاستخدام بعد — issue #185 — لأن مخرجات رأس القرار غير مُطبّعة عند حوالي 300 ضعف مقياس المُرمِّز، مما يُشبع رأس الفعل بحيث يقرأ 1.0 لكل مُدخل تقريبًا. تعمل لوجيتاتها الخام ضد الصحة، مع AUROC يبلغ 0.30 على 396 قرارًا مُصنَّفًا. اعتمد على الثقة بدلاً من ذلك، والتي تصل إلى AUROC يبلغ 0.77 على نفس العناصر. وبشكل منفصل، يمكن لـ noul أن يتبع تسميات خياراته الخاصة بدلاً من الحالة — issue #156 — لأن render_options تُثبّت تسميات noul إلى false: / true:، وهذا الزوج من التسميات يمكن أن يهيمن على الإجابة، فيعيد "لا" واثقة لمُدخل إيجابي بوضوح. الحل البديل الموثق هو طرح نفس السؤال كخيارين خيار بمفاتيح محايدة وصياغة نعم/لا الخاصة بك كأوصاف.

رابعًا، تفصيل معايرة يسهل تفويته ويجدر ذكره بدقة. يوفّر نقطة التحقق درجة حرارة مُلاءَمة مقدارها 0.1006 من أجل فئة choice:11+، ويحصر المُحمِّل كل درجة حرارة ضمن [0.5, 5.0]. هذا الحصر في صالحك. درجة حرارة بهذه الحدّة قد تأخذ توزيعًا منقسمًا حقًا وتُبلّغ عنه باعتباره شبه يقين؛ الحصر يعني أن أسوأ حالة هي إجابة أكثر ليونة مما قصدته الملاءمة، ويُصدر المُحمِّل تحذيرًا يُسمّي الفئة المتأثرة ويخبرك بأن تتعامل مع تلك الثقة باعتبارها غير مُعايَرة. اقرأ التحذيرات عند التحميل بدلًا من كبتها.

خامسًا، الاقتصار على الإنجليزية في جذر المستودع، ووضع الفشل خارج الإنجليزية ليس سلسًا — ومن هنا جاء الموجّه، ومن هنا جاءت التوصية باستخدام laya-multilingual لأي شيء ليس نصًا إنجليزيًا.

الصورة المستقلة، إن وُجدت، أضيق نطاقًا من صورة المورّد ولا تتعارض معها. مقارنة مباشرة مستقلة — sysone-bench، 751 حالة عبر تسع مجموعات، بتاريخ 2026-09-21، نُفّذت على مدخلات متطابقة بايتًا ببايت مع التحقق من تطابق تجزئات الأسئلة قبل المقارنة — تضع Jev في المقدمة في الفرز والضوابط والإشراف وbanking77 والنية متعددة اللغات، وتضع Laya في المقدمة في AG News (0.940 مقابل 0.910) وMNLI (0.983 مقابل 0.867). نتيجة تقييد الثقة فيه هي التي سأخطط بناءً عليها فعلاً: أدى التقييد عند ثقة 0.85 إلى الاحتفاظ بـ58% من حركة Laya بدقة 0.878، مقابل 78% من حركة Jev بدقة 0.917. وهذا هو شكل المقايضة — تؤتمت Laya قدرًا أقل من الحركة بدقة أدنى في الجزء الذي تحتفظ به، كما أن تشغيل الموجّه الخاص بها يرفع النية متعددة اللغات من 0.360 إلى 0.840.

السطح المحيط به، وهو عريض بشكل غير معتاد

بالنسبة لمشروع لا يتجاوز عمر أوزانه بضعة أيام، فإن سطح التكامل هو الجزء الذي يثير الدهشة. كل هذا موجود في المستودع المصدر على NandhaKishorM/laya، الذي بلغ عدد نجومه 19,871 على GitHub عند كتابة هذا، وهو Apache 2.0 بالكامل:

laya-serve — خادم HTTP يكشف عن Router على نفس شكل الطلب والاستجابة POST /v1/systemone كما في Jev API المستضاف من TypeSafe، بحيث ينتقل عميل TypeSafe موجود بتغيير عنوان URL الأساسي الخاص به. لاحظ الإعداد الأمني الافتراضي بصراحة: يربط 0.0.0.0 بدون مصادقة ما لم LAYA_API_KEY مضبوط، وفي هذه الحالة يتطلب رمز حامل. توجد نسخة وحدة NixOS محصّنة تعمل تحت وحدة DynamicUser systemd وتمرر الرمز عبر LoadCredential بدلاً من وضعه في المخزن.

• نقل كامل إلى TypeScript في laya-ts/ لـ Node والمتصفح، بالإضافة إلى مسار وكيل ONNX (laya.onnx_agent.ONNXAgent) لتشغيل نموذج مُصدَّر على ONNX Runtime بدون PyTorch في وقت التشغيل.

• خادم MCP خلف إضافة اختيارية، يعرض laya_predict، laya_route، laya_preset وlaya_status كأدوات.

• تكاملات LangChain وLangGraph — LayaRouter للتوجيه بالحواف الشرطية مع عتبة ثقة ومسار احتياطي، وLayaGuardrail.

• Nix flake يتضمن nix run .#laya-serve ووحدة services.laya-serve، وأربعة ملفات compose، ومسار صورة Docker مع بدء سريع موثّق، ودفتر Kaggle يشغّل حلقة الضبط الدقيق RLCD الكاملة على وحدات GPU من نوع 2xT4 مجانية خلال أربع إلى خمس ساعات على ما يقرب من 30 ألف سؤال.

A screenshot of the Laya repository on GitHub, showing the repository description, the three-checkpoint table, the Route Mode quickstart, the 23-of-51 versus 45-of-51 language sweep, the Khmer 0.000 accuracy at 0.952 confidence, the self-hosting curl example with the note that the server binds 0.0.0.0 with no authentication unless LAYA_API_KEY is set, the architecture and RLCD training sections, the speed and Laya-versus-Jev benchmark tables, and the honest limits list.

إن Apache 2.0 هو تفصيل الترخيص الذي يحدد ما إذا كان بإمكانك تضمين هذا داخل منتج: فهو يسمح بالاستخدام التجاري والتعديل وإعادة التوزيع، ولا يلزمك بنشر تغييراتك أو أوزانك المضبوطة بدقة. ويتمثل الالتزام في الالتزام المعتاد بالإسناد والحفاظ على الإشعارات، إضافة إلى الغياب الصريح لمنح براءة اختراع أو علامة تجارية يتجاوز ما ينص عليه الترخيص. وبالنسبة لطبقة قرار تقع أمام حركة مرور العملاء، فإن ذلك يمثل عرضًا مختلفًا جوهريًا عن نقطة نهاية مستضافة قائمة على الوصول المبكر تكون أوزانها وبنيتها ووصفتها التدريبية كلها غير معلنة — وهو ما يمثله Jev اليوم، بسعر 0.042 دولار لكل مليون رمز إدخال مع إخراج مجاني وواجهة إدخال نصية فقط.

أين يندرج هذا فعليًا: رأس قرار في المقدمة، ونموذج لغوي كبير (LLM) موجّه في الخلف

النمط الجدير بالاستيعاب ليس «نموذج قرار بدلًا من LLM». إنه خط أنابيب من مرحلتين، وكلتا المرحلتين موجودتان لأن الأخرى سيئة في شيء ما.

ضع Laya في المقدمة من أجل الأحكام ضيقة النطاق وعالية الحجم والقابلة للاستهلاك آليًا: توجيه التذكرة، وتصنيف النية، وتقييم درجة الإلحاح، وتحديد ما إذا كان هذا المستند ذا صلة بالاستعلام، والتحقق مما إذا كانت هذه المسودة تنتهك سياسة ما. تلك الاستدعاءات لها مجموعة إجابات ثابتة، وتحدث آلاف المرات في الساعة، وتُعد تمريرة أمامية محلية مدتها 33 مللي ثانية بصفر رموز إخراج أنسب لها من رحلة ذهاب وعودة توليدية. ثم ضع نموذجًا توليديًا خلفها للاستدعاءات التي تحتاج فعلًا إلى نثر أو تركيب أو استدلال على سياق طويل — الصياغة، والشرح، وملخص التصعيد.

هنا يقع OrcaRouter، ويجدر بنا أن نكون دقيقين بشأن الحدود. نحن لا نقدّم Laya؛ فهو مُرمِّز بحجم 421M تشغّله بنفسك، وبيت القصيد فيه أنه يعمل حيث توجد بياناتك أصلًا. ولا نقدّم Jev كذلك — فهو نقطة نهاية الوصول المبكر الخاصة بـ TypeSafe. ما نغطّيه هو النصف التوليدي من المسار نفسه: أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI، بسعر قائمة المزوّد نفسه وبربح صفري، مع تحويل تلقائي عند الفشل بين المزوّدين. والسبب العملي لأهمية ذلك هنا هو نقطة الوصل بين النصفين. فبمجرد أن تبدأ في توجيه القرارات إلى نموذج توليدي في الحالات التي رفضها رأس القرار، يصبح لديك تكامل ثانٍ وفاتورة ثانية ونمط فشل ثانٍ. أما مفتاح واحد للجانب التوليدي، مع التحويل عند الفشل إذا تراجع أحد المزوّدين، فيعني أن مسار التصعيد في طبقة القرار يصبح تغييرًا في الإعدادات بدلًا من علاقة مع مورّد ثانٍ. هذا ادّعاء متواضع، وهو الادّعاء الصحيح.

من الذي ينبغي أن يتبنّاه، ومن الذي ينبغي أن ينتظر؟

اعتمد Laya الآن إذا كانت لديك بيانات موسومة وحلقة تدريب، وسطح قرار مستقر بما يكفي ليستحق التخصّص. دفتر Kaggle موجود تحديدًا لكي لا تكون خطوة الضبط الدقيق مشروعًا بحثيًا، وتُحمَّل نقاط التحقق الأساسية في نحو ثانيتين على CPU، ويسمح لك الترخيص بشحن النتيجة تجاريًا دون نشر أوزانك. أعباء العمل التي تناسب أفضل هي تلك التي سبق أن قاسها المشروع بالفعل: فرز التذاكر، ومعالجة الفواتير، وتصنيف الحوادث الأمنية، وحواجز الحماية والإشراف، وقابلية مراقبة تتبع الوكيل. أبقِ أسئلة الاختيار تحت نحو 20 خيارًا، وعاير درجة حرارة على بياناتك المحجوزة قبل أن تضع عتبة في الإنتاج، واعتمد في البوابة على الثقة، وليس على احتمال_الفعل.

تريّث إذا كان قرارك بحاجة إلى أن يكون صحيحًا منذ الوهلة الأولى دون أي بيانات موسومة. فوجود نقطة تحقق أساسية تقع دون خط أساس فئة الأغلبية على المعيار الذي نُشرت مقابله ليس محرّكًا صفريًا، والقراءة الصادقة لأرقام المورّد مقابل الأرقام المستقلة هي أن واجهة برمجة تطبيقات قرار مستضافة جيدة التشغيل هي حاليًا الخيار الصفري الأقوى. وتريّث أيضًا إذا كانت مجموعات خياراتك كبيرة وكنت غير مستعد لضبط ميزانية الرأس، أو إذا كان تسجيلك الترتيبي بحاجة إلى أن يكون موثوقًا فورًا، أو إذا كنت تحتاج إلى مدخلات من الصور أو الصوت أو المستندات الطويلة — فإن Laya نصية فقط، وميزانية سياقها تتراوح من 512 إلى 1,024 رمزًا افتراضيًا، وهذا انتقاء من الأدلة لا المستند بأكمله.

إن ما سيحسم هذه الفئة ليس أرقام زمن الاستجابة، التي أصبحت جيدة بما يكفي لتتوقف عن كونها محل الجدل. بل ما إذا كان نموذج صغير يقدّم احتمالات صادقة على سطح قرار حددته أنت، ويمكنك إعادة تدريبه على تسمياتك الخاصة، يتغلّب على استدعاء نموذج توليدي كبير وتحليل مخرجاته. Laya محاولة أولى جادة وذات مصداقية للنسخة مفتوحة الأوزان من ذلك السؤال — وعمرها أيام على الأكثر، وهذه هي الطريقة الصحيحة لقراءة كل ما سبق. النموذج الأساسي هو نقطة البداية، وليس المنتج.

A generated single-column scoreboard titled "Laya - the scoreboard" with six labelled rows reading Architecture: non-autoregressive encoder plus decision head; Parameters: 421M total; Output tokens: zero, one forward pass; Zero-shot accuracy: 0.362 versus 0.461 majority class; Fine-tuned accuracy: 0.766 on typed-decisions; Licence: Apache 2.0, weights published; with a footer reading "All figures vendor-reported by Convai Innovations on its own harnesses."