تم إنشاء بطاقة عنوان لـ RSI-Jev مقابل Laya تحمل النص 'نموذجا قرار مفتوحان. رهانات متعاكسة.'، مع بطاقة يسرى تحمل التسمية 'RSI-Jev v6.1-VL' وأيقونة دماغ-ترس والسطر '4.69B معامل، بدون أمثلة'، وبطاقة يمنى تحمل التسمية 'Laya' وأيقونة ريشة والسطر '421M معامل، اضبطه بدقة'، وفاصل عمودي رفيع بين البطاقتين، وتعليق 'كلاهما Apache-2.0. لا يتم استضافة أي منهما لك.' تم تركيب شعار OrcaRouter في الزاوية اليمنى السفلية.
Guides & Insights

RSI-Jev مقابل Laya: نموذجا قرار مفتوحان، ورهانان متعاكسان

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

الرهان الأول يتعلق بالحجم. نقطة التفتيش الإنجليزية لدى Laya هي ModernBERT-large بـ 421M معامل مع سياق من 512 رمزًا، ونقطة التفتيش متعددة اللغات لديها هي mmBERT-base بـ 322M مع نافذة من 1,024 رمزًا تصل إلى 8,192 عند ضبط المُشفّر على نطاق واسع. يشغّل RSI-Jev v6.1-VL برج Qwen3.5-4B-Base كاملًا — 4.69B معامل، منها 3.57B في طبقات فك التشفير الـ32، إضافة إلى برج رؤية وثلاثة رؤوس قرار عند الطبقات 16 و20 و32. Laya نموذج يمكنك تحميل ثلاثة منه مسبقًا في بضعة غيغابايتات؛ أما RSI-Jev فهو نقطة تفتيش bf16 بحجم 9.7 GB. الرهان الثاني ينبع من الأول: لا يكاد Laya يستهلك شيئًا لكل استدعاء ويتوقع منك أن تعلّمه مجالك، بينما يستهلك RSI-Jev أربعة مليارات ونصفًا من المعاملات محاولًا الإجابة عن سؤالك دون أي تدريب على الإطلاق.

ما هو الغرض الفعلي من كل واحد منها

تحتوي بطاقة النموذج الخاصة بـ Laya على الجملة التي تؤطّر هذه المقارنة أفضل مما يستطيع أي مراجع: "Laya قاعدة سريعة للتخصّص، وليست محرّك قرارات يعمل دون أمثلة." في معيار typed-decisions — 2000 قرار عبر أربعة مسارات عمل — تسجّل نقطة التحقق الإنجليزية الأساسية 0.362، مقابل 0.318 للتخمين العشوائي و0.461 لاختيار الفئة الأغلب دائماً. وعلى القرارات نفسها، تسجّل نقطة التحقق التي ضبطتها Convai تخصيصياً على تقسيم التدريب الخاص بذلك المعيار نفسه 0.766، متجاوزةً سقف توافق المعلّم البالغ 0.735. تلك الفجوة هي المنتج: Laya مشفّر بحجم 421M تضبطه تخصيصياً على تصنيف ضيّق، بينما توفّر Convai دفتر Kaggle يُنفّذ الحلقة كاملة — بناء مجموعة البيانات، والتدريب، وملاءمة درجات حرارة المعايرة، والتقييم — على وحدتَي T4 مجانيتين.

RSI-Jev هو الصفقة الأخرى. يحقق إصداره v6.1-VL نتيجة 50.98 على مؤشر Decision Index 0.3 العام الخاص به، وهو تشغيل من 140,178 طلبًا بالإعداد الافتراضي، وهذا على لوحة المشروع بتاريخ 2026-10-06 يعادل أفضل نموذج 4B هناك ويحتل المرتبة 27 من 113 إجمالًا. مجموعة اختباراته الخمسة عشر هي 0.793 ومجموعته المحجوزة هي 0.729. هذه أرقام zero-shot — مع أن المشروع حريص على القول إن عشرة من الاختبارات الخمسة عشر تساهم ببيانات تدريب بشكل ما، لذا فإن "zero-shot" ينطبق على بحث الإصدار، وليس على كل رقم في الصفحة. ما تحصل عليه فعلًا من هذه الأرقام هو نموذج يجيب عن سؤال حول مستند لم تعرضه عليه قط ولا يحتاج إلى تشغيل تدريب أولًا.

• الحجم — Laya ‏421M للإنجليزية / 322M متعددة اللغات مقابل RSI-Jev ‏4.69B، الذي يشغّل كامل برج Qwen3.5-4B-Base.

• دقة التعلم الصفري — لايا 0.362 في القرارات المُصنَّفة، دون خط أساس الأغلبية البالغ 0.461، مقابل RSI-Jev 50.98 على مؤشر القرار الخاص به 0.3، ليعادل أفضل مدخل 4B هناك.

• الدقة بعد الضبط الدقيق — Laya 0.766 مع نقطة تحقق مدرَّبة على تقسيم المعيار نفسه مقابل أرقام RSI-Jev كونها على مستوى الإصدار، وليس لكل مجال.

• اللغات — Laya 45 من أصل 51 لغة قابلة للاستخدام، أعلى من التوجيه العشوائي من جانب الخادم بثلاثة أضعاف مقابل نص RSI-Jev المتمركز حول الإنجليزية.

• الوسائط — نص Laya فقط مقابل نص RSI-Jev مضافًا إليه ما يصل إلى أربع صور لكل طلب.

• السياق — Laya ‏512 رمزًا في الإنجليزية، و1,024 للغات المتعددة، وحتى 8,192 للمستندات الطويلة، مقابل RSI-Jev ‏32,768 رمزًا، مع الرفض بدلًا من الاقتطاع.

• زمن الاستجابة — Laya 32.8 ms p50 على T4، 7.2 ms لكل سؤال عند دفعة من عشرة مقابل RSI-Jev 22.5 ms عند جهد منخفض وحوالي 40 ms عند العمق الكامل، على H200.

جرف عدد الخيارات هو الفرق الأكثر حدّة.

يحدد كلا النموذجين مساحة الإجابة في وقت الطلب، لذا لا يحتاج المخطط الجديد إلى إعادة تدريب — وهذا هو المكسب الهيكلي المشترك لهذه العائلة بأكملها. لكنهما يخصصان مساحة الإجابة بشكل مختلف، ويظهر الاختلاف بالضبط في المهام التي يميل توجيه المؤسسات إلى أن يكون عليها. تقوم Laya بتقييم كل خيار عند الرمز المميز المقنع الخاص به، وتتشارك الخيارات ميزانية رأس ثابتة: 192 رمزًا مميزًا على نقطة التفتيش الإنجليزية، و256 على متعدد اللغات. في Banking77، مع 77 نية، يصل ذلك إلى حوالي ثلاثة أو أربعة رموز مميزة لكل تصنيف، وتنخفض الدقة إلى 0.425. توثق بطاقة Convai الخاصة الجرف وتقدم الحل — ارفع head_max_len إلى 512 والسياق إلى 1,024 أو أكثر حتى يكون لكل تصنيف مساحة، أو قسّم مجموعة خيارات كبيرة إلى اختيار من خطوتين من خشن إلى دقيق.

مسار التقديم في RSI-Jev يستوعب ما يصل إلى 5,120 خيارًا لكل سؤال. هذه ليست مقارنة مكافئة مع Laya's 0.425 — فقد قِيس الاثنان على أدوات اختبار مختلفة، وسقف الخيارات هو حد إعداد، وليس نتيجة. إنه بيان عن أي نموذج لن ينهار عندما يحتوي تصنيفك على مئة مدخل. إذا كانت أسئلة الاختيار لديك هي «الفوترة / التقنية / المبيعات / أخرى»، فأي منهما يفي بالغرض. وإذا كانت نحو مئة من تسميات النوايا، فأحدهما يحتاج إلى ضبط قبل أن يصلح للاستخدام، والآخر لا.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

زمن الاستجابة، ومسألة اللغة، والصور

ادعاء Laya بشأن زمن الاستجابة هو الأبرز، وهو ادعاء حقيقي: 32.8 ms p50 لسؤال واحد على Tesla T4، و72.3 ms لدفعة من عشرة، و337 ms لخمسين — أي من 103 إلى 332 سؤالًا في الثانية على وحدة GPU متواضعة واحدة. أرقام RSI-Jev الخاصة، المقاسة على H200، هي 22.5 ms عند جهد منخفض، و26.8 ms عند جهد متوسط، و39.9 ms افتراضيًا و40.4 ms عند العمق الكامل. هذه الأرقام من نفس الترتيب من حيث الحجم، وكلاهما تمريرات أمامية محلية وليس استدعاءات شبكة، وهي المقارنة التي تهم فعلاً بمجرد استبعاد نقطة النهاية المستضافة. لاحظ ما يفعله كلاهما بالوقت: يمكن لـ RSI-Jev أن يتوقف عمدًا عند الطبقة 16 ليحقق تلك 22.5 ms ويشغّل جميع الطبقات الـ32 عندما يكون السؤال صعبًا، بينما لا يمتلك Laya مثل هذا المفتاح — فهو يشغّل دائمًا مُشفّره بالكامل (الصغير).

تسير قصة اللغة في الاتجاه المعاكس، وهي حاسمة لأي شخص خارج الإنجليزية. تشحن Laya موجّهًا يكتشف نظام الكتابة في أقل بكثير من مللي ثانية واحدة ويوجّه إلى نقطة التحقق متعددة اللغات، ويُظهر جدولها المنشور أن 45 من 51 لغة قابلة للاستخدام فوق ثلاثة أضعاف العشوائي، مقابل 23 لنقطة التحقق الإنجليزية وحدها. كما أن بطاقتها صادقة بشأن سبب أهمية ذلك: تنهار نقطة التحقق الإنجليزية مع الأنظمة الكتابية غير اللاتينية — تسجّل الخميرية دقة 0.000 عند ثقة 0.952 — لذا لا يمكن لبوابة الثقة أن تنقذ مسارًا خاطئًا. ولا تملك RSI-Jev قصة لغوية من هذا النوع؛ فهي نموذج نصي يتمحور حول الإنجليزية ويتصادف أنه يقرأ الصور.

الصور هي الصورة المعكوسة. يأخذ RSI-Jev من واحدة إلى أربع لكل طلب كعناوين URL لبيانات base64، وسجّل 0.834 على مجموعة الصور المحجوزة الخاصة به في هذا الإصدار؛ نقاط التحقق التي شحنتها Laya هي مصنفات نصية، وبينما توجد منافذ مجتمعية مثل laya-vision على Hub، فهي ليست منتج البائع. إذا كان قرارك بشأن صورة فوتوغرافية أو مخطط أو لقطة شاشة، فهذا عمود أحد النموذجين وليس الآخر.

لم يخضع أيٌّ منهما لاختبار مرجعي مقابل الآخر.

هذا هو الجزء الذي تخفيه بهدوء مقارنة مواصفة بمواصفة: لا توجد مواجهة مباشرة بين هذين الطرازين. ما يوجد هو مواجهة مباشرة بين كل منهما والنموذج المغلق نفسه — Jev 1.13 من TypeSafe — ولا يمكن وضع أي منهما إلى جانب الآخر.

نشرت Convai واحدة: في typed-decisions، Jev 1.13.0 عند 0.727 مقابل 0.766 الخاص بـ Laya routed؛ في Banking77، Jev 0.870 مقابل 0.425 الخاص بـ Laya؛ في المعايرة، Jev 0.246 مقابل 0.081 الخاص بـ Laya بعد إصلاح درجة الحرارة. تشير Convai إلى حدودها الخاصة في نفس الجدول — أرقام Jev منشورة من طرف ثالث، ولم يكن لديها أبدًا وصول إلى API لقياسه، وأحجام العينات والمطالبات مختلفة. مقارنة RSI-Jev هي Decision Index، وهو لوحة RSI-Jev العامة الخاصة به ولا يحمل أي إدخال لـ Jev على الإطلاق. لذلك فإن الأرقام الخارجية الوحيدة التي تمس كلا هذين النموذجين تأتي من منصات اختبار بناها الأطراف التي تبيعها، والقراءة المنطقية لأي رقم منفرد أعلاه هي "هذا ما قاسه الصانع، على مهمة الصانع."

ما يفعله كلا المشروعين جيدًا، ونادرًا، هو نشر نقاط ضعفهما الخاصة. يذكر RSI-Jev مصادر الصور الخمسة غير التجارية التي تقف وراء إصداراته البصرية ويقول بصراحة إن ما إذا كانت الأوزان المدرّبة عليها ترث تلك الشروط ليس أمرًا محسومًا؛ ويُبلِغ عن تراجع في المعايرة في أحدث إصدار له ويصف عتبة الخروج الافتراضية لديه بأنها غير مؤكدة. توثّق Laya أنّ نقاط التحقق الأساسية لديها تقع دون خط أساس الأغلبية، وأن أسئلة التقييم الترتيبية هي أضعف عنصر بدائي لديها، وأن noul الخاص بها يمكن أن يتبع تسميات خياراته الخاصة بدلًا من الحالة، وأن أحد حقول استجابتها لا يحمل أي إشارة قابلة للاستخدام. هذا الصدق هو أنفع ما يمكن توارثه من أي من المشروعين: تحقق من قيم الثقة في حالاتك الموسومة الخاصة بك قبل أن تعتمد عليها في الأتمتة.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

أين يوجد فعلياً العقد الذي ينسخونه

كلا هذين النموذجين موجودان لأن تنسيق نقل واحدًا كان يستحق النسخ. يحدّد Jev من TypeSafe شكل الطلب — الحالة، والأسئلة، وثلاث أوليّات مُنمّطة — وشكل الإجابة، ويطبّقه كلٌّ من Laya وRSI-Jev بحيث يعمل عميل موجود بمجرد تغيير عنوان URL الأساسي. ذلك النموذج المرجعي، typesafe/jev-1.13، هو النموذج الوحيد من الثلاثة الذي نقدّمه: إنه مدرج في فهرسنا على نقطة النهاية systemone المخصّصة، عبر طلب POST إلى ‎/v1/systemone، غير متدفّق، مقابل سياق من 65,536 رمزًا، بسعر 0.042 دولار لكل مليون رمز إدخال مع فوترة الإخراج عند الصفر. لا Laya ولا RSI-Jev مدرج في فهرسنا — كلاهما قابلان للتنزيل، وهذا هو المقصد منهما.

النسخة العملية من ذلك تهم أكثر من المقارنة. نادرًا ما تكون طبقات القرار وحدها في مكدس؛ فهي تقع بجانب نموذج توليدي يكتب الرد أو الملخص أو الشيفرة. ووجود العقد المرجعي على المفتاح نفسه الذي تستخدمه أكثر من 200 نموذج آخر، بسعر سعر قائمة المزوّد مُمرَّرًا بهامش ربح 0%، يعني أن أي تغيير في سعر المزوّد يصلك في اليوم نفسه، كما أن التحويل التلقائي عند الفشل يعني أن النصف التوليدي في ذلك الزوج ليس نقطة فشل وحيدة بينما تحاول معرفة ما إذا كان نصف القرار الرخيص جيدًا بما يكفي. إذا قررت أن مُرمِّزًا مستضافًا ذاتيًا بسعة 421M أو نقطة تحقق بحجم 4.69B هو الخيار الصحيح، فما زلت تريد أن يكون العقد الذي يتعامل معه قابلاً للوصول من المكان نفسه — وإذا كنت تفضّل ألا تشغّل أيًا منهما، فإن النموذج الذي ينسخانه كلاهما لا يفصلك عنه سوى طلب واحد.

أي واحد يجب تنزيله؟

اختر Laya إذا كانت لديك بيانات موسومة، وتصنيف هرمي لا يتغير كثيرًا، ومزيج لغوي ليس مقتصرًا على الإنجليزية فقط. إنه صغير بما يكفي لتشغيل العديد منه، وسريع بما يكفي لتقديمه أمام كل طلب، ومصمم من الأساس ليُضبط ضبطًا دقيقًا — فدرجة 0.766 بعد الضبط الدقيق مقابل 0.362 في الوضع الصفري هي الحجة كلها. خصص ميزانية لجولة التدريب، والوسم، وإعادة ملاءمة درجة الحرارة لكل نوع سؤال، التي تنقل خطأ المعايرة من 0.466 إلى 0.081، وأبقِ مجموعات الخيارات أقل من نحو عشرين وسمًا، أو ارفع ميزانية الرأس قبل أن تثق في تصنيف كبير.

اختر RSI-Jev v6.1-VL إذا كنت تريد أن يعمل نظام اتخاذ القرار دون أي تدريب مسبق، أو إذا كانت أسئلتك تتعلق أحيانًا بصورة، أو إذا كانت مجموعات الخيارات لديك كبيرة، أو إذا كنت تريد المقايضة بين زمن الاستجابة والعمق في كل طلب. توقّع تشغيل نقطة تحقق بحجم 9.7 GB بدلًا من واحدة بحجم 400M، وتوقّع مشروعًا نشر ثمانية إصدارات خلال ثلاثة عشر يومًا وقد ينشر إصدارًا آخر أثناء تقييمك لهذا الإصدار، وتوقّع أن تتحقق من معايرته بنفسك — بطاقة هذا الإصدار نفسه تقول إنه أصبح أسوأ، لا أفضل.

أيًّا كان ما تختاره، فإن الأمرين نفسهما صحيحان. لا يولّد أي من النموذجين نصًا، لذا لا يمكن لأي منهما أن يفشل بإصدار حقل مشوّه؛ فكلاهما يعيد احتمالات، والاحتمال هو الجزء الذي يجب التحقق منه لكل عملية نشر بدلًا من أخذه من بطاقة. وقد نقل كلاهما السؤال المثير للاهتمام بشأن طبقة القرار من «واجهة برمجة تطبيقات مَن» إلى «أوزان مَن» — وهو سؤال أفضل لطرحه، ويجيب عليه هذان النموذجان بشكل مختلف جدًا.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'