כרטיס כותרת שנוצר עבור RSI-Jev נגד Laya, שעליו כתוב 'שני מודלים פתוחים לקבלת החלטות. הימורים מנוגדים.', עם כרטיס שמאלי שכתוב עליו 'RSI-Jev v6.1-VL' הנושא סמל מוח עם גלגל שיניים והשורה '4.69B פרמטרים, zero-shot', כרטיס ימני שכתוב עליו 'Laya' הנושא סמל נוצה והשורה '421M פרמטרים, כוונן אותו', מפריד אנכי דק בין שני הכרטיסים, והכיתוב 'שניהם Apache-2.0. אף אחד מהם לא מתארח עבורך.' הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

RSI-Jev מול Laya: שני מודלים פתוחים לקבלת החלטות, הימורים מנוגדים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

As of October 2026 there are two open-weight models worth considering if you want typed decisions — a yes/no, a pick-one-of-k, a rate-on-a-rubric — without a hosted endpoint in the path. They are RSI-Jev v6.1-VL 4B, published 2026-10-07 by the third-party Shanghua-Gao/RSI-Jev research loop, and Laya, released 2026-09-18 by Convai Innovations. Both answer in a single forward pass with no generated text; both return a calibrated probability for every option; both ship under Apache-2.0 weights with a server that speaks TypeSafe's decision API, so a client written for the commercial model runs against either by changing a base URL. They are also built on opposite bets, and the two numbers that separate them are 3 to 4 tokens per label and 421 million parameters.

ההימור הראשון נוגע לקנה מידה. הצ׳קפוינט האנגלי של Laya הוא ModernBERT-large עם 421 מיליון פרמטרים והקשר של 512 טוקנים, והצ׳קפוינט הרב-לשוני שלו הוא mmBERT-base עם 322 מיליון פרמטרים וחלון של 1,024 טוקנים שמגיע ל-8,192 כשהמקודד מוגדר במצב רחב. RSI-Jev v6.1-VL מריץ מגדל שלם של Qwen3.5-4B-Base — 4.69 מיליארד פרמטרים, 3.57 מיליארד מהם ב-32 שכבות המפענח, בתוספת מגדל חזותי ושלושה ראשי החלטה בשכבות 16, 20 ו-32. Laya הוא מודל שאפשר לטעון מראש שלושה ממנו בכמה גיגה-בייט; RSI-Jev הוא צ׳קפוינט bf16 בנפח 9.7 GB. ההימור השני נובע מהראשון: המודל Laya כמעט ולא מוציא דבר בכל קריאה ומצפה ממך ללמד אותו את התחום שלך, בעוד RSI-Jev מוציא ארבעה וחצי מיליארד פרמטרים בניסיון לענות על השאלה שלך בלי שום אימון כלל.

למה כל אחד מהם בעצם מיועד

כרטיס המודל של Laya עצמו מכיל את המשפט שממסגר את ההשוואה הזו טוב יותר מכל סוקר: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות אפס-שוט." במבחן typed-decisions — 2,000 החלטות בארבעה תהליכי עבודה — הצ'קפוינט הבסיסי באנגלית משיג 0.362, לעומת 0.318 לניחוש אקראי ו-0.461 לבחירה תמידית של מחלקת הרוב. על אותן ההחלטות, הצ'קפוינט של Convai שעבר כוונון עדין על פיצול האימון של אותו מבחן עצמו משיג 0.766, ועובר את תקרת הסכמת המורה של 0.735. הפער הזה הוא המוצר: Laya הוא מקודד של 421M שאותו מכווננים עדין על טקסונומיה צרה, ו-Convai מספקת מחברת Kaggle שמריצה את כל הלולאה — לבנות את מערך הנתונים, לאמן, להתאים טמפרטורות כיול, להעריך — על שני T4s חינמיים.

RSI-Jev הוא העסקה האחרת. מהדורת v6.1-VL שלו משיגה 50.98 במדד Decision Index 0.3 הציבורי של עצמו, הרצה של 140,178 בקשות בתצורת ברירת המחדל, אשר בלוח הפרויקט מתאריך 2026-10-06 משתווה למודל ה-4B הטוב ביותר שם ונמצאת במקום ה-27 מתוך 113 בסך הכול. סוויטת חמישה עשר המבחנים שלו היא 0.793, וקבוצת ה-held-out שלו היא 0.729. אלה נתוני zero-shot — אף שהפרויקט מקפיד לציין כי עשרה מחמישה עשר המבחנים תורמים נתוני אימון בצורה כלשהי, כך ש"zero-shot" חל על החיפוש של המהדורה, ולא על כל מספר בעמוד. מה שהנתונים האלה כן קונים לך הוא מודל שעונה על שאלה בנוגע למסמך שמעולם לא הצגת לו ואינו זקוק להרצת אימון מראש.

• גודל — Laya 421M אנגלית / 322M רב-לשוני לעומת RSI-Jev 4.69B, שמריץ את כל מגדל Qwen3.5-4B-Base.

• דיוק ללא דוגמאות — Laya 0.362 ב-typed-decisions, מתחת לרף הבסיס של הרוב 0.461, לעומת RSI-Jev 50.98 במדד ההחלטות 0.3 שלה — ומשתווה לתוצאה הטובה ביותר של 4B שם.

• דיוק מכוונן — Laya 0.766 עם צ'קפוינט שאומן על הפיצול של הבנצ'מרק עצמו, לעומת הנתונים של RSI-Jev שהם ברמת מהדורה, ולא לפי תחום.

• שפות — Laya: 45 מתוך 51 שפות שמישות, יותר מפי שלושה מניתוב אקראי בצד השרת לעומת טקסט ממוקד-אנגלית של RSI-Jev.

• מודאליות — טקסט בלבד של Laya לעומת טקסט של RSI-Jev בתוספת עד ארבע תמונות לבקשה.

• הקשר — Laya 512 טוקנים באנגלית, 1,024 רב־לשוני ועד 8,192 עבור מסמכים ארוכים לעומת RSI-Jev 32,768 טוקנים, מסרב במקום לקצץ.

• השהיה — Laya 32.8 ms p50 ב-T4, 7.2 ms לשאלה באצווה של עשר לעומת RSI-Jev 22.5 ms במאמץ נמוך וכ-40 ms בעומק מלא, ב-H200.

צוק מספר האפשרויות הוא ההבדל החד ביותר

שני המודלים מגדירים את מרחב התשובות בזמן הבקשה, כך שסכימה חדשה לא דורשת אימון מחדש — זהו היתרון המבני המשותף של כל המשפחה הזו. אבל הם מקצים את מרחב התשובות אחרת, וההבדל מתגלה בדיוק במשימות שאופייניות לניתוב ארגוני. Laya מדרגת כל אפשרות בטוקן הממוסך שלה, והאפשרויות חולקות תקציב ראש קבוע: 192 טוקנים בנקודת הביקורת באנגלית, 256 ברב-לשונית. ב-Banking77, עם 77 כוונות, זה יוצא בערך שלושה או ארבעה טוקנים לתווית, והדיוק יורד ל-0.425. הכרטיס של Convai עצמו מתעד את הצוק ומציע את התיקון — העלה head_max_len ל-512 ואת ההקשר ל-1,024 או יותר כך שלכל תווית יהיה מקום, או פצל קבוצת אפשרויות גדולה לבחירה דו-שלבית מגס לדק.

נתיב ההגשה של RSI-Jev מאפשר עד 5,120 אפשרויות לשאלה. זו אינה השוואה ישירה באותם תנאים מול 0.425 של Laya — השניים נמדדו במערכי בדיקה שונים, ותקרת האפשרויות היא מגבלת תצורה, לא ציון. זו הצהרה לגבי איזה מודל לא יקרוס כאשר בטקסונומיה שלך יש מאה ערכים. אם שאלות הבחירה שלך הן "חיוב / טכני / מכירות / אחר", כל אחד מהם יעבוד. אם הן מאה ומשהו תוויות כוונה, אחד מהשניים צריך כיוונון לפני שיהיה שמיש, והשני לא.

Headless Chromium capture of the GitHub repository page for Shanghua-Gao/RSI-Jev: the repository header with the Public badge and the counters Fork 5 and Star 80, the repository description about typed-decision models (noul / choice / score) trained by a self-improving loop of AI agents with the checkpoints, the code that produced them and every version that failed, a commit list headed by the merge commit 'Merge pull request #35 from Shanghua-Gao/copy-no-ranking', the file rows for the v6.1-VL weight-averaging work and the v5.0-VL 3B quickstart, the counters 202 commits, 8 tags and 8 releases, the MIT license line, and the topic tags decision-model, jev, lm, system-one and typed-decisions.

השהיה, שאלת השפה והתמונות

הטענה של Laya לגבי השהיה היא הקולנית ביותר שלה, והיא אמיתית: 32.8 ms חציון לשאלה בודדת על Tesla T4, 72.3 ms עבור אצווה של עשר, ו-337 ms עבור חמישים — 103 עד 332 שאלות בשנייה על GPU צנוע אחד. המספרים של RSI-Jev עצמו, שנמדדו על H200, הם 22.5 ms במאמץ נמוך, 26.8 ms בבינוני, 39.9 ms כברירת מחדל ו-40.4 ms בעומק מלא. אלו הם אותו סדר גודל, ושניהם מעברים קדימה מקומיים ולא קריאות רשת, וזו ההשוואה שבאמת חשובה ברגע שנקודת קצה מתארחת יוצאת מהתמונה. שימו לב למה ששניהם עושים עם הזמן: RSI-Jev יכול לעצור בכוונה בשכבה 16 כדי לקנות את ה-22.5 ms ולהריץ את כל 32 כשהשאלה קשה, ול-Laya אין חוגה כזו — היא תמיד מריצה את כל המקודד (הקטן) שלה.

סיפור השפה פועל בכיוון ההפוך והוא מכריע עבור כל מי שמחוץ לאנגלית. Laya מספקת נתב שמזהה את הכתב בהרבה פחות ממילישנייה ומפנה לנקודת הביקורת הרב-לשונית, והטבלה המפורסמת שלה מראה ש-45 מתוך 51 שפות שמישות מעל פי שלושה מהאקראי, לעומת 23 עבור נקודת הביקורת האנגלית לבדה. הכרטיס שלה גם כנה לגבי הסיבה שזה חשוב: נקודת הביקורת האנגלית קורסת בכתבים שאינם לטיניים — חמר משיגה דיוק של 0.000 בביטחון של 0.952 — כך שסינון לפי ביטחון לא יכול להציל מסלול שגוי. ל-RSI-Jev אין סיפור שפה מסוג זה; הוא מודל טקסט ממוקד באנגלית שבמקרה קורא תמונות.

תמונות הן תמונת ראי. RSI-Jev מקבל אחת עד ארבע לכל בקשה ככתובות נתונים מסוג base64, והשיג 0.834 במערך התמונות שנשמר לבדיקה שלו בגרסה הזו; הצ'קפוינטים המסופקים של Laya הם מסווגי טקסט, והסבות קהילתיות כמו laya-vision קיימות ב-Hub, הן אינן המוצר של הספק. אם ההחלטה שלך מתקבלת בנוגע לתמונה, תרשים או צילום מסך, זו העמודה של מודל אחד ולא של האחר.

אף אחד מהשניים לא נבחן בהשוואה לשני

זה החלק שהשוואה מפרט מול מפרט מסתירה בשקט: אין עימות ראש בראש בין שני המודלים האלה. מה שכן קיים הוא עימות ראש בראש בין כל אחד מהם לבין אותו מודל סגור — Jev 1.13 של TypeSafe — ואי אפשר להעמיד את האחד לצד האחר.

Convai פרסמה אחת: ב-typed-decisions, Jev 1.13.0 עם 0.727 לעומת ה-routed של Laya ב-0.766; ב-Banking77, Jev 0.870 לעומת 0.425 של Laya; בכיול, Jev 0.246 לעומת 0.081 של Laya לאחר תיקון הטמפרטורה. Convai מסמנת את המגבלות של עצמה באותה טבלה — נתוני Jev פורסמו על ידי צד שלישי, מעולם לא הייתה להם גישה ל-API כדי למדוד אותו, וגדלי המדגם והפרומפטים שונים. ההשוואה של RSI-Jev היא ה-Decision Index, שהוא לוח ציבורי של RSI-Jev עצמה ואינו מכיל רשומת Jev כלל. אז המספרים החיצוניים היחידים שנוגעים בשני המודלים האלה מגיעים ממערכי בדיקה שנבנו על ידי הגורמים שמוכרים אותם, והקריאה ההגיונית של כל נתון בודד לעיל היא „זה מה שהיצרן מדד, במשימה של היצרן".

מה ששני הפרויקטים עושים היטב, ולעיתים נדירות, הוא לפרסם את החולשות של עצמם. RSI-Jev מפרט את חמשת מקורות התמונות הלא-מסחריים שמאחורי מהדורות הראייה שלו ואומר בפשטות שלא הוכרע אם משקלות שאומנו עליהם יורשים את אותם תנאים; הוא מדווח על רגרסיית כיול במהדורה החדשה ביותר שלו ומציין שסף היציאה המוגדר כברירת מחדל שלו אינו מאומת. Laya מתעדת שהצ'קפוינטים הבסיסיים שלה נמצאים מתחת לקו הבסיס של הרוב, ששאלות הניקוד האורדינליות שלה הן הפרימיטיב החלש ביותר שלה, שהnoul שלה יכול לעקוב אחרי תוויות האפשרויות של עצמו במקום אחרי המצב, ושאחד משדות התגובה שלה אינו נושא אות שמיש. היושר הזה הוא הדבר המועיל ביותר לרשת מאחד משני הפרויקטים: בדקו את ערכי הביטחון במקרים המתויגים שלכם לפני שאתם בונים עליהם אוטומציה.

Headless Chromium capture of OrcaRouter's own model page for typesafe/jev-1.13: the breadcrumb 'Home / Models / TypeSafe', the page title Jev 1.13 above the slug typesafe/jev-1.13, the line 'by TypeSafe - 2026-09-24', the description that it is TypeSafe's structured decision and evaluation model taking noul / choice / score questions and returning a structured answer for each, the note 'POST /v1/systemone; non-streaming; up to ~64K input tokens; text in, structured JSON out.', the endpoint panel reading /v1/systemone with the price $0.04, our p50 TTFT of 161 ms, 363 ms and 58.9M, and the buttons 'Get the Jev 1.13 API', 'Try in playground' and 'Use via API'.

היכן נמצא בפועל החוזה שהם מעתיקים

שני המודלים האלה קיימים כי פורמט תקשורת אחד היה שווה להעתיק. ה-Jev של TypeSafe מגדיר את צורת הבקשה — מצב, שאלות, שלושה פרימיטיבים טיפוסיים — ואת צורת התשובה, וגם Laya וגם RSI-Jev מיישמים אותו כך שלקוח קיים עובד על ידי החלפת כתובת בסיס. מודל הייחוס הזה, typesafe/jev-1.13, הוא היחיד מבין השלושה שאנחנו מגישים: הוא נמצא בקטלוג שלנו בנקודת הקצה הייעודית systemone, POST אל /v1/systemone, ללא סטרימינג, מול חלון הקשר של 65,536 טוקנים, במחיר של $0.042 למיליון טוקני קלט, כשהפלט מחויב באפס. לא Laya ולא RSI-Jev נמצאים בקטלוג שלנו — שניהם הורדות, וזו בדיוק הנקודה בהם.

הגרסה המעשית של זה חשובה יותר מההשוואה. שכבות החלטה כמעט אף פעם לא נמצאות לבד בסטאק; הן יושבות לצד מודל גנרטיבי שכותב את התשובה, את הסיכום או את הקוד. העובדה שחוזה הייחוס נמצא על אותו מפתח כמו 200+ מודלים אחרים, לפי מחיר המחירון של הספק המועבר עם 0% תוספת, פירושה ששינוי תעריף של ספק מגיע אליכם באותו יום, ומעבר אוטומטי לגיבוי פירושו שהחצי הגנרטיבי של אותו זוג אינו נקודת כשל יחידה בזמן שאתם מבררים אם החצי הזול של קבלת ההחלטות טוב מספיק. אם תחליטו שמקודד 421M בהתארחות עצמית או צ'קפוינט 4.69B הוא הבחירה הנכונה, עדיין תרצו שהחוזה שאליו הוא מדבר יהיה נגיש מאותו מקום — ואם אתם מעדיפים לא להריץ אף אחד מהם, המודל ששניהם מעתיקים נמצא במרחק בקשה אחת.

איזה מהם להוריד?

בחר ב-Laya אם יש לך נתונים מסומנים, טקסונומיה שלא משתנה הרבה, ותערובת שפות שאינה אנגלית בלבד. היא קטנה מספיק כדי להריץ רבות כאלה, מהירה מספיק כדי להציב לפני כל בקשה, ותוכננה מלכתחילה להיות מכווננת דק — הציון המכוונן דק של 0.766 לעומת 0.362 באפס-שוט הוא כל הטיעון. תקצב את ריצת האימון, את הסימון ואת התאמת הטמפרטורה מחדש לפי סוג שאלה, שמביאה את שגיאת הכיול שלה מ-0.466 ל-0.081, ושמור על קבוצות האפשרויות מתחת לעשרים תוויות בערך או הגדל את תקציב הראש לפני שאתה סומך על סיווג גדול.

בחרו ב-RSI-Jev v6.1-VL אם אתם רוצים החלטה שתעבוד בלי אימון מוקדם, אם השאלות שלכם עוסקות לפעמים בתמונה, אם מערכי האפשרויות שלכם גדולים, או אם אתם רוצים להחליף השהיה בעומק לכל בקשה. צפו להריץ צ'קפוינט בנפח 9.7 GB ולא אחד של 400M, צפו לפרויקט שפרסם שמונה מהדורות בשלושה עשר ימים ועשוי לפרסם מהדורה נוספת בזמן שאתם מעריכים את זו, וצפו לבדוק את הכיול שלו בעצמכם — כרטיס המהדורה הזו עצמו אומר שהיא נעשתה גרועה יותר, לא טובה יותר.

לא משנה מה תבחר, שני הדברים הבאים נכונים. אף אחד מהמודלים לא מייצר טקסט, כך שאף אחד מהם לא יכול להיכשל בפליטת שדה פגום; שניהם מחזירים הסתברויות, וההסתברות היא החלק שצריך להיות מאומת לפי פריסה ולא להילקח מכרטיס. ושניהם העבירו את השאלה המעניינת של שכבת החלטה מ"של מי ה-API" ל"של מי המשקלים" — שהיא שאלה טובה יותר לשאול, ואחת שהצמד הזה עונה עליה באופן שונה מאוד.

A generated two-column scoreboard titled 'RSI-Jev v6.1-VL vs Laya - the scoreboard', six rows across both columns: size, '4.69B parameters' against '421M English / 322M multilingual'; zero-shot, '50.98 Decision Index' against '0.362 typed-decisions'; fine-tuned, 'Not per-domain' against '0.766 on its own split'; languages, 'English-centric' against '45 of 51 usable'; modality, 'Text + up to 4 images' against 'Text only'; and latency, '~23-40 ms on an H200' against '32.8 ms p50 on a T4'. A footer reads 'Both vendor-reported; neither has been benchmarked against the other.'