כרטיס כותרת מיוצר עבור השוואת Laya מול von, הנושא את כתובית המשנה של המאמר הזה עצמו, וכן שורת כותרת תחתונה שמציינת אילו נתונים של איזה צד מדווחים על ידי הספק ואילו הם של צד שלישי.
Engineering & Research

Laya נגד von: כאשר מדד הספק אינו עובר

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

משימת סיווג מסוג commit עם שש תוויות אפשריות, שבה ניחוש מניב 8.3% ו-von משיג 26.7%. משימת ניתוב קבצים שבה אותו מודל משיג 8.8%, בקושי מעל לניחוש מקרי. משימת היקף שינוי בינארי עם AUC של 0.513, שזה שקול להטלת מטבע. המספרים האלה מגיעים מהערכה של צד שלישי של von — מודל System One בקוד פתוח מבית wfzyx, מקודד ModernBERT-Large עם 395M ששוחרר תחת Apache 2.0 ב-18 בספטמבר 2026, באותו יום כמו Laya של Convai Innovations. בבנצ'מרק jabr v2 של von עצמו התמונה הפוכה: 71.5% דיוק מאקרו על פני 49 משימות ו-869 מקרים, ניתוב בחירה ב-83.4%, ותוצאה של ViZDoom של 9.38 הריגות בממוצע בזמן מתחת ל-18ms מול Jev של TypeSafe AI עם 5.62 הריגות וכ-115ms. שתי קבוצות המספרים אמיתיות. המרחק ביניהם הוא הדבר השימושי ביותר שמישהו פרסם על קטגוריית המודלים הזו, והוא חל גם על Laya.

שני מודלים, שני עמודי שדרה, מצב כשל משותף אחד

פון וליה הן שכנות כמעט צמודות מבחינה ארכיטקטונית, וזו הסיבה שבעיית ההעברה היא העדשה הנכונה להשוואה ביניהן. שתיהן מקודדים לא-אוטורגרסיביים הבנויים על ModernBERT: פון עם 395 מיליון פרמטרים, ונקודת הביקורת האנגלית של ליה עם 421 מיליון. שתיהן חושפות את אותם שלושת הפרימיטיבים — choice מתוך רשימה מסופקת, score על מחוון סדור, noul בתור הסתברות מכוילת ל"כן" — ושתיהן מיישמות את /v1/systemone פורמט התקשורת, כך שלקוח שנכתב ל-Jev של TypeSafe יכול להצביע במקום זאת על שרת מקומי. שתיהן ברישיון Apache 2.0. שתיהן מחזירות הסתברויות ולא טקסט, ולאף אחת מהן אין לולאת פענוח שאפשר להזות בה.

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

ההבדלים נמצאים בסיפור האימון. von עבר אימון מקדים על 2 טריליון טוקנים של טקסט אינטרנטי כללי, ספרות טכנית וקוד, ולאחר מכן כוונן עדין על קורפוס רב-תחומי מאוזן של כ-290,000 דוגמאות, המשתרע על זרימות עבודה תפעוליות וארגוניות, אבטחה ו-DevOps, בטיחות ומודרציה של מדיניות, בלשנות, מיון והסקה יריבה. לאחר האימון נעשה שימוש בלמידת חיזוק עם התפלגות כיול (Reinforcement Learning with Calibration Distribution), תוך מזעור של צירוף של אנטרופיה צולבת וציון Brier עם למבדה ב-0.5, וכיול טמפרטורה התכנס ב-T=1.1692. הצ'קפוינט האנגלי של Laya הוא ModernBERT-large שמכוונן עדין לצורת ההחלטה המטופסת, עם חלון של 512 טוקנים, לצד צ'קפוינט רב-לשוני mmBERT-base בגודל 322M המכסה יותר מ-100 שפות מאחורי ראוטר, ו-p50 מפורסם של 32.8ms לכל החלטה על Tesla T4.

מצב הכשל המשותף הוא ששניהם מקודדים שאומנו להפיק פלט, לא לבצע הסקה. ה-README של von עצמו מפורש שהוא מיועד לצינורות עיבוד רגישים לשהיה, שבהם מודלים אוטורגרסיביים מכניסים השהיה של 500–2,000ms ושגיאות לא-דטרמיניסטיות בפענוח סכמה. המסגור הזה אומר לך למה זה מיועד: סיווג מהיר, דטרמיניסטי, מכויל סטטיסטית. זה לא אומר לך שזה יעבוד על הסיווג שלך, ובנצ'מרק בלתי תלוי הוא מה שקורה כשמישהו בודק.

קריאה כנה של הבנצ'מרק של פון עצמו

התוצאות של jabr v2 פורסמו על ידי הבעלים ולא עברו ביקורת בלתי תלויה, וצורתו של הבנצ'מרק חשובה לא פחות מהציון. ארבעים ותשע משימות ו-869 מקרים הם רוחב סביר להערכת מודל החלטות, ודיוק מאקרו של 71.5% הוא מספר חזק עבור מקודד בן 395M. הפילוח לפי תחום הוא המקום שבו זה הופך למלמד: טריאז' סימפטומים ב-100.0%, שירותי בית ב-95.7%, ניתוב עירוני ב-94.7%, ניתוב בחירה בסך הכול ב-83.4%. אלה המשימות שסביבן נבנה קורפוס האימון — ה-README מתאר את נתוני הכוונון העדין כתהליכי עבודה תפעוליים וארגוניים, אבטחה ו-DevOps, בטיחות ומיתון מדיניות, בלשנות, טריאז' וחשיבה עוינת. ציון גבוה בטריאז' סימפטומים הוא הצהרה שהמודל למד את תחום הטריאז', לא שהוא למד לסווג.

A screenshot of the von repository on GitHub, showing the README heading, the Apache-2.0 licence, the benchmarks, examples, tests and training directories, and recent commit messages covering the Doom demo and the fixed benchmark harness.

התוצאה של ViZDoom היא זו שמצוטטת ביותר, והיא ראויה לקריאה מדוקדקת. 9.38 הריגות בממוצע ב״Defend the Center״, שמונה זרעים, zero-shot מטקסט סצנה מובנה, בהשהיה מתחת ל-18ms, לעומת 5.62 הריגות של Jev בכ-115ms — שיפור של +66.9%. זו תוצאה מרשימה, והיא גם סביבת משחק המונעת מטקסט מובנה שבה מדיניות רפלקסיבית מהירה היא בדיוק הצורה הנכונה. האופן שבו הפרויקט ממסגר את פרדיגמת System One — רפלקסיבית, מקבילית, דטרמיניסטית, מכוילת סטטיסטית — הוא תיאור הוגן של מה שהמשימה הזו מתגמלת.

אז ההערכה של צד שלישי הריצה את von על סיווג סוגי commit, ניתוב קבצים, זיהוי תכונות וניקוד רוחב שינויים, והוא הפסיד לקווי בסיס מבוססי מילות מפתח ו-regex בחלק מהם. AUC של 0.513 במשימה הבינארית הוא הנתון הבולט ביותר: הטלת מטבע, ממודל שהכיול שלו כוונן ל-T=1.1692 ושה-README שלו טוען לשגיאת כיול צפויה כמעט אידיאלית. שני הדברים יכולים להיות נכונים. מודל יכול להיות מכויל היטב על ההתפלגות שעליה אומן וחסר תועלת על התפלגות שמעולם לא ראה — ולמעשה, כיול טוב על ההתפלגות הלא נכונה גרוע מכיול רע בעליל, מפני שמספרי הביטחון נראים אמינים.

אותו המבחן הוחל על Laya

ל-Laya הייתה גרסה של טיפול זה, והתוצאות תואמות את אלה של von. בבנצ'מרק typed-decisions של TypeSafe, Laya מקבל 0.362 ללא דוגמאות לעומת 0.318 לאקראי ו-0.461 לקו הבסיס של מחלקת הרוב — קרוב יותר לאקראיות מאשר לתשובה הטריוויאלית. כרטיס המודל של עצמו מציין את המסקנה: "Laya הוא בסיס מהיר להתמחות, לא מנוע החלטות ללא דוגמאות." מעבר לעשרים אפשרויות בערך הוא מדרדר בחדות, ומקבל 0.425 ב-Banking77 לעומת 0.870 של Jev. ב-100 הודעות דחיפות של Mars-base במבחן חיצוני אחד, Jev קיבל 100/100 ו-Laya 53/100. בבנצ'מרק של סוכן דפדפן הוא השלים 0 מתוך 50 משימות, והכריז על השלמה מוקדמת ב-33 ניסיונות, 17 מהם לפני שנקט בכל פעולה — אם כי מחברי הבנצ'מרק מציינים שהוא אומן לעבודת שיפוט כמו כרטיסי תמיכה וחשבוניות, לא לניווט, שזו הצהרת היקף ולא פסק דין.

ההבדל בין Laya ל-von הוא במה שהיא טוענת לעצמה. Convai פרסמה את מספר ה-zero-shot הלא-מחמיא ואת שגיאת הכיול הצפויה 0.466 בכרטיס, לצד 0.081 שמייצרת התאמה מחדש של temperature לפי סוג שאלה. ה-README של von מפרסם את מספר ה-jabr v2 המחמיא ואת הניצחון ב-ViZDoom. שני הפרויקטים כנים לגבי מה שהם עשו; רק אחד מהם פותח עם בנצ'מרק שבו המודל מתפקד גרוע. זו תצפית בנוגע למקורות, לא האשמה — אבל אם אתם בוחרים בין השניים על סמך ראיות שפורסמו, שימו לב שאתם משווים פרויקט שהראה לכם את המספר החלש שלו מול אחד שהייתם צריכים למצוא את המספר החלש שלו במקום אחר.

ההבדל במפרט, ממד אחר ממד

• עמוד שדרה — Laya: ModernBERT-large 421M אנגלית, mmBERT-base 322M רב-לשוני. מאת: ModernBERT-Large 395M.

• שפות — Laya: 100+ באמצעות הצ'קפוינט הרב-לשוני ונתב. von: אנגלית, ללא צ'קפוינט רב-לשוני שפורסם.

• חלון הקשר — Laya: 512 טוקנים באנגלית, 1,024 רב־לשוני. von: לא פורסם באותם תנאים; מקרי jabr v2 הם החלטות מובנות קצרות.

• השהיה — Laya: p50 של 32.8ms על T4, 7.2ms לשאלה בבאצ' 10. von: נטען מתחת ל-15ms עד מתחת ל-25ms, מתחת ל-18ms בהרצת ViZDoom.

• דיוק מדווח — Laya: 0.362 ב-zero-shot, 0.766 בכיוונון עדין על הפיצול של הבנצ'מרק עצמו, 0.425 על Banking77. von: 71.5% מאקרו על פני 49 המשימות של jabr v2, 83.4% בניתוב בחירה, ו-26.7% בסוג קומיט בבדיקה בלתי תלויה.

• כיול — Laya: ECE 0.466 בגרסה ששוחררה, 0.081 לאחר התאמת טמפרטורה מחדש לפי סוג שאלה. von: הטמפרטורה הותאמה ל-T=1.1692 במהלך אימון-המשך RLCD, ונטען כי ה-ECE כמעט אידיאלי בהתפלגות של עצמו.

• הגשה — Laya: pip install laya, בנוסף לפורטים קהילתיים של ONNX, Go ו-Apple MLX. von: ערכות SDK ל-Python ול-TypeScript, שרת HTTP דרך von serve, הגדרות מוכנות מראש למיון פניות, אבטחת דואר אלקטרוני, מודרציה ומיון אירועי אבטחה.

• חומרה — Laya: CPU, CUDA ו-Apple MPS. מאת: NVIDIA CUDA, AMD ROCm, Apple Silicon MPS ו-CPU רב-תהליכוני.

• רישיון — Apache 2.0 עבור שניהם.

החלק של von שבאמת ייחודי

התבניות הניתנות להרכבה של von הן הדבר הפחות נידון במאגר שלה. שער ביטחון, הפצת מסלולים, ניקוד מורכב וניתוב דו-שלבי מסופקים כתבניות בעלות שם לצד הפריסטים — מיון פניות, אבטחת דואר אלקטרוני, מודרציה, מיון אירועי אבטחה — והם מגלמים את הארכיטקטורה שמודל החלטות באמת זקוק לה בפרודקשן. קריאה בודדת של choice היא לעתים רחוקות המערכת כולה; הצורה המועילה היא נתב זול בשלב ראשון שמפנה לשלב שני מתמחה, עם שער ביטחון שמסלים את המקרים הלא-ודאיים. von מספקת זאת כתבנית מתועדת במקום להשאיר זאת לך.

זה מתאים בצורה נקייה למה ש-OrcaRouter עושה בצד הגנרטיבי, וכדאי לומר זאת בפשטות משום ששני החצאים של התבנית נבנים בדרך כלל על ידי צוותים שונים. לא von ולא Laya מתארחים ב-OrcaRouter — שניהם משקלים שאתם מורידים ומריצים — ואין לקרוא דבר כאן כטענה שאנחנו משרתים אותם. מה שנמצא ברשימה שלנו הוא החצי השני: יותר מ-200 מודלים גנרטיביים מאחורי מפתח אחד תואם OpenAI במחיר המחירון של הספק מועבר הלאה עם 0% תוספת, כך שהורדת מחיר של ספק מגיעה לחשבון שלכם באותו יום ולא בחידוש. אם שער הביטחון של von מחליט ש-4% מהבקשות זקוקות למודל חזית, ה-DSL לניתוב הוא מה שמרכיב את ההחלטה הזו לקריאה אחת במקום שני חוזים ושני SDKs, ומעבר אוטומטי לגיבוי הוא מה שמונע מהענף היקר להיות נקודת כשל בודדת.

מה לעשות עם שני מודלים ששניהם נכשלים מחוץ להתפלגות האימון שלהם?

המסקנה המעשית מההערכה של von אינה ש-von הוא מודל גרוע. היא שהדיוק המפורסם של מודל קבלת החלטות הוא טענה על התפלגות האימון שלו, והדרך היחידה לדעת אם הבעיה שלך נמצאת בתוך אותה התפלגות היא לבדוק אותה. טבלת הבנצ'מרק ב-README של von עצמו משווה בינו לבין GLiNER2, Qwen3.5 4B שעבר כיוונון עדין, Laya, ו-Jev של TypeSafe לפי גודל, דיוק, השהיה ואירוח — וזו טבלה שימושית, וגם טבלה שבה כל ערך דיוק מלבד אחד מגיע מתשתית הבדיקות של המחבר עצמו.

בין השניים: בחרו ב-von אם אתם רוצים סט רחב יותר של דומיינים מפורסמים, טביעת רגל קטנה במעט, תבניות הגשה מוכנות מראש לטריאז' ולמודרציה, והעדות מ-ViZDoom שהוא מתמודד היטב עם החלטות מהירות על טקסט מובנה. בחרו ב-Laya אם אתם זקוקים לקלט רב-לשוני — ל-von אין צ'קפוינט רב-לשוני, והגרסה 322M mmBERT של Laya מכסה יותר מ-100 שפות — או אם נתון 32.8ms ב-T4 וחלון אנגלי של 512 טוקנים מתאימים לעומס העבודה שלכם. אל תבחרו באף אחד מהם בלי להקדיש אחר צהריים לתיוג כמה מאות דוגמאות מהתעבורה שלכם ולהריץ את שניהם עליהן. התיעוד של שני הפרויקטים עצמם מפנה אתכם לניסוי הזה, והתוצאה של צד שלישי לגבי von היא מה שקורה כשאיש לא מריץ אותו.

הדבר היחיד שישנה את ההשוואה הזו הוא הערכה מזווגת על קלטים זהים עם דיאגרמת מהימנות לכל מודל. זה לא קיים. עד שזה יקרה, הדירוג ההוגן הוא לפי איכות הראיות ולא לפי הציון: Laya פרסמה את המספר הגרוע ביותר שלה, von פרסם את הטוב ביותר שלו, והמבחן העצמאי של von הוא הדבר הקרוב ביותר שיש למי משניהם לבדיקה חיצונית.

A generated two-column scoreboard comparing Laya and von across backbone, languages, context, zero-shot accuracy, calibration and licence, with a footer reading "von's 71.5% is owner-published; the 26.7% result is a third-party evaluation."