כרטיס כותרת שנוצר עבור ההשוואה בין Laya ל-Nimble, הנושא את כתובית המשנה של המאמר הזה ושורת כותרת תחתונה המציינת של איזה צד הנתונים מדווחים על ידי הספק ואילו הם של צד שלישי.
Engineering & Research

Laya לעומת Nimble: נתונים קונטרסטיביים לעומת מקודד מהיר יותר

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Laya ו-Nimble הם שני מודלי ההחלטה עם משקולות פתוחות שמחבריהם עשו את המרב כדי להסביר כיצד הם נבנו, וההסברים שלהם חלוקים לגבי היכן טמון הקושי. Convai Innovations שחררה את Laya ב-18 בספטמבר 2026 תחת Apache 2.0 — צ'קפוינט ModernBERT-large באנגלית בגודל 421M, צ'קפוינט mmBERT-base רב-לשוני בגודל 322M המכסה יותר מ-100 שפות, נתב תת-מילישני ביניהם, ו-p50 מפורסם של 32.8ms לכל החלטה על Tesla T4. Bespoke Labs בנתה את Nimble כפיין-טיון LoRA על Qwen3.5-9B, תחת Apache 2.0, ומתארת אותו כ"ה-Jev בקוד פתוח" — בהשראת Jev של TypeSafe AI, אך ללא שימוש במשקולותיו, בארכיטקטורה שלו או בזיקוק של פלטיו. התשובה של Convai לבעיית הדיוק היא מהירות ובסיס שניתן לכוונן. התשובה של Bespoke היא נתוני האימון. ההבדל הזה ראוי ליותר תשומת לב מפער הדיוק של שלוש נקודות שמופיע בטבלאות הראשיות.

הטענה שכל פרויקט למעשה מעלה

הטענה של Laya היא ארכיטקטונית. היא אי-אוטורגרסיבית במובן הקפדני — מקודד דו-כיווני, ללא לולאת פענוח, ללא JSON לפרסור, ללא מרחב שבו ניתן לפלוט טקסט מחוץ לטיפוס המוצהר. ההבטחה המבנית הזו היא אותה הבטחה ש-Jev מציע, שאליה הגיע מכיוון אחר, והיא בעלת ערך אמיתי לכל מי שכתב לוגיקת ניסיונות חוזרים סביב מודל שלעתים שוכח לסגור סוגר מסולסל. המחיר הוא שמקודד עם 421 מיליון פרמטרים, חלון של 512 טוקנים וללא אימון מקדים גנרטיבי מאחוריו, לא יודע הרבה במיוחד. Convai אומרת זאת בכרטיס המודל: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות zero-shot."

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.A screenshot of the Nimble repository on GitHub, showing the description "Local typed decisions, contrastive data curation, and model evaluation", the README heading "Bespoke Nimble - Data, Model, Recipe for an open Jev", the contrastive example where changing one fact flips the correct answer, and the 2,676-example training split against the frozen 324 held-out set.

הטענה של Nimble היא על הנתונים. השיטה של Bespoke היא קוראציה קונטרסטיבית, שעובדה מעבודת Bespoke-MiniCheck המוקדמת של הצוות: לכתוב שתי דוגמאות כמעט זהות שנבדלות ב"עובדת מיקוד" אחת, כך שהתווית הנכונה מתהפכת. לתהליך יש ארבעה שלבים מוצהרים — לבדוק שכללי ההחלטה אכן יכולים להוביל לתשובות שונות, לבנות את הזוג על ידי שינוי של לכל היותר שמונה מילים, לאמת את שתי הדוגמאות באמצעות קריאות מודל נפרדות ובנוסף בדיקת הסרת כל משפט, וליצור תוויות בקוד תוך שמירה רק על הזוגות שהתוויות שלהם אכן נבדלות. המטרה אינה עוד דוגמאות אלא דוגמאות חדות יותר: לאלץ את המודל ללמוד אילו ראיות צריכות לשנות את ההחלטה. זו תיאוריה שונה של מדוע מודלי החלטה קטנים נכשלים, והיא מעניינת יותר מעוד נקודת דיוק.

מה שהמספרים שפורסמו באמת תומכים בו

Nimble מדווחת על הסכמה של 90.12% עם תוויות ייחוס ב-324 דגימות שנשמרו להערכה, לעומת 93.21% עבור Jev, 66.36% עבור בסיס Qwen3.5-9B שאינו מכוונן, ו-84.88% עבור Qwen3.8 בגודל 27B שאינו מכוונן. היא מדווחת על חציון של כ-106ms על H100 וחציון של 444ms על M5 Pro עם 64GB. אלה נתוני מסגרת הבדיקה של Bespoke עצמה. קבוצת ההערכה בת 324 הדגימות היא החלק שצריך לשקול בזהירות, והפרויקט עצמו אומר מדוע: הדגימות מכסות שש מתוך עשר משפחות מקור האימון, הן נוצרו ואומתו על ידי מודלים ללא סקירה אנושית, ולכן ההכללה לקטגוריות שלא נראו אינה מוכחת. כאשר מודל מאומן בשיטת אוצרות נתונים ואחר כך מוערך על פיצול שנשמר מאותה התפלגות מאוצרת, מספר הדיוק הוא אמירה על העקביות הפנימית של השיטה, ולא על התעבורה שלך.

המספרים של Laya מגיעים מהקצה האחר. בבנצ'מרק typed-decisions של TypeSafe היא מקבלת 0.362 ב-zero-shot — אקראי הוא 0.318, בסיס רוב-המחלקה הוא 0.461 — ו-0.766 כשהיא מכווננת על מחיצת האימון של הבנצ'מרק עצמו. ב-Banking77, 77 תוויות, היא מקבלת 0.425 מול 0.870 של Jev, וזה ההמחשה החדה ביותר לתקרת ריבוי האפשרויות שלה. ב-AG News עם ארבע תוויות היא מקבלת 0.950 מול 0.910 של Jev; ב-DAIR Emotion עם שש תוויות, 0.595 מול 0.480. שגיאת הכיול שלה מגיעה ל-0.466 ויורדת ל-0.081 לאחר התאמת טמפרטורה מחדש לפי סוג שאלה. בבדיקת צד-שלישי אחת של 100 הודעות דחיפות Mars-base, Jev עמדה על 100/100 ו-Laya על 53/100. ובהערכת קריאות-כלי-סוכן עצמאית Laya השיגה 100% recall של סירוב לקריאות מסוכנות, אבל רק באמצעות סימון של הכול, וזה כשל בדיוק שמחופש לניצחון בטיחות.

הציבו את שתי קבוצות המספרים זו לצד זו, והקריאה הכנה היא שהן נמדדו על דברים שונים. 90.12% של Nimble הם התאמה לתוויות הייחוס שנערכו על ידה עצמה. 0.362 של Laya הוא בנצ'מרק שהיא לא בנתה. אף אחד מהמספרים לא ניתן להעברה.

כיול: המקום היחיד שבו שני הפרויקטים גלויים באופן יוצא דופן

זה המקום שבו שני הפרויקטים קרובים ביותר ברוחם ורחוקים ביותר בתוצאה.

ה-README של Bespoke מזהיר במפורש שההסתברויות של Nimble הן לוגיטים מנורמלים ב-softmax על פני המועמדים שסופקו, ולא שיעורי נכונות מכוילים — 0.9 אינו אומר 90% נכונות. הוא ממליץ להוסיף אפשרות "אף אחד מהאפשרויות שלעיל", כי אם התשובה הנכונה אינה בין המועמדים, אחד מהם עדיין מנצח. בהערכה חדשה יותר בת 3,880 רשומות הפרושה על פני 13 תת-קבוצות, ל-Jev היה שגיאת כיול מדווחת נמוכה יותר ב-11 מתוך 13 תת-קבוצות וציון Brier נמוך יותר ב-10 מתוך 13. לכן הסכמה דומה בתוויות אינה מרמזת על איכות הסתברות דומה, ו-Bespoke אומר זאת.

הגילוי של Convai הוא תמונת מראה: שגיאת הכיול הצפויה של 0.466 מופיעה על הכרטיס, לצד ה-0.081 שמייצר כיוונון טמפרטורה מחדש לפי סוג שאלה. אף אחד מהפרויקטים לא מספק מודל שביטחונו ניתן לפעול לפיו ללא עבודה. שניהם אומרים לך זאת בכתב. אם אתה בונה סף ביטחון — שחרור אוטומטי מעל 0.95, הסלמה מתחת ל-0.7 — התיעוד משני המחברים אומר לך את אותו הדבר: התאם את הסף על הנתונים המתויגים שלך תחילה.

ההשוואה, מימד אחר מימד

• עמוד שדרה — Laya: מקודד ModernBERT-large 421M, דו-כיווני, ללא אימון מקדים גנרטיבי. Nimble: Qwen3.5-9B עם כוונון עדין LoRA, בסיס גנרטיבי נשמר.

• שפות — Laya: ‏100+ דרך נקודת הבדיקה הרב־לשונית 322M. Nimble: אנגלית.

• תקציב פרומפט — Laya: 512 טוקנים באנגלית, 1,024 רב-לשוני. Nimble: מקסימום 2,048 טוקנים לפרומפט, סכמות שטוחות בלבד, אנומים מוגבלים ל-26 אפשרויות לכל שדה.

• מהירות — Laya: 32.8ms p50 על T4, 7.2ms לשאלה כאשר מעבדים באצווה של 10. Nimble: בערך 106ms חציוני על H100, 444ms על M5 Pro 64GB.

• חומרה — Laya: CPU, CUDA ו-Apple MPS; מתחת לגיגהבייט בזיכרון תושב בפורט MLX. Nimble: BF16 CUDA GPU עבור הנתונים המוצהרים, עם תמיכה בנתיבי MLX ו-CUDA.

• דיוק מדווח — Laya: 0.362 במצב zero-shot, 0.766 לאחר כיוונון עדין, 0.425 על Banking77. Nimble: 90.12% על 324 דגימות מופרשות שנבחרו בקפידה לעומת 93.21% של Jev.

• שיטה — Laya: ארכיטקטורה תחילה, כוונון עדין לכל פריסה. Nimble: אוצרות נתונים קונטרסטיבית, שפורסמה כמתכון.

• רישיון — Apache 2.0 עבור שניהם.

שני אילוצים ברשימה ההיא ראויים להיקרא פעמיים לפני שאתה מתחייב. המגבלה של Nimble של 26 אפשרויות לכל enum ותקרת הפרומפט של 2,048 טוקנים הן מגבלות סכימה קשיחות, לא ירידה בביצועים — אם בטקסונומיה שלך יש ארבעים תוויות או שהפרומפט שלך מכיל מסמך ארוך, Nimble הוא הכלי הלא נכון ללא קשר לדיוק שלו. ו-Nimble מדרג כל שדה בנפרד, כך שכל כלל עקביות חוצה-שדות — "אם A נכון אז B חייב להיות שקרי" — צריך לחיות בקוד שלך, לא במודל.

מדוע מתכון הנתונים הוא הארטיפקט הנייד יותר

הנה הטיעון בעד Nimble שטבלאות הדיוק מפספסות. Bespoke פרסמה את פייפליין הקורציה, לא רק את המשקלים. אם לבעיית ההחלטה שלך יש טקסונומיה קבועה ואתה יכול לכתוב את החוקים, השיטה הקונטרסטיבית היא משהו שתוכל להריץ על הנתונים שלך עם עובדות המיקוד שלך, על גבי כל מודל בסיס שתעדיף. ה-9B LoRA הוא הדגמה של השיטה באותה מידה שהוא מוצר.

הניידות של Laya שונה ומשלימה. משום שהיא קטנה, משום שהיא רצה על CPU, ומשום שפורטי ה-ONNX וה-MLX קיימים, Laya הוא המודל שאפשר להכניס לתוך תהליך שאין בו GPU ואין בו רשת. בבנצ'מרק של סוכן דפדפן מצד שלישי השלימה Laya 0 מתוך 50 משימות והכריזה על השלמה בטרם עת ב-33 ניסיונות — אבל מחברי הבנצ'מרק מציינים שהיא אומנה לעבודת שיקול דעת כמו כרטיסי תמיכה, חשבוניות וסקירת עקבות סוכן, לא לניווט. יש לקרוא את התוצאה הזו כהצהרת היקף ולא כפסק דין, והיא עקבית עם המסגור של שני הפרויקטים: אלה רכיבים לסוג מסוים של החלטה, לא סוכנים כלליים.

לא Laya ולא Nimble הם מודלים מתארחים ב-OrcaRouter. שניהם משקלים שאתם מריצים בעצמכם, ואין לקרוא דבר במאמר הזה כטענה שאנו מגישים אותם. הסיבה שמוצר הניתוב עולה בכלל היא אותה סיבה שהוא עולה בכל ארכיטקטורת מודל החלטה: מודל ההחלטה עונה לקריאה אחת, והאפליקציה שסביבו עדיין זקוקה לפרוזה. צינור שמשתמש ב-Nimble כדי לתת ציון אם טיוטה עומדת בדרישות וב-Laya כדי לנתב את החריגה עדיין יצטרך מודל גנרטיבי כדי לכתוב את הטיוטה. החזקת החצי הגנרטיבי הזה על נקודת קצה אחת תואמת OpenAI — למעלה מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה עם 0% תוספתכך שהורדת מחיר של ספק נכנסת לתוקף באותו יום, מעבר אוטומטי בין ספקים בעת תקלה — פירושה שניתן להחליף את שכבת ההחלטה בלי לגעת בחוזה של השכבה הגנרטיבית.

פסק הדין, והניסוי שישנה אותו

בחר ב-Nimble אם הטקסונומיה שלך קבועה וצרה, הקלט שלך באנגלית וקצר, יש לך GPU, ואתה רוצה את מתכון הנתונים באותה מידה כמו את המודל. בחר ב-Laya אם אתה זקוק לקלט רב-לשוני, לתקציב תת-40ms, או לתהליך ללא GPU בכלל — ותמחר את הכיוונון העדין מלכתחילה, כי נקודת הביקורת של zero-shot נמצאת מתחת לקו הבסיס הטריוויאלי וכרטיס המודל אומר זאת.

הניסוי שיכריע את הסוגיה הוא הערכה מזווגת על תעבורה אמיתית: אותם קלטים, אותן קבוצות אפשרויות, אותם ספי ביטחון, שנבחנו מול תיוג אנושי, עם דיאגרמת מהימנות לכל אחד. התיעוד של Nimble עצמו מזהיר שההסתברויות שלו אינן שיעורי נכונות, והכרטיס של Laya מדווח על שגיאת כיול של 0.466 לפני התאמה מחדש, כך שהדיאגרמה הזאת היא הפריט שבאמת יגיד לך איזה מודל להעמיד מול סביבת הייצור. אף אחד מהפרויקטים לא פרסם דיאגרמה כזאת, ואף אחד מהם לא פרסם את זו של האחר. בנה אותה על הנתונים שלך לפני שאתה קובע סף.

A generated two-column scoreboard comparing Laya and Nimble across backbone, languages, prompt budget, label agreement, latency and licence, with a footer reading "Nimble's 90.12% is agreement with its own curated labels; Laya figures per its model card."