כרטיס כותרת שנוצר עבור השוואת Laya מול Decider, הנושא את כתובית המשנה של המאמר הזה ושורת כותרת תחתונה שמציינת אילו נתונים של איזה צד מדווחים על ידי הספק ואילו הם של צד שלישי.
Engineering & Research

Laya מול Decider: מקודד 421M נגד תערובת 35B

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Laya ו-Decider הם שניהם מודלים להחלטות עם משקולות פתוחות, לא-אוטורגרסיביים, שעונים על שאלות מטיפוס מוגדר — בחירה מתוך רשימה שסופקה, ציון לפי רובריקה סדורה, או הסתברות כן/לא — במעבר קדימה אחד, והם נמצאים בשני הקצוות המנוגדים של ספקטרום הגדלים. Convai Innovations שחררה את Laya ב-18 בספטמבר 2026 תחת Apache 2.0: מקודד ModernBERT-large בגודל 421M לאנגלית עם חלון של 512 טוקנים, צ'קפוינט רב-לשוני mmBERT-base בגודל 322M עם חלון של 1,024 טוקנים המכסה יותר מ-100 שפות, ונתב שמזהה כתב ומפנה למודל המתאים. משפחת Decider של Mapika נעה מ-decider-0.8b ו-decider-2b על בסיסים גנרטיביים קטנים ועד decider-35b-a3b, מודל תערובת מומחים בגודל 35B עם כ-3B פרמטרים פעילים. שניהם ניתנים להורדה בחינם ושניהם מחזירים הסתברויות ולא טקסט. הסיבה לכך שהם אינם ניתנים להחלפה אינה נתון הדיוק שרוב הכתבות פותחות בו.

שתי משפחות, הימור אדריכלי אחד

A screenshot of the Laya project page, showing the Apache 2.0 licence, the 421M ModernBERT-large English checkpoint with a 512-token window, the 322M mmBERT-base multilingual checkpoint with a 1,024-token window, the 32.8ms p50 per decision on a Tesla T4, and the pip install entry point.

ההימור המשותף הוא שהחלטה אינה זקוקה ללולאת פענוח. מודל גנרטיבי שנשאל "האם הפנייה הזו היא בקשת החזר?" חייב לפלוט טוקנים, וברגע שהוא פולט טוקנים אתה אחראי לניתוח, לאימות סכימה ולמסלול ניסיון חוזר למקרה האחד מתוך מאתיים שבו הוא שוכח סוגר מסולסל. Laya ו-Decider מדלגים שניהם על כך בכך שהם קוראים את התשובה ישירות מתוך מעבר קדמי יחיד — Laya ממקודד דו-כיווני, Decider מהלוגיטים של טוקנים של אפשרויות מסומנות באותיות במשבצת תשובה ייעודית בפרומפט.

כאן נגמר הדמיון. Laya היא שני מקודדים קטנים מאחורי נתב שפה, וזה מה שמקנה לה חלון אנגלי של 512 טוקנים וחלון רב-לשוני של 1,024 טוקנים, במספר פרמטרים של 421M ו-322M. Decider שומר על עמוד שדרה גנרטיבי ומוסיף מעליו שכבת קריאה: decider-2b הוא כיוונון עדין מפוקח של Qwen3.5-2B-Base, ואחריו מעבר חיזוק מודע לכיול על משימות דפדפן חיות ומשחקים מדויקים, בעוד decider-35b-a3b מקפיא את המומחים המנותבים ומאמן מטריצות בלוקים עם Muon. ההשלכה המעשית היא ש-Decider יורש את הידע העולמי של מודל שפה ואילו Laya לא. ההשלכה האחרת היא ש-Decider יורש את טביעת הרגל של מודל שפה.

A screenshot of the decider-2b model card on Hugging Face, showing the Qwen3.5-2B base, the text-classification pipeline tag, the English-language tag, and the decision-model and calibrated tags for the Mapika Decider family.

התיעוד של Mapika עצמה מציב את decider-2b על 18 מ״ש חציוניים לכל החלטה על B300 ב‑bf16, באצווה של 1, ללא CUDA graphs או קומפילציה, ואת decider-35b-a3b על 41 מ״ש באותה תצורה. על GH200 עם הקשרים של פניות תמיכה באורך של כ‑230 טוקנים ושלוש עד חמש שאלות מוקלדות, אותו פרויקט מדווח על 49 מ״ש במצב eager, 4.0 מ״ש עם CUDA graphs ו-torch.compile, וכ‑1,370 החלטות בשנייה באצווה של 32. אלה נתונים שמפורסמים על ידי הספק מתוך הכתיבה של הפרויקט עצמו, ולא מדידה בלתי תלויה. גם מספר הכותרת של Laya מפורסם על ידי הספק: 32.8 מ״ש p50 לכל החלטה על Tesla T4, ו‑7.2 מ״ש לשאלה בגודל אצווה של 10.

שאלת הכיול, ששני הפרויקטים עונים עליה בקני מידה שונים

כיול הוא המספר החשוב ביותר עבור מודל קבלת החלטות, כי כל הנקודה בהחזרת הסתברות היא שמישהו בהמשך יקבע עליה סף. זה גם המקום שבו השוואה ישירה בין Laya ל-Decider תטעה אותך.

Laya מגיעה עם שגיאת כיול צפויה של 0.466 בכרטיס המודל שלה עצמו, והכרטיס מציין בפשטות שהתאמה מחדש של טמפרטורה לכל סוג שאלה מזיזה את זה ל-0.081. זהו גילוי כן באופן יוצא דופן, וזה גם אומר שנקודת הביקורת שנשלחת אינה הארטיפקט המכויל. המספר שמקבלים מחוץ לקופסה הוא 0.466.

Decider מדווח על מכשיר אחר לגמרי. ה-Decision Index — לוח דירוג פתוח שהריץ כל שחזור פתוח של Jev על יותר מ-132,422 בקשות — מציב את decider-35b-a3b במקום הרביעי בסך הכל עם 54.3, אחרי 59.5 של Jev, ומדווח עליו כעל בעל הכיול הטוב ביותר מבין 32 הרשומות, עם שגיאת כיול של 3.1 נקודות ו-0.4% תשובות שגויות בביטחון מוצהר של 95%+. decider-2b מדווח 8.8 נקודות ו-0.9%. אלה מספרים שפורסמו בלוח הדירוג, ו-3.1 נקודות ב-ECE בעשרה סלים של ה-Decision Index אינו אותה מדידה כמו 0.466 של Laya בהערכה העצמית של Laya. הצבתם זו לצד זו בטבלה תהיה שגיאה של השוואת תפוחים לתפוזים בלבוש של קפדנות. מה שכן אפשר לומר הוא שמחבר Decider בחר להימדד בלוח דירוג של צד שלישי, ומחבר Laya בחר לפרסם בעצמו את מספר הכיול החלש ביותר של Laya; אף אחד מהם לא נבדק ברתמה של האחר.

היכן כל אחד מנצח, ממד אחר ממד

• עמוד שדרה — Laya: מקודד ModernBERT-large 421M, דו-כיווני. מכריע: בסיסים גנרטיביים של Qwen3.5, מ-0.8B עד 35B-A3B.

• שפות — Laya: יותר מ-100 באמצעות צ'קפוינט רב-לשוני של 322M מאחורי ראוטר. Decider: אנגלית בלבד, מוצהר כמגבלה.

• חלון הקשר — Laya: 512 טוקנים באנגלית, 1,024 רב-לשוני. Decider: קלטים של עד 32k מתקבלים, אומן עד 16k בדור v6, נבדק עד 30k.

• תקרת סט האפשרויות — Laya: מתדרדרת בחדות לאחר כ-20 אפשרויות, 0.425 ב-Banking77 לעומת 0.870 של Jev. מכריע: Choice על 2 עד 255 אפשרויות בעלות שם, Score על 2 עד 10 רמות מתוארות.

• דיוק ללא דוגמאות — Laya: 0.362 בבנצ'מרק typed-decisions, מתחת לקו הבסיס של מחלקת הרוב 0.461. Decider: לא פורסם כמספר ללא דוגמאות; הפרויקט מדווח במקום זאת תוצאות ספציפיות למשימה.

• כיול — Laya: ‏ECE 0.466 כפי שהופץ, 0.081 לאחר התאמה מחדש של טמפרטורה לפי סוג שאלה. Decider: 3.1 נקודות במדד ההחלטה עבור ה-35B, הטוב מבין 32 רשומות.

• הסקה — Laya: אין, מעצם הבנייה. Decider: אין, נאמר במפורש — זהו פלט של התאמת תבניות, לא מנמק.

• רישיון — Apache 2.0 עבור שניהם.

עוד פרט אחד ב-Decider שכדאי לדעת לפני שבוחרים בו: הפרויקט מזהיר שבחירת רשומה אחת מתוך מערך JSON ארוך לפי מיקום היא מקרה חלש, וממליץ לפנות לרשומות לפי מפתח. זה מסוג המגבלות שלומדים רק כשמריצים אותו.

מה זה עולה לך להפעיל אחד מהשניים

פרופיל העלויות של Laya הוא פרויקט של כיוונון עדין. המודל קטן מספיק כדי לרוץ על CPU של מחשב נייד לעבודה בתפוקה נמוכה, אך הציון ב-zero-shot של נקודת הביקורת האנגלית שנשלחת נמצא מתחת לקו הבסיס הטריוויאלי, כלומר לאמץ את Laya זה לאמץ את המשימה של בניית סט מתויג, כיוונון עדין והתאמה מחדש של הטמפרטורה לכל סוג שאלה. התגמול הוא שברגע שעשית זאת, התוצר הוא 421 מיליון פרמטרים והוא עונה בעשרות מילישניות על T4. נקודת הביקורת המכווננת עדין של Convai עצמה laya-typed-decisions מגיעה ל-0.766 בסט האימון של ה-benchmark — מספר שאומר יותר על הכיוונון העדין מאשר על מודל הבסיס, והכרטיס אומר זאת במפורש.

פרופיל העלויות של Decider הוא החלטת הגשה. אתה בוחר כמה GPU לשכור, והמשפחה נותנת לך חוגה אמיתית: 18ms על 2B לעומת 41ms על 35B-A3B, כשהמודל הגדול יותר קונה ידע ומרווח חשיבה ב-GPQA, GSM8K, CRUXEval ו-MMLU שאין לקטנים. אם המשימה שלך צרה והתוויות שלך קבועות, decider-2b היא המכונה הזולה יותר. אם המשימה שלך דורשת שהמודל ידע דברים, אתה משלם על התערובת.

איפה OrcaRouter מתאים — ואיפה הוא לא

לא Laya ולא Decider הם מודלים מתארחים ב-OrcaRouter. אתם מורידים את המשקולות ומריצים אותן בעצמכם, ושום דבר כאן לא משנה זאת. מה שכן משתנה הוא החצי השני של התבנית. מודל החלטות טיפוסי הוא כמעט אף פעם לא היישום כולו: משהו צריך לקרוא את הפנייה, לסכם את השרשור, או לנסח את התשובה ששער ההחלטה שולט עליה. החצי הזה הוא קריאה גנרטיבית, והוא החצי שעבורו נבנה OrcaRouter — יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI במחיר מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, כך שהורדת מחיר של ספק מגיעה לחשבון שלכם באותו יום ולא בחידוש החוזה הבא. אם אתם מכווננים צ'קפוינט של Laya מול הפלטים של מודל חזיתי, או מנתבים בין decider-2b למיון ראשוני ומודל גדול עבור 4% הקשים, החזקת הצד הגנרטיבי בנקודת קצה אחת פירושה שצד ההחלטה וצד היצירה לא זקוקים לשני חוזים ולשני SDK-ים. מעבר אוטומטי לכשל מכסה את המקרה שבו המודל הגדול הוא החלק שנופל.

איזה אחד לבחור?

בחר ב-Laya אם הקלט שלך הוא רב־לשוני, התוויות שלך מעטות, תקציב ההשהיה שלך הוא עשרות מילישניות על חומרה צנועה, ואתה מוכן לבצע כיוונון עדין — כי תצטרך. בחר ב-Decider אם הקלט שלך הוא אנגלית, אתה צריך שהמודל יישא עמו מעט ידע עולם אל תוך ההחלטה, ואתה מעדיף לבחור גודל מודל מאשר להריץ צינור אימון. אם קבוצות האפשרויות שלך חורגות מעשרים תוויות, קרא את הנתון של Laya לגבי Banking77 לפני שאתה מתחייב; אם הקלט שלך הוא מסמכי JSON ארוכים שאתה ניגש אליהם לפי מיקום, קרא את המגבלה המוצהרת של Decider לפני שאתה מתחייב.

ההשוואה שבאמת תכריע את העניין — שני המודלים על קלטים זהים לחלוטין ברמת הבתים, אותם פרומפטים, אותו סדר אפשרויות, אותה סריקת סף — עדיין לא קיימת. עד שהיא תתקיים, העמדה הכנה היא של-Laya יש את עקומת העלות הטובה יותר ול-Decider יש את ראיות הכיול הטובות יותר, ושניהם מוקדמים מספיק כך שההערכה שתבנה על הנתונים שלך תהיה שווה יותר מהמספרים המפורסמים של כל אחד מהפרויקטים.

A generated two-column scoreboard comparing Laya and Decider across backbone, languages, context, zero-shot accuracy, calibration and serving, with a footer reading "Laya figures per its own model card; Decider per Mapika and the Decision Index."