כרטיס כותרת שנוצר, שעליו כתוב 'Intern-Decision-4B vs Laya', עם כותרת משנה 'שני מודלים שעונים בלי לייצר טוקן', ועם שלושה צ'יפים שעליהם כתוב '4.54B vs 421M', 'שניהם במעבר קדימה אחד' ו'שניהם Apache-2.0'. הלוגו של OrcaRouter מוטמע בפינה הימנית התחתונה.
Engineering & Research

Intern-Decision-4B לעומת Laya: שני מודלים שמסרבים לכתוב תשובה, שגודלם נבדל פי עשרה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

יש שורה בכרטיס המודל של Intern-Decision-4B שאומרת "Laya — 57.77". כל מי שקרא את התיעוד של Laya עצמה יזהה את משמעות המספר: convaiinnovations/laya הוא מודל החלטות לא-אוטורגרסיבי עם 421 מיליון פרמטרים, ו-57.77 הוא הממוצע שהוא משיג כאשר משתמשים בו במצב zero-shot על בנצ'מרק של מישהו אחר. הכרטיס של עצמו אומר את אותו הדבר בצורה בוטה יותר — נקודות הביקורת הבסיסיות נמצאות מתחת לקו הבסיס של מחלקת הרוב בבנצ'מרק ההחלטות המטיפוסות, ב-0.362 לעומת 0.461. בינתיים internlm/Intern-Decision-4B הוא מודל עם 4.54 מיליארד פרמטרים שנבנה בדיוק לאותה משימה: לקחת מצב וקבוצה של שאלות מטיפוס, להריץ מעבר קדימה אחד, להחזיר הסתברויות מכויילות, ולעולם לא לייצר טוקן. אותו הימור ארכיטקטוני, אותה צורת פלט, אותו רישיון Apache-2.0, פי עשרה פרמטרים — ואחד מהם הוא בסיס לכיוונון עדין בעוד שהאחר טוען שהוא מנוע zero-shot מוגמר.

הם מסכימים על הנחת היסוד, וזה החלק הנדיר.

שני הכרטיסים טוענים את אותה טענה, וכדאי לציין זאת כי רוב התעשייה טוענת את ההיפך. אם הבעיה שלך היא לבחור מבין קבוצה ידועה של תשובות, יצירת פרוזה היא הפעולה הלא נכונה: אתה משלם על טוקנים שאתה זורק, אתה צריך מנתח, ואתה מקבל הסבר שלא ביקשת במקום הסתברות שאתה יכול לסנן לפי סף. הכרטיס של Laya מנסח זאת כך: "הוא אף פעם לא מייצר טקסט, כך שאין מה לנתח ואין מה להזות." הכרטיס של Intern-Decision-4B אומר שה-API שלו "מבצע ניקוד מובנה של מועמדים. הוא לא קורא ל-generate() או דוגם טקסט חופשי."

המנגנונים שונים באופן מלמד. Laya מזינה שאלות עם טיפוסים לראש מסווג ומחזירה תשובות עם טיפוסים והסתברויות מכוילות במעבר קדימה בודד, עם שכבת ניתוב שמזהה כתב ושפה בפחות מחצי מילישנייה לפני המעבר. Intern-Decision-4B ממפה את האפשרויות של כל שאלה לסמלים של טוקן בודד, מרנדרת שלד JSON של עוזר עם מציין מקום אחד לכל שדה, קוראת את הלוגיטים מיד לפני כל מציין מקום, ומבצעת softmax רק על הסמלים המותרים של אותו שדה. זה של Laya הוא בעיית סיווג; זה של InternLM הוא בעיית טוקן הבא, שאותה הוא מסרב לאפשר להפוך לבעיית יצירה.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

פער הגודל, ומה שהוא קונה

בקשה משני מודלים לבצע את אותה משימה עם 421M ו-4.54B פרמטרים מפיקה את התוצאה שהייתם חוזים, ואז הפתעה.

החלק החזוי הוא היכולת בשאלות קשות. Intern-Decision-4B משיג בממוצע 90.02 על פני שבע קבוצות הערכה עם ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065 במדידה של InternLM עצמה, וזמן הריצה הממוצע שלו הוא 44.16 ms לשאילתה על RTX 4090 בודד. הצ'קפוינט הבסיסי באנגלית של Laya הוא דיוק של 0.362 במבחן typed-decisions עם 2,000 החלטות, שאותו הכרטיס שלה עצמה מסמן כנמוך מקו מחלקת הרוב של 0.461 ובקושי מעל קו הבסיס האקראי של 0.318. כאשר אותו צ'קפוינט עובר כוונון עדין על פיצול האימון של אותו בנצ'מרק עצמו, המספר מזנק ל-0.766. הכרטיס של Laya מסיק את המסקנה בעצמו: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות zero-shot."

ההפתעה היא שהמודל הקטן יותר מנצח בשני מימדים באופן מוחלט. מהירות: Laya עונה על 103 עד 332 שאלות בשנייה בעיבוד אצווה על T4 בודד, והכרטיס שלה מציג אותה כמהירה בערך פי שישה עד שמונה מ-TypeSafe Jev, על סמך נתון p50 של 236–276 ms שנמדד באופן בלתי תלוי, שאותו היא מצטטת. פי עשרה פרמטרים לא קונים פי עשרה תפוקה בכיוון ההפוך — 44.16 ms של Intern-Decision-4B הם לכל שאילתה על 4090, בלי שפורסם סיפור batching. ולגבי שפה: Laya מדווחת ש-45 מתוך 51 שפות שנבחנו שמישות ביותר מפי שלושה מניחוש אקראי, עם ציון מנותב של 0.451 ב-MASSIVE intent בשלוש עשרה שפות שאינן אנגלית, לעומת 0.306 עבור נקודת הביקורת שלה לאנגלית בלבד. Intern-Decision-4B אינה מציגה שום טענה רב-לשונית כלל.

לוח תוצאות

• פרמטרים — 4.54B BF16 עבור Intern-Decision-4B, מגדל טקסט בתוספת מגדל ראייה בתוספת מקרן; 421M עבור Laya, מבנה קומפקטי יחיד מסוג מקודד.

• תקרת קלט — 8,192 אסימונים עבור שניהם, ושניהם מסרבים במקום לקטוע; שים לב שה־8,192 של Laya חל על נקודת הביקורת הרב־לשונית, שברירת המחדל שסופקה עמה היא 1,024.

• ריבוי — Intern-Decision-4B מקבל 1 עד 16 שאלות ולכל היותר 62 אפשרויות בכל אחת, ו-62 אינו שרירותי: זה בדיוק מספר הסימנים בני טוקן בודד שחוזה ההסקה שלו יכול להפנות אליהם. Laya מקבלת גם קלטים מסוגים מרובים, אבל כרטיס המודל שלה מתעד קריסה חדה לאחר כ-50 אפשרויות, כאשר שאלה בת 77 תוויות מקבלת רק שלושה או ארבעה טוקנים של תקציב והדיוק צונח ל-0.

• תמונות — עד שמונה עבור Intern-Decision-4B, נספרות במסגרת תקציב של 8,192 טוקנים; אין מסלול מולטימודלי עבור Laya.

• כיול — Intern-Decision-4B מגיע עם טמפרטורה מותאמת של 1.99241824, שנבחרה באמצעות מזעור NLL על פני 1,728 מקרים, ומדווח על ECE של 0.065 במערך הבדיקות שלו; Laya מגיע עם ביטחון יתר, ובכרטיס שלו נכתב שהתאמה מחדש של טמפרטורה אחת לכל סוג שאלה ומספר אפשרויות מזיזה את ה-ECE הממוצע מ-0.466 ל-0.081.

• תנוחת Zero-shot — צ'קפוינט מוגמר המצהיר על ממוצע של 90.02 לעומת בסיס מתועד שמקבל ציון מתחת לקו הרוב.

• השהיה — 44.16 ms בממוצע, 44.03 ms חציוני על RTX 4090 אחד לעומת 103 עד 332 שאלות לשנייה בעיבוד באצווה על T4 אחד.

• שפות — אין טענה שפורסמה נגד היותן של 45 מתוך 51 שפות שמישות כאשר מנותבות.

• רישיון — Apache-2.0, כאשר רישיון Qwen במעלה הזרם נשמר לצד Apache-2.0 המסומן במפורש לשימוש מסחרי.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

שני כרטיסים, שתי תפיסות שונות מאוד של גילוי נאות

כאן ההשוואה מפסיקה להיות דף מפרט והופכת לעניין של שיקול דעת, מפני ששני הספקים מתעדים את הדגמים שלהם בסגנונות מנוגדים.

הכרטיס של Laya מפרסם את כשליו שלו בפירוט. הוא מדווח שנקודת הביקורת האנגלית משיגה דיוק של 0.000 בחמר בביטחון של 0.952 — בטוחה בזמן שהיא טועה, מה שהופך סינון לפי ביטחון לחסר תועלת שם. הוא מדווח שaction.act_probability אינו נושא אות שמיש, ומציג 1.0 כמעט עבור כל קלט עם AUROC של 0.30 על 396 החלטות מתויגות, ומורה לך לסנן לפי ביטחון במקום, שמגיע ל-0.77 על אותם פריטים. הוא מכנה שאלות ניקוד אורדינליות "הפרימיטיב החלש ביותר", תוך ציון 0.372 ב-SST-5. כרטיס שאומר לך אילו מהפלטים של עצמו להתעלם מהם עושה משהו שרוב הספקים לא מנסים.

הכרטיס של Intern-Decision-4B מפרסם טבלה נקייה וללא מקרי כשל. ההסתייגויות שלו אמיתיות ובעלות משקל — חלק הכיול מפורש באופן יוצא דופן שעמודת ה"לפני" בפיילוט שלו אינה מה שכל משתמש היה רואה, ושהתוויות של ערכת הבדיקות לא שימשו לבחירת המודל — חלק ההערכה הוא שבעה ניצחונות וללא הפסדים. הוא כולל שורות עבור חמש מערכות מתחרות ש-InternLM הריצה על ההרנס של InternLM, כולל השורה של Laya שפותחת את המאמר הזה. אלה אינם המספרים של הפרויקטים עצמם, וקריאה שלהם ככאלה תהיה טעות.

אז קו המקורות בהתמודדות הזו הוא א-סימטרי באופן שמעדיף את המודל הקטן יותר: הראיות של Laya כוללות פגמים שהיא תיעדה בעצמה, והראיות של Intern-Decision-4B מעולם לא נתקלו בסט מבחן שלא נבחר בידי מחבריו.

איזו צורת בעיה מתאימה לכל אחד מהם?

בהינתן מצב קצר ומובנה באנגלית, קבוצה סגורה של תשובות וצורך בהסתברות מהימנה, Intern-Decision-4B הוא האובייקט היכולתי יותר על הנייר והיקר יותר בפועל — ארבעה שביבי safetensors, PyTorch 2.9.1 ו-Transformers 5.14.1 תחת Python 3.12, מנוע תושב, ומעטפת שאתה כותב בעצמך אם אתה רוצה נקודת קצה HTTP. בהינתן החלטת ניתוב או גדר בטיחות בנפח גבוה על פני עשרות שפות, כאשר התפוקה היא האילוץ המחייב, Laya הוא הצורה הטובה יותר: pip install laya, מודל של 421M, וכרטיס שכבר אמר לך לבצע כוונון עדין לפני שתסמוך על ההסתברויות.

הדבר היחיד ששני הכרטיסים מסכימים עליו הוא שאין לתת אמון באף אחד מהמודלים במצב zero-shot בלי לבדוק כיול על הנתונים שלך — Laya מפני שנקודות הביקורת הבסיסיות שלה קרובות לרמת ניחוש בסוגי החלטות לא מוכרים, ו-Intern-Decision-4B מפני שה-ECE של 0.065 שלו מגיע מחבילת בדיקות שהמחברים שלה עצמם הרכיבו.

מה נתב משנה ומה לא משנה כאן

אף אחד מהמודלים האלה אינו בקטלוג של OrcaRouter, וכדאי לומר זאת בפשטות ולא לרמוז אחרת: דפי המודלים שלנו מחזירים 404 הן עבור Intern-Decision-4B והן עבור Laya, ואף אחד מהם אינו נתיב שאפשר לקרוא לו היום. מה שזה אומר לשני הפרויקטים אינו זהה. הרישיון Apache-2.0 של Laya עם תג שימוש מסחרי אומר שהמכשול הוא אך ורק אריזה — מדובר בחבילת Python מקומית עם טביעת רגל קטנה, מסוג הדברים שאפשר בהחלט לשרת. המכשול של Intern-Decision-4B הוא גם אריזה, אבל משקולות ה-BF16 בגודל 4.54B ותקרת הסירוב של 8,192 טוקנים הופכים אותו לרכיב ולא לשירות.

המקום שבו OrcaRouter אכן עוזר הוא בצדה השני של ההחלטה. אם מתברר שבעיית ההחלטה המובנית שלכם אכן זקוקה לשלב הסקה, המודלים הכלליים שמסוגלים לכך נמצאים ב-מפתח אחד על פני יותר מ-200 מודלים, כאשר מחיר המחירון של הספק מועבר במרווח של 0% ו-מעבר אוטומטי בין ספקים — כך שהמודל שאתם מצמידים לו מדרג נמצא במרחק נקודת קצה אחת, ולא חוזה שני.

הגרסה הקצרה

שני הפרויקטים האלה הגיעו לאותה מסקנה לגבי האופן שבו יש לקבל החלטות, ואחר כך נחלקו כמעט על כל דבר אחר. Laya מהמר ש-421M פרמטרים, ניתוב שפתי הדוק וכנות חסרת רחמים כלפי הפגמים של עצמו יוצרים בסיס מהיר שמתמחים על גביו. Intern-Decision-4B מהמר שפי עשרה פרמטרים וחוזה ניקוד חד-טוקני מהונדס בקפידה יוצרים מנוע zero-shot מוגמר. הניסוי המכריע הוא כזה שאף אחד מהשניים לא הריץ בפומבי: קחו קבוצה של החלטות עם תשובות ניתנות לחישוב, הריצו את שניהם, ובדקו אם ההסתברויות אומרות משהו. Laya פרסם את הניסוי הזה באופן חלקי והראה לכם היכן הוא נכשל. Intern-Decision-4B לא פרסם אותו בכלל.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.