
Intern-Decision-4B לעומת Laya: שני מודלים שמסרבים לכתוב תשובה, שגודלם נבדל פי עשרה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
יש שורה בכרטיס המודל של Intern-Decision-4B שאומרת "Laya — 57.77". כל מי שקרא את התיעוד של Laya עצמה יזהה את משמעות המספר: convaiinnovations/laya הוא מודל החלטות לא-אוטורגרסיבי עם 421 מיליון פרמטרים, ו-57.77 הוא הממוצע שהוא משיג כאשר משתמשים בו במצב zero-shot על בנצ'מרק של מישהו אחר. הכרטיס של עצמו אומר את אותו הדבר בצורה בוטה יותר — נקודות הביקורת הבסיסיות נמצאות מתחת לקו הבסיס של מחלקת הרוב בבנצ'מרק ההחלטות המטיפוסות, ב-0.362 לעומת 0.461. בינתיים internlm/Intern-Decision-4B הוא מודל עם 4.54 מיליארד פרמטרים שנבנה בדיוק לאותה משימה: לקחת מצב וקבוצה של שאלות מטיפוס, להריץ מעבר קדימה אחד, להחזיר הסתברויות מכויילות, ולעולם לא לייצר טוקן. אותו הימור ארכיטקטוני, אותה צורת פלט, אותו רישיון Apache-2.0, פי עשרה פרמטרים — ואחד מהם הוא בסיס לכיוונון עדין בעוד שהאחר טוען שהוא מנוע zero-shot מוגמר.
הם מסכימים על הנחת היסוד, וזה החלק הנדיר.
שני הכרטיסים טוענים את אותה טענה, וכדאי לציין זאת כי רוב התעשייה טוענת את ההיפך. אם הבעיה שלך היא לבחור מבין קבוצה ידועה של תשובות, יצירת פרוזה היא הפעולה הלא נכונה: אתה משלם על טוקנים שאתה זורק, אתה צריך מנתח, ואתה מקבל הסבר שלא ביקשת במקום הסתברות שאתה יכול לסנן לפי סף. הכרטיס של Laya מנסח זאת כך: "הוא אף פעם לא מייצר טקסט, כך שאין מה לנתח ואין מה להזות." הכרטיס של Intern-Decision-4B אומר שה-API שלו "מבצע ניקוד מובנה של מועמדים. הוא לא קורא ל-generate() או דוגם טקסט חופשי."
המנגנונים שונים באופן מלמד. Laya מזינה שאלות עם טיפוסים לראש מסווג ומחזירה תשובות עם טיפוסים והסתברויות מכוילות במעבר קדימה בודד, עם שכבת ניתוב שמזהה כתב ושפה בפחות מחצי מילישנייה לפני המעבר. Intern-Decision-4B ממפה את האפשרויות של כל שאלה לסמלים של טוקן בודד, מרנדרת שלד JSON של עוזר עם מציין מקום אחד לכל שדה, קוראת את הלוגיטים מיד לפני כל מציין מקום, ומבצעת softmax רק על הסמלים המותרים של אותו שדה. זה של Laya הוא בעיית סיווג; זה של InternLM הוא בעיית טוקן הבא, שאותה הוא מסרב לאפשר להפוך לבעיית יצירה.

פער הגודל, ומה שהוא קונה
בקשה משני מודלים לבצע את אותה משימה עם 421M ו-4.54B פרמטרים מפיקה את התוצאה שהייתם חוזים, ואז הפתעה.
החלק החזוי הוא היכולת בשאלות קשות. Intern-Decision-4B משיג בממוצע 90.02 על פני שבע קבוצות הערכה עם ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065 במדידה של InternLM עצמה, וזמן הריצה הממוצע שלו הוא 44.16 ms לשאילתה על RTX 4090 בודד. הצ'קפוינט הבסיסי באנגלית של Laya הוא דיוק של 0.362 במבחן typed-decisions עם 2,000 החלטות, שאותו הכרטיס שלה עצמה מסמן כנמוך מקו מחלקת הרוב של 0.461 ובקושי מעל קו הבסיס האקראי של 0.318. כאשר אותו צ'קפוינט עובר כוונון עדין על פיצול האימון של אותו בנצ'מרק עצמו, המספר מזנק ל-0.766. הכרטיס של Laya מסיק את המסקנה בעצמו: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות zero-shot."
ההפתעה היא שהמודל הקטן יותר מנצח בשני מימדים באופן מוחלט. מהירות: Laya עונה על 103 עד 332 שאלות בשנייה בעיבוד אצווה על T4 בודד, והכרטיס שלה מציג אותה כמהירה בערך פי שישה עד שמונה מ-TypeSafe Jev, על סמך נתון p50 של 236–276 ms שנמדד באופן בלתי תלוי, שאותו היא מצטטת. פי עשרה פרמטרים לא קונים פי עשרה תפוקה בכיוון ההפוך — 44.16 ms של Intern-Decision-4B הם לכל שאילתה על 4090, בלי שפורסם סיפור batching. ולגבי שפה: Laya מדווחת ש-45 מתוך 51 שפות שנבחנו שמישות ביותר מפי שלושה מניחוש אקראי, עם ציון מנותב של 0.451 ב-MASSIVE intent בשלוש עשרה שפות שאינן אנגלית, לעומת 0.306 עבור נקודת הביקורת שלה לאנגלית בלבד. Intern-Decision-4B אינה מציגה שום טענה רב-לשונית כלל.
לוח תוצאות
• פרמטרים — 4.54B BF16 עבור Intern-Decision-4B, מגדל טקסט בתוספת מגדל ראייה בתוספת מקרן; 421M עבור Laya, מבנה קומפקטי יחיד מסוג מקודד.
• תקרת קלט — 8,192 אסימונים עבור שניהם, ושניהם מסרבים במקום לקטוע; שים לב שה־8,192 של Laya חל על נקודת הביקורת הרב־לשונית, שברירת המחדל שסופקה עמה היא 1,024.
• ריבוי — Intern-Decision-4B מקבל 1 עד 16 שאלות ולכל היותר 62 אפשרויות בכל אחת, ו-62 אינו שרירותי: זה בדיוק מספר הסימנים בני טוקן בודד שחוזה ההסקה שלו יכול להפנות אליהם. Laya מקבלת גם קלטים מסוגים מרובים, אבל כרטיס המודל שלה מתעד קריסה חדה לאחר כ-50 אפשרויות, כאשר שאלה בת 77 תוויות מקבלת רק שלושה או ארבעה טוקנים של תקציב והדיוק צונח ל-0.
• תמונות — עד שמונה עבור Intern-Decision-4B, נספרות במסגרת תקציב של 8,192 טוקנים; אין מסלול מולטימודלי עבור Laya.
• כיול — Intern-Decision-4B מגיע עם טמפרטורה מותאמת של 1.99241824, שנבחרה באמצעות מזעור NLL על פני 1,728 מקרים, ומדווח על ECE של 0.065 במערך הבדיקות שלו; Laya מגיע עם ביטחון יתר, ובכרטיס שלו נכתב שהתאמה מחדש של טמפרטורה אחת לכל סוג שאלה ומספר אפשרויות מזיזה את ה-ECE הממוצע מ-0.466 ל-0.081.
• תנוחת Zero-shot — צ'קפוינט מוגמר המצהיר על ממוצע של 90.02 לעומת בסיס מתועד שמקבל ציון מתחת לקו הרוב.
• השהיה — 44.16 ms בממוצע, 44.03 ms חציוני על RTX 4090 אחד לעומת 103 עד 332 שאלות לשנייה בעיבוד באצווה על T4 אחד.
• שפות — אין טענה שפורסמה נגד היותן של 45 מתוך 51 שפות שמישות כאשר מנותבות.
• רישיון — Apache-2.0, כאשר רישיון Qwen במעלה הזרם נשמר לצד Apache-2.0 המסומן במפורש לשימוש מסחרי.

שני כרטיסים, שתי תפיסות שונות מאוד של גילוי נאות
כאן ההשוואה מפסיקה להיות דף מפרט והופכת לעניין של שיקול דעת, מפני ששני הספקים מתעדים את הדגמים שלהם בסגנונות מנוגדים.
הכרטיס של Laya מפרסם את כשליו שלו בפירוט. הוא מדווח שנקודת הביקורת האנגלית משיגה דיוק של 0.000 בחמר בביטחון של 0.952 — בטוחה בזמן שהיא טועה, מה שהופך סינון לפי ביטחון לחסר תועלת שם. הוא מדווח שaction.act_probability אינו נושא אות שמיש, ומציג 1.0 כמעט עבור כל קלט עם AUROC של 0.30 על 396 החלטות מתויגות, ומורה לך לסנן לפי ביטחון במקום, שמגיע ל-0.77 על אותם פריטים. הוא מכנה שאלות ניקוד אורדינליות "הפרימיטיב החלש ביותר", תוך ציון 0.372 ב-SST-5. כרטיס שאומר לך אילו מהפלטים של עצמו להתעלם מהם עושה משהו שרוב הספקים לא מנסים.
הכרטיס של Intern-Decision-4B מפרסם טבלה נקייה וללא מקרי כשל. ההסתייגויות שלו אמיתיות ובעלות משקל — חלק הכיול מפורש באופן יוצא דופן שעמודת ה"לפני" בפיילוט שלו אינה מה שכל משתמש היה רואה, ושהתוויות של ערכת הבדיקות לא שימשו לבחירת המודל — חלק ההערכה הוא שבעה ניצחונות וללא הפסדים. הוא כולל שורות עבור חמש מערכות מתחרות ש-InternLM הריצה על ההרנס של InternLM, כולל השורה של Laya שפותחת את המאמר הזה. אלה אינם המספרים של הפרויקטים עצמם, וקריאה שלהם ככאלה תהיה טעות.
אז קו המקורות בהתמודדות הזו הוא א-סימטרי באופן שמעדיף את המודל הקטן יותר: הראיות של Laya כוללות פגמים שהיא תיעדה בעצמה, והראיות של Intern-Decision-4B מעולם לא נתקלו בסט מבחן שלא נבחר בידי מחבריו.
איזו צורת בעיה מתאימה לכל אחד מהם?
בהינתן מצב קצר ומובנה באנגלית, קבוצה סגורה של תשובות וצורך בהסתברות מהימנה, Intern-Decision-4B הוא האובייקט היכולתי יותר על הנייר והיקר יותר בפועל — ארבעה שביבי safetensors, PyTorch 2.9.1 ו-Transformers 5.14.1 תחת Python 3.12, מנוע תושב, ומעטפת שאתה כותב בעצמך אם אתה רוצה נקודת קצה HTTP. בהינתן החלטת ניתוב או גדר בטיחות בנפח גבוה על פני עשרות שפות, כאשר התפוקה היא האילוץ המחייב, Laya הוא הצורה הטובה יותר: pip install laya, מודל של 421M, וכרטיס שכבר אמר לך לבצע כוונון עדין לפני שתסמוך על ההסתברויות.
הדבר היחיד ששני הכרטיסים מסכימים עליו הוא שאין לתת אמון באף אחד מהמודלים במצב zero-shot בלי לבדוק כיול על הנתונים שלך — Laya מפני שנקודות הביקורת הבסיסיות שלה קרובות לרמת ניחוש בסוגי החלטות לא מוכרים, ו-Intern-Decision-4B מפני שה-ECE של 0.065 שלו מגיע מחבילת בדיקות שהמחברים שלה עצמם הרכיבו.
מה נתב משנה ומה לא משנה כאן
אף אחד מהמודלים האלה אינו בקטלוג של OrcaRouter, וכדאי לומר זאת בפשטות ולא לרמוז אחרת: דפי המודלים שלנו מחזירים 404 הן עבור Intern-Decision-4B והן עבור Laya, ואף אחד מהם אינו נתיב שאפשר לקרוא לו היום. מה שזה אומר לשני הפרויקטים אינו זהה. הרישיון Apache-2.0 של Laya עם תג שימוש מסחרי אומר שהמכשול הוא אך ורק אריזה — מדובר בחבילת Python מקומית עם טביעת רגל קטנה, מסוג הדברים שאפשר בהחלט לשרת. המכשול של Intern-Decision-4B הוא גם אריזה, אבל משקולות ה-BF16 בגודל 4.54B ותקרת הסירוב של 8,192 טוקנים הופכים אותו לרכיב ולא לשירות.
המקום שבו OrcaRouter אכן עוזר הוא בצדה השני של ההחלטה. אם מתברר שבעיית ההחלטה המובנית שלכם אכן זקוקה לשלב הסקה, המודלים הכלליים שמסוגלים לכך נמצאים ב-מפתח אחד על פני יותר מ-200 מודלים, כאשר מחיר המחירון של הספק מועבר במרווח של 0% ו-מעבר אוטומטי בין ספקים — כך שהמודל שאתם מצמידים לו מדרג נמצא במרחק נקודת קצה אחת, ולא חוזה שני.
הגרסה הקצרה
שני הפרויקטים האלה הגיעו לאותה מסקנה לגבי האופן שבו יש לקבל החלטות, ואחר כך נחלקו כמעט על כל דבר אחר. Laya מהמר ש-421M פרמטרים, ניתוב שפתי הדוק וכנות חסרת רחמים כלפי הפגמים של עצמו יוצרים בסיס מהיר שמתמחים על גביו. Intern-Decision-4B מהמר שפי עשרה פרמטרים וחוזה ניקוד חד-טוקני מהונדס בקפידה יוצרים מנוע zero-shot מוגמר. הניסוי המכריע הוא כזה שאף אחד מהשניים לא הריץ בפומבי: קחו קבוצה של החלטות עם תשובות ניתנות לחישוב, הריצו את שניהם, ובדקו אם ההסתברויות אומרות משהו. Laya פרסם את הניסוי הזה באופן חלקי והראה לכם היכן הוא נכשל. Intern-Decision-4B לא פרסם אותו בכלל.

