כרטיס כותרת שנוצר עם הכיתוב 'Intern-Decision-2B מול Laya', עם כתובית '2.21B מול 421M, אף אחד מהם לא כותב טוקן', עם התגים 'אחד מספק חבילת pip' ו'אחד מספק ערכת שחזור', כאשר הלוגו של OrcaRouter משולב בפינה.
Guides & Insights

Intern-Decision-2B מול Laya: 2.2 מיליארד פרמטרים לעומת 421 מיליון, ושניהם מסרבים לכתוב תשובה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

internlm/Intern-Decision-2B וconvaiinnovations/laya הם שני המודלים הדומים ביותר בנישת מודלי ההחלטה הקטנים, והעובדה השימושית ביותר בהשוואה היא שהם מגיעים לשם בדרכים הפוכות. הצ'ק פוינט של InternLM עם 2,213,241,664 פרמטרים קורא את הלוגיט במיקום קבוע לפני פלייסהולדר ולעולם אינו קורא ל-generate(). הצ'ק פוינט של Convai עם 421 מיליון פרמטרים מזין שאלות מוקלדות לראש החלטה על גבי עמוד שדרה ModernBERT-large ומחזיר הסתברויות מכויילות במעבר קדימה אחד. אף אחד מהם לא כותב טוקן, שניהם מבטיחים הסתברויות, שניהם מגיעים למקסימום של קרוב לשמונת אלפים טוקנים של קלט, והקטן מביניהם קטן פי חמישה ופופולרי בערך פי אלף. מה שמפריד ביניהם הוא לא היכולת אלא האריזה, ופער האריזה קובע את הרכישה עבור רוב הקוראים.

Intern-Decision-2B הופיע ב-Hugging Face בשעה 05:36 UTC ב-26 בספטמבר 2026, האמצעי מבין שלושה גדלים ש-InternLM העלתה בתוך ארבעים שניות ללא הכרזה, לאחר כיוונון עדין מ-Qwen/Qwen3.5-2B תחת Apache-2.0. Laya הועלה לראשונה ב-18 בספטמבר 2026 ומאז צבר 3,700 ומשהו לייקים, חבילת pip, שרת HTTP תואם Jev, אינטגרציות ONNX ו-LangChain ומחברת כיוונון עדין. הניגוד בבגרות הוא הכתבה.

ההנחה המשותפת להם, והמנגנונים הנבדלים

שני הכרטיסים טוענים שאם הבעיה שלך היא לבחור מבין תשובות ידועות, יצירת פרוזה היא הפעולה הלא נכונה. הניסוח של Laya הוא "היא לעולם אינה מייצרת טקסט, כך שאין מה לפרסר ואין מה להזות." הניסוח של Intern-Decision-2B הוא שה-API שלה "מבצע ניקוד מובנה של מועמדים. הוא אינו קורא ל-generate() ואינו דוגם טקסט חופשי."

המנגנונים הם המקום שבו הם נפרדים.

Laya הוא מסווג. מקודד ModernBERT-large (395M, דו-כיווני, מכוונן במלואו) מזין ראש החלטה שאומן מאפס — שתי שכבות טרנספורמר, מדרג סמני אופציה, וראש פעולה/הסלמה — עבור סה"כ 421M. אופציות חולקות תקציב אסימונים קבוע (head_max_len, 192 אסימונים בנקודת הביקורת האנגלית, 256 ברב-לשוני), והנתב מזהה כתב ומסיק שפה תוך פחות מחצי אלפית שנייה לפני המעבר.

Intern-Decision-2B הוא מודל של הטוקן הבא שנאסר עליו להפוך למחולל. הוא ממפה את האפשרויות של כל שאלה לסמלים בני טוקן בודד A–Z, a–z, 0–9; מרנדר שלד JSON מלא של עוזר עם מציין מקום <decision> אחד לכל שדה; מריץ מעבר קדימה סיבתי אחד; קורא לוגיטים מיד לפני כל מציין מקום; מפעיל softmax על הסמלים החוקיים של אותו שדה; ומיישם טמפרטורה מותאמת של 2.100509348278. מתחת לכך נמצא Qwen3_5ForConditionalGeneration סטנדרטי — 24 שכבות, שלוש שכבות קשב לינארי לכל שכבת קשב מלא, שכבת חיזוי רב-טוקנים נשמרת, תקרת הטמעות של 262,144 פוזיציות — בתוספת מגדל ראייה ומקרן.

ההשלכה המעשית של ההבדל היא אפשרות. התקציב לכל אפשרות של Lola קורס במרחבי תוויות רחבים; הכרטיס שלה עצמו מתעד שאלה עם 77 תוויות שמקבלת ציון 0.425 לעומת 0.870 של TypeSafe Jev באותה משימה, כי כל 77 אפשרויות מקבלות כשלושה או ארבעה טוקנים כל אחת. Intern-Decision-2B מקבל עד 62 אפשרויות לשאלה ועד שש עשרה שאלות, ו-62 אינו העדפה אלא המספר המדויק של סמלים בני טוקן בודד שהחוזה שלו יכול לטפל בהם. אף אחד מהם אינו נוח מעבר לכמה עשרות אפשרויות; צורות ההבדל שונות.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

לוח תוצאות

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת מגדל חזותי ומקרן, כ-4.46 GB בדיסק; Laya 421M, קובץ safetensors בודד בגודל 842 MB, עם צ'קפוינט רב-לשוני נפרד בגודל 644 MB.

• תקרת קלט — 8,192 אסימונים עבור שניהם, ושניהם מסרבים במקום לקטוע; שים לב שה־8,192 של Laya חל על laya-multilingual ומחייב max_len=8192, מכיוון שברירת המחדל המסופקת היא 1,024.

• תמונות — עד שמונה עבור Intern-Decision-2B, הנספרות כנגד אותו תקציב טוקנים; אין מסלול מולטימודלי עבור Laya.

• מהירות — 33.28 מילי־שניות בממוצע, 33.15 מילי־שניות P50, 33.55 מילי־שניות P95 לבקשה על RTX 4090 אחד עבור Intern-Decision-2B; Laya מדווחת על כ־33 מילי־שניות לבקשה ועל 103–332 שאלות בשנייה בעיבוד באצווה על T4 בודד.

• שפות — Intern-Decision-2B אינו טוען כלל לרב-לשוניות; Laya מנתבת על פני יותר מ-100 שפות, ומדווחת כי 45 מתוך 51 שפות שנבחנו שמישות ביותר מפי שלושה מניחוש אקראי, ו-0.451 ב-MASSIVE intent על פני שלוש עשרה שפות שאינן אנגלית, לעומת 0.306 עבור הצ'קפוינט האנגלי-בלבד שלה.

• דיוק Zero-shot — Intern-Decision-2B מציג 84.68 בממוצע על פני שבע סוויטות ספקים עם Brier 0.437 ו-ECE 0.100, שכולם לא שוחזרו; הצ'קפוינט הבסיסי באנגלית של Laya משיג 0.362 במבחן typed-decisions של 2,000 החלטות, שאותו הכרטיס שלה עצמו מסמן כמתחת לקו 0.461 של מחלקת הרוב.

• אריזה — נקודת ביקורת, קובץ inference.py ומאגר GitHub ציבורי שזה עתה נחשף עם קוד אימון והערכה, לעומת pip install laya, שרת HTTP תואם Jev, מסלולים מהירים של ONNX Runtime ו-TileLang, אינטגרציות MCP ו-LangChain, ומחברת כוונון עדין שרצה על GPUs בשכבת חינם.

ההשוואה ההוגנת ביותר אינה זו שדף המפרט יוצר

להציב את 84.68 לצד 0.362 גובל בחוסר יושר, וכדאי לומר מדוע במקום להשאיר את המספרים כפי שהם.

ה-0.362 של Laya הוא צ'קפוינט בסיס שנמדד ב-zero-shot על בנצ'מרק שהיא לא כווננה עבורו. הכרטיס שלה עצמו מנסח את המסקנה במפורש: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות zero-shot." כשהיא מכווננת על מחיצת האימון של אותו בנצ'מרק, היא מגיעה ל-0.766, עוברת את תקרת המורה של 0.735 ומנצחת את ה-0.727 המפורסם של TypeSafe Jev על אותן החלטות. ה-84.68 של Intern-Decision-2B, לעומת זאת, הוא ממוצע ספק על שבע חבילות בדיקה שערכות הבדיקה שלהן אינן אלו ש-Laya מצטטת, והוא הופק על ידי המעבדה שבנתה את המודל, בלי שאף צד שלישי הריץ אותו — הצ'קפוינט מציג לייק אחד ואפס הורדות. השוואה בין תוצאה מכווננת לתוצאת zero-shot, או בין ממוצע ספק ללוח עצמאי, אינה השוואה. אלו שתי מדידות שונות שחולקות אותו גופן.

מה שבאמת בר השוואה: שניהם קטנים, שניהם זולים להרצה, ושניהם לא ניתנים לכוונון עדין לתחום שלך. המאגר ש-InternLM פרסמה הבוקר הופך את החלק האחרון לקל באופן משמעותי מכפי שהיה אתמול, מכיוון שהוא מספק את מפעיל האימון, את מטרת ה-masked-next-token, חבילה מאומתת ב-hash של 10,751 שורות בדיקה בשבע סוויטות, ואת סקריפטי התאמת הטמפרטורה וה-replay. מעבדה שמספקת מחולל כיול דטרמיניסטי ומצהירה ש-replay משנה אפס החלטות מזמינה בדיוק את סוג ההתאמה שכרטיס של Laya ממליץ עליו.

איך היית בעצם קורא לאחד מהם

אף אחד מהמודלים אינו ב-OrcaRouter. עמוד המודל של OrcaRouter עבור Intern-Decision-2B מחזיר 404 וגם אין נתיב Laya; אין כאן שום טענת זמינות. Intern-Decision-2B משמעו הורדת ה-checkpoint והרצת המנוע המצורף שלו על ה-GPU שלך. Laya משמעו pip install laya ואם אתה רוצה את המשטח התואם ל-Jev, laya-serve על POST /v1/systemone.

השאלה שבדמות Orchestrator שמתחת לכך היא אם אתה רוצה משטח תפעולי שני עבור סוקר. Laya תוכנה להיות מוטמעת — אותו מבנה בקשה ותגובה כמו TypeSafe Jev, כך שלקוח קיים משנה כתובת בסיס ולא דבר אחר. Intern-Decision-2B תוכנן להיות משוחזר, וכיום מדובר בערך ביום של עבודת סביבה לפני שההחלטה הראשונה חוזרת. אם ההחלטה בקבוצה סגורה שאתה מקבל קרובה בצורתה לאחת מאלה, החלופה המתארחת ששתי הכרטיסים משווים מולה היא TypeSafe Jev 1.13, שכן יש לה נתיב: 0.042$ למיליון אסימוני קלט, חלון הקשר של 65K וזמן P50 עד לאסימון הראשון של 178 מ"ש, נגישה באותו מפתח כמו יותר מ-200 מודלים אחרים עם מחיר מחירון של הספק המועבר בתוספת של 0%.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

איפה כל אחד מנצח

Laya מנצחת בכל היבט תפעולי. חבילת pip מול הורדת צ'קפוינט. ראוטר ביותר ממאה שפות מול היעדר הצהרה על רב־לשוניות. תפוקה באצ'ים הנמדדת במאות שאלות בשנייה מול נתון לכל בקשה בלי שום סיפור באצ'ינג. שנתיים של כוח אקוסיסטמי — ONNX, TileLang, LangChain, MCP — מול מאגר ציבורי כבר שעתיים.

Intern-Decision-2B מנצח בשלושה דברים צרים. הוא קולט תמונות, מה ש-Laya לא עושה. אין עליו חוב כוונון עדין: הנתון 84.68 שלו הוא הצהרת ספק בלמידת אפס-שוט, בעוד שהנתון המרכזי 0.766 של Laya שייך לצ'קפוינט שעבר כוונון עדין על פיצול האימון של המבחן עצמו. והוא מתועד עם ערכת שחזור — חבילת הערכה ניתנת לאימות ומערך אימון ציבורי — ששווה יותר משורת טבלת מובילים למי שצריך להצדיק את המודל בפני מישהו אחר.

התיקו הוא נקודת המוצא. שניהם מסרבים לייצר, שניהם נותנים לך הסתברויות שאפשר להחיל עליהן סף, ושניהם מתחת לאורך הקלט שבו נמצאים רוב המסמכים האמיתיים. אם המצב שלך הוא פנייה, דוא״ל או טופס, כל אחד מהם יעשה את העבודה, ו-Laya תביא אותך לשם מהר יותר. אם למצב שלך מצורף צילום מסך, או שהארגון שלך צריך שהשחזור יהיה ניתן לביקורת, ה-checkpoint האמצעי של InternLM הוא זה שעונה על ההתנגדות הספציפית הזו — ולפי המספרים של InternLM עצמו הוא הכי פחות מכויל מבין שלושת אחיו, ב-ECE 0.100 לעומת 0.066 ו-0.065, אז כיילו טמפרטורה משלכם לפני שאתם סומכים על ציון הביטחון שהוא מדווח.