
Intern-Decision-2B מול Laya: 2.2 מיליארד פרמטרים לעומת 421 מיליון, ושניהם מסרבים לכתוב תשובה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 584 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
internlm/Intern-Decision-2B וconvaiinnovations/laya הם שני המודלים הדומים ביותר בנישת מודלי ההחלטה הקטנים, והעובדה השימושית ביותר בהשוואה היא שהם מגיעים לשם בדרכים הפוכות. הצ'ק פוינט של InternLM עם 2,213,241,664 פרמטרים קורא את הלוגיט במיקום קבוע לפני פלייסהולדר ולעולם אינו קורא ל-generate(). הצ'ק פוינט של Convai עם 421 מיליון פרמטרים מזין שאלות מוקלדות לראש החלטה על גבי עמוד שדרה ModernBERT-large ומחזיר הסתברויות מכויילות במעבר קדימה אחד. אף אחד מהם לא כותב טוקן, שניהם מבטיחים הסתברויות, שניהם מגיעים למקסימום של קרוב לשמונת אלפים טוקנים של קלט, והקטן מביניהם קטן פי חמישה ופופולרי בערך פי אלף. מה שמפריד ביניהם הוא לא היכולת אלא האריזה, ופער האריזה קובע את הרכישה עבור רוב הקוראים.
Intern-Decision-2B הופיע ב-Hugging Face בשעה 05:36 UTC ב-26 בספטמבר 2026, האמצעי מבין שלושה גדלים ש-InternLM העלתה בתוך ארבעים שניות ללא הכרזה, לאחר כיוונון עדין מ-Qwen/Qwen3.5-2B תחת Apache-2.0. Laya הועלה לראשונה ב-18 בספטמבר 2026 ומאז צבר 3,700 ומשהו לייקים, חבילת pip, שרת HTTP תואם Jev, אינטגרציות ONNX ו-LangChain ומחברת כיוונון עדין. הניגוד בבגרות הוא הכתבה.
ההנחה המשותפת להם, והמנגנונים הנבדלים
שני הכרטיסים טוענים שאם הבעיה שלך היא לבחור מבין תשובות ידועות, יצירת פרוזה היא הפעולה הלא נכונה. הניסוח של Laya הוא "היא לעולם אינה מייצרת טקסט, כך שאין מה לפרסר ואין מה להזות." הניסוח של Intern-Decision-2B הוא שה-API שלה "מבצע ניקוד מובנה של מועמדים. הוא אינו קורא ל-generate() ואינו דוגם טקסט חופשי."
המנגנונים הם המקום שבו הם נפרדים.
Laya הוא מסווג. מקודד ModernBERT-large (395M, דו-כיווני, מכוונן במלואו) מזין ראש החלטה שאומן מאפס — שתי שכבות טרנספורמר, מדרג סמני אופציה, וראש פעולה/הסלמה — עבור סה"כ 421M. אופציות חולקות תקציב אסימונים קבוע (head_max_len, 192 אסימונים בנקודת הביקורת האנגלית, 256 ברב-לשוני), והנתב מזהה כתב ומסיק שפה תוך פחות מחצי אלפית שנייה לפני המעבר.
Intern-Decision-2B הוא מודל של הטוקן הבא שנאסר עליו להפוך למחולל. הוא ממפה את האפשרויות של כל שאלה לסמלים בני טוקן בודד A–Z, a–z, 0–9; מרנדר שלד JSON מלא של עוזר עם מציין מקום <decision> אחד לכל שדה; מריץ מעבר קדימה סיבתי אחד; קורא לוגיטים מיד לפני כל מציין מקום; מפעיל softmax על הסמלים החוקיים של אותו שדה; ומיישם טמפרטורה מותאמת של 2.100509348278. מתחת לכך נמצא Qwen3_5ForConditionalGeneration סטנדרטי — 24 שכבות, שלוש שכבות קשב לינארי לכל שכבת קשב מלא, שכבת חיזוי רב-טוקנים נשמרת, תקרת הטמעות של 262,144 פוזיציות — בתוספת מגדל ראייה ומקרן.
ההשלכה המעשית של ההבדל היא אפשרות. התקציב לכל אפשרות של Lola קורס במרחבי תוויות רחבים; הכרטיס שלה עצמו מתעד שאלה עם 77 תוויות שמקבלת ציון 0.425 לעומת 0.870 של TypeSafe Jev באותה משימה, כי כל 77 אפשרויות מקבלות כשלושה או ארבעה טוקנים כל אחת. Intern-Decision-2B מקבל עד 62 אפשרויות לשאלה ועד שש עשרה שאלות, ו-62 אינו העדפה אלא המספר המדויק של סמלים בני טוקן בודד שהחוזה שלו יכול לטפל בהם. אף אחד מהם אינו נוח מעבר לכמה עשרות אפשרויות; צורות ההבדל שונות.

לוח תוצאות

• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת מגדל חזותי ומקרן, כ-4.46 GB בדיסק; Laya 421M, קובץ safetensors בודד בגודל 842 MB, עם צ'קפוינט רב-לשוני נפרד בגודל 644 MB.
• תקרת קלט — 8,192 אסימונים עבור שניהם, ושניהם מסרבים במקום לקטוע; שים לב שה־8,192 של Laya חל על laya-multilingual ומחייב max_len=8192, מכיוון שברירת המחדל המסופקת היא 1,024.
• תמונות — עד שמונה עבור Intern-Decision-2B, הנספרות כנגד אותו תקציב טוקנים; אין מסלול מולטימודלי עבור Laya.
• מהירות — 33.28 מילי־שניות בממוצע, 33.15 מילי־שניות P50, 33.55 מילי־שניות P95 לבקשה על RTX 4090 אחד עבור Intern-Decision-2B; Laya מדווחת על כ־33 מילי־שניות לבקשה ועל 103–332 שאלות בשנייה בעיבוד באצווה על T4 בודד.
• שפות — Intern-Decision-2B אינו טוען כלל לרב-לשוניות; Laya מנתבת על פני יותר מ-100 שפות, ומדווחת כי 45 מתוך 51 שפות שנבחנו שמישות ביותר מפי שלושה מניחוש אקראי, ו-0.451 ב-MASSIVE intent על פני שלוש עשרה שפות שאינן אנגלית, לעומת 0.306 עבור הצ'קפוינט האנגלי-בלבד שלה.
• דיוק Zero-shot — Intern-Decision-2B מציג 84.68 בממוצע על פני שבע סוויטות ספקים עם Brier 0.437 ו-ECE 0.100, שכולם לא שוחזרו; הצ'קפוינט הבסיסי באנגלית של Laya משיג 0.362 במבחן typed-decisions של 2,000 החלטות, שאותו הכרטיס שלה עצמו מסמן כמתחת לקו 0.461 של מחלקת הרוב.
• אריזה — נקודת ביקורת, קובץ inference.py ומאגר GitHub ציבורי שזה עתה נחשף עם קוד אימון והערכה, לעומת pip install laya, שרת HTTP תואם Jev, מסלולים מהירים של ONNX Runtime ו-TileLang, אינטגרציות MCP ו-LangChain, ומחברת כוונון עדין שרצה על GPUs בשכבת חינם.
ההשוואה ההוגנת ביותר אינה זו שדף המפרט יוצר
להציב את 84.68 לצד 0.362 גובל בחוסר יושר, וכדאי לומר מדוע במקום להשאיר את המספרים כפי שהם.
ה-0.362 של Laya הוא צ'קפוינט בסיס שנמדד ב-zero-shot על בנצ'מרק שהיא לא כווננה עבורו. הכרטיס שלה עצמו מנסח את המסקנה במפורש: "Laya היא בסיס מהיר להתמחות, לא מנוע החלטות zero-shot." כשהיא מכווננת על מחיצת האימון של אותו בנצ'מרק, היא מגיעה ל-0.766, עוברת את תקרת המורה של 0.735 ומנצחת את ה-0.727 המפורסם של TypeSafe Jev על אותן החלטות. ה-84.68 של Intern-Decision-2B, לעומת זאת, הוא ממוצע ספק על שבע חבילות בדיקה שערכות הבדיקה שלהן אינן אלו ש-Laya מצטטת, והוא הופק על ידי המעבדה שבנתה את המודל, בלי שאף צד שלישי הריץ אותו — הצ'קפוינט מציג לייק אחד ואפס הורדות. השוואה בין תוצאה מכווננת לתוצאת zero-shot, או בין ממוצע ספק ללוח עצמאי, אינה השוואה. אלו שתי מדידות שונות שחולקות אותו גופן.
מה שבאמת בר השוואה: שניהם קטנים, שניהם זולים להרצה, ושניהם לא ניתנים לכוונון עדין לתחום שלך. המאגר ש-InternLM פרסמה הבוקר הופך את החלק האחרון לקל באופן משמעותי מכפי שהיה אתמול, מכיוון שהוא מספק את מפעיל האימון, את מטרת ה-masked-next-token, חבילה מאומתת ב-hash של 10,751 שורות בדיקה בשבע סוויטות, ואת סקריפטי התאמת הטמפרטורה וה-replay. מעבדה שמספקת מחולל כיול דטרמיניסטי ומצהירה ש-replay משנה אפס החלטות מזמינה בדיוק את סוג ההתאמה שכרטיס של Laya ממליץ עליו.
איך היית בעצם קורא לאחד מהם
אף אחד מהמודלים אינו ב-OrcaRouter. עמוד המודל של OrcaRouter עבור Intern-Decision-2B מחזיר 404 וגם אין נתיב Laya; אין כאן שום טענת זמינות. Intern-Decision-2B משמעו הורדת ה-checkpoint והרצת המנוע המצורף שלו על ה-GPU שלך. Laya משמעו pip install laya ואם אתה רוצה את המשטח התואם ל-Jev, laya-serve על POST /v1/systemone.
השאלה שבדמות Orchestrator שמתחת לכך היא אם אתה רוצה משטח תפעולי שני עבור סוקר. Laya תוכנה להיות מוטמעת — אותו מבנה בקשה ותגובה כמו TypeSafe Jev, כך שלקוח קיים משנה כתובת בסיס ולא דבר אחר. Intern-Decision-2B תוכנן להיות משוחזר, וכיום מדובר בערך ביום של עבודת סביבה לפני שההחלטה הראשונה חוזרת. אם ההחלטה בקבוצה סגורה שאתה מקבל קרובה בצורתה לאחת מאלה, החלופה המתארחת ששתי הכרטיסים משווים מולה היא TypeSafe Jev 1.13, שכן יש לה נתיב: 0.042$ למיליון אסימוני קלט, חלון הקשר של 65K וזמן P50 עד לאסימון הראשון של 178 מ"ש, נגישה באותו מפתח כמו יותר מ-200 מודלים אחרים עם מחיר מחירון של הספק המועבר בתוספת של 0%.

איפה כל אחד מנצח
Laya מנצחת בכל היבט תפעולי. חבילת pip מול הורדת צ'קפוינט. ראוטר ביותר ממאה שפות מול היעדר הצהרה על רב־לשוניות. תפוקה באצ'ים הנמדדת במאות שאלות בשנייה מול נתון לכל בקשה בלי שום סיפור באצ'ינג. שנתיים של כוח אקוסיסטמי — ONNX, TileLang, LangChain, MCP — מול מאגר ציבורי כבר שעתיים.
Intern-Decision-2B מנצח בשלושה דברים צרים. הוא קולט תמונות, מה ש-Laya לא עושה. אין עליו חוב כוונון עדין: הנתון 84.68 שלו הוא הצהרת ספק בלמידת אפס-שוט, בעוד שהנתון המרכזי 0.766 של Laya שייך לצ'קפוינט שעבר כוונון עדין על פיצול האימון של המבחן עצמו. והוא מתועד עם ערכת שחזור — חבילת הערכה ניתנת לאימות ומערך אימון ציבורי — ששווה יותר משורת טבלת מובילים למי שצריך להצדיק את המודל בפני מישהו אחר.
התיקו הוא נקודת המוצא. שניהם מסרבים לייצר, שניהם נותנים לך הסתברויות שאפשר להחיל עליהן סף, ושניהם מתחת לאורך הקלט שבו נמצאים רוב המסמכים האמיתיים. אם המצב שלך הוא פנייה, דוא״ל או טופס, כל אחד מהם יעשה את העבודה, ו-Laya תביא אותך לשם מהר יותר. אם למצב שלך מצורף צילום מסך, או שהארגון שלך צריך שהשחזור יהיה ניתן לביקורת, ה-checkpoint האמצעי של InternLM הוא זה שעונה על ההתנגדות הספציפית הזו — ולפי המספרים של InternLM עצמו הוא הכי פחות מכויל מבין שלושת אחיו, ב-ECE 0.100 לעומת 0.066 ו-0.065, אז כיילו טמפרטורה משלכם לפני שאתם סומכים על ציון הביטחון שהוא מדווח.
