
Intern-Decision-0.8B לעומת Gemma 4 12B: ראש ניקוד כנגד גנרליסט רב-מודאלי
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
הדרך הזולה ביותר לראות מה הוא Intern-Decision-0.8B — ומה הוא לא — היא להעמיד אותו לצד Gemma 4 12B, ואז לשים לב שההשוואה עוסקת כמעט כולה במה שכל מודל עושה עם שכבת הפלט שלו. Gemma 4 12B, המודל הרב-מודאלי ללא מקודד של DeepMind בעל 11.95 מיליארד פרמטרים, שיצא ב-3 ביוני 2026 תחת Apache 2.0, הוא ג'נרליסט גנרטיבי: אתם נותנים לו טקסט, תמונות, אודיו או וידאו, והוא כותב תשובה. Intern-Decision-0.8B, שהועלה בשקט על ידי InternLM ל-Hugging Face ב-26 בספטמבר 2026 ללא הודעה, הוא כיוונון עדין של Qwen3.5-0.8B הקטן בהרבה, שאינו מייצר טקסט כלל — הוא מקבל מצב, סכמה של שאלות בעלות שמות ועד שמונה תמונות, ומחזיר התפלגות הסתברות מכוילת עבור כל שאלה לאחר מעבר קדימה בודד. האחד כותב. האחר מדרג. כל מה שלהלן נובע מכך.
זה הופך את ההשוואה הזו למפגש מוזר למסגור כתחרות, וכדאי לומר זאת בפשטות לפני שורות המפרט: השניים האלה אינם תחליפים, וכל מי שבוחר ביניהם כבר הציג את הבעיה באופן שגוי. Gemma 4 12B עונה על השאלה "מה צריכה להיות התשובה". Intern-Decision-0.8B עונה על השאלה "איזו מבין שש־עשרה האפשרויות הללו היא, וכמה בטוח אתה" — ועונה עליה בלי לולאת מפענח, ומכאן נובעים ההבדלים בזמן השהיה ובעלות. לכן ההשוואה המועילה עוסקת באופן שבו היית מחבר כל אחד מהם לזרימת עבודה אחת, ולא בשאלה מי מנצח.
ההבדל הגדול היחיד הוא בצד הפלט של החשבון
Gemma 4 12B מחויב כמו כל מודל גנרטיבי: גם טוקני קלט וגם טוקני פלט. כאשר אתה מבקש ממנו JSON מובנה, כל אחד מהטוקנים האלה נוצר, נדגם ומחויב, וככל שהסכימה שלך ארוכה יותר ומקוננת יותר, כך יש יותר מהם. זו אינה ביקורת על המודל — זה מה שמפענח עושה — אבל זה הסעיף שראשי החלטה נועדו להסיר. ל-Intern-Decision-0.8B אין טוקני פלט. הכרטיס שלו מפורש לגבי הסיבה: מסלול ההסקה לעולם אינו קורא ל-generate()/, קורא לוגיטים במיקומים ממש לפני כל <decision>/ מציין מקום בשלד מוכן מראש, ומבצע softmax רק על סמלי המועמדים המותרים עבור אותו שדה. מונה השימוש הנקרא output_tokens/ סופר שדות שקיבלו ניקוד, לא טקסט.
ההשפעה המצטברת מתעצמת בקנה מידה גדול. צינור עיבוד שמתייג עשרת אלפים רשומות עם Gemma 4 12B משלם עבור עשרת אלפים מסמכי JSON; אותו צינור עיבוד עם Intern-Decision-0.8B משלם עבור הפרומפטים ותו לא. אם המספר המוחלט גדול תלוי לחלוטין בנפח ובסכימה שלכם, וכל מי שיש לו תקציב לפי טוקנים יכול לחשב זאת בגיליון אלקטרוני בעשר דקות. אבל הכיוון אינו שנוי במחלוקת, והוא הסיבה לכך שקטגוריה של מודלים קטנים להחלטות בכלל הופיעה.
חביון, ומדוע פער הפרמטרים מטעה
• מודל תפוקה — Intern-Decision-0.8B: מעבר קדימה אחד, ללא לולאת פענוח. Gemma 4 12B: יצירה אוטורגרסיבית, טוקן אחד בכל פעם.
• השהיה נמדדת — Intern-Decision-0.8B: 33.98 ms ממוצע / 37.50 ms p95 על RTX 4090 בודד דרך מסלול Hugging Face המקומי, לפי המדידה של InternLM עצמה. Gemma 4 12B: אין נתון בר-השוואה של מעבר יחיד, מפני שאין מעבר יחיד שניתן למדוד.
• טביעת רגל — Intern-Decision-0.8B: כ-1.73 GB של אחסון מאגר, 852,985,920 פרמטרים על פני מקטע שפה של 1.50 GB, מקטע חזותי של 176 MB ומקרן של 25 MB. Gemma 4 12B: חומרי ההשקה של Google מציבים אותו ב-16 GB של VRAM או זיכרון מאוחד.
• דטרמיניזם של הפלט — Intern-Decision-0.8B: argmax על פני לוגיטים של מועמדים, כך שאותו קלט מניב את אותה תווית בכל פעם. Gemma 4 12B: דגימה אלא אם מקבעים את הטמפרטורה לאפס, וגם אז התווית מגיעה כטקסט שעליך לנתח.
פער הפרמטרים פי 14 בין שני המודלים האלה אינו מתורגם לשום דבר שמזכיר פער זמן ריצה פי 14 במשימת קבלת החלטות, משום שהעבודה שונה במהותה. Intern-Decision-0.8B מקדיש את המעבר היחיד שלו לקריאת הפרומפט — המצב, הסכימה, תיאורי האפשרויות — ואז עוצר. Gemma 4 12B מקדיש את אותה קריאת פרומפט ואז מוסיף עליה כל טוקן של התשובה. עבור סכימה בת שישה-עשר שדות עם תוויות אפשרויות תיאוריות, שלב היצירה אינו שגיאת עיגול זניחה; הוא מהווה את רוב זמן השעון. הטבלה של InternLM עצמה מבהירה את הנקודה בלי כוונה: האח ה-2B שלה רושם ממוצע של 33.28 מ"ש, מהיר במעט מזה של ה-0.8B, 33.98 מ"ש. כאשר עיבוד הפרומפט שולט, מספר הפרמטרים מפסיק להיות המנוף.img src="2.png">

במקום שבו Gemma 4 12B נמצא פשוט בקטגוריה אחרת
זה יהיה חסר יושר להשאיר את דף המפרט במסגור של משימת החלטה, כי מחוץ למסגור הזה Gemma 4 12B לא רק מוביל — הוא משחק ספורט אחר.
Intern-Decision-0.8B מקבל טקסט בתוספת עד שמונה תמונות, וזה כל משטח הקלט שלו. תקרת הקלט המוגדרת כברירת מחדל שלו היא 8,192 טוקנים, והקלט נדחה במקום להיחתך, וזו נמוכה בהרבה מ-262,144 הטמעת המיקום המקסימלית שהתצורה שלו מצהירה עליה — התקרה, לא הארכיטקטורה, היא החלון המעשי. Gemma 4 12B קולט טקסט, תמונה, אודיו ווידאו באופן נייטיבי דרך עיצוב ללא מקודד שמקרין פאצ'ים גולמיים וצורות גל ישירות אל מרחב ההטמעה, בעל חלון הקשר של 256K, ומחזיר טקסט. הכרטיס המפורסם של Google מעניק לו ציון של 77.2% ב-MMLU Pro, 77.5% ב-AIME 2026 ללא כלים, 72.0% ב-LiveCodeBench v6, 78.8% ב-GPQA Diamond, 69.1% ב-MMMU Pro ו-79.7% ב-MATH-Vision. אלה נתוני ספק מכרטיס ההערכה של Google עצמה, ובשונה מהטבלה של Intern-Decision-0.8B, יש מאחוריהם שנה של שימוש על ידי צד שלישי, מכיוון ש-Gemma 4 יצא לאקוסיסטם — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — מהיום הראשון.
השחרורים גם לא דומים זה לזה כלל, והניגוד מלמד. ל-Gemma 4 12B היה בלוג השקה, דוח טכני ב-arXiv, עמוד משפחה של חמישה מודלים, כרטיס הערכה, וקישור הורדה ביום שבו הופיע. ל-Intern-Decision-0.8B היה כרטיס מודל עם כתובת GitHub שמחזירה 404 ו-Space דמו שמחזיר 401, והוא הופיע בתוך ארבעים שניות משני אחים גדולים יותר שהם באותה מידה חסרי תיעוד. אחד מאלה הוא מוצר. האחר הוא צ'קפוינט שמישהו החליט להעלות לאינטרנט.
שניהם Apache 2.0, וזו אינה שורה משותפת טריוויאלית
המישור היחיד שבו השניים נפגשים באמת הוא הרישוי, וכדאי להקדיש לו פסקה, משום שזה המקום שבו ההחלטה משתנה עבור משתמשים מסחריים. שניהם תחת Apache 2.0. Gemma 4 12B מופץ תחת תנאי הרישיון של Gemma 4 המתארחים ב-Google, שאותם מזהה כרטיס המודל כ-Apache 2.0; Intern-Decision-0.8B נושא את Apache-2.0 לצד LICENSE-QWEN/ קובץ נוסף, שהוא הטיפול הנכון במודל הנגזר ממשקולות של Qwen, ואות לכך ש-InternLM הכינה את הניירת גם עבור מהדורה שהיא לא הכריזה עליה.
זה מבדיל את שניהם ממשפחת LFM2.5 של Liquid AI, שרישיון LFM Open License v1.0 שלה מתנה את הזכויות המסחריות בכך שהגוף המשפטי שלך יישאר מתחת לסף הכנסה שנתית של 10 מיליון דולר — אילוץ ממשי שקונה של מודל החלטות המשווה בין אפשרויות צריך לקרוא לפני שהוא מניח ש"משקולות פתוחות" משמעו אותו דבר בכל מקום. אם מקרה השימוש שלך הוא מסחרי וההכנסה שלך חוצה את הקו הזה, Apache 2.0 ורישיון LFM אינם ניתנים להחלפה זה בזה, ואף Gemma 4 12B ואף Intern-Decision-0.8B אינם נושאים את המגבלה.
ספר החשבונות הכנה על המספרים של Intern-Decision-0.8B
כל נתון ביצועים של Intern-Decision-0.8B הוא דיווח של הספק ואינו משוחזר. זו אינה פורמליות גרידא — זהו מצב הראיות הנוכחי, והוא צריך לקבוע כמה משקל יש לייחס לטבלה. InternLM בחרה את מדדי הבנצ'מרק, בחרה את המתחרים, ביצעה את ההערכות ופרסמה את התוצאות, ואין שום הרצה עצמאית באף לוח תוצאות ציבורי. חיפוש ב-Artificial Analysis עבור המודל אינו מחזיר דבר כלל. img src="3.png">

כאשר התווית הזו מצורפת, צורת התוצאה עדיין מלמדת. ה-0.8B רושם 77.35 בבנצ'מרק Typed Decision של TypeSafe לעומת 73.35 עבור Jev 1.13 — המודל שהבנצ'מרק נקרא על שמו — ו-94.52 ב-ToolACE לעומת 91.29. הוא ממוצע 79.38 בכל הסוויטה, כאשר אחיו ל-2B ול-4B נמצאים ב-84.68 ו-90.02. העמודה שאמורה לגרום לקונה לעצור היא WildJailBreak, שם הוא משיג 64.48 לעומת 96.29 של Jev: פער בחוסן סירוב בגודל כזה הוא תכונה של ה-fine-tune, והאם הוא מגיע מבסיס Qwen3.5-0.8B, ממטרת כיוונון ההחלטות או ממספר הפרמטרים אינו מתועד בשום מקום. פרופיל הכיול שלו הוא הקריאה המעניינת יותר — Brier של 0.530 ושגיאת כיול צפויה של 0.066, לעומת 0.358 ו-0.095 של Jev — כלומר הוא פחות מדויק בסך הכול, אבל רמות הביטחון המוצהרות שלו עוקבות אחרי הדיוק שלו מקרוב יותר. עבור זרימת עבודה מבוססת סף ההבחנה הזו חשובה יותר מדיוק גולמי, וזה מסוג הדברים של-InternLM לא היה תמריץ לפרסם.
לעומת זאת, כרטיס ההערכה של Gemma 4 12B גם הוא מדווח על ידי הספק — גם גוגל הרצה את אותם מבחני ביצועים — אבל הוא נמצא בעולם מאז יוני, הופץ דרך כל סביבת הרצה מקומית מרכזית, וכל אי-התאמה הייתה עולה לפני השטח. הפער הראייתי בין "לא שוחזר במשך שבוע" לבין "לא שוחזר במשך ארבעה חודשים ואיש לא סתר אותו" הוא ההבדל האמיתי בין שני הטורים האלה.
איך בעצם היית משלב אותם
התבנית ההגיונית אינה בחירה. ראש החלטה מטפל בקריאות המובנות — ניתוב, מיון, סיווג, ניקוד לפי מחוון — שבהן קבוצת התשובות סגורה, זמן התגובה חשוב ואסימוני הפלט הם תקורה טהורה. ג'נרליסט מטפל בכל מה שדורש פרוזה, קוד, סינתזה או הקשר ארוך: סיכום ההסלמה, ההסבר מדוע הפנייה עברה לחיוב, הטיוטה שאדם עורך.
אם אתם מנסים להבין היכן עובר הגבול, הניסוי הזול ביותר הוא להעמיד את שני החצאים מאחורי נקודת קצה אחת. OrcaRouter מנתב יותר מ-200 מודלים דרך API יחיד התואם ל-OpenAI, עם מעבר אוטומטי לגיבוי ומחיר המחירון של הספק המועבר הלאה ללא תוספת, כלומר לבדוק מודל החלטות מתארח ומודל כללי מתארח באותו סקריפט עולה מפתח אחד ואחר צהריים אחד. כדאי להיות מדויקים לגבי גבול אחד כאן: Intern-Decision-0.8B אינו אחד משלנו — זהו צ'קפוינט Apache-2.0 שאתם מורידים ומריצים בעצמכם, והסיבה היחידה לבחור במודל של 1.73 GB היא שהוא חי במקום שבו הנתונים שלכם כבר נמצאים. החצי הגנרטיבי של התבנית הוא החלק שנמצא במרחק שורה אחת. ולגבי Gemma 4 12B ספציפית, גם הוא לא בקטלוג שלנו; גדלי Gemma 4 שאנחנו כן מנתבים הם 31B ו-26B A4B, וה-12B הוא הורדה מקומית. img src="4.png">

אם כך, ההכרעה אינה מצביעה על מנצח. Intern-Decision-0.8B הוא ראש ניקוד זול, מהיר ודטרמיניסטי ממעבדה שטרם הסבירה אותו, עם טבלת בנצ'מרק שאיש לא שחזר ועמודת עמידות בסירובים שכדאי לבחון לפני שהוא מתקרב לקלט לא מהימן. Gemma 4 12B הוא כללן מולטימודלי בוגר עם משקולות פתוחות, בעל כרטיס מפורסם, דו"ח טכני ופי ארבעה עשר פרמטרים, והוא הכלי הלא נכון לקריאת סיווג בת שישה עשר שדות — לא משום שהוא גרוע יותר, אלא משום שלייצר תשובה לשאלה שקבוצת התשובות שלה כבר רשמת היא דרך יקרה לקבל תווית.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
