כרטיס כותרת בסגנון הירו שעליו הכיתוב 'Intern-Decision-0.8B vs Gemma 4 12B' עם כותרת המשנה 'אחד כותב תשובה, השני מדרג אותה', הנושא את התגים 'ראש ניקוד של 0.8B, ללא טוקני פלט' ו'גנרליסט מולטימודלי של 11.95B', כשהלוגו של OrcaRouter משולב בפינה.
Guides & Insights

Intern-Decision-0.8B לעומת Gemma 4 12B: ראש ניקוד כנגד גנרליסט רב-מודאלי

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדרך הזולה ביותר לראות מה הוא Intern-Decision-0.8B — ומה הוא לא — היא להעמיד אותו לצד Gemma 4 12B, ואז לשים לב שההשוואה עוסקת כמעט כולה במה שכל מודל עושה עם שכבת הפלט שלו. Gemma 4 12B, המודל הרב-מודאלי ללא מקודד של DeepMind בעל 11.95 מיליארד פרמטרים, שיצא ב-3 ביוני 2026 תחת Apache 2.0, הוא ג'נרליסט גנרטיבי: אתם נותנים לו טקסט, תמונות, אודיו או וידאו, והוא כותב תשובה. Intern-Decision-0.8B, שהועלה בשקט על ידי InternLM ל-Hugging Face ב-26 בספטמבר 2026 ללא הודעה, הוא כיוונון עדין של Qwen3.5-0.8B הקטן בהרבה, שאינו מייצר טקסט כלל — הוא מקבל מצב, סכמה של שאלות בעלות שמות ועד שמונה תמונות, ומחזיר התפלגות הסתברות מכוילת עבור כל שאלה לאחר מעבר קדימה בודד. האחד כותב. האחר מדרג. כל מה שלהלן נובע מכך.

זה הופך את ההשוואה הזו למפגש מוזר למסגור כתחרות, וכדאי לומר זאת בפשטות לפני שורות המפרט: השניים האלה אינם תחליפים, וכל מי שבוחר ביניהם כבר הציג את הבעיה באופן שגוי. Gemma 4 12B עונה על השאלה "מה צריכה להיות התשובה". Intern-Decision-0.8B עונה על השאלה "איזו מבין שש־עשרה האפשרויות הללו היא, וכמה בטוח אתה" — ועונה עליה בלי לולאת מפענח, ומכאן נובעים ההבדלים בזמן השהיה ובעלות. לכן ההשוואה המועילה עוסקת באופן שבו היית מחבר כל אחד מהם לזרימת עבודה אחת, ולא בשאלה מי מנצח.

ההבדל הגדול היחיד הוא בצד הפלט של החשבון

Gemma 4 12B מחויב כמו כל מודל גנרטיבי: גם טוקני קלט וגם טוקני פלט. כאשר אתה מבקש ממנו JSON מובנה, כל אחד מהטוקנים האלה נוצר, נדגם ומחויב, וככל שהסכימה שלך ארוכה יותר ומקוננת יותר, כך יש יותר מהם. זו אינה ביקורת על המודל — זה מה שמפענח עושה — אבל זה הסעיף שראשי החלטה נועדו להסיר. ל-Intern-Decision-0.8B אין טוקני פלט. הכרטיס שלו מפורש לגבי הסיבה: מסלול ההסקה לעולם אינו קורא ל-generate()/, קורא לוגיטים במיקומים ממש לפני כל <decision>/ מציין מקום בשלד מוכן מראש, ומבצע softmax רק על סמלי המועמדים המותרים עבור אותו שדה. מונה השימוש הנקרא output_tokens/ סופר שדות שקיבלו ניקוד, לא טקסט.

ההשפעה המצטברת מתעצמת בקנה מידה גדול. צינור עיבוד שמתייג עשרת אלפים רשומות עם Gemma 4 12B משלם עבור עשרת אלפים מסמכי JSON; אותו צינור עיבוד עם Intern-Decision-0.8B משלם עבור הפרומפטים ותו לא. אם המספר המוחלט גדול תלוי לחלוטין בנפח ובסכימה שלכם, וכל מי שיש לו תקציב לפי טוקנים יכול לחשב זאת בגיליון אלקטרוני בעשר דקות. אבל הכיוון אינו שנוי במחלוקת, והוא הסיבה לכך שקטגוריה של מודלים קטנים להחלטות בכלל הופיעה.

חביון, ומדוע פער הפרמטרים מטעה

• מודל תפוקה — Intern-Decision-0.8B: מעבר קדימה אחד, ללא לולאת פענוח. Gemma 4 12B: יצירה אוטורגרסיבית, טוקן אחד בכל פעם.

• השהיה נמדדת — Intern-Decision-0.8B: 33.98 ms ממוצע / 37.50 ms p95 על RTX 4090 בודד דרך מסלול Hugging Face המקומי, לפי המדידה של InternLM עצמה. Gemma 4 12B: אין נתון בר-השוואה של מעבר יחיד, מפני שאין מעבר יחיד שניתן למדוד.

• טביעת רגל — Intern-Decision-0.8B: כ-1.73 GB של אחסון מאגר, 852,985,920 פרמטרים על פני מקטע שפה של 1.50 GB, מקטע חזותי של 176 MB ומקרן של 25 MB. Gemma 4 12B: חומרי ההשקה של Google מציבים אותו ב-16 GB של VRAM או זיכרון מאוחד.

• דטרמיניזם של הפלט — Intern-Decision-0.8B: argmax על פני לוגיטים של מועמדים, כך שאותו קלט מניב את אותה תווית בכל פעם. Gemma 4 12B: דגימה אלא אם מקבעים את הטמפרטורה לאפס, וגם אז התווית מגיעה כטקסט שעליך לנתח.

פער הפרמטרים פי 14 בין שני המודלים האלה אינו מתורגם לשום דבר שמזכיר פער זמן ריצה פי 14 במשימת קבלת החלטות, משום שהעבודה שונה במהותה. Intern-Decision-0.8B מקדיש את המעבר היחיד שלו לקריאת הפרומפט — המצב, הסכימה, תיאורי האפשרויות — ואז עוצר. Gemma 4 12B מקדיש את אותה קריאת פרומפט ואז מוסיף עליה כל טוקן של התשובה. עבור סכימה בת שישה-עשר שדות עם תוויות אפשרויות תיאוריות, שלב היצירה אינו שגיאת עיגול זניחה; הוא מהווה את רוב זמן השעון. הטבלה של InternLM עצמה מבהירה את הנקודה בלי כוונה: האח ה-2B שלה רושם ממוצע של 33.28 מ"ש, מהיר במעט מזה של ה-0.8B, 33.98 מ"ש. כאשר עיבוד הפרומפט שולט, מספר הפרמטרים מפסיק להיות המנוף.img src="2.png">

A two-column scoreboard comparing Intern-Decision-0.8B with Gemma 4 12B on six shared rows: parameters 852,985,920 against 11.95B, output tokens none because logits are read rather than generated against every token generated and billed, latency 33.98 ms mean and 37.50 ms p95 against no comparable single-pass figure, input surface text plus up to eight images under an 8,192-token ceiling against text, image, audio and video with a 256K context, published evidence a vendor table unreproduced against Google's own evaluation card, and licence Apache 2.0 plus LICENSE-QWEN against Apache 2.0 under Gemma 4 terms.

במקום שבו Gemma 4 12B נמצא פשוט בקטגוריה אחרת

זה יהיה חסר יושר להשאיר את דף המפרט במסגור של משימת החלטה, כי מחוץ למסגור הזה Gemma 4 12B לא רק מוביל — הוא משחק ספורט אחר.

Intern-Decision-0.8B מקבל טקסט בתוספת עד שמונה תמונות, וזה כל משטח הקלט שלו. תקרת הקלט המוגדרת כברירת מחדל שלו היא 8,192 טוקנים, והקלט נדחה במקום להיחתך, וזו נמוכה בהרבה מ-262,144 הטמעת המיקום המקסימלית שהתצורה שלו מצהירה עליה — התקרה, לא הארכיטקטורה, היא החלון המעשי. Gemma 4 12B קולט טקסט, תמונה, אודיו ווידאו באופן נייטיבי דרך עיצוב ללא מקודד שמקרין פאצ'ים גולמיים וצורות גל ישירות אל מרחב ההטמעה, בעל חלון הקשר של 256K, ומחזיר טקסט. הכרטיס המפורסם של Google מעניק לו ציון של 77.2% ב-MMLU Pro, 77.5% ב-AIME 2026 ללא כלים, 72.0% ב-LiveCodeBench v6, 78.8% ב-GPQA Diamond, 69.1% ב-MMMU Pro ו-79.7% ב-MATH-Vision. אלה נתוני ספק מכרטיס ההערכה של Google עצמה, ובשונה מהטבלה של Intern-Decision-0.8B, יש מאחוריהם שנה של שימוש על ידי צד שלישי, מכיוון ש-Gemma 4 יצא לאקוסיסטם — LM Studio, Ollama, llama.cpp, MLX, vLLM, SGLang, Unsloth — מהיום הראשון.

השחרורים גם לא דומים זה לזה כלל, והניגוד מלמד. ל-Gemma 4 12B היה בלוג השקה, דוח טכני ב-arXiv, עמוד משפחה של חמישה מודלים, כרטיס הערכה, וקישור הורדה ביום שבו הופיע. ל-Intern-Decision-0.8B היה כרטיס מודל עם כתובת GitHub שמחזירה 404 ו-Space דמו שמחזיר 401, והוא הופיע בתוך ארבעים שניות משני אחים גדולים יותר שהם באותה מידה חסרי תיעוד. אחד מאלה הוא מוצר. האחר הוא צ'קפוינט שמישהו החליט להעלות לאינטרנט.

שניהם Apache 2.0, וזו אינה שורה משותפת טריוויאלית

המישור היחיד שבו השניים נפגשים באמת הוא הרישוי, וכדאי להקדיש לו פסקה, משום שזה המקום שבו ההחלטה משתנה עבור משתמשים מסחריים. שניהם תחת Apache 2.0. Gemma 4 12B מופץ תחת תנאי הרישיון של Gemma 4 המתארחים ב-Google, שאותם מזהה כרטיס המודל כ-Apache 2.0; Intern-Decision-0.8B נושא את Apache-2.0 לצד LICENSE-QWEN/ קובץ נוסף, שהוא הטיפול הנכון במודל הנגזר ממשקולות של Qwen, ואות לכך ש-InternLM הכינה את הניירת גם עבור מהדורה שהיא לא הכריזה עליה.

זה מבדיל את שניהם ממשפחת LFM2.5 של Liquid AI, שרישיון LFM Open License v1.0 שלה מתנה את הזכויות המסחריות בכך שהגוף המשפטי שלך יישאר מתחת לסף הכנסה שנתית של 10 מיליון דולר — אילוץ ממשי שקונה של מודל החלטות המשווה בין אפשרויות צריך לקרוא לפני שהוא מניח ש"משקולות פתוחות" משמעו אותו דבר בכל מקום. אם מקרה השימוש שלך הוא מסחרי וההכנסה שלך חוצה את הקו הזה, Apache 2.0 ורישיון LFM אינם ניתנים להחלפה זה בזה, ואף Gemma 4 12B ואף Intern-Decision-0.8B אינם נושאים את המגבלה.

ספר החשבונות הכנה על המספרים של Intern-Decision-0.8B

כל נתון ביצועים של Intern-Decision-0.8B הוא דיווח של הספק ואינו משוחזר. זו אינה פורמליות גרידא — זהו מצב הראיות הנוכחי, והוא צריך לקבוע כמה משקל יש לייחס לטבלה. InternLM בחרה את מדדי הבנצ'מרק, בחרה את המתחרים, ביצעה את ההערכות ופרסמה את התוצאות, ואין שום הרצה עצמאית באף לוח תוצאות ציבורי. חיפוש ב-Artificial Analysis עבור המודל אינו מחזיר דבר כלל. img src="3.png">

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

כאשר התווית הזו מצורפת, צורת התוצאה עדיין מלמדת. ה-0.8B רושם 77.35 בבנצ'מרק Typed Decision של TypeSafe לעומת 73.35 עבור Jev 1.13 — המודל שהבנצ'מרק נקרא על שמו — ו-94.52 ב-ToolACE לעומת 91.29. הוא ממוצע 79.38 בכל הסוויטה, כאשר אחיו ל-2B ול-4B נמצאים ב-84.68 ו-90.02. העמודה שאמורה לגרום לקונה לעצור היא WildJailBreak, שם הוא משיג 64.48 לעומת 96.29 של Jev: פער בחוסן סירוב בגודל כזה הוא תכונה של ה-fine-tune, והאם הוא מגיע מבסיס Qwen3.5-0.8B, ממטרת כיוונון ההחלטות או ממספר הפרמטרים אינו מתועד בשום מקום. פרופיל הכיול שלו הוא הקריאה המעניינת יותר — Brier של 0.530 ושגיאת כיול צפויה של 0.066, לעומת 0.358 ו-0.095 של Jev — כלומר הוא פחות מדויק בסך הכול, אבל רמות הביטחון המוצהרות שלו עוקבות אחרי הדיוק שלו מקרוב יותר. עבור זרימת עבודה מבוססת סף ההבחנה הזו חשובה יותר מדיוק גולמי, וזה מסוג הדברים של-InternLM לא היה תמריץ לפרסם.

לעומת זאת, כרטיס ההערכה של Gemma 4 12B גם הוא מדווח על ידי הספק — גם גוגל הרצה את אותם מבחני ביצועים — אבל הוא נמצא בעולם מאז יוני, הופץ דרך כל סביבת הרצה מקומית מרכזית, וכל אי-התאמה הייתה עולה לפני השטח. הפער הראייתי בין "לא שוחזר במשך שבוע" לבין "לא שוחזר במשך ארבעה חודשים ואיש לא סתר אותו" הוא ההבדל האמיתי בין שני הטורים האלה.

איך בעצם היית משלב אותם

התבנית ההגיונית אינה בחירה. ראש החלטה מטפל בקריאות המובנות — ניתוב, מיון, סיווג, ניקוד לפי מחוון — שבהן קבוצת התשובות סגורה, זמן התגובה חשוב ואסימוני הפלט הם תקורה טהורה. ג'נרליסט מטפל בכל מה שדורש פרוזה, קוד, סינתזה או הקשר ארוך: סיכום ההסלמה, ההסבר מדוע הפנייה עברה לחיוב, הטיוטה שאדם עורך.

אם אתם מנסים להבין היכן עובר הגבול, הניסוי הזול ביותר הוא להעמיד את שני החצאים מאחורי נקודת קצה אחת. OrcaRouter מנתב יותר מ-200 מודלים דרך API יחיד התואם ל-OpenAI, עם מעבר אוטומטי לגיבוי ומחיר המחירון של הספק המועבר הלאה ללא תוספת, כלומר לבדוק מודל החלטות מתארח ומודל כללי מתארח באותו סקריפט עולה מפתח אחד ואחר צהריים אחד. כדאי להיות מדויקים לגבי גבול אחד כאן: Intern-Decision-0.8B אינו אחד משלנו — זהו צ'קפוינט Apache-2.0 שאתם מורידים ומריצים בעצמכם, והסיבה היחידה לבחור במודל של 1.73 GB היא שהוא חי במקום שבו הנתונים שלכם כבר נמצאים. החצי הגנרטיבי של התבנית הוא החלק שנמצא במרחק שורה אחת. ולגבי Gemma 4 12B ספציפית, גם הוא לא בקטלוג שלנו; גדלי Gemma 4 שאנחנו כן מנתבים הם 31B ו-26B A4B, וה-12B הוא הורדה מקומית. img src="4.png">

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

אם כך, ההכרעה אינה מצביעה על מנצח. Intern-Decision-0.8B הוא ראש ניקוד זול, מהיר ודטרמיניסטי ממעבדה שטרם הסבירה אותו, עם טבלת בנצ'מרק שאיש לא שחזר ועמודת עמידות בסירובים שכדאי לבחון לפני שהוא מתקרב לקלט לא מהימן. Gemma 4 12B הוא כללן מולטימודלי בוגר עם משקולות פתוחות, בעל כרטיס מפורסם, דו"ח טכני ופי ארבעה עשר פרמטרים, והוא הכלי הלא נכון לקריאת סיווג בת שישה עשר שדות — לא משום שהוא גרוע יותר, אלא משום שלייצר תשובה לשאלה שקבוצת התשובות שלה כבר רשמת היא דרך יקרה לקבל תווית.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית