כרטיס כותרת שנוצר עם הכיתוב 'Intern-Decision-2B נגד Gemma 4 12B', עם כותרת משנה '8,192 טוקנים מול 256,000', עם התגים 'מעריך שמסרב' ו'כללן שכותב', כאשר הלוגו של OrcaRouter מורכב בפינה.
Guides & Insights

Intern-Decision-2B מול Gemma 4 12B: תקרה של 8,192 טוקנים כנגד חלון של 256K

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

נניח שהדבר שאתה צריך לשפוט הוא תיק תביעת ביטוח בן ארבעים עמודים. internlm/Intern-Decision-2B יסרב לטפל בו. לא יקצץ אותו, לא יסכם אותו — יסרב, מפני שמנוע ההסקה המצורף מצהיר DecisionEngine(max_length=8192) וכרטיס המודל אומר בלשון פשוטה שקלט גדול מדי "נדחה ללא קיצוץ". google/gemma-4-12B-it — Gemma 4 12B Unified — ייקח את אותו מסמך, בתוספת התצלומים הסרוקים שהודקו אליו, בתוספת שיחת הטלפון המוקלטת, ויכתוב לך תשובה. הניגוד הזה הוא כל ההשוואה, וכמעט אין לו דבר עם ספירת הפרמטרים — 2,213,241,664 מול 11,959,730,224 — שקורא של דף מפרט היה שם בראש.

Intern-Decision-2B הוא האמצעי מבין שלושה צ'קפוינטי החלטה ש-InternLM העלתה ל-Hugging Face ב-26 בספטמבר 2026 ללא הכרזה, מכוונן עדין מ-Qwen/Qwen3.5-2B וברישיון Apache-2.0 עם תנאי Qwen שנשמרים לצידו. Gemma 4 12B Unified הוא המודל המולטימודלי ללא אנקודר של Google DeepMind ממאי 2026, מערכת any-to-any שקולטת טקסט, תמונה, אודיו וווידאו ומייצרת טקסט בחלון של 256,000 טוקנים ביותר מ-140 שפות. אחד מהם הוא מודל ניקוד. האחר הוא ג'נרליסט שבמקרה מסוגל לתת ניקוד גרוע אם תנסחו לו פרומפט בקפידה. ההכרעה ביניהם היא פחות שאלת בנצ'מרק ויותר שאלה לגבי איזו צורה כבר יש לתשובה שלך.

כאשר השניים למעשה אינם ניתנים להשוואה

כדאי להיות ישירים לגבי זה לפני המספרים, מפני שההתמודדות מזמינה סימטריה מדומה.

Intern-Decision-2B אינו מפיק טוקנים. הוא מקבל מצב, בין אחת לשש-עשרה שאלות בעלות שם עם עד 62 אפשרויות בכל אחת, ובאופן אופציונלי עד שמונה תמונות; מרנדר שלד JSON של עוזר עם מציין מקום <decision> אחד לכל שדה; מריץ מעבר קדמי סיבתי בודד; קורא לוגיטים במיקום שמיד לפני כל מציין מקום; מפעיל softmax רק על הסמלים החוקיים של אותו שדה; ומיישם טמפרטורה מותאמת של 2.100509348278. הפלט הוא התפלגות מכוילת ו-argmax לכל שדה. הכרטיס מציין את השלילה במפורש: "API זה מבצע ניקוד מועמדים מובנה. הוא אינו קורא ל-generate() ואינו דוגם טקסט חופשי."

Gemma 4 12B מייצר. כל מה שהוא עושה — הסקה עם חשיבה ניתנת להגדרה, קריאה לפונקציות, OCR, הבנת תרשימים, זיהוי דיבור, כיסוי של 140 שפות — עובר דרך לולאת פענוח על אוצר מילים של 262,144 ערכים. אם תבקשו ממנו החלטת ניתוב עם הסתברויות, תקבלו פרוזה שמכילה מספר, והמספר יהיה מה שהדוגם הפיק, ולא softmax על קבוצת האפשרויות שלכם.

אז השאלה המעשית היא לא "מה מדויק יותר". היא "האם התשובה שלי היא כבר קבוצה סגורה?" אם כן, ה-12B הוא דרך בזבזנית לבחור מתוך רשימה. אם לא, Intern-Decision-2B לא יכול לעזור לך בשום רמת דיוק שהיא.

תקרת הקלט היא הקו החד ביותר ביניהם

הנה הממד שיש לשקול מעל לכל האחרים, מפני שהוא מייצר כשלים קשים ולא כשלים מדורגים.

• אורך קלט — Intern-Decision-2B מקבל 8,192 טוקנים ודוחה כל דבר ארוך יותר, בקול רם; Gemma 4 12B מקבל 256,000 טוקנים, ועל הכרטיס של גוגל עצמה, משיג 43.4% ב-MRCR v2 eight-needle ב-128k.

• תמונות — עד שמונה עבור Intern-Decision-2B, והן נספרות כנגד אותו תקציב של 8,192 טוקנים; יחס גובה-רוחב ורזולוציה משתנים עבור Gemma 4 12B, עם קלט טקסט ותמונה משולבים בכל סדר.

• מודאליות קלט — טקסט ותמונה עבור האחד; טקסט, תמונה, אודיו ווידאו עבור האחר.

• שפה — לא נטענת שום טענה רב-לשונית בשום מקום בתיעוד של Intern-Decision; Gemma 4 מכסה למעלה מ-140 שפות שאומנו מראש, עם ציון רב-לשוני מוערך של 83.4 ב-MMLU עבור גרסת ה-12B.

• פלט — התפלגות תשובות JSON עם טיפוסים עבור האחד; טקסט מחולל עבור האחר.

המגבלה של 8,192 אינה שרירותית, וזה מה שהופך אותה לקשה לעקיפה. מטרת ההחלטה קוראת לוגיט במיקום קבוע לכל שדה, לכן הפרומפט חייב להכיל את המצב, את הסכמה ואת השלד המלא במעבר אחד; אין אסטרטגיית חלוקה למקטעים ששומרת על החוזה. כרטיס, אימייל, מצב JSON קצר, צילום מסך או שניים — זה מרכז העיצוב. מסמך שדורש אחזור הוא מסמך שהמודל הזה אינו מיועד לו.

מה כל אחד עולה לך, כשסופרים בכנות

ל-Intern-Decision-2B אין נקודת קצה מתארחת ואין ספק. עמוד המודל של OrcaRouter עבורו מחזיר 404, ושום דבר במאמר זה אינו מהווה הצהרת זמינות. הפעלתו כרוכה בהורדה של כ-4.46 GB של מאגר — פלח שפה של 3.76 GB, מגדל חזותי של 612.5 MB, מקרן של 50.3 MB — והרצת inference.py לצד המשקלים בסביבת Python 3.12 עם torch 2.9.1 ו-transformers 5.14.1, על GPU שאתם משלמים עבורו בין אם הוא מדרג החלטות ובין אם לא.

זה לא חיסרון בכל מקרה, וכדאי לעשות את החשבון במקום להניח. בזמן ממוצע של 33.28 ms לבקשה על RTX 4090 בודד, במדידה של InternLM עצמה, Intern-Decision-2B המתארח מקומית לא גובה דבר לכל החלטה. מודל כללי מתארח גובה לפי טוקן, כולל עבור הטוקנים שהוא מוציא על חשיבה לפני שהוא עונה. בכמויות גדולות, כלי ניקוד שכבר בבעלותך הוא המכשיר הזול יותר — העלות היא ה-GPU וההנדסה, לא הקריאה.

גם Gemma 4 12B Unified אינו נמצא בקטלוג שלנו; אם אתם רוצים אותו, תצטרכו להוריד 11.96 מיליארד פרמטרים ב-BF16 ולהריץ אותו בעצמכם. במקום שבו לקטלוג שלנו כן יש נתיבי Gemma 4 אמיתיים זה בשני הגדלים האחרים, והם זולים: Gemma 4 26B A4B ב-$0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט, ו-Gemma 4 31B ב-$0.13 ו-$0.38, שניהם מופיעים עם חלונות הקשר של 262,144 טוקנים וזמן P50 עד לטוקן הראשון שהקטלוג מציג כ-1.73 שניות. אם מתברר שהבעיה שלכם היא חשיבה כללית ולא החלטה בקבוצה סגורה, זה הדבר שיש להשוות מול scorer המופעל מקומית — שני מודלים נוספים במפתח אחד, מחיר המחירון של הספק מועבר הלאה ללא תוספת, ומעבר אוטומטי לגיבוי כך שמודל שאתם עדיין מעריכים לעולם לא הופך לנקודת כשל יחידה בנתיב ייצור.

A screenshot of the OrcaRouter model page for google/gemma-4-31b-it, showing the Google breadcrumb, the model name Gemma 4 31B, a release date of 2026-04-02, the description of it as a 30.78B dense multimodal model with text and image input, a 256K token context window and configurable thinking mode, list pricing of $0.13 input and $0.38 output per million tokens, and a P50 time to first token of 1.73 seconds.

לוח תוצאות, עם ההסתייגויות המצורפות

• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת מגדל ראייה ומקרן; Gemma 4 12B Unified 11,959,730,224 ב-BF16.

• הקשר — 8,192 טוקנים, נדחה לעיל, לעומת 256,000 טוקנים.

• פלט — הסתברויות מכויילות ו-argmax, ללא טקסט; טקסט מחולל, טוקן אחד בכל פעם.

• מודאליות — טקסט ועד שמונה תמונות לעומת טקסט, תמונה, אודיו ווידאו כקלט, טקסט כפלט.

• עדויות שפורסמו — טבלת ספקים של שבע חבילות עם ממוצע 84.68, ציון Brier של 0.437 ו-ECE של 0.100, שלא שוחזרה על ידי איש מחוץ למעבדה; כרטיס הערכה של Google עם MMLU Pro 77.2%, GPQA Diamond 78.8%, AIME 2026 ללא כלים 77.5% ו-LiveCodeBench v6 72.0, בתוספת רישום עצמאי במדד Artificial Analysis Intelligence Index של 14.2.

• אימוץ — לייק אחד ואפס הורדות בצ׳קפוינט 2B לעומת משפחה שנמצאת בתפוצה מאז מאי עם קוונטיזציות, כיוונונים עדינים ונגזרות שמספרן במאות.

קראו את שורות הראיות באופן א־סימטרי, כי זה מה שהן. המספרים של Google עברו אינדוקס ושוחזרו באופן עצמאי על ידי צדדים שלישיים; אלה של InternLM לא הורצו על ידי איש מחוץ למעבדה, ובמיוחד יש להתייחס לנתון הכיול כאל כוונה מתועדת היטב עד שייפגש עם מערך בדיקה זר. הסיכום הכנה אינו שטבלת הספק שגויה. הוא ששתי העמודות אינן נושאות את אותו משקל ראייתי, והשוואה שמדפיסה 84.68 לצד 77.2 בלי לומר זאת מטעה את הקורא שלה.

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Gemma 4 12B'. The left column reads: Parameters 2.21B BF16 plus vision tower; Context 8,192 tokens, refused above; Output probabilities and an argmax, no text; Input text plus up to 8 images; Published evidence vendor table, unreproduced; Licence Apache 2.0 plus LICENSE-QWEN. The right column reads: Parameters 11.96B BF16; Context 256,000 tokens; Output generated text, token by token; Input text, image, audio and video; Published evidence Google card, AA Index 14.2; Licence Apache 2.0, Gemma 4 terms. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Gemma 4 12B figures come from Google's own card plus an independent Artificial Analysis index.

מה לעשות עם זה

בחרו ב-Intern-Decision-2B כאשר ההחלטה באמת סגורה, המצב נכנס בנוחות בתוך שמונת אלפים טוקנים, אתם רוצים הסתברות שאפשר להחיל עליה סף ולא פסקה שצריך לפרסר, ויש לכם החומרה והתיאבון להפעיל צ'קפוינט שאיש עדיין לא תומך בו. גודל הביניים דווקא נושא את הכיול החלש ביותר שפורסם מבין שלושת דגמי InternLM ששוחררו — ECE 0.100 לעומת 0.066 עבור המודל שחצי מגודלו ו-0.065 עבור זה שכמעט כפול ממנו — לכן אם אתם בוחרים מתוך המשפחה הזו, ה-2B הוא זה שכדאי להתאים לו טמפרטורה משלכם, ולא זה שאפשר לסמוך עליו כפי שהוא.

בחרו ב-Gemma 4 12B — או באופן מעשי יותר, באחד משני גדלי Gemma 4 שאנחנו מנתבים בפועל — כאשר הקלט ארוך מעמוד, כאשר מעורבים אודיו או וידאו או שפה שאינה אנגלית, כאשר יש להסביר את התשובה ולא רק לבחור בה, או כאשר אינכם רוצים להחזיק בעצמכם את מחסנית האינפרנס. ה-12B הוא הקטן מבין מודלי Gemma 4 בעלי אודיו מקורי; ה-26B A4B מפעיל כ-4 מיליארד פרמטרים לכל טוקן ומהווה את הדרך הזולה ביותר להיכנס למשפחה.

ואם מה שבאמת יש לך הוא בעיית ניקוד שאליה מצורף מסמך ארוך, אף אחד מאלה אינו הכלי המתאים: זו בעיית אחזור בתחפושת של מאמר השוואה.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face, showing the Gemma 4 banner, the Hugging Face, GitHub, launch blog, documentation and technical report links, an Apache 2.0 licence, the note that the card covers the Gemma 4 12B Unified model, and the opening paragraphs describing a multimodal family handling text, image, video and audio with a context window of up to 256K tokens and multilingual support in over 140 languages.