
Intern-Decision-2B מול Gemma 4 12B: תקרה של 8,192 טוקנים כנגד חלון של 256K
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 584 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
נניח שהדבר שאתה צריך לשפוט הוא תיק תביעת ביטוח בן ארבעים עמודים. internlm/Intern-Decision-2B יסרב לטפל בו. לא יקצץ אותו, לא יסכם אותו — יסרב, מפני שמנוע ההסקה המצורף מצהיר DecisionEngine(max_length=8192) וכרטיס המודל אומר בלשון פשוטה שקלט גדול מדי "נדחה ללא קיצוץ". google/gemma-4-12B-it — Gemma 4 12B Unified — ייקח את אותו מסמך, בתוספת התצלומים הסרוקים שהודקו אליו, בתוספת שיחת הטלפון המוקלטת, ויכתוב לך תשובה. הניגוד הזה הוא כל ההשוואה, וכמעט אין לו דבר עם ספירת הפרמטרים — 2,213,241,664 מול 11,959,730,224 — שקורא של דף מפרט היה שם בראש.
Intern-Decision-2B הוא האמצעי מבין שלושה צ'קפוינטי החלטה ש-InternLM העלתה ל-Hugging Face ב-26 בספטמבר 2026 ללא הכרזה, מכוונן עדין מ-Qwen/Qwen3.5-2B וברישיון Apache-2.0 עם תנאי Qwen שנשמרים לצידו. Gemma 4 12B Unified הוא המודל המולטימודלי ללא אנקודר של Google DeepMind ממאי 2026, מערכת any-to-any שקולטת טקסט, תמונה, אודיו וווידאו ומייצרת טקסט בחלון של 256,000 טוקנים ביותר מ-140 שפות. אחד מהם הוא מודל ניקוד. האחר הוא ג'נרליסט שבמקרה מסוגל לתת ניקוד גרוע אם תנסחו לו פרומפט בקפידה. ההכרעה ביניהם היא פחות שאלת בנצ'מרק ויותר שאלה לגבי איזו צורה כבר יש לתשובה שלך.
כאשר השניים למעשה אינם ניתנים להשוואה
כדאי להיות ישירים לגבי זה לפני המספרים, מפני שההתמודדות מזמינה סימטריה מדומה.
Intern-Decision-2B אינו מפיק טוקנים. הוא מקבל מצב, בין אחת לשש-עשרה שאלות בעלות שם עם עד 62 אפשרויות בכל אחת, ובאופן אופציונלי עד שמונה תמונות; מרנדר שלד JSON של עוזר עם מציין מקום <decision> אחד לכל שדה; מריץ מעבר קדמי סיבתי בודד; קורא לוגיטים במיקום שמיד לפני כל מציין מקום; מפעיל softmax רק על הסמלים החוקיים של אותו שדה; ומיישם טמפרטורה מותאמת של 2.100509348278. הפלט הוא התפלגות מכוילת ו-argmax לכל שדה. הכרטיס מציין את השלילה במפורש: "API זה מבצע ניקוד מועמדים מובנה. הוא אינו קורא ל-generate() ואינו דוגם טקסט חופשי."
Gemma 4 12B מייצר. כל מה שהוא עושה — הסקה עם חשיבה ניתנת להגדרה, קריאה לפונקציות, OCR, הבנת תרשימים, זיהוי דיבור, כיסוי של 140 שפות — עובר דרך לולאת פענוח על אוצר מילים של 262,144 ערכים. אם תבקשו ממנו החלטת ניתוב עם הסתברויות, תקבלו פרוזה שמכילה מספר, והמספר יהיה מה שהדוגם הפיק, ולא softmax על קבוצת האפשרויות שלכם.
אז השאלה המעשית היא לא "מה מדויק יותר". היא "האם התשובה שלי היא כבר קבוצה סגורה?" אם כן, ה-12B הוא דרך בזבזנית לבחור מתוך רשימה. אם לא, Intern-Decision-2B לא יכול לעזור לך בשום רמת דיוק שהיא.
תקרת הקלט היא הקו החד ביותר ביניהם
הנה הממד שיש לשקול מעל לכל האחרים, מפני שהוא מייצר כשלים קשים ולא כשלים מדורגים.
• אורך קלט — Intern-Decision-2B מקבל 8,192 טוקנים ודוחה כל דבר ארוך יותר, בקול רם; Gemma 4 12B מקבל 256,000 טוקנים, ועל הכרטיס של גוגל עצמה, משיג 43.4% ב-MRCR v2 eight-needle ב-128k.
• תמונות — עד שמונה עבור Intern-Decision-2B, והן נספרות כנגד אותו תקציב של 8,192 טוקנים; יחס גובה-רוחב ורזולוציה משתנים עבור Gemma 4 12B, עם קלט טקסט ותמונה משולבים בכל סדר.
• מודאליות קלט — טקסט ותמונה עבור האחד; טקסט, תמונה, אודיו ווידאו עבור האחר.
• שפה — לא נטענת שום טענה רב-לשונית בשום מקום בתיעוד של Intern-Decision; Gemma 4 מכסה למעלה מ-140 שפות שאומנו מראש, עם ציון רב-לשוני מוערך של 83.4 ב-MMLU עבור גרסת ה-12B.
• פלט — התפלגות תשובות JSON עם טיפוסים עבור האחד; טקסט מחולל עבור האחר.
המגבלה של 8,192 אינה שרירותית, וזה מה שהופך אותה לקשה לעקיפה. מטרת ההחלטה קוראת לוגיט במיקום קבוע לכל שדה, לכן הפרומפט חייב להכיל את המצב, את הסכמה ואת השלד המלא במעבר אחד; אין אסטרטגיית חלוקה למקטעים ששומרת על החוזה. כרטיס, אימייל, מצב JSON קצר, צילום מסך או שניים — זה מרכז העיצוב. מסמך שדורש אחזור הוא מסמך שהמודל הזה אינו מיועד לו.
מה כל אחד עולה לך, כשסופרים בכנות
ל-Intern-Decision-2B אין נקודת קצה מתארחת ואין ספק. עמוד המודל של OrcaRouter עבורו מחזיר 404, ושום דבר במאמר זה אינו מהווה הצהרת זמינות. הפעלתו כרוכה בהורדה של כ-4.46 GB של מאגר — פלח שפה של 3.76 GB, מגדל חזותי של 612.5 MB, מקרן של 50.3 MB — והרצת inference.py לצד המשקלים בסביבת Python 3.12 עם torch 2.9.1 ו-transformers 5.14.1, על GPU שאתם משלמים עבורו בין אם הוא מדרג החלטות ובין אם לא.
זה לא חיסרון בכל מקרה, וכדאי לעשות את החשבון במקום להניח. בזמן ממוצע של 33.28 ms לבקשה על RTX 4090 בודד, במדידה של InternLM עצמה, Intern-Decision-2B המתארח מקומית לא גובה דבר לכל החלטה. מודל כללי מתארח גובה לפי טוקן, כולל עבור הטוקנים שהוא מוציא על חשיבה לפני שהוא עונה. בכמויות גדולות, כלי ניקוד שכבר בבעלותך הוא המכשיר הזול יותר — העלות היא ה-GPU וההנדסה, לא הקריאה.
גם Gemma 4 12B Unified אינו נמצא בקטלוג שלנו; אם אתם רוצים אותו, תצטרכו להוריד 11.96 מיליארד פרמטרים ב-BF16 ולהריץ אותו בעצמכם. במקום שבו לקטלוג שלנו כן יש נתיבי Gemma 4 אמיתיים זה בשני הגדלים האחרים, והם זולים: Gemma 4 26B A4B ב-$0.06 למיליון טוקני קלט ו-$0.33 למיליון טוקני פלט, ו-Gemma 4 31B ב-$0.13 ו-$0.38, שניהם מופיעים עם חלונות הקשר של 262,144 טוקנים וזמן P50 עד לטוקן הראשון שהקטלוג מציג כ-1.73 שניות. אם מתברר שהבעיה שלכם היא חשיבה כללית ולא החלטה בקבוצה סגורה, זה הדבר שיש להשוות מול scorer המופעל מקומית — שני מודלים נוספים במפתח אחד, מחיר המחירון של הספק מועבר הלאה ללא תוספת, ומעבר אוטומטי לגיבוי כך שמודל שאתם עדיין מעריכים לעולם לא הופך לנקודת כשל יחידה בנתיב ייצור.

לוח תוצאות, עם ההסתייגויות המצורפות
• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת מגדל ראייה ומקרן; Gemma 4 12B Unified 11,959,730,224 ב-BF16.
• הקשר — 8,192 טוקנים, נדחה לעיל, לעומת 256,000 טוקנים.
• פלט — הסתברויות מכויילות ו-argmax, ללא טקסט; טקסט מחולל, טוקן אחד בכל פעם.
• מודאליות — טקסט ועד שמונה תמונות לעומת טקסט, תמונה, אודיו ווידאו כקלט, טקסט כפלט.
• עדויות שפורסמו — טבלת ספקים של שבע חבילות עם ממוצע 84.68, ציון Brier של 0.437 ו-ECE של 0.100, שלא שוחזרה על ידי איש מחוץ למעבדה; כרטיס הערכה של Google עם MMLU Pro 77.2%, GPQA Diamond 78.8%, AIME 2026 ללא כלים 77.5% ו-LiveCodeBench v6 72.0, בתוספת רישום עצמאי במדד Artificial Analysis Intelligence Index של 14.2.
• אימוץ — לייק אחד ואפס הורדות בצ׳קפוינט 2B לעומת משפחה שנמצאת בתפוצה מאז מאי עם קוונטיזציות, כיוונונים עדינים ונגזרות שמספרן במאות.
קראו את שורות הראיות באופן א־סימטרי, כי זה מה שהן. המספרים של Google עברו אינדוקס ושוחזרו באופן עצמאי על ידי צדדים שלישיים; אלה של InternLM לא הורצו על ידי איש מחוץ למעבדה, ובמיוחד יש להתייחס לנתון הכיול כאל כוונה מתועדת היטב עד שייפגש עם מערך בדיקה זר. הסיכום הכנה אינו שטבלת הספק שגויה. הוא ששתי העמודות אינן נושאות את אותו משקל ראייתי, והשוואה שמדפיסה 84.68 לצד 77.2 בלי לומר זאת מטעה את הקורא שלה.

מה לעשות עם זה
בחרו ב-Intern-Decision-2B כאשר ההחלטה באמת סגורה, המצב נכנס בנוחות בתוך שמונת אלפים טוקנים, אתם רוצים הסתברות שאפשר להחיל עליה סף ולא פסקה שצריך לפרסר, ויש לכם החומרה והתיאבון להפעיל צ'קפוינט שאיש עדיין לא תומך בו. גודל הביניים דווקא נושא את הכיול החלש ביותר שפורסם מבין שלושת דגמי InternLM ששוחררו — ECE 0.100 לעומת 0.066 עבור המודל שחצי מגודלו ו-0.065 עבור זה שכמעט כפול ממנו — לכן אם אתם בוחרים מתוך המשפחה הזו, ה-2B הוא זה שכדאי להתאים לו טמפרטורה משלכם, ולא זה שאפשר לסמוך עליו כפי שהוא.
בחרו ב-Gemma 4 12B — או באופן מעשי יותר, באחד משני גדלי Gemma 4 שאנחנו מנתבים בפועל — כאשר הקלט ארוך מעמוד, כאשר מעורבים אודיו או וידאו או שפה שאינה אנגלית, כאשר יש להסביר את התשובה ולא רק לבחור בה, או כאשר אינכם רוצים להחזיק בעצמכם את מחסנית האינפרנס. ה-12B הוא הקטן מבין מודלי Gemma 4 בעלי אודיו מקורי; ה-26B A4B מפעיל כ-4 מיליארד פרמטרים לכל טוקן ומהווה את הדרך הזולה ביותר להיכנס למשפחה.
ואם מה שבאמת יש לך הוא בעיית ניקוד שאליה מצורף מסמך ארוך, אף אחד מאלה אינו הכלי המתאים: זו בעיית אחזור בתחפושת של מאמר השוואה.

