
Intern-Decision-4B לעומת Qwen 3.8: מעבר קדמי של 44 אלפיות שנייה מול 2.4 טריליון פרמטרים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
InternLM פרסמה את Intern-Decision-4B ב-Hugging Face בבוקר ה-26 בספטמבר 2026 — בלי פוסט השקה, בלי רשומה בבלוג, קישור GitHub בכרטיס המודל שלה עצמו שמחזיר 404 ו-Space להדגמה שמחזיר 401. המשקלים אמיתיים וניתנים להורדה; ההכרזה לא נמצאת שם. והמודל שמתחתיהם הוא כיוונון עדין של Qwen3.5-4B, וזה מה שהופך את ההשוואה מול דגל הבית המתארח לשווה יותר מדף מפרט. השניים האלה אינם יריבים. הם שני הקצוות של צינור אחד, וכל השאלה היא היכן עובר הגבול ביניהם. הליבה הבסיסית היא המודל בעל 2.4 טריליון הפרמטרים שהספק פרסם באוגוסט וכעת מגיש כ-Qwen3.8-Max, בתעריף של $2.00 ו-$6.00 למיליון טוקנים; Intern-Decision-4B הוא בנייה מחדש בת 4.54 מיליארד פרמטרים של אותו מודל בסיס בן שבעה חודשים, שאינו פולט טוקנים כלל, עונה על עד שש-עשרה שאלות מטיפוס מוגדר במעבר קדמי אחד, ואינו עולה דבר לקריאה כי אין פלט לחייב עליו.
התשובה בשורה אחת: אם המשימה שלך היא החלטה עם קבוצה סגורה של תשובות, Intern-Decision-4B מהיר בערך פי חמישים לכל החלטה וזול יותר מבחינה מבנית, ואף מודל חזית לא ינצח אותו בציר הצר הזה. אם המשימה שלך היא כל דבר אחר — הסקה, הקשר ארוך, שימוש בכלים, כל דבר שבו התשובה אינה כבר מנויה בפרומפט שלך — Qwen 3.8 אינו רק טוב יותר; הוא היחיד מבין השניים שמסוגל לבצע את העבודה בכלל. כל מה שלמטה עוסק במציאת הגבול הזה במדויק.
מה שמאושר בפועל, ומה שלא
מתחילים מהראיות, כי המסגור חשוב. אין הודעת ספק עבור Intern-Decision-4B. אין הודעה לעיתונות, אין מאמר, אין תיאור מאגר לקרוא. מה שקיים היום הוא מאגר Hugging Face שפורסם הבוקר תחת הארגון internlm — Intern Large Models, הקבוצה של Shanghai AI Laboratory — הנושא את רישיון Apache 2.0, כשרישיון Qwen במעלה הזרם נשמר לצידו כ-LICENSE-QWEN. שני צ'קפוינטים אחים הופיעו בהפרש של ארבעים שניות זה מזה: Intern-Decision-0.8B עם 853 מיליון פרמטרים ו-Intern-Decision-2B עם 2.21 מיליארד. שלושתם נושאים את אותן תגיות — decision-making, multimodal, structured-prediction — ושלושתם נמצאים תחת אוסף מודלים אחד שטרם נגיש לציבור.
מה שלא מאושר: אם זו הגרסה הסופית או דחיפה מוקדמת. המאגר נוצר ב-05:36 UTC ושונה שוב לפני 08:00 UTC באותו יום, ופעילות ציבורית נוספת בצ׳ק-פוינטים האחים נמשכה גם אחרי 09:00. InternLM לא הודיעה מהי תוכנית הפריסה המיועדת, לא פרסמה את המאגר שאליו היא מפנה, ולא הודיעה אם נקודת קצה מתארחת עתידה להגיע. התייחסו לכל נתון בנצ׳מרק במאמר הזה כמדווח על ידי הספק ולא משוחזר — כי נכון לכתיבת שורות אלה ממש דבר לא נכתב על המודל הזה בשום מקום. שלושה מסלולי חיפוש נפרדים לא מחזירים דבר על השם.

ההימור הארכיטקטוני: מודד, לא מחולל
המשפט החשוב ביותר בתיעוד של Intern-Decision-4B עצמו הוא שלילי: נתיב ההסקה "אינו קורא ל-generate() ואינו דוגם טקסט חופשי." זה אינו פרט מימוש, זה כל העיצוב, וזה מה שמבדיל את זה מקריאה ל-Qwen3.8-Max עם סכימת JSON ובתקווה שהסוגר המסולסל ייסגר.
הנה המנגנון, כפי שהכרטיס מתאר אותו. אתם מוסרים למודל מצב משותף, סכימה של שאלות בעלות שמות, ובאופן אופציונלי עד שמונה תמונות. כל שאלה היא אחד משלושה סוגים: choice (בחירה באחת מתוך קבוצה סדורה של אפשרויות), score (דירוג על סולם אורדינלי, המוחזר כערך צפוי משוקלל בהסתברות), או noul (בינארי לא/כן). הנחיית המערכת, המצב, הסכימה ושלד JSON מלא של העוזר מרונדרים עם מציין מקום אחד לכל שדה. לאחר מכן — וזה הטריק — המודל מריץ מעבר קדמי סיבתי אחד, והלוגיטים נקראים במיקום שמיד לפני כל מציין מקום. מבוצע softmax רק על סמלי המועמדים המותרים של אותו שדה, מיושם כיול של נקודת הבדיקה, והסמלים ממופים חזרה לערכי האפשרויות המקוריות שלכם.
ההשלכות מוחשיות. מכיוון שמרחב התשובות של כל שדה נבנה בכל בקשה ולא צרוב לתוך ראש אוצר מילים, סכימה שאתם ממציאים היום אחר הצהריים לא דורשת אימון מחדש — הוסיפו שאלה, והאפשרויות הופכות לסמלים מועמדים עבור אותו שדה. ומכיוון שאין לולאת פענוח, אין אסימון פלט, אין סוגר מסולסל לשכוח, ואין לוגיקת ניסיון חוזר סביב JSON פגום. ומכיוון שכל השאלות מקבלות ציון על סמך אותה קריאה של המצב, שש-עשרה שאלות עולות במעבר קדימה אחד, לא בשש-עשרה.
המגבלות קונקרטיות באותה מידה, והכרטיס מציין אותן בלי להתחמק. בין אחת לשש־עשרה שאלות, עד 62 אפשרויות לשאלה, עד שמונה תמונות. ברירת מחדל של מקסימום 8,192 טוקנים — וקלטים שחורגים ממנו נדחים ללא חיתוך. הסעיף האחרון הזה הוא החלטת עיצוב שראויה להתעכב עליה: חיתוך שקט הוא הדרך שבה מסווג מתחיל בשקט לענות על שאלה אחרת מזו ששאלתם, ו-InternLM בחרה להיכשל בקול רם במקום זאת. זו הבחירה הנכונה, והיא גם מלכודת תפעולית, כי שרשור פניות ארוך ועוד סכימה ועוד תמונות יחצו את 8,192 מהר ממה שאתם מצפים ואין נתיב חינני — אתם מקבלים שגיאה.
היכן ש-Intern-Decision-4B מנצח, וזה לא צמוד
שני צירים, ושניהם מבניים ולא מצטברים.
• השהיה לכל החלטה — 44.16 ms בממוצע, 44.03 ms בחציון, 44.60 ms ב-p95, כפי שנמדד על RTX 4090 בודד דרך הנתיב המקומי של Hugging Face. לעומת Qwen3.8-Max, שחלון חי של שבעה ימים ב-playground שלנו מציג p50 של 2,474 ms ו-p95 של 9,789 ms בקצב של 55.4 אסימוני פלט לשנייה. זה בערך פי 56 בחציון, וההשוואה אינה כל כך לא הוגנת, כמו שהיא בין שתי פעולות שונות: מודל אחד מסווג, והאחר מנמק ואז כותב. הפער אמיתי, וכך גם הסיבה לו.
• עלות לכל החלטה — וזה חישוב אריתמטי, לא דעה. קחו קריאת טריאז׳ תמיכה מציאותית: 800 אסימוני קלט של מצב וסכימה, ו־150 אסימוני פלט של JSON מובנה. ב־Qwen3.8-Max זה 800 × $2.00/M ועוד 150 × $6.00/M, או בערך $0.0025 לכל החלטה, לפני אסימון חשיבה בודד — ו־Qwen3.8-Max הוא מודל חשיבה, כך שצד הפלט קטן באופן אופטימי. מיליון החלטות עולות בערך $2,500. אותו מיליון החלטות על Intern-Decision-4B עולה אפס באסימונים וכ־12.3 שעות של זמן RTX 4090. ל־Intern-Decision-4B אין מחיר פלט כי אין לו פלט.
העסקה כנה וברורה: ה-4B זקוק ל-GPU שבבעלותך או שאתה שוכר, הוא תופס את ה-GPU הזה, והוא יכול לעשות רק דבר אחד בלבד. אבל אם הדבר האחד הזה הוא מה שהמוצר שלך עושה מיליוני פעמים ביום, האריתמטיקה שלמעלה היא המקרה העסקי כולו, ושום כמות של יכולות של מודלי חזית לא תשנה זאת.
המספר ש-Qwen 3.8 אינו מפרסם: כיול
זהו הגורם המבדיל השקט, והוא הדבר שרוב ההשוואות יפספסו כי הוא לא נראה כמו מבחן ביצועים.
Intern-Decision-4B מחזיר התפלגות על ערכי האפשרויות שלך, לא רק תווית — בתוספת ציון ביטחון, ולגבי שאלות noul ההסתברות המכוילת ל'כן'. InternLM מדווחת על ציון Brier של 0.347 ועל שגיאת כיול צפויה של 0.065 בכל הסוויטה שלה, ומספקת את הטמפרטורה המותאמת בצ'קפוינט: 1.99241824, כשהיא הותאמה בנפרד לגודל הזה באמצעות מזעור לוג-נראות שלילית על 1,728 מקרי כיול ייעודיים עם 1,693 מקרי ולידציה מוחזקים. תוויות סוויטת הבדיקה לא שימשו לבחירתה. יש אבחון שני ועצמאי של 96 מקרים בכרטיס המשתמש בהתפלגויות ייחוס מדויקות ולא בתוויות מדגמיות, והוא מראה ש-Brier/ECE הכולל עובר מ-0.628 / 0.213 לפני כיול ל-0.550 / 0.089 אחרי — שלב הכיול מפחית את השגיאה הצפויה ביותר ממחצית.
כעת חפשו את אותו נתון בצד של Qwen 3.8. הוא לא נמצא שם. אליבאבא מפרסמת ציוני Artificial Analysis Index, GPQA Diamond, terminal-bench, SciCode, tau-banking וריקול של הקשר ארוך — כולם מדדי יכולת. היא אינה מפרסמת מדד כיול עבור שום חבר במשפחת Qwen 3.8, מפני שהביטחון של מודל גנרטיבי אינו כמות שהספק מספק. אם המערכת שלכם זקוקה להסתברות שהיא יכולה להחיל עליה סף או לנתב לפיה, ולא לתשובה שהיא חייבת לסמוך עליה, ההבדל הזה אינו עניין של מידה. מודל אחד נותן לכם מספר עם שיעור שגיאה מתועד; האחר נותן לכם טקסט, ואתם בונים סביבו אומדן ביטחון משלכם.
במקומות שבהם Qwen 3.8 מנצח, וזה אפילו לא צמוד.
הציבו את השניים זה לצד זה בהתייחס למה שאפשר לבקש מהם לעשות, והגבולות מפסיקים להיות דקים.
• הקשר — Qwen3.8-Max מחזיק חלון של 1,000,000 טוקנים. Intern-Decision-4B דוחה כל דבר מעבר ל-8,192. זה פי 122, ואין דרך לעקוף זאת, משום שמגבלת הקלט נאכפת ולא מתבצע חיתוך.
• מודאליות קלט — Qwen3.8-Max מקבל טקסט, תמונה ווידאו. Intern-Decision-4B מקבל טקסט ותמונות, עד שמונה, ואסימוני התמונות נספרים במסגרת אותו תקציב של 8,192.
• חשיבה וכלים — Qwen3.8-Max כולל שימוש בכלים, מצב JSON ויכולות חשיבה בין היכולות המוצהרות שלו, ומציג מדד Artificial Analysis Intelligence Index של 45.4, במקום החמישה־עשר מתוך 145 מודלים במדד, עם ציון AA Coding של 76.2 במקום התשיעי מתוך 138. אלה נתונים בלתי־תלויים שפורסמו על ידי Artificial Analysis, ולא טענות של הספק. ל-Intern-Decision-4B אין רשומה ב-Artificial Analysis, אין לו שום ציון בלתי־תלוי מכל סוג, ואין לו יכולת לחשוב, לתכנן או לקרוא לשום דבר.
• פלט פתוח — Qwen3.8-Max כותב. Intern-Decision-4B לא יכול להפיק פסקה, נימוק או תוכנית. הוא יכול רק לדרג את האפשרויות שכבר חשבת לרשום.
כדאי לציין גם בצד המשקולות הפתוחות: אם אתם רוצים את ליבת Qwen 3.8 עצמה ולא את המסלול המתארח, Qwen3.8-27B הוא האח ה־dense — 27.8 מיליארד פרמטרים, Apache 2.0, חלון הקשר של 262,144 טוקנים, ובערך $0.33 / $2.40 למיליון טוקנים במקומות שבהם הוא מוגש. הוא משיג 33.7 במדד AA Intelligence Index. הוא עדיין גדול בסדר גודל מ־Intern-Decision-4B, עדיין גנרטיבי, ועדיין הכלי הלא נכון להחלטה בסט סגור בהיקף — אבל זו אפשרות הביניים הכנה, והיחיד מבין השלושה שהוא גם זול באמת וגם מסוגל באמת בו־זמנית.

לקרוא בכנות את טבלת הבנצ'מרק של InternLM עצמו
הכרטיס של Intern-Decision-4B מכיל טבלת השוואה, ומה שנעדר ממנה מלמד יותר ממה שיש בה. השורות הן Jev, Laya, SemIf, Kev, JevK5, והמודלים 0.8B ו-2B של InternLM עצמה. כל אחד מאלה הוא רשומה נוספת של System One או של מודל החלטות — Jev מ-TypeSafe AI, Laya מ-Convai Innovations, ושלושה אחרים. כל נתון מדווח על ידי הספק על גבי הארנסים של InternLM עצמה. אין בטבלה שום מודל חזית בכלל.
זו אינה השמטה. זהו ההיקף האמיתי של הטענה. הממוצע המרכזי של Intern-Decision-4B העומד על 90.02 על פני שבע סוויטות — Jevbench-Easy 100.00, Jevbench-Original 98.61, Jevbench-Hard 73.87, Typed Decision 80.55, ToolACE 96.45, AG News 90.82, WildJailBreak 89.86 — מהווה טענה למובילות בקטגוריית מודלי ההחלטה, והוא אכן מוביל בטבלה הזו, בעודו גובר על 88.74 של Jev ועל 57.77 של Laya. זו אינה טענה להתחרות ב-Qwen 3.8, ו-InternLM אינה מציגה טענה כזו בשום מקום. כרטיס המודל מתוחם לקטגוריה של עצמו, ופירוש ניצחון בקטגוריה כניצחון ביכולות הוא הטעות שהסעיף הזה נועד למנוע.
שתי אזהרות נוספות. נתוני השהיה — ממוצע של 44 ms על 4090 — נמדדו על ידי הספק, תלויים בעומס העבודה ובחומרה, ומעבר קדימה על GPU בודד אינו אותה מדידה כמו קריאה ל-API מתארח הכוללת הלוך־חזור ברשת והמתנה בתור. ופיילוט הכיול הוא 96 מקרים: כלי אבחוני, לא בנצ׳מרק, והכרטיס מציין זאת.
שאלת הפריסה, שהיא הפיצול האמיתי
תשכח לרגע מבנצ'מרקים ושאל מה כל אחד מהם דורש ממך מבחינה תפעולית.
Intern-Decision-4B תופס כ-9.1 GB בדיסק ב-bf16 — שני שברי שפה בגודל 4.26 GB ו-4.15 GB, מגדל ראייה בגודל 612 MB, ומקרן בגודל 54 MB. הוא נטען דרך קובץ בגודל 16 KB inference.py שמסופק במאגר עצמו, עם מחלקת DecisionEngine שאתה יוצר פעם אחת ומשתמש בה שוב. dict אחד של Python נכנס, dict תגובה אחד יוצא, עם דרישת Python 3.12+. הוא רץ ב-44 ms על 4090, והאח הקטן 0.8B קטן מספיק כדי לחשוב עליו בהרבה פחות. אבל המודול הוא הממשק — אין שרת, אין נקודת קצה תואמת OpenAI, ואין API מתארח. אתה בונה את השירות סביבו, ואם אתה צריך שניים מהם לגיבוי, גם את זה אתה בונה.
הצד הגנרטיבי של אותו צינור הוא החלטה שונה לחלוטין, וזה בדיוק העניין שנתב נועד עבורו. Qwen3.8-Max ו-Qwen3.8-27B שניהם זמינים לקריאה ב-OrcaRouter מאחורי אותו מפתח תואם-OpenAI, לפי מחיר המחירון של הספק עם 0% תוספת שעוברת הלאה — כך שכאשר Alibaba משנה מחיר של Qwen, הוא מתעדכן אצלנו באותו יום ולא במחזור החיוב הבא. Intern-Decision-4B אינו אחד מהמסלולים שלנו, ולא יהיה עד ש-InternLM יארח אותו במקום כלשהו; אנחנו לא מתכוונים להעמיד פנים אחרת. מה שאנחנו מכסים הוא החצי של הצינור הזה שהוא קריאת רשת: מפתח אחד ל-200+ מודלים, מעבר כשל אוטומטי אם Qwen3.8-Max נחלש — שיעור השגיאות החי שלו על פני שבעה ימים הוא 1.78% — והיכולת להשוות A/B בין שני דרגי Qwen 3.8 זה מול זה באותו נתיב בקשה לפני שאתם מתחייבים לאחד מהם.
וזהו הדפוס ששווה לאמץ. הרץ את הסקורר מקומית, כי הוא זול ומהיר ועושה דבר אחד ממוקד היטב. נתב את שלב ההיסק, כי שם באמת מתרחשים תחלופת הספקים, קיצוצי המחירים וההשבתות.

איזה מהם אתה באמת צריך לבחור?
בחרו ב-Intern-Decision-4B אם ההחלטה שלכם היא מסוג סט סגור, את התשובות שלכם אפשר למנות בתוך פרומפט, אתם מריצים את אותה החלטה בהיקף גבוה, ואכפת לכם מההסתברות לא פחות מאשר מהתווית. ניתוב פניות, סינון תוכן מול טקסונומיה קבועה, חילוץ מובנה לסכמה שבשליטתכם, רובריקות דירוג, שערים בינאריים — כל דבר שבו אדם יכול היה לכתוב את רשימת האפשרויות מראש. 4.54 מיליארד הפרמטרים לא משקרים לגבי התקרה: הכרטיס עצמו מציג את ה-4B ב-73.87 ב-Jevbench-Hard לעומת 100.00 ב-Easy, כך שככל שצורת ההחלטה קשה יותר, המודל הקטן מוותר על יותר.
בחר ב-Qwen 3.8 — כלומר Qwen3.8-Max אם אתה רוצה את הליבה המתארחת, Qwen3.8-27B אם אתה רוצה משקלים שאתה יכול להחזיק — אם התשובה אינה ניתנת למנייה מראש, אם הקלט ארוך מ-8,192 טוקנים, אם אתה צריך נימוק שתוכל להראות לבן אדם, אם אתה צריך קריאות לכלים, או אם אתה צריך וידאו. בחר בו גם אם אתה פשוט לא רוצה להפעיל GPU: 12.3 שעות של זמן 4090 למיליון החלטות הן זולות רק אם כבר יש לך את ה-4090 ומשהו אחר לעשות איתו ב-363 הימים האחרים.
בחר את שניהם אם הפייפליין שלך הוא בצורה שבה רוב הפייפליינים באמת נמצאים — מסווג זול של קבוצה סגורה בחזית, ומודל פרונטיר מאחוריו עבור המקרים שהמסווג לא בטוח לגביהם. זו התצורה שעבורה נבנה הביטחון המכויל של Intern-Decision-4B, וזו הסיבה שמספר ה-ECE שלמעלה חשוב יותר מהממוצע הראשי.
מה לצפות
שלוש שאלות פתוחות, שכולן ניתנות למענה בתוך ימים. האם InternLM מפרסמת את מאגר ה-GitHub שאליו מקשיר הכרטיס שלה עצמה — שנכון לעכשיו מחזיר 404 — ולצדו תיאור אימון? האם הכרזה תבוא אחרי המשקלים, ותהפוך דחיפה שקטה לשחרור מתועד? והאם משהו בלתי תלוי משחזר את הממוצע 90.02, או את ה-Brier 0.347, על חומרה שאינה של InternLM?
יש אי-התאמה קטנה אחת שכדאי לציין בעודכם ממתינים, כי זה מסוג הדברים שחשובים כשקובעים את גודל הפריסה. המודל נקרא 4B. מספר הפרמטרים הוא 4,539,265,536 — 4.54 מיליארד. האח 0.8B הוא 853 מיליון והאח 2B הוא 2.21 מיליארד, כששניהם מתעגלים למעלה או למטה בשבריר. רק ה-4B מתעגל למטה ביותר מחצי מיליארד. זו לא בעיה. זו תזכורת שבשחרור לא מוכרז, המסמך הוא המפרט היחיד שיש לך, ואפילו המסמך עדיין נערך.
