
Intern-Decision-2B לעומת Qwen 3.8: עמוד שדרה אחד, שתי משימות שונות מאוד
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 584 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
פתחו זה לצד זה את קובץ התצורה של internlm/Intern-Decision-2B ואת קובץ התצורה של Qwen/Qwen3.5-2B וכמעט אין שום שוני. אותם 24 שכבות, אותו גודל מוסתר של 2,048, אותם 8 ראשי query מול 2 ראשי key-value, אותו ממד ראש של 256, אותה תקרת הטמעה של 262,144 עמדות, אותו אוצר מילים של 248,320 טוקנים, אותה תבנית חוזרת של שלוש שכבות קשב ליניארי לכל שכבת קשב מלא. Intern-Decision-2B אינה ארכיטקטורה חדשה. היא עמוד השדרה הזה, אלא שהוסרה ממנה היכולת לייצר טקסט, והביטחון שלה עבר כיול — וחיסור בודד זה הוא מה שהופך את ההשוואה מול Qwen3.8-Max, דגל הדגל בעל 2.4 טריליון הפרמטרים שכל שם המשפחה "Qwen 3.8" מתייחס אליו בקצה העליון, לשווה יותר מספירת פרמטרים לאחור.
השניים אינם מתחרים, והעימות ביניהם אינו תחרות. Intern-Decision-2B הוא כיוונון עדין של Qwen3.5-2B בעל 2,213,241,664 פרמטרים, שהועלה ל-Hugging Face בשעה 05:36 UTC ב-26 בספטמבר 2026 בין שלושה אחים שלא הוכרזו, והוא אינו פולט טוקנים: הוא מקבל מצב ושאלות עם טיפוסים, מריץ מעבר קדמי סיבתי אחד, קורא לוגיטים במיקומי מציין מקום קבועים, ומחזיר התפלגות מכוילת לכל שדה. Qwen3.8-Max הוא דגם הדגל המתארח של Alibaba, מודל תערובת מומחים דליל עם כ-95 מיליארד פרמטרים פעילים לכל טוקן, חלון הקשר מולטימודלי של מיליון טוקנים, ומחיר מחירון של $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט. האחד הוא רכיב. האחר הוא שירות. השאלה המועילה היא היכן אמור לעבור התפר ביניהם בפייפליין שאתה כבר משלם עליו.
החיסור, בדיוק
כדאי להצהיר במדויק מה כיוונון ההחלטות שינה, משום שזה מבהיר מה מודל הבסיס כבר נשא.
המשימה נקראת במאגר בשם מידול שפה מסכותי אוטורגרסיבי. הקלט של העוזר מכיל שלד JSON מלא עם אסימון <decision> אחד לכל שדה; סמלי התשובה של אמת הבסיס מופיעים רק בתוויות, ולעולם לא בקלט. האימון משתמש ביישור סיבתי רגיל של האסימון הבא, שבו הלוגיט שנמצא מיד לפני סמן מנבא את התשובה של אותו שדה, וכל השדות חולקים מעבר קדימה אחד. בזמן הסקה הלוגיטים מוגבלים לסמלי התשובה החוקיים של אסימון בודד — A–Z, a–z, 0–9, ומכאן נובעת תקרת 62 האפשרויות — ואז עוברים softmax וממופים בחזרה לתוויות שלך.
אז מנגנון הטוקן הבא של מודל הבסיס נשאר שלם וללא שינוי. מה שאומן לתוכו הוא העדפה לתפוס אחת מקומץ עמדות תשובה במקום להמשיך משפט, בתוספת טמפרטורה ייחודית לצ'קפוינט של 2.100509348278, שהותאמה באמצעות נראות לוגריתמית שלילית על פני 1,728 מקרי כיול מיועדים, כאשר 1,693 הוחזקו מחוץ למדגם. הכרטיס חד-משמעי שיצירה אינה על הפרק: ה-API "מבצע ניקוד מועמדים מובנה. הוא אינו קורא ל-generate() ואינו דוגם טקסט חופשי."
המאגר גם מתעד את מה שהכיוונון לא נגע בו: הוא "מבצע כיוונון עדין של עמוד השדרה הלשוני של Qwen3.5 תוך הקפאת מגדל הראייה והמקרן." מקטע הראייה בגודל 612,517,440 בתים ב-2B זהה במספר הבתים לזה שב-4B בנקודת הביקורת של ההחלטה, מה שמתאים לרכיבים שעברו בירושה ולא לרכיבים שאומנו. נתיב התמונה עובד; הוא פשוט לא היה מה שמעבר ההחלטה הוציא עליו את תקציבו.

מה ש-2.2 מיליארד פרמטרים לא יכולים לעשות, ומה ש-2.4 טריליון עושים במקום
הכול מתפצל על ציר אחד: האם התשובה שלך כבר קיימת כרשימה.
Intern-Decision-2B משיב על קבוצה סגורה. שאלה אחת עד שש־עשרה שאלות, עד 62 אפשרויות בכל אחת, עד שמונה תמונות, הכול בתוך תקציב של 8,192 טוקנים שהמנוע מסרב לחרוג ממנו במקום לקצץ. מוחזר כהסתברויות. בזמן ממוצע של 33.28 מילישניות לבקשה על RTX 4090 בודד עם P95 של 33.55 מילישניות, ואין חיוב לכל קריאה כיוון שאין פלט לחייב בגינו.
Qwen3.8-Max כותב. הקשר של מיליון טוקנים, קלט טקסט, תמונה וווידאו, הסקה עם מצב חשיבה, קריאה לכלים ילידית, פלטים מובנים, עד 131,000 טוקני פלט בבילד 0902 המתוארך. באופן עקרוני, הוא יכול גם לקבל את אותה החלטת ניתוב ש-Intern-Decision-2B מקבל — אפשר להנחות אותו לבחור בין אפשרויות ולהחזיר JSON. שלושה דברים משתבשים כשעושים זאת. אתה משלם על הטוקנים שהוא מוציא על קבלת ההחלטה. אתה מקבל מחרוזת שהניתוח שלה עשוי להצליח או להיכשל. והמספר בתוך המחרוזת הזו הוא מה שהסמפלר הפיק, לא softmax שאפשר להחיל עליו סף של 0.8 ולפעול לפיו.
שני התיאורים נכונים ואף אחד מהם אינו מבטל את האחר. דגם הדגל בעל 2.4 טריליון פרמטרים קיים כי רוב הבעיות אינן קבוצות סגורות. כלי הניקוד בעל 2.2 מיליארד פרמטרים קיים כי תת-הקבוצה שכן ראויה לכלי זול יותר.
לוח תוצאות

• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת מגדל ראייה ומקרן, כ-4.46 GB בדיסק; Qwen3.8-Max כ-2.4 טריליון סה"כ עם כ-95 מיליארד פעילים לכל טוקן, מוגש כשירות ולא מורד.
• הקשר — 8,192 טוקנים, נדחה לעיל; 1,000,000 טוקנים עם פלט מקסימלי של 131,000 בבילד 0902.
• פלט — הסתברויות מכוילות ו-argmax, ללא טקסט שנוצר; טקסט שנוצר הכולל עקבות הסקה.
• מודאליות קלט — טקסט בתוספת עד שמונה תמונות; טקסט, תמונה ווידאו.
• עלות — אין חיוב לכל קריאה, וה-GPU בבעלותך; $2.00 למיליון טוקני קלט, $6.00 למיליון טוקני פלט, עם קריאות מהמטמון ב-$0.25 וכתיבות למטמון ב-$2.50.
• ראיות שפורסמו — טבלת ספק בת שבע חבילות עם ממוצע של 84.68, Brier 0.437 ו-ECE 0.100 על פני 10,751 שורות בדיקה, שלא שוחזרה על ידי אף אחד מחוץ ל-InternLM, על צ'קפוינט עם לייק אחד ואפס הורדות; Artificial Analysis Intelligence Index של 45.4 בדירוג 15 מתוך 145 ו-AA Coding index של 76.2 בדירוג 9 מתוך 138, שניהם נמדדו באופן בלתי תלוי.
• השהיה — 33.28 ms בממוצע לבקשה על RTX 4090 אחד, יורדת ככל שמוסיפים עיבוד באצוות; 2.655 שניות P50 עד לטוקן הראשון כפי שהקטלוג מדווח, עולה עם העומס.
שורות הראיות אינן שקולות ואין להציגן כאילו היו. לדגם הדגל של אליבאבא יש ציון מדד עצמאי מאחוריו. לצ'קפוינט של InternLM יש טבלה שהמחברים שלה עצמם הפיקו, ואת נתון הכיול במיוחד יש לקרוא ככוונה מתועדת היטב עד שהוא פוגש נתונים של מישהו אחר — וביתר שאת כאן, מפני שהגודל המסוים הזה מציג את שגיאת הכיול הצפויה הגרועה ביותר מבין שלושת אלו ש-InternLM סיפקה, 0.100 לעומת 0.066 עבור המודל שחצי מגודלו ו-0.065 עבור זה שכמעט כפול ממנו.
התפר, ואיך להריץ אותו
התהליך ההגיוני אינו בחירה בין שני אלה אלא פיצול: מודל הניקוד מטפל בהחלטות המנויות, ומודל פרונטיר מטפל בכל דבר שתשובתו אינה רשימה. מיון פניות תמיכה שמנתב לאחד משישה צוותים ומדרג דחיפות בסולם של שלוש דרגות אינו זקוק ל-95 מיליארד פרמטרים פעילים; הוא זקוק להסתברות ולסף. מסלול ההסלמה שבסופו של דבר כותב ללקוח תשובה — כן זקוק לכך.
לפיצול הזה יש צורה תפעולית. Intern-Decision-2B אינו נמצא ב-OrcaRouter — עמוד המודל שלנו עבורו מחזיר 404 ואין מסלול מתארח בשום מקום שמצאנו — לכן הוא פועל על החומרה שלך, כלומר הוא רכיב שאתה מפעיל ומנטר. Qwen3.8-Max הוא מסלול: מפתח אחד על פני יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה ללא תוספת, מה שאומר ששינוי מחיר של ספק במודל הדגל מגיע לחשבון שלך באותו יום שבו הוא נכנס לתוקף. הצבת המקטע המתארח של הצינור מאחורי אותו ממשק יחיד היא מה ששומר על המקטע הזול זול: מודל הניקוד שומר על נפח הקריאות נמוך, ואל מודל החזית מגיעים רק במקרים שבאמת זקוקים לו.

אם אתה עדיין מתלבט איזה מודד ששייך למשבצת הזו — לזה אין הערכה עצמאית, והכיול שלו הוא החלש ביותר במשפחה שלו — מעבר אוטומטי בעת כשל בין ספקים הוא הדרך לנסות אותו בנתיב שכבר יש מאחוריו חלופה עובדת, במקום להחליף את החלופה הזאת ישירות.
המשפט הכנה
אם הבעיה שלך היא החלטה מתוך קבוצה של תשובות שאתה יכול למנות, והמצב נכנס בתוך שמונת אלפים טוקנים, Intern-Decision-2B יעשה זאת בשלושים ושלושה מילישניות בחינם לכל קריאה, ואף מודל חזיתי לא יגבר עליו בציר הזה, לא משנה כמה פרמטרים תשכור. תיישם עליו כיול משלך לפני שאתה סומך על רמת הביטחון שהוא מדווח עליה.
אם הבעיה שלך היא כל דבר אחר — הסקה, הקשר ארוך, שימוש בכלים, וידאו, מסמך של מיליון טוקנים, או פשוט תשובה שעוד לא נכתבה — Qwen3.8-Max אינו רק טוב יותר. הוא היחיד מבין השניים שמסוגל לבצע את המשימה בכלל.
ואם אתה עדיין לא יכול לומר איזה משני אלה יש לך, התשובה היא כנראה שיש לך את שניהם, באותו פייפליין, וזו הארכיטקטורה שמספרי הפרמטרים אמרו לך בשקט לאורך כל הדרך.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
