כרטיס כותרת שנוצר ועליו הכיתוב 'Intern-Decision-2B vs Qwen 3.8', עם כותרת משנה 'עמוד שדרה אחד, שתי משימות שונות מאוד', ועם התגים 'מודל ניקוד 2.2B, 33 ms' ו'דגם מוביל 2.4T, חלון הקשר 1M', כשהלוגו של OrcaRouter משולב בפינה.
Guides & Insights

Intern-Decision-2B לעומת Qwen 3.8: עמוד שדרה אחד, שתי משימות שונות מאוד

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

פתחו זה לצד זה את קובץ התצורה של internlm/Intern-Decision-2B ואת קובץ התצורה של Qwen/Qwen3.5-2B וכמעט אין שום שוני. אותם 24 שכבות, אותו גודל מוסתר של 2,048, אותם 8 ראשי query מול 2 ראשי key-value, אותו ממד ראש של 256, אותה תקרת הטמעה של 262,144 עמדות, אותו אוצר מילים של 248,320 טוקנים, אותה תבנית חוזרת של שלוש שכבות קשב ליניארי לכל שכבת קשב מלא. Intern-Decision-2B אינה ארכיטקטורה חדשה. היא עמוד השדרה הזה, אלא שהוסרה ממנה היכולת לייצר טקסט, והביטחון שלה עבר כיול — וחיסור בודד זה הוא מה שהופך את ההשוואה מול Qwen3.8-Max, דגל הדגל בעל 2.4 טריליון הפרמטרים שכל שם המשפחה "Qwen 3.8" מתייחס אליו בקצה העליון, לשווה יותר מספירת פרמטרים לאחור.

השניים אינם מתחרים, והעימות ביניהם אינו תחרות. Intern-Decision-2B הוא כיוונון עדין של Qwen3.5-2B בעל 2,213,241,664 פרמטרים, שהועלה ל-Hugging Face בשעה 05:36 UTC ב-26 בספטמבר 2026 בין שלושה אחים שלא הוכרזו, והוא אינו פולט טוקנים: הוא מקבל מצב ושאלות עם טיפוסים, מריץ מעבר קדמי סיבתי אחד, קורא לוגיטים במיקומי מציין מקום קבועים, ומחזיר התפלגות מכוילת לכל שדה. Qwen3.8-Max הוא דגם הדגל המתארח של Alibaba, מודל תערובת מומחים דליל עם כ-95 מיליארד פרמטרים פעילים לכל טוקן, חלון הקשר מולטימודלי של מיליון טוקנים, ומחיר מחירון של $2.00 למיליון טוקני קלט ו-$6.00 למיליון טוקני פלט. האחד הוא רכיב. האחר הוא שירות. השאלה המועילה היא היכן אמור לעבור התפר ביניהם בפייפליין שאתה כבר משלם עליו.

החיסור, בדיוק

כדאי להצהיר במדויק מה כיוונון ההחלטות שינה, משום שזה מבהיר מה מודל הבסיס כבר נשא.

המשימה נקראת במאגר בשם מידול שפה מסכותי אוטורגרסיבי. הקלט של העוזר מכיל שלד JSON מלא עם אסימון <decision> אחד לכל שדה; סמלי התשובה של אמת הבסיס מופיעים רק בתוויות, ולעולם לא בקלט. האימון משתמש ביישור סיבתי רגיל של האסימון הבא, שבו הלוגיט שנמצא מיד לפני סמן מנבא את התשובה של אותו שדה, וכל השדות חולקים מעבר קדימה אחד. בזמן הסקה הלוגיטים מוגבלים לסמלי התשובה החוקיים של אסימון בודד — A–Z, a–z, 0–9, ומכאן נובעת תקרת 62 האפשרויות — ואז עוברים softmax וממופים בחזרה לתוויות שלך.

אז מנגנון הטוקן הבא של מודל הבסיס נשאר שלם וללא שינוי. מה שאומן לתוכו הוא העדפה לתפוס אחת מקומץ עמדות תשובה במקום להמשיך משפט, בתוספת טמפרטורה ייחודית לצ'קפוינט של 2.100509348278, שהותאמה באמצעות נראות לוגריתמית שלילית על פני 1,728 מקרי כיול מיועדים, כאשר 1,693 הוחזקו מחוץ למדגם. הכרטיס חד-משמעי שיצירה אינה על הפרק: ה-API "מבצע ניקוד מועמדים מובנה. הוא אינו קורא ל-generate() ואינו דוגם טקסט חופשי."

המאגר גם מתעד את מה שהכיוונון לא נגע בו: הוא "מבצע כיוונון עדין של עמוד השדרה הלשוני של Qwen3.5 תוך הקפאת מגדל הראייה והמקרן." מקטע הראייה בגודל 612,517,440 בתים ב-2B זהה במספר הבתים לזה שב-4B בנקודת הביקורת של ההחלטה, מה שמתאים לרכיבים שעברו בירושה ולא לרכיבים שאומנו. נתיב התמונה עובד; הוא פשוט לא היה מה שמעבר ההחלטה הוציא עליו את תקציבו.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

מה ש-2.2 מיליארד פרמטרים לא יכולים לעשות, ומה ש-2.4 טריליון עושים במקום

הכול מתפצל על ציר אחד: האם התשובה שלך כבר קיימת כרשימה.

Intern-Decision-2B משיב על קבוצה סגורה. שאלה אחת עד שש־עשרה שאלות, עד 62 אפשרויות בכל אחת, עד שמונה תמונות, הכול בתוך תקציב של 8,192 טוקנים שהמנוע מסרב לחרוג ממנו במקום לקצץ. מוחזר כהסתברויות. בזמן ממוצע של 33.28 מילישניות לבקשה על RTX 4090 בודד עם P95 של 33.55 מילישניות, ואין חיוב לכל קריאה כיוון שאין פלט לחייב בגינו.

Qwen3.8-Max כותב. הקשר של מיליון טוקנים, קלט טקסט, תמונה וווידאו, הסקה עם מצב חשיבה, קריאה לכלים ילידית, פלטים מובנים, עד 131,000 טוקני פלט בבילד 0902 המתוארך. באופן עקרוני, הוא יכול גם לקבל את אותה החלטת ניתוב ש-Intern-Decision-2B מקבל — אפשר להנחות אותו לבחור בין אפשרויות ולהחזיר JSON. שלושה דברים משתבשים כשעושים זאת. אתה משלם על הטוקנים שהוא מוציא על קבלת ההחלטה. אתה מקבל מחרוזת שהניתוח שלה עשוי להצליח או להיכשל. והמספר בתוך המחרוזת הזו הוא מה שהסמפלר הפיק, לא softmax שאפשר להחיל עליו סף של 0.8 ולפעול לפיו.

שני התיאורים נכונים ואף אחד מהם אינו מבטל את האחר. דגם הדגל בעל 2.4 טריליון פרמטרים קיים כי רוב הבעיות אינן קבוצות סגורות. כלי הניקוד בעל 2.2 מיליארד פרמטרים קיים כי תת-הקבוצה שכן ראויה לכלי זול יותר.

לוח תוצאות

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת מגדל ראייה ומקרן, כ-4.46 GB בדיסק; Qwen3.8-Max כ-2.4 טריליון סה"כ עם כ-95 מיליארד פעילים לכל טוקן, מוגש כשירות ולא מורד.

• הקשר — 8,192 טוקנים, נדחה לעיל; 1,000,000 טוקנים עם פלט מקסימלי של 131,000 בבילד 0902.

• פלט — הסתברויות מכוילות ו-argmax, ללא טקסט שנוצר; טקסט שנוצר הכולל עקבות הסקה.

• מודאליות קלט — טקסט בתוספת עד שמונה תמונות; טקסט, תמונה ווידאו.

• עלות — אין חיוב לכל קריאה, וה-GPU בבעלותך; $2.00 למיליון טוקני קלט, $6.00 למיליון טוקני פלט, עם קריאות מהמטמון ב-$0.25 וכתיבות למטמון ב-$2.50.

• ראיות שפורסמו — טבלת ספק בת שבע חבילות עם ממוצע של 84.68, Brier 0.437 ו-ECE 0.100 על פני 10,751 שורות בדיקה, שלא שוחזרה על ידי אף אחד מחוץ ל-InternLM, על צ'קפוינט עם לייק אחד ואפס הורדות; Artificial Analysis Intelligence Index של 45.4 בדירוג 15 מתוך 145 ו-AA Coding index של 76.2 בדירוג 9 מתוך 138, שניהם נמדדו באופן בלתי תלוי.

• השהיה — 33.28 ms בממוצע לבקשה על RTX 4090 אחד, יורדת ככל שמוסיפים עיבוד באצוות; 2.655 שניות P50 עד לטוקן הראשון כפי שהקטלוג מדווח, עולה עם העומס.

שורות הראיות אינן שקולות ואין להציגן כאילו היו. לדגם הדגל של אליבאבא יש ציון מדד עצמאי מאחוריו. לצ'קפוינט של InternLM יש טבלה שהמחברים שלה עצמם הפיקו, ואת נתון הכיול במיוחד יש לקרוא ככוונה מתועדת היטב עד שהוא פוגש נתונים של מישהו אחר — וביתר שאת כאן, מפני שהגודל המסוים הזה מציג את שגיאת הכיול הצפויה הגרועה ביותר מבין שלושת אלו ש-InternLM סיפקה, 0.100 לעומת 0.066 עבור המודל שחצי מגודלו ו-0.065 עבור זה שכמעט כפול ממנו.

התפר, ואיך להריץ אותו

התהליך ההגיוני אינו בחירה בין שני אלה אלא פיצול: מודל הניקוד מטפל בהחלטות המנויות, ומודל פרונטיר מטפל בכל דבר שתשובתו אינה רשימה. מיון פניות תמיכה שמנתב לאחד משישה צוותים ומדרג דחיפות בסולם של שלוש דרגות אינו זקוק ל-95 מיליארד פרמטרים פעילים; הוא זקוק להסתברות ולסף. מסלול ההסלמה שבסופו של דבר כותב ללקוח תשובה — כן זקוק לכך.

לפיצול הזה יש צורה תפעולית. Intern-Decision-2B אינו נמצא ב-OrcaRouter — עמוד המודל שלנו עבורו מחזיר 404 ואין מסלול מתארח בשום מקום שמצאנו — לכן הוא פועל על החומרה שלך, כלומר הוא רכיב שאתה מפעיל ומנטר. Qwen3.8-Max הוא מסלול: מפתח אחד על פני יותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה ללא תוספת, מה שאומר ששינוי מחיר של ספק במודל הדגל מגיע לחשבון שלך באותו יום שבו הוא נכנס לתוקף. הצבת המקטע המתארח של הצינור מאחורי אותו ממשק יחיד היא מה ששומר על המקטע הזול זול: מודל הניקוד שומר על נפח הקריאות נמוך, ואל מודל החזית מגיעים רק במקרים שבאמת זקוקים לו.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

אם אתה עדיין מתלבט איזה מודד ששייך למשבצת הזו — לזה אין הערכה עצמאית, והכיול שלו הוא החלש ביותר במשפחה שלו — מעבר אוטומטי בעת כשל בין ספקים הוא הדרך לנסות אותו בנתיב שכבר יש מאחוריו חלופה עובדת, במקום להחליף את החלופה הזאת ישירות.

המשפט הכנה

אם הבעיה שלך היא החלטה מתוך קבוצה של תשובות שאתה יכול למנות, והמצב נכנס בתוך שמונת אלפים טוקנים, Intern-Decision-2B יעשה זאת בשלושים ושלושה מילישניות בחינם לכל קריאה, ואף מודל חזיתי לא יגבר עליו בציר הזה, לא משנה כמה פרמטרים תשכור. תיישם עליו כיול משלך לפני שאתה סומך על רמת הביטחון שהוא מדווח עליה.

אם הבעיה שלך היא כל דבר אחר — הסקה, הקשר ארוך, שימוש בכלים, וידאו, מסמך של מיליון טוקנים, או פשוט תשובה שעוד לא נכתבה — Qwen3.8-Max אינו רק טוב יותר. הוא היחיד מבין השניים שמסוגל לבצע את המשימה בכלל.

ואם אתה עדיין לא יכול לומר איזה משני אלה יש לך, התשובה היא כנראה שיש לך את שניהם, באותו פייפליין, וזו הארכיטקטורה שמספרי הפרמטרים אמרו לך בשקט לאורך כל הדרך.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית