כרטיס כותרת שנוצר עבור Intern-Decision-2B ועליו הכיתוב 'שוחרר בשקט, לא הוכרז', עם התגים 'קישור ה-GitHub עלה לאוויר היום' ו'2,213,241,664 פרמטרים', כשהלוגו של OrcaRouter משולב בפינה.
Engineering & Research

Intern-Decision-2B שוחרר בשקט ל-Hugging Face. הקישור ל-GitHub בכרטיס שלו זה עתה הפסיק להחזיר 404

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

מוקדם יותר היום כרטיס המודל של internlm/Intern-Decision-2Bהצביע על שלושה מקומות שבהם ניתן למצוא מידע נוסף, ושניים מהם היו מתים: ה-Space של ההדגמה החזיר HTTP 401, ו-github.com/internlm/Intern-Decisionהחזיר 404 לכל מי שלחץ עליו. נכון לשעה 08:58 UTC, המאגר שמאחורי הקישור השני קיים — ציבורי, בעומק שלושה קומיטים, ונושא קוד אימון, שני בקאנדים להסקה, חבילת הערכה עם 10,751 שורות בדיקה, מבחן כיול בן 96 מקרים ומדריך שחזור. זה הדבר היחיד שהשתנה במודל הזה מאז שהוא הופיע ב-Hugging Face בשעה 05:36 UTC ב-26 בספטמבר 2026, וזה מספיק כדי להעביר את Intern-Decision-2B מ"צ'קפוינט עם README בלתי נגיש" ל"צ'קפוינט שאפשר ממש לבדוק, לשחזר מולו ולהתווכח איתו".

המשקלים עצמם ללא שינוי וחד-משמעיים. Intern-Decision-2B הוא מודל החלטות מובנה מולטימודלי בעל 2,213,241,664 פרמטרים, שעבר כוונון עדין מתוך Qwen/Qwen3.5-2B — בסיס Alibaba מ-28 בפברואר 2026 — שוחרר תחת Apache-2.0 עם רישיון Qwen במעלה הזרם שנשמר לצידו בתור LICENSE-QWEN. זהו האמצעי מבין שלושה גדלים ש-InternLM פרסמה בארבעים שניות: Intern-Decision-0.8B בשעה 05:35:57, זה בשעה 05:36:19, ו-Intern-Decision-4B בשעה 05:36:37. עדיין אין שום הודעה מכל סוג מאחורי אף אחד מהם.

מה שהופך את הגודל הבינוני לראוי לקטע משל עצמו הוא שזה המקום שבו המשפחה מפסיקה להתנהג כצפוי. לפי הנתונים של InternLM עצמה, הוא המהיר מבין השלושה והכי פחות מכויל מבין השלושה, ושתי העובדות האלה כדאי להבין לפני שאתם מורידים ארבעה וחצי ג'יגה-בייט של משהו.

מה מאומת, ומה הוא רק דיבור של הספק

שתי קטגוריות, וצריך לשמור אותן מופרדות.

מאושר, מכיוון שזו רשימת קבצים או תגובת HTTP: מספר הפרמטרים (2,592 F32 ועוד 2,213,239,072 משקולות BF16); מפת הרסיסים (רסיס שפה של 3.76 GB, מגדל חזותי של 612.5 MB, מקרן של 50.3 MB, כ-4.43 GB של טנסורים וכ-4.46 GB של מאגר); זוג הרישיונות; מודל הבסיס; הארכיטקטורה שמתחת (Qwen3_5ForConditionalGeneration עם 24 שכבות, גודל מוסתר 2,048, 8 ראשי שאילתה מול 2 ראשי מפתח-ערך, ממד ראש 256, תבנית חוזרת של שלוש שכבות קשב ליניארי לשכבת קשב מלא אחת, שכבת חיזוי רב-אסימונים אחת שנשמרה, ותקרת הטבעה של 262,144 מיקומים); קיומו של המאגר; והעובדה שאוסף המודלים ב- huggingface.co/collections/internlm/intern-decision כעת נפתר ומפרט את כל שלושת נקודות הביקורת.

מדווחים על ידי הספק ולא משוחזרים: כל מספר דיוק, כל נתון השהיה, וטמפרטורת הכיול. אין מאמר, אין רשומה ב-arXiv, אין פוסט השקה, אין יומן שינויים, ואין הערכה בלתי תלויה — חיפוש אחר המחרוזת "Intern-Decision" לא מחזיר דבר שעוסק במודל הזה. ה-Space של הדמו עדיין מחזיר 401, מה שאומר שהוא לא ציבורי, ולא שהוא שבור. לצ'קפוינט ה-2B יש לייק אחד ואפס הורדות. אף אחד מחוץ ל-InternLM לא הריץ אותו.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal, the Demo, Model Weights and GitHub links, and the card text stating the model is 'a multimodal structured decision model fine-tuned from Qwen3.5-2B' that 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by the five-step 'How inference works' list.

חוזה ההסקה, לפי סדר ההתרחשות

הקובץ האינפורמטיבי ביותר במאגר אינו הכרטיס. הוא src/inference/engine.py והקובץ המצורף inference.py ב-Hub, מפני שבין השניים הם מתעדים חוזה ולא פרומפט.

• אתה מספק מצב — החומר הנשפט — סכימת שאלות, ובאופן אופציונלי עד שמונה תמונות. מ-1 עד 16 שאלות, עד 62 אפשרויות בכל אחת.

• האפשרויות של כל שאלה ממופות על סמלים של טוקן בודד: A–Z, לאחר מכן a–z, לאחר מכן 0–9. תקרת 62 האפשרויות אינה העדפת עיצוב, היא בדיוק מספר הסמלים של טוקן בודד שהחוזה יכול לפנות אליהם.

• תבנית ההנחיה של המערכת, המצב, הסכימה ושלד JSON מלא של העוזר מרונדרים עם מציין מיקום אחד <decision>לכל שדה. תבנית הצ'אט של הצ'קפוינט ובלוק החשיבה הריק נשמרים כפי שהם.

• מעבר קדימה סיבתי אחד מתבצע. הלוגיטים נקראים במיקום שמיד לפני כל מציין מקום — לא אחריו, ולא בטוקן שנוצר.

• מבוצע softmax רק על הסמלים המועמדים החוקיים של אותו שדה, מוחל הכיול של הצ'קפוינט, והסמלים ממופים בחזרה לערכי האפשרויות המקוריים שלך.

הכרטיס מבהיר באופן בוטה מה הדבר הזה: "ה-API הזה מבצע ניקוד מועמדים מובנה. הוא לא קורא ל-generate() או דוגם טקסט חופשי." DecisionEngine(max_length=8192) מסרב לקלט גדול מדי במקום לחתוך אותו, כך שבקשה שלא נכנסת נכשלת בקול רם במקום לאבד בשקט את הפסקה האחרונה שלה. גם רשימת הבקאנדים כנה — backend="hf" הוא ברירת המחדל והיחיד שמיושם במאגר Hugging Face, וזה שווה לדעת מכיוון שמהדורת GitHub כוללת גם בקאנד XTuner והשניים אינם זהים מבחינה נומרית. מדריך ההערכה של InternLM עצמו אומר זאת: "הבדלים ב-Kernel וב-BF16 יכולים לשנות הסתברויות ולעיתים גם תוויות."

האנומליה שבאמצע

הנח את שלושת הצ׳קפוינטים זה לצד זה בטבלה של InternLM עצמה, והצורה מוזרה מספיק כדי להיות הסיפור.

• ממוצע על פני שבע חבילות — Intern-Decision-0.8B 79.38, Intern-Decision-2B 84.68, Intern-Decision-4B 90.02. מסודרים, כפי שהייתם מצפים מהגדלת המשקלים.

• השהיה על RTX 4090 בודד — 33.98 מ״ש בממוצע עבור ה-0.8B, 33.28 מ״ש עבור ה-2B, 44.16 מ״ש עבור ה-4B. הגודל האמצעי הוא המהיר מבין השלושה, בפער קטן מספיק כדי להיחשב לרעש על GPU בודד, אך עקבי לאורך הממוצע, החציון (33.15 מ״ש) וה-P95 (33.55 מ״ש).

• ציון Brier, ככל שנמוך יותר כך טוב יותר — 0.530, 0.437, 0.347. מונוטוני עם הגודל, כפי שכלל ניקוד תקין בדרך כלל נוהג.

• שגיאת כיול צפויה, ככל שנמוך יותר כך טוב יותר — 0.066 עבור ה-0.8B, 0.100 עבור ה-2B הזה, 0.065 עבור ה-4B. הגודל האמצעי הוא הגרוע ביותר, והוא גרוע מהמודל שחצי מגודלו.

השורה האחרונה היא המעניינת, והטמפרטורות המותאמות מאששות אותה ולא מסבירות אותה. כל צ'קפוינט נושא טמפרטורה משלו המותאמת ב-NLL: 2.747760550703 עבור ה-0.8B, 2.100509348278 עבור ה-2B, 1.992418 עבור ה-4B. כל אחת מהן הותאמה על 1,728 מקרי כיול ייעודיים, עם 1,693 שנשמרו להערכה, על ידי מזעור הלוג-נראות השלילית על פני חיפוש בטמפרטורה הופכית בטווח [0.01, 100], כאשר תוויות ערכת המבחנים הושארו במכוון מחוץ להתאמה. הטמפרטורה של ה-2B נמצאת בין זו של שני אחיו, וזה מה שהיית מצפה לו אילו האנומליה הייתה תוצר לוואי של ההתאמה. זה אינו המצב: הערך המותאם מונוטוני עם הגודל, בעוד שהשגיאה שלאחר הכיול אינה מונוטונית. לפי המדידה של InternLM עצמה, הצ'קפוינט בעל 2.2 מיליארד הפרמטרים הוא הפחות אמין מבין השלושה כאשר הוא אומר לך עד כמה הוא בטוח.

שתי הסתייגויות לפני שזה הופך למסקנה. ECE עם עשרה תאים שווי-רוחב ורמת ודאות של הסתברות מרבית הוא סטטיסטיקה רועשת בחבילת הבדיקות הקטנה שהטבלה הזו משתמשת בה — Jevbench-Hard, 111 פריטים, כך שכל עמודת ה-ECE נשענת על כמאה ומשהו שאלות ועל בחירת חלוקה לתאים. וגם internlm/Intern-Decision-2B הוא הכרטיס היחיד מבין השלושה שלא נושא את סעיף הכיול הנוסף שיש לכרטיס ה-4B, כך שיש כאן פחות תיעוד, לא יותר. יש לקרוא את 0.100 כסיבה להתאים טמפרטורה משלך ולא כפסק דין על המשקולות.

A rendered comparison card titled 'Three checkpoints, forty seconds' listing the Intern-Decision 0.8B, 2B and 4B columns against seven rows: upload timestamps 05:35:57 / 05:36:19 / 05:36:37 UTC; parameters 852,985,920 / 2,213,241,664 / 4,539,265,536; seven-suite average 79.38 / 84.68 / 90.02; Brier 0.530 / 0.437 / 0.347; ECE 0.066 / 0.100 / 0.065; fitted temperature 2.747761 / 2.100509 / 1.992418; and RTX 4090 mean latency 33.98 ms / 33.28 ms / 44.16 ms, with a footer noting every figure is vendor-reported and unreproduced.

מה המאגר מוסיף, ומה הוא עדיין מסתיר

מהדורת GitHub שלמה יותר מכרטיס המודל, שהוא עצמו אינפורמטיבי — מעבדה שהתכוונה ליצור ארטיפקט של מאמר בדרך כלל אינה מספקת מחולל כיול דטרמיניסטי וחבילת הערכה שמאמתת גיבוב לצד משגר האימון.

מה שכיום פומבי: קוד האימון ומטרת ה-masked-next-token (סמלי תשובות אמת-הקרקע מופיעים רק בתוויות, ולעולם לא בקלט; התשובה של כל שדה נחזית על ידי ה-logit מיד לפני הסמן שלו, וכל השדות חולקים מעבר קדימה אחד); שבע חבילות הדיוק עם גיבובי SHA-256 מאומתים וספירות שורות; קוד הניקוד; סקריפטי התאמת הטמפרטורה והשחזור, שבהם נטען שהשחזור משנה אפס החלטות; בנצ'מרק כיול ההתפלגות בן 96 המקרים wraz עם המחולל והמנקד הלא-מקוון שלו; והדגמת דפדפן המוגשת על loopback עם POST /v1/decisions (עם כינוי /v1/jev).

מה מוחרג במפורש, בלשונו של המאגר עצמו: "נתוני אימון, רשומות כיול/אימות פרטיות, תמונות, צינורות הכנה ומשקולות מודל אינם נכללים." המאגר אינו מכיל קובץ רישיון כלל, ולכן תנאי הקוד אינם מצוינים אף שהמשקולות הן Apache-2.0. והרכב פיצול הכיול — אילו 1,728 מקרים, ומאיפה — נותר לא מגולה, וזו ההשמטה היחידה שמגבילה עד כמה ניתן לבדוק את מספרי ה-ECE.

הגדלים שאנחנו מנתבים בפועל, והאחד שאיננו מנתבים.

Intern-Decision-2B אינו נמצא ב-OrcaRouter. עמוד המודל שלנו עבורו מחזיר 404, לא מצאנו שום נקודת קצה מתארחת עבורו בשום מקום, ואין לקרוא שום דבר כאן כהצהרת זמינות. הדרך היחידה לקרוא לו היום היא להוריד את הצ'קפוינט ולהריץ את inference.py לצד המשקלים.

זה חשוב להחלטה שהמאמר הזה באמת עוסק בה, כי מודד שאיש לא מגיש הוא מודד שעליך להפעיל. אם ההחלטה בקבוצה סגורה שאתה מנסה לקבל קרובה בצורתה למה שהמשפחה הזו עושה — מצב, שאלות עם טיפוסים, הסתברויות מכוילות — ההשוואה המתארחת היא TypeSafe's Jev 1.13, שהוא המודל ש-InternLM בחנה מולו במכוון ושנמצא ב-OrcaRouter במחיר $0.042 למיליון טוקני קלט עם חלון הקשר של 65K וזמן P50 עד לטוקן הראשון של 178 ms.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

הרצה של צ'קפוינט עם 2.2 מיליארד פרמטרים באופן מקומי וקריאה למסווג מתארח הן לא אותה רכישה, אבל הן אותה בעיה, והחזקת שניהם על מפתח אחד עם מחיר המחירון של הספק מועבר הלאה בתוספת של 0% היא הסיבה להשאיר את ההשוואה פתוחה במקום להמר את הארכיטקטורה על אחד מהם.

מה היה משנה את התמונה הזו

שלושה דברים, לפי הסדר.

מישהו מחוץ ל-InternLM צריך לשחזר את הממוצע של 84.68 ואת ה-ECE של 0.100, והמאגר הוא כעת הדבר שמאפשר זאת — זו הידיעה האמיתית כאן. המבחן פומבי ומאומת ב-hash; חסר רק דף התשובות, ודף התשובות הוא הצ'ק-פוינט שכל אחד יכול כעת להוריד.

הספק צריך לומר לשם מה זה מיועד. מודל עם ערכת אימון עובדת, חבילת הערכה שפורסמה, בלי הכרזה, בלי רישיון על הקוד שלו ובלי נקודת קצה מתארחת נקרא כמו מהדורת מחקר שטרם הוכרעה לכדי מוצר. משקולות Apache-2.0 מעידות לכיוון אחד; רישיון הקוד החסר וה-Space עם 401 מעידים לכיוון האחר.

ולגודל האמצעי צריך להיות סיבה להתקיים. אם יתרון המהירות של ה-2B על פני ה-0.8B הוא אמיתי אך שולי, והכיול שלו הוא החלש מבין השלושה בכל מדד ש-InternLM פרסמה, אז ההמלצה הכנה עבור רוב הקוראים היא לשלם פי 2.6 בשטח דיסק עבור ה-4B או להשלים עם הדיוק החלש יותר של המודל הקטן. הטיעון בעד ה-2B הוא שהוא במקרה המהיר מבין המהירים — וזהו טיעון דק יותר ממה שהמסגור בעל הגוון השיווקי של המשפחה מרמז.