כרטיס כותרת הירו המציג 'Intern-Decision-0.8B' עם כותרת המשנה 'שוחרר בשקט, לא הוכרז', נושא את התגים 'ללא מאמר, ללא מאגר, ללא פוסט השקה' ו-'852,985,920 פרמטרים, 1.73 GB בדיסק', כאשר הלוגו של OrcaRouter משולב בפינה.
Guides & Insights

Intern-Decision-0.8B הגיע ללא הכרזה: מה ש-InternLM העלתה בשקט ל-Hugging Face

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הקישור ל-GitHub בכרטיס המודל מחזיר 404. ה-Space של ההדגמה מחזיר 401. אין קולקציה, אין פוסט בבלוג, אין דוח טכני, ואין תוצאת חיפוש בשום מקום עבור המחרוזת "Intern-Decision" שאינה מודעת משרה להתמחות — ובכל זאת Intern-Decision-0.8B יושב על Hugging Face ממש עכשיו כצ'קפוינט שלם, ניתן להורדה, ברישיון Apache-2.0, שעבר כיוונון עדין מ-Qwen3.5-0.8B, והועלה בשעות הקטנות של 26 בספטמבר 2026 עם שני אחים גדולים יותר שהופיעו באותן שלוש דקות: Intern-Decision-2B ו-Intern-Decision-4B. InternLM כבר שחררה בדרך הזו בעבר, וזו הסיבה שכל מה שלמטה מורכב מהמאגר עצמו ולא מהודעת השקה. ההבחנה הזו חשובה כאן יותר מהרגיל: מאגר מספר לך מה קיים, ורק הספק יכול לספר לך לשם מה זה נועד.

מה שהריפו כן אומר, בפירוט, יוצא דופן מספיק כדי להיות שווה קריאה. אלה אינם מודלי צ'אט ואינם מודלים לשוניים קטנים במובן הרגיל. Intern-Decision-0.8B מקבל פיסת מצב, סכימה של שאלות בעלות שמות שאתה כותב מראש, ובאופן אופציונלי עד שמונה תמונות, ומחזיר התפלגות תשובות עבור כל שאלה במעבר קדימה אחד. הוא אף פעם לא קורא ל-generate(). הוא אף פעם לא דוגם. אין פלט טקסט לנתח, אין JSON לתקן, אין לולאת ניסיון חוזר סביב סוגר מסולסל שמעולם לא נסגר. הצמצום הוא כל הארכיטקטורה, והוא מציב את המודל הזה באותה קטגוריה קטנה שבה נמצאים Jev 1.13 של TypeSafe ו-Laya של Convai — קטגוריה ש-InternLM ככל הנראה ערכה מולה בנצ'מרק במכוון, מפני ש-Jevbench הוא הבנצ'מארק של TypeSafe עצמה והוא העמודה הראשונה בטבלה.

הנה מה שניתן לדעת מהצ'קפוינט, מה שרק הצ'קפוינט טוען, ומה שאף אחד מחוץ ל-InternLM לא יכול לומר כרגע בכלל.

מה נמצא בפועל במאגר

הכרטיס קצר וגלוי לב בנוגע לייחוס. Intern-Decision-0.8B מתואר כ"מודל החלטה מובנה מולטימודלי שעבר כיוונון עדין מ-Qwen3.5-0.8B" — בסיס Qwen שיצא ב-28 בפברואר 2026 — והמאגר מכיל קובץ רישיון שני, LICENSE-QWEN, לצד תנאי Apache-2.0, וזה מה שמודל נגזר אמור לעשות וזה אות כנות קטן בפני עצמו. האינדקס של Hugging Face מדווח על 852,985,920 פרמטרים על פני שלושה פלחים: פלח שפה בנפח 1.50 GB, פלח ראייה בנפח 176 MB, ומקרן בנפח 25 MB. אחסון המאגר הכולל הוא כ-1.73 GB כולל קבצי טוקנייזר, מה שמכניס את כל הדבר בנוחות על GPU צרכני בודד או על מחשב נייד מצויד היטב.

הקונפיגורציה חושפת ארכיטקטורה ש-Qwen משחררת לאורך דור 3.5 ולא רשת החלטות ייעודית. מדובר ב-Qwen3_5ForConditionalGeneration עם 24 שכבות המסודרות בתבנית חוזרת של שלוש שכבות קשב ליניארי לשכבת קשב מלא אחת, גודל מוסתר של 1,024, 8 ראשי קשב מול 2 ראשי מפתח-ערך, ממד ראש של 256, והטמעת מיקום מקסימלית של 262,144 טוקנים. שכבת חיזוי ריבוי טוקנים אחת נשמרת. מסלול הראייה הוא אמיתי: הטקסט של הכרטיס מתאר טיפול בתמונות, המעבד מקבל תמונות, ונקודת הביקורת כוללת מגדל ראייה ומקרן כדי לשרת אותו — כך שהתג הרב-מודלי במאגר מגובה במשקלים, ולא רק בתגים.

התמונה המשפחתית ראויה לציון משום שהיא מעצבת את האופן שבו יש לקרוא את כל השאר. InternLM העלתה שלושה גדלים ב-40 שניות: 0.8B, אחר כך 2B, ואז 4B. ספירת הפרמטרים היא 852,985,920, 2,213,241,664 ו-4,539,265,536. הכרטיס של מודל 4B נושא מקטע נוסף — פיילוט כיול בן 96 מקרים על התפלגות ידועה, עם ציונים לפני ואחרי — שאין בכרטיס של 0.8B. חוסר הסימטריה הזה אינו ראיה לפגם במודל הקטן; הוא ראיה לכך שהתיעוד של המודל הקטן נכתב בתקציב קצר יותר, וזה בדיוק מסוג הדברים שנראים כמו מהדורה שקטה.

איך נתיב ההסקה באמת עובד

הקובץ inference.py המצורף הוא הקובץ האינפורמטיבי ביותר במאגר, מכיוון שהוא מתעד חוזה ולא פרומפט. הרצף פועל כך:

• אתה מספק בקשה עם מצב (הדבר שנשפט), שאלות (סכמה), ותמונות אופציונליות.

• האפשרויות של כל שאלה ממופות לסמלים של טוקן בודד — A עד Z, לאחר מכן אותיות קטנות, לאחר מכן ספרות, עד 62 אפשרויות לשאלה.

• הנחיית המערכת, המצב, הסכמה ושלד JSON מלא של העוזר מוצגים עם מציין מקום <decision> אחד לכל שדה.

• מתבצע מעבר קדימה סיבתי אחד. הלוגיטים נקראים במיקום מיד לפני כל מציין מקום.

• מבצעים softmax רק על הסמלים המועמדים המותרים של אותו שדה, מיושם הכיול של הצ'קפוינט, והסמלים ממופים בחזרה לערכי האפשרויות המקוריות שלך.

המנוע חושף שלושה סוגי שאלות. choice מקבל אובייקט מסודר הממפה ערכי אפשרויות לתיאורים. score מקבל רשימה — שהופכת לערכי המחרוזת "0", "1", "2" וכן הלאה — או אובייקט מסודר עם מפתחות מחרוזת מספריים סופיים, ומאפשר למודל להחזיר ערך צפוי משוקלל לפי הסתברות ולא רק קטגוריה. noul הוא החלטה בינארית שבה no בא לפני yes. התגובה מחזירה, עבור כל שדה, את התפלגות ההסתברות המכוילת, רמת ביטחון השווה להסתברות המועמד המקסימלית, החלטת ה־argmax עם שבירת שוויון לקסיקלית, ולשאלות score את הערך המספרי הצפוי ומקרא. המגבלות מפורשות: בין אחת לשש־עשרה שאלות לבקשה, עד 62 אפשרויות בכל אחת, תקרת קלט כברירת מחדל של 8,192 טוקנים שנדחית ולא נחתכת, ומקסימום של שמונה תמונות שהטוקנים שלהן נספרים במסגרת התקרה הזו.

שני פרטים ברשימה הזאת ראויים לתשומת לב, כי הם קובעים אם אפשר לסמוך על הפלט. הראשון הוא שלא מוכנסות תשובות זהב לפרומפט — המודל מדרג מועמדים שהתשובה לגביהם לא הוצגה לו. השני: usage.output_tokens אינו ספירת טוקנים של טקסט; הוא סופר שדות שקיבלו ניקוד. כל מי שמחבר את זה לחישוב קיים של תקציב טוקנים יופתע מכך, והכרטיס אומר זאת במקום להשאיר את זה להתגלות.

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

טבלת הבנצ'מרק, וכמה ממנה כדאי להאמין

היזהר, קורא, בקטע הזה: כל מספר להלן מדווח על ידי הספק ולא שוחזר. InternLM בחרה את מדדי הבנצ'מרק, בחרה את מודלי ההשוואה, הריצה את ההערכות ופרסמה את הטבלה. אין הרצה בלתי תלויה של Intern-Decision-0.8B באף לוח דירוג ציבורי, וחיפוש ב-Artificial Analysis אינו מחזיר דבר עבור המודל כלל. זה לא הופך את הטבלה לשקרית. זה הופך אותה לבלתי מבוקרת, וזה אומר שהעמודות שימושיות בעיקר לקריאת צורת התוצאה ולא את רמתה.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench, שלוש חלוקות — Intern-Decision-0.8B משיג 97.92 ב-Easy, 80.56 ב-Original ו-52.25 ב-Hard. ה-Jev של TypeSafe עומד על 100.00, 98.61 ו-72.07 באותן חלוקות.

Typed Decision — ה-0.8B משיג 77.35 לעומת 73.35 של Jev. זו העמודה היחידה שבה המודל הקטן ביותר בתחום גובר על המודל שהבנצ'מרק נקרא על שמו.

• ToolACE — 94.52 עבור ה-0.8B לעומת 91.29 עבור Jev. ToolACE הוא בנצ'מרק לקריאה לפונקציות, וראש החלטה שמתעלה על Jev בבחירת כלים הוא הטענה המהותית ביותר בטבלה.

• AG News — 88.61 מול 89.57 של Jev. למעשה, באותה רמה כמו חזית הקטגוריה הזו בסיווג נושאים לארבע מחלקות.

• WildJailBreak — 64.48 לעומת 96.29 של Jev. זו הקריסה. אפשר לטעון שזו העמודה החשובה ביותר עבור מודל שהייתם מפנים לקלט לא מהימן, וזו שבה ה-0.8B הוא הרחוק ביותר מהרפרנס.

• ממוצע — 79.38 עבור ה-0.8B, 84.68 עבור אחיה ה-2B, 90.02 עבור ה-4B. המשפחה מטפסת בתלילות, וזה בדיוק מה שמצפים לו, והדבר עצמו מהווה טיעון מתון לכך שהטבלה לא הונדסה לאחור כדי להחמיא לדגם הדגל.

• כיול — Brier 0.530 ושגיאת כיול צפויה 0.066 עבור ה-0.8B. Jev מדווח 0.358 ו-0.095. קריאה של שני אלה יחד מעלה תמונה ברורה יותר מאשר כל מספר לבדו: ה-0.8B מכויל טוב יותר מ-Jev במובן ECE — רמות הביטחון המוצהרות שלו עוקבות אחרי הדיוק שלו מקרוב יותר — ובמקביל הוא מדויק פחות באופן משמעותי בסך הכול. זהו פרופיל סביר למודל קטן עם טמפרטורה מכוילת בכוונה, וזהו לא צירוף מחמיא לפרסום בטעות.

לקבוצת ההשוואה יש תכונה אחת בולטת: היא נשלטת על ידי מודלי החלטה. Jev, Laya, SemIf, Kev ו-JevK5 כולם מופיעים; הבנצ׳מרק של הטבלה עצמה הוא של TypeSafe. InternLM בחרה להימדד בטריטוריה של מתחרה, תוך שימוש בהרנס של מתחרה, ואז פרסמה את העמודות שבהן המודל הקטן ביותר שלה מפסיד. זהו סוג ההחלטה שצוות מקבל כשהוא לא מתכנן קמפיין שיווקי סביב ההשקה — מה שעולה בקנה אחד עם כל שאר הדברים באופן שבו זה הושק.

טמפרטורת הכיול היא המספר המעניין ביותר

Intern-Decision-0.8B מתאים טמפרטורת ברירת מחדל של 2.747760550703, באמצעות מזעור NLL על פני 1,728 מקרי כיול מיועדים עם 1,693 מקרי אימות נפרדים. הכרטיס מבהיר במפורש שתוויות ערכת הבדיקה לא שימשו לבחירתה. הטרנספורמציה המיושמת היא p = softmax(candidate_logits.float()) ולאחריה calibrated_p = softmax(log(p) / T).

זה כיול הסתברות של מועמד, לא טמפרטורת דגימה, וההבחנה הזו אינה קפדנות יתרה. מכיוון שהטרנספורמציה מוחלת אחרי ה-softmax ומשמרת את הסדר, היא אינה יכולה לשנות כלל את החלטת ה-argmax. היא מזיזה את הביטחון, את ההסתברות החדשה ל'כן', ואת הערך הצפוי של שאלת ניקוד — ומותירה את ההחלטה הראשית זהה. אם זרימת העבודה שלך קוראת את התווית, הטמפרטורה היא חסרת השפעה. אם זרימת העבודה שלך קוראת את ההסתברות — מחילה עליה סף, מדרגת לפיה, או מזינה אותה לחישוב ערך צפוי בהמשך — הטמפרטורה היא ההבדל בין מספר שיש לו משמעות לבין מספר שאין לו. העברת temperature=1 מחזירה את ההתפלגות הלא-מכוילת, וזה פתח מילוט שימושי למי שרוצה להחיל כיול משלו על גבי זה.

הטמפרטורה מותאמת בנפרד לכל צ'קפוינט ולא משותפת. מודל 4B משתמש בערך שונה, 1.99241824, והכרטיס מורה לך להשתמש במודול ההסקה שמסופק עם הגודל שהורדת, כך שכיול ברירת המחדל שלו יתאים. כל מי שמעתיק עטיפת הסקה ממודל אחים אחד למשנהו יחיל בשקט טמפרטורה שגויה.

שלושים וארבעה מילישניות, ותוצאה שלא אמורה להיות אפשרית

InternLM מדד השהיה מקצה-לקצה לכל שאילתה על RTX 4090 בודד תוך שימוש בנתיב Hugging Face המקומי — מדידה אמיתית, אך גם תצורת ההגשה האיטית ביותר האפשרית, שכן פריסת ייצור הייתה משתמשת ב-runtime מהודר או ב-runtime עם אצוות. Jev רשום ב-109.70 ms ממוצע ו-106.30 ms חציוני עם p95 של 146.70 ms. Intern-Decision-0.8B מגיע ל-33.98 / 33.44 / 37.50 ms.

המספר ששווה לעצור עליו הוא האח בגודל 2B: ממוצע 33.28 ms, חציון 33.15 ms. ה-2B מהיר יותר מ-0.8B, בפער קטן מספיק כדי להיות רעש אבל לא בכיוון שספירת הפרמטרים מנבאת. זו אינה שגיאה בטבלה וזה לא ממש קשור למודלים. מודל קבלת החלטות מבצע בדיוק מעבר קדמי אחד על פני פרומפט שאורכו נקבע על ידי המצב, הסכימה ותיאורי האפשרויות — לא על ידי משהו שהמודל כותב, כי הוא לא כותב דבר. עבור פרומפטים במשטר הזה, עיבוד הפרומפט שולט וספירת הפרמטרים היא עלות מסדר שני. ההשלכה המעשית היא שהסיבה הרגילה לפנות לצ'קפוינט הקטן ביותר — שאתה משלם לפי טוקן — לא חלה כאן. הסיבה האמיתית לבחור ב-0.8B על פני ה-2B היא טביעת הרגל בזיכרון והעובדה שכל המאגר שלו נכנס ב-1.73 GB, לא בתפוקה.

מה שלא ניתן עדיין לקבוע

זה החלק שפוסט השקה היה עונה עליו, ושאין מאגר יכול לענות עליו.

אין תאריך שחרור מוצהר, אין הודעה, ואין דבר בערוצים הציבוריים של InternLM שמתאר את המשפחה. כתובת ה-GitHub שמודפסת בכרטיס המודל אינה נפתחת. ה-Space של הדמו שאליו מפנה הכרטיס אינו פתוח לקריאה לציבור. אין Collection שמקבץ את שלושת הצ׳קפוינטים, כלומר הדרך היחידה למצוא את ה-2B או ה-4B היא להסתכל ברשימת המודלים של הארגון. אין מאמר, ולכן נתוני האימון, מתכון הכיוונון, מספר צעדי האימון, ומה ש"כיוונון החלטות" שינה במשקלים — כל אלה אינם מצוינים. אין הערכה בלתי תלויה, אין שכפול השהיה מצד שלישי, ואין עדיין ראיות לכך שמישהו מחוץ ל-InternLM הריץ את הצ׳קפוינט.

ישנן גם שתי שאלות שהכרטיס מעלה בלי לענות עליהן. הראשונה היא מה משמעות הפער ב-WildJailBreak הלכה למעשה: חוסר בחוסן הסירוב בגודל כזה הוא תכונה של הכיוונון העדין, והאם הוא משקף את מודל הבסיס, את מטרת כיוונון ההחלטות, או את מספר הפרמטרים הקטן — את זה המאגר לא מספר לך. השנייה היא מה קורה בתקרת הקלט. בקשות מעבר ל-8,192 טוקנים נדחות ולא מקוצצות, וזו ההתנהגות הנכונה עבור מודל ניקוד, אבל המשמעות היא שחלון ההקשר המעשי אינו 262,144 שהתצורה מפרסמת — אלא מה שנכנס בתוך 8,192 טוקנים של מצב, סכימה, אפשרויות וטלאי תמונה. עבור מסמכים ארוכים עם סכימות עשירות, התקרה הזו מגיעה מוקדם יותר ממה שדיאגרמת הארכיטקטורה מרמזת.

היכן זה ממוקם, ואיך לנסות את זה בלי להמר על זה

הצגת הדברים בכנות היא ש-Intern-Decision-0.8B הוא צ'קפוינט משוחרר עם טענות שלא עברו ביקורת וללא תיעוד תומך. השילוב הזה אינו סיבה להתעלם ממנו — שחרור משקלים תחת Apache-2.0 שאפשר להוריד ולמדוד באחר צהריים אחד הוא מצב טוב יותר מ-API שנמצא ברשימת המתנה — אבל הוא כן אומר שנטל האימות מוטל עליך. המנוע נטען מתיקייה מקומית, רץ על GPU בדרגת 4090 או קטן יותר, והכרטיס מספק בקשה לדוגמה שאפשר להדביק. יום של הערכה מול המקרים המתויגים שלך יגיד לך יותר על עמודת WildJailBreak ממה שטבלת הספק יכולה.

אם שכבת ההחלטה היא החלק שאתם מעריכים, יעד ההשוואה השימושי הוא שכבת החלטה מתארחת. Jev 1.13 של TypeSafe הוא המודל ש-InternLM בחנה מולו, והוא ניתן לקרוא לו היום דרך נקודת קצה אחת תואמת OpenAI במחיר של 0.042 דולר למיליון אסימוני קלט, כאשר הפלט מחויב באפס — אותו מחיר שהספק מפרסם, מכיוון שOrcaRouter מעבירה את מחיר המחירון של הספק ללא תוספת במקום להוסיף עליו מרווח. הצבת ראש החלטה בגודל 0.8B באירוח עצמי ו-API החלטה מתארח על אותו מפתח, באותו אחר הצהריים, היא ניסוי זול בהרבה מלחבר שני חוזים נפרדים כדי לענות על אותה שאלה.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

מה שישנה את התמונה הזו הוא לא בנצ'מרק. זו הופעת מאגר ה-GitHub, או ש-InternLM מפרסמת את מתכון הכיוונון, או ריצה עצמאית ראשונה של הצ'קפוינט שמגיעה לטבלת מובילים. עד שאחד מהדברים האלה יקרה, התיאור המדויק של Intern-Decision-0.8B הוא צר, לא מחמיא, וכולו לטובתו: המשקלים אמיתיים, חוזה ההסקה מתועד טוב יותר מכפי שרוב המודלים שהושקו מצליחים לתעד, והשיווק עוד לא התחיל.