כרטיס כותרת שנוצר עבור Intern-Decision-4B, עם כתובית 'מודל החלטה מובנה שעונה מבלי לכתוב טוקן', נושא שלושה צ'יפים עם הכיתוב 'ללא הכרזה', 'שלוש נקודות ביקורת ב-40 שניות' ו'ללא הערכות בלתי תלויות', עם כותרת תחתונה עם הכיתוב 'נתונים לפי כרטיס המודל של InternLM; שום דבר כאן אינו משוחזר באופן בלתי תלוי.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

Intern-Decision-4B: InternLM שחררה מודל החלטות שמשיב בלי לכתוב טוקן

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שלושה מאגרי מודלים הופיעו בעמוד ה-Hugging Face של InternLM בתוך ארבעים שניות ב-26 בספטמבר 2026: Intern-Decision-0.8B בשעה 05:35:57 UTC, Intern-Decision-2B בשעה 05:36:19, ו-internlm/Intern-Decision-4B בשעה 05:36:37. ה-4B הוא המעניין. הוא fine-tune של Qwen3.5-4B שמקבל מצב משותף, סכימה של שאלות בעלות שם, ותמונות אופציונליות, ומחזיר התפלגות תשובות מכוילת לכל שאלה במעבר קדימה אחד. הוא לעולם לא מייצר טקסט. בהערות השחרור שלו נאמר זאת במפורש: "ה-API הזה מבצע ניקוד מועמדים מובנה. הוא לא קורא ל-generate() או דוגם טקסט חופשי." ארבעים שניות של העלאות ואף לא שורת הכרזה אחת בשום מקום — אין פוסט בבלוג, אין ציוץ, אין changelog, אין עמוד השקה. מה שקיים הוא כרטיס מודל, קובץ inference.py, וארבעה שברי safetensors.

A screenshot of the internlm organisation page on Hugging Face, showing the organisation's Recent Activity feed with the Intern-Decision-2B repository listed as published about an hour before the capture, above the organisation's model list and its 18 collections.

מה שוחרר, ומה לא

המשפחה היא הדבר הראשון שצריך לעשות נכון, מפני שהכרטיס של ה-4B נושא אותה בשקט. טבלת הבנצ'מרקים שלו מפרסמת שורות עבור Intern-Decision-0.8B ו-Intern-Decision-2B לצד שורות משל עצמו, וכל שלושת הצ'קפוינטים נחתו ב-hub בתוך אותה דקה. המאגר של ה-2B לעולם אינו מקושר מהכרטיס של ה-4B — צריך למצוא אותו דרך פיד ההעלאות של הארגון.

מה שלא שוחרר הוא כמעט כל מה ששחרור בדרך כלל מביא:

• בלי הודעה מוקדמת — אפס סיקור ברשת, אין הצהרה של הספק בשום שפה שיכולנו למצוא.

• אין דמו — הכרטיס מקשר ל-Space בכתובת huggingface.co/spaces/internlm/intern-decision; נקודת הקצה הזו מחזירה HTTP 401, כלומר היא אינה ציבורית, ולא שהיא שבורה.

• אין אוסף — אוסף המודלים המפורסם בכתובת huggingface.co/collections/internlm/intern-decision גם מחזיר 401.

• אין מאגר קוד — הקישור ל-GitHub של הכרטיס, github.com/internlm/Intern-Decision, מחזיר 404, ורשימת המאגרים של ארגון InternLM אינה מכילה פרויקט כזה.

• אין אימוץ — נכון לזמן כתיבת שורות אלה, ה-4B מציג לייק אחד ואפס הורדות.

זה כל המשטח הידוע. התייחס לכל מספר שלהלן כאל זה של הספק עצמו, כי אף אחד אחר עוד לא הריץ את הדבר הזה.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face, showing the model title, the Demo, Model Weights and GitHub links, the description naming Qwen3.5-4B as the base model, and the five-step 'How inference works' list describing single-token symbol mapping, the assistant JSON skeleton, one causal forward pass, a softmax over candidate-symbol logits, and probability calibration.

חוזה ההסקה הוא המוצר

רוב הכרטיס מוקדש לתהליך בן חמישה שלבים, וזה מספר לך היכן נעשתה העבודה ההנדסית. השאלות והאפשרויות שומרות על סדרן. האפשרויות של כל שאלה ממופות לסמלים של אסימון בודד — A עד Z, ואז a עד z, ואז 0 עד 9. אלה 62 סמלים, וזו בדיוק הסיבה שהכרטיס מגביל שאלה ל-62 אפשרויות. הפרומפט מרונדר מפרומפט המערכת המקורי, המצב, סכימת ההחלטה ושלד JSON מלא של עוזר עם <decision> מציין מקום לכל שדה, תוך שמירה על תבנית הצ'אט של נקודת הבדיקה ובלוק חשיבה ריק. לאחר מכן מעבר קדימה סיבתי אחד. הלוגיטים נקראים במיקום ממש לפני כל מציין מקום, softmax פועל רק על הלוגיטים של סמלי המועמדים המותרים של אותו שדה, מתבצע כיול, והסמלים ממופים בחזרה לערכי האפשרויות שלך.

התוצאה היא צורה קבועה: אין לולאת פענוח, אין דגימה, אין מנתח, אין משטח הזיות, ותקרה קשיחה של החלטה אחת לכל שאלה בכל מעבר. שלושה סוגי שאלות נתמכים — choice עם מפת קריטריונים מסודרת, score עם רשימה או מפה עם מפתחות מספריים, ו-noul, בינארי לא/כן.

הפרט במפרט הטכני שהכי חשוב

הכרטיס מפורש בכך שקלטים "נדחים ללא קיטוע" מעל DecisionEngine(max_length=8192). קרא זאת לצד התצורה ומשהו מוזר עולה לפני השטח: מגדל הטקסט הבסיסי מצהיר על max_position_embeddings של 262,144. עמוד השדרה יכול לפנות לרבע מיליון אסימונים; המעטפת ששוחררה מסרבת לכל דבר מעבר ל-8,192. זה אינו מודל הקשר ארוך עם ברירת מחדל שמרנית — זהו מודל לניקוד החלטות שההרנס שלו עצמו מגביל את הראיות שאתה רשאי למסור לו. אם שאלת הניתוב שלך תלויה ביותר מ-8,000 אסימוני מצב בקירוב, נקודת ביקורת זו כפי שהיא נשלחת לא תענה עליה, והיא תסרב במקום לקצץ את הקלט שלך.

ניתן להשתמש בעד שמונה תמונות, והכרטיס מציין שאסימוני תמונות נספרים במסגרת אותה מגבלה של 8,192.

A generated timeline card titled 'Three checkpoints, forty seconds', listing Intern-Decision-0.8B at 05:35:57 UTC, Intern-Decision-2B at 05:36:19 UTC and Intern-Decision-4B at 05:36:37 UTC on 26 September 2026, with a footer reading 'Upload timestamps from the InternLM organisation feed on Hugging Face. No announcement accompanied any of the three.' The OrcaRouter logo is composited in the bottom-right corner.

בתוך המשקולות

ארבעה שברים, 4.54 מיליארד פרמטרי BF16, וקונפיגורציה שמסבירה את שם הגודל: יש מגדל טקסט, מגדל ראייה של בערך שני תריסרים שכבות עם גודל טלאי של 16 פיקסלים, ומקרן ביניהם. צד הטקסט הוא 32 שכבות בגודל מוסתר 2,560, עם 16 ראשי קשב מול 4 ראשי מפתח/ערך, אוצר מילים של 248,320 טוקנים והטמעות קשורות. סוגי השכבות מתחלפים במרווח קבוע — שלוש שכבות קשב ליניארי, ואז שכבת קשב מלא אחת, וחוזר חלילה. רק שכבות הקשב המלא נושאות קשב גלובלי, וההטמעה הסיבובית היא חלקית בפקטור של 0.25. טעינתו דורשת Python 3.12 או חדש יותר, PyTorch 2.9.1 ו-Transformers 5.14.1, ורשימת הקבצים עדיין מכילה את קבצי הטוקנייזר, המיזוגים ואוצר המילים במקום להישען על טוקנייזר בצד ההאב.

המספרים, ומי שהפיק אותם

כל מה שבסעיף הזה נמדד על ידי InternLM ופורסם בכרטיס המודל. שום דבר מכך לא שוחזר על ידי צד שלישי, ואין רשומה של Artificial Analysis, אין דירוג Arena ואין שורה בלוח המובילים עבור המודל הזה בשום מקום.

לאורך שבעה מערכי הערכה, ה-4B מגיע בממוצע ל-90.02, עם ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065. באותה טבלה מופיעים Intern-Decision-0.8B ב-79.38 ו-Intern-Decision-2B ב-84.68, כך שהמשפחה מתעקלת כלפי מעלה עם הגודל — 4.7 נקודות מ-0.8B ל-2B, ואז עוד 5.3 ל-4B. הטבלה כוללת גם חמש שורות שהספק לא אימן: Jev ב-88.74, JevK5 ב-85.16, SemIf ב-84.23, Kev ב-79.56, ו-Laya ב-57.77. אלה הורצו על ידי InternLM על ההרנס של InternLM מול הצ'קפוינט של InternLM. הם אינם המספרים של אותם פרויקטים עצמם, ולקרוא אותם ככאלה היא הטעות הקלה ביותר הזמינה כאן.

השהיה נמדדת על RTX 4090 בודד דרך הנתיב המקומי של Hugging Face, והכרטיס מסמן את הערכים ככאלה שתלויים בעומס העבודה ובחומרה. ה-4B מציג 44.16 ms בממוצע, 44.03 ms בחציון ו-44.60 ms ב-P95 — פער של הרבה פחות ממילישנייה בין החציון לזנב, וזה מה שמאפיין מעבר קדימה בעל צורה קבועה. שתי נקודות הביקורת הקטנות יותר נמצאות שתיהן בסביבות 33 ms, כאשר ה-2B מקדים במעט את ה-0.8B בממוצע ובחציון, וכדאי לשים לב לכך ולא להחליק זאת: שתי אלו קרובות מספיק כדי להימצא בתוך רעש המדידה זו של זו.

כיול, וההסתייגויות הכנות שבו

הצ'קפוינט מגיע עם טמפרטורת ברירת מחדל של 1.99241824, שהותאמה בנפרד עבור מודל זה באמצעות מזעור לוג-נראות שלילית על 1,728 מקרי כיול ייעודיים, כאשר 1,693 הוחזקו בנפרד לצורך ולידציה. הכרטיס מציין שתוויות חבילת הבדיקות לא שימשו לבחירתה. המימוש הוא כיול הסתברות מועמדים, ולא טמפרטורת דגימה: הוא משנה את הביטחון, את ההסתברות הבינארית ואת הציון הצפוי, בעוד שהחלטת ה-argmax נותרת ללא שינוי.

אבחון נפרד של 96 מקרים מדווח אז על ההשפעה. בעמודות ה"לפני ואחרי" של InternLM עצמו, ה-Brier וה-ECE הכוללים של ה-4B נעים מ-0.628 / 0.213 ל-0.550 / 0.089, לעומת 0.595 / 0.130 אצל Jev. שתי קריאות כנות של הטבלה הזו: הכיול בבירור עובד, ועמודת ה"לפני" אינה מה ששום משתמש אי-פעם יראה, שכן ברירת המחדל הנשלחת היא הטמפרטורה המותאמת. כדאי גם לציין — שתיים משש קטגוריות האבחון גרועות יותר עבור ה-4B מאשר עבור Jev, והגרועה שבהן, ראיות יומיות והטיית תצפית, משתפרת ל-0.575 / 0.210 אך עדיין מפגרת אחרי 0.603 / 0.114 של Jev. בחתך הזה הכיול מצמצם את הפער בלי לסגור אותו.

איפה נתב מתאים, ואיפה הוא עדיין לא

המכשול המעשי בשימוש במודל הזה אינו הדיוק, אלא האריזה. הגרסה המשוחררת מספקת מחלקת Python שאתם מייבאים לאחר הורדת ארבעה שברים, ולא נקודת קצה HTTP שאפשר לקרוא לה. זה בדיוק הפער ששכבת ניתוב קיימת כדי לסגור — מפתח אחד ליותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, ו-מעבר אוטומטי לגיבוי כשספק מתערער — אבל עלינו להיות גלויים: OrcaRouter אינה כוללת כיום את Intern-Decision-4B או כל מודל מסוגו. הקטלוג שלנו אינו מפרט אותו, ואין לקרוא כאן דבר כהצהרה על זמינות. מה שכן можем להציע הוא ההחלטה הזולה יותר: אם ברצונכם לנסות מדרג החלטות בעל 4.5 מיליארד פרמטרים לפני נתיב ייצור, תוכלו לבנות אותו בתוך ראוטר עם נפילה חזרה למודל כללי, כך שיום כיול גרוע יעלה לכם בניסיון חוזר ולא בהשבתה.

מה היה משנה את התמונה

שלושה דברים, לפי סדר חשיבות. מישהו מחוץ ל-InternLM צריך לשחזר את הממוצע 90.02 ואת שגיאת הכיול הצפויה 0.065 — טענות כיול שמעולם לא פגשו ערכת בדיקה זרה הן המספרים הפחות ניתנים להעברה בלמידת מכונה. טביעת הרגל של הכרטיס עצמו צריכה להופיע: ה-Space, האוסף, מאגר ה-GitHub. והספק צריך לומר אם זה מוצר או ארטיפקט מחקרי, מפני שרישיון למחקר בלבד ורישיון Apache-2.0 אינם אותה התחייבות, וה-4B בחר ב-Apache-2.0 עם רישיון Qwen שנשמר לצידו. עד אז, המסגור הנכון הוא זה שההעלאה עצמה מרמזת עליו: זהו checkpoint אמיתי עם חוזה הסקה אמיתי ולוח ציונים לא מאומת לחלוטין, שפורסם בלי שאיש יידע.

לעת עתה, הסיכום הכנה הוא צר ושימושי. אם הבעיה שלך היא "בחר אחת מחמש תוויות ניתוב ותגיד לי עד כמה אתה בטוח", מודל 4.5B שפולט 62 לוגיטים ולא מייצר פרוזה הוא צורה ניתנת להצדקה להערכה. אם הבעיה שלך כוללת מסמך ארוך, יותר משמונה תמונות, או כל צורך להסביר את התשובה במילים, הצ'קפוינט הזה כפי שהוא מסופק הוא הכלי הלא נכון, ושום כמות של ליטוש בנצ'מרקים מצד הספק לא תשנה את זה.