
Intern-Decision-4B: InternLM שחררה מודל החלטות שמשיב בלי לכתוב טוקן
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
שלושה מאגרי מודלים הופיעו בעמוד ה-Hugging Face של InternLM בתוך ארבעים שניות ב-26 בספטמבר 2026: Intern-Decision-0.8B בשעה 05:35:57 UTC, Intern-Decision-2B בשעה 05:36:19, ו-internlm/Intern-Decision-4B בשעה 05:36:37. ה-4B הוא המעניין. הוא fine-tune של Qwen3.5-4B שמקבל מצב משותף, סכימה של שאלות בעלות שם, ותמונות אופציונליות, ומחזיר התפלגות תשובות מכוילת לכל שאלה במעבר קדימה אחד. הוא לעולם לא מייצר טקסט. בהערות השחרור שלו נאמר זאת במפורש: "ה-API הזה מבצע ניקוד מועמדים מובנה. הוא לא קורא ל-generate() או דוגם טקסט חופשי." ארבעים שניות של העלאות ואף לא שורת הכרזה אחת בשום מקום — אין פוסט בבלוג, אין ציוץ, אין changelog, אין עמוד השקה. מה שקיים הוא כרטיס מודל, קובץ inference.py, וארבעה שברי safetensors.

מה שוחרר, ומה לא
המשפחה היא הדבר הראשון שצריך לעשות נכון, מפני שהכרטיס של ה-4B נושא אותה בשקט. טבלת הבנצ'מרקים שלו מפרסמת שורות עבור Intern-Decision-0.8B ו-Intern-Decision-2B לצד שורות משל עצמו, וכל שלושת הצ'קפוינטים נחתו ב-hub בתוך אותה דקה. המאגר של ה-2B לעולם אינו מקושר מהכרטיס של ה-4B — צריך למצוא אותו דרך פיד ההעלאות של הארגון.
מה שלא שוחרר הוא כמעט כל מה ששחרור בדרך כלל מביא:
• בלי הודעה מוקדמת — אפס סיקור ברשת, אין הצהרה של הספק בשום שפה שיכולנו למצוא.
• אין דמו — הכרטיס מקשר ל-Space בכתובת huggingface.co/spaces/internlm/intern-decision; נקודת הקצה הזו מחזירה HTTP 401, כלומר היא אינה ציבורית, ולא שהיא שבורה.
• אין אוסף — אוסף המודלים המפורסם בכתובת huggingface.co/collections/internlm/intern-decision גם מחזיר 401.
• אין מאגר קוד — הקישור ל-GitHub של הכרטיס, github.com/internlm/Intern-Decision, מחזיר 404, ורשימת המאגרים של ארגון InternLM אינה מכילה פרויקט כזה.
• אין אימוץ — נכון לזמן כתיבת שורות אלה, ה-4B מציג לייק אחד ואפס הורדות.
זה כל המשטח הידוע. התייחס לכל מספר שלהלן כאל זה של הספק עצמו, כי אף אחד אחר עוד לא הריץ את הדבר הזה.

חוזה ההסקה הוא המוצר
רוב הכרטיס מוקדש לתהליך בן חמישה שלבים, וזה מספר לך היכן נעשתה העבודה ההנדסית. השאלות והאפשרויות שומרות על סדרן. האפשרויות של כל שאלה ממופות לסמלים של אסימון בודד — A עד Z, ואז a עד z, ואז 0 עד 9. אלה 62 סמלים, וזו בדיוק הסיבה שהכרטיס מגביל שאלה ל-62 אפשרויות. הפרומפט מרונדר מפרומפט המערכת המקורי, המצב, סכימת ההחלטה ושלד JSON מלא של עוזר עם <decision> מציין מקום לכל שדה, תוך שמירה על תבנית הצ'אט של נקודת הבדיקה ובלוק חשיבה ריק. לאחר מכן מעבר קדימה סיבתי אחד. הלוגיטים נקראים במיקום ממש לפני כל מציין מקום, softmax פועל רק על הלוגיטים של סמלי המועמדים המותרים של אותו שדה, מתבצע כיול, והסמלים ממופים בחזרה לערכי האפשרויות שלך.
התוצאה היא צורה קבועה: אין לולאת פענוח, אין דגימה, אין מנתח, אין משטח הזיות, ותקרה קשיחה של החלטה אחת לכל שאלה בכל מעבר. שלושה סוגי שאלות נתמכים — choice עם מפת קריטריונים מסודרת, score עם רשימה או מפה עם מפתחות מספריים, ו-noul, בינארי לא/כן.
הפרט במפרט הטכני שהכי חשוב
הכרטיס מפורש בכך שקלטים "נדחים ללא קיטוע" מעל DecisionEngine(max_length=8192). קרא זאת לצד התצורה ומשהו מוזר עולה לפני השטח: מגדל הטקסט הבסיסי מצהיר על max_position_embeddings של 262,144. עמוד השדרה יכול לפנות לרבע מיליון אסימונים; המעטפת ששוחררה מסרבת לכל דבר מעבר ל-8,192. זה אינו מודל הקשר ארוך עם ברירת מחדל שמרנית — זהו מודל לניקוד החלטות שההרנס שלו עצמו מגביל את הראיות שאתה רשאי למסור לו. אם שאלת הניתוב שלך תלויה ביותר מ-8,000 אסימוני מצב בקירוב, נקודת ביקורת זו כפי שהיא נשלחת לא תענה עליה, והיא תסרב במקום לקצץ את הקלט שלך.
ניתן להשתמש בעד שמונה תמונות, והכרטיס מציין שאסימוני תמונות נספרים במסגרת אותה מגבלה של 8,192.

בתוך המשקולות
ארבעה שברים, 4.54 מיליארד פרמטרי BF16, וקונפיגורציה שמסבירה את שם הגודל: יש מגדל טקסט, מגדל ראייה של בערך שני תריסרים שכבות עם גודל טלאי של 16 פיקסלים, ומקרן ביניהם. צד הטקסט הוא 32 שכבות בגודל מוסתר 2,560, עם 16 ראשי קשב מול 4 ראשי מפתח/ערך, אוצר מילים של 248,320 טוקנים והטמעות קשורות. סוגי השכבות מתחלפים במרווח קבוע — שלוש שכבות קשב ליניארי, ואז שכבת קשב מלא אחת, וחוזר חלילה. רק שכבות הקשב המלא נושאות קשב גלובלי, וההטמעה הסיבובית היא חלקית בפקטור של 0.25. טעינתו דורשת Python 3.12 או חדש יותר, PyTorch 2.9.1 ו-Transformers 5.14.1, ורשימת הקבצים עדיין מכילה את קבצי הטוקנייזר, המיזוגים ואוצר המילים במקום להישען על טוקנייזר בצד ההאב.
המספרים, ומי שהפיק אותם
כל מה שבסעיף הזה נמדד על ידי InternLM ופורסם בכרטיס המודל. שום דבר מכך לא שוחזר על ידי צד שלישי, ואין רשומה של Artificial Analysis, אין דירוג Arena ואין שורה בלוח המובילים עבור המודל הזה בשום מקום.
לאורך שבעה מערכי הערכה, ה-4B מגיע בממוצע ל-90.02, עם ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065. באותה טבלה מופיעים Intern-Decision-0.8B ב-79.38 ו-Intern-Decision-2B ב-84.68, כך שהמשפחה מתעקלת כלפי מעלה עם הגודל — 4.7 נקודות מ-0.8B ל-2B, ואז עוד 5.3 ל-4B. הטבלה כוללת גם חמש שורות שהספק לא אימן: Jev ב-88.74, JevK5 ב-85.16, SemIf ב-84.23, Kev ב-79.56, ו-Laya ב-57.77. אלה הורצו על ידי InternLM על ההרנס של InternLM מול הצ'קפוינט של InternLM. הם אינם המספרים של אותם פרויקטים עצמם, ולקרוא אותם ככאלה היא הטעות הקלה ביותר הזמינה כאן.
השהיה נמדדת על RTX 4090 בודד דרך הנתיב המקומי של Hugging Face, והכרטיס מסמן את הערכים ככאלה שתלויים בעומס העבודה ובחומרה. ה-4B מציג 44.16 ms בממוצע, 44.03 ms בחציון ו-44.60 ms ב-P95 — פער של הרבה פחות ממילישנייה בין החציון לזנב, וזה מה שמאפיין מעבר קדימה בעל צורה קבועה. שתי נקודות הביקורת הקטנות יותר נמצאות שתיהן בסביבות 33 ms, כאשר ה-2B מקדים במעט את ה-0.8B בממוצע ובחציון, וכדאי לשים לב לכך ולא להחליק זאת: שתי אלו קרובות מספיק כדי להימצא בתוך רעש המדידה זו של זו.
כיול, וההסתייגויות הכנות שבו
הצ'קפוינט מגיע עם טמפרטורת ברירת מחדל של 1.99241824, שהותאמה בנפרד עבור מודל זה באמצעות מזעור לוג-נראות שלילית על 1,728 מקרי כיול ייעודיים, כאשר 1,693 הוחזקו בנפרד לצורך ולידציה. הכרטיס מציין שתוויות חבילת הבדיקות לא שימשו לבחירתה. המימוש הוא כיול הסתברות מועמדים, ולא טמפרטורת דגימה: הוא משנה את הביטחון, את ההסתברות הבינארית ואת הציון הצפוי, בעוד שהחלטת ה-argmax נותרת ללא שינוי.
אבחון נפרד של 96 מקרים מדווח אז על ההשפעה. בעמודות ה"לפני ואחרי" של InternLM עצמו, ה-Brier וה-ECE הכוללים של ה-4B נעים מ-0.628 / 0.213 ל-0.550 / 0.089, לעומת 0.595 / 0.130 אצל Jev. שתי קריאות כנות של הטבלה הזו: הכיול בבירור עובד, ועמודת ה"לפני" אינה מה ששום משתמש אי-פעם יראה, שכן ברירת המחדל הנשלחת היא הטמפרטורה המותאמת. כדאי גם לציין — שתיים משש קטגוריות האבחון גרועות יותר עבור ה-4B מאשר עבור Jev, והגרועה שבהן, ראיות יומיות והטיית תצפית, משתפרת ל-0.575 / 0.210 אך עדיין מפגרת אחרי 0.603 / 0.114 של Jev. בחתך הזה הכיול מצמצם את הפער בלי לסגור אותו.
איפה נתב מתאים, ואיפה הוא עדיין לא
המכשול המעשי בשימוש במודל הזה אינו הדיוק, אלא האריזה. הגרסה המשוחררת מספקת מחלקת Python שאתם מייבאים לאחר הורדת ארבעה שברים, ולא נקודת קצה HTTP שאפשר לקרוא לה. זה בדיוק הפער ששכבת ניתוב קיימת כדי לסגור — מפתח אחד ליותר מ-200 מודלים, מחיר המחירון של הספק מועבר הלאה עם 0% תוספת, ו-מעבר אוטומטי לגיבוי כשספק מתערער — אבל עלינו להיות גלויים: OrcaRouter אינה כוללת כיום את Intern-Decision-4B או כל מודל מסוגו. הקטלוג שלנו אינו מפרט אותו, ואין לקרוא כאן דבר כהצהרה על זמינות. מה שכן можем להציע הוא ההחלטה הזולה יותר: אם ברצונכם לנסות מדרג החלטות בעל 4.5 מיליארד פרמטרים לפני נתיב ייצור, תוכלו לבנות אותו בתוך ראוטר עם נפילה חזרה למודל כללי, כך שיום כיול גרוע יעלה לכם בניסיון חוזר ולא בהשבתה.
מה היה משנה את התמונה
שלושה דברים, לפי סדר חשיבות. מישהו מחוץ ל-InternLM צריך לשחזר את הממוצע 90.02 ואת שגיאת הכיול הצפויה 0.065 — טענות כיול שמעולם לא פגשו ערכת בדיקה זרה הן המספרים הפחות ניתנים להעברה בלמידת מכונה. טביעת הרגל של הכרטיס עצמו צריכה להופיע: ה-Space, האוסף, מאגר ה-GitHub. והספק צריך לומר אם זה מוצר או ארטיפקט מחקרי, מפני שרישיון למחקר בלבד ורישיון Apache-2.0 אינם אותה התחייבות, וה-4B בחר ב-Apache-2.0 עם רישיון Qwen שנשמר לצידו. עד אז, המסגור הנכון הוא זה שההעלאה עצמה מרמזת עליו: זהו checkpoint אמיתי עם חוזה הסקה אמיתי ולוח ציונים לא מאומת לחלוטין, שפורסם בלי שאיש יידע.
לעת עתה, הסיכום הכנה הוא צר ושימושי. אם הבעיה שלך היא "בחר אחת מחמש תוויות ניתוב ותגיד לי עד כמה אתה בטוח", מודל 4.5B שפולט 62 לוגיטים ולא מייצר פרוזה הוא צורה ניתנת להצדקה להערכה. אם הבעיה שלך כוללת מסמך ארוך, יותר משמונה תמונות, או כל צורך להסביר את התשובה במילים, הצ'קפוינט הזה כפי שהוא מסופק הוא הכלי הלא נכון, ושום כמות של ליטוש בנצ'מרקים מצד הספק לא תשנה את זה.
