כרטיס כותרת שנוצר עבור Microsoft-Decision-1 לעומת Intern-Decision-0.8B עם כתובית 'מעריך מתארח ללא מספרים מול נקודת ביקורת של 1.73 GB עם מספר לא מחמיא', עם צ'יפים שמציגים נקודת קצה של Foundry מול 852,985,920 פרמטרים, פסקת מתודולוגיה לעומת ציון WildJailBreak של 64.48, ו-32,768 טוקנים מול תקרה של 8,192.
Guides & Insights

Microsoft-Decision-1 מול Intern-Decision-0.8B: חצי אונקיה של צרות ג'יילברייק כנגד ריק מתארח

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

מתחילים מהעמודה שפוסט השקה היה משמיט. Intern-Decision-0.8B — מודל ההחלטות של InternLM עם 852,985,920 פרמטרים, שעבר כיוונון עדין מ-Qwen3.5-0.8B והועלה ל-Hugging Face ב-26 בספטמבר 2026 בלי הודעה, בלי מאמר ובלי קישור ל-GitHub שעדיין מחזיר 404 — נמדד ב-64.48 ב-WildJailBreak לעומת ייחוס של 96.29 ל-Jev 1.13 של TypeSafe. זה לא הבדל שנובע מעיגול. זו התמוטטות של חוסן הסירוב במודל שכל תפקידו הוא לשפוט קלטים, והיא מפורסמת בכרטיס של הספק עצמו, בטבלה שהמדד שלה שייך למתחרה. שימו את זה לצד Microsoft-Decision-1, שהפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026 כמעריך טקסט-בלבד שעבר אימון-המשך על Qwen3.5-9B עם מתודולוגיית הערכה מתועדת ואפס תוצאות מודפסות תחתיה, ותקבלו את הצורה האמיתית של ההתמודדות הזו. אחד מהמודלים האלה יגיד לכם מספר שגורם לו להיראות רע. השני יגיד לכם באילו מדדים הוא היה משתמש.

ההיפוך הזה שווה יותר מדף המפרט. שני המודלים מקבלים מצב וקבוצת שאלות חסומה ומחזירים הסתברויות על האפשרויות שלך — אף אחד מהם אינו מייצר טקסט, ובציר הזה הם אותו סוג של מכשיר. ההבדלים שחשובים הם מי מפעיל אותו, כמה הוא גדול, כמה אפשר לאמת, ועמודת בטיחות אחת שהמודל הקטן יותר, השקט יותר, שניתן להוריד במלואו, בחר לפרסם בכל זאת.

מה שכל אחד מהם למעשה מחזיר

Microsoft-Decision-1 הוא API מתארח, וזהו ההבדל המבני הראשון. המשקלים אינם מופצים — אין הורדה, אין מאגר, ואין מסלול כיוונון עדין — והאינטגרציה משמעה פריסת Foundry עם אימות Azure, חיוב וממשל מצורפים. הוא מבצע מעבר אחד על עד 32,768 אסימונים, תומך בשאלות כן/לא, רב-ברירה, דירוג, סיווג ושאלות בצורת מחוון, וקולט טקסט בלבד ומפיק מספרים. הוא תומך במפורש באפשרות הימנעות כגון "לא ניתן לדעת" כאשר אין די ראיות, וזה מה שהופך את הסף למשמעותי.

Intern-Decision-0.8B הוא ההסדר ההפוך. אלו משקלים ברישיון Apache 2.0, כשרישיון Qwen ממעלה הזרם נשמר לצדם כקובץ LICENSE-QWEN, כ-1.73 GB של מאגר המחולק לשלושה שברים — שבר שפה של 1.50 GB, שבר ראייה של 176 MB ומקרין של 25 MB — אשר נכנס על GPU צרכני בודד או על מחשב נייד בעל מפרט נדיב. הוא מקבל מצב, סכימה של שאלה אחת עד שש-עשרה שאלות בעלות שם עם עד 62 אפשרויות כל אחת, ובאופן אופציונלי עד שמונה תמונות, וה-inference.py המצורף שלו מתעד את החוזה בפירוט רב יותר ממה שרוב המודלים שהושקו טורחים לעשות: האפשרויות ממופות על סמלים של טוקן בודד A–Z, ואחר כך a–z, ואחר כך 0–9; הלוגיטים נקראים במיקום שמיד לפני כל <decision> מציין מקום בשלד מוכן מראש; מחושב softmax רק על המועמדים החוקיים של אותו שדה; ומופעלת טמפרטורה מכוילת.

שני הרישיונות אינם אותה רכישה. Microsoft-Decision-1 נותן לך נקודת קצה מנוהלת ובלי ארטיפקט שבבעלותך. Intern-Decision-0.8B נותן לך ארטיפקט שבבעלותך, בלי נקודת קצה, בלי חוזה תמיכה ובלי תיעוד מעבר למאגר עצמו.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

התקרה, והכיול שאפשר לבצע עליו ביקורת

שני מספרים קובעים את רוב האינטגרציות האמיתיות, ושניהם שייכים למודל הקטן.

הראשון הוא 8,192 אסימונים. מנוע ההסקה של Intern-Decision-0.8B מסרב לקלט בגודל מוגזם במקום לחתוך אותו, וזו ההתנהגות הנכונה עבור מודל ניקוד, אך גם חומה קשיחה: אין אסטרטגיית חלוקה למקטעים שמשמרת את החוזה, מפני שהמצב, הסכימה והשלד חייבים כולם להיות במעבר אחד. התקרה של Microsoft-Decision-1 גבוהה פי ארבעה, 32,768, והיא מגבלה של שירות מתארח שאפשר להעלות באמצעות הקצאה שונה, ולא קבוע בקובץ Python.

השני הוא כיול, וכאן הכיוון מתהפך. InternLM מפרסמת טמפרטורה מותאמת של 2.747760550703 עבור ה-0.8B, שנבחרה על ידי מזעור NLL על פני 1,728 מקרי כיול מיועדים, כאשר 1,693 הוחזקו לולידציה, כשהכרטיס מפורש בכך שתוויות חבילת הבדיקות לא שימשו לבחירתה. הטרנספורמציה המיושמת היא softmax על הלוגיטים המועמדים של השדה, ולאחריה softmax שני על הלוגריתם של אותה התפלגות חלקי הטמפרטורה. מכיוון שהטרנספורמציה פועלת אחרי ה-softmax הראשון ומשמרת את הסדר, היא אינה יכולה לשנות כלל את ה-argmax — היא מזיזה את הביטחון, את הסתברות ה"כן" ואת התוחלת של שאלת ניקוד, ומשאירה את התווית זהה. אם הצינור שלך קורא את התווית, הטמפרטורה חסרת השפעה. אם הוא קורא את ההסתברות, מפעיל עליה סף, או מזין אותה לחישוב תוחלת, הטמפרטורה היא ההבדל בין מספר שיש לו משמעות למספר שאין לו. העברת temperature=1 מחזירה את ההתפלגות הלא-מכוילת אם תעדיף להתאים אחת משלך.

ל-Microsoft-Decision-1 אין ארטיפקט מקביל. הלשונית Benchmarks שלו מציינת כי דיוק, שגיאת כיול, ריקול בטיחות, שיעורי חיוב שגוי ועקביות הוגנות נמדדו על בנצ'מרקים ציבוריים וקהילתיים לקבלת החלטות, בתוספת ערכות בדיקה פנימיות שנשמרו בנפרד; כי סדר האפשרויות שונה; כי הופעלו מבחנים סטטיסטיים מזווגים; וכי המודל "מתפקד באותה רמה כמו מודלים מובילים לקבלת החלטות ומציג ביצועים טובים יותר ממודלים פתוחים אחרים לקבלת החלטות שהוערכו באותה מתודולוגיה". לא מודפסת שגיאת כיול, אין טמפרטורה לבדוק, ולא מתואר פיצול אימות. התכונה היחידה שהופכת הסתברות לשימושית — האם 0.8 פירושו 0.8 — מוצהרת ולא מכומתת.

קראו את שתי הפסקאות הללו זו מול זו וההשוואה מפסיקה להיות עניין של גודל. צ'קפוינט עם 0.8 מיליארד פרמטרים שאפשר לבדוק את הכיול שלו ולהריץ את התוכנה שלו הוא, עבור צוות הערכה, אובייקט עביד יותר מאשר API מתארח שהכיול שלו הוא משפט. למודל הקטן יש גם נתון השהיה מתועד — 33.98 ms ממוצע, 33.44 ms חציון, 37.50 ms p95 לשאילתה על RTX 4090 בודד דרך נתיב Hugging Face המקומי, במדידה של InternLM עצמה — ואילו זה של Microsoft הוא משהו שמודדים דרך הפריסה שלכם, שבה הבחירה בין serverless ל-provisioned throughput תזיז את המספר יותר מאשר המודל.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Intern-Decision-0.8B. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; parameters 9B Qwen3.5 base post-trained; context 32,768 tokens; weights not distributed; calibration error not published; latency not published. Right column Intern-Decision-0.8B rows read: availability uploaded September 26, 2026; parameters 852,985,920 in 1.73 GB; input ceiling 8,192 tokens with oversize input rejected; weights Apache 2.0 and self-serve; Brier 0.530 and ECE 0.066; 33.98 ms mean on a single RTX 4090. A footer line reads that the InternLM figures are vendor-reported on InternLM's own harness with no independent reproduction.

היכן שהמודל הקטן מפסיד

שום דבר מהאמור לעיל אינו הופך את Intern-Decision-0.8B לבחירה הבטוחה, ואותה טבלה מפורסמת מסבירה מדוע. WildJailBreak ב-64.48לעומת 96.29 של Jev הוא פער של שלושים נקודות בחוסן הסירוב, בדיוק בקטגוריה שבה מנוע ניקוד פוגש קלט שאינו מהימן. מודל החלטות הוא לעתים קרובות הרכיב שמכריע אם פעולה מוצעת מותרת; מודל שקל לעקוף אותו בדיבור הוא נטל בתפקיד הזה. אם הגירעון נובע מבסיס Qwen3.5-0.8B, מיעד כיוונון ההחלטות או ממספר הפרמטרים הקטן — הדבר אינו משהו שהמאגר מספר לך, ו� אין מאמר, אין מתכון אימון ואין גילוי נתונים שיעשו זאת.

שאר הטבלה של InternLM עצמה מחמיאה יותר מהעמודה ההיא, ובכל זאת צנועה. הממוצע על פני שבע מערכות הוא 79.38 עבור ה-0.8B, לעומת 84.68 עבור ה-2B האח שלה ו-90.02 עבור ה-4B — המשפחה מטפסת בתלילות עם הגודל, וזה אות קל לכך שהטבלה לא הונדסה לאחור כדי להחמיא לדגם הדגל. AG News נוחת על 88.61 לעומת 89.57 של Jev, למעשה באותה רמה בסיווג נושאים ארבע-כיווני. בכיול, ה-0.8B מדווח על Brier של 0.530 ועל שגיאת כיול צפויה של 0.066, לעומת 0.358 ו-0.095 של Jev — ECE טוב יותר, דיוק גרוע יותר באופן מהותי. זהו פרופיל סביר למודל קטן עם טמפרטורה שהותאמה במכוון, וזה לא שילוב שצוות שיווק היה בוחר לפרסם בטעות.

כמו כן אין תאריך שחרור, אין הכרזה, אין אוסף שמאגד את שלושת הצ'קפוינטים, אין נקודת קצה מתארחת בשום מקום, ואין הערכה בלתי תלויה מכל סוג. ה-Space של ההדגמה מחזיר 401. התיאור הנכון של Intern-Decision-0.8B הוא צ'קפוינט משוחרר עם טענות שלא בוקרו — וזה מצב טוב יותר מאשר API ברשימת המתנה, כי אתה יכול למדוד אותו בתוך אחר צהריים, אבל זה אומר שנטל הוולידציה הוא כולו עליך.

בחירה, והיכן ש-OrcaRouter ממוקם

קח את Microsoft-Decision-1 אם החסם הוא רכש או קנה מידה: אתה צריך אימות Azure, חיוב אחיד והערכת Responsible AI לפני שמשהו מגיע לפרודקשן; אתה צריך הקשר של 32K; אתה צריך נקודת קצה שאינך מפעיל; או שאתה צריך שנתיב ההימנעות יהיה מתוכנן מראש ולא מגולגל ביד. קבל בתמורה שאתה לא יכול להריץ אותו, לא יכול לכוונן אותו, לא יכול לבדוק את הכיול שלו, ותמדוד את הטענה המרכזית שלו בעצמך.

קח את Intern-Decision-0.8B אם החסם הוא עלות, זיכרון או שליטה: אתה רוצה מודל ניקוד Apache-2.0 שנכנס ב-1.73 GB, פועל על חומרה שכבר יש לך, מפיק את אותה תווית בכל פעם, וניתן להחליפו באחיו ה-2B או ה-4B על ידי שינוי נתיב checkpoint. קבל בתמורה את מגבלת 8,192 הטוקנים, את עמודת WildJailBreak, ואת העובדה שאף אחד מחוץ ל-InternLM לא שחזר דבר על הכרטיס.

ההמלצה הכנה היא לעשות את שניהם, כי הם זולים מספיק כדי שעצם הדיון בכך בקושי יהיה שווה. קריאת הניקוד עצמה אינה משהו שאנחנו מנתבים — מודל שמחזיר הסתברויות במקום טקסט אינו השלמת צ'אט, ואף אחד מהשניים לא נמצא בקטלוג שלנו. מה ש-OrcaRouter מספק הוא החצי השני של הלולאה: יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI שמנסחים את הרובריקה, מייצרים את התשובות המועמדות, או פולטים את קריאת הכלי שהמעריך שלך עומד לדרג, במחיר המחירון של הספק כפי שהוא, עם 0% תוספת, כך שהורדת מחיר של ספק על גנרטור חלה אצלנו כבר באותו יום. מעבר אוטומטי בין ספקים לכשל חשוב כאן יותר מהרגיל, מפני שלצינור שמנקד כל מה שהוא רואה אין מרווח לניסיון חוזר של קריאה שנתקעה, וה-DSL של הניתוב מאפשר לך לשלוח פרומפט שופט אחד לכמה כותבים ולמזג את ההסכמה ביניהם במקום לסמוך על אחד בודד.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

שורה תחתונה

Microsoft-Decision-1 הגיע לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: מתארח, טקסט בלבד, 32,768 אסימונים, מבוסס על Qwen3.5-9B, עם פסקת מתודולוגיה במקום טבלת בנצ'מרק. Intern-Decision-0.8B הוא צ'קפוינט בנפח 1.73 GB ברישיון Apache-2.0 שהועלה ב-26 בספטמבר 2026 ומפרסם Brier של 0.530, ECE של 0.066, טמפרטורה מותאמת של 2.747760550703, 33.98 מילישניות על 4090 — וציון WildJailBreak של 64.48 שאיש לא ביקש ממנו להדפיס. אם אתם יכולים לאמת רק דבר אחד לפני אימוץ מי מהם, אמתו כיול על המקרים המתויגים שלכם; זה המספר ששני הספקים השאירו לכם למצוא.