כרטיס כותרת שנוצר עבור Microsoft-Decision-1 לעומת Intern-Decision-4B, עם כיתוב משנה "שני מדרגים, אחד עם מספרים ואחד בלי", עם תגיות שעליהן כתוב 9B לעומת 4B, API מתארח לעומת משקולות פתוחות, ללא מבחני ביצועים מפורסמים לעומת Brier 0.347 ו-ECE 0.065, וכותרת תחתונה של מקורות שמציינת שהנתונים של Microsoft אינם משוחזרים ונתוני InternLM מדווחים על ידי הספק.
Guides & Insights

Microsoft-Decision-1 לעומת Intern-Decision-4B: האחד מפרסם את הכיול שלו, והאחר מפרסם את המתודולוגיה שלו

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצב Microsoft-Decision-1 לצד Intern-Decision-4B ותקבל השוואה שנקבעת פחות לפי יכולת אלא לפי מה שכל ספק היה מוכן לפרסם. המודל של מיקרוסופט הגיע לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: בסיס Qwen3.5-9B, שעבר אימון-המשך מטעם מיקרוסופט, טקסט בלבד, הקשר של 32,768 טוקנים, המשקולות אינן מופצות, מתודולוגיית הערכה המתארת דיוק, שגיאת כיול ומבחנים סטטיסטיים מותאמים — ואף לא תוצאה אחת. המודל Intern-Decision-4B של InternLM הועלה ל-Hugging Face ב-26 בספטמבר 2026 בשעה 05:36:37 UTC בלי שום הודעה מאחוריו, הוא מכוונן דק מ-Qwen3.5-4B, מקבל גם תמונות וגם טקסט, פועל ב-44 אלפיות השנייה על RTX 4090 בודד, ומדפיס טבלה מלאה של נתוני Brier ושל שגיאת כיול צפויה. שניהם מחזירים התפלגות הסתברות מעל האפשרויות שאתה מספק. רק אחד מהם אומר לך עד כמה הוא עושה זאת טוב.

ההיפוך הזה — שהמודל הגדול יותר, הממומן טוב יותר, הוא דווקא האטום — הוא כל הצורה של ההתמודדות הזו, והוא מכריע את הבחירה עבור רוב הצוותים מהר יותר מכל שורת מפרט.

המספר האחד שמפריד ביניהם

InternLM מדווחת על Brier 0.347 ו-ECE 0.065 עבור Intern-Decision-4B בכל חבילת הבנצ'מרקים שלה, עם ציון ממוצע של 90.02 על פני Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) ו-WildJailBreak (89.86). אלה נתונים שהספק מדווח על ההרנס של הספק עצמו, ושורות Jevbench בפרט הן משפחת הבנצ'מרקים של הפרויקט עצמו — יש לקרוא אותן כהערכה עצמית, לא כאימות בלתי תלוי. אך אלה מספרים עם סקאלה מוצהרת, ו-ECE בפרט הוא הנתון שאומר לך אם 0.8 שמוחזר שווה לפעול על פיו.

מיקרוסופט אינה מפרסמת מקבילה. הלשונית Benchmarks בעמוד הקטלוג של Microsoft-Decision-1 מתארת מה נמדד וטוענת שהמודל "מתפקד בקנה אחד עם מודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שנבחנו באותה מתודולוגיה", כאשר התחומים החזקים ביותר מצוינים כהסקה, יישום כללים ועמידות לפורמט פרומפט, והחלשים ביותר כידע תחומי מיוחד. אין Brier, אין ECE, אין טבלת דיוק. אם החלטת האימוץ שלך זקוקה לנתון כיול לפני שתוכל לקבוע סף הסלמה, אחד משני המודלים הללו נותן לך אותו והאחר מבקש שתמדוד אותו בעצמך.

A generated two-column scoreboard for Microsoft-Decision-1 and Intern-Decision-4B across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus Qwen3.5-4B fine-tuned by InternLM; weights hosted API only versus Apache-2.0 download; modality text only versus text plus up to eight images; context 32,768 tokens versus per-call limits of one to sixteen questions and up to 62 options each; published scores none versus a vendor-reported average of 90.02 with Brier 0.347 and ECE 0.065; and latency not published versus 44.16 ms mean on an RTX 4090. A footer notes Microsoft figures are unreproduced and InternLM figures vendor-reported.

היכן ששני החוזים באמת שונים

על פני השטח, המודלים האלה מקבלים את אותה קריאה. אתה מספק מצב, סכימה של שאלות בעלות שמות, וקבוצה קבועה של אפשרויות; אתה מקבל בחזרה הסתברות לכל אפשרות בלי טוקן אחד של טקסט שנוצר. ההבדלים מתגלים בשוליים של אותו חוזה.

• מודאליות — Microsoft-Decision-1 הוא טקסטואלי בלבד באופן מפורש ואינו מקבל או מפיק תוכן של תמונה, אודיו או וידאו. Intern-Decision-4B מקבל תמונות אופציונליות לצד המצב, עד שמונה מהן בכל קריאה, וזה מה שהופך אותו למועמד למיון צילומי מסך, בדיקות פריסת מסמכים וניתוב QA חזותי.

• קרדינליות שאלות — InternLM מתעדת מ-1 עד 16 שאלות לכל קריאה, עד 62 אפשרויות בכל שאלה, על פני שלושה סוגי שדות (choice, score, noul). Microsoft מתעדת את הפורמטים — כן/לא, רב-ברירה, דירוג, סיווג, מחוון — וקריאה בודדת על פני עד 32K אסימונים, אך לא תקרה למספר השאלות בכל קריאה.

• הקשר — Microsoft מציינת 32,768 טוקנים. הכרטיס של Intern-Decision-4B מציין את מגבלותיו בשאלות, באפשרויות ובתמונות ולא כמספר הקשר אחד, כך שאי אפשר להשוות ביניהם לפי נתון יחיד.

• הפצה — Microsoft-Decision-1 הוא API של Foundry המתארח; משקולות המודל אינן מופצות ואין הורדה. Intern-Decision-4B הוא Apache-2.0 ב-Hugging Face כאשר רישיון Qwen במעלה הזרם נשמר בתור LICENSE-QWEN, כלומר יש לשמור על רישיון זה ועל הודעות במעלה הזרם אם תפיץ מחדש.

• צורת עלות — המשקולות של InternLM לא עולות דבר להרצה, והן מצוטטות ב-44.16 ms בממוצע, 44.60 ms ב-P95, על RTX 4090 אחד. המחיר לכל טוקן של Microsoft אינו מודפס כלל בעמוד המודל.

• משילות — מיקרוסופט מספקת הערכת AI אחראי, נהלי פריסה מתועדים, והחרגות מפורשות (לא ליצירת טקסט, שו"ת פתוח, שיחה, תרגום או סיכום; לא להיות מקבל ההחלטות האוטומטי היחיד בהחלטות בעלות השלכות לגבי אנשים). InternLM מספקת כרטיס מודל שמצהיר בגילוי לב על מקוריות — משקולות "ששונו על ידי כוונון החלטות" — ושום דבר שדומה לחבילת תאימות.

A screenshot of the Intern-Decision-4B model card on Hugging Face, read 10 October 2026, showing the internlm organisation, 83 likes, the Image-Text-to-Text pipeline tag, Transformers and Safetensors badges, and qwen3_5 and decision-making as the listed tags alongside the model card heading.

שתי סיבות שונות מאוד לכך שקשה להשוות את נתוני השהיה

Microsoft-Decision-1 אינו מפרסם נתון השהיה, כך שאין מה להציב לצד הממוצע של InternLM, 44.16 מילי־שניות. זו אינה השמטה קטנה עבור עומס העבודה הזה. המודלים האלה קיימים כדי להיקרא פעמים רבות בתוך צינור עיבוד — פעם אחת לכל מסמך מאוחזר, פעם אחת לכל קריאת כלי מוצעת, פעם אחת לכל תגובה שמדורגת — וההבדל בין ארבע החלטות בשנייה לבין ארבעים הוא ההבדל בין לדרג מדגם לבין לדרג הכול. המספר של InternLM ניתן להשגה היום על חומרה שאפשר לשכור לפי שעה; את זה של Microsoft יש למדוד דרך פריסת Foundry שלך, וצורת הפריסה שתבחר (ללא שרת בתשלום לפי שימוש לעומת provisioned throughput) תשנה אותו יותר מאשר המודל עצמו.

זה גם המקום שבו החצי של OrcaRouter בתבנית נעשה רלוונטי, וזה החצי הגנרטיבי בלבד. איננו מארחים את Microsoft-Decision-1 או Intern-Decision-4B — מודל שמחזיר הסתברויות במקום טקסט אינו משהו שמנתבים אליו השלמות צ'אט, ואף אחד מהם אינו מופיע בקטלוג שלנו. מה שעומד מאחורי המפתח האחד שלנו שתואם OpenAI הוא מאגר של יותר מ-200 מודלים שעושה את הכתיבה: פרומפט השופט שנוסח על ידי מודל אחד, תשובות המועמדים שהופקו על ידי שניים אחרים, קריאת הכלי שמקבלת ניקוד לפני שהיא רצה. מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך שהורדת מחיר במודל יוצר נכנסת לתוקף אצלנו באותו היום, ומעבר אוטומטי לגיבוי שומר על הצד הגנרטיבי של לולאת ניקוד פעיל כאשר ספק בודד נחלש — מה שחשוב כאן יותר מהרגיל, כי לצינור שמנקד כל מה שהוא רואה אין מרווח לנסות שוב קריאה שנתקעה.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

מי צריך לקחת איזה?

בחר בIntern-Decision-4B אם אחד מהבאים נכון: אתה צריך לדרג גם תמונות וגם טקסט, אתה צריך מספר כיול לפני שתוכל לשחרר, אתה רוצה את האפשרות להריץ את המודל על החומרה שלך בתוך גבול שבשליטתך, או שאתה רוצה לכוונן אותו. הנקודה האחרונה ראויה להדגשה — מודל ניקוד עם משקולות פתוחות בנפח 4B עם מעטפת מתועדת הוא מודל שאתה יכול להתאים לתוויות שלך, ו-Microsoft-Decision-1 הוא API מתארח ללא מסלול כיוונון עדין וללא משקולות להתאמה.

בחר בMicrosoft-Decision-1 אם החסם הוא רכש ולא ביצועים: אתה צריך אימות של Azure, חיוב מאוחד, ממשל והערכת Responsible AI של הספק לפני שמשהו מגיע לפרודקשן, ואתה צריך חלון הקשר של 32K עבור מסמכים ארוכים שמגבלות ה-per-call של המודל 4B מסבכות. היעדר בנצ'מרקים מפורסמים הוא עלות אמיתית, אבל זו עלות שאפשר לסגור בתוך אחר צהריים על ידי הרצת סט מתויג משלך דרך שני המודלים והשוואת ECE — וזה מה שתעשה בכל מקרה לפני שתסמוך על הטבלה של מי מהספקים.

התשובה הלא-נוחה היא ששניהם זולים מספיק כדי לבדוק, עד כדי כך שהמחלוקת בקושי שווה דיון. Intern-Decision-4B צריך GPU שכנראה כבר יש לך. Microsoft-Decision-1 צריך פריסת Foundry ומדגם של החלטות מתויגות משלך. העבר את הנתונים שלך דרך שניהם, חשב כיול על תת-הקבוצה שחשובה לך, ותן למספרים להכריע — וזה, באופן הולם, בדיוק למה מיועדים המודלים האלה.