
Microsoft-Decision-1 לעומת Intern-Decision-4B: האחד מפרסם את הכיול שלו, והאחר מפרסם את המתודולוגיה שלו
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
הצב Microsoft-Decision-1 לצד Intern-Decision-4B ותקבל השוואה שנקבעת פחות לפי יכולת אלא לפי מה שכל ספק היה מוכן לפרסם. המודל של מיקרוסופט הגיע לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: בסיס Qwen3.5-9B, שעבר אימון-המשך מטעם מיקרוסופט, טקסט בלבד, הקשר של 32,768 טוקנים, המשקולות אינן מופצות, מתודולוגיית הערכה המתארת דיוק, שגיאת כיול ומבחנים סטטיסטיים מותאמים — ואף לא תוצאה אחת. המודל Intern-Decision-4B של InternLM הועלה ל-Hugging Face ב-26 בספטמבר 2026 בשעה 05:36:37 UTC בלי שום הודעה מאחוריו, הוא מכוונן דק מ-Qwen3.5-4B, מקבל גם תמונות וגם טקסט, פועל ב-44 אלפיות השנייה על RTX 4090 בודד, ומדפיס טבלה מלאה של נתוני Brier ושל שגיאת כיול צפויה. שניהם מחזירים התפלגות הסתברות מעל האפשרויות שאתה מספק. רק אחד מהם אומר לך עד כמה הוא עושה זאת טוב.
ההיפוך הזה — שהמודל הגדול יותר, הממומן טוב יותר, הוא דווקא האטום — הוא כל הצורה של ההתמודדות הזו, והוא מכריע את הבחירה עבור רוב הצוותים מהר יותר מכל שורת מפרט.
המספר האחד שמפריד ביניהם
InternLM מדווחת על Brier 0.347 ו-ECE 0.065 עבור Intern-Decision-4B בכל חבילת הבנצ'מרקים שלה, עם ציון ממוצע של 90.02 על פני Jevbench-Easy (100.00), Jevbench-Original (98.61), Jevbench-Hard (73.87), Typed Decision (80.55), ToolACE (96.45), AG News (90.82) ו-WildJailBreak (89.86). אלה נתונים שהספק מדווח על ההרנס של הספק עצמו, ושורות Jevbench בפרט הן משפחת הבנצ'מרקים של הפרויקט עצמו — יש לקרוא אותן כהערכה עצמית, לא כאימות בלתי תלוי. אך אלה מספרים עם סקאלה מוצהרת, ו-ECE בפרט הוא הנתון שאומר לך אם 0.8 שמוחזר שווה לפעול על פיו.
מיקרוסופט אינה מפרסמת מקבילה. הלשונית Benchmarks בעמוד הקטלוג של Microsoft-Decision-1 מתארת מה נמדד וטוענת שהמודל "מתפקד בקנה אחד עם מודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שנבחנו באותה מתודולוגיה", כאשר התחומים החזקים ביותר מצוינים כהסקה, יישום כללים ועמידות לפורמט פרומפט, והחלשים ביותר כידע תחומי מיוחד. אין Brier, אין ECE, אין טבלת דיוק. אם החלטת האימוץ שלך זקוקה לנתון כיול לפני שתוכל לקבוע סף הסלמה, אחד משני המודלים הללו נותן לך אותו והאחר מבקש שתמדוד אותו בעצמך.

היכן ששני החוזים באמת שונים
על פני השטח, המודלים האלה מקבלים את אותה קריאה. אתה מספק מצב, סכימה של שאלות בעלות שמות, וקבוצה קבועה של אפשרויות; אתה מקבל בחזרה הסתברות לכל אפשרות בלי טוקן אחד של טקסט שנוצר. ההבדלים מתגלים בשוליים של אותו חוזה.
• מודאליות — Microsoft-Decision-1 הוא טקסטואלי בלבד באופן מפורש ואינו מקבל או מפיק תוכן של תמונה, אודיו או וידאו. Intern-Decision-4B מקבל תמונות אופציונליות לצד המצב, עד שמונה מהן בכל קריאה, וזה מה שהופך אותו למועמד למיון צילומי מסך, בדיקות פריסת מסמכים וניתוב QA חזותי.
• קרדינליות שאלות — InternLM מתעדת מ-1 עד 16 שאלות לכל קריאה, עד 62 אפשרויות בכל שאלה, על פני שלושה סוגי שדות (choice, score, noul). Microsoft מתעדת את הפורמטים — כן/לא, רב-ברירה, דירוג, סיווג, מחוון — וקריאה בודדת על פני עד 32K אסימונים, אך לא תקרה למספר השאלות בכל קריאה.
• הקשר — Microsoft מציינת 32,768 טוקנים. הכרטיס של Intern-Decision-4B מציין את מגבלותיו בשאלות, באפשרויות ובתמונות ולא כמספר הקשר אחד, כך שאי אפשר להשוות ביניהם לפי נתון יחיד.
• הפצה — Microsoft-Decision-1 הוא API של Foundry המתארח; משקולות המודל אינן מופצות ואין הורדה. Intern-Decision-4B הוא Apache-2.0 ב-Hugging Face כאשר רישיון Qwen במעלה הזרם נשמר בתור LICENSE-QWEN, כלומר יש לשמור על רישיון זה ועל הודעות במעלה הזרם אם תפיץ מחדש.
• צורת עלות — המשקולות של InternLM לא עולות דבר להרצה, והן מצוטטות ב-44.16 ms בממוצע, 44.60 ms ב-P95, על RTX 4090 אחד. המחיר לכל טוקן של Microsoft אינו מודפס כלל בעמוד המודל.
• משילות — מיקרוסופט מספקת הערכת AI אחראי, נהלי פריסה מתועדים, והחרגות מפורשות (לא ליצירת טקסט, שו"ת פתוח, שיחה, תרגום או סיכום; לא להיות מקבל ההחלטות האוטומטי היחיד בהחלטות בעלות השלכות לגבי אנשים). InternLM מספקת כרטיס מודל שמצהיר בגילוי לב על מקוריות — משקולות "ששונו על ידי כוונון החלטות" — ושום דבר שדומה לחבילת תאימות.

שתי סיבות שונות מאוד לכך שקשה להשוות את נתוני השהיה
Microsoft-Decision-1 אינו מפרסם נתון השהיה, כך שאין מה להציב לצד הממוצע של InternLM, 44.16 מילי־שניות. זו אינה השמטה קטנה עבור עומס העבודה הזה. המודלים האלה קיימים כדי להיקרא פעמים רבות בתוך צינור עיבוד — פעם אחת לכל מסמך מאוחזר, פעם אחת לכל קריאת כלי מוצעת, פעם אחת לכל תגובה שמדורגת — וההבדל בין ארבע החלטות בשנייה לבין ארבעים הוא ההבדל בין לדרג מדגם לבין לדרג הכול. המספר של InternLM ניתן להשגה היום על חומרה שאפשר לשכור לפי שעה; את זה של Microsoft יש למדוד דרך פריסת Foundry שלך, וצורת הפריסה שתבחר (ללא שרת בתשלום לפי שימוש לעומת provisioned throughput) תשנה אותו יותר מאשר המודל עצמו.
זה גם המקום שבו החצי של OrcaRouter בתבנית נעשה רלוונטי, וזה החצי הגנרטיבי בלבד. איננו מארחים את Microsoft-Decision-1 או Intern-Decision-4B — מודל שמחזיר הסתברויות במקום טקסט אינו משהו שמנתבים אליו השלמות צ'אט, ואף אחד מהם אינו מופיע בקטלוג שלנו. מה שעומד מאחורי המפתח האחד שלנו שתואם OpenAI הוא מאגר של יותר מ-200 מודלים שעושה את הכתיבה: פרומפט השופט שנוסח על ידי מודל אחד, תשובות המועמדים שהופקו על ידי שניים אחרים, קריאת הכלי שמקבלת ניקוד לפני שהיא רצה. מחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך שהורדת מחיר במודל יוצר נכנסת לתוקף אצלנו באותו היום, ומעבר אוטומטי לגיבוי שומר על הצד הגנרטיבי של לולאת ניקוד פעיל כאשר ספק בודד נחלש — מה שחשוב כאן יותר מהרגיל, כי לצינור שמנקד כל מה שהוא רואה אין מרווח לנסות שוב קריאה שנתקעה.

מי צריך לקחת איזה?
בחר בIntern-Decision-4B אם אחד מהבאים נכון: אתה צריך לדרג גם תמונות וגם טקסט, אתה צריך מספר כיול לפני שתוכל לשחרר, אתה רוצה את האפשרות להריץ את המודל על החומרה שלך בתוך גבול שבשליטתך, או שאתה רוצה לכוונן אותו. הנקודה האחרונה ראויה להדגשה — מודל ניקוד עם משקולות פתוחות בנפח 4B עם מעטפת מתועדת הוא מודל שאתה יכול להתאים לתוויות שלך, ו-Microsoft-Decision-1 הוא API מתארח ללא מסלול כיוונון עדין וללא משקולות להתאמה.
בחר בMicrosoft-Decision-1 אם החסם הוא רכש ולא ביצועים: אתה צריך אימות של Azure, חיוב מאוחד, ממשל והערכת Responsible AI של הספק לפני שמשהו מגיע לפרודקשן, ואתה צריך חלון הקשר של 32K עבור מסמכים ארוכים שמגבלות ה-per-call של המודל 4B מסבכות. היעדר בנצ'מרקים מפורסמים הוא עלות אמיתית, אבל זו עלות שאפשר לסגור בתוך אחר צהריים על ידי הרצת סט מתויג משלך דרך שני המודלים והשוואת ECE — וזה מה שתעשה בכל מקרה לפני שתסמוך על הטבלה של מי מהספקים.
התשובה הלא-נוחה היא ששניהם זולים מספיק כדי לבדוק, עד כדי כך שהמחלוקת בקושי שווה דיון. Intern-Decision-4B צריך GPU שכנראה כבר יש לך. Microsoft-Decision-1 צריך פריסת Foundry ומדגם של החלטות מתויגות משלך. העבר את הנתונים שלך דרך שניהם, חשב כיול על תת-הקבוצה שחשובה לך, ותן למספרים להכריע — וזה, באופן הולם, בדיוק למה מיועדים המודלים האלה.
