
Microsoft-Decision-1 לעומת Intern-Decision-2B: מהיר יותר בתשע אלפיות שנייה, ועם כיול גרוע יותר באופן מדיד
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 55 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
יש מספר בטבלה של InternLM עצמה שאסור היה שיהיה קיים, והוא הסיבה לכך שההשוואה הזו שווה יותר מדף המפרט. Intern-Decision-2B — 2,213,241,664 פרמטרים, שעבר כיוונון עדין מ-Qwen/Qwen3.5-2B, הועלה ל-Hugging Face ב-26 בספטמבר 2026 בשעה 05:36:19 UTC בלי הודעה מוקדמת — מציג 33.28 ms של השהיה ממוצעת לשאילתה על RTX 4090 בודד, וזו מהירה במעט מאחיו בעל 852 מיליון הפרמטרים, עם 33.98 ms. הוא גם מציג את הכיול הגרוע ביותר במשפחה שלו: סטיית כיול צפויה של 0.100 לעומת 0.066 של ה-0.8B, עם טמפרטורה מכוילת של 2.100509348278 לעומת 2.747760550703 של ה-0.8B. בינתיים Microsoft-Decision-1, שזמין באופן כללי ב-Microsoft Foundry מאז 8 באוקטובר 2026, אינו מפרסם לא נתון השהיה ולא סטיית כיול כלל — רק פסקת מתודולוגיה שמתארת כיצד נמדדו שניהם. אז השאלה שהעימות הזה באמת שואל היא לא איזו מהשתיים טובה יותר. היא מה אתה קונה כשאתה קונה את המידה האמצעית של משהו.
שני המודלים הם מדרגי החלטות: מצב נכנס, קבוצת שאלות תחומה נכנסת, הסתברויות מכוילות יוצאות, ללא טקסט מיוצר וללא טוקנים לפענוח. החוזה המשותף הזה הוא שהופך את ההבדלים לקריאים. Microsoft-Decision-1 הוא ממשק API מתארח של Foundry, לטקסט בלבד, על בסיס Qwen3.5-9B עם חלון של 32,768 טוקנים, ללא הפצה וללא נתיב כיוונון עדין. Intern-Decision-2B הוא צ'קפוינט Apache-2.0 שבו רישיון Qwen נשמר כ-LICENSE-QWEN, מאגר בגודל כ-4.46 GB, קוד הסקה מותאם, וללא נקודת קצה מתארחת בשום מקום.
בשביל מה הגודל הבינוני בעצם
InternLM פרסמה שלושה צ'ק-פוינטים בארבעים שניות: ה-0.8B ב-05:35:57, זה ב-05:36:19, וה-4B ב-05:36:37. בממוצע שבע הסוויטות של הספק עצמו המשפחה מטפסת בסדר שהייתם מקווים לו — 79.38, 84.68, 90.02 — וזה המקום היחיד שבו ה-2B נראה כרכישה הגיונית. בכל מקום אחר הוא נראה כמו הגודל שאיש לא היה בוחר בו בכוונה.
עיבוד פרומפט שולט בקריאת החלטה, וזהו ההסבר המכני להיפוך ההשהיה, לא תעלומה. מנקד מבצע בדיוק מעבר קדימה אחד על פרומפט שאורכו נקבע על ידי המצב, הסכמה ותיאורי האפשרויות — ולעולם לא על ידי משהו שהמודל כותב, כי הוא לא כותב דבר. במשטר הזה מספר הפרמטרים הוא עלות משנית, כך שהסיבה הרגילה לפנות לנקודת הביקורת הקטנה ביותר אינה חלה: אתה לא חוסך זמן, אתה חוסך זיכרון. המאגר כולו של ה-0.8B הוא בערך 0.8 GB לעומת 4.0 GB של המודל הזה, וזו הסיבה הכנה להעדיף אותו. הטענה האמיתית היחידה של ה-2 היא שהוא במקרה המהיר שבמהירים, בפער קטן מספיק כדי להיחשב לרעש.
לעומת Microsoft-Decision-1, הטענה הזו כמעט לא רלוונטית, מפני ששני המודלים אינם באותו משטר השהיה. המהירות של נקודת קצה מתארחת היא פונקציה של צורת הפריסה שלך — serverless לעומת תפוקה מוקצית (provisioned throughput) באותו SKU תקני — לפני שהיא פונקציה של המודל, ומיקרוסופט אינה מפרסמת נתון לכל קריאה להשוואה. מה שמיקרוסופט כן מפרסמת הוא אילוץ תפעולי נוקשה שפועל בכיוון ההפוך: הסקה באצווה מושבתת. אין ערוץ לא מקוון שדרכו ניתן לפרוס על פני זמן את עלותה של ריצת ניקוד בכמות גדולה, כך שצינור Microsoft-Decision-1 משלם את העלות האינטראקטיבית של כל החלטה, בעוד שצ'קפוינט באירוח עצמי משלם בשעות GPU בין אם הוא מבצע ניקוד ובין אם לא.
עמודת הכיול, שבה האמצע מפסיד
קרא את שלושת הכרטיסים של Intern-Decision יחד, והמשפחה מפסיקה להתנהג באופן צפוי. הדיוק הוא מונוטוני ביחס לגודל; הכיול אינו כך. ל-2B יש ECE של 0.100 — החלש מבין השלושה — וטמפרטורה מותאמת של 2.100509348278, נמוכה בהרבה מזו של ה-0.8B, 2.747760550703. הכרטיס מורה לך להשתמש במודול ההסקה שמגיע עם הגודל שהורדת, מכיוון שכיולי ברירת המחדל הם לפי checkpoint; כל מי שמעתיק wrapper מאח אחד למשנהו מחיל בשקט את הטמפרטורה השגויה.
כדאי להבין את הטרנספורמציה הזו עצמה לפני שאתם מתייחסים ל-0.100 הזה כאל פסק דין על המשקלים. היא softmax מעל הלוגיטים המועמדים של השדה, ואחריה softmax שני מעל הלוג של אותה התפלגות חלקי הטמפרטורה. מכיוון שהיא רצה אחרי ה-softmax הראשון ומשמרת את הסדר, היא לא יכולה לשנות את ה-argmax כלל. היא מזיזה את הביטחון, את הסתברות ה"כן" ואת התוחלת של שאלת ציון, ומשאירה את התווית זהה. אם ה-pipeline שלכם קורא תוויות, הטמפרטורה היא חסרת השפעה וה-ECE הוא קוריוז. אם ה-pipeline שלכם קורא הסתברויות — מחיל עליהן סף, מדרג לפיהן, מזין אותן לחישוב תוחלת — אז ECE של 0.100 הוא ההבדל בין סף שמשמעותו היא מה שכתבתם לבין סף שלא. התגובה הנכונה היא להתאים טמפרטורה משלכם על המקרים המתויגים שלכם, ולא להסיק שהמשקלים גרועים.
Microsoft-Decision-1 דורש בדיוק את אותה עבודה, עם פחות נקודת מוצא. בלשונית Benchmarks שלו נאמר כי דיוק, שגיאת כיול, זיכרון בטיחות, שיעורי חיוביים כוזבים ועקביות הוגנות נמדדו על מדדי השוואה ציבוריים וקהילתיים לקבלת החלטות בתוספת ערכות בדיקה פנימיות מוחזקות, כי סדר האפשרויות שונה, כי בוצעו מבחנים סטטיסטיים מזווגים, וכי המודל "מתפקד ברמה דומה למודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שהוערכו באותה מתודולוגיה". אין ECE. אין Brier. אין טמפרטורה. אין טבלת דיוק. המודל שכל הצעת הערך שלו היא הסתברות מהימנה הוא זה בהשוואה הזו ללא מספר כיול מפורסם כלל.

גבולות החוזה: ארבעה דברים שהמודל המתארח לא יעשה
שני המודלים מקבלים מה שנראה כמו אותה קריאה, וההבדלים חיים בשוליים שלה.
• מודאליות — Microsoft-Decision-1 הוא טקסטואלי בלבד באופן מפורש ואינו מקבל תמונות, אודיו או וידאו. Intern-Decision-2B מקבל עד שמונה תמונות לצד המצב, מה שהופך אותו למועמד למיון צילומי מסך ולבדיקות פריסה שה-API המתארח אינו יכול לספק בשום רמת דיוק.
• תקרת קלט ומצב כשל — Microsoft-Decision-1 מריץ קריאה אחת על עד 32,768 אסימונים. Intern-Decision-2B מצהיר על DecisionEngine(max_length=8192) ודוחה קלט גדול מדי במקום לקצץ אותו, וזו התנהגות נכונה עבור כלי ניקוד וגם מחסום קשיח, מפני שהמצב, הסכמה והשלד חייבים כולם להיות נוכחים במעבר אחד; שום אסטרטגיית חלוקה למקטעים אינה משמרת את החוזה.
• צורת השאלה — InternLM מתעדת בין אחת לשש-עשרה שאלות לכל קריאה, עם עד 62 אפשרויות בכל אחת, על פני שלושה סוגי שדות (choice, score, noul), כאשר noul הוא כן/לא בינארי שמחזיר הסתברות, ו-score מחזיר תוחלת משוקללת בהסתברות על סקאלה שאתם מגדירים. Microsoft מתעדת את הפורמטים — כן/לא, רב-ברירה, דירוג, סיווג, רובריקה — וכן אפשרות הימנעות נתמכת במפורש כגון "cannot tell" כשהראיות אינן מספקות, וזו השורה השימושית ביותר בעמוד לכל מי שכותב לוגיקת הסלמה.
• מחיר — עמוד המודל Microsoft-Decision-1 אינו מציג תעריף; התמחור מפנה בקישור אל משטח התמחור של Microsoft, כך שעלות לכל החלטה היא משהו שקוראים מ-Azure או מחשבונית, כש-0% ממנה מיוחס לטוקני פלט פשוט מפני שאין כאלה. Intern-Decision-2B אינו עולה דבר לקריאה, והכול מתבטא בזמן GPU, ואין לו ספק אירוח. האחסון שלו הוא כ-4.46 GB, המשתרעים על מקטע שפה של 3.76 GB, מגדל ראייה של 612.5 MB ומקרן של 50.3 MB.
מה מאומת, ומה הוא רק דיבור של הספק
ההפרדה בין שתי הקטגוריות הללו היא כל המשמעת בכל הנוגע למשפחה הזו. מאושר באמצעות רשימת קבצים או תגובת HTTP: מספר הפרמטרים, מפת הרסיסים, צמד הרישיונות, מודל הבסיס, הארכיטקטורה שמתחת — Qwen3_5ForConditionalGeneration עם 24 שכבות, גודל מוסתר של 2,048, 8 ראשי שאילתה מול 2 ראשי מפתח-ערך, ממד ראש של 256, דפוס חוזר של שלוש שכבות קשב ליניארי לכל שכבה אחת של קשב מלא, שכבה אחת נשמרת של חיזוי רב-אסימונים, ותקרת הטמעה של 262,144 עמדות שתקרת המנוע של 8,192 אסימונים הופכת לחסרת חשיבות כמעט לחלוטין.

מדווח על ידי הספק ולא משוחזר: כל מספר דיוק, כל נתון השהיה, והטמפרטורה. אין מאמר, אין רשומה ב-arXiv, אין פוסט השקה, אין יומן שינויים ואין הערכה בלתי תלויה. ה-Demo Space מחזיר 401, מה שאומר שהוא אינו ציבורי, ולא שהוא שבור. מאגר ה-GitHub שהופיע אחרי שהמודל הופיע — שלושה קומיטים, קוד אימון, שני בקאנדים להסקה, חבילת הערכה עם 10,751 שורות בדיקה, מבחן כיול של 96 מקרים ומדריך שחזור — הוא יותר תיעוד ממה שרוב ההשקות השקטות מקבלות, והוא אינו כולל משקלים, נתוני אימון או רישיון קוד. מיקרוסופט נמצאת בעמדה שונה אך סמוכה: המתודולוגיה שלה אמיתית והטענה שלה איכותנית, ואף אחת מהחברות אינה נמצאת כעת בעמדה שבה המספר המרכזי שלה ייבדק בידי מישהו מלבדך.
היכן ש-OrcaRouter ממוקם בצינור עיבוד כמו זה
אף אחד מהמודלים אינו בקטלוג שלנו, ואין לפרש דבר כאן כהצהרת זמינות. מודל שמחזיר הסתברויות במקום טקסט אינו משהו שאליו מנתבים השלמות צ'אט, וזה נכון לשניהם. מה שכן יש לנו הוא החצי הגנרטיבי של הלולאה שהמעריכים האלה נועדו לשרת: יותר מ-200 המודלים שמאחורי מפתח אחד תואם OpenAI, שכותבים את המחוון, מנסחים את תשובות המועמדים ופולטים את קריאת הכלי שמעריך מדרג לפני שהיא מבוצעת. מחיר המחירון של הספק מועבר הלאה ב-0% תוספת מחיר, כך שהורדת מחיר של ספק בצד הגנרטיבי פעילה אצלנו באותו יום, ואם אתם מעדיפים לא להמר את הסף שלכם על שופט אחד, ה-DSL לניתוב מרכיב כמה מודלים לקריאה אחת, ומיזוג מודלים מדווח על ההסכמה ביניהם כשדה שאפשר לדרג. מעבר אוטומטי לכשל שומר על הצד הזה פעיל כשספק בודד מתדרדר, וזה חשוב יותר בלולאה שמדרגת כל מה שהיא רואה מאשר באחת שעונה למשתמש מדי פעם.

שורה תחתונה
Microsoft-Decision-1 זמין באופן כללי ב-Microsoft Foundry מאז 8 באוקטובר 2026: באירוח, טקסט בלבד, 32,768 טוקנים, בסיס Qwen3.5-9B שעבר אימון-המשך (post-training) על ידי Microsoft, ללא משקלים מבוזרים, וסעיף בנצ'מרק שמתעד את המתודולוגיה שלו בלי להדפיס נתון — כולל בלי השהיה (latency), כאשר הסקה בקבוצות (batch inference) כבויה. Intern-Decision-2B הוא צ'ק-פוינט Apache-2.0 עם 2,213,241,664 פרמטרים מ-26 בספטמבר 2026, שהוא המהיר מבין שלושת אחיו עם 33.28 מ״ש על 4090 והמכויל הגרוע ביותר עם ECE של 0.100, עם טמפרטורה מותאמת של 2.100509348278 שלא יכולה לשנות תווית אבל תשנה כל רמת ביטחון שעליה אתה מפעיל סף. אם אתה רוצה את הגודל האמצעי, הצידוק הישר לקיומו דק: שלם את תוספת 2.7GB עבור הדיוק של ה-4B או קבל את טביעת הרגל של ה-0.8B, ובכל אחד מהעולמות התאם כיול משלך לפני שסף מתקרב לפרודקשן.
מה שאנחנו כן מספקים הוא החצי הגנרטיבי של הלולאה שהמעריכים האלה נועדו לשרת: יותר מ-200 מודלים שמאחורי מפתח אחד תואם OpenAI שכותבים את מחוון הניקוד, מנסחים את התשובות המועמדות ופולטים את קריאת הכלי שאותה מעריך מדרג לפני שהיא מבוצעת.
