
Microsoft-Decision-1 מול Intern-Decision-0.8B: חצי אונקיה של צרות ג'יילברייק כנגד ריק מתארח
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 55 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 120 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 369 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
מתחילים מהעמודה שפוסט השקה היה משמיט. Intern-Decision-0.8B — מודל ההחלטות של InternLM עם 852,985,920 פרמטרים, שעבר כיוונון עדין מ-Qwen3.5-0.8B והועלה ל-Hugging Face ב-26 בספטמבר 2026 בלי הודעה, בלי מאמר ובלי קישור ל-GitHub שעדיין מחזיר 404 — נמדד ב-64.48 ב-WildJailBreak לעומת ייחוס של 96.29 ל-Jev 1.13 של TypeSafe. זה לא הבדל שנובע מעיגול. זו התמוטטות של חוסן הסירוב במודל שכל תפקידו הוא לשפוט קלטים, והיא מפורסמת בכרטיס של הספק עצמו, בטבלה שהמדד שלה שייך למתחרה. שימו את זה לצד Microsoft-Decision-1, שהפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026 כמעריך טקסט-בלבד שעבר אימון-המשך על Qwen3.5-9B עם מתודולוגיית הערכה מתועדת ואפס תוצאות מודפסות תחתיה, ותקבלו את הצורה האמיתית של ההתמודדות הזו. אחד מהמודלים האלה יגיד לכם מספר שגורם לו להיראות רע. השני יגיד לכם באילו מדדים הוא היה משתמש.
ההיפוך הזה שווה יותר מדף המפרט. שני המודלים מקבלים מצב וקבוצת שאלות חסומה ומחזירים הסתברויות על האפשרויות שלך — אף אחד מהם אינו מייצר טקסט, ובציר הזה הם אותו סוג של מכשיר. ההבדלים שחשובים הם מי מפעיל אותו, כמה הוא גדול, כמה אפשר לאמת, ועמודת בטיחות אחת שהמודל הקטן יותר, השקט יותר, שניתן להוריד במלואו, בחר לפרסם בכל זאת.
מה שכל אחד מהם למעשה מחזיר
Microsoft-Decision-1 הוא API מתארח, וזהו ההבדל המבני הראשון. המשקלים אינם מופצים — אין הורדה, אין מאגר, ואין מסלול כיוונון עדין — והאינטגרציה משמעה פריסת Foundry עם אימות Azure, חיוב וממשל מצורפים. הוא מבצע מעבר אחד על עד 32,768 אסימונים, תומך בשאלות כן/לא, רב-ברירה, דירוג, סיווג ושאלות בצורת מחוון, וקולט טקסט בלבד ומפיק מספרים. הוא תומך במפורש באפשרות הימנעות כגון "לא ניתן לדעת" כאשר אין די ראיות, וזה מה שהופך את הסף למשמעותי.
Intern-Decision-0.8B הוא ההסדר ההפוך. אלו משקלים ברישיון Apache 2.0, כשרישיון Qwen ממעלה הזרם נשמר לצדם כקובץ LICENSE-QWEN, כ-1.73 GB של מאגר המחולק לשלושה שברים — שבר שפה של 1.50 GB, שבר ראייה של 176 MB ומקרין של 25 MB — אשר נכנס על GPU צרכני בודד או על מחשב נייד בעל מפרט נדיב. הוא מקבל מצב, סכימה של שאלה אחת עד שש-עשרה שאלות בעלות שם עם עד 62 אפשרויות כל אחת, ובאופן אופציונלי עד שמונה תמונות, וה-inference.py המצורף שלו מתעד את החוזה בפירוט רב יותר ממה שרוב המודלים שהושקו טורחים לעשות: האפשרויות ממופות על סמלים של טוקן בודד A–Z, ואחר כך a–z, ואחר כך 0–9; הלוגיטים נקראים במיקום שמיד לפני כל <decision> מציין מקום בשלד מוכן מראש; מחושב softmax רק על המועמדים החוקיים של אותו שדה; ומופעלת טמפרטורה מכוילת.
שני הרישיונות אינם אותה רכישה. Microsoft-Decision-1 נותן לך נקודת קצה מנוהלת ובלי ארטיפקט שבבעלותך. Intern-Decision-0.8B נותן לך ארטיפקט שבבעלותך, בלי נקודת קצה, בלי חוזה תמיכה ובלי תיעוד מעבר למאגר עצמו.

התקרה, והכיול שאפשר לבצע עליו ביקורת
שני מספרים קובעים את רוב האינטגרציות האמיתיות, ושניהם שייכים למודל הקטן.
הראשון הוא 8,192 אסימונים. מנוע ההסקה של Intern-Decision-0.8B מסרב לקלט בגודל מוגזם במקום לחתוך אותו, וזו ההתנהגות הנכונה עבור מודל ניקוד, אך גם חומה קשיחה: אין אסטרטגיית חלוקה למקטעים שמשמרת את החוזה, מפני שהמצב, הסכימה והשלד חייבים כולם להיות במעבר אחד. התקרה של Microsoft-Decision-1 גבוהה פי ארבעה, 32,768, והיא מגבלה של שירות מתארח שאפשר להעלות באמצעות הקצאה שונה, ולא קבוע בקובץ Python.
השני הוא כיול, וכאן הכיוון מתהפך. InternLM מפרסמת טמפרטורה מותאמת של 2.747760550703 עבור ה-0.8B, שנבחרה על ידי מזעור NLL על פני 1,728 מקרי כיול מיועדים, כאשר 1,693 הוחזקו לולידציה, כשהכרטיס מפורש בכך שתוויות חבילת הבדיקות לא שימשו לבחירתה. הטרנספורמציה המיושמת היא softmax על הלוגיטים המועמדים של השדה, ולאחריה softmax שני על הלוגריתם של אותה התפלגות חלקי הטמפרטורה. מכיוון שהטרנספורמציה פועלת אחרי ה-softmax הראשון ומשמרת את הסדר, היא אינה יכולה לשנות כלל את ה-argmax — היא מזיזה את הביטחון, את הסתברות ה"כן" ואת התוחלת של שאלת ניקוד, ומשאירה את התווית זהה. אם הצינור שלך קורא את התווית, הטמפרטורה חסרת השפעה. אם הוא קורא את ההסתברות, מפעיל עליה סף, או מזין אותה לחישוב תוחלת, הטמפרטורה היא ההבדל בין מספר שיש לו משמעות למספר שאין לו. העברת temperature=1 מחזירה את ההתפלגות הלא-מכוילת אם תעדיף להתאים אחת משלך.
ל-Microsoft-Decision-1 אין ארטיפקט מקביל. הלשונית Benchmarks שלו מציינת כי דיוק, שגיאת כיול, ריקול בטיחות, שיעורי חיוב שגוי ועקביות הוגנות נמדדו על בנצ'מרקים ציבוריים וקהילתיים לקבלת החלטות, בתוספת ערכות בדיקה פנימיות שנשמרו בנפרד; כי סדר האפשרויות שונה; כי הופעלו מבחנים סטטיסטיים מזווגים; וכי המודל "מתפקד באותה רמה כמו מודלים מובילים לקבלת החלטות ומציג ביצועים טובים יותר ממודלים פתוחים אחרים לקבלת החלטות שהוערכו באותה מתודולוגיה". לא מודפסת שגיאת כיול, אין טמפרטורה לבדוק, ולא מתואר פיצול אימות. התכונה היחידה שהופכת הסתברות לשימושית — האם 0.8 פירושו 0.8 — מוצהרת ולא מכומתת.
קראו את שתי הפסקאות הללו זו מול זו וההשוואה מפסיקה להיות עניין של גודל. צ'קפוינט עם 0.8 מיליארד פרמטרים שאפשר לבדוק את הכיול שלו ולהריץ את התוכנה שלו הוא, עבור צוות הערכה, אובייקט עביד יותר מאשר API מתארח שהכיול שלו הוא משפט. למודל הקטן יש גם נתון השהיה מתועד — 33.98 ms ממוצע, 33.44 ms חציון, 37.50 ms p95 לשאילתה על RTX 4090 בודד דרך נתיב Hugging Face המקומי, במדידה של InternLM עצמה — ואילו זה של Microsoft הוא משהו שמודדים דרך הפריסה שלכם, שבה הבחירה בין serverless ל-provisioned throughput תזיז את המספר יותר מאשר המודל.

היכן שהמודל הקטן מפסיד
שום דבר מהאמור לעיל אינו הופך את Intern-Decision-0.8B לבחירה הבטוחה, ואותה טבלה מפורסמת מסבירה מדוע. WildJailBreak ב-64.48לעומת 96.29 של Jev הוא פער של שלושים נקודות בחוסן הסירוב, בדיוק בקטגוריה שבה מנוע ניקוד פוגש קלט שאינו מהימן. מודל החלטות הוא לעתים קרובות הרכיב שמכריע אם פעולה מוצעת מותרת; מודל שקל לעקוף אותו בדיבור הוא נטל בתפקיד הזה. אם הגירעון נובע מבסיס Qwen3.5-0.8B, מיעד כיוונון ההחלטות או ממספר הפרמטרים הקטן — הדבר אינו משהו שהמאגר מספר לך, ו� אין מאמר, אין מתכון אימון ואין גילוי נתונים שיעשו זאת.
שאר הטבלה של InternLM עצמה מחמיאה יותר מהעמודה ההיא, ובכל זאת צנועה. הממוצע על פני שבע מערכות הוא 79.38 עבור ה-0.8B, לעומת 84.68 עבור ה-2B האח שלה ו-90.02 עבור ה-4B — המשפחה מטפסת בתלילות עם הגודל, וזה אות קל לכך שהטבלה לא הונדסה לאחור כדי להחמיא לדגם הדגל. AG News נוחת על 88.61 לעומת 89.57 של Jev, למעשה באותה רמה בסיווג נושאים ארבע-כיווני. בכיול, ה-0.8B מדווח על Brier של 0.530 ועל שגיאת כיול צפויה של 0.066, לעומת 0.358 ו-0.095 של Jev — ECE טוב יותר, דיוק גרוע יותר באופן מהותי. זהו פרופיל סביר למודל קטן עם טמפרטורה שהותאמה במכוון, וזה לא שילוב שצוות שיווק היה בוחר לפרסם בטעות.
כמו כן אין תאריך שחרור, אין הכרזה, אין אוסף שמאגד את שלושת הצ'קפוינטים, אין נקודת קצה מתארחת בשום מקום, ואין הערכה בלתי תלויה מכל סוג. ה-Space של ההדגמה מחזיר 401. התיאור הנכון של Intern-Decision-0.8B הוא צ'קפוינט משוחרר עם טענות שלא בוקרו — וזה מצב טוב יותר מאשר API ברשימת המתנה, כי אתה יכול למדוד אותו בתוך אחר צהריים, אבל זה אומר שנטל הוולידציה הוא כולו עליך.
בחירה, והיכן ש-OrcaRouter ממוקם
קח את Microsoft-Decision-1 אם החסם הוא רכש או קנה מידה: אתה צריך אימות Azure, חיוב אחיד והערכת Responsible AI לפני שמשהו מגיע לפרודקשן; אתה צריך הקשר של 32K; אתה צריך נקודת קצה שאינך מפעיל; או שאתה צריך שנתיב ההימנעות יהיה מתוכנן מראש ולא מגולגל ביד. קבל בתמורה שאתה לא יכול להריץ אותו, לא יכול לכוונן אותו, לא יכול לבדוק את הכיול שלו, ותמדוד את הטענה המרכזית שלו בעצמך.
קח את Intern-Decision-0.8B אם החסם הוא עלות, זיכרון או שליטה: אתה רוצה מודל ניקוד Apache-2.0 שנכנס ב-1.73 GB, פועל על חומרה שכבר יש לך, מפיק את אותה תווית בכל פעם, וניתן להחליפו באחיו ה-2B או ה-4B על ידי שינוי נתיב checkpoint. קבל בתמורה את מגבלת 8,192 הטוקנים, את עמודת WildJailBreak, ואת העובדה שאף אחד מחוץ ל-InternLM לא שחזר דבר על הכרטיס.
ההמלצה הכנה היא לעשות את שניהם, כי הם זולים מספיק כדי שעצם הדיון בכך בקושי יהיה שווה. קריאת הניקוד עצמה אינה משהו שאנחנו מנתבים — מודל שמחזיר הסתברויות במקום טקסט אינו השלמת צ'אט, ואף אחד מהשניים לא נמצא בקטלוג שלנו. מה ש-OrcaRouter מספק הוא החצי השני של הלולאה: יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI שמנסחים את הרובריקה, מייצרים את התשובות המועמדות, או פולטים את קריאת הכלי שהמעריך שלך עומד לדרג, במחיר המחירון של הספק כפי שהוא, עם 0% תוספת, כך שהורדת מחיר של ספק על גנרטור חלה אצלנו כבר באותו יום. מעבר אוטומטי בין ספקים לכשל חשוב כאן יותר מהרגיל, מפני שלצינור שמנקד כל מה שהוא רואה אין מרווח לניסיון חוזר של קריאה שנתקעה, וה-DSL של הניתוב מאפשר לך לשלוח פרומפט שופט אחד לכמה כותבים ולמזג את ההסכמה ביניהם במקום לסמוך על אחד בודד.

שורה תחתונה
Microsoft-Decision-1 הגיע לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: מתארח, טקסט בלבד, 32,768 אסימונים, מבוסס על Qwen3.5-9B, עם פסקת מתודולוגיה במקום טבלת בנצ'מרק. Intern-Decision-0.8B הוא צ'קפוינט בנפח 1.73 GB ברישיון Apache-2.0 שהועלה ב-26 בספטמבר 2026 ומפרסם Brier של 0.530, ECE של 0.066, טמפרטורה מותאמת של 2.747760550703, 33.98 מילישניות על 4090 — וציון WildJailBreak של 64.48 שאיש לא ביקש ממנו להדפיס. אם אתם יכולים לאמת רק דבר אחד לפני אימוץ מי מהם, אמתו כיול על המקרים המתויגים שלכם; זה המספר ששני הספקים השאירו לכם למצוא.
