כרטיס כותרת שנוצר עבור Microsoft-Decision-1, עם כותרת משנה 'מודל לניקוד החלטות שמחזיר הסתברות במקום משפט', עם תג שעליו כתוב Microsoft Foundry, זמין באופן כללי החל מ-8 באוקטובר 2026, וצ'יפים שעליהם כתוב מודל בסיס 9B, הקשר של 32,768 טוקנים, משקולות לא מופצות, וטקסט בלבד ללא יצירה.
Guides & Insights

Microsoft-Decision-1: המודל של מיקרוסופט שמשיב במספר במקום במשפט

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ל-Microsoft-Decision-1 יש שורה בכרטיס המודל שלו שאף מודל אחר של מיקרוסופט לא נשא מעולם: לא מיועד ליצירת טקסט. המודל הפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026, וזהו צמצום מכוון של הייעוד של מודל שפה. אתה מעביר לו סיטואציה ושאלה עם רשימה קבועה של תשובות — כן/לא, מערך רב-ברירה, סולם דירוג, רובריקה — והוא מחזיר הסתברות מכוילת לכל אפשרות. בלי פרוזה. בלי הסבר. בלי שדה נימוק. הפלט הוא מספרי JSON ותו לא. הוא בנוי על מודל בעל משקולות פתוחות Qwen3.5-9B, שעבר אימון משלים (post-trained) על ידי מיקרוסופט, ומיקרוסופט אומרת שהיא תעביר את המודל לבסיסים (backbones) אחרים בהמשך, כשהיא מציינת את MAI ומודלים של שותפים אחרים.

זהו מוצר מוזר יותר מכפי שזה נשמע בתחילה. המעמד התחרותי של Microsoft ב-2026 נשען על מודלי צ'אט חזיתיים ועל Copilot, ו-Microsoft-Decision-1 הוא ההפך משניהם: מדרג בגודל בינוני, בעל ייעוד יחיד, שכל תפקידו הוא לומר לאפליקציה איזו מהאפשרויות שלך סביר ביותר שהיא הנכונה, ועד כמה הוא בטוח בכך. השאלה המעניינת אינה אם הוא טוב בכתיבה — הוא גרוע בכך באופן מפורש ואינו מנסה — אלא אם התפלגות הסתברות על פני אפשרויות היא פרימיטיב שימושי יותר לעומסי העבודה שארגונים מריצים בפועל מאשר עוד מודל לשימוש כללי עם מצב JSON.

מה זה עושה, בדיוק

החוזה הוא קריאה אחת נכנסת, התפלגות אחת יוצאת. Microsoft מפרטת את פורמטי השאלות הנתמכים: כן/לא, רב-ברירה, דירוג, סיווג ומבוססי רובריקה. כל אפשרות מקבלת ציון. המודל רץ בהפעלה אחת על קלטים של עד 32K אסימונים — 32,768 הוא חלון ההקשר המוצהר — והתקרה המעשית היא הקלט בתוספת קבוצת האפשרויות, ולא תקציב יצירה, מכיוון שאין יצירה.

מקרי השימוש שפורסמו הם אלו שצוות פלטפורמה היה מזהה מיד:

• הערכת פלט AI — דרג תגובה שנוצרה לפי מחוון שסופק, או החלט אם היא מבוססת על הראיות שניתנו לה.

• סיווג וניתוב — לסווג בקשה, לשפוט רלוונטיות, למיין תור, לבחור ענף בזרימת עבודה.

• מעקות בטיחות לסוכן — דרגו קריאת כלי או פעולת סוכן שהוצעו לפני שהאפליקציה המשלבת מאפשרת להריץ אותן.

• סינון בטיחות תוכן — סימון תוכן לפי ספים שהאפליקציה מגדירה, במקום מדיניות ספק קבועה.

• רלוונטיות חיפוש ומסמך — לשפוט אם מסמך שנשלף עונה על שאלה שסופקה.

• אוטומציה מבוססת ביטחון — קבלה אוטומטית של תוצאות בעלות ביטחון גבוה והעברת השאר לאדם.

אפשרות ההימנעות היא הפרט שכדאי לשים לב אליו. Microsoft תומכת באופן מפורש באפשרויות כמו "לא ניתן לדעת" כאשר הראיות שסופקו אינן מספקות, וזה ההבדל בין מעריך מכויל לבין מעריך שרק בטוח בעצמו. ומכיוון שהציונים חוזרים כמספרים, סף ההסלמה הוא החלטה שלך — אתה קובע היכן 0.7 שולח משהו לאדם ו-0.95 לא.

מה שזה לא יעשה

מיקרוסופט מפורשת באופן יוצא דופן לגבי ההחרגות, והן חשובות יותר מרשימת התכונות לכל מי שמתאים את זה לצינור אמיתי. Microsoft-Decision-1לא מיועד ליצירת טקסט, מענה על שאלות פתוחות, שיחה, תרגום או סיכום. הוא אינו מיועד למשימות בלי שאלה סגורה וקבוצה מוגדרת של אפשרויות תשובה, או למשימות שדורשות ידע שאינו נמצא בקלט. הוא טקסטואלי בלבד: אין תמונות, אודיו או וידאו בקלט, ולא בפלט. הוא אינו מספק הסברים או נימוקים.

קראו אותם יחד ומופיע גבול שקל למעוד עליו. זה לא צ׳אטבוט שאפשר לבקש ממנו גם לסווג דברים, וזה לא כלי סיכום שאפשר להלביש עליו ציון. זו פונקציית ניקוד עם תקציב טוקנים. האופן שבו הצוות עצמו מנסח זאת — שהיא לא אמורה להיות מקבל ההחלטות האוטומטי הבלעדי בהחלטות בעלות השלכות על אנשים, ולא אמורה להיות הבסיס הבלעדי להחלטות הנוגעות לאשראי, תעסוקה, דיור, ביטוח, חינוך, שירותי בריאות, זכויות משפטיות "או תחומים בעלי השלכות דומות" — מצביע לאותו כיוון. היא מיועדת לשבת לצד החלטה, לא להיות ההחלטה עצמה.

A single-column generated scoreboard for Microsoft-Decision-1 with six rows: base model Qwen3.5-9B post-trained by Microsoft; weights hosted API only and not distributed; context window 32,768 tokens; output calibrated JSON probabilities with zero output tokens; published benchmarks none, methodology only; status generally available on Microsoft Foundry on October 8 2026. A footer line reads that all figures are Microsoft-reported and not independently reproduced.

מצב הבנצ'מרק הוא הסיפור שאף אחד לא רוצה להדפיס

אין מספרים. בדף הקטלוג של Microsoft Foundry עבור Microsoft-Decision-1 יש לשונית Benchmarks, והיא ריקה מנתונים מספריים. מה שהיא מכילה במקום זאת הוא פסקת מתודולוגיה וטענה איכותנית: המודל "הוערך על מדדי החלטה ציבוריים וקהילתיים ועל מערכי בדיקה פנימיים שנשמרו ולא שימשו באימון", מיקרוסופט מדווחת שהוא "משתווה למודלי החלטה מובילים ומקדים מודלי החלטה פתוחים אחרים שהוערכו באותה מתודולוגיה", והמדדים שבהם נעשה שימוש היו דיוק, שגיאת כיול, ריקול בטיחות, שיעורי חיוביים-שגויים ועקביות הוגנות, כאשר סדר האפשרויות שונה והוחלו מבחנים סטטיסטיים מזווגים.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text states that it is a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, that it is built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, that it will also rebase on other models including MAI and OpenAI, and lists quick facts: publisher Microsoft, type Text classification and Zero shot classification, lifecycle Generally available (GA), context window 32768, and a Pricing field that links out rather than printing a rate.

זהו תיאור מתודולוגיה רציני שמצורף לאפס תוצאות מפורסמות. זה אומר שכל טענת ביצועים לגבי Microsoft-Decision-1 כיום היא מדווחת על ידי הספק ואינה משוחזרת, והעמדה הישרה של כל מי שמעריך אותו היא שהכיול — התכונה היחידה שהופכת הסתברות לשימושית בכלל — אינו מאומת מחוץ ל-Microsoft. החברה כן מציינת היכן שלדעתה המודל הכי חזק והכי חלש, וזה שימושי יותר מציון כותרת: החזק ביותר בהסקה, ביישום כללים ובעמידות לשינויי עיצוב של פרומפטים; תחרותי בסיווג, באחזור, בהוגנות, בשימוש בכלים וברוב המשימות הרב-לשוניות; חלש יותר במשימות ידע תחומי מיוחדות.

כדאי לקרוא את המגבלות שהמערכת מדווחת על עצמה לפני רשימת התכונות. ציונים יכולים להשתנות בהתאם לניסוח ולסדר האפשרויות, וגם שאלה מנוסחת בצורה גרועה עדיין מחזירה ציון. הכיול הוא החזק ביותר בסוגי משימות מוכרים. ייתכן שהוא נשען על ידע מיושן, והוא אינו מספק הסברים. בנוגע לכיסוי רב-לשוני: 25 שפות רשומות כנתמכות, ובהן יפנית, קוריאנית, ערבית, וייטנאמית, תאית, טורקית, הינדי, בנגלית, סוואהילית, עברית, פרסית ואוקראינית, אך Microsoft מציינת שהכיסוי, האיכות והכיול "עשויים להשתנות לפי שפה", ומפרטת שפות שאינן אנגלית — במיוחד שפות דלות-משאבים — כאזור של תת-ביצועים. המודל הבסיסי Qwen3.5-9B תומך ביותר מ-200 שפות; המודל שעבר אימון ממוקד תומך ברבע מכך.

איך משיגים את זה, ומה זה עולה

Microsoft-Decision-1 מופץ כ-API מתארח ב-Microsoft Foundry תחת תיק "Direct from Azure". משקולות המודל אינן מופצות — זוהי אינה מהדורה עם משקולות פתוחות, ואין מאגר Hugging Face להורדתה. כל יישום שיכול לשלוח בקשות HTTPS יכול להשתלב באמצעות נקודות הקצה של Foundry ואימות Azure סטנדרטי. רשימת הפריסה מציגה אפשרויות ללא שרת ונקודת קצה מאוחדת על בסיס תשלום לפי שימוש או תפוקה מוקצית שמורה, SKU סטנדרטי, עם הסקה באצווה מושבתת, וחשיפת האימון מדווחת שמערך נתוני האימון שימש לראשונה בספטמבר 2026 עם איסוף מתמשך.

התמחור אינו מפורסם בדף המודל. שדה התמחור של הקטלוג מפנה אל דף התמחור של המודל של Microsoft במקום להציג תעריף קלט ופלט, כך שהעלות לכל אסימון של קריאה ל-Decision-1 היא משהו שעליך לחפש בממשק התמחור של Azure או לקרוא מחשבון. זהו פער ממשי לכל מי שמנסה למדל עלות לכל החלטה בנפח, וראוי לומר זאת בבירור ולא להעריך. שני דברים שכדאי לדעת כשאתה מתמחר את זה: 0% מהעלות הם אסימוני פלט, כי אין כאלה, והסקה באצווה מושבתת, כך שאינך יכול לפרוס הרצת ניקוד בכמות גדולה דרך ערוץ האצווה כפי שהיית עושה עם מודל גנרטיבי.

המקום שבו OrcaRouter נכנס לתמונה הוא בצד השני של הקריאה. אנחנו לא מארחים את Microsoft-Decision-1, והוא אינו בקטלוג שלנו — מודל שמחזיר הסתברויות ולא טקסט אינו מודל שמנתבים אליו השלמות צ'אט. מה שכן יש לנו הוא החצי של התבנית שכן מייצר: המודלים שכותבים את המחוון, מנסחים את תשובות המועמדים, או מפיקים את קריאת הכלי ש-Decision-1 מדרג לאחר מכן. אלה יושבים מאחורי מפתח אחד תואם OpenAI ועליו יותר מ-200 מודלים, לפי מחיר המחירון של הספק כפי שהוא, עם 0% תוספת מחיר, כך שהורדת מחיר של ספק על מודל שופט נכנסת לתוקף אצלנו באותו יום. אם אתם בונים לולאת הערכה שבה מודל אחד כותב ואחר מדרג, קריאת הדירוג הולכת ל-Microsoft וקריאת הייצור יכולה ללכת לכל מקום — כולל דרך ה-DSL של הניתוב, שמרכיב כמה מודלים לקריאה אחת כשאתם רוצים פאנל ולא שופט בודד.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filter controls for input modalities, context length, input price, status, series and supported parameters, and a search field. No decision-scoring model appears in the listing.

למה סקורר הוא הימור שונה מצ׳אטבוט טוב יותר

התבנית שמיקרוסופט מוכרת כאן כבר קיימת באופן פתוח. Intern-Decision-4B של InternLM, d1-3B של Liquid AI, Laya של Convai Innovations ומשפחת Kev של Jared Palmer — כולם מחזירים התפלגויות מכוילות על פני האפשרויות שסופקו בלי לייצר טקסט, ורובם הם משקלים תחת Apache-2.0 שאפשר להריץ על החומרה שלך בחינם. הפתרון של מיקרוסופט נבדל בשלושה היבטים שאינם תלויים במדדי ביצועים: הוא API מנוהל עם אימות, חיוב וממשל של Azure מצורפים, כך שהוא מתאים למסלול רכש ארגוני שהורדה מ-Hugging Face אינה מתאימה לו; הבסיס שלו הוא מודל 9B, גדול יותר מרוב המודלים בתחום הזה; והוא מגיע עם הערכת Responsible AI ומתודולוגיית הערכה מתועדת, שלעיתים קרובות היא דרישת הסף האמיתית לפריסה רגולטורית.

מה שחסר בו הוא מספר. לעומת מתחרים פתוחים שמפרסמים ציוני Brier ושגיאת כיול צפויה — שני הנתונים שאומרים לך אם 0.8 פירושו 0.8 — מיקרוסופט פרסמה מתודולוגיה ולא תוצאות. עד לקיומו של בדיק כיול בלתי תלוי, הדרך הניתנת להגנה להשתמש ב-Microsoft-Decision-1 היא הדרך שהתיעוד שלה עצמה ממליץ עליה: לאמת על נתונים שמייצגים את מקרה השימוש שלך, לקבוע ספים לפי עלות השגיאות שלך, תמיד לכלול אפשרות הימנעות, לערבב באקראי את סדר האפשרויות במקרים שבהם הסדר עלול להטות את התשובה, ולהשאיר אדם בתהליך בכל דבר בעל השלכות. זו עצה טובה לכל מודל ניקוד. היא עצה טובה במיוחד לכזה שאיש מחוץ לחברה לא מדד את הכיול שלו.