
Decision 3.0 לעומת Microsoft-Decision-1: האחד הוא הורדה, והשני הוא SKU
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 71 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
דרגת ה-9B של Decision 3.0 ו-Microsoft-Decision-1 הם, על הנייר, אותו מוצר. שניהם מבצעים פוסט-אימון על Qwen3.5-9B והופכים אותו למודל ניקוד שמשיב לקבוצה קבועה של תשובות מועמדות עם הסתברות מכוילת לכל אחת, מבלי לייצר אף טוקן. שניהם מיועדים לאותן משימות — ניתוב בקשה, דירוג פלט מול רובריקה, שער לפעולת סוכן, מיון תור. שניהם יצאו בתוך שבוע זה מזה: Microsoft-Decision-1 הפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026 והוכרז למחרת, ו-d3-flash הועלה ל-Hugging Face בשעה 17:23 UTC ב-10 באוקטובר 2026.
ההבדל אינו המודל. הוא מה שמותר לך לעשות איתו. d3-flash הוא צ'קפוינט Apache-2.0 בעל 8.39 מיליארד פרמטרים שאתה מוריד ומריץ, והוא נמצא במקום השלישי במשפחה שמתחילה ב-0.59B ומגיעה עד 26.09B. Microsoft-Decision-1 הוא נקודת קצה מתארחת ב-Foundry, עם משקלות שאינם מופצים כלל, בקו שמיקרוסופט אומרת שהיא תבסס מחדש על מודלי MAI שלה בהמשך. אחד מאלה הוא ארטיפקט; האחר הוא שירות. כמעט כל שאלה מעשית על השניים נובעת מאותה עובדה בודדת, כולל אלה שנראות כאילו הן עוסקות בבנצ'מרקים.
שתי החלטות בדבר מטרתו של מודל החלטות
הפרסום של מיקרוסופט מפורש לגבי ההיקף באופן שכרטיסי מודל רק לעתים רחוקות מפורשים. צורות השאלות הנתמכות הן כן/לא, בחירה מרובה, דירוג, סיווג וציונים מבוססי רובריקה. ההחרגות מפורטות באותה פשטות: לא מיועד ליצירת טקסט, למענה על שאלות פתוחות, לשיחה, לתרגום או לתמצות, ולא נועד למשימות הדורשות ידע שאינו נמצא בקלט. הוא מבצע מעבר אחד על עד 32,768 אסימונים ופולט אפס אסימוני פלט מכיוון שאין לולאת פענוח. מיקרוסופט תומכת גם באפשרות הימנעות כגון "לא ניתן לקבוע" כאשר הראיות שסופקו אינן מספיקות, וזה הפרט שהופך את החלת סף על הפלט למשמעותית בכלל.
d3-flash נמצא בתוך אותה קופסה רעיונית — שאלות Choice, Noul (כן/לא) ו-Score, מעבר קדימה אחד לכל שאלה, הסתברות לכל אפשרות, ללא יצירה — ואז מרחיב את צד הקלט. בעוד Microsoft-Decision-1 הוא טקסט בלבד מעצבו, d3-flash מקבל טקסט או JSON, מספר תמונות לבקשה עד 1.6 מגה-פיקסל כל אחת, ומספר סרטונים הנקראים בקצב של 2 פריימים לשנייה. כל שאלה בבקשה רואה כל תמונה וסרטון המצורפים אליה. זהו מודל קטן יותר שעושה יותר עם הקלט שהוא מקבל.
זהו הפיצול האמיתי הראשון, וזה לא עניין של טעם. אם ההחלטה שעליכם לקבל היא בנוגע לצילום מסך, לקבלה, לתרשים או לקליפ ממצלמה, Microsoft-Decision-1 לא יכול לקבל אותה. זהו גבול יכולת, לא פער באיכות, ושום כמות של עבודת דיוק לא תסגור אותו.
מה כל אחד מפרסם, ואיך
כאן שתי המהדורות מבצעות סוגים שונים בתכלית של הוכחה, וכדאי להפריד ביניהן ולא להשוות מספרים.
Microsoft הריצה השוואה בת 36 בנצ'מרקים על פני כמעט 150,000 שאלותשהוחזקו בהסתרה מהאימון, שכיסתה ניתוב, דירוג, הקשר ארוך, משימות רב-לשוניות ומחוץ להתפלגות, הסקה ובטיחות, ואומרת שהמודל שלה יצא הטוב ביותר בכל אותן קבוצות. היא מדווחת על השהיה כיחס ולא כמספר — p50 מהיר פי כ-35 מ-GPT-6 Sol, ומהיר פי 2.5 מ-H2O-Lightning-4B v1.1, שאותו היא מכנה כסגן-האלוף. היא מתעדת עמידות כהליך: אותה בקשה עוברת הפרעות בשמונה דרכים, שיעור היפוך החלטה ממוצע של 1.3%, ואפס היפוכים כאשר תיאורי האפשרויות מנוסחים מחדש או שהאפשרויות מוצגות בסדר הפוך או מעורבלות. היא בדקה בטיחות על 5,250 בקשות ב-11 בנצ'מרקים המכסים תוכן מזיק, פריצות (jailbreaking) והזרקת פרומפטים. היא מציינת את תקן הכיול שהיא מחויבת לו — תחזית של 90% צריכה להיות נכונה בערך תשע פעמים מתוך עשר במקרים מייצגים.
vLLM-SR פרסמה מדד. מדד Jev Decision 0.3.1 ממקם את d3 ב-64.7, בעוד d3-flash עומד על 57.79 בסוויטה הציבורית — שיפור לכאורה של 11.0 לעומת המודל 9B של Decision 2.0, שעומד על 46.76. הוא גם טוען שכל 140,178 הבקשות הציבוריות נענו, ואף אחת לא נותרה ללא תמיכה, וזו הצהרה בדבר כיסוי ולא בדבר דיוק. הכרטיס חושף כי השורה של d3 עצמו היא הערכה פנימית, בעוד ששורות ההשוואה שלצידה — Perplexity Decider v1.1, Fastino GLiDE, Jev, Torchcast Decision 27B — הן נתוני לוח בזמן אמת. ובצד הרב-מודלי, מודלים ממשפחת d3 מדווחים על ציוני Perception Test בכל 19,140 שאלות האימות, כאשר d3-flash עומד על 73.3 מול רצפת ניחוש של 33.3 בשלוש אפשרויות.
אז: מיקרוסופט מפרסמת טענת רוחב עם מתודה מתועדת ומספר עמידות, ובלי נתון כיול לכל צ'קפוינט. vLLM-SR מפרסמת מיקום בלוח הדירוג עם פער מקור מוצהר בין השורה שלה לשורות האחרות, בתוספת תוצאת וידאו, וגם בלי נתון כיול. אף אחד מהכרטיסים לא נושא ציון Brier או מספר שגיאת כיול צפויה עבור המודל שהוא מתאר. עבור שני מוצרים שכל הצעת הערך שלהם היא שהמספר המוחזר אומר משהו, זו החוליה החסרה המשותפת, וזה הדבר האחד המועיל ביותר שכל אחד מהספקים יוכל לשחרר בשלב הבא.

הפצה קובעת יותר מדף המפרט
כאן ההשוואה מפסיקה להיות על מודלים.
עם d3-flash אתה מקבל משקולות, decision_config.json שמצמיד את גרסת הבסיס, מניפסט SHA-256 לכל קובץ, קוד מידול מותאם אישית, ראש קריאה, וקבוצת תלויות מתועדת שכוללת transformers==5.17.0 וחבילת ליבת CUDA אופציונלית לשכבות הקשב הלינארי. אתה יכול להריץ אותו על החומרה שלך, לכוונן אותו, לכמת אותו, ולבודד אותו ברשת סגורה. אתה גם נוטל על עצמך את העבודה התפעולית: מחלקת Python אינה נקודת קצה, והכרטיס אינו מפרט תקציב טוקנים עבור מצב ועוד שאלות ועוד תיאורי מועמדים — max_length הוא null בקונפיג שסופק, כך שהתקרה הזו היא שלך לגלות.
עם Microsoft-Decision-1 אתם מקבלים נקודת קצה בתוך חשבון ענן קיים, עם האימות, הזמינות האזורית ובקרות ההקצאה הנלווים לכך, ואתם לא מקבלים שום עבודה תפעולית. אתם גם לא מקבלים שום שליטה. אין מאגר להורדה, אין מסלול כוונון עדין, ואין אפשרות אירוח עצמי; מחזור החיים של המודל הוא של Microsoft, לא שלכם, והודעת הוצאה משימוש או החלפת בסיס למודל ליבה אחר היא שינוי שאתם סופגים ולא כזה שאתם מתזמנים. Microsoft אמרה שהחלפת בסיס למודלי MAI שלה מגיעה; זו מפת דרכים סבירה למודל שכל מטרתו היא ניקוד מהיר במעבר יחיד, והיא גם אומרת שהצ'קפוינט הספציפי שהרצתם עליו בנצ'מרק אינו בהכרח זה שתפנו אליו בעוד שנה.
גם את סיפור ההשהיה יש לקרוא בקפידה. הנתון המרכזי של מיקרוסופט הוא יחס מול מודל כללי גדול בהרבה, שזו ההשוואה הנכונה עבור הטיעון של מיקרוסופט — תפקידו של מודל החלטות הוא להחליף קריאה גנרטיבית יקרה בקריאת ניקוד זולה, ופי 35 מול GPT-6 Sol ב-p50 הוא איך שהטיעון הזה נראה כשהוא מתממש. המספרים המוחלטים של vLLM-SR הם עבור בקשה בודדת ו-GPU בודד, והם מציגים בבירור את מס המודאליות: על AMD Instinct MI325X אחד, בקשת טקסט אל d3-flash נמשכת 19.1 ms בחציון, אותה בקשה עם תמונה נמשכת 149.1 ms, ועם וידאו באורך עשר שניות — 407.6 ms. שתי קבוצות הנתונים הן דיווחי ספק, על חומרה שונה, ואף אחת מהן לא שוחזרה מחוץ למעבדה שהפיקה אותה.

איך לבחור
כלל ההחלטה קצר, וזה סימן טוב ששני המוצרים בעצם לא מתחרים על אותה משבצת.
בחרו ב-Microsoft-Decision-1 אם ההחלטה היא טקסט בלבד, אם אתם כבר פועלים על Foundry, ואם העובדה שמדובר בקריאה ולא בפריסה היא כל העניין — אין GPU לקנות, אין קונטיינר להפעיל, אין מחזור חיים של מודל לקחת עליו בעלות. החומר התומך של מיקרוסופט הוא גם השימושי מבין השניים עבור צוות פלטפורמה: הפרטורבציות, ספירות בדיקות הבטיחות וההצהרה שתמיכה באפשרות הימנעות קיימת הם הדברים שדרושים כדי לכתוב מדיניות סף, ותקרת 32,768 הטוקנים מצוינת במפורש ולא נותרת ריקה.
בחר ב-Decision 3.0 — באופן ריאלי d3-flash או d3-mini — אם חלק כלשהו מההחלטה תלוי בתמונה או בקליפ, אם אתה צריך להריץ אותו במקום ש-API מתארח לא יכול להגיע אליו, או אם אתה רוצה לכוונן את המדרג על מקרים מתויגים משלך. הרישיון Apache-2.0 ומניפסט ה-hash ברמת הקובץ הופכים את זה לאפשרות אמיתית ולא תיאורטית. מה שאתה מקבל בתמורה הוא תקציב קלט לא מוצהר, ללא כיול מפורסם, והעובדה שהמשפחה בת ימים ספורים עם למעשה אין שימוש חיצוני מאחוריה.
אם אתה צריך את שניהם — סקורר מתארח (hosted) עבור מסלול הטקסט השגרתי וסקורר בהתארחות עצמית (self-hosted) עבור המקרים הרב-מודאליים או המנותקים מרשת (air-gapped), הנקראים דרך אותו ממשק — אז העמדה הכנה היא שאף ספק לא מספק לך זאת כיום, ושני פורמטי הבקשה קרובים מספיק כדי לאחד ביניהם אך אינם זהים.
היכן OrcaRouter נמצא, והיכן הוא לא
typesafe/jev-1.13 הוא מודל קבלת ההחלטות בקטלוג שלנו, המוגש דרך POST /v1/systemone עם אותו חוזה של מצב ושאלות בעלות שמות ששני המודלים שלמעלה מיישמים: טקסט נכנס, JSON מובנה יוצא, עד כ-64K אסימוני קלט, ללא סטרימינג, $0.042 למיליון אסימוני קלט ללא חיוב עבור השלמה, משום שהוא לעולם אינו מייצר כזו. ראוי לציון ששאלת תקציב האסימונים בסגנון אנדרואיד, שאף אחד מהכרטיסים שלמעלה אינו עונה עליה במלואה, נענית כאן.
איננו מציעים אף אחד מהמודלים בהשוואה הזו. הצ'קפוינטים של Decision 3.0 מגיעים כנתיב הסקה מקומי במאגר Hugging Face ולא כנקודת קצה ניתנת לניתוב, ו-Microsoft-Decision-1 מופץ דרך הפלטפורמה של מיקרוסופט עצמה ומספר פלטפורמות של צד שלישי — לא דרכנו. אין לפרש דבר כאן כטענת זמינות לאף אחד מהשניים.
מה ששכבת הניתוב באמת שווה בהחלטה הזו נמצא בחצי השני של הלולאה. מודל ניקוד זול מעצם טבעו; המודל שפועל על הפלט שלו — לא, ושילוב מודל החלטה עם מודל גנרטיבי פירושו בדרך כלל שתי אינטגרציות, שני קשרי חיוב ושתי נקודות כשל. קריאה לשניהם דרך מפתח אחד על פני יותר מ-200 מודלים — עם מעבר אוטומטי לגיבוי כשספק מתערער, ומחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך ששינוי מחיר של ספק נכנס לתוקף באותו יום — מאפשר לך להחליף את מודל הניקוד בלי לגעת בנקודת הקריאה. זה חשוב כאן יותר מהרגיל, משום ששני המודלים האלה מוקדמים מספיק כדי שההחלטה שתקבל השבוע תהיה כזו שתוכל לבטל בחודש הבא.

השאלה שתכריע את זה בעוד חצי שנה
שתי קבוצות ביצעו אימון-המשך לאותו צ'קפוינט בסיס והפכו אותו לאותה צורת מוצר באותו שבוע, והגיעו למסקנות הפוכות לגבי האופן שבו הוא אמור להגיע ללקוח. אין זה כל כך צירוף מקרים של תזמון אלא הסתעפות באופן שבו הקטגוריה נמכרת: כמשקלים או כשירות, כדבר שבבעלותך או כדבר שאתה קורא לו.
שימו לב לשלושה אותות. האם הריבייס של מיקרוסופט אל MAI או אל המודלים שלה משנה את התנהגות הדיוק וההשהיה שהיא מוכרת כעת — וכמה הודעה מוקדמת מקבלים הלקוחות. האם vLLM-SR מפרסמת תקציב קלט ונתון כיול עבור Decision 3.0, ובכך סוגרת את הפער שמונע מהמדד שלה להיות שמיש לפעולה. והאם מישהו מחוץ לשתי המעבדות מריץ את חבילת הבדיקות הציבורית על משקולות ה-d3 שפורסמו, כי נכון לעכשיו המספר היחיד שיכריע את ההשוואה הזו הוא מספר שאף אחד מהספקים לא הפיק.
