כרטיס כותרת שנוצר עבור ההשוואה בין Decision 3.0 ל-Microsoft-Decision-1, עם כתובית משנה 'אותו backbone של Qwen3.5-9B, דרכים הפוכות לקנות אותו', עם צ'יפים שעליהם כתוב 'משקלים Apache-2.0 לעומת אירוח בלבד', 'תמונות ווידאו לעומת טקסט בלבד', 'פורסם 10 באוקטובר לעומת GA 8 באוקטובר', וכותרת תחתונה שעליה כתוב 'הנתונים של Decision 3.0 מקורם ב-vLLM-SR; הנתונים של Microsoft-Decision-1 מקורם ב-Microsoft; אף אחד מהם לא שוחזר באופן עצמאי.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Engineering & Research

Decision 3.0 לעומת Microsoft-Decision-1: האחד הוא הורדה, והשני הוא SKU

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

דרגת ה-9B של Decision 3.0 ו-Microsoft-Decision-1 הם, על הנייר, אותו מוצר. שניהם מבצעים פוסט-אימון על Qwen3.5-9B והופכים אותו למודל ניקוד שמשיב לקבוצה קבועה של תשובות מועמדות עם הסתברות מכוילת לכל אחת, מבלי לייצר אף טוקן. שניהם מיועדים לאותן משימות — ניתוב בקשה, דירוג פלט מול רובריקה, שער לפעולת סוכן, מיון תור. שניהם יצאו בתוך שבוע זה מזה: Microsoft-Decision-1 הפך לזמין באופן כללי ב-Microsoft Foundry ב-8 באוקטובר 2026 והוכרז למחרת, ו-d3-flash הועלה ל-Hugging Face בשעה 17:23 UTC ב-10 באוקטובר 2026.

ההבדל אינו המודל. הוא מה שמותר לך לעשות איתו. d3-flash הוא צ'קפוינט Apache-2.0 בעל 8.39 מיליארד פרמטרים שאתה מוריד ומריץ, והוא נמצא במקום השלישי במשפחה שמתחילה ב-0.59B ומגיעה עד 26.09B. Microsoft-Decision-1 הוא נקודת קצה מתארחת ב-Foundry, עם משקלות שאינם מופצים כלל, בקו שמיקרוסופט אומרת שהיא תבסס מחדש על מודלי MAI שלה בהמשך. אחד מאלה הוא ארטיפקט; האחר הוא שירות. כמעט כל שאלה מעשית על השניים נובעת מאותה עובדה בודדת, כולל אלה שנראות כאילו הן עוסקות בבנצ'מרקים.

שתי החלטות בדבר מטרתו של מודל החלטות

הפרסום של מיקרוסופט מפורש לגבי ההיקף באופן שכרטיסי מודל רק לעתים רחוקות מפורשים. צורות השאלות הנתמכות הן כן/לא, בחירה מרובה, דירוג, סיווג וציונים מבוססי רובריקה. ההחרגות מפורטות באותה פשטות: לא מיועד ליצירת טקסט, למענה על שאלות פתוחות, לשיחה, לתרגום או לתמצות, ולא נועד למשימות הדורשות ידע שאינו נמצא בקלט. הוא מבצע מעבר אחד על עד 32,768 אסימונים ופולט אפס אסימוני פלט מכיוון שאין לולאת פענוח. מיקרוסופט תומכת גם באפשרות הימנעות כגון "לא ניתן לקבוע" כאשר הראיות שסופקו אינן מספיקות, וזה הפרט שהופך את החלת סף על הפלט למשמעותית בכלל.

d3-flash נמצא בתוך אותה קופסה רעיונית — שאלות Choice, Noul (כן/לא) ו-Score, מעבר קדימה אחד לכל שאלה, הסתברות לכל אפשרות, ללא יצירה — ואז מרחיב את צד הקלט. בעוד Microsoft-Decision-1 הוא טקסט בלבד מעצבו, d3-flash מקבל טקסט או JSON, מספר תמונות לבקשה עד 1.6 מגה-פיקסל כל אחת, ומספר סרטונים הנקראים בקצב של 2 פריימים לשנייה. כל שאלה בבקשה רואה כל תמונה וסרטון המצורפים אליה. זהו מודל קטן יותר שעושה יותר עם הקלט שהוא מקבל.

זהו הפיצול האמיתי הראשון, וזה לא עניין של טעם. אם ההחלטה שעליכם לקבל היא בנוגע לצילום מסך, לקבלה, לתרשים או לקליפ ממצלמה, Microsoft-Decision-1 לא יכול לקבל אותה. זהו גבול יכולת, לא פער באיכות, ושום כמות של עבודת דיוק לא תסגור אותו.

מה כל אחד מפרסם, ואיך

כאן שתי המהדורות מבצעות סוגים שונים בתכלית של הוכחה, וכדאי להפריד ביניהן ולא להשוות מספרים.

Microsoft הריצה השוואה בת 36 בנצ'מרקים על פני כמעט 150,000 שאלותשהוחזקו בהסתרה מהאימון, שכיסתה ניתוב, דירוג, הקשר ארוך, משימות רב-לשוניות ומחוץ להתפלגות, הסקה ובטיחות, ואומרת שהמודל שלה יצא הטוב ביותר בכל אותן קבוצות. היא מדווחת על השהיה כיחס ולא כמספר — p50 מהיר פי כ-35 מ-GPT-6 Sol, ומהיר פי 2.5 מ-H2O-Lightning-4B v1.1, שאותו היא מכנה כסגן-האלוף. היא מתעדת עמידות כהליך: אותה בקשה עוברת הפרעות בשמונה דרכים, שיעור היפוך החלטה ממוצע של 1.3%, ואפס היפוכים כאשר תיאורי האפשרויות מנוסחים מחדש או שהאפשרויות מוצגות בסדר הפוך או מעורבלות. היא בדקה בטיחות על 5,250 בקשות ב-11 בנצ'מרקים המכסים תוכן מזיק, פריצות (jailbreaking) והזרקת פרומפטים. היא מציינת את תקן הכיול שהיא מחויבת לו — תחזית של 90% צריכה להיות נכונה בערך תשע פעמים מתוך עשר במקרים מייצגים.

vLLM-SR פרסמה מדד. מדד Jev Decision 0.3.1 ממקם את d3 ב-64.7, בעוד d3-flash עומד על 57.79 בסוויטה הציבורית — שיפור לכאורה של 11.0 לעומת המודל 9B של Decision 2.0, שעומד על 46.76. הוא גם טוען שכל 140,178 הבקשות הציבוריות נענו, ואף אחת לא נותרה ללא תמיכה, וזו הצהרה בדבר כיסוי ולא בדבר דיוק. הכרטיס חושף כי השורה של d3 עצמו היא הערכה פנימית, בעוד ששורות ההשוואה שלצידה — Perplexity Decider v1.1,‏ Fastino GLiDE,‏ Jev,‏ Torchcast Decision 27B — הן נתוני לוח בזמן אמת. ובצד הרב-מודלי, מודלים ממשפחת d3 מדווחים על ציוני Perception Test בכל 19,140 שאלות האימות, כאשר d3-flash עומד על 73.3 מול רצפת ניחוש של 33.3 בשלוש אפשרויות.

אז: מיקרוסופט מפרסמת טענת רוחב עם מתודה מתועדת ומספר עמידות, ובלי נתון כיול לכל צ'קפוינט. vLLM-SR מפרסמת מיקום בלוח הדירוג עם פער מקור מוצהר בין השורה שלה לשורות האחרות, בתוספת תוצאת וידאו, וגם בלי נתון כיול. אף אחד מהכרטיסים לא נושא ציון Brier או מספר שגיאת כיול צפויה עבור המודל שהוא מתאר. עבור שני מוצרים שכל הצעת הערך שלהם היא שהמספר המוחזר אומר משהו, זו החוליה החסרה המשותפת, וזה הדבר האחד המועיל ביותר שכל אחד מהספקים יוכל לשחרר בשלב הבא.

A generated two-column scoreboard headed 'Decision 3.0 d3-flash vs Microsoft-Decision-1 - the scoreboard'. The left column for d3-flash reads: base model Qwen3.5-9B fine-tuned, 8.39B parameters; distribution Apache-2.0 weights on Hugging Face from 10 October 2026; input text, images and video; context budget not stated on the card; reported accuracy Jev Decision Index 0.3 public suite 57.79, an internal evaluation; latency median 19.1 ms text, 149.4 ms image and 407.6 ms video. The right column for Microsoft-Decision-1 reads: base model Qwen3.5-9B post-trained, weights not distributed; distribution hosted on Microsoft Foundry, generally available 8 October 2026; input text only; context budget 32,768 tokens; reported accuracy best of 36 benchmarks covering nearly 150,000 blind questions; latency p50 around 35 times faster than GPT-6 Sol. A footer reads 'd3-flash figures are vLLM-SR's own internal evaluation; Microsoft-Decision-1 figures are Microsoft's own; neither is independently reproduced.'

הפצה קובעת יותר מדף המפרט

כאן ההשוואה מפסיקה להיות על מודלים.

עם d3-flash אתה מקבל משקולות, decision_config.json שמצמיד את גרסת הבסיס, מניפסט SHA-256 לכל קובץ, קוד מידול מותאם אישית, ראש קריאה, וקבוצת תלויות מתועדת שכוללת transformers==5.17.0 וחבילת ליבת CUDA אופציונלית לשכבות הקשב הלינארי. אתה יכול להריץ אותו על החומרה שלך, לכוונן אותו, לכמת אותו, ולבודד אותו ברשת סגורה. אתה גם נוטל על עצמך את העבודה התפעולית: מחלקת Python אינה נקודת קצה, והכרטיס אינו מפרט תקציב טוקנים עבור מצב ועוד שאלות ועוד תיאורי מועמדים — max_length הוא null בקונפיג שסופק, כך שהתקרה הזו היא שלך לגלות.

עם Microsoft-Decision-1 אתם מקבלים נקודת קצה בתוך חשבון ענן קיים, עם האימות, הזמינות האזורית ובקרות ההקצאה הנלווים לכך, ואתם לא מקבלים שום עבודה תפעולית. אתם גם לא מקבלים שום שליטה. אין מאגר להורדה, אין מסלול כוונון עדין, ואין אפשרות אירוח עצמי; מחזור החיים של המודל הוא של Microsoft, לא שלכם, והודעת הוצאה משימוש או החלפת בסיס למודל ליבה אחר היא שינוי שאתם סופגים ולא כזה שאתם מתזמנים. Microsoft אמרה שהחלפת בסיס למודלי MAI שלה מגיעה; זו מפת דרכים סבירה למודל שכל מטרתו היא ניקוד מהיר במעבר יחיד, והיא גם אומרת שהצ'קפוינט הספציפי שהרצתם עליו בנצ'מרק אינו בהכרח זה שתפנו אליו בעוד שנה.

גם את סיפור ההשהיה יש לקרוא בקפידה. הנתון המרכזי של מיקרוסופט הוא יחס מול מודל כללי גדול בהרבה, שזו ההשוואה הנכונה עבור הטיעון של מיקרוסופט — תפקידו של מודל החלטות הוא להחליף קריאה גנרטיבית יקרה בקריאת ניקוד זולה, ופי 35 מול GPT-6 Sol ב-p50 הוא איך שהטיעון הזה נראה כשהוא מתממש. המספרים המוחלטים של vLLM-SR הם עבור בקשה בודדת ו-GPU בודד, והם מציגים בבירור את מס המודאליות: על AMD Instinct MI325X אחד, בקשת טקסט אל d3-flash נמשכת 19.1 ms בחציון, אותה בקשה עם תמונה נמשכת 149.1 ms, ועם וידאו באורך עשר שניות — 407.6 ms. שתי קבוצות הנתונים הן דיווחי ספק, על חומרה שונה, ואף אחת מהן לא שוחזרה מחוץ למעבדה שהפיקה אותה.

A screenshot of the vllm-sr/d3 model card on Hugging Face, the flagship checkpoint of the Decision 3.0 family that d3-flash belongs to. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The sidebar shows 130 downloads last month, the model tree pinned to Qwen/Qwen3.8-27B, and a collection entry listing 6 items.

איך לבחור

כלל ההחלטה קצר, וזה סימן טוב ששני המוצרים בעצם לא מתחרים על אותה משבצת.

בחרו ב-Microsoft-Decision-1 אם ההחלטה היא טקסט בלבד, אם אתם כבר פועלים על Foundry, ואם העובדה שמדובר בקריאה ולא בפריסה היא כל העניין — אין GPU לקנות, אין קונטיינר להפעיל, אין מחזור חיים של מודל לקחת עליו בעלות. החומר התומך של מיקרוסופט הוא גם השימושי מבין השניים עבור צוות פלטפורמה: הפרטורבציות, ספירות בדיקות הבטיחות וההצהרה שתמיכה באפשרות הימנעות קיימת הם הדברים שדרושים כדי לכתוב מדיניות סף, ותקרת 32,768 הטוקנים מצוינת במפורש ולא נותרת ריקה.

בחר ב-Decision 3.0 — באופן ריאלי d3-flash או d3-mini — אם חלק כלשהו מההחלטה תלוי בתמונה או בקליפ, אם אתה צריך להריץ אותו במקום ש-API מתארח לא יכול להגיע אליו, או אם אתה רוצה לכוונן את המדרג על מקרים מתויגים משלך. הרישיון Apache-2.0 ומניפסט ה-hash ברמת הקובץ הופכים את זה לאפשרות אמיתית ולא תיאורטית. מה שאתה מקבל בתמורה הוא תקציב קלט לא מוצהר, ללא כיול מפורסם, והעובדה שהמשפחה בת ימים ספורים עם למעשה אין שימוש חיצוני מאחוריה.

אם אתה צריך את שניהם — סקורר מתארח (hosted) עבור מסלול הטקסט השגרתי וסקורר בהתארחות עצמית (self-hosted) עבור המקרים הרב-מודאליים או המנותקים מרשת (air-gapped), הנקראים דרך אותו ממשק — אז העמדה הכנה היא שאף ספק לא מספק לך זאת כיום, ושני פורמטי הבקשה קרובים מספיק כדי לאחד ביניהם אך אינם זהים.

היכן OrcaRouter נמצא, והיכן הוא לא

typesafe/jev-1.13 הוא מודל קבלת ההחלטות בקטלוג שלנו, המוגש דרך POST /v1/systemone עם אותו חוזה של מצב ושאלות בעלות שמות ששני המודלים שלמעלה מיישמים: טקסט נכנס, JSON מובנה יוצא, עד כ-64K אסימוני קלט, ללא סטרימינג, $0.042 למיליון אסימוני קלט ללא חיוב עבור השלמה, משום שהוא לעולם אינו מייצר כזו. ראוי לציון ששאלת תקציב האסימונים בסגנון אנדרואיד, שאף אחד מהכרטיסים שלמעלה אינו עונה עליה במלואה, נענית כאן.

איננו מציעים אף אחד מהמודלים בהשוואה הזו. הצ'קפוינטים של Decision 3.0 מגיעים כנתיב הסקה מקומי במאגר Hugging Face ולא כנקודת קצה ניתנת לניתוב, ו-Microsoft-Decision-1 מופץ דרך הפלטפורמה של מיקרוסופט עצמה ומספר פלטפורמות של צד שלישי — לא דרכנו. אין לפרש דבר כאן כטענת זמינות לאף אחד מהשניים.

מה ששכבת הניתוב באמת שווה בהחלטה הזו נמצא בחצי השני של הלולאה. מודל ניקוד זול מעצם טבעו; המודל שפועל על הפלט שלו — לא, ושילוב מודל החלטה עם מודל גנרטיבי פירושו בדרך כלל שתי אינטגרציות, שני קשרי חיוב ושתי נקודות כשל. קריאה לשניהם דרך מפתח אחד על פני יותר מ-200 מודלים — עם מעבר אוטומטי לגיבוי כשספק מתערער, ומחיר המחירון של הספק מועבר הלאה בתוספת של 0%, כך ששינוי מחיר של ספק נכנס לתוקף באותו יום — מאפשר לך להחליף את מודל הניקוד בלי לגעת בנקודת הקריאה. זה חשוב כאן יותר מהרגיל, משום ששני המודלים האלה מוקדמים מספיק כדי שההחלטה שתקבל השבוע תהיה כזו שתוכל לבטל בחודש הבא.

A screenshot of the OrcaRouter models catalogue, headed 'Models - 207 models - 16 providers - one API key, one bill'. Filter tabs read All 207, Text 172, Image 10, Embeddings 5, Video 10 and TTS 10. A panel titled 'How to call any model' lists three steps - copy the model ID from any card, paste it into the model field, POST to our OpenAI-compatible endpoint - beside a code block showing POST https://api.orcarouter.ai/v1/chat/completions. Model cards below include OpenAI: GPT-6.1 Sol and Anthropic: Claude Sonnet 5.5 at $2.00 per million input tokens and $10.00 output, and TypeSafe: Jev 1.13 at 65K context with $0.042 per million input tokens and $0.042 per million output tokens. A credit panel above shows monthly plans from $50 to $1,000.

השאלה שתכריע את זה בעוד חצי שנה

שתי קבוצות ביצעו אימון-המשך לאותו צ'קפוינט בסיס והפכו אותו לאותה צורת מוצר באותו שבוע, והגיעו למסקנות הפוכות לגבי האופן שבו הוא אמור להגיע ללקוח. אין זה כל כך צירוף מקרים של תזמון אלא הסתעפות באופן שבו הקטגוריה נמכרת: כמשקלים או כשירות, כדבר שבבעלותך או כדבר שאתה קורא לו.

שימו לב לשלושה אותות. האם הריבייס של מיקרוסופט אל MAI או אל המודלים שלה משנה את התנהגות הדיוק וההשהיה שהיא מוכרת כעת — וכמה הודעה מוקדמת מקבלים הלקוחות. האם vLLM-SR מפרסמת תקציב קלט ונתון כיול עבור Decision 3.0, ובכך סוגרת את הפער שמונע מהמדד שלה להיות שמיש לפעולה. והאם מישהו מחוץ לשתי המעבדות מריץ את חבילת הבדיקות הציבורית על משקולות ה-d3 שפורסמו, כי נכון לעכשיו המספר היחיד שיכריע את ההשוואה הזו הוא מספר שאף אחד מהספקים לא הפיק.