
Microsoft-Decision-1 נגד Kev: לקנות ציון, או להחזיק במתכון שמייצר אותו
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
ג'ארד פאלמר הניח קבלה לצד המודל שלו. משפחת Kev — Kev-0.8B, Kev-4B ו-Kev-9B, שנבנו על צ'קפוינטים בסיסיים קפואים במשקלים פתוחים עם מתאם LoRA בדרגה 16 וראש מצביע קטן — שוחררה ב-24 בספטמבר 2026 כאשר מתכון האימון שלה, ספירות הנתונים שלה שלב אחר שלב ומספרי ההערכה שלה כולם פורסמו, והכותרת הכנה עבור כל מי שמשווה אותה ל-Microsoft-Decision-1 היא ש-Kev מספר לך הרבה יותר על איך לשחזר את עצמה. המעריך של Microsoft הושק לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: בסיס Qwen3.5-9B שעבר אימון-על על ידי Microsoft, חלון הקשר של 32,768 טוקנים, טקסט בלבד, המשקלים אינם מופצים, מתודולוגיית הערכה שפורסמה וללא תוצאות שפורסמו. שניהם מקבלים מצב וקבוצה של שאלות עם טיפוסים ומחזירים התפלגות מכוילת במקום טקסט שנוצר. האחד הוא שירות, והאחר הוא שיטה שאתה יכול להריץ במחברת כבר הלילה.
הסיבה שההבחנה הזו מכריעה את ההתמודדות הזו ולא היכולת: Kev-4B מדווח ECE 0.017 במבחן הנעול מחוץ לתחום שלו, ו-Microsoft-Decision-1 לא מדווח דבר, כך שבטיעון הכיול, שבדרך כלל מכריע השוואה בין מעריך למעריך, רק צד אחד מציג את עמדתו.
מה שקֶב באמת מפרסם
הכרטיס של Kev-4B ספציפי באופן יוצא דופן, והספציפיות היא העיקר. עמוד השדרה הוא Qwen3.5-4B-Base, קפוא בגרסה נקובת שם, עם 24 שכבות קשב ליניארי מסוג Gated DeltaNet ו-8 שכבות קשב מלא בגודל חבוי 2,560. על גביו יושב מתאם LoRA בדרגה 16 — 33.8 מיליון פרמטרים הניתנים לאימון, המיושם על היטלי attention, MLP ו-DeltaNet — וראש pointer המדרג את טוקן הסיום של כל אפשרות מול הטוקן האחרון של השאלה ומפעיל softmax. טמפרטורה אחת, T = 2.41, נשמרת בקובץ הראש ומוחלת בעת הטעינה, והכרטיס נותן את הערך המותאם ואת ה-hash של הקובץ. האימון התנהל בשלבים עם מספרי רשומות שפורסמו: מתכון בסיס של 12,576 רשומות, 1,425 עבור תאריכים וראיות חסרות, 5,219 נרטיבים אמיתיים של תלונות CFPB, 6,000 רשומות מיומנויות ו-5,320 רשומות של כלי פיתוח, כששלבים מאוחרים יותר מריצים מחדש את הקודמים. הכרטיס גם מציין מה לא נעשה בו שימוש: "לא נעשה שימוש בפלט של Jev (מודל ההחלטות המתארח של TypeSafe)."
טבלת הבנצ׳מרק מוצגת באותו עמוד, והיא מגיעה עם מקרי הכישלון מצורפים, וזה נדיר יותר מההצלחות. Transfer-v4 במבחן חסום מחוץ לתחום: דיוק 0.838, Brier 0.224, ECE 0.017. Breadth-v1 על פני 14 מערכי נתונים שהוחזקו מחוץ לאימון ו-3,089 שאלות: דיוק 0.690, ECE 0.029. מבחן Hard-v1: 0.803. מבחן Documents-v1: 0.903. MMLU-Pro עם עשר אפשרויות: 0.565. חשבון תאריכים: 0.65, שהמחבר ציין כאזור החלש ביותר, עם דגל preprocessor שהוצע כתיקון חלקי והערה מפורשת שלא נמדד מחדש. סעיף המגבלות מוסיף שהכיול הוא טמפרטורה אחת בתוך-התפלגות, ולכן הכיסוי נפגע מחוץ לתחום; שסדר האפשרויות יכול להפוך תשובה; ושמשכים מעל 8,192 טוקנים מוגשים אך אינם מאומתים. גם נתוני ההגשה מפורסמים: 18.1 ms עבור שש שאלות מעל מצב קצר על H100, 12.9 ms במטמון, 14.3 GB זיכרון GPU תושב.

מה שמיקרוסופט מפרסמת במקום זאת
Microsoft-Decision-1 מכסה את רוב אותו תחום עם עמדה שונה. הוא מדרג שאלות כן/לא, רב-ברירה, דירוג, סיווג ורובריקה, תומך באפשרויות הימנעות מפורשות כגון "לא ניתן לדעת", מחזיר הסתברויות JSON, ופועל בקריאה אחת על עד 32K טוקנים — פי ארבעה מההקשר ש-Kev מאמת. הוא מופץ כ-API מתארח ב-Microsoft Foundry תחת פורטפוליו Direct from Azure, עם פריסה ללא שרת ונקודת קצה מאוחדת, SKU סטנדרטי, אימות Azure ונתיב חיוב מאוחד. הסקת אצווה מושבתת, ואין הורדת משקלים ואין מסלול כיוונון עדין.
קטע ההערכה מתאר מדדי החלטה ציבוריים וקהילתיים וכן מערכים פנימיים שנשמרו בנפרד, מדדים הכוללים דיוק ושגיאת כיול, סדר אפשרויות משתנה, מבחנים סטטיסטיים מזווגים, וטענה שהמודל "מתפקד במידה שווה למודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שנערכו לפי אותה מתודולוגיה". אין טבלה. כרטיס המודל מפרט את מגבלותיו ביושר — הציונים משתנים בהתאם לניסוח ולסדר האפשרויות, הכיול חזק ביותר בסוגי משימות מוכרות, לא מופקים הסברים, והכיסוי שאינו באנגלית הוא החלש ביותר — אך רשימת מגבלות אינה מדידת כיול. כל מי שקובע סף קבלה אוטומטית של 0.9 על Microsoft-Decision-1 קובע אותו מתוך אמונה ומכוונן אותו בייצור.

החלק של ההשוואה שעולה כסף
הכלכלה של Kev היא הסיבה שההתמודדות הזו צמודה באמת. המתכון הוא בסיס קפוא ועוד מתאם של 33.8M, מה שאומר שהמודל השולי שאתה מאמן עולה מחשוב בגודל של מתאם, לא מחשוב בגודל של מודל יסוד. אפשר להחזיק את הבסיס בזיכרון פעם אחת ולטעון כמה מתאמים — אחד לכל תחום החלטה — וזו צורת פריסה שה-API המתארח של Microsoft לא יכול לבטא בכלל. אם כללי הניתוב שלך שונים מאלה של שופט גנרי, Kev מאפשר לך לאמן את ההבדל; Microsoft-Decision-1 מאפשר לך לכתוב פרומפט טוב יותר ולקוות.
לעומת זאת, ל-API המתארח אין משטח תפעולי. אין מתאם שצריך לעקוב אחריו, אין מחסנית הגשה שצריך לשמור חמה, אין פער בין הקשר מאומת להקשר מוגש שצריך לתת עליו את הדעת, ואין סיכון שטמפרטורה שהותאמה למערך נתונים אחד תתנהג אחרת על שלך. עבור צוות שנפח ההחלטות שלו מתון, השירות הוא הארטיפקט הזול יותר מבחינת שעות הנדסה גם אם הטוקנים עולים כסף; עבור צוות שמנקד מיליוני פריטים ביום, המתאם באחסון עצמי מנצח בעלות ליחידה ברגע שה-GPU שולם.
יש נתיב שלישי שלא משתמש באף אחד מהשניים בחלק שבו הוא החלש ביותר, ושם יושב OrcaRouter. אנחנו לא מארחים את Microsoft-Decision-1 או Kev — מעריך שמחזיר הסתברויות אינו יעד chat-completions, ואף אחד מהשניים אינו בקטלוג שלנו. החצי הגנרטיבי של צינור החלטה הוא מה שאנחנו מציעים: המודל שמנסח את התשובה המועמדת, כותב את מחוון ההערכה, או פולט את קריאת הכלי שמקבלת ניקוד. כל זה עומד מאחורי מפתח אחד תואם OpenAI ועליו יותר מ-200 מודלים במחיר המחירון של הספק, כשהוא מועבר הלאה עם 0% תוספת, כך ששינוי מחיר מצד ספק בא לידי ביטוי אצלנו באותו היום. אם אתם בונים לופ של ניקוד או מיון, קריאת הכתיבה ניתנת לניתוב וקריאת הניקוד לא, ושמירה על הגבול הזה ברור היא מה שמונע מצינור ניקוד להפוך בשקט לצינור צ'אט.

איך להחליט
בחרו Kev כאשר אתם צריכים מספרים לפני שאתם משחררים, כאשר אתם רוצים לבצע כיוונון עדין על תוויות ההחלטה שלכם, כאשר אתם רוצים להריץ ניקוד בתוך הגבול שלכם בעלות שולית אפס, או כאשר אתם רוצים שכמה תחומי החלטה יחלקו מודל בסיס תושב אחד. נתוני ה-ECE המפורסמים שלו הם עדיין מדידות של המחבר עצמו על ההרנס של המחבר עצמו — התייחסו אליהם כהערכה עצמית מהימנה, לא כתוצאה מבוקרת של צד שלישי — אבל הם לפחות קנה מידה מוצהר שאפשר לנסות לשחזר, והמתכון נמצא ממש שם כדי לשחזר אותם איתו.
בחר Microsoft-Decision-1כאשר גורם השער הוא רכש או אורך הקשר: נקודת קצה מנוהלת של Azure עם חיוב מאוחד וחבילת Responsible AI, 32K של קלט עבור מסמכים ארוכים, וספק שאפשר להסלים אליו. טבלת הבנצ'מרק החסרה שלו אינה שערורייה — הרבה מודלים מתארחים משיקים בלי אחת — אבל זה כן אומר שעקומת הכיול הראשונה עבור המודל הזה תשורטט על ידי המשתמשים שלו, וכדאי שתכנן להיות אחד מהם, על הנתונים המתויגים שלך, לפני שאתה מחיל עליו סף ייצור.
