כרטיס כותרת שנוצר עבור Microsoft-Decision-1 מול Kev, עם כותרת משנה 'מודד מתארח מול מתכון שאפשר לאמן מחדש', עם צ'יפים שקוראים API מתארח של 9B מול בסיס קפוא בתוספת מתאם LoRA בדירוג 16 בנפח 33.8M, ללא מדדי ביצועים מפורסמים מול ECE 0.017 על transfer-v4, ללא משקולות מופצות מול Apache-2.0, וכיתוב מקור בתחתית שמציין ששני מערכי המספרים הם בדיווח עצמי.
Engineering & Research

Microsoft-Decision-1 נגד Kev: לקנות ציון, או להחזיק במתכון שמייצר אותו

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ג'ארד פאלמר הניח קבלה לצד המודל שלו. משפחת Kev — Kev-0.8B, Kev-4B ו-Kev-9B, שנבנו על צ'קפוינטים בסיסיים קפואים במשקלים פתוחים עם מתאם LoRA בדרגה 16 וראש מצביע קטן — שוחררה ב-24 בספטמבר 2026 כאשר מתכון האימון שלה, ספירות הנתונים שלה שלב אחר שלב ומספרי ההערכה שלה כולם פורסמו, והכותרת הכנה עבור כל מי שמשווה אותה ל-Microsoft-Decision-1 היא ש-Kev מספר לך הרבה יותר על איך לשחזר את עצמה. המעריך של Microsoft הושק לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: בסיס Qwen3.5-9B שעבר אימון-על על ידי Microsoft, חלון הקשר של 32,768 טוקנים, טקסט בלבד, המשקלים אינם מופצים, מתודולוגיית הערכה שפורסמה וללא תוצאות שפורסמו. שניהם מקבלים מצב וקבוצה של שאלות עם טיפוסים ומחזירים התפלגות מכוילת במקום טקסט שנוצר. האחד הוא שירות, והאחר הוא שיטה שאתה יכול להריץ במחברת כבר הלילה.

הסיבה שההבחנה הזו מכריעה את ההתמודדות הזו ולא היכולת: Kev-4B מדווח ECE 0.017 במבחן הנעול מחוץ לתחום שלו, ו-Microsoft-Decision-1 לא מדווח דבר, כך שבטיעון הכיול, שבדרך כלל מכריע השוואה בין מעריך למעריך, רק צד אחד מציג את עמדתו.

מה שקֶב באמת מפרסם

הכרטיס של Kev-4B ספציפי באופן יוצא דופן, והספציפיות היא העיקר. עמוד השדרה הוא Qwen3.5-4B-Base, קפוא בגרסה נקובת שם, עם 24 שכבות קשב ליניארי מסוג Gated DeltaNet ו-8 שכבות קשב מלא בגודל חבוי 2,560. על גביו יושב מתאם LoRA בדרגה 16 — 33.8 מיליון פרמטרים הניתנים לאימון, המיושם על היטלי attention, MLP ו-DeltaNet — וראש pointer המדרג את טוקן הסיום של כל אפשרות מול הטוקן האחרון של השאלה ומפעיל softmax. טמפרטורה אחת, T = 2.41, נשמרת בקובץ הראש ומוחלת בעת הטעינה, והכרטיס נותן את הערך המותאם ואת ה-hash של הקובץ. האימון התנהל בשלבים עם מספרי רשומות שפורסמו: מתכון בסיס של 12,576 רשומות, 1,425 עבור תאריכים וראיות חסרות, 5,219 נרטיבים אמיתיים של תלונות CFPB, 6,000 רשומות מיומנויות ו-5,320 רשומות של כלי פיתוח, כששלבים מאוחרים יותר מריצים מחדש את הקודמים. הכרטיס גם מציין מה לא נעשה בו שימוש: "לא נעשה שימוש בפלט של Jev (מודל ההחלטות המתארח של TypeSafe)."

טבלת הבנצ׳מרק מוצגת באותו עמוד, והיא מגיעה עם מקרי הכישלון מצורפים, וזה נדיר יותר מההצלחות. Transfer-v4 במבחן חסום מחוץ לתחום: דיוק 0.838, Brier 0.224, ECE 0.017. Breadth-v1 על פני 14 מערכי נתונים שהוחזקו מחוץ לאימון ו-3,089 שאלות: דיוק 0.690, ECE 0.029. מבחן Hard-v1: 0.803. מבחן Documents-v1: 0.903. MMLU-Pro עם עשר אפשרויות: 0.565. חשבון תאריכים: 0.65, שהמחבר ציין כאזור החלש ביותר, עם דגל preprocessor שהוצע כתיקון חלקי והערה מפורשת שלא נמדד מחדש. סעיף המגבלות מוסיף שהכיול הוא טמפרטורה אחת בתוך-התפלגות, ולכן הכיסוי נפגע מחוץ לתחום; שסדר האפשרויות יכול להפוך תשובה; ושמשכים מעל 8,192 טוקנים מוגשים אך אינם מאומתים. גם נתוני ההגשה מפורסמים: 18.1 ms עבור שש שאלות מעל מצב קצר על H100, 12.9 ms במטמון, 14.3 GB זיכרון GPU תושב.

A generated two-column scoreboard for Microsoft-Decision-1 and Kev across six shared dimensions: base model Qwen3.5-9B post-trained by Microsoft versus a frozen Qwen3.5-4B-Base with a 33.8M rank-16 LoRA adapter and pointer head; weights not distributed versus Apache-2.0 download; context 32,768 tokens versus 8,192 validated and 65,536 served; published scores none versus vendor-reported ECE 0.017 on transfer-v4 with Brier 0.224; tuning not available versus the full training recipe published with per-stage record counts; and price a Foundry per-token rate versus free to self-host. A footer reads that both sets of figures are self-reported by their publishers.

מה שמיקרוסופט מפרסמת במקום זאת

Microsoft-Decision-1 מכסה את רוב אותו תחום עם עמדה שונה. הוא מדרג שאלות כן/לא, רב-ברירה, דירוג, סיווג ורובריקה, תומך באפשרויות הימנעות מפורשות כגון "לא ניתן לדעת", מחזיר הסתברויות JSON, ופועל בקריאה אחת על עד 32K טוקנים — פי ארבעה מההקשר ש-Kev מאמת. הוא מופץ כ-API מתארח ב-Microsoft Foundry תחת פורטפוליו Direct from Azure, עם פריסה ללא שרת ונקודת קצה מאוחדת, SKU סטנדרטי, אימות Azure ונתיב חיוב מאוחד. הסקת אצווה מושבתת, ואין הורדת משקלים ואין מסלול כיוונון עדין.

קטע ההערכה מתאר מדדי החלטה ציבוריים וקהילתיים וכן מערכים פנימיים שנשמרו בנפרד, מדדים הכוללים דיוק ושגיאת כיול, סדר אפשרויות משתנה, מבחנים סטטיסטיים מזווגים, וטענה שהמודל "מתפקד במידה שווה למודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שנערכו לפי אותה מתודולוגיה". אין טבלה. כרטיס המודל מפרט את מגבלותיו ביושר — הציונים משתנים בהתאם לניסוח ולסדר האפשרויות, הכיול חזק ביותר בסוגי משימות מוכרות, לא מופקים הסברים, והכיסוי שאינו באנגלית הוא החלש ביותר — אך רשימת מגבלות אינה מדידת כיול. כל מי שקובע סף קבלה אוטומטית של 0.9 על Microsoft-Decision-1 קובע אותו מתוך אמונה ומכוונן אותו בייצור.

A screenshot of the Kev-4B model card on Hugging Face, read 10 October 2026, showing the jaredpalmer organisation, 114 likes, an apache-2.0 licence label, and the Model card, Files and versions and Community tabs above the Kev-4B heading and a Model summary section.

החלק של ההשוואה שעולה כסף

הכלכלה של Kev היא הסיבה שההתמודדות הזו צמודה באמת. המתכון הוא בסיס קפוא ועוד מתאם של 33.8M, מה שאומר שהמודל השולי שאתה מאמן עולה מחשוב בגודל של מתאם, לא מחשוב בגודל של מודל יסוד. אפשר להחזיק את הבסיס בזיכרון פעם אחת ולטעון כמה מתאמים — אחד לכל תחום החלטה — וזו צורת פריסה שה-API המתארח של Microsoft לא יכול לבטא בכלל. אם כללי הניתוב שלך שונים מאלה של שופט גנרי, Kev מאפשר לך לאמן את ההבדל; Microsoft-Decision-1 מאפשר לך לכתוב פרומפט טוב יותר ולקוות.

לעומת זאת, ל-API המתארח אין משטח תפעולי. אין מתאם שצריך לעקוב אחריו, אין מחסנית הגשה שצריך לשמור חמה, אין פער בין הקשר מאומת להקשר מוגש שצריך לתת עליו את הדעת, ואין סיכון שטמפרטורה שהותאמה למערך נתונים אחד תתנהג אחרת על שלך. עבור צוות שנפח ההחלטות שלו מתון, השירות הוא הארטיפקט הזול יותר מבחינת שעות הנדסה גם אם הטוקנים עולים כסף; עבור צוות שמנקד מיליוני פריטים ביום, המתאם באחסון עצמי מנצח בעלות ליחידה ברגע שה-GPU שולם.

יש נתיב שלישי שלא משתמש באף אחד מהשניים בחלק שבו הוא החלש ביותר, ושם יושב OrcaRouter. אנחנו לא מארחים את Microsoft-Decision-1 או Kev — מעריך שמחזיר הסתברויות אינו יעד chat-completions, ואף אחד מהשניים אינו בקטלוג שלנו. החצי הגנרטיבי של צינור החלטה הוא מה שאנחנו מציעים: המודל שמנסח את התשובה המועמדת, כותב את מחוון ההערכה, או פולט את קריאת הכלי שמקבלת ניקוד. כל זה עומד מאחורי מפתח אחד תואם OpenAI ועליו יותר מ-200 מודלים במחיר המחירון של הספק, כשהוא מועבר הלאה עם 0% תוספת, כך ששינוי מחיר מצד ספק בא לידי ביטוי אצלנו באותו היום. אם אתם בונים לופ של ניקוד או מיון, קריאת הכתיבה ניתנת לניתוב וקריאת הניקוד לא, ושמירה על הגבול הזה ברור היא מה שמונע מצינור ניקוד להפוך בשקט לצינור צ'אט.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither Kev nor Microsoft-Decision-1 appears, because neither is a chat-completions target.

איך להחליט

בחרו Kev כאשר אתם צריכים מספרים לפני שאתם משחררים, כאשר אתם רוצים לבצע כיוונון עדין על תוויות ההחלטה שלכם, כאשר אתם רוצים להריץ ניקוד בתוך הגבול שלכם בעלות שולית אפס, או כאשר אתם רוצים שכמה תחומי החלטה יחלקו מודל בסיס תושב אחד. נתוני ה-ECE המפורסמים שלו הם עדיין מדידות של המחבר עצמו על ההרנס של המחבר עצמו — התייחסו אליהם כהערכה עצמית מהימנה, לא כתוצאה מבוקרת של צד שלישי — אבל הם לפחות קנה מידה מוצהר שאפשר לנסות לשחזר, והמתכון נמצא ממש שם כדי לשחזר אותם איתו.

בחר Microsoft-Decision-1כאשר גורם השער הוא רכש או אורך הקשר: נקודת קצה מנוהלת של Azure עם חיוב מאוחד וחבילת Responsible AI, 32K של קלט עבור מסמכים ארוכים, וספק שאפשר להסלים אליו. טבלת הבנצ'מרק החסרה שלו אינה שערורייה — הרבה מודלים מתארחים משיקים בלי אחת — אבל זה כן אומר שעקומת הכיול הראשונה עבור המודל הזה תשורטט על ידי המשתמשים שלו, וכדאי שתכנן להיות אחד מהם, על הנתונים המתויגים שלך, לפני שאתה מחיל עליו סף ייצור.