כרטיס כותרת שנוצר עבור Microsoft-Decision-1 לעומת Liquid AI d1-3B, עם כתובית 'שני מודלי ההחלטה היחידים שמסכימים לגבי חלון ההקשר', עם תגים שמציגים 32,768 טוקנים בשניהם, טקסט בלבד לעומת טקסט, תמונות ואודיו, 25 שפות לעומת 16, API מתארח לעומת משקולות lfm1.0, ובתחתית צוין שהנתונים של שני הספקים הם בהצהרה עצמית ולא מאומתים.
Guides & Insights

Microsoft-Decision-1 מול Liquid AI d1-3B: אותו חלון 32K, שני חושים שונים

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

לשם שינוי, המפרט מסתדר. Microsoft-Decision-1, זמין לשימוש כללי ב-Microsoft Foundry מאז 8 באוקטובר 2026, מכיל 32,768 טוקנים של הקשר. כך גם Liquid AI d1-3B, שהועלה ל-Hugging Face ב-5 באוקטובר 2026 והוכרז על ידי Liquid AI יומיים לאחר מכן. שניהם מקבלים מצב יחד עם קבוצה של שאלות מטיפוסים מוגדרים — כן/לא, בחירה מבין אפשרויות בעלות שמות, עמדה על סולם סדור — ושניהם עונים במעבר קדימה יחיד עם התפלגות הסתברות במקום טקסט מיוצר; Laya, Intern-Decision-4B, Kev ושאר הנישה הזו חלוקים ביניהם לגבי אורך ההקשר, כך שזהו הזיווג היחיד שבו הממד הזה יוצא מהמשוואה וההשוואה צריכה להיות מנומקת על בסיס משהו אחר.

ה"משהו האחר" מתגלה כערוץ הקלט. המודל של מיקרוסופט הוא טקסטואלי בלבד, במפורש: הוא "אינו מקבל או מייצר תוכן של תמונה, שמע או וידאו". זה של Liquid AI נושא מקודד ראייה SigLIP2 NaFlex עם 400 מיליון פרמטרים על עמוד שדרה לשוני עם 2.6 מיליארד פרמטרים ומגיע ל-3.12 מיליארד פרמטרים בסך הכול, והוא נבנה בדיוק לדבר שמיקרוסופט שללה — לתת ציון לצילום מסך, לטופס סרוק או לפריים ממצלמה מול שאלה קבועה. הפיצול הזה, בתוספת הבדל ברישיון שאין לו דבר עם היכולת, הוא כל ההתמודדות.

במקום ששניהם מסכימים, וזה יותר ממה שהיית מצפה

• חלון הקשר — 32,768 טוקנים עבור Microsoft-Decision-1 ו-32,768 טוקנים עבור Liquid AI d1-3B.

• מבנה הפלט — הסתברויות מכוילות על פני האפשרויות שסופקו; אף אחד מהם אינו מייצר טקסט, ומונה השימוש של Liquid AI מדווח על כך בתור output_tokens: 0.

• סוגי שאלות — גם בחירת מסמך, ניקוד מסודר וגם כן/לא בינארי, ושניהם מאפשרים להגדיר את מערך האפשרויות לכל בקשה במקום לאמן מחדש ראש אוצר מילים.

• הימנעות — Microsoft מתעדת אפשרויות הימנעות מפורשות כגון "לא ניתן לדעת"; סכימת Decision Index של Liquid AI תומכת בכך באמצעות מערך האפשרויות שלה.

• הסקה במעבר יחיד — קריאה אחת לכל החלטה בשני הצדדים, וזה מה שהופך כל אחד מהם לישים בהיקפים של פייפליין.

שני מודלים שמסכימים על שני האילוצים הקשים ביותר בנישה הזו הם דבר שראוי להתעכב עליו. חלון של 32K הוא מה שהופך מדרג החלטות לשימושי על חוזה מלא, מדיניות מרובת עמודים או שרשור תמיכה ארוך; צ'קפוינט Laya באנגלית של 512 טוקנים ומגבלות השאלות לכל קריאה ב-Intern-Decision-4B לא. אם הקלט שלך קצר, רוב מה שיש בתחום הזה ניתן להחלפה, וההחלטה היא בעניין אירוח. אם הקלט שלך ארוך, התחום מצטמצם לשניים האלה.

התחושה שרק לאחד מהם יש

Liquid AI d1-3B הוא מולטימודלי, ועץ המודלים מבהיר את השושלת: LFM2.5-2.6B-Base, אחר כך LFM2.5-VL-3B, ואז d1-3B שעבר אימון-המשך לקבלת החלטות מכוילות במעבר יחיד. תמונות נכנסות דרך המקודד SigLIP2 NaFlex, והכרטיס מדווח על ממוצע של 74.1 across eleven public image benchmarks לעומת 73.9 עבור מודל הראייה הבסיסי — כך שכיוונון-ההחלטות לא פגע באיכות הראייה שלו. הוא גם מדווח על הניסוי ההפוך: הסירו את התמונות ואותן שאלות צונחות ל-45.1, וזו הראיה הנקייה ביותר שתקבלו לכך שערוץ התפיסה הוא עומס נשיאה ולא קישוט.

אין מקבילה ל-Microsoft-Decision-1, וההשמטה מכוונת ולא תוצאה של עבודה שלא הושלמה. הכרטיס של Microsoft מפרט את השימושים מחוץ לתחום כיצירת טקסט, מענה על שאלות פתוחות, שיחה, תרגום וסיכום, ובנפרד מציין שהמודל הוא טקסטואלי בלבד. עבור צינור עיבוד שצריך להעניק ציון לצילום מסך של טופס לפי מחוון, או להחליט אם פריים ממצלמה מכיל אירוע בטיחות, זהו עצירה מוחלטת — שום הנדסת פרומפטים לא מחזירה מודאליות שהמודל מעולם לא קיבל.

ספירת השפות נעה בכיוון ההפוך, וזהו הפער האמיתי השני. Microsoft-Decision-1 מפרטת 25 שפות נתמכות, והחברה כנה בכך שכיסוי, איכות וכיול "עשויים להשתנות לפי שפה", כשהיא מכנה שפות שאינן אנגלית ובמיוחד שפות דלות משאבים כתחום של תת-ביצועים. Liquid AI d1-3B מציין 16 שפות. מבחינת רוחב, Microsoft מובילה על הנייר; מבחינת כנות לגבי מה שרוחב אומר, שני הספקים אומרים משהו דומה, ואף אחד מהשניים לא פרסם כיול לפי שפה.

A generated two-column scoreboard for Microsoft-Decision-1 and Liquid AI d1-3B across six shared dimensions: context window 32,768 tokens for both; modality text-only versus text, images and audio through a 400M SigLIP2 NaFlex encoder on a 3.12B model; languages 25 versus 16; published scores none versus a vendor-scored value of 48.57 on Liquid AI's own Decision Index; weights not distributed versus lfm1.0 weights on Hugging Face; and latency not published versus 8 ms per decision on an RTX 4090 and 30 ms on an Apple M5 Pro. A footer notes both vendors' figures are self-reported and unreproduced.

לשונית ה-Benchmark, שוב

עמוד ה-Foundry של Microsoft-Decision-1 מכיל לשונית Benchmarks עם סעיף מתודולוגיה וללא נתונים: בנצ'מרקים ציבוריים וקהילתיים לקבלת החלטות בתוספת קבוצות פנימיות שנשמרו בצד, מדדים המכסים דיוק ושגיאת כיול, סדר האפשרויות משתנה, מבחנים סטטיסטיים מזווגים, וטענה שהמודל "מתפקד ברמה של מודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שנבדקו באותה מתודולוגיה." אין מה לבדוק, אין מה לשחזר.

Liquid AI d1-3B מפרסם 48.57 ב-Decision Index 0.2.1 — וההסתייגות חשובה יותר מהמספר, מפני ש-Decision Index הוא אינדקס של Liquid AI עצמה ו-d1-3B הוא מודל של Liquid AI עצמה. זוהי תוצאה שנוקדה על ידי ספק בבנצ'מרק שנכתב על ידי ספק, וממוצבת על ידי החברה כטובה ביותר מבין מודלי החלטה מתחת ל-10B ומקדימה מודל 35B באותה סקאלה. התייחסו ל-48.57 כאל טענה כיוונית, ולא כאל נתון מבוקר. לצדה, הכרטיס מפרט הערכות פנימיות של פורמט החלטות בממוצע של 77.1, SQuAD 2.0 ב-85.3, PAWS-X ב-76.9 ו-DecisionBench 71.8 — כולם בדיווח עצמי, והמסגור של "מתחת ל-10B" הוא הסתייגות אמיתית ולא התחמקות, שכן המודל הוא 3.12B.

אז שאלת הכיול נפתרת באותו אופן שבו היא נפתרת בכל התחום הזה: Liquid AI נותנת לך מספר שנוצר בסקאלה שלה, Microsoft נותנת לך מתודולוגיה ובלי מספר, ואף אחת מהן לא נותנת לך מדידה בלתי תלויה של צד שלישי. נתון הכיול היחיד שיהיה חשוב לפריסה שלך הוא זה שתחשב על נתונים מתויגים משלך.

A screenshot of the Microsoft-Decision-1 model catalogue page on Microsoft Foundry, read 10 October 2026, headed Catalog / Models / Microsoft-Decision-1 with Details, Benchmarks, Responsible AI and License tabs. The visible text describes a decision-scoring model returning calibrated probability scores for fixed answer options instead of generated text, built on Alibaba's open-weight Qwen3.5-9B and post-trained by Microsoft, with quick facts listing publisher Microsoft, lifecycle Generally available (GA), context window 32768 and a Pricing field that links out rather than printing a rate.

הגשה, רישיונות, ומה שאתם בעצם קונים

ההשהיה של d1-3B מפורסמת, והיא הסיבה שהמודל קיים. שמונה מילישניות להחלטה על RTX 4090, תשע על AMD MI325X, עם תפוקה דחוסה של 475 ו-1,106 בשנייה ב-64 מצבים. על חומרת קצה: 30 מילישניות על Apple M5 Pro, 16 מילישניות על Jetson AGX Thor, 26 מילישניות על Jetson AGX Orin 64 GB, 50 מילישניות על Orin Nano. Microsoft-Decision-1 אינו מפרסם נתון השהיה כלל, והאפשרויות המובנות בו — API מתארח של Foundry על בסיס תשלום לפי שימוש או תפוקה מוקצית שמורה, כאשר הסקת אצווה מושבתת — משמעותן שאתה מודד אותו דרך הפריסה שלך. זה אינו פער קטן עבור מודל שכל מטרתו היא להיקרא פעם אחת לכל מסמך מאוחזר או פעולה מוצעת.

הרישיון הוא הנקודה שבה השניים נפרדים בדרך שמפתיעה אנשים. Liquid AI d1-3B מתויג lfm1.0, לא Apache 2.0 — אותו רישיון משפחתי כמו שאר קו LFM של Liquid, שנושא תנאי שימוש שרישיון מתירני אינו נושא. אם הסקירה המשפטית שלך קוראת לכך "תואם OpenAI ללא תנאים", זה לא זה, וכדאי לקרוא אותו לפני שהמודל יוצא לדרך ולא אחרי. ל-Microsoft-Decision-1 אין משקלים בכלל: זה נקודת קצה מתארחת תחת תיק Direct from Azure, עם אימות Azure, חיוב מאוחד, בלי הורדה, ושאלת הרישיון מוחלפת בהסכם שירות. אין אפשרות לכוונן עדין אף אחד מהמודלים דרך הנתיבים שהספקים מתעדים, וזו המגבלה החדה ביותר עבור מודל החלטה — מדרג שאינך יכול להתאים לתוויות שלך הוא מדרג שאי אפשר לתקן בו את אופני השגיאה, רק לעקוף אותם.

ניתוב סביבם הוא המקום שאליו שייך OrcaRouter בתבנית הזו, ורק בצד אחד שלה. איננו מארחים לא את Microsoft-Decision-1 ולא את Liquid AI d1-3B: אף אחד מהם אינו מחזיר טקסט, אף אחד מהם אינו בקטלוג שלנו, ונקודת קצה לדירוג הסתברויות אינה יעד של chat-completions. מה שאנחנו מספקים הוא החצי המחולל של הלולאה — המודל שמנסח את התשובה שהמעריך שלך ידרג, מחלץ את השדות שהמעריך שלך ישפוט, או מציע את הפעולה שהמעריך שלך יאשר. מדובר ביותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI במחיר המחירון של הספק, מועבר הלאה עם 0% תוספת, כך ששינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום, ומעבר אוטומטי (failover) מכסה את קריאת היצירה בלולאה שאין בה זמן השהיה פנוי לניסיון חוזר.

A screenshot of the OrcaRouter models catalogue page headed 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters. Neither decision model appears in the catalogue.

שני פיקים נקיים, ואחד שלא צמוד

קח את Liquid AI d1-3B אם משהו בפייפליין שלך הוא תמונה. מיון צילומי מסך, חילוץ טפסים, ניתוב בקרת איכות חזותית, מודרטור שמדרג פריימים ממצלמה — לא ניתן לגרום ל-Microsoft-Decision-1 לעשות זאת, ו-d1-3B נבנה בדיוק לשם כך, עם בנצ'מרקים חזותיים שפורסמו כדי לגבות את הטענה. קח אותו גם אם אתה צריך הסקת קצה הנמדדת בעשרות מילישניות על Jetson או על מחשב נייד, אם אתה רוצה את המודל על החומרה שלך, או אם רישיון שאתה יכול לקרוא מספיק ליועץ המשפטי שלך.

בחר ב־Microsoft-Decision-1 אם הקלט שלך הוא טקסט, המסמכים שלך ארוכים, החסם שלך הוא רכש — אימות Azure, חיוב מאוחד, הערכת בינה מלאכותית אחראית, ספק שאליו ניתן להסלים — או שהתעבורה שלך מכסה יותר מ-16 השפות ש-d1-3B מפרט. קבל את העובדה שנתון השהיה החסר וטבלת הבנצ'מרק החסרה שלו אומרים שהשבועיים הראשונים שלך איתו הם מדידה, לא אינטגרציה.

המקרה היחיד שאינו גבולי הוא עבודה מולטימודלית: שם, הבחירה נעשתה כאשר מיקרוסופט כתבה "טקסט בלבד" בכרטיס המודל.