כרטיס כותרת שנוצר עבור Microsoft-Decision-1 לעומת Liquid AI d1-omni-600M, עם כתובית משנה 'משטח החיישנים הרחב ביותר בקטגוריה מול רשימת הקלטים הצרה ביותר', עם צ'יפים המציינים 587M פרמטרים עם ראייה ושמע, Foundry API לטקסט בלבד, 30 שניות של דיבור מול 32,768 טוקנים של טקסט, מקודד דו-כיווני מול מפענח שעבר פוסט-אימון, וללא כיול מפורסם באף אחד מהצדדים.
Engineering & Research

Microsoft-Decision-1 מול Liquid AI d1-omni-600M: מעריך שמקשיב לעומת מעריך שרק קורא

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

אתה מנתב תביעות בדלפק ביטוח, והתיק מגיע כשלושה דברים: קובץ PDF, תצלום של דלת מעוכה, ושיחת טלפון בת תשעים שניות. Liquid AI d1-omni-600M יכול לקרוא את המסמך, להסתכל בתצלום ולהקשיב לשיחה, ואז לענות על סט שאלות שכתבת מראש — האם זה מכוסה, איזו קטגוריה, עד כמה חמור, בסולם משתיים עד עשר — במעבר אחד, בלי טקסט שנוצר ובלי דבר לנתח. Microsoft-Decision-1 יכול לקרוא את המסמך. הוא הפך לזמין לכלל הציבור ב-Microsoft Foundry ב-8 באוקטובר 2026 כמודל ניקוד מתארח, טקסטואלי בלבד, שעבר אימון-המשך על Qwen3.5-9B עם חלון של 32,768 טוקנים, ומשטח הקלט שלו נגמר שם: בלי תמונה, בלי אודיו, בלי וידאו. שניהם מחזירים הסתברויות מכוילות על אפשרויות שאתה מספק, שניהם פולטים אפס טוקני פלט, ואף אחד מהם לא פרסם נתון כיול.

המשפט המשותף האחרון הזה הוא החלק הלא-נוח בהשוואה הזאת. שני אלה הם מודלי ההחלטה עם החיישן הרחב ביותר ועם החיישן הצר ביותר שישוחררו החודש, ולמרות כל המרחק הארכיטקטוני ביניהם הם נחתו בדיוק באותה עמדה ראייתית: משקלים אמיתיים או נקודת קצה אמיתית, חוזים מתועדים, ואין שום מספר שמישהו מחוץ לספק יכול להצביע עליו כשמישהו שואל אם ההסתברויות מהימנות.

שני מוצאות, לא שני גדלים

הנתון 587M מזמין אותך לקרוא את Liquid AI d1-omni-600M כקרוב מוקטן של המודלים שהבלוג הזה סקר בעבר. זה לא המקרה. המודל מאומן מ־LFM2.5-Encoder-350M, מקודד דו-כיווני, עם גזע משותף וראש החלטה של 381M, מקודד חזותי של 94M שנלקח מסדרת LFM2.5-VL-450M וFastConformer בעל 17 שכבות לאודיו. Microsoft-Decision-1 הוא שושלת אחרת לגמרי: מפענח Qwen3.5-9B, שעבר אימון-המשך בידי מיקרוסופט, מתארח ב-Foundry, המשקולות אינן מופצות ולא מוצע מסלול כיוונון עדין.

דו-כיווני לעומת דקודר הוא העובדה הארכיטקטונית שמכריעה כיצד כל אחד מהם מתנהג, והיא גם הסיבה לכך שמספרי הפרמטרים הם הסחת דעת. מקודד דו-כיווני קורא את כל המצב בבת אחת, וזו הצורה הנכונה לשיפוט על קלט קבוע; דקודר שעבר אימון-על מוותר על מסלול היצירה אך שומר על הטוקנייזר, על החלון ועל האריזה הארגונית שמגיעים עם פריסת foundry. אף אחד מהם אינו גרסה מוגדלת של האחר, ולא ניתן להחליף ביניהם, לא משנה כיצד קוראים טבלת בנצ'מרקים.

מה רשימת הקלט בעצם נותנת לך

זה המקום שבו ה-d1-omni-600M נבדל בצורה החדה ביותר מכל דבר אחר בקטגוריה, וזה המקום שבו יש לקרוא טענה בעיון.

• דיבור — Liquid AI d1-omni-600M מקבל טקסט בתוספת עד 30 שניות של דיבור ומדווח על החלטה על סמך זה, דבר שאף מעריך טקסטואלי בלבד לא יכול לעשות בכל דיוק. המודאליות הלא-טקסטואליות של Microsoft-Decision-1 אינן קיימות.

• הדרה הדדית — ה-d1-omni-600M מעלה ValueError אם תמונות ואודיו מגיעים באותה בקשה. משטח החיישנים הרחב ביותר בקטגוריה הוא עדיין מודאליות לא-טקסטואלית אחת בכל פעם, וזהו אילוץ ממשי על דסק התביעות הזה.

• קיצוץ — הכרטיס שלו מציין 16,384 מיקומים משולבים של טקסט, תמונה ואודיו, ומוסיף שכאשר יש תמונות, טקסט המצב והשאלה מקוצץ ל-896 טוקנים כדי להתאים לאימון. כל מסמך שאליו תצרף תמונה מתחרה בקיצוץ הזה. 32,768 הטוקנים של Microsoft-Decision-1 הם כולם טקסט ואינם מקוצצים.

• פורמטים — ל-d1-omni-600M יש שלושה סוגי שאלות: noul עבור החלטה בינארית שמחזירה P(yes) בין 0 ל-1, choice עבור תווית אחת מתוך קבוצה שאתם מגדירים, עם רמת ביטחון והסתברות לכל אפשרות, ו-score עבור מיקום על סולם סדור של שתיים עד עשר רמות, עם ההתפלגות שלו. כמה שאלות תלויות במצב אחד ונקראות במעבר אחד, ומונה השימוש מדווח output_tokens: 0. Microsoft מתעדת תצורות של כן/לא, רב-ברירה, דירוג, סיווג ורובריקה, וכן אפשרות הימנעות הנתמכת במפורש כגון "cannot tell" כאשר הראיות אינן מספקות — פרט התכנון היחיד בעמוד של Microsoft שאין לו מקבילה ישירה כאן.

• זמן ריצה — הדגם d1-omni-600M מגיע עם קוד מותאם אישית, דורש trust_remote_code=True, וכרטיס המודל שלו ממליץ על float16 ב-GPU תוך אזהרה ש-bfloat16 שינה את התשובה המובילה בחלק מהשורות. זוהי רגישות בזמן שירות שמתועדת על ידי הספק, ולא פגם. Microsoft-Decision-1 הוא נקודת קצה מנוהלת שבה צורת הפריסה היא המשתנה היחיד בזמן הריצה שלך, וראוי לציין שהסקה באצוות מושבתת: אין ערוץ לא־מקוון שדרכו ניתן לפרוס את עלותה של ריצת ניקוד בהיקף גדול.

A two-column generated scoreboard titled Microsoft-Decision-1 vs Liquid AI d1-omni-600M. Left column Microsoft-Decision-1 rows read: availability Foundry GA, October 8, 2026; base post-trained Qwen3.5-9B decoder; inputs text only; context 32,768 tokens of text, untrimmed; weights not distributed; calibration not published. Right column Liquid AI d1-omni-600M rows read: availability uploaded October 7, 2026; base LFM2.5-Encoder-350M bidirectional encoder with 587M total; inputs text, images, or 30 seconds of speech, one non-text modality at a time; context 16,384 positions with text trimmed to 896 tokens when images are present; weights open under lfm1.0; calibration not published. A footer line reads that neither vendor has published an accuracy or calibration benchmark for these models.

פער הראיות, בשני הכיוונים

Liquid AI פרסמה את משפחת d1 הפתוחה, כולל d1-omni-600M, ב-7 באוקטובר 2026 עם פוסט שחרור ומערך תיעוד. מה שלא פורסם הוא המספר שהיה הופך את הטענה הרב-מודלית לקונקרטית. אין בנצ'מרק דיוק ייעודי ליכולת הדגל שלה — איכות קבלת ההחלטות בראייה ובשמע שמצדיקה את המקודדים 94M ו-112M — וחלק הראייה מוסתר מחומר ההערכה ששוחרר. גם לא פורסם נתון השהיה, כך שאת התפוקה של המודל מגלים על החומרה שלך.

עמדתה של מיקרוסופט זהה מבחינה מבנית, וצעד אחד קדימה. לשונית ה-Benchmarks שלה מפרטת את המדדים — דיוק, שגיאת כיול, ריקול בטיחות, שיעורי חיוביים-שגויים, עקביות הוגנות — ומציינת שההערכה בוצעה על בנצ'מרקים ציבוריים וקהילתיים לקבלת החלטות, ובנוסף על מערכי בדיקה פנימיים מוחזקים שלא שימשו באימון, שסדר האפשרויות שונה, שהופעלו מבחנים סטטיסטיים מזווגים, וטוענת שהמודל "מתפקד בדומה למודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שהוערכו באותה מתודולוגיה". היא אינה מציגה אף אחת מהתוצאות. עשרים וחמישה שפות מופיעות כשפות נתמכות, כולל יפנית, קוריאנית, ערבית, וייטנאמית, תאית, טורקית, הינדי, בנגלית, סווהילית, עברית, פרסית ואוקראינית, עם אזהרה כנה שכיסוי, איכות וכיול "עשויים להשתנות משפה לשפה" ושאי-אנגלית, במיוחד שפות עם מעט משאבים, היא נקודת תורפה. גם התמחור לא נמצא בעמוד המודל; הוא מקשר אל אזור התמחור של מיקרוסופט.

אז ההשוואה בין שני אלה אינה השוואה של ראיות מול ראיות. זהו בחירה בין שני סוגים של מספר חסר. Liquid AI סיפקה את משטח החישה והותירה את הדיוק של אותו משטח בלתי מדוד בפומבי. Microsoft סיפקה את מסלול הרכש — אימות Azure, ממשל, הערכת Responsible AI, מתודולוגיה מתועדת — והותירה את הכיול של מוצר הסתברותי ללא כימות.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

שאלת הכיול שאיש מהם לא עונה עליה

עבור מודל החלטה, ההסתברות היא התוצר. כל מה שבהמשך הוא סף: 0.7 מסלים, 0.95 מאשר אוטומטית, והמחיר של הצבת הקו הזה לא נכון משולם בהחלטות אוטומטיות גרועות ולא בטוקנים. בקטגוריה הזו יש לפחות משפחה אחת שמפרסמת את המספרים — הצ'קפוינטים של Intern-Decision מבית InternLM מציגים מספרי Brier ושגיאת כיול צפויה בכרטיסי המודל שלהם — ואף אחד מהמודלים במאמר זה לא מפרסם אותם. האסימטריה הזו היא הסיבה המעשית להשאיר את מרחב האפשרויות רחב ולא להתחייב על ארכיטקטורה בלבד.

החדשות הטובות הן שהבדיקה זולה ואינה מחייבת את שיתוף הפעולה של הספק. אספו כמה מאות מקרים מתויגים שנראים כמו התעבורה האמיתית שלכם, כתבו את סכמת השאלות שהאפליקציה שלכם באמת תשלח, הריצו את שני המודלים עליהם, וחשבו את שגיאת הכיול הצפויה על הפלט. אז תדעו שני דברים שאיש מחוץ לשני הספקים לא יודע כיום: עד כמה ההסתברויות של Microsoft-Decision-1 עוקבות אחרי הדיוק שלו בהתפלגות שלכם, והאם נתיבי האודיו והתמונה של d1-omni-600M שווים את המקודדים שהם נושאים. ההנחיות המתועדות של Microsoft עצמה מצביעות לאותו כיוון — בצעו ולידציה על נתונים מייצגים, קבעו ספים לפי העלות של השגיאות שלכם, תמיד כללו אפשרות להימנעות, סדרו באקראיות את סדר האפשרויות, ושלבו אדם בתהליך עבור החלטות בעלות השלכות.

היכן כל אחד שייך, והיכן OrcaRouter שייך

Microsoft-Decision-1 שייך בכל מקום שבו החומר המכריע הוא טקסט והחסם הוא רכש: מסמך ארוך, קטע שנשלף, קריאה מוצעת לכלי, תשובה מחוללת הנבחנת מול מחוון, עם אימות Azure, חיוב מאוחד והערכת ספק הנדרשים לפני שמשהו מגיע לייצור. זהו הכלי הצר יותר והקל יותר לאישור.

Liquid AI d1-omni-600M שייך בכל מקום שבו החומר המכריע אינו טקסט — תמונה שצורפה לטופס, הקלטת שיחה קצרה, צילום מסך — ובכל מקום שבו אתה רוצה משקולות lfm1.0 שתוכל להריץ ולכוונן בתוך גבול שאתה שולט בו. זהו הכלי הרחב יותר והקשה יותר לאימות, מפני שהטענה הרב-מודלית היא בדיוק החלק שאין מאחוריו מדד פורסם.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

אף אחד מהשניים אינו בקטלוג שלנו, ושום דבר כאן אינו הצהרת זמינות לגבי מי מהם. מודל שמחזיר הסתברויות במקום טקסט אינו משהו שמנתבים אליו השלמות שיחה, ולהישאר מחוץ למושב הניקוד הוא כל תכליתו של המכשיר. מה ש-OrcaRouter נושאת הוא הצד הגנרטיבי של אותה לולאה: יותר מ-200 המודלים שמאחורי מפתח יחיד תואם OpenAI שכותבים את מחוון הניקוד שלפיו מדרג הגורם המנקד שלך, מתמללים או מסכמים את החומר לפני שהוא הופך למצב, ופולטים את קריאת הכלי שאותה הגורם המנקד שלך מאשר לפני שהיא רצה. מחיר המחירון של הספק מועבר הלאה ב-תוספת של 0%, כך שהורדת מחיר של ספק בצד הגנרטיבי נכנסת לתוקף אצלנו באותו יום. מעבר אוטומטי לכשל שומר על אותו צד פעיל כאשר ספק בודד נפגע — דבר שצינור עיבוד שמנקד כל מסמך מאוחזר מבחין בו מיד — ואם ברצונך שכמה כותבים יישפטו ולא רק אחד, ה-DSL של הניתוב מרכיב אותם לקריאה אחת ומיזוג מודלים מדווח על ההסכמה ביניהם כשדה שהגורם המנקד שלך יכול לקרוא כמו כל שדה אחר.

שורה תחתונה

Microsoft-Decision-1 הגיע לזמינות כללית ב-Microsoft Foundry ב-8 באוקטובר 2026: טקסט בלבד, 32,768 טוקנים, מבוסס על Qwen3.5-9B שעבר אימון לאחר השלב המקדים, מתארח ללא משקולות, אין מחיר בעמוד המודל, אין נתון השהיה ומדור בנצ'מרקים שמתאר את המתודולוגיה שלו בלי להציג תוצאה. Liquid AI d1-omni-600M הועלה ב-7 באוקטובר 2026 כמודל מקודד דו-כיווני בן 587M שקורא טקסט, תמונות או 30 שניות של דיבור — מודאליות אחת שאינה טקסט בכל פעם, כשהטקסט נחתך ל-896 טוקנים כאשר יש תמונות — תחת רישיון lfm1.0, בלי בנצ'מרק דיוק ליכולת הראשית שלו, בלי פיצול חזותי ובלי השהיה שפורסמה. בחרו לפי מודאליות ושליטה ולא לפי ציונים, כי הציונים לא קיימים: אם החומר שלכם הוא תצלום או שיחת טלפון, רק אחד מאלה יכול לענות, ואם הוא מסמך בן ארבעים עמודים עם סקירת רכש מצורפת, רק את האחר ניתן לפרוס.

מה ש-OrcaRouter נושא הוא הצד הגנרטיבי של אותו לופ: יותר מ-200 המודלים מאחורי מפתח יחיד תואם OpenAI, שכותבים את הרובריקה שהמעריך שלך מדרג לפיה, מתמללים או מסכמים את החומר לפני שהוא הופך למצב, ופולטים את קריאת הכלי שהמעריך שלך מאשר לפני שהיא מבוצעת.