
Microsoft-Decision-1 מול Liquid AI d1-3B: אותו חלון 32K, שני חושים שונים
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
לשם שינוי, המפרט מסתדר. Microsoft-Decision-1, זמין לשימוש כללי ב-Microsoft Foundry מאז 8 באוקטובר 2026, מכיל 32,768 טוקנים של הקשר. כך גם Liquid AI d1-3B, שהועלה ל-Hugging Face ב-5 באוקטובר 2026 והוכרז על ידי Liquid AI יומיים לאחר מכן. שניהם מקבלים מצב יחד עם קבוצה של שאלות מטיפוסים מוגדרים — כן/לא, בחירה מבין אפשרויות בעלות שמות, עמדה על סולם סדור — ושניהם עונים במעבר קדימה יחיד עם התפלגות הסתברות במקום טקסט מיוצר; Laya, Intern-Decision-4B, Kev ושאר הנישה הזו חלוקים ביניהם לגבי אורך ההקשר, כך שזהו הזיווג היחיד שבו הממד הזה יוצא מהמשוואה וההשוואה צריכה להיות מנומקת על בסיס משהו אחר.
ה"משהו האחר" מתגלה כערוץ הקלט. המודל של מיקרוסופט הוא טקסטואלי בלבד, במפורש: הוא "אינו מקבל או מייצר תוכן של תמונה, שמע או וידאו". זה של Liquid AI נושא מקודד ראייה SigLIP2 NaFlex עם 400 מיליון פרמטרים על עמוד שדרה לשוני עם 2.6 מיליארד פרמטרים ומגיע ל-3.12 מיליארד פרמטרים בסך הכול, והוא נבנה בדיוק לדבר שמיקרוסופט שללה — לתת ציון לצילום מסך, לטופס סרוק או לפריים ממצלמה מול שאלה קבועה. הפיצול הזה, בתוספת הבדל ברישיון שאין לו דבר עם היכולת, הוא כל ההתמודדות.
במקום ששניהם מסכימים, וזה יותר ממה שהיית מצפה
• חלון הקשר — 32,768 טוקנים עבור Microsoft-Decision-1 ו-32,768 טוקנים עבור Liquid AI d1-3B.
• מבנה הפלט — הסתברויות מכוילות על פני האפשרויות שסופקו; אף אחד מהם אינו מייצר טקסט, ומונה השימוש של Liquid AI מדווח על כך בתור output_tokens: 0.
• סוגי שאלות — גם בחירת מסמך, ניקוד מסודר וגם כן/לא בינארי, ושניהם מאפשרים להגדיר את מערך האפשרויות לכל בקשה במקום לאמן מחדש ראש אוצר מילים.
• הימנעות — Microsoft מתעדת אפשרויות הימנעות מפורשות כגון "לא ניתן לדעת"; סכימת Decision Index של Liquid AI תומכת בכך באמצעות מערך האפשרויות שלה.
• הסקה במעבר יחיד — קריאה אחת לכל החלטה בשני הצדדים, וזה מה שהופך כל אחד מהם לישים בהיקפים של פייפליין.
שני מודלים שמסכימים על שני האילוצים הקשים ביותר בנישה הזו הם דבר שראוי להתעכב עליו. חלון של 32K הוא מה שהופך מדרג החלטות לשימושי על חוזה מלא, מדיניות מרובת עמודים או שרשור תמיכה ארוך; צ'קפוינט Laya באנגלית של 512 טוקנים ומגבלות השאלות לכל קריאה ב-Intern-Decision-4B לא. אם הקלט שלך קצר, רוב מה שיש בתחום הזה ניתן להחלפה, וההחלטה היא בעניין אירוח. אם הקלט שלך ארוך, התחום מצטמצם לשניים האלה.
התחושה שרק לאחד מהם יש
Liquid AI d1-3B הוא מולטימודלי, ועץ המודלים מבהיר את השושלת: LFM2.5-2.6B-Base, אחר כך LFM2.5-VL-3B, ואז d1-3B שעבר אימון-המשך לקבלת החלטות מכוילות במעבר יחיד. תמונות נכנסות דרך המקודד SigLIP2 NaFlex, והכרטיס מדווח על ממוצע של 74.1 across eleven public image benchmarks לעומת 73.9 עבור מודל הראייה הבסיסי — כך שכיוונון-ההחלטות לא פגע באיכות הראייה שלו. הוא גם מדווח על הניסוי ההפוך: הסירו את התמונות ואותן שאלות צונחות ל-45.1, וזו הראיה הנקייה ביותר שתקבלו לכך שערוץ התפיסה הוא עומס נשיאה ולא קישוט.
אין מקבילה ל-Microsoft-Decision-1, וההשמטה מכוונת ולא תוצאה של עבודה שלא הושלמה. הכרטיס של Microsoft מפרט את השימושים מחוץ לתחום כיצירת טקסט, מענה על שאלות פתוחות, שיחה, תרגום וסיכום, ובנפרד מציין שהמודל הוא טקסטואלי בלבד. עבור צינור עיבוד שצריך להעניק ציון לצילום מסך של טופס לפי מחוון, או להחליט אם פריים ממצלמה מכיל אירוע בטיחות, זהו עצירה מוחלטת — שום הנדסת פרומפטים לא מחזירה מודאליות שהמודל מעולם לא קיבל.
ספירת השפות נעה בכיוון ההפוך, וזהו הפער האמיתי השני. Microsoft-Decision-1 מפרטת 25 שפות נתמכות, והחברה כנה בכך שכיסוי, איכות וכיול "עשויים להשתנות לפי שפה", כשהיא מכנה שפות שאינן אנגלית ובמיוחד שפות דלות משאבים כתחום של תת-ביצועים. Liquid AI d1-3B מציין 16 שפות. מבחינת רוחב, Microsoft מובילה על הנייר; מבחינת כנות לגבי מה שרוחב אומר, שני הספקים אומרים משהו דומה, ואף אחד מהשניים לא פרסם כיול לפי שפה.

לשונית ה-Benchmark, שוב
עמוד ה-Foundry של Microsoft-Decision-1 מכיל לשונית Benchmarks עם סעיף מתודולוגיה וללא נתונים: בנצ'מרקים ציבוריים וקהילתיים לקבלת החלטות בתוספת קבוצות פנימיות שנשמרו בצד, מדדים המכסים דיוק ושגיאת כיול, סדר האפשרויות משתנה, מבחנים סטטיסטיים מזווגים, וטענה שהמודל "מתפקד ברמה של מודלים מובילים לקבלת החלטות ומקדים מודלים פתוחים אחרים לקבלת החלטות שנבדקו באותה מתודולוגיה." אין מה לבדוק, אין מה לשחזר.
Liquid AI d1-3B מפרסם 48.57 ב-Decision Index 0.2.1 — וההסתייגות חשובה יותר מהמספר, מפני ש-Decision Index הוא אינדקס של Liquid AI עצמה ו-d1-3B הוא מודל של Liquid AI עצמה. זוהי תוצאה שנוקדה על ידי ספק בבנצ'מרק שנכתב על ידי ספק, וממוצבת על ידי החברה כטובה ביותר מבין מודלי החלטה מתחת ל-10B ומקדימה מודל 35B באותה סקאלה. התייחסו ל-48.57 כאל טענה כיוונית, ולא כאל נתון מבוקר. לצדה, הכרטיס מפרט הערכות פנימיות של פורמט החלטות בממוצע של 77.1, SQuAD 2.0 ב-85.3, PAWS-X ב-76.9 ו-DecisionBench 71.8 — כולם בדיווח עצמי, והמסגור של "מתחת ל-10B" הוא הסתייגות אמיתית ולא התחמקות, שכן המודל הוא 3.12B.
אז שאלת הכיול נפתרת באותו אופן שבו היא נפתרת בכל התחום הזה: Liquid AI נותנת לך מספר שנוצר בסקאלה שלה, Microsoft נותנת לך מתודולוגיה ובלי מספר, ואף אחת מהן לא נותנת לך מדידה בלתי תלויה של צד שלישי. נתון הכיול היחיד שיהיה חשוב לפריסה שלך הוא זה שתחשב על נתונים מתויגים משלך.

הגשה, רישיונות, ומה שאתם בעצם קונים
ההשהיה של d1-3B מפורסמת, והיא הסיבה שהמודל קיים. שמונה מילישניות להחלטה על RTX 4090, תשע על AMD MI325X, עם תפוקה דחוסה של 475 ו-1,106 בשנייה ב-64 מצבים. על חומרת קצה: 30 מילישניות על Apple M5 Pro, 16 מילישניות על Jetson AGX Thor, 26 מילישניות על Jetson AGX Orin 64 GB, 50 מילישניות על Orin Nano. Microsoft-Decision-1 אינו מפרסם נתון השהיה כלל, והאפשרויות המובנות בו — API מתארח של Foundry על בסיס תשלום לפי שימוש או תפוקה מוקצית שמורה, כאשר הסקת אצווה מושבתת — משמעותן שאתה מודד אותו דרך הפריסה שלך. זה אינו פער קטן עבור מודל שכל מטרתו היא להיקרא פעם אחת לכל מסמך מאוחזר או פעולה מוצעת.
הרישיון הוא הנקודה שבה השניים נפרדים בדרך שמפתיעה אנשים. Liquid AI d1-3B מתויג lfm1.0, לא Apache 2.0 — אותו רישיון משפחתי כמו שאר קו LFM של Liquid, שנושא תנאי שימוש שרישיון מתירני אינו נושא. אם הסקירה המשפטית שלך קוראת לכך "תואם OpenAI ללא תנאים", זה לא זה, וכדאי לקרוא אותו לפני שהמודל יוצא לדרך ולא אחרי. ל-Microsoft-Decision-1 אין משקלים בכלל: זה נקודת קצה מתארחת תחת תיק Direct from Azure, עם אימות Azure, חיוב מאוחד, בלי הורדה, ושאלת הרישיון מוחלפת בהסכם שירות. אין אפשרות לכוונן עדין אף אחד מהמודלים דרך הנתיבים שהספקים מתעדים, וזו המגבלה החדה ביותר עבור מודל החלטה — מדרג שאינך יכול להתאים לתוויות שלך הוא מדרג שאי אפשר לתקן בו את אופני השגיאה, רק לעקוף אותם.
ניתוב סביבם הוא המקום שאליו שייך OrcaRouter בתבנית הזו, ורק בצד אחד שלה. איננו מארחים לא את Microsoft-Decision-1 ולא את Liquid AI d1-3B: אף אחד מהם אינו מחזיר טקסט, אף אחד מהם אינו בקטלוג שלנו, ונקודת קצה לדירוג הסתברויות אינה יעד של chat-completions. מה שאנחנו מספקים הוא החצי המחולל של הלולאה — המודל שמנסח את התשובה שהמעריך שלך ידרג, מחלץ את השדות שהמעריך שלך ישפוט, או מציע את הפעולה שהמעריך שלך יאשר. מדובר ביותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI במחיר המחירון של הספק, מועבר הלאה עם 0% תוספת, כך ששינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום, ומעבר אוטומטי (failover) מכסה את קריאת היצירה בלולאה שאין בה זמן השהיה פנוי לניסיון חוזר.

שני פיקים נקיים, ואחד שלא צמוד
קח את Liquid AI d1-3B אם משהו בפייפליין שלך הוא תמונה. מיון צילומי מסך, חילוץ טפסים, ניתוב בקרת איכות חזותית, מודרטור שמדרג פריימים ממצלמה — לא ניתן לגרום ל-Microsoft-Decision-1 לעשות זאת, ו-d1-3B נבנה בדיוק לשם כך, עם בנצ'מרקים חזותיים שפורסמו כדי לגבות את הטענה. קח אותו גם אם אתה צריך הסקת קצה הנמדדת בעשרות מילישניות על Jetson או על מחשב נייד, אם אתה רוצה את המודל על החומרה שלך, או אם רישיון שאתה יכול לקרוא מספיק ליועץ המשפטי שלך.
בחר ב־Microsoft-Decision-1 אם הקלט שלך הוא טקסט, המסמכים שלך ארוכים, החסם שלך הוא רכש — אימות Azure, חיוב מאוחד, הערכת בינה מלאכותית אחראית, ספק שאליו ניתן להסלים — או שהתעבורה שלך מכסה יותר מ-16 השפות ש-d1-3B מפרט. קבל את העובדה שנתון השהיה החסר וטבלת הבנצ'מרק החסרה שלו אומרים שהשבועיים הראשונים שלך איתו הם מדידה, לא אינטגרציה.
המקרה היחיד שאינו גבולי הוא עבודה מולטימודלית: שם, הבחירה נעשתה כאשר מיקרוסופט כתבה "טקסט בלבד" בכרטיס המודל.
