
Microsoft-Decision-1 לעומת Laya: 25 שפות מאחורי API, 100+ מאחורי הורדה של 322MB
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
תספרו את השפות וההשוואה נראית מוכרעת. Microsoft-Decision-1, זמין באופן כללי ב-Microsoft Foundry מאז 8 באוקטובר 2026, מפרט 25 שפות נתמכות ומציין במפורש שכיסוי, איכות וכיול "עשויים להשתנות לפי שפה", ומציין שפות שאינן אנגלית ובמיוחד שפות עם מעט משאבים כאזור של תת-ביצועים. Laya, שפורסם על ידי Convai Innovations ב-18 בספטמבר 2026 תחת Apache 2.0, מתאר את עצמו כרב-לשוני בלמעלה מ-100 שפות ומדווח ש-45 מתוך 51 שפות שנבדקו נשארות שמישות עם ניתוב, לעומת 23 מתוך 51 עבור אחיו האנגלי-בלבד. האחד הוא מודל 9B מאחורי נקודת קצה של Azure עם הקשר של 32,768 טוקנים; האחר הוא מסווג עם 421 מיליון פרמטרים שרץ ב-32.8 אלפיות שנייה להחלטה על Tesla T4 בודדת בחינם. שניהם מסרבים לכתוב טוקן ושניהם מחזירים הסתברויות על אפשרויות שאתם מגדירים.
אבל קראו את שני כרטיסי המודל במלואם, ומספר השפות מפסיק להיות המספר המעניין. זה סיפור הכיול שמאחוריו, ושני הפרויקטים מספרים את הסיפור הזה בכיוונים מנוגדים.
Laya מפרסמת את המספר שהופך את השיווק העצמי שלה למביך
כרטיס המודל של Laya מציין, בסעיף המגבלות שלו עצמו, שנקודות הביקורת הבסיסיות משיגות 0.362 ב-zero-shot במבחן ההחלטות המסווגות — מתחת לרף הבסיס של רוב המחלקה העומד על 0.461. זהו כרטיס שאומר לך שהמודל שלו גרוע מניחוש "התשובה הנפוצה ביותר" במבחן הזה. הוא גם מציין שנקודות הביקורת הבסיסיות קרובות לאקראיות ב-zero-shot, שנתון ההחלטות המסווגות המוביל של 0.766 דורש כיוונון עדין על הפיצול של המבחן הזה עצמו, שאורדינל ציון שאלות הן הפרימיטיב החלש ביותר (SST-5 0.372), ששאלות בחירה עם קרדינליות גבוהה נפגעות משום ש-77 אפשרויות משאירות בערך שלושה או ארבעה טוקנים לכל אחת, ש-noul יכול לעקוב אחרי התוויות של עצמו, ושהשדה action.act_probability "אינו נושא אות שמיש עדיין" ב-AUROC 0.30. משפט הסיכום של Convai עצמו הוא זה שיש לשאת לכל הערכה: Laya הוא בסיס מהיר להתמחות, לא מנוע החלטות ב-zero-shot.
הכנות הזו שווה יותר ממה שהיא נשמעת, כי היא אומרת לך בדיוק למה נועדה Laya. זהו מקודד שאתה מבצע עליו כיוונון עדין בעזרת התוויות שלך — כל הארכיטקטורה בנויה כך שסכמות חדשות לא דורשות אימון מחדש, אבל ביצועים טובים במשימה כן דורשים. בשימוש כזה, הנתונים שפורסמו חזקים: 0.766 לעומת 0.727 של Jev בהחלטות מסווגות לאחר כיוונון עדין, AG News 0.950 לעומת 0.910, DAIR Emotion 0.595 לעומת 0.480, ו-ECE 0.081 לעומת 0.246 של Jev — עם ההערה הכנה שהיא מגיעה עם ביטחון יתר וזקוקה להתאמת טמפרטורה מחדש, מה שמזיז את ה-ECE הממוצע מ-0.466 ל-0.081.
Microsoft מפרסמת את המתודולוגיה ומסתירה את התוצאה
הדף של Microsoft-Decision-1 ב-Foundry מריץ את אותו תרגיל בכיוון ההפוך. הוא מתאר את ההערכה בפירוט — בנצ'מרקים ציבוריים וקהילתיים לקבלת החלטות בתוספת ערכות פנימיות שמורות, מדדים הכוללים דיוק ושגיאת כיול, סדר אפשרויות משתנה, מבחנים סטטיסטיים מזווגים, מערכת בדיקה זהה למודלים המושווים — ומדווח שהמודל "מציג ביצועים דומים למודלי החלטה מובילים ומקדים מודלי החלטה פתוחים אחרים שהוערכו באותה מתודולוגיה." הוא מפרט את תחומי החוזק שלו (הסקה, יישום כללים, עמידות לעיצוב פרומפט) ואת תחומי החולשה שלו (ידע תחומי מתמחה, לא-אנגלית).
ואז היא לא מדפיסה דבר. לא נתון דיוק, לא שגיאת כיול, לא טבלה לפי בנצ'מרקים. המגבלות שהיא מדווחת על עצמה אמיתיות ושימושיות — הציונים משתנים בהתאם לניסוח ולסדר האפשרויות, שאלה מנוסחת בצורה גרועה עדיין מחזירה ציון, הכיול חזק ביותר בסוגי משימות מוכרים, לא מופקים הסברים — אבל רשימת מגבלות אינה מדידה. אז העסקה נקייה באופן יוצא דופן: Laya נותנת לך מספרים שאתה יכול לנסות להפריך על הנתונים שלך, ומיקרוסופט נותנת לך עמדת ציות והקשר של 32K שאליו אתה יכול להכניס מסמך ארוך.

מה שההבדל בגודל למעשה נותן
הקטנות של Laya אינה פשרה כאן; היא התכנון עצמו. מכיוון שכל אפשרות מנוקדת לפי הטוקן [MASK] של עצמה ומועברת ב-softmax על פני האפשרויות של אותה שאלה, מרחב התשובות נבנה בזמן הבקשה ולא נאפה לתוך ראש אוצר מילים — ולכן סכימה שאתה ממציא אחר הצהריים הזה אינה דורשת אימון מחדש, ולכן המודל נכנס ל-322 עד 421 מיליון פרמטרים. הצ'קפוינט הרב-לשוני פועל בערך פי 2.2 מהר יותר מזה האנגלי, הראוטר מזהה כתב בפחות מחצי מילישנייה, ותפוקה באצוות מגיעה ל-103 עד 332 שאלות בשנייה על T4 אחד. עבור עומס עבודה שמנקד כל פנייה, כל מסמך מאוחזר או כל פעולה מוצעת, התפוקה הזו היא הפיצ'ר, לא מספר הפרמטרים.
העלויות של העיצוב הזה ספציפיות באותה מידה וכדאי להציגן למול החלופה של Microsoft. הצ'קפוינט האנגלי מקבל חלון של 512 אסימונים; הרב-לשוני מקבל 1,024, עם אפשרות הרחבה לעבר 8K. Microsoft-Decision-1 משתמש ב־32,768. שרשור תמיכה ארוך, חוזה מלא או מסמך מדיניות רב-עמודי אינם נכנסים כלל לחלון של Laya, ושום מהירות לא מפצה על קיטוע. Laya עונה על סט שאלות אחד בכל מעבר קדימה, עם תקציב אסימונים מתועד לכל אפשרות; אצל Microsoft מתועדת הפעלה בודדת על פני עד 32K אסימונים, ללא תקרה לכל שאלה. ונקודת התורפה התחרותית של Laya כמסווגת כדאי להכיר: היא משיגה 0.425 ב-Banking77 לעומת 0.870 של Jev, שזה מסוג בעיות הכוונה העדינות ובעלות הקרדינליות הגבוהה, שבהן מעבר התמחות הוא החשוב ביותר.

השוואת העלויות שאינה לפי טוקן
Laya חינמית בנקודת השימוש — באירוח עצמי, Apache 2.0, רשומה בעלות אירוח עצמי של "$0" — והמחיר האמיתי שלה הוא ריצת הכיוונון עדין שאתה חייב לה לפני שהיא טובה במשימה שלך. Microsoft-Decision-1 הוא Foundry API מתארח עם תעריף לפי טוקן שאינו מודפס בעמוד המודל, אין משקולות להורדה, אין מסלול כיוונון עדין, והסקת אצווה מושבתת. האחד הוא פרויקט תיוג נתונים מראש, והאחר הוא קריאה מדודה. מה זול יותר תלוי לחלוטין בנפח, ונקודת החיתוך גבוהה: מקודד 421M שמדרג 300 פריטים בשנייה על T4 שכור קשה מאוד להביס אותו לכל החלטה לאחר שאומן.
כאן OrcaRouter זוכה למקומו בצינור עיבוד הבנוי על כל אחד מהמודלים, וזהו הצד הגנרטיבי בלבד. איננו מארחים לא את Microsoft-Decision-1 ולא את Laya: שניהם מחזירים הסתברויות ולא טקסט, אף אחד מהם אינו בקטלוג שלנו, ונקודת קצה לניקוד אינה יעד של השלמות צ'אט. מה שכן יש לנו הוא המודל שמייצר את הדבר שמנוקד — טיוטת התשובה, קריאת הכלי המוצעת, התשובה המועמדת שאותה שופט לאחר מכן הראש המותאם (fine-tuned) של Laya. זה יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI במחיר המחירון של הספק, כשהוא מועבר הלאה עם 0% תוספת, עם מעבר אוטומטי (failover) כאשר נתיב הגשה אחד נפגע. בלולאה שמנקדת כל מה שהיא מייצרת, קריאת היצירה היא החלק שעלול לקרוס, וה-failover הוא מה שמזין את תור הניקוד.

איזה אחד לבחור?
בחר את Laya אם ההחלטות שלך מגיעות בשפות רבות, אם הנפח שלך גבוה מספיק שתמחור לפי טוקן משנה, אם יש לך תוויות ושבוע לכוונן, או אם אתה צריך להריץ ניקוד על חומרה בתוך הגבול שלך. קבל את החלון של 512 עד 1,024 טוקנים ואת העובדה שנקודת הביקורת הבסיסית תהיה קרובה לאקראי עד שתמחה אותה, ותקבל מודל החלטות שהוא כן לגבי היותו נקודת התחלה.
בחר את Microsoft-Decision-1 אם הקלט שלך מורכב ממסמכים ארוכים ולא מפניות, אם שער הפריסה שלך מורכב מאימות Azure, חיוב מאוחד וחבילת Responsible AI ולא מהורדה, אם 25 שפות מכסות את התעבורה שלך, או אם אתה מעדיף שלא להחזיק במודל בכלל. קבל את העובדה שאתה תשרטט בעצמך את עקומת הכיול הראשונה שלו, והקצה אחר צהריים לדוגמה מתויגת כדי לעשות זאת — כי בניגוד ל-Laya, זה לא ימסור לך מספר ECE להתווכח איתו.
