
Xiaomi MiMo-V2.6-Pro בראש מדד המשקולות הפתוחות עם 46 — ומפרסם את חשבון האימון
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro הוא כעת המודל בעל המשקולות הפתוחות המדורג הגבוה ביותר במדד האינטליגנציה של Artificial Analysis, עם 46 בגרסה 4.3.2 — נקודה אחת מעל GLM-5.3 ושתיים מעל Kimi K3, ועשרים נקודות מעל ה-26 שרשם קודמו MiMo-V2.5-Pro בסולם המדד הקודם. המספר הזה הופק על ידי Artificial Analysis שהריצה את הארנס שלה, לא על ידי Xiaomi, וזו העובדה השימושית ביותר בהוצאה הזו. העובדה השימושית השנייה היא המחיר המודפס לצידו: $0.43 למיליון טוקנים בקלט, $0.87 למיליון בפלט, לעומת $5.00 ו-$25.00 עבור Claude Opus 5 — מודל שנמצא חמש נקודות מדד גבוה יותר. השלישית היא זו שאף אחד לא ציפה ששיאומי תמסור: דיווח פומבי של מה שעלתה בפועל ריצת למידת החיזוק שייצרה את MiMo-V2.6-Pro.
הציון הוא מדידה, לא טענה
כמעט כל מה שמתפרסם על השקת מודל סיני מגיע כמספר של ספק, והקוראים למדו לקחת אותו בערבון מוגבל. זה שלפנינו שונה, וכדאי לדייק לגבי השוני, מפני שסיקור ההשקה כבר טשטש אותו.
Artificial Analysis העריכה את MiMo-V2.6-Pro עצמו, במדד המשולב v4.3.2 — עשר הערכות המכסות חשיבה, ידע, מתמטיקה ותכנות, כולל AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience ו-AA-LCR v1.1. ה-46 הוא מה שהחזירה חבילת ההערכות הזו. היא גם תיעדה את המאפיינים התפעוליים שקובעים אם מודל הוא שמיש ולא רק טוב: 134.3 אסימוני פלט בשנייה, 2.15 שניות עד לאסימון הראשון, הנחת מטמון של 99%, ועלות מדודה של $0.13 לכל משימת Intelligence Index.
שניים מאלה ראויים להדגשה. 134.3 טוקנים לשנייה מציבים את MiMo-V2.6-Pro במקום האחד-עשר מתוך 114 מודלים במהירות — עבור מודל תערובת מומחים עם טריליון פרמטרים, זוהי תוצאת serving, לא רק תוצאת אימון. והעלות של $0.13 למשימה היא המספר ששורד מפגש עם תקציב: זה מה שהאינדקס עלה בפועל להריץ מול המודל הזה, נמדד באותו אופן בכל מודל בלוח, מה שהופך אותו לבר-השוואה באופן שתעריפים לכל טוקן שמוצגים בכותרות אינם.

מה המדד מכסה ומה אינו מכסה
כתר המשקולות הפתוחות הוא אמיתי אך צר מכפי שהוא משתמע. בציון 46, MiMo-V2.6-Pro מוביל בקטגוריית המשקולות הפתוחות. הוא אינו מוביל את המדד. בראש v4.3 ניצבים Claude Fable 5.1 במאמץ מקסימלי עם מנגנון גיבוי ברירת מחדל ו-GPT-6 Astra במאמץ מקסימלי, שניהם בציון 53, כאשר Claude Opus 5 בציון 51 ו-Claude Fable 5 בציון 50. אז ההצגה הכנה היא פער של חמש נקודות מהחזית במדד משולב שמתגמל רוחב, ושיפור של עשרים נקודות לעומת הדור הקודם של Xiaomi עצמה.
• מוביל המודלים במשקלים פתוחים — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44
• בראש אותו מדד — Claude Fable 5.1 (מקסימום, גיבוי) 53, GPT-6 Astra (מקסימום) 53, Claude Opus 5 (מקסימום) 51
• מהירות — 134.3 אסימוני פלט לשנייה, האחד עשר מתוך 114 מודלים שנמדדו; החציון עבור מחלקת הגודל הוא 77.9
• זמן עד לאסימון הראשון — 2.15 שניות, לעומת חציון של 2.34 שניות
• עלות לכל משימת Intelligence Index — $0.13, כאשר עלות הרצת ההערכה כולה היא $206.66
• תעריף מפורסם — $0.43 למיליון טוקני קלט, $0.87 למיליון טוקני פלט, הנחת מטמון של 99%, ותעריף משוקלל של $0.18 בתמהיל של 7:2:1 של פגיעות מטמון/קלט/פלט
מספר אחד בעמוד של Artificial Analysis הוא הסתייגות אמיתית ולא התפארות: הוא ספר ספק API יחיד עבור MiMo-V2.6-Pro בזמן כתיבת הדברים. זהו צוואר הבקבוק המעשי של המודל הזה כרגע, וזו אינה בעיה של איכות — אלא בעיה של זמינות. למודל שנגיש דרך נתיב אחד אין מעבר לגיבוי. אם הנתיב הזה נפגע, האפליקציה שלך נפגעת יחד איתו, וסיפור המעבר לגיבוי הוא בדיוק מה שנתב נועד לספק. התצפית הרלוונטית לכל מי שמתכנן סביב ההשקה הזו היא שאנחנו לא מארחים את MiMo-V2.6-Pro, ולא נעמיד פנים אחרת; הנתיב אליו היום הוא הפלטפורמה של Xiaomi עצמה וקומץ הקטלוגים של צד שלישי שמפרטים אותו.

שני המספרים שאסור לערבב ביניהם
Xiaomi גם פרסמה נתוני בנצ'מרק משלה, והם סוג אחר של אובייקט מ-46. לוח המחוונים של החברה מדווח ש-MiMo-V2.6-Pro עובר מ-58.4 ל-72.57 ב-DeepSWE v1.1 לאורך ריצת למידת החיזוק שלו, בהערכה עם mini-swe-agent לפי ממוצע של שלוש. זו סביבת ההרצה של Xiaomi, מערכת הניקוד של Xiaomi, הריצה הלא-מקוונת של Xiaomi. הוא לא הוגש ללוח המובילים הציבורי של DeepSWE והוא לא שוחזר על ידי איש.
קראו את השניים זה לצד זה, והפיתוי הוא להתייחס ל-72.57 כאל ציון שווה-ערך ל-74% שלוח DeepSWE הציבורי מציג בדרגה העליונה. הם אינם באותו קנה מידה. נתון לוח התוצאות הוא תצורה שהוגשה, Pass@1, עם רווח סמך מפורסם ועלות ממוצעת למשימה; נתון הספק הוא הערכה פנימית בלי שכל אלה מצורפים. המאמר שלנו מ-21 בספטמבר העלה נקודה זו כשהמספרים עוד היו קריאות מלוח מחוונים, והיא תקפה גם כעת, כשהמשקלות פורסמו. רתמת הערכה של ספק יכולה להיות כנה לחלוטין ועדיין לא להיחשב רשומה בלוח התוצאות, משום שרשומה בלוח התוצאות היא טענה על תצורה מסוימת בתנאים מסוימים שצד שלישי יכול להריץ מחדש.
אותה משמעת חלה גם על הוצאות האימון. Xiaomi מדווחת על כ-3,474,715 דולר בסך הכל עבור ריצות ה-Pro וה-Flash — 2,620,670 דולר עבור Pro, 854,044 דולר עבור Flash — למעלה משלושים צעדי למידת חיזוק בכל ריצה וכ-750,000 מסלולים בכל ריצה, שהושלמו בפחות משישה ימים. אלה הם נתוני חשבונאות המחשוב של החברה עצמה. הם מעניינים מכיוון שמעבדות כמעט אף פעם לא מפרסמות אותם, והם אינם מחיר API, לא עלות שתשלמו, ולא מספר שצד שלישי כלשהו ערך לו ביקורת.
מה ששיאומי למעשה שלחה
השחרור הוא מודל תערובת־מומחים דליל עם 1.02 טריליון פרמטרים בסך הכול, 42 מיליארד פעילים לכל טוקן, חלון הקשר של 1M טוקנים, ורב־מודאליות מובנית על פני טקסט, תמונה, וידאו ואודיו. המודל האח Xiaomi MiMo-V2.6-Flash הוא אותה ארכיטקטורה בקנה מידה קטן יותר, 309 מיליארד בסך הכול ו־15 מיליארד פעילים. המשקולות שפורסמו נושאות תג רישיון MIT, וחבילת השחרור כוללת דוח טכני, הוראות פריסה, ולפי Xiaomi — גם את סביבות האימון של למידת חיזוק והקוד הדרושים כדי לבחון ולשחזר את תהליך הפוסט-אימון.
הפריט האחרון הוא ההבדל המהותי בין ההשקה הזו לבין הכרזת API טיפוסית, וכדאי להפריד אותו מהשיווק. פרסום סביבת ה-RL הוא הצהרה שתצורת האימון ניתנת לבחינה. האם הסביבות שפורסמו מספיקות כדי לשחזר 72.57 היא שאלה נפרדת שתוכרע בידי אנשים שינסו לעשות זאת, ולא בידי הערות השחרור. הערות האימון של Xiaomi עצמה מתארות ריצה שערבבה משימות קידוד, סוכן כללי, חזותיות ואבטחת סייבר במעבר אחד, עם מעריכים שמדרגים מסלולים מוצלחים ומחלקים מחדש תגמול לעבר מסלולים טובים יותר — והן גם מתעדות כשלים: הפעלה מחדש עקב אזילת זיכרון ב-GPU שנגרמה מחוסר איזון בעומס המומחים, תקלת רשת בין אשכול האימון לפריסת המעריך, ואתחול מחדש של Flash לאחר ששגיאת תשתית לא זוהתה במשך כשלוש שעות. פרסום הכשלים לצד ההישגים הוא החלק שהופך את שאר החשיפה למהימנה.
מה העלות של שיחה, והיכן נמצאת שאלת הניתוב
בתמחור של $0.43 ו-$0.87 למיליון טוקנים, MiMo-V2.6-Pro מתומחר כמו מודל בדרג הביניים ומקבל ציוני benchmark כמו מודל חזיתי עם משקולות פתוחות. שיאומי שמרה על התמחור הסטנדרטי של הדור הקודם MiMo-V2.5 במקום לתמחר מחדש כלפי מעלה את ה-checkpoint החדש, וזו הסיבה שהתעריף נראה נמוך ביחס למספר הפרמטרים. הנחת cache של 99% משמעה שלולאת סוכן עתירת cache קוראת את ההקשר שלה כמעט ללא עלות, ושם בעצם מצטבר החשבון של סוכן לטווח ארוך.
יש גרסה של המסחר הזה שמנתבת בצורה חלקה, ויש גרסה שלא. הגרסה שכן: מודלי החזית שמולם תשוו את MiMo-V2.6-Pro — Claude Opus 5 ב-$5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — כולם נגישים דרך מפתח OrcaRouter אחד במחיר המחירון של הספק עם 0% תוספת, כך שהורדת מחיר של ספק באחד מהם נכנסת לתוקף אצלנו באותו היום, וכלל ניתוב יכול לשלוח בקשה למודל שני כשהראשון איטי או לא זמין. זה חשוב כאן יותר מהרגיל, כי המודל עם הציון הטוב ביותר ב-open-weights הוא גם זה שהמסלול אליו הוא הדק ביותר. שילוב של השניים — מסלול open-weights זול לעבודה בנפח גדול ומסלול חזית לקצה הקשה — הוא החלטת ניתוב, וזה סוג ההחלטה שמפסיק להיות הימור ברגע ששני המסלולים נמצאים על אותו מפתח.
עוד מוצר אחד שצריך להבחין בו היטב, כי קל לבלבל בינו לבין המודל: Xiaomi מציעה גם את MiMo-V2.6-Pro-UltraSpeed, שכבת שירות מתארחת שנבנתה מאותו צ'קפוינט. החומרים של Xiaomi עצמה טוענים למהירות פלט של עד פי עשרים מזו של שירות ה-Pro הרגיל באותה איכות; רישומי קטלוג של צד שלישי מתארים בערך פי עשרה. אלה שני מספרים שונים המתארים את אותה שכבה, איש לא פרסם התפלגויות השהיה לפי בקשה שמיישבות ביניהם, והשכבה כרוכה בתעריף גבוה מהותית. שום דבר ב-UltraSpeed לא משנה מה המשקלים מסוגלים לעשות — הוא משנה את המהירות שבה השרתים של מישהו אחר יריצו אותם.
מה היה משנה את התמונה הזו
שלושה דברים, לפי סדר המידה שבה הם ישנו.
נתיב הגשה שני ושלישי. ספירת הספק היחיד ב-Artificial Analysis היא האילוץ על כל השאר. יותר נתיבים משמעם מעבר לגיבוי, משמעם תחרות מחירים בשכבת ההגשה, ומשמעם שניתן להציב את המודל במסלול ייצור ולא בניסוי.
שחזור בלתי־תלוי של נתוני DeepSWE. ה-46 כבר בלתי־תלוי; ה-72.57 אינו. אם הרצות חיצוניות ינחתו קרוב אליו, הטיעון בעד המודל מתחזק במידה ניכרת. אם הן ינחתו מתחתיו באופן מהותי, המספר של Artificial Analysis נותר זה שאפשר לסמוך עליו, והנתון של הספק מצטרף לרשימה הארוכה של טענות השקה שלא שרדו את המפגש.

פילוחים לכל הערכה בנפרד. הציון המשולב הוא ציון משולב. אילו מעשר ההערכות MiMo-V2.6-Pro מנצח ואילו מפסיד הוא ההבדל בין מודל שתפרוס לקידוד סוכני לבין מודל שתפרוס למענה על שאלות עתיר אחזור, והמדד לבדו לא אומר לך זאת. הפרט הזה הוא מה שכדאי לעקוב אחריו בהמשך, והוא מה שתצורת ניתוב צריכה לפני ששווה לרשום אותה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
