
Xiaomi MiMo-V2.6-Pro: ציון DeepSWE של 72.57, הרצה שנעצרה, ועדיין אין תאריך שחרור
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro הפסיק את ריצת למידת החיזוק שלו ששודרה בפומבי ב-20 בספטמבר עם ציון DeepSWE v1.1 של 72.57 שמופיע בלוח המחוונים של Xiaomi עצמה — 1.4 נקודות מתחת ל-74% ש-GPT-6 Astra, Gemini 3.8 Flash ו-Claude Opus 5 חולקים בראש אותו לוח דירוג. Xiaomi MiMo-V2.6-Flash, המודל הקטן יותר שאומן לצידו, נעצר ב-19 בספטמבר על 65.68. שתי הריצות הסתיימו בצעד 30, והחיוב המשולב ש-Xiaomi פרסמה לצידן עמד על $3,474,715 כשתפסנו את הדף הבוקר.
אלה כל החדשות הטובות, והן באמת טובות. שאר הסיפור הוא פער בין מספר למוצר. לאף אחד מהדגמים Xiaomi MiMo-V2.6-Pro או Xiaomi MiMo-V2.6-Flash אין תאריך שחרור, כרטיס דגם, מזהה API, מחיר מפורסם, או סט משקולות להורדה. אין נקודת קצה לקרוא לה. מה שקיים הוא לוח מחוונים לאימון שכל אחד יכול לצפות בו, נתון בנצ'מרק שהארנס של Xiaomi עצמה הפיק, וקהילה שבילתה שישה ימים בקריאת דף טלמטריה כמו שאנשים נהגו לקרוא בעלי תה.
אז זו כתבת "מה שאנחנו יודעים עד כה", והגרסה הישרה שלה מפרידה בין שלושה דברים ששבוע הסיקור האחרון ערבב בשקט: מה ש-Xiaomi מסרה באופן רשמי, מה שמשקיף יחיד דיווח על כך, ומה המשמעות של כל זה עבור מי שבוחר מודל קידוד היום.
מה שXiaomi בעצם העלתה לאינטרנט
ב-16 בספטמבר פתח צוות MiMo, בראשות Luo Fuli, עמוד שידור חי בדומיין של Xiaomi עצמה, שהציג בזמן אמת את האימון-המשך (post-training) של שני מודלים שטרם פורסמו: ספירת צעדים, עקומות תגמול, תפוקת טוקנים, מספר ארגזי חול, התראות על תקלות GPU, ומונה עלויות שמטפס בזמן שאתם צופים. המסגור של Xiaomi, לפי הסיקור, הוא שהיא השקיעה כששה חודשים בעבודה על שאלה אחת — עד כמה אפשר להרחיב את הלמידה מחיזוק — והחליטה להריץ את הניסוי הזה בפומבי במקום להכריז על תוצאה.
לוח המחוונים גלוי לב באופן יוצא דופן עבור תוצר של ספק. הוא מפרט את הכשלים של עצמו בפיד הודעות: אתחול מחדש של Pro בשלב 17 שנגרם מתקלת מחסור בזיכרון ב-GPU עקב חוסר איזון בעומס המומחים, שהצוות אומר שתיקן על ידי התאמת אסטרטגיית המקביליות באימון; תקלת קישוריות רשת בין אשכול האימון של Pro לפריסת הדירוג שאילצה אתחול מחדש והחלטה להסיר את מערך הנתונים הסייבר מהרצת ה-Pro הקרובה לאחר "דפוסים גרועים ביומני ה-rollout"; אתחול מחדש של Flash משלב 15 לאחר שסוג של שגיאת תשתית לא זוהה במשך כשלוש שעות; ואתחול מחדש של Pro עקב תקלת VRAM בצומת בודדת. הוא גם מציין שמשימות שהוערכו כ"קלות יחסית עבור מודל ה-Pro הנוכחי" סוננו החוצה — הודאה שרוב דוחות הפוסט-אימון נמנעים מלציין.

שני כרטיסי ההרצה הם החלק החשוב למי שעוקב אחרי תזמון. שני המודלים מסומנים כהופסקו: MiMo-V2.6-Pro אחרי 5 ימים ו-7 שעות של זמן קיר, MiMo-V2.6-Flash אחרי 3 ימים ו-11 שעות, כל אחד בצעד 30, ב-20 בספטמבר וב-19 בספטמבר בהתאמה. Pro צרך 75B אסימונים ו-753k דגימות תמורת 2.62 מיליון דולר; Flash צרך 81.4B אסימונים תמורת 854 אלף דולר. כל צעד שואב אצווה של 1,568 פרומפטים עם 16 רולאאוטים לכל פרומפט — 25,088 מסלולים לכל צעד, בהרצה אסינכרונית מלאה.
כדאי לומר זאת בבירור: שיאומי לא הודיעה אם „stopped” פירושו שההרצה הסתיימה, הושהתה או נשמרה כנקודת ביקורת. כרטיס עצור אינו הודעת השלמה, ואף אחד מחוץ לצוות לא יודע איזו מהאפשרויות היא.
מה מאומת, ומה לא
72.57 אינו שמועה. הוא מודפס על לוח המחוונים של Xiaomi, בתרשים שכותרתו DeepSWE v1.1, mini-swe-agent, avg@3, לצד העקומה הכתומה של ריצת ה-Pro. ה-65.68 של דגם Flash נמצא באותו תרשים. הנתון מופיע גם — כ-62.24 ואחר כך 65.97 — בצילומי מצב מוקדמים יותר של אותו פאנל, וזה מה שנותן לעקומה את צורתה: עלייה יציבה לאורך 30 צעדים ולא הערכה בודדת בת מזל.
מה שהוא דיווח בלבד הוא נקודת המוצא. הטענה שמסתובבת ב-X ב-21 בספטמבר, מהחשבון @nrehiew_, היא שמודל Pro עבר "מ-58.41 ל-72.57" ב-DeepSWE ושההרצות הושלמו. נקודת הסיום תואמת בדיוק את לוח המחוונים של הספק. קו הבסיס 58.41 הוא הקריאה של אותו חשבון לגבי היכן שהעקומה מתחילה — נקודת ה-Pro השמאלית ביותר בתרשים אכן נמצאת בחמישים הגבוהות — ו-Xiaomi לא פרסמה נתון של שלב 1. טענת ההשלמה היא אף היא פרשנות של שני כרטיסים המסומנים כ"הופסקו", וזו קריאה סבירה ולא הצהרה של Xiaomi. התייחסו לשיפור של 14 נקודות כמוצק מבחינת כיוון וכמשוער מבחינה מספרית.

יש עוד הבחנה אחת שהסיקור פסח עליה, והיא זו שקובעת כמה שווה המספר. לוחות הבנצ'מרק של הדשבורד הם ההערכות של Xiaomi עצמה: החברה הריצה את מערכת ההערכה על הצ'קפוינטים שלה ופרסמה את התוצאות. מערכת ההערכה היא אותה מערכת שבה משתמש לוח התוצאות הציבורי — mini-swe-agent, DeepSWE v1.1 — מה שהופך את הנתון לבר-השוואה יותר מאשר בנצ'מרק שספק פיתח בעצמו. אבל הערכה שהחברה מריצה בעצמה אינה רשומה בלוח תוצאות, ו-72.57 אינו מופיע בלוח של Datacurve, משום שאיש לא הגיש אותו.
תקרת 74% הדוקה יותר ממה שהכותרת מרמזת
מה שמביא את ההשוואה למוקד. טבלת המובילים DeepSWE v1.1 של Datacurve, שעודכנה לאחרונה ב-3 בספטמבר 2026, מפרטת 113 משימות ב-91 מאגרי קוד בחמש שפות, ושלוש התצורות המובילות שלה נמצאות בתיקו ב-74% Pass@1: GPT-6 Astra במאמץ חשיבה xhigh, Gemini 3.8 Flash ברמה high, ו-Claude Opus 5 ברמה max. המספרים שלצד הציונים האלה הם המעניינים.
• ביטחון — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. באותו לוח, GPT-5.6 Sol נמצא ב-73% ±3 ו-GLM-5.3 ו-Kimi K3 ב-69%. המרווחים חופפים הרבה מעבר למקום העשרוני השני.
• עלות לכל משימה — Gemini 3.8 Flash בממוצע $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84. התרשים של טבלת המובילים עצמה מסמן את Gemini 3.8 Flash כקונפיגורציה היעילה ביותר בלוח, והפער בין שלושתם הוא בערך חמישה לאחד עבור שיעור מעבר שהבנצ'מרק אינו מצליח להבדיל בו.
• צעדים — Gemini 3.8 Flash היה זקוק בממוצע ל-166 צעדי סוכן לכל משימה, Claude Opus 5 — 99, GPT-6 Astra — 29. הציון הזהה מסתיר שלושה סגנונות עבודה שונים מאוד, והזול הוא זה שעובד הכי קשה.

אז כאשר הנתון המדווח 72.57 מתואר כ"מתקרב לצמרת הטבלה", הגרסה המדויקת צרה יותר ופחות דרמטית. הוא נמצא במרחק של כנקודה וחצי מתיקו משולש שאין אפשרות להפריד בין חבריו זה מזה באמצעות פסי השגיאה של הבנצ'מרק עצמו. מדובר בתוצאה חזקה עבור מודל שעדיין נמצא בשלב שלאחר האימון, שהופקה על ידי הספק ולא על ידי מתחזקי הבנצ'מרק, על טבלה שהמודל לא הוגש אליה. העדכון האחרון של טבלת המובילים קדם לחלוטין להרצת Xiaomi, ולכן שום רשומת MiMo עדיין לא מופיעה בה.
מדוע שיאומי מתאמנת בפומבי
השקיפות אינה מקרית. השחרור האחרון של Xiaomi במודלים עם משקלים פתוחים היה Xiaomi MiMo-V2.5 ו-Xiaomi MiMo-V2.5-Pro בסוף אפריל, שניהם תחת רישיון MIT — שמישים מסחרית, ניתנים לכוונון עדין, ניתנים להפצה מחדש. MiMo-V2.5-Pro הוא מודל תערובת-מומחים בעל 1.02 טריליון פרמטרים עם 42 מיליארד פרמטרים פעילים, ארכיטקטורת קשב היברידית וחלון הקשר של מיליון טוקנים, וחומרי ההשקה שלו הציגו במפורש את הטענות הסוכניות: מהדר שנכתב מאפס ב-Rust לאורך מאות קריאות לכלים, יישום שולחני בן שמונת אלפי שורות שנבנה במהלך אחת עשרה שעות של עבודת סוכן.
שידור חי של הפוסט-אימון של הדור הבא הוא סוג אחר של טענה. מעבדה שמפרסמת את עקומות התגמול שלה, את מספרי ארגזי החול שלה ואת תקלות ה-GPU שלה בזמן אמת מבקשת שישפטו אותה לפי תהליך ולא לפי מצגת השקה, והיא מאותתת על לוח זמנים. לואו פולי אמרה שהפרטים הטכניים של עבודת ה-RL ייפתחו בקוד פתוח חלק אחר חלק בשבועות הקרובים. זה הדבר הקרוב ביותר ללוח זמנים שמישהו הציע: קודם מתודולוגיה, אחר כך מודל.
זה גם מתאים לדפוס ששיאומי השתמשה בו בעבר, שבו מודל מופיע בפומבי תחת שם אחר לפני שהחברה טוענת לבעלות עליו. ההרגלים של החברה הם לאמן בשקט, לבדוק בגלוי, ואז לשחרר עם משקלים.
מה ניתן להריץ כיום
אין שום דבר במשפחת MiMo-V2.6. אם אתם רוצים מודל Xiaomi MiMo כרגע, דור V2.5 הוא מה שקיים — משקלים פתוחים דרך הערוצים של Xiaomi עצמה וכמה פלטפורמות צד-שלישי, עם כרטיסים ותמחור שפורסמו. אין API של MiMo-V2.6, אין מזהה מודל, ואין רשימת מחירים, וכל עמוד שמצטט מזהה MiMo-V2.6 או תעריף לפי טוקן ממלא חלל שהותירה Xiaomi ריק. המחרוזות `mimo-v2.6-pro` ו-`mimo-v2.6-flash` בלוח הבקרה הן שמות של משימות אימון, לא נקודות קצה מפורסמות.
ההשלכה המעשית הנוספת היא מה עושים בינתיים. אם הסיבה ש-MiMo-V2.6-Pro מעניין אותך היא שהוא עשוי להיות דרך זולה יותר להגיע לביצועי קידוד ברמת החזית, התצורות שמולו הוא נמדד כבר זמינות לקריאה, ולוח התוצאות אומר שהזול מביניהם תחרותי: Gemini 3.8 Flash משתווה לשיעור המעבר הגבוה ביותר ב-2.36 דולר למשימה ומסומן כתצורה היעילה ביותר בלוח. Gemini 3.8 Flash, Claude Opus 5 ו-GPT-6 Astra נגישים כולם דרך מפתח API אחד של OrcaRouter במחיר המחירון של הספק עם 0% תוספת שעוברת הלאה — כך ששינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום ולא במחזור החיוב הבא — עם failover מוגדר לפי מודל ולא לפי ספק. וכאשר מעבדה אכן משחררת מודל כמו זה, ניתובו מאחורי אותו מפתח הוא הדרך בעלת ההתחייבות הנמוכה להעריך אותו: אפשר להעמיד אותו מול תעבורה אמיתית בלי להמר נתיב ייצור על checkpoint שאיש לא אפיין.
מה בעצם ישנה את הסיפור הזה?
ארבעה אותות, בערך לפי סדר מידת ההכרעה שלהם:
• משקלים ב-Hugging Face תחת רישיון מוצהר, וכך הגיע דור V2.5, והעדות החזקה ביותר לכך שריצת RL הניבה מודל שניתן לשחרר ולא ניסוי שהגיע לקיצו.
• כרטיס דגם עם מספרי פרמטרים, אורך הקשר וארכיטקטורה — אף אחד ממספרי V2.6 אינו פומבי, והדשבורד אינו מציג אותם. להניח ש-V2.6-Pro יורש את הצורה 1.02T/42B של V2.5-Pro יהיה בגדר ניחוש.
מזהה API ומחירון — זה הרגע שבו הנתון של DeepSWE הופך להחלטת רכישה ולא לספורט צופים.
• הגשה ללוח ה-DeepSWE של Datacurve, שתציב את MiMo-V2.6-Pro באותה טבלה ותחת אותם פסי שגיאה כמו המודלים שאליהם הוא מושווה. הערכה שמבוצעת על ידי הספק והגשה ללוח דירוג אינן אותה טענה, והפער ביניהן הוא בדיוק שורה אחת באותה טבלה.
עד אז, סיכום כן הוא ש-Xiaomi הציגה את ריצת הפוסט-אימון השקופה ביותר שפרסמה מעבדה גדולה כלשהי, על שני מודלים שהיא טרם שחררה, עם נתון בנצ'מרק אחד שדווח על ידה בעצמה, שמגיע קרוב לראש הטבלה — אך אינו מצטרף אליו. מסמך המתודולוגיה מובטח בשבועות הקרובים. תאריך השחרור אינו מובטח כלל.
