כרטיס כותרת ראשי עבור המאמר "MiMo-V2.6: מה שמראה מאמר ה-RL", עם הכיתוב העליון "דו"ח טכני" והכתובית המשנה "הדו"ח המשולב-RL של Xiaomi, נקרא לפי מה שהוא מאמת ומה שהוא לא". ארבעה צ'יפים מעוגלים מציגים "נתב MoE קפוא", "עלות מדרג 12.7%", "DeepSWE 58.4 ל-72.6" ו-"AA Index 46". שורת פוטר מציינת "נתוני DeepSWE מדווחים על ידי הספק; AA Index 46 נמדד על ידי Artificial Analysis." הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

MiMo-V2.6: מה שמאמר ה-RL של Xiaomi באמת מראה, ומה שהוא משאיר לא מאומת

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

רוב מאמרי המודלים שפורסמו החודש הם מאמרי ארכיטקטורה. הדוח הטכני שמאחורי Xiaomi MiMo-V2.6-Pro ו-Xiaomi MiMo-V2.6-Flash אינו כזה. הוא נושא את הכותרת MiMo-V2.6: הרחבת למידת חיזוק לעבר שיפור עצמי, שהוגש ב-21 בספטמבר 2026 ומיוחס ל-LLM-Core Xiaomi, וכמעט אינו מקדיש מאורכו לעמוד השדרה של תערובת המומחים הדלילה, וכמעט את כולו לשאלה אחת: מה קורה כאשר כל תקציב האימון שלאחר האימון מושקע בריצת למידת חיזוק משולבת אחת. הדוח של DeepSeek-V4.1-Flash, לעומת זאת, הוא מסמך זיכרון — אורכו מוקדש לקשב דליל דחוס, לשימוש חוזר ב-KV חוצה שכבות ולאחסון FP4. העמידו את השניים זה לצד זה והם טיעונים על מאין מגיעה היכולת, והם אינם מסכימים.

הדוח שווה קריאה במונחים שלו, אבל כדאי לקרוא אותו בקפידה, מפני שהוא דיווח עצמי מהמעבדה שהפעילה את הריצה. הוא מפרט את המנגנונים שלו, מציג את האבלציות שלו, מפרסם את כישלונותיו, ובאותה נשימה מדווח על מספרים שאי אפשר לבדוק מבחוץ. ההפרדה בין שני הדברים האלה היא עיקר העבודה. הטקסט הזה עושה זאת, והוא נכתב ב-23 בספטמבר 2026 — יומיים לאחר שהצ'קפוינטים הועלו, בעוד שהמאמר הוא הדבר החדש ביותר והפחות מאושש לגביהם.

למה התאריך שעל הנייר חשוב יותר מהרגיל

הצ'קפוינטים של MiMo-V2.6-Pro ו-MiMo-V2.6-Flash של שיאומי עלו למאגר המודלים ב-21 בספטמבר 2026, ברישיון MIT וללא הגבלת גישה. הדוח מתוארך לאותו יום והגיע לראש רשימת הטרנדים באתר הפרסומים המוקדמים שבו פורסם. התזמון הזה הוא הסיבה לכך שזה פריט חדשותי ולא רטרוספקטיבה: המאמר אינו הסבר מאוחר למודל שכולם כבר בחנו. הוא מגיע לצד המשקלים, לפני שמישהו מחוץ לשיאומי פרסם הרצה עצמאית.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

סדר הדברים הזה הוא גם החולשה העיקרית של המאמר כראיה. כל מה שנובע ממנו — עקומת ה-DeepSWE, שיפורי שיעור ההצלחה, ההגנה מפני רימוי התגמול — הוא טענה על תהליך אימון שקרה פעם אחת, בתוך מעבדה אחת, על אשכול אחד, ושאיש אחר לא שחזר. השרשור שסימן את הדוח מתייחס לכך כחלק המעניין: זהו מאמר נתונים וניסויים, לא מאמר ארכיטקטורה, וניסויים הם בדיוק סוג התוצאה שכן משוכפלת או שלא.

שלושה צירים של סקיילינג, ורק אחד מהם הוא בעיית חומרה

המסגור של הדוח הוא שמשאבי המחשוב של למידת החיזוק הורחבו לאורך שלושה צירים בבת אחת, והשלישי הוא זה שמשנה את הדרך שבה אתה חושב על השיטה.

• אצווה ותפוקה — 1,568 דגימות לכל עדכון, שמתרחבות לשש עשרה רולאאוטים כל אחת, כך שכ-25,000 מסלולים בכל צעד, בצריכת 2.7 עד 3.7 מיליארד טוקנים בכל צעד באורכי הקשר של עד מיליון טוקנים. ארכיטקטורת הרולאאוט היא אסינכרונית לחלוטין, וזה מה שמאפשר בכלל לגודל האצווה הזה לשרוד.

• סביבות — ריצה מעורבת אחת על פני משימות קוד, סוכן כללי, חזותיות וסייבר, תחת מספר רתמות סוכנים בו-זמנית, במקום ריצות RL נפרדות לכל תחום. הקיצור של שיאומי לכך הוא "You Only RL Once". הטיעון בעד ערבוב הוא שהשיפורים ביכולת אחת מחזקים את האחרות; הסיכון הוא שסוג משימה איטי יורעב, והדוח אומר שהם מטפלים בכך באמצעות תזמון מסתגל.

• מחשוב של מעריך — הציר שאינו עוסק ב-GPU במובן המקובל. עובר/נכשל בינארי אינו יכול לדרג שני פתרונות ששניהם עוברים, ולכן אות התגמול עצמו הופך לדבר שאותו מרחיבים. מעריך סוכני משווה את שש עשרה הניסיונות עבור משימה באופן משותף ומייצר אות מדורג במקום ביט.

הציר השלישי הוא המקום שבו הביטוי "שיפור עצמי" בכותרת מצדיק את מקומו, ושבו הדוח חשוף ביותר. מודל שמדרג את ההרצות של עצמו הוא משטח לניצול תגמול, והדוח מתייחס אליו ככזה.

שני המנגנונים ששווה באמת להבין

חלוקה מחדש של יתרון Groupwise

לאחר כל שלב, המדיניות מפיקה שישה-עשר ניסיונות לכל משימה, וכולם מונחים בסביבת עבודה משותפת כדי שמודל מעריך יוכל לבחון אותם יחד ולא אחד-אחד. לאחר מכן, טלאים שעברו מדורגים לפי חמישה צירים: אם הגישה מתאימה לבעיה, אם המימוש מדויק בלי מנגנוני גיבוי מיותרים, אם השינוי מינימלי, אם הוא עורך משהו מחוץ לתחום, ואם הוא תואם את סגנון הקוד שמסביב. טלאים שעברו בדירוג נמוך יותר מקבלים חיזוק חיובי מועט יותר. טלאי שאושר כהאק מוחזר לאפס ומטופל ככישלון.

התוצאה היא אות אימון שדוחף לפתרונות קצרים וזולים יותר ולא רק נכונים — הדוח מציג זאת כהכוונה לעבר פחות טוקנים לכל משימה. זה החלק שיש להיאחז בו, מפני שתוצאות הכותרת בהמשך המאמר מצביעות בכיוון ההפוך.

סינתזת תגמול לפי קבוצה

החצי הלא־מקוון של אותו רעיון. במקום להפיק איכות אך ורק ממעריך חי, הצוות מחשב מראש רובריקות ייעודיות למשימה ומכפיל את תגמול הבדיקה הבינארי בציוני איכות והתנהגות הנגזרים מאותן רובריקות. הדוח מתאר זאת כבנייה של הרובריקות מתוך רולאאוטים מנוגדים — כלומר, ממקרים שבהם התוצאה הייתה שונה, וזה המקום שבו נמצא המידע.

ההערכה אינה בחינם. הדוח מעמיד את עלות המעריכים על כ-12.7% מהעלות הכוללת של למידת החיזוק ב-MiMo-V2.6-Pro. הנתון הבודד הזה הוא הדבר השימושי ביותר במאמר לכל מי ששוקל להעתיק את השיטה, מפני שהוא הופך את "להרחיב את מערך המעריכים שלך" מרעיון לשורת תקציב.

הראוטר הקפוא הוא התוצאה שרוב הצוותים יעתיקו ראשונים

מדור היציבות של הדוח מכיל ממצא העומד בפני עצמו, בלתי תלוי ב-MiMo-V2.6 ובלתי תלוי במידת הביצועים של המודל.

עם ראוטרים ניתנים לאימון של תערובת מומחים, עומס המומחים נסחף קשות במהלך עשרים צעדים. מקדם השונות בין המומחים עלה מ-0.78 ל-2.0. עומס השיא על המומחה העמוס ביותר עלה מפי שישה מהממוצע לפי שישה עשר מהממוצע. חלקם של המומחים הקרים — אלה שמקבלים כמעט אפס תעבורה — עלה מ-0.5% ל-22%. החזרת משקולות הראוטר לערכי ההתחלה שלהם בצעד 20 השיבה את האיזון מיד.

תגובתה של Xiaomi הייתה להקפיא את ה-MoE router עבור הריצה. ההיגיון אינו מעודן: בקנה המידה הזה של הבאצ'ים, חוסר יציבות בניתוב הוא בעיית דינמיקת אימון שאפשר פשוט לבחור שלא לקיים, וה-router אינו המקום שבו למידת החיזוק עושה את עבודתה. האם ההקפאה עולה משהו באיכות הסופית — אין לכך תשובה באבלציה בחומר שפורסם, וזה דבר סביר לרצות לדעת.

מה שהממצא אינו אומר הוא דבר כלשהו בנוגע להגשה. איזון עומסים של הראוטר במהלך ריצת אימון וניצול מומחים תחת תעבורת ייצור הם שאלות שונות, והדוח מתייחס רק לראשונה.

המספרים, עם התוויות שלהם מצורפות

התוצאות העיקריות של הדוח נקיות בצורתן ומבולגנות בפרטיהן, והבלבול אינו שערורייה — מדובר בשלוש מדידות שונות של שלושה עצמים שונים החולקים שם.

• DeepSWE v1.1, שהוחזק בנפרד — MiMo-V2.6-Pro עלה מ-58.4 ל-72.6 לאורך הריצה; MiMo-V2.6-Flash מ-48.7 ל-65.7. הבנצ'מרק מורכב מ-113 משימות הנדסת מאגרי קוד באופק ארוך, הנבחנות על ידי מאמתים פונקציונליים בחמש שפות תכנות, והמדד הוא average@3 — שיעור המעבר הממוצע של המאמת על פני שלושה ניסיונות מדגמיים, שאינו זהה לשאלה אם מי משלושת הניסיונות הצליח. פירוש avg@3 כ-pass@3 יגרום להערכת יתר של כל מספר בעמוד.

• אותו מבחן, כפי שנמדד במקום אחר — כרטיסי המודל שפורסמו מציגים 71.9 עבור Pro ו-67.9 עבור Flash. לוח המחוונים הציבורי לאימון של שיאומי הציג 72.57 ו-65.68. כלומר, קיימים שלושה נתונים מפורסמים לכל מודל, שניים מהם משיאומי, וכיוון הפער שונה עבור כל אחד מהאחים. אף אחד מהם אינו שגוי; הם מתארים תמונת מצב של לוח מחוונים, רשומת כרטיס ושורת דוח, בנקודות שונות ואולי תחת מערכות בדיקה שונות.

• זיקוק — ‏MiMo-V2.6-Distill-Qwen-9B, שעבר כיוונון עדין מ-Qwen3.5-9B על גבי הדגמות שנוצרו בידי MiMo, העלה את SWE-bench Verified מ-61.1 ל-66.2. זהו המספר בעל היכולת ההעברה הגבוהה ביותר במאמר, מפני שתלמיד בגודל 9B הוא גודל שרוב הצוותים יכולים למעשה להריץ.

• מיני־בנצ'מרק פנימי לאבטחת סייבר — 31.3 עד 47.0. פנימי פירושו פנימי: המשימות אינן מפורסמות, ולכן לא ניתן לשחזר את הדלתא אפילו באופן עקרוני.

• מדד Artificial Analysis Intelligence Index — 46 עבור MiMo-V2.6-Pro. הנתון הזה שונה במהותו. הוא הופק על ידי Artificial Analysis, שהריצה הארנס משלה מול הצ'קפוינט שפורסם, ולא על ידי Xiaomi, מה שהופך אותו לנתון הכותרת היחיד בפרסום הזה שקורא יכול להתייחס אליו כאל מדוד ולא כאל מדווח. זהו גם המספר שלפיו יש להשוות מול GLM-5.3, Kimi K3 והחזית הסגורה, והוא נמצא חמש נקודות מתחת ל-Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

הדוח כנה לגבי גבולות הטבלה של עצמו, וזהו המשפט ששווה לצטט בחזרה בפני כל מי שאינו: ההשוואות מערבבות בנצ'מרקים ציבוריים ופנימיים ואינן מבודדות את תרומתה של למידת החיזוק מהארכיטקטורה או מהקדם-אימון. מודל שטוב יותר לאחר RL אינו הוכחה ש-RL הוא הסיבה.

יש הסתייגות שנייה, והיא זו שפועלת נגד המסגור. השיפורים המדווחים מלווים בדרך כלל בעלייה בשימוש בטוקנים. הדוח מציג זאת כשיפור מתמשך ביכולות ולא כיעילות, ובצדק. אך GAR תוכנן במפורש לכוון למסלולים קצרים יותר ולפחות טוקנים לכל משימה, והתוצאה המצטברת אינה מראה שעומס העבודה נעשה זול יותר. היכולת עלתה; העלות לכל משימה לא ירדה. אם תפרש "שיפור עצמי" כ"המודל יזדקק לפחות מכספי ברבעון הבא", המאמר אינו תומך בפרשנות הזו.

מה שהדוח משאיר לא מאומת

נכון ל-23 בספטמבר 2026, אף צד שלישי לא פרסם הרצה חוזרת עצמאית של העמודות DeepSWE, Terminal Bench או CyberGym. ההבחנה החשובה היא בין נקודת המדד לכל השאר: 46 הוא מדידה שמישהו אחר ביצע, ו-72.6 הוא טענה על ריצת אימון שאיש אינו יכול להריץ מחדש, מפני שהריצה עלתה, לפי הדיווחים, 2.6 מיליון דולר עבור Pro ו-0.9 מיליון דולר עבור Flash, והיא לא תקרה פעמיים.

מה ש-Xiaomi כן פרסמה, בעוד שרוב המעבדות לא, הוא דינמיקת האימון, מסגרת למידת החיזוק וסביבות המשימות — יותר מ-7,000 סביבות מדורגות בתחומי הנדסת תוכנה, שחזור פגיעויות, עבודת ידע ועיצוב אתרים. זהו הארטיפקט עם חיי המדף הארוכים ביותר. המשקלים מספרים לך מה ההרצה הפיקה; הסביבות מספרות לך איך להריץ את הניסוי בעצמך, וזו הדרך היחידה שבה אפשר אי פעם להכריע בטענות ה-RL.

ההגנה מפני האקינג תגמול ראויה להסתייגות ספציפית. היא מתוארת כרב-שכבתית — עיצוב תגמול, הערכה יריבה, זיהוי אנומליות ובדיקה צולבת בין מאמתים — והיא מתוארת כולה בידי הצד שכשל שלה היה מביך אותו. הגנה מפני מודל שמתמרן מעריך מבוסס-מודל אינה מסוג הדברים שדיווח עצמי יכול לסגור. המנגנון נקרא בשמו ואופן הכשל מוכר, וזה יותר ממה שרוב המאמרים עושים, וזו עדיין שאלה פתוחה.

מה אפשר למעשה לעשות עם זה היום

שני הצ'קפוינטים ניתנים להורדה, ללא חסימת גישה, תחת תגית רישיון MIT: Xiaomi MiMo-V2.6-Pro-RL ו-Xiaomi MiMo-V2.6-Flash-RL, אומני-מודאליים, חלון הקשר של מיליון טוקנים, כאשר אינדקס Flash מדווח על 172.9 GB של נתוני משקלים על פני 65 שרדים ב-FP8. Xiaomi לא פרסמה מחירון לפי טוקן עבור דור V2.6, לכן הבחירה היום היא בין אירוח עצמי לבין מודל מתארח שאתם כבר משלמים עליו.

ההשוואה הזו היא המקום שבו טמון הערך המעשי של המאמר, והיא לא מחמיאה למאמר בדרך מועילה. הטענה הנבחנת אינה "האם MiMo-V2.6-Pro טוב" — 46 התשובות עונות על כך. היא "האם למידת חיזוק על משימות סוכניות מעורבות מייצרת חשיבה שעוברת לעומס העבודה שלי", והדרך ההגונה היחידה לענות על כך היא להריץ את שניהם ולהשוות, וזו בעיית ניתוב לפני שהיא בעיית מחקר. DeepSeek-V4.1-Flash נמצא במרחק מפתח API אחד במחיר של $0.15 ו-$0.60 למיליון טוקנים, Qwen3.8-Flash ו-GLM-5.3-Flash יושבים על אותו מפתח, ואם ברצונכם להעמיד checkpoint עצמאי של MiMo מאחורי אותה נקודת קצה לשבוע ולראות אם עקומת DeepSWE מופיעה בהערכות שלכם, זהו שינוי תצורה ולא מיגרציה. OrcaRouter אינה מארחת את המודלים של Xiaomi, ואין לקרוא דבר כאן כטענה אחרת — אבל המודלים שמולם הייתם משווים אותם נגישים כולם דרך מפתח API אחד של OrcaRouter במחיר המחירון של הספק עם 0% תוספת המועברת הלאה, עם מעבר אוטומטי לגיבוי אם checkpoint שאתם בוחנים מתגלה כלא יציב תחת עומס.

מקרה המודל הלא-מוכח הוא המקרה שלשמו נבנה ה-failover. צ'קפוינט שפורסם לפני יומיים, עם הערכה שביצע הספק וללא הרצה חוזרת בלתי תלויה, הוא בדיוק הדבר שתרצה לנסות בלי להעמיד מאחוריו נתיב ייצור.

מי צריך לקרוא את המאמר

אם אתם מריצים פוסט-טריינינג, קראו אותו עבור ממצא הנתב ונתון עלות המדרג. שניהם ניתנים להעברה, שניהם זולים לבדיקה, ואף אחד מהם לא דורש להאמין למשהו מטבלת הבנצ'מרק של MiMo-V2.6. תוצאת הנתב הקפוא בפרט היא מהסוג של דברים שעולים אחר צהריים לנסות וחוסכים ריצה.

אם אתם בוחרים מודל, קראו את נקודת המדד ודלגו על השאר. Artificial Analysis מדדה 46 על הארטיפקט שפורסם; זה המספר היחיד במהדורה הזו שלא הגיע מהספק, והוא ממקם את MiMo-V2.6-Pro בראש תחום המשקולות הפתוחות וחמש נקודות אחרי Claude Opus 5. כל השאר בדוח מתאר איך Xiaomi הגיעה לשם, ואיך Xiaomi הגיעה לשם הוא לא משהו שאפשר לקנות.

ואם אתם קוראים את הסיקור ולא את המאמר עצמו, הדבר שכדאי לשים לב אליו הוא המילה "שיפור עצמי". התוצאות של הדוח עצמו מראות שהיכולת עולה יחד עם השימוש בטוקנים, וזהו ממצא אמיתי וניתן לשחזור בנוגע להרחבה של למידת חיזוק. זו אינה טענה שהמודל הפך זול יותר להרצה, והמאמרים שיבואו בעקבות זה הם אלה שיגידו לכם אם בסופו של דבר זה יקרה.