Титульная карточка статьи «MiMo-V2.6: что показывает работа по RL», с надзаголовком «ТЕХНИЧЕСКИЙ ОТЧЁТ» и подзаголовком «Отчёт Xiaomi о смешанном RL: что он подтверждает, а что нет». Четыре скруглённых чипа гласят: «Замороженный роутер MoE», «Стоимость грейдера 12,7 %», «DeepSWE с 58,4 до 72,6» и «AA Index 46». Строка нижнего колонтитула гласит: «Показатели DeepSWE заявлены вендором; AA Index 46 измерен Artificial Analysis». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

MiMo-V2.6: что на самом деле показывает статья Xiaomi об RL и что остаётся непроверенным

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Большинство статей о моделях, опубликованных в этом месяце, посвящены архитектуре. Технический отчёт, стоящий за Xiaomi MiMo-V2.6-Pro и Xiaomi MiMo-V2.6-Flash, таковым не является. Он озаглавлен MiMo-V2.6: масштабирование обучения с подкреплением в направлении самосовершенствования, подан 21 сентября 2026 года с указанием авторства LLM-Core Xiaomi, и почти не тратит свой объём на разреженный бэкбон смеси экспертов, зато почти весь его отводит одному вопросу: что происходит, когда весь бюджет посттренировки уходит на один смешанный прогон обучения с подкреплением. Отчёт DeepSeek-V4.1-Flash, напротив, — это документ о памяти: его объём уходит на сжатое разреженное внимание, межслойное повторное использование KV и хранение в FP4. Поставьте их рядом — и это аргументы о том, откуда берётся способность, и они расходятся.

Отчёт стоит читать, оценивая его по его собственным меркам, но читать его надо внимательно, потому что это самоотчёт лаборатории, которая провела этот прогон. Он называет свои механизмы, показывает свои абляции, публикует свои неудачи и одновременно сообщает числа, которые невозможно проверить извне. Отделить эти две вещи — вот в чём состоит большая часть работы. Эта статья делает это, и она написана 23 сентября 2026 года — через два дня после того, как были выложены чекпойнты, при том что эта работа — самое новое и наименее подтверждённое, что о них есть.

Почему дата на бумаге важнее, чем обычно

Чекпойнты Xiaomi MiMo-V2.6-Pro и MiMo-V2.6-Flash появились в хабе моделей 21 сентября 2026 года — с лицензией MIT и без ограничений доступа. Отчёт датирован тем же днём и возглавил список трендов на сайте препринтов, где был опубликован. Именно это совпадение по времени — причина того, что перед нами новость, а не ретроспектива: статья не является более поздним объяснением модели, которую все уже успели протестировать. Она выходит одновременно с весами — до того, как кто-либо за пределами Xiaomi опубликовал независимый прогон.

Screenshot of the MiMo-V2.6 technical report page captured September 23, 2026, showing the title 'MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement', attributed to LLM-Core Xiaomi and dated 21 September 2026, with the author list and the opening of the abstract visible.

Такой порядок — и главная слабость статьи как доказательства. Всё, что из него следует, — кривая DeepSWE, прирост доли успешных прохождений, защита от взлома вознаграждения — это утверждение о процессе обучения, который произошёл один раз, в одной лаборатории, на одном кластере и который никто больше не воспроизвёл. Ветка, обратившая внимание на отчёт, считает именно это интересной частью: перед нами статья о данных и экспериментах, а не об архитектуре, а эксперименты — как раз тот тип результата, который либо воспроизводится, либо нет.

Три оси масштабирования, и только одна из них — проблема аппаратного обеспечения

В отчёте это подаётся так: вычислительные ресурсы для обучения с подкреплением масштабировались сразу по трём осям, и именно третья меняет ваше представление о методе.

• Батч и пропускная способность — 1 568 образцов на обновление, разворачиваемых в шестнадцать роллаутов каждый, то есть примерно 25 000 траекторий на шаг, что потребляет от 2,7 до 3,7 миллиарда токенов на шаг при длине контекста до одного миллиона токенов. Архитектура роллаутов полностью асинхронна, и именно это позволяет вообще выдержать такой размер батча.

• Среды — единый смешанный запуск по задачам кода, общего агента, визуальным и киберзадачам, одновременно под несколькими агентными обвязками, а не отдельные RL-запуски по доменам. В самой Xiaomi это сокращённо называют «You Only RL Once». Смысл смешивания в том, что улучшения в одной способности подкрепляют остальные; риск в том, что медленный тип задач останется без ресурсов, и, как сказано в отчёте, это решается адаптивным планированием.

• Вычисления для грейдера — это ось, которая не про GPU в привычном смысле. Бинарный результат «прошёл/не прошёл» не может ранжировать два решения, которые оба проходят, поэтому сам сигнал вознаграждения становится тем, что вы масштабируете. Агентный грейдер сравнивает шестнадцать попыток для задачи совместно и выдаёт градуированный сигнал вместо одного бита.

Эта третья ось — то, чем фраза «самосовершенствование» в заголовке оправдывает своё место, и то, где отчёт наиболее уязвим. Модель, оценивающая собственные прогоны, — это поверхность для reward hacking, и отчёт относится к ней именно так.

Два механизма, которые действительно стоит понять

Групповое перераспределение преимуществ

После каждого шага политика создаёт шестнадцать попыток на задачу, и все они помещаются в общее рабочее пространство, чтобы модель-оценщик могла рассматривать их вместе, а не по одной. Прошедшие патчи затем оцениваются по пяти осям: подходит ли подход к проблеме, является ли реализация точной без ненужных резервных вариантов, минимально ли изменение, не редактирует ли оно что-либо за пределами области задачи и соответствует ли оно стилю окружающего кода. Прошедшие с более низким рейтингом получают меньше положительного подкрепления. Патч, подтверждённый как хак, сбрасывается до нуля и считается неудачей.

Следствие — это обучающий сигнал, который подталкивает к более коротким и дешёвым решениям, а не просто к правильным; в отчёте это описывается как смещение в сторону меньшего числа токенов на задачу. Именно это стоит запомнить, потому что главные результаты, приведённые далее в статье, указывают в противоположную сторону.

Групповой синтез вознаграждений

Офлайн-половина той же идеи. Вместо того чтобы выводить качество исключительно из оценщика, работающего в реальном времени, команда заранее вычисляет рубрики для конкретных задач и умножает бинарную награду за тест на оценки качества и поведения, взятые из этих рубрик. В отчёте это описывается как построение рубрик на основе контрастирующих прогонов — то есть на основе случаев, где результат различался, а именно там и содержится информация.

Оценивание не бесплатно. В отчёте затраты на оценщиков оцениваются примерно в 12,7% от общих затрат MiMo-V2.6-Pro на обучение с подкреплением. Эта единственная цифра — самое полезное в статье для всех, кто думает скопировать этот метод, потому что она превращает «масштабируйте своих оценщиков» из идеи в статью расходов.

Замороженный роутер — это результат, который большинство команд скопирует в первую очередь.

В разделе отчёта о стабильности содержится вывод, который имеет самостоятельное значение — независимо от MiMo-V2.6 и независимо от того, насколько хорошо работает модель.

При использовании обучаемых маршрутизаторов смеси экспертов нагрузка на экспертов сильно дрейфовала за двадцать шагов. Коэффициент вариации по экспертам вырос с 0,78 до 2,0. Пиковая нагрузка на самом загруженном эксперте выросла с шестикратного превышения среднего до шестнадцатикратного. Доля «холодных» экспертов — тех, которые почти не получают трафика, — выросла с 0,5% до 22%. Возврат весов маршрутизатора к начальным значениям на шаге 20 немедленно восстановил баланс.

Ответ Xiaomi состоял в том, чтобы заморозить MoE-роутер на весь прогон. Логика здесь не отличается тонкостью: при таком размере батча нестабильность маршрутизации — это проблема динамики обучения, которую можно просто не допускать, а роутер — не то место, где обучение с подкреплением выполняет свою работу. На вопрос о том, приводит ли заморозка к каким-либо потерям в итоговом качестве, в опубликованных материалах нет ответа в виде абляции, и это законное желание.

О чём не говорит находка, так это об обслуживании. Балансировка нагрузки роутера во время обучения и использование экспертов под продакшн-трафиком — это разные вопросы, и отчёт освещает только первый.

Числа с прикреплёнными к ним метками

Основные результаты отчёта аккуратны по форме и неопрятны в деталях, и этот беспорядок — не скандал: это три разных измерения трёх разных объектов, которые носят одно и то же название.

• DeepSWE v1.1, отложенная выборка — MiMo-V2.6-Pro вырос с 58.4 до 72.6 за прогон; MiMo-V2.6-Flash — с 48.7 до 65.7. Этот бенчмарк состоит из 113 задач по репозиторной инженерии с длинным горизонтом, оцениваемых функциональными верификаторами на пяти языках программирования, а метрика — average@3: средняя доля прохождения верификатора по трём выборочным попыткам, что не то же самое, что успех хотя бы одной из трёх попыток. Если читать avg@3 как pass@3, это завысит все числа на странице.

• Тот же бенчмарк, измеренный в другом месте, — в выпущенных карточках моделей указано 71,9 для Pro и 67,9 для Flash. Публичный дашборд обучения Xiaomi показывал 72,57 и 65,68. Таким образом, для каждой модели опубликовано три значения, два из них от Xiaomi, и направление расхождения различается для каждого из двух собратьев. Ни одно из них не является ошибочным; они описывают снимок дашборда, запись в карточке и строку отчёта, сделанные в разные моменты и, возможно, с использованием разных испытательных стендов.

• Дистилляция — MiMo-V2.6-Distill-Qwen-9B, дообученная на базе Qwen3.5-9B на демонстрациях, сгенерированных MiMo, подняла SWE-bench Verified с 61,1 до 66,2. Это самая переносимая цифра в статье, потому что ученик на 9B — это размер, который действительно может запустить большинство команд.

• Внутренний мини-бенчмарк по кибербезопасности — от 31,3 до 47,0. Внутренний означает внутренний: задачи не публикуются, поэтому дельту невозможно воспроизвести даже в принципе.

• Индекс интеллекта Artificial Analysis — 46 у MiMo-V2.6-Pro. Этот показатель принципиально иного рода. Он был получен Artificial Analysis, запустившей собственный тестовый стенд на выпущенном чекпоинте, а не Xiaomi, что делает его единственной ключевой цифрой в этом релизе, которую читатель может считать измеренной, а не заявленной. Это также то число, с которым следует сравнивать GLM-5.3, Kimi K3 и закрытые фронтирные модели, и оно на пять пунктов ниже Claude Opus 5.

A scoreboard card titled 'Published by Xiaomi vs verified from outside', subtitled 'Every headline figure in the report, and who stands behind it', with columns 'Dimension', 'In the report' and 'Independent status'. Rows read: DeepSWE v1.1, held out — 58.4 to 72.6 Pro; 48.7 to 65.7 Flash, average@3 — No third-party rerun; Released model card — 71.9 Pro; 67.9 Flash — Vendor-published; Public training dashboard — 72.57 Pro; 65.68 Flash — Vendor-published; Distill-Qwen-9B — SWE-bench Verified 61.1 to 66.2 — No third-party rerun; Internal cyber benchmark — 31.3 to 47.0 — Tasks not published; AA Intelligence Index — 46 for MiMo-V2.6-Pro — Measured by Artificial Analysis. A footer reads 'DeepSWE, card and dashboard figures are vendor-reported and have not been independently reproduced; the internal benchmark tasks are not published. The AA Intelligence Index is the one headline number produced outside Xiaomi.' The OrcaRouter logo is composited in the bottom-right corner.Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro captured September 23, 2026, showing an Intelligence Index of 46, an Intelligence versus Cost scatter placing MiMo-V2.6-Pro against Kimi K3, Claude Opus 5 and other frontier models, and a comparison table of the same models.

Отчёт честно говорит об ограничениях собственной таблицы, и именно эту фразу стоит процитировать в ответ любому, кто не честен: сравнения смешивают публичные и внутренние бенчмарки и не позволяют отделить вклад обучения с подкреплением от архитектуры или предварительного обучения. То, что модель стала лучше после обучения с подкреплением, не доказывает, что причина именно в нём.

Есть и вторая оговорка, и именно она противоречит этой подаче. Заявленные улучшения, как правило, сопровождаются ростом использования токенов. В отчёте это представлено как устойчивое улучшение возможностей, а не как эффективность, и это справедливо. Но GAR был явно задуман так, чтобы направлять к более коротким путям и меньшему числу токенов на задачу, а совокупный результат не показывает, что рабочая нагрузка становится дешевле. Возможности выросли; затраты на задачу не снизились. Если вы читаете «самоулучшение» как «в следующем квартале модели понадобится меньше моих денег», статья не поддерживает такое прочтение.

Что отчёт оставляет непроверенным

По состоянию на 23 сентября 2026 года ни одна третья сторона не опубликовала независимый повторный прогон колонок DeepSWE, Terminal Bench или CyberGym. Важное различие — между значением индекса и всем остальным: 46 — это измерение, выполненное кем-то другим, а 72,6 — это утверждение о запуске обучения, который никто не может воспроизвести, потому что этот запуск, по сообщениям, стоил 2,6 миллиона долларов для Pro и 0,9 миллиона долларов для Flash и не будет проведён второй раз.

То, что Xiaomi всё же опубликовала, а большинство лабораторий — нет, — это динамику обучения, фреймворк обучения с подкреплением и среды задач — более 7 000 ранжированных сред в области программной инженерии, воспроизведения уязвимостей, интеллектуальной работы и веб-дизайна. Именно этот артефакт дольше всего сохраняет актуальность. Веса говорят о том, что дал запуск; среды говорят о том, как провести эксперимент самостоятельно, — а это единственный способ когда-либо окончательно разрешить любые утверждения об RL.

Защита от хакеринга вознаграждения заслуживает отдельной оговорки. Она описывается как многоуровневая — дизайн вознаграждения, состязательная оценка, обнаружение аномалий и перекрёстная проверка между верификаторами — и описывается целиком той стороной, для которой её провал был бы неловким. Защита от того, что модель обманывает оценщика на основе модели, — это не то, что можно закрыть самоотчётом. Механизм назван, и режим отказа признан — это больше, чем делают большинство статей, — и это всё ещё открытый вопрос.

Что вы на самом деле можете сделать с этим уже сегодня

Оба чекпоинта доступны для скачивания без ограничений, под тегом лицензии MIT: Xiaomi MiMo-V2.6-Pro-RL и Xiaomi MiMo-V2.6-Flash-RL — омнимодальные, с контекстом в один миллион токенов, при этом индекс Flash сообщает о 172,9 ГБ данных весов по 65 шардам в FP8. Xiaomi не опубликовала тарифную сетку за токены для поколения V2.6, поэтому сегодня выбор — между самостоятельным хостингом и размещённой моделью, за которую вы уже платите.

Именно в этом сравнении и заключается реальная ценность статьи для практики, и оно не льстит статье — но это полезная критика. Проверяемое утверждение — не «хороша ли MiMo-V2.6-Pro» (на это отвечают те 46), а «порождает ли обучение с подкреплением на смешанных агентных задачах рассуждения, которые переносятся на мою рабочую нагрузку», и единственный честный способ ответить на это — запустить оба варианта и сравнить, а это задача маршрутизации прежде, чем задача исследования. DeepSeek-V4.1-Flash — всего в одном API-ключе, по $0.15 и $0.60 за миллион токенов, Qwen3.8-Flash и GLM-5.3-Flash находятся на том же ключе, и если вы хотите на неделю поместить самостоятельно размещённый чекпоинт MiMo за тем же эндпоинтом и посмотреть, проявится ли кривая DeepSWE в ваших собственных эвалах, то это изменение конфигурации, а не миграция. OrcaRouter не хостит модели Xiaomi, и ничто здесь не должно восприниматься как утверждение обратного — но модели, с которыми вы бы их сравнивали, все доступны через один API-ключ OrcaRouter по прайс-листовой цене провайдера с 0% наценки, с автоматическим переключением при сбое, если испытываемый вами чекпоинт окажется нестабильным под нагрузкой.

Случай с недоказанной моделью — это именно тот случай, для которого создавался механизм отработки отказа. Чекпойнт, опубликованный два дня назад, с оценкой, проведённой вендором, и без независимого повторного прогона, — это ровно то, что стоит попробовать, не ставя за ним производственный путь.

Кому стоит прочитать статью

Если вы запускаете постобучение, прочтите это ради вывода о роутере и цифры стоимости грейдера. И то и другое легко переносится, и то и другое дёшево проверить, и ни то ни другое не требует, чтобы вы верили чему-либо о таблице бенчмарков MiMo-V2.6. Особенно результат с замороженным роутером — из тех вещей, проверка которых стоит полдня, а экономит целый запуск.

Если вы выбираете модель, прочитайте показатель индекса и пропустите всё остальное. Artificial Analysis измерила 46 на выпущенном артефакте; это единственное число в этом релизе, которое пришло не от вендора, и оно ставит MiMo-V2.6-Pro во главе сегмента открытых весов и на пять пунктов позади Claude Opus 5. Всё остальное в отчёте описывает, как Xiaomi этого добилась, а то, как Xiaomi этого добилась, — не то, что можно купить.

И если вы читаете не саму статью, а публикации о ней, следить стоит за словом «самоулучшение». Собственные результаты отчёта показывают, что возможности растут вместе с использованием токенов, и это реальный и воспроизводимый вывод о масштабировании обучения с подкреплением. Это не утверждение, что модель стала дешевле в эксплуатации, а статьи, которые последуют за этой, и покажут, произойдёт ли это в конце концов.