Титульная карточка статьи «Xiaomi MiMo-V2.6-Pro: 72.57 в DeepSWE» с надзаголовком «OrcaRouter · радар моделей — не выпущена» и подзаголовком «Прогон, который остановился, модель, которая так и не вышла — что подтверждено, а что нет». Под ней две карточки: слева — «На собственном дашборде Xiaomi» с текстом «DeepSWE v1.1: 72.57 — прогон остановлен на шаге 30, 20 сентября»; справа — «Всё ещё не опубликовано» с текстом «Ни карточки модели, ни API id, ни цены, ни весов». Четыре чипа: «Родственная модель Flash: 65.68», «Общие расходы: $3,474,715», «Верх таблицы: 74%» и «Оценка от вендора, не подана». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

Xiaomi MiMo-V2.6-Pro: оценка 72,57 в DeepSWE, остановившийся прогон и по-прежнему никакой даты релиза

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Xiaomi MiMo-V2.6-Pro 20 сентября остановила свой публично транслировавшийся прогон обучения с подкреплением с результатом DeepSWE v1.1 72.57, который красуется на собственной панели Xiaomi, — на 1.4 балла ниже 74%, которые делят между собой GPT-6 Astra, Gemini 3.8 Flash и Claude Opus 5 на вершине того же лидерборда. Xiaomi MiMo-V2.6-Flash, меньшая модель, обучавшаяся вместе с ней, остановилась 19 сентября на 65.68. Оба прогона завершились на шаге 30, а суммарный счёт, опубликованный Xiaomi вместе с ними, составил $3,474,715, когда мы зафиксировали страницу сегодня утром.

Вот и все хорошие новости, и они действительно хороши. Остальная часть истории — это разрыв между числом и продуктом. Ни у Xiaomi MiMo-V2.6-Pro, ни у Xiaomi MiMo-V2.6-Flash нет даты выпуска, карточки модели, идентификатора API, опубликованной цены или набора весов для скачивания. Нет эндпоинта, к которому можно было бы обратиться. Что есть — это панель обучения, за которой может наблюдать любой желающий, показатель бенчмарка, полученный собственным испытательным стендом Xiaomi, и сообщество, которое провело шесть дней, читая страницу телеметрии так, как люди когда-то гадали по чайным листьям.

Итак, это материал в формате «что нам известно на данный момент», и его честная версия разделяет три вещи, которые освещение за последнюю неделю тихо смешивало: что Xiaomi официально заявила, что сообщил об этом один наблюдатель, и что всё это значит для того, кто сегодня выбирает модель для программирования.

Что Xiaomi на самом деле выложила в сеть

16 сентября команда MiMo под руководством Ло Фули открыла живую страницу на собственном домене Xiaomi, где в реальном времени показывалось постобучение двух ещё не выпущенных моделей: число шагов, кривые вознаграждения, пропускная способность по токенам, количество песочниц, уведомления о сбоях GPU и счётчик затрат, который увеличивается прямо на глазах. Согласно публикациям, Xiaomi подаёт это так: компания потратила примерно шесть месяцев на один вопрос — насколько далеко можно масштабировать обучение с подкреплением — и решила провести этот эксперимент публично, а не объявлять результат.

Эта панель мониторинга на удивление откровенна для артефакта вендора. Она перечисляет собственные сбои в ленте уведомлений: перезапуск Pro на шаге 17, вызванный сбоем из-за нехватки памяти GPU (out-of-memory) вследствие дисбаланса нагрузки на экспертов, который, по словам команды, был устранён настройкой стратегии параллелизма обучения; сбой сетевого подключения между обучающим кластером Pro и развёртыванием для оценки, который вынудил выполнить перезапуск и принять решение исключить кибердатасет из предстоящего запуска Pro после «плохих паттернов в логах развёртывания»; перезапуск Flash с шага 15 после того, как класс инфраструктурных ошибок оставался незамеченным около трёх часов; и перезапуск Pro из-за сбоя VRAM на одном узле. Также отмечается, что задачи, сочтённые «относительно лёгкими для текущей модели Pro», были отфильтрованы, — признание, которое большинство отчётов о постобучении оставляют невысказанным.

Screenshot of Xiaomi's public MiMo-V2.6 reinforcement-learning dashboard captured September 21, 2026. A total-cost counter reads $3,474,715, and a notices feed lists a Pro restart at step 17 from a GPU out-of-memory fault caused by expert load imbalance, a network connectivity fault between the Pro training cluster and the grader deployment, a Flash restart from step 15 after an infrastructure error went undetected for about three hours, a Pro restart from a node VRAM fault, and a note that tasks relatively easy for the current Pro model were filtered out. Two run cards show mimo-v2.6-pro stopped at step 30 — started 2026-09-15 10:32 UTC, stopped 2026-09-20, $2,620,670 spent, 75B tokens, 753k samples, batch 1,568 x 16 — and mimo-v2.6-flash stopped at step 30 — started 2026-09-15 15:16 UTC, stopped 2026-09-19, $854,044 spent, 81.4B tokens. Three benchmark panels read DeepSWE v1.1 mini-swe-agent avg@3: mimo-v2.6-pro 72.57, mimo-v2.6-flash 65.68; an in-house coding bench at 65.43 and 62.87; and AutomationBench v1.0.6 at 53.10 and 52.70.

Две карточки запусков — это то, что важно для всех, кто отслеживает тайминг. Обе модели помечены как остановленные: MiMo-V2.6-Pro после 5 дней и 7 часов реального времени, MiMo-V2.6-Flash после 3 дней 11 часов, каждая на шаге 30, 20 и 19 сентября соответственно. Pro израсходовал 75 млрд токенов и 753 тыс. образцов за $2,62 млн; Flash израсходовал 81,4 млрд токенов за $854 тыс. На каждом шаге берётся батч из 1 568 промптов с 16 прогонами на промпт — 25 088 траекторий на шаг, выполняемых полностью асинхронно.

Стоит сказать прямо: Xiaomi не сообщила, означает ли «остановлено», что запуск завершён, приостановлен или сохранён как чекпоинт. Остановленная карточка — не уведомление о завершении, и никто за пределами команды не знает, какой из вариантов имеется в виду.

Что подтверждено, а что нет

Число 72,57 — не слух. Оно напечатано на дашборде Xiaomi, на графике с подписью DeepSWE v1.1, mini-swe-agent, avg@3, рядом с оранжевой кривой прогона Pro. Показатель 65,68 модели Flash находится на том же графике. Эта цифра также встречается — как 62,24, а позднее 65,97 — в более ранних снимках той же панели, и именно это придаёт кривой её форму: устойчивый подъём на протяжении 30 шагов, а не единичная удачная оценка.

То, что это только отчётные данные, — отправная точка. Утверждение, распространяющееся в X 21 сентября с аккаунта @nrehiew_, состоит в том, что модель Pro прошла «с 58.41 до 72.57» на DeepSWE и что прогоны завершились. Конечная точка в точности совпадает с дашбордом вендора. Базовая отметка 58.41 — это трактовка того аккаунта, где начинается кривая: крайняя левая точка Pro на графике действительно находится в районе верхних 50-х, — а Xiaomi не публиковала показатель для шага 1. Утверждение о завершении — это тоже интерпретация двух карточек, помеченных как остановленные, что является разумным прочтением, а не заявлением Xiaomi. Считайте улучшение на 14 пунктов направленно надёжным, но численно приблизительным.

A two-column scoreboard titled 'MiMo-V2.6-Pro vs the DeepSWE top tier', subtitled 'What Xiaomi published about its own checkpoint, against what the public leaderboard lists — September 21, 2026'. The left column, badged VENDOR-REPORTED and headed 'MiMo-V2.6-Pro', reads: DeepSWE v1.1 — 72.57; Basis — Xiaomi's own offline eval, mini-swe-agent avg@3; Confidence — not published; Cost per task — not published; Release — not announced; Independent runs — none. The right column, badged PUBLIC LEADERBOARD and headed 'Top tier — three-way tie', reads: DeepSWE v1.1 — 74%; Basis — submitted configs, Pass@1, GPT-6 Astra · Gemini 3.8 Flash · Claude Opus 5; Confidence — plus or minus 1 to 4 points; Cost per task — $2.36 to $11.84; Release — shipping today; Independent runs — on the public board. A footer reads 'MiMo-V2.6-Pro is Xiaomi's own offline evaluation, read from the vendor's public RL dashboard on 2026-09-21 and not submitted to the leaderboard. Top-tier figures per Datacurve's DeepSWE v1.1 leaderboard, updated 2026-09-03.' The OrcaRouter logo is composited in the bottom-right corner.

В освещении упущено ещё одно различие, и именно оно определяет, насколько ценным является это число. Панели бенчмарков на дашборде — это собственные оценки Xiaomi: компания запустила этот харнесс на своих чекпойнтах и опубликовала результаты. Этот харнесс — тот же, что использует публичный лидерборд, — mini-swe-agent, DeepSWE v1.1, — что делает показатель более сопоставимым, чем если бы это был собственный бенчмарк вендора. Но оценка, проведённая самостоятельно, — это не запись в лидерборде, и 72.57 не появляется в таблице Datacurve, потому что её никто не отправил.

Потолок в 74% жёстче, чем намекает заголовок.

Что выводит сравнение в фокус. Таблица лидеров DeepSWE v1.1 от Datacurve, последнее обновление — 3 сентября 2026 года, включает 113 задач в 91 репозитории на пяти языках, а её три лучшие конфигурации показывают одинаковый результат 74% Pass@1: GPT-6 Astra с уровнем рассуждений xhigh, Gemini 3.8 Flash с уровнем high и Claude Opus 5 с уровнем max. Самое интересное — это числа, стоящие рядом с этими результатами.

• Уверенность — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. В том же рейтинге GPT-5.6 Sol находится на отметке 73% ±3, а GLM-5.3 и Kimi K3 — на 69%. Интервалы перекрываются далеко за вторым десятичным знаком.

• Стоимость за задачу — Gemini 3.8 Flash в среднем $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84. На собственной диаграмме таблицы лидеров Gemini 3.8 Flash отмечен как самая эффективная конфигурация в таблице, а разрыв между этими тремя составляет примерно пять к одному при показателе прохождения, который бенчмарк не может разделить.

• Шаги — Gemini 3.8 Flash требовалось в среднем 166 шагов агента на задачу, Claude Opus 5 — 99, GPT-6 Astra — 29. Одинаковый счёт скрывает три очень разных стиля работы, и самый дешёвый из них — тот, кто работает усерднее всех.

Screenshot of Datacurve's DeepSWE v1.1 leaderboard captured September 21, 2026, showing 113 tasks, 91 repositories, five languages and 28 models, with the v1.1 and Best tabs selected and the board marked 'updated September 3, 2026'. The Pass@1 table lists gpt-6-astra (xhigh) at 74 percent plus or minus 3 with an average cost of $6.52, 30k output tokens and 29 steps; gemini-3.8-flash (high) at 74 percent plus or minus 1 at $2.36, 143k tokens and 166 steps; claude-opus-5 (max) at 74 percent plus or minus 4 at $11.84, 118k tokens and 99 steps; gpt-5.6-sol at 73 percent; claude-fable-5 at 70 percent; glm-5.3 and kimi-k3 at 69 percent; and grok-4.6 and gpt-5.6-luna at 67 percent. The score-versus-average-cost chart above the table labels gemini-3.8-flash as the most efficient configuration. No Xiaomi MiMo model appears on the board.

Итак, когда заявленные 72,57 описывают как «приближение к вершине таблицы», точная версия оказывается более узкой и менее драматичной. Это примерно в пределах полутора баллов от тройного равенства результатов, участников которого невозможно отделить друг от друга с учётом собственных планок погрешностей бенчмарка. Это сильный результат для модели, всё ещё находящейся на этапе пост-обучения, полученный производителем, а не мейнтейнерами бенчмарка, в таблице, в которую модель ещё не подана. Последнее обновление таблицы лидеров полностью предшествует прогону Xiaomi, поэтому ничего из MiMo в ней пока не появляется.

Почему Xiaomi обучается публично

Прозрачность здесь не случайна. Последний релиз Xiaomi с открытыми весами — Xiaomi MiMo-V2.5 и Xiaomi MiMo-V2.5-Pro в конце апреля, обе под лицензией MIT: коммерческое использование, дообучение и распространение разрешены. MiMo-V2.5-Pro — это модель со смесью экспертов, имеющая 1,02 триллиона параметров (42 млрд активных), гибридную архитектуру внимания и контекстное окно на 1 млн токенов, а материалы запуска прямо заявляли об агентных возможностях: компилятор, написанный с нуля на Rust в ходе сотен вызовов инструментов, настольное приложение на восемь тысяч строк, созданное за одиннадцать часов работы агента.

Стриминг пост-обучения следующего поколения — это заявление иного рода. Лаборатория, которая публикует свои кривые вознаграждения, данные о количестве песочниц и сбоях GPU в реальном времени, просит судить её по процессу, а не по презентации к запуску, и сигнализирует о временной шкале. Ло Фули заявил, что технические детали работы по RL будут открываться по частям в течение ближайших недель. Это самое близкое к графику, что кто-либо предлагал: сначала методология, модель — позже.

Это также укладывается в схему, которую Xiaomi уже использовала раньше: модель появляется публично под другим именем, прежде чем компания заявит о ней. Компания привыкла тихо обучать, открыто тестировать, а затем выпускать с весами.

Что можно запустить сегодня

В семействе MiMo-V2.6 ничего нет. Если вам прямо сейчас нужна модель Xiaomi MiMo, существует поколение V2.5 — открытые веса через собственные каналы Xiaomi и несколько сторонних платформ, с опубликованными карточками и ценами. API MiMo-V2.6 не существует, идентификатора модели нет, и прайс-листа нет, а любая страница, где указан идентификатор MiMo-V2.6 или цена за токен, заполняет пробел, который Xiaomi оставила пустым. Строки `mimo-v2.6-pro` и `mimo-v2.6-flash` на панели управления — это названия заданий обучения, а не опубликованные эндпоинты.

Другое практическое следствие — что делать в это время. Если MiMo-V2.6-Pro интересен вам потому, что может оказаться более дешёвым способом достичь производительности в кодинге на уровне фронтира, то конфигурации, с которыми его сравнивают, уже доступны для вызова, и таблица лидеров говорит, что дешёвая из них конкурентоспособна: Gemini 3.8 Flash делит лучший показатель успешных прохождений при $2.36 за задачу и отмечена как самая эффективная конфигурация в таблице. Gemini 3.8 Flash, Claude Opus 5 и GPT-6 Astra доступны через один API-ключ OrcaRouter по каталожной цене провайдера с нулевой наценкой — поэтому изменение цены вендором у нас вступает в силу в тот же день, а не в следующем расчётном цикле — с переключением при сбое, настроенным для каждой модели, а не для каждого вендора. И когда лаборатория всё же открывает такую модель, маршрутизация её через тот же ключ — это способ оценить её с минимальными обязательствами: вы можете поставить её перед реальным трафиком, не ставя производственный путь на чекпойнт, который никто не охарактеризовал.

Что действительно изменило бы эту историю

Четыре сигнала, примерно в порядке того, насколько они могли бы всё решить:

• Веса на Hugging Face под указанной лицензией — именно так появилось поколение V2.5, и это самое сильное свидетельство того, что RL-прогон дал модель, готовую к выпуску, а не эксперимент, который завершился.

• Карточка модели с количеством параметров, длиной контекста и архитектурой — ни одна из цифр V2.6 не опубликована, и дашборд их не показывает. Предположение, что V2.6-Pro наследует структуру 1.02T/42B от V2.5-Pro, было бы догадкой.

• Идентификатор API и прайс-лист — это тот момент, когда показатель DeepSWE становится основанием для решения о покупке, а не просто зрелищем.

• Заявка в борд DeepSWE от Datacurve, которая поставила бы MiMo-V2.6-Pro в ту же таблицу и под те же планки погрешности, что и модели, с которыми его сравнивают. Оценка, проведённая вендором, и заявка на лидерборд — не одно и то же утверждение, и разрыв между ними — ровно одна строка этой таблицы.

До тех пор честное резюме таково: Xiaomi показала самый прозрачный посттренировочный прогон из всех, что публиковала какая-либо крупная лаборатория, — на двух моделях, которые она ещё не выпустила, с одной заявленной самой компанией цифрой бенчмарка, которая близка к — но не входит в — верхушку таблицы. Описание методологии обещано в ближайшие недели. Дата выпуска не обещана вообще.