
Xiaomi MiMo-V2.6-Pro: оценка 72,57 в DeepSWE, остановившийся прогон и по-прежнему никакой даты релиза
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro 20 сентября остановила свой публично транслировавшийся прогон обучения с подкреплением с результатом DeepSWE v1.1 72.57, который красуется на собственной панели Xiaomi, — на 1.4 балла ниже 74%, которые делят между собой GPT-6 Astra, Gemini 3.8 Flash и Claude Opus 5 на вершине того же лидерборда. Xiaomi MiMo-V2.6-Flash, меньшая модель, обучавшаяся вместе с ней, остановилась 19 сентября на 65.68. Оба прогона завершились на шаге 30, а суммарный счёт, опубликованный Xiaomi вместе с ними, составил $3,474,715, когда мы зафиксировали страницу сегодня утром.
Вот и все хорошие новости, и они действительно хороши. Остальная часть истории — это разрыв между числом и продуктом. Ни у Xiaomi MiMo-V2.6-Pro, ни у Xiaomi MiMo-V2.6-Flash нет даты выпуска, карточки модели, идентификатора API, опубликованной цены или набора весов для скачивания. Нет эндпоинта, к которому можно было бы обратиться. Что есть — это панель обучения, за которой может наблюдать любой желающий, показатель бенчмарка, полученный собственным испытательным стендом Xiaomi, и сообщество, которое провело шесть дней, читая страницу телеметрии так, как люди когда-то гадали по чайным листьям.
Итак, это материал в формате «что нам известно на данный момент», и его честная версия разделяет три вещи, которые освещение за последнюю неделю тихо смешивало: что Xiaomi официально заявила, что сообщил об этом один наблюдатель, и что всё это значит для того, кто сегодня выбирает модель для программирования.
Что Xiaomi на самом деле выложила в сеть
16 сентября команда MiMo под руководством Ло Фули открыла живую страницу на собственном домене Xiaomi, где в реальном времени показывалось постобучение двух ещё не выпущенных моделей: число шагов, кривые вознаграждения, пропускная способность по токенам, количество песочниц, уведомления о сбоях GPU и счётчик затрат, который увеличивается прямо на глазах. Согласно публикациям, Xiaomi подаёт это так: компания потратила примерно шесть месяцев на один вопрос — насколько далеко можно масштабировать обучение с подкреплением — и решила провести этот эксперимент публично, а не объявлять результат.
Эта панель мониторинга на удивление откровенна для артефакта вендора. Она перечисляет собственные сбои в ленте уведомлений: перезапуск Pro на шаге 17, вызванный сбоем из-за нехватки памяти GPU (out-of-memory) вследствие дисбаланса нагрузки на экспертов, который, по словам команды, был устранён настройкой стратегии параллелизма обучения; сбой сетевого подключения между обучающим кластером Pro и развёртыванием для оценки, который вынудил выполнить перезапуск и принять решение исключить кибердатасет из предстоящего запуска Pro после «плохих паттернов в логах развёртывания»; перезапуск Flash с шага 15 после того, как класс инфраструктурных ошибок оставался незамеченным около трёх часов; и перезапуск Pro из-за сбоя VRAM на одном узле. Также отмечается, что задачи, сочтённые «относительно лёгкими для текущей модели Pro», были отфильтрованы, — признание, которое большинство отчётов о постобучении оставляют невысказанным.

Две карточки запусков — это то, что важно для всех, кто отслеживает тайминг. Обе модели помечены как остановленные: MiMo-V2.6-Pro после 5 дней и 7 часов реального времени, MiMo-V2.6-Flash после 3 дней 11 часов, каждая на шаге 30, 20 и 19 сентября соответственно. Pro израсходовал 75 млрд токенов и 753 тыс. образцов за $2,62 млн; Flash израсходовал 81,4 млрд токенов за $854 тыс. На каждом шаге берётся батч из 1 568 промптов с 16 прогонами на промпт — 25 088 траекторий на шаг, выполняемых полностью асинхронно.
Стоит сказать прямо: Xiaomi не сообщила, означает ли «остановлено», что запуск завершён, приостановлен или сохранён как чекпоинт. Остановленная карточка — не уведомление о завершении, и никто за пределами команды не знает, какой из вариантов имеется в виду.
Что подтверждено, а что нет
Число 72,57 — не слух. Оно напечатано на дашборде Xiaomi, на графике с подписью DeepSWE v1.1, mini-swe-agent, avg@3, рядом с оранжевой кривой прогона Pro. Показатель 65,68 модели Flash находится на том же графике. Эта цифра также встречается — как 62,24, а позднее 65,97 — в более ранних снимках той же панели, и именно это придаёт кривой её форму: устойчивый подъём на протяжении 30 шагов, а не единичная удачная оценка.
То, что это только отчётные данные, — отправная точка. Утверждение, распространяющееся в X 21 сентября с аккаунта @nrehiew_, состоит в том, что модель Pro прошла «с 58.41 до 72.57» на DeepSWE и что прогоны завершились. Конечная точка в точности совпадает с дашбордом вендора. Базовая отметка 58.41 — это трактовка того аккаунта, где начинается кривая: крайняя левая точка Pro на графике действительно находится в районе верхних 50-х, — а Xiaomi не публиковала показатель для шага 1. Утверждение о завершении — это тоже интерпретация двух карточек, помеченных как остановленные, что является разумным прочтением, а не заявлением Xiaomi. Считайте улучшение на 14 пунктов направленно надёжным, но численно приблизительным.

В освещении упущено ещё одно различие, и именно оно определяет, насколько ценным является это число. Панели бенчмарков на дашборде — это собственные оценки Xiaomi: компания запустила этот харнесс на своих чекпойнтах и опубликовала результаты. Этот харнесс — тот же, что использует публичный лидерборд, — mini-swe-agent, DeepSWE v1.1, — что делает показатель более сопоставимым, чем если бы это был собственный бенчмарк вендора. Но оценка, проведённая самостоятельно, — это не запись в лидерборде, и 72.57 не появляется в таблице Datacurve, потому что её никто не отправил.
Потолок в 74% жёстче, чем намекает заголовок.
Что выводит сравнение в фокус. Таблица лидеров DeepSWE v1.1 от Datacurve, последнее обновление — 3 сентября 2026 года, включает 113 задач в 91 репозитории на пяти языках, а её три лучшие конфигурации показывают одинаковый результат 74% Pass@1: GPT-6 Astra с уровнем рассуждений xhigh, Gemini 3.8 Flash с уровнем high и Claude Opus 5 с уровнем max. Самое интересное — это числа, стоящие рядом с этими результатами.
• Уверенность — GPT-6 Astra 74% ±3, Gemini 3.8 Flash 74% ±1, Claude Opus 5 74% ±4. В том же рейтинге GPT-5.6 Sol находится на отметке 73% ±3, а GLM-5.3 и Kimi K3 — на 69%. Интервалы перекрываются далеко за вторым десятичным знаком.
• Стоимость за задачу — Gemini 3.8 Flash в среднем $2.36, GPT-6 Astra $6.52, Claude Opus 5 $11.84. На собственной диаграмме таблицы лидеров Gemini 3.8 Flash отмечен как самая эффективная конфигурация в таблице, а разрыв между этими тремя составляет примерно пять к одному при показателе прохождения, который бенчмарк не может разделить.
• Шаги — Gemini 3.8 Flash требовалось в среднем 166 шагов агента на задачу, Claude Opus 5 — 99, GPT-6 Astra — 29. Одинаковый счёт скрывает три очень разных стиля работы, и самый дешёвый из них — тот, кто работает усерднее всех.

Итак, когда заявленные 72,57 описывают как «приближение к вершине таблицы», точная версия оказывается более узкой и менее драматичной. Это примерно в пределах полутора баллов от тройного равенства результатов, участников которого невозможно отделить друг от друга с учётом собственных планок погрешностей бенчмарка. Это сильный результат для модели, всё ещё находящейся на этапе пост-обучения, полученный производителем, а не мейнтейнерами бенчмарка, в таблице, в которую модель ещё не подана. Последнее обновление таблицы лидеров полностью предшествует прогону Xiaomi, поэтому ничего из MiMo в ней пока не появляется.
Почему Xiaomi обучается публично
Прозрачность здесь не случайна. Последний релиз Xiaomi с открытыми весами — Xiaomi MiMo-V2.5 и Xiaomi MiMo-V2.5-Pro в конце апреля, обе под лицензией MIT: коммерческое использование, дообучение и распространение разрешены. MiMo-V2.5-Pro — это модель со смесью экспертов, имеющая 1,02 триллиона параметров (42 млрд активных), гибридную архитектуру внимания и контекстное окно на 1 млн токенов, а материалы запуска прямо заявляли об агентных возможностях: компилятор, написанный с нуля на Rust в ходе сотен вызовов инструментов, настольное приложение на восемь тысяч строк, созданное за одиннадцать часов работы агента.
Стриминг пост-обучения следующего поколения — это заявление иного рода. Лаборатория, которая публикует свои кривые вознаграждения, данные о количестве песочниц и сбоях GPU в реальном времени, просит судить её по процессу, а не по презентации к запуску, и сигнализирует о временной шкале. Ло Фули заявил, что технические детали работы по RL будут открываться по частям в течение ближайших недель. Это самое близкое к графику, что кто-либо предлагал: сначала методология, модель — позже.
Это также укладывается в схему, которую Xiaomi уже использовала раньше: модель появляется публично под другим именем, прежде чем компания заявит о ней. Компания привыкла тихо обучать, открыто тестировать, а затем выпускать с весами.
Что можно запустить сегодня
В семействе MiMo-V2.6 ничего нет. Если вам прямо сейчас нужна модель Xiaomi MiMo, существует поколение V2.5 — открытые веса через собственные каналы Xiaomi и несколько сторонних платформ, с опубликованными карточками и ценами. API MiMo-V2.6 не существует, идентификатора модели нет, и прайс-листа нет, а любая страница, где указан идентификатор MiMo-V2.6 или цена за токен, заполняет пробел, который Xiaomi оставила пустым. Строки `mimo-v2.6-pro` и `mimo-v2.6-flash` на панели управления — это названия заданий обучения, а не опубликованные эндпоинты.
Другое практическое следствие — что делать в это время. Если MiMo-V2.6-Pro интересен вам потому, что может оказаться более дешёвым способом достичь производительности в кодинге на уровне фронтира, то конфигурации, с которыми его сравнивают, уже доступны для вызова, и таблица лидеров говорит, что дешёвая из них конкурентоспособна: Gemini 3.8 Flash делит лучший показатель успешных прохождений при $2.36 за задачу и отмечена как самая эффективная конфигурация в таблице. Gemini 3.8 Flash, Claude Opus 5 и GPT-6 Astra доступны через один API-ключ OrcaRouter по каталожной цене провайдера с нулевой наценкой — поэтому изменение цены вендором у нас вступает в силу в тот же день, а не в следующем расчётном цикле — с переключением при сбое, настроенным для каждой модели, а не для каждого вендора. И когда лаборатория всё же открывает такую модель, маршрутизация её через тот же ключ — это способ оценить её с минимальными обязательствами: вы можете поставить её перед реальным трафиком, не ставя производственный путь на чекпойнт, который никто не охарактеризовал.
Что действительно изменило бы эту историю
Четыре сигнала, примерно в порядке того, насколько они могли бы всё решить:
• Веса на Hugging Face под указанной лицензией — именно так появилось поколение V2.5, и это самое сильное свидетельство того, что RL-прогон дал модель, готовую к выпуску, а не эксперимент, который завершился.
• Карточка модели с количеством параметров, длиной контекста и архитектурой — ни одна из цифр V2.6 не опубликована, и дашборд их не показывает. Предположение, что V2.6-Pro наследует структуру 1.02T/42B от V2.5-Pro, было бы догадкой.
• Идентификатор API и прайс-лист — это тот момент, когда показатель DeepSWE становится основанием для решения о покупке, а не просто зрелищем.
• Заявка в борд DeepSWE от Datacurve, которая поставила бы MiMo-V2.6-Pro в ту же таблицу и под те же планки погрешности, что и модели, с которыми его сравнивают. Оценка, проведённая вендором, и заявка на лидерборд — не одно и то же утверждение, и разрыв между ними — ровно одна строка этой таблицы.
До тех пор честное резюме таково: Xiaomi показала самый прозрачный посттренировочный прогон из всех, что публиковала какая-либо крупная лаборатория, — на двух моделях, которые она ещё не выпустила, с одной заявленной самой компанией цифрой бенчмарка, которая близка к — но не входит в — верхушку таблицы. Описание методологии обещано в ближайшие недели. Дата выпуска не обещана вообще.
