Hero-карточка радара моделей OrcaRouter для Xiaomi MiMo-V2.6-Pro с заголовком — названием модели — и строкой «Открытые веса, 46 в индексе, $0.43 / $0.87», с двумя панелями с подписями «Что выпущено» и «Сколько это стоит».
Guides & Insights

Xiaomi MiMo-V2.6-Pro возглавляет индекс открытых весов с результатом 46 — и публикует счёт за обучение

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Xiaomi MiMo-V2.6-Pro теперь самая высоко оцениваемая модель с открытыми весами в Artificial Analysis Intelligence Index — 46 баллов в версии v4.3.2, на один балл больше, чем у GLM-5.3, и на два — чем у Kimi K3, а также на двадцать баллов выше показателя 26, который её предшественница MiMo-V2.5-Pro зафиксировала на прежней шкале индекса. Этот показатель был получен Artificial Analysis при запуске собственного испытательного стенда, а не Xiaomi, и это самый полезный факт в этом анонсе. Второй по полезности факт — цена, указанная рядом: 0,43 доллара за миллион входных токенов, 0,87 доллара за миллион выходных против 5,00 и 25,00 долларов у Claude Opus 5 — модели, которая находится на пять пунктов выше в индексе. Третий — тот, который никто не ожидал, что Xiaomi обнародует: публичный отчёт о том, сколько на самом деле стоил прогон обучения с подкреплением, в результате которого была создана MiMo-V2.6-Pro.

Оценка — это измерение, а не утверждение.

Почти всё, что публикуется о запуске китайской модели, приходит в виде цифр от вендора, и читатели научились делать на них скидку. Этот случай — иной, и в этом различии стоит быть точным, потому что освещение запуска уже его размыло.

Artificial Analysis оценила саму MiMo-V2.6-Pro на композитном наборе v4.3.2 — десять оценок, охватывающих рассуждения, знания, математику и программирование, включая AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR v1.1. Именно такой результат вернул этот набор — 46. Были также зафиксированы эксплуатационные характеристики, определяющие, пригодна ли модель для практического использования, а не просто хороша: 134,3 выходных токена в секунду, 2,15 секунды до первого токена, 99%-ная скидка за кэш и измеренная стоимость $0,13 за задачу Intelligence Index. Среди этих чисел разбросаны маркеры KEEP, разрешавшиеся медленнее, чем было объявлено ранее.

Два из них заслуживают особого внимания. 134,3 токена в секунду ставят MiMo-V2.6-Pro на одиннадцатое место из 114 моделей по скорости — для модели-смеси экспертов с триллионом параметров это результат сервинга, а не просто результат обучения. А $0,13 за задачу — это число, которое выдерживает проверку бюджетом: именно столько на самом деле стоило запустить индекс против этой модели, измерено одинаково для всех моделей в таблице, что делает его сопоставимым так, как не сопоставимы заявленные ставки за токен.

Scoreboard card headed 'Xiaomi MiMo-V2.6-Pro — the scoreboard', listing the index score of 46 on Intelligence Index v4.3.2 as the highest of any open-weights model, the open-weights field behind it at GLM-5.3 45 and Kimi K3 44, the top of the same index at Claude Fable 5.1 53, GPT-6 Astra 53 and Claude Opus 5 51, serving at 134.3 output tokens per second and 2.15 seconds to first token, a price of $0.43 in and $0.87 out per million tokens with a 99% cache discount and $0.13 per index task, MIT-licensed weights at 1.02T total and 42B active parameters with a 1M-token context window and text, image, video and audio input, and a route count of one API provider.

Что охватывает индекс, а что нет

Корона открытых весов реальна, но разрыв уже, чем кажется. С 46 баллами MiMo-V2.6-Pro лидирует в категории открытых весов. Но не в общем индексе. Вершину v4.3 занимают Claude Fable 5.1 на максимальном уровне усилий с резервным вариантом по умолчанию и GPT-6 Astra на максимальном уровне усилий — обе с 53, — а также Claude Opus 5 с 51 и Claude Fable 5 с 50. Так что честная формулировка такова: разрыв с фронтиром в пять пунктов по композитной метрике, поощряющей широту, и улучшение на двадцать пунктов по сравнению с предыдущим поколением самой Xiaomi.

• Лидер среди открытых весов — Xiaomi MiMo-V2.6-Pro 46, GLM-5.3 (max) 45, Kimi K3 (max) 44

• Топ того же индекса — Claude Fable 5.1 (макс., резервный) 53, GPT-6 Astra (макс.) 53, Claude Opus 5 (макс.) 51

• Скорость — 134,3 выходных токена в секунду, одиннадцатое место из 114 измеренных моделей; медиана для этого класса размера — 77,9

• Время до первого токена — 2,15 секунды против медианы 2,34 секунды

• Стоимость одной задачи в Intelligence Index — $0,13, а проведение всей оценки обходится в $206,66.

• Указанная ставка — $0.43 за миллион входных токенов, $0.87 за миллион выходных токенов, скидка 99% на кэш и смешанная ставка $0.18 при соотношении кэш-хитов/входных/выходных 7:2:1

Одна цифра на странице Artificial Analysis — это не похвальба, а настоящая оговорка: на момент написания она учитывала лишь одного поставщика API для MiMo-V2.6-Pro. Сейчас это практическое узкое место для данной модели, и это не проблема качества — это проблема доступности. Модель, доступная через один маршрут, не имеет отказоустойчивого переключения. Если этот маршрут деградирует, ваше приложение деградирует вместе с ним, а отказоустойчивое переключение — это ровно то, что призван обеспечивать роутер. Уместное наблюдение для всех, кто планирует что-то вокруг этого релиза, состоит в том, что мы не размещаем MiMo-V2.6-Pro у себя и не будем делать вид, что это не так; маршрут к ней сегодня — собственная платформа Xiaomi и несколько сторонних каталогов, в которых она указана.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, showing the Intelligence Index score of 46 on version 4.3.2, the listed price of $0.43 per million input tokens and $0.87 per million output tokens, a 99% cache discount, output speed of 134.3 tokens per second, time to first token of 2.15 seconds, and the open-weights attribution with the MIT licence.

Два числа, которые нельзя путать

Xiaomi также опубликовала собственные бенчмарк-показатели, и они — объект иного рода, чем 46. На дашборде компании сообщается, что MiMo-V2.6-Pro в ходе прогона обучения с подкреплением вырос с 58.4 до 72.57 на DeepSWE v1.1 при оценке с помощью mini-swe-agent и усреднении по трём. Это тестовый стенд Xiaomi, система оценки Xiaomi, офлайн-прогон Xiaomi. Он не был подан в публичную таблицу лидеров DeepSWE и никем не воспроизведён.

Прочитайте эти два числа рядом друг с другом — и возникает соблазн воспринимать 72,57 как результат, стоящий на одном уровне с 74%, которые публичный лидерборд DeepSWE помещает на верхний ярус. Они относятся к разным шкалам. Показатель в лидерборде — это заявленная конфигурация, Pass@1, с опубликованным доверительным интервалом и средней стоимостью за задачу; показатель поставщика — это внутренняя оценка, к которой ничего этого не прилагается. В нашем собственном материале от 21 сентября эта мысль уже звучала, когда числа ещё были показаниями дашборда, и она остаётся верной теперь, когда веса опубликованы. Стенд поставщика может быть совершенно честным и при этом не быть записью в лидерборде, потому что запись в лидерборде — это утверждение о конкретной конфигурации в конкретных условиях, которое третья сторона может воспроизвести.

Та же дисциплина применима и к затратам на обучение. Xiaomi сообщает о примерно $3 474 715 по запускам Pro и Flash — $2 620 670 для Pro, $854 044 для Flash — более тридцати шагов обучения с подкреплением в каждом и около 750 000 траекторий на каждый, завершённых менее чем за шесть дней. Это собственные данные компании по учёту вычислений. Они интересны тем, что лаборатории почти никогда их не публикуют, и это не цена API, не затраты, которые вы понесёте, и не число, проверенное какой-либо третьей стороной.

Что Xiaomi на самом деле выпустила

Этот релиз — разрежённая модель смеси экспертов с 1,02 трлн общих параметров и 42 млрд активируемых на токен, окном контекста в 1 млн токенов и нативной мультимодальностью для текста, изображений, видео и аудио. Её собрат Xiaomi MiMo-V2.6-Flash — та же архитектура в меньшем масштабе: 309 млрд общих и 15 млрд активных. Опубликованные веса имеют метку лицензии MIT, а пакет релиза включает технический отчёт, инструкции по развёртыванию и — по словам Xiaomi — среды обучения с подкреплением и код, необходимые для изучения и воспроизведения постобучения.

Последний пункт — это содержательное отличие этого запуска от типичного анонса API, и его стоит отделить от маркетинга. Публикация RL-среды — это заявление о том, что конфигурацию обучения можно проверить. Достаточно ли опубликованных сред, чтобы воспроизвести 72.57, — отдельный вопрос, и его решат люди, которые попытаются это сделать, а не примечания к выпуску. В собственных заметках Xiaomi об обучении описывается прогон, в котором задачи по программированию, задачи общего агента, визуальные задачи и задачи по кибербезопасности смешивались за один проход, с грейдерами, которые ранжируют успешные траектории и перераспределяют награду в пользу лучших путей, — и там же фиксируются сбои: перезапуск из-за исчерпания памяти GPU, вызванного дисбалансом нагрузки экспертов, сетевой сбой между обучающим кластером и развёртыванием грейдера, и перезапуск Flash после того, как инфраструктурная ошибка оставалась незамеченной примерно три часа. Именно публикация сбоев наряду с успехами делает остальную часть раскрытия информации заслуживающей доверия.

Сколько стоит позвонить и какое место занимает вопрос маршрутизации

При цене $0,43 и $0,87 за миллион токенов MiMo-V2.6-Pro стоит как модель среднего уровня, а по результатам бенчмарков — как фронтирная модель с открытыми весами. Xiaomi сохранила стандартные цены предыдущего поколения MiMo-V2.5, а не подняла их для нового чекпоинта, поэтому тариф выглядит низким относительно количества параметров. 99-процентная скидка на кэш означает, что агентный цикл с интенсивным использованием кэша читает свой контекст фактически бесплатно, и именно там у агента с длинным горизонтом реально накапливается счёт.

Есть версия этой сделки, которая маршрутизируется чисто, и версия, которая — нет. Версия, которая маршрутизируется чисто: фронтирные модели, с которыми вы бы сравнивали MiMo-V2.6-Pro — Claude Opus 5 по $5.00/$25.00, GPT-6 Astra, Gemini 3.8 Flash, GLM-5.3 — все доступны через один ключ OrcaRouter по каталожной цене провайдера с 0% наценки, так что снижение цены вендором на любую из них действует на нашей стороне в тот же день, а правило маршрутизации может отправить запрос ко второй модели, когда первая работает медленно или недоступна. Здесь это важно больше обычного, потому что модель с лучшим показателем среди открытых весов — это ещё и та, к которой ведёт самый тонкий маршрут. Совместить две — дешёвую полосу на открытых весах для объёмной работы и фронтирную полосу для тяжёлого хвоста — это решение о маршрутизации, и это тот вид решения, который перестаёт быть ставкой в тот самый момент, когда обе полосы оказываются на одном ключе.

Ещё один продукт, который стоит держать в голове, потому что его легко спутать с самой моделью: Xiaomi также предлагает MiMo-V2.6-Pro-UltraSpeed — размещённый на своих серверах уровень обслуживания, построенный на том же чекпоинте. В собственных материалах Xiaomi заявлена скорость вывода до двадцати раз выше, чем у стандартного сервиса Pro, при том же качестве; в сторонних каталогах говорится примерно о десятикратной. Это два разных числа, описывающих один и тот же уровень, никто не публиковал распределения задержек по отдельным запросам, которые бы их примирили, и этот уровень тарифицируется существенно выше. UltraSpeed никак не меняет то, на что способны сами веса, — он меняет лишь то, как быстро их будут прогонять чужие серверы.

Что изменило бы эту картину?

Три вещи, в порядке того, насколько они были бы важны.

Второй и третий маршрут обслуживания. То, что в Artificial Analysis модель представлена лишь у одного провайдера, — это ограничение для всего остального. Больше маршрутов означает отказоустойчивость, ценовую конкуренцию на уровне обслуживания и возможность вывести модель в продакшен, а не оставить экспериментом.

Независимое воспроизведение показателей DeepSWE. Цифра 46 уже независима; 72,57 — нет. Если сторонние прогоны окажутся близки к ней, аргументы в пользу модели существенно окрепнут. Если же они окажутся заметно ниже, доверять по-прежнему стоит цифре Artificial Analysis, а показатель вендора пополнит длинный список заявлений на запуске, не переживших соприкосновения с реальностью.

Timeline card headed 'MiMo-V2.6-Pro — what was disclosed, and by whom', with six dated rows: 21 September 2026 weights, technical report, deployment instructions and RL environments published; 22 September 2026 Xiaomi's launch page carrying the DeepSWE v1.1 figures and the training-spend accounting; the independent Artificial Analysis score of 46 on v4.3.2; the vendor harness result moving 58.4 to 72.57 on DeepSWE v1.1; the vendor accounting of $2,620,670 for Pro and $854,044 for Flash across the RL runs; and a route count of one API provider.

Разбивки по отдельным оценкам. Сводный показатель — это сводный показатель. Какие из десяти оценок MiMo-V2.6-Pro выигрывает, а какие проигрывает, — это разница между моделью, которую вы развёртываете для агентного программирования, и моделью, которую вы развёртываете для ответов на вопросы с интенсивным поиском, и один только индекс вам этого не скажет. Именно за этой деталью стоит следить дальше, и именно она нужна конфигурации маршрутизации, прежде чем её стоит записывать.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно