
MiMo-V2.6-Pro против Grok 4.6: оба вендора опубликовали показатели DeepSWE, но ни одного из них нет в таблице лидеров
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Два вендора, один бенчмарк, два числа, которые нельзя вычесть друг из друга. Материалы запуска SpaceXAI для Grok 4.6 сообщают о 65,9% на DeepSWE v1.1. Материалы Xiaomi для MiMo-V2.6-Pro сообщают о 72,57 на DeepSWE v1.1. При совместном чтении они предполагают, что более дешёвая модель с открытыми весами превосходит проприетарную фронтирную почти на семь пунктов. При внимательном чтении они почти ничего не говорят, потому что одно — это процент из презентации к запуску на собственном стенде вендора, а другое — среднее из трёх из прогона обучения с подкреплением на собственном грейдере Xiaomi, и ни один из них не был подан в публичный лидерборд DeepSWE. Сравнение MiMo-V2.6-Pro и Grok 4.6, которое выдерживает тщательную проверку, находится в независимом индексе, и там ответ противоположен цифрам вендоров: 46 против 44 в пользу Xiaomi, на два пункта.
Grok 4.6 был выпущен 12 августа 2026 года компанией SpaceXAI и является здесь действующим лидером — уже выпущенная, широко используемая передовая модель с документированным прайс-листом и месяцами независимых измерений за плечами. Xiaomi MiMo-V2.6-Pro стал общедоступным 22 сентября 2026 года, а его репозитории контрольных точек обучения с подкреплением появились днём ранее, и он является новичком. Обе способны к рассуждениям, обе созданы для длительной агентной работы, и разрыв в цене между ними настолько велик, что неопытность новичка — единственное, что сдерживает сравнение.
Что на самом деле представляет собой каждая модель
Grok 4.6 является проприетарным, принимает текстовый и графический ввод и возвращает текст, а его дата отсечки знаний — 1 февраля 2026 года. Его контекстное окно составляет 500 000 токенов, что вдвое меньше, чем у основных конкурентов, и это самая значимая характеристика в его спецификации. Его базовые тарифы: $2,00 за миллион входных токенов, $0,50 за миллион кэшированных входных и $6,00 за миллион выходных при объёме промпта менее 200 000 токенов, с резким скачком на этой границе: при 200K и выше тарифы становятся $4,00, $1,00 и $12,00, причём более высокий уровень тарифицирует весь запрос, а не только часть, превышающую порог. Приоритетная обработка удваивает стандартный тариф. Artificial Analysis измерила 63,0 выходных токенов в секунду и 42,79 секунды до первого токена при максимальном усилии, а также $2 351,83 на прогон полного индекса.
Xiaomi MiMo-V2.6-Pro — это разреженная модель со смесью экспертов: 1,02 трлн общих параметров и 42 млрд активируемых на токен, с контекстным окном на 1 млн токенов и нативной мультимодальностью по тексту, изображениям, видео и аудио. Она распространяется под лицензией MIT с доступными для скачивания весами, и Xiaomi сохранила цены предыдущего поколения, а не подняла их для нового чекпоинта — $0,43 за миллион входных токенов и $0,87 за миллион выходных, 99%-ная скидка за кэш и смешанная цена $0,18 при соотношении попаданий в кэш/входных/выходных токенов 7:2:1. Artificial Analysis измерила 134,3 выходных токена в секунду, 2,15 секунды до первого токена и $206,66 на прогон индекса — $0,13 за задачу.
• Веса — {{1}}MiMo-V2.6-Pro{{/1}} с лицензией MIT и доступен для скачивания; {{2}}Grok 4.6{{/2}} проприетарный, только через API
• Параметры — MiMo-V2.6-Pro: всего 1,02 трлн / 42 млрд активных; Grok 4.6 — не раскрыто
• Контекст — MiMo-V2.6-Pro 1M токенов; Grok 4.6 500K, с ценовым скачком при 200K входных токенов
• Модальность — MiMo-V2.6-Pro принимает текст, изображения, видео и аудио; заявленный набор входных данных Grok 4.6 — текст и изображения
• Оценка индекса — MiMo-V2.6-Pro 46; Grok 4.6 44, оба — Artificial Analysis v4.3.2
• Прейскурантная цена — MiMo-V2.6-Pro: $0,43 / $0,87 за 1 млн; Grok 4.6: $2,00 / $6,00, с удвоением при объёме входных данных свыше 200 тыс.
• Смешанная ставка — MiMo-V2.6-Pro $0,18 за 1 млн; Grok 4.6 $1,35
• Стоимость запуска индекса — MiMo-V2.6-Pro $206,66; Grok 4.6 $2 351,83
• Скорость — MiMo-V2.6-Pro 134,3 выходных токена/секунду; Grok 4.6 63,0
• Время до первого токена — MiMo-V2.6-Pro 2,15 секунды; Grok 4.6 42,79 секунды
• Дата отсечки знаний — для MiMo-V2.6-Pro не опубликована; Grok 4.6 — 1 февраля 2026 г.

Бенчмарк, который провели оба вендора, и почему он несопоставим
DeepSWE v1.1 — это реальная публичная сторонняя оценка кодирующих агентов, проводимая Datacurve, и именно то семейство задач, по которому обе компании решили публиковать результаты. Это делает его заманчивым. Его не следует использовать для прямого сравнения, и причина не в том, что кто-то из вендоров лжёт, — а в том, что эти две цифры описывают разные измерения в рамках одного и того же названия задачи.
72,57 у Xiaomi — это среднее из трёх на её собственном тестовом стенде с mini-swe-agent, полученное в ходе прогона обучения с подкреплением, а не из замороженного релиз-кандидата, и оно приводится вместе со стартовым показателем 58,4. Прогон задокументирован как 30 шагов и примерно 750 000 траекторий на модель, выполненных менее чем за шесть дней при опубликованных расходах около $2,62 млн для модели Pro. Он не был отправлен в табло Datacurve. Показатель SpaceXAI в 65,9% для Grok 4.6 — это цифра со слайда запуска из собственного оценочного набора вендора, приведённая рядом с приростом относительно Grok 4.5 на 11,9 пункта на том же бенчмарке — а на публичном табло представлена отправленная конфигурация Grok 4.6 примерно с 67%, что достаточно близко к числу вендора, чтобы предположить, что тестовый стенд хотя бы приблизительно согласован. Это не относится к показателю Xiaomi, у которого вообще нет публичного аналога.
Итак, честная формулировка такая: в публичном рейтинге Grok 4.6 присутствует, а MiMo-V2.6-Pro отсутствует. В независимом сводном рейтинге обе модели действительно оценивались одним и тем же оценщиком, и модель Xiaomi лидирует на два балла. Эти два факта не противоречат друг другу. Они просто измеряют разные вещи, и цитировать следует второй.
Контекст в 500K — это спецификация, определяющая реальные рабочие нагрузки
Полмиллиона токенов — это большое контекстное окно по любым обычным меркам и маленькое для 2026 года. Модели, с которыми группируется MiMo-V2.6-Pro, все находятся на уровне 1M, и практическое следствие проявляется именно в тех рабочих нагрузках, для которых продвигается Grok 4.6. Долго работающий агент для программирования, удерживающий репозиторий, журнал вызовов инструментов и накопленный план, за сессию превысит 200 000 токенов промпта — и на этой отметке тарифы Grok 4.6 удваиваются и применяются задним числом ко всему запросу. Та же сессия на MiMo-V2.6-Pro доходит до миллиона токенов без изменения тарифного уровня.
Это одновременно различие в спецификации и различие в структуре ценообразования, и второе легко упустить при сравнении заявленных тарифов. Смешанная цена $1.35 для Grok 4.6 против $0.18 для MiMo-V2.6-Pro — это разрыв в 7,5 раза. На запросе, превышающем 200K, он расширяется до примерно 15 раз, потому что тариф Grok удваивается, а тариф Xiaomi не меняется.
Контраргумент тоже зафиксирован, и он заслуживает этого. Тезис запуска Grok 4.6 строился на эффективности по числу ходов, а не на сыром объёме контекста: в агентной оценке, где его сравнивали с Claude Opus 5 на идентичных задачах, он завершил работу примерно за 53 хода и около 500 миллионов входных токенов против примерно 103 ходов и двух миллиардов токенов у другой модели, при оценочной стоимости $0.84 за задачу — самый низкий показатель среди передовых моделей в этом сравнении. Модели, которая проходит цикл вдвое меньше раз, не требуется так много контекста, и она не сжигает столько токенов. Это подлинное архитектурное преимущество, и это сильнейший аргумент в пользу Grok 4.6 против любой более дешёвой по цене за токен альтернативы, включая эту.

Как добраться до каждого из них
Grok 4.6 представлен на OrcaRouter как grok/grok-4.6, доступ к нему можно получить через единый совместимый с OpenAI эндпоинт по цене провайдера из прайс-листа с наценкой 0% — поэтому изменение цен SpaceXAI, включая изменение того порога в 200K, вступает в силу на нашей стороне в тот же день. Xiaomi MiMo-V2.6-Pro нет на OrcaRouter. Ни одной модели Xiaomi там нет, и сегодня путь к ней — собственная платформа Xiaomi или один из сторонних каталогов, где она указана. Сказать это прямо полезнее, чем позволять странице модели подразумевать обратное.
То, чего эта асимметрия стоит на практике, — это дешёвый эксперимент. Grok 4.6 — модель, за которую вы, возможно, уже платите. MiMo-V2.6-Pro — это улучшение индекса на два пункта при кратно меньшей цене, выпущенное на этой неделе, и за ним стоит единственный маршрут обслуживания. Вопрос, на который стоит ответить, не в том, какая модель лучше в абстракции, а в том, какую долю вашего трафика Grok модель Xiaomi может взять на ваших собственных промптах — и ответ на него через открытие второго контракта, второго ключа и вторых биллинговых отношений — это то трение, которое мешает провести тест. С одним эндпоинтом и автоматическим переключением при сбое между провайдерами сравнение сводится к изменению конфигурации, и часть с переключением при сбое здесь важна более обычного: модель, вышедшая на этой неделе и указанная одним API-провайдером на момент, когда её зафиксировала Artificial Analysis, — не то, что стоит ставить в производственный путь без резервного маршрута.

Какой из них выбрать?
Выбирайте Grok 4.6, когда вы оптимизируете эффективность по числу ходов — длинные агентные циклы, где способность модели завершать работу за вдвое меньшее число шагов важнее, чем её стоимость за токен, — или когда вам нужна модель, за которой стоят месяцы независимых измерений, а не неделя. Его 63 токена в секунду и 42,79 секунды до первого токена делают его моделью для пакетных и офлайн-нагрузок с точки зрения интерактива, а контекст в 500K с ценовым скачком на 200K говорит в пользу того, чтобы держать промпты короткими.
Выбирайте MiMo-V2.6-Pro, когда вы запускаете требующие большого контекста повторяющиеся циклы, которые перешагнули бы порог Grok в 200K; когда вам нужна задержка до первого токена, достаточно низкая, чтобы человек мог дождаться; когда вы хотите держать веса в собственной инфраструктуре; или когда объём делает разрыв в 7.5x по смешанной ставке решающим числом. Его преимущество в два пункта по индексу достаточно мало, чтобы быть причиной само по себе; $206.66 против $2,351.83 затрат на запуск того же набора оценок — причина получше.
Открытый вопрос решила бы отправленная конфигурация DeepSWE для MiMo-V2.6-Pro. У Grok 4.6 она уже есть. Как только модель Xiaomi появится на публичном лидерборде с указанным харнессом, доверительным интервалом и стоимостью за задачу, 72.57 перестанет быть цифрой вендора, а приведённое выше сравнение станет реальным — и, учитывая разрыв в два пункта по индексу, исход может быть любым.
OrcaRouter объединяет более 200 моделей за одной конечной точкой, совместимой с OpenAI, по каталожной цене провайдера с наценкой 0%, поэтому изменение цены поставщиком вступает в силу в тот же день.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
