
Xiaomi MiMo-V2.6-Pro-UltraSpeed против Xiaomi MiMo-V2.6: Один чекпоинт, в десять раз дороже
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Xiaomi MiMo-V2.6-Pro-UltraSpeed и Xiaomi MiMo-V2.6-Pro — это не две модели. Это одна модель, продаваемая двумя способами. Обе обслуживаются из одного и того же чекпоинта MiMo-V2.6 с триллионом параметров, опубликованного Xiaomi в сентябре 2026 года — уровня Pro серии Xiaomi MiMo-V2.6, младший собрат которой — Xiaomi MiMo-V2.6-Flash. Разница между двумя предложениями Pro полностью заключается в том, как быстро выдаются токены и сколько вы за них платите. Стандартный уровень просит $0.435 за миллион входных токенов и $0.87 за миллион выходных токенов. Уровень UltraSpeed — $4.35 и $8.70. Это ровно десять к одному с обеих сторон счётчика, и за это обещают примерно десятикратную скорость вывода — заявление, которое Xiaomi делает о собственном стеке обслуживания, и для которого пока ни один независимый бенчмарк не опубликовал цифру.
Итак, интересен не вопрос о том, какая модель лучше. А вопрос о том, оправдана ли десятикратная цена за десятикратную скорость, и, как выясняется, у этого есть прецедент, который стоит изучить, прежде чем закладывать это в продакшен.
Быстрый уровень — это решение об обслуживании, а не о модели.
Собственное позиционирование Xiaomi для линейки UltraSpeed состоит в том, что она соответствует стандартной модели по качеству и отличается только пропускной способностью. Это важнее, чем кажется, потому что устраняет обычную причину сомневаться в новом уровне. Вы не делаете ставку на характер другого чекпоинта, его поведение при отказах или его особенности форматирования. Вы делаете ставку на то, что те же веса, запущенные через более агрессивную конфигурацию обслуживания, будут вести себя так же на ваших промптах. Если это подтвердится, переключение между двумя уровнями — это изменение конфигурации, а не миграция.
То, что находится внутри этой конфигурации обслуживания, не было задокументировано для этого поколения. Предыдущий уровень UltraSpeed, построенный на контрольной точке MiMo-V2.5-Pro в июне 2026 года, был описан Xiaomi как использующий FP4-квантование только на экспертных слоях, схему блочно-параллельного спекулятивного декодирования под названием DFlash и среду выполнения под названием TileRT, и он работал на одном узле с восемью GPU. Xiaomi не опубликовала аналогичные подробности для уровня V2.6. Рассматривайте предыдущий стек как контекст того, как достигается скорость, а не как описание того, что работает сейчас.
Линейка, в которую он входит, коротка. Рядом с двумя уровнями Pro находится MiMo-V2.6-Flash — меньший собрат с 309 млрд общих параметров и 15 млрд активных. Pro — это флагман на основе разреженной смеси экспертов: Artificial Analysis указывает для него 1,0 трлн общих параметров при 42 млрд активных на токен, контекстное окно в 1 млн токенов и лицензию MIT с весами на Hugging Face. Именно эти числа стоит запомнить, потому что на них держится всё сравнение.
Что на самом деле проверено, а что нет

Асимметрия между двумя столбцами выше — самое важное в этой статье. Почти всё измеримое в этой паре было измерено на медленной стороне.
Artificial Analysis провела бенчмаркинг MiMo-V2.6-Pro и публикует для него Intelligence Index, равный 46, — лучший результат в классе из 114 моделей, к которому она относит эту модель. Он измеряет 134,3 выходных токена в секунду через API Xiaomi по сравнению с медианой по классу 77,9, а также время до первого чанка 2,15 секунды по сравнению с медианой 2,34. Он указывает стоимость одной задачи Intelligence Index на уровне $0,13, 99%-ную скидку на кэш для входной цены и объём вывода в 140 миллионов токенов. Это независимые показатели для названной конфигурации, и они представляют собой единственный надёжный ориентир по пропускной способности, имеющийся у этого сравнения.
Для UltraSpeed проверенный список намного короче:
• Скорость вывода — примерно в десять раз выше, чем у стандартного уровня, как заявляет Xiaomi, и это повторяют платформы, которые его предлагают. Ни одна третья сторона не публиковала измерений скорости в токенах в секунду для этого конкретного уровня.
• Цена — $4,35 за миллион входных токенов и $8,70 за миллион выходных токенов; в обоих случаях это десятикратный размер стандартного тарифа. Уровень кэширования рядом с этими двумя тарифами не указан.
• Качество — «соответствует оригиналу», и снова это заявление вендора. Независимой оценки эндпоинта UltraSpeed не публиковалось, поэтому утверждение о неизменности качества не проверено, а не опровергнуто.
• Контекст и модальность — 1 048 576 токенов, а также нативный ввод текста, изображений, видео и аудио, унаследованный от базового чекпоинта.
Есть также вендорный бенчмарк, который стоит упомянуть именно из-за того, как он разошёлся. Публичный дашборд Xiaomi по обучению с подкреплением, на котором в сентябре 2026 года транслировались прогоны постобучения V2.6, сообщает о результатах DeepSWE v1.1: 72,57 для прогона Pro и 65,68 для Flash. Эти цифры получены в ходе собственной офлайн-оценки Xiaomi с использованием стенда mini-swe-agent при усреднении по трём; они никогда не отправлялись в публичный лидерборд и не были воспроизведены за пределами лаборатории. Если вы видели, как 72,57 цитируют как результат из лидерборда, это вендорное число, надевшее одежды лидерборда.

Прецедент: в прошлый раз Xiaomi взимала втрое, а не вдесятеро.
Это не первый скоростной уровень Xiaomi, и предыдущий — самое полезное сравнение во всей этой истории, потому что множитель изменился.
MiMo-V2.5-Pro-UltraSpeed появился в июне 2026 года, был создан на основе чекпойнта V2.5-Pro, а цена за вывод была примерно втрое выше, чем у стандартной модели. Рекламный тезис Xiaomi тогда был тем же, что и сейчас: скорость вывода примерно в десять раз выше. Публикации того времени сообщали об устойчивой пропускной способности около 1 000 токенов в секунду с пиками около 1 200 на одном узле с восемью GPU, хотя на самой странице модели указывался более широкий диапазон — от 500 до 1 000, — и ничего из этого не было независимо подтверждено. Доступ предоставлялся через форму заявки, а не через открытую регистрацию.
Поставьте эти два показателя рядом — и всё дело в сдвиге. Множитель скорости остался на уровне примерно десяти. Множитель цены вырос с трёх до десяти. Это совсем другие условия для одного и того же по сути улучшения, и Xiaomi не опубликовала объяснения этого изменения. Оно может отражать действительно более дорогое обслуживание — более крупный чекпоинт, более агрессивную конфигурацию декодирования или более ограниченную мощность на старте. Оно может отражать цену стартового окна для уровня, который доступен всего один день. Чего пока нет, так это публичного обоснования, которое можно проверить.
Об одном практическом отличии стоит упомянуть всем, кто пользовался уровнем V2.5: это было пробное тестирование с доступом по заявке. Уровень V2.6 указан как общедоступный через собственный API Xiaomi и несколько сторонних платформ, по опубликованным тарифам, без этапа подачи заявки. Что бы ещё ни изменилось, порог для того, чтобы его попробовать, снизился.
Чего стоит десятикратный прирост на реальной рабочей нагрузке
Проценты скрывают форму этого, поэтому вот арифметика на конкретном запуске агента — таком, который за время своего существования читает 20 миллионов входных токенов и выдаёт 2 миллиона выходных токенов. Это тяжёлая, но не экзотическая агентная нагрузка, та, где модель зацикливается на вызовах инструментов и перечитывает собственный контекст.
• Стандартный тариф, ввод — 20 млн токенов по $0.435 за миллион: $8.70.
• Стандартный тариф, вывод — 2 млн токенов по $0,87 за миллион: $1,74.
• Стандартный тариф, итого — $10.44 за запуск.
• Уровень UltraSpeed, ввод — 20 млн токенов по $4,35 за миллион: $87,00.
• Уровень UltraSpeed, выход — 2 млн токенов по $8.70 за миллион: $17.40.
• Уровень UltraSpeed, итого — $104.40 за запуск.
Разница составляет $93,96, и это ровно в десять раз больше всего счёта, а не в десять раз больше одной его строки, потому что оба тарифа масштабируются вместе. Теперь другая сторона бухгалтерской книги. При скорости 134,3 выходных токена в секунду, которую Artificial Analysis измеряет для стандартного уровня, генерация 2 миллионов выходных токенов занимает чуть больше четырёх часов чистого времени генерации. При десятикратной скорости это занимает около двадцати пяти минут. Так что дополнительные $94 возвращают где-то около трёх с половиной часов реального времени в этом запуске — примерно $27 за каждый сэкономленный час, если можно так выразиться.
Хорош ли этот обмен, полностью зависит от того, сколько для вас стоит реальное время, и есть один нюанс, который противоречит наивному прочтению. На странице Artificial Analysis цена входных данных в стандартном тарифе включает 99%-ную скидку за кэширование, а значит, половина счёта за входные данные может упасть почти до нуля при рабочих нагрузках, которые повторно читают один и тот же контекст. В карточке UltraSpeed показаны только два основных тарифа, и нет тарифа с кэшированием. Если ваша нагрузка активно использует кэш, эффективная кратность не равна десяти — она намного хуже, потому что вы теряете скидку на той стороне, где платили почти ничего. Если ваша нагрузка ориентирована на вывод и почти не использует кэш, десятикратное значение близко к реальной цифре. Прежде чем доверять любой из этих цифр, измерьте собственный профиль.
Асимметрия открытых весов
Между двумя уровнями есть структурное различие, не имеющее ничего общего с ценой или скоростью, и оно может оказаться важнее и того, и другого.
MiMo-V2.6-Pro распространяется под лицензией MIT, а его веса опубликованы на Hugging Face. Это допускает коммерческое развёртывание, модификацию и дальнейшее обучение, а также означает, что у стандартной модели есть нижняя граница цены, которую ни один вендор не может поднять: если цена хостинга перестанет быть оправданной, вы можете развернуть контрольную точку самостоятельно. Вы не достигнете пропускной способности Xiaomi на собственном оборудовании и заплатите за GPU, но такая возможность существует, и она ограничивает то, сколько может взимать хостинговый тариф.
У UltraSpeed такого нижнего предела нет. У UltraSpeed нет собственных весов, потому что этот уровень — это стек обслуживания, а не модель: чекпойнт — тот же, что уже находится в открытом доступе, и вы арендуете способность Xiaomi запускать его быстро. Это законно продавать, и по форме это совпадает с любым другим скоростным тарифом на рынке. Правда, из этого следует, что у десятикратной ставки нет конкурентного ограничения, кроме других провайдеров, запускающих те же открытые веса, и нет запасного выхода в виде собственного хостинга, если цена снова изменится.

Сопоставьте это с картиной доступности. Стандартный чекпоинт доступен через собственные каналы Xiaomi и несколько сторонних платформ, а также его можно скачать. Уровень UltraSpeed доступен через собственный API Xiaomi и несколько сторонних платформ, и это единственный способ его получить. Для тех, кто оценивает долгосрочную зависимость, эту разницу в опциональности стоит учитывать наряду со ставкой за токен.
Кто что должен взять?
Решение четко разделяется в зависимости от того, какую часть ваших затрат составляют выходные токены и какую часть вашего бюджета задержки занимает генерация, а не ожидание в очереди.
• Используйте UltraSpeed, когда рабочая нагрузка предполагает большой объём вывода, малое использование кэша и интерактивность — длинная генерация, циклы агента, в которых модель выдаёт много рассуждений между вызовами инструментов, или любые другие случаи, когда человек ждёт ответа на запрос.
• Выбирайте стандартный тариф, когда рабочая нагрузка сильно завязана на кэш, допускает пакетную обработку или чувствительна к маржинальным затратам — массовая классификация, ответы с дополненной выборкой по фиксированному корпусу, ночные оценочные прогоны, всё, где четырёхчасовая генерация приемлема, потому что никто не следит.
• Выбирайте стандартный тариф, если хотите иметь возможность развернуть решение у себя. Если ваши требования по соблюдению нормативных требований предполагают наличие весов, которые вы можете хранить у себя, UltraSpeed недоступен вам ни за какие деньги.
• Не выбирайте ни один, пока не проведёте измерения. Утверждение о десятикратном превосходстве — это главная цифра, на которой здесь всё держится, и на данный момент оно заявлено вендором. Всего один послеобеденный прогон ваших собственных промптов через оба уровня скажет вам больше, чем любые опубликованные цифры, потому что единственный показатель пропускной способности, который кто-либо независимо проверил, относится к медленной стороне сравнения.
Что касается последнего пункта, механика тестирования уровня обслуживания такая же, как и тестирования модели, и именно здесь слой маршрутизации заслуживает своё место. OrcaRouter предоставляет доступ более чем к 200 моделям через один API-ключ по прейскурантной цене провайдера с нулевой наценкой, передаваемой напрямую, поэтому изменение цены вендора отражается на вашей стороне в тот же день, а не при следующем продлении контракта. Автоматическое переключение при сбое означает, что уровень, который вы всё ещё оцениваете, никогда не окажется на продакшен-пути сам по себе, а DSL маршрутизации позволяет отправлять один класс запросов на быстрый эндпоинт, а всё остальное — на стандартный, без поддержки двух интеграций. Ничто из этого не требует именно моделей Xiaomi — суть в том, что решения, касающиеся уровней, подобные этому, легко откатить, когда уровни находятся за одним ключом.
Что могло бы это уладить?
Честная картина в вопросе MiMo-V2.6-Pro-UltraSpeed против MiMo-V2.6-Pro такова: половина здесь измерена, а половина — лишь заявлена. У стандартного уровня есть независимый Intelligence Index, независимый показатель пропускной способности и опубликованные открытые веса. У быстрого уровня есть цена, контекстное окно и обещание вендора, что это та же модель, только быстрее.
Три вещи закрыли бы этот разрыв. Независимое измерение пропускной способности на эндпоинте UltraSpeed — Artificial Analysis измеряла стандартный тариф через API Xiaomi, так что такой же подход возможен, и этого просто ещё не произошло. Политика кеширования для быстрого тарифа, поскольку её отсутствие как раз и превращает десятикратный счёт во что-то худшее при кеше-интенсивной работе. И любые опубликованные детали о стеке обслуживания V2.6 — так же, как Xiaomi документировала FP4-экспертов, DFlash и TileRT для поколения V2.5.
А до тех пор десятикратная цена реальна, а десятикратная скорость — всего лишь заявление. Если ваша рабочая нагрузка связана с большим объёмом вывода и кто-то ждёт, это заявление стоит проверить на собственных промптах — и стоит проверить через слой, который позволит переключиться обратно в тот же день, если оно не подтвердится.
