
MiniMax M3.1 Flash Preview против MiniMax M3: когда более новая модель — более рискованный выбор
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 468 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 192 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
В собственной документации поставщика MiniMax-M3.1-Flash-Preview теперь указана выше MiniMax-M3, и эта очерёдность во многом способствует убеждению. Это новейшая текстовая модель в линейке, у неё то же контекстное окно на миллион токенов, и она добавляет настройку глубины мышления, которой нет у старой модели. Чего таблица не показывает, так это того, что старая модель — единственная из двух, которую можно скачать, у которой можно рассчитать цену за токен, сравнить с чем угодно по бенчмаркам или вызвать без подписки, — и что новая лишила вас переключателя, который давала MiniMax-M3.
Это не история о том, что одна модель уступила место другой. Это история о том, как поставщик разделил собственную линейку на рабочую лошадку с оплатой по мере использования и предварительную версию, доступную только по подписке, — и эти две вещи не взаимозаменяемы ни в одну сторону, ни в другую. Вот что каждая из них на самом деле собой представляет.
Две спецификации, бок о бок
Начните с того, что собственные страницы вендора утверждают в отношении обоих, потому что характер различия проявляется здесь, а не в таблице бенчмарков.
• Анонсированы — MiniMax-M3 1 июня 2026 года вместе с описанием архитектуры, таблицей бенчмарков и тарифной сеткой; MiniMax-M3.1-Flash-Preview 27 сентября 2026 года с записью в документации и постом в аккаунте MiniMax для агентов • Контекстное окно — 1 000 000 токенов для обеих, согласно собственным таблицам моделей MiniMax • Максимальный вывод — 512 000 токенов для MiniMax-M3 в нашей карточке каталога, цифра, которую сама MiniMax не публикует; нигде не опубликована для MiniMax-M3.1-Flash-Preview • Входные модальности — текст, изображение и видео на входе, текст на выходе, для обеих • Управление мышлением — параметр мышления, который MiniMax-M3 можно указать пропустить и который можно выделить в reasoning_details поле через reasoning_split; на MiniMax-M3.1-Flash-Preview мышление обязательно, и reasoning_split нельзя отключить • Глубина мышления — недоступна на MiniMax-M3; лестница effort из low, medium, high, xhigh и max, по умолчанию max, на MiniMax-M3.1-Flash-Preview • Опубликованная скорость вывода — примерно 100+ токенов в секунду для MiniMax-M3, согласно собственной таблице модели MiniMax; ничего не опубликовано для MiniMax-M3.1-Flash-Preview • Веса — MiniMax-M3 имеет открытые веса и публичный репозиторий; у MiniMax-M3.1-Flash-Preview их нет • Цены — $0.30 за миллион входных токенов и $1.20 за миллион выходных для MiniMax-M3 по тарифу провайдера; для MiniMax-M3.1-Flash-Preview цена за токен отсутствует • Доступ — MiniMax-M3 по модели оплаты за использование и по Token Plan, а также с возможностью маршрутизации через сторонние платформы; MiniMax-M3.1-Flash-Preview только по Token Plan и в MiniMax Code
Две строки там относятся к другой категории, чем остальные. Опубликованная скорость вывода — это число от производителя только для старой модели, поэтому новую модель продают как быструю, не прикрепляя к ней цифру. А управление мышлением сместилось в направлении, противоположном маркетингу: новая модель даёт более тонкий контроль над тем, сколько она думает, но при этом лишает вас возможности вообще остановить её мышление.
Переключатель, который забрал MiniMax
Эта деталь, скорее всего, и вызовет проблемы, и она задокументирована, а не скрыта. В MiniMax-M3 отправка thinking: {"type": "disabled"} на эндпоинте, совместимом с OpenAI, пропускает размышления и возвращает прямой ответ; на эндпоинте, совместимом с Anthropic, размышления по умолчанию отключены, и их можно включить с помощью режима adaptive. В MiniMax-M3.1-Flash-Preview идентичный запрос возвращает HTTP 400 с сообщением требуется адаптивное мышление. Нет поддерживаемого способа получить ответ без размышлений.
На практике это означает, что рабочая нагрузка, в которой MiniMax-M3 использовался как дешёвый быстрый классификатор или маршрутизатор — короткий промпт на входе, короткий структурированный ответ на выходе, без цепочки рассуждений — не имеет пути обновления простой заменой на более новую модель. Можно понизить effort до low, и рекомендации MiniMax прямо указывают: понижение effort — это и есть предусмотренный способ сократить задержку и количество токенов на рассуждения, а не отключать их. Но токены и задержка не становятся нулевыми, и для задачи извлечения данных с большим объёмом, которая записывает четыре поля за вызов, «всегда сначала думает» — это другая структура затрат, чем «думает, когда попросят».

Что на самом деле измеряется на каждом
У одной стороны этого сравнения есть числа, а у другой — пустой столбец, и стоит точно указать, какие числа чьи.
Независимые результаты MiniMax-M3 реальны: Artificial Analysis присваивает ему 29,2 в Intelligence Index — 60-е место из 145 — при 58,6 в Coding Index, 59,18 в его Math index, 92,9% в GPQA Diamond в рамках того же семейства индексов, 83% на recall при длинном контексте и 82,9% в IFBench. Это сторонние оценки модели, которую любой может скачать и перезапустить. Собственные стартовые цифры MiniMax для M3 — BrowseComp на 83,5%, SWE-Bench Pro на 59,0%, Terminal-Bench 2.1 на 66,0%, MCP Atlas на 74,2%, OSWorld-Verified на 70% — это данные вендора, и мы не видели, чтобы их воспроизвели.
MiniMax-M3.1-Flash-Preview не имеет ни того, ни другого. MiniMax не опубликовала таблицу бенчмарков, и у модели нет записи в индексе Artificial Analysis, поэтому нет ни независимой оценки, ни индекса программирования, ни показателя recall на длинном контексте, ни измерения галлюцинаций. Все ходящие о ней характеристики — «быстрая», «надёжная», «создана для повседневной разработки» — это собственные прилагательные вендора из поста о запуске. Об этом отсутствии стоит сказать прямо, потому что оно работает в обе стороны: не было показано, что что-то хуже, и не было показано, что что-то лучше.
Эта асимметрия и есть всё решение. Вы можете оценить MiniMax-M3 уже сегодня во второй половине дня, скачав его или обратившись к нему, и сравнить эту оценку с публичной таблицей результатов. А с MiniMax-M3.1-Flash-Preview вы можете только пользоваться им и сформировать личное мнение.
Где более новая модель действительно выигрывает
Вышесказанное легко было бы воспринять как аргумент в пользу игнорирования новой модели, но и это не было бы правильным выводом. Три вещи реальны и присущи именно ей.
Лестница усилий — это настоящая возможность, а не переключатель. Пять уровней: от низкого до максимального — позволяют одной модели обслуживать и рутинное переименование, и рефакторинг всего репозитория при разных вычислительных затратах, и задокументировано, что это эффективно только для MiniMax-M3.1-Flash-Preview. На MiniMax-M3 ваш выбор бинарный. Если ваша проблема в том, что вы не можете предсказать задержку для каждой задачи, настраиваемая глубина — это ровно то управление, которое вам нужно.
Это текущая флагманская модель производителя, а значит, она наследует всё, чему линейка M-серии научилась с июня, и MiniMax прямо заявляет, что это новейшая модель для агентного рассуждения, использования инструментов, программирования и задач с длинным контекстом. Механизм использования инструментов с чередующимся мышлением, представленный в M3, сохраняется, включая требование добавлять полный ответ — вместе с блоками мышления и всем остальным — обратно в историю сообщений.
И он принимает видео — по цене уровня Flash и в рамках подписки. MiniMax-M3 тоже умеет, по цене за токен. Если вы уже платите за место в Token Plan и единственным препятствием для использования видеовхода была предельная стоимость каждого вызова, M3.1-Flash-Preview устраняет это препятствие.
Где более старая модель по-прежнему остаётся той, к которой стоит обратиться
Три случая, и все они о предсказуемости, а не о качестве.
Когда нужно смоделировать стоимость. У MiniMax-M3 есть тарифная сетка: $0.30 за миллион входных токенов, $1.20 за миллион выходных и ставка за чтение из кэша $0.06 за миллион по нашему каталогу. Вы можете оценить месячный счёт за рабочую нагрузку с точностью до цента ещё до её запуска. У MiniMax-M3.1-Flash-Preview нигде на страницах MiniMax нет ставки за токен, поэтому её стоимость — это ваша подписка, делённая на то, сколько вы ею пользуетесь: годится для фиксированного бюджета, бесполезно для юнит-экономики.
Когда вам нужно, чтобы модель оставалась именно той моделью. MiniMax-M3 — модель с открытыми весами: её можно скачать, запустить на собственном оборудовании и быть уверенным, что артефакт, отвечающий на ваши запросы через полгода, — тот же самый, что отвечает на них сегодня. У MiniMax-M3.1-Flash-Preview нет чекпоинта, а доступ уровня preview означает, что стек обслуживания, состав квот и доступность полностью контролируются вендором и явно могут быть изменены.
Когда нужен ответ без рассуждений. Как и выше, — это единственная регрессия возможностей в сравнении, и именно она удивляет людей, потому что более новая модель, не способная на то, что умела старая, — это не тот случай, к которому кто-либо готовится.

Вызов обоих из одного места
Неудобство здесь в том, что эти две модели покупаются по-разному — одна по счётчику, другая по подписке — и естественный инстинкт — выбрать одну сторону. Гораздо полезнее направлять запросы между ними в зависимости от типа задачи, но это работает только если к стороне со счётчиком можно добраться из того же места, что и ко всему остальному.
MiniMax-M3 на OrcaRouterпредлагается по прейскурантной цене MiniMax с наценкой 0%, так что $0.30 и $1.20 в тарифной карте — это и есть стоимость вызова, без платформенной маржи сверху. Он работает на том же OpenAI-совместимом эндпоинте, что и MiniMax M2.7 — тот же ценник $0.30/$1.20 при окне в 200 000 токенов, тоже с открытыми весами — и что и 200+ других моделей, за одним API-ключом, с автоматическим переключением при сбое между провайдерами, когда один эндпоинт начинает сбоить. По нашей собственной телеметрии, а это числа иного рода, чем у вендора: за последние семь дней M3 отвечал примерно на 238 выходных токенов в секунду при p50 около 4,1 секунды до первого токена и уровне ошибок около 0,15%, измеренных в песочнице OrcaRouter. Если вы хотите использовать MiniMax-M3 как надёжную половину пайплайна, а MiniMax-M3.1-Flash-Preview — как экспериментальную, то надёжная половина — это одна строка конфигурации, а не вторые отношения с вендором. Сам MiniMax-M3.1-Flash-Preview отсутствует в нашем каталоге; путь к нему — собственный Token Plan и кодинг-продукт вендора.
То, что изменило бы эту статью, конкретно и легко отслеживается. Опубликованный прайс-лист для MiniMax-M3.1-Flash-Preview свёл бы на нет главную экономическую причину предпочитать M3. Набор независимых оценок заменил бы пустой столбец чем-то сопоставимым. Скачиваемый чекпойнт устранил бы возражение о воспроизводимости. Пока не появится хотя бы что-то из этого, MiniMax-M3 остаётся той моделью из этой пары, которую можно призвать к ответу, — а более новая остаётся более быстрым, лучше контролируемым, неизмеренным превью, за которое MiniMax решила взимать плату помесячно, а не по токенам.

