
MiniMax M3 против Muse Spark 1.2: четырёхкратный разрыв в цене на фоне полной победы в бенчмарках
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 стоит $0.30 за миллион входных токенов в нашем каталоге. Muse Spark 1.2 стоит $1.25. Это разрыв в 4,2 раза на входе и в 3,5 раза на выходе, и это самый полезный факт об этой паре, потому что на тех же страницах каталога Muse Spark 1.2 опережает MiniMax M3 по каждой строке бенчмарков, которую эти две модели разделяют. Одна — дешёвый вариант с открытыми весами, с гарантированным вендором 512K полезного контекста и потолком вывода 512K. Другая — чекпойнт рассуждений от Meta, который теперь на одно поколение отстаёт от собственного семейства и всё ещё превосходит его почти везде. Остальная часть этой страницы о том, какой из этих двух фактов на самом деле определяет рабочую нагрузку, — и ответ не одинаков для каждой рабочей нагрузки.
Что на самом деле представляет собой каждая из этих моделей
Оба вышли в этом году, и ни один из них не нов. Это важно, потому что страница сравнения, написанная так, будто один из них только выходит, устареет уже через месяц.

MiniMax M3 — это собственный релиз MiniMax, анонсированный в блоге вендора 1 июня 2026 года под заголовком «MiniMax M3: передовой кодинг, контекст 1M, нативная мультимодальность — всё в одной модели». Пост начинается прямо: «MiniMax M3 официально выпущен сегодня». Три заявления MiniMax о нём: он достигает передового уровня производительности в кодинге и агентной работе, использует MSA (MiniMax Sparse Attention) — новую архитектуру внимания, предложенную компанией, и является нативно мультимодальным — принимает изображения и видео на вход и, по словам MiniMax, «может управлять настольным компьютером». MiniMax добавляет, что эти три возможности являются обязательными для закрытых фронтирных моделей, и что M3 — «первая и единственная открытая по весам модель, объединяющая все три». В нашем каталоге модель указана как доступная с 31 мая 2026 года, на день раньше даты в блоге.
Muse Spark 1.2 принадлежит Meta. В нашем каталоге он датирован 2026-08-05. Это не новый уровень — это обновлённый чекпоинт по сравнению с Muse Spark 1.1 с чуть более высокой производительностью, предоставляемый на том же уровне Standard по той же цене, что делает его обновлением, не требующим изменений, а не отдельным продуктом. Его отличительная особенность — это входные данные: текст, изображения, видео, аудио и PDF. Выходные данные — текст.
Одну часть контекста стоит привести здесь, а не прятать её на потом. Meta перевела семейство Muse Spark на чекпойнт 1.3 2 сентября 2026 года, из-за чего 1.2 стало предыдущим поколением в его собственной линейке. Это произошло три недели назад, так что это не новость, и эта страница не преподносит это как новость — но тем, кто сегодня выбирает между этими двумя, стоит знать, что они сравнивают актуальную модель MiniMax с устаревшей моделью Meta.
Цена за миллион токенов и во сколько на самом деле обходится рабочая нагрузка

Опубликованные тарифы, взятые со страницы каждой модели в нашем собственном каталоге, где цена провайдера из прайс-листа указывается без добавления наценки:
• Ввод — MiniMax M3 $0.30 за 1 млн токенов против Muse Spark 1.2 $1.25 за 1 млн токенов
• Вывод — MiniMax M3 $1,20 за 1 млн против Muse Spark 1.2 $4,25 за 1 млн
• Чтение кэша — MiniMax M3 $0.060 за 1 млн против Muse Spark 1.2 $0.150 за 1 млн
• Соотношение — Muse Spark 1.2: 4,2x на входе, 3,5x на выходе, 2,5x при чтении из кэша
Эти абстрактные соотношения становятся конкретными в калькуляторе стоимости на каждой странице. Задайте оба значения в 10 миллионов токенов в месяц при доле входных данных 70% — разумная конфигурация для задачи суммирования или извлечения, и именно с такими настройками по умолчанию поставляется оценщик, — и MiniMax M3 обойдётся в $5.70 в месяц. Muse Spark 1.2 обойдётся в $11.30 в месяц. Включите кеширование промптов, и та же нагрузка обойдётся примерно в $4.86 против примерно $9.63. Калькулятор помечает оба значения как оценки на основе прайс-листа, и это правильная оговорка: реальное количество токенов зависит от токенизатора провайдера.
Для дешёвой нагрузки эта разница — цена чашки кофе. Важна форма кривой, а не абсолютное значение: нагрузка в сто миллионов токенов с преобладанием вывода в месяц переходит от трёхзначных сумм к четырёхзначным только на стороне Muse Spark. Если стоимость — то ограничение, из-за которого вы обратили внимание на это сочетание, именно это число и стоит смоделировать на собственном трафике.
Поскольку мы передаём прейскурантную цену провайдера напрямую без наценки, снижение цены поставщиком отражается на нашей стороне в тот же день, когда о нём объявляют, а обе эти модели маршрутизируются сюда — один ключ покрывает обе, поэтому для сопоставления их цен не требуется второй договор или изменение кода.
Контекстное окно и что в него реально помещается
Это тот раздел, где оба выглядят наиболее похоже на бумаге и наименее похоже в использовании.
• Контекстное окно — 1 048 576 токенов у MiniMax M3 против 1 048 576 токенов у Muse Spark 1.2
• Максимальный вывод — MiniMax M3 512 000 токенов против Muse Spark 1.2 131 072 токена
• Поддерживаемые входные данные — MiniMax M3: текст, изображения и видео против Muse Spark 1.2: текст, изображения, видео, аудио и PDF
• Поверхность вывода — оба выводят только текст
• Структурированные параметры — MiniMax M3 предоставляет tools и tool_choice; Muse Spark 1.2 предоставляет reasoning_effort и structured_outputs
У обоих окон одинаковый объём — миллион токенов, так что у вопроса «у кого больше контекста» нет победителя. Строка максимального объёма вывода — именно здесь они расходятся: ответ MiniMax M3 может достигать 512 000 токенов, что примерно в четыре раза больше верхнего предела Muse Spark 1.2 в 131 072. Если ваша работа — генерация длинных текстов: полная перезапись файла, длинный отчёт, вывод масштаба транскрипта, — это различие структурное, а не постепенное. Если ваша работа — короткие ответы при длинном входе, оно не имеет значения.
Строка о поддерживаемых входных данных играет в обратную сторону. Muse Spark 1.2 напрямую принимает аудио и PDF; задокументированный набор входных данных MiniMax M3 ограничивается изображениями и видео. Конвейеру, который обрабатывает записи звонков или отсканированные документы, придётся выполнять разный объём предварительной обработки для каждого из этих двух вариантов.
На стороне MiniMax заявление о контексте сопровождается замечанием об архитектуре, которое стоит чётко обозначить как принадлежащее самому вендору. MiniMax связывает поведение M3 на длинном контексте с MSA (MiniMax Sparse Attention), которую наш каталог описывает как поддерживающую контекст до 1 млн токенов «с гарантированным минимумом 512K». Формулировка о гарантированном минимуме принадлежит MiniMax; независимых измерений, на которые мы могли бы сослаться, нет, поэтому относитесь к порогу 512K как к заявлению вендора, а не к проверенной цифре.
Задержка и пропускная способность на нашем собственном шлюзе
Это показатели, о которых мы можем говорить наиболее непосредственно, потому что это наши собственные цифры. Они охватывают семь дней по 23 сентября 2026 года и описывают трафик на нашем шлюзе, а не бенчмарк производителя.
• p50 времени до первого токена — MiniMax M3: 4,28 с против Muse Spark 1.2: 4,82 с
• p95 времени до первого токена — MiniMax M3 10,00 с против Muse Spark 1.2 10,00 с
• Скорость вывода — MiniMax M3 289 ток/с против Muse Spark 1.2 507 ток/с
• Уровень ошибок — MiniMax M3 0,12% против Muse Spark 1.2 0,15%
• Трафик за последние 7 дней — MiniMax M3 153,8 млн токенов против Muse Spark 1.2 79,6 млн токенов
Если читать это честно, картина получается противоречивой. По времени до первого токена они близки — 4,28 против 4,82 секунды по медиане, а p95 совпадает до сотой при 10,00 секунды, что является артефактом округления из-за того, что оба находятся вблизи одного и того же потолка, а не настоящим равенством. А вот по скорости вывода они совсем не близки: Muse Spark 1.2 выдаёт поток примерно в 1,75 раза быстрее, чем MiniMax M3, и это меняет ощущение от длинной генерации для пользователя, который за ней наблюдает, даже если общая стоимость выше. Частоты ошибок различаются в пределах погрешности округления, и обе низкие.
На строку трафика стоит смотреть как на сигнал, а не как на табло: за те же семь дней MiniMax M3 обработал примерно вдвое больше токенов, чем Muse Spark 1.2 на нашем шлюзе. Это то, что выбирает рынок, а не то, что говорят бенчмарки, и в этой паре они расходятся.
Маршрутизация обоих через одну конечную точку — это также дешёвый способ выяснить, какой из них предпочитает ваша рабочая нагрузка, потому что отказоустойчивость означает, что деградация на стороне провайдера у любой из моделей переключается на рабочий путь, а не приводит к ошибке.
Вызов инструментов и длинногоризонтная агентная работа
Именно здесь эти два сильнее всего расходятся по измеренным результатам, и именно здесь оговорки имеют наибольшее значение.
• Terminal-Bench v2.1 — MiniMax M3 52.4 против Muse Spark 1.2 80.1
• tau_banking (использование инструментов) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74,2 (по данным производителя) против Muse Spark 1.2 — не измерено
• BrowseComp — MiniMax M3 83,5 (по данным производителя) против Muse Spark 1.2 — не измерялось
• OSWorld-Verified — MiniMax M3 70,0 (по данным производителя) против Muse Spark 1.2 — не измерялось
Первые две строки взяты из панели бенчмарков на страницах нашего собственного каталога, и это единственные агентные строки, заполненные обеими моделями. Разрыв между ними совсем не мал: Muse Spark 1.2 более чем вдвое превосходит MiniMax M3 по tau_banking и лидирует в Terminal-Bench v2.1 с отрывом почти в 28 пунктов. Если ваша рабочая нагрузка — это агент с длинным горизонтом и инструментальной поверхностью, это крупнейший единичный разрыв на этой странице.
Следующие три строки — это собственные цифры MiniMax, опубликованные в анонсе запуска. Они несопоставимы с первыми двумя — другие тестовые стенды, независимый аудит отсутствует — но это единственные опубликованные показатели для MiniMax M3 по этим задачам, поэтому их исключение занизило бы возможности модели. Считайте их данными, заявленными производителем, и не более.
Одно расхождение заслуживает отдельного абзаца, потому что это как раз то, что страница сравнения обычно сглаживает. В анонсе MiniMax Terminal-Bench 2.1 указан как 66.0 для M3, внутри изображения с графиком и без сопроводительной числовой таблицы. Независимая строка Terminal-Bench v2.1 на странице нашего каталога показывает 52.4 для той же модели. Названия задач достаточно близки, чтобы читатели встретили их рядом, и два показателя различаются более чем на 13 пунктов. Мы не собираемся объявлять один из них неверным: вероятное объяснение — другой тестовый стенд или другая конфигурация запуска, и честная формулировка такова: собственное число вендора и проверенное число не совпадают, причём у вендора оно выше.
Списки параметров рассказывают более скромную и более практичную историю. MiniMax M3 предоставляет tools и tool_choice, поэтому выбор инструмента можно направлять из запроса. Muse Spark 1.2 предоставляет reasoning_effort, поэтому вместо этого можно управлять глубиной рассуждений. Ни один из них не предоставляет регулятор другого. Если задача управления в вашем приложении — «заставить его вызвать нужную функцию», это указывает в одну сторону; если «заставить его дольше думать над сложными случаями» — в другую.
Программирование
Программирование — главное обещание MiniMax M3 и та область, где измеренный разрыв наиболее неудобен для неё.
• AA Coding Index — MiniMax M3 38,7 против Muse Spark 1.2 72,2
• SciCode — MiniMax M3 43,1 против Muse Spark 1.2 57,4
• SWE-Bench Pro — MiniMax M3 59.0 (по данным производителя) против Muse Spark 1.2 — не измерено
• KernelBench Hard — MiniMax M3 28,8 (по данным производителя) против Muse Spark 1.2 — не измерялось
Позиционирование M3 от MiniMax ориентировано в первую очередь на программирование — в заголовке запуска «Frontier Coding» стоит впереди контекста на миллион токенов и мультимодальности. Его собственный заявленный показатель SWE-Bench Pro в 59,0 — сильная цифра на тестовом стенде вендора. Однако в строках независимых Coding Index и SciCode, которые заполнили обе модели, Muse Spark 1.2 лидирует с большим отрывом, а разрыв в Coding Index в 33 пункта — второй по величине на этой странице после tau_banking.
Нет честного способа представить MiniMax M3 как лучшую модель для программирования на основе имеющихся данных. Можно лишь сказать, что собственные показатели поставщика по программированию высоки, а независимые — нет, в той же закономерности, что и расхождение по Terminal-Bench выше. Тот, чьё решение зависит от программирования, должен придавать проверенным строкам больший вес, чем графикам из анонса, и тестировать на собственном репозитории, а не на чём-либо из них.
Там, где они действительно близки
Три строки не позволяют определить победителя, и сказать об этом полезнее, чем сфабриковать его.
• GPQA Diamond — MiniMax M3 89,9 против Muse Spark 1.2 90,4: разрыв в 0,5 балла, который для любых практических целей является ничьей.
• p95 времени до первого токена — оба по 10,00 с за последние семь дней на нашем шлюзе
• Окно контекста и модальность вывода — идентичны: 1 048 576 входных токенов и вывод только в текстовом виде
В научных рассуждениях уровня магистратуры эти две модели практически неразличимы, и это единственная строка рассуждений, где гораздо более дешёвая модель MiniMax M3 не уступает более дорогой. Стоит помнить, читая агрегированные показатели: разрыв между этими моделями неодинаков по разным способностям — он сосредоточен в агентной работе и программировании, а в вопросах с множественным выбором, требующих больших знаний, он практически равен нулю.

Выберите MiniMax M3, если, выберите Muse Spark 1.2, если
Два факта из вступительного абзаца разрешаются по-разному в зависимости от того, что вы создаёте, поэтому вот разграничение без оговорок.
• Выбирайте MiniMax M3, если стоимость за токен — жёсткое ограничение; если вам нужен вывод в виде длинных текстов объёмом свыше 131 072 токенов; если вам нужны открытые веса; если вы хотите подавать видео без отдельного пайплайна; или если вам нужна работа со знаниями, требующая интенсивных рассуждений, примерно за четверть входной цены — GPQA Diamond идёт вровень, и именно в этой строке дешёвая модель заслуживает своё место.
• Выбирайте Muse Spark 1.2, если ваша нагрузка — это долгосрочный агент с инструментами, если вам нужны самые высокие проверенные оценки по программированию, если вы хотите явную настройку reasoning_effort, если вам нужно напрямую обрабатывать аудио или PDF или если вам нужен быстрый потоковый вывод — 507 ток/с против 289 ток/с — это заметная разница, а не разница в бенчмарках.
• Если вы ещё не знаете, какую именно выбрать, решающие доказательства не на этой странице. Проверьте обе модели на выборке вашего собственного трафика и измерьте результат; калькулятор цен на странице каждой модели за минуту покажет вам сторону затрат, а приведённые выше семидневные показатели задержки — это самое близкое к предварительному обзору производительности.
Оба работают через один API без наценки к прайсовой цене провайдера, поэтому пробный переход — это смена model-id, а не миграция, и автоматическое переключение при сбое означает, что неудачный день у любого из провайдеров обернётся более медленным ответом, а не отказом в обслуживании.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
