Карточка заголовка hero для сравнения MiniMax M3 и Muse Spark 1.2, подзаголовок 'Цена за токен, контекст, пропускная способность и где расходятся бенчмарки', с двумя абстрактными скруглёнными карточками, обращёнными друг к другу через тонкий вертикальный разделитель, левая карточка с синим акцентом, а правая — с голубым, и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

MiniMax M3 против Muse Spark 1.2: четырёхкратный разрыв в цене на фоне полной победы в бенчмарках

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

MiniMax M3 стоит $0.30 за миллион входных токенов в нашем каталоге. Muse Spark 1.2 стоит $1.25. Это разрыв в 4,2 раза на входе и в 3,5 раза на выходе, и это самый полезный факт об этой паре, потому что на тех же страницах каталога Muse Spark 1.2 опережает MiniMax M3 по каждой строке бенчмарков, которую эти две модели разделяют. Одна — дешёвый вариант с открытыми весами, с гарантированным вендором 512K полезного контекста и потолком вывода 512K. Другая — чекпойнт рассуждений от Meta, который теперь на одно поколение отстаёт от собственного семейства и всё ещё превосходит его почти везде. Остальная часть этой страницы о том, какой из этих двух фактов на самом деле определяет рабочую нагрузку, — и ответ не одинаков для каждой рабочей нагрузки.

Что на самом деле представляет собой каждая из этих моделей

Оба вышли в этом году, и ни один из них не нов. Это важно, потому что страница сравнения, написанная так, будто один из них только выходит, устареет уже через месяц.

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 — это собственный релиз MiniMax, анонсированный в блоге вендора 1 июня 2026 года под заголовком «MiniMax M3: передовой кодинг, контекст 1M, нативная мультимодальность — всё в одной модели». Пост начинается прямо: «MiniMax M3 официально выпущен сегодня». Три заявления MiniMax о нём: он достигает передового уровня производительности в кодинге и агентной работе, использует MSA (MiniMax Sparse Attention) — новую архитектуру внимания, предложенную компанией, и является нативно мультимодальным — принимает изображения и видео на вход и, по словам MiniMax, «может управлять настольным компьютером». MiniMax добавляет, что эти три возможности являются обязательными для закрытых фронтирных моделей, и что M3 — «первая и единственная открытая по весам модель, объединяющая все три». В нашем каталоге модель указана как доступная с 31 мая 2026 года, на день раньше даты в блоге.

Muse Spark 1.2 принадлежит Meta. В нашем каталоге он датирован 2026-08-05. Это не новый уровень — это обновлённый чекпоинт по сравнению с Muse Spark 1.1 с чуть более высокой производительностью, предоставляемый на том же уровне Standard по той же цене, что делает его обновлением, не требующим изменений, а не отдельным продуктом. Его отличительная особенность — это входные данные: текст, изображения, видео, аудио и PDF. Выходные данные — текст.

Одну часть контекста стоит привести здесь, а не прятать её на потом. Meta перевела семейство Muse Spark на чекпойнт 1.3 2 сентября 2026 года, из-за чего 1.2 стало предыдущим поколением в его собственной линейке. Это произошло три недели назад, так что это не новость, и эта страница не преподносит это как новость — но тем, кто сегодня выбирает между этими двумя, стоит знать, что они сравнивают актуальную модель MiniMax с устаревшей моделью Meta.

Цена за миллион токенов и во сколько на самом деле обходится рабочая нагрузка

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

Опубликованные тарифы, взятые со страницы каждой модели в нашем собственном каталоге, где цена провайдера из прайс-листа указывается без добавления наценки:

• Ввод — MiniMax M3 $0.30 за 1 млн токенов против Muse Spark 1.2 $1.25 за 1 млн токенов

• Вывод — MiniMax M3 $1,20 за 1 млн против Muse Spark 1.2 $4,25 за 1 млн

• Чтение кэша — MiniMax M3 $0.060 за 1 млн против Muse Spark 1.2 $0.150 за 1 млн

• Соотношение — Muse Spark 1.2: 4,2x на входе, 3,5x на выходе, 2,5x при чтении из кэша

Эти абстрактные соотношения становятся конкретными в калькуляторе стоимости на каждой странице. Задайте оба значения в 10 миллионов токенов в месяц при доле входных данных 70% — разумная конфигурация для задачи суммирования или извлечения, и именно с такими настройками по умолчанию поставляется оценщик, — и MiniMax M3 обойдётся в $5.70 в месяц. Muse Spark 1.2 обойдётся в $11.30 в месяц. Включите кеширование промптов, и та же нагрузка обойдётся примерно в $4.86 против примерно $9.63. Калькулятор помечает оба значения как оценки на основе прайс-листа, и это правильная оговорка: реальное количество токенов зависит от токенизатора провайдера.

Для дешёвой нагрузки эта разница — цена чашки кофе. Важна форма кривой, а не абсолютное значение: нагрузка в сто миллионов токенов с преобладанием вывода в месяц переходит от трёхзначных сумм к четырёхзначным только на стороне Muse Spark. Если стоимость — то ограничение, из-за которого вы обратили внимание на это сочетание, именно это число и стоит смоделировать на собственном трафике.

Поскольку мы передаём прейскурантную цену провайдера напрямую без наценки, снижение цены поставщиком отражается на нашей стороне в тот же день, когда о нём объявляют, а обе эти модели маршрутизируются сюда — один ключ покрывает обе, поэтому для сопоставления их цен не требуется второй договор или изменение кода.

Контекстное окно и что в него реально помещается

Это тот раздел, где оба выглядят наиболее похоже на бумаге и наименее похоже в использовании.

• Контекстное окно — 1 048 576 токенов у MiniMax M3 против 1 048 576 токенов у Muse Spark 1.2

• Максимальный вывод — MiniMax M3 512 000 токенов против Muse Spark 1.2 131 072 токена

• Поддерживаемые входные данные — MiniMax M3: текст, изображения и видео против Muse Spark 1.2: текст, изображения, видео, аудио и PDF

• Поверхность вывода — оба выводят только текст

• Структурированные параметры — MiniMax M3 предоставляет tools и tool_choice; Muse Spark 1.2 предоставляет reasoning_effort и structured_outputs

У обоих окон одинаковый объём — миллион токенов, так что у вопроса «у кого больше контекста» нет победителя. Строка максимального объёма вывода — именно здесь они расходятся: ответ MiniMax M3 может достигать 512 000 токенов, что примерно в четыре раза больше верхнего предела Muse Spark 1.2 в 131 072. Если ваша работа — генерация длинных текстов: полная перезапись файла, длинный отчёт, вывод масштаба транскрипта, — это различие структурное, а не постепенное. Если ваша работа — короткие ответы при длинном входе, оно не имеет значения.

Строка о поддерживаемых входных данных играет в обратную сторону. Muse Spark 1.2 напрямую принимает аудио и PDF; задокументированный набор входных данных MiniMax M3 ограничивается изображениями и видео. Конвейеру, который обрабатывает записи звонков или отсканированные документы, придётся выполнять разный объём предварительной обработки для каждого из этих двух вариантов.

На стороне MiniMax заявление о контексте сопровождается замечанием об архитектуре, которое стоит чётко обозначить как принадлежащее самому вендору. MiniMax связывает поведение M3 на длинном контексте с MSA (MiniMax Sparse Attention), которую наш каталог описывает как поддерживающую контекст до 1 млн токенов «с гарантированным минимумом 512K». Формулировка о гарантированном минимуме принадлежит MiniMax; независимых измерений, на которые мы могли бы сослаться, нет, поэтому относитесь к порогу 512K как к заявлению вендора, а не к проверенной цифре.

Задержка и пропускная способность на нашем собственном шлюзе

Это показатели, о которых мы можем говорить наиболее непосредственно, потому что это наши собственные цифры. Они охватывают семь дней по 23 сентября 2026 года и описывают трафик на нашем шлюзе, а не бенчмарк производителя.

• p50 времени до первого токена — MiniMax M3: 4,28 с против Muse Spark 1.2: 4,82 с

• p95 времени до первого токена — MiniMax M3 10,00 с против Muse Spark 1.2 10,00 с

• Скорость вывода — MiniMax M3 289 ток/с против Muse Spark 1.2 507 ток/с

• Уровень ошибок — MiniMax M3 0,12% против Muse Spark 1.2 0,15%

• Трафик за последние 7 дней — MiniMax M3 153,8 млн токенов против Muse Spark 1.2 79,6 млн токенов

Если читать это честно, картина получается противоречивой. По времени до первого токена они близки — 4,28 против 4,82 секунды по медиане, а p95 совпадает до сотой при 10,00 секунды, что является артефактом округления из-за того, что оба находятся вблизи одного и того же потолка, а не настоящим равенством. А вот по скорости вывода они совсем не близки: Muse Spark 1.2 выдаёт поток примерно в 1,75 раза быстрее, чем MiniMax M3, и это меняет ощущение от длинной генерации для пользователя, который за ней наблюдает, даже если общая стоимость выше. Частоты ошибок различаются в пределах погрешности округления, и обе низкие.

На строку трафика стоит смотреть как на сигнал, а не как на табло: за те же семь дней MiniMax M3 обработал примерно вдвое больше токенов, чем Muse Spark 1.2 на нашем шлюзе. Это то, что выбирает рынок, а не то, что говорят бенчмарки, и в этой паре они расходятся.

Маршрутизация обоих через одну конечную точку — это также дешёвый способ выяснить, какой из них предпочитает ваша рабочая нагрузка, потому что отказоустойчивость означает, что деградация на стороне провайдера у любой из моделей переключается на рабочий путь, а не приводит к ошибке.

Вызов инструментов и длинногоризонтная агентная работа

Именно здесь эти два сильнее всего расходятся по измеренным результатам, и именно здесь оговорки имеют наибольшее значение.

• Terminal-Bench v2.1 — MiniMax M3 52.4 против Muse Spark 1.2 80.1

• tau_banking (использование инструментов) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8

• MCP Atlas — MiniMax M3 74,2 (по данным производителя) против Muse Spark 1.2 — не измерено

• BrowseComp — MiniMax M3 83,5 (по данным производителя) против Muse Spark 1.2 — не измерялось

• OSWorld-Verified — MiniMax M3 70,0 (по данным производителя) против Muse Spark 1.2 — не измерялось

Первые две строки взяты из панели бенчмарков на страницах нашего собственного каталога, и это единственные агентные строки, заполненные обеими моделями. Разрыв между ними совсем не мал: Muse Spark 1.2 более чем вдвое превосходит MiniMax M3 по tau_banking и лидирует в Terminal-Bench v2.1 с отрывом почти в 28 пунктов. Если ваша рабочая нагрузка — это агент с длинным горизонтом и инструментальной поверхностью, это крупнейший единичный разрыв на этой странице.

Следующие три строки — это собственные цифры MiniMax, опубликованные в анонсе запуска. Они несопоставимы с первыми двумя — другие тестовые стенды, независимый аудит отсутствует — но это единственные опубликованные показатели для MiniMax M3 по этим задачам, поэтому их исключение занизило бы возможности модели. Считайте их данными, заявленными производителем, и не более.

Одно расхождение заслуживает отдельного абзаца, потому что это как раз то, что страница сравнения обычно сглаживает. В анонсе MiniMax Terminal-Bench 2.1 указан как 66.0 для M3, внутри изображения с графиком и без сопроводительной числовой таблицы. Независимая строка Terminal-Bench v2.1 на странице нашего каталога показывает 52.4 для той же модели. Названия задач достаточно близки, чтобы читатели встретили их рядом, и два показателя различаются более чем на 13 пунктов. Мы не собираемся объявлять один из них неверным: вероятное объяснение — другой тестовый стенд или другая конфигурация запуска, и честная формулировка такова: собственное число вендора и проверенное число не совпадают, причём у вендора оно выше.

Списки параметров рассказывают более скромную и более практичную историю. MiniMax M3 предоставляет tools и tool_choice, поэтому выбор инструмента можно направлять из запроса. Muse Spark 1.2 предоставляет reasoning_effort, поэтому вместо этого можно управлять глубиной рассуждений. Ни один из них не предоставляет регулятор другого. Если задача управления в вашем приложении — «заставить его вызвать нужную функцию», это указывает в одну сторону; если «заставить его дольше думать над сложными случаями» — в другую.

Программирование

Программирование — главное обещание MiniMax M3 и та область, где измеренный разрыв наиболее неудобен для неё.

• AA Coding Index — MiniMax M3 38,7 против Muse Spark 1.2 72,2

• SciCode — MiniMax M3 43,1 против Muse Spark 1.2 57,4

• SWE-Bench Pro — MiniMax M3 59.0 (по данным производителя) против Muse Spark 1.2 — не измерено

• KernelBench Hard — MiniMax M3 28,8 (по данным производителя) против Muse Spark 1.2 — не измерялось

Позиционирование M3 от MiniMax ориентировано в первую очередь на программирование — в заголовке запуска «Frontier Coding» стоит впереди контекста на миллион токенов и мультимодальности. Его собственный заявленный показатель SWE-Bench Pro в 59,0 — сильная цифра на тестовом стенде вендора. Однако в строках независимых Coding Index и SciCode, которые заполнили обе модели, Muse Spark 1.2 лидирует с большим отрывом, а разрыв в Coding Index в 33 пункта — второй по величине на этой странице после tau_banking.

Нет честного способа представить MiniMax M3 как лучшую модель для программирования на основе имеющихся данных. Можно лишь сказать, что собственные показатели поставщика по программированию высоки, а независимые — нет, в той же закономерности, что и расхождение по Terminal-Bench выше. Тот, чьё решение зависит от программирования, должен придавать проверенным строкам больший вес, чем графикам из анонса, и тестировать на собственном репозитории, а не на чём-либо из них.

Там, где они действительно близки

Три строки не позволяют определить победителя, и сказать об этом полезнее, чем сфабриковать его.

• GPQA Diamond — MiniMax M3 89,9 против Muse Spark 1.2 90,4: разрыв в 0,5 балла, который для любых практических целей является ничьей.

• p95 времени до первого токена — оба по 10,00 с за последние семь дней на нашем шлюзе

• Окно контекста и модальность вывода — идентичны: 1 048 576 входных токенов и вывод только в текстовом виде

В научных рассуждениях уровня магистратуры эти две модели практически неразличимы, и это единственная строка рассуждений, где гораздо более дешёвая модель MiniMax M3 не уступает более дорогой. Стоит помнить, читая агрегированные показатели: разрыв между этими моделями неодинаков по разным способностям — он сосредоточен в агентной работе и программировании, а в вопросах с множественным выбором, требующих больших знаний, он практически равен нулю.

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

Выберите MiniMax M3, если, выберите Muse Spark 1.2, если

Два факта из вступительного абзаца разрешаются по-разному в зависимости от того, что вы создаёте, поэтому вот разграничение без оговорок.

• Выбирайте MiniMax M3, если стоимость за токен — жёсткое ограничение; если вам нужен вывод в виде длинных текстов объёмом свыше 131 072 токенов; если вам нужны открытые веса; если вы хотите подавать видео без отдельного пайплайна; или если вам нужна работа со знаниями, требующая интенсивных рассуждений, примерно за четверть входной цены — GPQA Diamond идёт вровень, и именно в этой строке дешёвая модель заслуживает своё место.

• Выбирайте Muse Spark 1.2, если ваша нагрузка — это долгосрочный агент с инструментами, если вам нужны самые высокие проверенные оценки по программированию, если вы хотите явную настройку reasoning_effort, если вам нужно напрямую обрабатывать аудио или PDF или если вам нужен быстрый потоковый вывод — 507 ток/с против 289 ток/с — это заметная разница, а не разница в бенчмарках.

• Если вы ещё не знаете, какую именно выбрать, решающие доказательства не на этой странице. Проверьте обе модели на выборке вашего собственного трафика и измерьте результат; калькулятор цен на странице каждой модели за минуту покажет вам сторону затрат, а приведённые выше семидневные показатели задержки — это самое близкое к предварительному обзору производительности.

Оба работают через один API без наценки к прайсовой цене провайдера, поэтому пробный переход — это смена model-id, а не миграция, и автоматическое переключение при сбое означает, что неудачный день у любого из провайдеров обернётся более медленным ответом, а не отказом в обслуживании.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно