Сгенерированная главная карточка с заголовком «Claude Sonnet 5.5 против MiniMax M3», подзаголовком «где модель в 15 раз дешевле показывает равный результат» и тремя карточками статистики: воспроизведение в длинном контексте — 82,7% против 83,0%, Terminal-Bench 4.0 — 63,6% против 2,0%, стоимость за задачу — $7,60 против $0,51, а внизу — подпись: «Все показатели согласно Artificial Analysis v4.3.2; характеристики MiniMax M3 — согласно MiniMax».
Guides & Insights

Claude Sonnet 5.5 против MiniMax M3: где модель, дешевле в 15 раз, на самом деле идёт вровень

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

В независимом рейтинге есть одна строка, где MiniMax M3 и Claude Sonnet 5.5 — это одна и та же модель, и это не та, о которой кто-либо догадался бы. В тесте на извлечение из длинного контекста MiniMax M3 набирает 83,0%, а Claude Sonnet 5.5 — 82,7%. MiniMax M3 стоит $0,30 за миллион входных токенов и $1,20 за миллион выходных токенов. Claude Sonnet 5.5 стоит $2,00 и $10,00. В целом по Intelligence Index измеренная стоимость M3 составляет $0,51 за задачу против $7,60 у Claude Sonnet 5.5 — в пятнадцать раз дешевле, и в единственной оценке, которая проверяет, может ли модель всё ещё найти что-то в очень длинном документе, она вовсе не отстаёт.

Затем вы открываете агентные оценки, и картина переворачивается настолько сильно, что это перестаёт быть сравнением. В Terminal-Bench 4.0, где модели предлагается управлять оболочкой и действительно довести до конца программную задачу, MiniMax M3 набирает 2,0%, а Claude Sonnet 5.5 — 63,6%. Тридцатикратный разрыв в единственном бенчмарке, который ближе всего к продакшн-работе, — это не вопрос цены, и никакая экономия на токенах такого разрыва не выдерживает. Полезный вопрос, который ставит это противостояние, не «что лучше», а какой из этих двух режимов отказа способна выдержать ваша нагрузка: MiniMax M3 — это модель с открытыми весами, контекстом на миллион токенов и нативной поддержкой видео, которая не уступает передовой модели в извлечении информации и проваливается при выполнении, а Claude Sonnet 5.5 — это закрытая модель, выпущенная 28 сентября 2026 года, чтобы делать противоположное.

Что представляет собой каждый из них, простыми словами

MiniMax M3 — флагманская фундаментальная модель с открытыми весами китайской лаборатории, анонсированная 1 июня 2026 года и доступная для скачивания по собственной лицензии сообщества MiniMax. Это смесь экспертов примерно с 428 миллиардами общих параметров и около 23 миллиардами активных на токен, и она нативно мультимодальна в сильном смысле: на вход подаются текст, изображение и видео, на выходе получается текст, при этом мультимодальный конвейер был перестроен с самого первого этапа предобучения, а не приделан сверху. Окно составляет 1 048 576 токенов — с гарантированным минимальным рабочим объёмом 512 000 в нашей собственной записи каталога, — а максимальный объём вывода — 512 000 токенов; это наша цифра, а не цифра поставщика, потому что MiniMax её не публикует. Архитектура — MiniMax Sparse Attention, тема arXiv 2606.13392, и заявление поставщика о ней таково: предзаполнение более чем в 9 раз быстрее и декодирование более чем в 15 раз быстрее, чем у предыдущего поколения при окне в миллион токенов. Это цифры поставщика, и мы не видели их независимого воспроизведения.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 — вторая модель поколения 5.5 от Anthropic, на момент написания ей один день, и она закрытая. Anthropic описывает её как лучшее сочетание скорости и интеллекта в линейке, а характеристики таковы: 1 000 000 токенов контекста, 128 000 токенов синхронного вывода и 300 000 в Message Batches API, ввод текста, изображений и файлов, адаптивное мышление с выбираемым уровнем усилий, дата отсечения знаний — июнь 2026, а также нулевое хранение данных, доступное с момента запуска. Её цена не изменилась по сравнению с Claude Sonnet 5: $2.00 за ввод, $10.00 за вывод, $0.20 за чтение из кеша, $2.50 за запись в кеш. Anthropic говорит, что она работает на 30% быстрее и стоит до 30% меньше за задачу, чем Claude Sonnet 5, — данные вендора, не воспроизведённые, и их следует воспринимать как утверждения о количестве токенов, а не о тарифах, поскольку тарифы идентичны.

Форма бенчмарка — вот и вся суть.

Обе модели оцениваются по одному и тому же индексу, ревизия v4.3.2, и именно результаты по каждому оцениванию делают это сопоставление интересным, а не однобоким.

• Воспроизведение в длинном контексте — MiniMax M3 83,0% против Claude Sonnet 5.5 82,7%, разница в пределах ошибки округления при фактическом равенстве

• SciCode — MiniMax M3 47,1 % против Claude Sonnet 5.5 61,0 % — реальный, но преодолимый разрыв

• Humanity's Last Exam — MiniMax M3 39,0% против Claude Sonnet 5.5 55,0%

• Terminal-Bench 4.0 — MiniMax M3 2,0% против Claude Sonnet 5.5 63,6%, где сравнение перестаёт быть полезным

• Индекс интеллекта — MiniMax M3 29 против Claude Sonnet 5.5 56

• Стоимость за задачу Index — MiniMax M3 $0.51 против Claude Sonnet 5.5 $7.60

• Выходные токены, сгенерированные по всему индексу — MiniMax M3 120M против Claude Sonnet 5.5 410M

• Скорость вывода — MiniMax M3 115,3 токенов/сек против Claude Sonnet 5.5 138,7 токенов/сек

Прочитайте эти строки по порядку — и возникнет стройная модель. MiniMax M3 демонстрирует компетентность в статическом рассуждении и извлечении информации и слабость в длительном выполнении. Результат MiniMax M3 в Terminal-Bench — не скромное отставание; оценка 2,0% означает, что модель по сути не выполняет задачи, и та же закономерность проявляется в оценке за автоматизационный бенчмарк — 0,21 против 0,71 — и в оценке всезнания — 1,35 против 32,3. А удерживает MiniMax M3 позиции ровно там, где архитектура M3 заявляет преимущество: по-настоящему длинный вход, который прочитывают и на который отвечают. Это MSA делает то, для чего MiniMax её продавал.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

Тема затрат добавляет второй, менее очевидный момент. MiniMax M3 не только дешевле в расчёте на токен — 1/6,7 на входе и 1/8,3 на выходе, — она ещё и тратит меньше токенов, чтобы прийти к ответу: примерно 120 миллионов против 410 миллионов по тому же набору тестов. Два эффекта перемножаются, давая пятнадцатикратный разрыв в расчёте на задачу. Часть этого разрыва — настоящая эффективность, а часть — просто то, что MiniMax M3 раньше сдаётся на задачах, которые проваливает; дешёвая задача, дающая неправильный ответ, — это не экономия, и это самый дешёвый урок в статье.

Измерение, которое не может показать прайс-лист

MiniMax M3 обладает свойством, которого у Claude Sonnet 5.5 нет и которое он не может приобрести: вы можете забрать веса. Это важно ровно для одного класса покупателей, и для этого покупателя это перевешивает всё вышесказанное. Если запрос не может покинуть юрисдикцию, не может пересечь сетевую границу или должен выполняться там, где API вообще недоступен, модель без загружаемых весов не является вариантом ни за какую цену, а модель с открытыми весами на 428 миллиардов параметров — является. То же свойство оборачивается недостатком в обратную сторону: самостоятельный хостинг 428 млрд параметров при 23 млрд активных — это капитальное решение, а не API-ключ, и собственные заявления M​iniMax о разреженном внимании существуют потому, что альтернатива при миллионе токенов — это неподъёмная инфраструктура.

Для всех остальных честная формулировка такова: это линия «разработать или купить» с прикреплённым ценником. Claude Sonnet 5.5 — лучшая модель для всего, что связано с агентами. MiniMax M3 — лучшая модель для чтения чего-то огромного и ответа на вопрос об этом, и она значительно лучше подходит для обработки видео, которое Claude Sonnet 5.5 вообще не принимает — его входная поверхность — это текст, изображения и файлы.

• Веса — MiniMax M3 открытая под общественной лицензией MiniMax, в отличие от закрытой Claude Sonnet 5.5

• Входная модальность — MiniMax M3: текст, изображение и видео против Claude Sonnet 5.5: текст, изображение и файл

• Максимальный объём вывода — MiniMax M3 512 000 токенов по нашему каталогу против Claude Sonnet 5.5 128 000 синхронно, 300 000 в Batches

• Цены на кэш — MiniMax M3 $0.06 за миллион чтений против Claude Sonnet 5.5: $0.20 за миллион чтений и $2.50 за миллион записей

• Контроль усилий — мышление MiniMax M3: включено, адаптивное или отключено, против адаптивного мышления Claude Sonnet 5.5, где отключение теперь требует between_tools-форму

• Хранение данных — MiniMax M3 управляется вашим собственным развёртыванием при самостоятельном хостинге, тогда как для Claude Sonnet 5.5 нулевое хранение данных доступно от A​nthropic уже при запуске

Запуск обоих без запуска двух контрактов

Смешайте китайскую модель с открытыми весами и закрытую модель A​nthropic в одном конвейере — и операционные расходы обычно заключаются не в токенах; это второй контракт, второй ключ, второй набор лимитов скорости и второе место, где может произойти сбой. OrcaRouter сводит это к одной конечной точке, совместимой с Open​AI, охватывающей более 200 моделей, при этом прейскурантная цена провайдера передаётся без изменений — наценка не добавляется ни с одной стороны, — действует автоматическое переключение при отказе между вышестоящими провайдерами и есть DSL маршрутизации для объединения нескольких моделей в один вызов. M​iniMax M3 здесь маршрутизируется как minimax/minimax-m3 по цене M​iniMax $0.30 и $1.20 при $0.06 за чтение кэша, и по трафику это одна из самых нагруженных моделей в каталоге, что само по себе полезный сигнал: слой маршрутизации может показать, какую реальную нагрузку несёт модель, а не только то, сколько баллов она набрала.

Claude Sonnet 5.5 пока нет в нашем каталоге, и статья не станет делать вид, что это не так. Попасть к нему сегодня можно через собственный API Anthropic. Claude Sonnet 5 доступен здесь по тем же ценам — $2,00 и $10,00 — и так с 30 июня; это естественная цель для поэтапного перехода и партнёр на случай отказа, пока его преемнику всего один день от роду.

Эта комбинация — переключение на длинный контекст и агентный путь за одним ключом — как раз то, для чего нужен роутер. MiniMax M3 пропускает через этот каталог 63,2 млн токенов трафика в неделю против 7,9 млн у Claude Sonnet 5, так что дешёвая модель здесь не теоретическая замена; она уже несёт этот объём. Маршрутизация обеих из одного ключа означает, что разделение — это решение о конфигурации, в рамках которого вы можете перераспределять трафик, а не второй договор, который нужно подписать, прежде чем вы сможете протестировать более дешёвую сторону.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

Что делать с галстуком

Если ваша рабочая нагрузка — это ответы на вопросы масштаба документа: очень длинный ввод, короткий фактический ответ, терпимая задержка, — то ничья по длинному контексту реальна, и пятнадцатикратное преимущество MiniMax M3 по стоимости реально вместе с ней. Это простая замена, и её стоит протестировать на этой неделе.

Если ваша нагрузка агентная, показатель Terminal-Bench решает вопрос ещё до того, как в разговор вступит цена. Claude Sonnet 5.5 за $7,60 за задачу Index против MiniMax M3 за $0,51 — это 15-кратная надбавка за модель, которая набирает на шестьдесят баллов больше в оценке, наиболее близкой к вашему продакшн-трафику, а вариант, который в пятнадцать раз дешевле и при этом не справляется с задачей, оказывается дорогим. Метрика, которую нужно считать на своих данных, — это токены на выполненную задачу, а не токены на запрос, потому что это единственный показатель в этой статье, при котором ценовое преимущество MiniMax M3 не сохраняется автоматически.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно