Сгенерированная hero-карточка под названием «GPT-6.1 Sol vs MiniMax M3» с двумя закруглёнными панелями: слева «GPT-6.1 Sol» со списком «OpenAI — выпущена 29 сентября 2026 г.», «$2.00 за вход / $10.00 за выход за 1 млн», «AA Index 51.8» и «$0.72 за задачу»; справа «MiniMax M3» со списком «MiniMax — выпущена 31 мая 2026 г.», «$0.30 за вход / $1.20 за выход за 1 млн», «AA Index 29.2» и «$0.51 за задачу»; между ними строка «Дешевле карточка — меньше счёт: разница 22.6 пункта индекса»; в футере «Данные: Artificial Analysis v4.3.2.» и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

GPT-6.1 Sol против MiniMax M3: более дешёвый тариф проигрывает по итоговой стоимости

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

MiniMax M3 запрашивает лишь малую долю того, что GPT-6.1 Sol — $0,30 за миллион входных токенов против $2,00, $1,20 за миллион выходных против $10,00 — а по счётчику, который реально работает, он дешевле: $0,508 за задачу против $0,724 в оценке Artificial Analysis v4.3.2. Это настоящая победа, и в то же время это весь аргумент, потому что то же измерение, которое даёт M3 меньший счёт, даёт GPT-6.1 Sol преимущество в 22,6 пункта по индексу, а набор бенчмарков, который измеряет, способна ли модель завершать агентную работу, а не описывать её, превращает разрыв в стену. Поставщик выпустил GPT-6.1 Sol 29 сентября 2026 года. Компания выпустила M3, свою модель с открытыми весами и 428 млрд параметров, 31 мая 2026 года.

Оба уже работают, у обоих есть цена, и к обоим ведёт один вызов API. Далее — арифметика, которая решает, что выбрать между ними, и два места, где арифметика — не вся история.

Что на самом деле представляет собой каждая модель

GPT-6.1 Sol — текущий флагман OpenAI для рассуждений и разработки ПО — закрытая модель, выпущенная всего через неделю после GPT-6 Sol, которую она заменяет, и продаётся по той же прейскурантной цене $2.00 / $10.00, что и предшественница. У неё тариф $0.10 за кэшированный ввод — вдвое меньше, чем GPT-6 Sol взимала за попадания в кэш, — и именно на эту модель указывает OpenAI, когда говорит об агентном программировании, а не о чате.

MiniMax M3 — это модель смеси экспертов с 428 млрд общих параметров и 23 млрд активных на токен, опубликованная под MiniMax Community License — релиз с открытыми весами на основе нестандартной лицензии с некоммерческим уклоном, а не одобренной OSI. Её обслуживает широкий круг провайдеров инференса: Artificial Analysis фиксирует пятнадцать хостов для M3 против восьми для GPT-6.1 Sol. Эта широта — практическое преимущество открытых весов, и именно поэтому ценовая конкуренция вокруг M3 развивалась быстрее, чем вокруг закрытой модели.

Тарифная карта и счетчик, который ее отменяет

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Поставьте рядом две опубликованные тарифные карты — и станет ясно, что они даже близко не сопоставимы.

• Ввод — GPT-6.1 Sol $2,00 за 1 млн против MiniMax M3 $0,30 за 1 млн; M3 дешевле на 85%
• Вывод — $10,00 за 1 млн против $1,20 за 1 млн; M3 дешевле на 88%
• Кэшированный ввод — $0,10 за 1 млн против $0,06 за 1 млн
• Стоимость за задачу AA — $0,724 против $0,508; M3 дешевле на 30%, а не на 85%
• Выходные токены на задачу — 38 128 против 48 192; M3 пишет на 26% больше
• Время на задачу — 640 с против 486 с
• Контекстное окно — 1 050 000 против 1 048 576 токенов; фактически одинаково
• Максимальный вывод — 128 000 токенов против 512 000; M3 напишет один очень длинный ответ
• Принимаемые входные данные — текст, изображение и файл против текста, изображения и видео
• Место в индексе — GPT-6.1 Sol: 10-е из 147 моделей против MiniMax M3: 62-е

Две дешёвые строки вверху — это то, что видит закупочная ведомость. Третья строка — та, что оплачивает счёт, и она говорит, что преимущество в 85–88% по тарифной сетке превращается в 30% преимущество в реальном мире, потому что M3 генерирует больше токенов на задачу и потому что задача — не фиксированный объём работы. Тарифные сетки оценивают токены; работа оценивается в задачах. Любое сравнение, которое останавливается на первых двух строках, сравнивает не те числа и не в тех единицах измерения.

Где тридцать процентов перестают иметь значение

Стоимость задачи достаточно близка, поэтому для всего, что выходит за рамки массового текста, решающим становится разрыв в индексе. Artificial Analysis оценивает GPT-6.1 Sol в 51,83, а MiniMax M3 — в 29,22: разрыв в 22,6 балла, причём по всему набору тестов он распределён неравномерно. В тестах, где от модели требуется работать с терминалом, редактировать репозиторий и проверять собственную работу, эти две модели находятся в разных категориях:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 против MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 против 0.0048
• AA-Omniscience — 41.53 против 1.35
• MMLU-Pro — 0.8595 против 0.7856
• AutomationBench — 0.6487 против 0.2125
• τ²-bench — в этом запуске не опубликовано для GPT-6.1 Sol против 0.8889 для M3
• GPQA Diamond — в этом запуске не опубликовано для GPT-6.1 Sol против 0.9293 для M3
• CritPT — 0.3171 против 0.0371

Прочитайте это внимательно, потому что это не безоговорочная победа, и самое интересное — как раз исключения. MiniMax M3 набирает 0,8889 в τ²-bench — оценке использования инструментов и диалогового обслуживания клиентов — и 0,9293 в GPQA Diamond — результате уровня выпускника по естественным наукам, который превосходит все показатели OpenAI, опубликованные именно в этом прогоне. M3 умеет рассуждать и хорошо использовать инструменты в разговоре. В Terminal-Bench 4.0 M3 набирает 0,0202. Это не «хуже»; это модель, которая вообще не способна удержать в целостности многошаговую задачу по репозиторию, и никакая скидка на токены не делает задачу, которую модель проваливает, дешевле задачи, которую модель выполняет.

Существует издержка второго порядка, которую скрывает показатель на задачу. M3 фиксирует 48 192 выходных токена на задачу и время до первого ответа 23,0 секунды против 332,0 секунд у GPT-6.1 Sol — маленькая модель начинает говорить почти сразу, а затем рассуждает подолгу. Если ваша рабочая нагрузка чувствительна к задержке, но поверхностна, это аргумент в пользу M3. Если она агентная, то количество токенов — это то, за что вы платите, а итоговый балл — то, что вы получаете.

Наша собственная карточка модели для GPT-6.1 Sol содержит те же цифры в том виде, в котором вы действительно будете на них ориентироваться при маршрутизации: ставка $2.00 / $10.00, контекстное окно на 1 050 000 токенов, p50 времени до первого токена — 4,54 секунды, а также индекс Artificial Analysis и блок бенчмарков на той же странице.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Что здесь стоят открытые веса

Самый сильный аргумент в пользу M3 — возможность скачать её, и стоит точно понимать, что это даёт. Это даёт лицензионные условия, позволяющие запускать модель внутри собственного периметра, — что полезно, если данные не могут его покидать, — а также ценовую конкуренцию, которую обеспечивают пятнадцать независимых хостинг-провайдеров. Но это не даёт дешёвого развёртывания: 428 млрд параметров при 23 млрд активных всё равно требуют серьёзного оборудования для инференса, а MiniMax Community License — это нестандартная лицензия с дополнительными условиями, а не лицензия без ограничений. Для большинства команд «открытые веса» означают лучшую цену на инференс у хостинг-провайдера, а не коробку в серверной стойке.

Карточка OrcaRouter для MiniMax M3 — это место, где живут предоставляемые показатели: тариф $0.30 / $1.20, контекстное окно в 1 048 576 токенов, максимальный вывод в 512 000 токенов, ввод текста/изображений/видео и семидневный объём в 56,4 миллиона токенов у провайдеров, которые его маршрутизируют.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Оба они за одной клавишей

Практическая причина, по которой это сравнение — изменение конфигурации, а не миграция, заключается в том, что обе модели доступны через единую конечную точку OrcaRouter — один API для более чем 200 моделей, при этом прайс-лист провайдера передаётся без наценки, 0%, а значит, изменение тарифа MiniMax попадёт в ваш счёт в тот же день, когда поставщик его публикует, а не когда перепродавец заново согласует условия. Для M3 это важнее, чем для его конкурента: весь смысл маршрутизации к модели с открытыми весами в том, что её цена и список хостов меняются, и только счётчик со сквозной передачей способен отслеживать движущуюся цель.

Автоматическое переключение при отказе — это вторая половина. M3 обслуживают многие провайдеры с разной надёжностью, и уровень маршрутизации может перенести запрос на другой хост, когда один из них начинает деградировать, при этом вызывающий не знает, на какой хост он попал. Это честный способ внедрить модель, чей результат в Terminal-Bench говорит: «не для критического пути», — поставить её туда, где повторная попытка дёшева.

Какой из них, если нужно выбрать сегодня?

Если работа — это массовый текст: извлечение, суммаризация, классификация, диалог, всё, где вывод представляет собой связный текст, а отказ проявляется как неверное предложение, а не сломанная сборка, — MiniMax M3 является правильным выбором по умолчанию, и эти тридцать процентов — реальные деньги. Используйте показатели GPQA и τ²-bench как доказательство: это способная модель, которая к тому же оказывается дешёвой.

Если работа агентная — репозитории, терминалы, цепочки инструментов, всё, где есть этап верификации, — то 0,0202 на Terminal-Bench 4.0 дисквалифицирует, и GPT-6.1 Sol с 0,5606 за $0,724 за задачу — более выгодная сделка, даже при на 85% более высокой цене за токен. Тарифная карта никогда не была тем, что вы покупали.

Полезный ответ таков: выбирать один раз не обязательно. Направьте поверхностный уровень на M3, агентный уровень — на GPT-6.1 Sol, и держите оба за одними учётными данными — DSL маршрутизации объединяет их в один вызов, когда задача начинается как извлечение и превращается в работу по исправлению.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно