
Mistral Large 4 против Claude Opus 5: разрыв меньше, чем разница в цене
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 151 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Единственное прямое сопоставительное число, которое кто-либо публиковал для Mistral Large 4 против Claude Opus 5, получено в ходе слепой оценки людьми, и разрыв оказался меньше, чем можно предположить по таблицам бенчмарков. Surge AI скрыла личности моделей и попросила профессиональных аннотаторов оценить качество кода по шкале от 1 до 5; Claude Opus 5 занял первое место с 4,22, а Mistral Large 4 Preview — второе с 3,74, опередив Kimi K3, GLM-5.3 и GLM-5.2. В независимом агрегате эти двое вовсе не соседи — 50,8 против 38,4 в Intelligence Index от Artificial Analysis по состоянию на 6 октября. Что делает это сопоставление достойным того, чтобы посвятить ему день, — так это то, что модель, набирающая на 12 баллов меньше, обходится примерно впятеро дешевле при выполнении задачи.
У обеих цифр должно быть указано происхождение, потому что это не однотипные числа. Оценка Surge AI — это стороннее исследование с участием людей, которое Mistral заказала и опубликовала, — более сильная форма доказательства, чем самостоятельно проведённый бенчмарк, и всё же исследование, публикацию которого контролировала Mistral. Показатели индекса — это собственные прогоны Artificial Analysis, сопоставимые между собой, и потому именно та пара, от которой следует отталкиваться в рассуждениях. Ни один из них по отдельности не говорит, на какой модели строить; вместе они очерчивают рамки вопроса.
Два продукта, а не два поколения одного.
Claude Opus 5 — это флагманская модель с закрытыми весами от производителя, выпущенная 24 июля 2026 года и предоставляемая с окном контекста на 1 млн токенов и до 128 тыс. выходных токенов, по цене $5 за миллион входных токенов и $25 за миллион выходных, при этом кэшированные чтения — $0.50. Это самая мощная модель производителя в линейке Opus, и она прямо нацелена на долгосрочную агентную работу — сохраняя связность в многошаговых сессиях при интенсивном использовании инструментов.
Mistral Large 4 — это предварительная версия, анонсированная 6 октября 2026 года, которую Mistral описывает как разреженную смесь экспертов с 1,05 трлн параметров, 49 млрд активных параметров и визуальным энкодером на 1,6 млрд параметров. Его API-идентификатор — mistral-large-4-0, он нативно мультимодален, а документация Mistral даёт ему контекстное окно в 1M токенов, в то время как Artificial Analysis сообщает о 524 288 в тестируемой конфигурации. Веса обещаны к концу октября, а лицензия ещё не названа.
Так что это не противостояние более новой модели с более старой. Это проприетарная фронтирная модель против претендента, которому ещё предстоит стать открытым по весам, и цена на обе устанавливается соответственно.

Тот же индекс, обе модели
Считано 6 октября с их страниц Artificial Analysis по Intelligence Index v4.3:
• Индекс интеллекта — Mistral Large 4 Preview 38.4 против Claude Opus 5 50.8
• Стоимость за задачу индексации — $1.13 для Mistral Large 4 Preview против $5.86 для Claude Opus 5
• Terminal-Bench 4.0 — 26,8% против 49,0%, наибольший единичный разрыв между ними
• Humanity's Last Exam — 35,0% против 54,9%
• MMMU-Pro, мультимодальное рассуждение — 76.4% vs 84.7%
• AutomationBench, бизнес-процессы — 59,9% против 56,6%, единственная строка, где лидирует Mistral Large 4
• Контекстное окно — 1 млн, заявленный Mistral, и 524 288 в протестированной конфигурации, против 1 млн фактически предоставляемого.
• Максимальный объём вывода — не опубликован для предварительной версии, в отличие от 128K токенов.
• Цена за миллион, ввод / вывод — $1.36 / $4.18 по прайс-листу, сейчас $0.68 / $2.09 по акции, против $5.00 / $25.00

Закономерность читается. Opus 5 впереди в двух самых сложных строках, требующих интенсивных рассуждений, — работа в терминале и знания открытого типа — и впереди в мультимодальном понимании, несмотря на то, что Mistral Large 4 — это модель, которую продают за счёт её зрения. Mistral Large 4 лидирует в строке автоматизации рабочих процессов, которая ближе всего к тому, что бизнес-подразделение на самом деле просит модель делать, и делает это за пятую часть цены за задачу.
Где Mistral Large 4 действительно выигрывает
Самое интересное утверждение в посте Mistral о запуске — не результат бенчмарка. Оно в том, что в одном из тестов Artificial Analysis Cyber Index — воспроизвести реальную уязвимость в программном обеспечении с открытым исходным кодом, а затем исправить её — Mistral Large 4 набирает 82%, что, как утверждается, является самым высоким показателем среди всех моделей, и что несколько ведущих закрытых моделей набирают почти ноль в том же тесте, потому что отказываются выполнять задачу. Mistral называет Claude Opus 5.5 и GPT-6 Astra примерами такого отказа.
Это интерпретация вендором цифры, на которую ссылается сам вендор, и читать её следует именно так. Это также реальное операционное различие, если оно подтверждается: модель, которая не воспроизводит уязвимость, нельзя использовать, чтобы доказать, что она реальна, а это первый шаг большинства процессов реагирования на инциденты. Mistral ставит рядом с 82% результат 93% на 40 соревновательных упражнениях Cybench и встречное утверждение о том, что её частота отказов на киберпромптах, взятых из JailbreakBench, StrongREJECT и AgentHarm, выше, чем у других моделей с открытыми весами, — смысл аргумента в том, что нужны и способность, и дисциплина в одной и той же модели, а не обмен одного на другое.
Помимо кибербезопасности, аргументы в пользу Mistral Large 4 опираются на три вещи, которых Opus 5 не предлагает. Он обучается и обслуживается на европейской инфраструктуре в соответствии с европейским законодательством, что важно для покупателей с обязательствами по резидентности данных. Mistral обещает, что его можно будет скачать, — и в этом суть всей затеи, поскольку именно самостоятельное развёртывание устраняет риск доступа в самый разгар инцидента, который Mistral так настойчиво описывает. И он достаточно дёшев в расчёте на задачу, чтобы использовать его на первом проходе, а сложные остатки передавать передовой модели, — это экономически разумно, а не ошибка округления.
Где Claude Opus 5 по-прежнему оправдывает свою цену
Разрыв в 12 пунктов по индексу — это немало, и картина по строкам показывает, где именно он кроется. Terminal-Bench 4.0 почти вдвое выше — 49,0% против 26,8% — а работа в терминале — самый близкий публичный прокси для агентного программирования, ради которого команды в этом году в основном и покупают фронтирные модели. Humanity's Last Exam разделяет их на 20 пунктов. Что касается долгосрочной автономности, адаптивная архитектура рассуждений Opus 5, потолок вывода в 128K и обслуживаемый контекст 1M — это именно та конфигурация, которая нужна, если ваша нагрузка — многочасовая сессия агента, а не один сложный вопрос.
Потолок вывода — это менее заметное различие. Mistral не опубликовала максимальную длину вывода для предварительной версии, а 128K у Opus 5 реально снимает ограничения для генерации кода и длинных структурированных документов. Если ваш пайплайн выдаёт файлы, а не ответы, проверьте это число, прежде чем переключаться, потому что это тот вид разрыва, который проявляется только в продакшене.
Стоимость за задачу — вот за какой показатель стоит держаться
Цены за токен льстят дешёвым моделям и вводят в заблуждение относительно дорогих. Собственная стоимость индекса в расчёте на задачу — общие расходы на выполнение одной задачи оценки, включая кэш и всё остальное, — это число, которое выдерживает проверку бюджетом: $1,13 против $5,86.
Это не разрешение переводить всё на более дешёвую модель, потому что задача, с которой дешёвая модель не справляется, — это задача, за которую вы платите дважды. Это разрешение перестать считать одну фронтирную модель единственным возможным вариантом. На OrcaRouterClaude Opus 5 присутствует в каталоге по прайсовой цене вендора с наценкой 0 % — в той же конечной точке с совместимостью с OpenAI, что и ещё более 200 других моделей, и именно это превращает конвейер из двух моделей в работу на один день, а не в заключение второго контракта с вендором. Mistral Large 4 сегодня в каталоге нет — доступ к предварительной версии открыт через собственный API Mistral и несколько сторонних платформ. Когда его веса появятся и какой-нибудь провайдер начнёт его хостить, будет действовать то же правило сквозной передачи: сколько берёт вендор, столько берут и с вас, а снижение цены вендором отражается в вашем счёте в тот же день.

Для непроверенной preview-версии самая важная функция маршрутизации — это отказоустойчивое переключение. Если направлять часть продакшен-трафика на Mistral Large 4, пока Opus 5 обрабатывает остальное, регрессия превращается в перенаправление, а не в сбой, и вы узнаёте реальные режимы отказа модели на собственных данных, а не на лидерборде.
Что решает это за три недели
Три факта всё ещё остаются открытыми, и каждый из них меняет ответ. Если веса выйдут под разрешительной лицензией, Mistral Large 4 станет единственной моделью из этой пары, которую можно развернуть у себя, и расклад для регулируемых покупателей резко изменится. Если акционные цены $0,68 / $2,09 вернутся к $1,36 / $4,18 из тарифной сетки, разрыв на одну задачу сократится, но останется определяющим. А если Artificial Analysis перенесёт в свой публичный индекс без изменений показатели по программированию, полученные в ходе закрытой оценки, история с программированием станет подтверждённой третьей стороной, а не опубликованной вендором от имени третьей стороны.
До тех пор: Opus 5 — это безопасный вариант по умолчанию для продакшена, и его цена, превышающая другие в несколько раз, оправдана для агентных задач и работы с активным использованием терминала. Mistral Large 4 — интересная ставка: достаточно дешёвая в расчёте на задачу, чтобы запускать её параллельно, достаточно сильная в автоматизации и кибербезопасности, чтобы уже сегодня привлекать трафик, и обещающая возможность саморазвёртывания, которую не может предложить ни одна закрытая модель в этом сравнении.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
