Сгенерированная титульная карточка для статьи «Mistral Large 4 против Claude Opus 5», на которой заголовок набран жирным геометрическим шрифтом без засечек, под ним — подзаголовок «Разрыв меньше, чем разница в цене», а сверху — ряд из трёх плоских линейных иконок: две полосы разной высоты, ценник и шкала человеческих оценок, — на белом фоне с сине-голубыми градиентными акцентами и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Mistral Large 4 против Claude Opus 5: разрыв меньше, чем разница в цене

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Единственное прямое сопоставительное число, которое кто-либо публиковал для Mistral Large 4 против Claude Opus 5, получено в ходе слепой оценки людьми, и разрыв оказался меньше, чем можно предположить по таблицам бенчмарков. Surge AI скрыла личности моделей и попросила профессиональных аннотаторов оценить качество кода по шкале от 1 до 5; Claude Opus 5 занял первое место с 4,22, а Mistral Large 4 Preview — второе с 3,74, опередив Kimi K3, GLM-5.3 и GLM-5.2. В независимом агрегате эти двое вовсе не соседи — 50,8 против 38,4 в Intelligence Index от Artificial Analysis по состоянию на 6 октября. Что делает это сопоставление достойным того, чтобы посвятить ему день, — так это то, что модель, набирающая на 12 баллов меньше, обходится примерно впятеро дешевле при выполнении задачи.

У обеих цифр должно быть указано происхождение, потому что это не однотипные числа. Оценка Surge AI — это стороннее исследование с участием людей, которое Mistral заказала и опубликовала, — более сильная форма доказательства, чем самостоятельно проведённый бенчмарк, и всё же исследование, публикацию которого контролировала Mistral. Показатели индекса — это собственные прогоны Artificial Analysis, сопоставимые между собой, и потому именно та пара, от которой следует отталкиваться в рассуждениях. Ни один из них по отдельности не говорит, на какой модели строить; вместе они очерчивают рамки вопроса.

Два продукта, а не два поколения одного.

Claude Opus 5 — это флагманская модель с закрытыми весами от производителя, выпущенная 24 июля 2026 года и предоставляемая с окном контекста на 1 млн токенов и до 128 тыс. выходных токенов, по цене $5 за миллион входных токенов и $25 за миллион выходных, при этом кэшированные чтения — $0.50. Это самая мощная модель производителя в линейке Opus, и она прямо нацелена на долгосрочную агентную работу — сохраняя связность в многошаговых сессиях при интенсивном использовании инструментов.

Mistral Large 4 — это предварительная версия, анонсированная 6 октября 2026 года, которую Mistral описывает как разреженную смесь экспертов с 1,05 трлн параметров, 49 млрд активных параметров и визуальным энкодером на 1,6 млрд параметров. Его API-идентификатор — mistral-large-4-0, он нативно мультимодален, а документация Mistral даёт ему контекстное окно в 1M токенов, в то время как Artificial Analysis сообщает о 524 288 в тестируемой конфигурации. Веса обещаны к концу октября, а лицензия ещё не названа.

Так что это не противостояние более новой модели с более старой. Это проприетарная фронтирная модель против претендента, которому ещё предстоит стать открытым по весам, и цена на обе устанавливается соответственно.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid in which 'Mistral Large 4' is listed at version v26.10 with the description 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 that does carry an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible, with the OCR MODELS section starting below.

Тот же индекс, обе модели

Считано 6 октября с их страниц Artificial Analysis по Intelligence Index v4.3:

• Индекс интеллекта — Mistral Large 4 Preview 38.4 против Claude Opus 5 50.8

• Стоимость за задачу индексации — $1.13 для Mistral Large 4 Preview против $5.86 для Claude Opus 5

• Terminal-Bench 4.0 — 26,8% против 49,0%, наибольший единичный разрыв между ними

• Humanity's Last Exam — 35,0% против 54,9%

• MMMU-Pro, мультимодальное рассуждение — 76.4% vs 84.7%

• AutomationBench, бизнес-процессы — 59,9% против 56,6%, единственная строка, где лидирует Mistral Large 4

• Контекстное окно — 1 млн, заявленный Mistral, и 524 288 в протестированной конфигурации, против 1 млн фактически предоставляемого.

• Максимальный объём вывода — не опубликован для предварительной версии, в отличие от 128K токенов.

• Цена за миллион, ввод / вывод — $1.36 / $4.18 по прайс-листу, сейчас $0.68 / $2.09 по акции, против $5.00 / $25.00

A generated two-column scoreboard titled 'Mistral Large 4 vs Claude Opus 5 — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; Humanity's Last Exam 35.0%; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Claude Opus 5': Intelligence Index v4.3 50.8; cost per index task $5.86; Terminal-Bench 4.0 49.0%; Humanity's Last Exam 54.9%; MMMU-Pro 84.7%; AutomationBench 56.6%.

Закономерность читается. Opus 5 впереди в двух самых сложных строках, требующих интенсивных рассуждений, — работа в терминале и знания открытого типа — и впереди в мультимодальном понимании, несмотря на то, что Mistral Large 4 — это модель, которую продают за счёт её зрения. Mistral Large 4 лидирует в строке автоматизации рабочих процессов, которая ближе всего к тому, что бизнес-подразделение на самом деле просит модель делать, и делает это за пятую часть цены за задачу.

Где Mistral Large 4 действительно выигрывает

Самое интересное утверждение в посте Mistral о запуске — не результат бенчмарка. Оно в том, что в одном из тестов Artificial Analysis Cyber Index — воспроизвести реальную уязвимость в программном обеспечении с открытым исходным кодом, а затем исправить её — Mistral Large 4 набирает 82%, что, как утверждается, является самым высоким показателем среди всех моделей, и что несколько ведущих закрытых моделей набирают почти ноль в том же тесте, потому что отказываются выполнять задачу. Mistral называет Claude Opus 5.5 и GPT-6 Astra примерами такого отказа.

Это интерпретация вендором цифры, на которую ссылается сам вендор, и читать её следует именно так. Это также реальное операционное различие, если оно подтверждается: модель, которая не воспроизводит уязвимость, нельзя использовать, чтобы доказать, что она реальна, а это первый шаг большинства процессов реагирования на инциденты. Mistral ставит рядом с 82% результат 93% на 40 соревновательных упражнениях Cybench и встречное утверждение о том, что её частота отказов на киберпромптах, взятых из JailbreakBench, StrongREJECT и AgentHarm, выше, чем у других моделей с открытыми весами, — смысл аргумента в том, что нужны и способность, и дисциплина в одной и той же модели, а не обмен одного на другое.

Помимо кибербезопасности, аргументы в пользу Mistral Large 4 опираются на три вещи, которых Opus 5 не предлагает. Он обучается и обслуживается на европейской инфраструктуре в соответствии с европейским законодательством, что важно для покупателей с обязательствами по резидентности данных. Mistral обещает, что его можно будет скачать, — и в этом суть всей затеи, поскольку именно самостоятельное развёртывание устраняет риск доступа в самый разгар инцидента, который Mistral так настойчиво описывает. И он достаточно дёшев в расчёте на задачу, чтобы использовать его на первом проходе, а сложные остатки передавать передовой модели, — это экономически разумно, а не ошибка округления.

Где Claude Opus 5 по-прежнему оправдывает свою цену

Разрыв в 12 пунктов по индексу — это немало, и картина по строкам показывает, где именно он кроется. Terminal-Bench 4.0 почти вдвое выше — 49,0% против 26,8% — а работа в терминале — самый близкий публичный прокси для агентного программирования, ради которого команды в этом году в основном и покупают фронтирные модели. Humanity's Last Exam разделяет их на 20 пунктов. Что касается долгосрочной автономности, адаптивная архитектура рассуждений Opus 5, потолок вывода в 128K и обслуживаемый контекст 1M — это именно та конфигурация, которая нужна, если ваша нагрузка — многочасовая сессия агента, а не один сложный вопрос.

Потолок вывода — это менее заметное различие. Mistral не опубликовала максимальную длину вывода для предварительной версии, а 128K у Opus 5 реально снимает ограничения для генерации кода и длинных структурированных документов. Если ваш пайплайн выдаёт файлы, а не ответы, проверьте это число, прежде чем переключаться, потому что это тот вид разрыва, который проявляется только в продакшене.

Стоимость за задачу — вот за какой показатель стоит держаться

Цены за токен льстят дешёвым моделям и вводят в заблуждение относительно дорогих. Собственная стоимость индекса в расчёте на задачу — общие расходы на выполнение одной задачи оценки, включая кэш и всё остальное, — это число, которое выдерживает проверку бюджетом: $1,13 против $5,86.

Это не разрешение переводить всё на более дешёвую модель, потому что задача, с которой дешёвая модель не справляется, — это задача, за которую вы платите дважды. Это разрешение перестать считать одну фронтирную модель единственным возможным вариантом. На OrcaRouterClaude Opus 5 присутствует в каталоге по прайсовой цене вендора с наценкой 0 % — в той же конечной точке с совместимостью с OpenAI, что и ещё более 200 других моделей, и именно это превращает конвейер из двух моделей в работу на один день, а не в заключение второго контракта с вендором. Mistral Large 4 сегодня в каталоге нет — доступ к предварительной версии открыт через собственный API Mistral и несколько сторонних платформ. Когда его веса появятся и какой-нибудь провайдер начнёт его хостить, будет действовать то же правило сквозной передачи: сколько берёт вендор, столько берут и с вас, а снижение цены вендором отражается в вашем счёте в тот же день.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the model identity, a 1M-token context window, a 128K maximum output, input modalities of text, image and file with text output, the pre-October-2026 release date, a p-50 time-to-first-token figure of 4.82 seconds, pricing of $5.00 per million input and $25.00 per million output, and an OpenAI-compatible code sample pointing at the api.orcarouter.ai base URL.

Для непроверенной preview-версии самая важная функция маршрутизации — это отказоустойчивое переключение. Если направлять часть продакшен-трафика на Mistral Large 4, пока Opus 5 обрабатывает остальное, регрессия превращается в перенаправление, а не в сбой, и вы узнаёте реальные режимы отказа модели на собственных данных, а не на лидерборде.

Что решает это за три недели

Три факта всё ещё остаются открытыми, и каждый из них меняет ответ. Если веса выйдут под разрешительной лицензией, Mistral Large 4 станет единственной моделью из этой пары, которую можно развернуть у себя, и расклад для регулируемых покупателей резко изменится. Если акционные цены $0,68 / $2,09 вернутся к $1,36 / $4,18 из тарифной сетки, разрыв на одну задачу сократится, но останется определяющим. А если Artificial Analysis перенесёт в свой публичный индекс без изменений показатели по программированию, полученные в ходе закрытой оценки, история с программированием станет подтверждённой третьей стороной, а не опубликованной вендором от имени третьей стороны.

До тех пор: Opus 5 — это безопасный вариант по умолчанию для продакшена, и его цена, превышающая другие в несколько раз, оправдана для агентных задач и работы с активным использованием терминала. Mistral Large 4 — интересная ставка: достаточно дешёвая в расчёте на задачу, чтобы запускать её параллельно, достаточно сильная в автоматизации и кибербезопасности, чтобы уже сегодня привлекать трафик, и обещающая возможность саморазвёртывания, которую не может предложить ни одна закрытая модель в этом сравнении.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно