
Mistral Large 4 против DeepSeek V4 Pro: архитектуры-близнецы, противоположные ставки
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 151 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
Две модели в этом сравнении почти неотличимы на бумаге и совершенно не похожи на практике. Mistral Large 4 — это разреженная смесь экспертов с 1,05 трлн параметров и 49 млрд активных параметров, анонсированная 6 октября 2026 года. DeepSeek V4 Pro — это разреженная смесь экспертов с 1,6 трлн параметров и 49 млрд активных параметров, выпущенная 24 апреля 2026 года. Тот же бюджет активаций, то же архитектурное семейство, то же заявление о передовой производительности при экономике открытых весов — и ровно у одной из них есть веса, которые можно скачать уже сегодня.
Это сопоставление придумала не эта статья. В собственном посте о запуске Mistral бенчмаркается с DeepSeek V4 Pro по имени в трёх отдельных местах: агентное программирование, длительная интеллектуальная работа и автоматизация бизнес-процессов. Если задать тот же вопрос с другой стороны — что DeepSeek V4 Pro уже умеет делать из того, что Mistral Large 4 только обещает, — это, как выясняется, самый быстрый способ увидеть, что на самом деле добавляет предварительная версия.
Спецификация, бок о бок
Данные по состоянию на 6 октября: показатели Mistral — из её собственного анонса и карточки модели, DeepSeek — из её актуальной записи в каталоге:
• Общее количество против активных параметров — 1,05 трлн всего / 49 млрд активных против 1,6 трлн всего / 49 млрд активных
• Модальности — текст и изображение на входе, текст на выходе против только текста
• Контекстное окно — 1 млн заявлено Mistral, 524 288 в конфигурации, которую тестирует Artificial Analysis, против 1 млн в обслуживании
• Предел вывода — не опубликован для предварительной версии, в отличие от 384K токенов
• Цена за миллион токенов, вход / выход — $1.36 / $4.18 по прайс-листу, сейчас $0.68 / $2.09 по акции, против $0.66 / $1.98
• Кэшированный ввод за миллион — $0,14, сейчас $0,07, против $0,022
• Веса — обещаны к концу октября, лицензия не указана, против доступных уже сейчас
• Инфраструктура обучения — 3 800 GPU NVIDIA Grace Blackwell в собственных европейских дата-центрах Mistral против собственного кластера DeepSeek

Симметрия показателя активации в 49B — это и заголовок, и ловушка. Активные параметры определяют, сколько стоит генерация токена; общие параметры определяют, что модель знает. 1,6T у DeepSeek против 1,05T у Mistral означает, что DeepSeek несёт примерно на 50% больше ёмкости на вычисленный токен — реальное преимущество в работе, требующей больших знаний, и никакого преимущества в задачах, где узкое место — следование инструкциям или использование инструментов.
Что говорит независимый индекс
У обеих моделей есть страницы на Artificial Analysis, что делает это одним из немногих сравнений в серии, где обе стороны измеряются на одном и том же стенде. Intelligence Index v4.3, данные от 6 октября:
• Индекс интеллекта — 38,4 у Mistral Large 4 Preview против 36,0 у DeepSeek V4 Pro 0813
• Стоимость за задачу индексации — $1,13 против $0,67
• Terminal-Bench 4.0 — 26,8 % против 14,1 %
• Humanity's Last Exam — 35,0% против 41,0%
• AutomationBench, бизнес-процессы — 59,9% против 56,7%
• τ²-Bench, агентные сценарии с использованием инструментов — для предварительной версии не опубликовано, в сравнении с 96,2%
• SciCode — 54,2% против 51,0%
Это гораздо более плотная гонка, чем предполагают ценники, и расхождения здесь информативны, а не являются шумом. Mistral Large 4 побеждает в строке агентного программирования почти на тринадцать пунктов, а в строке автоматизации рабочих процессов — с небольшим преимуществом, тогда как DeepSeek V4 Pro побеждает в открытых знаниях на шесть пунктов и стоит на 40% меньше за задачу. Отметьте также, что индекс распределяет затраты по чтению кэша, записи кэша, токенам рассуждения и токенам ответа — кэш Mistral имеет скидку 90%, а кэш DeepSeek — 97%, поэтому две модели с похожими заявленными тарифами оказываются на $1.13 и $0.67 за выполненную задачу.

Где DeepSeek V4 Pro уже одержал победу
Решающее отличие — не бенчмарк. Дело в том, что DeepSeek V4 Pro уже сегодня доступна с открытыми весами, а Mistral Large 4 — это предварительная версия, обслуживаемая из собственного кластера её создателя. Mistral говорит, что веса выйдут в конце октября — это обязательство, а не артефакт. Её организация на Hugging Face, проверенная 6 октября, не содержит ничего новее июля. Пока не появится репозиторий с файлом лицензии, аргумент о самостоятельном развёртывании, который приводит Mistral, принадлежит DeepSeek.
Второе отличие — широта доступности. DeepSeek V4 Pro доступен для маршрутизации с апреля и с большим отрывом является самой используемой моделью в нашем собственном каталоге — 1,13 млрд токенов за последние семь дней на момент написания, против десятков миллионов, которые обрабатывает типичная фронтирная модель. Такой объём значит для покупателя то, чего не значит таблица лидеров: он означает, что режимы отказов известны, характеристики пропускной способности известны, а провайдеры, которые её предоставляют, прошли стресс-тестирование продакшн-трафиком других людей.
DeepSeek также выигрывает по скучной механике. Потолок вывода в 384K против неопубликованного, контекст в 1M, который реально предоставляется, а не просто заявлен, и поддержка только текста, которая делает пропускную способность на длинном контексте предсказуемой. Если ваша нагрузка — это анализ документов, генерация длинных текстов или извлечение знаний из более чем миллиона токенов, DeepSeek V4 Pro дешевле, открытее и более проверен, чем предварительная версия Mistral, по всем параметрам.
Где Mistral Large 4 — более удачный выбор
Mistral тщательно выбирала строки для своих бенчмарков, и разрыв в кодинге не косметический. 26,8% против 14,1% на Terminal-Bench 4.0 — это примерно вдвое больше, и это согласуется с заявлением Mistral о 61,7% на DeepSWE v1.1 и 59,4% на SWE-Atlas-QnA — цифрах, которые, по словам Mistral, Artificial Analysis оценила приватно до публичного запуска харнесса, поэтому их пока нет в публичном индексе. Когда они появятся — или не появятся, — это и решит вопрос о кодинге.
Мультимодальность — второй явный водораздел. Mistral Large 4 нативно принимает изображения, имея выделенный визуальный энкодер на 1,6 млрд параметров, и Mistral заявляет о передовой визуальной привязке среди открытых моделей — называя 42% против 41% у GPT-6 Astra на Dense 200. DeepSeek V4 Pro работает только с текстом, и в его карточке в каталоге это прямо сказано. Любой пайплайн, включающий скриншоты, инженерные чертежи, отсканированные документы или чтение графиков, имеет здесь только одного кандидата, а не двух.
А ещё есть кибербезопасность, где утверждение Mistral резче, чем всё, что публиковал DeepSeek: 82% в тесте Artificial Analysis Cyber Index, который просит модель воспроизвести реальную уязвимость и исправить её, — как утверждается, это самый высокий результат среди всех моделей, — и 93% на соревновательных упражнениях Cybench. Это цифры, приводимые вендором, и их следует обозначать именно так — но они основаны на независимом индексе, а сопоставимый результат DeepSeek не публиковался. Для работы по безопасности честная позиция такова: Mistral Large 4 заявляет о лидерстве, которое не было опровергнуто.
Последнее отличие — юрисдикционное. Mistral обучила модель на 3 800 GPU Grace Blackwell в собственных европейских дата-центрах и там же обслуживает предварительную версию: европейское развёртывание, работающее от начала до конца по европейским законам. Для европейского поднадзорного покупателя, чья альтернатива — китайская модель с открытыми весами или закрытая американская, это отдельная категория.
Цены, если прочитать их правильно.
Ни у одной из моделей цена в прейскуранте не отражает всей картины. В каталожной записи DeepSeek V4 Pro указаны два временных окна — 01:00–04:00 и 06:00–10:00 UTC, — в течение которых указанный тариф умножается, так что нагрузка, попадающая на эти часы, обходится вдвое дороже заявленной цены. $0,68 / $2,09 для Mistral Large 4 — это стартовая промоакция по сравнению с тарифной сеткой $1,36 / $4,18; промоакция — это цена на сегодня, а тарифная сетка — это цена, на которую следует ориентироваться при расчёте счёта.
Там, где OrcaRouter вносит ясность, — это сквозная передача: 0% наценки на прайс-листы провайдеров, а значит, снижение цены поставщиком становится вашим снижением цены в тот же день, а промо-тариф поставщика передаётся дальше, а не поглощается. DeepSeek V4 Pro уже доступен для маршрутизации через один OpenAI-совместимый эндпоинт по тарифу его провайдера, с теми же учётными данными, что и у более чем 200 других моделей, с автоматическим переключением между провайдерами при деградации одного из них. Mistral Large 4 отсутствует в нашем каталоге — предварительная версия доступна через собственный API Mistral и несколько сторонних платформ, — так что если вы хотите запустить обе стороны этого сравнения одновременно уже сегодня, это означает один маршрут через нас и один напрямую.

Какой выбрать?
Если вам нужны веса, которые можно держать у себя, 384K выходных токенов, миллион токенов обслуживаемого контекста, самая низкая в паре стоимость за выполненную задачу и модель, поведение которой другие уже успели сломать в продакшене, DeepSeek V4 Pro — не компромисс: это готовый продукт, а не трейлер. Это правильный выбор по умолчанию для работы с документами, знаниями и длинными текстами, а его открытые веса означают, что потолок возможностей задаёт ваша собственная инфраструктура, а не дорожная карта вендора.
Если ваша рабочая нагрузка — это агентное программирование, если она связана с изображениями, с задачами безопасности или если европейская юрисдикция для вас требование, а не предпочтение, Mistral Large 4 — это модель, ради которой стоит пойти на риск предварительной версии, — и риск ограничен, поскольку Mistral взяла на себя обязательство опубликовать веса и провести окно ред-тиминга с заявленной датой окончания. Направьте на неё часть трафика сейчас, оставьте DeepSeek V4 Pro на остальное и позвольте этим двум решить вопрос архитектуры на ваших данных. Бюджет активации в 49B будет выглядеть одинаково с любой стороны; различается всё, что вокруг него.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
