Сгенерированная титульная карточка для статьи «Mistral Large 4 vs Gemini 3.1 Pro», на которой заголовок показан жирным геометрическим шрифтом без засечек, под ним — подзаголовок «Восемь месяцев, два направления», а выше — ряд из трёх плоских линейных иконок: страница календаря, окно терминала и рамка изображения — на белом фоне с сине-голубыми градиентными акцентами и логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Mistral Large 4 против Gemini 3.1 Pro: восемь месяцев, два направления

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Gemini 3.1 Proнаходится на рынке с 19 февраля 2026 года и по-прежнему занимает одно из первых мест в любой общей таблице возможностей, включая те, где его сравнивают с моделями, выпущенными этой осенью. Mistral Large 4существует максимум три недели — это предварительная версия, анонсированная 6 октября 2026 года, с обещанными весами к концу октября и без указания лицензии. По индексу интеллекта Artificial Analysis, прочитанному 6 октября, восьмимесячный Gemini 3.1 Pro набирает 29,7 против 38,4 у новичка. Это честная отправная точка для данного сравнения, и она противоположна тому, на что указывают даты выпуска.

Объяснение не таинственно. Gemini 3.1 Pro — это флагман линейки предварительных версий, который Google так и не перевёл в статус стабильного релиза, а на странице Artificial Analysis он обозначен как «Gemini 3.1 Pro Preview» — на той же странице, где более низкий индекс соседствует с результатом GPQA Diamond топового уровня. Это модель, созданная для широты охвата: очень большое контекстное окно, широкий набор модальностей и рассуждения, сильные в вопросах на знания. Mistral Large 4 создана для совершенно иной карты мира, и цена у неё соответствующая.

Что представляет собой каждый

Gemini 3.1 Pro — это передовая мультимодальная модель рассуждений от Google, идентификатор API — gemini-3.1-pro-preview, с контекстным окном на 1 048 576 токенов и потолком вывода в 65 536 токенов. Она принимает текст, изображения, видео, аудио и файлы. Она предоставляется из каталога OrcaRouter по собственным тарифам Google. В документации Google не указано никакой версии Gemini 3.1 Pro без пометки preview; название preview — это и есть продукт.

Mistral Large 4 — это разреженная смесь экспертов с 1,05 триллиона параметров, 49 миллиардами активных параметров и выделенным визуальным кодировщиком на 1,6 миллиарда параметров, предлагаемая как «Mistral Large 4 Preview» под API-идентификатором mistral-large-4-0. В документации Mistral указано окно контекста в 1 млн токенов; Artificial Analysis указывает 524 288 на тестируемой конфигурации. Максимальный объём вывода не опубликован. Mistral описывает её как свою самую крупную и самую способную модель на сегодняшний день и сообщает, что веса появятся в конце октября.

Цифры, с приложенной к ним информацией об их происхождении

У обеих моделей есть отдельные страницы, поэтому приведённое ниже сравнение проводится в одинаковых условиях, а не между разными производителями:

• Индекс интеллекта v4.3 — Mistral Large 4 Preview 38,4 против Gemini 3.1 Pro 29,7

• Стоимость одной задачи индексации — $1.13 против $1.30

• Рассуждение с длинным контекстом — 81,3% против 82,0%

• GPQA Diamond — не опубликовано для предварительной версии против 94,1%

• Humanity's Last Exam — 35,0% против 47,0%

• Terminal-Bench 4.0 — 26,8% против 4,0%

• SciCode — 54,2% против 58,7%

• AutomationBench, бизнес-процессы — 59,9% против 35,4%

• MMMU-Pro, мультимодальное рассуждение — 76.4% против 82.4%

• Контекстное окно — заявлено 1 млн / протестировано 524 288 против 1 048 576 обслуживаемых

• Потолок вывода — не опубликован против 65 536 токенов

• Цена за миллион, ввод / вывод — $1.36 / $4.18 по прайс-листу, $0.68 / $2.09 по промоакции, против $2.00 / $12.00 при менее 200 тыс. токенов и $4.00 / $18.00 при более 200 тыс. токенов

• Веса — обещаны, лицензия не указана, против проприетарных

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

Самая поразительная строка — Terminal-Bench 4.0. Gemini 3.1 Pro набирает 4,0% — это не опечатка и не галлюцинация в таблице: она отражает модель, выпущенную в феврале, которую запускают на стенде для терминальных агентов, появившемся позже неё. 26,8% у Mistral Large 4 — в шесть раз выше в том же тесте. Тот, кто списал Gemini со счетов из-за старой цифры по агентному программированию, должен снова принять её в расчёт на основании показателя GPQA Diamond, а тому, кто списал Mistral со счетов из-за места в индексе, стоит сначала взглянуть на строку с терминалом.

Где Gemini 3.1 Pro всё ещё удерживает преимущество

Знания и широта. 94,1% на GPQA Diamond — самый высокий показатель во всей этой статье, у любой из сторон, и это научный бенчмарк уровня выпускника, а не число, которое модель может вытянуть разговорами. Humanity's Last Exam — 47,0% против 35,0%, а также результат SciCode, который немного опережает новичка, говорят о том же. Если ваша нагрузка — это точные ответы на сложные вопросы на основе корпуса знаний, Gemini 3.1 Pro остаётся более сильной моделью и через восемь месяцев после выпуска.

Широта модальностей — второе преимущество. Gemini 3.1 Pro принимает видео и аудио, а также текст и изображения. Mistral Large 4 принимает текст и изображения. Если ваш конвейер обрабатывает записанные встречи, записи экрана или аудио с датчиков, только одна модель здесь способна увидеть весь вход целиком.

Потолок вывода — третий. 65 536 токенов — это опубликованный и гарантированный потолок; Mistral не опубликовала его для третьего. Ничто в посте о запуске не выйдет вам боком в продакшене с большей вероятностью, чем необъявленный лимит вывода.

А контекстное окно Gemini действительно предоставляется в объёме 1 048 576 токенов, тогда как 1M у Mistral — это заявленная вендором цифра против независимо измеренных 524 288. Для рабочей нагрузки, которая находится у дальнего края окна, разница между заявленным и измеренным числом — это переписывание.

Где Mistral Large 4 меняет решение

Агентная работа — и особенно всё, что связано с терминалом, — это именно то, где две модели перестают быть сопоставимыми. В собственном анонсирующем посте Mistral объединяет 61,7% на DeepSWE v1.1, 59,4% на SWE-Atlas-QnA и 28,3% на Terminal-Bench 4.0 в Coding Agent Index на уровне 49,8% и прямо заявляет, что по этому совокупному показателю опередила DeepSeek V4 Pro 0813 и Qwen3.8 Max. Эти три цифры, по словам Mistral, — числа, которые Artificial Analysis оценила в закрытом режиме до того, как её харнесс стал публичным; их ещё нет в публичном индексе, и до тех пор, пока они там не появятся, их следует помечать как опубликованные вендором.

Независимые свидетельства указывают в том же направлении. В AutomationBench — 657 бизнес-процессов, охватывающих Gmail, Sheets, Slack и Salesforce — Mistral Large 4 набирает 59,9%, опережая Kimi K3, MiMo-V2.6-Pro и DeepSeek V4 Pro, а на том же стенде Gemini 3.1 Pro вообще не фигурирует, поскольку бенчмарк появился позже него. Слепое исследование с участием людей, проведённое Surge AI, поставило Mistral Large 4 Preview на второе место из пяти моделей по качеству кодинга с оценкой 3,74, опередив GLM-5.3 и Kimi K3 и уступив только Claude Opus 5.

Заявление о кибербезопасности — самое резкое в посте Mistral, и его стоит привести точно: 82% в тесте Artificial Analysis Cyber Index, который требует от модели воспроизвести реальную уязвимость, а затем исправить её, описывается как самый высокий показатель среди всех моделей, а также 93% в 40 соревновательных упражнениях Cybench и утверждение Mistral о том, что модель входит в мировую пятёрку лучших по Cyber Index в целом, лидируя среди моделей с открытыми весами, разработанных за пределами Китая. Это цифры, приведённые производителем, по независимому индексу. Их практическое преимущество в том, что Mistral создала модель, чтобы выполнять эту работу, а не отказываться от неё.

Самая дешёвая строка в таблице тоже принадлежит Mistral, но лишь с небольшим отрывом: 1,13 доллара за задачу против 1,30 — преимущество в 13 %, которое создаёт промотариф, а тарифная сетка его сведёт на нет. Gemini 3.1 Pro — это модель 2026 года по ценам 2026 года, и выполнить на ней задачу индексации недорого.

Тай-брейкер, который никто не бенчмаркает

Есть два фактора, которые таблицы не могут показать. Первый — лицензирование. Gemini 3.1 Pro является проприетарным и останется таким; Mistral Large 4 — это предварительная версия, весь смысл которой в том, что она станет загружаемым артефактом, который вы сможете запускать в рамках своей собственной политики, на своём оборудовании, по европейскому законодательству — Mistral обучила её на 3800 GPU Grace Blackwell в своих дата-центрах и предоставляет доступ к превью там же. Этот аргумент не стоит ничего, пока не появится репозиторий и у лицензии не будет названия. В тот день, когда это произойдёт, он будет стоить очень многого.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Второй — операционный риск. Предварительная версия, которая всё ещё дорабатывается, будет меняться у вас под руками. В OrcaRouter обе стороны этого сравнения доступны через одну совместимую с OpenAI конечную точку по прейскурантным ценам провайдеров с наценкой 0%: Gemini 3.1 Pro уже в каталоге по тарифам Google, тогда как Mistral Large 4 приходится подключать через собственный API Mistral и несколько сторонних платформ, поскольку мы такой маршрут не предоставляем. Полезная вещь здесь — DSL маршрутизации: направляйте классификацию и извлечение в ту модель, что дешевле на этой неделе, эскалируйте сложные остатки, и пусть автоматическое переключение при сбоях поглощает плохие дни предварительной версии, а не ваша дежурная ротация.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

Вердикт

Спросите, какова рабочая нагрузка, а не какая модель лучше. Для работы со знаниями, ввода аудио и видео, гарантированного потолка вывода и обслуживаемого окна в миллион токенов Gemini 3.1 Pro по-прежнему остаётся более сильной моделью, и её возраст — не недостаток: это восемь месяцев, в течение которых другие находили её границы. Для агентного программирования, работы в терминале и операций по безопасности Mistral Large 4 опережает с отрывом, достаточно большим, чтобы рейтинг в индексе вводил в заблуждение, и это единственная из двух, которая может оказаться пригодной для самостоятельного хостинга.

Решающий фактор, за которым стоит следить, — конец октября. Если веса выйдут под разрешительной лицензией, Mistral Large 4 перестанет конкурировать с Gemini 3.1 Pro по цене и начнёт конкурировать с ним по контролю, а это уже совсем другой бой. Если они выйдут под ограничительной, ответ этой статьи не сильно изменится — но причина изменится.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно