Une carte de titre générée pour l’article « Mistral Large 4 vs Gemini 3.1 Pro », affichant le titre en sans-serif géométrique gras, le sous-titre « Huit mois, deux directions » en dessous, et une rangée de trois icônes plates au trait au-dessus — une page de calendrier, une fenêtre de terminal et un cadre d’image — sur un fond blanc avec des accents dégradés bleu et cyan et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Mistral Large 4 vs Gemini 3.1 Pro : Huit mois, deux directions

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 3.1 Pro est sur le marché depuis le 19 février 2026 et figure encore parmi les meilleurs de tous les tableaux de capacités générales, y compris ceux où il est comparé à des modèles sortis cet automne. Mistral Large 4 a tout au plus trois semaines — un aperçu annoncé le 6 octobre 2026, dont les poids sont promis pour la fin octobre et dont la licence n'est pas nommée. Dans l'Intelligence Index d'Artificial Analysis, consulté le 6 octobre, le Gemini 3.1 Pro, âgé de huit mois, obtient 29,7 contre 38,4 pour le nouveau venu. C'est le point de départ honnête de cette comparaison, et c'est l'inverse de ce que suggèrent les dates de sortie.

L'explication n'a rien de mystérieux. Gemini 3.1 Pro est un fleuron de la gamme preview que Google n'a jamais promu en version stable, et la page qu'Artificial Analysis lui consacre est intitulée « Gemini 3.1 Pro Preview » — la même page où un indice inférieur côtoie un GPQA Diamond de tout premier ordre. C'est un modèle conçu pour la largeur de couverture : une très grande fenêtre de contexte, un large éventail de modalités et un raisonnement solide sur les questions de connaissances. Mistral Large 4 est conçu pour une carte du monde entièrement différente, et son prix est fixé en conséquence.

Ce que chacun est

Gemini 3.1 Pro est le modèle de raisonnement multimodal de pointe de Google, identifiant API gemini-3.1-pro-preview, avec une fenêtre de contexte de 1 048 576 jetons et un plafond de sortie de 65 536 jetons. Il accepte le texte, les images, la vidéo, l'audio et les fichiers. Il est servi depuis le catalogue d'OrcaRouter aux tarifs pratiqués par Google. La documentation de Google ne répertorie aucun Gemini 3.1 Pro hors preview ; le nom preview est le produit.

Mistral Large 4 est un modèle clairsemé à mélange d'experts (mixture-of-experts) de 1,05 billion de paramètres, avec 49 milliards de paramètres actifs et un encodeur visuel dédié de 1,6 milliard de paramètres, proposé sous le nom de « Mistral Large 4 Preview » avec l'identifiant d'API mistral-large-4-0. La documentation de Mistral indique une fenêtre de contexte de 1 M de tokens ; Artificial Analysis relève 524 288 sur la configuration qu'elle teste. Le nombre maximal de tokens en sortie n'est pas publié. Mistral le décrit comme son modèle le plus grand et le plus performant à ce jour et indique que les poids seront disponibles fin octobre.

Les chiffres, accompagnés de leur provenance.

Les deux modèles disposent de pages indépendantes ; la comparaison ci-dessous relève donc d'un même banc d'évaluation, et non d'un face-à-face entre fournisseurs :

• Indice d’intelligence v4.3 — Mistral Large 4 Preview 38,4 vs Gemini 3.1 Pro 29,7

• Coût par tâche d'indexation : 1,13 $ vs 1,30 $

• Raisonnement à long contexte — 81,3 % vs 82,0 %

• GPQA Diamond — non publié pour la préversion vs 94,1 %

• Humanity's Last Exam — 35,0 % vs 47,0 %

• Terminal-Bench 4.0 — 26,8 % contre 4,0 %

• SciCode — 54,2 % vs 58,7 %

• AutomationBench, flux de travail métier — 59,9 % vs 35,4 %

• MMMU-Pro, raisonnement multimodal — 76,4 % vs 82,4 %

• Fenêtre de contexte — 1 M annoncé / 524 288 testés vs 1 048 576 servis

• Plafond de sortie — non publié vs 65 536 jetons

• Prix par million, entrée / sortie — 1,36 $ / 4,18 $ tarif catalogue, 0,68 $ / 2,09 $ tarif promotionnel, contre 2,00 $ / 12,00 $ en dessous de 200 K tokens et 4,00 $ / 18,00 $ au-dessus

• Poids — licence non nommée, vs propriétaire

A generated two-column scoreboard titled 'Mistral Large 4 vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mistral Large 4 Preview': Intelligence Index v4.3 38.4; cost per index task $1.13; Terminal-Bench 4.0 26.8%; GPQA Diamond not published; MMMU-Pro 76.4%; AutomationBench 59.9%. Right column 'Gemini 3.1 Pro': Intelligence Index v4.3 29.7; cost per index task $1.30; Terminal-Bench 4.0 4.0%; GPQA Diamond 94.1%; MMMU-Pro 82.4%; AutomationBench 35.4%.

La ligne la plus marquante est Terminal-Bench 4.0. Gemini 3.1 Pro obtient 4,0 % — ce n’est pas une faute de frappe, et ce n’est pas une hallucination dans le tableau : cela reflète un modèle de février exécuté sur un harnais d’agent terminal qui lui est postérieur. Les 26,8 % de Mistral Large 4 sont six fois plus élevés sur le même test. Quiconque a écarté Gemini sur la base d’un ancien score de codage agentique devrait le réintégrer sur la base de son GPQA Diamond, et quiconque a écarté Mistral en raison de son rang dans l’indice devrait d’abord regarder la ligne terminal.

Là où Gemini 3.1 Pro garde encore l'avantage

Connaissances et étendue. Un score de 94,1 % à GPQA Diamond est le chiffre le plus élevé de tout cet article, d’un côté comme de l’autre, et il s’agit d’un benchmark scientifique de niveau troisième cycle — pas un chiffre auquel un modèle parvient en baratinant. Humanity’s Last Exam à 47,0 % contre 35,0 %, et un score SciCode qui devance de peu le nouveau venu, racontent la même histoire. Si votre charge de travail consiste à répondre avec précision à des questions difficiles à partir d’un corpus de connaissances, Gemini 3.1 Pro reste le modèle le plus solide huit mois après sa sortie.

L'étendue des modalités est le deuxième avantage. Gemini 3.1 Pro prend en charge la vidéo et l'audio ainsi que le texte et les images. Mistral Large 4 prend en charge le texte et les images. Si votre pipeline ingère des réunions enregistrées, des enregistrements d'écran ou de l'audio de capteurs, un seul modèle ici peut voir l'intégralité de l'entrée.

Le plafond de sortie est le troisième. 65 536 jetons est un plafond publié et garanti ; Mistral n’en a publié aucun pour l’aperçu. Rien dans un article de lancement n’est plus susceptible de vous poser problème en production qu’une limite de sortie non précisée.

Et la fenêtre de contexte de Gemini est réellement servie à 1 048 576 jetons, alors que le 1 M de Mistral est le chiffre annoncé par le fournisseur face à 524 288 mesurés indépendamment. Pour une charge de travail qui se situe à l’extrémité de la fenêtre, la différence entre un chiffre déclaré et un chiffre mesuré équivaut à une réécriture.

Là où Mistral Large 4 change la décision

Le travail agentique, et plus précisément tout ce qui touche à un terminal, est le domaine où les deux modèles cessent d'être comparables. Le propre article de lancement de Mistral regroupe 61,7 % sur DeepSWE v1.1, 59,4 % sur SWE-Atlas-QnA et 28,3 % sur Terminal-Bench 4.0 dans un Coding Agent Index de 49,8 %, et affirme clairement qu'il se classe devant DeepSeek V4 Pro 0813 et Qwen3.8 Max sur cette mesure combinée. Ces trois chiffres sont, selon les mots de Mistral, des nombres qu'Artificial Analysis a évalués en privé avant que son harnais ne soit public ; ils ne figurent pas encore sur l'index public et devraient être étiquetés comme publiés par le fournisseur tant que ce n'est pas le cas.

Des preuves indépendantes convergent dans le même sens. Sur AutomationBench — 657 flux de travail professionnels couvrant Gmail, Sheets, Slack et Salesforce — Mistral Large 4 obtient 59,9 %, devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro, et sur le même harnais d'évaluation, Gemini 3.1 Pro n'apparaît pas du tout parce que le benchmark lui est postérieur. Une étude humaine en aveugle menée par Surge AI a classé Mistral Large 4 Preview deuxième sur cinq modèles pour la qualité du code, avec une note de 3,74, devant GLM-5.3 et Kimi K3, et derrière seulement Claude Opus 5.

L’affirmation en matière de cybersécurité est la plus percutante dans le post de Mistral et mérite d’être citée précisément : 82 % au test Cyber Index d’Artificial Analysis, qui demande à un modèle de reproduire une vulnérabilité réelle puis de la corriger, décrit comme le plus élevé de tous les modèles, avec 93 % aux 40 exercices de compétition de Cybench, et l’affirmation de Mistral selon laquelle il se classe dans le top cinq mondial au Cyber Index global tout en étant en tête des modèles à poids ouverts développés hors de Chine. Ce sont des chiffres cités par le fournisseur sur un indice indépendant. Leur avantage pratique est que Mistral a conçu le modèle pour faire le travail plutôt que pour le refuser.

La ligne la moins chère du tableau appartient elle aussi à Mistral, mais de justesse : 1,13 $ par tâche contre 1,30 $, un avantage de 13 % que le tarif promotionnel produit et que la grille tarifaire effacerait. Gemini 3.1 Pro est un modèle de 2026 avec une tarification de 2026, et il n’est pas coûteux d’y exécuter une tâche d’index.

Le départage que personne ne mesure

Deux choses entrent en jeu que les tableaux ne peuvent pas montrer. La première, c'est la question des licences. Gemini 3.1 Pro est propriétaire et le restera ; Mistral Large 4 est une preview dont tout l'argumentaire repose sur sa transformation en artefact téléchargeable que vous pourrez exécuter selon votre propre politique, sur votre propre matériel, sous la loi européenne — Mistral l'a entraîné sur 3 800 GPU Grace Blackwell dans ses propres centres de données et y sert la preview. Cet argument ne vaut rien tant que le dépôt n'apparaît pas et que la licence n'a pas de nom. Il vaudra beaucoup le jour où ce sera le cas.

A screenshot of Mistral's own documentation, the Models Overview page at docs.mistral.ai, showing the GENERALIST MODELS card grid with 'Mistral Large 4' listed at v26.10 as 'A state-of-the-art, open-weight, general-purpose multimodal model' and no licence badge, beside a Mistral Large 3 card at v25.12 carrying an APACHE 2.0 badge. Mistral Small 4, Mistral Medium 3.5, Z.ai GLM 5.3 and the Ministral 3 sizes are also visible.

Le deuxième est le risque opérationnel. Une préversion encore en cours d’affinage changera sous vos pieds. Sur OrcaRouter, les deux côtés de cette comparaison sont accessibles via un seul point de terminaison compatible OpenAI, aux prix catalogue des fournisseurs et avec 0 % de marge — Gemini 3.1 Pro est disponible dans le catalogue aux tarifs de Google, tandis que Mistral Large 4 doit être joint via l’API propre à Mistral et plusieurs plateformes tierces, puisqu’il ne s’agit pas d’une route que nous proposons. Le DSL de routage est l’élément utile ici : envoyez la classification et l’extraction au modèle le moins cher cette semaine-là, escaladez les cas difficiles restants, et laissez le basculement automatique absorber les mauvais jours de la préversion plutôt que votre rotation d’astreinte ne les absorbe.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the preview model identity, a 1M-token context window, a 65K maximum output, inputs of audio, file, image, text and video with text output, the 2026-02-19 release date, a p-50 time-to-first-token figure of 10.00 seconds, pricing of $2.00 per million input and $12.00 per million output, and a code sample against the api.orcarouter.ai base URL.

Le verdict

Demandez quelle est la charge de travail, pas quel modèle est meilleur. Pour le travail intellectuel, les entrées audio et vidéo, un plafond de sortie garanti et une fenêtre d'un million de jetons réellement servie, Gemini 3.1 Pro reste le modèle le plus solide, et son ancienneté n'est pas un défaut — ce sont huit mois durant lesquels d'autres ont exploré ses limites. Pour le codage agentique, le travail en terminal et les opérations de sécurité, Mistral Large 4 est en avance d'une marge suffisamment large pour que son rang dans l'index soit trompeur, et c'est le seul des deux qui pourrait finir par être auto-hébergeable.

Le critère décisif à surveiller est la fin du mois d’octobre. Si les poids arrivent sous une licence permissive, Mistral Large 4 cesse de concurrencer Gemini 3.1 Pro sur le prix et commence à le concurrencer sur le contrôle, et c’est un combat différent. S’ils arrivent sous une licence restrictive, la réponse de cet article ne change pas beaucoup — mais la raison, si.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement