
Mistral Large 4 vs Claude Opus 5 : L'écart est plus petit que l'écart de prix
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 151 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 120 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le seul chiffre de comparaison directe que quiconque ait publié pour Mistral Large 4 face à Claude Opus 5 provient d'une évaluation humaine en aveugle, et il est plus serré que ne le suggèrent les tableaux de benchmarks. Surge AI a masqué l'identité des modèles et demandé à des annotateurs professionnels de noter les sorties de code sur une échelle de 1 à 5 ; Claude Opus 5 a terminé premier à 4,22 et Mistral Large 4 Preview deuxième à 3,74, devant Kimi K3, GLM-5.3 et GLM-5.2. Sur l'agrégat indépendant, les deux ne sont pas du tout voisins — 50,8 contre 38,4 sur l'Intelligence Index d'Artificial Analysis, relevé le 6 octobre. Ce qui rend cette paire digne qu'on y consacre un après-midi, c'est que le modèle qui obtient 12 points de moins coûte environ un cinquième du prix pour exécuter une tâche.
Les deux chiffres doivent être accompagnés de leur provenance, car ce ne sont pas des chiffres de même nature. L’évaluation de Surge AI est une étude humaine tierce que Mistral a commandée et publiée — une forme de preuve plus solide qu’un benchmark réalisé en interne, et néanmoins une étude dont Mistral contrôlait la publication. Les scores de l’indice proviennent des propres exécutions d’Artificial Analysis, comparables entre elles, et constituent donc la bonne paire à partir de laquelle raisonner. Aucun des deux ne vous dit sur quel modèle bâtir ; ensemble, ils encadrent la question.
Deux produits, pas deux générations d’un même.
Claude Opus 5 est un modèle phare à poids fermés du fournisseur, publié le 24 juillet 2026, doté d’une fenêtre de contexte de 1 M de tokens et pouvant produire jusqu’à 128 K de tokens, à 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, avec des lectures en cache à 0,50 $. C’est le modèle le plus performant du fournisseur dans la gamme Opus, clairement positionné sur le travail agentique à long horizon — restant cohérent au fil de sessions à plusieurs étapes avec un usage intensif d’outils.
Mistral Large 4 est un aperçu, annoncé le 6 octobre 2026, que Mistral décrit comme un mélange d'experts creux de 1,05 billion de paramètres avec 49 milliards de paramètres actifs et un encodeur visuel de 1,6 milliard de paramètres. Son identifiant d'API est mistral-large-4-0, il est nativement multimodal, et la documentation de Mistral lui attribue une fenêtre de contexte de 1 M de tokens, tandis qu'Artificial Analysis relève 524 288 sur la configuration qu'elle teste. Les poids sont promis pour la fin octobre et la licence n'a pas été nommée.
Il ne s’agit donc pas d’un modèle plus récent face à un modèle plus ancien. C’est un modèle de pointe propriétaire face à un challenger destiné à être à poids ouverts, et les deux sont tarifés en conséquence.

Le même index, les deux modèles
Lu le 6 octobre sur leurs pages Artificial Analysis, sur l'Intelligence Index v4.3 :
• Indice d'intelligence — Mistral Large 4 Preview 38,4 vs Claude Opus 5 50,8
• Coût par tâche d'indexation — 1,13 $ pour Mistral Large 4 Preview contre 5,86 $ pour Claude Opus 5
• Terminal-Bench 4.0 — 26,8 % vs 49,0 %, le plus grand écart entre eux
• Humanity's Last Exam — 35,0 % contre 54,9 %
• MMMU-Pro, raisonnement multimodal — 76,4 % vs 84,7 %
• AutomationBench, workflows métier — 59,9 % vs 56,6 %, la seule ligne où Mistral Large 4 est en tête
• Fenêtre de contexte — 1 M annoncé par Mistral et 524 288 sur la configuration testée, contre 1 M servi
• Plafond de sortie — non publié pour l’aperçu vs 128K tokens
• Prix par million, entrée / sortie — 1,36 $ / 4,18 $ tarif public, actuellement 0,68 $ / 2,09 $ en promotion, contre 5,00 $ / 25,00 $

Le schéma est lisible. Opus 5 est en tête sur les deux lignes les plus difficiles à forte composante de raisonnement — le travail en terminal et la connaissance ouverte — et en tête sur la compréhension multimodale, bien que Mistral Large 4 soit le modèle vendu pour sa vision. Mistral Large 4 mène la ligne d’automatisation des flux de travail, qui est la ligne la plus proche de ce qu’une unité d’affaires demande réellement à un modèle, et il le fait à un cinquième du prix par tâche.
Là où Mistral Large 4 gagne vraiment
L’affirmation la plus intéressante dans le post de lancement de Mistral n’est pas un score de benchmark. C’est que, sur l’un des tests de l’Artificial Analysis Cyber Index — reproduire une vulnérabilité réelle dans un logiciel open source, puis la corriger —, Mistral Large 4 obtient 82 %, un score présenté comme le plus élevé de tous les modèles, et que plusieurs grands modèles fermés obtiennent un score proche de zéro au même test parce qu’ils refusent la tâche. Mistral cite Claude Opus 5.5 et GPT-6 Astra comme exemples de ce refus.
Il s'agit d'une interprétation de fournisseur d'un chiffre cité par le fournisseur, et il convient de la lire comme telle. C'est aussi une différence opérationnelle réelle si elle se vérifie : un modèle qui ne reproduit pas une vulnérabilité ne peut pas servir à prouver qu'elle est réelle, ce qui est la première étape de la plupart des interventions en cas d'incident. Mistral associe les 82 % à un score de 93 % aux 40 exercices de compétition de Cybench et à une contre-affirmation selon laquelle son taux de refus sur les invites cyber tirées de JailbreakBench, StrongREJECT et AgentHarm est plus élevé que celui des autres modèles à poids ouverts — l'argument étant que l'on veut la capacité et la discipline dans le même modèle plutôt que d'échanger l'une contre l'autre.
Au-delà du cyber, l’argumentaire en faveur de Mistral Large 4 repose sur trois choses qu’Opus 5 n’offre pas. Il est entraîné et servi sur une infrastructure européenne, sous le droit européen, ce qui compte pour les acheteurs ayant des obligations de résidence des données. Il sera, promet Mistral, téléchargeable — l’objectif même de tout l’exercice, puisque c’est le déploiement autonome qui élimine le risque d’accès en cours d’incident que Mistral s’efforce de décrire. Et il est suffisamment bon marché par tâche pour que l’utiliser en première passe et faire remonter les cas difficiles restants vers un modèle de pointe soit économiquement judicieux, plutôt qu’une erreur d’arrondi.
Là où Claude Opus 5 justifie encore son prix
Un écart de 12 points d'indice n'est pas négligeable, et le détail ligne par ligne indique où il se situe. Terminal-Bench 4.0 est presque du double — 49,0 % contre 26,8 % — et le travail en terminal est le proxy public le plus proche du codage agentique, ce qui représente l'essentiel de ce pour quoi les équipes achètent des modèles de pointe cette année. Humanity's Last Exam les sépare de 20 points. En matière d'autonomie à long horizon, la conception du raisonnement adaptatif d'Opus 5, son plafond de sortie de 128K et un contexte servi de 1M constituent la configuration qu'il vous faut si votre charge de travail correspond à une session d'agent de plusieurs heures plutôt qu'à une seule question difficile.
Le plafond de sortie est la différence la plus discrète. Mistral n'a pas publié de longueur de sortie maximale pour la preview, et le 128K d'Opus 5 lève une véritable contrainte pour la génération de code et les longs documents structurés. Si votre pipeline produit des fichiers plutôt que des réponses, vérifiez ce chiffre avant de basculer, car c'est le genre d'écart qui n'apparaît qu'en production.
Le coût par tâche est le chiffre à retenir
Les prix par token flattent les modèles bon marché et donnent une image trompeuse des modèles coûteux. Le coût par tâche propre à l’indice — la dépense totale pour accomplir une tâche d’évaluation, cache compris — est le chiffre qui résiste au contact d’un budget : 1,13 $ contre 5,86 $.
Ce n'est pas une autorisation de tout transférer vers le modèle le moins cher, car une tâche que le modèle bon marché échoue est une tâche que vous payez deux fois. C'est une autorisation de cesser de considérer un seul modèle de pointe comme la seule option. Sur OrcaRouter, Claude Opus 5 figure au catalogue au prix catalogue du fournisseur, avec 0 % de marge, dans le même point de terminaison compatible OpenAI que plus de 200 autres modèles, ce qui fait d'un pipeline à deux modèles le travail d'un après-midi plutôt qu'un second contrat avec un fournisseur. Mistral Large 4 n'est pas au catalogue aujourd'hui — l'aperçu est accessible via l'API propre à Mistral et plusieurs plateformes tierces. Lorsque ses poids seront disponibles et qu'un fournisseur l'hébergera, la même règle de répercussion s'appliquera : ce que le fournisseur facture est ce qui vous est facturé, et une baisse de prix du fournisseur apparaît sur votre facture le jour même.

Pour un aperçu non éprouvé, la fonctionnalité de routage qui compte le plus est le basculement. Envoyer une fraction du trafic de production vers Mistral Large 4 pendant qu'Opus 5 assure le reste signifie qu'une régression se transforme en reroutage plutôt qu'en panne, et vous découvrez les vrais modes de défaillance du modèle sur vos propres données plutôt que sur un classement.
Qu’est-ce qui résout cela en trois semaines ?
Trois faits restent en suspens, et chacun d’eux fait pencher la réponse. Si les poids arrivent sous une licence permissive, Mistral Large 4 devient le seul modèle de cette paire que vous pouvez auto-héberger, et le calcul pour les acheteurs soumis à réglementation bascule nettement. Si la tarification promotionnelle de 0,68 $ / 2,09 $ revient à 1,36 $ / 4,18 $ sur la grille tarifaire, l’écart par tâche se réduit mais reste décisif. Et si Artificial Analysis transpose tels quels les chiffres de codage évalués en privé dans son indice public, le récit autour du codage devient vérifié par un tiers plutôt que publié par le fournisseur au nom d’un tiers.
En attendant : Opus 5 est la valeur sûre par défaut en production et justifie son prix multiple pour les travaux agentiques et à forte utilisation du terminal. Mistral Large 4 est le pari intéressant — assez bon marché par tâche pour tourner à ses côtés, assez capable en automatisation et en cybersécurité pour générer du trafic dès aujourd'hui, et porteur d'une promesse d'auto-déploiement qu'aucun modèle fermé de cette comparaison ne peut égaler.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
