Une carte de titre principale pour « Qwen 4 Max vs Claude Opus 5 » avec le sous-titre « Le benchmark qui a bougé sous leurs pieds », trois badges pilule indiquant « Révision de l’index v4.3.2 », « 51 vs 53 » et « 5,00 $ et 25,00 $ », et le logo OrcaRouter dans le coin inférieur droit.
Engineering & Research

Qwen 4 Max vs Claude Opus 5 : le benchmark qui a bougé sous leurs pieds

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Qwen 4 Max a été présenté en avant-première lors de la conférence Yunqi à Hangzhou le 22 septembre 2026 — le niveau phare d’une gamme Qwen 4 de quatre modèles qui est annoncée mais pas encore disponible, sans prix, sans fenêtre de contexte et sans score publié. Claude Opus 5 est en disponibilité générale depuis le 24 juillet 2026 à 5,00 $ par million de jetons d’entrée et 25,00 $ par million de jetons de sortie, et il a été la cible visée par chaque modèle phare depuis la sortie de Qwen3.8-Max. La façon évidente d’écrire cette comparaison est une fiche technique avec une colonne vide. La façon utile est de remarquer que le 19 septembre 2026, trois jours avant l’annonce, Artificial Analysis a réévalué son Intelligence Index et Claude Opus 5 a cessé d’être le modèle en tête de celui-ci. Ce seul changement recadre ce que Qwen 4 Max doit battre.

Qu'est-ce qui a changé le 19 septembre

Artificial Analysis a publié la révision v4.3.2 de son indice le 19 septembre 2026. Selon la révision actuelle, Claude Opus 5 obtient un score de 51 sur l'Intelligence Index à son effort de raisonnement maximal — 50 à xhigh, 48 à high, 45 à medium et 39 à low — et il se classe derrière Claude Fable 5.1 et GPT-6 Astra, tous deux à 53. Le coût par tâche sur cet indice est de 5,86 $.

Si cela ressemble à une rétrogradation, ce n’en est pas une. Le modèle n’a pas changé. L’indice, si. Notre propre couverture de juillet et août citait Claude Opus 5 à 61-63 et en tête du tableau, et ces chiffres étaient corrects selon les révisions en vigueur à l’époque. Quiconque les cite encore sans date de révision cite un chiffre retiré, et c’est l’erreur la plus fréquente dans les comparaisons rédigées ce mois-ci. La conséquence pratique est qu’une affirmation comme « Claude Opus 5 est le modèle disponible ayant obtenu le meilleur score » n’est plus vraie, et une comparaison fondée sur elle s’effondre.

Du côté de Qwen, la conséquence est encore plus nette. Un échelon phare annoncé en septembre 2026 vise une cible qui a été redéfinie en septembre 2026. Tout ce qu’Alibaba finira par publier pour Qwen 4 Max sera lu à l’aune d’un classement où 53 est le nombre à battre, et non 63.

A two-column scoreboard titled "Qwen 4 Max vs Claude Opus 5 - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Independent score none exists; Open weights not published. Right column Claude Opus 5: Status generally available; Input price $5.00 per 1M tokens; Output price $25.00 per 1M tokens; Context window 1M tokens; Independent score 51 on index v4.3.2; Open weights none. Footer reads "Claude Opus 5 from Anthropic published pricing and Artificial Analysis index v4.3.2, September 19 2026.", with the OrcaRouter logo bottom-right.

La comparaison, honnêtement formulée

Un côté de ce tableau est complet et l'autre est vide, et prétendre le contraire serait le mode de défaillance même de cet article. Voici ce qui est réellement connu :

• Statut — Claude Opus 5 en disponibilité générale depuis le 24 juillet 2026, contre Qwen 4 Max annoncé le 22 septembre 2026 sans date de sortie

• Prix d’entrée — Claude Opus 5 : 5,00 $ par million de jetons, contre Qwen 4 Max, non publié

• Prix de sortie — Claude Opus 5 : 25,00 $ par million de jetons, contre Qwen 4 Max, non publié

• Entrée mise en cache — Claude Opus 5 0,50 $ par million de jetons lors d'une lecture du cache, contre Qwen 4 Max non publié

• Contexte — Claude Opus 5, 1 M de tokens par défaut comme au maximum, contre Qwen 4 Max, non publié

• Plafond de sortie — Claude Opus 5 : 128K tokens en mode synchrone et 300K sur la Batches API avec un en-tête bêta, contre Qwen 4 Max non publié

• Modalité — Claude Opus 5 : entrée texte, image et fichier avec sortie texte, contre Qwen 4 Max non publié

• Tarification pour contextes longs — Claude Opus 5 n’applique aucun surcoût, donc une requête de 900 000 jetons est facturée au même tarif par jeton qu’une requête de 9 000 jetons, contrairement à Qwen 4 Max, dont les tarifs ne sont pas publiés

• Score indépendant — Claude Opus 5 : 51 à l'Artificial Analysis Intelligence Index v4.3.2 en effort maximal, contre Qwen 4 Max, pour lequel aucune évaluation indépendante n'existe

• Scores rapportés par les fournisseurs — Claude Opus 5 SWE-bench Verified 96,0 %, SWE-bench Pro 79,2 %, OSWorld 2.0 70,6 %, Terminal-Bench 2.1 autour de 85 % selon le harnais, contre Qwen 4 Max, aucune donnée rapportée

• Contrôle du raisonnement — réflexion adaptative de Claude Opus 5 activée par défaut avec une échelle d'effort en cinq niveaux, contre Qwen 4 Max non publié

Dix lignes de « non publié » ne sont pas une figure de rhétorique. C’est l’état des preuves, et la conclusion honnête que l’on peut en tirer est que personne ne peut encore établir de comparaison des capacités entre ces deux modèles.

La partie de l'écart qui ne se refermera pas

Les prix et le contexte finiront par être publiés. Une différence survivra à la sortie, et il vaut la peine de trancher à ce sujet dès maintenant plutôt que dans la semaine où Qwen 4 Max sortira : les deux modèles sont conçus pour être achetés de différentes manières.

Claude Opus 5 est un modèle fermé unique, à un prix unique, proposé par un seul fournisseur, avec un engagement de retrait publié au plus tôt le 24 juillet 2027. C'est une cible stable pour la planification de capacité. Qwen 4 Max est le fleuron d'une famille qu'Alibaba a publiée à plusieurs reprises sur une gamme de prix bien plus large — la génération Qwen 3.8 s'étend d'un fleuron de pointe à 2,00 $ en entrée jusqu'à une gamme Flash bien en dessous — et la gamme phare de la ligne Qwen a historiquement été celle dont la durée de vie utile est la plus courte avant qu'une gamme moins chère ne comble l'écart.

L'autre différence réside dans les poids ouverts, et elle joue en sens inverse. La génération Qwen 3.8 a publié les poids de son plus grand modèle sous une licence Qwen personnalisée, ce qui rend tout simplement possibles le fine-tuning, la quantification et l'auto-hébergement. Claude Opus 5 ne fait l'objet d'aucune publication de poids et n'en fera pas l'objet. Si votre charge de travail exige un modèle que vous pouvez exécuter dans votre propre périmètre, ou modifier, il s'agit d'un avantage structurel qu'aucune révision de benchmark ne peut retirer à Alibaba — et c'est la raison la plus forte de s'intéresser à cette comparaison en particulier plutôt que de la considérer comme un modèle phare opposé à un autre.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, English UI), showing the 1M token context badge, the model ID anthropic/claude-opus-5, a 128K maximum output, text plus image plus file input with text output, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24 credited to Anthropic, a p50 time-to-first-token of 5.75s, the OpenAI-compatible code sample, the Public benchmarks block, and the opening of the model description calling Claude Opus 5 Anthropic flagship for demanding reasoning, coding and long-horizon agentic work.

Comment exécuter cette comparaison aujourd'hui

Claude Opus 5 est désormais disponible, et OrcaRouter le route en tant qu'anthropic/claude-opus-5 au tarif catalogue d'Anthropic, avec 0 % de marge — le tarif du fournisseur est répercuté tel quel, de sorte que les montants de 5,00 $ et 25,00 $ indiqués ci-dessus correspondent à ce qui vous est facturé, et non à un équivalent majoré. Cela compte plus que d'ordinaire pour un modèle de cette gamme de prix : une marge de plateforme de 10 % sur un tarif de sortie de 25,00 $ représente 2,50 $ par million de tokens, soit plus que le coût d'entrée total de la plupart des alternatives à poids ouverts. À ses côtés, le catalogue propose près de 200 modèles sur un seul point de terminaison compatible OpenAI, avec basculement automatique en cas de dégradation d'un chemin fournisseur et un DSL de routage permettant d'exprimer explicitement la politique au lieu de coder en dur un nom de modèle dans votre application.

Ce qu'OrcaRouter ne propose pas, c'est Qwen 4 Max, ni aucun palier de Qwen 4. Le catalogue ne contient aucune entrée pour cette famille, ce à quoi on peut s'attendre pour un modèle annoncé mais non encore publié. Lorsque ces paliers seront effectivement disponibles, ils apparaîtront au même endroit, et d'ici là le modèle Qwen qui vaut la peine d'être comparé à Claude Opus 5 est celui que vous pouvez réellement appeler : Qwen3.8-Max, disponible en général depuis le 3 août 2026 à 2,00 $ en entrée et 6,00 $ en sortie par million de tokens, avec des poids publiés et un score d'intelligence indépendant enregistré de 56 à 1,14 $ par tâche — un chiffre obtenu sous une révision antérieure de l'indice, alors ne le comparez au 51 de Claude Opus 5 qu'en gardant cette réserve à l'esprit.

Que faire de ceci avant qu’une fiche de modèle n’existe

Il n’y a pas de verdict à rendre ici, car l’un des deux modèles n’existe pas en tant que produit. Ce que l’on peut dire, c’est que la comparaison a changé de forme le 19 septembre 2026 sans que l’un ou l’autre des fournisseurs n’ait rien fait : Claude Opus 5 n’est plus le modèle au meilleur score sur l’indice indépendant sur lequel s’appuient la plupart des comparaisons, et il se trouve désormais deux points derrière deux autres modèles. Le lancement de Qwen 4 Max arrivera dans ce tableau-là, pas dans celui de juillet.

Donc, la décision pour les prochains mois n'est pas Qwen 4 Max contre Claude Opus 5. C'est Claude Opus 5 contre le modèle Qwen déjà livré — un modèle phare à un cinquième du prix d'entrée, avec des poids publiés — et cette comparaison est disponible dès maintenant, avec de vrais chiffres des deux côtés. Réexaminez-la quand Alibaba publiera une fiche de modèle, et considérez tout tableau de benchmarks de Qwen 4 Max que vous verriez d'ici là comme non vérifié.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the OpenAI-compatible Python code sample, and the model description naming Qwen3.8-Max Alibaba newest flagship and highest-capability tier to date.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement