Carte hero intitulée Claude Sonnet 5.5 vs Qwen3.8 Max, sous-titrée six semaines, deux niveaux, un verdict sur le coût, avec des pastilles indiquant entrée 2 $ les deux, sortie 10 $ vs 6 $, et Indice 56 vs 45, et un pied de page citant Artificial Analysis v4.3.2 et les tarifs des fournisseurs.
Guides & Insights

Claude Sonnet 5.5 vs Qwen3.8 Max : six semaines, deux niveaux, un verdict sur le coût

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Faites le calcul sur trois prompts et la comparaison se résout en grande partie avant même d’atteindre les benchmarks. Un court appel de réponse au support : 2 000 tokens en entrée, 500 en sortie. Sur Qwen3.8 Max à 2 $ par million en entrée et 6 $ par million en sortie, cela fait quatre dixièmes de centime ; sur Claude Sonnet 5.5 à 2 $ et 10 $, cela fait neuf dixièmes. Une refactorisation de dépôt : 400 000 en entrée, 30 000 en sortie — quarante-trois centimes contre quatre-vingt-trois. Une longue session agentique qui dépense réellement son budget : deux millions de tokens en entrée, 200 000 en sortie, soit 5,20 $ contre 6,30 $ une fois que les chiffres deviennent suffisamment grands pour que le côté entrée domine.

L’écart qui commence comme une différence de 2,25× sur le prix de sortie se réduit à environ 1,2× à l’échelle agentique, et cette mise à l’échelle n’est pas une curiosité. Qwen3.8 Max et Claude Sonnet 5.5 sont tous deux des modèles à 1 M de tokens avec de lourds plafonds de sortie, tous deux facturés à 2 $ par million en entrée, et tous deux sortis à huit semaines d’intervalle — celui du fournisseur le 3 août 2026 avec une mise à jour datée le 2 septembre, celui d’Anthro​pic le 28 septembre. La différence entre eux ne tient pas à la grille tarifaire. Elle tient à ce que chacun dépense pour finir.

Qu'est-ce qui a été livré, et quand ?

Qwen3.8 Max est le niveau de capacité le plus élevé d'Alibaba à ce jour. Alibaba le positionne directement face à GPT-5.5, Claude Opus 4.7 et Gemini 3.1 Pro dans son propre guide de migration, et le recommande chaque fois qu'une tâche nécessite le raisonnement le plus puissant disponible. Il dispose d'une fenêtre de contexte de 1 M de tokens, accepte les entrées texte, image et vidéo, et produit du texte — la prise en charge de l'entrée vidéo est la seule capacité ici que Claude Sonnet 5.5 ne possède pas. La tarification est de 2 $ par million de tokens en entrée et de 6 $ par million en sortie, avec les lectures de cache à 0,25 $ et les écritures de cache à 2,50 $. L'entrée du 3 août dans notre catalogue est rejointe par une mise à jour du 2 septembre répertoriée sous le nom de Qwen3.8 Max (0902), qui affiche les mêmes tarifs principaux et un plafond de sortie de 131 K.

Two-column scoreboard for Claude Sonnet 5.5 and Qwen3.8 Max across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, text and image input, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column Qwen3.8 Max: input $2.00 per million, output $6.00 per million, text image and video input, AA Intelligence Index 45, cost per Index task $5.41, September 2 2026 refresh. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

Claude Sonnet 5.5 est le deuxième modèle de la génération 5.5 d'Anthropic, sorti le 28 septembre 2026, six jours après Claude Opus 5.5. Il est déployé sous l'identifiant claude-sonnet-5-5 sur l'API Claude ainsi que sur Amazon Bedrock, Google Cloud et Microsoft Foundry, avec une fenêtre de 1 M de tokens, un plafond de sortie synchrone de 128 K qui s'étend à 300 K sur l'API Message Batches derrière l'en-tête output-300k-2026-03-24, et les tarifs de Claude Sonnet 5 maintenus à l'identique : 2 $ en entrée, 10 $ en sortie, 0,20 $ pour les lectures de cache, 2,50 $ pour les écritures de cache. Rétention de données nulle dès le lancement, retrait pas avant le 28 septembre 2027.

Ainsi, le tarif d’entrée est identique, les fenêtres de contexte ont la même taille, et les deux fournisseurs ont actualisé leur offre à un mois d’intervalle. Tout ce qui les distingue se joue du côté des sorties sur la facture ou dans les benchmarks.

Benchmarks : tableau des fournisseurs face à un indice indépendant

Deux types de preuves existent ici et ils ne sont pas interchangeables.

Le tableau de lancement d’Anthropic est déclaré par le fournisseur, non reproduit par un tiers, et couvre huit évaluations. Les lignes qui comptent

• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6 % contre 10,3 % pour Claude Sonnet 5

• CursorBench 4.0 — 55,5 % contre les 34,1 % de Claude Sonnet 5

• GDPval-AA v2.1 — 1844 contre 1449 pour Claude Sonnet 5, 1846 pour Claude Opus 5.5 et 1487 pour GPT-6 Sol

• Humanity's Last Exam, avec outils — 64,5 % contre 54,9 % ; Claude Opus 5.5 se situe à 67,7 %

• OSWorld 2.1, partiel — 80,1 % contre 57,0 %

• Chartography, sans outils — 61,6 % contre 15,6 %

Alibaba ne publie pas de tableau à quatre colonnes directement équivalent, donc les seuls chiffres qui peuvent être placés sur le même axe sont les chiffres indépendants. Artificial Analysis, révision v4.3.2

• Indice d'intelligence composite — Claude Sonnet 5.5 56 au 3e rang sur 27 ; Qwen3.8 Max 45 au 27e rang

• Coût par tâche de l'Intelligence Index — 7,60 $ contre 5,41 $

• Vitesse de sortie — le modèle d'Anthropic tourne face à une référence Claude Sonnet 5 mesurée à 78,7 tokens par seconde ; Qwen3.8 Max est mesuré à 39,1

• Verbosité — 410 M de jetons de sortie sur l’Index contre 190 M

Les scores par évaluation de Qwen3.8 Max sont respectables plutôt que marginaux : 92,8 % sur GPQA Diamond, 88,8 % sur Terminal-Bench 2.1, 80,3 % sur le rappel en contexte long, 47,8 % sur tau-banking. Il perd du terrain sur le composite parce qu'il ne remporte rien de façon décisive et que le nouveau palier d'Anthropic remporte plusieurs éléments d'emblée. Notez également que la page indépendante de Qwen3.8 Max porte une date de sortie au 2 septembre 2026 et une lecture de contexte de 984K — elle décrit la mise à jour (0902), et non la version d'août, et mélanger les chiffres entre les deux serait une erreur.

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

Ce qui manque dans les deux colonnes est aussi important que ce qu’elles contiennent. Personne n’a reproduit de manière indépendante les chiffres d’Anthropic pour OSWorld ou Terminal-Bench. Personne n’a publié de chiffre Chartography ou CursorBench pour Qwen3.8 Max. Le composite est le seul nombre mesuré de la même manière sur les deux modèles, ce qui explique précisément pourquoi le chiffre de coût par tâche en dessous joue un rôle aussi déterminant.

Le chiffre qui tranche, et il ne figure sur aucune des deux grilles tarifaires.

Artificial Analysis facture les deux modèles de la même manière : exécuter les dix évaluations de l’Index, compter les tokens, multiplier par le prix catalogue. Claude Sonnet 5.5 revient à 7,60 $ par tâche et Qwen3.8 Max à 5,41 $, soit une prime de 40 % pour le modèle d’Anthropic malgré un score composite plus élevé. Les mesures de verbosité expliquent la direction — 410 M de tokens contre 190 M — et les mesures de vitesse expliquent le reste : un modèle qui émet moins de tokens et prend plus de temps par token n’est pas celui qui paie la sortie au double du tarif.

L'affirmation d'Anthropic sur sa propre efficacité s'inscrit dans la même logique plutôt que de la contredire. L'entreprise affirme que Claude Sonnet 5.5 génère des sorties plus de 30 % plus rapidement que Claude Sonnet 5 et coûte « jusqu'à 30 % de moins par tâche » à prix identiques — une affirmation sur les jetons par tâche, et non sur les tarifs. Savoir si cela tient face à un modèle qui consomme moins de la moitié d'autant de jetons est précisément la question que pose le chiffre de 7,60 $, et une exécution indépendante ne représente qu'un seul point de données.

La conséquence pratique : le tarif de sortie de 6 $ contre 10 $ est le chiffre que les achats examineront, et c’est le chiffre le moins prédictif de l’article. Le chiffre prédictif, lui, est le nombre de tokens par tâche sur vos propres prompts, et aucun des deux fournisseurs ne vous le donnera.

Entrées, vidéo et le piège de la migration

La différence de capacités qui saute immédiatement aux yeux est la modalité. Qwen3.8 Max accepte la vidéo en plus du texte et des images ; Claude Sonnet 5.5 accepte le texte et les images. Pour l’analyse d’enregistrements d’écran, les pipelines de séquences de réunion ou tout ce qui traite une vidéo comme une entrée de première classe, ce n’est pas un écart de benchmark — c’est une question d’éligibilité binaire, et un seul de ces modèles passe.

OrcaRouter model page for qwen/qwen3.8-max, attributed to Qwen and dated 2026-08-03, showing a 1M-token context window, text, image and video input, an input price of $2.00 and output price of $6.00 per million tokens, a p50 time to first token of 2.25 seconds, and 53.0M tokens of traffic in the last seven days.

La différence qui apparaît une semaine plus tard est comportementale. Claude Sonnet 5.5 apporte cinq changements incompatibles au code exécuté sur Claude Sonnet 5. Un paramètre non défini par défaut : temperature, top_p ou top_k renvoie désormais une erreur 400. Envoyer thinking: {"type": "disabled"} renvoie une erreur 400 pointant vers between_tools, le nouveau paramètre de réflexion le plus bas, accepté pour les niveaux d'effort low, medium et high et rejeté pour xhigh ou max. L'utilisation forcée d'outils — tool_choice valant "any" ou un outil nommé — renvoie directement une erreur 400. L'ancien outil d'utilisation de l'ordinateur computer_20251124 est refusé sur l'API Claude et Google Cloud. Et les blocs de réflexion sont liés au modèle et au compte qui les a produits, de sorte que le raisonnement peut être reporté depuis Claude Sonnet 5 mais pas vers une autre famille, et un préfixe de conversation modifié peut transformer un rejeu en erreur.

Qwen3.8 Max n'exige rien de tout cela. C'est un modèle au format OpenAI doté d'une surface de requête classique, et passer à lui depuis un autre palier Qwen ne représente qu'un changement de chaîne de modèle.

Pesez honnêtement les deux coûts. Choisir le modèle Qwen vous coûte l'écart composite de onze points et les chiffres du fournisseur Anthropic que vous ne pouvez de toute façon pas vérifier indépendamment. Choisir le modèle Anthropic vous coûte l'entrée vidéo et une liste de quatre modifications d'API qui échoueront chacune bruyamment avec un 400 dès la première fois qu'elles seront sollicitées — ce qui est le bon genre d'échec, mais une journée de travail quoi qu'il en soit.

Où se situe OrcaRouter

La raison de router plutôt que de choisir est que le chiffre déterminant — le coût par tâche sur votre trafic — ne peut être calculé à partir de la documentation d'aucun des deux fournisseurs.

OrcaRouter est un point de terminaison unique compatible OpenAI donnant accès à plus de 200 modèles, avec le prix catalogue du fournisseur répercuté sans marge, de sorte qu'une baisse de tarif ou un changement de palier d'un côté comme de l'autre est effective le jour même de son annonce. Les deux versions de Qwen3.8 Max figurent au catalogue aux tarifs d'Alibaba, soit 2 $ / 6 $ — l'entrée d'août et la mise à jour (0902) — aux côtés de Claude Sonnet 5, le modèle sur lequel tourne encore l'essentiel du trafic de l'API Claude, routable depuis le 30 juin aux tarifs d'Anthropic, soit 2 $ / 10 $ avec un débit mesuré de 150 jetons de sortie par seconde. Claude Sonnet 5.5 lui-même n'est pas encore dans notre catalogue ; tant que c'est le cas, la voie honnête pour y accéder est l'API du fournisseur lui-même et les trois clouds listés par Anthropic, et le moyen de l'essayer sans migrer une charge de travail est une fraction du trafic derrière un basculement automatique vers Claude Sonnet 5 ou Qwen3.8 Max.

Lequel, pour quel travail ?

Qwen3.8 Max l'emporte sur l'entrée vidéo, sur le débit de sortie, sur le coût mesuré par tâche d'indexation et sur l'effort d'intégration. C'est le choix par défaut approprié pour le travail à gros volume et bien spécifié, où un écart composite de douze points ne se manifeste pas dans la qualité de la sortie.

Claude Sonnet 5.5 l'emporte sur le composite indépendant, sur les évaluations de codage agentique où les chiffres du fournisseur Anthropic ont montré un bond de 60 points par rapport à son propre prédécesseur sur Terminal-Bench 4.0, sur le plafond de sortie par lot de 300K, et sur une décision de type professionnel qu'une grille tarifaire ne peut pas prendre : c'est le modèle à choisir lorsque la tâche est suffisamment difficile pour que l'exactitude importe plus que le coût.

Ce qui changerait la réponse pour l’un ou l’autre est la même chose, et ce n’est pas la sortie d’un nouveau benchmark. C’est un décompte de tokens par tâche sur vos propres prompts, selon vos propres réglages d’effort, pour les deux modèles. Le paramètre d’effort d’Anthropic et le plafond de sortie de Qwen sont tous deux des leviers sur ce chiffre, et tous deux sont définis par vous plutôt que par la grille tarifaire du fournisseur.

La seule chose que cette comparaison permet de trancher : à 2 $ par million en entrée, le volet entrée de la facture n’est plus un facteur de différenciation entre un modèle phare chinois et le milieu de gamme d’Anthropic. Cette course s’est déplacée vers le volet sortie et vers le nombre de tokens il y a des mois.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement