
Qwen 3.8 vs Claude Opus 4.8 : L'échelle économique rencontre le spécialiste du raisonnement
- metaNOUVEAUMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 par million de tokens · 819 tok/s
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 56 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 198 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
Alibaba a dévoilé Qwen3.8-Max à Shanghai le 19 juillet 2026, un modèle à 2,4 billions de paramètres conçu pour l'échelle et la rigueur. Celui d'Anthropic, Claude Opus 4.8, est un tout autre animal : un fleuron haut de gamme de raisonnement profond vers lequel les équipes se tournent lorsqu'une tâche comporte de nombreuses étapes et qu'une mauvaise réponse coûte cher.
Pendant deux semaines, il était difficile de faire cette comparaison honnêtement, car Qwen n'avait ni prix publié ni benchmarks publiés. Cela a changé le 3 août 2026, lorsque Qwen3.8-Max est devenu généralement disponible avec une grille tarifaire de $2 / $6 par million de jetons et un tableau complet de benchmarks. La question philosophique reste la même — l'échelle brute et l'ouverture contre la fiabilité du raisonnement — mais désormais, il y a des chiffres des deux côtés.
Une note pour les développeurs — le moyen le plus rapide de trancher une telle question est de tester les deux sur vos propres flux de travail. OrcaRouter regroupe plus de 200 modèles derrière un seul point de terminaison compatible OpenAI, vous pouvez donc opposer Qwen 3.8 Max à Opus 4.8 sur la même tâche sans avoir à configurer deux SDK.
Verdict en bref. Opus 4.8 reste le spécialiste du raisonnement : audité dans le groupe de tête de l’Artificial Analysis Intelligence Index et fiable pour les longues chaînes agentiques, où une réponse erronée mais assurée coûte plus que la facture de jetons. Ses faiblesses sont le coût et la verbosité — AA situe son tarif mixte à environ $3.85/1M au maximum d’effort, et il consomme beaucoup de jetons, avec Grok 4.5 accomplissant, selon les rapports, des tâches comparables en utilisant environ 4× moins de jetons de sortie. Qwen3.8-Max contre-attaque désormais avec ce qui lui manquait en juillet : un vrai prix bas de $2 / $6 fixes pour 1M de jetons, entrée en cache à 0,25 $, et un tableau de benchmarks du fournisseur mené par Terminal-Bench 2.1 86.6 et OSWorld-Verified 86.1. Il a également fait preuve d’une réelle diligence agentique dans l’unique test tiers disponible. Mais il n’est encore noté par aucun évaluateur indépendant. Opus pour un raisonnement fiable ; Qwen pour un travail sensible au coût et priorisant l’exhaustivité.
Points clés
• Qwen3.8-Max est en disponibilité générale depuis le 3 août 2026 au prix de $2 / $6 par 1M de jetons, fixe sur l'ensemble du contexte de 1M de jetons — une véritable grille tarifaire, remplaçant la remise temporaire de la préversion de juillet.
• Opus 4.8 est nettement plus cher : Artificial Analysis estime son coût mixte à environ $3.85/1M à effort maximal, et il est gourmand en tokens — selon les informations, ~4× plus de tokens de sortie par tâche que Grok 4.5, de sorte que les longues exécutions agentiques creusent encore l’écart.
• Les sources divergent sur le nombre exact d'AA d'Opus 4.8. Sur AA v4.1, Kimi K3 (57.1) est rapporté juste au-dessus de lui, donc l'énoncé fiable est « groupe de tête, sous les leaders Fable 5 / GPT-5.6 Sol » plutôt qu'un score unique précis.
• Qwen a désormais des scores agentiques, auto-déclarés : Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (contre 40,7 pour son prédécesseur). Aucun n'a été vérifié indépendamment.
• Un point de données agentique tiers de Qwen est favorable : contre Kimi K3, il a produit 354 citations de dépôt contre 274, a utilisé 22 requêtes de passerelle contre 53, et a enregistré 0 appel d'outil échoué contre 2 — tandis qu'il a obtenu un score de 80/100 contre 83 pour Kimi.
• L'ouverture diverge définitivement : Qwen promet des poids ouverts d'ici la fin de la semaine, ainsi qu'un Qwen3.8-27B nécessitant ~17 Go de VRAM ; Opus 4.8 est fermé et réservé à l'API.
Note sur l'exactitude : tous les chiffres de qualité de Qwen3.8-Max sont rapportés par Alibaba et non vérifiés par des tiers. Les chiffres d'Opus 4.8 sont attribués à Artificial Analysis et à des sources nommées et peuvent différer des rapports d'Anthropic ; car les trackers divergent sur l'indice exact d'Opus, nous indiquons sa position relative plutôt qu'un chiffre unique. La tarification de Qwen est la grille tarifaire GA et remplace la remise d'aperçu de juillet.
Les spécifications et le prix, côte à côte
Voici les données concrètes, chaque chiffre étant attribué à sa source.
• Fabricant / statut — Qwen3.8-Max : Alibaba ; disponibilité générale (3 août 2026) ; Claude Opus 4.8 : Anthropic ; modèle phare en disponibilité générale pour le raisonnement approfondi
• Architecture — Qwen3.8-Max : ~2,4T au total, MoE éparse (paramètres actifs toujours non divulgués) ; Opus 4.8 : Fermé ; architecture non divulguée
• Fenêtre de contexte — Qwen3.8-Max : 1M jetons (983 616 avec réflexion ; sortie maximale 131 072) ; Opus 4.8 : modèle phare longue-contexte
• AA Intelligence Index — Qwen3.8-Max : Pas encore noté ; Opus 4.8 : Groupe supérieur, sous les leaders (Artificial Analysis ; Kimi K3 à 57,1 rapporté juste au-dessus)
• Atout principal — Qwen3.8-Max : échelle, exhaustivité, rentabilité en contexte long ; Opus 4.8 : Raisonnement profond multi-étapes + fiabilité agentique
• Scores agentiques rapportés par le fournisseur — Qwen3.8-Max : Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (rapporté par Alibaba) ; Opus 4.8 : n/a — la réputation se gagne en production
• Tarification (entrée / sortie) — Qwen3.8-Max : $2.00 / $6.00 par 1M, forfaitaire ; entrée en cache $0.25 ; Opus 4.8 : Premium — AA en moyenne ~$3.85/1M à effort maximal
• Efficacité des tokens — Qwen3.8-Max : Verbeux ; IFBench 82,8 est son score auto-déclaré le plus faible ; Opus 4.8 : Gourmand en tokens — environ 4× plus de sortie que Grok 4.5 (annoncé)
• Poids ouverts — Qwen3.8-Max : Promis dans la semaine (pas encore de licence) ; Opus 4.8 : Non — fermé / API uniquement
Deux choses encadrent la comparaison, et toutes deux ont bougé le 3 août.
D'abord, l'écart de coût est désormais mesurable plutôt que théorique. En juillet, l'avantage de Qwen était une remise sur laquelle vous ne pouviez pas baser votre budget. Maintenant, c'est un taux, et la forme de l'écart est inhabituelle : Opus est cher et gourmand en tokens, ce qui signifie que les deux se multiplient. Si Opus émet quatre fois plus de tokens de sortie pour la même tâche et facture un supplément par token, une longue exécution agentique peut coûter de nombreuses fois ce que les tarifs affichés suggèrent. Le taux de sortie de 6 $ de Qwen, son contexte de 1M à tarif plat, et son entrée en cache à 0,25 $ contrent exactement cet effet cumulatif.
Deuxièmement, la colonne des benchmarks de Qwen n'est plus vide — et pour une fois, une partie de celle-ci est directement pertinente. Toute la revendication d'Opus 4.8 repose sur la fiabilité agentique, et Alibaba a désormais publié des chiffres agentiques : Terminal-Bench 2.1 86.6 pour les opérations shell, OSWorld-Verified 86.1 pour piloter une véritable interface graphique. Ces métriques mesurent les bonnes choses. La réserve porte sur la provenance, pas sur la pertinence : Alibaba les a produites avec son propre harnais de test, et aucun tiers ne les a reproduites. Pendant ce temps, la réputation d'Opus repose sur quelque chose de plus difficile à publier mais sans doute plus précieux — une utilisation en production soutenue dans de nombreuses équipes, ce qui est une forme de preuve qu'un tableau de fournisseur ne peut pas fabriquer.

Fiabilité du raisonnement vs minutie brute
La différence intéressante entre ces deux-là n'est pas la qualité en un seul essai — c'est leur comportement lorsqu'une tâche comporte de nombreuses étapes et est associée à de véritables outils.
La réputation d'Opus 4.8 repose sur la fiabilité agentique : de longues chaînes de raisonnement où il suit le contexte, se remet des impasses et renvoie des réponses exploitables sans avoir à revérifier chaque étape. C'est la propriété pour laquelle les équipes paient un supplément, car en production, le coût d'une réponse multi-étapes faussement assurée dépasse de loin la facture de tokens. Le compromis, c'est qu'Opus est gourmand en tokens — Grok 4.5 accomplirait des tâches comparables avec environ 4× moins de tokens de sortie — sa fiabilité a donc un coût réel et continu.
Qwen 3.8 répond avec un autre type de force : une pure minutie, et il existe désormais un point de données tiers à ce sujet. Lors d'un test de compréhension d'architecture mené par Trilogy AI (Qwen3.8-Max contre Kimi K3), Qwen a obtenu 80/100 contre 83 pour Kimi — perdant sur le score principal — mais c'était l'agent le plus appliqué, produisant 354 citations de dépôts contre 274 pour Kimi, utilisant 22 requêtes de passerelle contre 53, et enregistrant 0 appel d'outil échoué contre 2. Les deux modèles sont arrivés à la même conclusion architecturale fondamentale ; Qwen a simplement fait plus de travail d'ancrage pour y parvenir, avec une utilisation d'outils plus propre.
Ce résultat de zéro appel d'outil échoué est le signal agentique le plus encourageant que Qwen ait, car ce sont les appels d'outil échoués qui cassent réellement les agents en production. Il ne s'agit aussi que d'un seul test, sur une seule tâche, par un seul évaluateur — loin de la base de preuves qui sous-tend la réputation d'Opus.
Le coût de la minutie de Qwen, c'était la latence et les tokens. Les testeurs de la période de préversion l'ont trouvé « très bon et très lent » — plus de 30 minutes pour créer un site web, plus d'une heure pour une simulation de poker, le modèle le plus lent que ce testeur ait utilisé. Deux réserves s'appliquent désormais. Cela tenait à l'infrastructure de préversion, et le service GA est un système différent ; la télémétrie d'OrcaRouter sur 7 jours affiche actuellement un p50 du temps jusqu'au premier jeton de 1,64 seconde, bien que le TTFT et le débit de bout en bout sur des tâches d'une heure soient des grandeurs différentes. Ce constat mérite d'être retesté plutôt que répété.
Il y a aussi un problème structurel qu'il convient de signaler : le score le plus faible rapporté par Alibaba est IFBench 82.8, suivi d'instructions sous contrainte. Pour les pipelines agentiques qui analysent la sortie du modèle à chaque étape, un modèle qui dépasse son périmètre et ajoute un travail non demandé est un inconvénient, quelle que soit sa rigueur. C'est précisément là que la discipline d'Opus justifie son surcoût.

Coût en pratique : là où l'écart de tokens 4× se fait sentir
Prenons une exécution d'agent en plusieurs étapes : 80 000 jetons d'entrée de contexte et — c'est la variable clé — des volumes de sortie différents, car Opus émet environ 4× plus.
• Qwen3.8-Max à 8 000 jetons de sortie : 0,08M × 2 $ = 0,16 $, plus 0,008M × 6 $ = 0,048 $. ≈ 0,21 $ par exécution.
• Opus 4.8 à un prix mixte d’environ 3,85 $/1M pour 80 000 tokens d’entrée + ~32 000 tokens de sortie (4× les tokens) : environ 0,43 $ par exécution sur la base du prix mixte — et nettement plus si vous facturez l’entrée et la sortie séparément aux tarifs de la catégorie premium.
• À 3 000 exécutions/jour : Qwen ≈ 630 $/jour ; Opus ≈ 1 290 $/jour ou plus.
• Avec l'entrée en cache de Qwen à $0.25/1M sur un contexte stable, son exécution tombe à ≈ $0.07 — environ 6× moins cher qu'Opus.
Le contrepoids honnête est celui qui s'applique toujours aux comparaisons avec Opus : si Opus résout une tâche en une seule tentative là où un modèle moins cher nécessite deux tentatives plus une relecture humaine, le modèle moins cher n'est pas réellement moins cher. La verbosité d'Opus est en partie le mécanisme de sa fiabilité — il raisonne à voix haute, et cela coûte des jetons. La question pour votre charge de travail est de savoir si vous payez pour une délibération dont vous avez besoin. Dans le raisonnement à forts enjeux et faible volume, c'est probablement le cas. Dans l'analyse à haut volume où vous vérifiez en aval de toute façon, ce n'est probablement pas le cas.
Ouverture et la question de l'on-premise
Opus 4.8 est fermé et accessible uniquement par API, définitivement. Qwen3.8-Max ne l'est peut-être pas — les poids sont promis dans la semaine — mais le modèle phare n'est pas une cible réaliste pour un auto-hébergement : environ 1,2 To en 4 bits contre environ 141 Go par H200, ce qui implique huit accélérateurs haut de gamme ou plus, et le nombre de paramètres actifs n'étant toujours pas divulgué, vous ne pouvez pas modéliser le débit qu'un tel investissement permettrait d'obtenir. Il n'y a pas non plus encore de texte de licence, donc l'utilisabilité commerciale est formellement indéterminée.
L'annonce simultanée de Qwen3.8-27B constitue la sortie pratique pour les équipes dont l'intérêt est le contrôle plutôt que la capacité brute. Également disponible en poids ouverts, ce modèle fonctionnerait dans environ 17 Go de VRAM — une seule carte haut de gamme. Si vous comparez avec Opus parce que vous avez besoin de raisonnement au sein de votre propre réseau, la 27B est le modèle à évaluer ; l'ouverture du fleuron 2.4T est surtout théorique.
FAQ
Est-ce que Qwen 3.8 est meilleur que Claude Opus 4.8 ?
Non, pas sur la base des preuves existantes. Opus 4.8 fait partie du groupe de tête de l'indice audité Artificial Analysis Intelligence Index et a fait ses preuves en matière de raisonnement agentique profond en production. Qwen3.8-Max a un tableau de résultats auto-déclaré solide (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) et un test agentique tiers favorable, mais aucun score indépendant. Qwen gagne sur le prix ; Opus gagne sur la preuve et la fiabilité du raisonnement.
Pourquoi le numéro de référence d'Opus 4.8 est-il décrit de manière si vague ?
Parce que les trackers divergent réellement. Sur AA v4.1, Kimi K3 (57,1) est signalé juste au-dessus d'Opus 4.8, ce qui place Opus dans le groupe de tête mais en dessous des leaders Fable 5 / GPT-5.6 Sol — pourtant, les différentes sources ne s'accordent pas, donc citer un seul chiffre précis serait trompeur. Sa position relative est la donnée fiable.
Combien moins cher est Qwen 3.8 que Claude Opus 4.8 ?
De manière significative, et l'écart se creuse sur les longues exécutions. Qwen3.8-Max est à 2 $ / 6 $ par million en tarif fixe, avec une entrée en cache à 0,25 $. Artificial Analysis estime le coût mixte d'Opus à environ 3,85 $/1M à effort maximal, et Opus serait environ 4 fois plus gourmand en tokens que Grok 4.5 — l'écart de prix se multiplie donc avec le volume de sortie. Sur une exécution typique en plusieurs étapes, Qwen revient environ 2 à 6 fois moins cher selon la mise en cache.
Est-ce que Qwen 3.8 Max a quitté la version d’aperçu ?
Oui, le 3 août 2026. Il dispose d'une grille tarifaire publiée et d'un endpoint compatible avec OpenAI et DashScope, de sorte que la campagne de crédits Qoder de juillet et la présentation « -90 % » ne décrivent plus la manière dont il est vendu.
Est-ce que Qwen 3.8 est fiable pour le travail agentique ?
Les premiers signaux sont encourageants mais limités. Alibaba fait état de 86,6 sur Terminal-Bench 2.1 et de 86,1 sur OSWorld-Verified, et lors d'un test tiers, il a enregistré zéro appel d'outil échoué contre deux pour un concurrent. En revanche, son score auto-déclaré le plus faible est de 82,8 sur IFBench pour le suivi d'instructions, et les testeurs de l'aperçu ont vu à plusieurs reprises qu'il dépassait le cadre — un risque réel pour les pipelines qui analysent la sortie de chaque étape.
Puis-je auto-héberger Qwen 3.8 pour éviter le tarif premium d'Opus ?
Ce n'est pas le modèle phare, réalistiquement. Les poids sont promis dans la semaine, mais aucune licence n'est publiée, et avec ~1,2 To en 4 bits, il faudrait huit GPU de classe H200 ou plus. Le Qwen3.8-27B, annoncé simultanément et nécessitant apparemment ~17 Go de VRAM, est l'option viable. Opus 4.8 est fermé, il n'y a donc aucune voie d'auto-hébergement.
Lequel devrais-je utiliser aujourd'hui ?
Opus 4.8 pour les travaux de production critiques en termes de raisonnement ou agentiques auxquels vous devez pouvoir vous fier, où une réponse multi-étapes erronée coûte cher. Qwen3.8-Max pour les travaux où le coût compte et l'exhaustivité prime — en particulier l'analyse de longs contextes, où son tarif fixe de 1M et ses 0,25 $ d'entrée en cache rendent l'argument économique difficile à contester.
En résumé
Qwen 3.8 vs Claude Opus 4.8 reste un contraste de philosophies, mais la donne économique n'est plus hypothétique. Qwen3.8-Max est arrivé en GA avec des prix réels qui sous-cotent largement Opus, et l'écart se creuse car Opus est à la fois cher et gourmand en tokens. Qwen a également publié des chiffres agentiques qui parlent directement au terrain de prédilection d'Opus, et son test agentique tiers a montré une utilisation d'outils plus propre qu'un rival solide.
Opus conserve l'avantage là où il l'a toujours eu : une position auditée dans le cluster de tête, et un historique de production en matière de raisonnement multi-étapes fiable qu'aucun tableau de fournisseur ne peut remplacer. Les lacunes restantes de Qwen sont celles que l'on connaît — aucun score indépendant, aucun nombre de paramètres actifs divulgué, pas encore de licence, et une faiblesse auto-déclarée en suivi d'instructions qui compte précisément dans les pipelines agentiques pour lesquels Opus est choisi. Surveillez deux événements : le premier score indépendant de l'Intelligence Index, et l'arrivée des poids avec une licence. D'ici là, Opus est le modèle auquel vous confiez les décisions coûteuses, et Qwen 3.8 est celui vers lequel vous dirigez le volume — testé sur vos propres flux de travail.

Comparés dans cet article4
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
