
Qwen 3.8 contre Claude Fable 5 : la build 0902 prend la tête en matière de codage
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Quand Alibaba a présenté en avant-première Qwen3.8-Max à Shanghai le 19 juillet 2026, il a fait une déclaration plus forte que toutes les autres : ce modèle de 2,4 billions de paramètres est proche du niveau frontière et n'est devancé que par Claude Fable 5. À l'époque, il était impossible de l'évaluer. Il n'y avait ni grille tarifaire, ni tableau de benchmarks, ni licence — seulement une déclaration de positionnement.
Le 3 août 2026, Qwen3.8-Max est devenu généralement disponible — une vraie grille tarifaire à 2 $ / 6 $ par million de jetons, un tableau de benchmarks avec des chiffres, un endpoint compatible OpenAI et DashScope. Le 2 septembre, Alibaba a lancé l’étape suivante sans changer le numéro de version : Qwen3.8-Max-0902, une actualisation post-entraînement destinée au codage et au travail agentique, qui a fait ses débuts à la 1re place du classement Code Arena: WebDev avec 1 691 Elo. Claude Fable 5, le modèle derrière lequel Alibaba s’est directement positionné en juillet, se situe à 1 628 sur ce même classement. La question de juillet s’est précisée : Qwen 3.8 est-il toujours « uniquement dépassé par Fable 5 », ou l’axe du codage a-t-il déjà basculé ?
Une note pour les développeurs — le moyen le plus rapide de trancher une telle affirmation est d'exécuter les deux modèles sur vos propres prompts. OrcaRouter donne accès à plus de 200 modèles derrière un endpoint compatible OpenAI, afin que vous puissiez opposer Qwen 3.8 Max à Fable 5 sur la même tâche sans avoir à connecter deux SDK.
Verdict en bref. Qwen3.8-Max-0902 est la version la plus puissante à ce jour du fleuron 2,4T d'Alibaba, et le nouveau volet de son argumentaire n'est plus auto-déclaré : il a fait ses débuts à la première place du classement indépendant Code Arena: WebDev avec 1 691 Elo, devant Claude Fable 5 (1 628, 8ᵉ de ce classement). Le prix est inchangé et reste décisif : au tarif fixe de 2 $ / 6 $ par million de jetons, contre 10 $ / 50 $ pour Fable 5, Qwen est environ 5 fois moins cher en entrée et 8 fois moins cher en sortie. Ce qui ne s'est pas comblé, c'est l'écart sur les performances généralistes : Artificial Analysis donne à Qwen3.8-Max un score de 56 sur son Intelligence Index, contre 62 pour Claude Fable 5 ; et sur la dernière semaine publiée du classement général Arena (du 24 au 30 août), Fable 5 reste n°1 (1 508 Elo), tandis que Qwen3.8-Max est n°20 (1 479). Deux verdicts, donc : côté code, la version 0902 de Qwen a désormais un arbitre et une victoire à son actif ; côté raisonnement général et audité, Claude Fable 5 — et Claude Fable 5.1, le plus récent modèle d'Anthropic, qui mène l'indice AA avec 66 — conservent toujours leur avance.
Points clés
• Qwen3.8-Max a atteint sa disponibilité générale le 3 août 2026, et son rafraîchissement 0902 a suivi le 2 septembre — pas de changement de version, même grille tarifaire à 2 $ / 6 $, même contexte de 1M tokens.
• L'écart de prix est énorme : Qwen à 2 $ / 6 $ par million contre Fable 5 à 10 $ / 50 $. Soit ~5× en entrée et ~8× en sortie, et le tarif de Qwen est fixe sur l'intégralité du contexte d'un million de jetons, sans surcoût pour les prompts longs.
• Les deux camps ont désormais des scores indépendants — et ils pointent dans des directions différentes. Qwen3.8-Max obtient 56 sur l'Artificial Analysis Intelligence Index (Claude Fable 5 : 62), et sa version 0902 domine Code Arena: WebDev avec 1 691 Elo contre 1 628 pour Fable 5.
• Le propre tableau de benchmarks de Qwen est toujours solide et toujours produit par le fournisseur. GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — mais la mise à jour du 2 septembre est le premier résultat Qwen à être classé n°1 par une arène indépendante.
• La lacune de la fiche technique sur l'architecture est désormais comblée. Qwen3.8-2.4T-A95B compte ~95B de paramètres actifs sur un total de 2,4T, répartis sur 512 experts — le tout dévoilé lors de la sortie des poids ouverts du 12 août. L'architecture de Fable 5 reste non divulguée.
• Les poids ouverts sont disponibles, pas simplement promis. Qwen3.8-2.4T-A95B (BF16 et FP8) est arrivé sur Hugging Face et ModelScope le 12 août sous une licence personnalisée Qwen3.8-Max, et Qwen3.8-27B a suivi le 14 août sous Apache 2.0. Fable 5 est fermé et uniquement accessible via API, définitivement.
Note sur l'exactitude : les chiffres du tableau de référence propre à Alibaba restent déclarés par le fournisseur et ne sont pas reproduits de manière indépendante. Les chiffres indépendants présentés ici sont horodatés et proviennent de tiers : l'indice Artificial Analysis Intelligence (Qwen3.8-Max 56, Claude Fable 5 62, Claude Fable 5.1 66), le classement Code Arena : WebDev Elo, et le classement hebdomadaire général d'Arena — les scores d'arène fluctuent à mesure que les votes s'accumulent, et la première place de la version 0902 est selon l'annonce par Alibaba d'un classement à un instant donné. Le score de 95,0 % SWE-bench Verified de Fable 5 est rapporté par Anthropic ; la tarification de Qwen est la grille tarifaire GA d'Alibaba Model Studio.
Les spécifications et le prix, côte à côte
Voici les données concrètes, chaque chiffre étant attribué à sa source.
• Créateur / statut — Qwen3.8-Max : Alibaba ; disponibilité générale (GA) le 3 août 2026 ; mise à jour 0902 le 2 septembre 2026. Claude Fable 5 : Anthropic ; modèle phare en GA.
Architecture — Qwen3.8-Max : 2,4 T au total / ~95 B actifs, MoE sparse, 512 experts (divulgué le 12 août) ; Fable 5 : non divulgué
• Fenêtre de contexte — Qwen3.8-Max : 1M de jetons (983,616 avec réflexion ; sortie maximale 131,072) ; Fable 5 : modèle phare à long contexte
• AA Intelligence Index — Qwen3.8-Max : 56 ; Claude Fable 5 : 62 ; Claude Fable 5.1 (1er sept.) : 66, en tête
• SWE-bench Verified — Qwen3.8-Max : Non communiqué (Alibaba rapporte plutôt FrontierSWE 73.5) ; Fable 5 : 95.0% (Anthropic / buildfastwithai)
• Points forts indépendants + rapportés par le fournisseur — Qwen3.8-Max : Code Arena WebDev n°1 à 1 691 (0902, indépendant) ; tableau fournisseur : GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6. Claude Fable 5 : AA 62 ; SWE-bench Verified 95,0 %
• Tarifs (entrée / sortie) — Qwen3.8-Max : $2.00 / $6.00 par 1M, forfaitaire sur 1M de contexte ; entrée en cache $0.25 ; Fable 5 : $10 / $50 par 1M
• Poids ouverts — Qwen3.8-Max : publié le 12 août 2026 (licence personnalisée, pas Apache) ; Qwen3.8-27B sous Apache 2.0 le 14 août. Fable 5 : non — fermé / API uniquement
• Multimodalité — Qwen3.8-Max : Texte, image, vidéo en entrée → texte en sortie ; Fable 5 : produit phare multimodal
Deux choses encadrent toute la comparaison. La première a changé le 3 août et tient toujours ; la seconde a changé de nouveau le 2 septembre.
Premièrement, la colonne des prix est désormais l'élément le plus marquant de la page. En juillet, l'avantage de coût de Qwen était un coupon de réduction — 90 % de remise sur les crédits, temporaire, sans tarif par jeton pour servir de base à la planification. Désormais, c'est une grille tarifaire, et l'écart est structurel plutôt que promotionnel. À 6 $ en sortie contre 50 $ pour Fable, vous pouvez exécuter environ huit appels Qwen pour le prix d'un seul appel Fable. Pour toute charge de travail où vous payez pour le volume plutôt que pour la seule réponse la plus difficile, ce rapport change l'architecture de ce que vous construisez.
Deuxièmement, la colonne des benchmarks a cessé d'être à sens unique. Pendant la majeure partie du mois d'août, la lecture honnête était étroite : Alibaba a rapporté FrontierSWE 73,5 et un tableau de chiffres auto-exécutés, Anthropic a rapporté un score de 95,0 % sur SWE-bench Verified, vérifié par un tiers, et aucun évaluateur indépendant n'avait noté Qwen du tout. La build 0902 a mis fin à cela. Code Arena: WebDev est une arène de vote humain par paire en aveugle — le projet anciennement connu sous le nom de WebDev Arena, géré par personne chez Alibaba — et Qwen3.8-Max-0902 y est entré à la première place avec 1 691 Elo, devant Claude Opus 5 (1 688), Kimi K3 (1 674) et Claude Fable 5 (1 628, #8). Deux réserves maintiennent cette honnêteté : c'est un seul tableau, qui mesure le développement front-end agentique plutôt que la capacité générale, et « débuté à la première place » est l'annonce par Alibaba d'un classement à un instant donné. Mais l'affirmation selon laquelle Qwen n'a aucun arbitre du tout n'est plus vraie, et cela change la comparaison plus que n'importe quel chiffre dans ce tableau.

Ce que l'écart de prix vous apporte réellement
Les généralités abstraites sont moins utiles qu'un exemple concret, alors en voici un. Prenez un agent de revue de code qui envoie 150 000 jetons de contexte de dépôt et génère 6 000 jetons de revue par appel.
• Qwen3.8-Max: 0.15M × $2 = $0.30, plus 0.006M × $6 = $0.036. ≈ $0.34 par appel.
• Claude Fable 5 : 0,15M × 10 $ = 1,50 $, plus 0,006M × 50 $ = 0,30 $. ≈ 1,80 $ par appel.
• À 2 000 appels/jour : Qwen ≈ 672 $/jour ; Fable ≈ 3 600 $/jour. Sur un mois, cela représente environ 20 000 $ contre 108 000 $.
• Avec la mise en cache des prompts sur un contexte de dépôt stable, l'entrée en cache de Qwen à $0.25/1M fait passer le coût d'entrée de $0.30 à moins de $0.04, ramenant l'appel à ≈ $0.08 — environ 22× moins cher que Fable par appel.
Ce n'est pas une économie marginale ; c'est la différence entre faire passer un relecteur sur chaque pull request et n'en faire passer un que sur les plus risquées. Et le contexte à tarif forfaitaire de Qwen renforce cet effet à mesure que les prompts s'allongent : comme Alibaba n'applique aucune surcharge pour les prompts longs, faire passer un contexte de 900 000 jetons coûte le même prix par jeton qu'un contexte de 5 000 jetons.
Le contrepoids honnête est que le prix par token n'est pas le prix par tâche résolue. Si Fable 5 résout un problème en une seule passe là où un modèle moins cher nécessite trois essais plus une correction humaine, le modèle moins cher peut coûter plus cher au total — et sur les tâches de raisonnement les plus difficiles, le classement n° 1 audité de Fable est la meilleure preuve disponible qu'il en résout davantage en une seule passe. L'argument du coût pour Qwen est le plus fort sur les charges de travail à volume élevé et tolérantes, et le plus faible sur celles à faible volume et à enjeux élevés.
La dénomination 0902 : les capacités ont bondi, pas le numéro de version.
Ce qui est remarquable à propos du 2 septembre, c'est ce qu'Alibaba n'a pas fait : publier Qwen 3.9. L'amélioration est sortie sous la forme d'un point de contrôle daté portant le même nom de modèle — Qwen3.8-Max-0902 — et l'API l'a servi sous le même nom et au même prix. C'est la direction vers laquelle dérive l'industrie : quand un bond en matière de capacités ne garantit plus un nouveau numéro de version, « quel modèle dois-je utiliser » devient une question de builds et de dates, et pas seulement de noms de familles.
Cela signifie aussi qu’un score de référence attribué à « Qwen3.8-Max » a une durée de validité : un score mesuré sur la version de juillet ou d’août peut ne pas décrire le modèle que l’API renvoie aujourd’hui. Vérifiez l’identifiant de version sur le point de terminaison que vous appelez réellement — le numéro 0902 fait la différence entre un modèle qui était derrière Claude Fable 5 et un modèle qui le devance sur Code Arena : WebDev.
Preuve, et pourquoi cela décide toujours de cet affrontement.
Les preuves pratiques les plus citées pour Qwen3.8-Max proviennent d'un test datant de la période d'aperçu (thomas-wiegold.com) qui a soumis le modèle à quatre builds réels. Les résultats étaient vraiment impressionnants : Qwen a réussi du premier coup une simulation de poker Go — seulement le troisième modèle à avoir réussi ce prompt en un seul passage, aux côtés de Fable 5 et Grok 4.5 — et sur un prompt de site Web de torréfacteur, il a produit la meilleure sortie que le testeur ait jamais vue pour ce test, ajoutant un panier d'achat non demandé, une section de vente en gros et une intégration Instagram par pure minutie.
Le problème, c'était la vitesse : 30 minutes et plus sur le site web et 1 h 20 sur la simulation de poker, ce qui en faisait le modèle le plus lent que ce testeur ait utilisé. Cette conclusion mérite aujourd'hui une réserve dont elle n'avait pas besoin en juillet.Elle a été mesurée sur l'infrastructure de preview, par un seul testeur, lors d'exécutions agentiques exceptionnellement longues. Le service GA est un système différent. Pour ce que cela vaut, la propre télémétrie sur 7 jours d'OrcaRouter montre actuellement un p50 time-to-first-token de 1,64 seconde pour Qwen3.8-Max — une mesure interne, même si le TTFT et le débit de bout en bout sur des builds d'une heure sont des grandeurs différentes. La position honnête est que le constat de lenteur en preview devrait être re-testé plutôt que répété comme un fait actuel.
Ce qui reste vrai après la mise à jour 0902, c'est que les preuves les plus solides de chaque côté proviennent toujours de sources différentes. La première place de Qwen3.8-Max-0902 sur Code Arena: WebDev est un résultat de vote indépendant et à l'aveugle, mais il ne porte que sur un seul classement, et le tableau de benchmarks qu'Alibaba présente lui-même reste un artefact du fournisseur — les laboratoires choisissent les benchmarks qu'ils publient, et le chiffre le plus faible qu'Alibaba rapporte (IFBench 82.8, suivi d'instructions) concorde toujours avec la critique formulée lors de l'aperçu, selon laquelle le modèle en fait trop et ignore le périmètre. Les éléments en faveur de Claude Fable 5 sont plus larges et proviennent surtout de tiers : 62 sur l'AA Intelligence Index, n°1 du classement général Arena, 95.0 % SWE-bench Verified — et le nouveau Claude Fable 5.1 d'Anthropic est en tête de l'indice AA avec 66 depuis le 1er septembre. Sur « quel modèle prendra en charge un travail que je n'ai pas les moyens de rater », la réponse générale est inchangée. Sur « quel modèle livre le meilleur front-end à un dixième du prix », la réponse s'est inversée le 2 septembre.

Ouverture : l'axe sur lequel Qwen a déjà gagné
Fable 5 ne sera jamais auto-hébergeable. Qwen3.8-Max l'est déjà : le 12 août, les poids de Qwen3.8-2.4T-A95B — BF16 et une variante officielle FP8 — sont arrivés sur Hugging Face et ModelScope, ce qui en fait le premier Qwen de classe Max que n'importe qui peut télécharger. Deux mises en garde méritent qu'on leur accorde le même poids.
Le premier est légal. La version est distribuée sous une licence personnalisée « Qwen3.8-Max », et non sous Apache 2.0 : les fournisseurs exploitant des services de modèle à la demande (model-as-a-service) ou des activités d'assistant de travail basé sur l'IA dont le chiffre d'affaires sur douze mois dépasse 50 millions de dollars doivent négocier une licence séparée auprès de Qwen, et les produits commerciaux qui dépassent 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels doivent afficher le nom du modèle. Pour un usage interne et pour les start-ups, ces seuils s'appliquent rarement — mais ce n'est pas pour autant un libre-service généralisé.
Le deuxième est d’ordre physique. Un MoE de 2,4T au total occupe environ 4,9 To en BF16 (environ la moitié dans le checkpoint FP8 officiel), contre environ 141 Go de mémoire par H200 — si bien que l’auto-hébergement du modèle phare implique un rack d’accélérateurs avant de servir un seul jeton. Les ~95B de paramètres actifs divulgués permettent au moins d’estimer ce que ce rack peut apporter. Pour presque toutes les équipes, l’API hébergée à 2 $ / 6 $ est la voie la plus pratique.
C'est pourquoi Qwen3.8-27B, dont les poids sous licence Apache-2.0 ont suivi le 14 août et qui fonctionnerait dans environ 17 Go de VRAM, reste la version auto-hébergée d'importance pratique. Si votre raison de préférer Qwen à Fable 5 est la résidence des données ou le contrôle sur site plutôt que la capacité brute, le modèle 27B est celui qui offre réellement cet avantage — et des deux côtés, la comparaison en matière d'ouverture n'est plus théorique.
FAQ
Est-ce que Qwen 3.8 est meilleur que Claude Fable 5 ?
Désormais, tout dépend de l’axe, ce qui est un véritable changement par rapport à août. En codage, Qwen3.8-Max-0902 est en tête : n°1 sur Code Arena : WebDev avec 1 691 Elo contre 1 628 pour Claude Fable 5, à 2 $ / 6 $ contre 10 $ / 50 $ pour Fable 5. En matière de qualité globale et auditée, Fable 5 est toujours en tête : 62 sur l’indice AA Intelligence Index contre 56 pour Qwen, 95,0 % SWE-bench Verified et n°1 sur le classement général d’Arena. Pour les travaux où une réponse erronée coûte cher, Fable 5 est le choix le mieux documenté ; pour le codage à grand volume et le travail web agentique, le plus récent Qwen est à la fois moins cher et mieux classé sur l’Arena.
Est-ce que l'affirmation « behind only Fable 5 » est vraie ?
Le positionnement d'Alibaba a été effectué sans chiffres indépendants, et la version 0902 a depuis changé de forme. Qwen3.8-Max-0902 se classe devant Claude Fable 5 sur Code Arena : WebDev (1 691 contre 1 628), mais derrière lui sur l'indice AA Intelligence (56 contre 62) et sur le classement général Arena (Qwen n°20 avec un Elo de 1 479 ; Fable 5 n°1 avec 1 508). Ainsi, « deuxième derrière Fable 5 » est devenu « devant Fable 5 sur le classement de codage ciblé par cette mise à jour, derrière lui sur les classements généraux étendus ».
Combien moins cher est Qwen 3.8 que Fable 5 ?
Substantiellement, et c'est désormais un tarif réel plutôt qu'une remise. Le Qwen3.8-Max est à 2 $ / 6 $ par million de jetons, contre 10 $ / 50 $ pour Fable 5 — environ 5× moins cher en entrée et 8× en sortie. Le tarif de Qwen est également fixe sur l'ensemble du contexte de 1M, et l'entrée en cache à 0,25 $/1M rend les charges de travail à contexte répété encore moins chères.
Est-ce que Qwen 3.8 Max a quitté la version d’aperçu ?
Oui. Il est devenu généralement disponible le 3 août 2026 avec une grille tarifaire publiée et un endpoint compatible OpenAI et DashScope. La campagne de crédits Qoder et le cadre d’aperçu à -90 % qui circulaient en juillet ne décrivent plus la manière dont le modèle est vendu.
Est-ce que Qwen 3.8 est toujours le modèle le plus lent, comme le disaient les premières critiques ?
Cette conclusion provient d'un seul relecteur sur une infrastructure d'aperçu exécutant des builds agentiques d'une heure, et elle devrait être re-testée contre le service GA plutôt que considérée comme un fait actuel. La télémétrie sur 7 jours d'OrcaRouter montre un p50 de 1,64 seconde pour le délai jusqu'au premier jeton, bien que cela mesure la latence du premier jeton plutôt que le débit sur des builds très longs.
Puis-je auto-héberger Qwen 3.8 au lieu de payer pour Fable 5 ?
Oui pour Qwen, avec des réserves. Qwen3.8-2.4T-A95B est téléchargeable depuis le 12 août sous une licence personnalisée (pas Apache 2.0), et Qwen3.8-27B sous Apache 2.0 depuis le 14 août. La barrière pratique est le matériel : un MoE de 2,4T au total nécessite environ 4,9 To en BF16 — un rack d'accélérateurs — donc la plupart des équipes utiliseront encore l'API hébergée à 2 $ / 6 $ plutôt que de servir le modèle phare. Fable 5 est fermé définitivement.
Lequel devrais-je utiliser aujourd'hui ?
Pour les travaux généraux où une mauvaise réponse coûte cher — raisonnement difficile, chemins de production à forts enjeux — Claude Fable 5 reste le choix le mieux documenté, et Claude Fable 5.1 d’Anthropic prolonge cette avance. Pour le codage à grande échelle et le développement web agentique, Qwen3.8-Max-0902 dispose désormais de l’avantage dans l’arène indépendante et d’un prix de sortie environ 8 fois inférieur : revue de code en masse, génération front-end, analyse de longs documents. De nombreuses équipes devraient utiliser les deux et router selon la tâche.
En résumé
Qwen 3.8 contre Claude Fable 5 est une comparaison différente de ce qu'elle était il y a un mois, et encore différente de celle d'il y a une semaine. Qwen3.8-Max est un modèle généralement disponible avec une grille tarifaire qui sous-cote Fable 5 de 5× sur l'entrée et de 8× sur la sortie, à prix fixe sur un million de jetons — et depuis le 2 septembre, ce même nom désigne la build 0902, qu'une arène indépendante classe désormais n°1 pour le développement web agentique, devant Fable 5 dans ce classement.
Aucun des deux modèles ne détient désormais toute la comparaison. Claude Fable 5 — et Claude Fable 5.1 d’Anthropic, qui est en tête de l’AA Intelligence Index avec un score de 66 depuis le 1er septembre — occupent le terrain généraliste, vaste et audité, et le propre tableau de référence d’Alibaba reste un artefact de fournisseur. Mais la raison pour laquelle cette confrontation était déséquilibrée en juillet — à savoir que Qwen ne disposait d’aucun arbitre indépendant — a expiré le 2 septembre : Qwen3.8-Max-0902 est le modèle n°1 sur Code Arena: WebDev. La réponse sensée reste de séparer selon les enjeux et la tâche — Fable 5 pour le raisonnement général, où une erreur coûte cher, Qwen3.8-Max pour le codage à volume élevé, où l’écart de prix et l’avantage à l’arène jouent en sa faveur — et de tester les deux modèles sur vos propres prompts.

Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
