Qwen 3.8 vs GPT-5.6 : Maintenant que les deux ont un prix, lequel gagne ?
Guides & Insights

Qwen 3.8 vs GPT-5.6 : Maintenant que les deux ont un prix, lequel gagne ?

Auteur

jinhao song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Quand Alibaba a présenté Qwen3.8-Max à Shanghai le 19 juillet 2026, la réaction de la communauté a été immédiate : ce modèle de 2 400 milliards de paramètres était « soi-disant en avance sur GPT-5.6 et seulement légèrement derrière Fable 5. » Le GPT-5.6 d'OpenAI dans sa configuration phare Sol se classe au deuxième rang de l'indice indépendant Artificial Analysis Intelligence Index, un point en dessous de Fable 5, ce qui était une affirmation audacieuse à faire sans aucun chiffre publié pour l'étayer.

Deux choses ont changé depuis. Qwen3.8-Max est devenu généralement disponible le 3 août 2026 avec une véritable grille tarifaire et un véritable tableau de référence. Et le 31 juillet, OpenAI a réduit les prix de la famille GPT-5.6 — Terra à 2 $ / 12 $, Luna à 0,20 $ / 1,20 $, Sol inchangé au niveau premium. Ce face-à-face n'est plus une simple affirmation face à un classement ; ce sont deux modèles tarifés et documentés qui peuvent réellement être comparés.

Une note pour les développeurs — le moyen le plus rapide de trancher une telle affirmation est de tester les deux sur vos propres prompts. OrcaRouter regroupe plus de 200 modèles derrière un point de terminaison compatible OpenAI, vous pouvez donc opposer Qwen 3.8 Max à GPT-5.6 sur la même tâche sans avoir à intégrer deux SDK.

TL;DR : le verdict. Qwen3.8-Max en GA est proposé à un prix agressif — 2 $ / 6 $ par 1M de tokens, un tarif fixe sur 1M de tokens — ce qui le place au même prix d'entrée que GPT-5.6 Terra, mais à la moitié du coût de sortie de Terra, et bien en dessous de Sol. Ses chiffres auto-déclarés sont solides (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Mais GPT-5.6 Sol gagne toujours sur les deux critères qui décident de l'utilisation en production : il est le #2 audité sur l'Artificial Analysis Intelligence Index (~59) et il est rapide — jusqu'à 750 tokens/s sur du matériel Cerebras. Aucun évaluateur indépendant n'a encore attribué de score à Qwen3.8-Max. Qwen peut donc très bien égaler GPT-5.6 sur la qualité one-shot et bat clairement Terra sur le prix de sortie ; GPT-5.6 gagne sur la preuve évaluée par les pairs et sur le débit, ce qui est souvent l'essentiel.

Points clés

Qwen3.8-Max est généralement disponible depuis le 3 août 2026 avec un prix publié de $2 / $6 par million de jetons, fixe sur l’ensemble du contexte de 1 million de jetons.

Face à GPT-5.6 Terra ($2 / $12 après la baisse du 31 juillet d'OpenAI), Qwen s'aligne sur le prix d'entrée et divise par deux celui de sortie. Face à Sol, Qwen est considérablement moins cher.

GPT-5.6 Sol est audité n°2 sur l'AA Intelligence Index (~59), et Artificial Analysis note qu'il est en tête sur les problèmes STEM les plus difficiles. Qwen3.8-Max est toujours non évalué par AA et LMArena.

La vitesse est le contraste le plus net. GPT-5.6 atteint jusqu'à 750 tokens/sec sur Cerebras. Qwen était le modèle le plus lent lors des tests pratiques en version préliminaire — une conclusion qui précède la mise en service GA et qui doit être re-testée.

Le tableau du fournisseur Qwen est crédible mais non évalué par les pairs : GPQA Diamond 92,6, PaperBench 93,0, Terminal-Bench 2.1 86,6, OSWorld-Verified 86,1, FrontierSWE 73,5 (contre 40,7 pour son prédécesseur).

L'ouverture les divise définitivement : Qwen promet des poids ouverts dans la semaine, plus un Qwen3.8-27B nécessitant ~17 Go de VRAM ; GPT-5.6 est fermé et réservé à l'API.

Note d'exactitude : tous les chiffres de qualité Qwen3.8-Max proviennent d'Alibaba et n'ont pas été vérifiés par des tiers. Les chiffres de GPT-5.6 proviennent d'Artificial Analysis et peuvent différer de ceux rapportés par OpenAI. Les tarifs de la famille GPT-5.6 reflètent la réduction d'OpenAI du 31 juillet 2026. Le tarif Qwen correspond à la grille tarifaire GA et remplace la remise de préversion de juillet.

Les spécifications et le prix, côte à côte

Voici les données concrètes, chaque chiffre étant attribué à sa source.

• Créateur / statut — Qwen3.8-Max : Alibaba ; GA (3 août 2026) ; GPT-5.6 Sol : OpenAI ; modèle phare fermé (variantes Sol / Terra / Luna)

• Architecture — Qwen3.8-Max : ~2,4 T au total, MoE sparse (paramètres actifs encore non divulgués) ; GPT-5.6 Sol : fermé ; architecture non divulguée

• Fenêtre de contexte — Qwen3.8-Max : 1M de jetons (983 616 avec réflexion ; sortie maximale 131 072) ; GPT-5.6 Sol : modèle phare à long contexte

• AA Intelligence Index — Qwen3.8-Max : Pas encore noté ; GPT-5.6 Sol : ~59 — #2 (Artificial Analysis)

• Forces auditées — Qwen3.8-Max : aucun audit tiers ; GPT-5.6 Sol : en tête des problèmes STEM les plus difficiles (Artificial Analysis)

• Points forts rapportés par le fournisseur — Qwen3.8-Max : GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (rapporté par Alibaba) ; GPT-5.6 Sol : n/a

• Vitesse — Qwen3.8-Max : p50 TTFT 1.64s (télémétrie OrcaRouter sur 7 jours) ; modèle le plus lent lors des tests pratiques en préversion ; GPT-5.6 Sol : Jusqu'à 750 tok/s sur Cerebras (Artificial Analysis)

• Tarifs (entrée / sortie) — Qwen3.8-Max : 2,00 $ / 6,00 $ par 1M, forfaitaire ; entrée en cache 0,25 $ ; GPT-5.6 : Terra 2 $ / 12 $, Luna 0,20 $ / 1,20 $, Sol premium (~1/3 du coût de Fable par AA)

• Poids ouverts — Qwen3.8-Max : Promis dans la semaine (pas encore de licence) ; GPT-5.6 : Non — fermé / API uniquement

Deux choses encadrent cette comparaison, et toutes deux sont nouvelles depuis juillet.

D'abord, l'histoire des prix est devenue vraiment intéressante plutôt que simplement bon marché. En juillet, l'avantage de Qwen était une remise impossible à budgéter. Maintenant, la comparaison est concrète et se décline par niveau. Par rapport à Terra à $2 / $12, Qwen correspond exactement au prix d'entrée et divise par deux le prix de sortie — un réel avantage pour les tâches à forte intensité de raisonnement où les coûts de sortie dominent les dépenses. Par rapport à Luna à $0.20 / $1.20, Qwen est 10× plus cher, et Luna est le meilleur choix pour les tâches simples à haut volume. Par rapport à Sol, Qwen est beaucoup moins cher. Donc « lequel est moins cher » a désormais trois réponses différentes selon le GPT-5.6 dont vous parlez — et le constat honnête est que la réduction du 31 juillet d'OpenAI a considérablement resserré l'écart.

Deuxièmement, le critère de la vitesse reste celui où ces deux modèles divergent le plus, et il penche toujours en faveur d'OpenAI. Artificial Analysis mesure GPT-5.6 Sol à une vitesse allant jusqu'à 750 tokens/sec sur les puces Cerebras. Rien dans les supports GA d'Alibaba ne suggère que Qwen3.8-Max est conçu pour ce type de débit, et le testeur de la phase d'aperçu qui l'avait qualifié de modèle le plus lent qu'il ait utilisé mesurait précisément les longues exécutions agentiques où le débit se cumule. Si votre charge de travail est interactive, agentique ou à fort volume, cet écart peut départager les deux modèles avant même que la qualité n'entre en jeu.

Preuve : ce que le tableau de référence GA établit et ce qu'il n'établit pas

La décision d'Alibaba de publier des chiffres en GA est une réelle amélioration par rapport à l'aperçu, où la ligne de la communauté « en avance sur GPT-5.6 » ne reposait sur rien de publié du tout. Le tableau est solide : GPQA Diamond 92.6 sur les sciences de niveau postuniversitaire, PaperBench 93.0 sur la reproduction de résultats de recherche, Terminal-Bench 2.1 86.6 sur l'utilisation d'un véritable shell, OSWorld-Verified 86.1 sur le pilotage d'une interface graphique de bureau. Le bond générationnel en codage est le point le plus marquant — FrontierSWE 73.5 contre 40,7 pour son prédécesseur, et DeepSWE 1.1 56.6 contre 21,6.

Ce que le tableau ne fait pas, c'est trancher la comparaison GPT-5.6, pour deux raisons.

Le premier est la provenance. Chaque chiffre a été produit par Alibaba sur son propre banc d'essai. Les tableaux des fournisseurs sont choisis, non échantillonnés — un laboratoire publie les benchmarks où il brille et omet le reste. La deuxième place d'OpenAI à l'Intelligence Index, en revanche, a été attribuée par un évaluateur qui n'a aucun intérêt dans le résultat. Notamment, Artificial Analysis crédite spécifiquement GPT-5.6 Sol d'être en tête sur les plus difficiles problèmes STEM, ce qui est précisément le terrain que le GPQA Diamond 92.6 de Qwen est censé revendiquer. L'une de ces affirmations a été vérifiée.

Le deuxième point, c'est que le chiffre le plus faible d'Alibaba est en soi révélateur. IFBench 82.8 — le suivi d'instructions sous contrainte — est le score le plus bas de son tableau, et cela correspond exactement à la critique la plus constante de l'ère des aperçus : le modèle en fait trop, dépasse le cadre et ajoute des choses que personne n'a demandées. C'est charmant dans une démo, mais coûteux lorsque la sortie est facturée 6 $ par million de jetons et qu'un format précis est requis. Pour les pipelines agentiques où les étapes en aval analysent la sortie, la rigueur dans le suivi des instructions compte plus qu'un point GPQA.

Pour servir de référence : le prédécesseur Qwen3.7-Max a obtenu 46 sur l'AA Intelligence Index, contre ~59 pour GPT-5.6 Sol. Combler treize points en une seule génération serait un bond extraordinaire. Possible — le quasi-doublement du propre FrontierSWE d'Alibaba suggère de réels progrès — mais tant qu'un arbitre n'a pas publié de chiffre, « en avance sur GPT-5.6 » reste une affirmation non prouvée plutôt qu'un résultat.

Coût en pratique : un exemple concret couvrant tous les paliers.

Prenez un agent de raisonnement envoyant 100,000 jetons de contexte et générant 10,000 jetons de sortie par appel — une forme typique de l'analyse de documents ou de la planification en plusieurs étapes.

Qwen3.8-Max : 0,1M × 2 $ = 0,20 $, plus 0,01M × 6 $ = 0,06 $. ≈ 0,26 $ par appel.

GPT-5.6 Terra: 0,1M × 2 $ = 0,20 $, plus 0,01M × 12 $ = 0,12 $. ≈ 0,32 $ par appel.

GPT-5.6 Luna : 0,1M × 0,20 $ = 0,02 $, plus 0,01M × 1,20 $ = 0,012 $. ≈ 0,03 $ par appel.

• À 5 000 appels/jour : Qwen ≈ 1 300 $, Terra ≈ 1 600 $, Luna ≈ 160 $.

Deux leçons en ressortent. Face à Terra, l'économie réalisée avec Qwen est réelle mais modeste — environ 19 % sur cette configuration — et loin de l'avantage d'un ordre de grandeur dont Qwen bénéficie face aux modèles premium comme Fable 5 ou Sol. Quiconque supposait qu'OpenAI était structurellement coûteux devrait revoir son jugement : la baisse du 31 juillet a fait l'essentiel du travail pour neutraliser l'argument tarifaire de Qwen dans le segment intermédiaire.

Là où Qwen se démarque nettement, c'est le contexte long et la mise en cache. En effet, le tarif de 2 $/6 $ est uniforme sur toute la fenêtre de 1 million de jetons : une requête de 900 000 jetons coûte le même prix par jeton qu'une requête courte, tandis que de nombreux concurrents facturent un supplément pour les entrées longues. Et l'entrée en cache à 0,25 $ par million de jetons réduit le coût d'entrée par 8× pour les charges de travail à contexte répété : l'appel ci-dessus passe de 0,26 $ à environ 0,09 $ une fois le contexte mis en cache. Si votre agent relit un contexte relativement stable à chaque itération, c'est là que se trouve l'avantage durable — pas dans le tarif affiché.

Ouverture et le modèle frère 27B

GPT-5.6 ne sera jamais auto-hébergeable. Qwen3.8-Max pourrait l'être — Alibaba annonce maintenant que les poids arrivent dans la semaine — mais le modèle phare n'est pas une cible pratique : environ 1,2 To en 4 bits contre environ 141 Go par H200 implique huit accélérateurs haut de gamme ou plus, et avec le nombre de paramètres actifs toujours non divulgué, vous ne pouvez même pas modéliser le débit que cela procure. Il n'y a également toujours pas de texte de licence, ce qui signifie que l'utilisabilité commerciale est formellement indéterminée.

Annoncé en même temps, Qwen3.8-27B est la sortie la plus importante pour quiconque s'intéresse à Qwen pour le contrôle plutôt que pour la capacité brute. Lui aussi disponible en open-weights, il tournerait dans environ 17 Go de VRAM — soit une seule carte grand public haut de gamme — ce qui en fait une véritable option on-premise, ce que le modèle phare de 2,4T ne sera jamais. Si vous comparez Qwen à GPT-5.6 pour des raisons de résidence des données, le modèle 27B est celui à évaluer.

FAQ

Est-ce que Qwen 3.8 est meilleur que GPT-5.6 ?

Pas sur la base des preuves existantes. Le tableau GA d'Alibaba est solide (GPQA Diamond 92,6, Terminal-Bench 2.1 86,6), mais il est entièrement auto-déclaré et aucun évaluateur indépendant n'a noté le modèle. GPT-5.6 Sol détient la 2e place sur l'indice d'intelligence audité (~59), domine les problèmes STEM les plus difficiles selon Artificial Analysis et atteint jusqu'à 750 tokens par seconde. GPT-5.6 l'emporte sur les plans de la preuve et de la vitesse.

L'affirmation "Qwen 3.8 est en avance sur GPT-5.6" est-elle vraie ?

Cela a commencé comme un sentiment communautaire et reste non vérifié. GA a apporté le tableau de benchmarks d'Alibaba, mais aucun score tiers — Artificial Analysis et LMArena restent sans score. Le prédécesseur Qwen3.7-Max a obtenu 46 contre ~59 pour Sol, donc l'affirmation nécessite un très grand bond d'une génération pour être littéralement vraie.

Lequel est le moins cher, Qwen 3.8 ou GPT-5.6 ?

Cela dépend du palier, et la réponse a changé le 31 juillet lorsque OpenAI a réduit ses prix. Qwen3.8-Max est à 2 $ / 6 $ par 1M. GPT-5.6 Terra est à 2 $ / 12 $ — même entrée, sortie double, donc Qwen gagne ici. Luna est à 0,20 $ / 1,20 $, ce qui la rend environ 10× moins chère que Qwen. Sol est premium, donc Qwen est bien moins cher que Sol.

Lequel est le plus rapide ?

{{1}}GPT-5.6, sans conteste en termes de débit.{{/1}} {{2}}Artificial Analysis fait état de jusqu'à 750 tokens/sec sur le matériel Cerebras.{{/2}} {{3}}Qwen3.8-Max affiche un temps de premier token p50 de 1,64 seconde dans la télémétrie sur 7 jours d'OrcaRouter,{{/3}} {{4}}mais les évaluateurs de l'ère d'aperçu l'ont jugé très lent sur les builds agentiques longs — ce constat précède le serveur GA et mérite d'être retesté.{{/4}}

Est-ce que Qwen 3.8 Max a quitté la version d’aperçu ?

Oui, le 3 août 2026. Il dispose désormais d'une grille tarifaire publiée et d'un endpoint compatible OpenAI et DashScope, si bien que le cadrage de juillet d'une campagne de crédits Qoder avec une réduction de 90 % ne décrit plus la façon dont il est vendu.

Puis-je auto-héberger Qwen 3.8 pour éviter les tarifs d'OpenAI ?

Ce n'est pas le modèle phare, réalistiquement. Les poids sont promis dans la semaine, mais aucune licence n'a été publiée, et avec ~1,2 To en 4 bits, il faudrait huit GPU ou plus de classe H200. Le Qwen3.8-27B, annoncé simultanément et nécessitant environ 17 Go de VRAM, est l'option pratique.

Lequel devrais-je utiliser aujourd'hui ?

GPT-5.6 Sol pour tout ce qui est sensible à la latence, interactif ou critique en matière de raisonnement, là où une qualité auditée compte. Luna pour les tâches simples à grand volume, où elle est de loin la moins chère. Qwen3.8-Max lorsque le long contexte et la mise en cache des prompts dominent votre facture — son tarif plat d'1M de tokens et ses 0,25 $ pour l'entrée en cache sont ses principaux atouts.

En résumé

Qwen 3.8 vs GPT-5.6 est un combat plus équitable qu'en juillet, et un peu moins déséquilibré sur le prix que ne l'espéraient les fans de Qwen. Qwen3.8-Max a atteint la disponibilité générale avec une tarification réelle, un tableau crédible de benchmarks auto-déclarés, un tarif fixe par million de tokens et une mise en cache peu coûteuse, qui le rendent véritablement attractif pour les tâches à long contexte. Ce sont des avantages structurels, pas promotionnels.

Mais la baisse de prix du 31 juillet d'OpenAI a émoussé l'argument du coût dans le segment intermédiaire — Terra égalise désormais Qwen sur l'entrée — et GPT-5.6 détient toujours les deux propriétés décisives : un classement n°2 audité par un évaluateur n'ayant aucun intérêt dans le résultat, et un débit allant jusqu'à 750 tokens/seconde, dont Qwen n'a montré aucun signe de se rapprocher. Surveillez deux événements : le premier score indépendant de l'Intelligence Index pour Qwen3.8-Max, et la mise à disposition des poids avec une licence. D'ici là, routez selon le profil de la tâche — GPT-5.6 quand la vitesse et la preuve comptent, Qwen quand la longueur du contexte et les cache hits dominent la facture — et vérifiez sur vos propres prompts.

Comparés dans cet article4

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube