
GPT-6 Sol vs Qwen3.8-Max : la seule ligne où le modèle fermé ne peut pas rivaliser
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Presque toutes les comparaisons entre GPT-6 Sol et Qwen3.8-Max se joueront sur le coût, et presque toutes se tromperont sur le coût dans le même sens. Qwen3.8-Max, le produit phare hébergé du fournisseur, est facturé à 2,00 $ par million de jetons d'entrée et 6,00 $ par million de jetons de sortie depuis sa disponibilité générale du 3 août 2026, avec l'instantané daté Qwen3.8-Max-0902 arrivé le 2 septembre. GPT-6 Sol a atteint la disponibilité générale le 22 septembre 2026, à 2,00 $ en entrée et 10,00 $ en sortie. Prix d'entrée identique, et une sortie 40 % moins chère sur la grille tarifaire de Qwen3.8-Max — et, sur le harnais indépendant, environ cinq fois le coût pour terminer une tâche.
Mais il existe une deuxième différence, plus nette, que l’argument du coût ne cesse d’enterrer, et c’est celle qui décide réellement de certaines charges de travail. Qwen3.8-Max accepte la vidéo. GPT-6 Sol, non. Ce n’est pas une question de prix ni de benchmark ; c’est une capacité que l’un de ces modèles possède et que l’autre ne peut pas approcher, et c’est la seule partie de cette confrontation qu’aucun travail sur l’efficacité des tokens, aussi poussé soit-il, ne pourra corriger.

Deux fleurons, deux formes différentes.
Qwen3.8-Max est un modèle à mélange d'experts clairsemé de 2,4 billions de paramètres, dont environ 95 milliards de paramètres sont actifs par requête — le deuxième plus grand modèle hébergé en production, derrière Kimi K3. Sa fenêtre de contexte est d'un million de jetons, avec un plafond de sortie de 131 072 jetons ; ses modalités d'entrée sont le texte, l'image et la vidéo, et il prend en charge un effort de raisonnement réglable sur faible, moyen et très élevé, avec des sorties structurées et l'appel d'outils. Le modèle phare hébergé n'est pas à poids ouverts ; l'artefact téléchargeable de la même génération constitue une publication distincte, avec ses propres limitations.
GPT-6 Sol prend en entrée du texte et des images et produit du texte en sortie. Sa fenêtre est de 1 050 000 tokens, avec une entrée maximale de 922 000 tokens et un plafond de sortie de 128 000 tokens, à un tarif fixe de 2,00 $ et 10,00 $, avec une lecture en cache à 0,20 $ et des écritures de cache à 2,50 $, revalorisant toute la requête au-dessus de 272 000 tokens d'entrée à 4,00 $ et 15,00 $. Il est fermé, à identifiant unique, et OpenAI a décrit ces tarifs comme permanents plutôt que promotionnels.
Les chiffres de la fenêtre présentent un écart d'environ 7 % les uns par rapport aux autres, et les plafonds de sortie se situent dans la même fourchette. La liste des modalités est le seul écart structurel — et il est à sens unique.
Ligne par ligne
• Entrée — GPT-6 Sol 2,00 $ par million de jetons contre Qwen3.8-Max 2,00 $ par million de jetons ; le chiffre phare est identique
• Sortie — GPT-6 Sol à 10,00 $ par million de tokens contre Qwen3.8-Max à 6,00 $ par million de tokens ; le tarif d’Alibaba est inférieur de 40 %
• Entrée mise en cache — GPT-6 Sol 0,20 $ par million de tokens contre Qwen3.8-Max 0,25 $ par million de tokens pour les lectures de cache implicites, avec une lecture de cache explicite à 0,17 $ et une écriture de cache explicite à 2,50 $
• Fenêtre de contexte — GPT-6 Sol 1 050 000 jetons contre Qwen3.8-Max 1 000 000 jetons
• Sortie maximale — GPT-6 Sol 128 000 tokens vs Qwen3.8-Max 131 072 tokens
• Modalités d'entrée — texte et image pour GPT-6 Sol vs texte, image et vidéo pour Qwen3.8-Max
• Gestion du contexte long — GPT-6 Sol applique un nouveau tarif à l'ensemble de la requête au-delà de 272 000 jetons d'entrée, à 2× les tarifs d'entrée et de cache et 1,5× la sortie, contre Qwen3.8-Max qui applique un palier unique sur toute la fenêtre, ce qui est le seul point où la grille tarifaire de Qwen est structurellement meilleure plutôt que marginalement moins chère
• Effort de raisonnement — GPT-6 Sol aucun, faible, moyen (par défaut), élevé, très élevé, max vs Qwen3.8-Max faible, moyen et extra-élevé
• Date de coupure des connaissances — GPT-6 Sol : 20 avril 2026 vs Qwen3.8-Max : pas de date unique publiée
• Instantané daté — GPT-6 Sol, un identifiant unique évolutif vs Qwen3.8-Max-0902 disponible sous forme de révision épinglée du 2 septembre 2026 au même prix
La longue fenêtre de contexte mérite plus d’attention qu’on ne lui en accorde habituellement. Le supplément de GPT-6 Sol est une étape appliquée à l’ensemble de la requête, si bien qu’une exécution d’agent de 900 000 tokens est facturée à 4,00 $ et 15,00 $ sur chaque token. Qwen3.8-Max facture un seul palier sur toute la fenêtre. Pour une charge de travail qui se situe au-delà de 272 000 tokens, les deux grilles tarifaires cessent d’être comparables du tout — le modèle le moins cher sur le prix d’appel est le plus cher, et de loin, et le sens de l’écart dépend entièrement de l’endroit où se situe votre contexte.

La grille tarifaire annonce 40 % moins cher. Le harnais, lui, annonce une facture cinq fois plus élevée.
Artificial Analysis a mesuré Qwen3.8-Max-0902 à un score de 45 à l’Intelligence Index, pour un coût de 5,41 $ par tâche d’indice complétée, après avoir généré 190 millions de tokens de sortie sur l’ensemble de l’exécution. Son résumé décrit le modèle comme « remarquablement lent et très verbeux ». GPT-6 Sol a obtenu un score de 48 pour 1,06 $ par tâche sur 77 millions de tokens de sortie.
Lisez ces trois paires ensemble et la forme du duel apparaît. Qwen accuse trois points d’indice de retard, a généré deux fois et demie autant de tokens, et a coûté environ cinq fois plus cher par tâche terminée — sur une grille tarifaire où sa sortie est 40 % moins chère. Le mécanisme n’a rien de subtil. À 6,00 $ par million de tokens de sortie, 190 millions de tokens coûtent 1,14 $ par exécution de l’indice rien qu’en sortie, avant même de compter l’entrée ; à 10,00 $ par million, les 77 millions de Sol coûtent 0,77 $. Le tarif moins cher achète plus de tokens, pas une facture plus petite.
C’est le même schéma qui apparaît dans tout le champ de septembre, et il vaut la peine de l’énoncer comme une règle plutôt que comme un fait concernant ces deux modèles : sur une grille tarifaire par token, une remise de 40 % sur les tokens de sortie ne vaut rien si le modèle émet deux fois et demie plus de tokens. Le coût par tâche accomplie est le seul chiffre qui tienne.
Ce qu'Alibaba a publié, et le problème du réglage de l'effort
Le tableau de benchmark propre à Alibaba est le plus long de cette comparaison et le moins comparable. Les chiffres déclarés par le fournisseur placent Qwen3.8-Max en tête sur PaperBench et IFBench, mais en retard sur SWE-bench Pro et Humanity's Last Exam, avec une échelle d'effort de raisonnement — faible, moyen, extra-élevé — qui n'a pas de correspondance directe avec l'échelle à six niveaux d'OpenAI. Un score publié au niveau extra-élevé n'est pas le même produit qu'un score publié au niveau moyen, et aucun des deux fournisseurs n'indique lequel a produit un chiffre donné sur un graphique comparatif.
C'est la raison honnête de ne pas s'appuyer sur le tableau de l'un ou l'autre fournisseur ici. Les chiffres d'Alibaba sont obtenus sur le harnais d'Alibaba, avec le réglage d'effort d'Alibaba ; ceux d'OpenAI sont obtenus sur celui d'OpenAI. Les chiffres d'Artificial Analysis existent précisément parce que ces deux sources sont inutilisables pour une comparaison directe, et ce sont eux qui sont utilisés ci-dessus.
La reproductibilité est une véritable fonctionnalité, et son prix est de zéro.
L'instantané daté est l'élément le plus sous-estimé de cette comparaison. Qwen3.8-Max-0902 est une révision figée du 2 septembre 2026 dont Alibaba affirme qu'elle offre les mêmes capacités et le même tarif que le modèle de base. L'épingler signifie que le modèle derrière votre point de terminaison ne change pas sous vos pieds entre un mardi et un jeudi.
GPT-6 Sol n'a pas d'équivalent. Il s'agit d'un identifiant unique et évolutif — la même page de modèle comporte un instantané par défaut et aucune variante datée — ce qui signifie que ce que vous avez évalué en septembre n'est pas nécessairement ce que vous appelez en novembre. Pour la plupart des équipes, cela ne pose pas de problème. Pour un pipeline réglementé qui doit démontrer ce qui a produit un résultat, c'est une véritable différence, et c'est une différence qu'Alibaba offre gratuitement alors qu'OpenAI ne l'offre pas du tout.
La ligne vidéo est celle qui décide
Tout ce qui précède est une comparaison. Cette partie ne l’est pas. Si votre entrée comprend de la vidéo — enregistrements d’écran, séquences d’inspection, captation de cours, tout élément où l’information est en mouvement plutôt que dans une image fixe — Qwen3.8-Max l’accepte nativement et GPT-6 Sol n’a aucun moyen d’y accéder. Vous ne pouvez pas contourner une modalité à coups de prompts. Vous ne pouvez pas prétraiter une vidéo en images et obtenir la même chose, car l’information temporelle est l’essentiel, et aucune quantité de points d’indice sur un benchmark textuel ne remplace l’entrée dont votre tâche a réellement besoin.
Le cas inverse mérite aussi d'être cité, car c'est là que la comparaison cesse d'être déséquilibrée. Si votre entrée est du texte et des images, Sol est moins cher par tâche, quatre points d'avance sur le classement neutre, et moins cher sur les lectures en cache. La capacité vidéo n'est pas un facteur de départage en votre faveur ; elle est simplement inutilisée.
Routage d’une décision qui comporte deux réponses distinctes

Dans ce duel, la bonne architecture se compose réellement de deux modèles, et non d’un seul, et la raison en est que la séparation se fait par modalité d’entrée plutôt que par difficulté. Un pipeline qui ingère de la vidéo et raisonne sur du texte a besoin des deux, et la règle de routage est une propriété de la requête plutôt qu’une décision subjective.
Qwen3.8-Max figure au catalogue d'OrcaRouter — l'instantané daté qwen/qwen3.8-max-0902 est routable au prix catalogue d'Alibaba dans le cadre du modèle de refacturation, ce qui signifie que une modification des tarifs d'Alibaba est effective de notre côté le jour même plutôt qu'après qu'un revendeur ait renégocié. GPT-6 Sol ne figure pas dans notre catalogue à l'heure où nous écrivons et est accessible via l'API propre à OpenAI. Le DSL de routage est l'élément qui convient à ce cas précis : une règle qui envoie les requêtes contenant de la vidéo d'un côté et tout le reste de l'autre est exactement à quoi il sert, et le basculement automatique signifie que la branche par modalité ne devient pas le point de défaillance unique.
Là où chacun gagne
• Vidéo en entrée, texte en sortie — Qwen3.8-Max, et il n'y a même pas match.
• Texte et image en entrée, le coût par tâche accomplie comme métrique — GPT-6 Sol, d'environ cinq fois sur le banc d'essai indépendant.
• Travail sur préfixe mis en cache — GPT-6 Sol. Sa lecture en cache est légèrement moins coûteuse et son volume de tokens représente moins de la moitié.
• Requêtes dépassant 272 000 jetons d'entrée — Qwen3.8-Max. La refacturation par Sol de la requête dans son intégralité est la différence de coût la plus importante de cette comparaison, et elle reste invisible dans les tarifs affichés.
• Épinglage reproductible — Qwen3.8-Max-0902, qui ne coûte rien de plus et constitue la seule révision épinglée des deux.
• Si l’on vous a montré un graphique où Qwen est en tête sur SWE-bench Pro — vérifiez quel harness a produit ce graphique et à quel réglage d’effort. Le classement indépendant place Qwen trois points derrière sur le composite, et les tableaux des fournisseurs ne sont pas à la même échelle les uns que les autres.
Comparés dans cet article3
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
