Une carte hero générée intitulée « GPT-6.1 Sol vs Qwen3.8-Max » avec deux panneaux arrondis : à gauche « GPT-6.1 Sol » indiquant « OpenAI - sorti le 29 sept. 2026 », « 2,00 $ en entrée / 10,00 $ en sortie par 1 M », « 0,72 $ par tâche » et « AA Index 51,8 » ; à droite « Qwen3.8-Max » indiquant « Alibaba - sorti le 3 août 2026 », « 2,00 $ en entrée / 6,00 $ en sortie par 1 M », « 5,41 $ par tâche » et « AA Index 45,4 » ; en dessous, le bandeau « Même prix d'entrée. 7,5x la facture. » ; en pied de page « Chiffres : Artificial Analysis v4.3.2. » et le logo OrcaRouter en bas à droite.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max : La facture, pas la liste de prix

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Prenez une tâche nocturne de maintenance de dépôt, exécutez-la une fois par nuit pendant un mois, et confiez-la à tour de rôle à GPT-6.1 Sol et à Qwen3.8-Max. D'après les chiffres par tâche de la v4.3.2 d'Artificial Analysis, GPT-6.1 Sol coûte $21.72 pour ces trente nuits et Qwen3.8-Max coûte $162.27 — un écart de $140.55 par mois, soit environ $1,690 par an, pour une tâche dont la grille tarifaire par token affiche $2.00 en entrée et $10.00 en sortie contre $2.00 en entrée et $6.00 en sortie. Les tarifs par million ne diffèrent que d'une erreur d'arrondi en entrée et le modèle chinois est 40 % moins cher en sortie, et pourtant la facture diffère d'un facteur de 7,5. Le fournisseur a publié GPT-6.1 Sol le 29 septembre 2026 ; Qwen3.8-Max est en service depuis le 3 août 2026.

Cet écart n'est pas une astuce tarifaire et ce n'est pas un artefact de benchmark — c'est tout ce que cette comparaison a à dire, et il provient d'un seul chiffre qu'aucune grille tarifaire ne vous montre.

Ce qu'est chaque modèle

GPT-6.1 Sol est le fleuron actuel d’OpenAI en matière de raisonnement et de codage, commercialisé une semaine après le GPT-6 Sol qu’il remplace, au même prix catalogue de 2,00 $ / 10,00 $, avec un tarif de 0,10 $ pour les entrées mises en cache et une fenêtre de contexte de 1 050 000 tokens. Il est vendu pour le travail agentique : ses étiquettes « idéal pour » sur notre propre fiche de modèle indiquent raisonnement, codage et agentique, et il affiche le score de qualité du plus haut niveau.

Qwen3.8-Max est le modèle phare agentique d'Alibaba — un modèle fermé, uniquement accessible via API, qui accepte en entrée du texte, des images et de la vidéo et dispose d'un contexte de 1 000 000 de tokens. Contrairement aux versions plus petites de Qwen, celui-ci n'a pas de poids publiés. Sur Artificial Analysis, il obtient 45,42 à l'Intelligence Index, soit le 17e rang sur 147 modèles, avec un indice de codage de 76,2 qui le classe 9e dans ce domaine. Ce n'est pas un modèle faible. C'est simplement un modèle coûteux à laisser réfléchir.

Le numéro qui ne figure pas sur la grille tarifaire

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis relève 107 730 jetons de sortie par tâche pour Qwen3.8-Max, dont 70 830 jetons de raisonnement. GPT-6.1 Sol produit 38 128 jetons de sortie, dont 25 190 de raisonnement. Le modèle chinois écrit 2,8 fois plus de jetons pour répondre à la même question, et il les écrit à un coût inférieur de 40 % par jeton.

• Jetons de sortie par tâche — 38 128 contre 107 730 ; Qwen en écrit 2,8× plus

• Dont le raisonnement — 25 190 vs 70 830

• Coût par tâche — 0,724 $ contre 5,409 $ ; Qwen coûte 7,5 fois plus cher

• Temps par tâche — 640 s contre 2 152 s ; environ 11 minutes contre environ 36

• Temps jusqu'au premier jeton de réponse — 332,0 s contre 55,1 s

• Indice d'intelligence — 51,83 vs 45,42

• Fenêtre de contexte — 1 050 000 vs 1 000 000 tokens

• Entrées acceptées — texte, image et fichier vs texte, image et vidéo

Faites la multiplication et la remise disparaît. Un modèle qui émet près de trois fois plus de jetons à un tarif inférieur de 40 % ne coûte pas moins — il coûte environ 1,7 fois plus cher sur la sortie seule, et le chiffre mesuré par tâche situe le véritable multiple à 7,5 une fois pris en compte l’entrée, les lectures en cache et la longueur de la réponse productive.

Notez les quatrième et cinquième lignes, car elles pointent dans des directions opposées et, ensemble, elles expliquent ce qu'est Qwen3.8-Max. Il renvoie son premier token en 55 secondes là où GPT-6.1 Sol met cinq minutes et demie, puis passe trente-six minutes à terminer la tâche là où le modèle d'OpenAI s'en acquitte en onze. C'est un modèle qui se met à parler immédiatement et réfléchit très longuement. Pour une interface de chat avec une réponse en streaming, cela passe pour de la réactivité. Pour une tâche nocturne non surveillée, c'est du temps d'horloge que vous payez aussi.

Trois domaines où Qwen3.8-Max est véritablement en avance

L’écart d’indice est de 6,4 points sur l’ensemble de la suite, soit le genre de chiffre que l’on cite comme s’il était uniforme. Il ne l’est pas, et le désaccord est instructif :

• GPQA Diamond — Qwen3.8-Max 0,9283 vs GPT-6.1 Sol non publié dans cette exécution

• GDPval — 1 671,4 vs 1 575,09

• Terminal-Bench 2.1 — 0,8876 contre non publié dans cette exécution

• AutomationBench — 0,5619 vs 0,6487

• SciCode — non publié dans cette exécution, contre 0,5417 pour GPT-6.1 Sol

• CritPT — 0,1771 vs 0,3171

Qwen3-Max remporte l’épreuve de niveau master et l’échantillon de tâches de raisonnement, ce qui est un résultat notable pour un modèle de sa génération et la raison pour laquelle il est 9e sur 100 en codage. Il perd sur les évaluations plus difficiles axées sur la recherche — CritPT de ... — et il perd AutomationBench de 8,7, celui qui ressemble le plus à du travail informatique sans supervision. Celle de ces deux qui vous importe pour votre évaluation est la clé ; le 6,4-... est une moyenne sur un désaccord.

Ce que les tokens supplémentaires apportent, et ce qu’ils n’apportent pas

Les longues traces de raisonnement ne sont pas du gaspillage par définition. Un modèle qui dépense 70 830 tokens de délibération sur une tâche difficile fait quelque chose que le modèle plus court pourrait sauter, et sur les évaluations où Qwen3.8-Max est en tête, cette délibération en est plausiblement la raison. Le mode de défaillance est que vous le payez sur chaque tâche, pas seulement les difficiles. Le nombre de tokens de raisonnement est une propriété de la calibration du modèle, pas de la difficulté de la question, et un modèle qui réfléchit trop à une extraction d'une ligne vous le facture.

La façon de déterminer laquelle de vos tâches est laquelle est d’arrêter de considérer le choix du modèle comme global. Ce qui nous amène à la partie qui est un changement de configuration.

Notre propre fiche de modèle pour GPT-6.1 Sol contient les chiffres servis du sujet : le tarif de 2,00 $ / 10,00 $, la fenêtre de contexte de 1 050 000 jetons, un p50 de 4,54 secondes jusqu'au premier jeton, et un bloc d'indice Artificial Analysis stocké sur la même page que la tarification qu'une application utiliserait réellement pour router.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Une clé, un compteur, deux modèles

Les deux modèles sont accessibles via un point de terminaison OrcaRouter unique — une seule API pour plus de 200 modèles, le prix catalogue du fournisseur étant répercuté avec 0 % de marge. La fiche OrcaRouter de Qwen3.8-Max indique le tarif appliqué aux côtés de la fenêtre de contexte de 1 000 000 de tokens, des modalités d'entrée texte/image/vidéo et du volume sur sept jours de 101,4 millions de tokens — les chiffres sur lesquels une application fonde son routage, à côté de ceux dont l'article débat. Cette répercussion compte tout particulièrement pour Qwen3.8-Max, car un modèle dont l'économie est dominée par le volume de tokens de sortie est un modèle dont le fournisseur peut modifier le tarif à tout moment, et un compteur en répercussion signifie que le changement se retrouve sur votre facture le jour où Alibaba le publie, plutôt que selon le calendrier d'un revendeur.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

L’utilisation la plus intéressante de la couche de routage ici est le DSL de routage, qui vous permet de composer des modèles en un seul appel plutôt que d’en choisir un pour toute l’application. Répartissez la tâche nocturne : un modèle économique classe et extrait, GPT-6.1 Sol prend en charge les étapes de raisonnement et de vérification, et Qwen3.8-Max est réservé aux tâches où sa longue délibération et sa puissance scientifique de classe GPQA changent réellement la réponse. Le basculement automatique couvre le reste — si un fournisseur se dégrade en cours d’exécution, la requête est déplacée plutôt que de faire échouer le lot.

Aucun des deux n’est une raison de choisir un modèle. C’est la raison pour laquelle vous n’avez pas à faire ce choix une fois pour toutes et à devoir vivre avec.

L’appel, et ce qu’il faut surveiller

Ne payez le facteur 7,5 que là où la délibération le justifie. Sur une tâche nocturne polyvalente, GPT-6.1 Sol à 0,724 $ la tâche est le choix par défaut défendable, et les 1 690 $ par an sont bien réels. Là où la tâche relève de la science dure ou du raisonnement professionnel avec une réponse vérifiable, le 0,9283 de Qwen3.8-Max sur GPQA Diamond vaut les tokens — c’est précisément ce qu’il fait mieux.

Ce qu'il faut surveiller, c'est de savoir si Alibaba révise ses tarifs. Un modèle à 2,8× tokens facturé 2,00 $/6,00 $ est tarifé comme si les tokens étaient la ressource rare ; or le comportement du modèle lui-même rend les tokens abondants. Si le tarif de sortie évolue sensiblement, l'arithmétique de cet article évolue avec lui, et le compteur de répercussion vous le montrera le jour même où cela se produit.

Comparés dans cet article3

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement