Carte de titre principale pour GPT-6 Astra vs Qwen3.8-Max, avec pour sous-titre « Deux fleurons agentiques et les petites lignes sous chacun », des pastilles statistiques indiquant « AA Intelligence 61 vs 58 », « Prix catalogue 10 $ / 50 $ vs 2 $ / 6 $ » et « ARC-AGI-3 : 99,9 % fournisseur vs 62,7 % harnais neutre », un pied de page avec la date de lancement, et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

GPT-6 Astra contre Qwen3.8-Max : Deux fleurons agentiques et les petits caractères de chacun

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Septembre 2026 est marqué par deux récits de « modèle phare agentique », et GPT-6 Astra et Qwen3.8-Max en sont les sujets. OpenAI a lancé GPT-6 Astra le 3 septembre, en le présentant comme le modèle qu’elle estime être le meilleur au monde pour l’utilisation informatique, le génie logiciel, la science et la cybersécurité ; le Qwen3.8-Max d’Alibaba, disponible depuis le 3 août, est le modèle phare agentique du plus puissant laboratoire chinois — celui qu’Artificial Analysis classe parmi les meilleurs du domaine sur son indice agentique et le rival open-source le plus proche des affirmations de travail autonome de la frontière. Les deux sont réellement puissants, et les deux sont vendus avec des chiffres accrocheurs qui se réduisent à l’examen : le résultat de 99,9 % d’OpenAI sur ARC-AGI-3 tombe à 62,7 % quand ARC Prize exécute son propre environnement de test neutre, et le génie agentique de Qwen3.8-Max s’accompagne d’une régression mesurée de manière indépendante en matière d’hallucinations et d’une habitude à dépenser 64 itérations et plus d’un dollar sur des tâches que son prédécesseur terminait en 14. C’est une comparaison de deux modèles — et de deux manières de lire un benchmark.

Les deux gros titres

L'argumentaire d'OpenAI pour GPT-6 Astra repose sur l'ampleur des capacités et l'autonomie : un modèle unique qui pilote un navigateur, écrit et corrige du code, mène des analyses scientifiques et — fait unique — se montre particulièrement doué pour découvrir de nouvelles vulnérabilités de sécurité, au point qu'OpenAI a classé l'ensemble du modèle « critique » dans le cadre de son Preparedness Framework et a réservé les configurations les plus performantes à des partenaires agréés. Les documents de lancement revendiquent un score parfait de 100 % sur ExploitBench, 97,6 % sur FrontierMath Tier 4, 96,0 % sur GPQA Diamond, ainsi que le score de saturation sur ARC-AGI-3. L'argumentaire d'Alibaba pour Qwen3.8-Max est plus restreint, mais incisif : un cheval de trait de l'agentique à 2 $ / 6 $ qui se classe en tête, ou presque, des évaluations agentiques indépendantes, avec les poids sous-jacents publiés (sous une licence personnalisée) plutôt que verrouillés dans une boîte noire.

Ce que dit le tableau d'affichage indépendant

Artificial Analysis attribue actuellement à GPT-6 Astra (max) un score d’Intelligence de 61 — soit le 8e rang des 202 modèles qu’elle suit — et à Qwen3.8-Max un score d’Intelligence de 58, 24e rang. Cet écart de trois points est plus faible que l’écart de prix et plus faible que le marketing de l’un ou l’autre fournisseur ; sur l’indice agentique distinct d’AA, Qwen3.8-Max affiche un 58 qui l’a placé au niveau des meilleurs modèles propriétaires de pointe, tandis qu’AA ne publie encore aucun indice agentique pour GPT-6 Astra. La lecture honnête : en termes d’intelligence purement mesurée, ces deux modèles sont proches voisins, et l’angle du « modèle le plus intelligent du monde » dans les documents de lancement d’OpenAI ne correspond pas à ce que montre l’évaluation indépendante d’AA.

Intelligence — GPT-6 Astra (max) : AA Intelligence 61, rang #8/202. Qwen3.8-Max : AA Intelligence 58, rang #24/202 ; AA Agentic 58.

Prix catalogue — GPT-6 Astra : 10,00 $ / 50,00 $ par 1M, 1,00 $ pour les lectures de cache, 2× le prix de l’entrée au-delà de 272K tokens. Qwen3.8-Max : 2,00 $ / 6,00 $ par 1M, 0,25 $ pour les lectures de cache.

Contexte / sortie — GPT-6 Astra : 1,05 M en entrée / 128 K en sortie. Qwen3.8-Max : 1 M en entrée / ~128 K en sortie.

Preuves agentiques — GPT-6 Astra : ARC-AGI-3 99,9 % (harnais OpenAI) contre 62,7 % (harnais standard ARC Prize) ; WANDR 0,682 à 11,98 $/tâche (rapporté par Perplexity). Qwen3.8-Max : AA GDPval 1 739 Elo à 64 tours/tâche (~1,14 $/tâche) ; Code Arena WebDev n° 1 à 1 691 Elo.

Signaux d'alarme indépendants — GPT-6 Astra : pas encore dans le sélecteur de ChatGPT, API déployée par étapes, concession de surveillabilité. Qwen3.8-Max : régression des hallucinations AA-Omniscience de 23 % à 40 % par rapport à la génération précédente.

Poids — GPT-6 Astra : propriétaire. Qwen3.8-Max : checkpoint de classe Max (Qwen3.8-2.4T-A95B) rendu public sous licence personnalisée depuis le 12 août ; AA répertorie toujours le modèle phare hébergé comme propriétaire.

Two-column comparison scoreboard for GPT-6 Astra vs Qwen3.8-Max. GPT-6 Astra column: AA Intelligence 61 (#8 of 202), AA Agentic not yet published, list price $10.00/$50.00, context/output 1.05M/128K, headline score ARC-AGI-3 99.9% on OpenAI's provider-adapter harness, independent caveat 62.7% on ARC Prize's standard harness. Qwen3.8-Max column: AA Intelligence 58 (#24 of 202), AA Agentic 58, list price $2.00/$6.00, context/output 1M/~128K, headline score GDPval 1,739 Elo on Artificial Analysis runs, independent caveat hallucination regression from 23% to 40% per AA-Omniscience.

Les petits caractères, annotés

Prenons d'abord le chiffre ARC-AGI-3, car c'est l'exemple le plus net de la façon dont un nombre peut être à la fois vrai et trompeur. OpenAI annonce 99,9 % pour GPT-6 Astra sur son propre harnais adapté au fournisseur — une configuration ajustée au modèle. ARC Prize, l'organisation qui gère le benchmark, a exécuté GPT-6 Astra sur son harnais standard indépendant du fournisseur et a mesuré 62,7 %. Les deux chiffres sont à la pointe ; aucun n'atteint 99,9 % sur un harnais que le fabricant du modèle ne contrôle pas. La même prudence s'applique au score WANDR de Perplexity, soit 0,682 — le plus élevé que Perplexity ait enregistré, mais mesuré par une entreprise qui intègre simultanément GPT-6 Astra dans ses propres produits, ce qui lui confère un intérêt commercial. Ce schéma mérite d'être nommé : les chiffres les plus spectaculaires d'OpenAI proviennent tous de harnais contrôlés par OpenAI ou par ses partenaires, et le seul chiffre totalement indépendant — l'Intelligence 61 d'AA — est simplement excellent.

Le petit caractère de Qwen3.8-Max va dans l'autre sens : ses forces sont mesurées indépendamment, et ses faiblesses aussi. Le score GDPval de 1 739 Elo est authentique — mais les exécutions d'Artificial Analysis montrent que Qwen3.8-Max l'atteint en dépensant 64 tours et environ 1,14 $ par tâche, contre 14 tours et 0,53 $ pour la génération précédente. C'est une taxe d'effort : le modèle achète son plafond agentique avec des jetons de raisonnement, ce qui compte pour quiconque paie au jeton. Et l'évaluation Omniscience d'AA a mesuré une régression de l'hallucination de 23 % à 40 % par rapport à la génération Qwen précédente — un signal indépendant réel pour exactement les charges de travail autonomes et multi-étapes où une réponse fausse mais confiante coûte le plus cher. Un modèle qui se raisonne en erreurs sur 64 tours n'est pas évidemment plus sûr à libérer qu'un modèle dont le fabricant concède que sa surveillabilité a diminué.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) showing an Intelligence Index of 61 ranked #8 of 202, Cost ranked #86 of 202 with $10.00 input and $50.00 output per million tokens and a 90% cache discount, a $1.67 cost per Intelligence Index task, and a summary describing the model as among the leaders in intelligence but expensive for its class.

Prix, déploiement et la manière honnête de choisir

Sur le prix, le débat est tranché : Qwen3.8-Max à 2,00 $ / 6,00 $ par million de jetons représente un cinquième du tarif d’entrée de GPT-6 Astra et un huitième de son tarif de sortie, avec un contexte de 1M de jetons qui n’inclut pas la surcharge pour prompts longs d’Astra. Sur la déployabilité, Qwen3.8-Max a un avantage supplémentaire cette semaine — il est disponible dès aujourd’hui, et il est en service sur OrcaRouter au prix catalogue d’Alibaba, transmis avec une marge de 0 % et un basculement automatique. GPT-6 Astra, encore en cours de déploiement et pas encore sélectionnable dans ChatGPT pour la plupart des utilisateurs au 4 septembre, est accessible via l’API d’OpenAI et les principales places de marché cloud, tandis que l’accès s’élargit. La démarche pratique pour une équipe qui construit des pipelines agentiques consiste à exécuter la charge de travail sur le modèle que vous pouvez appeler dès aujourd’hui, et à traiter l’autre comme une référence à surveiller. Si vous voulez évaluer les allégations « agentiques » plutôt que de leur faire confiance, une couche de routage est l’outil qu’il vous faut : Qwen3.8-Max, Kimi K3, Grok 4.6 et plus de 200 autres modèles se trouvent derrière une seule clé sur OrcaRouter, et le DSL de routage peut combiner plusieurs de ces modèles en un seul appel — vous pouvez ainsi exécuter votre propre suite de tâches face aux concurrents et lire les résultats vous-même, plutôt que de choisir entre les petites lignes de deux fournisseurs.

Deux questions que cette confrontation ne cesse de soulever

Pourquoi OpenAI annonce 99,9 % sur ARC-AGI-3 alors qu'ARC Prize mesure 62,7 % ? Parce qu'il ne s'agit pas du même test. Le harnais d'OpenAI avec adaptateur de fournisseur est une version du benchmark configurée pour l'appel de GPT-6 Astra en production ; le harnais standard d'ARC Prize est une configuration neutre conçue pour comparer équitablement n'importe quel modèle. Le résultat de 62,7 % est celui qui se généralise à « ce qui se passe si j'appelle ce modèle moi-même », et c'est toujours le meilleur score qu'ARC Prize ait enregistré sur ce harnais.

Qwen3.8-Max a-t-il des poids ouverts ? Partiellement, avec une réserve sur la licence. Alibaba a publié le checkpoint de classe Max Qwen3.8-2.4T-A95B le 12 août sous une licence personnalisée : les poids sont téléchargeables, mais cela ne correspond pas à l'ouverture de type Apache-2.0 du plus petit Qwen3.8-27B, et Artificial Analysis classe toujours le modèle phare hébergé comme propriétaire. Si votre exigence est « pouvoir exécuter le modèle exact que je paie », cette distinction compte ; si votre exigence est « pouvoir inspecter l'architecture et auto-héberger une variante proche », Qwen3.8-Max y répond, contrairement à GPT-6 Astra.

Le point à retenir

Choisissez {{1}}GPT-6 Astra{{/1}} si vous avez besoin des choses spécifiques que lui seul fait actuellement — {{2}}travail de sécurité offensive, raisonnement scientifique de pointe, les tâches les plus difficiles d’utilisation autonome de l’ordinateur{{/2}} — et que votre organisation peut franchir ses conditions d’accès et se permettre son prix. Choisissez {{3}}Qwen3.8-Max{{/3}} si vous voulez un modèle agentique de premier ordre que vous pouvez réellement déployer dès cette semaine à {{4}}$2/$6{{/4}}, avec les poids comme porte de sortie et une {{5}}régression en matière d’hallucinations{{/5}} que vous savez désormais devoir tester. La leçon plus large tient aux petites lignes elles-mêmes : en {{6}}septembre 2026{{/6}}, les deux modèles phares « agentiques » sont vendus avec des chiffres d’appel que ni l’un ni l’autre fabricant ne maîtrise pleinement, et l’acheteur rationnel lit le harnais, compte les tours et exécute ses propres tâches avant de choisir son camp.

Screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing the $2.00 per 1M input and $6.00 per 1M output prices, and Alibaba listed as the provider with the model's flagship reasoning and agentic positioning.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement