
GPT-6 Astra contre Qwen3.8-Max : Deux fleurons agentiques et les petits caractères de chacun
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Septembre 2026 est marqué par deux récits de « modèle phare agentique », et GPT-6 Astra et Qwen3.8-Max en sont les sujets. OpenAI a lancé GPT-6 Astra le 3 septembre, en le présentant comme le modèle qu’elle estime être le meilleur au monde pour l’utilisation informatique, le génie logiciel, la science et la cybersécurité ; le Qwen3.8-Max d’Alibaba, disponible depuis le 3 août, est le modèle phare agentique du plus puissant laboratoire chinois — celui qu’Artificial Analysis classe parmi les meilleurs du domaine sur son indice agentique et le rival open-source le plus proche des affirmations de travail autonome de la frontière. Les deux sont réellement puissants, et les deux sont vendus avec des chiffres accrocheurs qui se réduisent à l’examen : le résultat de 99,9 % d’OpenAI sur ARC-AGI-3 tombe à 62,7 % quand ARC Prize exécute son propre environnement de test neutre, et le génie agentique de Qwen3.8-Max s’accompagne d’une régression mesurée de manière indépendante en matière d’hallucinations et d’une habitude à dépenser 64 itérations et plus d’un dollar sur des tâches que son prédécesseur terminait en 14. C’est une comparaison de deux modèles — et de deux manières de lire un benchmark.
Les deux gros titres
L'argumentaire d'OpenAI pour GPT-6 Astra repose sur l'ampleur des capacités et l'autonomie : un modèle unique qui pilote un navigateur, écrit et corrige du code, mène des analyses scientifiques et — fait unique — se montre particulièrement doué pour découvrir de nouvelles vulnérabilités de sécurité, au point qu'OpenAI a classé l'ensemble du modèle « critique » dans le cadre de son Preparedness Framework et a réservé les configurations les plus performantes à des partenaires agréés. Les documents de lancement revendiquent un score parfait de 100 % sur ExploitBench, 97,6 % sur FrontierMath Tier 4, 96,0 % sur GPQA Diamond, ainsi que le score de saturation sur ARC-AGI-3. L'argumentaire d'Alibaba pour Qwen3.8-Max est plus restreint, mais incisif : un cheval de trait de l'agentique à 2 $ / 6 $ qui se classe en tête, ou presque, des évaluations agentiques indépendantes, avec les poids sous-jacents publiés (sous une licence personnalisée) plutôt que verrouillés dans une boîte noire.
Ce que dit le tableau d'affichage indépendant
Artificial Analysis attribue actuellement à GPT-6 Astra (max) un score d’Intelligence de 61 — soit le 8e rang des 202 modèles qu’elle suit — et à Qwen3.8-Max un score d’Intelligence de 58, 24e rang. Cet écart de trois points est plus faible que l’écart de prix et plus faible que le marketing de l’un ou l’autre fournisseur ; sur l’indice agentique distinct d’AA, Qwen3.8-Max affiche un 58 qui l’a placé au niveau des meilleurs modèles propriétaires de pointe, tandis qu’AA ne publie encore aucun indice agentique pour GPT-6 Astra. La lecture honnête : en termes d’intelligence purement mesurée, ces deux modèles sont proches voisins, et l’angle du « modèle le plus intelligent du monde » dans les documents de lancement d’OpenAI ne correspond pas à ce que montre l’évaluation indépendante d’AA.
• Intelligence — GPT-6 Astra (max) : AA Intelligence 61, rang #8/202. Qwen3.8-Max : AA Intelligence 58, rang #24/202 ; AA Agentic 58.
• Prix catalogue — GPT-6 Astra : 10,00 $ / 50,00 $ par 1M, 1,00 $ pour les lectures de cache, 2× le prix de l’entrée au-delà de 272K tokens. Qwen3.8-Max : 2,00 $ / 6,00 $ par 1M, 0,25 $ pour les lectures de cache.
• Contexte / sortie — GPT-6 Astra : 1,05 M en entrée / 128 K en sortie. Qwen3.8-Max : 1 M en entrée / ~128 K en sortie.
• Preuves agentiques — GPT-6 Astra : ARC-AGI-3 99,9 % (harnais OpenAI) contre 62,7 % (harnais standard ARC Prize) ; WANDR 0,682 à 11,98 $/tâche (rapporté par Perplexity). Qwen3.8-Max : AA GDPval 1 739 Elo à 64 tours/tâche (~1,14 $/tâche) ; Code Arena WebDev n° 1 à 1 691 Elo.
• Signaux d'alarme indépendants — GPT-6 Astra : pas encore dans le sélecteur de ChatGPT, API déployée par étapes, concession de surveillabilité. Qwen3.8-Max : régression des hallucinations AA-Omniscience de 23 % à 40 % par rapport à la génération précédente.
• Poids — GPT-6 Astra : propriétaire. Qwen3.8-Max : checkpoint de classe Max (Qwen3.8-2.4T-A95B) rendu public sous licence personnalisée depuis le 12 août ; AA répertorie toujours le modèle phare hébergé comme propriétaire.

Les petits caractères, annotés
Prenons d'abord le chiffre ARC-AGI-3, car c'est l'exemple le plus net de la façon dont un nombre peut être à la fois vrai et trompeur. OpenAI annonce 99,9 % pour GPT-6 Astra sur son propre harnais adapté au fournisseur — une configuration ajustée au modèle. ARC Prize, l'organisation qui gère le benchmark, a exécuté GPT-6 Astra sur son harnais standard indépendant du fournisseur et a mesuré 62,7 %. Les deux chiffres sont à la pointe ; aucun n'atteint 99,9 % sur un harnais que le fabricant du modèle ne contrôle pas. La même prudence s'applique au score WANDR de Perplexity, soit 0,682 — le plus élevé que Perplexity ait enregistré, mais mesuré par une entreprise qui intègre simultanément GPT-6 Astra dans ses propres produits, ce qui lui confère un intérêt commercial. Ce schéma mérite d'être nommé : les chiffres les plus spectaculaires d'OpenAI proviennent tous de harnais contrôlés par OpenAI ou par ses partenaires, et le seul chiffre totalement indépendant — l'Intelligence 61 d'AA — est simplement excellent.
Le petit caractère de Qwen3.8-Max va dans l'autre sens : ses forces sont mesurées indépendamment, et ses faiblesses aussi. Le score GDPval de 1 739 Elo est authentique — mais les exécutions d'Artificial Analysis montrent que Qwen3.8-Max l'atteint en dépensant 64 tours et environ 1,14 $ par tâche, contre 14 tours et 0,53 $ pour la génération précédente. C'est une taxe d'effort : le modèle achète son plafond agentique avec des jetons de raisonnement, ce qui compte pour quiconque paie au jeton. Et l'évaluation Omniscience d'AA a mesuré une régression de l'hallucination de 23 % à 40 % par rapport à la génération Qwen précédente — un signal indépendant réel pour exactement les charges de travail autonomes et multi-étapes où une réponse fausse mais confiante coûte le plus cher. Un modèle qui se raisonne en erreurs sur 64 tours n'est pas évidemment plus sûr à libérer qu'un modèle dont le fabricant concède que sa surveillabilité a diminué.

Prix, déploiement et la manière honnête de choisir
Sur le prix, le débat est tranché : Qwen3.8-Max à 2,00 $ / 6,00 $ par million de jetons représente un cinquième du tarif d’entrée de GPT-6 Astra et un huitième de son tarif de sortie, avec un contexte de 1M de jetons qui n’inclut pas la surcharge pour prompts longs d’Astra. Sur la déployabilité, Qwen3.8-Max a un avantage supplémentaire cette semaine — il est disponible dès aujourd’hui, et il est en service sur OrcaRouter au prix catalogue d’Alibaba, transmis avec une marge de 0 % et un basculement automatique. GPT-6 Astra, encore en cours de déploiement et pas encore sélectionnable dans ChatGPT pour la plupart des utilisateurs au 4 septembre, est accessible via l’API d’OpenAI et les principales places de marché cloud, tandis que l’accès s’élargit. La démarche pratique pour une équipe qui construit des pipelines agentiques consiste à exécuter la charge de travail sur le modèle que vous pouvez appeler dès aujourd’hui, et à traiter l’autre comme une référence à surveiller. Si vous voulez évaluer les allégations « agentiques » plutôt que de leur faire confiance, une couche de routage est l’outil qu’il vous faut : Qwen3.8-Max, Kimi K3, Grok 4.6 et plus de 200 autres modèles se trouvent derrière une seule clé sur OrcaRouter, et le DSL de routage peut combiner plusieurs de ces modèles en un seul appel — vous pouvez ainsi exécuter votre propre suite de tâches face aux concurrents et lire les résultats vous-même, plutôt que de choisir entre les petites lignes de deux fournisseurs.
Deux questions que cette confrontation ne cesse de soulever
Pourquoi OpenAI annonce 99,9 % sur ARC-AGI-3 alors qu'ARC Prize mesure 62,7 % ? Parce qu'il ne s'agit pas du même test. Le harnais d'OpenAI avec adaptateur de fournisseur est une version du benchmark configurée pour l'appel de GPT-6 Astra en production ; le harnais standard d'ARC Prize est une configuration neutre conçue pour comparer équitablement n'importe quel modèle. Le résultat de 62,7 % est celui qui se généralise à « ce qui se passe si j'appelle ce modèle moi-même », et c'est toujours le meilleur score qu'ARC Prize ait enregistré sur ce harnais.
Qwen3.8-Max a-t-il des poids ouverts ? Partiellement, avec une réserve sur la licence. Alibaba a publié le checkpoint de classe Max Qwen3.8-2.4T-A95B le 12 août sous une licence personnalisée : les poids sont téléchargeables, mais cela ne correspond pas à l'ouverture de type Apache-2.0 du plus petit Qwen3.8-27B, et Artificial Analysis classe toujours le modèle phare hébergé comme propriétaire. Si votre exigence est « pouvoir exécuter le modèle exact que je paie », cette distinction compte ; si votre exigence est « pouvoir inspecter l'architecture et auto-héberger une variante proche », Qwen3.8-Max y répond, contrairement à GPT-6 Astra.
Le point à retenir
Choisissez {{1}}GPT-6 Astra{{/1}} si vous avez besoin des choses spécifiques que lui seul fait actuellement — {{2}}travail de sécurité offensive, raisonnement scientifique de pointe, les tâches les plus difficiles d’utilisation autonome de l’ordinateur{{/2}} — et que votre organisation peut franchir ses conditions d’accès et se permettre son prix. Choisissez {{3}}Qwen3.8-Max{{/3}} si vous voulez un modèle agentique de premier ordre que vous pouvez réellement déployer dès cette semaine à {{4}}$2/$6{{/4}}, avec les poids comme porte de sortie et une {{5}}régression en matière d’hallucinations{{/5}} que vous savez désormais devoir tester. La leçon plus large tient aux petites lignes elles-mêmes : en {{6}}septembre 2026{{/6}}, les deux modèles phares « agentiques » sont vendus avec des chiffres d’appel que ni l’un ni l’autre fabricant ne maîtrise pleinement, et l’acheteur rationnel lit le harnais, compte les tours et exécute ses propres tâches avant de choisir son camp.

Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
