
GPT-6 Astra vs Qwen3.8-Max: Twee agentische vlaggenschepen en de kleine lettertjes eronder
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
In september 2026 spelen zich twee verhalen over 'agentische vlaggenschepen' af, en GPT-6 Astra en Qwen3.8-Max zijn in beide de hoofdrolspelers. OpenAI lanceerde GPT-6 Astra op 3 september als het model dat volgens het bedrijf wereldwijd het beste is op het gebied van computergebruik, software-engineering, wetenschap en cybersecurity; Alibaba's Qwen3.8-Max, sinds 3 augustus op de markt, is het agentische vlaggenschip van het sterkste Chinese lab — het lab dat Artificial Analysis op zijn agentische index bij de top van het veld plaatst en dat als nauwste rivaal uit het open ecosysteem het dichtst bij de aanspraken op autonoom werk van de frontier-modellen staat. Beide zijn oprecht sterk, en beide worden aangeprezen met cijfers die de krantenkoppen halen maar onder de loep krimpen: OpenAI's resultaat van 99,9% op ARC-AGI-3 zakt naar 62,7% wanneer ARC Prize zijn eigen neutrale testomgeving inzet, en de agentische briljantie van Qwen3.8-Max gaat gepaard met een onafhankelijk gemeten hallucinatieregressie en de gewoonte om 64 beurten en meer dan een dollar te besteden aan taken waar zijn voorganger in 14 beurten klaar mee was. Dit is een vergelijking van twee modellen — en van twee manieren om een benchmark te lezen.
De twee krantenkoppen
OpenAI's pitch voor GPT-6 Astra is breedte plus autonomie: één model dat een browser aanstuurt, code schrijft en repareert, wetenschappelijke analyses uitvoert en — uniek — nieuwe beveiligingskwetsbaarheden vindt, goed genoeg dat OpenAI het hele model als 'kritiek' beoordeelde onder zijn Preparedness Framework en de meest capabele instellingen beperkte tot gescreende partners. Het lanceringsmateriaal claimt een perfecte 100% op ExploitBench, 97,6% op FrontierMath Tier 4, 96,0% op GPQA Diamond en de verzadigingsscore op ARC-AGI-3. Alibaba's pitch voor Qwen3.8-Max is smaller maar doelgericht: een agentisch werkpaard voor $2/$6 dat aan of nabij de top scoort van onafhankelijke agentische evaluaties, met de onderliggende gewichten gepubliceerd (onder een eigen licentie) in plaats van opgesloten in een zwarte doos.
Wat het onafhankelijke scorebord zegt
Artificial Analysis geeft GPT-6 Astra (max) momenteel een Intelligentiescore van 61 — nummer 8 van de 202 modellen die het bijhoudt — en Qwen3.8-Max een Intelligentiescore van 58, nummer 24. Die kloof van drie punten is kleiner dan het prijsverschil en kleiner dan de marketingclaims van beide leveranciers; op de afzonderlijke agentic-index van AA scoort Qwen3.8-Max een 58, waarmee het op gelijke hoogte staat met de top van de propriëtaire frontier, terwijl AA voor GPT-6 Astra nog helemaal geen agentic-index publiceert. De eerlijke lezing: wat puur gemeten intelligentie betreft liggen deze twee dicht bij elkaar, en de framing van "het meest intelligente model ter wereld" in het lanceringsmateriaal van OpenAI wordt niet ondersteund door de onafhankelijke evaluatie van AA.
• Intelligentie — GPT-6 Astra (max): AA Intelligence 61, rang #8/202. Qwen3.8-Max: AA Intelligence 58, rang #24/202; AA Agentic 58.
• Catalogusprijs — GPT-6 Astra: $10,00 / $50,00 per 1M, $1,00 voor cache-uitlezingen, 2× voor input boven 272K tokens. Qwen3.8-Max: $2,00 / $6,00 per 1M, $0,25 voor cache-uitlezingen.
• Context / uitvoer — GPT-6 Astra: 1,05M invoer / 128K uitvoer. Qwen3.8-Max: 1M invoer / ~128K uitvoer.
• Agentisch bewijs — GPT-6 Astra: 99,9% op ARC-AGI-3 (OpenAI-harness) vs 62,7% (standaard ARC Prize-harness); WANDR 0,682 @ $11,98 per taak (door Perplexity gerapporteerd). Qwen3.8-Max: AA GDPval 1739 Elo met 64 beurten per taak (~$1,14 per taak); Code Arena WebDev #1 met 1691 Elo.
• Onafhankelijke rode vlaggen — GPT-6 Astra: nog niet in de modelkiezer van ChatGPT, gefaseerde API, concessie op het gebied van controleerbaarheid. Qwen3.8-Max: hallucinatieregressie op AA-Omniscience van 23% naar 40% ten opzichte van de vorige generatie.
• Gewichten — GPT-6 Astra: propriëtair. Qwen3.8-Max: Max-class checkpoint (Qwen3.8-2.4T-A95B), sinds 12 augustus openbaar beschikbaar onder een maatwerklicentie; AA vermeldt het gehoste vlaggenschip nog steeds als propriëtair.

De kleine lettertjes, geannoteerd
Neem eerst het ARC-AGI-3-cijfer, want dat is het duidelijkste voorbeeld van hoe een getal zowel waar als misleidend kan zijn. OpenAI rapporteert 99.9% voor GPT-6 Astra op zijn eigen provider-adaptertestomgeving — een opzet die is afgestemd op het model. ARC Prize, de organisatie die de benchmark onderhoudt, draaide GPT-6 Astra op zijn provider-neutrale standaardtestomgeving en mat 62.7%. Beide zijn state-of-the-art; geen van beide haalt 99.9% op een testomgeving die de maker van het model niet controleert. Dezelfde voorzichtigheid geldt voor Perplexity's WANDR-score van 0.682 — de hoogste die Perplexity heeft geregistreerd — maar gemeten door een bedrijf dat GPT-6 Astra tegelijkertijd in zijn eigen producten integreert en dus een commercieel belang heeft. Het patroon verdient een naam: de meest spectaculaire cijfers van OpenAI komen allemaal uit testomgevingen die OpenAI of zijn partners controleren, en het enige volledig onafhankelijke cijfer — AA's Intelligence 61 — is slechts uitstekend.
De kleine lettertjes van Qwen3.8-Max werken echter de andere kant op: de sterke punten worden onafhankelijk gemeten, en de zwakke punten ook. De GDPval-score van 1.739 Elo is echt — maar de runs van Artificial Analysis laten zien dat Qwen3.8-Max die score bereikt door per taak 64 beurten en ongeveer $1,14 te verbruiken, tegen 14 beurten en $0,53 voor de vorige generatie. Dat is een inspanningstaks: het model koopt zijn agentische plafond met redeneertokens, wat ertoe doet voor iedereen die per token betaalt. En de Omniscience-evaluatie van AA meette een hallucinatieregressie van 23% naar 40% ten opzichte van de vorige Qwen-generatie — een echt onafhankelijk signaal voor juist de autonome, meerstaps-workloads waarin een zelfverzekerd fout antwoord het duurst is. Een model dat zichzelf gedurende 64 beurten in fouten praat, is niet duidelijk veiliger om los te laten dan een model waarvan de maker toegeeft dat de monitorbaarheid is afgenomen.

Prijs, implementatie en de eerlijke manier om te kiezen
Op prijs is er geen vergelijking mogelijk: Qwen3.8-Max kost $2.00 / $6.00 per miljoen, dat is een vijfde van de inputprijs van GPT-6 Astra en een achtste van de outputprijs, met een context van 1M tokens zonder de toeslag voor lange prompts die Astra hanteert. Op het gebied van inzetbaarheid heeft Qwen3.8-Max deze week nog een voordeel: het is vandaag al aan te roepen, en het is live op OrcaRouter tegen de lijstprijs van Alibaba, doorberekend zonder opslag en met automatische failover. GPT-6 Astra, dat nog wordt uitgerold en per 4 september voor de meeste gebruikers nog niet te selecteren is in ChatGPT, is bereikbaar via OpenAI's eigen API en de grote cloud-marktplaatsen, terwijl de toegang wordt verruimd. Voor een team dat agentische pipelines bouwt, is de praktische aanpak om de werklast te leggen bij het model dat je vandaag kunt aanroepen, en het andere model als benchmark in de gaten te houden. Als je “agentische” beweringen wilt evalueren in plaats van ze te vertrouwen, is een routeringslaag het juiste middel: Qwen3.8-Max, Kimi K3, Grok 4.6 en meer dan 200 andere modellen zitten achter één API-sleutel op OrcaRouter, en de routing-DSL kan meerdere daarvan samenvoegen tot één enkele aanroep — zodat je je eigen taaksuite tegen de kandidaten kunt laten draaien en de resultaten zelf kunt lezen, in plaats van te kiezen tussen de kleine lettertjes van twee leveranciers.
Twee vragen die deze confrontatie blijft oproepen
Waarom rapporteert OpenAI 99,9% op ARC-AGI-3 terwijl ARC Prize 62,7% meet? Omdat ze niet dezelfde test zijn. De provider-adapter-harness van OpenAI is een versie van de benchmark die is geconfigureerd voor hoe GPT-6 Astra in productie wordt aangeroepen; de standaardharness van ARC Prize is een neutrale configuratie die is ontworpen om elk model eerlijk te vergelijken. Het resultaat van 62,7% is het resultaat dat generaliseert naar "wat gebeurt er als ik dit model zelf aanroep", en het is nog steeds de beste score die ARC Prize op die harness heeft geregistreerd.
Zijn de gewichten van Qwen3.8-Max open? Deels, met een voorbehoud over de licentie. Alibaba publiceerde op 12 augustus de Max-klasse checkpoint Qwen3.8-2.4T-A95B onder een aangepaste licentie — de gewichten zijn downloadbaar, maar het is niet de Apache-2.0-achtige openheid van de kleinere Qwen3.8-27B, en Artificial Analysis vermeldt het gehoste vlaggenschip nog steeds als propriëtair. Als je vereiste is "ik kan het exacte model draaien waarvoor ik betaal", dan maakt dat onderscheid uit; als je vereiste is "ik kan de architectuur inspecteren en een nauwe variant zelf hosten", dan komt Qwen3.8-Max in aanmerking en GPT-6 Astra niet.
De kern
Kies GPT-6 Astra als je de specifieke dingen nodig hebt die het momenteel als enige kan — offensief beveiligingswerk, wetenschappelijk redeneren op het scherpst van de snede, de moeilijkste autonome computertaken — en je organisatie de toegangsdrempels kan passeren en de prijs kan betalen. Kies Qwen3.8-Max als je een agentisch model van topklasse wilt dat je deze week nog echt kunt inzetten voor $2/$6, met de gewichten als ontsnappingsluik en een hallucinatieregressie waarvan je nu weet dat je erop moet testen. De bredere les zit in de kleine lettertjes zelf: in september 2026 worden de twee toonaangevende 'agentische' vlaggenschepen verkocht met kopcijfers waar geen van beide makers volledige controle over heeft, en de rationele koper leest de testopstelling, telt de beurten en draait zijn eigen taken voordat hij partij kiest.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
