
GPT-6 Astra vs Qwen3.8-Max: Två agentiska flaggskepp och det finstilta under varje
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
September 2026 har två berättelser om ”agentiska flaggskepp”, och GPT-6 Astra och Qwen3.8-Max är föremål för båda. OpenAI lanserade GPT-6 Astra den 3 september som den modell som företaget säger är bäst i världen för datoranvändning, mjukvaruteknik, vetenskap och cybersäkerhet; Alibabas Qwen3.8-Max, tillgänglig sedan den 3 augusti, är det agentiska flaggskeppet från det starkaste kinesiska labbet – den modell som Artificial Analysis rankar bland de främsta inom fältet på sitt agentiska index och den närmaste rivalen inom det öppna ekosystemet till frontlinjens anspråk på autonomt arbete. Båda är genuint starka, och båda säljs med rubriksiffror som krymper vid granskning: OpenAIs 99,9 %-resultat på ARC-AGI-3 sjunker till 62,7 % när ARC Prize kör sin egen neutrala testmiljö, och Qwen3.8-Max:s agentiska briljans åtföljs av en oberoende uppmätt hallucinationsförsämring och en vana att använda 64 omgångar och över en dollar på uppgifter som dess föregångare klarade på 14. Detta är en jämförelse mellan två modeller – och mellan två sätt att läsa ett riktmärke.
De två rubrikerna
OpenAI:s säljargument för GPT-6 Astra är bredd plus autonomi: en enda modell som styr en webbläsare, skriver och fixar kod, genomför vetenskaplig analys och – vilket är unikt – upptäcker nya säkerhetsbrister så pass bra att OpenAI klassade hela modellen som ”kritisk” enligt sitt Preparedness Framework och begränsade de mest kraftfulla inställningarna till granskade partners. Lanseringsmaterialet hävdar full poäng (100 %) på ExploitBench, 97,6 % på FrontierMath Tier 4, 96,0 % på GPQA Diamond och mättnadspoängen på ARC-AGI-3. Alibabas säljargument för Qwen3.8-Max är smalare men skarpare: en agentisk arbetshäst till $2/$6 som ligger på eller nära toppen i oberoende agentiska utvärderingar, med de underliggande vikterna publicerade (under en anpassad licens) snarare än inlåsta i en svart låda.
Vad den oberoende resultattavlan säger
Artificial Analysis ger för närvarande GPT-6 Astra (max) betyget Intelligens 61 — rank 8 bland de 202 modeller som den spårar — och Qwen3.8-Max betyget Intelligens 58, rank 24. Det trepoängsgapet är mindre än prisgapet och mindre än någondera leverantörens marknadsföring; på AA:s separata agentindex uppnår Qwen3.8-Max 58, vilket har fört den i nivå med de bästa proprietära frontlinjemodellerna, medan AA ännu inte publicerar något agentindex för GPT-6 Astra alls. Den ärliga läsningen: på ren uppmätt intelligens ligger dessa två nära varandra, och formuleringen ”världens mest intelligenta modell” i OpenAI:s lanseringsmaterial är inte vad AA:s oberoende utvärdering visar.
• Intelligens — GPT-6 Astra (max): AA Intelligence 61, placering #8/202. Qwen3.8-Max: AA Intelligence 58, placering #24/202; AA Agentic 58.
• Listpris — GPT-6 Astra: $10,00 / $50,00 per 1M, $1,00 cache-läsningar, 2× input över 272K tokens. Qwen3.8-Max: $2,00 / $6,00 per 1M, $0,25 cache-läsningar.
• Kontext / utdata — GPT-6 Astra: 1.05M in / 128K ut. Qwen3.8-Max: 1M in / ~128K ut.
• Agentiska belägg — GPT-6 Astra: ARC-AGI-3 99,9 % (OpenAI:s testmiljö) mot 62,7 % (ARC Prize:s standardtestmiljö); WANDR 0,682 för 11,98 USD/uppgift (rapporterat av Perplexity). Qwen3.8-Max: AA GDPval 1 739 Elo med 64 steg/uppgift (~1,14 USD/uppgift); Code Arena WebDev #1 med 1 691 Elo.
• Oberoende varningsflaggor — GPT-6 Astra: ännu inte i ChatGPT:s modellväljare, stegvis lanserat API, eftergift gällande övervakningsbarhet. Qwen3.8-Max: AA-Omniscience-hallucinationsregression från 23 % till 40 % jämfört med föregående generation.
• Vikter — GPT-6 Astra: proprietär. Qwen3.8-Max: Max-klass checkpoint (Qwen3.8-2.4T-A95B) allmänt tillgänglig under en anpassad licens sedan den 12 augusti; AA listar fortfarande den värdbaserade flaggskeppsmodellen som proprietär.

Det finstilta, kommenterat
Ta siffran för ARC-AGI-3 först, eftersom den är det tydligaste exemplet på hur en siffra kan vara både sann och vilseledande. OpenAI rapporterar 99,9 % för GPT-6 Astra på sin egen provider-adapterharness — en uppsättning som är finjusterad för modellen. ARC Prize, organisationen som underhåller benchmarken, körde GPT-6 Astra på sin providerneutrala standardharness och mätte 62,7 %. Båda är state-of-the-art; ingen är 99,9 % på en harness som modellens tillverkare inte kontrollerar. Samma försiktighet gäller Perplexitys WANDR-poäng på 0,682 — den högsta Perplexity har registrerat, men mätt av ett företag som samtidigt integrerar GPT-6 Astra i sina egna produkter, och därmed har ett kommersiellt intresse. Mönstret är värt att namnge: OpenAIs mest spektakulära siffror kommer alla från harnessar som OpenAI eller dess partners kontrollerar, och den enda helt oberoende siffran — AAs Intelligence 61 — är bara utmärkt.
Den finstilta texten för Qwen3.8-Max går åt andra hållet: dess styrkor har mätts oberoende, och dess svaghet har också mätts oberoende. GDPval-poängen på 1 739 Elo är äkta – men Artificial Analysis:s körningar visar att Qwen3.8-Max når den genom att förbruka 64 steg och ungefär 1,14 dollar per uppgift, jämfört med 14 steg och 0,53 dollar för den tidigare generationen. Det är en ansträngningsskatt: modellen köper sitt agentiska tak med resonemangstokens, vilket spelar roll för alla som betalar per token. Och AA:s Omniscience-utvärdering uppmätte en hallucinationsregression från 23 % till 40 % jämfört med den tidigare Qwen-generationen – en verklig oberoende varningsflagga för just de autonoma flerstegsuppgifter där ett självsäkert felaktigt svar kostar mest. En modell som över 64 steg pratar sig själv till fel är inte uppenbart säkrare att släppa lös än en sådan vars tillverkare medger att dess övervakningsbarhet har minskat.

Pris, driftsättning och det ärliga sättet att välja
I fråga om pris finns ingen konkurrens: Qwen3.8-Max till $2.00 / $6.00 per miljon tokens är en femtedel av GPT-6 Astra:s inmatningspris och en åttondel av dess utmatningspris, med en kontext på 1M tokens som inte medför Astra:s tilläggsavgift för långa prompter. När det gäller driftsättbarhet har Qwen3.8-Max ytterligare en fördel denna vecka — den är anropsbar idag, och den är live på OrcaRouter till Alibabas listpris, förmedlad utan påslag och med automatisk failover. GPT-6 Astra, som fortfarande rullas ut och ännu inte är valbar i ChatGPT för de flesta användare per den 4 september, är nåbar via OpenAI:s eget API och de stora molnmarknadsplatserna medan åtkomsten vidgas. Det praktiska mönstret för ett team som bygger agentiska pipelines är att lägga arbetsbelastningen på den modell du kan anropa idag och att behandla den andra som ett riktmärke att bevaka. Om du vill utvärdera ”agentiska” påståenden snarare än att lita på dem, är ett routningslager rätt verktyg: Qwen3.8-Max, Kimi K3, Grok 4.6 och 200+ andra modeller ligger bakom en enda nyckel på OrcaRouter, och routnings-DSL:et kan sätta samman flera av dem till ett enda anrop — så du kan köra din egen uppgiftssvit mot kandidaterna och själv läsa resultaten i stället för att välja mellan två leverantörers finstilta villkor.
Två frågor som denna matchning ständigt väcker.
Varför rapporterar OpenAI 99,9 % på ARC-AGI-3 när ARC Prize mäter 62,7 %? Därför att de inte är samma test. OpenAIs leverantörsadapter-harness är en version av benchmarken som konfigurerats för hur GPT-6 Astra anropas i produktion; ARC Prizes standardharness är en neutral konfiguration utformad för att rättvist jämföra vilken modell som helst. Resultatet 62,7 % är det som generaliserar till ”vad händer om jag själv anropar den här modellen”, och det är fortfarande det bästa resultat som ARC Prize har registrerat på det harnesset.
Har Qwen3.8-Max öppna vikter? Delvis, med ett licensförbehåll. Alibaba publicerade checkpointen Qwen3.8-2.4T-A95B av Max-klass den 12 augusti under en anpassad licens — vikterna går att ladda ner, men det är inte samma öppenhet i Apache-2.0-stil som hos den mindre Qwen3.8-27B, och Artificial Analysis listar fortfarande det värdbaserade flaggskeppet som proprietärt. Om ditt krav är ”Jag kan köra exakt den modell jag betalar för” spelar den skillnaden roll; om ditt krav är ”Jag kan inspektera arkitekturen och själv driva en näraliggande variant” uppfyller Qwen3.8-Max det, medan GPT-6 Astra inte gör det.
Slutsatsen
Välj GPT-6 Astra om du behöver de specifika saker som den för närvarande är ensam om att kunna — offensivt säkerhetsarbete, vetenskapligt resonerande vid forskningsfronten, de svåraste autonoma datoranvändningsuppgifterna — och din organisation kan passera dess behörighetskrav och ha råd med priset. Välj Qwen3.8-Max om du vill ha en topprankad agentisk modell som du faktiskt kan driftsätta den här veckan för $2/$6, med vikterna som en utväg och en hallucinationsregression som du nu vet att du ska testa för. Den bredare lärdomen är själva det finstilta: i september 2026 säljs de två ledande "agentiska" flaggskeppen med rubriksiffror som ingen av tillverkarna fullt ut kontrollerar, och den rationella köparen läser testmiljön, räknar turerna och kör sina egna uppgifter innan de väljer sida.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
