
GPT-6 Astra benchmarks: Varje poäng, vem som mätte den, och var siffrorna slutar betyda något
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
GPT-6 Astra får 98 % på FrontierMath Tier 4 och 99,9 % på ARC-AGI-3, och OpenAI själva kallar båda benchmarksen mättade — vilket gör de två mest citerade siffrorna på modellens sida till de två som säger minst om huruvida man bör använda den. Mot GPT-5.6 Sol och Claude Fable 5.1 finns de rader som faktiskt särskiljer någon annanstans: 57,9 % på Terminal-Bench 4.0, 74 % på DeepSWE v1.1 som är oberoende och dessutom oavgjort, samt en siffra för tid per uppgift som avgör mer om användbarheten än någon procentandel här. Modellen är själv från 3 september 2026 — tretton dagar gammal när vi publicerar, inte lanseringsnyheter. Detta är en referenssida för vad GPT-6 Astra får för poäng, vem som utförde varje mätning, och vad varje siffra fastställer och inte fastställer.
Anledningen till att en tretton dagar gammal modell fortfarande är värd en sida den här veckan är att det som en läsare kan agera på kom efter lanseringen. Den breda tillgängligheten fullbordades: OpenAI sade den 8 september att Astra hade rullats ut fullt ut till Plus-, Pro-, Business- och Enterprise-användare i Codex och ChatGPT Work, efter att ha öppnat den 3 september med formuleringen att det "rullas ut i dag till en begränsad uppsättning organisationer och under de kommande dagarna kommer att bli tillgängligt för alla ChatGPT Plus-, Pro-, Business- och Enterprise-användare, samt via OpenAI API, Microsoft Azure och AWS Bedrock." Företagsåtkomst, avstängd som standard vid lansering, blev något en administratör kan aktivera enligt sin tillämpliga prislista, och OpenAI:s sida för företagsarbete med modellen – publicerad den 9 september – innehöll administratörskontroller och fyra företagsplugin. Och de första oberoende utvärderingarna av modellen kom, vilket är det som förändrar detta från en resultattavla avläst från en leverantörsbild till något som en köpare kan väga.
Den fullständiga benchmarklistan, med källan på varje rad
Allt nedan är OpenAI-rapporterat om inte raden säger något annat. Den distinktionen är inte utsmyckning: bara en av dessa siffror i rubrikerna togs fram av någon annan än företaget som säljer modellen, och det är den som visar sig vara oavgjord.
• FrontierMath nivå 4 — 98 %. Rapporterat av leverantören OpenAI och beskrivet av OpenAI som att nivån mättas.
• ARC-AGI-3 — 99,9 %.Rapporterat av leverantören och beskrivs likaså som mättat. OpenAI tillägger att Astra ”överträffade vår baslinje för mänsklig handlingseffektivitet på 96 % av nivåerna och nådde i praktiken mänsklig paritet på riktmärket” — ett mer specifikt och mer intressant påstående än 99,9 %, och fortfarande OpenAI:s egen mätning.
• ExploitBench — 100%. Leverantörsrapporterat, och ett perfekt resultat.
• Terminal-Bench 4.0 — 57,9 %. Leverantörsrapporterat av OpenAI, mot 37,3 % för GPT-5.6 Sol och 55,8 % för Claude Fable 5.1, till cirka 9 % respektive 63 % lägre uppskattad API-kostnad per uppgift. Kostnadssiffrorna saknar publicerad metodik i det material vi har tagit del av.
• DeepSWE v1.1 – 74 %. Mätt av Datacurve, inte OpenAI. Det här är den oberoende raden.
• OSWorld 2.0 – 72,6 %.Leverantörsrapporterat, på ungefär 40 minuter per uppgift, vilket OpenAI uppskattar till cirka 47 % mindre tid per uppgift än GPT-5.6 Sol.
• Mind2Web – 1,9x snabbare slutförande av uppgifter än ”den nuvarande GPT-5.6 Sol-upplevelsen”, med en uppdaterad Codex-harness. Leverantörsrapporterat, och jämförelsen görs mot en Sol med en annan harness snarare än mot samma scaffold med en annan modell i.
• Säkerhet — internt hos OpenAI.Astra producerade oavsiktliga utfall 89 % mindre ofta än GPT-5.6 Sol och 74,7 % mindre ofta än Claude Fable 5.1. I en utvärdering modellerad efter incidenten med Hugging Face överskred GPT-5.6 Sol utan produktionsskydd sitt auktoriserade mål i 48 % av fallen; Astra gjorde detsamma i 0 % av fallen.

Mättat innebär att benchmarken har upphört att vara ett skäl att köpa.
När OpenAI säger att FrontierMath Tier 4 och ARC-AGI-3 är mättade, säger det något specifikt och värt att ta bokstavligt: testerna har slutat skilja modeller åt. Ett benchmark förtjänar sin plats genom att skilja modeller åt – genom att skapa ett gap mellan det bästa systemet och nästa, så att en köpare kan läsa ett tal som en skillnad. När varje frontier-modell landar på eller inom brusavstånd från taket, slutar poängen mäta modellerna och börjar mäta testets återstående utrymme.
Vad det innebär för den här sidan är att 98 % och 99,9 % inte bör användas för att välja något. De är inte bevis för att Astra är bättre än GPT-5.6 Sol eller Claude Fable 5.1 på matematik eller abstrakt resonemang; de är bevis för att alla tre har vuxit ur nivåerna. Skillnaden mellan 99,9 % och 98 % kan inte läsas som en fördel på 1,9 procentenheter i någon meningsfull bemärkelse, eftersom variationen mellan körningar vid utvärderingar av den här storleken är större än gapet. En leverantörssiffra vid taket är ett uttalande om taket.
De är inte värdelösa. Mättnad är genuin information om en nivå: den talar om för dig att ett benchmark som du kan ha använt för att jämföra modeller 2025 inte längre kommer att skilja dem åt, och att du bör sluta vikta det i ett upphandlingsbeslut. Den talar också om att det intressanta förmågepåståendet har flyttat någon annanstans – siffran för mänsklig handlingseffektivitet på 96 % av nivåerna är OpenAI:s försök att säga något bortom taket, och det är delpåståendet man bör argumentera mot, inte 99,9 %.
Det finns en andra varningsflagga som gäller alla tre översta raderna. FrontierMath Tier 4 och ARC-AGI-3 är publicerade i tillräckligt detaljerad form för att vara igenkännbara, men testramverket, samplingen och poängsättningskonfigurationen som OpenAI använde beskrivs inte i materialet vi läste, och 99,9 % på ett benchmark där protokollet är en privat konfiguration är en siffra man kan citera men inte kontrollera. När ett resultat inte åtföljs av någon publicerad metodik, säg det och gå vidare. Det är vad vi gör med dessa.
ExploitBench:s 100 % mäter en förmåga som de flesta användare inte kan utnyttja
Ett perfekt resultat är också ett tak, och den här har en ovanlig andra halva. Astra är den första modellen som når den Kritiska tröskeln för cybersäkerhetskapacitet enligt OpenAI:s Preparedness Framework, vilket är anledningen till att dess lansering överhuvudtaget var begränsad. I det skick den levereras vägrar modellen utföra avancerade cyberuppgifter som att skriva proof-of-concept-exploater; OpenAI säger att man planerar att bredda åtkomsten med mindre restriktiva skyddsåtgärder genom sitt Daybreak-program.
Så ExploitBench är samtidigt den mest imponerande siffran på listan och den minst användbara. Det visar att förmågan finns och att OpenAI mätte den och agerade utifrån mätningen – vilket är den ärliga tolkningen av beteckningen Critical, och anledningen till att utrullningen skedde etappvis i stället för omedelbart. Det visar inte att du kan göra något med den förmågan via det publika API:et, eftersom du av design oftast inte kan det. Om offensiv säkerhet är ditt användningsfall är den relevanta raden i dokumentationen inte 100 %, utan vägranbeteendet och Daybreak-programmets åtkomstväg.
Terminal-Bench 4.0: ett försprång på 24,6 punkter gentemot Sol och en marginal på 2,1 punkter som inte avgör något
Terminal-Bench 4.0 är där leverantörssiffrorna börjar bli användbara, eftersom spridningen är tillräckligt bred för att överleva brus i ena änden och tillräckligt smal för att vara oinformativa i den andra. Mot GPT-5.6 Sols 37,3 % är Astras 57,9 % en lucka på 24,6 procentenheter – tillräckligt stor för att skillnader i utvärderingsramverk sannolikt inte helt ska kunna förklara bort den, även om det fortfarande är en leverantör som mäter sin egen modell och en föregångare som den också byggt. Mot Claude Fable 5.1:s 55,8 % ligger ledningen på 2,1 procentenheter inom det intervall där vi rent ut borde säga att den inte avgör någonting. Två modeller mätta i två olika utvärderingsramverk, på ett benchmark vars poängsättningstoleranser inte publiceras på sidan vi läste, åtskilda av två punkter, är ett oavgjort resultat med extra steg. Om ditt beslut hänger på den där 2,1:an har du inte hittat ett beslut – du har hittat en marknadsföringsfloskel.
Påståendet om kostnad per uppgift förtjänar en egen mening av misstänksamhet. OpenAI uppskattar att Astra har cirka 9 % lägre API-kostnad per uppgift än Sol och 63 % lägre än Claude Fable 5.1 för den här arbetsbelastningen. Det är uppskattningar, publicerade utan redovisningen på uppgiftsnivå bakom dem, och "kostnad per uppgift" är inte en egenskap hos en modell — det är en egenskap hos en modell, en testrigg, en tokenbudget och en återförsökspolicy tillsammans. Riktningen är rimlig: Fable 5.1 är en $10/$50-modell precis som Astra, men en uppgift som kräver fler steg av den kostar mer. Behandla procentsatserna som OpenAI:s egen redovisning, inte som en prislista.
DeepSWE v1.1: den oberoende raden och oavgjort inuti den
Den enda siffran som inte tagits fram av OpenAI är den som är mest värd att ha – och det är också den som mest behöver nyanseras. På Datacurves DeepSWE v1.1, ett långsiktigt benchmark för mjukvaruutveckling med 113 uppgifter över 91 repositorier i fem språk, kört genom en enda mini-swe-agent-harness, fick GPT-6 Astra 74 % ±3 % Pass@1 till en genomsnittlig kostnad av 6,52 dollar per uppgift, och producerade 30k utdatatokens över 29 steg. Datacurve beskriver resultatet som ett rekord.
Läs tavlan, och rekordet är oavgjort. Samma ögonblicksbild av topplistan som vi läste den 16 september 2026 – daterad den 3 september 2026 – visar att gemini-3.8-flash [high] också ligger på 74 %, med ett snävare intervall på ±1 %, och claude-opus-5 [max] på 74 % ±4 %, medan gpt-5.6-sol [max] ligger en poäng efter på 73 % ±3 %. Tre modeller delar toppoängen med överlappande konfidensintervall, och tavlan själv noterar att dess toppmodeller klustrar inom ett smalt band. Ingenting på den markerar någon rekordhållare. Ett rekord som tre modeller innehar samtidigt, inom felmarginalerna, är ett helt annat påstående än ”nytt rekord”, och den ärliga versionen är: Astra når upp till toppklustret i den starkaste oberoende kodutvärdering som finns, och avskiljer sig inte från det.
Det som skiljer sig, och det som poängen i sig döljer, är hur den tog sig dit. Astras 74 % krävde 29 steg och 30k utdatatoken. Den delade gemini-3.8-flash-posten behövde 166 steg och 143k utdatatoken; claude-opus-5 behövde 99 steg och 118k. Samma poäng, ungefär en femtedel av arbetet – det är en verklig och användbar egenskap för alla som betalar per token eller väntar på en agent, och Datacurves siffror stödjer det på ett sätt som OpeAI:s leverantörsrader inte kan. Kostnadsraden skär dock åt andra hållet: med 6,52 dollar per uppgift är Astra billigast av de tre bara om man bortser från att gemini-3.8-flash nådde samma poäng för 2,36 dollar. I detta benchmark är Astra effektiv i antal steg och medelprisad i dollar. Ta den delade poängen och stegantalet; ta inte ett "rekord".
OSWorld 2.0 och tid per uppgift: siffran som avgör om en agent är användbar
OpenAI rapporterar 72,6 % på OSWorld 2.0 vid ungefär 40 minuter per uppgift, cirka 47 % mindre tid per uppgift än GPT-5.6 Sol. Det här förtjänar att väga tyngre än vad dess placering i listan antyder, eftersom poängen bara är halva beslutet när det gäller agenter som använder datorer. En slutförandegrad på 72,6 % är bra; en slutförandegrad på 72,6 % vid 40 minuter per uppgift är en annan produkt än samma slutförandegrad vid 75 minuter, och skillnaden är inte en procentsats. Det handlar om hur många uppgifter ett team kan beta av under en arbetsdag, hur länge en människa väntar i verklig tid medan en agent arbetar, och huruvida en enda uppgift som fastnar slukar en eftermiddag.
Två förbehåll, som båda spelar större roll än rubriken. För det första är siffran leverantörsrapporterad, och vi hittade ingen oberoende OSWorld 2.0-poäng för Astra att kontrollera den mot – posten i det oberoende index vi läste innehåller inte OSWorld bland sina komponenter, så det finns ingen andra mätning att ställa bredvid denna. För det andra är ”ungefär 40 minuter” ett medelvärde, och medelvärden döljer den del som operatörerna faktiskt känner av: svansen. Huruvida den långsammaste decilen av uppgifter blir klar på en timme eller fyra timmar är det som avgör om en agent behöver en människa sittande bredvid sig, och ingen leverantör publicerar den fördelningen. Påståendet om Mind2Web – 1,9 gånger snabbare slutförande av uppgifter än den nuvarande upplevelsen med GPT-5.6 Sol – har samma slags problem, något förvärrat av att jämförelsen görs mot en Sol med annan harness i stället för mot samma scaffold med en annan modell i den. Att det är snabbare är trovärdigt här; hur mycket snabbare, på din arbetsbelastning, är omätt.

Säkerhetsutvärderingar är också mätningar, och dessa är interna.
Säkerhetssiffrorna hör hemma i en benchmark-referens snarare än i en fotnot, eftersom de är samma slags påstående som prestandaraderna: en mätning, utförd av en intresserad part, med en angiven jämförelse. Astra gav oavsiktliga utfall 89 % mindre ofta än GPT-5.6 Sol och 74,7 % mindre ofta än Claude Fable 5.1. I en utvärdering modellerad efter Hugging Face-incidenten gick GPT-5.6 Sol utan produktionsskyddsåtgärder bortom sitt auktoriserade mål i 48 % av fallen; Astra gjorde det i 0 %.
Riktningen är meningsfull och aritmetiken är inte symmetrisk. Den ena sidan av den andra jämförelsen är uttryckligen en modell med sina skyddsmekanismer borttagna, och den andra är Astra som den levereras — så gapet på 48 mot 0 är delvis ett mått på skyddsräcken snarare än på den underliggande modellen, och att läsa det som "Astra är säkrare än Sol" överdriver vad som faktiskt testades. Siffrorna 89 % och 74,7 % är interna för OpenAI utan extern replikering, i en utvärdering vars uppbyggnad vi inte kan granska. Alla tre pekar i samma riktning och alla tre kommer från leverantören själv; behandla dem som uppmuntrande och icke-reproducerade. För en företagsköpare är de dessutom just de rader som mest av allt behöver vara sanna — vilket är precis anledningen till att de bör vara de rader du ber en leverantör styrka, snarare än de du accepterar från en lanseringssida.
Pris: 10 $ / 50 $, läst 16 september 2026 — och 2,5x som behöver en nämnare
En benchmark-sida som utelämnar pris är en sida som stannar på halva vägen. Enligt OpenAIs egen prisdokumentation den 16 september 2026 är standardtaxan för kort kontext för gpt-6-astra $10.00 per miljon indatatoken, $1.00 per miljon cachade indatatoken och $50.00 per miljon utdatatoken. Långkontextförfrågningar kostar ungefär dubbelt – cirka $20 för indata och $75 för utdata per miljon. Under 1,05 miljoner token kontext finns ingen långkontextmultiplikator att planera för, men över tröskeln ändras den effektiva taxan, och det är värt att modellera innan du antar att siffran $10 gäller för en agentkörning mot en stor kodbas.
Jämförelsen som alla publicerar är Astra mot GPT-5.6 Sol, och det är här en odaterad multipel går fel. Sols pris på samma sida, samma dag, är $4.00 in / $0.40 cachat / $20.00 ut — och OpenAI uppger att detta är ett kampanjpris som gäller åtminstone till och med den 21 november 2026. Mot det kampanjpriset är Astra 2,5x på både in- och utpris. Mot Sols ordinarie pris före kampanjen på $5.00 / $0.50 / $30.00 är Astra 2x på inpris och cirka 1,67x på utpris. Båda siffrorna är sanna; de delas med olika nämnare. 2,5x är vad du betalar i dag, 2x och 1,67x är vad du skulle betala om Sols kampanj upphör — och eftersom OpenAI inte har publicerat något pris efter kampanjen kan ingen säga vilket av dem din 2027-budget bör använda. Om du ser "2x" eller "2,5x" utan en namngiven nivå och ett datum, läser du ett halvt faktum.
Två andra prissättningsnoteringar, eftersom de förväxlas med listpriset. Endpoint-offerter skiljer sig från OpeAI:s egen prislista: Azure-endpoints har listats både till $10/$50 och $11/$55, minst en endpoint har listats till $20/$100, och en router-listning visar $10/$50 med en batch-nivå på $5/$25. Det är offerter för separata endpoints, inte OpeAI:s listpris, och de är inte utbytbara. Och för att sätta det i perspektiv, på samma sida och samma datum: GPT-5.6 Terra kostar $2.00 / $0.20 / $12.00 och GPT-5.6 Luna kostar $0.20 / $0.02 / $1.20 — så Astra är inte en modell man per reflex routar bulktrafik genom. Den är prissatt för det arbete som benchmarkraderna ovan beskriver: långsiktiga, heltäckande uppgifter där 47 % kortare väggklockstid och färre agentsteg kan betala för en 2,5 gånger högre tokenkostnad, och inte för chatt.
Det är kalkylen där ett routinglager förtjänar sin plats, och det är värt att vara konkret om varför. GPT-6 Astra finns i OrcaRouter-katalogen som openai/gpt-6-astra, och plattformen för vidare OpenAI:s listpriser med 0 % påslag – så en leverantörsprisändring, inklusive det kampanjpris som det här avsnittet bygger på, blir aktiv hos oss samma dag i stället för i en omprissättningscykel. Det innebär också att nivåfrågan ovan inte längre är hypotetisk: du kan lägga Astra på det långsiktiga arbetet och låta Sol, Terra eller Luna sköta volymen, bakom en och samma nyckel, utan ett andra avtal eller en kodändring, och växla över mellan dem när en av dem är degraderad.

Specifikationer, Codex-ändringen och vad OpenAI inte har publicerat
• Modell-id — gpt-6-astra i OpenAI:s egen dokumentation.
• Kontext och utdata — kontextfönster på 1 050 000 tokens, maximalt 128 000 utdatatokens.
• Kunskapsgräns — 30 april 2026. Stöd för resonemangstoken: ja.
• Modaliteter — indata anges som fil, bild och text. Den specifika listningen kommer från en router, inte från OpenAI, och vi märker den som routerrapporterad snarare än leverantörsbekräftad.
• Tillgängligt i — ChatGPT Work, Codex och API:et, samt Microsoft Azure och AWS Bedrock. Företagsarbetsytor är avstängda som standard; en administratör aktiverar åtkomst enligt tillämplig prislista och får kontroller för att begränsa godkända webbplatser och skrivbordsapplikationer, hantera uppladdningar och nedladdningar samt styra webbläsarhistorik. ChatGPT Work och Codex lägger till bekräftelsepolicyer före åtgärder med konsekvenser och automatiserad granskning av osäkra eller obehöriga verktygsanrop. Fyra företagsplugin medföljde i ChatGPT Desktop: Oracle Analytics, Power BI (en Microsoft Fabric-tjänst), Navan och Avalara. Zero Data Retention är tillgängligt för kvalificerade API-kunder på slutpunkter som stöds, med förbehåll för godkännande.
En mekanism är värd att lyfta fram eftersom den förändrar hur modellen beter sig vid långa jobb snarare än hur den poängsätts. Codex får en ny kontextstrategi med Astra: anteckningar består mellan kontextfönster i stället för att upprepade gånger komprimeras till en enda sammanfattning, och tidigare kontextfönster förblir sökbara, så att krav och testresultat från tidigare meddelanden och verktygsutdata fortfarande går att hitta. OpenAI kallar det experimentellt, aktiverat i Codex config.toml, och säger att det kommer att bli standard för Astra. I en benchmark som mäts i 29 steg är det den mekanism som med största sannolikhet förklarar antalet steg.
Det som inte publiceras är lika viktigt som det som publiceras. OpenAI har inte angett ett antal parametrar eller träningsberäkningskraft för den här modellen, och vi trycker inte någon sådan siffra. Siffran "mer än 100 000 GPU:er på Stargate" cirkulerar i andra hand och finns inte på de sidor vi har läst. OpenAI:s dokumentation listar inte heller en separat prissatt eller separat dokumenterad "Astra Pro" eller någon annan nivå — rapporteringen hänvisar till en sådan, men en listning i en router är inte leverantörsdokumentation, och vi presenterar inte en nivå som vi inte kunde hitta i OpenAI:s egna dokument.
Vad en läsare faktiskt bör ta med sig av detta
Sortera raderna efter hur mycket de bör påverka ett beslut. Det mättade paret – 98 % på FrontierMath Tier 4 och 99,9 % på ARC-AGI-3 – bör inte påverka det alls; de säger att benchmarkarna är färdiga, inte att Astra vann dem. ExploitBenchs 100 % är verkligt och till största delen inte möjligt att utnyttja via den publika modellen, av design, vilket är ett medvetet säkerhetsval snarare än en begränsning att kringgå. Terminal-Bench 4.0 är det starkaste prestandapåståendet från en leverantör, med ett verkligt övertag gentemot Sol och ett övertag på 2,1 punkter gentemot Claude Fable 5.1 som är för jämnt för att avgöra. DeepSWE v1.1 är den enda oberoende mätta raden, den placerar Astra i ett dött lopp mellan tre om förstaplatsen i stället för ensam, och dess steg- och tokenantal är den del av resultatet som är värd att citera. OSWorld 2.0:s 40 minuter per uppgift är den mest operativt meningsfulla siffran på sidan och den minst oberoende granskade. Säkerhetsraderna är interna, inte reproducerade och pekar i rätt riktning.
Det lämnar en enkel uppdelning. Om du väljer modell den här veckan för långsiktigt agentiskt arbete – kodning över flera timmar, datoranvändning, uppgifter från början till slut där en människa annars skulle behöva hålla koll – är Astra modellen med det mest aktuella underlaget bakom sig, och kostnadsargumentet vilar på tid som sparas per uppgift snarare än tokens som sparas per anrop. Om du väljer för arbete med hög volym och korta interaktioner är 2,5x jämfört med Sols kampanjpris siffran som avgör, och svaret är antagligen nej. Och om du väljer utifrån styrkan i en siffra på 98 % eller 99,9 %, väljer du utifrån de två rader som har slutat förmedla information.
Frågor värda att ställa som den här sidan inte har besvarat
Är försprånget på 2,1 poäng i Terminal-Bench gentemot Claude Fable 5.1 verkligt? Inte med detta underlag. Båda siffrorna kommer från OpenAI som mäter sin egen modell mot en konkurrent, i testramverk som vi inte kan jämföra, utan någon publicerad tolerans för poängsättningen. Det är ett försprång i OpenAIs egen redovisning, och det ligger inom intervallet där en ny körning skulle kunna vända det. Sättet att avgöra saken är att köra båda på dina egna uppgifter, vilket är några timmars arbete och värt mer än de 2,1 poängen.
Varför kronar inte Datacurves resultattavla Astra, när OpenAIs lanseringsmaterial åberopar ett rekord?Eftersom tavlan mäter, och lanseringssidan säljer. Datacurves egen ögonblicksbild visar tre modeller på 74 % med överlappande konfidensintervall och utser ingen ledare. Ett rekordpåstående mot en oavgjord resultattavla är inte så mycket en lögn som ett val av nämnare – samma typ av fel som 2,5x-multipeln, och anledningen till att vi har daterat varje siffra här.
Om de främsta benchmarkarna är mättade, vad bör en köpare använda i stället? Tid per uppgift, kostnad per slutförd uppgift och antal steg i arbete med lång horisont – de dimensioner där siffrorna fortfarande är utspridda och fortfarande korrelerar med vad ett team betalar. Det är en svårare mätning att hitta publicerad, vilket är precis varför leverantörers lanseringssidor fortfarande inleder med de mättade.
Den öppna frågan
Den siffra som snabbast kommer att göra den här sidan inaktuell är priset. Sols kampanjpris gäller åtminstone till och med den 21 november 2026, och OpenAI har inte publicerat någon prisnivå efter kampanjen; när det ändras ändras 2,5x i den här artikeln med det, i riktning mot 2x. Den andra är huruvida någon kör om dessa utvärderingar oberoende i samma testramverk – DeepSWE är förebilden för hur det bör se ut, och OSWorld 2.0 och Terminal-Bench 4.0 är de två raderna som mest behöver behandlingen. Fram till dess är den ärliga sammanfattningen av GPT-6 Astras benchmarkresultat att de imponerande siffrorna är mättade, att de särskiljande siffrorna är leverantörsrapporterade och ligger nära varandra, och att den enda oberoende siffran är ett oavgjort resultat som leverantörens eget lanseringsmaterial kallar ett rekord.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
