Titelkort i hero-sektionen med texten "Gemini 4 Argon vs GPT-6 Astra", med ett chip som visar "Index 52,6 vs 52,7" och ett chip som visar "Kostnad per indexuppgift $1,99 vs $3,26", samt en sidfotsrad med texten "Argon-siffror rapporterade av leverantören; index- och kostnadssiffror enligt Artificial Analysis, 2026-09-30."
Guides & Insights

Gemini 4 Argon vs GPT-6 Astra: Dött lopp i indexet, och ett prissteg två tredjedelar ned

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två frontmodeller, 0,11 poäng ifrån varandra på Artificial Analysis Intelligence Index. Gemini 4 Argon får 52,56. GPT-6 Astra får 52,67. Om du var tvungen att välja mellan dem utifrån uppmätt generell förmåga skulle du kunna singla slant, och skillnaden mellan de två poängen är mindre än konfidensintervallet för endera. Det är en genuint sällsynt situation på en marknad där de tio bästa modellerna spänner över ungefär femton poäng totalt, och det gör detta till den enklaste av Gemini 4 Argons matchningar att resonera kring, eftersom förmågeargumentet är över innan det har börjat och allt som återstår är ekonomi och åtkomst.

De två är dock inte tvillingar. Argon tillkännagavs den 30 september 2026 av Google DeepMind och rullas ut i faser, med start bland betrodda cyberförsvarare i Fairwind Program. GPT-6 Astra släpptes i början av september — vårt katalogkort daterar den till 2026-09-04, Artificial Analysis listar 2026-09-03 — och är en live-rutt som du kan anropa i eftermiddag för $10 in och $50 ut per miljon tokens, med ett kontextfönster på 1 050 000 tokens och ett tak för utdata på 128 000 tokens. En av dessa modeller har ett pris som du kan faktureras mot idag.

När en skillnad på 0,11 poäng är verklig och när den är brus

Ett index är en sammansättning, så två modeller som ligger lika på sammansättningen kan skilja sig meningsfullt åt i sina delar. Här stämmer delarna mestadels överens, med tre undantag värda att nämna.

• Terminal-Bench 4.0 — GPT-6 Astra 59,1 % mot Gemini 4 Argon 57,1 %. Astra leder, med knapp marginal.

• Långkontextresonemang — GPT-6 Astra 80,7 % mot Gemini 4 Argon 79,7 %.

• GPQA Diamond — GPT-6 Astra 96,1 %. Argon publicerar ingen siffra på denna resultattavla.

• CritPt — GPT-6 Astra 31,7 % mot Gemini 4 Argon 27,1 %.

• SciCode — Gemini 4 Argon 61,8 % mot GPT-6 Astra 56,5 %.

• Humanity's Last Exam — Gemini 4 Argon 57,1 % mot GPT-6 Astra 54,7 %.

• AutomationBench-AA — Gemini 4 Argon 77,5 % mot GPT-6 Astra 68,5 %.

• GDPval — Gemini 4 Argon 1 611 mot GPT-6 Astra 1 542.

• Allvetenhet — GPT-6 Astra 43,4 mot Gemini 4 Argon 42,4.

• ITBench-SRE — GPT-6 Astra 48,6 % mot ingen publicerad Argon-siffra.

• Utdatashastighet — GPT-6 Astra 51,2 tokens per sekund mot Gemini 4 Argon 48,9. I praktiken lika.

• Latens för första token i index-testbänken — Gemini 4 Argon 2,8 sekunder mot GPT-6 Astra 320,2 sekunder.

Astra har fördelar när det gäller vetenskapligt flervalsresonemang, fysikproblem om kritiska punkter och SRE-riktmärket. Argon har fördelar när det gäller vetenskaplig kodning, den svårare end-to-end-uppgiftsuppsättningen och GDP-värderat arbete. Inget av försprången är tillräckligt stort för att på egen hand ligga till grund för en migrering.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

Latensraden är en annan sak. 320 sekunder till första token är fem och en halv minuts tystnad innan något över huvud taget sänds ut, jämfört med under tre sekunder för Argon. Båda mäter samma sak – tiden till första chunk i indexkörningarna från Artificial Analysis – så det är jämförbart. Astras resonemang är alltid på och kan konfigureras från låg till maximal ansträngning; en körning med maximal ansträngning på en svår uppgift tänker faktiskt i minuter innan den svarar. Huruvida det är en defekt beror helt och hållet på ditt gränssnitt. För ett batchjobb kostar det ingenting. För allt där en användare sitter och tittar på en snurra är det den mest användarsynliga skillnaden mellan dessa två modeller, större än något benchmarkgap på sidan.

Prissteget, som är det egentliga ämnet

Det är här skiljelinjen går, och den går på ett sätt som är lätt att modellera fel, eftersom Astras prislista har tre nivåer som ser likadana ut.

• Standard, upp till 272 000 indata-token — GPT-6 Astra $10.00 in / $50.00 ut, cachade läsningar till $1.00, cache-skrivningar till $12.50.

• Lång kontext, över 272 000 indatatoken – GPT-6 Astra $20.00 in / $75.00 ut, cachade läsningar till $2.00. Hela begäran omprissätts till den högre nivån, inte bara överskottet: 2× indata och 1,5× utdata.

• Snabbläge – 2× den tillämpliga standardtaxan, alltså $20.00 in / $100.00 ut. Det här är $100-siffran som anges som om den vore långkontexttaxan; det är den inte.

• Gemini 4 Argon — $2.00 in / $10.00 ut, platt på introduktionsbasis, cachad input till $0.10, utan publicerad stegnivå och utan publicerad snabbnivå.

Så Argon är fem gånger billigare på indata och fem gånger billigare på utdata än Astras standardnivå, och tio gånger billigare på indata över 272K. Två oberoende kostnadsmätningar visar samma sak ur en annan vinkel: Artificial Analysis anger Argon till 1,99 USD per indextask jämfört med Astras 3,26 USD, och 2 407 USD för att köra hela indexet jämfört med Astras 5 324 USD. Kvoten per task är mindre än kvoten per token av samma anledning som den var mot DeepSeek – Argon kör färre tokens för att bli klar – men den är fortfarande 1,6×.

Vals BNP-viktade resultattavla berättar en tredje version av samma historia: Argon först med 68,90 % och 15,68 USD per körning, Astra på sjätte plats med 63,13 % och 18,46 USD. Astra är dyrare och får lägre poäng där. Googles material säger uttryckligen att prissättningen är ett introduktionspris, ett ord som betyder att det kan ändras, och den ärliga tolkningen är att Argons prisfördel är verklig och att dess varaktighet inte är garanterad.

Två arkitekturfakta som avgör mer än benchmarks

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Utdatataket först. Gemini 4 Argon genererar upp till 1 000 000 tokens i en enda trajektoria – Googles tillkännagivande framhåller detta som en utökning från 64K i den föregående generationen. GPT-6 Astra har ett tak på 128 000. Båda har ett kontextfönster på omkring en miljon tokens, så detta handlar enbart om hur mycket modellen kan skriva i ett svep. För långformatsgenerering, kodändringar som omfattar hela patchar eller dokumentutkast i ett enda pass innebär det en åttafaldig skillnad i vad ett enda anrop kan producera. För chatt, extrahering och korta agentsteg är båda taken i praktiken oändliga, och skillnaden kostar dig ingenting.

Modalitet i andra hand, och här går fördelen i motsatt riktning i ett avseende. GPT-6 Astra accepterar text, bilder och filer. Gemini 4 Argon accepterar text, bilder, video och filer, och Googles lanseringsmaterial lutar sig särskilt mot förståelse av långa videor – en LVBench-siffra på 91,7 % som är leverantörsrapporterad. Om din pipeline tar in video är Astra inte en ersättning. Ljud nämns inte heller i Argons publicerade lista över modaliteter, så utgå inte ifrån att uppgraderingen omfattar det.

Vad man faktiskt ska göra

Astra är tillgänglig och Argon är det inte, och det avgör de flesta beslut för den kommande månaden. Den konkreta vägen som inte slösar något arbete: bygg på GPT-6 Astra om din arbetsbelastning behöver en alltid påslagen resonemangsmodell med stark vetenskaplig noggrannhet och ett bevisat agentiskt track record, håll ditt modellnamn i konfigurationen, och sätt dina klienttidsgränser utifrån Astras uppmätta beteende i stället för utifrån optimism — en körning på fem minuter till första token kommer att utlösa en standardtidsgräns på 60 sekunder, och en ström som dör vid 300 sekunder ser ut som ett avbrott. Om du är kostnadskänslig över 272K indatatokens bör du modellera omprissättningen explicit innan du binder dig, eftersom steget fördubblar indata och höjer utdata med hälften vid en enda gräns.

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

Den intressanta mellanvägen är att du inte behöver välja en enda standard. Astra och Argon – när Argon släpps – är samma typ av modell riktad mot samma sorts arbete, vilket gör dem till naturliga failover-partner snarare än konkurrenter om samma plats. På OrcaRouter, openai/gpt-6-astra är live till leverantörens listpris utan påslag, på samma OpenAI-kompatibla endpoint som över 200 andra modeller, med automatisk failover mellan leverantörer och ett routing-DSL för att uttrycka ett primär- och backupupplägg på en enda nyckel. När Argon ansluter till katalogen under vilket id Google än publicerar, är bytet en sträng – inget ytterligare avtal, inget integrationsarbete och ingen ombyggnad av vad du än har byggt kring Astra under tiden.

Vad skulle bryta oavgjordheten permanent?

Ett publicerat Argon-pris efter introduktionsperioden, och en oberoende reproduktion av Googles agentiska påståenden – siffran 77,9 % för DeepSWE v1.1 och resultatet 68 % i CWE-bench v1 är båda leverantörsrapporterade och ingen av dem har en extern körning bakom sig. Endera skulle kunna flytta Argon väsentligt upp eller ner, eftersom ett indexförsprång på 0,11 punkter inte är en buffert mot en 1,6× kostnadsnackdel om kostnadsfördelen visar sig vara tillfällig, och det är inte ett underläge om Google behåller introduktionspriset och Astras långkontextnivå biter hårdare än väntat i produktion.

För nu: sett till uppmätt allmän förmåga är dessa två samma modell i två olika inkapslingar. Astra är den med en live-rutt, ett känt prissteg och en fem minuters tankepaus. Argon är den med ett billigare kort och ingen slutpunkt. Det oavgjorda är verkligt, och ena sidan av det är köpbar.