
Gemini 4 Argon vs GPT-6 Sol: En femtedel av priset, fyra gånger notan
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Kör man Artificial Analysis indexsvit på Gemini 4 Argon debiteras man 2 407 $. Kör man samma svit på GPT-6 Sol debiteras man 1 546 $. Samma index, samma uppgifter, samma vecka. De två modellerna har identiska listpriser – 2,00 $ per miljon indatatoken och 10,00 $ per miljon utdatatoken, Argon som ett angivet introduktionspris från Google och Sol som OpenAI:s ordinarie pris – och ändå skiljer sig slutkostnaden för att utföra identiskt arbete med 56 %, till förmån för modellen som ligger fem poäng lägre. Den klyftan är hela anledningen till att den här jämförelsen är värd att skriva, och den har ingenting med prislistan att göra.
Google tillkännagav Gemini 4 Argon den 2026-09-30 och kallade det nästa era av frontier-intelligens, med ett pris på $2 in och $10 ut med cachad indata med 95 % rabatt, och rullas ut till betrodda cyberförsvarare via Fairwind Program. GPT-6 Sol har varit allmänt tillgänglig sedan 2026-09-22, då OpenAI släppte mellannivån i GPT-6-serien till $2 in och $10 ut med 90 % cacherabatt. Den ena går att köpa idag via en OpenAI-kompatibel endpoint och den andra går inte att köpa av någon utanför en namngiven kohort, vilket är den praktiska skiljelinjen i den här artikeln. Men kostnadsinversionen ovan består även om du helt bortser från tillgänglighet, och att förstå varför är det användbara.
Inversionen, uttryckt i klartext
Artificial Analysis publicerar både ett Intelligence Index och en redovisning av vad det kostade att köra det indexet. Lästa tillsammans säger de detta:
• Intelligence Index — Gemini 4 Argon 52,6 mot GPT-6 Sol 47,5. En skillnad på fem punkter, uppmätt med Argon vid dess höga ansträngningsinställning och Sol vid max, så jämförelsen är generös mot Sol snarare än mot Argon.
• Listpris per miljon tokens — identiskt. $2,00 in / $10,00 ut på båda. Cacheläsningar är den enda skillnaden: $0,10 på Argon, $0,20 på Sol.
• Kostnad per indextask — Gemini 4 Argon $1,99 mot GPT-6 Sol $1,05. Argon kostar ungefär dubbelt så mycket per uppgift trots att det kostar samma per token.
• Kostnad för att köra hela sviten — Gemini 4 Argon 2 407 $ mot GPT-6 Sol 1 546 $.
• Uppmätt utdatahastighet — GPT-6 Sol 77,0 tokens per sekund mot Gemini 4 Argon 48,9, en skillnad på 1,6× som visar sig både som latens och kostnad.
Det finns en rad i den listan som förklarar alla de andra, och det är inte priset. Det är tokenantalet. På indexets egna uppgifter genererade Gemini 4 Argon ungefär 561 000 utdatatokens per uppgift; GPT-6 Sol genererade ungefär 282 000. Argon tänker dubbelt så länge för att svara på samma fråga, och med samma pris per token blir räkningen exakt dubbelt så hög.

Varför tokenarna är priset
Detta är en korrigering värd att ta till sig innan någon budgeterar en migrering, eftersom intuitionen pekar i fel riktning. När en modell har samma pris som sin konkurrent och förbrukar dubbelt så många output-tokens för att bli klar, är per-token-priset inte priset. Priset är per-token-priset multiplicerat med hur många tokens modellen än bestämmer sig för att göra av med, och den andra faktorn är en egenskap hos modellen, inte hos prislistan.
Marginalen per uppgift varierar enormt, vilket gör det ännu värre – du kan inte bara tillämpa en fast multiplikator och gå vidare:
• Terminal-Bench 4.0 — Argon 165 330 utdatatokens per uppgift mot Sols 97 372. Argon kostar 6,78 dollar per uppgift här mot Sols 4,00 dollar, trots att Argon får 57,1 % mot Sols 43,9 %.
• CritPt — Argon 109 533 tokens mot Sols 31 848. En tokenkvot på 3,4× på en uppgift där Sol faktiskt ligger högre, 30,9 % mot 27,1 %.
• GDPval — Argon 74 571 tokens mot Sols 41 567, för 1,82 $ per uppgift mot 1,32 $.
• Allvetenhet – en tokenkvot på 938 mot 2 662 till Argons fördel, till $0,010 per uppgift mot Sols $0,027. Den enda uppgiftsfamiljen där riktningen vänds.
• Långkontextresonemang — Argon 2 197 tokens mot Sols 954, och den enda uppgiften i sviten där Sol tydligt vinner på poäng, 83,7 % mot 79,7 %.
CritPt är den instruktiva. En modell som bränner tre och en halv gånger så många tokens för att producera ett något sämre svar på samma fråga är inte en historia om kapacitet; det är en historia om utgiftsvanor. Argons resonemang blir långt, och för vissa uppgiftsformer omvandlas den längden till poäng och för andra omvandlas den helt enkelt till dollar. Indexets 52,6 och Sols 47,5 är aggregatet, och aggregat döljer exakt detta.
Varifrån de fem punkterna faktiskt kommer
Eftersom indexgapet och kostnadsgapet pekar i motsatta riktningar är det värt att veta vilka uppgifter som driver vart och ett.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1 % mot GPT-6 Sol 43,9 %. Argons största enskilda vinst, och den uppgiftsfamilj som ligger närmast långsiktig agentisk kodning.
• Allvetenhet — Gemini 4 Argon 42,4 mot GPT-6 Sol 27,1. En spridning på femton punkter i faktatäckning, den största proportionella skillnaden i sviten.
• AutomationBench-AA — Gemini 4 Argon 77,5 % mot GPT-6 Sol 61,6 %.
• SciCode — Gemini 4 Argon 61,8 % mot GPT-6 Sol 57,6 %.
• Humanity's Last Exam — Gemini 4 Argon 57,1 % mot GPT-6 Sol 47,9 %.
• GDPval — Gemini 4 Argon 1 611 mot GPT-6 Sol 1 487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1 482,78 Elo mot Argons 1 493,84, en skillnad på 11 poäng som ligger inom de publicerade konfidensintervallen och bör kallas oavgjort.
• Långkontextresonemang — GPT-6 Sol 83,7 % mot Gemini 4 Argon 79,7 %. Sols enda tydliga seger.
• CritPt — GPT-6 Sol 30,9 % mot Gemini 4 Argon 27,1 %. Sol vinner igen, med knapp marginal.
Så bilden är inte ”Argon är bättre”. Det är att Argon är bättre på de två saker som dess lanseringsmaterial lyfte fram först – utförande av affärsuppgifter från början till slut och mjukvaruutveckling över långa tidshorisonter – och att Sol är jämbördig eller ligger före i den akademiskt anstrukna resonemangstrappan och på att bevara koherens över en lång kontext. För en läsare vars arbetsbelastning är en retrieval-pipeline med en prompt på 400K token är Sol samtidigt den bättre modellen och den billigare, vilket är en ovanlig och bekväm position att befinna sig i.
Specifikationsskillnaderna som överlever benchmarkdiskussionen
• Maximal utdata — Gemini 4 Argon 1 000 000 tokens i en enda trajektoria, vilket Google beskriver som det största i branschen och en ökning från föregående generations tak på 64K. GPT-6 Sol 128 000 tokens.
• Kontextfönster — GPT-6 Sols leverantörskort anger ungefär 1 050 000 tokens; Argons är 1 000 000. Artificial Analysis mätte Sol till 872 000 tokens via sin testrigg, vilket är ett mätvärde från testriggen och inte en siffra från kortet — behandla kortet som specifikationen och testriggssiffran som vad utvärderaren faktiskt använde.
• Indatamodaliteter – båda tar emot text, bilder och filer. Arons lanseringsmaterial lutar sig också mot förståelse av långa videor, där Google uppger 91,7 % på LVBench och kallar det toppmodernt; det är en leverantörsrapporterad siffra, och ingen oberoende instans har ännu reproducerat den.
• Videoinmatning – Mjuk. Artificial Analysis listar Argon med videoinmatning inaktiverad och nämner video uttryckligen vid lansering, medan Sols kort inte listar video alls. Om video är bärande i din pipeline avgör inget av korten saken, och du bör testa innan du bygger arkitekturen.
• Resonemangsinsats — Sol exponerar konfigurerbar insats (none till max, medium som standard) i API:et och mättes vid max. Argon mättes vid high; ingen har publicerat samma svit vid dess högsta inställning.
Taket på 1M tokens utdata är det som verkligen kan förändra en arkitektur snarare än en budget. Allt du för närvarande delar upp i ett dussin kedjade anrop för att hålla dig under ett 128K-tak – en flerfilig patchuppsättning, en fullständig granskningsrapport, ett långt dokument i en enda körning – blir ett enda anrop med färre ställen där en agentloop kan tappa tillstånd. Om det är värt dubbla kostnaden per uppgift beror helt och hållet på om du har den arbetsbelastningen. Om du har det är det förmodligen värt det. Om dina anrop är klassificera-och-returnera är det pengar som spenderas på ingen; ingen kommer att utnyttja det.
Den ansträngningsinställning som ingen matchade, och varför den spelar roll
En brasklapp förtjänar ett eget stycke eftersom den talar emot att tolka fempunktskillnaden i indexet som en ren kapacitetsskillnad. Artificial Analysis visar Gemini 4 Argon vid dess hög-inställning för resonemangsansträngning och GPT-6 Sol vid max. Det är inte samma steg på de två stegarna, och riktningen på missmatchningen är intressant: Sol kördes med sin dyraste inställning och Argon med en medelhög inställning.
Två tolkningar följer och data kan inte skilja dem åt. Antingen skulle Argon på max få högre poäng än 52.6 – men också förbruka fler tokens än 561 000 per uppgift och kosta mer än $1.99 – eller så skulle den få ungefär samma poäng, vilket skulle innebära att ansträngningsratten inte gör särskilt mycket i den här sviten. Det finns ingen publicerad körning som avgör det. Den som citerar 52.6 som Argons tak citerar en konfiguration, inte en modell, och konfigurationen är den som dess leverantör valde att publicera först.
Samma logik gäller för Sols 47,5, fast i motsatt riktning: max är toppen av sin stege, så siffran ligger närmare ett tak än ett golv. En rättvis kamp med matchad ansträngning skulle kunna minska gapet, och skulle också kunna vända kostnadsjämförelsen, eftersom de tokens som max bränner är de tokens som kostar 10 dollar per miljon.
Tillgänglighetsförgreningen, som avgör det faktiska svaret
Gemini 4 Argon är inte allmänt tillgänglig. Googles tillkännagivande säger att den rullas ut till en grupp betrodda cyberförsvarare genom Fairwind Program, att företaget deltar i den amerikanska regeringens frivilliga process för modellåtkomst före lansering, och att allmän åtkomst för utvecklare, företag och konsumenter kommer "så snart som möjligt", med start hos betalande API-kunder och prenumeranter på Google AI Ultra. Det finns ingen modellidentifierare, ingen slutpunkt, ingen kvot och inget datum. Den finns inte i något offentligt API, inte heller vårt — kontrollera katalogen och den ger 404, eftersom den inte finns där ännu.
GPT-6 Sol är en anropbar produkt. På OrcaRouter är den openai/gpt-6-sol, på samma OpenAI-kompatibla endpoint som de andra 200+ modellerna i katalogen, till OpenAI:s listpris som förs vidare med noll påslag, så $2/$10 ovan och steget för lång kontext med 272 000 token till $4/$15 är vad du faktiskt betalar snarare än vad en prislista hävdar. Automatisk failover mellan leverantörer täcker fallet där rutten försämras under körning, och routing-DSL:en låter en enda applikation skicka sin billiga klassificeringstrafik till en mindre modell och sin krävande resonemangstrafik till Sol utan ett andra SDK.

Det där sista upplägget är det ärliga svaret på den här jämförelsen för de flesta team. Kostnadsargumentet för Argon är verkligt men förutsätter en arbetsbelastning där agentarbete med lång tidshorisont dominerar; kostnadsargumentet mot det är verkligt för alla andra arbetsbelastningar; och du kan inte köpa det den här månaden ändå. Det billiga draget är att bygga utvärderingsramverket nu – dina egna prompter, din egen poängsättning, kört mot Sol med några olika inställningar för ansträngningsnivå – så att du, när Argon når betalande API-kunder, har ett uppmätt svar på en fråga som alla andra kommer att besvara utifrån en leaderboard.
Vad skulle avgöra det?
Tre saker, i ordning efter hur mycket de skulle rubba domen. Allmän tillgänglighet för Argon till ett verkligt pris, inte ett introduktionspris – ordet ”introduktions-” innebär att $2/$10 kan ändras, och Googles egen ordning sätter betalande API-kunder först, så den första publicerade prisnivån efter lansering är den att hålla ögonen på. En publicerad Artificial Analysis-körning av Argon vid dess högsta ansträngningsnivå, som skulle visa huruvida 52,6 är ett tak eller en hårsmån från det. Och en oberoende reproduktion av siffran för DeepSWE v1.1 – Google hävdar 77,9 % och kallar det ett nytt state of the art; den är leverantörsrapporterad och inte reproducerad utanför Google i dagsläget.
Fram till dess är uppdelningen ren och lätt ironisk. GPT-6 Sol är den mer välverifierade modellen, den snabbare, den billigare per slutförd uppgift och den du kan anropa i eftermiddag. Gemini 4 Argon är den modell som får högre poäng på den resultattavla som dess leverantör valde att publicera, ungefär dubbelt så dyr att faktiskt använda och ännu inte till salu. Att välja mellan dem är inte en bedömning av förmåga. Det är en bedömning av vilken av de där två meningarna som beskriver din månad.

