Hero-titelkort med texten "Gemini 4 Argon — vilken pinne på Gemini 4-stegen?", med en vertikal stege med fem rangordnade pinnar som listar Claude Opus 5.5 på 57.6, Gemini 4 Argon på 52.6, GPT-6 Astra på 52.7, Gemini 3.8 Flash på 40.9 och Gemini 3.1 Pro Preview på 29.7, en badge med texten "Ingen Gemini 4 Ultra — Ultra-sidan omdirigerar till en prenumerationsplan", och en sidfotsrad med texten "Indexsiffror enligt Artificial Analysis, v4.3.2-revision; Argon kan inte anropas från något publikt API."
Guides & Insights

Gemini 4 Argons steg i Gemini 4 Ladder – och varför det inte finns någon G4 Ultra

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det korta svaret på frågan som inledde den här artikeln är att Gemini 4 Argon är Goog​les främsta modell och inte dess högsta nivå, eftersom nivån ovanför den inte existerar ännu — och möjligen inte i den form någon förväntar sig. Goog​le har publicerat exakt en Gemini 4-modell, Argon, och den enda förstapartssidan på deras egen domän under sökvägen /models/gemini/ultra/ är inte en modellsida alls: den omdirigerar till Goog​les AI-prenumerationsplaner. Den omdirigeringen är det enskilt mest användbara faktumet i den här artikeln, och den går att kontrollera på en enda rad från en terminal. Allt annat här handlar om var Argon faktiskt befinner sig när man slutar läsa dess pris som en nivåetikett och börjar läsa det som en siffra.

Två saker är sanna samtidigt och de är lätta att förväxla. Argon är den mest kapabla G​emini som finns, och Argon är inte en modell på frontier-nivå. Det överträffar alla G​oogle-modeller som har släppts, med en marginal som är tillräckligt stor för att jämförelsen inte riktigt är en jämförelse, och det hamnar på Artificial Analysis Intelligence Index inom en bråkdel av en poäng från två konkurrerande flaggskepp som själva ligger hela fem poäng efter den nuvarande ledaren. G​oogle prissatte det som om det ligger ett steg under frontlinjen, och den oberoende mätningen håller med. Så priset är inte ett marknadsföringsbeslut som underskattar modellen. Det är ett korrekt påstående om modellen.

Detta är en artikel om vad vi vet så här långt. Gemini 4 Argon tillkännagavs 2026-09-30 i ett inlägg från Google DeepMind som tillskrivs Koray Kavukcuoglu, och den rullas först ut till en namngiven grupp cyberförsvarare via Googles Fairwind Program – inte till utvecklare, inte till företag, inte till konsumenter och inte till någon med ett kreditkort. Den har inget modell-ID i Gemini API, ingen slutpunkt och inget publicerat pris per token som du kan faktureras för. Modellidentifierare, genomströmning och tillförlitlighet som mätts på verklig trafik finns inte för den, vilket innebär att mätningen nedan är ett labbs benchmarkkörning och inget mer. När en siffra kommer från Google märks den som Googles; när den kommer från Artificial Analysis märks den som deras. Inget här bör läsas som ett påstående om att Argon är en köpbar produkt.

Stegen som Google faktiskt släppte, avläst från dess egna sidor

Det snabbaste sättet att svara på ”var hamnar Argon i Gemini 4-serien” är att sluta fråga om serien och börja lista de modeller som Google publicerar sidor för. En serie är ett marknadsföringskoncept; en sida är ett faktum. Här är vad förstapartssökvägarna leder till per den 1 oktober 2026.

• deepmind.google/models/gemini/pro/ returnerar 200 och har titeln ”Gemini 3.1 Pro — Google DeepMind”. Pro-platsen på Googles egen webbplats är fortfarande en modell av 3.1-generationen.

• deepmind.google/models/gemini/flash/ returnerar 200 och dess titel är ”Gemini 3.8 Flash — Google DeepMind”. Flash-platsen har flyttats tre gånger — 3.5, 3.6, 3.7, 3.8 — medan Pro-platsen inte har flyttats alls.

• deepmind.google/models/gemini/argon/ returnerar 404. Argon får ingen egen sökväg per modell. Dess hem är familjesidan på deepmind.google/models/gemini/, vilket är där Google placerar den modell som man för närvarande leder med.

• deepmind.google/models/gemini/ultra/ returnerar 302 och landar på one.google.com/about/google-ai-plans/, konsumentprenumerationssidan. Detsamma gäller den äldre sökvägen deepmind.google/technologies/gemini/ultra/. En ”Ultra” på Googles modellsökväg är en faktureringsnivå, inte en checkpoint.

• deepmind.google/models/gemini/nano/ returnerar 301 till sidan för Gemini-familjen. Det finns inte heller någon Nano-plats som fristående modellsida.

• deepmind.google/models/gemini/model-cards/ — det register som Google underhåller över varje modellkort som det har publicerat — innehåller ingen post för Argon och ingen post med ”Gemini 4” i namnet. Dess nyaste Gemini-rader är 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite och 3.1 Pro. Kortregistret är det långsammast rörliga dokumentet i den här uppsättningen, så dess tystnad är inte bevis för att Argon aldrig kommer att få ett kort; det är bevis för att pappersarbetet inte har hunnit ikapp tillkännagivandet.

• deepmind.google/models/, modellindexet listar ”Gemini 4 Argon” som flaggskeppskortet med sloganen ”Vår nästa era av frontier-intelligens”, direkt ovanför ”Gemini 3.8 Flash – Bäst för att hantera komplexa agentiska uppgifter i stor skala”. Två Gemini-kort, med en generation mellan sig, i den ordningen.

Lägger man ihop dessa är stegens form inte tvetydig. Googles offentliga modellutbud har en post på Gemini 4-pinnen, en post på Gemini 3.8-pinnen, en inaktuell Pro-pinne tre och en halv generationer bakåt, och ingenting ovanför något av det. Ordet ”Ultra” på Googles domän leder till en prenumeration. Det finns en Gemini 4 Pro-sida, ingen Gemini 4 Flash-sida, ingen Gemini 4 Ultra-sida och inget Gemini 4-modellkort. Google tillkännagav en modell, inte en familj.

Finns det en Gemini 4 Ultra? Bevisen, och vad som skulle falsifiera det

Det här förtjänar ett eget avsnitt, dels för att det är den del av frågan som med störst sannolikhet besvaras annorlunda om en vecka, dels för att det ärliga svaret har en begränsad hållbarhet.

De negativa bevisen är specifika snarare än vaga. En 302 på Ultra-sökvägen till prenumerationsplansidan är inte en svag signal; det är en omdirigering som Googles eget webbteam har konfigurerat. Flera blog.google URL-mönster för ett Gemini 4 Ultra-inlägg returnerar 404 — produktsökvägen, sökvägen innovation-and-ai models-and-research och den vanliga announcement-sökvägen. Ultra-namngivningen har form här, och formen talar emot en Gemini 4 Ultra. Googles ursprungliga Gemini-tillkännagivande introducerade Gemini 1.0 "optimerad för tre olika storlekar: Ultra, Pro och Nano", där Gemini Ultra beskrevs som "vår största och mest kapabla modell". Ett lanseringsinlägg som namnger tre storlekar är vad ett familjetillkännagivande ser ut som. Argons inlägg namnger en modell och inga syskon alls. Google pensionerade senare modellnamnet Ultra till förmån för numeriska nivåer och flyttade ordet till prenumerationssidan av verksamheten, där det nu namnger den högsta konsumentplanen. En modellsida som omdirigerar till en plansida är vad ett pensionerat modellnamn ser ut som när marknadsföringswebbplatsen har städats upp runt det.

Det finns inte heller något i tillkännagivandet som lovar ett större syskon. Argon-lanseringsinlägget beskriver Argon som ”vår nya frontiermodell” och beskriver den fasvisa utrullningen, säkerhetsarbetet och de interna driftsättningarna – och sedan slutar det. Det står inte ”först i Gemini 4-familjen”, det ger ingen förhandsvisning av en Pro eller en Ultra, och det namnger ingen efterträdare. Googles egen inramning behandlar Argon som huvudsaken, inte som den lilla.

Vad som skulle falsifiera slutsatsen är lätt att ange och värt att hålla utkik efter, eftersom vilken som helst av dessa skulle vända den inom en dag.

• Ett 200 på deepmind.google/models/gemini/ultra/ som renderar en modellsida i stället för plansidan, eller en ny models/gemini/ underordnad sökväg som dyker upp vid sidan av pro och flash.

• En Gemini 4 Ultra-rad som visas i modellkortindexet, vilket är hur Google historiskt sett bekräftar att en modell finns som en dokumenterad artefakt.

• Ett andra modell-ID i Gemini API i gemini-4-*namnrymden. Argon har för närvarande inget, så ett Pro- eller Ultra-ID skulle vara det första beviset på att familjen är verklig.

• En post i modellistan från Artificial Analysis, eller en benchmarktabell på familjesidan med en fjärde kolumn. Båda följer Googles lanseringar tillräckligt nära för att vara tidiga.

• Ett tillkännagivandeinlägg från Google I/O, Cloud Next eller DeepMind som använder ordet ”family” om Gemini 4. Argons inlägg gör det inte.

Tills åtminstone en av dessa inträffar är en text som hävdar att en Gemini 4 Ultra är på väg en förutsägelse utklädd till en rapport. Behandla den därefter, även när den kommer från oss.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Att läsa prisstegen som ett nivåuttalande

Prissättningen är den enda delen av detta som Google publicerade avsiktligt, med en fotnot, och det är det tydligaste uttalandet om avsikten med nivåerna i hela lanseringen. Argons introduktionspris är 2 USD per miljon indatatokens och 10 USD per miljon utdatatokens, med 95 % rabatt på cachad indata, och Googles egen fotnot nummer ett säger att efter en introduktionsperiod som den inte kunde definiera, ”kommer priset på 4 USD per 1M indatatokens och 20 USD per 1M utdatatokens att gälla.”

Läs de två paren mot fältet, så skriver nivåpåståendet sig självt.

• $4 / $20 är listpriset för Claude Opus 5.5. Googles pris efter introduktionsperioden för Argon landar exakt på den nuvarande frontlinjeledarens prislista, för en modell som ligger fem poäng efter den.

• $2 / $10 är det kampanjprisband som både GPT-6 Sol och Claude Sonnet 5.5 befinner sig i. Argons introduktionspris är samma $2 / $10, vilket placerar Argons lansering i samma prisband som en Sol på mellannivå snarare än i frontier-prisbandet.

• Claude Fable 5.1 och GPT-6 Astra ligger båda på $10 / $50. Argon är en femtedel av Fable 5.1:s pris för indata och en femtedel av dess pris för utdata, och den ligger inom 0,8 poäng från det.

• 0,75 $ / 3,75 $ är Gemini 3.8 Flash. Argon är 2,7× så mycket för indata och 2,7× för utdata – ett klart steg upp, inte ett stup.

Så Google har prissatt Argon som en modell som hör hemma under $10/$50 och över $0,75/$3,75, med en slutlig viloplats på $4/$20. Inget i den stegen säger ”frontier”. Den säger ”toppen av mellansegmentet, med ett annonserat pris som kommer att landa på samma nivå som ledaren tar betalt i dag, för mindre förmåga.” Det är ett försvarbart kommersiellt val. Det är inte prissättningen för en modell som ligger två nivåer före allt annat.

En strukturell poäng värd att ta med sig: Argons prissteg är ett verkligt steg, definierat i en fotnot och odaterat. Sonnet 5.5- och GPT-6-familjerna gör något liknande med långkontextnivåer, och Sol trappar upp till $4/$15 över 272K. Argons steg avser tid, inte kontextlängd — samma $2/$10 gäller över hela 1M-fönstret och bara kalendern ändrar taxan. Det är en ovanlig form, och det gör varje kostnadsjämförelse mot Argon till en tvåkolumnsövning: vilken period och vilken användning.

Var Argon står i förhållande till rivalerna, utifrån de siffror som finns

Artificial Analysis hade en mätning av 4 Argon ute tillräckligt snabbt för att den ska vara den enda oberoende bedömning som finns tillgänglig. I den revision som är aktuell den 1 oktober – v4.3.2 – får Argon 52 på Intelligence Index, konfigurerad med hög resonemangsansträngning. Modellerna runt den utgör inte ett slumpmässigt urval av fältet.

• Claude Opus 5.5 ligger på 57,62, mätt vid maximal ansträngning med fallback. Det är drygt fem poäng över Argon, och den toppar för närvarande resultattavlan.

• Claude Fable 5.1 ligger på 53,35, uppmätt vid maximal ansträngning med fallback. Argon ligger 0,79 bakom det.

• GPT-6 Astra ligger på 52,67, uppmätt vid max. Argon ligger 0,11 bakom.

• Claude Sonnet 5.5 ligger på 55,98, även max med fallback. Det är en modell i mellanskiktet som överträffar Argon med 3,4 poäng, och det är siffran som borde oroa alla som vill hävda att ”Gemini 4 Argon är världens näst bästa modell”.

• GPT-6 Sol ligger på 47,63, mätt vid max, i ett kontextfönster på 872K. Argon ligger 4,9 före.

• Gemini 3.8 Flash ligger på 40,93 vid hög ansträngning. Argon ligger 11,6 före.

• Gemini 3.1 Pro Preview ligger på 29,72. Argon ligger 22,8 före, vilket är det tydligaste enskilda beviset på hur långt Googles levererade Pro-nivå har hamnat efter sin egen forskning.

Tre saker faller ut ur den listan. För det första ligger Argon i nivå med de två utmanarna, Fable 5.1 och Astra, och klart efter två Anthropic-modeller – Opus 5.5 och, mer besvärande, Sonnet 5.5. För det andra är gapet mellan Argon och Googles egen bästa lanserade modell det största generationsklivet i den nuvarande uppsättningen, med god marginal. För det tredje är signalens framing att ”frontlinjen ligger minst två nivåer före” korrekt i sak men något fel i geometrin: det finns en modellnivå som klart ligger före Argon (Opus 5.5 på 57.6) och en andra modell i en billigare nivå som också ligger före den (Sonnet 5.5 på 56.0), vilket är ett skarpare problem än att vara två steg ned på en stege som Argon faktiskt befinner sig på.

Inramningen med prisjämförelse i den ursprungliga frågan – ”priserna tyder på att detta är deras Sol/Sonnet-motsvarighet” – visar sig vara ungefär rätt om lanseringspriset och fel om det slutliga priset. Argon öppnar på Sols och Sonnet 5.5:s nivå och landar på Opus 5.5:s. Det är prissatt som en mellannivåmodell som avser att bli en frontier-prissatt sådan, men mäter sig inte med någon av dem.

Bilden av kostnad per uppgift är där Argon är starkast och där nivåberättelsen får en andra dimension. På Index-uppgiften kostar Argon $1,99 och avger 142 374 utdata-tokens. Opus 5.5 kostar $5,98 och avger 338 099. Sonnet 5.5 kostar $7,62 för 599 849. Fable 5.1 kostar $7,63 för 187 455. Astra kostar $3,26 för 68 691. Gemini 3.8 Flash kostar $1,24 för 154 230. Argon är det billigaste sättet att köpa en poäng nära fronten, och det är billigare än Flash-modellen som ligger högre i poäng med mindre än en dollar per uppgift.

Effort-inställningar är asterisken på allt ovanstående och fältet rapporterar dem inte enhetligt. Argon mäts vid high; Opus 5.5 och Fable 5.1 och Sonnet 5.5 vid max med fallback; Astra och Sol vid max. En high-effort-körning och en max-effort-körning är inte samma mätning, och Anthropics egen effort-stege flyttar en modell flera punkter mellan inställningar. Om Argon mätt vid max effort får en poäng meningsfullt över 52,6 förändras tier-argumentet. Ingen har publicerat den körningen ännu.

Vad Googles egen tabell hävdar, och hur den skiljer sig från den oberoende

Gemini-familjens sida innehåller en av Google författad prestandatabell med fyra kolumner – Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 – och nitton benchmarkrader. Det är den mest detaljerade uppsättning påståenden som Google har publicerat för denna modell, och den är genomgående leverantörsrapporterad. Att läsa den mot det oberoende indexet är lärorikt just eftersom de två inte är överens om hur fältet ser ut.

• I Googles tabell tar Argon hem tretton av de nitton raderna ohotat eller delar förstaplatsen, inklusive Vals Index Knowledge work på 68,9, AutomationBench på 51,3, Harvey’s Legal Agent Benchmark på 19,6, DeepSWE v1.1 på 77,9, LABBench 2 på 88,8, GraphWalks på 99,7 för intervallet ≤128K och 84,2 för intervallet 256K–1M, Agent’s Last Exam på 39,5, LVBench på 91,7 och Chartography på 71,6.

• Claude Opus 5.5 vinner raderna som läses som uthålligt ingenjörsarbete: FrontierSWE v2 på 62,3 mot Argons 55,0, Terminal-bench 4.0 på 66,4 mot 57,4, Terminal-Bench Science 0.1 på 63,3 mot 57,6 och PostTrainBench på 49,3 mot 45,3.

• GPT-6 Astra uppnår 68,1 i Terminal-Bench Science 0.1 och 72,6 i OSWorld-2.0 offline-delmängd, och ligger lika med Argon i CWE-bench v1 på 68,0. Claude Fable 5.1 förlorar på varje rad utom en delad placering i Vibe Code Bench.

• På det oberoende Indexet är ordningen Opus 5.5 först, sedan Sonnet 5.5, sedan Fable 5.1, sedan Argon och Astra i praktiken på samma nivå. Googles tabell har ingen Sonnet 5.5-kolumn alls, vilket är den mest betydelsefulla utelämningen i den: tabellens fyra kolumner är valda, och modellen som rankas högre än Argon på Indexet till ett lägre pris finns inte med bland dem.

Inget av detta gör Googles tabell oärlig. Leverantörers benchmarktabeller är utvalda, inte samplade, och varje labbs är det. Det gör den till ett påstående snarare än en mätning, och det innebär att nivåfrågan inte kan avgöras utifrån den. Det enda stället där tabellen verkligen är bärande för den här artikeln är det negativa: nitton rader, fyra kolumner och ingen femte kolumn för en Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Det enda med Argon som inte alls är en tier-fråga

Varje argument om nivåer ovan förutsätter att Argon är en modell som du så småningom kan anropa. Det är värt att skilja det från positioneringsfrågan, eftersom de två har olika svar och bara ett av dem handlar om förmåga.

Argons utdatagräns är 1 miljon token, upp från 64K, och Google uppger det direkt. Det är ett tak för utdata, inte ett kontextfönster. Åtskillnaden spelar roll eftersom de två ständigt blandas samman i bevakningen av den här lanseringen, och en gräns på 1M utdata är ett annat ingenjörspåstående än ett kontextfönster på 1M — den första handlar om hur länge en enskild trajektoria kan köras, den andra om hur mycket du kan ge modellen på en gång. Google har varit explicit om utdatagränsen och tyst om kontextfönstret. Artificial Analysis registrerar även 1 000 000 token för Argons kontext, men det är trackerns fält och inte Googles, så behandla de två siffrorna som om de kom från olika rum trots att de ser likadana ut.

Det som otvetydigt inte är tillgängligt är åtkomst. Argon är inte allmänt tillgängligt, det finns inte i Gemini API under någon identifierare, och det finns inte i någon tredjepartskatalog. Det är tillgängligt för granskade cyberförsvarare genom Fairwind Program och för Googles egna ingenjörer, och nästa steg som Google nämner – ”med start hos betalande API-kunder och prenumeranter på Google AI Ultra” – har inget datum kopplat till sig. Du kan inte benchmarka det på din egen arbetsbelastning. Varje siffra i den här artikeln är därför någon annans mätning av en modell som du inte kan använda.

Vad skulle kunna flytta upp Argon ett steg?

En nivåbedömning är en ögonblicksbild, och det finns ungefär fem saker som skulle ändra den här, i grov ordning efter hur mycket de skulle spela roll.

• En oberoende uppmätt körning med maximal ansträngning. Argon är för närvarande en mätning med hög ansträngning på 52,56. Anthropics egna ansträngningsnivåer flyttar en modell flera poäng mellan inställningar, och om Googles modell beter sig på liknande sätt vid max är Argons verkliga position gentemot Fable 5.1 och Astra bättre än vad den här artikeln säger. Detta är den enskilt mest sannolika ändringen.

• En andra mätkälla. En tracker är en mätning. Ett andra oberoende labb som poängsätter Argon i sin egen harness skulle göra mer för tier-anspråket än någon ytterligare benchmark-rad från Google.

• En Gemini 4 Pro. Om Google öppnar Pro-nivån i 4-generationen under Argon blir sortimentet en familj med en form, Argons position slutar vara ”den enda” och börjar vara ”toppen av tre”, och varje argument i den här artikeln om en saknad familj behöver skrivas om. Värt att hålla utkik efter, och närmare än Ultra-frågan.

• Ett pris som inte trappas upp. Om introduktionsperioden helt enkelt aldrig löper ut — Google har inte definierat när den slutar — är Argons effektiva vilopris $2/$10 i stället för $4/$20, och dess fördel i kostnad per uppgift gentemot Opus 5.5 ökar från ungefär 3× till ungefär 6×. Det är en kommersiell händelse, inte en förmågehändelse, men det förändrar hur ett inköpsbeslut ser ut.

• Ett Argon-modellkort, systemkort eller sida för utvärderingsmetodik. Prestandatabellen länkar till en metodiksida på Googles domän; ett fullständigt modellkort skulle föra kontextfönstret, driftsättningskonfigurationen och säkerhetsenveloppen till protokollet, och skulle vara den första artefakten som låter någon utanför Fairwind-kohorten kontrollera Googles siffror i stället för att läsa dem.

Omvänt är det som mest sannolikt skulle flytta Argon nedåt inte en benchmark alls. Det är Bloombergs rapportering den 30 september, som citerade Google-anställda med tillgång till modellen och som sade att den presterar sämre på verkligt arbete än dess poäng antyder. Det påståendet är obekräftat av någon utanför Google och det är inte en mätning, men det är den typ av påstående som en andra oberoende benchmark antingen skulle bekräfta eller vederlägga. Fram till dess står det i protokollet som ett påstående med en namngiven publikation och icke namngivna källor, och det hör till nivådiskussionen eftersom en modell vars gap mellan benchmark och verklighet är omtvistat inte kan lyftas enbart utifrån benchmarks.

Vad detta innebär om du ska välja en modell den här månaden

Om man bortser från positioneringsargumentet är den praktiska bilden tillräckligt enkel för att ett stycke ska räcka. Gemini 4 Argon är den bästa Gemini som Google har byggt, och den är inte tillgänglig för dig, så de Google-modeller du faktiskt kan välja mellan i dag är de som har släppts: Gemini 3.8 Flash, som mäter 40,93 på Index till $0,75/$3,75, och Gemini 3.1 Pro Preview, som mäter 29,72 till $2/$12. Om du behöver en Gemini just nu är det det verkliga valet, och Argon finns inte med i det.

Om du väljer mellan leverantörer i stället för inom Google förändrar inget i Argons tillkännagivande dagens beslut. Högst upp i Indexet ligger Claude Opus 5.5 på 57,62, med Claude Sonnet 5.5 på 55,98 tätt efter, till en femtedel av priset för indata och hälften för utdata. Gemini 4 Argon på 52,56 har ingen väg till din applikation, så det är inte en kandidat, hur bra poängen än till slut visar sig vara.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter är ett enda API framför över 200 modeller med leverantörernas listpriser vidarebefordrade utan påslag och automatisk redundansväxling mellan leverantörer, vilket betyder att beslutet att byta modell inte kräver att man bygger om något: id:t i förfrågningskroppen är hela ändringen. De Google-modeller som finns i vår katalog idag är de som Google faktiskt har släppt – google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash och google/gemini-3.1-pro-preview. Gemini 4 Argon är inte en av dem och kommer inte att vara det så länge den saknar offentlig modellidentifierare och publicerad prislista, så ingen bör läsa in ett påstående om routning i något av ovanstående. När Google gör Argon tillgänglig via ett API med ett ID blir det en routingfråga. Fram till dess är den ärliga versionen av OrcaRouters svar att det ännu inte är tillämpligt, och det användbara som katalogen gör för just detta beslut är att låta dig jämföra priset på de modeller som faktiskt går att anropa sida vid sida utan att öppna fyra konton för att ta reda på det.

Slutsatsen

Gemini 4 Argon är Googles flaggskepp, men inte dess absoluta framkant. Den mäter 52,56 i Artificial Analysis v4.3.2-index vid hög ansträngning – i nivå med Claude Fable 5.1 och GPT-6 Astra, fem poäng efter Claude Opus 5.5 och efter Claude Sonnet 5.5, en billigare modell från ett konkurrerande labb. Google prissatte den till $2/$10 i introduktionspris, som trappas upp till $4/$20, vilket gör att dess slutliga pris exakt landar på Claude Opus 5.5:s – för mätbart lägre förmåga. Dess ledning med 11,6 punkter över Gemini 3.8 Flash är den största generationsklyftan i Googles egen produktlinje, och det är det starkaste beviset för att Gemini 4-generationen är ett verkligt steg uppåt och inte bara en ny etikett.

Om frågan som föranledde allt detta: det finns ingen Gemini 4 Ultra. Googles Ultra-sökväg på deras egen domän omdirigerar till en sida för prenumerationsplaner, modellkortsindexet innehåller inte någon Gemini 4-post alls, varje URL-mönster för ett meddelande om Gemini 4 Ultra ger 404, och lanseringsinlägget tillkännager en modell utan att utlova en familj. Det är ett verkligt fynd och det är förstahandseviden snarare än en slutledning, men det är också ett faktum med kort halveringstid – en enda 200 på en sökväg omkullkastar det, och Pro-nivån i Gemini 4-generationen är den som troligare dyker upp först.

Två förbehåll att ta med sig från den här artikeln. Varje Argon-siffra här är någon annans mätning av en modell som ingen utanför en granskad kohort av cyberförsvarare kan anropa, och Googles egen tabell med nitton rader är ett påstående snarare än en mätning – användbar för vad den är, och inte en ersättning för det oberoende Index. Och den rimliga domen i tier-frågan är preliminär: Argon mäts vid hög ansträngning, inte max, och en körning med maximal ansträngning är det billigaste möjliga sättet för den här artikeln att ha fel.

Jämförda i den här artikeln4

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen