
Gemini 4 Argon: Vad Google tillkännagav, och vad namnet förknippas med
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 64 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Gemini 4 Argon är den enda Gemini 4 som finns. Den meningen låter självklar ända tills man räknar på vad den innebär, och det är just vad den här sidan är till för. Google tillkännagav Gemini 4 Argon den 2026-09-30, i ett DeepMind-inlägg som tillskrivs Koray Kavukcuoglu; det är ett riktigt modellnamn på en riktig förstapartssida, det har uppmätts av Artificial Analysis till ett Intelligence Index på 52,56 i revisionen v4.3.2, och det ligger inom en halv poäng från GPT-6 Astra på 52,67 och Claude Fable 5.1 på 53,35 – samtidigt som det ligger fem poäng under Claude Opus 5.5 på 57,62 och Claude Sonnet 5.5 på 56,00, och inom en poäng från GPT-6.1 Sol på 51,83. Vad det inte har är det som var och en av dessa konkurrenter har: en modellidentifierare som du kan lägga in i en begäran.
Så det ärliga enradssvaret på ”vad är Gemini 4 Argon” är att det är en modell som Google har tillkännagivit och benchmarkat men ännu inte gjort anropbar, att namnet är kopplat till en behörighetsstyrd utrullning snarare än en produkt, och att ”Gemini 4” i sig inte är kopplat till någonting alls. Båda halvorna av den meningen går att kontrollera från en terminal, vilket är varför den här sidan kontrollerar dem i stället för att påstå dem.
Namnet är äkta. Produkten är det inte.
Börja med vad en entitetskontroll faktiskt returnerar. Från och med den 8 oktober 2026 har Googles familjesida på deepmind.google/models/gemini/ Gemini 4 Argon som sitt huvudkort, under taglinen "Vår nästa era av frontier intelligence", med kapacitetstext som nämner mjukvaruutveckling, kunskapsarbete inom företag inom juridik och finans, samt defensiv cybersäkerhet. Tillkännagivandeinlägget finns på blog.google/innovation-and-ai/models-and-research/gemini-models/-sökvägen. Det finns en modellfamiljsida. Det finns en nittonradig leverantörsbenchmarktabell. Det finns en femsidig PDF med utvärderingsmetodik. Det är ett omfattande pappersspår, och det är mer än vad en läcka får.
Lista nu vad som saknas i den, för listan över det som saknas är själva artikeln.
• Ett modell-ID — Gemini API:ets modellista innehåller noll förekomster av "argon" och noll förekomster av "gemini-4". De nyaste identifierarna som Googles dokumentation känner till är 3.8-familjen.
• En slutpunkt eller ett pris du kan faktureras mot — priset på 2 $ för indata / 10 $ för utdata per miljon tokens i tillkännagivandet är ett introduktionspris för en utrullning som ännu inte har nått betalande kunder.
• Ett modellkort eller systemkort — DeepMinds modellkortsindex har ingen Argon-rad, och familjens modellkortssökväg returnerar 404.
• Ett kontextfönster — Google publicerade en utdatagräns på 1 miljon token, upp från ett tidigare tak på 64K, och publicerade inte inputsidan av det paret. Artificial Analysis anger 1M för modellen som den mätte.
• Ett datum för allmän tillgänglighet — meddelandet beskriver en etappvis utrullning utan datum för någon fas efter den första.
• En ..., som Google inte har publicerat för någon Gemini.
Utrullningen som Google beskriver sker i tre etapper vars varaktighet inte anges. Först en namngiven grupp cyberförsvarare via Fairwind Program. Sedan betalande API-kunder och prenumeranter på Google AI Ultra. Sist utvecklare, företag och konsumenter. Endast den första är live i någon mening som en läsare kan verifiera, och Google anger inget datum för etapp två och tre. Det är inte en fotnot. Det är skillnaden mellan en modell och en nedräkning.

Vad Googles egen tabell påstår, och vem som faktiskt mätte det
Googles familjesida innehåller en benchmarktabell med fyra kolumner med Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 och Claude Opus 5.5. Den är värd att läsa, och den är värd att läsa med proveniensen i åtanke, eftersom Google redovisar den proveniensen i metodik-PDF:en, och redovisningen förändrar hur mycket tabellen kan bära.
Påståendena, märkta som Googles: Argon leder på Vals Index med 68,9 mot Opus 5.5:s 67,0 och Fable 5.1:s 65,8; på AutomationBench med 51,3 mot 42,5, 31,4 och 41,4; på Vals Finance Agent v2 med 65,4; på Harveys Legal Agent Benchmark med 19,6 mot 3,8, 6,7 och 5,4 — ett gap på fyra till fem gånger; på DeepSWE v1.1 med 77,9 mot 74,2, 67,4 och 74,1; på Vibe Code Bench med 91,9, en marginal på 1,6 punkter; på LABBench 2 med 88,8 mot 73,1, 68,6 och 85,4; på RiemannBench med 76,0; på båda GraphWalks-raderna, 99,7 vid ≤128k och 84,2 vid 256k–1M; på Agent’s Last Exam med 39,5; på Terminal-Bench Science 0.1 med 57,6; på Chartography med 71,6; och på LVBench med 91,7 som state of the art.
Och den förlorar, på Googles egen sida: FrontierSWE v2 på 55,0 mot Astras 65,5 och Opus 5.5:s 62,3; Terminal-bench 4.0 på 57,4 mot Opus 5.5:s 66,4; PostTrainBench på 45,3 mot Opus 5.5:s 49,3; och OSWorld-2.0 på 69,2 mot Astras 72,6. CWE-bench v1 är oavgjort på 68,0 med Astra.
Proveniensraden är viktigare än någon enskild rad. Googles metodik anger att resultaten är pass@1, ett enda försök, vid de högsta tänkandeinställningarna, och – avgörande – att de icke-Gemini-siffror som finns i den tabellen är leverantörernas egna självrapporterade siffror, med GPT-6 Astra, Claude Fable 5.1 och Claude Opus 5.5 tagna vid maximal tänkandeinställning där sådan finns tillgänglig. En leverantörstabell vars konkurrentkolumner är konkurrenternas pressmeddelanden är ett användbart dokument, men det är inte en kontrollerad jämförelse. Var och en av dessa rader är rapporterad av Google, och några av dem är Google som rapporterar vad någon annan rapporterade. Behandla marginalerna, inte bara värdena, i enlighet med detta.
En modell, tre indexnummer och varför de alla är korrekta
Argons oberoende ställning är mer intressant än en enskild siffra, eftersom siffran rör sig beroende på var du läser den, och rörelsen är inte ett fel.
Artificial Analysis uppmäter Gemini 4 Argon (High) till 52,56 på version v4.3.2 av sitt Intelligence Index. Samma index placerar Claude Opus 5.5 på 57,62, Claude Sonnet 5.5 på 56,00, Claude Fable 5.1 på 53,35, GPT-6 Astra på 52,67, GPT-6.1 Sol på 51,83 och Gemini 3.8 Flash på 40,93. I topplistans visade ordning pressas de tio främsta modellerna, eller där omkring, ihop till ungefär sex indexpoäng, och Argon hamnar i den klungan snarare än under den.
Då ser en läsare ett andra nummer – 53 – i resultattavlans avrundade visning, och ett tredje om man jämför med en annan konfiguration av en systermodell, och drar slutsatsen att en av källorna är fel. Ingen av dem är det. Den avrundade 53:an är samma mätning som 52,56. Det som skiljer sig mellan konfigurationer är tankeansträngning: Artificial Analysis mäter varje modell vid flera ansträngningsnivåer, och samma modell vid en högre ansträngningsnivå kan skilja sig flera punkter. Det är därför resultattavlan listar Opus 5.5 fyra separata gånger, vid 58, 56, 54 och 51. Argon förekommer en gång, vid hög ansträngning, eftersom det är den enda konfiguration som Google har gjort tillgänglig att mäta. Om Google släpper en Argon-nivå vid maximalt tänkande kommer den raden att röra sig, och det ärliga att säga om den i dag är att den ännu inte har rört sig.
Ytterligare tre av Argons oberoende siffror är värda att ta med, alla från Artificial Analysis och alla uppmätta i (High)konfigurationen. Utdatahastigheten är 60,69 tokens per sekund i median. Tiden till första svarstoken är 2,92 sekunder i median. Kostnaden per uppgift i Intelligence Index – indexpoängen normaliserad mot den tokenförbrukning som krävs för att uppnå den – är 1,99 dollar. Det sista talet är det man bör hålla fast vid, för det är där Argons position blir obekväm: Opus 5.5 får fem poäng högre och kostar 5,98 dollar per Index-uppgift, så Argon är tre gånger billigare per enhet uppmätt förmåga. Men GPT-6.1 Sol får en halv poäng lägre och kostar 0,72 dollar, vilket är ungefär en tredjedel av Argons siffra. Argon är inte valet med bäst värde i sitt eget indexband. Det är mitten av det.
Det finns ytterligare två oberoende mätvärden som en noggrann läsare inte bör förväxla med varandra. Artificial Analysis registrerar Argons AutomationBench-siffra som ett partiellt resultat på 0,7751 på en skala från 0 till 1, medan Googles tabell rapporterar 51,3 av 100 på AutomationBench-tavlan. Det är inte samma mätvärde, och att ställa dem sida vid sida är precis den typ av jämförelse som ger en påhittad siffra. Samma försiktighet gäller leverantörstabellens grupperingar för kunskapsarbete: ”ledande inom kunskapsarbete” är Googles sammanfattning av Googles egen tabell.
Vilken “Gemini 4”-sida är det du faktiskt letar efter?
Det här är förvirringen som namnet skapar, och det är värt att reda ut på ett ställe, eftersom bloggen nu har skrivit om fem olika ”Gemini 4”-saker och de är inte varianter av en och samma artikel.
• Om du vill ha utgivningsdatumet och tidslinjen för utrullningen — när Argon tillkännagavs, hur den stegvisa utrullningen ser ut och vad arenatavlorna gjorde med det — är det artikeln om utgivningsdatumet, som är den del som äger tidslinjen och läsningarna från Text Arena och Code Arena.
• Om du vill veta ”är Gemini 4 Argon en nivå eller en modell”, och huruvida en Gemini 4 Ultra finns — artikeln om nivåpositionering, som läser av nivåstegen utifrån Googles egna sökvägar och förklarar varför Ultra-sökvägen leder till en prenumerationssida.
• Om du vill ha själva namngivningsfrågan: argumentet att exakt en av “Gemini 4” och “Gemini 4 Argon” är en modell och en är ett generationsprefix utan modell-ID, utan endpoint och utan pris — det är den direkta jämförelsen mellan de två Google-namnen.
• Om du vill ha tredjeplatsresultatet i FrontierSWE v2 och självkritikalitetsobservationen som kom med det, är det FrontierSWE-utvärderingsdelen.
• Om du vill jämföra Argon mot en specifik rival på siffrorna, finns det tretton jämförelsesidor på webbplatsen som täcker frontier band, och de är rätt plats för en genomgång av två modeller.
Det som ingen av dem är, och det som den här sidan är, är pelaren: den enda platsen som säger vad entiteten är, vad varje siffra som hör till den betyder och inte betyder, och vad du faktiskt kan göra med den i dag. Den relaterade sidan ”Gemini 4 vs Gemini 4 Argon” lägger redan fram namnargumentet i sin helhet och den här sidan kommer inte att upprepa det. Allt nedan är nytt.

Trycket som ännu inte har sagt oss något
Två av de starkaste signalerna i Argon-historien pekar på en nära förestående utvecklarversion, och ingen av dem är ett bevis för att en utvecklarversion har släppts.
Det första är att Googles egna API-ytor har gått vidare utan Argon. Den senaste posten i Gemini API:s ändringslogg är 6 oktober 2025 – Gemini Nano Banana 2. allmänt tillgänglig, under identifieraren gemini-nano-banana-2.1. Med andra ord, under de åtta dagar som gått sedan Argon tillkännagavs, har Google valt en namnkonvention för en Gemini-modell i produktion och släppt en GA-identifierare för en annan modell, och gemini-4-namnrymden är fortfarande tom. En modell vars utrullning är verklig lämnar ett spår i ändringsloggen. Den här har inte lämnat något.
Den andra är inramningen kring nationell säkerhet. Google uppger att man ”aktivt deltar i den amerikanska regeringens frivilliga process för tillgång till modeller före lansering”, och den första utrullningsfasen är en namngiven kohort av cyberförsvarare. Det är förenligt med en stegvis utrullning där frontier-kapacitetsmålgruppen får modellen innan det offentliga API:t gör det, och det är lika förenligt med att modellen helt enkelt inte är redo för allmän trafik. Inget i inramningen säger vilket som gäller. Den som säger att den gör det läser teblad, och Google har inte satt något datum för API-fasen för att avgöra det.
Vad du kan ringa idag, och vad du inte kan
Det här är den del av sidan som dateras snabbast, så den bär sitt datum. Från och med den 8 oktober 2026 returnerar OrcaRouter-modell-API:et HTTP 404 för google/gemini-4-argon. Den finns inte bland våra rutter. Inte heller google/gemini-4, inte heller google/gemini-4-argon-high, inte heller google/gemini-4-pro — ingen av dessa identifierare går att slå upp, eftersom ingen av dem existerar som anropbar modell någonstans.
Vad finns på våra rutter idag, från samma leverantör, och vad var och en kostar enligt leverantörens listpris:
• google/gemini-3.8-flash — släppt 2026-09-02, ett kontextfönster på 1 048 576 tokens och en maximal utdata på 65 536 tokens, till $0,75 in och $3,75 ut per miljon tokens. Det här är modellen som Argon så småningom kommer att jämföras med av folk som äger ett kreditkort, och det är det närmaste en Argon-närliggande arbetsbelastning du kan köra i eftermiddag.
• google/gemini-3.6-flash — släppt 2026-07-21, för 0,75 $ och 3,75 $.
• google/gemini-3.5-flash — släppt 2026-05-23, för $1,50 och $9,00.
• google/gemini-3.5-flash-lite — släppt 2026-07-21, för 0,30 och 2,50 USD.
• google/gemini-3.1-flash-lite — för $0.25 och $1.50.
• google/gemini-3.1-pro-preview — släpptes 2026-02-19, till priset $2,00 och $12,00. Detta är den enda Gemini-modellen i Pro-platsen som du kan anropa, och den ligger tre och en halv generationer bakom Flash-seriens senaste tillskott.
Alla dessa körs på samma nyckel som Claudes och OpenAIs frontier-modeller i samma indexband — Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1, GPT-6 Astra och GPT-6.1 Sol ligger alla på samma rutter — vilket innebär att det intressanta med Argons position går att testa utan Argon. Om du vill veta hur det känns med cirka 52 indexpoäng kunskapsarbete till en femtedel av priset kan du mäta det i dag mot google/gemini-3.8-flash på 40,93, och om du vill ha toppen av bandet kan du mäta Claude Opus 5.5 på 57,62 samma dag, i samma konto, utan ett andra avtal och utan kodändring. Det är den praktiska formen av hela artikeln: ett API för 200+ modeller, 0 % påslag på leverantörens listpris som förs vidare, så en leverantörsprissänkning når dig samma dag som den landar, och automatisk redundansväxling mellan leverantörer för den dag en modell du är beroende av slutar svara. Vi beskriver det här eftersom det gäller Gemini 3.8 Flash som du kan anropa, inte för att det säger något om Argon. Argon är inte en av dem.
Om du vill ha Argon självt är dina alternativ i dag Fairwind cyber-defender cohort och att vänta. Googles eget API serverar det inte, och inte vi heller, och ingen tredjepartsväg kan servera en modell som inte har någon identifierare att adressera.
De öppna frågorna, och exakt vad som skulle stänga dem
Fyra saker är ouppklarade, och var och en har en specifik, kontrollerbar utlösare. Att hålla den listan kort är poängen – en sida som den här är bara användbar så länge den är falsifierbar.
• Får Argon en Gemini API-identifierare? Håll utkik i API-modellistan efter något gemini-4-prefixat ID. I samma stund som ett sådant dyker upp blir prisfrågan verklig, och introduktionspriset på $2 / $10 blir ett belopp du kan debiteras för snarare än en siffra i ett blogginlägg. Håll också utkik efter om introduktionspriset överhuvudtaget överlever in i API-skedet, och om det stiger till $4 / $20 eller någon annanstans.
• Ändras den uppmätta konfigurationen? Argon mäts vid en tankenivå och får 52,56. Om Google exponerar en konfiguration med högre ansträngning flyttas den raden; de jämförbara modeller som den jagar listas alla med två till fyra ansträngningsnivåer, så att Argon bara listas en gång är ett faktum om tillgänglighet, inte om modellens tak.
• Står sig de juridiska och finansiella påståendena vid en oberoende körning?Harvey’s Legal Agent Benchmark på 19,6 mot en konkurrents 3,8, och Vals Finance Agent v2 på 65,4 som leder fältet, är de två största relativa marginalerna i Googles tabell. De är också de två rader som med störst sannolikhet kommer att köras igen av någon som inte arbetar på Google. En fyra- till femfaldig marginal i ett domänbenchmark är antingen den viktigaste meningen i tillkännagivandet eller en skillnad i testramverket, och sättet att ta reda på det är att hålla utkik efter en andra körning.
• 有同类产品吗?Argon 的公告帖没有点名任何系列,没有预告 Pro,也没有预告 Ultra。第二条 gemini-4-*路径、第二个专栏或模型卡条目,都会在一天内推翻这一解读。这篇层级定位文章完整列出了这些反证。
Slutsatsen
Gemini 4 Argon är en äkta frontier-modell med en äkta benchmark-tabell och en äkta indexpoäng på 52,56 från Artificial Analysis — och det är inte en produkt, i den specifika bemärkelsen att det inte finns någon modellidentifierare, endpoint, modellkort, kontextfönster eller datum för allmän tillgänglighet för den, och både Googles egen dokumentation och tredjepartstjänsterna för mätning är överens om att exakt en leverantör hostar den. ”Gemini 4” i namnet är en generationsetikett; ”Argon” är den del som modellen är kopplad till. Om du väljer något att bygga på den här månaden, handlar beslutet inte om Argon: det handlar om Gemini 3.8 Flash som du kan anropa idag för $0.75 / $3.75 och frontier-modellerna i samma indexband som ligger på samma nyckel. Läs den här sidan igen när en gemini-4identifierare dyker upp i API-listan. Fram till dess är allt om Argon ett påstående som Google har gjort om en modell som ingen utanför den första kohorten kan adressera.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
