Hero-titelkaart met de tekst "Gemini 4 Argon — welke tree van de Gemini 4-ladder?", met een verticale ladder van vijf gerangschikte treden die Claude Opus 5.5 op 57,6, Gemini 4 Argon op 52,6, GPT-6 Astra op 52,7, Gemini 3.8 Flash op 40,9 en Gemini 3.1 Pro Preview op 29,7 vermeldt, een badge met de tekst "Geen Gemini 4 Ultra — de Ultra-pagina verwijst door naar een abonnementsplan", en een voettekst met de tekst "Indexcijfers volgens Artificial Analysis, revisie v4.3.2; Argon is op geen enkele openbare API aanroepbaar."
Guides & Insights

Gemini 4 Argon's trede in de Gemini 4-ladder — en waarom er geen G4 Ultra is

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het korte antwoord op de vraag waarmee dit stuk begon, is dat Gemini 4 Argon Google's topmodel is en niet zijn hoogste tier, omdat de tier erboven nog niet bestaat — en mogelijk niet in de vorm die iemand verwacht. Google heeft precies één Gemini 4-model gepubliceerd, Argon, en de enige first-party pagina op zijn eigen domein onder het pad /models/gemini/ultra/ is helemaal geen modelpagina: die verwijst door naar de Google AI-abonnementsplannen. Die redirect is het meest bruikbare feit in dit artikel, en het is met één regel vanaf een terminal te controleren. Al het andere hier gaat erover waar Argon werkelijk staat zodra je zijn prijs niet meer als tierlabel leest, maar als een getal.

Twee dingen zijn tegelijk waar, en ze zijn gemakkelijk met elkaar te verwarren. Argon is het meest capabele Gemini dat bestaat, en Argon is geen frontier-tier model. Het voert elk Google-model aan dat is uitgebracht, met een marge die zo groot is dat de vergelijking niet echt een vergelijking is, en op de Intelligence Index van Artificial Analysis scoort het binnen een fractie van een punt van twee concurrerende vlaggenschepen die zelf een volle vijf punten achter de huidige koploper staan. Google heeft het geprijsd alsof het één trede onder de frontier zit, en de onafhankelijke meting bevestigt dat. De prijs is dus geen marketingbeslissing die het model tekortdoet. Het is een nauwkeurige uitspraak over het model.

Dit is een stuk over wat we tot nu toe weten. Gemini 4 Argon werd aangekondigd op 30-09-2026 in een Google DeepMind-bericht dat aan Koray Kavukcuoglu wordt toegeschreven, en het wordt eerst uitgerold naar een genoemde groep cyberverdedigers via Google's Fairwind Program — niet naar ontwikkelaars, niet naar ondernemingen, niet naar consumenten, en niet naar wie dan ook met een creditcard. Het heeft geen model-ID in de Gemini API, geen endpoint en geen gepubliceerde prijs per token waartegen je gefactureerd kunt worden. Model-ID's, doorvoer en betrouwbaarheid gemeten op echt verkeer bestaan er niet voor, wat betekent dat de onderstaande meting één benchmarkrun van één lab is en niets meer. Waar een cijfer van Google afkomstig is, wordt het aangeduid als van Google; waar het van Artificial Analysis afkomstig is, wordt het aangeduid als van hen. Niets hierin moet worden gelezen als een bewering dat Argon een koopbaar product is.

De ladder die Google daadwerkelijk heeft uitgebracht, afgelezen van zijn eigen pagina's

De snelste manier om te antwoorden op “waar Argon staat in de line-up van Gemini 4” is om op te houden met vragen over de line-up en te beginnen met het opsommen van de modellen waarvoor Google pagina’s publiceert. Een line-up is een marketingconcept; een pagina is een feit. Dit is waar de first-party-paden op uitkomen per 1 oktober 2026.

• deepmind.google/models/gemini/pro/ geeft een 200-status terug en de titel luidt “Gemini 3.1 Pro — Google DeepMind”. De Pro-plek op Googles eigen site is nog steeds een model uit de 3.1-generatie.

• deepmind.google/models/gemini/flash/ geeft 200 terug en de titel is “Gemini 3.8 Flash — Google DeepMind”. De Flash-plek is drie keer opgeschoven — 3.5, 3.6, 3.7, 3.8 — terwijl de Pro-plek helemaal niet is opgeschoven.

• deepmind.google/models/gemini/argon/ geeft een 404 terug. Argon krijgt geen eigen pad per model. De thuisbasis is de familiepagina op deepmind.google/models/gemini/, de plek waar Google het model neerzet waarmee het momenteel vooroploopt.

• deepmind.google/models/gemini/ultra/ geeft een 302 terug en komt uit op one.google.com/about/google-ai-plans/, de pagina voor consumentenabonnementen. Hetzelfde geldt voor het oudere pad deepmind.google/technologies/gemini/ultra/. Een “Ultra” op het modellenpad van Google is een facturatielaag, geen checkpoint.

• deepmind.google/models/gemini/nano/ verwijst met een 301 naar de Gemini-familiepagina. Er is ook geen Nano-slot als zelfstandige modelpagina.

• deepmind.google/models/gemini/model-cards/ — de index die Google bijhoudt van elke modelkaart die het heeft gepubliceerd — bevat geen vermelding voor Argon en geen vermelding met “Gemini 4” in de naam. De nieuwste Gemini-rijen zijn 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite en 3.1 Pro. De kaartindex is het traagst veranderende document in deze set, dus het zwijgen ervan is geen bewijs dat Argon nooit een kaart zal krijgen; het is bewijs dat het papierwerk de aankondiging nog niet heeft ingehaald.

• deepmind.google/models/, de modelindex, vermeldt “Gemini 4 Argon” als de flagship-kaart met de tagline “Ons volgende tijdperk van frontier-intelligentie”, direct boven “Gemini 3.8 Flash — Beste voor het aanpakken van complexe agentische taken op schaal”. Twee Gemini-kaarten, met één generatie verschil, in die volgorde.

Als je die dingen combineert, is de vorm van de ladder niet dubbelzinnig. Het publieke modelaanbod van Google heeft momenteel één vermelding op de Gemini 4-trede, één vermelding op de Gemini 3.8-trede, een verouderde Pro-trede drie en een halve generatie terug, en niets daarboven. Het woord “Ultra” op het domein van Google verwijst naar een abonnement. Er is geen Gemini 4 Pro-pagina, geen Gemini 4 Flash-pagina, geen Gemini 4 Ultra-pagina en geen Gemini 4-modelkaart. Google kondigde een model aan, geen familie.

Bestaat er een Gemini 4 Ultra? Het bewijs, en wat het zou weerleggen

Dit verdient een eigen sectie, omdat het het deel van de vraag is dat over een week waarschijnlijk anders zal worden beantwoord, en omdat het eerlijke antwoord een houdbaarheidsdatum heeft.

Het negatieve bewijs is specifiek, niet vaag. Een 302 op het Ultra-pad naar de pagina met abonnementsplannen is geen zacht signaal; het is een redirect die Google's eigen webteam heeft geconfigureerd. Meerdere blog.google URL-patronen voor een Gemini 4 Ultra-bericht geven een 404 — het productenpad, het pad innovation-and-ai models-and-research, en het gewone aankondigingspad. De Ultra-naamgeving heeft hier precedent, en dat precedent pleit tegen een Gemini 4 Ultra. Google's oorspronkelijke Gemini-aankondiging introduceerde Gemini 1.0 "geoptimaliseerd voor drie verschillende formaten: Ultra, Pro en Nano", waarbij Gemini Ultra werd beschreven als "ons grootste en meest capabele model". Een lanceringsbericht dat drie formaten noemt, is hoe een familieaankondiging eruitziet. Argon's bericht noemt één model en helemaal geen zustermodellen. Google heeft de modelnaam Ultra later laten varen ten gunste van numerieke niveaus en het woord naar de abonnementskant van het bedrijf verplaatst, waar het nu het hoogste consumentenplan aanduidt. Een modelpagina die doorverwijst naar een plannenpagina is hoe een uitgefaseerde modelnaam eruitziet wanneer de marketingsite eromheen is opgeschoond.

Er staat ook niets in de aankondiging dat een grotere broer of zus in het vooruitzicht stelt. De Argon-lanceerpost beschrijft Argon als “ons nieuwe frontiermodel” en beschrijft de gefaseerde uitrol, het werk aan veiligheidsmaatregelen en de interne implementaties, en stopt daar. Er wordt niet gezegd dat het “de eerste in de Gemini 4-familie” is, er wordt geen vooruitblik gegeven op een Pro of een Ultra, en er wordt geen opvolger genoemd. De eigen framing van Google behandelt Argon als hét ding, niet als de kleine.

Wat de conclusie zou weerleggen, is gemakkelijk te benoemen en de moeite waard om op te letten, want elk van deze zou het binnen een dag laten omslaan.

• Een 200 op deepmind.google/models/gemini/ultra/ die een modelpagina weergeeft in plaats van de plannenpagina, of een nieuw models/gemini/ subpad dat naast pro en flash.

Een Gemini 4 Ultra-rij die op de index van modelkaarten verschijnt, wat voor Google historisch gezien de manier is om te bevestigen dat een model als gedocumenteerd artefact bestaat.

• Een tweede model-ID in de Gemini API in de gemini-4-*naamruimte. Argon heeft er momenteel geen, dus een Pro- of Ultra-ID zou het eerste bewijs zijn dat de familie echt bestaat.

• Een vermelding in de modellenlijst van Artificial Analysis, of een benchmarktabel op de familiepagina met een vierde kolom. Beide volgen de releases van Google nauwlettend genoeg om er vroeg bij te zijn.

• Een aankondigingspost van Google I/O, Cloud Next of DeepMind waarin het woord “family” wordt gebruikt met betrekking tot Gemini 4. De post van Argon doet dat niet.

Totdat ten minste één daarvan gebeurt, is een stuk dat beweert dat er een Gemini 4 Ultra aankomt een voorspelling in de kleren van een verslag. Behandel het als zodanig, ook als het van ons afkomstig is.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

De prijsladder lezen als een uitspraak over tiers

Prijsstelling is het enige onderdeel hiervan dat Google met opzet heeft gepubliceerd, met een voetnoot, en het is de duidelijkste uiting van de beoogde tier-indeling in de hele lancering. De introductieprijs van Argon is $2 per miljoen inputtokens en $10 per miljoen outputtokens, met 95% korting op cached input, en Google's eigen voetnoot één zegt dat na een introductieperiode die het niet kon definiëren, “de prijs van $4 per 1M inputtokens en $20 per 1M outputtokens zal gelden.”

Lees die twee paren af tegen het veld en de tier-claim schrijft zichzelf.

• $4 / $20 is de lijstprijs van Claude Opus 5.5. Het na-introductietarief van Google voor Argon komt exact overeen met de tarievenkaart van de huidige frontier-leider, voor een model dat vijf punten achterblijft bij die leider.

• $2 / $10 is de promotionele prijsband die zowel GPT-6 Sol als Claude Sonnet 5.5 bezetten. Het introductietarief van Argon is hetzelfde $2 / $10, waardoor de introductieprijs van Argon in dezelfde prijsband terechtkomt als een mid-tier Sol, in plaats van in de frontier-band.

• Op $10 / $50 zitten Claude Fable 5.1 en GPT-6 Astra beide. Argon is een vijfde van de inputprijs van Fable 5.1 en een vijfde van diens outputprijs, en het scoort binnen 0,8 van die van Fable 5.1.

• $0,75 / $3,75 is Gemini 3.8 Flash. Argon is op input 2,7× dat en op output 2,7× — een nette stap omhoog, geen afgrond.

Google heeft Argon dus geprijsd als een model dat onder $10/$50 en boven $0,75/$3,75 thuishoort, met een uiteindelijke rustpositie op $4/$20. Niets aan die ladder zegt ‘frontier’. Die zegt: ‘top van de middenband, met een hoofdtarief dat zal uitkomen op hetzelfde tarief dat de leider vandaag rekent, voor minder capaciteit.’ Dat is een verdedigbare commerciële keuze. Het is niet de prijsstelling van een model dat twee niveaus hoger is gepositioneerd dan wat dan ook.

Eén structureel punt om mee te nemen: de prijsstap van Argon is een echte stap, gedefinieerd in een voetnoot, en niet gedateerd. De families Sonnet 5.5 en GPT-6 doen iets vergelijkbaars met niveaus voor lange context, en Sol gaat naar $4/$15 boven 272K. De stap van Argon is gebaseerd op tijd, niet op contextlengte — dezelfde $2/$10 geldt voor het hele 1M-venster en alleen de kalender verandert het tarief. Dat is een ongebruikelijke vorm en het maakt elke kostenvergelijking met Argon tot een oefening met twee kolommen: welke periode, en welk gebruik.

Waar Argon staat tegenover de rivalen, op de cijfers die bestaan

Artificial Analysis had een meting van Gemini 4 Argon snel genoeg beschikbaar dat het de enige onafhankelijke meting is die beschikbaar is. In de revisie die op 1 oktober actueel was — v4.3.2 — scoort Argon 52,56 op de Intelligence Index, geconfigureerd op hoge redeneerinspanning. De modellen eromheen vormen geen willekeurige steekproef uit het veld.

• Claude Opus 5.5 staat op 57,62, gemeten bij maximale inspanning met fallback. Dat is vijf punten boven Argon, en het is de huidige koploper op het scorebord.

• Claude Fable 5.1 staat op 53,35, gemeten bij maximale inspanning met fallback. Argon staat 0,79 achter.

• GPT-6 Astra staat op 52,67, gemeten op max. Argon ligt 0,11 achter.

• Claude Sonnet 5.5 staat op 55,98, ook het maximum met fallback. Dat is een model uit de middenklasse dat 3,4 punten hoger scoort dan Argon, en het is het cijfer dat iedereen die naar “Gemini 4 Argon is het op een na beste model ter wereld” grijpt, zorgen zou moeten baren.

• GPT-6 Sol staat op 47,63, gemeten bij maximaal, op een contextvenster van 872K. Argon ligt 4,9 voor.

• Gemini 3.8 Flash staat op 40,93 bij hoge inspanning. Argon staat 11,6 hoger.

• Gemini 3.1 Pro Preview staat op 29,72. Argon staat 22,8 punten voor, wat in één enkele uitspraak het duidelijkst weergeeft hoe ver het Pro-tier dat Google uitbrengt achterop is geraakt bij zijn eigen onderzoek.

Uit die lijst komen drie dingen naar voren. Ten eerste staat Argon op gelijke hoogte met de twee uitdagers, Fable 5.1 en Astra, en duidelijk achter twee Anthropic-modellen — Opus 5.5 en, nog ongemakkelijker, Sonnet 5.5. Ten tweede is het gat tussen Argon en het beste model dat Google zelf heeft uitgebracht de grootste generatiesprong in de huidige line-up, met afstand. Ten derde klopt de framing van het signaal dat ‘de frontier minstens twee niveaus voorligt’ inhoudelijk, maar klopt die qua geometrie net niet helemaal: er is één modelniveau dat duidelijk op Argon voorloopt (Opus 5.5 op 57.6) en een tweede model in een goedkoper niveau dat er ook op voorloopt (Sonnet 5.5 op 56.0), wat een scherper probleem is dan twee treden lager staan op een ladder waar Argon eigenlijk op staat.

De prijsvergelijkingsframing in de oorspronkelijke vraag — “prijzen suggereren dat dit hun Sol/Sonnet-equivalent is” — blijkt ongeveer te kloppen voor de introductieprijs en niet voor de uiteindelijke prijs. Argon opent tegen het tarief van Sol en Sonnet 5.5 en komt uit op dat van Opus 5.5. Het is geprijsd als een mid-tier model dat van plan is een frontier-geprijsd model te worden, terwijl het op geen van beide niveaus meet.

Het beeld van de kosten per taak is waar Argon het sterkst is en waar het tierverhaal een tweede dimensie krijgt. Op de Index-taak kost Argon $1,99 en genereert 142.374 outputtokens. Opus 5.5 kost $5,98 en genereert 338.099. Sonnet 5.5 kost $7,62 voor 599.849. Fable 5.1 kost $7,63 voor 187.455. Astra kost $3,26 voor 68.691. Gemini 3.8 Flash kost $1,24 voor 154.230. Argon is de goedkoopste manier om een score te kopen die aan de frontier grenst, en het is minder dan een dollar per taak goedkoper dan het Flash-model dat qua score boven Argon staat.

Effort-instellingen zijn het voorbehoud bij alles hierboven en het veld rapporteert ze niet uniform. Argon wordt gemeten op high; Opus 5.5, Fable 5.1 en Sonnet 5.5 op max met fallback; Astra en Sol op max. Een high-effort-run en een max-effort-run zijn niet dezelfde meting, en de effort-ladder van Anthropic zelf verplaatst een model meerdere punten tussen instellingen. Als Argon, gemeten op max effort, wezenlijk boven 52,6 scoort, verandert het tierargument. Niemand heeft die run nog gepubliceerd.

Wat Googles eigen tabel beweert, en hoe die verschilt van de onafhankelijke

De Gemini-familiepagina bevat een door Google opgestelde prestatietabel met vier kolommen — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — en negentien benchmarkrijen. Het is de meest gedetailleerde reeks claims die Google voor dit model heeft gepubliceerd, en deze is van begin tot eind door de leverancier gerapporteerd. Het lezen ervan naast de onafhankelijke Index is juist leerzaam omdat de twee het niet eens zijn over de vorm van het veld.

• In de tabel van Google wint Argon dertien van de negentien rijen op eigen kracht of deelt het de eerste plaats, waaronder Vals Index Knowledge work met 68,9, AutomationBench met 51,3, Harvey’s Legal Agent Benchmark met 19,6, DeepSWE v1.1 met 77,9, LABBench 2 met 88,8, GraphWalks met 99,7 voor de band ≤128K en 84,2 voor de band 256K–1M, Agent’s Last Exam met 39,5, LVBench met 91,7 en Chartography met 71,6.

• Claude Opus 5.5 wint de rijen die aanvoelen als volgehouden engineering: FrontierSWE v2 met 62,3 tegen Argon’s 55,0, Terminal-bench 4.0 met 66,4 tegen 57,4, Terminal-Bench Science 0.1 met 63,3 tegen 57,6, en PostTrainBench met 49,3 tegen 45,3.

GPT-6 Astra haalt 68,1 op Terminal-Bench Science 0.1 en 72,6 op de offline subset van OSWorld-2.0, en evenaart Argon op CWE-bench v1 met 68,0. Claude Fable 5.1 verliest elke rij, behalve een gedeeld gelijkspel op Vibe Code Bench.

• Op de onafhankelijke Index is de volgorde als volgt: eerst Opus 5.5, dan Sonnet 5.5, dan Fable 5.1, en dan Argon en Astra vrijwel gelijk. De tabel van Google heeft helemaal geen kolom voor Sonnet 5.5, wat de meest ingrijpende weglating erin is: de vier kolommen van de tabel zijn gekozen, en het model dat Argon op de Index voorbijstreeft tegen een lagere prijs, staat er niet tussen.

Niets daarvan maakt de tabel van Google oneerlijk. Benchmarktabellen van leveranciers zijn geselecteerd, niet steekproefsgewijs samengesteld, en die van elk lab ook. Het maakt er een bewering van in plaats van een meting, en het betekent dat de tier-vraag er niet mee kan worden beslecht. De enige plek waar de tabel voor dit artikel echt dragend is, is het negatieve: negentien rijen, vier kolommen, en geen vijfde kolom voor een Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Het enige aan Argon dat helemaal geen tierkwestie is

Elk argument per tier hierboven gaat ervan uit dat Argon een model is dat je uiteindelijk kunt aanroepen. Het is de moeite waard dat te scheiden van de positioneringsvraag, want die twee hebben verschillende antwoorden en slechts één ervan gaat over capaciteit.

De outputtokenlimiet van Argon is 1 miljoen tokens, tegenover 64K eerder, en Google zegt dat direct. Dat is een uitvoerplafond, geen contextvenster. Het onderscheid is belangrijk omdat de twee in de berichtgeving over deze lancering voortdurend door elkaar worden gehaald, en omdat een uitvoerlimiet van 1M een andere technische claim is dan een contextvenster van 1M — het eerste gaat erover hoe lang één enkele trajectorie kan lopen, het tweede over hoeveel je het model in één keer kunt geven. Google is expliciet geweest over de uitvoerlimiet en zwijgt over het contextvenster. Artificial Analysis registreert ook 1.000.000 tokens voor Argons context, maar dat is het veld van de tracker en niet een uitspraak van Google, dus beschouw de twee cijfers als afkomstig uit verschillende kamers, ook al lezen ze hetzelfde.

Wat ondubbelzinnig niet beschikbaar is, is toegang. Argon is niet algemeen beschikbaar, het zit niet in de Gemini API onder welke identifier dan ook, en het is niet opgenomen in enige catalogus van derden. Het is beschikbaar voor gescreende cyberverdedigers via het Fairwind Program en voor de eigen ingenieurs van Google, en aan de volgende fase die Google noemt — “te beginnen met betalende API-klanten en abonnees van Google AI Ultra” — is geen datum verbonden. Je kunt het niet benchmarken op je eigen workload. Elk cijfer in dit artikel is daarom de meting van iemand anders van een model dat je niet kunt gebruiken.

Wat zou Argon een trede hoger brengen?

Een tier-beoordeling is een momentopname, en er zijn ongeveer vijf dingen die deze zouden veranderen, in grove volgorde van hoeveel ze zouden uitmaken.

• Een onafhankelijk gemeten run op maximale inspanning. Argon is momenteel een meting bij hoge inspanning van 52,56. Anthropic's eigen inspanningsladders verplaatsen een model meerdere punten tussen instellingen, en als Google's model zich op max vergelijkbaar gedraagt, is Argon's werkelijke positie tegenover Fable 5.1 en Astra beter dan dit artikel zegt. Dit is de meest waarschijnlijke verandering.

• Een tweede meetbron. Eén tracker is één meting. Een tweede onafhankelijk lab dat Argon op zijn eigen meetomgeving beoordeelt, zou meer doen voor de tierclaim dan welke extra benchmarkrij van Google dan ook.

• Een Gemini 4 Pro. Als Google de Pro-trede van de 4-generatie onder Argon opent, wordt de line-up een familie met een duidelijke vorm, is Argon niet langer “de enige” maar “de top van drie”, en moet elk argument in dit stuk over een ontbrekende familie worden herschreven. Iets om in de gaten te houden, en dichterbij dan de Ultra-kwestie.

• Een prijs die niet stijgt. Als de introductieperiode simpelweg nooit afloopt — Google heeft niet gedefinieerd wanneer die eindigt — is de effectieve rustprijs van Argon $2/$10 in plaats van $4/$20, en wordt het voordeel van Argon in kosten per taak ten opzichte van Opus 5.5 groter, van ruwweg 3× naar ruwweg 6×. Dat is een commerciële gebeurtenis, geen capaciteitsgebeurtenis, maar het verandert hoe een inkoopbeslissing eruitziet.

• Een Argon-modelkaart, systeemkaart of pagina met evaluatiemethodologie. De prestatietabel linkt naar een methodologiepagina op het domein van Google; een volledige modelkaart zou het contextvenster, de deploymentconfiguratie en de veiligheidsenvelop openbaar vastleggen, en zou het eerste artefact zijn waarmee iemand buiten het Fairwind-cohort de cijfers van Google kan controleren in plaats van ze te lezen.

Omgekeerd is wat Argon het waarschijnlijkst zou laten zakken helemaal geen benchmark. Het is het Bloomberg-artikel van 30 september, waarin Google-medewerkers met toegang tot het model worden geciteerd die zeggen dat het minder goed presteert op echt werk dan zijn scores suggereren. Die bewering is door niemand buiten Google geverifieerd en het is geen meting, maar het is wel het soort bewering dat een tweede onafhankelijke benchmark ofwel zou bevestigen ofwel zou weerleggen. Tot dan staat ze in het dossier als een beschuldiging met een genoemde nieuwsbron en anonieme bronnen, en ze hoort thuis in de tierdiscussie, want een model waarvan de kloof tussen benchmark en praktijk betwist wordt, kan niet op basis van benchmarks alleen worden gepromoveerd.

Wat dit betekent als je deze maand een model kiest

Ontdaan van het positioneringsargument is het praktische plaatje eenvoudig genoeg om in één alinea te vatten. Gemini 4 Argon is de beste Gemini die Google heeft gebouwd, en die is niet voor jou beschikbaar, dus de Google-modellen waar je vandaag daadwerkelijk uit kunt kiezen, zijn de modellen die al zijn uitgebracht: Gemini 3.8 Flash, die 40,93 scoort op de Index voor $0,75/$3,75, en Gemini 3.1 Pro Preview, die 29,72 scoort voor $2/$12. Als je nu een Gemini nodig hebt, is dat de echte keuze, en Argon zit daar niet bij.

Als je tussen leveranciers kiest in plaats van binnen Google, verandert de aankondiging van Argon niets aan de beslissing van vandaag. Bovenaan de Index staat Claude Opus 5.5 met 57,62, met Claude Sonnet 5.5 op 55,98 vlak daarachter, tegen een vijfde van het tarief voor input en de helft voor output. Gemini 4 Argon met 52,56 heeft geen route naar jouw applicatie, dus het is geen kandidaat, hoe goed de score uiteindelijk ook blijkt te zijn.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter is één enkele API vóór meer dan 200 modellen met de lijstprijzen van providers één-op-één doorgegeven zonder mark-up en automatische failover tussen providers, wat betekent dat de beslissing om van model te wisselen geen enkele aanpassing van de infrastructuur vereist: het id in de request body is de enige wijziging. De Google-modellen in onze catalogus vandaag zijn de modellen die Google daadwerkelijk heeft uitgebracht — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash en google/gemini-3.1-pro-preview. Gemini 4 Argon is daar niet één van en zal dat ook niet zijn zolang er geen openbare model-ID en geen gepubliceerde prijslijst is, dus niemand zou een routeringsclaim moeten lezen in wat hierboven staat. Wanneer Google Argon op een API zet met een ID, wordt het een routeringsvraagstuk. Tot dan is de eerlijke versie van het OrcaRouter-antwoord dat het nog niet van toepassing is, en het nuttige dat de catalogus voor deze specifieke beslissing doet, is dat je de modellen die daadwerkelijk aanroepbaar zijn naast elkaar kunt prijzen zonder vier accounts te hoeven openen om erachter te komen.

De bottom line

Gemini 4 Argon is het vlaggenschip van Google en niet zijn frontier-model. Het scoort 52,56 op de v4.3.2 Index van Artificial Analysis bij hoge inspanning — gelijk aan Claude Fable 5.1 en GPT-6 Astra, vijf punten achter Claude Opus 5.5, en achter Claude Sonnet 5.5, een goedkoper model van een concurrerend lab. Google zette de introductieprijs op $2/$10, oplopend naar $4/$20, waarmee het uiteindelijke tarief exact uitkomt op dat van Claude Opus 5.5 voor meetbaar minder capaciteit. De voorsprong van 11,6 punten op Gemini 3.8 Flash is de grootste generatiekloof in Googles eigen line-up en het sterkste bewijs dat de Gemini 4-generatie een echte stap vooruit is en geen rebadge.

Over de vraag die dit alles opriep: er is geen Gemini 4 Ultra. Google’s Ultra-pad op zijn eigen domein verwijst door naar een pagina met abonnementsplannen, de modelcards-index bevat helemaal geen vermelding van Gemini 4, elk URL-patroon voor een aankondiging van een Gemini 4 Ultra-post geeft een 404, en de lanceringspost kondigt één model aan zonder een familie te beloven. Dat is een echte bevinding en het is first-party bewijs in plaats van een gevolgtrekking, maar het is ook een feit met een korte halfwaardetijd — één enkele 200 op één pad keert het om, en de Pro-trede van de Gemini 4-generatie is degene die waarschijnlijk het eerst zal verschijnen.

Twee kanttekeningen om uit dit stuk mee te nemen. Elk Argon-getal hier is de meting van iemand anders van een model dat niemand buiten een gescreend cohort cyberverdedigers kan aanroepen, en Googles eigen tabel met negentien rijen is een claim, geen meting — nuttig voor wat het is, en geen vervanging voor de onafhankelijke Index. En het eerlijke oordeel over de tier-kwestie is voorlopig: Argon wordt bij hoge inspanning gemeten, niet bij max, en een run met maximale inspanning is de goedkoopst mogelijke manier waarop dit artikel ernaast kan zitten.

Vergeleken in dit artikel4

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt