
Gemini 4 Argon op FrontierSWE: Het schreeuwt "Eureka!" en beoordeelt dan zijn eigen huiswerk
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 261 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- xAISpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
Gemini 4 Argon heeft een persoonlijkheidsprobleem, en het is het meest interessante dat iemand over het model heeft gezegd sinds Google het op 2026-09-30 aankondigde. Op de ultra long-horizon-benchmark FrontierSWE liet het model dat als derde eindigde — achter GPT-6 Astra en Claude Opus 5.5 — bij zijn beoordelaars een gedenkwaardige indruk achter: zijn favoriete woord is "Eureka!", en het besteedt een groot deel van het taakbudget van twintig uur eraan om uiterst streng voor zichzelf te zijn. Dat is een aan een lek grenzende observatie uit één bron van een benchmarkexploitant, geen claim van een leverancier en geen release-opmerking, en het is de moeite waard om precies te zijn over wat het je wel en niet vertelt. Aan geen van de drie bovenstaande modellen is een GA-datum voor Argon verbonden; de observatie gaat over gedrag binnen een testharnas, en de cijfers die erbij horen zijn de eerste onafhankelijke meting van Argon op een benchmark die Google niet zelf draait.
Wat de "Eureka!"-opmerking eigenlijk is
De bron is een post van @nrehiew_, een engineer die aan modelevaluatie werkt, gepubliceerd op 2026-09-30, waarin Sundar Pichai's aankondiging van Gemini 4 Argon wordt geciteerd. De kern bestaat uit drie beweringen: Argon is het vermakelijkste model dat ze op FrontierSWE hebben geëvalueerd; zijn favoriete woord is "Eureka!"; en het is extreem zelfkritisch. De poster beschrijft het als een grote verbetering ten opzichte van eerdere Geminis, terwijl die persoonlijkheid behouden blijft, en noemt het indrukwekkend.
Lees dat zorgvuldig, want het is makkelijk om er te veel in te lezen. Het is de indruk van één beoordelaar die naar agenttraces heeft gekeken, geen gescoord resultaat, geen gepubliceerde metriek, en niet iets waar Proximal Labs — de makers en beheerders van FrontierSWE — hun naam als bevinding aan hebben verbonden. Er is geen kolom "zelfkritiek" op het leaderboard. Wat de opmerking de moeite van het opschrijven waard maakt, is niet dat ze gezaghebbend is; het is dat het de enige kwalitatieve lezing is die iemand buiten Google over Argon heeft gegeven, en omdat het model niet algemeen beschikbaar is, zijn traces zoals deze momenteel de enige manier om het ding te zien functioneren.
Het komt ook uit bij een echte vraag voor iedereen die van plan is Argon als agent te draaien. Langetermijn-coderuns zijn grotendeels een kwestie van budgetbeheer: een model dat zichzelf onderbreekt om opnieuw te overwegen, dat zijn eigen tussentijdse werk beoordeelt en dat doorbraken aankondigt, is een model dat tokens aan proces besteedt. Of dat een kracht of een belasting is, hangt volledig af van de vraag of de zelfkritiek convergeert of in een lus blijft hangen. Eén enkele beoordelaar die "indrukwekkend" zegt, is een datapunt, geen antwoord.
FrontierSWE v2, en waarom de derde plaats het echte verhaal is
FrontierSWE is niet het soort benchmark waarvan je één headline-getal kunt aflezen. Het is gebouwd door Proximal Labs en wordt in hun repository beschreven als een ultra-langehorizonbenchmark voor coding-agents die implementatie, performance engineering en ML-onderzoek test. Versie 2 verscheen in september 2026 met 21 nieuwe taken bovenop de oorspronkelijke set, voor een totaal van 34, en verwacht dat een agent tot twintig uur blijft doorwerken. Alles loopt via Proximals eigen harness, proximus, die is gebouwd op mini-swe-agent en contextcompressie, visuele mogelijkheden en een expliciete submit-tool toevoegt. De scoring is mean@5 — het gemiddelde van vijf pogingen per taak — waarbij de gerapporteerde onzekerheidsband loopt van het gemiddelde van de slechtste run van elke taak tot het gemiddelde van de beste run.
Die methodologie is belangrijk om Argon's rij eerlijk te lezen:
• Score — Gemini 4 Argon 55,0% mean@5, ±9,9, tegenover GPT-6 Astra 65,5% en Claude Opus 5.5 62,3%
• Spreiding — Argon's runs variëren van 44,5% (slechtste@5) tot 64,3% (beste@5), een bereik dat aan de bovenkant overlapt met Opus 5.5's 52,0%–71,5% en nergens met Astra's 55,1%–73,0%
• Kosten per test — Argon $129,36, Opus 5.5 $98,87, Astra $1.029,65
• Kloktijd per trial — Argon 10,6 uur, Opus 5.5 14,2 uur, Astra 12,1 uur
Het eerste dat je opvalt, is dat Argon derde staat en qua score niet in de buurt van de tweede komt. Het tweede — het punt dat zou moeten bepalen of het je iets kan schelen — is dat Argon op deze benchmark strikt gedomineerd wordt door Claude Opus 5.5. Opus 5.5 scoorde hoger (62,3% vs. 55,0%) en kostte minder per testronde ($98,87 vs. $129,36). Er is hier geen enkele as waarop Argon wint. Het enige voordeel is tijd: 10,6 uur tegenover de 14,2 van Opus 5.5, wat reëel is als je betaalt voor kloktijd en niet voor tokens, en irrelevant als je betaalt voor een budget per testronde.
De eigen ranglijst van Proximal bevat een voetnoot bij de rij van Argon die iedereen die dit cijfer citeert, zou moeten herhalen: "Gemini 4 Argon: de cache-hitratio is veel lager door een niet-productie-instelling." Dat zijn de beoordelaars die ermee aangeven dat ze Argon hebben gedraaid buiten de configuratie die een productie-implementatie zou gebruiken, wat de kosten opdrijft en naar alle waarschijnlijkheid ook de latentie. Het is specifiek een voorbehoud bij het kostencijfer, en het is de reden dat de $129,36 als een bovengrens moet worden gelezen en niet als een tariefkaart.
Het getal dat Googles eigen grafiek niet toont
Dit is waar de bronvermelding echt interessant wordt, en waar de meeste artikelen over dit resultaat de fout in zullen gaan. Het aankondigingsbericht van Google bevat een benchmarkgrafiek met een rij voor FrontierSWE v2. In die rij staat GPT-6 Astra 65,5%, Claude Fable 5.1 56,3%, Claude Opus 5.5 62,3%. Gemini 4 Argon staat er niet in. De live ranglijst van Proximal toont Astra op 65,5% en Opus 5.5 op 62,3% — dezelfde cijfers — maar zet Claude Fable 5.1 op 56,5%, niet 56,3%, en vermeldt Gemini 4 Argon met 55,0%.
De reden voor de weglating is niet geheimzinnig, en Google zegt het zelf: de methodologische notities bij hun evaluatiesuite stellen dat FrontierSWE-resultaten worden gerapporteerd vanaf Proximals officiële openbare leaderboard. Google heeft deze benchmark niet zelf berekend. Ze citeren dezelfde derde partij als wij, en het enige Argon-cijfer dat die derde partij publiceert, is de 55,0%. De eerlijke lezing is dus dat Argons FrontierSWE-score een werkelijk onafhankelijke meting is — Proximal heeft die uitgevoerd, op hun harness, op hun taken — en dat die Argon achter twee concurrenten plaatst.
Al het andere in de grafiek van Google is door de leverancier gerapporteerd en moet je in je hoofd ook zo bestempelen: Argon 63,1% op de Vals Index tegenover 67,0% van Opus 5.5, 41,4% AutomationBench tegenover 42,5% van Opus 5.5, 89,6% Vibe Code Bench tegenover 90,3% voor zowel Astra als Opus 5.5, 87,5% LVBench tegenover 83,7%, 68,0% CWE-bench v1 tegenover 67,0% van Opus 5.5. Dat zijn de runs van Google op de door Google gekozen evaluaties. De FrontierSWE-rij is de enige in dat beeld die een lezer onafhankelijk kan controleren, en dat is precies waarom de derde plaats zwaarder weegt dan het patroon van gelijkspel of een kleine overwinning eromheen.
Wat Artificial Analysis onafhankelijk zegt
FrontierSWE is één lens. Artificial Analysis is de andere, en die komt overeen met de vorm van het verhaal. Op hun Intelligence Index v4.3.2 scoort Gemini 4 Argon in de configuratie met hoog redeneervermogen 52,56 — onafhankelijk gemeten op hun eigen hardware, niet gerapporteerd door Google — tegen een lijstprijs van $2,00 per miljoen inputtokens en $10,00 per miljoen outputtokens, met 95% korting op gecachte input. Hun instrumentatie stelt de kosten van een enkele indextaak op $1,99.
De vergelijking die ertoe doet, is dezelfde die FrontierSWE heeft geproduceerd. Claude Opus 5.5 scoort in zijn hoge configuratie hoger op de index, 53,58, tegen lagere kosten per taak, $1,82. Twee onafhankelijke beoordelaars, met verschillende taken en verschillende testharnassen, plaatsen Argon achter Opus 5.5 op zowel kwaliteit als kosten. Dat is een consistent signaal in plaats van een enkel benchmarkartefact, en het is het sterkste dat je momenteel kunt zeggen over de economie van Gemini 4 Argon.

Aangekondigd, niet uitgebracht — en waarom die framing geen haarkloverij is
Er bestaat geen model-ID Gemini 4 Argon. Toegang wordt uitgerold via het Fairwind Program naar gescreende cyberverdedigers, naast een gefaseerde openstelling voor betalende API-klanten en abonnees van Google AI Ultra, zonder gepubliceerde datum voor algemene beschikbaarheid. Googles bericht is een aankondiging van een model en een reeks evaluaties, niet de lancering van een endpoint dat je kunt aanroepen. Als je berichtgeving hebt gelezen die dit als een release beschreef, loopt die berichtgeving op de feiten vooruit.
Dat onderscheid heeft praktische gevolgen voor iedereen die het FrontierSWE-getal leest. De evaluatie werd uitgevoerd op een model waartoe Proximal via een of andere regeling toegang had; het vertelt je wat het model kan doen, niet wat jij kunt krijgen. Het betekent ook dat de prestatiecijfers een kortere halfwaardetijd dan gebruikelijk hebben. Een model dat nog niet algemeen beschikbaar is, kan nog veranderen — decoding-instellingen, systeemprompts, standaardinstellingen voor toolgebruik en veiligheidskaders worden allemaal nog afgesteld, en de opgegeven reden dat de cache-hitratio van Argon slecht was, is precies dat de evaluatoren geen productieconfiguratie gebruikten. Verwacht dat de 55,0% en de $129,36 gaan verschuiven.
Wat zou dit beeld veranderen: een gepubliceerde model-ID met een tariefkaart, een GA-datum, een FrontierSWE-rerun onder productie-instellingen, en een tweede onafhankelijke evaluator die het resultaat van de derde plaats reproduceert. Totdat ten minste de eerste twee daarvan bestaan, behandel je elk Argon-getal — inclusief de goede in Google's eigen grafiek — als voorlopig.

De persoonlijkheidsanalyse is het onderdeel dat het beste zal verouderen.
Benchmarkscores voor een pre-GA-model hebben een houdbaarheid van weken. De gedragsobservatie niet. Agentwerk met een lange horizon is waar het karakter van een model zich echt toont, omdat een budget van twintig uur met 34 taken genoeg touw is voor de neigingen van een model om zich te versterken: hoe het herstelt van een mislukte aanpak, of het stopt om opnieuw te plannen, of het het verschil kan zien tussen een moeilijk probleem en een verkeerde afslag. Een beoordelaar die veel van deze traces bekijkt en een model omschrijft als zelfkritisch en geneigd om uit te roepen wanneer iets werkt, beschrijft een model dat zijn redenering over zijn eigen voortgang externaliseert. Dat is een hypothese over waarom de runs van Argon uiteenlopen van 44,5% tot 64,3% — een bredere band dan die van Opus 5.5 — en die is testbaar zodra het model aanroepbaar is.
De andere helft van de opmerking is het deel waarover je sceptisch moet zijn. "Een grote verbetering ten opzichte van eerdere Geminis" is een vergelijking met modellen die nooit op deze benchmark een score hebben gekregen binnen deze harness, dus die kan helemaal niet aan het leaderboard worden getoetst. Het is een indruk, en die moet als zodanig worden behandeld, hoe geloofwaardig degene die hem naar voren brengt ook is.

Wat dit voor jou betekent als je vandaag echt een agent voor de lange termijn nodig hebt
Je kunt Gemini 4 geen Argon noemen, dus de praktische vraag is niet Argon versus wat dan ook — het is welk model je zou moeten draaien voor het werk waarop Argon is gebenchmarkt. De eigen rangschikking van FrontierSWE geeft daarop het antwoord: GPT-6 Astra staat bovenaan met 65,5%, maar tegen $1.029,65 per test, ongeveer tien keer de kosten van de twee modellen daaronder, terwijl Claude Opus 5.5 62,3% levert voor $98,87. De beste koop op deze benchmark is Opus 5.5, en het is ook het model dat Argon versloeg op Artificial Analysis tegen lagere kosten per taak.
Beide modellen, en het grootste deel van de top tien van het board — waaronder GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp en Muse Spark 1.2 — zijn routeerbaar via de enkele API van OrcaRouter naast meer dan 200 andere — één sleutel, 0% markup, dus de listprijs van de provider is wat je betaalt en een prijsverlaging van een leverancier komt dezelfde dag nog bij ons terecht. Die laatste eigenschap is meer dan gebruikelijk waard bij een pre-GA-model: als de prijsstelling van Argon verandert tussen nu en GA, wat de voetnoot over de non-productiecache suggereert, verandert er niets aan je integratie wanneer dat gebeurt. Automatische failover is het andere stuk dat bij dit specifieke geval past — een onbekend model waarvan nog niemand de faalmodi in kaart heeft gebracht, is precies wat je niet wilt op één hardgecodeerd productiepad.
Om één ding duidelijk te maken: Gemini 4 Argon staat niet in onze catalogus. Een opzoeking via onze publieke model-API voor google/gemini-4-argon retourneert "model not found", en niemand anders host het ook — het zit achter Google's Fairwind Program, zonder dat er een model-ID is gepubliceerd. Zodra het aanroepbaar is, zullen we het routeren, en de FrontierSWE-cijfers hierboven zijn de reden om naar die dag uit te kijken in plaats van erop te wachten. De modellen waartegen het verloor, zijn er al.
Wat te kijken
De signalen die dit van een wat-we-tot-nu-toe-weten in een beslissing zouden veranderen, zijn specifiek. Een gepubliceerde model-ID en de bijbehorende tariefkaart. Een datum voor algemene beschikbaarheid. Een FrontierSWE-rerun onder productie-instellingen, die zou uitmaken of de kosten van $129,36 per proef een reëel tarief zijn of een artefact van de cacheconfiguratie die Proximal aanstipte. En, idealiter, een tweede evaluator die Argon-traces publiceert, zodat de "Eureka!"-observatie ophoudt een steekproef van één te zijn.
Tot dan is de eerlijke samenvatting beperkt en de moeite waard om aan vast te houden: Gemini 4 Argon is aangekondigd, het is ongewoon expressief in langetermijn-agenttraces volgens één evaluator, en op de enige onafhankelijke benchmark die we kunnen controleren, eindigde het als derde achter twee modellen — waarvan er één het tegelijkertijd op score en kosten versloeg.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
