
Gemini 4 Argon vs Claude Opus 5.5: de benchmarkkloof die niemand had verwacht
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 223 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Gemini 4 Argon en Claude Opus 5.5 zijn het er niet over eens wie beter is, en dat meningsverschil is geen ruis. Op de Intelligence Index van Artificial Analysis liggen de twee vijf punten uit elkaar in het voordeel van Opus 5.5. Op de Vals Index — de GDP-gewogen ranglijst voor economische impact — staat Gemini 4 Argon op nummer één en Claude Opus 5.5 op nummer drie, achter zowel Argon als Claude Sonnet 5.5. Beide ranglijsten maten dezelfde twee modellen in dezelfde week. Dat is het hele artikel: welke je moet kiezen hangt ervan af of je werk meer op een examenvraag lijkt of op een dinsdag op een advocatenkantoor, en of je überhaupt API-toegang tot Argon hebt, wat op dit moment bijna niemand heeft.
Google kondigde Gemini 4 Argon aan op 2026-09-30 in een DeepMind-post die op naam staat van Koray Kavukcuoglu, SVP voor Google DeepMind en Chief AI Architect. Anthropic bracht Claude Opus 5.5 acht dagen eerder uit, op 2026-09-22. Een van deze twee is een GA-release die je vanmiddag kunt aanroepen. De andere is een gefaseerde uitrol naar een genoemd cohort cyberverdedigers plus de eigen engineers van Google, met de uitgesproken intentie om "betalende API-klanten en abonnees van Google AI Ultra" te bereiken zodra de guardrails gereed zijn, en zonder dat daaraan een datum is verbonden.
Het antwoord in één regel, vóór het detail
Als je vandaag het best gemeten algemene redeneervermogen nodig hebt en je hebt het op een productiesleutel nodig, is Claude Opus 5.5 nu beschikbaar op OrcaRouter, en Gemini 4 Argon staat op geen enkele publieke API. Als je bouwt voor financiële, juridische, fiscale of codingagents die worden beoordeeld op economische output per dollar, zijn Argons cijfers beter en is de prijs per taak een vijfde van die van Opus 5.5 op het enige board dat precies dat meet. Als je werkt in cyberbeveiligingsdefensie voor kritieke infrastructuur, heeft Argon een programma waarvoor je je kunt aanmelden en het antwoord zou wel eens ja kunnen zijn.
Waar elk getal eigenlijk vandaan komt
Twee indexboards, twee methodologieën, en het loont om precies te zijn over welke welke is, want de twee kampen zullen maandenlang langs elkaar heen citeren.
• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 op 57,6 en Gemini 4 Argon op 52,6, beide afgelezen van Artificial Analysis op 2026-09-30. Dit is een samengestelde index van tien evaluaties, bewust algemeen qua taken, en het is het overzicht waarnaar de meeste mensen verwijzen als "de" ranglijst.
• Vals Index, bijgewerkt op 2026-09-29 — Gemini 4 Argon op de eerste plaats met 68,90% (±0,97), Claude Sonnet 5.5 tweede met 67,04% (±0,92), Claude Opus 5.5 derde met 66,97% (±0,89). Vals weegt financiële, programmeer-, juridische en fiscale taken op basis van het aandeel van elke sector in het Amerikaanse bbp, dus een model dat middelmatig is in puzzels maar uitstekend in contractbeoordeling en spreadsheetwerk, scoort hier goed.
Een verschil van vijf punten op AA is reëel en het is niet klein. Een verschil van twee punten op Vals is ook reëel, en met de betrouwbaarheidsintervallen die op het leaderboard staan, is Argon met 68,90 ±0,97 tegen Opus 5.5 met 66,97 ±0,89 een afstand van ongeveer 1,5 standaardfouten — beter dan een muntworp, maar niet overweldigend. Geen van beide boards is fout. Ze meten verschillende taken.

Eén configuratiekanttekening, en die pleit tegen het interpreteren van het AA-verschil als een zuivere modelvergelijking. Artificial Analysis zet Gemini 4 Argon in de grafiek op zijn hoge inspanningsinstelling en Claude Opus 5.5 op "Adaptive Reasoning, Max Effort, Default Fallback". Dat zijn niet hetzelfde punt op de twee inspanningsladders, dus de kop van 57,6 tegenover 52,6 is geen vergelijking van appels met appels bij gelijke redeneerbudgetten. Het is het getal dat beide pagina's publiceren, en het is het getal dat je moet citeren als je eerlijk wilt zijn tegenover Anthropic, maar het is geen gecontroleerd experiment.
De kosten per taak zijn waar de kloof ongemakkelijk wordt.
Artificial Analysis publiceert ook een verantwoording van wat het kostte om zijn indexsuite te draaien, en hier liggen de twee modellen niet dicht bij elkaar.
• Kosten per indextaak — Gemini 4 Argon $ 1,99 versus Claude Opus 5.5 $ 5,98.
• Kosten om de hele indexsuite te draaien — Gemini 4 Argon $2.407 versus Claude Opus 5.5 $8.708.
• Lijstprijs per miljoen tokens — Gemini 4 Argon $2 in / $10 uit (het door Google opgegeven introductietarief, met 95% korting op gecachte invoer, dus $0,10) tegenover Claude Opus 5.5 $4 in / $20 uit.
• Doorvoer — Gemini 4 Argon 48,9 uitvoertokens per seconde, eerste token na 2,79 seconden; Claude Opus 5.5 92,2 uitvoertokens per seconde, maar een latentie van 702 seconden tot het eerste token op dezelfde testopstelling — de prijs voor uitgebreid denkwerk die hier openlijk zichtbaar wordt.
• Valse kosten per run — Gemini 4 Argon $15,68 tegen Claude Opus 5.5 $32,14 op dezelfde GDP-gewogen takenreeks.
Er is een complicatie die het waard is om aan te stippen in plaats van te verdoezelen: de ranglijst van Vals vermeldt de tarieven van Argon als $4 in / $20 uit, terwijl de aankondiging van Google $2 in / $10 uit vermeldt voor de introductieperiode. De meest waarschijnlijke interpretatie is dat Vals een standaard lijsttarief weergeeft en Google een promotietarief, maar dat is een gevolgtrekking en geen gepubliceerde verklaring van een van beide partijen. Als uw budget van dat cijfer afhangt, vraag het dan aan Google.
Wat Argon beweert en wat is gecontroleerd

De post van Google staat vol cijfers en elk ervan is door de leverancier gerapporteerd. Voor zover ik kan nagaan, is geen enkele onafhankelijk gereproduceerd, en de onafhankelijke benchmarks hierboven meten andere dingen dan degene die Google als hoofdpunt heeft gekozen. Weergegeven als Google's eigen beweringen:
• DeepSWE v1.1 — 77,9%, beschreven als een nieuwe state of the art voor software-engineering op lange termijn in de echte wereld.
• LVBench langvideo-begrip — 91,7%, beschreven als state-of-the-art.
• AutomationBench (Zapiers benchmark voor end-to-end bedrijfstaken) — rang #1 met 51,3%.
• CWE-bench v1 remediatie van kwetsbaarheden — gedeeld eerste op 68%, voortbouwend op het resultaat van Gemini 3.8 Flash Cyber op het v0-bord.
• Gray Swan Indirect Prompt Injection — beschreven als toonaangevend, zonder dat er een cijfer in het bericht is gepubliceerd.
• Vals Finance Agent v2 en Harvey's Legal Agent Benchmark — beschreven als toonaangevend, eveneens zonder een afgedrukt nummer in de aankondiging.
De twee families claims die wél onafhankelijke ondersteuning hebben, zijn het meest te vertrouwen: Vals bevestigt de indexpositie met een cijfer en een interval, en Artificial Analysis bevestigt een index van 52,6 en de prijs. De anekdotes over interne productiviteit — een verbetering van 40% ten opzichte van een gepubliceerde baseline op een kwantumsubroutine, meer dan 300 TiB geheugen vrijgemaakt in de vloot van Google door Argon-agenten — zijn bedrijfsinterne resultaten zonder externe test, en moeten als zodanig worden gelezen.
Wat Opus 5.5 is, als je onder een steen hebt geleefd
Claude Opus 5.5 is het vlaggenschip van Anthropic: 1M-token context, 128K maximale output, multimodale input voor tekst, afbeelding en bestand, extended thinking, toolgebruik en gestructureerde outputs. Het is sinds 2026-09-22 de opvolger van Claude Opus 5, en het grote nieuws bij de lancering was misschien wel de prijsverlaging — het tarief ging omlaag in plaats van omhoog, naar $4/$20 met gecachte reads tegen $0,20. Het is vandaag routeerbaar op OrcaRouter tegen precies dat tarief, waarbij de lijstprijs van de provider wordt doorgegeven met nul opslag, en een prijswijziging van een leverancier komt bij ons dezelfde dag aan als bij hen.
Op de scores op taakniveau die beide modellen hebben, is het beeld een echte wipwap in plaats van een eenzijdige overwinning:
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% versus Gemini 4 Argon 57,1%.
• SciCode — Claude Opus 5.5 66,9% versus Gemini 4 Argon 61,8%.
• Het laatste examen van de mensheid — Claude Opus 5.5 61,4% tegenover Gemini 4 Argon 57,1%.
• Redeneren met een lange context — Claude Opus 5.5 84,7% versus Gemini 4 Argon 79,7%.
• CritPt — Claude Opus 5.5 31,7% tegenover Gemini 4 Argon 27,1%.
• Alwetendheid — Claude Opus 5.5 46,4 versus Gemini 4 Argon 42,4.
• GDPval — Claude Opus 5.5 1.846 versus Gemini 4 Argon 1.611.
• AutomationBench-AA — Gemini 4 Argon 77,5% versus Claude Opus 5.5 69,5%. Dit is de enige head-to-head taakscore waarop Argon duidelijk wint, en het is ook de taakfamilie die het dichtst in de buurt komt van wat de Vals Index beloont.
Het patroon is dus consistent: Opus 5.5 loopt voorop op de academisch getinte redeneerladder, en Argon loopt voorop bij end-to-end taakuitvoering. Dat is niet langer een tegenstelling tussen de twee ranglijsten. Het is dezelfde bevinding, tweemaal uitgedrukt.
De capaciteit waar niemand op vergelijkt
Het uitvoerplafond van Gemini 4 Argon is 1.000.000 tokens in één enkel traject, tegenover 64K voor de vorige generatie. Claude Opus 5.5 beperkt de uitvoer tot 128K. Beide hebben een contextvenster van 1M tokens, maar context en uitvoer zijn verschillende budgetten, en dit is de grootste enkele specificatiesprong in de aankondiging.
Of dat van belang is, hangt volledig af van wat je draait. Een outputplafond van 128K is royaal voor chat, code review, gestructureerde extractie en agentstappen. Het is een harde grens voor het genereren van een volledige migratiepatchset, een volledig auditrapport of een lang document in één keer — de workflows die Google koos om de lancering mee te illustreren. Als je pipeline twintig aanroepen aan elkaar schakelt om onder een limiet te blijven, bespaart het plafond van Argon je latentie en orchestratiecode. Als dat niet het geval is, betaal je voor overcapaciteit die je niet zult gebruiken.
Beschikbaarheid is de beslissende variabele, niet kwaliteit
Dit is het deel van de vergelijking waaraan geen benchmark hangt en dat meer betekent dan alle andere.
Gemini 4 Argon is niet algemeen beschikbaar. In een bericht van Google staat dat het wordt uitgerold naar vertrouwde cyberverdedigers via het Fairwind Program, dat het bedrijf deelneemt aan het vrijwillige pre-release modeltoegangsproces van de Amerikaanse overheid, en dat bredere toegang voor ontwikkelaars, ondernemingen en consumenten "zo snel mogelijk" komt, te beginnen met de betaalde API en abonnees van Google AI Ultra. Er is geen daar, geen endpoint, geen gepubliceerde datum. Het staat niet in onze catalogus en het staat ook niet op de publieke API van iemand anders; een prijspagina voor Argon bestaat nog niet.
Claude Opus 5.5 is vandaag beschikbaar. Op OrcaRouter is het anthropic/claude-opus-5.5, bereikbaar via hetzelfde OpenAI-compatibele endpoint als de meer dan 200 andere modellen in de catalogus, met automatische failover tussen providers wanneer een route verslechtert, en een routing-DSL voor gevallen waarin je een deel van het verkeer naar Opus 5.5 wilt sturen en de rest ergens anders met dezelfde sleutel. Geen tweede contract, geen tweede SDK.

De praktische aanbeveling voor de komende maand is weinig glamoureus: bouw voort op Opus 5.5, houd je modelnaam in een configuratiewaarde in plaats van in een letterlijke tekenreeks, en zet een goedkoop model achter je retry-pad, zodat een latentiepiek bij een run van 702 seconden voor de eerste token je product niet mee naar beneden haalt. Dat laatste punt is niet theoretisch — de first-token-latentie van Opus 5.5 op de harness van AA is elf minuten, en of dat een artefact van de harness is of het model werkelijk langer nadenkt dan alles vóór zich, je time-outbudget moet door dat getal worden bepaald, niet door de marketing.
Wat zou deze uitspraak veranderen?
Drie dingen, in volgorde van waarschijnlijkheid. Algemene beschikbaarheid van Argon met een gepubliceerde prijs, wat het kostenargument onmiddellijk bruikbaar zou maken en zou testen of $2/$10 contact met echt verkeer overleeft. Een onafhankelijke, reproduceerbare run van DeepSWE v1.1 en CWE-bench v1 buiten Google, die de leveranciersclaims zou bevestigen of ontkrachten. Of een Artificial Analysis-configuratie van Argon op de hoogste inspanningsinstelling, wat zou uitmaken of de indexkloof van vijf punten een capaciteitsverschil is of een artefact van de inspanningsinstellingen.
Totdat een van die twee er is, is de eerlijke samenvatting dat Opus 5.5 het beter geverifieerde model is en Argon de beter geprijsde claim. Welke daarvan je vandaag daadwerkelijk kunt gebruiken, is geen moeilijke keuze.
Claude Opus 5.5 is live op OrcaRouter tegen het listtarief van de leverancier, zonder opslag, naast de rest van de catalogus — als je het wilt benchmarken tegen je eigen workload in plaats van tegen een leaderboard, anthropic/claude-opus-5.5is de id om aan te roepen, en later een ander model inwisselen is een wijziging van één regel op dezelfde sleutel.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
