Hjälterubrikkort med texten "Gemini 4 Argon vs Claude Opus 5.5 — benchmarkdelningen", med en datumremsa med texten "Argon tillkännagavs 2026-09-30" och "Opus 5.5 släpptes 2026-09-22", ett märke med texten "Argon: definierad pilot, inte allmän tillgänglighet", och en sidfotsrad med texten "Argon-siffror rapporterade av leverantören; båda modellernas indexsiffror enligt Artificial Analysis."
Guides & Insights

Gemini 4 Argon vs Claude Opus 5.5: Benchmark-klyvningen som ingen förväntade sig

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Gemini 4 Argon och Claude Opus 5.5 är oense om vem som är bättre, och oenigheten är inte brus. På Artificial Analysis Intelligence Index skiljer de två fem poäng till Opus 5.5:s fördel. På Vals Index – rankningstabellen för ekonomisk påverkan viktad efter BNP – ligger Gemini 4 Argon på första plats och Claude Opus 5.5 på tredje plats, efter både Argon och Claude Sonnet 5.5. Båda tabellerna mätte samma två modeller under samma vecka. Det är hela artikeln: vilken du bör välja beror på om ditt arbete liknar mer en tentamensfråga eller en tisdag på en advokatbyrå, och på om du överhuvudtaget har API-åtkomst till Argon, vilket i dagsläget nästan ingen har.

Google tillkännagav Gemini 4 Argon den 30 september 2026 i ett DeepMind-inlägg som tillskrevs Koray Kavukcuoglu, SVP för Google DeepMind och Chief AI Architect. Anthropic släppte Claude Opus 5.5 åtta dagar tidigare, den 22 september 2026. En av dem är ett GA-släpp som du kan anropa i eftermiddag. Den andra är en etappvis utrullning till en namngiven grupp cyberförsvarare plus Googles egna ingenjörer, med en uttalad avsikt att nå "betalande API-kunder och prenumeranter på Google AI Ultra" så snart skyddsräcken är klara, utan något datum kopplat till det.

Svaret på en rad, innan detaljerna

Om du behöver den bäst uppmätta allmänna resonemangsförmågan i dag och behöver den på en produktionsnyckel, är Claude Opus 5.5 tillgänglig på OrcaRouter just nu, och Gemini 4 Argon finns inte på något publikt API. Om du bygger för finans-, juridik-, skatte- eller kodningsagenter som bedöms efter ekonomisk avkastning per dollar, är Argons siffror bättre och dess pris per uppgift är en femtedel av Opus 5.5:s på den enda resultattavla som mäter exakt detta. Om du arbetar med cybersäkerhetsförsvar för kritisk infrastruktur har Argon ett program som du kan ansöka till, och svaret kan vara ja.

Varifrån varje nummer faktiskt kommer

Två indexnämnder, två metodologier, och det är värt att vara precis om vilken som är vilken, eftersom de två lägren kommer att citera förbi varandra i månader.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 på 57,6 och Gemini 4 Argon på 52,6, båda avlästa från Artificial Analysis den 30 september 2026. Detta är ett sammansatt mått av tio utvärderingar, avsiktligt uppgiftsgenerellt, och det är den resultattavla som de flesta citerar som "den" rankningen.

• Vals Index, uppdaterat 2026-09-29 — Gemini 4 Argon på första plats med 68,90 % (±0,97), Claude Sonnet 5.5 på andra plats med 67,04 % (±0,92), Claude Opus 5.5 på tredje plats med 66,97 % (±0,89). Vals viktar uppgifter inom finans, kodning, juridik och skatt efter varje sektors andel av USA:s BNP, så en modell som är medelmåttig på pussel men utmärkt på avtalsgranskning och kalkylbladsarbete presterar bra här.

Ett AA-gap på fem punkter är verkligt och det är inte litet. Ett Vals-gap på två punkter är också verkligt, och med de konfidensintervall som anges på resultattavlan är Argons 68,90 ±0,97 mot Opus 5.5:s 66,97 ±0,89 en separation på ungefär 1,5 standardfel – bättre än ett myntkast, men inte överväldigande. Ingen av tavlorna har fel. De mäter olika uppgifter.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Ett konfigurationsförbehåll, och det talar emot att tolka AA-gapet som en ren modelljämförelse. Artificial Analysis plottar Gemini 4 Argon vid dess höga ansträngningsinställning och Claude Opus 5.5 vid "Adaptivt resonemang, max ansträngning, standardreserv". De är inte samma punkt på de två ansträngningsstegarna, så rubriken 57,6 mot 52,6 är inte en jämförelse på lika villkor vid matchade resonemangsbudgetar. Det är siffran som båda sidorna publicerar, och det är siffran att citera om du är rättvis mot Anthropic, men det är inte ett kontrollerat experiment.

Kostnad per uppgift är där gapet blir obehagligt

Artificial Analysis publicerar också en redovisning av vad det kostade att köra deras indexsvit, och här är de två modellerna inte i närheten av varandra.

• Kostnad per indexeringsuppgift — Gemini 4 Argon 1,99 $ mot Claude Opus 5.5 5,98 $.

• Kostnad för att köra hela indexsviten – Gemini 4 Argon 2 407 $ mot Claude Opus 5.5 8 708 $.

• Listpris per miljon tokens – Gemini 4 Argon $2 in / $10 ut (Googles angivna introduktionspris, med cachad indata med 95 % rabatt, alltså 0,10 $) jämfört med Claude Opus 5.5 $4 in / $20 ut.

• Genomströmning — Gemini 4 Argon 48,9 utdatatoken per sekund, första token efter 2,79 sekunder; Claude Opus 5.5 92,2 utdatatoken per sekund men en latens för första token på 702 sekunder i samma testrigg, vilket är skatten för utökat tänkande som visar sig i öppen dager.

• Vals kostnad per körning — Gemini 4 Argon 15,68 $ mot Claude Opus 5.5 32,14 $ på samma BNP-viktade uppgiftsuppsättning.

Det finns en hake värd att flagga snarare än att släta över: Vals topplista anger Argons priser som $4 in / $20 ut, medan Googles meddelande anger $2 in / $10 ut för introduktionsperioden. Den mest sannolika tolkningen är att Vals visar ett standardlistpris och att Google visar ett kampanjpris, men det är en slutledning och inte ett publicerat uttalande från någon av parterna. Om din budget hänger på siffran, fråga Google.

Vad Argon påstår och vad som har kontrollerats

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Googles inlägg är späckat med siffror och varenda en är leverantörsrapporterad. Ingen av dem har oberoende reproducerats såvitt jag kan hitta, och de oberoende bänkarna ovan mäter andra saker än de som Google valde att lyfta fram i rubrikerna. Uttryckt som Googles egna påståenden:

• DeepSWE v1.1 — 77,9 %, beskrivs som ett nytt state of the art inom verklighetsnära långsiktig mjukvaruutveckling.

• LVBench-förståelse av långa videor — {{1}}91,7{{/1}} %, beskrivet som toppmodern teknik.

• AutomationBench (Zapiers benchmark för end-to-end-affärsuppgifter) – rankad #1 med 51,3 %.

• CWE-bench v1-åtgärdning av sårbarheter – delad förstaplats på 68 %, som bygger vidare på resultatet för Gemini 3.8 Flash Cyber på v0-tavlan.

• Gray Swan Indirect Prompt Injection — beskrivs som ledande, utan någon siffra publicerad i inlägget.

• Vals Finance Agent v2 och Harvey's Legal Agent Benchmark – beskrivs som ledande, likaså utan ett tryckt nummer i tillkännagivandet.

De två påståendefamiljer som faktiskt har oberoende stöd är de som är mest värda att lita på: Vals bekräftar indexpositionen med en siffra och ett intervall, och Artificial Analysis bekräftar ett index på 52,6 och priset. Anekdoterna om intern produktivitet — en förbättring på 40 % jämfört med en publicerad baslinje för en kvantsubrutin, över 300 TiB minne frigjort i Googles maskinpark av Argon-agenter — är företagsinterna resultat utan extern testning och bör läsas som sådana.

Vad Opus 5.5 är, om du har levt under en sten

Claude Opus 5.5 är Anthropics flaggskepp: kontext på 1M tokens, maximal utdata på 128K, multimodala indata i form av text, bild och fil, utökat tänkande, verktygsanvändning och strukturerade utdata. Den efterträdde Claude Opus 5 den 22 september 2026 och det stora samtalsämnet vid lanseringen var utan tvekan prissänkningen — nivån sänktes snarare än höjdes, till $4/$20 med cachade läsningar på $0,20. Den kan routas på OrcaRouter idag till exakt den taxan, där leverantörens listpris förs vidare med noll påslag, och en prisändring från leverantören slår igenom hos oss samma dag som den gör det hos dem.

På de poäng på uppgiftsnivå som båda modellerna har är bilden en äkta gungbräda snarare än ett svep:

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % mot Gemini 4 Argon 57,1 %.

• SciCode — Claude Opus 5.5 66,9 % mot Gemini 4 Argon 61,8 %.

• Mänsklighetens sista prov — Claude Opus 5.5 61,4 % mot Gemini 4 Argon 57,1 %.

• Resonemang med lång kontext — Claude Opus 5.5 84,7 % mot Gemini 4 Argon 79,7 %.

• CritPt — Claude Opus 5.5 31,7 % mot Gemini 4 Argon 27,1 %.

• Allvetenhet — Claude Opus 5.5 46,4 mot Gemini 4 Argon 42,4.

• GDPval — Claude Opus 5.5 1 846 mot Gemini 4 Argon 1 611.

• AutomationBench-AA — Gemini 4 Argon 77,5 % mot Claude Opus 5.5 69,5 %. Detta är den enda uppgiftspoängen i en direkt jämförelse där Argon tydligt vinner, och det är också den uppgiftsfamilj som ligger närmast det som Vals Index belönar.

Mönstret är alltså konsekvent: Opus 5.5 ligger före på den akademiskt präglade resonemangsstegen, och Argon ligger före när det gäller uppgiftsutförande från början till slut. Det är inte längre någon motsättning mellan de två resultattavlorna. Det är samma resultat formulerat två gånger.

Den förmåga som ingen jämför utifrån

Gemini 4 Argons utdatatak är 1 000 000 tokens i en enda trajektoria, upp från förra generationens 64K. Claude Opus 5.5 begränsar utdata till 128K. Båda har ett kontextfönster på 1M tokens, men kontext och utdata är olika budgetar, och detta är det största enskilda specifikationshoppet i tillkännagivandet.

Huruvida det spelar någon roll beror helt och hållet på vad du kör. Ett tak på 128K utdata är generöst för chatt, kodgranskning, strukturerad extraktion och agentsteg. Det är en hård vägg för att generera en hel uppsättning migreringspatchar, en fullständig revisionsrapport eller ett långt dokument i ett svep – de arbetsflöden som Google valde för att illustrera lanseringen. Om din pipeline kedjar tjugo anrop för att hålla sig under ett tak kommer Argons tak att spara dig latens och orkestreringskod. Om den inte gör det betalar du för utrymme du inte kommer att använda.

Tillgänglighet är den avgörande variabeln, inte kvaliteten

Det här är den del av jämförelsen som inte har något jämförelsemått kopplat till sig och som väger tyngre än alla de andra.

Gemini 4 Argon är inte allmänt tillgänglig. Googles inlägg säger att det rullas ut till betrodda cyberförsvarare genom Fairwind-programmet, att företaget deltar i den amerikanska regeringens frivilliga process för modellåtkomst före lansering, och att bredare tillgång för utvecklare, företag och konsumenter kommer "så snart som möjligt", med start för betalande API-kunder och prenumeranter på Google AI Ultra. Det finns ingen modellidentifierare, ingen endpoint, ingen publicerad kvot och inget datum. Det finns inte i vår katalog och inte heller i någon annans publika API, så en prissida för Argon finns inte ännu.

Claude Opus 5.5 släpps idag. På OrcaRouter är den anthropic/claude-opus-5.5, nås via samma OpenAI-kompatibla endpoint som de andra över 200 modellerna i katalogen, med automatisk redundansväxling mellan leverantörer när en rutt försämras, och en routing-DSL för fall där du vill skicka en del trafik till Opus 5.5 och resten någon annanstans med samma nyckel. Inget andra avtal, inget andra SDK.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

Den praktiska rekommendationen för nästa månad är oglamorös: bygg vidare på Opus 5.5, behåll ditt modellnamn i ett konfigvärde i stället för i en strängliteral, och placera en billig modell bakom din återförsöksväg så att en latenspik på en 702 sekunder lång first-token-körning inte tar ner din produkt med sig. Den sista punkten är inte teoretisk — Opus 5.5:s first-token-latens i AA:s harness är elva minuter, och oavsett om det är en artefakt från harnessen eller modellen som verkligen tänker längre än något tidigare, bör din timeout-budget sättas efter siffran, inte efter marknadsföringen.

Vad skulle ändra denna dom?

Tre saker, i sannolikhetsordning. Allmän tillgänglighet för Argon med ett publicerat pris, vilket skulle göra kostnadsargumentet omedelbart användbart och skulle testa om $2/$10 överlever kontakt med verklig trafik. En oberoende, reproducerbar körning av DeepSWE v1.1 och CWE-bench v1 utanför Google, vilket antingen skulle bekräfta leverantörens påståenden eller punktera dem. Eller en Artificial Analysis-konfiguration av Argon vid dess högsta ansträngningsinställning, vilket skulle avgöra om gapet på fem punkter i indexet är en kapacitetsskillnad eller en artefakt av ansträngningsinställningar.

Fram till dess att ett av dem blir verklighet är den ärliga sammanfattningen att Opus 5.5 är den bättre verifierade modellen och Argon är det bättre prissatta påståendet. Vilket av dem du faktiskt kan använda i dag är inte ett svårt val.

Claude Opus 5.5 finns nu på OrcaRouter till leverantörens listpris utan påslag, tillsammans med resten av katalogen – om du vill benchmarka den mot din egen arbetsbelastning i stället för mot en resultattavla,anthropic/claude-opus-5.5 är id:t att anropa, och att byta in en annan modell senare är en ändring på en rad på samma nyckel.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen