Hero-Titelkarte mit der Aufschrift „Gemini 4 Argon vs. Claude Opus 5.5 – der Benchmark-Split“, mit einer Datumsleiste mit der Aufschrift „Argon angekündigt 2026-09-30“ und „Opus 5.5 veröffentlicht 2026-09-22“, einem Badge mit der Aufschrift „Argon: definierter Pilot, keine allgemeine Verfügbarkeit“ und einer Fußzeile mit der Aufschrift „Argon-Zahlen vom Anbieter gemeldet; Indexwerte beider Modelle gemäß Artificial Analysis.“
Guides & Insights

Gemini 4 Argon vs. Claude Opus 5.5: Der Benchmark-Split, den niemand erwartet hat

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Gemini 4 Argon und Claude Opus 5.5 sind sich uneinig darüber, wer besser ist, und diese Uneinigkeit ist kein Rauschen. Im Intelligence Index von Artificial Analysis liegen die beiden fünf Punkte auseinander, zugunsten von Opus 5.5. Im Vals Index – der nach BIP gewichteten Rangliste zur wirtschaftlichen Wirkung – steht Gemini 4 Argon auf Platz eins und Claude Opus 5.5 auf Platz drei, hinter sowohl Argon als auch Claude Sonnet 5.5. Beide Ranglisten haben dieselben zwei Modelle in derselben Woche gemessen. Das ist der ganze Artikel: Welches Sie wählen sollten, hängt davon ab, ob Ihre Arbeit eher wie eine Prüfungsfrage oder wie ein Dienstag in einer Anwaltskanzlei aussieht, und davon, ob Sie überhaupt API-Zugang zu Argon haben, den heute so gut wie niemand hat.

Google kündigte Gemini 4 Argon am 30. September 2026 in einem DeepMind-Beitrag an, der Koray Kavukcuoglu zugeschrieben wird, SVP für Google DeepMind und Chief AI Architect. Anthropic veröffentlichte Claude Opus 5.5 acht Tage zuvor, am 22. September 2026. Eines davon ist eine GA-Version, die man heute Nachmittag aufrufen kann. Das andere ist eine schrittweise Einführung für eine benannte Kohorte von Cyber-Verteidigern sowie Googles eigene Ingenieure, mit der erklärten Absicht, „zahlende API-Kunden und Google AI Ultra-Abonnenten“ zu erreichen, sobald die Schutzmechanismen bereit sind – und ohne dass ein Datum dafür genannt wurde.

Die einzeilige Antwort, vor dem Detail.

Wenn Sie heute das beste gemessene allgemeine Reasoning brauchen und es mit einem Production-Key benötigen, ist Claude Opus 5.5 ab sofort auf OrcaRouter verfügbar, und Gemini 4 Argon ist auf keiner öffentlichen API. Wenn Sie Finanz-, Rechts-, Steuer- oder Coding-Agenten entwickeln, die nach wirtschaftlichem Output pro Dollar bewertet werden, sind Argons Zahlen besser, und sein Preis pro Aufgabe beträgt ein Fünftel von dem von Opus 5.5 auf dem einen Board, das genau das misst. Wenn Sie im Bereich der Cybersicherheitsverteidigung für kritische Infrastrukturen tätig sind, hat Argon ein Programm, für das Sie sich bewerben können, und die Antwort könnte Ja lauten.

Woher jede Zahl tatsächlich kommt

Zwei Index-Boards, zwei Methodologien, und es lohnt sich, genau zu unterscheiden, welches welches ist, denn die beiden Lager werden monatelang aneinander vorbeizitieren.

• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 mit 57,6 und Gemini 4 Argon mit 52,6, beide am 30.09.2026 bei Artificial Analysis abgelesen. Dies ist ein Composite aus zehn Evaluierungen, bewusst aufgabenübergreifend angelegt, und es ist die Rangliste, die die meisten Leute als „die“ Rangliste zitieren.

• Vals Index, aktualisiert am 29.09.2026 — Gemini 4 Argon auf dem ersten Platz mit 68,90 % (±0,97), Claude Sonnet 5.5 auf dem zweiten Platz mit 67,04 % (±0,92), Claude Opus 5.5 auf dem dritten Platz mit 66,97 % (±0,89). Vals gewichtet Finanz-, Coding-, Rechts- und Steueraufgaben nach dem Anteil des jeweiligen Sektors am US-BIP; daher schneidet ein Modell, das bei Puzzles mittelmäßig, bei Vertragsprüfung und Tabellenkalkulationsarbeit aber exzellent ist, hier gut ab.

Eine Fünf-Punkte-Lücke bei AA ist real, und sie ist nicht klein. Eine Zwei-Punkte-Lücke bei Vals ist ebenfalls real, und mit den auf der Bestenliste ausgewiesenen Konfidenzintervallen ist Argons 68,90 ±0,97 gegenüber den 66,97 ±0,89 von Opus 5.5 eine Trennung von ungefähr 1,5 Standardfehlern – besser als ein Münzwurf, aber nicht überwältigend. Keine der beiden Bestenlisten ist falsch. Sie messen unterschiedliche Aufgaben.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, Vals Index 68.90% (rank 1), price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, throughput 48.9 tok/s. Claude Opus 5.5 reads: AA Intelligence Index 57.6, Vals Index 66.97% (rank 3), price $4 / $20, cost per index task $5.98, output ceiling 128K tokens, throughput 92.2 tok/s. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis on 2026-09-30.

Ein Vorbehalt zur Konfiguration, und er spricht dagegen, die AA-Lücke als reinen Modellvergleich zu lesen. Artificial Analysis führt Gemini 4 Argon mit seiner hohen Effort-Einstellung auf und Claude Opus 5.5 bei „Adaptive Reasoning, Max Effort, Default Fallback“. Das sind nicht dieselben Punkte auf den beiden Effort-Leitern, daher ist die Schlagzeile 57,6 gegen 52,6 kein Vergleich von Gleichem mit Gleichem bei übereinstimmenden Reasoning-Budgets. Es ist die Zahl, die beide Seiten veröffentlichen, und es ist die Zahl, die man zitieren sollte, wenn man Anthropic fair behandeln will, aber es ist kein kontrolliertes Experiment.

Die Kosten pro Aufgabe sind der Punkt, an dem die Lücke unangenehm wird

Artificial Analysis veröffentlicht außerdem eine Aufstellung darüber, was der Betrieb seiner Index-Suite gekostet hat, und hier liegen die beiden Modelle nicht dicht beieinander.

• Kosten pro Indexierungsaufgabe — Gemini 4 Argon 1,99 $ gegenüber Claude Opus 5.5 5,98 $.

• Kosten für die Ausführung der gesamten Index-Suite — Gemini 4 Argon 2.407 $ gegenüber Claude Opus 5.5 8.708 $.

• Listenpreis pro Million Tokens — Gemini 4 Argon: 2 $ Eingabe / 10 $ Ausgabe (Googles angegebener Einführungspreis, wobei für zwischengespeicherte Eingabe 95 % Rabatt gilt, also 0,10 $) gegenüber Claude Opus 5.5: 4 $ Eingabe / 20 $ Ausgabe.

• Durchsatz — Gemini 4 Argon 48,9 Ausgabe-Token pro Sekunde, erstes Token nach 2,79 Sekunden; Claude Opus 5.5 92,2 Ausgabe-Token pro Sekunde, aber eine Latenz bis zum ersten Token von 702 Sekunden auf demselben Prüfstand, was die Extended-Thinking-Steuer ist, die offen zutage tritt.

• Vals-Kosten pro Durchlauf — Gemini 4 Argon 15,68 $ gegenüber Claude Opus 5.5 32,14 $ beim selben BIP-gewichteten Aufgabensatz.

Es gibt eine Unstimmigkeit, die man besser ansprechen sollte, statt sie zu beschönigen: Die Bestenliste von Vals führt Argons Preise mit 4 $ Eingabe / 20 $ Ausgabe auf, während Googles Ankündigung für den Einführungszeitraum 2 $ Eingabe / 10 $ Ausgabe nennt. Die naheliegendste Interpretation ist, dass Vals einen regulären Listenpreis und Google einen Aktionspreis zeigt, doch das ist eine Schlussfolgerung und keine von einer der beiden Seiten veröffentlichte Aussage. Wenn Ihr Budget von dieser Zahl abhängt, fragen Sie Google.

Was Argon behauptet und was überprüft wurde

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst reading that Gemini 4 Argon delivers frontier performance in complex workflows across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Googles Beitrag ist voller Zahlen, und jede einzelne davon wurde vom Anbieter gemeldet. Keine davon wurde, soweit ich das feststellen kann, unabhängig reproduziert, und die oben aufgeführten unabhängigen Ranglisten messen andere Dinge als die, die Google als Aufmacher gewählt hat. Als Googles eigene Behauptungen formuliert:

• DeepSWE v1.1 — 77,9 %, beschrieben als neuer State of the Art für reales Software-Engineering mit langen Zeithorizonten.

• LVBench Langvideo-Verständnis — 91,7 %, bezeichnet als State of the Art.

• AutomationBench (Zapiers Benchmark für End-to-End-Geschäftsaufgaben) — Platz 1 mit 51,3 %.

• Behebung von Schwachstellen in CWE-bench v1 – mit 68 % punktgleich auf Platz eins, aufbauend auf dem Ergebnis von Gemini 3.8 Flash Cyber auf dem v0-Board.

• Gray Swan Indirect Prompt Injection — als führend beschrieben, ohne dass im Beitrag eine Zahl veröffentlicht wurde.

• Vals Finance Agent v2 und Harvey's Legal Agent Benchmark — als führend beschrieben, ebenfalls ohne eine gedruckte Zahl in der Ankündigung.

Die beiden Behauptungsfamilien, die tatsächlich unabhängige Unterstützung haben, sind die, denen man am meisten vertrauen sollte: Vals bestätigt die Indexposition mit einer Zahl und einem Intervall, und Artificial Analysis bestätigt einen Index von 52,6 und den Preis. Die internen Produktivitätsanekdoten – eine Verbesserung um 40 % gegenüber einer veröffentlichten Baseline bei einer Quanten-Subroutine, mehr als 300 TiB Speicher, die durch Argon-Agenten über Googles Flotte hinweg freigegeben wurden – sind unternehmensinterne Ergebnisse ohne externen Test und sollten als solche verstanden werden.

Was Opus 5.5 ist, falls du hinter dem Mond lebst

Claude Opus 5.5 ist Anthropics Flaggschiff: 1M-Token-Kontext, 128K maximale Ausgabe, multimodale Eingabe über Text, Bild und Datei, Extended Thinking, Tool-Nutzung und strukturierte Ausgaben. Es trat am 22. September 2026 die Nachfolge von Claude Opus 5 an, und die Schlagzeile seines Launches war wohl die Preissenkung – die Preisstufe ging nach unten statt nach oben, auf $4/$20 bei gecachten Lesezugriffen zu $0.20. Es lässt sich heute auf OrcaRouter genau zu diesem Tarif routen, wobei der Listenpreis des Anbieters durchgereicht wird – mit null Aufschlag, und eine Preisänderung eines Anbieters landet bei uns am selben Tag, an dem sie bei ihm eintrifft.

Bei den Task-Level-Werten, über die beide Modelle verfügen, zeigt sich ein echtes Auf und Ab statt eines Durchmarschs:

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6 % gegenüber Gemini 4 Argon 57,1 %.

• SciCode — Claude Opus 5.5 66,9 % gegenüber Gemini 4 Argon 61,8 %.

• Humanity's Last Exam — Claude Opus 5.5 61,4 % gegen Gemini 4 Argon 57,1 %.

• Langkontext-Reasoning — Claude Opus 5.5 84,7 % gegenüber Gemini 4 Argon 79,7 %.

• CritPt — Claude Opus 5.5 31,7 % gegenüber Gemini 4 Argon 27,1 %.

• Allwissenheit — Claude Opus 5.5 46,4 versus Gemini 4 Argon 42,4.

• GDPval — Claude Opus 5.5 1.846 gegenüber Gemini 4 Argon 1.611.

• AutomationBench-AA — Gemini 4 Argon 77,5 % gegenüber Claude Opus 5.5 69,5 %. Dies ist die einzige Aufgabenbewertung im Direktvergleich, bei der Argon eindeutig gewinnt, und zugleich die Aufgabenfamilie, die dem, was der Vals Index belohnt, am nächsten kommt.

Das Muster ist also konsistent: Opus 5.5 liegt auf der akademisch angehauchten Reasoning-Leiter vorn, und Argon liegt bei der End-to-End-Aufgabenausführung vorn. Das ist kein Widerspruch zwischen den beiden Ranglisten mehr. Es ist derselbe Befund, zweimal ausgedrückt.

Die Fähigkeit, die niemand zum Vergleich heranzieht

Die Ausgabeobergrenze von Gemini 4 Argon liegt bei 1.000.000 Token in einer einzigen Trajektorie, ein Anstieg gegenüber den 64K der vorherigen Generation. Claude Opus 5.5 begrenzt die Ausgabe auf 128K. Beide haben ein Kontextfenster von 1 Mio. Token, doch Kontext und Ausgabe sind unterschiedliche Budgets, und dies ist der größte einzelne Spezifikationssprung in der Ankündigung.

Ob das eine Rolle spielt, hängt ganz davon ab, was Sie ausführen. Eine Ausgabegrenze von 128K ist großzügig für Chat, Code-Review, strukturierte Extraktion und Agent-Schritte. Sie ist eine harte Grenze für das Generieren eines kompletten Migrations-Patchsets, eines vollständigen Audit-Berichts oder eines Langform-Dokuments in einem Durchgang – die Workflows, mit denen Google den Launch illustrieren wollte. Wenn Ihre Pipeline zwanzig Aufrufe aneinanderkettet, um unter einer Obergrenze zu bleiben, spart Ihnen die Grenze von Argon Latenz und Orchestrierungscode. Wenn nicht, zahlen Sie für Spielraum, den Sie nicht nutzen werden.

Verfügbarkeit ist die entscheidende Variable, nicht die Qualität.

Das ist der Teil des Vergleichs, für den es keinen Maßstab gibt und der mehr zählt als alle anderen zusammen.

Gemini 4 Argon ist nicht allgemein verfügbar. In Googles Beitrag heißt es, es werde über das Fairwind Program nach und nach an vertrauenswürdige Cyber-Verteidiger ausgerollt, das Unternehmen beteilige sich am freiwilligen Prozess der US-Regierung für Modellzugang vor der Veröffentlichung, und ein breiterer Zugang für Entwickler, Unternehmen und Verbraucher komme „so bald wie möglich“, beginnend mit zahlenden API-Kunden und Abonnenten von Google AI Ultra. Es gibt keine Modellkennung, keinen Endpoint, keine veröffentlichte Quote und kein Datum. Es steht nicht in unserem Katalog und auch nicht in der öffentlichen API von irgendjemand anderem, daher gibt es noch keine Preisseite für Argon.

Claude Opus 5.5 ist ab heute verfügbar. Auf OrcaRouter ist es anthropic/claude-opus-5.5, erreichbar über denselben OpenAI-kompatiblen Endpoint wie die über 200 anderen Modelle im Katalog, mit automatischem Failover über Anbieter hinweg, wenn eine Route schlechter wird, und einer Routing-DSL für Fälle, in denen du einen Teil des Traffics an Opus 5.5 und den Rest über denselben Key woandershin senden möchtest. Kein zweiter Vertrag, kein zweites SDK.

A capture of the OrcaRouter model page for Anthropic: Claude Opus 5.5, showing the Anthropic provider, a release date of 2026-09-22, a 1,000,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $4.00 input / $20.00 output per million tokens with cache reads at $0.20 and cache writes at $5.00.

Die praktische Empfehlung für den nächsten Monat ist wenig glamourös: Setzen Sie auf Opus 5.5, halten Sie Ihren Modellnamen in einem Konfigurationswert statt in einem String-Literal und setzen Sie ein günstiges Modell hinter Ihren Retry-Pfad, damit eine Latenzspitze bei einem First-Token-Lauf von 702 Sekunden nicht auch noch Ihr Produkt mit in den Abgrund reißt. Dieser letzte Punkt ist nicht theoretisch — die First-Token-Latenz von Opus 5.5 im Harness von AA beträgt elf Minuten, und ob es sich dabei um ein Harness-Artefakt handelt oder das Modell tatsächlich länger nachdenkt als alles, was es zuvor gab, sollten Sie Ihr Timeout-Budget an der Zahl ausrichten, nicht am Marketing.

Was würde dieses Urteil ändern?

Drei Dinge, in der Reihenfolge ihrer Wahrscheinlichkeit. Allgemeine Verfügbarkeit von Argon mit veröffentlichtem Preis, was das Kostenargument sofort handlungsrelevant machen und testen würde, ob $2/$10 den Kontakt mit echtem Traffic übersteht. Ein unabhängiger, reproduzierbarer Lauf von DeepSWE v1.1 und CWE-bench v1 außerhalb von Google, der entweder die Anbieterbehauptungen bestätigen oder sie entlarven würde. Oder eine Artificial-Analysis-Konfiguration von Argon mit seiner höchsten Effort-Einstellung, die klären würde, ob die Fünf-Punkte-Indexlücke ein Fähigkeitsunterschied oder ein Artefakt der Effort-Einstellungen ist.

Bis eines davon eintritt, lautet die ehrliche Zusammenfassung, dass Opus 5.5 das besser verifizierte Modell und Argon die besser bepreiste Behauptung ist. Welche davon man heute tatsächlich nutzen kann, ist keine knappe Entscheidung.

Claude Opus 5.5 ist jetzt auf OrcaRouter zum Listenpreis des Anbieters ohne Aufschlag verfügbar, zusammen mit dem Rest des Katalogs – wenn du es lieber an deiner eigenen Workload als an einem Leaderboard messen möchtest, anthropic/claude-opus-5.5 ist die ID, die du aufrufen musst, und der Wechsel zu einem anderen Modell ist später eine einzeilige Änderung mit demselben Schlüssel.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert