Hero-Titelkarte mit dem Text „Gemini 4 Argon – welche Sprosse der Gemini-4-Leiter?“, einer vertikalen Leiter aus fünf nach Rang geordneten Sprossen, auf denen Claude Opus 5.5 mit 57,6, Gemini 4 Argon mit 52,6, GPT-6 Astra mit 52,7, Gemini 3.8 Flash mit 40,9 und Gemini 3.1 Pro Preview mit 29,7 aufgeführt sind, einem Badge mit der Aufschrift „Kein Gemini 4 Ultra – die Ultra-Seite leitet zu einem Abo-Plan weiter“ und einer Fußzeilenzeile mit dem Text „Indexwerte laut Artificial Analysis, Revision v4.3.2; Argon ist über keine öffentliche API aufrufbar.“
Guides & Insights

Gemini 4 Argons Sprosse in der Gemini-4-Leiter – und warum es kein G4 Ultra gibt

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die kurze Antwort auf die Frage, die diesen Artikel ausgelöst hat, lautet, dass Gemini 4 Argon Goog​les Topmodell ist und nicht seine oberste Stufe, denn die Stufe darüber existiert noch nicht – und möglicherweise nicht in der Form, die irgendjemand erwartet. Goog​le hat genau ein Gemini-4-Modell veröffentlicht, Argon, und die einzige First-Party-Seite auf seiner eigenen Domain unter dem Pfad /models/gemini/ultra/ ist überhaupt keine Modellseite: Sie leitet auf die Goog​le-AI-Abonnementpläne weiter. Diese Weiterleitung ist der einzige wirklich nützliche Fakt in diesem Artikel, und sie lässt sich mit einer einzigen Zeile im Terminal überprüfen. Alles Weitere hier dreht sich darum, wo Argon tatsächlich steht, sobald man aufhört, seinen Preis als Stufenbezeichnung zu lesen, und anfängt, ihn als Zahl zu lesen.

Zwei Dinge sind gleichzeitig wahr, und sie sind leicht zu verwechseln. Argon ist das leistungsfähigste G​emini, das es gibt, und Argon ist kein Modell der Frontier-Klasse. Es führt jedes G​oogle-Modell an, das veröffentlicht wurde, mit einem Abstand, der groß genug ist, dass der Vergleich nicht wirklich ein Vergleich ist, und es landet auf dem Intelligence Index von Artificial Analysis nur einen Bruchteil eines Punktes entfernt von zwei konkurrierenden Flaggschiffen, die selbst volle fünf Punkte hinter dem aktuellen Spitzenreiter liegen. G​oogle hat es so bepreist, als läge es eine Stufe unterhalb der Frontier, und die unabhängige Messung stimmt dem zu. Der Preis ist also keine Marketingentscheidung, die das Modell unter Wert verkauft. Er ist eine zutreffende Aussage über das Modell.

Dies ist ein Artikel zum Stand unseres Wissens. Gemini 4 Argon wurde am 30. September 2026 in einem Google-DeepMind-Beitrag angekündigt, der Koray Kavukcuoglu zugeschrieben wird, und es wird zunächst an eine namentlich genannte Kohorte von Cyber-Verteidigern über Googles Fairwind Program ausgerollt – nicht an Entwickler, nicht an Unternehmen, nicht an Verbraucher und nicht an irgendjemanden mit einer Kreditkarte. Es hat keine Modell-ID in der Gemini API, keinen Endpoint und keinen veröffentlichten Preis pro Token, gegen den man abgerechnet werden könnte. Modellkennungen sowie Durchsatz und Zuverlässigkeit, gemessen unter realem Verkehr, gibt es dafür nicht, was bedeutet, dass die Messung unten der Benchmark-Lauf eines einzelnen Labors und nichts darüber hinaus ist. Wenn eine Zahl von Google stammt, ist sie als Googles Zahl gekennzeichnet; wenn sie von Artificial Analysis stammt, ist sie als deren Zahl gekennzeichnet. Nichts hier sollte als Behauptung gelesen werden, dass Argon ein Produkt ist, das man kaufen kann.

Die Leiter, die Google verwendete, abgelesen aus seinen eigenen Seiten

Der schnellste Weg, die Frage „wo Argon in der Produktpalette von Gemini 4 steht“ zu beantworten, ist, aufzuhören, nach der Produktpalette zu fragen, und stattdessen damit anzufangen, die Modelle aufzulisten, für die Google Seiten veröffentlicht. Eine Produktpalette ist ein Marketingkonzept; eine Seite ist eine Tatsache. Hier ist, wozu die First-Party-Pfade mit Stand vom 1. Oktober 2026 aufgelöst werden.

• deepmind.google/models/gemini/pro/ liefert 200 zurück und sein Titel lautet „Gemini 3.1 Pro — Google DeepMind“. Der Pro-Platz auf Googles eigener Website ist nach wie vor ein Modell der 3.1-Generation.

• deepmind.google/models/gemini/flash/ antwortet mit 200 und trägt den Titel „Gemini 3.8 Flash — Google DeepMind“. Der Flash-Slot hat sich dreimal verschoben — 3.5, 3.6, 3.7, 3.8 — während sich der Pro-Slot überhaupt nicht bewegt hat.

• deepmind.google/models/gemini/argon/ gibt 404 zurück. Argon erhält keinen eigenen Pfad pro Modell. Seine Heimat ist die Familienseite unter deepmind.google/models/gemini/, wo Google das Modell platziert, mit dem es derzeit vorangeht.

• deepmind.google/models/gemini/ultra/ gibt 302 zurück und landet auf one.google.com/about/google-ai-plans/, der Seite für Verbraucherabbonnements. Dasselbe gilt für den älteren Pfad deepmind.google/technologies/gemini/ultra/. Ein „Ultra“ im Modellpfad von Google ist eine Abrechnungsstufe, kein Checkpoint.

• deepmind.google/models/gemini/nano/leitet per 301 auf die Gemini-Familienseite weiter. Es gibt auch keinen Nano-Slot als eigenständige Modellseite.

• deepmind/models/gemini/model-cards/Der Index, den Google von jeder von ihm veröffentlichten Model Card pflegt – enthält keinen Eintrag für Argon und keinen Eintrag mit „Gemini 4“ im Namen. Seine neuesten Gemini-Zeilen sind 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite und 3.1 Pro. Der Kartenindex ist das sich am langsamsten verändernde Dokument in diesem Set, daher ist sein Schweigen kein Beweis dafür, dass Argon nie eine Karte haben wird; es ist ein Beweis dafür, dass die Formalitäten mit der Ankündigung nicht Schritt gehalten haben.

• deepmind.google/models/, das Modellverzeichnis, listet „Gemini 4 Argon“ als Flaggschiff-Karte mit dem Slogan „Unsere nächste Ära der Frontier-Intelligenz“ direkt über „Gemini 3.8 Flash — Am besten geeignet für die Bewältigung komplexer agentischer Aufgaben in großem Maßstab“ auf. Zwei Gemini-Karten, eine Generation auseinander, in dieser Reihenfolge.

Fügt man das zusammen, ist die Form der Leiter nicht mehrdeutig. Googles öffentlich sichtbare Modelllandschaft umfasst derzeit einen Eintrag auf der Gemini-4-Sprosse, einen Eintrag auf der Gemini-3.8-Sprosse, eine veraltete Pro-Sprosse dreieinhalb Generationen zurück und nichts oberhalb davon. Das Wort „Ultra“ auf Googles Domain läuft auf ein Abonnement hinaus. Es gibt keine Gemini-4-Pro-Seite, keine Gemini-4-Flash-Seite, keine Gemini-4-Ultra-Seite und keine Gemini-4-Modellkarte. Google hat ein Modell angekündigt, keine Familie.

Gibt es ein Gemini 4 Ultra? Die Beweislage und was sie widerlegen würde

Das verdient einen eigenen Abschnitt, weil es der Teil der Frage ist, der am wahrscheinlichsten in einer Woche anders beantwortet wird, und weil die ehrliche Antwort eine begrenzte Haltbarkeit hat.

The negative evidence is specific rather than vague. A 302 on the Ultra path to the subscription plans page is not a soft signal; it is a redirect that Google’s own web team configured. Multiple blog.google URL patterns for a Gemini 4 Ultra post return 404 — the products path, the innovation-and-ai models-and-research path, and the plain announcement path. The Ultra naming has form here, and the form cuts against a Gemini 4 Ultra. Google’s original Gemini announcement introduced Gemini 1.0 “optimized for three different sizes: Ultra, Pro and Nano”, with Gemini Ultra described as “our largest and most capable model”. A launch post that names three sizes is what a family announcement looks like. Argon’s post names one model and no siblings at all. Google later retired the Ultra model name in favour of numeric tiers and moved the word to the subscription side of the business, where it now names the top consumer plan. A model page that redirects to a plans page is what a retired model name looks like when the marketing site has been cleaned up around it.

In der Ankündigung gibt es auch nichts, was ein größeres Geschwistermodell verspricht. Der Argon-Launch-Post beschreibt Argon als „unser neues Frontier-Modell“ und beschreibt den schrittweisen Rollout, die Schutzmaßnahmen-Arbeit und die internen Deployments – und endet damit. Er sagt nicht „Erster in der Gemini-4-Familie“, er stellt weder ein Pro noch ein Ultra in Aussicht, und er nennt keinen Nachfolger. Googles eigene Darstellung behandelt Argon als das eigentliche Modell, nicht als das kleine.

Was die Schlussfolgerung widerlegen würde, ist leicht zu benennen und es lohnt sich, darauf zu achten, denn jedes Einzelne davon würde sie innerhalb eines Tages umwerfen.

• Eine 200 auf deepmind.google/models/gemini/ultra/, die eine Modellseite statt der Planseite rendert, oder ein neuer models/gemini/ untergeordneter Pfad erscheint neben pro und flash.

• Eine Gemini 4 Ultra-Zeile, die im Index der Modellkarten auftaucht – auf diese Weise bestätigt Google traditionell, dass ein Modell als dokumentiertes Artefakt existiert.

• Eine zweite Modell-ID in der Gemini-API im gemini-4-* Namensraum. Argon hat derzeit keine, eine Pro- oder Ultra-ID wäre also der erste Beweis dafür, dass diese Familie tatsächlich existiert.

• Ein Eintrag in der Modellliste von Artificial Analysis oder eine Benchmark-Tabelle auf der Familienseite mit einer vierten Spalte. Beide verfolgen Googles Veröffentlichungen eng genug, um früh dran zu sein.

• Ein Ankündigungspost von Google I/O, Cloud Next oder DeepMind, der das Wort „family“ in Bezug auf Gemini 4 verwendet. Argons Beitrag nicht.

Solange nicht mindestens eines davon eingetreten ist, ist ein Beitrag, der behauptet, ein Gemini 4 Ultra stehe bevor, eine Vorhersage im Gewand eines Berichts. Behandle ihn entsprechend – auch dann, wenn er von uns stammt.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Die Preisstaffel als Stufenaussage lesen

Die Preisgestaltung ist der eine Teil davon, den Google absichtlich veröffentlicht hat, mit einer Fußnote, und sie ist die klarste Aussage über die Absicht hinter den Tarifstufen in der gesamten Markteinführung. Argons Einführungspreis beträgt 2 $ pro Million Eingabe-Tokens und 10 $ pro Million Ausgabe-Tokens, wobei zwischengespeicherte Eingabe mit 95 % Rabatt angeboten wird, und Googles eigene Fußnote eins besagt, dass nach einer Einführungsphase, die sie nicht definieren konnte, „der Preis von 4 $ pro 1 Mio. Eingabe-Tokens und 20 $ pro 1 Mio. Ausgabe-Tokens gelten wird.“

Lies diese beiden Paare gegen das Feld, und die Behauptung zur Stufe schreibt sich von selbst.

• 4 $ / 20 $ ist der Listenpreis von Claude Opus 5.5. Googles Preis nach der Einführungsphase für Argon entspricht genau der Preisliste des aktuellen Frontier-Spitzenreiters – für ein Modell, das fünf Punkte dahinter liegt.

• $2 / $10 ist das Aktionspreisband, das sowohl GPT-6 Sol als auch Claude Sonnet 5.5 besetzen. Argons Einstiegspreis ist derselbe $2 / $10, was Argons Startpreis in dasselbe Preisband wie ein Mittelklasse-Sol einordnet statt in das Frontier-Band.

• 10 $ / 50 $ – dort liegen sowohl Claude Fable 5.1 als auch GPT-6 Astra. Argon kostet ein Fünftel des Eingabepreises von Fable 5.1 und ein Fünftel von dessen Ausgabepreis und weicht bei der Punktzahl nur um 0,8 davon ab.

• $0,75 / $3,75 ist Gemini 3.8 Flash. Ar liegt bei Eingabe und Ausgabe jeweils beim 2,7-Fachen davon – ein sauberer Anstieg, keine Klippe.

Google hat Argon also als ein Modell eingepreist, das unter $10/$50 und über $0,75/$3,75 liegt, mit einem letztendlichen Ruhepunkt bei $4/$20. Nichts an dieser Staffelung sagt »Frontier«. Sie sagt »Spitze des mittleren Segments, mit einer Headline-Zahl, die sich auf demselben Preis einpendeln wird, den der Marktführer heute verlangt, für weniger Leistungsfähigkeit«. Das ist eine vertretbare kommerzielle Entscheidung. Es ist nicht die Preisgestaltung eines Modells, das zwei Stufen vor allem anderen positioniert ist.

Ein struktureller Punkt, der es wert ist, festgehalten zu werden: Argons Preisstufe ist eine echte Stufe, in einer Fußnote definiert und ohne Datumsangabe. Die Familien Sonnet 5.5 und GPT-6 machen bei Long-Context-Stufen etwas Ähnliches, und Sol springt ab 272K auf $4/$15. Argons Stufe richtet sich nach der Zeit, nicht nach der Kontextlänge – dieselben $2/$10 gelten über das gesamte 1M-Fenster, und nur der Kalender ändert den Satz. Das ist eine ungewöhnliche Form, und sie macht jeden Kostenvergleich mit Argon zu einer Übung mit zwei Spalten: welcher Zeitraum und welche Nutzung.

Wo Argon im Vergleich zu den Rivalen steht – gemessen an den vorhandenen Zahlen

Artificial Analysis hatte so schnell eine Messung von Gemini 4 Argon vorliegen, dass sie die einzige verfügbare unabhängige Auswertung ist. In der am 1. Oktober aktuellen Revision – v4.3.2 – erzielt Argon 52,56 auf dem Intelligence Index, konfiguriert mit hohem Reasoning-Aufwand. Die Modelle um es herum sind keine Zufallsstichprobe des Feldes.

Claude Opus 5.5 liegt bei 57,62, gemessen mit maximalem Aufwand mit Fallback. Das sind gut fünf Punkte über Argon, und es steht derzeit an der Spitze der Rangliste.

• Claude Fable 5.1 liegt bei 53,35, gemessen mit maximalem Aufwand und Fallback. Argon liegt 0,79 dahinter.

• GPT-6 Astra liegt bei 52,67, gemessen im Maximum. Argon liegt 0,11 dahinter.

• Claude Sonnet 5.5 liegt bei 55,98 – ebenfalls das Maximum mit Fallback. Das ist ein Mittelklasse-Modell, das Argon um 3,4 Punkte übertrifft, und genau diese Zahl sollte jeden beunruhigen, der zu der Aussage „Gemini 4 Argon ist das zweitbeste Modell der Welt“ greift.

• GPT-6 Sol liegt bei 47,63, gemessen am Maximum, bei einem 872K-Kontextfenster. Argon liegt 4,9 vor ihm.

• Gemini 3.8 Flash liegt bei hohem Aufwand bei 40,93. Argon liegt 11,6 davor.

• Gemini 3.1 Pro Preview liegt bei 29,72. Argon liegt 22,8 Punkte vor ihm, was die denkbar klarste Aussage darüber ist, wie weit Googles ausgelieferte Pro-Stufe hinter der eigenen Forschung zurückgefallen ist.

Aus dieser Liste ergeben sich drei Dinge. Erstens liegt Argon gleichauf mit den beiden Herausforderern Fable 5.1 und Astra und klar hinter zwei Anthropic-Modellen – Opus 5.5 und, unangenehmerweise, Sonnet 5.5. Zweitens ist der Abstand zwischen Argon und Googles eigenem besten ausgelieferten Modell der größte Generationssprung im aktuellen Lineup, und das mit Abstand. Drittens ist die Darstellung des Signals, dass „die Frontier mindestens zwei Stufen voraus ist“, inhaltlich richtig, aber geometrisch leicht daneben: Es gibt eine Modellstufe, die klar vor Argon liegt (Opus 5.5 mit 57,6), und ein zweites Modell in einer günstigeren Stufe, das ebenfalls davor liegt (Sonnet 5.5 mit 56,0), was ein schärferes Problem ist, als zwei Sprossen weiter unten auf einer Leiter zu stehen, auf der Argon tatsächlich ist.

Die Rahmung über den Preisvergleich in der ursprünglichen Frage – „die Preise legen nahe, dass dies ihr Sol/Sonnet-Äquivalent ist“ – erweist sich beim Einführungspreis als ungefähr richtig und beim letztendlichen Preis als falsch. Argon startet mit dem Preis von Sol und Sonnet 5.5 und pendelt sich bei dem von Opus 5.5 ein. Es ist als Mittelklasse-Modell bepreist, das sich zu einem Modell zum Frontier-Preis entwickeln soll, während es bei keinem von beiden mithält.

Das Bild der Kosten pro Aufgabe ist der Bereich, in dem Argon am stärksten ist und in dem die Stufen-Erzählung eine zweite Dimension erhält. Bei der Index-Aufgabe kostet Argon 1,99 $ und gibt 142.374 Output-Tokens aus. Opus 5.5 kostet 5,98 $ und gibt 338.099 aus. Sonnet 5.5 kostet 7,62 $ für 599.849. Fable 5.1 kostet 7,63 $ für 187.455. Astra kostet 3,26 $ für 68.691. Gemini 3.8 Flash kostet 1,24 $ für 154.230. Argon ist der günstigste Weg, eine Frontier-nahe Punktzahl zu kaufen, und es ist pro Aufgabe um weniger als einen Dollar günstiger als das in der Punktzahl über ihm liegende Flash-Modell.

Die Effort-Einstellungen sind das Sternchen bei allem oben Genannten, und das Feld weist sie nicht einheitlich aus. Argon wird bei high gemessen; Opus 5.5 und Fable 5.1 und Sonnet 5.5 bei max mit Fallback; Astra und Sol bei max. Ein High-Effort-Lauf und ein Max-Effort-Lauf sind nicht dieselbe Messung, und Anthropics eigene Effort-Leiter verschiebt ein Modell zwischen den Einstellungen um mehrere Punkte. Wenn Argon bei max-Effort gemessen deutlich über 52,6 erzielt, ändert sich das Tier-Argument. Diesen Lauf hat noch niemand veröffentlicht.

Was Googles eigene Tabelle behauptet und wie sie sich von der unabhängigen unterscheidet

Die Seite der Gemini-Familie enthält eine von Google verfasste Leistungstabelle mit vier Spalten – Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 – und neunzehn Benchmark-Zeilen. Sie ist die detaillierteste Zusammenstellung von Leistungsbehauptungen, die Google für dieses Modell veröffentlicht hat, und sie ist durchweg herstellerberichtet. Sie gegen den unabhängigen Index zu lesen ist gerade deshalb aufschlussreich, weil die beiden sich über die Gestalt des Feldes nicht einig sind.

In Googles Tabelle gewinnt Argon dreizehn der neunzehn Zeilen allein oder teilt sich den ersten Platz, darunter Vals Index Knowledge work mit 68,9, AutomationBench mit 51,3, Harvey’s Legal Agent Benchmark mit 19,6, DeepSWE v1.1 mit 77,9, LABBench 2 mit 88,8, GraphWalks mit 99,7 für den ≤128K-Bereich und 84,2 für den 256K–1M-Bereich, Agent’s Last Exam mit 39,5, LVBench mit 91,7 und Chartography mit 71,6.

• Claude 5.5 gewinnt die Zeilen, die sich wie nachhaltiges Engineering lesen: FrontierSWE v mit 62,3 gegen Argons 55,0, Terminal-bench 4.0 mit 66,4 gegen 57,4, Terminal-Bench Science 0.1 mit 63,3 gegen 57,6 und PostTrainBench mit 49,3 gegen 45,3.

• GPT-6 Astra erreicht bei Terminal-Bench Science 0.1 68,1 und bei der Offline-Teilmenge von OSWorld-2.0 72,6 und liegt bei CWE-bench v1 mit 68,0 gleichauf mit Argon. Claude Fable 5.1 verliert jede Zeile außer einem geteilten Gleichstand bei Vibe Code Bench.

• Im Index lautet die Reihenfolge: zuerst Opus 5.5, dann Sonnet 5.5, dann Fable 5.1, dann Argon und Astra praktisch gleichauf. Googles Tabelle enthält überhaupt keine Spalte für Sonnet 5.5, was die folgenreichste Auslassung darin ist: Die vier Spalten der Tabelle sind ausgewählt, und das Modell, das Argon im Index bei niedrigerem Preis übertrifft, ist nicht darunter.

Nichts davon macht Googles Tabelle unehrlich. Anbieter-Benchmark-Tabellen werden ausgewählt, nicht per Stichprobe erhoben, und jede Labortabelle ist es genauso. Das macht sie zu einer Behauptung statt zu einer Messung, und es bedeutet, dass sich die Frage nach der Stufe nicht daraus klären lässt. Die einzige Stelle, an der die Tabelle für diesen Artikel wirklich tragend ist, ist das Negative: neunzehn Zeilen, vier Spalten und keine fünfte Spalte für ein Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Das Einzige an Argon, das überhaupt keine Tier-Frage ist

Jedes der obigen Argumente für eine Stufe geht davon aus, dass Argon ein Modell ist, das man irgendwann aufrufen kann. Es lohnt sich, das von der Positionierungsfrage zu trennen, denn die beiden haben unterschiedliche Antworten, und nur bei einer von ihnen geht es um Leistungsfähigkeit.

Argons Ausgabe-Token-Limit liegt bei 1 Million Tokens, erhöht von 64K, und Google sagt das direkt. Das ist eine Ausgabeobergrenze, kein Kontextfenster. Der Unterschied ist wichtig, weil die beiden in der Berichterstattung über diesen Launch ständig vermischt werden und weil ein Ausgabelimit von 1 Mio. eine andere technische Aussage ist als ein Kontextfenster von 1 Mio. — beim ersten geht es darum, wie lange eine einzelne Trajektorie laufen kann, beim zweiten darum, wie viel man dem Modell auf einmal übergeben kann. Google hat sich zum Ausgabelimit eindeutig geäußert und zum Kontextfenster nicht. Artificial Analysis verzeichnet ebenfalls 1.000.000 Tokens für Argons Kontext, aber das ist das Feld des Trackers und keine Aussage von Google; behandeln Sie die beiden Zahlen also so, als stammten sie aus verschiedenen Räumen, auch wenn sie gleich lauten.

Was eindeutig nicht verfügbar ist, ist der Zugang. Argon ist nicht allgemein verfügbar, es ist unter keiner Kennung in der Gemini API enthalten, und es steht in keinem Drittanbieter-Katalog. Es ist für geprüfte Cyber-Verteidiger über das Fairwind-Programm und für Googles eigene Ingenieure verfügbar, und die nächste Phase, die Google nennt – „beginnend mit zahlenden API-Kunden und Google AI Ultra-Abonnenten“ –, ist an kein Datum gebunden. Sie können es nicht mit Ihrer eigenen Workload benchmarken. Jede Zahl in diesem Artikel ist daher die Messung von jemand anderem an einem Modell, das Sie nicht nutzen können.

Was Argon eine Sprosse höher bringen würde

Eine Tier-Einstufung ist eine Momentaufnahme, und es gibt ungefähr fünf Dinge, die diese ändern würden – grob geordnet danach, wie sehr sie ins Gewicht fallen würden.

• Ein unabhängig gemessener Maximalaufwand. Argon ist derzeit eine High-Effort-Messung bei 52,56. Anthropics eigene Effort-Leitern verschieben ein Modell über Einstellungen hinweg um mehrere Punkte, und wenn sich Googles Modell bei Maximalaufwand ähnlich verhält, ist Argons tatsächliche Position gegenüber Fable 5.1 und Astra besser, als dieser Artikel sagt. Dies ist die wahrscheinlichste einzelne Änderung.

• Eine zweite Messquelle. Ein Tracker ist eine Messung. Ein zweites unabhängiges Labor, das Argon auf seinem eigenen Test-Harness bewertet, würde für die Tier-Behauptung mehr bewirken als jede zusätzliche Benchmark-Zeile von Google.

• Ein Gemini 4 Pro. Wenn Google die Pro-Stufe der 4. Generation unterhalb von Argon öffnet, wird die Produktpalette zu einer Familie mit Kontur, Argons Position ist nicht mehr „die einzige“, sondern „die Spitze von dreien“, und jedes Argument in diesem Beitrag über eine fehlende Familie muss neu geschrieben werden. Es lohnt sich, darauf zu achten, und es ist näher als die Ultra-Frage.

• Ein Preis, der nicht steigt. Wenn die Einführungsphase einfach nie endet – Google hat nicht definiert, wann sie endet –, liegt Argons effektiver Dauerpreis bei $2/$10 statt bei $4/$20, und sein Kostenvorteil pro Aufgabe gegenüber Opus 5.5 wächst von rund 3× auf rund 6×. Das ist ein kommerzielles Ereignis, kein Fähigkeitsereignis, aber es verändert, wie eine Beschaffungsentscheidung aussieht.

• Eine Argon-Modellkarte, Systemkarte oder Seite zur Evaluierungsmethodik. Die Leistungstabelle verlinkt auf eine Seite zur Methodik auf Googles Domain; eine vollständige Modellkarte würde das Kontextfenster, die Bereitstellungskonfiguration und die Sicherheitshülle zu Protokoll geben und wäre das erste Artefakt, das jemanden außerhalb der Fairwind-Kohorte in die Lage versetzt, Googles Zahlen zu überprüfen, statt sie nur zu lesen.

Umgekehrt ist das, was Argon am ehesten nach unten ziehen würde, überhaupt kein Benchmark. Es ist der Bloomberg-Bericht vom 30. September, in dem Google-Mitarbeiter mit Zugang zum Modell zitiert werden, die sagen, dass es bei realer Arbeit schlechter abschneidet, als seine Werte vermuten lassen. Diese Behauptung ist von niemandem außerhalb Googles verifiziert, und sie ist keine Messung, aber sie ist die Art von Behauptung, die ein zweiter unabhängiger Benchmark entweder bestätigen oder ausräumen würde. Bis dahin steht sie als Vorwurf mit einem genannten Medium und ungenannten Quellen zu Protokoll, und sie gehört in die Bench-Diskussion, denn ein Modell, dessen Kluft zwischen Benchmark und Praxis umstritten ist, kann nicht allein anhand von Benchmarks beworben werden.

Was das bedeutet, wenn Sie diesen Monat ein Modell auswählen

Ohne das Positionierungsargument betrachtet, ist das praktische Bild so einfach, dass ein Absatz es abdeckt. Gemini 4 Argon ist das beste Gemini, das Google gebaut hat, und es ist für Sie nicht verfügbar. Die Google-Modelle, zwischen denen Sie heute tatsächlich wählen können, sind daher die, die bereits veröffentlicht wurden: Gemini 3.8 Flash, das im Index 40,93 bei 0,75 $/3,75 $ erreicht, und Gemini 3.1 Pro Preview, das 29,72 bei 2 $/12 $ erreicht. Wenn Sie jetzt ein Gemini brauchen, ist das die echte Wahl, und Argon ist nicht dabei.

Wenn Sie anbieterübergreifend auswählen statt innerhalb von Google, ändert die Ankündigung von Argon nichts an der heutigen Entscheidung. An der Spitze des Index steht Claude Opus 5.5 mit 57,62, dicht gefolgt von Claude Sonnet 5.5 mit 55,98 – zu einem Fünftel des Preises bei Input und der Hälfte bei Output. Gemini 4 Argon mit 52,56 hat keinen Weg in Ihre Anwendung, ist also kein Kandidat, so gut der Score am Ende auch ausfallen mag.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter ist eine einzige API vor über 200 Modellen mit den Listenpreisen der Anbieter, die ohne Aufschlag weitergegeben werden, und automatischem Failover zwischen Anbietern, was bedeutet, dass die Entscheidung zum Modellwechsel keine Neuverdrahtung erfordert: Die ID im Anfragekörper ist die gesamte Änderung. Die Google-Modelle in unserem Katalog heute sind diejenigen, die Google tatsächlich veröffentlicht hat — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash und google/gemini-3.1-pro-preview. Gemini 4 Argon ist keines davon und wird es auch nicht sein, solange es keine öffentliche Modellkennung und keine veröffentlichte Preisliste hat, also sollte niemand eine Routing-Behauptung in irgendetwas oben hineinlesen. Wenn Google Argon mit einer ID auf eine API bringt, wird es zu einer Routing-Frage. Bis dahin ist die ehrliche Version der OrcaRouter-Antwort, dass sie noch nicht zutrifft, und das Nützliche, was der Katalog für diese spezielle Entscheidung tut, ist, dass er Ihnen ermöglicht, die Preise für die Modelle, die tatsächlich aufrufbar sind Seite an Seite zu vergleichen, ohne vier Konten zu eröffnen, um es herauszufinden.

Das Fazit

Gemini 4 Argon ist Googles Flaggschiff und nicht sein Frontier-Modell. Es erzielt 52,56 im v4.3.2-Index von Artificial Analysis bei hohem Aufwand – auf Augenhöhe mit Claude Fable 5.1 und GPT-6 Astra, fünf Punkte hinter Claude Opus 5.5 und hinter Claude Sonnet 5.5, einem günstigeren Modell aus einem konkurrierenden Labor. Google setzte den Einführungspreis auf $2/$10, der auf $4/$20 steigt, womit sein endgültiger Preis genau auf dem von Claude Opus 5.5 landet – bei messbar geringerer Leistungsfähigkeit. Sein Vorsprung von 11,6 Punkten gegenüber Gemini 3.8 Flash ist der größte Generationsabstand in Googles eigener Produktpalette, und er ist der stärkste Beleg dafür, dass die Gemini-4-Generation ein echter Sprung nach vorn und keine bloße Umetikettierung ist.

Zu der Frage, die das alles ausgelöst hat: Es gibt kein Gemini 4 Ultra. Googles Ultra-Pfad auf seiner eigenen Domain leitet auf eine Seite mit Abonnementplänen weiter, der Modellkarten-Index enthält überhaupt keinen Eintrag zu Gemini 4, jedes Ankündigungs-URL-Muster für einen Beitrag zu Gemini 4 Ultra liefert 404, und der Launch-Beitrag kündigt ein Modell an, ohne eine Familie zu versprechen. Das ist ein echter Befund und First-Party-Evidenz statt einer Schlussfolgerung, aber es ist auch eine Tatsache mit kurzer Halbwertszeit – ein einziges 200 auf einem Pfad widerlegt sie, und die Pro-Stufe der Generation Gemini 4 ist diejenige, die eher zuerst erscheinen dürfte.

Zwei Einschränkungen, die aus diesem Beitrag mitzunehmen sind. Jede Argon-Zahl hier ist die Messung eines anderen an einem Modell, das niemand außerhalb einer überprüften Kohorte von Cyber-Verteidigern aufrufen kann, und Googles eigene Tabelle mit neunzehn Zeilen ist eine Behauptung statt einer Messung – nützlich für das, was sie ist, und kein Ersatz für den unabhängigen Index. Und das faire Urteil zur Frage der Stufen ist vorläufig: Argon wird bei hohem Aufwand gemessen, nicht bei maximalem, und ein Lauf mit maximalem Aufwand ist die billigste mögliche Art, wie dieser Artikel falsch liegen kann.

In diesem Artikel verglichen4

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert