Hero-Titelkarte mit der Aufschrift „Gemini 4 Argon auf FrontierSWE: Es ruft Eureka, dann benotet es seine eigene Hausaufgabe“, mit einem Chip mit der Aufschrift „FrontierSWE v2 55,0 Prozent Mittelwert bei 5“, einem Chip mit der Aufschrift „Dritter von zehn Modellen“ und einem Chip mit der Aufschrift „129,36 Dollar pro Versuch“ sowie einer Fußzeile mit der Aufschrift „FrontierSWE-Zahlen laut der öffentlichen Bestenliste von Proximal Labs, 2026-09-30“.
Guides & Insights

Gemini 4 Argon on FrontierSWE: Es ruft „Eureka!“, dann benotet es seine eigene Hausaufgabe

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Gemini 4 Argon hat ein Persönlichkeitsproblem, und das ist das Interessanteste, was jemand über das Modell gesagt hat, seit Go​ogle es am 30. September 2026 angekündigt hat. Im Ultra-Long-Horizon-Benchmark FrontierSWE hinterließ das Modell, das Dritter wurde – hinter GPT-6 Astra und Claude Opus 5.5 –, bei seinen Evaluatoren einen bleibenden Eindruck: Sein Lieblingswort ist „Eureka!“, und es verbringt einen großen Teil des Zwanzig-Stunden-Aufgabenbudgets damit, extrem streng mit sich selbst zu sein. Das ist eine an einen Leak angrenzende Beobachtung aus einer einzigen Quelle von einem Benchmark-Betreiber, keine Herstellerangabe und kein Versionshinweis, und es lohnt sich, genau zu sein, was sie einem sagt und was nicht. An keines der drei oben genannten Modelle ist ein GA-Termin für Argon geknüpft; die Beobachtung betrifft das Verhalten innerhalb eines Test-Harness, und die Zahlen, die damit einhergehen, sind die erste unabhängige Messung von Argon in einem Benchmark, den Go​ogle nicht selbst durchführt.

Was die „Eureka!“-Bemerkung tatsächlich ist

Die Quelle ist ein Beitrag von @nrehiew_, einem Ingenieur, der an Modellevaluierung arbeitet, veröffentlicht am 30.09.2026, der Sundar Pichais Ankündigung zu Gemini 4 Argon zitiert. Der Kern besteht aus drei Aussagen: Argon ist das unterhaltsamste Modell, das sie auf FrontierSWE evaluiert haben; sein Lieblingswort ist „Eureka!“; und es ist extrem selbstkritisch. Der Verfasser beschreibt es als eine große Verbesserung gegenüber früheren Geminis, während es diese Persönlichkeit beibehält, und nennt es beeindruckend.

Lesen Sie das sorgfältig, denn es ist leicht, zu viel hineinzulesen. Es ist der Eindruck eines einzelnen Bewerters, der Agenten-Traces beobachtet hat, kein bewertetes Ergebnis, keine veröffentlichte Metrik und nichts, das Proximal Labs – die FrontierSWE entwickeln und betreiben – als Befund mit ihrem Namen versehen haben. In der Rangliste gibt es keine Spalte „Selbstkritik“. Was die Bemerkung es wert macht, darüber zu schreiben, ist nicht, dass sie maßgeblich ist; es ist, dass sie die einzige qualitative Einschätzung ist, die irgendjemand außerhalb von Google zu Argon abgegeben hat, und weil das Modell nicht allgemein verfügbar ist, sind Traces wie diese derzeit die einzige Möglichkeit, das Ding in Aktion zu sehen.

Es führt auch zu einer echten Frage für jeden, der vorhat, Argon als Agenten zu betreiben. Coding-Läufe mit langem Horizont sind größtenteils ein Budgetverwaltungsproblem: Ein Modell, das sich selbst unterbricht, um neu abzuwägen, das seine eigenen Zwischenergebnisse bewertet und das Durchbrüche verkündet, ist ein Modell, das Tokens für den Prozess ausgibt. Ob das eine Stärke oder eine Belastung ist, hängt ganz davon ab, ob die Selbstkritik konvergiert oder in Schleifen gerät. Ein einzelner Evaluator, der „beeindruckend“ sagt, ist ein Datenpunkt, keine Antwort.

FrontierSWE v2, und warum der dritte Platz die eigentliche Geschichte ist

FrontierSWE ist nicht die Art von Benchmark, aus der man eine Schlagzeilenzahl ablesen kann. Er wird von Proximal Labs entwickelt und in ihrem Repository als ein Ultra-Long-Horizon-Benchmark für Coding-Agents beschrieben, der Implementierung, Performance-Engineering und ML-Forschung testet. Version 2 erschien im September 2026 mit 21 neuen Aufgaben zusätzlich zum ursprünglichen Set, insgesamt 34, und erwartet, dass ein Agent bis zu zwanzig Stunden weiterarbeitet. Alles läuft über Proximals eigenen Harness, proximus, der auf mini-swe-agent aufbaut und Kontextkompaktierung, Vision und ein explizites Submit-Tool hinzufügt. Die Bewertung erfolgt mit mean@5 — dem Durchschnitt aus fünf Versuchen pro Aufgabe —, wobei das angegebene Unsicherheitsband vom Durchschnitt des schlechtesten Laufs jeder Aufgabe bis zum Durchschnitt ihres besten Laufs reicht.

Diese Methodik ist wichtig, um Argons Zeile ehrlich zu lesen:

• Punktzahl — Gemini 4 Argon 55,0 % mean@5, ±9,9, gegenüber GPT-6 Astra 65,5 % und Claude Opus 5.5 62,3 %

• Streuung — Argons Läufe reichen von 44,5 % (worst@5) bis 64,3 % (best@5), eine Spanne, die sich am oberen Ende mit dem Bereich von Opus 5.5 (52,0 %–71,5 %) und dem von Astra (55,1 %–73,0 %) überschneidet

• Kosten pro Testlauf — Argon 129,36 $, Opus 5.5 98,87 $, Astra 1.029,65 $

• Wall-Clock-Zeit pro Durchlauf — Argon 10,6 Stunden, Opus 5.5 14,2 Stunden, Astra 12,1 Stunden

Das Erste, was auffällt, ist, dass Argon Dritter ist und punktemäßig nicht nahe an Platz zwei liegt. Das Zweite – das, was entscheiden sollte, ob es Sie interessiert – ist, dass Argon in diesem Benchmark von Claude Opus 5.5 strikt dominiert wird. Opus 5.5 erzielte eine höhere Punktzahl (62,3 % vs. 55,0 %) und kostete weniger pro Versuch (98,87 $ vs. 129,36 $). Es gibt hier keine Achse, auf der Argon gewinnt. Sein einziger Vorteil ist die Zeit: 10,6 Stunden gegenüber 14,2 bei Opus 5.5, was real ist, wenn Sie nach Wall-Clock-Zeit und nicht nach Tokens bezahlen, und irrelevant, wenn Sie nach einem Budget pro Versuch bezahlen.

Proximals eigene Rangliste enthält eine Fußnote zur Zeile von Argon, die jeder, der diese Zahl zitiert, wiederholen sollte: „Gemini 4 Argon: Die Cache-Trefferrate ist aufgrund einer Nicht-Produktions-Einstellung viel niedriger.“ Damit kennzeichnen die Evaluatoren, dass sie Argon außerhalb der Konfiguration ausgeführt haben, die ein Produktions-Deployment verwenden würde, was seine Kosten und plausiblerweise auch seine Latenz in die Höhe treibt. Es ist ein Vorbehalt speziell zur Kostenangabe, und es ist der Grund dafür, dass die 129,36 US-Dollar als Obergrenze und nicht als Preisliste gelesen werden sollten.

Die Zahl, die Googles eigene Grafik nicht zeigt

Hier wird die Quellenrecherche wirklich interessant, und hier werden die meisten Berichte über dieses Ergebnis falsch liegen. Der Ankündigungsbeitrag von Google enthält ein Benchmark-Diagramm mit einer FrontierSWE-v2-Zeile. Diese Zeile liest sich: GPT-6 Astra 65,5 %, Claude Fable 5.1 56,3 %, Claude Opus 5.5 62,3 %. Gemini 4 Argon ist nicht darin enthalten. Das Live-Leaderboard von Proximal führt Astra mit 65,5 % und Opus 5.5 mit 62,3 % – dieselben Werte –, setzt Claude Fable 5.1 aber auf 56,5 %, nicht 56,3 %, und führt Gemini 4 Argon mit 55,0 % auf.

Der Grund für die Auslassung ist nicht rätselhaft, und Google sagt es selbst: Die Methodikhinweise, die ihrer Evaluationssuite beiliegen, besagen, dass FrontierSWE-Ergebnisse von Proximals offiziellem öffentlichen Leaderboard übernommen werden. Google hat diesen Benchmark nicht selbst berechnet. Sie zitieren dieselbe dritte Partei wie wir, und die einzige Argon-Zahl, die diese dritte Partei veröffentlicht, ist die 55,0 %. Die ehrliche Lesart ist also, dass Argons FrontierSWE-Wert eine wirklich unabhängige Messung ist – Proximal hat sie durchgeführt, mit ihrem eigenen Harness, auf ihren eigenen Aufgaben – und dass sie Argon hinter zwei Wettbewerbern einordnet.

Alles andere in Googles Diagramm ist von Anbietern gemeldet und sollte im Kopf auch so gekennzeichnet werden: Argon 63,1 % auf dem Vals Index gegenüber 67,0 % von Opus 5.5, 41,4 % AutomationBench gegenüber 42,5 % von Opus 5.5, 89,6 % Vibe Code Bench gegenüber 90,3 % für sowohl Astra als auch Opus 5.5, 87,5 % LVBench gegenüber 83,7 %, 68,0 % CWE-bench v1 gegenüber 67,0 % von Opus 5.5. Das sind Googles Durchläufe von Googles ausgewählten Evaluierungen. Die FrontierSWE-Zeile ist die einzige in diesem Bild, die ein Leser unabhängig überprüfen kann, weshalb der dritte Platz mehr Gewicht trägt als das Muster aus Gleichstand oder knappem Sieg um sie herum.

Was Artificial Analysis unabhängig sagt

FrontierSWE ist eine Linse. Artificial Analysis ist die andere, und sie stimmt mit der Form der Geschichte überein. In ihrem Intelligence Index v4.3.2 erreicht Gemini 4 Argon in seiner hohen Reasoning-Konfiguration 52,56 — unabhängig auf ihrer eigenen Hardware gemessen, nicht von Google gemeldet — zu einem Listenpreis von 2,00 $ pro Million Eingabe-Token und 10,00 $ pro Million Ausgabe-Token, mit einem Rabatt von 95 % auf zwischengespeicherte Eingaben. Ihre Instrumentierung beziffert die Kosten einer einzelnen Index-Aufgabe auf 1,99 $.

Der Vergleich, der zählt, ist derselbe, den FrontierSWE erstellt hat. Claude Opus 5.5 erzielt in seiner High-Konfiguration einen höheren Wert auf dem Index, 53,58, bei niedrigeren Kosten pro Aufgabe, 1,82 $. Zwei unabhängige Evaluatoren, die unterschiedliche Aufgaben und unterschiedliche Testumgebungen verwenden, stufen Argon sowohl bei der Qualität als auch bei den Kosten hinter Opus 5.5 ein. Das ist ein konsistentes Signal und nicht ein einzelnes Benchmarking-Artefakt, und es ist das Stärkste, was man derzeit über die Wirtschaftlichkeit von Gemini 4 Argon sagen kann.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

Angekündigt, nicht veröffentlicht – und warum diese Formulierung keine Haarspalterei ist

Es gibt keine Modell-ID Gemini 4 Argon. Der Zugang wird im Rahmen des Fairwind-Programms nach und nach für geprüfte Cyber-Verteidiger:innen freigeschaltet, parallel zu einer schrittweisen Öffnung für zahlende API-Kunden und Google AI Ultra-Abonnenten; ein Datum für die allgemeine Verfügbarkeit wurde nicht veröffentlicht. Googles Beitrag ist die Ankündigung eines Modells und einer Reihe von Evaluierungen, nicht die Markteinführung eines Endpunkts, den man aufrufen kann. Wenn Sie Berichterstattung gelesen haben, die dies als Veröffentlichung beschrieben hat, dann eilt diese Berichterstattung den Tatsachen voraus.

Diese Unterscheidung hat praktische Konsequenzen für alle, die den FrontierSWE-Wert lesen. Die Evaluation wurde gegen ein Modell ausgeführt, auf das Proximal im Rahmen einer Vereinbarung Zugriff hatte; sie sagt Ihnen, was das Modell leisten kann, nicht, was Sie bekommen können. Das bedeutet außerdem, dass die Leistungskennzahlen eine kürzere Halbwertszeit als üblich haben. Ein Modell, das noch nicht allgemein verfügbar (GA) ist, kann sich noch ändern – Decodierungseinstellungen, System-Prompts, Standardeinstellungen für die Tool-Nutzung und Sicherheits-Scaffolding werden alle noch abgestimmt, und der angegebene Grund, warum die Cache-Trefferrate von Argon schlecht war, ist genau der, dass die Evaluierenden keine Produktionskonfiguration ausgeführt haben. Rechnen Sie damit, dass sich die 55,0 % und die 129,36 $ ändern.

Was würde dieses Bild ändern: eine veröffentlichte Modell-ID mit einer Preisliste, ein GA-Datum, ein FrontierSWE-Rerun unter Produktionseinstellungen und ein zweiter unabhängiger Evaluator, der das Ergebnis des dritten Platzes reproduziert. Bis mindestens die ersten beiden davon vorliegen, behandle jede Argon-Zahl – einschließlich der guten in Googles eigenem Diagramm – als vorläufig.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

Die Persönlichkeitsdeutung ist der Teil, der am besten altern wird.

Benchmark-Werte für ein Pre-GA-Modell haben eine Haltbarkeit, die in Wochen gemessen wird. Die Verhaltensbeobachtung nicht. Langhorizontige Agentenarbeit ist der Bereich, in dem der Charakter eines Modells tatsächlich sichtbar wird, denn ein Zwanzig-Stunden-Budget mit 34 Aufgaben bietet genug Spielraum, damit sich die Tendenzen eines Modells kumulieren: wie es sich von einem gescheiterten Ansatz erholt, ob es stoppt, um neu zu planen, ob es den Unterschied zwischen einem schwierigen Problem und einer falschen Abzweigung erkennen kann. Ein Evaluator, der viele dieser Traces beobachtet, in denen ein Modell als selbstkritisch und als dazu neigend beschrieben wird, auszurufen, wenn etwas funktioniert, beschreibt damit ein Modell, das sein Reasoning über den eigenen Fortschritt externalisiert. Das ist eine Hypothese dazu, warum die Runs von Argon von 44,5 % bis 64,3 % streuen – ein breiteres Band als bei Opus 5.5 – und sie ist testbar, sobald das Modell aufrufbar ist.

Die andere Hälfte der Bemerkung ist diejenige, bei der Skepsis angebracht ist. „Eine große Verbesserung gegenüber früheren Geminis“ ist ein Vergleich mit Modellen, die nie in diesem Benchmark unter diesem Harness bewertet wurden, sodass er überhaupt nicht anhand des Leaderboards überprüft werden kann. Es ist ein Eindruck, und als solcher sollte er behandelt werden, so glaubwürdig die Person, die ihn äußert, auch sein mag.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

Was das für Sie bedeutet, wenn Sie heute tatsächlich einen Agenten mit langem Zeithorizont benötigen

Man kann Gemini 4 nicht Argon nennen, daher ist die praktische Frage nicht Argon gegen irgendetwas – sondern, welches Modell Sie für die Arbeit laufen lassen sollten, für die Argon benchmarkiert wurde. Die eigene Rangfolge von FrontierSWE beantwortet das: GPT-6 Astra führt die Rangliste mit 65,5 % an, aber zu 1.029,65 $ pro Versuch, rund zehnmal so viel wie die Kosten der beiden Modelle darunter, während Claude Opus 5.5 62,3 % für 98,87 $ liefert. Der Preis-Leistungs-Tipp in diesem Benchmark ist Opus 5.5, und es ist außerdem das Modell, das Argon bei Artificial Analysis zu niedrigeren Kosten pro Aufgabe geschlagen hat.

Beide dieser Modelle – und die meisten der Top Ten des Leaderboards, darunter GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp und Muse Spark 1.2 – lassen sich über OrcaRouters einzelne API routen neben über 200 weiteren – ein Schlüssel, 0 % Aufschlag, sodass der Listenpreis des Anbieters genau das ist, was Sie zahlen, und eine Preissenkung eines Anbieters noch am selben Tag bei uns ankommt. Diese letzte Eigenschaft ist bei einem Pre-GA-Modell mehr wert als sonst: Sollte sich Argons Preisgestaltung zwischen jetzt und GA ändern, worauf die Fußnote zum Nicht-Produktions-Cache hindeutet, ändert sich nichts an Ihrer Integration, wenn es dazu kommt. Automatisches Failover ist das andere Element, das zu diesem speziellen Fall passt – ein unbekanntes Modell, dessen Fehlermodi noch niemand kartiert hat, ist genau das, was Sie nicht auf einem einzigen fest verdrahteten Produktionspfad haben wollen.

Um eines ganz deutlich zu sagen: Gemini 4 Argon ist nicht in unserem Katalog. Eine Abfrage gegen unsere öffentliche Modell-API für google/gemini-4-argon liefert „model not found“, und niemand sonst hostet es ebenfalls – es ist hinter Googles Fairwind Program gated, ohne veröffentlichte Modell-ID. Wenn es aufrufbar wird, werden wir es routen, und die FrontierSWE-Zahlen oben sind der Grund, auf diesen Tag zu achten, statt auf ihn zu warten. Die Modelle, gegen die es verloren hat, sind bereits dort.

Was zu sehen

Die Signale, die dies von einem Was-wir-bisher-wissen in eine Entscheidung verwandeln würden, sind konkret. Eine veröffentlichte Modell-ID und ihre Preisliste. Ein Datum für die allgemeine Verfügbarkeit. Ein erneuter FrontierSWE-Lauf unter Produktionseinstellungen, der klären würde, ob die Kosten von 129,36 $ pro Testlauf ein echter Tarif oder ein Artefakt der Cache-Konfiguration sind, die Proximal geflaggt hat. Und idealerweise ein zweiter Evaluator, der Argon-Traces veröffentlicht, damit die „Heureka!“-Beobachtung aufhört, eine Stichprobe der Größe eins zu sein.

Bis dahin ist die ehrliche Zusammenfassung eng und es lohnt sich, an ihr festzuhalten: Gemini 4 Argon ist angekündigt, es ist laut einem Evaluator ungewöhnlich ausdrucksstark bei Long-Horizon-Agent-Traces, und auf dem einzigen unabhängigen Benchmark, den wir überprüfen können, belegte es den dritten Platz hinter zwei Modellen – von denen eines es gleichzeitig bei Punktzahl und Kosten übertraf.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert