Karta tytułowa hero z napisem „Gemini 4 Argon na FrontierSWE: krzyczy »Eureka«, a potem ocenia własną pracę domową”, z chipem o treści „FrontierSWE v2: średnia 55,0 procent przy 5”, z chipem o treści „Trzeci z dziesięciu modeli” oraz z chipem o treści „129,36 dolara za próbę”, a także linia stopki o treści „Dane FrontierSWE według publicznego rankingu Proximal Labs, 2026-09-30”.
Guides & Insights

Gemini 4 Argon w FrontierSWE: Krzyczy „Eureka!”, a potem ocenia własną pracę domową

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 4 Argon ma problem z osobowością i jest to najciekawsza rzecz, jaką ktokolwiek powiedział o tym modelu od czasu, gdy Google ogłosiło go 30 września 2026 r. W benchmarku FrontierSWE o ultradługim horyzoncie model, który zajął trzecie miejsce — za GPT-6 Astra i Claude Opus 5.5 — wywarł na swoich oceniających niezapomniane wrażenie: jego ulubionym słowem jest „Eureka!”, a znaczną część dwudziestogodzinnego budżetu zadania spędza, będąc wobec siebie wyjątkowo surowym. To obserwacja z pogranicza przecieku, pochodząca z jednego źródła, od operatora benchmarku — nie twierdzenie dostawcy i nie notatka o wydaniu — i warto być precyzyjnym co do tego, co ona mówi, a czego nie. Żaden z trzech powyższych modeli nie ma przypisanej daty GA dla Argonu; obserwacja dotyczy zachowania wewnątrz środowiska testowego, a towarzyszące jej liczby to pierwszy niezależny pomiar Argonu w benchmarku, którego Google nie prowadzi samodzielnie.

Czym tak naprawdę jest uwaga „Eureka!”

Źródłem jest post od @nrehiew_, inżyniera zajmującego się ewaluacją modeli, opublikowany 30.09.2026, cytujący ogłoszenie Sundara Pichaia o Gemini 4 Argon. Sedno to trzy twierdzenia: Argon jest najzabawniejszym modelem, jaki oceniali na FrontierSWE; jego ulubionym słowem jest „Eureka!”; i jest niezwykle samokrytyczny. Autor posta opisuje go jako dużą poprawę względem poprzednich modeli Gemini, przy zachowaniu tej osobowości, i nazywa go imponującym.

Przeczytaj to uważnie, bo łatwo o nadinterpretację. To wrażenie jednego ewaluatora z obserwowania śladów agentów, a nie wynik z punktacją, nie opublikowana metryka i nie coś, co Proximal Labs — które buduje i prowadzi FrontierSWE — firmuje jako ustalenie. W tabeli wyników nie ma kolumny „samokrytyka”. To, co sprawia, że ta uwaga jest warta opisania, nie polega na tym, że jest autorytatywna; polega na tym, że jest jedynym jakościowym odczytem, jaki ktokolwiek spoza Google zaproponował na temat Argonu, a ponieważ model nie jest ogólnie dostępny, takie ślady są obecnie jedynym sposobem, by zobaczyć, jak ta rzecz się zachowuje.

To również sprowadza się do prawdziwego pytania dla każdego, kto planuje uruchamiać Argon jako agenta. Długoterminowe przebiegi kodowania to w większości problem zarządzania budżetem: model, który przerywa sam sobie, aby coś ponownie przemyśleć, który ocenia własną pracę pośrednią i który ogłasza przełomy, to model, który wydaje tokeny na proces. To, czy jest to mocna strona, czy obciążenie, zależy wyłącznie od tego, czy samokrytyka zbiega, czy wpada w pętlę. Pojedynczy ewaluator mówiący „imponujące” to punkt danych, a nie odpowiedź.

FrontierSWE v2 i dlaczego trzecie miejsce jest prawdziwą historią

FrontierSWE nie jest benchmarkiem, z którego można odczytać jedną liczbę nagłówkową. Został stworzony przez Proximal Labs i opisany w ich repozytorium jako ultradługohoryzontowy benchmark agentów kodujących, testujący implementację, inżynierię wydajności i badania ML. Wersja 2 została wydana we wrześniu 2026 roku z 21 nowymi zadaniami dodanymi do pierwotnego zestawu, co daje łącznie 34, i zakłada, że agent będzie pracował nieprzerwanie nawet przez dwadzieścia godzin. Wszystko jest uruchamiane przez własny harness Proximal, proximus, który jest zbudowany na mini-swe-agent i dodaje kompakcję kontekstu, widzenie oraz jawne narzędzie do przesyłania. Punktacja to mean@5 — średnia z pięciu prób na zadanie — a podawany przedział niepewności rozciąga się od średniej z najgorszego przebiegu każdego zadania do średniej z jego najlepszego przebiegu.

Ta metodologia ma znaczenie dla uczciwego odczytania wiersza Argonu:

• Wynik — Gemini 4 Argon 55,0% średnia@5, ±9,9, w porównaniu z GPT-6 Astra 65,5% i Claude Opus 5.5 62,3%

• Rozrzut — pasmo wyników Argonu rozciąga się od 44,5% (worst@5) do 64,3% (best@5); zakres ten pokrywa się u góry z przedziałem Opus 5.5 (52,0%–71,5%), a z przedziałem Astry (55,1%–73,0%) nie pokrywa się wcale

• Koszt na próbę — Argon $129.36, Opus 5.5 $98.87, Astra $1,029.65

• Czas rzeczywisty na próbę — Argon 10,6 godziny, Opus 5,5 14,2 godziny, Astra 12,1 godziny

Pierwszą rzeczą, którą zauważasz, jest to, że Argon jest trzeci i pod względem wyniku nie jest blisko drugiego. Drugą rzeczą — tą, która powinna zdecydować, czy cię to obchodzi — jest to, że w tym benchmarku Argon jest ściśle zdominowany przez Claude Opus 5.5. Opus 5.5 uzyskał wyższy wynik (62,3% wobec 55,0%) i kosztował mniej na próbę (98,87 USD wobec 129,36 USD). Nie ma tu żadnej osi, na której Argon wygrywa. Jego jedyna przewaga to czas: 10,6 godziny wobec 14,2 godziny w przypadku Opus 5.5 — co ma znaczenie, jeśli płacisz za czas zegarowy, a nie za tokeny, i nie ma znaczenia, jeśli rozliczasz się w oparciu o budżet na próbę.

Własny ranking Proximal zawiera przypis przy wierszu Argon, który każdy cytujący tę liczbę powinien powtórzyć: „Gemini 4 Argon: współczynnik trafień pamięci podręcznej jest znacznie niższy z powodu ustawienia nieprodukcyjnego”. To oceniający sygnalizują, że uruchomili Argon poza konfiguracją, jakiej użyłoby wdrożenie produkcyjne, co zawyża jego koszt i prawdopodobnie także opóźnienie. To zastrzeżenie dotyczy konkretnie wartości kosztu i jest powodem, dla którego 129,36 USD należy odczytywać jako górną granicę, a nie cennik.

Liczba, której nie pokazuje własny wykres Google

I tu właśnie kwestia źródeł staje się naprawdę interesująca i tu większość tekstów o tym wyniku popełni błąd. Post ogłaszający Google zawiera wykres benchmarku z wierszem FrontierSWE v2. W tym wierszu podano: GPT-6 Astra 65,5%, Claude Fable 5.1 56,3%, Claude Opus 5.5 62,3%. Nie ma tam Gemini 4 Argon. Aktualna tabela wyników Proximal podaje Astrę na 65,5%, a Opus 5.5 na 62,3% — te same liczby — ale Claude Fable 5.1 umieszcza na 56,5%, a nie 56,3%, i wymienia Gemini 4 Argon z 55,0%.

Powód pominięcia nie jest tajemniczy, i sam Google to mówi: notatki metodologiczne dołączone do ich zestawu ewaluacyjnego stwierdzają, że wyniki FrontierSWE są raportowane z oficjalnej publicznej tabeli liderów Proximal. Google nie obliczył tego benchmarku samodzielnie. Cytują ten sam podmiot trzeci co my, a jedyną liczbą dotyczącą Argon, którą ten podmiot trzeci publikuje, jest 55,0%. Uczciwa interpretacja jest więc taka, że wynik Argon w FrontierSWE jest rzeczywiście niezależnym pomiarem — Proximal przeprowadził go, w swoim środowisku testowym, na swoich zadaniach — i że plasuje to Argon za dwoma konkurentami.

Wszystko inne na wykresie Google'a jest raportowane przez dostawcę i właśnie tak należy to sobie oznaczać w głowie: Argon 63,1% w Vals Index w porównaniu z 67,0% Opus 5.5, 41,4% w AutomationBench w porównaniu z 42,5% Opus 5.5, 89,6% w Vibe Code Bench w porównaniu z 90,3% zarówno dla Astra, jak i Opus 5.5, 87,5% w LVBench w porównaniu z 83,7%, 68,0% w CWE-bench v1 w porównaniu z 67,0% Opus 5.5. To uruchomienia wykonane przez Google na wybranych przez Google ewaluacjach. Wiersz FrontierSWE to jedyny element na tym obrazie, który czytelnik może niezależnie sprawdzić, i właśnie dlatego trzecie miejsce ma większe znaczenie niż otaczający go wzorzec remisów lub nieznacznych zwycięstw.

Co niezależnie mówi Artificial Analysis

FrontierSWE to jedna perspektywa. Artificial Analysis to druga i zgadza się z kształtem tej historii. W ich Intelligence Index v4.3.2 Gemini 4 Argon w konfiguracji wysokiego rozumowania uzyskuje wynik 52,56 — zmierzony niezależnie na ich własnym sprzęcie, a nie zgłoszony przez Google — przy cenie katalogowej 2,00 USD za milion tokenów wejściowych i 10,00 USD za milion tokenów wyjściowych, z 95-procentową zniżką na tokeny wejściowe z pamięci podręcznej. Ich narzędzia pomiarowe określają koszt pojedynczego zadania w indeksie na 1,99 USD.

Porównanie, które ma znaczenie, to to samo, które przedstawiło FrontierSWE. Claude Opus 5.5 w konfiguracji high osiąga wyższy wynik w indeksie — 53,58 — przy niższym koszcie na zadanie — 1,82 USD. Dwóch niezależnych ewaluatorów, wykorzystując różne zadania i różne zestawy testowe, uplasowało Argon poniżej Opus 5.5 zarówno pod względem jakości, jak i kosztu. To spójny sygnał, a nie pojedynczy artefakt benchmarku, i jest to najmocniejsze stwierdzenie, jakie można obecnie sformułować na temat ekonomiki Gemini 4 Argon.

A two-column scoreboard comparing Gemini 4 Argon and Claude Opus 5.5 on six dimensions. Gemini 4 Argon reads: FrontierSWE v2 mean at 5 55.0 percent, FrontierSWE spread 44.5 to 64.3 percent, FrontierSWE cost per trial 129 dollars 36, FrontierSWE wall clock 10.6 hours, AA Intelligence Index 52.6, AA cost per index task 1 dollar 99. Claude Opus 5.5 reads: FrontierSWE v2 mean at 5 62.3 percent, FrontierSWE spread 52.0 to 71.5 percent, FrontierSWE cost per trial 98 dollars 87, FrontierSWE wall clock 14.2 hours, AA Intelligence Index 53.6, AA cost per index task 1 dollar 82. A footer line reads that FrontierSWE v2 figures are per Proximal Labs' public leaderboard as of 2026-09-30 with Argon's cost marked as a non-production cache setting, and that AA figures are per Artificial Analysis Intelligence Index v4.3.2.

Zapowiedziane, nie wydane — i dlaczego takie ujęcie nie jest pedanterią

Nie istnieje identyfikator modelu Gemini 4 Argon. Dostęp jest udostępniany stopniowo w ramach Programu Fairwind zweryfikowanym specjalistom ds. cyberbezpieczeństwa, równolegle z etapowym otwieraniem dla płatnych klientów API i subskrybentów Google AI Ultra, przy czym nie opublikowano daty ogólnej dostępności. Wpis Google to ogłoszenie modelu i zestawu ewaluacji, a nie premiera punktu końcowego, który można wywołać. Jeśli czytasz materiały, które opisywały to jako wydanie, to wyprzedzają one fakty.

To rozróżnienie ma praktyczne konsekwencje dla każdego, kto czyta liczbę FrontierSWE. Ewaluację przeprowadzono na modelu, do którego Proximal miał dostęp w ramach pewnych ustaleń; mówi ona, co model potrafi, a nie co możesz mieć. Oznacza to również, że wskaźniki wydajności mają krótszy okres przydatności niż zwykle. Model, który nie osiągnął jeszcze statusu GA, może się jeszcze zmienić — ustawienia dekodowania, prompty systemowe, domyślne ustawienia korzystania z narzędzi i mechanizmy zabezpieczeń są wciąż dostrajane, a podany powód niskiego współczynnika trafień pamięci podręcznej Argon jest dokładnie taki, że oceniający nie korzystali z konfiguracji produkcyjnej. Spodziewaj się, że 55,0% i 129,36 USD ulegną zmianie.

Co zmieniłoby ten obraz: opublikowany identyfikator modelu wraz z cennikiem, data GA, ponowne uruchomienie FrontierSWE w ustawieniach produkcyjnych oraz drugi niezależny ewaluator odtwarzający wynik trzeciego miejsca. Dopóki nie istnieją przynajmniej pierwsze dwa z nich, traktuj każdą liczbę modelu Argon — w tym te dobre na wykresie samego Google — jako wstępną.

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated 2026-09-30, credited to Koray Kavukcuoglu, with a standfirst describing frontier performance in complex workflows, cyber defense and software engineering and a benchmark chart whose FrontierSWE v2 row lists GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5 but omits Gemini 4 Argon.

Odczyt osobowości to ta część, która najlepiej się zestarzeje.

Wyniki benchmarków dla modelu pre-GA mają termin przydatności mierzony w tygodniach. Obserwacja behawioralna już nie. Praca agentowa w długim horyzoncie to miejsce, w którym naprawdę ujawnia się charakter modelu, ponieważ dwudziestogodzinny budżet na 34 zadania to wystarczająco dużo liny, by skłonności modelu się kumulowały: jak podnosi się po nieudanym podejściu, czy zatrzymuje się, by ponownie zaplanować, czy potrafi odróżnić trudny problem od błędnej ścieżki. Ewaluator, który ogląda wiele takich śladów, opisując model jako samokrytyczny i skłonny do wykrzykiwania, gdy coś zadziała, opisuje model, który uzewnętrznia swoje rozumowanie o własnych postępach. To hipoteza wyjaśniająca, dlaczego przebiegi Argonu rozciągają się od 44,5% do 64,3% — szerszy zakres niż w przypadku Opus 5.5 — i można ją przetestować, gdy będzie można wywołać model.

Druga połowa tej uwagi to ta, do której należy podchodzić sceptycznie. „Duża poprawa w stosunku do poprzednich Gemini” to porównanie z modelami, które nigdy nie były oceniane na tym benchmarku w tym środowisku testowym, więc nie da się go w ogóle zweryfikować z tabelą liderów. To wrażenie i tak należy je traktować, niezależnie od tego, jak wiarygodna jest osoba, która je przedstawia.

A capture of the FrontierSWE public leaderboard showing ten models ranked by mean at 5. GPT-6 Astra leads at 65.5 percent, Claude Opus 5.5 second at 62.3 percent, Gemini 4 Argon third at 55.0 percent with a spread of 9.9, followed by GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp, Muse Spark 1.2 and Inkling, with per-trial average cost and time columns and a footnote that Gemini 4 Argon's cache hit rate is much lower due to a non-production setting.

Co to dla ciebie oznacza, jeśli faktycznie potrzebujesz dziś agenta o długim horyzoncie działania

Nie możesz wywołać Gemini 4 Argon, więc praktyczne pytanie nie brzmi: Argon kontra cokolwiek — lecz: który model powinieneś uruchamiać do pracy, na której benchmarkowano Argon. Własny ranking FrontierSWE odpowiada na to: GPT-6 Astra prowadzi w tabeli z 65,5%, ale przy 1029,65 USD za próbę, około dziesięciokrotnie drożej niż dwa modele poniżej, podczas gdy Claude Opus 5.5 osiąga 62,3% za 98,87 USD. Najlepszym wyborem pod względem stosunku ceny do jakości w tym benchmarku jest Opus 5.5, a to także model, który pokonał Argon w Artificial Analysis przy niższym koszcie na zadanie.

Oba te modele, a także większość z pierwszej dziesiątki rankingu — w tym GLM-5.3, Grok 4.7, Kimi K3, Qwen3.8-Max, DeepSeek V4 Flash Vision Exp i Muse Spark 1.2 — można kierować przez jedno API OrcaRouter obok ponad 200 innych — jeden klucz, 0% narzutu, więc cena katalogowa dostawcy to dokładnie to, co płacisz, a obniżka ceny przez dostawcę trafia do nas tego samego dnia. Ta ostatnia właściwość jest warta więcej niż zwykle w przypadku modelu przed GA: jeśli cennik Argonu zmieni się między teraz a GA, co — jak sugeruje przypis o nieprodukcyjnej pamięci podręcznej — może nastąpić, nic w Twojej integracji się nie zmieni, gdy to nastąpi. Automatyczne przełączanie awaryjne to drugi element, który pasuje do tego konkretnego przypadku — nieznany model, którego tryby awarii nikt jeszcze nie zmapował, to dokładnie to, czego nie chcesz na jednej zakodowanej na sztywno ścieżce produkcyjnej.

Żeby było jasne co do jednej rzeczy: Gemini 4 Argon nie znajduje się w naszym katalogu. Sprawdzenie w naszym publicznym API modeli dla google/gemini-4-argon zwraca „model not found”, a nikt inny też go nie hostuje — jest dostępny wyłącznie w ramach programu Fairwind Google’a, bez opublikowanego identyfikatora modelu. Gdy będzie można go wywołać, będziemy do niego kierować ruch, a powyższe wyniki FrontierSWE są powodem, by wypatrywać tego dnia, a nie czekać na niego. Modele, z którymi przegrał, już tam są.

Co obejrzeć

Sygnały, które przekształciłyby to z tego, co wiemy do tej pory, w decyzję, są konkretne. Opublikowany identyfikator modelu i jego cennik. Data ogólnej dostępności. Ponowne uruchomienie FrontierSWE w ustawieniach produkcyjnych, które rozstrzygnęłoby, czy koszt 129,36 USD za próbę to rzeczywista stawka, czy artefakt konfiguracji pamięci podręcznej wskazanej przez Proximal. A najlepiej drugi ewaluator publikujący ślady Argon, aby obserwacja „Eureka!” przestała być próbką jednego przypadku.

Do tego czasu uczciwe podsumowanie jest wąskie i warte zachowania: Gemini 4 Argon został ogłoszony, według jednego z oceniających jest niezwykle ekspresyjny w długoterminowych śladach pracy agentów, a w jedynym niezależnym benchmarku, jaki możemy sprawdzić, zajął trzecie miejsce za dwoma modelami — z których jeden pobił go jednocześnie pod względem wyniku i kosztu.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie