Karta tytułowa hero z napisem „Gemini 4 Argon — który szczebel drabiny Gemini 4?”, z pionową drabiną pięciu uszeregowanych szczebli wymieniających Claude Opus 5.5 przy 57.6, Gemini 4 Argon przy 52.6, GPT-6 Astra przy 52.7, Gemini 3.8 Flash przy 40.9 i Gemini 3.1 Pro Preview przy 29.7, plakietka z napisem „Brak Gemini 4 Ultra — strona Ultra przekierowuje do planu subskrypcji”, oraz wiersz stopki z napisem „Wartości indeksu według Artificial Analysis, rewizja v4.3.2; Argon nie jest wywoływalny w żadnym publicznym API.”
Guides & Insights

Szczebel Gemini 4 Argon w drabinie Gemini 4 — i dlaczego nie ma G4 Ultra

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Krótka odpowiedź na pytanie, które zapoczątkowało ten tekst, brzmi: Gemini 4 Argon jest najwyższym modelem Goog​le, a nie najwyższym tierem Goog​le, ponieważ tier powyżej jeszcze nie istnieje — a być może nie w formie, której ktokolwiek się spodziewa. Goog​le opublikowało dokładnie jeden model Gemini 4, Argon, a jedyna strona first-party w jego własnej domenie pod ścieżką /models/gemini/ultra/ nie jest w ogóle stroną modelu: przekierowuje do planów subskrypcji Goog​le AI. To przekierowanie to najbardziej użyteczny fakt w tym artykule i można je sprawdzić jedną linią z terminala. Wszystko inne tutaj dotyczy tego, gdzie Argon faktycznie się znajduje, gdy przestaniesz czytać jego cenę jako etykietę tieru, a zaczniesz czytać ją jako liczbę.

Dwie rzeczy są prawdziwe jednocześnie i łatwo je pomylić. Argon jest najzdolniejszym Gemini, jaki istnieje, a Argon nie jest modelem klasy frontier. Przewodzi każdemu modelowi Google, który został wydany, z przewagą tak dużą, że porównanie nie jest tak naprawdę porównaniem, i trafia do Intelligence Index Artificial Analysis w odległości ułamka punktu od dwóch konkurujących flagowców, które same są o pełne pięć punktów za obecnym liderem. Google wyceniło go tak, jakby znajdował się o szczebel poniżej frontieru, a niezależny pomiar się z tym zgadza. Cena nie jest więc decyzją marketingową, która zaniża wartość modelu. Jest trafnym stwierdzeniem o modelu.

To tekst podsumowujący to, co wiemy do tej pory. Gemini 4 Argon został ogłoszony 30.09.2026 w poście Google DeepMind przypisanym Korayowi Kavukcuoglu i jest wdrażany najpierw dla konkretnej grupy specjalistów ds. cyberbezpieczeństwa w ramach Google’s Fairwind Program — nie dla deweloperów, nie dla przedsiębiorstw, nie dla konsumentów i nie dla kogokolwiek z kartą kredytową. Nie ma identyfikatora modelu w Gemini API, punktu końcowego ani opublikowanej ceny za token, według której można by wystawiać rachunki. Nie istnieją dla niego identyfikatory modelu, przepustowość ani niezawodność mierzona na rzeczywistym ruchu, co oznacza, że poniższy pomiar to jeden przebieg benchmarku w jednym laboratorium i nic więcej. Jeśli liczba pochodzi od Google, jest oznaczona jako Google; jeśli pochodzi od Artificial Analysis, jest oznaczona jako ich. Niczego tutaj nie należy odczytywać jako twierdzenia, że Argon jest produktem dostępnym w sprzedaży.

Drabina, którą Google faktycznie wypuścił, odczytana z jego własnych stron

Najszybszym sposobem, aby odpowiedzieć na pytanie „gdzie w gamie Gemini 4 znajduje się Argon”, jest przestać pytać o gamę, a zacząć wymieniać modele, dla których Google publikuje strony. Gama to pojęcie marketingowe; strona to fakt. Oto dokąd prowadzą ścieżki first-party na dzień 1 października 2026 r.

• deepmind.google/models/gemini/pro/ zwraca kod 200, a jego tytuł to „Gemini 3.1 Pro — Google DeepMind”. Slot Pro na własnej stronie Google’a to nadal model generacji 3.1.

• deepmind.google/models/gemini/flash/ zwraca 200, a jego tytuł to „Gemini 3.8 Flash — Google DeepMind”. Slot Flash przesunął się trzy razy — 3.5, 3.6, 3.7, 3.8 — podczas gdy slot Pro nie przesunął się ani razu.

• deepmind.google/models/gemini/argon/ zwraca 404. Argon nie ma osobnej ścieżki dla modelu. Jego domem jest strona rodziny modeli pod adresem deepmind.google/models/gemini/, gdzie Google umieszcza model, który obecnie promuje jako wiodący.

• deepmind.google/models/gemini/ultra/ zwraca 302 i prowadzi do one.google.com/about/google-ai-plans/, strony subskrypcji konsumenckiej. To samo dotyczy starszej ścieżki deepmind.google/technologies/gemini/ultra/. „Ultra” na ścieżce modeli Google to poziom rozliczeniowy, a nie punkt kontrolny.

• deepmind.google/models/gemini/nano/ zwraca przekierowanie 301 na stronę rodziny Gemini. Nie ma też miejsca dla Nano jako samodzielnej strony modelu.

• deepmind.google/models/gemini/model-cards/ — prowadzony przez Google indeks wszystkich opublikowanych przez niego kart modeli — nie zawiera wpisu dla Argon ani wpisu z „Gemini 4” w nazwie. Jego najnowsze wiersze Gemini to 3.8 Flash, 3.8 Audio, 3.7 Flash, 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite i 3.1 Pro. Indeks kart to najwolniej aktualizowany dokument w tym zestawie, więc jego milczenie nie jest dowodem, że Argon nigdy nie będzie miał karty; jest dowodem, że dokumentacja nie nadążyła za ogłoszeniem.

• deepmind.google/models/, indeks modeli, wymienia „Gemini 4 Argon” jako flagową kartę z hasłem „Nasza kolejna era inteligencji frontier”, bezpośrednio nad „Gemini 3.8 Flash — najlepszy do rozwiązywania złożonych zadań agentowych na dużą skalę”. Dwie karty Gemini, różniące się o jedną generację, w tej kolejności.

Złóż to razem, a kształt drabiny nie będzie dwuznaczny. Publiczny zestaw modeli Google ma obecnie jeden wpis na szczeblu Gemini 4, jeden wpis na szczeblu Gemini 3.8, przestarzały szczebel Pro trzy i pół generacji w tyle oraz nic powyżej któregokolwiek z nich. Słowo „Ultra” w domenie Google oznacza subskrypcję. Nie ma strony Gemini 4 Pro, strony Gemini 4 Flash, strony Gemini 4 Ultra ani karty modelu Gemini 4. Google ogłosiło model, a nie rodzinę.

Czy istnieje Gemini 4 Ultra? Dowody i co pozwoliłoby to obalić

Zasługuje to na własną sekcję, ponieważ jest to część pytania, na które najprawdopodobniej za tydzień odpowiedź będzie inna, a także dlatego, że szczera odpowiedź ma termin przydatności.

Negatywne dowody są konkretne, a nie ogólnikowe. Przekierowanie 302 na ścieżce Ultra do strony planów subskrypcji nie jest słabym sygnałem; to przekierowanie skonfigurowane przez własny zespół internetowy Google. Wiele wzorców URL w blog.google dla wpisu o Gemini 4 Ultra zwraca 404 — ścieżka produktów, ścieżka innovation-and-ai models-and-research oraz zwykła ścieżka ogłoszenia. Nazwa Ultra ma tu swoją historię, a ta historia przemawia przeciwko Gemini 4 Ultra. Pierwotne ogłoszenie Gemini od Google wprowadziło Gemini 1.0 „zoptymalizowane pod trzy różne rozmiary: Ultra, Pro i Nano”, a Gemini Ultra opisano jako „nasz największy i najbardziej zaawansowany model”. Wpis o premierze, który wymienia trzy rozmiary, wygląda właśnie jak ogłoszenie całej rodziny. Wpis Argonu wymienia tylko jeden model i nie wymienia żadnych modeli siostrzanych. Google później wycofało nazwę modelu Ultra na rzecz poziomów liczbowych i przeniosło to słowo do części biznesu związanej z subskrypcjami, gdzie obecnie określa ono najwyższy plan konsumencki. Strona modelu, która przekierowuje na stronę planów, to obraz wycofanej nazwy modelu, gdy witryna marketingowa została wokół niej uprzątnięta.

W ogłoszeniu nie ma też niczego, co obiecywałoby większego brata. Wpis Argon ogłaszający premierę opisuje Argon jako „nasz nowy model frontier”, opisuje etapowe wdrażanie, prace nad zabezpieczeniami i wewnętrzne wdrożenia, po czym się kończy. Nie mówi „pierwszy w rodzinie Gemini 4”, nie zapowiada wersji Pro ani Ultra i nie wymienia następcy. Sam sposób, w jaki Google to przedstawia, traktuje Argon jako ten główny, a nie jako ten mniejszy.

To, co obaliłoby ten wniosek, łatwo określić i warto na to uważać, bo którakolwiek z tych rzeczy odwróciłaby go w ciągu jednego dnia.

• Status 200 na deepmind.google/models/gemini/ultra/, który renderuje stronę modelu, a nie stronę planów, lub nowa models/gemini/ ścieżka podrzędna pojawiająca się obok pro i flash.

• Wiersz Gemini 4 Ultra pojawiający się w indeksie kart modeli, co jest sposobem, w jaki Google historycznie potwierdza, że model istnieje jako udokumentowany artefakt.

• Drugi identyfikator modelu w API Gemini w przestrzeni nazw gemini-4-*. Argon obecnie nie ma żadnego, więc identyfikator Pro lub Ultra byłby pierwszym dowodem, że ta rodzina jest prawdziwa.

• Wpis na liście modeli Artificial Analysis albo tabela benchmarków na stronie rodziny modeli z czwartą kolumną. Oba te źródła śledzą wydania Google na tyle uważnie, że są wczesne.

• Post ogłaszający z Google I/O, Google Next lub DeepMind, w którym użyto słowa „family" w odniesieniu do Gemini 4. W poście Argon tego nie ma.

Dopóki nie nastąpi przynajmniej jedno z tych zdarzeń, materiał twierdzący, że nadchodzi Gemini 4 Ultra, jest przepowiednią przebraną w szaty reportażu. Traktuj go odpowiednio, również gdy pochodzi od nas.

A two-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column showing Gemini 4 Argon at AA Intelligence Index 52.6, 1M context window, $2 input per million tokens, $10 output per million tokens, $1.99 cost per Index task and 142,374 output tokens per Index task, and the right column showing Gemini 3.8 Flash at AA Intelligence Index 40.9, 1M context window, $0.75 input, $3.75 output, $1.24 cost per Index task and 154,230 output tokens per Index task, with a footer reading "Both columns' Index, price, context, cost-per-task and token-use figures per Artificial Analysis, v4.3.2 revision."

Odczytywanie drabinki cenowej jako deklaracji poziomu

Cennik to jedyna część tego, którą Google opublikował celowo, wraz z przypisem, i jest to najwyraźniejszy wyraz intencji dotyczących poziomu w całej premierze. Cena wprowadzająca Argon wynosi 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych, a wejście z pamięci podręcznej jest objęte 95% zniżki; z kolei własny przypis numer jeden Google’a mówi, że po okresie wprowadzającym, którego nie potrafił zdefiniować, „obowiązywać będzie cena 4 USD za 1 mln tokenów wejściowych i 20 USD za 1 mln tokenów wyjściowych”.

Zestaw te dwie pary z polem, a twierdzenie o tierze pisze się samo.

• $4 / $20 to cena katalogowa Claude Opus 5.5. Stawka Google dla modelu Argon po okresie wprowadzeniowym pokrywa się dokładnie z cennikiem obecnego lidera na froncie, w przypadku modelu, który osiąga wynik o pięć punktów niższy od niego.

• $2 / $10 to promocyjny przedział, w którym znajdują się zarówno GPT-6 Sol, jak i Claude Sonnet 5.5. Cena wprowadzająca Argonu to również $2 / $10, co sytuuje cenę startową Argonu w tym samym przedziale co Sol średniej klasy, a nie w przedziale czołowym.

• $10 / $50 to stawka, na której plasują się zarówno Claude Fable 5.1, jak i GPT-6 Astra. Argon kosztuje jedną piątą ceny wejściowej Fable 5.1 i jedną piątą ceny wyjściowej, a jego wynik jest w granicach 0,8 od niego.

• $0,75 / $3,75 to Gemini 3.8 Flash. Argon to 2,7× tego na wejściu i 2,7× na wyjściu — równy krok w górę, a nie przepaść.

Google wyceniło więc Argon jako model, który mieści się poniżej $10/$50 i powyżej $0,75/$3,75, a docelowo osiądzie na poziomie $4/$20. Nic w tej drabince nie mówi „frontier”. Mówi ona: „szczyt średniej półki, z liczbą w nagłówku, która ustabilizuje się na tym samym poziomie, jaki lider pobiera dziś, za mniejsze możliwości”. To wybór biznesowy, którego można bronić. To nie jest wycena modelu pozycjonowanego o dwa szczeble przed czymkolwiek.

Jeden punkt strukturalny wart zapamiętania: skok cenowy Argonu to prawdziwy skok, zdefiniowany w przypisie i bez daty. Rodziny Sonnet 5.5 i GPT-6 robią coś podobnego w przypadku progów długiego kontekstu, a Sol przechodzi na $4/$15 powyżej 272K. Skok Argonu opiera się na czasie, a nie na długości kontekstu — te same $2/$10 obowiązują w całym oknie 1M i tylko kalendarz zmienia stawkę. To nietypowy kształt i sprawia, że każde porównanie kosztów z Argonem staje się ćwiczeniem z dwiema kolumnami: który okres i jakie użycie.

Jak Argon wypada na tle rywali, na podstawie istniejących liczb

Artificial Analysis zdobyło pomiar Gemini 4 Argon wystarczająco szybko, że jest to jedyny dostępny niezależny odczyt. Na wersji aktualnej na 1 października — v4.3.2 — Argon uzyskuje 52,56 w Intelligence Index, skonfigurowany z wysokim poziomem wysiłku rozumowania. Modele wokół niego nie stanowią losowej próby całego zbioru.

Claude Opus 5.5 plasuje się na 57,62, mierzone przy maksymalnym wysiłku z mechanizmem awaryjnym. To ponad pięć punktów powyżej Argon i obecnie szczyt tabeli.

• Claude Fable 5.1 plasuje się na poziomie 53,35, mierzonym przy maksymalnym wysiłku z fallbackiem. Argon jest o 0,79 za nim.

• GPT-6 Astra znajduje się na poziomie 52,67, mierzone przy maksymalnych ustawieniach. Argon jest o 0,11 za nią.

• Claude Sonnet 5.5 plasuje się na 55,98, również maks. z fallbackiem. To model średniej klasy, który przewyższa Argon o 3,4 punktu, i to jest liczba, która powinna zaniepokoić każdego, kto sięga po tezę „Gemini 4 Argon jest drugim najlepszym modelem na świecie”.

• GPT-6 Sol plasuje się na poziomie 47,63, mierzonym przy maksimum, w oknie kontekstowym 872K. Argon wyprzedza go o 4,9.

• Gemini 3.8 Flash znajduje się na poziomie 40,93 przy wysokim wysiłku. Argon jest o 11,6 przed nim.

• Gemini 3.1 Pro Preview plasuje się na 29,72. Argon wyprzedza go o 22,8, co jest najdobitniejszym dowodem na to, jak bardzo warstwa Pro, którą Google faktycznie udostępnia, pozostaje w tyle za własnymi badaniami.

Wynikają z tego trzy rzeczy. Po pierwsze, Argon jest na równi z dwoma pretendentami, Fable 5.1 i Astra, a wyraźnie ustępuje dwóm modelom Anthropic — Opus 5.5 i, co bardziej kłopotliwe, Sonnet 5.5. Po drugie, przepaść między Argonem a najlepszym wydanym modelem samego Google to zdecydowanie największy skok generacyjny w obecnej ofercie. Po trzecie, ujęcie w sygnale, że „czołówka jest co najmniej dwa poziomy z przodu”, jest słuszne co do istoty, ale nieco chybia w geometrii: jeden poziom modeli jest wyraźnie przed Argonem (Opus 5.5 z wynikiem 57,6), a drugi model na tańszym poziomie również jest przed nim (Sonnet 5.5 z wynikiem 56,0), co jest dotkliwszym problemem niż bycie dwa szczeble niżej na drabinie, na której Argon w istocie się znajduje.

Ujęcie oparte na porównywaniu cen w pierwotnym pytaniu — „ceny sugerują, że to ich odpowiednik Sol/Sonnet” — okazuje się w przybliżeniu trafne, jeśli chodzi o cenę premierową, i błędne, jeśli chodzi o cenę docelową. Argon startuje w cenie Sol i Sonnet 5.5, a zatrzymuje się na cenie Opus 5.5. Jest wyceniany jak model średniej klasy, który zamierza stać się modelem z wyceną frontier, choć pod względem wyników nie dorównuje żadnej z tych klas.

Obraz kosztu przypadającego na zadanie to obszar, w którym Argon wypada naj mocniej i w którym opowieść o poziomach zyskuje drugi wymiar. W zadaniu Index Argon kosztuje 1,99 USD i generuje 142 374 tokeny wyjściowe. Opus 5.5 kosztuje 5,98 USD i generuje 338 099. Sonnet 5.5 kosztuje 7,62 USD za 599 849. Fable 5.1 kosztuje 7,63 USD za 187 455. Astra kosztuje 3,26 USD za 68 691. Gemini 3.8 Flash kosztuje 1,24 USD za 154 230. Argon jest najtańszym sposobem na uzyskanie wyniku zbliżonego do czołówki, a jest tańszy od modelu Flash, który znajduje się wyżej od niego pod względem wyniku, o mniej niż dolara na zadanie.

Ustawienia wysiłku to gwiazdka przy tym wszystkim, a branża nie raportuje ich jednolicie. Argon jest mierzony na poziomie high; Opus 5.5, Fable 5.1 i Sonnet 5.5 na poziomie max z fallbackiem; Astra i Sol na poziomie max. Przebieg przy wysokim wysiłku i przebieg przy maksymalnym wysiłku to nie ten sam pomiar, a własna drabina wysiłku Anthropic przesuwa model o kilka punktów między ustawieniami. Jeśli Argon mierzony przy maksymalnym wysiłku uzyskuje wynik istotnie powyżej 52,6, argument o poziomach się zmienia. Nikt jeszcze nie opublikował takiego przebiegu.

Co twierdzi własna tabela Google i czym różni się od niezależnej

Strona rodziny Gemini zawiera przygotowaną przez Google tabelę wydajności z czterema kolumnami — Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 — oraz dziewiętnastoma wierszami testów porównawczych. To najbardziej szczegółowy zestaw twierdzeń, jaki Google opublikowało dla tego modelu, i w całości pochodzi od dostawcy. Czytanie go w zestawieniu z niezależnym Indeksem jest pouczające właśnie dlatego, że oba źródła nie zgadzają się co do kształtu tej dziedziny.

• W tabeli Google Argon zwycięża samodzielnie lub remisuje na pierwszym miejscu w trzynastu z dziewiętnastu wierszy, w tym Vals Index Knowledge work na poziomie 68,9, AutomationBench na poziomie 51,3, Harvey’s Legal Agent Benchmark na poziomie 19,6, DeepSWE v1.1 na poziomie 77,9, LABBench 2 na poziomie 88,8, GraphWalks na poziomie 99,7 dla zakresu ≤128K i 84,2 dla zakresu 256K–1M, Agent’s Last Exam na poziomie 39,5, LVBench na poziomie 91,7 i Chartography na poziomie 71,6.

• Claude Opus 5.5 wygrywa wiersze, które czyta się jak ciągła praca inżynierska: FrontierSWE v2 z wynikiem 62,3 przeciwko 55,0 Argon, Terminal-bench 4.0 z 66,4 przeciwko 57,4, Terminal-Bench Science 0.1 z 63,3 przeciwko 57,6 oraz PostTrainBench z 49,3 przeciwko 45,3.

• GPT-6 Astra osiąga wynik 68,1 w Terminal-Bench Science 0.1 i 72,6 w podzbiorze offline OSWorld-2.0, a w CWE-bench v1 ma taki sam wynik jak Argon – 68,0. Claude Fable 5.1 przegrywa w każdym wierszu, z wyjątkiem wspólnego remisu w Vibe Code Bench.

• W niezależnym Indexie kolejność jest następująca: najpierw Opus 5.5, potem Sonnet 5.5, następnie Fable 5.1, a Argon i Astra praktycznie ex aequo. Tabela Google’a nie ma w ogóle kolumny Sonnet 5.5, co jest najpoważniejszym pominięciem w niej: wybrano cztery kolumny tej tabeli, a model, który w Indexie przewyższa Argon przy niższej cenie, nie znajduje się wśród nich.

Nic z tego nie czyni tabeli Google’a nieuczciwej. Tabele benchmarków dostawców są wybierane, a nie próbkowane, i w każdym laboratorium jest tak samo. To czyni ją twierdzeniem, a nie pomiarem, i oznacza, że na jej podstawie nie można rozstrzygnąć kwestii tieru. Jedynym miejscem, w którym tabela naprawdę ma znaczenie dla tego artykułu, jest negatywny dowód: dziewiętnaście wierszy, cztery kolumny i żadnej piątej kolumny dla Ultra.

A screenshot of Google DeepMind's Gemini 4 Argon page scrolled to its Performance section, showing the Performance heading and the line “Frontier performance in complex workflows” above the vendor-reported benchmark table, whose four model columns are Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, with rows running from Vals Index and AutomationBench down through FrontierSWE v2 and Terminal-bench 4.0 to GraphWalks and Agent's Last Exam.

Jedyna rzecz dotycząca Argonu, która w ogóle nie jest kwestią tieru

Każdy z powyższych argumentów dotyczących poziomów zakłada, że Argon to model, który w końcu będziesz mógł wywołać. Warto oddzielić to od kwestii pozycjonowania, ponieważ te dwie sprawy mają różne odpowiedzi i tylko jedna z nich dotyczy możliwości.

Limit tokenów wyjściowych modelu Argon to 1 milion tokenów, wzrost z 64K, i Google mówi to wprost. To pułap wyjściowy, a nie okno kontekstowe. To rozróżnienie ma znaczenie, ponieważ te dwie rzeczy są stale mylone w relacjach z tej premiery oraz ponieważ limit wyjściowy 1 mln to inne twierdzenie inżynieryjne niż okno kontekstowe 1 mln — pierwsze dotyczy tego, jak długo może przebiegać pojedyncza trajektoria, drugie tego, ile można przekazać modelowi naraz. Google wypowiedziało się jednoznacznie o limicie wyjściowym, a milczy o oknie kontekstowym. Artificial Analysis również odnotowuje 1 000 000 tokenów dla kontekstu Argon, ale to pole trackera, a nie oświadczenie Google, więc traktuj te dwie liczby jako pochodzące z różnych pokoi, mimo że wyglądają tak samo.

Tym, co jest jednoznacznie niedostępne, jest dostęp. Argon nie jest ogólnie dostępny, nie ma go w Gemini API pod żadnym identyfikatorem i nie znajduje się w żadnym katalogu zewnętrznym. Jest dostępny dla zweryfikowanych obrońców cyberbezpieczeństwa w ramach Programu Fairwind oraz dla własnych inżynierów Google, a kolejny etap, który Google wymienia — „zaczynając od płacących klientów API i subskrybentów Google AI Ultra” — nie ma przypisanej daty. Nie możesz przeprowadzić na nim testów wydajnościowych na własnym obciążeniu. Każda liczba w tym artykule jest więc cudzym pomiarem modelu, którego nie możesz używać.

Co przesunęłoby Argon o szczebel wyżej?

Ocena poziomu to migawka, a istnieje około pięciu rzeczy, które by ją zmieniły, w przybliżonej kolejności od tego, jak bardzo by miały znaczenie.

• Niezależnie zmierzony przebieg przy maksymalnym wysiłku. Argon jest obecnie pomiarem przy wysokim wysiłku wynoszącym 52,56. Własne drabiny wysiłku Anthropic przesuwają model o kilka punktów między ustawieniami, a jeśli model Google zachowuje się podobnie przy maksymalnym wysiłku, rzeczywista pozycja Argonu względem Fable 5.1 i Astra jest lepsza, niż twierdzi ten artykuł. To najbardziej prawdopodobna pojedyncza zmiana.

• Drugie źródło pomiaru. Jeden tracker to jeden pomiar. Drugie niezależne laboratorium oceniające Argon na własnym zestawie testowym zrobiłoby więcej dla twierdzenia o poziomie niż jakikolwiek dodatkowy wiersz benchmarku od Google.

• Gemini 4 Pro. Jeśli Google otworzy poziom Pro czwartej generacji poniżej Argonu, oferta staje się rodziną o konkretnym kształcie, pozycja Argonu przestaje być „jedyną” i zaczyna być „najwyższą z trzech”, a każdy argument w tym tekście o brakującej rodzinie wymaga przepisania. Warto to obserwować, a jest to bliższe niż kwestia Ultra.

• Cena, która nie rośnie skokowo. Jeśli okres wprowadzający po prostu nigdy nie wygaśnie — Google nie określił, kiedy się kończy — efektywna cena ustabilizowana Argonu wynosi $2/$10, a nie $4/$20, a jego przewaga pod względem kosztu na zadanie nad Opus 5.5 rośnie z około 3× do około 6×. To zdarzenie komercyjne, a nie dotyczące możliwości, ale zmienia to, jak wygląda decyzja zakupowa.

• Karta modelu Argon, karta systemu lub strona metodologii ewaluacji. Tabela wyników prowadzi do strony metodologii w domenie Google; pełna karta modelu oficjalnie dokumentowałaby okno kontekstowe, konfigurację wdrożenia i kopertę bezpieczeństwa, i byłaby pierwszym artefaktem, który pozwoliłby komuś spoza kohorty Fairwind sprawdzić liczby Google, a nie tylko je przeczytać.

I odwrotnie, rzeczą, która najprawdopodobniej przesunęłaby Argon w dół, nie jest wcale benchmark. Jest to doniesienie Bloomberga z 30 września, w którym cytowano pracowników Google mających dostęp do modelu, mówiących, że radzi sobie on gorzej w rzeczywistej pracy, niż sugerują jego wyniki. To twierdzenie nie zostało zweryfikowane przez nikogo spoza Google i nie jest pomiarem, ale jest to rodzaj twierdzenia, które drugi niezależny benchmark albo potwierdziłby, albo obalił. Do tego czasu pozostaje w zapisie jako zarzut z nazwanym medium i nienazwanymi źródłami, i należy do dyskusji o poziomie, ponieważ model, którego rozbieżność między benchmarkiem a praktyką jest kwestionowana, nie może być promowany wyłącznie na podstawie benchmarków.

Co to oznacza, jeśli w tym miesiącu wybierasz model

Po odrzuceniu argumentu o pozycjonowaniu praktyczny obraz jest na tyle prosty, że wystarczy jeden akapit. Gemini 4 Argon to najlepszy Gemini, jaki Google zbudował, i nie jest dostępny dla ciebie, więc modele Google, spośród których możesz dziś faktycznie wybierać, to te, które zostały wydane: Gemini 3.8 Flash, który osiąga 40,93 w rankingu Index przy $0,75/$3,75, oraz Gemini 3.1 Pro Preview, który osiąga 29,72 przy $2/$12. Jeśli potrzebujesz Gemini już teraz, to jest prawdziwy wybór, a Argon nie jest jego częścią.

Jeśli wybierasz spośród różnych dostawców, a nie w obrębie Google, ogłoszenie Argona niczego nie zmienia w dzisiejszej decyzji. Na szczycie Indexu znajduje się Claude Opus 5.5 z wynikiem 57,62, a tuż za nim plasuje się Claude Sonnet 5.5 z wynikiem 55,98, przy jednej piątej stawki za dane wejściowe i połowie stawki za dane wyjściowe. Gemini 4 Argon z wynikiem 52,56 nie ma drogi do Twojej aplikacji, więc nie jest kandydatem, niezależnie od tego, jak dobry ostatecznie okaże się jego wynik.

A screenshot of Google's own Google AI plans page, showing the three consumer Google AI plans side by side — Google AI Plus at $4.99/mo with 400 GB storage, Google AI Pro at $19.99/mo with 5 TB storage, and Google AI Ultra from $99.99/mo starting at 20 TB of storage — each with a “View plan benefits” link, illustrating that “Ultra” on Google's domain names a subscription plan rather than a Gemini model.

OrcaRouter to jedno API przed ponad 200 modelami z cenami katalogowymi dostawców przekazywanymi bez marży i automatycznym przełączaniem awaryjnym między dostawcami, co oznacza, że decyzja o zmianie modelu nie wymaga przerabiania niczego: identyfikator w treści żądania to cała zmiana. Modele Google w naszym katalogu dzisiaj to te, które Google faktycznie udostępniło — google/gemini-3.8-flash, google/gemini-3.6-flash, google/gemini-3.5-flash i google/gemini-3.1-pro-preview. Gemini 4 Argon nie jest jednym z nich i nie będzie, dopóki nie ma identyfikatora modelu ani opublikowanego cennika, więc nikt nie powinien dopatrywać się w powyższym twierdzenia o routingu. Kiedy Google udostępni Argon przez API z identyfikatorem, stanie się to kwestią routingu. Do tego czasu uczciwa wersja odpowiedzi OrcaRouter brzmi: to jeszcze nie ma zastosowania, a pożyteczną rzeczą, jaką katalog robi w tej konkretnej decyzji, jest umożliwienie wyceny modeli, które można faktycznie wywołać obok siebie, bez otwierania czterech kont, aby się przekonać.

Najważniejsze

Gemini 4 Argon to flagowy, ale nie frontierowy model Google. Uzyskuje 52,56 w indeksie v4.3.2 Artificial Analysis przy wysokim wysiłku — tyle samo co Claude Fable 5.1 i GPT-6 Astra, pięć punktów za Claude Opus 5.5 i za Claude Sonnet 5.5, tańszym modelem od konkurencyjnego laboratorium. Google wyceniło go na 2/10 USD w cenie wprowadzającej, która później rośnie do 4/20 USD, co sprawia, że jego ostateczna stawka równa się dokładnie stawce Claude Opus 5.5 przy wymiernie mniejszych możliwościach. Jego przewaga 11,6 punktu nad Gemini 3.8 Flash to najszersza przepaść międzypokoleniowa w ofercie samego Google i najsilniejszy dowód, że generacja Gemini 4 to prawdziwy krok naprzód, a nie tylko zmiana szyldu.

Co do pytania, które zapoczątkowało to wszystko: nie istnieje Gemini 4 Ultra. Ścieżka Ultra Google’a w jego własnej domenie przekierowuje na stronę planów subskrypcji, indeks kart modeli nie zawiera żadnego wpisu Gemini 4, każdy wzorzec adresu URL ogłoszenia dotyczącego Gemini 4 Ultra zwraca 404, a wpis premierowy ogłasza jeden model, nie obiecując całej rodziny. To realne ustalenie i dowód z pierwszej ręki, a nie wnioskowanie, ale jest to również fakt o krótkim okresie ważności — pojedyncza odpowiedź 200 na jednej ścieżce odwraca ten stan, a szczebel Pro generacji Gemini 4 jest tym, który najprawdopodobniej pojawi się jako pierwszy.

Dwa zastrzeżenia do wyniesienia z tego tekstu. Każda liczba dotycząca Argonu jest czyimś pomiarem modelu, którego nikt spoza zweryfikowanej grupy obrońców cyberbezpieczeństwa nie może wywołać, a własna dziewiętnastowierszowa tabela Google’a jest twierdzeniem, a nie pomiarem — przydatna jako to, czym jest, i nie zastępuje niezależnego Index. A uczciwy werdykt w kwestii poziomu jest tymczasowy: Argon jest mierzony przy wysokim wysiłku, nie maksymalnym, a przebieg przy maksymalnym wysiłku to najtańszy możliwy sposób, w jaki ten artykuł może się mylić.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie