Karta tytułowa hero o treści „Gemini 4 Argon — do czego przypisana jest nazwa”, z pojedynczą wyróżnioną kartą dla Gemini 4 Argon i poniżej listą artefaktów, które dla niego istnieją — post ogłoszeniowy, strona rodziny, tabela benchmarków dostawcy, metodologia ewaluacji — obok przekreślonej listy artefaktów, które nie istnieją, o treści: brak identyfikatora modelu, brak punktu końcowego API, brak karty modelu, brak opublikowanego okna kontekstowego, brak daty ogólnej dostępności, oraz wiersz stopki o treści „Wskaźniki indeksu według Artificial Analysis, wersja v4.3.2; Argon nie jest wywoływalny w żadnym publicznym API”.
Guides & Insights

Gemini 4 Argon: Co ogłosił Google i z czym wiąże się ta nazwa

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Gemini 4 Argon to jedyny Gemini 4, jaki istnieje. To zdanie brzmi banalnie, dopóki nie zacznie się go wyceniać, a właśnie wycenie poświęcona jest ta strona. Goog​le ogłosiło Gemini 4 Argon 30 września 2026 r., w poście DeepMind przypisanym Korayowi Kavukcuoglu; to prawdziwa nazwa modelu na prawdziwej stronie firmowej, została zmierzona przez Artificial Analysis ze wskaźnikiem Intelligence Index wynoszącym 52,56 w wersji v4.3.2 i plasuje się w granicach pół punktu od GPT-6 Astra z 52,67 i Claude Fable 5.1 z 53,35 — jednocześnie leżąc pięć punktów poniżej Claude Opus 5.5 z 57,62 i Claude Sonnet 5.5 z 56,00 oraz w granicach punktu od GPT-6.1 Sol z 51,83. Czego jednak nie ma, to tego, co ma każdy z tych rywali: identyfikatora modelu, który można wpisać w żądanie.

Uczciwa odpowiedź w jednym zdaniu na pytanie „czym jest Gemini 4 Argon” brzmi: to model, który został ogłoszony i poddany benchmarkom przez Google, ale nie można go jeszcze wywołać; nazwa jest przypisana do ograniczonego wdrożenia, a nie do produktu; a samo „Gemini 4” nie jest przypisane do niczego. Obie połowy tego zdania można sprawdzić z terminala, dlatego ta strona je sprawdza, zamiast po prostu je stwierdzać.

Nazwa jest prawdziwa. Produkt nie.

Zacznij od tego, co faktycznie zwraca weryfikacja podmiotu. Na dzień 8 października 2026 r. strona rodziny modeli Google pod adresem deepmind.google/models/gemini/ przedstawia Gemini 4 Argon jako swoją główną kartę, pod hasłem „Nasza kolejna era inteligencji frontierowej”, z opisem możliwości wymieniającym inżynierię oprogramowania, korporacyjną pracę z wiedzą w obszarze prawa i finansów oraz defensywne cyberbezpieczeństwo. Post z ogłoszeniem znajduje się pod blog.google/innovation-and-ai/models-and-research/gemini-models/ ścieżką. Istnieje strona rodziny modeli. Istnieje dziewiętnastowierszowa tabela benchmarków dostawców. Istnieje pięciostronicowy PDF z metodologią ewaluacji. To pokaźny ślad dokumentacyjny i to więcej, niż udaje się uzyskać przeciekowi.

Teraz wymień, czego w nim brakuje, ponieważ lista braków to artykuł.

• Identyfikator modelu — lista modeli Gemini API nie zawiera ani jednego wystąpienia „argon”, ani jednego wystąpienia „gemini-4”. Najnowsze identyfikatory, jakie rozpoznaje dokumentacja Google, to rodzina 3.8.

• Punkt końcowy lub cena, według której można wystawić rachunek — stawki 2 USD za tokeny wejściowe / 10 USD za tokeny wyjściowe za milion tokenów podane w ogłoszeniu to cena wprowadzająca dla wdrożenia, które nie dotarło jeszcze do płacących klientów.

• karta modelu lub karta systemu — indeks kart modeli DeepMind nie zawiera wiersza Argon, a ścieżka karty modelu dla tej rodziny zwraca 404.

• Okno kontekstu — Google opublikował limit wyjściowy na poziomie 1 miliona tokenów, podniesiony z poprzedniego pułapu 64 tys., ale nie opublikował części wejściowej tej pary. Artificial Analysis odnotowuje 1 mln dla modelu poddanego pomiarowi.

• Data ogólnej dostępności — ogłoszenie opisuje stopniowe wdrażanie bez dat na żadnym etapie po pierwszym.

• Liczba parametrów, której Google nie opublikowało dla żadnego Gemini.

Opisany przez Google rollout przebiega w trzech etapach o nieokreślonym czasie trwania. Po pierwsze, nazwana grupa obrońców cyberprzestrzeni w ramach Fairwind Program. Po drugie, płatni klienci API i subskrybenci Google AI Ultra. Po trzecie, deweloperzy, przedsiębiorstwa i konsumenci. Tylko pierwszy etap jest aktywny w jakimkolwiek sensie, który czytelnik może zweryfikować, a Google nie podaje żadnej daty dla etapów drugiego i trzeciego. To nie jest przypis. To różnica między modelem a odliczaniem.

A screenshot of Google's Gemini 4 Argon announcement post, showing the headline and the byline for Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, above the intro pricing line of $2 per million input tokens and $10 per million output tokens with cached input at 95 percent off, and the line stating an output limit of 1 million tokens, up from the previous 64K ceiling.

Co twierdzi własna tabela Google’a i kto faktycznie to zmierzył

Strona Google poświęcona rodzinie modeli zawiera czterokolumnową tabelę benchmarków z Gemini 4 Argon, GPT-6 Astra, Claude Fable 5.1 i Claude Opus 5.5. Warto ją przeczytać i warto ją czytać z uwzględnieniem proweniencji, ponieważ Google ujawnia tę proweniencję w PDF-ie metodologii, a to ujawnienie zmienia to, ile tabela może udźwignąć.

Twierdzenia, oznaczone jako należące do Google’a: Argon prowadzi w Vals Index z wynikiem 68,9 wobec 67,0 Opus 5.5 i 65,8 Fable 5.1; w AutomationBench z wynikiem 51,3 wobec 42,5, 31,4 i 41,4; w Vals Finance Agent v2 z wynikiem 65,4; w Harvey’s Legal Agent Benchmark z wynikiem 19,6 wobec 3,8, 6,7 i 5,4 — różnica od czterech do pięciu razy; w DeepSWE v1.1 z wynikiem 77,9 wobec 74,2, 67,4 i 74,1; w Vibe Code Bench z wynikiem 91,9, przewaga 1,6 punktu; w LABBench 2 z wynikiem 88,8 wobec 73,1, 68,6 i 85,4; w RiemannBench z wynikiem 76,0; w obu wierszach GraphWalks, 99,7 przy ≤128k i 84,2 przy 256k–1M; w Agent’s Last Exam z wynikiem 39,5; w Terminal-Bench Science 0.1 z wynikiem 57,6; w Chartography z wynikiem 71,6; oraz w LVBench z wynikiem 91,7 jako najlepszy w swojej klasie.

A przegrywa, na własnej stronie Google’a: FrontierSWE v2 z 55,0 przeciwko 65,5 Astra i 62,3 Opus 5.5; Terminal-bench 4.0 z 57,4 przeciwko 66,4 Opus 5.5; PostTrainBench z 45,3 przeciwko 49,3 Opus 5.5; oraz OSWorld-2.0 z 69,2 przeciwko 72,6 Astra. CWE-bench v1 remisuje na poziomie 68,0 z Astra.

Wiersz metodologii ma większe znaczenie niż jakikolwiek pojedynczy wiersz. Metodologia Google’a mówi, że wyniki to pass@1, pojedyncza próba, przy najwyższych ustawieniach myślenia, i — co kluczowe — że dane w tej tabeli niepochodzące od Google to własne, samodzielnie raportowane liczby dostawców, przy czym GPT-6 Astra, Claude Fable 5.1 i Claude Opus 5.5 uwzględniono przy maksymalnym poziomie myślenia, tam gdzie był dostępny. Tabela dostawcy, w której kolumny konkurencji to komunikaty prasowe konkurentów, jest użytecznym dokumentem, ale nie jest kontrolowanym porównaniem. Każdy z tych wierszy jest raportowany przez Google, a w niektórych przypadkach Google raportuje to, co zgłosił ktoś inny. Odpowiednio interpretuj marginesy, nie tylko same wartości.

Jeden model, trzy liczby indeksowe i dlaczego wszystkie są poprawne

Niezależna pozycja Argonu jest ciekawsza niż pojedyncza wartość, ponieważ wartość ta zmienia się w zależności od tego, gdzie ją odczytasz, a ta zmienność nie jest błędem.

Artificial Analysis mierzy Gemini 4 Argon (High) na poziomie 52,56 w wersji v4.3.2 swojego Intelligence Index. Ten sam indeks plasuje Claude Opus 5.5 na 57,62, Claude Sonnet 5.5 na 56,00, Claude Fable 5.1 na 53,35, GPT-6 Astra na 52,67, GPT-6.1 Sol na 51,83 i Gemini 3.8 Flash na 40,93. W wyświetlanej kolejności na liście rankingowej około dziesięciu najlepszych modeli mieści się w mniej więcej sześciu punktach indeksu, a Argon trafia do tego ścisku, a nie poniżej niego.

Wtedy czytelnik widzi drugą liczbę — 53 — w zaokrąglonym widoku tabeli liderów, a trzecią, jeśli porówna z inną konfiguracją siostrzanego modelu, i dochodzi do wniosku, że jedno ze źródeł jest błędne. Żadne z nich nie jest. Zaokrąglone 53 to ten sam pomiar co 52.56. To, co różni się między konfiguracjami, to wysiłek myślowy: Artificial Analysis mierzy każdy model na kilku poziomach wysiłku, a ten sam model na wyższym poziomie wysiłku może różnić się o kilka punktów. Dlatego tabela liderów wymienia Opus 5.5 cztery osobne razy, z wynikami 58, 56, 54 i 51. Argon pojawia się raz, przy wysokim wysiłku, ponieważ to jedyna konfiguracja, jaką Google udostępnił do pomiaru. Jeśli Google wypuści wariant Argon z maksymalnym myśleniem, ten wiersz się zmieni, a uczciwe stwierdzenie na dziś jest takie, że jeszcze się nie zmienił.

Trzy kolejne niezależne dane Argonu warto zapamiętać; wszystkie pochodzą z Artificial Analysis i wszystkie zostały zmierzone na (High) konfiguracji. Mediana szybkości generowania wynosi 60,69 tokena na sekundę. Mediana czasu do pierwszego tokena odpowiedzi wynosi 2,92 sekundy. Koszt na zadanie Intelligence Index — wynik indeksu znormalizowany względem wydatku tokenów potrzebnego do jego uzyskania — wynosi 1,99 USD. Ta ostatnia liczba jest tą, którą warto zapamiętać, ponieważ właśnie tutaj pozycja Argonu staje się niewygodna: Opus 5.5 ma o pięć punktów wyższy wynik i kosztuje 5,98 USD na zadanie Intelligence Index, więc Argon jest trzykrotnie tańszy na jednostkę zmierzonej możliwości. Ale GPT-6.1 Sol ma o pół punktu niższy wynik i kosztuje 0,72 USD, co stanowi około jednej trzeciej wartości Argonu. Argon nie jest wyborem o najlepszym stosunku wartości do ceny w swoim własnym przedziale indeksu. Jest w jego środku.

Istnieją jeszcze dwa niezależne odczyty, których uważny czytelnik nie powinien ze sobą mylić. Artificial Analysis odnotowuje wynik Argonu w AutomationBench jako 0,7751 punktu w skali 0–1, a raporty Google podają 51,3 na 100 w rankingu AutomationBench. To nie jest ta sama metryka, a zestawianie ich obok siebie to dokładnie taki rodzaj porównania, który prowadzi do wymyślonej liczby. Ta sama ostrożność dotyczy grupowań dotyczących pracy z wiedzą w tabeli dostawcy: „wiodąca pozycja w pracy z wiedzą” to podsumowanie Google’a dotyczące jego własnej tabeli.

Której strony „Gemini 4” faktycznie szukasz

To jest zamieszanie, które tworzy ta nazwa, i warto je raz na zawsze wyjaśnić w jednym miejscu, ponieważ blog napisał już o pięciu różnych rzeczach „Gemini 4”, a nie są to warianty jednego artykułu.

• Jeśli chcesz poznać datę premiery i harmonogram wdrożenia — kiedy ogłoszono Argon, na czym polega etapowe wdrażanie i co zrobiły z tym rankingi Arena — to jest tekst o dacie premiery, czyli materiał, który obejmuje harmonogram oraz odczyty Text Arena i Code Arena.

• Jeśli interesuje Cię „czy Gemini 4 Argon to poziom czy model”, i czy istnieje Gemini 4 Ultra — materiał o pozycjonowaniu poziomów, który odczytuje drabinkę z własnych ścieżek Google’a i wyjaśnia, dlaczego ścieżka Ultra prowadzi do strony subskrypcji.

• Jeśli chcesz samego pytania o nazewnictwo, argument, że spośród „Gemini 4” i „Gemini 4 Argon” dokładnie jedno jest modelem, a drugie to prefiks generacji bez identyfikatora modelu, bez endpointu i bez ceny — to jest bezpośrednie starcie tych dwóch nazw Google.

• Jeśli chcesz wynik FrontierSWE v2 na trzecim miejscu i towarzyszącą mu obserwację dotyczącą samokrytyczności, to jest część poświęcona ocenie FrontierSWE.

• Jeśli chcesz zestawić Argon z konkretnym rywalem na liczbach, w serwisie znajduje się trzynaście stron porównawczych obejmujących frontier band i to właśnie odpowiednie miejsce na analizę dwóch modeli.

To, czym nie jest żadna z nich, a czym jest ta strona, to filar: jedyne miejsce, które mówi, czym jest encja, co oznacza, a czego nie oznacza każda przypisana do niej liczba, i co można z nią dziś faktycznie zrobić. Powiązana strona „Gemini 4 vs Gemini 4 Argon” już w pełni przedstawia argumentację dotyczącą nazewnictwa, a ta strona nie będzie jej powtarzać. Wszystko poniżej jest nowe.

A screenshot of the Artificial Analysis page for Gemini 4 Argon, showing the model name and the line reading released September 2026, a proprietary reasoning model with a 1M token context window, and the statement that it is available via API through 1 provider — with the provider count identifiable in artificial analysis's own hosting panel rather than named in this description.

Presja, która jeszcze nic nam nie powiedziała

Dwa z najsilniejszych sygnałów w historii Argon wskazują na wydanie deweloperskie, a żaden z nich nie jest dowodem na to, że wydanie deweloperskie miało miejsce.

Po pierwsze, własne powierzchnie API Google’a poszły dalej bez Argona. Najnowszy wpis w dzienniku zmian Gemini API to 6 października 2026 — Gemini Nano Banana 2.1 ogólnie dostępny, pod identyfikatorem gemini-nano-banana-2.1. Innymi słowy, w ciągu ośmiu dni od ogłoszenia Argona Google wybrało konwencję nazewnictwa dla modelu Gemini w produkcji i wydało identyfikator GA dla innego modelu, a przestrzeń nazw gemini-4 wciąż jest pusta. Model, którego wdrożenie jest prawdziwe, zostawia ślad w dzienniku zmian. Ten nie zostawił żadnego.

Drugie to ujęcie w kategoriach bezpieczeństwa narodowego. Google podaje, że „aktywnie uczestniczy w dobrowolnym procesie rządu USA dotyczącym dostępu do modelu przed jego wydaniem”, a pierwszym etapem wdrożenia jest nazwana kohorta cyberobrońców. To jest spójne ze stopniowym udostępnianiem, w którym odbiorcy potrzebujący możliwości frontierowych otrzymują model, zanim zostanie on udostępniony przez publiczne API, i równie spójne z tym, że model po prostu nie jest gotowy na ogólny ruch. Nic w tym ujęciu nie wskazuje, który to scenariusz. Kto twierdzi, że wskazuje, ten wróży z fusów, a Google nie podało daty etapu API, która by to rozstrzygnęła.

Co możesz dziś nazwać, a czego nie możesz

To jest ta część strony, która najszybciej się dezaktualizuje, więc podano przy niej datę. Na dzień 8 października 2026 r. API modeli OrcaRouter zwraca HTTP 404 dla google/gemini-4-argon. Nie ma go na naszych trasach. Nie ma też google/gemini-4, ani google/gemini-4-argon-high, ani google/gemini-4-pro — żaden z tych identyfikatorów się nie rozwiązuje, ponieważ żaden z nich nigdzie nie istnieje jako model, który można wywołać.

Co jest dzisiaj na naszych trasach, od tego samego dostawcy, i ile każdy z nich kosztuje według cennika dostawcy:

• google/gemini-3.8-flash — wydany 2026-09-02, okno kontekstu 1 048 576 tokenów i maksymalna długość odpowiedzi 65 536 tokenów, w cenie 0,75 USD za wejście i 3,75 USD za wyjście za milion tokenów. To model, z którym Argon w końcu będą porównywać ludzie mający kartę kredytową, i jest to najbliższa rzecz do obciążenia zbliżonego do Argon, jaką możesz uruchomić jeszcze dziś po południu.

• google/gemini-3.6-flash — wydany 2026-07-21, w cenie 0,75 USD i 3,75 USD.

• google/gemini-3.5-flash — wydany 23.05.2026, w cenie 1,50 USD i 9,00 USD.

• google/gemini-3.5-flash-lite — wydany 2026-07-21, w cenie 0,30 USD i 2,50 USD.

• google/gemini-3.1-flash — po 0,25 USD i 1,50 USD.

• google/gemini-3.1-pro-preview — wydany 19.02.2026, w cenie 2,00 USD i 12,00 USD. To jedyny Gemini w slocie Pro, który możesz wywołać, i pozostaje o trzy i pół generacji za najnowszą pozycją w linii Flash.

Wszystkie one działają na tym samym kluczu co modele czołowe Claude i OpenAI w tym samym przedziale indeksu — Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1, GPT-6 Astra i GPT-6.1 Sol są na tych samych trasach — co oznacza, że to, co ciekawe w pozycji Argonu, można przetestować bez Argonu. Jeśli chcesz wiedzieć, jak to jest mieć około 52 punktów indeksu pracy opartej na wiedzy za jedną piątą ceny, możesz to dziś zmierzyć w zestawieniu z google/gemini-3.8-flash na poziomie 40,93, a jeśli chcesz górę przedziału, możesz zmierzyć Claude Opus 5.5 na poziomie 57,62 tego samego dnia, na tym samym koncie, bez drugiej umowy i bez zmian w kodzie. Taki jest praktyczny wymiar całego artykułu: jedno API dla ponad 200 modeli, 0% narzutu na przekazywaną dalej cenę katalogową dostawcy, więc obniżka ceny dostawcy dociera do Ciebie tego samego dnia, w którym zostaje wprowadzona, a automatyczne przełączanie awaryjne między dostawcami na dzień, w którym model, na którym polegasz, przestanie odpowiadać. Opisujemy to tutaj, ponieważ jest to prawdą w przypadku Gemini 3.8 Flash, którego możesz wywołać, a nie dlatego, że mówi to cokolwiek o Argonie. Argon nie jest jednym z nich.

Jeśli chcesz samego Argonu, dziś masz do wyboru kohortę cyberobrońców Fairwind albo czekanie. Własne API Google go nie udostępnia, my również nie, a żadna zewnętrzna ścieżka nie może udostępnić modelu, który nie ma identyfikatora, pod którym można by go zaadresować.

Otwarte pytania i dokładnie to, co pozwoliłoby je rozstrzygnąć

Cztery rzeczy pozostają nierozstrzygnięte, a każda z nich ma konkretny, sprawdzalny wyzwalacz. Sedno polega na tym, żeby ta lista była krótka — strona taka jak ta jest użyteczna tylko dopóki jest falsyfikowalna.

• Czy Argon otrzyma identyfikator Gemini API? Obserwuj listę modeli API pod kątem dowolnego gemini-4-prefiksowego identyfikatora. Gdy tylko taki się pojawi, kwestia cen staje się realna, a stawka wprowadzająca 2 USD / 10 USD staje się kwotą, na podstawie której można wystawiać rachunki, a nie liczbą z wpisu na blogu. Obserwuj też, czy stawka wprowadzająca w ogóle przetrwa do etapu API i czy wzrośnie do 4 USD / 20 USD, czy do czegoś innego.

• Czy mierzona konfiguracja się zmienia? Argon jest mierzony na jednym poziomie rozumowania i uzyskuje wynik 52,56. Jeśli Google udostępni konfigurację o większym nakładzie, ten wiersz się przesunie; konkurenci, których ściga, są wymienieni na dwóch do czterech poziomach nakładu, więc fakt, że Argon jest wymieniony tylko raz, dotyczy dostępności, a nie pułapu możliwości modelu.

• Czy twierdzenia z zakresu prawa i finansów przetrwają niezależny przebieg?Harvey’s Legal Agent Benchmark z wynikiem 19,6 w porównaniu z 3,8 konkurenta oraz Vals Finance Agent v2 z 65,4 prowadzący w stawce to dwie największe względne przewagi w tabeli Google’a. To także dwa wiersze, które najprawdopodobniej zostaną ponownie uruchomione przez kogoś, kto nie pracuje dla Google’a. Cztero- do pięciokrotna przewaga w benchmarku dziedzinowym to albo najważniejsze zdanie w ogłoszeniu, albo różnica w sposobie przeprowadzenia testu, a sposobem, by się przekonać, jest wypatrywanie drugiego przebiegu.

• Czy istnieje model siostrzany? W poście ogłaszającym Argon nie podano nazwy rodziny, nie zapowiedziano wersji Pro ani Ultra. Druga gemini-4-* ścieżka, druga kolumna albo wpis w karcie modelu każdy z osobna odwróciłby ten odczyt w ciągu jednego dnia. Tekst o pozycjonowaniu poziomów wymienia wszystkie falsyfikatory w całości.

Najważniejsze

Gemini 4 Argon to prawdziwy model frontierowy z prawdziwą tabelą benchmarków i prawdziwym wynikiem indeksu 52,56 od Artificial Analysis — a jednocześnie nie jest produktem w tym konkretnym sensie, że nie istnieje dla niego żaden identyfikator modelu, punkt końcowy, karta modelu, okno kontekstowe ani data ogólnej dostępności, a zarówno dokumentacja samego Google, jak i zewnętrzne usługi pomiarowe zgadzają się, że hostuje go dokładnie jeden dostawca. „Gemini 4” w jego nazwie to etykieta generacji; „Argon” to ta część, do której przypisany jest model. Jeśli wybierasz coś, na czym chcesz budować w tym miesiącu, decyzja nie dotyczy Argonu: dotyczy Gemini 3.8 Flash, który możesz wywołać już dziś za 0,75 USD / 3,75 USD, oraz modeli frontierowych w tym samym przedziale indeksu, które działają na tym samym kluczu. Wróć do tej strony, gdy gemini-4 pojawi się identyfikator w liście API. Do tego czasu wszystko, co dotyczy Argonu, jest twierdzeniem, które Google złożyło o modelu, do którego nikt spoza pierwszej kohorty nie może się zwrócić.

A single-column comparison scoreboard titled "Gemini 4 Argon vs Gemini 3.8 Flash — the scoreboard", with the left column headed Gemini 4 Argon showing rows reading Artificial Analysis Index: 52.6, Context window: 1M (output limit 1M), Price: $2 in / $10 out intro, Cost per Index task: $1.99, Callable via API: No — gated rollout, and Supplier count: 1, and the right column headed Gemini 3.8 Flash showing the same six dimension labels with Artificial Analysis Index: 40.9, Context window: 1,048,576, Price: $0.75 in / $3.75 out, Cost per Index task: $1.24, Callable via API: Yes, and Supplier count: on our routes, with a footer line reading "Argon index, price and cost-per-task figures per Artificial Analysis, v4.3.2 revision; Argon availability verified 2026-10-08."

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie