Karta tytułowa hero z napisem „Gemini 4 Argon vs GPT-6 Astra”, z chipem o treści „Indeks 52,6 vs 52,7” oraz chipem o treści „Koszt na zadanie indeksowe 1,99 USD vs 3,26 USD”, a także wiersz stopki o treści „Dane Argonu podane przez dostawcę; dane indeksu i kosztów według Artificial Analysis, 30.09.2026.”
Guides & Insights

Gemini 4 Argon vs GPT-6 Astra: łeb w łeb w Indeksie i spadek ceny o dwie trzecie

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa modele frontier, różniące się o 0,11 punktu w Artificial Analysis Intelligence Index. Gemini 4 Argon uzyskuje 52,56 punktu. GPT-6 Astra uzyskuje 52,67 punktu. Gdybyś musiał wybierać między nimi na podstawie zmierzonych ogólnych zdolności, mógłbyś rzucić monetą, a różnica między oboma wynikami jest mniejsza niż przedział ufności dla każdego z nich. To naprawdę rzadka sytuacja na rynku, na którym łączny rozstęp dziesięciu najlepszych modeli wynosi około piętnastu punktów, i czyni to najłatwiejszym z pojedynków Gemini 4 Argon do przeanalizowania, ponieważ spór o zdolności kończy się, zanim się zacznie, a wszystko, co zostaje, to ekonomia i dostęp.

Te dwa modele nie są jednak bliźniakami. Argon został ogłoszony 2026-09-30 przez Google DeepMind i jest wdrażany etapami, począwszy od zaufanych obrońców cyberprzestrzeni w ramach Fairwind Program. GPT-6 Astra został udostępniony na początku września — nasza karta katalogowa datuje go na 2026-09-04, a Artificial Analysis podaje 2026-09-03 — i jest aktywną trasą, którą możesz wywołać dziś po południu za 10 USD za wejście i 50 USD za wyjście za milion tokenów, z oknem kontekstowym wynoszącym 1 050 000 tokenów i górnym limitem wyjścia wynoszącym 128 000 tokenów. Jeden z tych modeli ma cenę, na podstawie której możesz zostać dziś rozliczony.

Gdzie różnica 0,11 punktu jest rzeczywista, a gdzie to szum

Indeks jest miarą złożoną, więc dwa modele, które uzyskują taki sam wynik zbiorczy, mogą w istotny sposób różnić się w poszczególnych częściach. Tutaj poszczególne części w większości są zgodne, z trzema wyjątkami, które warto wymienić.

• Terminal-Bench 4.0 — GPT-6 Astra 59,1% versus Gemini 4 Argon 57,1%. Astra prowadzi, nieznacznie.

• Rozumowanie na długim kontekście — GPT-6 Astra 80,7% kontra Gemini 4 Argon 79,7%.

• GPQA Diamond — GPT-6 Astra 96,1%. Argon nie publikuje żadnej wartości w tym zestawieniu.

• CritPt — GPT-6 Astra 31,7% kontra Gemini 4 Argon 27,1%.

• SciCode — Gemini 4 Argon 61,8% kontra GPT-6 Astra 56,5%.

• Humanity's Last Exam — Gemini 4 Argon 57,1% versus GPT-6 Astra 54,7%.

• AutomationBench-AA — Gemini 4 Argon 77,5% kontra GPT-6 Astra 68,5%.

• GDPval — Gemini 4 Argon 1 611 kontra GPT-6 Astra 1 542.

• Wszechwiedza — GPT-6 Astra 43,4 kontra Gemini 4 Argon 42,4.

• ITBench-SRE — GPT-6 Astra 48,6% wobec braku opublikowanego wyniku Argon.

• Szybkość generowania — GPT-6 Astra 51,2 tokena na sekundę w porównaniu z Gemini 4 Argon 48,9. Praktycznie na tym samym poziomie.

• Opóźnienie pierwszego tokenu w środowisku testowym indeksu — Gemini 4 Argon 2,8 sekundy w porównaniu z GPT-6 Astra 320,2 sekundy.

Astra ma przewagę w naukowym rozumowaniu opartym na pytaniach wielokrotnego wyboru, w problemach fizycznych dotyczących punktów krytycznych oraz w benchmarku SRE. Argon ma przewagę w naukowym kodowaniu, w trudniejszym zestawie zadań end-to-end oraz w pracy wycenianej w PKB. Żadna z tych przewag nie jest wystarczająco duża, by samodzielnie stanowić podstawę migracji.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

Kwestia opóźnienia to inna sprawa. 320 sekund do pierwszego tokenu to pięć i pół minuty ciszy, zanim cokolwiek zostanie wygenerowane, w porównaniu do mniej niż trzech sekund w przypadku Argon. Oba mierzą to samo — czas do pierwszego fragmentu w przebiegach indeksu Artificial Analysis — więc jest to porównywalne. Rozumowanie Astry jest zawsze włączone i konfigurowalne od niskiego do maksymalnego wysiłku; przebieg z maksymalnym wysiłkiem na trudnym zadaniu naprawdę myśli przez kilka minut, zanim coś powie. To, czy jest to wadą, zależy wyłącznie od twojego interfejsu. W przypadku zadania wsadowego nic nie kosztuje. W przypadku czegokolwiek, gdzie użytkownik patrzy na spinner, jest to najbardziej widoczna dla użytkownika różnica między tymi dwoma modelami, większa niż jakakolwiek różnica w benchmarkach na stronie.

Krok cenowy, który jest prawdziwym tematem

Tu właśnie rozstrzyga się remis — i rozstrzyga się w sposób, który łatwo błędnie zamodelować, ponieważ cennik Astry ma trzy poziomy, które wyglądają łudząco podobnie.

• Standard, do 272 000 tokenów wejściowych — GPT-6 Astra 10,00 USD za wejście / 50,00 USD za wyjście, odczyty z pamięci podręcznej po 1,00 USD, zapisy do pamięci podręcznej po 12,50 USD.

• Długi kontekst, powyżej 272 000 tokenów wejściowych — GPT-6 Astra $20.00 za wejście / $75.00 za wyjście, odczyty z pamięci podręcznej po $2.00. Całe żądanie jest wyceniane według wyższego progu, nie tylko nadwyżka: 2× za wejście i 1,5× za wyjście.

• Tryb szybki — 2× obowiązującej stawki standardowej, czyli 20,00 USD za wejście / 100,00 USD za wyjście. To właśnie ta kwota 100 USD, którą przytacza się tak, jakby była stawką za długi kontekst; ale nią nie jest.

• Gemini 4 Argon — 2,00 USD za wejście / 10,00 USD za wyjście, jednolita stawka w ramach oferty wprowadzającej, dane wejściowe z pamięci podręcznej po 0,10 USD, bez opublikowanego progu i bez opublikowanej szybkiej warstwy.

Argon jest więc pięć razy tańszy na wejściu i pięć razy tańszy na wyjściu niż standardowy plan Astra, a dziesięć razy tańszy na wejściu powyżej 272K. Dwa niezależne pomiary kosztów pokazują to samo pod innym kątem: Artificial Analysis wycenia Argon na 1,99 USD za zadanie indeksowe w porównaniu z 3,26 USD w przypadku Astra oraz na 2407 USD za uruchomienie całego indeksu w porównaniu z 5324 USD w przypadku Astra. Współczynnik na zadanie jest mniejszy niż współczynnik na token z tego samego powodu co w przypadku DeepSeek — Argon zużywa mniej tokenów, aby zakończyć — ale nadal wynosi 1,6×.

Ranking Vals ważony PKB opowiada trzecią wersję tej samej historii: Argon pierwszy z 68,90% i 15,68 USD za uruchomienie, Astra szósta z 63,13% i 18,46 USD. Astra jest tam droższa i osiąga niższy wynik. Materiały Google wyraźnie mówią, że cena jest stawką wprowadzającą, a to słowo oznacza, że może się zmienić; uczciwa interpretacja jest taka, że przewaga cenowa Argonu jest realna, ale jej trwałość nie jest gwarantowana.

Dwa fakty architektoniczne, które decydują o więcej niż benchmarki

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Najpierw limit wyjścia. Gemini 4 Argon generuje do 1 000 000 tokenów w pojedynczym przebiegu — ogłoszenie Google określa to jako rozszerzenie z 64K w poprzedniej generacji. GPT-6 Astra ma limit 128 000. Oba mają okno kontekstowe obejmujące około miliona tokenów, więc chodzi tu wyłącznie o to, ile model może napisać za jednym razem. W przypadku generowania długich form, zmian w kodzie w postaci pełnych patchy lub tworzenia dokumentu w jednym przebiegu jest to ośmiokrotna różnica w tym, co może wygenerować pojedyncze wywołanie. W przypadku czatu, ekstrakcji i krótkich kroków agenta oba limity są praktycznie nieskończone, a różnica nic cię nie kosztuje.

Modalność po drugie, a tutaj przewaga układa się odwrotnie pod jednym względem. GPT-6 Astra przyjmuje tekst, obrazy i pliki. Gemini 4 Argon przyjmuje tekst, obrazy, wideo i pliki, a materiały premierowe Google kładą nacisk konkretnie na rozumienie długich filmów — wynik 91,7% w LVBench, raportowany przez producenta. Jeśli Twój potok przetwarzania przyjmuje wideo, Astra nie jest zamiennikiem. Audio również nie jest wymienione na opublikowanej liście modalności Argon, więc nie zakładaj, że aktualizacja je obejmuje.

Co właściwie zrobić

Astra jest dostępna, a Argon nie, i to rozstrzyga większość decyzji na następny miesiąc. Konkretna ścieżka, która nie marnuje pracy: buduj na GPT-6 Astra, jeśli Twoje obciążenie wymaga stale działającego modelu rozumującego o silnej dokładności naukowej i sprawdzonym dorobku agentowym, pozostaw nazwę modelu w konfiguracji i ustaw limity czasu klienta na podstawie zmierzonego zachowania Astra, a nie optymizmu — pięciominutowy przebieg do pierwszego tokenu przekroczy domyślny 60-sekundowy limit czasu, a strumień, który pada po 300 sekundach, wygląda jak awaria. Jeśli koszty są dla Ciebie wrażliwe powyżej 272 tys. tokenów wejściowych, przed zobowiązaniem się jawnie zamodeluj zmianę cennika, ponieważ ten próg podwaja dane wejściowe i zwiększa dane wyjściowe o połowę w ramach jednej granicy.

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

Ciekawa droga pośrednia polega na tym, że nie musisz wybierać jednego domyślnego modelu. Astra i Argon — gdy Argon zostanie wydany — mają ten sam kształt modelu i są ukierunkowane na tę samą klasę zadań, co czyni je naturalnymi partnerami do przełączania awaryjnego, a nie konkurentami do tego samego miejsca. W OrcaRouter openai/gpt-6-astra jest dostępny w cenie katalogowej dostawcy bez marży, na tym samym endpointcie zgodnym z OpenAI co ponad 200 innych modeli, z automatycznym przełączaniem awaryjnym między dostawcami oraz DSL routingu do wyrażenia układu modelu głównego i zapasowego na jednym kluczu. Gdy Argon dołączy do katalogu pod identyfikatorem, jaki opublikuje Google, zmiana będzie sprowadzać się do jednego ciągu znaków — żadnej drugiej umowy, żadnej pracy integracyjnej i żadnego przebudowywania tego, co w międzyczasie zbudowano wokół Astry.

Co przełamałoby remis na stałe?

Opublikowana cena Argonu po okresie wprowadzającym oraz niezależne odtworzenie twierdzeń Google o zdolnościach agentowych — wynik 77,9% dla DeepSWE v1.1 i wynik 68% w CWE-bench v1 są oba raportowane przez dostawcę i za żadnym z nich nie stoi zewnętrzne uruchomienie. Każde z nich mogłoby istotnie przesunąć Argon w górę lub w dół, ponieważ 0,11-punktowa przewaga w indeksie nie jest buforem wobec 1,6× niekorzyści kosztowej, jeśli przewaga kosztowa okaże się tymczasowa, a nie stanowi deficytu, jeśli Google utrzyma stawkę wprowadzającą, a warstwa długiego kontekstu Astry da się we znaki w produkcji mocniej, niż oczekiwano.

Na razie: pod względem zmierzonej ogólnej zdolności te dwa to ten sam model w dwóch opakowaniach. Astra to ta z aktywną trasą, znanym krokiem cenowym i pięciominutową pauzą na myślenie. Argon to ten z tańszą kartą i bez endpointu. Remis jest prawdziwy, a jedną z jego stron można kupić.