
Gemini 4 Argon vs Claude Opus 5.5: Podział w benchmarkach, którego nikt się nie spodziewał
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Gemini 4 Argon i Claude Opus 5.5 nie zgadzają się co do tego, który jest lepszy, a ta niezgodność nie jest szumem. W Intelligence Index firmy Artificial Analysis dzieli je pięć punktów na korzyść Opus 5.5. W Vals Index — rankingu wpływu gospodarczego ważonego PKB — Gemini 4 Argon zajmuje pierwsze miejsce, a Claude Opus 5.5 trzecie, za zarówno Argonem, jak i Claude Sonnet 5.5. Oba rankingi zmierzyły te same dwa modele w tym samym tygodniu. To cały artykuł: to, który powinieneś wybrać, zależy od tego, czy twoja praca bardziej przypomina pytanie egzaminacyjne, czy wtorek w kancelarii prawnej, oraz od tego, czy w ogóle masz dostęp API do Argon, którego na dzień dzisiejszy prawie nikt nie ma.
Google ogłosiło Gemini 4 Argon 30 września 2026 w poście DeepMind przypisanym Korayowi Kavukcuoglu, starszemu wiceprezesowi Google DeepMind i głównemu architektowi AI. Anthropic udostępniło Claude Opus 5.5 osiem dni wcześniej, 22 września 2026. Jedno z nich to wydanie GA, które możesz wywołać jeszcze dziś po południu. Drugie to stopniowe wdrażanie dla wskazanej grupy obrońców cyberbezpieczeństwa oraz inżynierów samego Google, z deklarowanym zamiarem dotarcia do „płatnych klientów API i subskrybentów Google AI Ultra”, gdy tylko zabezpieczenia będą gotowe, i bez podanej do tego daty.
Odpowiedź w jednej linijce, przed szczegółami
Jeśli potrzebujesz dzisiaj najlepszego mierzonego ogólnego rozumowania i potrzebujesz go na kluczu produkcyjnym, Claude Opus 5.5 jest już dostępny w OrcaRouter, a Gemini 4 Argon nie jest dostępny w żadnym publicznym API. Jeśli tworzysz dla finansowych, prawnych, podatkowych lub programistycznych agentów, których ocenia się pod kątem wyniku ekonomicznego na dolara, wyniki Argon są lepsze, a jego cena za zadanie to jedna piąta ceny Opus 5.5 na jednym benchmarku, który mierzy dokładnie to. Jeśli zajmujesz się obroną cyberbezpieczeństwa infrastruktury krytycznej, Argon ma program, do którego możesz się zgłosić, a odpowiedź może brzmieć: tak.
Skąd tak naprawdę pochodzi każda liczba
Dwie tablice indeksów, dwie metodologie — i warto być precyzyjnym co do tego, co jest czym, bo oba obozy będą przez miesiące cytować się nawzajem, rozmijając się.
• Artificial Analysis Intelligence Index v4.3 — Claude Opus 5.5 z wynikiem 57,6 i Gemini 4 Argon z wynikiem 52,6; oba odczytane z Artificial Analysis w dniu 2026-09-30. To kompozyt dziesięciu ewaluacji, celowo ogólny pod względem zadań, i to zestawienie, na które większość osób powołuje się jako na „ten” ranking.
• Vals Index, zaktualizowany 2026-09-29 — Gemini 4 Argon na pierwszym miejscu z 68,90% (±0,97), Claude Sonnet 5.5 na drugim miejscu z 67,04% (±0,92), Claude Opus 5.5 na trzecim miejscu z 66,97% (±0,89). Vals nadaje wagi zadaniom z zakresu finansów, programowania, prawa i podatków zgodnie z udziałem każdego sektora w PKB USA, dlatego model, który jest przeciętny w łamigłówkach, ale doskonały w przeglądzie umów i pracy z arkuszami kalkulacyjnymi, osiąga tutaj dobry wynik.
Pięciopunktowa różnica w AA jest realna i nie jest mała. Dwupunktowa różnica w Vals też jest realna, a biorąc pod uwagę przedziały ufności podane w tabeli liderów, 68,90 ±0,97 Argonu w porównaniu z 66,97 ±0,89 Opusa 5.5 to różnica około 1,5 błędu standardowego — lepsza niż rzut monetą, ale nie aż tak przytłaczająca. Żadna z tych tabel nie jest błędna. Mierzą różne zadania.

Jedno zastrzeżenie dotyczące konfiguracji — i przemawia ono przeciwko odczytywaniu różnicy AA jako czystego porównania modeli. Artificial Analysis umieszcza Gemini 4 Argon na wysokim ustawieniu wysiłku, a Claude Opus 5.5 na „Adaptive Reasoning, Max Effort, Default Fallback". To nie są te same punkty na obu drabinach wysiłku, więc nagłówek 57,6 kontra 52,6 nie jest porównaniem jak do jak przy dopasowanych budżetach rozumowania. To liczba, którą publikują obie strony, i to liczba, którą należy cytować, jeśli chce się być uczciwym wobec Anthropic, ale nie jest to kontrolowany eksperyment.
Koszt na zadanie to punkt, w którym różnica staje się niekomfortowa.
Artificial Analysis publikuje również rozliczenie kosztów uruchomienia swojego zestawu indeksów, a tutaj dwa modele nie są sobie bliskie.
• Koszt na zadanie indeksowania — Gemini 4 Argon 1,99 USD wobec Claude Opus 5.5 5,98 USD.
• Koszt uruchomienia całego pakietu indeksów — Gemini 4 Argon 2 407 USD w porównaniu z Claude Opus 5.5 8 708 USD.
• Cena katalogowa za milion tokenów — Gemini 4 Argon 2 USD za wejście / 10 USD za wyjście (podana przez Google stawka wprowadzająca, przy czym wejście z pamięci podręcznej objęte jest 95% zniżki, czyli 0,10 USD) w porównaniu z Claude Opus 5.5 4 USD za wejście / 20 USD za wyjście.
• Przepustowość — Gemini 4 Argon 48,9 tokena wyjściowego na sekundę, pierwszy token po 2,79 sekundy; Claude Opus 5.5 92,2 tokena wyjściowego na sekundę, ale opóźnienie pierwszego tokena wynoszące 702 sekundy na tym samym stanowisku testowym, co jest jawnie widocznym podatkiem od rozszerzonego myślenia.
• Koszt Vals za przebieg — Gemini 4 Argon 15,68 USD wobec Claude Opus 5.5 32,14 USD na tym samym zestawie zadań ważonym PKB.
Jest pewna komplikacja, którą warto zasygnalizować, a nie wygładzać: ranking Vals podaje stawki Argonu jako 4 USD za wejście / 20 USD za wyjście, podczas gdy ogłoszenie Google podaje 2 USD za wejście / 10 USD za wyjście na okres wprowadzający. Najbardziej prawdopodobna interpretacja jest taka, że Vals pokazuje standardową stawkę cennikową, a Google promocyjną, ale to wniosek, a nie opublikowane oświadczenie którejkolwiek ze stron. Jeśli Twój budżet zależy od tej liczby, zapytaj Google.
Co twierdzi Argon, a co zostało sprawdzone

Post Google'a jest gęsto wypełniony liczbami i każda z nich pochodzi od dostawcy. Nie znalazłem żadnej, która zostałaby niezależnie odtworzona, a niezależne testy powyżej mierzą coś innego niż to, co Google postanowiło wysunąć na pierwszy plan. Przedstawione jako twierdzenia samego Google:
• DeepSWE v1.1 — 77,9%, opisywany jako nowy stan sztuki w zakresie rzeczywistej inżynierii oprogramowania o długim horyzoncie czasowym.
• Rozumienie długich wideo LVBench — 91,7%, określane jako najnowocześniejsze rozwiązanie.
• AutomationBench (benchmark Zapiera dla kompleksowych zadań biznesowych) — 1. miejsce z wynikiem 51,3%.
• Usuwanie podatności w CWE-bench v1 — ex aequo na pierwszym miejscu z wynikiem 68%, opierając się na wyniku Gemini 3.8 Flash Cyber na tablicy v0.
• Gray Swan Indirect Prompt Injection — opisany jako wiodący, bez podanej w poście liczby.
• Vals Finance Agent v2 i Harvey's Legal Agent Benchmark — określane jako wiodące, podobnie bez podanej liczby w ogłoszeniu.
Dwie rodziny twierdzeń, które rzeczywiście mają niezależne potwierdzenie, są tymi, którym warto ufać najbardziej: Vals potwierdza pozycję w indeksie za pomocą liczby i przedziału, a Artificial Analysis potwierdza indeks 52,6 i cenę. Wewnętrzne anegdoty o produktywności — 40-procentowa poprawa względem opublikowanego punktu odniesienia dla podprogramu kwantowego, ponad 300 TiB pamięci uwolnionej w całej flocie Google przez agentów Argon — to wyniki wewnątrzfirmowe bez zewnętrznego testu i tak należy je odczytywać.
Czym jest Opus 5.5, jeśli żyłeś pod kamieniem
Claude Opus 5.5 to flagowy model Anthropic: kontekst 1 mln tokenów, maksymalnie 128 tys. tokenów wyjściowych, multimodalne dane wejściowe obejmujące tekst, obrazy i pliki, rozszerzone myślenie, korzystanie z narzędzi i strukturyzowane dane wyjściowe. Zastąpił Claude Opus 5 22 września 2026 r., a głównym tematem premiery była prawdopodobnieobniżka ceny — poziom cenowy poszedł w dół, a nie w górę, wynosząc 4 USD/20 USD przy odczytach z pamięci podręcznej po 0,20 USD. Jest dziś dostępny w routingu na OrcaRouter dokładnie w tej stawce, z ceną katalogową dostawcy przekazywaną dalej przyzerowej marży, a zmiana ceny u dostawcy pojawia się po naszej stronie tego samego dnia, w którym pojawia się po jego stronie.
W przypadku wyników na poziomie zadań, którymi dysponują oba modele, obraz przypomina prawdziwą huśtawkę, a nie jednostronne zwycięstwo:
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% kontra Gemini 4 Argon 57,1%.
• SciCode — Claude Opus 5.5 66,9% kontra Gemini 4 Argon 61,8%.
• Humanity's Last Exam — Claude Opus 5.5 61,4% kontra Gemini 4 Argon 57,1%.
• Rozumowanie na długim kontekście — Claude Opus 5.5 84,7% kontra Gemini 4 Argon 79,7%.
• CritPt — Claude Opus 5.5 31,7% kontra Gemini 4 Argon 27,1%.
• Wszechwiedza — Claude Opus 5.5 46,4 versus Gemini 4 Argon 42,4.
• GDPval — Claude Opus 5.5 1 846 kontra Gemini 4 Argon 1 611.
• AutomationBench-AA — Gemini 4 Argon 77,5% kontra Claude Opus 5.5 69,5%. To jedyny wynik bezpośredniego starcia w zadaniu, w którym Argon wyraźnie wygrywa, a jednocześnie jest to rodzina zadań najbliższa temu, co nagradza Vals Index.
Więc wzorzec jest spójny: Opus 5.5 prowadzi na akademicko zabarwionej drabince rozumowania, a Argon prowadzi w kompleksowym wykonywaniu zadań. To nie jest już sprzeczność między tymi dwoma rankingami. To to samo ustalenie wyrażone dwa razy.
Możliwość, której nikt nie porównuje
Limit wyjściowy Gemini 4 Argon to 1 000 000 tokenów w pojedynczej trajektorii, w porównaniu z 64K w poprzedniej generacji. Claude Opus 5.5 ogranicza wyjście do 128K. Oba mają okno kontekstowe o rozmiarze 1M tokenów, ale kontekst i wyjście to różne budżety, a to największy pojedynczy skok w specyfikacji w tej zapowiedzi.
Czy to ma znaczenie, zależy wyłącznie od tego, co uruchamiasz. Limit wyjściowy 128K jest hojny w przypadku czatu, przeglądu kodu, ekstrakcji ustrukturyzowanej i kroków agenta. Jest twardą ścianą przy generowaniu całego zestawu poprawek migracyjnych, pełnego raportu audytowego lub długiego dokumentu w jednym przebiegu — przepływów pracy, którymi Google postanowiło zilustrować premierę. Jeśli Twój pipeline łączy dwadzieścia wywołań, aby zmieścić się pod limitem, limit Argon oszczędzi Ci opóźnień i kodu orkiestracji. Jeśli nie, płacisz za zapas, którego nie wykorzystasz.
Dostępność, a nie jakość, jest decydującą zmienną.
To jest ta część porównania, do której nie dołączono żadnego benchmarku i która ma większe znaczenie niż wszystkie z nich.
Gemini 4 Argon nie jest ogólnie dostępny. W poście Google czytamy, że jest wdrażany u zaufanych specjalistów ds. cyberbezpieczeństwa w ramach Fairwind Program, że firma uczestniczy w dobrowolnym procesie dostępu do modelu przed premierą prowadzonym przez rząd USA oraz że szerszy dostęp dla deweloperów, przedsiębiorstw i konsumentów pojawi się „tak szybko, jak to możliwe”, zaczynając od płacących klientów API i subskrybentów Google AI Ultra. Nie ma identyfikatora modelu, punktu końcowego, opublikowanego limitu ani daty. Nie ma go w naszym katalogu ani w publicznym API nikogo innego, więc strona z cennikiem dla Argon jeszcze nie istnieje.
Claude Opus 5.5 ma dziś premierę. W OrcaRouter występuje jako anthropic/claude-opus-5.5, dostępny przez ten sam endpoint zgodny z OpenAI co pozostałe ponad 200 modeli w katalogu, z automatycznym przełączaniem awaryjnym między dostawcami, gdy jedna trasa ulegnie degradacji, oraz DSL do routingu w przypadkach, gdy chcesz kierować część ruchu do Opus 5.5, a resztę gdzie indziej, używając tego samego klucza. Bez drugiej umowy, bez drugiego SDK.

Praktyczna rekomendacja na następny miesiąc jest nieefektowna: buduj na Opus 5.5, trzymaj nazwę swojego modelu w wartości konfiguracji, a nie w literale ciągu znaków, i umieść tani model za swoją ścieżką ponawiania, aby skok opóźnienia przy przebiegu, w którym pierwszy token pojawia się po 702 sekundach, nie pociągnął za sobą awarii twojego produktu. Ten ostatni punkt nie jest teoretyczny — opóźnienie pierwszego tokenu Opus 5.5 w harnessie AA wynosi jedenaście minut, a niezależnie od tego, czy jest to artefakt harnessu, czy model naprawdę myśli dłużej niż cokolwiek przed nim, twój budżet limitu czasu powinien być ustalany na podstawie tej liczby, a nie marketingu.
Co zmieniłoby ten werdykt?
Trzy rzeczy, w kolejności prawdopodobieństwa. Ogólna dostępność Argonu z opublikowaną ceną, co od razu uczyniłoby argument kosztowy możliwym do wykorzystania i pozwoliłoby sprawdzić, czy $2/$10 przetrwa kontakt z rzeczywistym ruchem. Niezależne, powtarzalne uruchomienie DeepSWE v1.1 i CWE-bench v1 poza Google, które albo potwierdziłoby twierdzenia dostawcy, albo je obaliło. Albo konfiguracja Argonu w Artificial Analysis przy najwyższym ustawieniu wysiłku, która rozstrzygnęłaby, czy pięciopunktowa różnica w indeksie to różnica w możliwościach, czy artefakt ustawień wysiłku.
Dopóki jedno z nich się nie zmaterializuje, uczciwe podsumowanie jest takie, że Opus 5.5 to lepiej zweryfikowany model, a Argon to korzystniej wyceniona obietnica. To, z którego z nich możesz faktycznie korzystać już dziś, nie pozostawia wątpliwości.
Claude Opus 5.5 jest już dostępny na OrcaRouter w cenie katalogowej dostawcy, bez marży, obok reszty katalogu — jeśli chcesz go przetestować na własnym obciążeniu, a nie na tabeli wyników, anthropic/claude-opus-5.5 to identyfikator, który należy wywołać, a podmiana na inny model później to zmiana jednej linii przy tym samym kluczu.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
