Wygenerowano kartę tytułową hero dla Claude Opus 5.5 vs Grok 4.6, podzieloną pionowym separatorem: „Claude Opus 5.5” z „$4.00 / $20.00” po lewej, „Grok 4.6” z „$2.00 / $6.00” po prawej, a na dole hasło „JEDEN MODEL CZYTA, DRUGI DZIAŁA”, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Claude Opus 5.5 vs Grok 4.6: Jeden model czyta, drugi działa

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Claude Opus 5.5 i Grok 4.6 to dwa najtańsze sposoby na zakup modelu klasy frontier, który utrzyma pół miliona tokenów kontekstu — i nie są tym samym produktem. W jednym pomiarze Grok 4.6 ma trzy punkty straty do absolutnego pułapu: 94,9 na GPQA Diamond, zestawie pytań naukowych na poziomie magisterskim, w którym flagowy model Anthropic plasuje się w tym samym przedziale. W kolejnym traci trzydzieści osiem punktów. W Terminal-Bench 4.0, agentowym benchmarku terminala, który wymaga od modelu wykonania prawdziwej pracy w powłoce, Artificial Analysis przyznało Grokowi 4.6 wynik 21,21%, a Claude'owi Opus 5.5 — 59,60%. To nie jest błąd w druku w żadną stronę, a cała istota tego zestawienia polega na wyjaśnieniu, dlaczego obie liczby są prawdziwe jednocześnie.

Dwie premiery, jedna półka cenowa, cztery miesiące odstępu

SpaceXAI udostępnił Grok 4.6 12 sierpnia 2026 r. jako obecny flagowy model linii Grok, w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za tokeny wyjściowe, z oknem kontekstowym wynoszącym 500 000 tokenów oraz obsługą danych wejściowych w postaci tekstu, obrazów i plików. Anthropic udostępnił Claude Opus 5.5 22 września 2026 r., około sześć tygodni później, w cenie 4,00 USD/20,00 USD z oknem kontekstowym 1 000 000 tokenów i 128 000 tokenów wyjściowych. Oba obsługują konfigurowalny poziom intensywności rozumowania, wywoływanie narzędzi i ustrukturyzowane dane wyjściowe; oba obsługują interfejs czatu zgodny z OpenAI, a także własny format swojego dostawcy.

Zatem naiwna interpretacja to czysty układ: Grok 4.6 kosztuje połowę ceny wejścia i około jedną trzecią ceny wyjścia, a Claude Opus 5.5 odpowiada z dwukrotnie większym oknem kontekstowym. Ten układ jest realny i w pracy z długimi dokumentami może być jedyną rzeczą, która ma znaczenie. To także nie jest miejsce, w którym kryje się interesująca rozbieżność, ponieważ oba modele zostały zmierzone na tym samym niezależnym środowisku testowym i nie znalazły się w tym samym punkcie na osiach, które mają znaczenie dla pracy agentowej.

Co katalog mówi o osiach, na których oba zostały zmierzone.

Katalog OrcaRouter zawiera proweniencję benchmarków w każdym wierszu — każda liczba wskazuje ewaluatora, od którego pochodzi — więc poniższe pary pochodzą w całości z jednego źródła dla obu modeli, Artificial Analysis, a nie z liczby dostawcy po jednej stronie i liczby strony trzeciej po drugiej:

• GPQA Diamond — Claude Opus 5.5 nie jest wymieniony na tej osi w naszym katalogu; Grok 4.6 uzyskuje 94,9%

• Ostatni egzamin ludzkości — 61,4% dla Claude Opus 5.5 wobec 42,9% dla Grok 4.6

• SciCode — 66,9% wobec 56,5%

• Przywoływanie w długim kontekście — 84,7% wobec 80,3%

• Terminal-Bench 4.0 — 59,60% wobec 21,21%

• AA Intelligence Index — 57,6 w porównaniu do 44,3

Wiersz GPQA celowo pozostawiono pusty po stronie Anthropic, zamiast wypełniać go z prezentacji dostawcy. Wynik 94,9 modelu Grok 4.6 w tym wierszu to najmocniejsza liczba na jego karcie i jest autentyczny — niezależny pomiar, a nie twierdzenie SpaceXAI — i mówi coś prawdziwego o modelu: gdy zadanie jest dobrze sformułowanym pytaniem z jedną odpowiedzią, której można bronić, Grok 4.6 osiąga poziom czołówki. Zestaw to z wynikiem 21,21% w Terminal-Bench 4.0, a kształt staje się czytelny. Udzielenie poprawnej odpowiedzi na temat nauki i wykonanie pięcioetapowego zadania w powłoce na rzeczywistym systemie plików to różne kompetencje, a Grok 4.6 jest znacznie dalej zaawansowany w pierwszej niż w drugiej.

Jedno zastrzeżenie do tego zestawienia, zanim zostanie ono użyte jako werdykt: wyniki obu modeli w Artificial Analysis zostały zarejestrowane w różnych datach oceny, a te dla Grok 4.6 pochodzą z wcześniejszego zestawu. Porównanie dotyczy modelu ocenianego w sierpniu i modelu ocenianego we wrześniu w środowisku testowym, które samo zostało zmienione w tym okresie. Kierunek tej różnicy jest spójny w pięciu odrębnych wymiarach, dlatego traktujemy to jako sygnał, ale dokładne wartości punktowe należy odczytywać jako porównanie sierpnia z wrześniem, a nie jako porównanie z tego samego dnia.

Indeks zbudowany przez kogoś, kto też nie sprzedaje.

Istnieje drugi, niezależny pomiar, który zgadza się co do kierunku, choć znacznie mniej chętnie dokonuje subtelnych rozróżnień. Epoch Capabilities Index, stworzony przez Epoch AI jako kompozyt ponad pięćdziesięciu benchmarków i przeskalowany tak, że Claude 3.5 Sonnet plasuje się na 130, a GPT-5 na 150, umieszcza Claude Opus 5.5 na 167,35 w pliku, który czytaliśmy 2 października 2026 r. Grok 4.6 ma 156,61, z oceny z 12 sierpnia. To różnica 10,74 punktu w skali, w której — jak zaobserwowano — około pięć punktów odpowiadało podwojeniu miary horyzontu czasowego METR w momencie uruchomienia indeksu — duża i z dużym zapasem wykraczająca poza opublikowane przedziały obu modeli: od 164,0 do 172,0 oraz od 154,66 do 158,93, które w ogóle się nie pokrywają.

Warto zauważyć, czego ten indeks nie rozstrzyga. Daje on Claude Sonnet 5.5 wynik 165,2, a Claude Fable 5.1 – 164,82, oba powyżej Grok 4.6, a oba z nich mają niższy koszt za milion tokenów wyjściowych niż stawka drugiego poziomu Grok 4.6. Kto kieruje się wyłącznie stosunkiem możliwości do ceny, ma trzecią i czwartą opcję w tej samej rodzinie dostawcy, a zestawienie w tym artykule dotyczy czegoś innego: tego, w czym każdy z tych dwóch modeli jest dobry.

Karty stawek i wiersz, który pojawia się tylko na jednej z nich

A two-column scoreboard comparing Claude Opus 5.5 and Grok 4.6 across six rows. Left column Claude Opus 5.5: input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K max output, AA Intelligence Index 57.6, Epoch Capabilities Index 167.35. Right column Grok 4.6: input $2.00 doubling to $4.00 above 200K tokens, output $6.00 doubling to $12.00, cache read $0.50, context 500K tokens, AA Intelligence Index 44.3, Epoch Capabilities Index 156.61. A footer line reads 'Prices and catalogue figures per the OrcaRouter catalogue; Index figures per Artificial Analysis and the Epoch Capabilities Index.'

Cennik Grok 4.6 zawiera próg, którego nie ma cennik Claude Opus 5.5: żądania powyżej 200 000 tokenów promptu są rozliczane po podwójnej stawce podstawowej, więc wejście rośnie z $2.00 do $4.00, a wyjście z $6.00 do $12.00, przy czym odczyt z pamięci podręcznej zmienia się z $0.50 na $1.00. Claude Opus 5.5 pobiera $4.00/$20.00, a odczyty z pamięci podręcznej kosztują płasko $0.20 w całym oknie 1 000 000 tokenów. Ta inwersja jest praktyczną konsekwencją kupowania długiego kontekstu w którymkolwiek z tych modeli i odwraca porównanie cen na metce, gdy obciążenie faktycznie rośnie:

• Cena przy 30 000 tokenów wejściowych — Claude Opus 5.5 jest tym droższym, około 28 centów za 30 000 na wejściu i 8 000 na wyjściu, w porównaniu z około 11 centami dla Grok 4.6

• Cena przy 250 000 tokenów wejściowych — kolejność się odwraca, ponieważ Grok 4.6 przeszedł na swój podwojony próg, a Claude Opus 5.5 nie.

• Odczyty z pamięci podręcznej — 0,20 USD za milion w przypadku Claude Opus 5.5 w porównaniu z 0,50 USD w przypadku Grok 4.6, a powyżej progu wzrasta do 1,00 USD

• Maksymalna wielkość wyjścia — 128 000 tokenów dla Claude Opus 5.5; górny limit wyjścia Grok 4.6 nie został podany w rekordzie katalogowym

Grok 4.6 ma też jedną lukę, którą warto przedstawić wprost, zamiast pozostawiać ją do późniejszego odkrycia. W jego zapisie nie podano w ogóle żadnej wartości maksymalnego wyjścia — to pole jest niezmierzone, a nie zerowe — więc obciążenie zależne od bardzo długich pojedynczych odpowiedzi nie ma opublikowanej liczby, na której można by oprzeć planowanie po tej stronie porównania.

Kolumna wydajności, która nie powinna być odczytywana

Nasz katalog zawiera również panel wydajności serwowania dla każdego modelu, a w przypadku Grok 4.6 jest to najbardziej mylący element na stronie. Karta podaje opóźnienie p50 na poziomie 10 000 milisekund oraz wskaźnik błędów 97,58% w siedmiodniowym oknie, przy 26 184 tokenach obsłużonych w tym okresie. Te pola nie opisują wolnego modelu. Opisują model, który był ledwie wywoływany: przy takim poziomie ruchu próba jest zbyt uboga, by rozkład opóźnień mógł cokolwiek znaczyć, a wskaźnik błędów odzwierciedla garstkę prób, a nie jakość usługi. Traktowanie tego bloku jako dowodu na to, że Grok 4.6 jest wolny, byłoby odczytaniem artefaktu pomiarowego jako pomiaru.

Panel Claude Opus 5.5, dla kontrastu, ma za sobą populację — p50 w zakresie 4,4 sekundy w siedmiodniowym oknie z dziennymi próbkami i 156 milionów tokenów obsłużonych w tym samym okresie. Nawet to należy odczytywać jako to, czym jest: nasz własny ruch w piaskownicy, który jest próbką naszych użytkowników, a nie właściwością modelu.

Który z nich skierować i jak się tego dowiedzieć na podstawie własnej pracy

Podział, który opisują liczby, jest wystarczająco stabilny, by na jego podstawie działać. Claude Opus 5.5 to wybór do pracy agentowej i długoterminowej — różnica w Terminal-Bench 4.0 wynosząca 59,60% wobec 21,21% to największa różnica spośród osi, na których mierzono oba modele, i to właśnie ta oś pozwala przewidzieć, czy modelowi można powierzyć zadanie, a nie pytanie. Jest także wyborem, gdy prompt jest naprawdę długi, ponieważ stawki nie rosną skokowo, a okno jest dwa razy większe. Grok 4.6 to wybór do masowej pracy w formie pytań: wynik 94,9% w GPQA Diamond przy stawce $2.00/$6.00 w ramach pierwszych 200 000 tokenów to bardzo korzystna oferta dla obciążeń typu wyszukiwanie i udzielanie odpowiedzi, które nigdy nie rozrosną się na tyle, by wejść w próg podwójnych stawek.

Oba są dostępne na OrcaRouter w cenie katalogowej dostawcy z 0% marży — Claude Opus 5.5 za $4.00/$20.00 z odczytami z pamięci podręcznej po $0.20, Grok 4.6 za $2.00/$6.00 z progiem powyżej 200K stosowanym dokładnie tak, jak ustala SpaceXAI — pod jednym kluczem, więc powyższy podział można przetestować na własnym zestawie promptów, zamiast się o niego spierać. Gdzie oba są kierowane, automatyczne przełączanie awaryjne działa pod spodem, co warto mieć, gdy tańszy model jest tym, który utrzymuje ścieżkę agentową.

Werdykt, na jaki zasługuje ten duet: Grok 4.6 jest lepszym czytelnikiem, a Claude Opus 5.5 lepszym pracownikiem. Wyniki 94,9 w GPQA Diamond i 21,21 w Terminal-Bench to ten sam model mierzony dwukrotnie, a cała decyzja sprowadza się do wiedzy o tym, którą z tych dwóch liczb przypomina twoje obciążenie pracą.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.Screenshot of the OrcaRouter model page for Grok 4.6 (grok/grok-4.6), showing the model header, the context window of 500,000 tokens, the text, image and file input surface, the capability tags, and the input and output price figures per million tokens.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie