Karta tytułowa z napisem „Grok 4.7 vs Claude Opus 5” i podtytułem „Luka cenowa jest realna; parytetu nie ma” oraz trzy karty: AA Index v4.3.2 46 vs 51, Cena za 1 mln $2/$6 vs $5/$25 i Terminal-Bench 4.0 26 vs 49.
Guides & Insights

Grok 4.7 vs Claude Opus 5: Różnica cen jest realna, parytet nie

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Możesz wywołać Grok 4.7 za 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. Możesz wywołać Claude Opus 5 za 5,00 USD i 25,00 USD. To 4,2-krotna różnica na wyjściu — taka luka, która zwykle rozstrzyga porównanie, zanim jeszcze zostaną otwarte benchmarki. Tego porównania nie rozstrzyga. W wersji Artificial Analysis Intelligence Index, względem której oba modele są obecnie oceniane — v4.3.2, wersji opublikowanej 19 września 2026 — Claude Opus 5 ma 51, a Grok 4.7, wydany przez dostawcę 21 września 2026, ma 46. Pięć punktów to nie pogrom, ale układ tych pięciu punktów jest taki: Opus 5 wygrywa osiem z dziesięciu ewaluacji w tym indeksie. Atutem tańszego modelu jest cena, kontekst jest remisowy, a jedyne miejsce, w którym przewaga cenowa Grok 4.7 miała mieć największe znaczenie, jest dokładnie tam, gdzie znika.

Dwa flagowe modele, dwa bardzo różne cenniki

Claude Opus 5 jest dostępny na rynku od 24 lipca 2026 r. i stanowi flagowy model klasy Opus firmy Anthropic, plasujący się poniżej Claude Fable 5.1 w ofercie samej firmy. Oferuje okno kontekstowe o rozmiarze 1 mln tokenów przy stałej cenie — Anthropic wprost podaje, że żądanie o rozmiarze 900 tys. tokenów jest rozliczane według tej samej stawki za token co żądanie o rozmiarze 9 tys. tokenów, bez żadnej dopłaty za długi kontekst — a także maksymalną długość odpowiedzi 128K, rozszerzalną do 300K w Message Batches API. Myślenie jest adaptacyjne i domyślnie włączone, a drabinka wysiłku obejmuje poziomy low, medium, high, xhigh i max, z domyślnym ustawieniem high. Wagi są zamknięte.

Grok 4.7 ma dzień. Ma kontekst 500 tys. tokenów, przyjmuje tekst i obrazy, a zwraca tekst, oraz ma własną regulację poziomu wysiłku rozumowania. Jego cena katalogowa wynosi 2,00 USD za tokeny wejściowe i 6,00 USD za tokeny wyjściowe za milion tokenów poniżej 200 tys. tokenów promptu, a przy tym progu lub powyżej wzrasta do 4,00 USD i 12,00 USD; odczyty z pamięci podręcznej kosztują 0,50 USD i 1,00 USD w tych samych dwóch przedziałach. xAI wymienia również szybszy wariant działający z mniej więcej dwukrotnie większą prędkością wyjściową za mniej więcej dwukrotnie wyższą cenę, choć ta konfiguracja została udostępniona bez dołączonego opublikowanego pomiaru prędkości. Wagi są tutaj również zamknięte, co usuwa furtkę „uruchom to samodzielnie” z obu stron tego porównania.

Niezależna rada nie jest bliska i nie jest to pochlebne.

Oba te modele są oceniane w indeksie v4.3.2 Artificial Analysis, który obejmuje dziesięć ewaluacji dotyczących agentów, kodowania, wiedzy ogólnej i rozumowania naukowego. Zestawienie obu kolumn obok siebie sprawia, że pięciopunktowa różnica z nagłówka wygląda korzystnie dla tańszego modelu — pojedyncza pięciopunktowa luka w wyniku złożonym może wiele ukryć, a tutaj ukrywa niemal kompletne zwycięstwo.

Inteligencja złożona — Grok 4.7 (xhigh): 46 w Artificial Analysis Intelligence Index v4.3.2. Claude Opus 5 (rozumowanie adaptacyjne, maksymalny wysiłek): 51 w tej samej wersji.

Trudne rozumowanie — Grok 4.7: Humanity's Last Exam 43, CritPt 18. Claude Opus 5: HLE 55, CritPt 29. Odpowiednio dwunasto- i jedenastopunktowa różnica, obie na korzyść Opus 5.

Terminale agentowe — Grok 4.7: Terminal-Bench 4.0 26. Claude Opus 5: 49. To największa pojedyncza luka w zestawieniu i dotyczy benchmarku najbliższego prawdziwej autonomicznej pracy.

Automatyzacja pracy — Grok 4.7: AutomationBench-AA 66%. Claude Opus 5: 57%. Jedno wyraźne zwycięstwo Groka 4.7, i to prawdziwe — dziewięć punktów w ewaluacji, która sprawdza, czy agent kończy przepływ pracy, nie naruszając przy tym zabezpieczeń.

Wiedza i uczciwość — Grok 4.7: AA-Omniscience 32. Claude Opus 5: 37. Oba modele halucynują; Opus 5 robi to rzadziej w tym pomiarze.

Długi kontekst — Grok 4.7: AA-LCR v1.1 77%, okno 500 tys. tokenów. Claude Opus 5: 79%, okno 1 mln tokenów.

Koszt uruchomienia indeksu — Grok 4.7: 240 mln tokenów wyjściowych w całej ewaluacji, oznaczony przez Artificial Analysis jako wyjątkowo rozwlekły. Claude Opus 5: 140 mln. Grok 4.7 zużywa 1,7x więcej tokenów, aby osiągnąć niższy wynik.

OrcaRouter model page for Claude Opus 5 showing the anthropic/claude-opus-5 identifier, a 1M-token context window, 128K maximum output, text, image and file input with text output, list rates of $5.00 per 1M input and $25.00 per 1M output, and 69.9M tokens of traffic over seven days.

Gdzie przewaga cenowa Grok 4.7 ginie

Oto arytmetyka, którą ukrywa cennik. Weź realistyczne żądanie agentowe: 30 tys. tokenów wejściowych, 8 tys. wyjściowych. Grok 4.7 nalicza 0,06 USD za wejście i 0,048 USD za wyjście — około jedenastu centów. Claude Opus 5 nalicza 0,15 USD za wejście i 0,20 USD za wyjście — około trzydziestu pięciu centów. To prawdziwa trzykrotność, a przy tym rozmiarze Grok 4.7 jest oczywistym wyborem już pod względem samego kosztu.

Weźmy teraz zapytanie, wokół którego zbudowano marketing samego Grok 4.7: sesję agentową z długim kontekstem. Zwiększ prompt powyżej 200 tys. tokenów, a stawki Grok 4.7 podwajają się do $4,00 za wejście i $12,00 za wyjście. Claude Opus 5 ani drgnie — jego okno 1 mln jest rozliczane po stałych $5,00 i $25,00. Przy 250 tys. tokenów wejściowych i 8 tys. tokenów wyjściowych Grok 4.7 kosztuje $1,00 za wejście i $0,096 za wyjście, około $1,10. Opus 5 kosztuje $1,25 za wejście i $0,20 za wyjście, około $1,45. Różnica zmniejszyła się z 3x do około 1,3x. Zwiększaj dalej — 400 tys., 500 tys., górna granica okna Grok 4.7 — a stała stawka Opus 5 wciąż zmniejsza tę różnicę, podczas gdy jego okno nadal rośnie do miliona tokenów.Grok 4.7 jest tanim modelem przy krótkich promptach i niemal równorzędnym cenowo przy długich, co odwraca intuicję, którą ma tworzyć strona z cennikiem.

Dwa zastrzeżenia pozwalają zachować uczciwość. Po pierwsze, poziom długiego kontekstu to udokumentowana struktura cen katalogowych z dokumentacji modeli samego xAI, a nie pomiar — rzeczywiste rachunki zależą od buforowania, a stawka Grok 4.7 za odczyt z pamięci podręcznej w wysokości 0,50 USD jest naprawdę niska. Po drugie, Artificial Analysis nie opublikowało jeszcze pomiaru szybkości dla Grok 4.7, więc część „jest szybszy” argumentu o taniości i szybkości jest obecnie niezweryfikowana. Zmierzono natomiast Opus 5: 59 tokenów na sekundę przy 49-sekundowym czasie do pierwszego tokenu — wolny, drogi i prowadzący niemal na każdej osi jakości.

Co faktycznie byś trasował

To porównanie, w którym uczciwa odpowiedź zależy od obciążenia, a router to najtańszy sposób, by na tej podstawie działać. Claude Opus 5 jest dostępny w OrcaRouter, wymieniony na własnej stronie modelu, z ceną dostawcy przekazywaną przy 0% marży — więc 5,00 i 25,00 USD Opusa 5 w naszym katalogu to cena katalogowa Anthropic, a nie powiększona kopia, a jeśli Anthropic ją zmieni, liczba zmieni się tego samego dnia na tym samym kluczu. Grok 4.7 nie znajduje się w katalogu OrcaRouter na dzień pisania tego tekstu; aby wywołać go dziś, korzystasz z własnego API xAI oraz platform zewnętrznych, które go udostępniają. Ta asymetria jest warta poznania, zanim zaczniesz projektować wokół niej architekturę.

Two-column scoreboard titled “Grok 4.7 vs Claude Opus 5 - the scoreboard”: AA Index 46 vs 51, Terminal-Bench 4.0 26 vs 49, AutomationBench 66% vs 57%, context 500k vs 1M, price per 1M $2/$6 vs $5/$25, and open weights “no” on both sides.

Wzorzec routingu, który wynika z tych liczb, jest prosty. Zadania wymagające długiego kontekstu, intensywnego rozumowania i pracy agenta terminalowego kieruj do Opus 5 — wygrywa Terminal-Bench 4.0 o 23 punkty i oferuje dwukrotnie większe okno przy stałej cenie, co jest dokładnie profilem trudnego, długiego zadania. Zadania automatyzacji i workflow o dużej skali kieruj do Grok 4.7: wygrywa AutomationBench-AA o dziewięć punktów i kosztuje jedną trzecią tego, co tamten, przy krótkich promptach. Ponieważ do obu dociera się przez jeden endpoint, gdy znajdują się w katalogu, ten podział jest regułą routingu, a nie drugą umową z dostawcą, a automatyczne przełączanie awaryjne sprawia, że limit szybkości na jednej ścieżce staje się zdarzeniem routingu, a nie awarią. Tam, gdzie obciążenie rzeczywiście wymaga obu — taniego pierwszego przebiegu i kosztownego przebiegu weryfikacyjnego — DSL routingu łączy je w jedno wywołanie, a nie dwie integracje.

Werdykt

Jeśli kierujesz się dowodami, Claude Opus 5 wygrywa to starcie i nie jest to nawet blisko: osiem z dziesięciu ocen, dwie największe różnice, dwa razy większy kontekst przy stałej cenie oraz budżet tokenów znacznie poniżej dwóch trzecich rozmiaru przy wyższym wyniku. Pięciopunktowy wynik złożony nie oddaje tego, jak zdecydowanie prowadzi. Sprawa Groka 4.7 jest węższa, niż sugeruje jego cennik, ale nie jest pusta — jest naprawdę tańszy przy rozmiarach promptów, których większość aplikacji faktycznie używa, jest lepszym modelem do automatyzacji, a liczy sobie zaledwie dzień, a jego zestaw benchmarków od dostawcy wciąż jest niezależnie odtwarzany. Kupuj go do automatyzacji wrażliwej na koszty, obserwuj jego wyniki szybkości, gdy Artificial Analysis je opublikuje, a poziom cenowy dla długiego kontekstu traktuj jako to, co rozstrzyga, czy tani model pozostanie tani.

Artificial Analysis page for Grok 4.7 at xhigh reasoning effort: an Artificial Analysis Intelligence Index score of 46, ranked #16 of 655; Speed and Cost both reported as N/A; 240M output tokens from the Intelligence Index run, ranked #140 of 655; a 500k-token context window with text and image input and text output; and comparison charts for intelligence, speed and cost per task.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie