Wygenerowana karta tytułowa dla Claude Opus 5.5 vs GPT-6 Astra, z podtytułem „Sześciodolarowa różnica i dopłata powyżej 272 000 tokenów”, z płaską ikoną wagi szalkowej oraz wierszem stopki o treści „Indeks według Artificial Analysis przy maksymalnym wysiłku; ceny według dostawców”. Prawdziwe logo OrcaRouter zostało wkomponowane w prawym dolnym rogu.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: różnica 6 dolarów i druga cena, którą Astra pobiera powyżej 272K

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W tym miesiącu dwóch dostawców opublikowało tabele benchmarków dla swoich flagowych modeli, a każda z nich pokazuje, że wygrywa jej własny model, i w żadnej z tych tabel nie ma ani jednego wiersza, w którym oba modele zostałyby skonfrontowane ze sobą. Claude Opus 5.5, wydany 22 września 2026 r. w cenie 4 USD za milion tokenów wejściowych, oraz GPT-6 Astra, wydany 3 września 2026 r. w cenie 10 USD za milion tokenów wejściowych, mają między sobą dokładnie dwa pokrywające się benchmarki — i dzielą je między siebie: Opus 5.5 bierze dla siebie zadania zbliżone do AutomationBench w tabeli Ant​hropic, a Astra w tabeli Open​AI, przy czym Astra jest wyraźnie lepsza w rozumowaniu naukowym w obu. To właśnie mogą przekazać materiały dostawcy. Niezależny obraz jest mniej dwuznaczny i wskazuje przeciwny kierunek, a obraz cenowy jest bardziej jednostronny niż którykolwiek z nich.

Co opublikowała każda ze stron

Tabela Anthropic dla Opus 5.5 korzysta z własnego harnessu i własnych ustawień wysiłku, a tam, gdzie wymienia Astra, liczby pochodzą od Anthropic, a nie z ponownego uruchomienia. Cały zestaw traktuj jako dane raportowane przez dostawcę:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-6 Astra 57,9% (Anthropic odnotowuje, że w przebiegu Opusa użyto wysiłku xhigh)

• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%

• GDPval-AA v2.1, praca wiedzowa — Claude Opus 5.5 1846 Elo vs GPT-6 Astra 1542

• AutomationBench — Claude Opus 5.5 40,0% vs GPT-6 Astra 41,4% (Astra na prowadzeniu)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra na prowadzeniu)

• Ostatni egzamin ludzkości, z narzędziami — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%

Strona OpenAI jest trudniejsza do zestawienia, ponieważ OpenAI opublikowało Astrę w zestawieniu z własnym poprzednikiem, a nie z flagowym modelem Anthropic, a wybrane przez OpenAI benchmarki — korzystanie z komputera, inżynieria front-endu, wiedza ogólna — w większości w ogóle nie występują w tabeli Anthropic. To nie jest nieuczciwość, to normalne zachowanie przy premierze, i właśnie dlatego porównanie zbudowane z tabel dwóch dostawców jest porównaniem dwóch selekcji, a nie dwóch modeli. Jedyna rzecz, co do której obie tabele się zgadzają, to że Astra jest mocna w badaniach naukowych z użyciem agentów i w korzystaniu z komputera oraz że oba modele są na tyle blisko siebie w kodowaniu, że wybór środowiska testowego mógłby zmienić wynik.

Niezależny odczyt, którego nie wybrał żaden z dostawców

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis uruchamia każdy model w jednej opublikowanej konfiguracji, więc jego liczby są tutaj jedynymi, które zostały uzyskane przez tego samego ewaluatora w tych samych warunkach:

• Indeks inteligencji — Claude Opus 5.5 58, miejsce #1 spośród 210, a GPT-6 Astra 53, miejsce #6

• Etykieta konfiguracji — Claude Opus 5.5 „Adaptive Reasoning, Max Effort, Default Fallback”, GPT-6 Astra „max”

• Szybkość generowania — GPT-6 Astra 52,5 tokena/s, w dolnej części swojego przedziału cenowego w porównaniu z jeszcze nieopublikowanym Claude Opus 5.5

• Czas do pierwszego tokenu — GPT-6 Astra 352,15 s wobec mediany na tablicy wyników wynoszącej 3,83 s; Claude Opus 5.5 jeszcze nie został opublikowany

• Cena — Claude Opus 5.5 $4.00 za milion na wejściu / $20.00 za milion na wyjściu w porównaniu z GPT-6 Astra $10.00 / $50.00

• Kontekst i wyjście — GPT-6 Astra: kontekst 1M i maksymalne wyjście 128K w porównaniu z Claude Opus 5.5: 1M i 128K

Pięciopunktowa różnica w indeksie nie jest sama w sobie rozstrzygająca i nie należy jej tak odczytywać — oba modele trafiają do tego samego przedziału możliwości, a to właśnie oznacza „frontier” w tym kwartale. To, co jednak ustalają wiersze Astra, to fakt, że wyższa cena nie kupuje przewagi w możliwościach na jednej tablicy wyników, na której występują oba modele. Wiersz dotyczący opóźnienia to uczciwa komplikacja: 352 sekundy do pierwszego tokenu to najwyższy wynik w tej grupie, i to z dużą przewagą, choć mierzy się go przy maksymalnym wysiłku, a model rozumujący, który myśli, zanim coś wygeneruje, zawsze będzie wyglądał na wolny według tej metryki. Wartość 52,5 tokena/s jest bardziej uniwersalna i jest niska jak na model w cenie $10/$50.

Druga cena Astry, powyżej 272 000 tokenów

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

Tabela stawek to miejsce, w którym te dwa przestają być w ogóle porównywalne, ponieważ cennik Astry ma próg. Standardowe stawki to 10,00 USD za wejście, 1,00 USD za wejście z pamięci podręcznej, 12,50 USD za zapis do pamięci podręcznej i 50,00 USD za wyjście za milion tokenów. Po przekroczeniu 272 000 tokenów wejściowych całe żądanie jest jednak wyceniane od nowa — nie nadwyżka, lecz całe wywołanie — według dwukrotności stawek za wejście i pamięć podręczną oraz 1,5-krotności stawki za wyjście. To sprowadza zadania z długim kontekstem do około 20 USD za wejście i 75 USD za wyjście za milion tokenów.

Claude Opus 5.5 nie robi tego. Anthropic nalicza 4,00 USD i 20,00 USD przy pełnym oknie 1 mln tokenów w standardowej cenie i wyraźnie stwierdza, że żądanie o rozmiarze 900 tys. tokenów jest rozliczane według tej samej stawki za token co żądanie o rozmiarze 9 tys. tokenów. Kluczowy stosunek między tymi dwoma — Astra kosztująca 2,5x więcej niż Opus 5.5 w obu kierunkach — nie jest stosunkiem, który ma zastosowanie do obciążeń, dla których oba modele są faktycznie sprzedawane. W przypadku agenta o długim horyzoncie działania, utrzymującego duży kontekst roboczy, porównanie wynosi 20 USD/75 USD wobec 4 USD/20 USD, co daje czynnik pięć na wejściu i prawie cztery na wyjściu. Ceny wsadowe potęgują to, zamiast to naprawiać: Opus 5.5 zmniejsza się o połowę do 2,00 USD/10,00 USD, podczas gdy warstwa flex Astry zmniejsza się o połowę do 5,00 USD/25,00 USD na bazie, która w przypadku długiego kontekstu jest już pięciokrotnie wyższa.

To najważniejsza z punktu widzenia decyzji asymetria w tym porównaniu i jest niewidoczna we wszystkich tabelach premierowych obu firm, ponieważ obaj dostawcy podają stawkę nagłówkową. Jeśli Twoje prompty mieszczą się poniżej 272 tys. tokenów, zignoruj to. Jeśli budujesz agenta, który czyta repozytorium lub zestaw dokumentów, wyceniaj go na $20/$75, zanim cokolwiek porównasz.

Dostęp stanowi część specyfikacji

Astra to pierwszy model OpenAI, który przekroczył krytyczny próg zdolności w zakresie cyberbezpieczeństwa w ramach własnego Preparedness Framework firmy, a sposób wdrożenia odzwierciedla tę klasyfikację, a nie względy przepustowości. Dostęp otwarto najpierw dla ograniczonego zestawu organizacji, dostęp dla przedsiębiorstw wymaga, aby administrator go włączył, zanim użytkownicy go zobaczą, a udostępniony model wprost odmawia wykonania niektórych kategorii prac. Claude Opus 5.5 pojawia się z wersją tego samego problemu z przeciwnej strony: jest dostarczany z poziomem zabezpieczeń, który Anthropic wcześniej zarezerwował dla Claude Fable 5.1, co oznacza, że większość zapytań dotyczących cyberbezpieczeństwa jest przekierowywana do Claude Opus 4.8, a prace biologiczne są kierowane do Claude Opus 5, chyba że konto jest zweryfikowane.

Oba zachowania pojawiają się w tym samym miejscu, czyli w Twojej ewaluacji. Artificial Analysis określa konfigurację Opus 5.5 mianem „Default Fallback” właśnie dlatego, że żądania mogą trafić do innego modelu niż ten, który wskazano, a w przypadku promptów dotyczących bezpieczeństwa lub nauk przyrodniczych dzieje się tak rutynowo. Jeśli Twoje obciążenie mieści się w tych dziedzinach, ciąg znaków modelu w żądaniu nie jest gwarancją co do modelu, który odpowiedział, a Twoje wskaźniki jakości będą obejmować mniejszy model w nieznanym odsetku wywołań. Żaden z dostawców tego nie ukrywa — obaj to dokumentują — ale żaden nagłówek też o tym nie wspomina.

Wybór między nimi

To porównanie w istocie sprowadza się do decyzji, czy obciążenie związane z długim kontekstem uzasadnia progowy cennik Astry, a dla większości zespołów odpowiedź będzie brzmieć: nie; Opus 5.5 jest tańszy w każdej pozycji poniżej 272K, drastycznie tańszy powyżej tego progu, uzyskuje wyższe wyniki w jedynym niezależnym rankingu i sięga 1 mln tokenów kontekstu bez dopłaty. Argument Astry jest węższy, ale realny — rozumowanie naukowe, korzystanie z komputera i narzędzia ekosystemu OpenAI — a jeśli twoje ewaluacje stawiają ją wyżej w tych obszarach, dopłata jest pozycją kosztową, a nie błędem.

To staje się praktyczne w tym, jak zestawiasz oba modele ze sobą, ponieważ rzetelne porównanie wymaga obu modeli na tym samym kluczu i tym samym rachunku. Oba można kierować przez OrcaRouter po cenie katalogowej dostawcy z 0% marży — Claude Opus 5.5 w cenie Anthropic 4,00/20,00 USD, a GPT-6 Astra w cenie 10,00/50,00 USD — co oznacza, że decyzję dotyczącą 272K można przetestować na własnym ruchu, zamiast spierać się na podstawie dwóch komunikatów prasowych. Przypisanie Astry do klas zadań, w których wygrywa, i pozwolenie, by automatyczne przełączanie awaryjne zajęło się resztą, to reguła routingu, a żądanie przekraczające granicę 272K można skierować tańszą ścieżką bez zmiany kodu, ponieważ reguła znajduje się w routerze, a nie w Twojej aplikacji.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

Co zmieniłoby odpowiedź

Jedna rzecz by to rozstrzygnęła: kontrolowane bezpośrednie porównanie przy dopasowanym nakładzie na wspólnych benchmarkach. Żaden z dostawców takiego nie opublikował i żaden nie ma w tym interesu, co pozostawia niezależny indeks jako jedyne dostępne porównanie w tych samych warunkach — a ten indeks stawia Opus 5.5 o pięć punktów i pięć miejsc wyżej niż Astra, za mniej niż połowę ceny za token. Kontrargument, na który warto uważać, jest taki, że oba modele oceniano przy maksymalnym nakładzie, podczas gdy Opus 5.5 jest domyślnie udostępniany w trybie średnim; jeśli przewaga Astry w długoterminowej pracy naukowej przetrwa próbę przy dopasowanym nakładzie, argument za premią cenową stanie się mocniejszy, a nie słabszy. Dopóki ktoś tego nie przeprowadzi, jedynym możliwym do obrony stanowiskiem jest to, że Astra jest specjalistą wycenionym jak generalista, a Opus 5.5 to generalista, który przypadkiem uzyskuje wyższe wyniki.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie