
Claude Opus 5.5 vs GPT-6 Astra: różnica 6 dolarów i druga cena, którą Astra pobiera powyżej 272K
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
W tym miesiącu dwóch dostawców opublikowało tabele benchmarków dla swoich flagowych modeli, a każda z nich pokazuje, że wygrywa jej własny model, i w żadnej z tych tabel nie ma ani jednego wiersza, w którym oba modele zostałyby skonfrontowane ze sobą. Claude Opus 5.5, wydany 22 września 2026 r. w cenie 4 USD za milion tokenów wejściowych, oraz GPT-6 Astra, wydany 3 września 2026 r. w cenie 10 USD za milion tokenów wejściowych, mają między sobą dokładnie dwa pokrywające się benchmarki — i dzielą je między siebie: Opus 5.5 bierze dla siebie zadania zbliżone do AutomationBench w tabeli Anthropic, a Astra w tabeli OpenAI, przy czym Astra jest wyraźnie lepsza w rozumowaniu naukowym w obu. To właśnie mogą przekazać materiały dostawcy. Niezależny obraz jest mniej dwuznaczny i wskazuje przeciwny kierunek, a obraz cenowy jest bardziej jednostronny niż którykolwiek z nich.
Co opublikowała każda ze stron
Tabela Anthropic dla Opus 5.5 korzysta z własnego harnessu i własnych ustawień wysiłku, a tam, gdzie wymienia Astra, liczby pochodzą od Anthropic, a nie z ponownego uruchomienia. Cały zestaw traktuj jako dane raportowane przez dostawcę:
• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-6 Astra 57,9% (Anthropic odnotowuje, że w przebiegu Opusa użyto wysiłku xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%
• GDPval-AA v2.1, praca wiedzowa — Claude Opus 5.5 1846 Elo vs GPT-6 Astra 1542
• AutomationBench — Claude Opus 5.5 40,0% vs GPT-6 Astra 41,4% (Astra na prowadzeniu)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% vs GPT-6 Astra 64,6% (Astra na prowadzeniu)
• Ostatni egzamin ludzkości, z narzędziami — Claude Opus 5.5 67,7% vs GPT-6 Astra 57,2%
Strona OpenAI jest trudniejsza do zestawienia, ponieważ OpenAI opublikowało Astrę w zestawieniu z własnym poprzednikiem, a nie z flagowym modelem Anthropic, a wybrane przez OpenAI benchmarki — korzystanie z komputera, inżynieria front-endu, wiedza ogólna — w większości w ogóle nie występują w tabeli Anthropic. To nie jest nieuczciwość, to normalne zachowanie przy premierze, i właśnie dlatego porównanie zbudowane z tabel dwóch dostawców jest porównaniem dwóch selekcji, a nie dwóch modeli. Jedyna rzecz, co do której obie tabele się zgadzają, to że Astra jest mocna w badaniach naukowych z użyciem agentów i w korzystaniu z komputera oraz że oba modele są na tyle blisko siebie w kodowaniu, że wybór środowiska testowego mógłby zmienić wynik.
Niezależny odczyt, którego nie wybrał żaden z dostawców

Artificial Analysis uruchamia każdy model w jednej opublikowanej konfiguracji, więc jego liczby są tutaj jedynymi, które zostały uzyskane przez tego samego ewaluatora w tych samych warunkach:
• Indeks inteligencji — Claude Opus 5.5 58, miejsce #1 spośród 210, a GPT-6 Astra 53, miejsce #6
• Etykieta konfiguracji — Claude Opus 5.5 „Adaptive Reasoning, Max Effort, Default Fallback”, GPT-6 Astra „max”
• Szybkość generowania — GPT-6 Astra 52,5 tokena/s, w dolnej części swojego przedziału cenowego w porównaniu z jeszcze nieopublikowanym Claude Opus 5.5
• Czas do pierwszego tokenu — GPT-6 Astra 352,15 s wobec mediany na tablicy wyników wynoszącej 3,83 s; Claude Opus 5.5 jeszcze nie został opublikowany
• Cena — Claude Opus 5.5 $4.00 za milion na wejściu / $20.00 za milion na wyjściu w porównaniu z GPT-6 Astra $10.00 / $50.00
• Kontekst i wyjście — GPT-6 Astra: kontekst 1M i maksymalne wyjście 128K w porównaniu z Claude Opus 5.5: 1M i 128K
Pięciopunktowa różnica w indeksie nie jest sama w sobie rozstrzygająca i nie należy jej tak odczytywać — oba modele trafiają do tego samego przedziału możliwości, a to właśnie oznacza „frontier” w tym kwartale. To, co jednak ustalają wiersze Astra, to fakt, że wyższa cena nie kupuje przewagi w możliwościach na jednej tablicy wyników, na której występują oba modele. Wiersz dotyczący opóźnienia to uczciwa komplikacja: 352 sekundy do pierwszego tokenu to najwyższy wynik w tej grupie, i to z dużą przewagą, choć mierzy się go przy maksymalnym wysiłku, a model rozumujący, który myśli, zanim coś wygeneruje, zawsze będzie wyglądał na wolny według tej metryki. Wartość 52,5 tokena/s jest bardziej uniwersalna i jest niska jak na model w cenie $10/$50.
Druga cena Astry, powyżej 272 000 tokenów

Tabela stawek to miejsce, w którym te dwa przestają być w ogóle porównywalne, ponieważ cennik Astry ma próg. Standardowe stawki to 10,00 USD za wejście, 1,00 USD za wejście z pamięci podręcznej, 12,50 USD za zapis do pamięci podręcznej i 50,00 USD za wyjście za milion tokenów. Po przekroczeniu 272 000 tokenów wejściowych całe żądanie jest jednak wyceniane od nowa — nie nadwyżka, lecz całe wywołanie — według dwukrotności stawek za wejście i pamięć podręczną oraz 1,5-krotności stawki za wyjście. To sprowadza zadania z długim kontekstem do około 20 USD za wejście i 75 USD za wyjście za milion tokenów.
Claude Opus 5.5 nie robi tego. Anthropic nalicza 4,00 USD i 20,00 USD przy pełnym oknie 1 mln tokenów w standardowej cenie i wyraźnie stwierdza, że żądanie o rozmiarze 900 tys. tokenów jest rozliczane według tej samej stawki za token co żądanie o rozmiarze 9 tys. tokenów. Kluczowy stosunek między tymi dwoma — Astra kosztująca 2,5x więcej niż Opus 5.5 w obu kierunkach — nie jest stosunkiem, który ma zastosowanie do obciążeń, dla których oba modele są faktycznie sprzedawane. W przypadku agenta o długim horyzoncie działania, utrzymującego duży kontekst roboczy, porównanie wynosi 20 USD/75 USD wobec 4 USD/20 USD, co daje czynnik pięć na wejściu i prawie cztery na wyjściu. Ceny wsadowe potęgują to, zamiast to naprawiać: Opus 5.5 zmniejsza się o połowę do 2,00 USD/10,00 USD, podczas gdy warstwa flex Astry zmniejsza się o połowę do 5,00 USD/25,00 USD na bazie, która w przypadku długiego kontekstu jest już pięciokrotnie wyższa.
To najważniejsza z punktu widzenia decyzji asymetria w tym porównaniu i jest niewidoczna we wszystkich tabelach premierowych obu firm, ponieważ obaj dostawcy podają stawkę nagłówkową. Jeśli Twoje prompty mieszczą się poniżej 272 tys. tokenów, zignoruj to. Jeśli budujesz agenta, który czyta repozytorium lub zestaw dokumentów, wyceniaj go na $20/$75, zanim cokolwiek porównasz.
Dostęp stanowi część specyfikacji
Astra to pierwszy model OpenAI, który przekroczył krytyczny próg zdolności w zakresie cyberbezpieczeństwa w ramach własnego Preparedness Framework firmy, a sposób wdrożenia odzwierciedla tę klasyfikację, a nie względy przepustowości. Dostęp otwarto najpierw dla ograniczonego zestawu organizacji, dostęp dla przedsiębiorstw wymaga, aby administrator go włączył, zanim użytkownicy go zobaczą, a udostępniony model wprost odmawia wykonania niektórych kategorii prac. Claude Opus 5.5 pojawia się z wersją tego samego problemu z przeciwnej strony: jest dostarczany z poziomem zabezpieczeń, który Anthropic wcześniej zarezerwował dla Claude Fable 5.1, co oznacza, że większość zapytań dotyczących cyberbezpieczeństwa jest przekierowywana do Claude Opus 4.8, a prace biologiczne są kierowane do Claude Opus 5, chyba że konto jest zweryfikowane.
Oba zachowania pojawiają się w tym samym miejscu, czyli w Twojej ewaluacji. Artificial Analysis określa konfigurację Opus 5.5 mianem „Default Fallback” właśnie dlatego, że żądania mogą trafić do innego modelu niż ten, który wskazano, a w przypadku promptów dotyczących bezpieczeństwa lub nauk przyrodniczych dzieje się tak rutynowo. Jeśli Twoje obciążenie mieści się w tych dziedzinach, ciąg znaków modelu w żądaniu nie jest gwarancją co do modelu, który odpowiedział, a Twoje wskaźniki jakości będą obejmować mniejszy model w nieznanym odsetku wywołań. Żaden z dostawców tego nie ukrywa — obaj to dokumentują — ale żaden nagłówek też o tym nie wspomina.
Wybór między nimi
To porównanie w istocie sprowadza się do decyzji, czy obciążenie związane z długim kontekstem uzasadnia progowy cennik Astry, a dla większości zespołów odpowiedź będzie brzmieć: nie; Opus 5.5 jest tańszy w każdej pozycji poniżej 272K, drastycznie tańszy powyżej tego progu, uzyskuje wyższe wyniki w jedynym niezależnym rankingu i sięga 1 mln tokenów kontekstu bez dopłaty. Argument Astry jest węższy, ale realny — rozumowanie naukowe, korzystanie z komputera i narzędzia ekosystemu OpenAI — a jeśli twoje ewaluacje stawiają ją wyżej w tych obszarach, dopłata jest pozycją kosztową, a nie błędem.
To staje się praktyczne w tym, jak zestawiasz oba modele ze sobą, ponieważ rzetelne porównanie wymaga obu modeli na tym samym kluczu i tym samym rachunku. Oba można kierować przez OrcaRouter po cenie katalogowej dostawcy z 0% marży — Claude Opus 5.5 w cenie Anthropic 4,00/20,00 USD, a GPT-6 Astra w cenie 10,00/50,00 USD — co oznacza, że decyzję dotyczącą 272K można przetestować na własnym ruchu, zamiast spierać się na podstawie dwóch komunikatów prasowych. Przypisanie Astry do klas zadań, w których wygrywa, i pozwolenie, by automatyczne przełączanie awaryjne zajęło się resztą, to reguła routingu, a żądanie przekraczające granicę 272K można skierować tańszą ścieżką bez zmiany kodu, ponieważ reguła znajduje się w routerze, a nie w Twojej aplikacji.

Co zmieniłoby odpowiedź
Jedna rzecz by to rozstrzygnęła: kontrolowane bezpośrednie porównanie przy dopasowanym nakładzie na wspólnych benchmarkach. Żaden z dostawców takiego nie opublikował i żaden nie ma w tym interesu, co pozostawia niezależny indeks jako jedyne dostępne porównanie w tych samych warunkach — a ten indeks stawia Opus 5.5 o pięć punktów i pięć miejsc wyżej niż Astra, za mniej niż połowę ceny za token. Kontrargument, na który warto uważać, jest taki, że oba modele oceniano przy maksymalnym nakładzie, podczas gdy Opus 5.5 jest domyślnie udostępniany w trybie średnim; jeśli przewaga Astry w długoterminowej pracy naukowej przetrwa próbę przy dopasowanym nakładzie, argument za premią cenową stanie się mocniejszy, a nie słabszy. Dopóki ktoś tego nie przeprowadzi, jedynym możliwym do obrony stanowiskiem jest to, że Astra jest specjalistą wycenionym jak generalista, a Opus 5.5 to generalista, który przypadkiem uzyskuje wyższe wyniki.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
