
Claude Opus 5.5 kontra GPT-6 Astra: Test smaku, który wyprzedził benchmarki
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ktoś poprosił Claude Opus 5.5 o zrobienie krótkiego filmu o konkurencyjnym laboratorium rozwiązującym równania Naviera–Stokesa, opublikował wynik, a potem napisał zdanie, które sprawia, że to porównanie warto przeprowadzić: model jest „bardzo miły”, ma „świetny gust” i jest pierwszym Claude'em od czasów Opus 4.7, którego naprawdę chce intensywnie używać — ale nadal zostawia GPT-6 Astra i GPT-5.6 Sol jako swoje główne modele do pracy, bo ich praca w dużym stopniu opiera się na badaniach. To trzy twierdzenia w jednym poście i ciągną w różnych kierunkach. Model może być najprzyjemniejszą rzeczą, z jaką się pracuje, a mimo to nie być tym, do którego kierujesz ruch produkcyjny. Ciekawe pytanie nie brzmi, który model jest lepszy. Brzmi: który z tych dwóch werdyktów przetrwa zderzenie z liczbami, a który okaże się stwierdzeniem o guście.
Ten wpis to relacja jednego praktyka, a nie przebieg benchmarku — traktuj go jako sygnał co do tego, jak model jest odbierany w pracy twórczej i otwartej, a nie jako dowód jego możliwości. Wszystkie dane liczbowe poniżej są oznaczone informacją, kto je wytworzył.
Co test smaku może, a czego nie może ci powiedzieć
Tu liczy się artefakt. Robienie filmu o wyniku matematycznym nie jest zadaniem programistycznym z bramką zaliczone/niezaliczone. Nie ma etapu kompilacji, zestawu testów ani środowiska testowego Terminal-Bench, które oceniałoby, czy rzecz jest w ogóle dobra. Model musiał wybrać ujęcie, zdecydować, co pokazać, zachować spójność i przestać. Kiedy praktyk mówi, że model ma „świetny gust”, właśnie to opisuje: osąd dotyczący zakresu i akcentów, który ujawnia się w pracy, w której specyfikacja jest celowo niejasna.
To jest prawdziwa umiejętność i właśnie ją zestawy benchmarków mierzą najgorzej. To także powód, dla którego ta sama osoba może chwalić model, ale nie przejść na niego. Gust jest tym, czego chcesz, gdy eksplorujesz. Nie jest tym, czego chcesz, gdy masz 200 000 linii kodu do audytu i rachunek do uzasadnienia.
Własna narracja Anthropic wokół premiery wskazuje na tę samą zdolność, tyle że w prozie, a nie w wideo: Claude Opus 5.5 jest reklamowany jako piszący mniej „Claudish" — mniej wstępów, mniej asekuracji, więcej gotowości, by postawić sedno na pierwszym miejscu. Niezależne oceny czytelności potwierdzają kierunek tego twierdzenia, nawet jeśli nie zgadzają się co do jego skali. Dostawca donosi również o wewnętrznym teście weryfikacji faktów, w którym zaliczono 16 z 18 prób, wobec zera na 18 w przypadku zarówno Claude Fable 5.1, jak i Claude Opus 5; liczba ta pochodzi od samego Anthropic, nie została odtworzona, więc należy ją czytać jako twierdzenie, a nie wynik.
Dwie tablice wyników, jedna różnica zdań, która ma znaczenie

W surowych opublikowanych benchmarkach Claude Opus 5.5 w większości przypadków wyprzedza GPT-6 Astra. Problem polega na tym, że dwa najczęściej cytowane źródła nie zgadzają się co do tego, jak duża jest ta przewaga.
Tabela premierowa Anthropic umieszcza Claude Opus 5.5 na poziomie 66,4% w Terminal-Bench 4.0, a GPT-6 Astra na 57,9% i Claude Fable 5.1 na 55,8%. To zgłoszona przez dostawcę przewaga 8,5 punktu w kodowaniu agentowym — taki margines, który rozstrzyga spór w prezentacji marketingowej. Artificial Analysis, korzystając z własnego środowiska testowego, zmierzyła Claude Opus 5.5 na 59,6% w tym samym benchmarku: na równi z GPT-6 Astra przy xhigh effort i około 11 punktów powyżej Claude Opus 5. Przewaga jest realna w obu odczytach. Jej rozmiar już nie.
To, gdzie oba modele zamieniają się miejscami, jest bardziej przydatne niż to, gdzie tego nie robią:
• Terminal-Bench 4.0 (kodowanie agentowe) — Claude Opus 5.5 66,4% według własnej tabeli Anthropic, 59,6% według Artificial Analysis; GPT-6 Astra 57,9%.
• Humanity's Last Exam, z użyciem narzędzi — Claude Opus 5.5 67,7% według dostawcy, niezależnie zmierzone na poziomie 61,4%; GPT-6 Astra 57,2%.
• GDPval-AA v2.1 (praca oparta na wiedzy w realnym świecie w 44 zawodach) — Claude Opus 5.5 1 846 Elo; GPT-6 Astra 1 542 Elo. Obie wartości pochodzą z niezależnego rankingu Artificial Analysis, a nie od dostawcy.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% vs Claude Opus 5.5 58,7%. To czyste zwycięstwo Astry, a to naukowo zabarwiony benchmark agentowy.
• AutomationBench — GPT-6 Astra 41,4% vs Claude Opus 5.5 40,0%. Niewielka różnica, ale znów Astra.
• FrontierCode v1.1 — Claude Opus 5.5 54,4% vs GPT-6 Astra 53,3%. W granicach jednego punktu.
Przeczytaj tę listę tak, jak zrobiłby to praktyk. Obciążenia w dużym stopniu oparte na badaniach — te z komponentem naukowym lub literackim, te, które wykonują długą pętlę korzystania z narzędzi i wymagają, by model utrzymał grunt pod nogami — to dokładnie tam, gdzie GPT-6 Astra trzyma się mocno. Tablice pracy wiedzowej i programowania, na których Claude Opus 5.5 zdecydowanie odjeżdża, są tymi, na które wskazałbyś, gdyby twoją pracą było dostarczanie oprogramowania. Obie osoby w tej rozmowie prawidłowo czytają własny benchmark. Po prostu czytają różne benchmarki.
Ustawienie wysiłku wykonuje więcej pracy niż sam model.
Istnieje drugi, mniej pochlebny powód, dla którego główne marże są słabe. Porównania dostawców nie są przeprowadzane przy tych samych ustawieniach.
Opublikowane wyniki Claude Opus 5.5 pochodzą z konfiguracji wysiłku rozumowania extra-high (xhigh), w zestawieniu z GPT-6 Astra w trybie high. Niezależne testy Artificial Analysis ustawiły oba modele na xhigh i luka w kodowaniu znika — 8,5-punktowa przewaga dostawcy staje się remisem. To nie jest oskarżenie o niewłaściwe postępowanie; tak się dzieje, gdy dostawca wybiera konfigurację, w której jego model wypada najlepiej, a niezależne laboratorium wybiera konfigurację odpowiadającą konkurencji. Zanim przeniesiesz obciążenie na podstawie tabeli benchmarków, sprawdź, na jakim ustawieniu wysiłku je uruchomiono, ponieważ odpowiedź często brzmi: „to pochlebne”.
Rachunek za tokeny opowiada tę samą historię z innej perspektywy. Własne materiały premierowe Anthropic pokazują, że Claude Opus 5.5 zużywa rzędu 119 000 tokenów na problem, z czego około 84 000 przypada na myślenie, podczas gdy GPT-6 Astra rozwiązuje porównywalne problemy w około 27 000 tokenów. Tokeny myślenia są rozliczane jako tokeny wyjściowe. Model, który zużywa czterokrotnie więcej tokenów przy jednej piątej ceny wyjścia, wychodzi prawie na zero — i to jeszcze przed uwzględnieniem faktu, że tańszy model często jest tym, który i tak byłbyś gotów uruchomić z wyższym ustawieniem wysiłku.
Jeszcze jedno zastrzeżenie dotyczy konkretnie strony Claude Opus 5.5: system routingu zabezpieczeń Anthropic może kierować niektóre żądania na pograniczu cyberbezpieczeństwa i biologii do bardziej restrykcyjnej ścieżki, co zaniża publikowane wyniki w tych ewaluacjach względem tego, co wygenerowałby sam model bazowy. Jeśli twoja praca dotyczy tych dziedzin, różnica między benchmarkiem a twoim doświadczeniem będzie realna i będzie w kierunku świadczącym o tym, że to benchmark jest optymistyczny.
Ile kosztuje prawdziwe zadanie na każdym

Claude Opus 5.5 to tańszy model w cenniku i nie ma tu nawet porównania:
• Claude Opus 5.5 — 4,00 USD za milion tokenów wejściowych, 20,00 USD za milion tokenów wyjściowych, 0,20 USD za milion tokenów wejściowych z pamięci podręcznej, 5,00 USD za milion zapisów do pamięci podręcznej. Kontekst 1 mln tokenów, maksymalnie 128 tys. tokenów wyjściowych.
• GPT-6 Astra — 10,00 USD za milion tokenów wejściowych, 50,00 USD za milion tokenów wyjściowych, 1,00 USD za milion tokenów wejściowych z pamięci podręcznej, 12,50 USD za milion zapisów do pamięci podręcznej. Po przekroczeniu 272 000 tokenów wejściowych w pojedynczym żądaniu całe żądanie jest wyceniane ponownie według stawki 20,00 USD za wejście i 100,00 USD za wyjście; poziom wsadowy to 5,00 USD/25,00 USD.
Więc Claude Opus 5.5 jest 2,5 razy tańszy na wejściu i 2,5 razy tańszy na wyjściu, a buforowane wejście jest pięć razy tańsze. Jeśli twoje zadania są podobne pod względem tokenów, to cała decyzja, a kwestia gustu jest tylko ozdobą.
Powyższe zastrzeżenie dotyczące zużycia tokenów sprawia, że nie jest to takie proste, a zmiana cennika GPT-6 Astra dla długiego kontekstu to druga pułapka. Wystarczy przekroczyć 272 000 tokenów wejściowych w jednym żądaniu, a całe żądanie — nie tylko nadwyżka — przechodzi na stawkę dla długiego kontekstu. Obciążenie badawcze, które upycha duży korpus w jednym wywołaniu, ma dokładnie taki kształt, który to wyzwala. Tryb wsadowy za połowę ceny to legalna furtka i znajduje się w wolniejszej kolejce.
Uczciwe podsumowanie jest takie, że obraz kosztów odwraca się w zależności od tego, co się robi. W przypadku zadania, w którym oba modele zużywają porównywalną liczbę tokenów, Claude Opus 5.5 wygrywa cenowo z dużą przewagą. W przypadku długiej pętli badawczej typu agentowego, w której liczba tokenów rozjeżdża się tak, jak pokazuje własny materiał premierowy Anthropic, oba modele zbiegają się — co jest znacznie mniej ekscytującym nagłówkiem niż 40% obniżka kosztów i bliższe temu, co raportował praktyk.
Dlaczego użytkownik intensywnie prowadzący research nie dokonał zmiany
Złóż to w całość, a zdanie „nadal wolę Astrę” przestaje być sprzeczne ze zdaniem „świetny smak”. To ta sama obserwacja z innego miejsca.
Zadania, które wymienił użytkownik, są długie, otwarte, wymagają korzystania z narzędzi i są kosztowne w przeliczeniu na jedno uruchomienie. W nich GPT-6 Astra przewodzi w rankingach nauki i automatyzacji, zużywa ułamek tokenów myślenia i — według niezależnego pomiaru — jest na równi w kodowaniu, gdy oba modele pracują z takim samym nakładem. Przewagi Claude Opus 5.5 koncentrują się w pracy, w której widać wynik i można go ocenić: proza, wybory projektowe, określanie zakresu niejednoznacznego zlecenia, decydowanie, co film o Navier-Stokesie powinien właściwie pokazywać. To jest gust, a gust to dokładnie ta część, która nie pojawia się na osi benchmarku.
Jeśli liczyliście na werdykt, że jeden model wygrywa, dowody tego nie potwierdzają. Wersja, której można bronić, jest węższa: Claude Opus 5.5 jest lepszym modelem do pracy, w której wąskim gardłem jest osąd, GPT-6 Astra jest lepszym modelem do pracy, w której wąskim gardłem jest utrzymywany wysiłek w długim kontekście, a różnica cen między nimi maleje niemal do zera w przypadku drugiego rodzaju pracy. To decyzja o routingu, a nie konwersja.
Uruchamianie obu bez migracji

To jest ten moment, w którym dwa modele przestają być wyborem „albo–albo”. GPT-6 Astra jest dziś dostępny w OrcaRouter w cenie katalogowej samego OpenAI — 10,00 USD za wejście, 50,00 USD za wyjście, 1,00 USD za odczyt z pamięci podręcznej, 12,50 USD za zapis do pamięci podręcznej — przy 0% marży, cenie katalogowej dostawcy przekazywanej wprost. Oznacza to, że zmiana stawek dostawcy pojawia się u nas tego samego dnia, a nie wtedy, gdy odsprzedawca zsynchronizuje dane.
Claude Opus 5.5 jest dostępny przez własne API Anthropic oraz kilka platform zewnętrznych; nie wymieniamy go jako czegoś, co oferujemy, a powinieneś sceptycznie podchodzić do każdego, kto twierdzi inaczej, zanim model się upowszechni. To, co możesz zrobić już dziś, to umieścić oba modele za jednym kluczem i jednym kształtem punktu końcowego, i kierować według obciążenia, a nie według preferencji: wysyłaj otwarte, wymagające osądu żądanie do Claude Opus 5.5, a długą pętlę badawczą do GPT-6 Astra bez utrzymywania dwóch kontraktów lub dwóch integracji klienckich.
Automatyczne przełączanie awaryjne sprawia, że można to bezpiecznie testować. Nowy model nie jest jeszcze ścieżką produkcyjną, a kierowanie przez jeden punkt końcowy oznacza, że awaria dostawcy lub limit szybkości przenosi żądanie, zamiast je odrzucać. Jeśli chcesz się przekonać, czy luka w wyczuciu jest prawdziwa w twojej własnej pracy, to tani sposób, by się tego dowiedzieć — uruchom go obok tego, co już masz, zamiast go zastępować, i pozwól swojemu własnemu zestawowi testów zdecydować, a nie tabelom premierowym.
Pytanie, na które benchmarki nie mogą odpowiedzieć
Dwie rzeczy są warte obserwacji i żadna z nich nie jest kolejnym punktem benchmarku.
Pierwsza kwestia to, czy asymetria ustawień wysiłku zostanie rozwiązana. Obecnie tabela dostawcy przy ustawieniu xhigh przeciwko konkurentowi przy ustawieniu high daje 8,5-punktową przewagę, którą niezależne testy przy dopasowanych ustawieniach zamieniają w remis. Gdy niezależne laboratoria publikują serie testów przy dopasowanych ustawieniach na rankingach nauki i automatyzacji, w których GPT-6 Astra obecnie prowadzi, ten obraz może się przesunąć w obie strony — i przesunie się na podstawie dowodów, a nie czyjejś narracji.
Druga to kwestia efektywności tokenów. Jeśli narzut myślenia Claude’a Opus 5.5 spadnie w wydaniu poprawkowym, jego 2,5-krotna przewaga w cenniku przestaje być kompensowana i argument ceny wygrywa bezapelacyjnie. Jeśli tak się nie stanie, to praktyk, który utrzymał GPT-6 Astra jako swoje główne narzędzie, nie jest w tyle za cyklem informacyjnym. Trafnie odczytał własne obciążenie pracą, a tabela premier po prostu go nie mierzyła.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
