Karta tytułowa hero dla Claude Opus 5.5 vs GPT-5.6 Sol, z nagłówkiem „Dwie tabele premier, które ledwo się pokrywają”, z plakietkami o treści 4,00 USD vs 5,00 USD, 66,4% vs 37,3% i odcięcie cze vs lut, a w prawym dolnym rogu logo OrcaRouter.
Guides & Insights

Claude Opus 5.5 kontra GPT-5.6 Sol: dwie tabele premierowe, które ledwo się pokrywają

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw Claude Opus 5.5 i GPT-5.6 Sol obok siebie w tym tygodniu, a pierwsze, co zauważysz, to nie zwycięzca. To, że obaj dostawcy opublikowali tabele benchmarków, które ledwie mają wspólny wiersz. Materiały premierowe Claude Opus 5.5, wydanego 22 września 2026 r., stawiają go 29 punktów przed GPT-5.6 Sol w Terminal-Bench 4.0. Materiały premierowe Sol, powszechnie dostępnego od 9 lipca 2026 r., prowadzą natomiast z Terminal-Bench 2.1, gdzie Sol Ultra uzyskał 91,9%, oraz Artificial Analysis Coding Agent Index, gdzie zajął pierwsze miejsce z wynikiem 80. Obie tabele są prawdziwe. Obie zostały przeprowadzone przez dostawcę, który w nich wygrywa. Użyteczne pytanie nie brzmi, który model jest lepszy w oderwaniu od kontekstu — lecz który benchmark, uruchomiony w czyim środowisku testowym, mówi ci cokolwiek o twoim obciążeniu. To pytanie trudniejsze, niż którykolwiek z wpisów premierowych chciałby, żebyś zadał, i to właśnie wokół niego zbudowane jest to porównanie.

Te dwa modele, obok siebie

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• Dostawca — Anthropic vs OpenAI

• Wydano — Claude Opus 5.5 22 września 2026 r. kontra GPT-5.6 Sol 9 lipca 2026 r.

• Cena za milion tokenów — 4,00 USD za wejście / 20,00 USD za wyjście vs 5,00 USD za wejście / 30,00 USD za wyjście

• Odczyt z pamięci podręcznej — 0,20 USD za milion w Opus 5.5; stawka za pamięć podręczną Sol jest ustalana dla każdej platformy osobno i nie jest publikowana jako jedna porównywalna wartość

• Okno kontekstu — 1 mln tokenów w obu

• Maksymalna liczba tokenów wyjściowych — 128 tys. tokenów w obu przypadkach, a 300 tys. w Batch API Anthropic z nagłówkiem beta

• Punkt odcięcia wiedzy — czerwiec 2026 dla Opus 5.5 vs 16 lutego 2026 dla Sol

• Kontrola rozumowania — adaptacyjne myślenie zawsze włączone, domyślnie średni wysiłek, zakres od niskiego do maksymalnego vs ustawienie maksymalnego wysiłku rozumowania plus tryb Ultra, który koordynuje równoległe podagenty

• Gama — Opus 5.5 jest pierwszym z rodziny 5.5, a Sonnet 5.5 i Haiku 5.5 zapowiedziano na najbliższe tygodnie, podczas gdy Sol jest flagowcem trzypoziomowej rodziny obok Terra i Luna

Dwa z tych wierszy robią więcej niż pozostałe. Luka w dacie odcięcia wiedzy wynosi cztery miesiące, co ma znaczenie, jeśli Twoje prompty dotyczą czegokolwiek, co wydarzyło się tej wiosny. A Opus 5.5 jest teraz tańszy od Sol zarówno pod względem ceny wejściowej, jak i wyjściowej — to odwrócenie sytuacji sprzed trzech miesięcy, gdy Sol był tańszym sposobem na uzyskanie wyników klasy frontier, a Claude Opus 5 kosztował $5/$25.

Jedyne wiersze, w których faktycznie pojawiają się oba modele

Istnieje dokładnie jedna opublikowana tabela zawierająca oba modele i jest to tabela Anthropic. Każda liczba w niej została podana przez dostawcę, pochodzi od firmy sprzedającej jeden z tych dwóch modeli:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% kontra GPT-5.6 Sol 37,3%

• Terminal-Bench-Science 0.1 — 58,7% vs 22,4%

• FrontierCode v1.1 (Main) — 54,4% vs 47,5%

• CursorBench 4.0 — 57,8% vs 41,7%

• AutomationBench — 40,0% wobec 28,8%

• GDPval-AA v2.1 — 1846 Elo kontra 1588

To komplet zwycięstw, a przewagi w dwóch wierszach Terminal-Bench są na tyle duże, że zasługują na krytyczne spojrzenie, a nie na bezkrytyczną akceptację. Część tej pracy wykonuje za ciebie własny przypis Anthropic: przeprowadzony na Terminal-Bench test Opus 5.5 korzystał z trybu xhigh effort, a nie z domyślnego, a przy domyślnym średnim wysiłku przewaga FrontierCode zmniejsza się do 54,6% wobec 47,5% — siedmiopunktowa różnica zamiast liczb z nagłówka. Anthropic dołącza też ogólne zastrzeżenie do całej tabeli, stwierdzając, że na tym poziomie możliwości różnice w benchmarkach są „mniej wiarygodnym wskaźnikiem rzeczywistych różnic”, a jego wewnętrzna różnica względem Claude Fable 5.1 jest mniejsza, niż sugerują wyniki. To, że dostawca sam podważa własną tabelę, jest najbardziej godnym zaufania zdaniem w niej.

Zauważ też, czego brakuje w tej tabeli: jakiegokolwiek benchmarku, w którym model OpenAI wygrywa. Tabela dostawcy zawierająca wyłącznie korzystne wiersze nie jest dowodem na całkowite zwycięstwo; jest dowodem na selekcję wierszy.

Co mówią własne liczby OpenAI

Materiały premierowe Sol opowiadają inną historię, na innych benchmarkach, przy innym zestawie testowym. Podane przy lipcowej premierze:

• Terminal-Bench 2.1 — 91,9% dla Sol Ultra i 88,8% dla standardowego Sol, w porównaniu z Claude Mythos 5 na poziomie 88,0% i Claude Fable 5 na poziomie 84,3%

• Artificial Analysis Coding Agent Index — 80, określany wówczas jako najlepszy w swojej klasie, o 2,8 punktu powyżej Claude Fable 5

• Agents' Last Exam, długotrwałe profesjonalne przepływy pracy — 53,6, co OpenAI podało jako 13,1 punktu przewagi nad Claude Fable 5

• BrowseComp — 92,2%; OSWorld 2.0 — 62,6%; SWE-Bench Pro — 64,6%

Żaden z tych wierszy nie zawiera Claude Opus 5.5, ponieważ nie istniał on w lipcu. Tabela Sol została zbudowana, aby pokonać Fable 5 i Mythos 5, i robi to. To, czy pokonuje Opus 5.5, po prostu nie wynika z materiałów żadnego z dostawców — obie tabele zostały zestawione w odstępie dwóch miesięcy, przeciwko różnym przeciwnikom.

Wiersz SWE-Bench Pro zasługuje na osobną uwagę, ponieważ to jedyne miejsce, w którym materiały premierowe OpenAI pokazują, że jego model przegrywa: 64,6% dla Sol wobec 80% dla Claude Fable 5. OpenAI odpowiedziało, kwestionując wiarygodność tego benchmarku i szacując, że około 30% jego zadań jest zepsutych. To całkiem możliwe. To także użyteczne przypomnienie, że „ten benchmark jest wadliwy” to twierdzenie, które wygłaszają oba laboratoria — i zawsze dotyczy benchmarku, w którym przegrywają.

Problem z uprzężą, którego nie rozwiązuje niczyja tabela

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

Powód, dla którego te dwie tabele się nie zgadzają, nie polega na tym, że jeden dostawca kłamie. Polega na tym, że benchmarki kodowania agentowego mierzą model plus szkielet, a szkielety się różnią. Terminal-Bench 4.0 i Terminal-Bench 2.1 to różne wersje tego samego pomysłu, prowadzone przez różne osoby, z różnymi budżetami narzędziowymi i różnymi zasadami ponawiania. Wyniki Opus 5.5 firmy Anthropic powstały w środowisku Anthropic; wyniki Sol firmy OpenAI — w narzędziach w stylu Codex. Przenieś którykolwiek model do środowiska drugiego, a wyniki się zmienią.

Niezależne dane, tam gdzie istnieją, opisują bardziej wyrównany wyścig niż którakolwiek z tych tabel. Jeden zewnętrzny benchmark agentów z sierpnia 2026 r., przeprowadzony na wielu modelach podczas rzeczywistej pracy z aplikacjami, wskazał GPT-5.6 Sol jako najlepsze połączenie dokładności, kosztu i szybkości — około 0,52 USD i pięć minut na przebieg — podczas gdy Claude Opus 5, a nie 5.5, był najdokładniejszy w 92% przebiegów. Osobny ranking obejmujący korporacyjne zadania programistyczne umieścił Claude Opus 5 na pierwszym miejscu z wynikiem 96,4%, a GPT-5.6 Sol na trzecim z 86,5%, ponownie porównując Sol z poprzednim Opus, a nie z nowym. Żadne z nich nie jest bezpośrednim porównaniem z Opus 5.5 i żadne niczego nie rozstrzyga. Dowodzą jednak, że gdy porównanie przeprowadza ktoś inny niż dostawca, różnice stają się małe.

Praktyczny wniosek jest taki, żeby przestać czytać te tabele jako ranking, a zacząć je czytać jako listę hipotez. Jeśli Twoja praca to długoterminowa automatyzacja terminala, przewaga Anthropic w Terminal-Bench to hipoteza warta przetestowania na własnych zadaniach. Jeśli to wieloetapowe profesjonalne badania, wynik Sola w Agents' Last Exam to ten sam rodzaj hipotezy. Żadna z tych liczb nie przekłada się na Twoje obciążenie bez uruchomienia.

Koszt na ukończone zadanie, który jest jedynym kosztem, który ma znaczenie.

W cenniku Claude Opus 5.5 jest teraz tańszy w obu kierunkach: 4,00 USD wobec 5,00 USD za wejście, 20,00 USD wobec 30,00 USD za wyjście oraz stawka za odczyt z pamięci podręcznej wynosząca 0,20 USD, która jest o 60% niższa niż stawka Claude Opus 5. Dla agenta, który przy każdej turze ponownie wysyła długi prompt systemowy, ta pozycja dotycząca pamięci podręcznej jest dominującym kosztem i powodem, dla którego długo działająca sesja może stać się istotnie tańsza bez żadnej zmiany promptu.

Ale cena za token nigdy nie decydowała o rachunku agenta. Argumentacja OpenAI za Sol przy premierze opierała się na efektywności tokenowej, a nie na cenie katalogowej — firma poinformowała o 54% poprawie efektywności tokenowej w kodowaniu, przy liczbie tokenów wyjściowych i czasie krótszych o ponad połowę niż w Claude Fable 5, przy koszcie niższym o około jedną trzecią. Anthropic przedstawia lustrzany argument za Opus 5.5: około 40% niższy koszt działania w typowych obciążeniach niż Claude Opus 5, przy cenniku, który spadł tylko o 20%, a oświadczenia klientów Box, Kiro, Factory i GitHub mówią o dużych redukcjach liczby tokenów lub kroków. Oba twierdzenia wskazują w tym samym kierunku — wygrywa model, który kończy w mniejszej liczbie tur — i żadne z nich nie zostało niezależnie zweryfikowane.

Tam, gdzie niezależne wyliczenia kosztu na zadanie faktycznie istnieją, obecnie przemawiają na korzyść Sol: jedna analiza opublikowana we wrześniu wyceniła GPT-5.6 Sol na 1,56 USD za rozwiązany problem w SWE-bench Verified przy 96,2% skuteczności, w porównaniu z Claude Opus 4.8 przy 88,6%. To Sol mierzony względem starszego modelu Anthropic, a nie względem Opus 5.5, więc to punkt wyjścia, a nie werdykt — ale przypomina, że model, który rozwiązuje problem za pierwszym podejściem, jest tańszy niż tańszy model, który potrzebuje trzech podejść. Jedynym pomiarem, który rozstrzyga to dla Ciebie, jest Twoje własne zadanie, uruchomione oboma sposobami, z liczbami tokenów przed oczami.

To problem routingu, a nie zakupów, i warto być precyzyjnym co do tego, która jego strona jest już rozwiązywalna. GPT-5.6 Sol jest już dostępny w OrcaRouter w cenie katalogowej samego OpenAI z 0% marży — cena katalogowa dostawcy przekazywana wprost, więc zmiana stawek dostawcy jest u nas widoczna tego samego dnia, a nie dopiero po synchronizacji. Claude Opus 5.5 nie jest jeszcze jedną z naszych tras; jest dostępny przez własne API Anthropic oraz główne chmury. Gdy się pojawi, ten sam klucz obsłuży oba, co zamienia eksperyment w regułę routingu zamiast drugiej umowy i drugiego SDK: kieruj obciążenie do tego modelu, za którym przemawiają twoje własne liczby, ustaw automatyczny failover na ten drugi i pozwól, by linia routing-DSL decydowała przy każdym żądaniu, a nie raz na kwartał. Obniżka ceny po którejkolwiek stronie to zmiana konfiguracji, a nie migracja.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

Tam, gdzie te dwa naprawdę się różnią

Usuń benchmarki, a pozostaną cztery różnice, wszystkie możliwe do sprawdzenia:

• Data odcięcia wiedzy. Czerwiec 2026 dla Opus 5.5 w porównaniu z 16 lutego 2026 dla Sol. Cztery miesiące to realna różnica w przypadku wszystkiego, co dotyczy najnowszych bibliotek, ostatnich wydarzeń lub niedawno zmienionych API, a żaden benchmark tego nie oddaje.

• Routing zabezpieczeń. Opus 5.5 jest dostarczany z zabezpieczeniami klasy Fable 5.1: większość żądań dotyczących cyberbezpieczeństwa jest przekierowywana do Claude Opus 4.8, a prace biologiczne są obsługiwane awaryjnie przez Claude Opus 5, chyba że konto jest zweryfikowane. Jeśli Twój produkt należy do którejkolwiek z tych dziedzin, część Twojego ruchu obsługuje mniejszy model. Sol nie ma udokumentowanego równoważnego routingu, choć OpenAI odnotowuje własne oceny bezpieczeństwa związane z cyberbezpieczeństwem.

• Orkiestracja. Sol dostarcza tryb Ultra, który koordynuje wielu równoległych podagentów — domyślnie czterech — oraz ustawienie maksymalnego wysiłku rozumowania. Opus 5.5 nie ma żadnego z nich jako funkcji platformy; jego dźwignią jest parametr effort, a kompozycja wielu modeli to coś, co sam budujesz lub trasujesz, a nie coś, co wręcza ci dostawca.

• Ekonomia rodziny. Sol to jeden z trzech poziomów, a poniżej niego są Terra i Luna — a w aktualizacji z 30 lipca cenę Luny obniżono o 80%, a Terry o 20%. Tańsze modele siostrzane Anthropic, Sonnet 5.5 i Haiku 5.5, zostały zapowiedziane, ale nie zostały jeszcze udostępnione. Jeśli Twoje obciążenie pracą jest mieszane, OpenAI już dziś oferuje tańsze poziomy.

Wybór między nimi

Wybierz Claude Opus 5.5, jeśli Twoja praca to długotrwałe kodowanie agentowe lub praca oparta na wiedzy, jeśli liczy się cena za token, jeśli Twoje prompty dotyczą czegokolwiek z ostatnich czterech miesięcy, albo jeśli kontekst 1M tokenów w cenie 0,20 USD za milion tokenów z pamięci podręcznej jest tym, co czyni Twoją architekturę przystępną cenowo. Zacznij od średniego poziomu wysiłku, a nie odziedziczonego wysokiego ustawienia, i sprawdź, czy niski poziom się sprawdza.

Wybierz GPT-5.6 Sol, jeśli chcesz tryb orkiestracji dostarczany w pakiecie przez dostawcę, jeśli potrzebujesz tańszego poziomu poniżej flagowca już teraz, a nie za kilka tygodni, albo jeśli Twój typ obciążenia najlepiej odpowiada temu, co obejmują dowody z premiery samego Sol — długoterminowe profesjonalne przepływy pracy i korzystanie z komputera, gdzie odnotowano jego najlepsze wyniki.

Jeśli korzystasz już z Claude Opus 5, pamiętaj, że Opus 5.5 nie jest bezpośrednim zamiennikiem: nie można już wyłączyć myślenia, wymuszone użycie narzędzi zwraca błąd, bloki myślenia są powiązane z modelem i konwersacją, a starsze computer_20251124 narzędzie computer-use nie jest akceptowane w Claude API ani w Google Cloud. Pierwsze trzy dotyczą również Claude Fable 5.1. Przejście na Sol to zupełnie inna integracja.

Co tak naprawdę rozstrzygnęłoby to porównanie, to pojedynczy niezależny przebieg obu modeli przy dopasowanym wysiłku, w dopasowanym środowisku testowym, na tym samym zestawie zadań. Według stanu na ten tydzień nikt takiego nie opublikował. Dopóki ktoś tego nie zrobi, uczciwym stanowiskiem jest to, które wspierają dowody: tabela Anthropic faworyzuje Opus 5.5 i została sporządzona przez Anthropic; tabela OpenAI faworyzuje Sol i została sporządzona przez OpenAI; istniejące niezależne wyniki porównują Sol z poprzednim Opus i opisują znacznie bardziej wyrównaną rywalizację; a dwa wiersze, które zdecydują o wysokości twojego rachunku — tokeny na ukończone zadanie i wolumen odczytu z pamięci podręcznej — to dwa wiersze, których nie publikuje żaden z dostawców.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie