
GPT-6 kontra Claude Opus 5.5: model, który właśnie trafił do wszystkich, przeciw temu, który wciąż prowadzi
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
7 października 2026 r. GPT-6 stał się modelem, z którym rozmawia ponad 1,2 miliarda cotygodniowych użytkowników ChatGPT, a wciąż nie jest najwyżej ocenianym modelem na niezależnej liście rankingowej. GPT-6 Sol — poziom, który OpenAI włączyło dla ChatGPT Plus, Pro, Business i Enterprise — uzyskuje 47,6 punktu w Intelligence Index v4.3.2 od Artificial Analysis. Claude Opus 5.5, który Anthropic wypuścił 22 września 2026 r. w cenie 4,00 USD za milion tokenów wejściowych i 20,00 USD za milion tokenów wyjściowych, uzyskuje 57,6 punktu w tej samej wersji. Dziesięć punktów, w jedynym pomiarze, na który zespoły marketingowe obu dostawców są skłonne pozwolić się oceniać.
Ta luka jest prawdziwa i nie zamierzam jej umniejszać. Jest jednak także najmniej interesującym faktem dotyczącym tego zestawienia w październiku, ponieważ to, co zmieniło się w tym tygodniu, nie jest benchmarkiem. GPT-6 trafił do ChatGPT dla wszystkich wraz z możliwością, którą OpenAI nazywa Intelligent UI, a model napędzający płatne plany w ramach tego wdrożenia to GPT-6 Sol. Zatem użyteczne porównanie nie brzmi już „które API jest lepsze” — brzmi „co tak naprawdę otrzymało 1,2 miliarda ludzi, którzy właśnie dostali GPT-6, i czy to wystarczy, by jakiś twórca albo zespół przestał płacić za Claude Opus 5.5”. Te dwie odpowiedzi się różnią, a różnica to nie te dziesięć punktów.
Co tak naprawdę zmieniło się 7 października
Mówiąc precyzyjnie o dacie — bo to nie premiera: GPT-6 Sol i GPT-6 Luna zostały udostępnione 22 września 2026 r. jako modele API. GPT-6 Astra, model flagowy, pojawił się przed nimi — OpenAI wydało go 3 września 2026 r. 7 października stało się to, że GPT-6 dotarł globalnie do karty Czat w ChatGPT dla planów Plus, Pro, Business i Enterprise, a plany Free i Go dołączyły od 8 października; dostęp w planie Enterprise nadal zależy od ustawień administratora w miejscu pracy. To wydarzenie dystrybucyjne, a nie premiera, i to rozróżnienie ma znaczenie dla każdego, kto czyta starsze materiały.
Towarzysząca mu funkcja to naprawdę nowy element. Intelligent UI pozwala GPT-6 komponować odpowiedź z tekstu, grafiki, klikalnych przycisków, formularzy i wykresów, dobieranych do każdego pytania, oraz strumieniować interfejs w miarę, jak model go generuje. Według samego OpenAI porównanie może wrócić w układzie obok siebie, wyjaśnienie jako interaktywny diagram, a odpowiedź w czystym tekście — gdy to tekst jest właściwą odpowiedzią. Towarzyszą temu dwa wewnętrzne wyniki raportowane przez dostawcę: w przypadku wartościowych codziennych zadań agentowych GPT-6 przy wysiłku Extra High zaczyna odpowiadać w tym samym czasie co GPT-5.6 przy Medium, uzyskując jednocześnie lepsze wyniki ogółem niż GPT-5.6 przy Extra High, a w przypadku pytań wymagających wyszukiwania w sieci GPT-6 Instant zaczyna odpowiadać średnio o 44% szybciej niż GPT-5.6 Instant. Jedne i drugie to liczby OpenAI, powtórzone z jego własnego ogłoszenia, i żadne z nich nie doczekało się jeszcze niezależnego odtworzenia.
Dwie karty stawek i gdzie kupuje się dziesięć punktów
Żaden z modeli nie zmienił w tym tygodniu swojej ceny. Claude Opus 5.5 ma 4,00 USD za wejście i 20,00 USD za wyjście od 22 września. GPT-6 Sol ma 2,00 USD i 10,00 USD od tego samego dnia. Jedna linia na wymiar, obie strony w każdej:
• Cena bazowa wejścia — GPT-6 Sol 2,00 USD za 1 mln vs Claude Opus 5.5 4,00 USD; Sol jest o połowę tańszy
• Cena bazowa wyjścia — GPT-6 Sol 10,00 USD za 1 mln vs Claude Opus 5.5 20,00 USD; znowu połowa
• Klauzula długiego kontekstu — GPT-6 Sol przelicza całe zapytanie po 4,00 USD za wejście i 15,00 USD za wyjście powyżej 272 000 tokenów wejściowych; Claude Opus 5.5 nie ma porównywalnego progu cenowego w swoim oknie 1 mln
• Wejście z pamięci podręcznej — GPT-6 Sol 0,20 USD za 1 mln vs Claude Opus 5.5 0,20 USD; na tym samym poziomie
• Koszt uruchomienia pełnego zestawu Intelligence Index — Claude Opus 5.5 5,98 USD za zadanie vs GPT-6 Sol 1,04 USD, rozpiętość 5,7× okupiona tymi dziesięcioma punktami
• Okno kontekstu — GPT-6 Sol 1 050 000 tokenów vs Claude Opus 5.5 1 000 000, przy limicie wyjścia 128 000 tokenów w obu

Czwarty wiersz to ten, który rozstrzyga o większości rzeczywistych wdrożeń, i nie jest to ten ze strony marketingowej. Dopłata GPT-6 Sol za długi kontekst jest agresywna względem jego własnej ceny z nagłówka: gdy żądanie przekroczy 272 000 tokenów wejściowych, całe żądanie jest rozliczane stawkami 4,00 i 15,00 USD, a nie tylko nadwyżka. W przypadku agenta prowadzącego długą sesję z dużym dokumentem w kontekście po cichu odbiera to większość korzyści płynącej z o połowę niższej ceny. Claude Opus 5.5 nie ma odpowiednika takiego progu, więc żądanie o długości 400 000 tokenów kosztuje go tyle samo za token co żądanie o długości 4 000 tokenów.
Gdzie znajduje się dziesięć punktów, ponieważ nie są one rozmieszczone równomiernie
Indeks złożony ukrywa własne składniki, a ten skrywa wyjątkowo nierówny profil. Wyciągnij poszczególne oceny, na tle których można odczytać liczby obu dostawców:
• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6 Sol 47,9%, różnica 13,5 punktu w rozumowaniu abstrakcyjnym
• SciCode — Claude Opus 5.5 66,9% vs GPT-6 Sol 57,6%, różnica 9,3 punktu w kodzie o jakości badawczej
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% vs GPT-6 Sol 43,9%
• Odtwarzanie przy długim kontekście — Claude Opus 5.5 84,7% vs GPT-6 Sol 83,7%, różnica 1,0 punktu, najwęższa na tej stronie
• Wieloturowe agentowe użycie narzędzi — oba modele dzieli zaledwie kilka punktów w rodzinie τ²-Bench, w której oba są mocne

Rozkład mówi wszystko. W rozumowaniu abstrakcyjnym — trudne pytanie egzaminacyjne, problem badawczy, do którego nie ma gotowej odpowiedzi do skopiowania — Claude Opus 5.5 jest zdecydowanie na czele, a różnica jest o wiele za duża, by mogła być szumem. W wyciąganiu faktu z bardzo długiego wejścia oba modele są praktycznie na tym samym poziomie, a GPT-6 Sol ma nieznacznie większe okno. Jeśli twoim obciążeniem jest wyszukiwanie informacji w długich dokumentach i praca z agentami w długich sesjach, te dziesięć punktów to w dużej mierze problem kogoś innego. Jeśli to nowatorskie rozumowanie, są twoim problemem, a ich uniknięcie kosztuje cię 5,7× na zadanie.
Co rollout ChatGPT mówi, a czego nie
Istnieje pokusa, by odczytywać „1,2 miliarda użytkowników tygodniowo ma teraz GPT-6” jako dowód na możliwości. Nie jest nim. Jest dowodem dotyczącym dystrybucji, a OpenAI wyraźnie stwierdza, że wdrożenie ChatGPT jest napędzane przez GPT-6 Sol w płatnych planach oraz GPT-6 Luna w planach Free i Go — oba „dostrojone do codziennej rozmowy”, co jest innym celem optymalizacji niż w produkcie API. Modele stojące za Work i Codex nie zostały zmienione przez tę premierę, co jest najwyraźniejszym sygnałem w ogłoszeniu, że to wydarzenie dotyczące warstwy konsumenckiej, a nie premiera nowych możliwości. Każdy, kto benchmarkuje „GPT-6, którego używa 1,2 miliarda ludzi”, powinien wiedzieć, że mierzy wdrożenie dostrojone do czatu, a nie punkt końcowy API.
To, co wdrożenie rzeczywiście zmienia, to domyślny wybór. Model, który jest po prostu dostępny dla wszystkich, trafia do znacznie większej liczby prototypów, narzędzi wewnętrznych i niedokończonych projektów pobocznych niż model, który trzeba świadomie wybrać. Jeśli wybierasz API do czegoś trwałego, ta wszechobecna znajomość ma swoją wartość — ale nie jest warta dziesięciu punktów indeksu i nie jest warta 5,7× kosztu przypadającego na zadanie w potoku wymagającym intensywnego rozumowania.
Uruchamianie obu bez wybierania
Uczciwa odpowiedź na pytanie „czy powinienem się przenosić" jest tu taka, że te dwa modele chcą różnych zadań, a kwestia przenosin to w większości kwestia routingu. Oba są w katalogu OrcaRouter — GPT-6 Sol w cenie dostawcy $2.00/$10.00, z warstwą długiego kontekstu $4.00/$15.00 przepuszczoną bez zmian, oraz Claude Opus 5.5 w cenie $4.00/$20.00 — za jednym kluczem i jednym endpointem zgodnym z OpenAI, przy 0% narzutu ponad cenę katalogową dostawcy. Ma to większe znaczenie niż zwykle w tygodniu, w którym dostawca zmienia konsumenckie wdrożenie, bo nasza linia cenowa to cena dostawcy, a nie nasza.
Wzorzec pasujący do tej pary to podział: kieruj ruch związany z długimi dokumentami i długimi sesjami do tego z dwóch, który przy tej liczbie tokenów jest tańszy — a powyżej 272 000 tokenów nie jest to już GPT-6 Sol — a ruch związany z nowatorskim rozumowaniem kieruj do Claude Opus 5.5, z GPT-6 Sol utrzymywanym jako automatyczne przełączenie awaryjne, dzięki czemu limit liczby żądań na jednej trasie nie staje się awarią po Twojej stronie. Nie musisz rozstrzygać tego dziesięciopunktowego sporu, aby wdrożyć rozwiązanie; musisz wiedzieć, które z Twoich żądań znajdują się w tej części rozkładu, w której to ma zastosowanie.

Werdykt, taki jaki jest
Claude Opus 5.5 jest lepszym modelem w pomiarze, względem którego wyniki publikują oba laboratoria, i w dwóch ewaluacjach najważniejszych dla trudnego rozumowania nie ma nawet blisko. GPT-6 Sol kosztuje o połowę mniej według stawki podstawowej, jedną piątą kosztu na zadanie w niezależnym zestawie testów, a teraz jest domyślnym modelem w aplikacji, którą większość twoich współpracowników ma już otwartą. Żaden z tych faktów nie zmienił się w tym tygodniu; zmieniło się to, że GPT-6 przestał być czymś, co trzeba było wybrać, a stał się czymś, co się po prostu ma.
Na co trzeba uważać, to czy następny ruch OpenAI będzie krokiem w zakresie możliwości, czy kolejnym krokiem dystrybucyjnym. Jego własne ogłoszenie wyraźnie takie oczekiwanie ustawia — firma mówi, że chce, aby ChatGPT z czasem budował więcej interfejsów, których ludzie potrzebują — a to plan działania dotyczący powierzchni, a nie punktów indeksu. Jeśli twoja decyzja zależy od indeksu, Claude Opus 5.5 nadal go wygrywa. Jeśli zależy od kosztu przy dużej skali i tego, że model jest taki, który wszyscy już znają, GPT-6 Sol jest dziś bezpieczniejszym domyślnym wyborem, a klauzula dotycząca długiego kontekstu to jedyna pozycja w jego cenniku, na którą musisz zaplanować budżet.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
