Wygenerowana karta hero dla GPT-6.1 Sol vs Claude Opus 5.5 z nagłówkiem „Realna luka, nierównomiernie rozłożona”, z dwiema kartami informacyjnymi o treści „GPT-6.1 Sol: Intelligence Index 51,8, 0,72 USD za zadanie indeksowe, przywoływanie w długim kontekście 83,0%” i „Claude Opus 5.5: Intelligence Index 57,6, 5,98 USD za zadanie indeksowe, przywoływanie w długim kontekście 84,7%”, stopką o treści „Dane według Artificial Analysis, Intelligence Index v4.3.2; oba modele naniesiono na wykres przy ich maksymalnym ustawieniu wysiłku.” oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6.1 Sol vs Claude Opus 5.5: Prawdziwa przepaść, nierównomiernie rozłożona

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Różnica 5,8 punktu między Claude Opus 5.5 i GPT-6.1 Sol w Artificial Analysis Intelligence Index jest największa spośród wszystkich par w tym zestawie i, w odróżnieniu od większości z nich, nie zniknie po zmianie ustawień. Claude Opus 5.5, wydany 22 września 2026 r. i wyceniony na $4,00 za milion tokenów wejściowych oraz $20,00 za milion tokenów wyjściowych, uzyskuje 57,6. GPT-6.1 Sol, wydany 29 września 2026 r. w cenie $2,00 i $10,00, uzyskuje 51,8. Claude Opus 5.5 jest modelem z wyższym wynikiem, a jego przewaga jest większa niż ta dzieląca większość modeli czołowych od siebie, i kosztuje 8,3× więcej na zadanie, by do tego dojść — $5,98 wobec $0,72. Jak dotąd droższy model po prostu wygrywa, co jest najmniej interesującą wersją tego porównania. To, co czyni je wartym czytania, to fakt, że te 5,8 punktu nie rozkładają się równomiernie w całym zestawie testów: na jednej osi, która decyduje o większości pracy z długimi dokumentami i długimi sesjami, oba modele mieszczą się w granicach dwóch punktów od siebie.

Oba to flagowe modele w tej samej niszy rynkowej: okna kontekstu klasy 1M, limity wyjścia 128K, wejście tekstowe, obrazowe i plikowe, rozszerzone myślenie po jednej stronie i pięciopoziomowa drabinka wysiłku po drugiej. Claude Opus 5.5 zastępuje Claude Opus 5 i jest pozycjonowany do wymagającego rozumowania, kodowania oraz długoterminowej pracy agentowej; GPT-6.1 Sol plasuje się o jeden poziom poniżej GPT-6 Astra i jest pozycjonowany do agentowego kodowania, korzystania z komputera i profesjonalnej pracy z dużą ilością dokumentów. Celują w te same zadania. Pomiar mówi, że nie są równie dobre we wszystkich z nich.

Gdzie tak naprawdę znajduje się 5,8 punktu

Indeks złożony ukrywa swoje składniki. Wyodrębnij poszczególne oceny, a luka przestanie wyglądać jak luka i zacznie wyglądać jak profil.

• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6.1 Sol 52,9%, 8,5-punktowa różnica w rozumowaniu abstrakcyjnym

• SciCode — Claude Opus 5.5 66,9% vs GPT-6.1 Sol 54,2%, różnica 12,7 punktu w kodzie klasy badawczej

• Przywoływanie informacji z długiego kontekstu — Claude Opus 5.5 84,7% vs GPT-6.1 Sol 83,0%, różnica 1,7 punktu przy wydobywaniu faktów z długiego wejścia

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% wobec wyniku Sol nieopublikowanego w tej samej wersji

• Okno kontekstowe — GPT-6.1 Sol 1 050 000 tokenów vs Claude Opus 5.5 1 000 000 tokenów, z limitem wyjściowym 128 000 tokenów w obu przypadkach

• Koszt na zadanie indeksowania — Claude Opus 5.5 5,98 USD vs GPT-6.1 Sol 0,72 USD

Cała historia tkwi w rozkładzie wyników. Tam, gdzie zadanie polega na rozumowaniu w abstrakcji — trudne pytanie egzaminacyjne, problem programistyczny na poziomie badawczym, do którego nie ma gotowej odpowiedzi do skopiowania — Claude Opus 5.5 jest zdecydowanie na prowadzeniu, a 12,7-punktowa różnica w SciCode to nie szum. Tam, gdzie zadanie polega na znalezieniu właściwego fragmentu w bardzo długim wejściu i wykorzystaniu go, oba modele są praktycznie na tym samym poziomie, a GPT-6.1 Sol utrzymuje tę pozycję, mając o 50 000 tokenów większą pojemność. Duża część produkcyjnej pracy z LLM-ami to ten drugi rodzaj: odpowiadanie wspomagane wyszukiwaniem, przegląd umów i dokumentów, analiza logów i transkrypcji, przegląd kodu w dużym repozytorium. Tę pracę mierzy trzeci punkt, a nie dwa pierwsze, i w tym punkcie wersja premium daje 1,7 punktu.

Uczciwe czytanie wierszy indeksu

Dwa zastrzeżenia powinny znajdować się obok tych liczb, a nie na dole strony.

Konfiguracje różnią się. Artificial Analysis umieszcza Claude Opus 5.5 na wykresie w konfiguracji „Max, Default Fallback”, a GPT-6.1 Sol przy maksymalnym wysiłku. Oba są najsilniejszymi ustawieniami, w jakich publikowany jest każdy z modeli, co sprawia, że porównanie jest uczciwe, ale to porównanie dwóch górnych granic, a nie dwóch domyślnych ustawień produkcyjnych. Domyślne ustawienia Claude Opus 5.5 w hostowanym API mogą różnić się od uruchomienia przedstawionego na wykresie, a domyślny wysiłek GPT-6.1 Sol jest średni.

Wiersz Terminal-Bench jest celowo pusty z jednej strony. 59,6% Claude Opus 5.5 pochodzi z wersji Artificial Analysis, w której został opublikowany; odpowiednia wartość dla GPT-6.1 Sol nie jest dostępna w pasującej wersji. Cytowanie liczby z innego przebiegu tego samego benchmarku byłoby fałszywym porównaniem, a uczciwym posunięciem jest pozostawienie komórki pustej, zamiast wypełniać ją czymś w przybliżeniu poprawnym.

Gadatliwość działa tutaj w tym samym kierunku co w przypadku tańszych braci: Claude Opus 5.5 generuje 260 mln tokenów wyjściowych w zestawie testów index wobec 67 mln w GPT-6.1 Sol, co daje różnicę 3,9× przy stawce już dwukrotnie wyższej. Stąd bierze się współczynnik 8,3× na zadanie, gdy cennik pokazuje 2× na wejściu i 2× na wyjściu. Ta premia nie wynosi 8,3× dlatego, że model kosztuje 8,3× — wynosi 8,3×, bo kosztuje 2× i myśli 3,9× dłużej.

Argumenty za tym, by to zapłacić

Jeśli Twoja praca przypomina dwa pierwsze punkty, kalkulacja jest prosta i przemawia za Claude Opus 5.5. Różnica 12,7 punktu w kodzie naukowym klasy badawczej albo 8,5 punktu w trudnym rozumowaniu abstrakcyjnym to różnica między agentem, który zamyka zgłoszenie bez nadzoru, a takim, który wymaga człowieka przy co trzecim kroku. Agentowe programowanie nad dużym zbiorem kodu to obciążenie, które obaj dostawcy wymieniają jako pierwsze, i właśnie przy nim rozrzut jest największy. Płacenie 5,98 USD zamiast 0,72 USD za zadanie, aby uniknąć nieudanego uruchomienia, które kosztuje inżyniera dwadzieścia minut, nie jest trudną decyzją.

Jest jeszcze drugi argument, który wcale nie dotyczy wyników. Claude Opus 5.5 ma piętnaście dni i wytworzył zasób doświadczeń z ewaluacji, przeglądów i wdrożeń prowadzonych przez strony trzecie, którego model mający osiem dni nie ma. Na ścieżce produkcyjnej dojrzałość otaczającej wiedzy jest warta coś, czego indeks nie wycenia.

Argument przeciw i liczba, która rozstrzyga

Kontrargumentem jest wiersz długiego kontekstu. Jeśli dominującym kształtem Twojego ruchu jest „duże wejście, krótka odpowiedź” — a dla bardzo wielu zespołów tak jest — to oś, za którą jesteś rozliczany, nie jest osią, którą zużywasz. W przywoływaniu długiego kontekstu dwa modele dzieli 1,7 punktu przy 8,3-krotnym stosunku cen, a tańszy model ma większe okno. To właśnie przypadek, w którym dopłata jest realna, mierzalna i wydawana na możliwości, których obciążenie nigdy nie wykorzystuje.

Rozstrzygającą liczbą nie jest więc indeks. Jest nią udział twoich zadań, które przypominają SciCode, a nie odtwarzanie z pamięci. Zespoły, które potrafią odpowiedzieć na to pytanie na podstawie własnych logów, powinny odpowiedzieć na nie na podstawie własnych logów; zestaw benchmarków jest przybliżeniem zastępczym dla mieszanki zadań, a zmienną jest ta mieszanka.

Oba na jednym klawiszu, co sprawia, że na to pytanie można odpowiedzieć

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 jest dostępny w OrcaRouter w swojej cenie $4.00 / $20.00, a odczyty z pamięci podręcznej kosztują $0.20. GPT-6.1 Sol jest dostępny w OrcaRouter w cenie $2.00 / $10.00, która powyżej 272 000 tokenów promptu rośnie do $4.00 / $15.00, a odczyty z pamięci podręcznej kosztują $0.10. Oba w cenie katalogowej dostawcy, bez żadnych dodatkowych opłat, na jednym kluczu i jednym rachunku.

To ma większe znaczenie niż zwykle w przypadku tego połączenia, ponieważ te dwa modele nie są substytutami — to decyzja o routingu. Zadania związane z długimi dokumentami i dużym wolumenem kieruj do GPT-6.1 Sol, a trudne rozumowanie i modyfikację kodu pozostaw w Claude Opus 5.5; oba działają za tym samym punktem końcowym z tymi samymi poświadczeniami. Jeśli trasa ulegnie degradacji, automatyczne przełączanie awaryjne przenosi wywołanie, zamiast kończyć je błędem, a ponieważ routing jest deklaratywny, można go wyrazić dla każdej klasy zadań, a nie dla każdej aplikacji. Przetestowanie tego podziału to zmiana konfiguracji, a nie migracja.

Ostatnia rzecz, o której warto wspomnieć, dotyczy trwałości tego porównania. Oba modele mają zaledwie dni lub tygodnie. GPT-6.1 Sol ma opublikowaną jedną niezależną konfigurację; Claude Opus 5.5 ma jedną. Pojedyncze uruchomienie danego modelu to migawka, a ciekawym trybem awarii nie jest to, że jedna z tych liczb jest błędna — lecz to, że konfiguracja o średnim nakładzie pracy albo drugi ewaluator przerysowuje profil. Do tego czasu jedynym możliwym do obrony odczytem jest ten, który dają komponenty: zdecydowana różnica w trudnym rozumowaniu i kodzie badawczym, niewielka w pracy z długim kontekstem oraz rachunek 8.3×, który musi zostać uzasadniony przez tę część twojego obciążenia, która przypomina ten pierwszy przypadek.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie