Wygenerowana karta tytułowa do artykułu o Epoch Capabilities Index, z nagłówkiem „Claude Opus 5.5 na czele Epoch Capabilities Index” nad jasnoniebieską linią monospace o treści „167.35 vs 166.51” i szarym podtytułem „Dwie najlepsze pozycje w kompozycie ponad 50 benchmarków”, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Claude Opus 5.5 na czele Epoch Capabilities Index z przewagą 0,84 punktu

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Liczba wynosi 0,84. Claude Opus 5.5 zajmuje 167,35 w Epoch Capabilities Index według pliku, który czytaliśmy 2 października 2026 r., z GPT-6 Astra na poziomie 166,51 — różnica mniejsza niż jeden punkt w skali, w której opublikowane 95-procentowe przedziały dla obu modeli pokrywają się niemal całkowicie: 164,0–172,0 dla Opus 5.5 wobec 163,14–171,05 dla Astry. Poniżej nich, Claude Sonnet 5.5 uzyskał 165,2, a Claude Fable 5.1 osiągnął 164,82, więc cztery najwyżej sklasyfikowane pozycje w niezależnym kompozytie ponad pięćdziesięciu benchmarków dzieli 2,53 punktu, a trzy z nich noszą nazwę tego samego dostawcy. Ta kolejność jest realna w tym sensie, że oszacowania punktowe są uporządkowane. Nie jest realna w tym sensie, że przewaga 0,84 punktu przetrwałaby własne przedziały błędów, a wszystko, co warto powiedzieć o tym rankingu, wynika z jednoczesnego uwzględnienia obu tych faktów.

Czym jest indeks, a czym nie jest 0,84 punktu

Epoch Capabilities Index nie jest rankingiem dostawców. Został stworzony przez Epoch AI, niezależną organizację badawczą, jako kompozyt łączący wyniki z ponad pięćdziesięciu różnych benchmarków w jedną skalę ogólnych zdolności, wnioskując względną trudność każdego benchmarku na podstawie modeli, które akurat pojawiają się w kilku z nich jednocześnie. Metodologia została przedstawiona w artykule napisanym z badaczami z zespołu AGI Safety & Alignment Google DeepMind i sfinansowanym przez DeepMind, ale Epoch wyraźnie stwierdza, że indeks jest jego własnym produktem i że ma do niego pełne prawa — rozróżnienie warte zachowania, gdy źródło finansowania i wydawca wyniku nie są tym samym podmiotem. Kod jest publiczny.

Dwie właściwości tej skali mają większe znaczenie niż nagłówek. Po pierwsze, ECI jest celowo zakotwiczony, a nie absolutny: surowe wyniki są przeskalowywane tak, by Claude 3.5 Sonnet znalazł się na poziomie 130, a GPT-5 na poziomie 150, co oznacza, że liczba w tym indeksie ma znaczenie tylko obok innej liczby z tego samego pliku, nigdy sama w sobie. Po drugie, indeks nie ma pułapu. Nie ma 100, do którego można by się zbliżać, więc „szczyt indeksu” to stwierdzenie o dacie, a nie o limicie, który ktokolwiek osiągnął.

Właśnie dlatego uczciwe odczytanie 167,35 wobec 166,51 nie brzmi: „Claude Opus 5.5 to najzdolniejszy model na świecie”. Jest węższe i mniej nadaje się do cytowania: w modelowaniu Epoch opartym na dowodach dostępnych 2 października 2026 r. dwa modele są na szczycie nieodróżnialne, a ustalenie kolejności między nimi to rozstrzygnięcie remisu, a nie pomiar. Publikowane przedziały mówią to wprost — 164,0 do 172,0 oraz 163,14 do 171,05 mają wspólną zdecydowaną większość swojego zakresu. Ktokolwiek cytuje 0,84 jako werdykt, cytuje artefakt zaokrąglenia.

Blok Anthropic i rozmiar wydania

Bardziej informacyjnym elementem tabeli nie jest to, kto jest pierwszy. To trzeci i czwarty wiersz. Claude Sonnet 5.5, wydany 28 września i z wynikiem 165,2, plasuje się 0,38 punktu powyżej Claude Fable 5.1, wydanego 1 września z wynikiem 164,82 — na tyle blisko, że w praktyce oba zajmują tę samą pozycję, i na tyle blisko, że ta para znajduje się tylko 2,15 punktu poniżej szczytu tabeli. Sonnet to produkt średniej klasy w ofercie Anthropic, a Fable to model, który firma historycznie wskazywała do ogólnych zadań związanych z rozumowaniem; to, że oba z nich teraz obejmują czołówkę od dołu, jest zasadniczą zmianą w tej aktualizacji, bardziej niż tożsamość lidera.

Własny skok generacyjny Anthropic również jest widoczny. Claude Opus 5.5 jest następcą Claude Opus 5, którego Epoch ocenia na 162.94, z przedziałem od 160.2 do 166.7. To poprawa o 4.41 punktu w ciągu około dwóch miesięcy, od wydania z 24 lipca do wydania z 22 września — większy skok niż 0.84 punktu dzielącego dzisiejsze pierwsze i drugie miejsce. Czytając to w ten sposób, interesującą wielkością w tej tabeli jest nachylenie w obrębie linii pojedynczego dostawcy, a nie różnica między dwoma dostawcami na szczycie.

Gdzie przebiega granica open-weights

Epoch rozdziela modele według dostępności, co sprawia, że granica otwartych wag jest czytelna bez konieczności zgadywania. Najlepszą pozycją wśród otwartych wag jest Kimi K3 z wynikiem 157,61, datowany na 16 lipca i oznaczony jako niekomercyjny. Za nią plasują się DeepSeek V4 Pro 0813 z wynikiem 155,38 i DeepSeek V4.1 Flash z wynikiem 155,0, oba bez ograniczeń, następnie GLM-5.3-Flash z wynikiem 151,94 i GLM-5.2 z wynikiem 151,78. Najbliższy otwarty model do szczytu ma zatem 9,74 punktu straty — luka osiemnaście razy szersza niż ta między pierwszym a drugim miejscem, i wystarczająco szeroka, że przedziały nie zbliżają się do siebie.

Ta asymetria to jedyne trwałe ustalenie w tabeli. Zamknięta granica to stłoczenie w obrębie trzech punktów; odległość od zamkniętej granicy do najlepszych wag do pobrania jest o rząd wielkości większa. Indeks złożony, który pozwala porównywać różne generacje benchmarków, to dokładnie narzędzie do zauważenia tego, ponieważ potrafi powiedzieć to samo w lipcu i we wrześniu, zamiast raportować, że nasycający się benchmark zamilkł.

Niektóre z pobliskich wierszy warto przypiąć dla kontekstu, ponieważ to modele, które czytelnicy faktycznie porównują z Opus 5.5:

• Claude Sonnet 5 — 156,34, wydany 30 czerwca, przedział od 153,61 do 158,81

• Grok 4.6 — 156,61, wydany 12 sierpnia, przedział od 154,66 do 158,93

• Gemini 3.8 Flash — 156.93, wydany 2 września, przedział od 154.64 do 160.42

• Muse Spark 1.3 — 156.86, wydany 2 września, przedział od 154.73 do 159.56

• GPT-5.6 Sol — 161,8, wydany 9 lipca, przedział od 159,26 do 165,26

Pozycja indeksu nie jest rachunkiem

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

Tutaj ranking przestaje być całą historią, bo dwa modele na szczycie nie kosztują nawet w przybliżeniu tyle samo. Z naszego własnego katalogu, który oferuje oba w cenie katalogowej dostawcy bez narzutu, Claude Opus 5.5 w cenie $4.00/$20.00 z odczytami z pamięci podręcznej po $0.20 i GPT-6 Astra w cenie $10.00/$50.00 z odczytami z pamięci podręcznej po $1.00 dzieli 2,5-krotna różnica w obu kierunkach cennika. Astra dodatkowo wchodzi na wyższy próg powyżej 272 000 tokenów promptu, gdzie wejście rośnie do $20.00, a wyjście do $75.00; Opus 5.5 utrzymuje stałe $4.00/$20.00 przez całe swoje okno 1 mln tokenów. Oba obsługują 128 000 tokenów wyjściowych.

Przeprowadź obliczenia, które faktycznie pociąga za sobą obciążenie z długim kontekstem — prefiks 180 000 tokenów obsługiwany z pamięci podręcznej, 5 000 wygenerowanych tokenów. W przypadku Opus 5.5 to 180 000 tokenów po 0,20 USD za milion, czyli około 3,6 centa, plus 5 000 po 20 USD za milion, czyli 10 centów: razem około 13,6 centa. W przypadku GPT-6 Astra to 180 000 po 1,00 USD, czyli 18 centów, plus 5 000 po 50 USD, czyli 25 centów: razem około 43 centów. Przewaga 0,84 punktu i 3,2-krotna różnica kosztów nie są faktami tego samego rodzaju, a decyzja zakupowa, która bierze pod uwagę tylko pierwszą z nich, wzięła pod uwagę mniejszą liczbę.

Fable 5.1 pokazuje to samo z drugiej strony cennika tego samego dostawcy: przy 10,00/50,00 USD jest wyceniony dokładnie tak jak Astra i uzyskuje wynik 164,82 — o 2,53 punktu mniej niż Opus 5.5 za te same pieniądze. Indeks umieszcza trzy flagowe pozycje Anthropic w odległości 2,53 punktu od siebie, a cennik rozsuwa je 2,5-krotnie — co znacznie lepiej opisuje wybór, przed którym stoi kupujący, niż jakikolwiek pojedynczy ranking.

Jeśli zamierzasz się spierać o liczbę, spieraj się na własnym ruchu.

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

Powód, dla którego ten indeks w ogóle warto czytać, jest taki, że mierzy go ktoś inny niż dostawcy — ale sama struktura kompozytu wyznacza warunki sporu. Kalibracja Epoch, jej szacunki trudności i sposób traktowania modeli, które pomijają benchmarki, poprzedzają liczbę w tabeli, a żadnej z tych rzeczy czytelnik nie może odtworzyć ze zrzutu ekranu. To samo dotyczy każdego sztandarowego benchmarku dostawcy, dlatego użytecznym posunięciem nie jest opowiedzenie się po którejś stronie między nimi, lecz porównanie ich na ruchu, który kontrolujesz.

Oba te modele są dostępne z jednego klucza API w OrcaRouter, który przekazuje cennik dostawcy bez marży 0%: Claude Opus 5.5 za $4.00/$20.00 z odczytem z pamięci podręcznej po $0.20 oraz GPT-6 Astra za $10.00/$50.00 z jej progiem powyżej 272K stosowanym dokładnie tak, jak ustawia go dostawca. Wysłanie tego samego zestawu promptów do obu to zmiana konfiguracji, a nie drugi kontrakt, a tam, gdzie oba są kierowane, automatyczne przełączanie awaryjne działa pod spodem, co ma znaczenie przy decyzji tak blisko progu szumu. Tabela liderów może powiedzieć, że te dwa modele są nieodróżnialne. Tylko Twój własny eval może powiedzieć, który z nich jest nieodróżnialny w Twojej pracy.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

Co mogłoby wpłynąć na tę liczbę w przyszłym miesiącu?

Plik Epoch jest żywym dokumentem, a trzy rzeczy szybko zmieniłyby odczyt. Pierwszą jest każda nowa ocena modelu granicznego, która znajdzie się w pierwszej czwórce, ponieważ pojedyncza dodatkowa obserwacja benchmarkowa przesuwa kompozyt bardziej, gdy klaster jest tak ciasny, niż gdy istnieje wyraźny lider. Drugą jest dryf przedziałów ufności — najnowsze wpisy mają najszersze przedziały, ponieważ zostały ocenione na najmniejszej liczbie pokrywających się benchmarków, więc wydania z września to wiersze, które najprawdopodobniej się przesuną, a te z lipca – najmniej. Trzecią jest benchmark osiągający nasycenie, co jest konkretnym niepowodzeniem, które indeks miał przetrwać: gdy komponent przestaje rozróżniać, Epoch ponownie waży kompozycję, zamiast pozwolić, by przewaga modelu wyparowała wraz z testem.

Na razie możliwe do obrony podsumowanie jest wąskie. Claude Opus 5.5 zajmuje pierwsze miejsce w Epoch Capabilities Index z wynikiem 167,35 dzięki przewadze 0,84 punktu, której nie potwierdza jego własny przedział ufności, Claude Sonnet 5.5 wspiął się ze średniej półki tej samej linii na odległość 2,15 punktu od prowadzenia, a modele z otwartymi wagami pozostają ponad dziewięć punktów za nimi wszystkimi. Lider to rzut monetą między dwoma dostawcami. Czteropunktowa różnica w cenie między nimi już nie.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie