
Claude Opus 5.5 na czele Epoch Capabilities Index z przewagą 0,84 punktu
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 221 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Liczba wynosi 0,84. Claude Opus 5.5 zajmuje 167,35 w Epoch Capabilities Index według pliku, który czytaliśmy 2 października 2026 r., z GPT-6 Astra na poziomie 166,51 — różnica mniejsza niż jeden punkt w skali, w której opublikowane 95-procentowe przedziały dla obu modeli pokrywają się niemal całkowicie: 164,0–172,0 dla Opus 5.5 wobec 163,14–171,05 dla Astry. Poniżej nich, Claude Sonnet 5.5 uzyskał 165,2, a Claude Fable 5.1 osiągnął 164,82, więc cztery najwyżej sklasyfikowane pozycje w niezależnym kompozytie ponad pięćdziesięciu benchmarków dzieli 2,53 punktu, a trzy z nich noszą nazwę tego samego dostawcy. Ta kolejność jest realna w tym sensie, że oszacowania punktowe są uporządkowane. Nie jest realna w tym sensie, że przewaga 0,84 punktu przetrwałaby własne przedziały błędów, a wszystko, co warto powiedzieć o tym rankingu, wynika z jednoczesnego uwzględnienia obu tych faktów.
Czym jest indeks, a czym nie jest 0,84 punktu
Epoch Capabilities Index nie jest rankingiem dostawców. Został stworzony przez Epoch AI, niezależną organizację badawczą, jako kompozyt łączący wyniki z ponad pięćdziesięciu różnych benchmarków w jedną skalę ogólnych zdolności, wnioskując względną trudność każdego benchmarku na podstawie modeli, które akurat pojawiają się w kilku z nich jednocześnie. Metodologia została przedstawiona w artykule napisanym z badaczami z zespołu AGI Safety & Alignment Google DeepMind i sfinansowanym przez DeepMind, ale Epoch wyraźnie stwierdza, że indeks jest jego własnym produktem i że ma do niego pełne prawa — rozróżnienie warte zachowania, gdy źródło finansowania i wydawca wyniku nie są tym samym podmiotem. Kod jest publiczny.
Dwie właściwości tej skali mają większe znaczenie niż nagłówek. Po pierwsze, ECI jest celowo zakotwiczony, a nie absolutny: surowe wyniki są przeskalowywane tak, by Claude 3.5 Sonnet znalazł się na poziomie 130, a GPT-5 na poziomie 150, co oznacza, że liczba w tym indeksie ma znaczenie tylko obok innej liczby z tego samego pliku, nigdy sama w sobie. Po drugie, indeks nie ma pułapu. Nie ma 100, do którego można by się zbliżać, więc „szczyt indeksu” to stwierdzenie o dacie, a nie o limicie, który ktokolwiek osiągnął.
Właśnie dlatego uczciwe odczytanie 167,35 wobec 166,51 nie brzmi: „Claude Opus 5.5 to najzdolniejszy model na świecie”. Jest węższe i mniej nadaje się do cytowania: w modelowaniu Epoch opartym na dowodach dostępnych 2 października 2026 r. dwa modele są na szczycie nieodróżnialne, a ustalenie kolejności między nimi to rozstrzygnięcie remisu, a nie pomiar. Publikowane przedziały mówią to wprost — 164,0 do 172,0 oraz 163,14 do 171,05 mają wspólną zdecydowaną większość swojego zakresu. Ktokolwiek cytuje 0,84 jako werdykt, cytuje artefakt zaokrąglenia.
Blok Anthropic i rozmiar wydania
Bardziej informacyjnym elementem tabeli nie jest to, kto jest pierwszy. To trzeci i czwarty wiersz. Claude Sonnet 5.5, wydany 28 września i z wynikiem 165,2, plasuje się 0,38 punktu powyżej Claude Fable 5.1, wydanego 1 września z wynikiem 164,82 — na tyle blisko, że w praktyce oba zajmują tę samą pozycję, i na tyle blisko, że ta para znajduje się tylko 2,15 punktu poniżej szczytu tabeli. Sonnet to produkt średniej klasy w ofercie Anthropic, a Fable to model, który firma historycznie wskazywała do ogólnych zadań związanych z rozumowaniem; to, że oba z nich teraz obejmują czołówkę od dołu, jest zasadniczą zmianą w tej aktualizacji, bardziej niż tożsamość lidera.
Własny skok generacyjny Anthropic również jest widoczny. Claude Opus 5.5 jest następcą Claude Opus 5, którego Epoch ocenia na 162.94, z przedziałem od 160.2 do 166.7. To poprawa o 4.41 punktu w ciągu około dwóch miesięcy, od wydania z 24 lipca do wydania z 22 września — większy skok niż 0.84 punktu dzielącego dzisiejsze pierwsze i drugie miejsce. Czytając to w ten sposób, interesującą wielkością w tej tabeli jest nachylenie w obrębie linii pojedynczego dostawcy, a nie różnica między dwoma dostawcami na szczycie.
Gdzie przebiega granica open-weights
Epoch rozdziela modele według dostępności, co sprawia, że granica otwartych wag jest czytelna bez konieczności zgadywania. Najlepszą pozycją wśród otwartych wag jest Kimi K3 z wynikiem 157,61, datowany na 16 lipca i oznaczony jako niekomercyjny. Za nią plasują się DeepSeek V4 Pro 0813 z wynikiem 155,38 i DeepSeek V4.1 Flash z wynikiem 155,0, oba bez ograniczeń, następnie GLM-5.3-Flash z wynikiem 151,94 i GLM-5.2 z wynikiem 151,78. Najbliższy otwarty model do szczytu ma zatem 9,74 punktu straty — luka osiemnaście razy szersza niż ta między pierwszym a drugim miejscem, i wystarczająco szeroka, że przedziały nie zbliżają się do siebie.
Ta asymetria to jedyne trwałe ustalenie w tabeli. Zamknięta granica to stłoczenie w obrębie trzech punktów; odległość od zamkniętej granicy do najlepszych wag do pobrania jest o rząd wielkości większa. Indeks złożony, który pozwala porównywać różne generacje benchmarków, to dokładnie narzędzie do zauważenia tego, ponieważ potrafi powiedzieć to samo w lipcu i we wrześniu, zamiast raportować, że nasycający się benchmark zamilkł.
Niektóre z pobliskich wierszy warto przypiąć dla kontekstu, ponieważ to modele, które czytelnicy faktycznie porównują z Opus 5.5:
• Claude Sonnet 5 — 156,34, wydany 30 czerwca, przedział od 153,61 do 158,81
• Grok 4.6 — 156,61, wydany 12 sierpnia, przedział od 154,66 do 158,93
• Gemini 3.8 Flash — 156.93, wydany 2 września, przedział od 154.64 do 160.42
• Muse Spark 1.3 — 156.86, wydany 2 września, przedział od 154.73 do 159.56
• GPT-5.6 Sol — 161,8, wydany 9 lipca, przedział od 159,26 do 165,26
Pozycja indeksu nie jest rachunkiem

Tutaj ranking przestaje być całą historią, bo dwa modele na szczycie nie kosztują nawet w przybliżeniu tyle samo. Z naszego własnego katalogu, który oferuje oba w cenie katalogowej dostawcy bez narzutu, Claude Opus 5.5 w cenie $4.00/$20.00 z odczytami z pamięci podręcznej po $0.20 i GPT-6 Astra w cenie $10.00/$50.00 z odczytami z pamięci podręcznej po $1.00 dzieli 2,5-krotna różnica w obu kierunkach cennika. Astra dodatkowo wchodzi na wyższy próg powyżej 272 000 tokenów promptu, gdzie wejście rośnie do $20.00, a wyjście do $75.00; Opus 5.5 utrzymuje stałe $4.00/$20.00 przez całe swoje okno 1 mln tokenów. Oba obsługują 128 000 tokenów wyjściowych.
Przeprowadź obliczenia, które faktycznie pociąga za sobą obciążenie z długim kontekstem — prefiks 180 000 tokenów obsługiwany z pamięci podręcznej, 5 000 wygenerowanych tokenów. W przypadku Opus 5.5 to 180 000 tokenów po 0,20 USD za milion, czyli około 3,6 centa, plus 5 000 po 20 USD za milion, czyli 10 centów: razem około 13,6 centa. W przypadku GPT-6 Astra to 180 000 po 1,00 USD, czyli 18 centów, plus 5 000 po 50 USD, czyli 25 centów: razem około 43 centów. Przewaga 0,84 punktu i 3,2-krotna różnica kosztów nie są faktami tego samego rodzaju, a decyzja zakupowa, która bierze pod uwagę tylko pierwszą z nich, wzięła pod uwagę mniejszą liczbę.
Fable 5.1 pokazuje to samo z drugiej strony cennika tego samego dostawcy: przy 10,00/50,00 USD jest wyceniony dokładnie tak jak Astra i uzyskuje wynik 164,82 — o 2,53 punktu mniej niż Opus 5.5 za te same pieniądze. Indeks umieszcza trzy flagowe pozycje Anthropic w odległości 2,53 punktu od siebie, a cennik rozsuwa je 2,5-krotnie — co znacznie lepiej opisuje wybór, przed którym stoi kupujący, niż jakikolwiek pojedynczy ranking.
Jeśli zamierzasz się spierać o liczbę, spieraj się na własnym ruchu.

Powód, dla którego ten indeks w ogóle warto czytać, jest taki, że mierzy go ktoś inny niż dostawcy — ale sama struktura kompozytu wyznacza warunki sporu. Kalibracja Epoch, jej szacunki trudności i sposób traktowania modeli, które pomijają benchmarki, poprzedzają liczbę w tabeli, a żadnej z tych rzeczy czytelnik nie może odtworzyć ze zrzutu ekranu. To samo dotyczy każdego sztandarowego benchmarku dostawcy, dlatego użytecznym posunięciem nie jest opowiedzenie się po którejś stronie między nimi, lecz porównanie ich na ruchu, który kontrolujesz.
Oba te modele są dostępne z jednego klucza API w OrcaRouter, który przekazuje cennik dostawcy bez marży 0%: Claude Opus 5.5 za $4.00/$20.00 z odczytem z pamięci podręcznej po $0.20 oraz GPT-6 Astra za $10.00/$50.00 z jej progiem powyżej 272K stosowanym dokładnie tak, jak ustawia go dostawca. Wysłanie tego samego zestawu promptów do obu to zmiana konfiguracji, a nie drugi kontrakt, a tam, gdzie oba są kierowane, automatyczne przełączanie awaryjne działa pod spodem, co ma znaczenie przy decyzji tak blisko progu szumu. Tabela liderów może powiedzieć, że te dwa modele są nieodróżnialne. Tylko Twój własny eval może powiedzieć, który z nich jest nieodróżnialny w Twojej pracy.

Co mogłoby wpłynąć na tę liczbę w przyszłym miesiącu?
Plik Epoch jest żywym dokumentem, a trzy rzeczy szybko zmieniłyby odczyt. Pierwszą jest każda nowa ocena modelu granicznego, która znajdzie się w pierwszej czwórce, ponieważ pojedyncza dodatkowa obserwacja benchmarkowa przesuwa kompozyt bardziej, gdy klaster jest tak ciasny, niż gdy istnieje wyraźny lider. Drugą jest dryf przedziałów ufności — najnowsze wpisy mają najszersze przedziały, ponieważ zostały ocenione na najmniejszej liczbie pokrywających się benchmarków, więc wydania z września to wiersze, które najprawdopodobniej się przesuną, a te z lipca – najmniej. Trzecią jest benchmark osiągający nasycenie, co jest konkretnym niepowodzeniem, które indeks miał przetrwać: gdy komponent przestaje rozróżniać, Epoch ponownie waży kompozycję, zamiast pozwolić, by przewaga modelu wyparowała wraz z testem.
Na razie możliwe do obrony podsumowanie jest wąskie. Claude Opus 5.5 zajmuje pierwsze miejsce w Epoch Capabilities Index z wynikiem 167,35 dzięki przewadze 0,84 punktu, której nie potwierdza jego własny przedział ufności, Claude Sonnet 5.5 wspiął się ze średniej półki tej samej linii na odległość 2,15 punktu od prowadzenia, a modele z otwartymi wagami pozostają ponad dziewięć punktów za nimi wszystkimi. Lider to rzut monetą między dwoma dostawcami. Czteropunktowa różnica w cenie między nimi już nie.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
