Wygenerowana karta tytułowa z nagłówkiem „poziom 165” i podtytułem „Epoch Capabilities Index, plik z 1 października 2026”, trzema kartami statystyk z wartościami 165 (Claude Sonnet 5.5), 165 (Claude Fable 5.1) oraz 11 vs 20 (oceny benchmarkowe stojące za każdą z tych liczb) i logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Claude Sonnet 5.5 remisuje z Claude Fable 5.1 w Epoch Capabilities Index

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Remis na szczycie tabeli wyników jest zwykle najmniej interesującą rzeczą, jaka się na niej znajduje. Ten jest wyjątkiem, ponieważ dwa modele ex aequo na szczycie nie kosztują tyle samo. W pliku Epoch Capabilities Index zaktualizowanym 1 października 2026 r., Claude Sonnet 5.5 i Claude Fable 5.1 oba mają 165 — wiersze trzeci i czwarty spośród 253 śledzonych modeli — dwa punkty za Claude Opus 5.5 i GPT-6 Astra, którzy sami są ex aequo na 167, i o dwa punkty wyprzedzają Claude Opus 5 z wynikiem 163. Claude Sonnet 5.5 został wydany 28 września 2026 r. w cenie 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych. Claude Fable 5.1 został wydany 1 września w cenie 10 USD i 50 USD. Pojedyncza liczba mówi, że oba modele są wymienne pod względem ogólnych możliwości. Pięciokrotnie wyższa cena tokenów wyjściowych mówi, że nie są. Oba się bronią, a powód, dla którego bronią się razem, to ta część tabeli, której nikt nie cytuje.

Czym właściwie jest ten indeks i kto go mierzy

ECI nie jest tablicą wyników dostawców. Jest tworzony przez Epoch AI, niezależną organizację badawczą, jako kompozyt, który zszywa wyniki z ponad pięćdziesięciu różnych benchmarków w jedną skalę ogólnych możliwości, wnioskując względną trudność każdego benchmarku na podstawie modeli, które przypadkiem pojawiają się w kilku z nich jednocześnie. Metodologia została przedstawiona w artykule „A Rosetta Stone for AI Benchmarks”, sfinansowanym przez Google DeepMind i napisanym wspólnie z badaczami z jego zespołu AGI Safety & Alignment — ale Epoch wyraźnie stwierdza, że indeks jest jej własnym produktem i że posiada do niego pełne prawa, a kod dopasowujący jest publiczny. To rozróżnienie ma znaczenie, gdy fundator badania i wydawca wyniku nie są tym samym podmiotem.

Dwie właściwości tej skali decydują o tym, jak można odczytywać liczbę na niej. Pierwsza to fakt, że ECI jest zakotwiczony, a nie absolutny: surowe wartości są przeskalowywane tak, aby Claude 3.5 Sonnet wypadał na 130, a GPT-5 na 150, co oznacza, że dana liczba coś znaczy tylko w zestawieniu z inną liczbą z tego samego pliku. Druga to brak górnej granicy. Nie ma 100, do którego można by się zbliżać, więc „szczyt indeksu” to stwierdzenie o dacie, a nie o limicie, który ktokolwiek osiągnął.

Trzecia właściwość jest tym, co zamienia remis w historię. Przedziały publikowane obok każdego wyniku — 90-procentowe przedziały bootstrapowe, skonstruowane przez 500-krotne ponowne próbkowanie własnych zaobserwowanych wyników benchmarkowych każdego modelu — są identyczne dla obu modeli przy wyniku 165: od 162 do 169 dla Claude Sonnet 5.5 i od 162 do 169 dla Claude Fable 5.1. Liczby, które je wygenerowały, nie są identyczne. Wynik 165 Claude Sonnet 5.5 został dopasowany na podstawie 11 ewaluacji benchmarkowych. Wynik 165 Claude Fable 5.1 został dopasowany na podstawie 20.

Dlaczego ten sam przedział nie oznacza tego samego dowodu

ECI wymaga co najmniej czterech ocen benchmarkowych, zanim model w ogóle zostanie oceniony, więc obie liczby z zapasem przekraczają ten próg. Ale przedział mówi o tym, jak bardzo rozrzucają się własne wyniki modelu, a nie o tym, ile ich jest — dlatego dwa modele mogą przedstawić ten sam pas wokół tego samego oszacowania punktowego, podczas gdy jeden z nich opiera się na mniej więcej połowie dowodów. Jeśli potraktujesz oba wyniki 165 jako równie solidne, odczytasz ten przedział jako korektę na wielkość próby, którą on nie jest.

Asymetria ma praktyczne znaczenie dla wyczucia czasu. Epoch dopasowuje ponownie cały model wspólnie na wszystkich danych, gdy tylko pojawią się nowe oceny, więc wartość modelu może się przesunąć, nawet jeśli w samym modelu nic się nie zmienia. Model oparty na 11 obserwacjach ma większe pole do ruchu niż ten oparty na 20, co sprawia, że z tej pary to Claude Sonnet 5.5 ma większe szanse na zmianę w kolejnej rewizji — w którąkolwiek stronę.

Sposób, w jaki sam Epoch ujmuje obecną sytuację, jest węższy niż nagłówki, które się z tego zrodziły. Podsumowanie aktualizacji przygotowane przez organizację otwiera informacja, że Claude Opus 5.5 zajął pierwsze miejsce z wynikiem 167, minimalnie wyprzedzając GPT-6 Astra, a drugie zdanie poświęcono temu, że Claude Sonnet 5.5 „w przybliżeniu dorównał” Claude Fable 5.1 z wynikiem 165. „W przybliżeniu dorównał” to kluczowe sformułowanie, a opublikowane przedziały są powodem, dla którego jest ono właściwe.

Gdzie te dwa profile faktycznie się rozchodzą

A two-column comparison scoreboard titled 'Claude Sonnet 5.5 vs Claude Fable 5.1 - the scoreboard'. Left column 'Claude Sonnet 5.5': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 11', 'Mystery Game Puzzles: 65%', 'Furniture Assembly: 75%', 'Price: $2 / $10'. Right column 'Claude Fable 5.1': rows reading 'ECI: 165', 'Interval: 162-169', 'Benchmarks: 20', 'Mystery Game Puzzles: 58%', 'Furniture Assembly: 70%', 'Price: $10 / $50'. A footer line reads 'Epoch Capabilities Index, file updated 1 October 2026; prices per the vendors' own rate cards.'

Poziom w zbiorczym wyniku nie oznacza poziomu w poszczególnych częściach. Epoch publikuje panel dla poszczególnych benchmarków na każdej stronie modelu, a sześć benchmarków pojawia się zarówno na stronie Claude Sonnet 5.5, jak i na stronie Claude Fable 5.1 — co sprawia, że są to jedyne sześć, dla których można przeprowadzić porównanie na tych samych zasadach na podstawie samego indeksu.

• Zagadki z gier detektywistycznych — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%

• FrontierMath Poziomy 1–3 (v2) — Claude Sonnet 5.5 89% vs Claude Fable 5.1 90%

• FrontierMath Tier 4 (v2) — Claude Sonnet 5.5 80% vs Claude Fable 5.1 88%

• OTIS Próbny AIME 2024–2025 — Claude Sonnet 5.5 100% kontra Claude Fable 5.1 100%

• Benchmark montażu mebli — Claude Sonnet 5.5 75% vs Claude Fable 5.1 70%

• SimpleQA Verified — Claude Sonnet 5.5 47% vs Claude Fable 5.1 71%

Cztery punkty ruchu w obie strony w tak zatłoczonym zestawieniu zbiorczym, a leżący u podstaw podział nie jest nawet blisko symetrii. Claude Sonnet 5.5 prowadzi tam, gdzie praca przypomina gry i ma charakter multimodalny — rozwiązywanie łamigłówek, montaż fizyczny — i dorównuje w matematyce konkursowej. Claude Fable 5.1 prowadzi o 8 punktów na najtrudniejszym poziomie FrontierMath i o 24 punkty w SimpleQA Verified, zestawie wiedzy o świecie, w którym wynik 47% wobec 71% to największa pojedyncza różnica we wspólnym panelu. Nabywca wybierający między tymi dwoma modelami nie wybiera między dwoma odczytami tej samej zdolności; wybiera między tańszym modelem, który jest silniejszy w niektórych zadaniach, a droższym, który jest silniejszy w innych, przy czym ogólny wskaźnik zdolności nie chce ich rozdzielić.

Indeks Epoch wyraźnie mówi również, że przewaga w pojedynczym benchmarku nie musi znaleźć odzwierciedlenia w kompozycie. Benchmarki nie są ważone według dokładności, a model, który się specjalizuje, może uzyskać niższy wynik niż rywal o innym profilu, nawet gdy prowadzi w poszczególnych testach — jego dokumentacja mówi o tym wprost. To nie jest wada, którą się usprawiedliwia; właśnie temu służy kompozyt obejmujący pięćdziesiąt kilka testów.

Dwa niezależne przyrządy wskazują w przeciwnych kierunkach.

A capture of the Epoch AI model page for Claude Sonnet 5.5, headed ECI #3, Anthropic, Sep. 28, 2026, Closed weights, and the line that it has an ECI score of 165 and ranks 3rd of 253 tracked models. Beneath it a comparison table headed 'Claude Sonnet 5.5 vs select alternatives' carries four columns - Claude Sonnet 5.5, Claude Opus 5.5, GPT-6 Astra and Kimi K3 - with an ECI score row reading 165, 167, 167 and 158, a ranking row reading #3, #1 - Best, #2 and #13, and per-benchmark rows for Mystery Game Puzzles, FrontierMath Tiers 1-3 (v2), FrontierMath Tier 4 (v2), OTIS Mock AIME 2024-2025, Furniture Assembly Benchmark, SciCode, GPQA Diamond, Text Arena (Coding) and SimpleQA Verified.

W obiegu istnieje drugi niezależny pomiar i nie zgadza się z pierwszym co do tego, który z tych dwóch modeli jest na prowadzeniu. W Artificial Analysis Intelligence Index wartości, które nasz własny katalog podaje dla tych dwóch modeli, wynoszą 56 dla Claude Sonnet 5.5 i 53,4 dla Claude Fable 5.1, pochodzą z tej samej wersji tego indeksu i tym samym opierają się na tej samej próbie ocenianych modeli. Różnica trzech punktów na korzyść tańszego modelu — podczas gdy Epoch odczytuje je jako identyczne.

Żaden z tych odczytów nie jest błędny, a sposób korzystania z nich polega na zauważeniu, w czym się nie zgadzają. Oba indeksy obejmują różne zestawy benchmarków i różnie je ważą; kompozyt Epoch został zbudowany tak, by przetrwać nasycenie benchmarków, podczas gdy indeks Artificial Analysis to prosta agregacja innego koszyka. Gdy para modeli jest tak blisko siebie, wybór narzędzia ma większe znaczenie niż mierzona różnica. Czytelnik, który chce wybrać mocniejszą z dwóch sąsiadujących liczb, powinien spojrzeć na panel wspólnych pojedynczych benchmarków powyżej, a nie na którykolwiek z nagłówków, ponieważ tylko tam oba modele są porównywane ze sobą w tym samym teście.

Jest jeszcze jeden element kontekstu, którego wskaźnik złożony nie obejmuje, a Epoch obejmuje: data premiery. Claude Fable 5.1 zajmuje dziś czwarte miejsce spośród 253 śledzonych modeli. W chwili własnej premiery 1 września 2026 r. zajmował pierwsze miejsce spośród 247 modeli śledzonych wówczas. Jego wagi się nie zmieniły. Granica możliwości po prostu wyprzedziła go o sześć miejsc w ciągu miesiąca — taki jest kształt całej tabeli i powód, dla którego miesięczny odczyt indeksu jest migawką, a nie wyrokiem.

Ile kosztuje różnica i gdzie jest tańsza strona

A capture of the OrcaRouter model page for Claude Sonnet 5.5, listed under anthropic/claude-sonnet-5.5, showing a 1M-token context window with up to 128K output tokens, input pricing at $2.00 per million tokens and output at $10.00 per million tokens, and the catalogue's capability tags for the model.

Równy poziom pod względem ogólnych możliwości, różnica 2,5 raza na wejściu i 5 razy na wyjściu — to cała praktyczna treść tego odczytu. Oba modele są w naszym własnym katalogu — anthropic/claude-sonnet-5.5za $2.00 za milion tokenów wejściowych i $10.00 za milion wyjściowych, przy $0.20 za odczyt z pamięci podręcznej, oraz anthropic/claude-fable-5.1 za $10.00 i $50.00, przy $0.25 za odczyt z pamięci podręcznej — a oba są przekazywane po cenie katalogowej samego dostawcy, bez doliczania marży, więc zmiana stawek u dostawcy pojawia się po naszej stronie tego samego dnia, w którym pojawia się po ich stronie.

Cykliczność ma większe znaczenie niż nagłówek. Weźmy obciążenie, które wysyła z pamięci podręcznej prefiks o długości 120 000 tokenów i generuje 8 000 tokenów danych wyjściowych, uruchamiane raz dziennie przez miesiąc. W Claude Sonnet 5.5 ten prefiks kosztuje 120 000 tokenów po 0,20 USD za milion, około 2,4 centa, plus 8 000 po 10 USD za milion, 8 centów — w przybliżeniu 10,4 centa za uruchomienie, czyli około 3,12 USD w ciągu trzydziestu dni. W Claude Fable 5.1 ten sam prefiks to 120 000 po 0,25 USD, 3 centy, plus 8 000 po 50 USD, 40 centów — około 43 centów za uruchomienie, czyli 12,90 USD przez miesiąc. Oba modele obsługują to samo okno 1 mln tokenów z maksymalnie 128 tys. tokenów wyjściowych, więc różnica tkwi w cenniku, a nie w górnym limicie.

Na tym tle sześć wspólnych benchmarków wskazuje, w którą stronę dodatkowe pieniądze coś kupują. Zespół, którego praca przypomina FrontierMath Tier 4 lub otwarte odtwarzanie faktów, kupuje realną różnicę 8–24 punktów w tych testach, płacąc cztery razy więcej; zespół, którego praca przypomina rozwiązywanie łamigłówek lub montaż multimodalny, kupuje 5 do 7 punktów w drugą stronę, płacąc mniejszą kwotę. Na jednej platformie to nie są dwie decyzje zakupowe. Oba modele znajdują się za jednym kluczem API spośród ponad 200 modeli, więc porównywanie ich na własnym ruchu to zmiana konfiguracji, a nie drugi kontrakt, a tam, gdzie oba są kierowane, pod spodem znajduje się automatyczne przełączanie awaryjne — co ma znaczenie, gdy dwa niezależne instrumenty nie zgadzają się co do tego, który prowadzi.

Co przesunęłoby ten odczyt

Trzy rzeczy by to zmieniły, a tylko jedna z nich dotyczy któregokolwiek z tych dwóch modeli.

Pierwsza sprawa to więcej ewaluacji benchmarkowych. Claude Sonnet 5.5 wszedł do indeksu cztery dni temu, mając za sobą 11; każda dodatkowa ewaluacja zawęża jego przedział i może przesunąć jego estymatę punktową, a wspólne ponowne dopasowanie sprawia, że zmiana nie ogranicza się do nowego wiersza.

Drugim jest pojawienie się kolejnego modelu typu frontier. Cztery górne wiersze obejmują cztery punkty, z dwoma remisami w tym zakresie, więc pojedynczy, dobrze oceniony nowicjusz trafia do wnętrza klastra, a nie poniżej niego — a opublikowane przedziały, które nakładają się we wszystkich czterech przypadkach, oznaczają, że uporządkowanie między nimi jest rozstrzygnięciem remisu, a nie pomiarem.

Trzecią kwestią jest cena samych modeli, której nie śledzi żaden indeks. Luka, na której skupia się ten tekst, to luka w cenniku stawek: 2 i 10 dolarów wobec 10 i 50 dolarów obecnie. Zmiana w którymkolwiek z cenników przechyla decyzję, nie zmieniając ani jednego wyniku w zakresie możliwości.

Możliwa do obrony konkluzja jest wąska. W zbiorczym wskaźniku Epoch AI, w pliku zaktualizowanym 1 października 2026 r., Claude Sonnet 5.5 i Claude Fable 5.1 mają ten sam wynik — 165, ex aequo na trzecim miejscu, z identycznymi publikowanymi przedziałami opartymi na różnej ilości danych. W odrębnym narzędziu Artificial Analysis te same dwa modele dzieli trzy punkty. W sześciu benchmarkach, w których indeks porównuje je bezpośrednio, wymieniają się prowadzeniem w zależności od dziedziny, zamiast stać na tym samym poziomie. A w cenniku nie są nawet blisko siebie. Jedyną rzeczą, której ta interpretacja nie poprze, jest zdanie, jako które najprawdopodobniej zostanie przytoczona: że modele są równoważne.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie