Wygenerowana karta tytułowa dla Claude Opus 5.5 vs Claude Fable 5.1, z podtytułem „Tańszy model wygrał niezależny indeks”, z prawdziwym logo OrcaRouter nałożonym w prawym dolnym rogu i wierszem stopki o treści „Indeks według Artificial Analysis przy maksymalnym wysiłku; ceny według Anthropic”.
Guides & Insights

Claude Opus 5.5 kontra Claude Fable 5.1: Tańszy model wygrał w Niezależnym Indeksie

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Anthropic sprzedaje teraz dwa modele na szczycie swojej oferty, a ten, który kosztuje dwa i pół razy więcej, nie jest tym na szczycie tabeli. Claude Opus 5.5, wydany 22 września 2026 r. w cenie 4 dolarów za milion tokenów wejściowych i 20 dolarów za milion tokenów wyjściowych, uzyskuje 58 punktów w Artificial Analysis Intelligence Index. Claude Fable 5.1, który od 1 września utrzymuje pozycję flagowego modelu w cenie 10 dolarów za wejście i 50 dolarów za wyjście, uzyskuje 53 punkty. Obie liczby pochodzą od tego samego ewaluatora, obie zmierzono w tej samej rodzinie konfiguracji, a różnica biegnie w przeciwnym kierunku niż metki z cenami. To fakt, od którego musi zacząć się to porównanie, ponieważ niemal każdy tekst premierowy z ostatniego tygodnia przedstawia Opus 5.5 jako wersję rabatową Fable 5.1 — tańszy model, który „dorównuje” droższemu w większości zadań. Niezależna liczba mówi, że model rabatowy jest z przodu.

To, czy powinno to zmienić to, co wdrażasz, to odrębne pytanie, a odpowiedź zależy mniej od pięciopunktowej różnicy niż od dwóch ustawień, których nikt nie umieszcza w nagłówku: na jaki poziom wysiłku każdy model jest domyślnie ustawiony i który z nich da się przyspieszyć.

Niezależne liczby i to jedno, co je łączy

A two-column scoreboard comparing Claude Opus 5.5 and Claude Fable 5.1 across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #4), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), context window (1M tokens on both), default effort (medium against high), knowledge cutoff (Jun 2026 on both) and fast mode (supported at $8.00 / $40.00 against not supported). The footer reads 'Index figures per Artificial Analysis at max effort; prices, effort defaults and fast-mode support per Anthropic.'

Artificial Analysis publikuje jedną konfigurację na model, a w przypadku obu tych modeli jest ona oznaczona jako „Adaptive Reasoning, Max Effort, Default Fallback”. Ta sama etykieta, ten sam ewaluator, ten sam przebieg — co czyni to najczystszym bezpośrednim starciem, jakie ma którykolwiek z tych modeli:

• Indeks Inteligencji — Claude Opus 5.5 58, nr 1 spośród 210 w porównaniu z Claude Fable 5.1 53, nr 4

• Prędkość generowania — Claude Fable 5.1 65,8 tokenów/s, poniżej mediany rankingu wynoszącej 71,0, w porównaniu z Claude Opus 5.5, który nie został jeszcze opublikowany w rankingu

• Czas do pierwszego tokenu — Claude Fable 5.1 274,43 s w porównaniu z medianą tablicy wynoszącą 3,83 s; Claude Opus 5.5 jeszcze nieopublikowany

• Gadatliwość w Indexie — Claude Opus 5.5 wygenerował 260 mln tokenów wyjściowych, wobec mediany wynoszącej 88 mln w całym zestawieniu

• Cena — Claude Opus 5.5 4,00 $ / 20,00 $ za milion vs Claude Fable 5.1 10,00 $ / 50,00 $

Dwa z tych wierszy wymagają czytania, a nie cytowania. Pierwszy to etykieta „Max Effort”: wynik żadnego z modeli nie odzwierciedla jego domyślnego ustawienia produkcyjnego, a te dwa ustawienia domyślne nie są takie same — więcej o tym poniżej. Drugi to wiersz dotyczący rozwlekłości, który stoi w sprzeczności ze sposobem, w jaki sprzedawano Opus 5.5. Narracja Anthropic o wydajności głosi, że model osiąga tę samą odpowiedź przy mniejszej liczbie tokenów, a materiały premierowe cytują partnerów, którzy raportują o jedną trzecią do połowy mniej tokenów wyjściowych. W Indexie, gdzie mierzy się, a nie cytuje, Opus 5.5 wygenerował 260 mln tokenów wobec mediany rankingowej wynoszącej 88 mln — około trzykrotnie bardziej gadatliwy niż typowy model, z którym jest porównywany. Obie rzeczy mogą być prawdziwe: może zużywać mniej tokenów niż Claude Opus 5, a mimo to być modelem rozwlekłym w ujęciu absolutnym. Jeśli jednak planowałeś budżet na podstawie hasła „mniej tokenów”, a nie własnego rachunku, to niezależny pomiar jest tym, który warto sprawdzić.

Co daje dodatkowe 6 dolarów za milion

A screenshot of Anthropic's Claude Platform Docs page for Claude Opus 5.5 showing its 'How it compares' table: Claude Fable 5.1 and Claude Opus 5.5 both at 1M context and 128K max output with a Jun 2026 cutoff, Fable 5.1 at $10 / $50 with high default effort and slower latency against Opus 5.5 at $4 / $20 with medium default effort and moderate latency, with Claude Sonnet 5 at $2 / $10 and a Jan 2026 cutoff and Claude Haiku 4.5 below them. The Opus 5.5 pricing panel underneath lists $4 input, $20 output, $5 and $8 cache writes, $0.20 cache read and a 50% batch discount.

Usuń benchmarki, a różnica sprowadza się do cennika. Wszystko tutaj pochodzi z opublikowanej przez Anthropic strony z cennikiem i można to zweryfikować dziś:

• Dane wejściowe — 4,00 USD za milion w Opus 5.5 vs 10,00 USD w Fable 5.1

• Wyjście — 20,00 USD za milion vs 50,00 USD

• Odczyt z pamięci podręcznej — 0,20 USD za milion w Opus 5.5 vs 0,25 USD w Fable 5.1

• Mnożnik pamięci podręcznej — Opus 5.5 rozlicza trafienia w pamięci podręcznej po 0,05x stawki bazowej danych wejściowych; Fable 5.1 rozlicza je po 0,025x, czyli lepszy mnożnik przy wyższej podstawie

• Zapis do pamięci podręcznej — 5 USD za milion w oknie 5-minutowym i 8 USD za godzinne w Opus 5.5, wobec 12,50 USD i 20 USD w Fable 5.1

• Batch API — Opus 5.5 spada o połowę do 2,00 USD / 10,00 USD; Fable 5.1 spada o połowę do 5,00 USD / 25,00 USD

• Tryb szybki — Opus 5.5 obsługuje go w cenie $8.00 / $40.00 za nawet około 2,5× większą szybkość generowania; Fable 5.1 w ogóle nie obsługuje trybu szybkiego

Na wiersz pamięci podręcznej warto spojrzeć dwa razy, ponieważ oba modele odwracają zwykły wzorzec. Fable 5.1 ma bardziej agresywny mnożnik — 2,5% wejścia bazowego w porównaniu z 5% w Opus 5.5 — ale ponieważ jego podstawa wynosi 10 USD, a nie 4 USD, jego odczyt z pamięci podręcznej jest nadal droższy z tych dwóch w wartościach bezwzględnych. Nie ma konfiguracji, w której model premium wygrywa na tokenie kontekstu z pamięci podręcznej. A mnożnika nie można przenieść: pętla agenta dostrojona do zachowania pamięci podręcznej Fable 5.1 zapłaci proporcjonalnie więcej za trafienie w pamięć podręczną w Opus 5.5, nawet jeśli zapłaci mniej za świeży token.

Tryb szybki to ostrzejsza asymetria. Dokumentacja Anthropic wymienia tryb szybki dla Claude Opus 5.5, Claude Opus 5 i Claude Opus 4.8 — Fable 5.1 nie ma na tej liście. Tańszy model ma więc dźwignię opóźnienia, której droższy po prostu nie ma, przy $8/$40, co wciąż jest poniżej standardowej stawki wyjściowej Fable 5.1 wynoszącej $10/$50. Jeśli Twoje obciążenie jest na tyle interaktywne, że wolny pierwszy token stanowi problem produktowy, zwróć uwagę, że zmierzony czas do pierwszego tokenu w Fable 5.1 wynosi 274 sekundy. Ta liczba jest artefaktem rozumowania przy maksymalnym wysiłku, a nie defektem, ale to liczba zarejestrowana przez oceniającego.

Wartości domyślne nie są takie same i to jest pułapka.

Dokumentacja modeli samego Anthropic stawia oba modele obok siebie, a wiersz, który rozstrzyga większość rzeczywistych porównań, to nie cena. Jest nim domyślny poziom wysiłku: medium dla Claude Opus 5.5, high dla Claude Fable 5.1. Oba korzystają z adaptacyjnego myślenia, którego nie można wyłączyć; głębokość jest kontrolowana wyłącznie przez parametr effort, w skali obejmującej low, medium, high, xhigh i max.

Właśnie dlatego zdanie premierowe „Opus 5.5 dorównuje Fable 5.1 w większości zadań” i znajdujące się pod nim tabele benchmarków wyglądają, jakby się nie zgadzały. Wiersze bezpośredniego porównania Anthropic dla Opus 5.5 są często oznaczone ustawieniem wyższego wysiłku niż domyślne — wynik 66,4% w Terminal-Bench 4.0 przeciwko 55,8% Fable 5.1 uzyskano przy wysiłku xhigh, a nie przy medium. Tymczasem własne wyniki Fable 5.1 powstały przy jego wyższym ustawieniu domyślnym. Dwa modele porównywane przy różnych ustawieniach wysiłku w ogóle nie są porównywane, a Anthropic mówi o tym wprost w swoich materiałach premierowych, ostrzegając, że różnice w benchmarkach na tym poziomie możliwości są mniej wiarygodnym wskaźnikiem rzeczywistych różnic, niż sugerowałyby same wyniki.

W praktyce zamienia to decyzję w ćwiczenie z dostrajania, a nie w wybór. Jeśli przechodzisz z Fable 5.1 na Opus 5.5 i przenosisz swoje ustawienie effort bez zmian, po cichu zmieniłeś to, ile model myśli, a każda liczba dotycząca jakości i kosztów, którą potem uzyskasz, jest zakłócona. Zalecenie Anthropic mówi, by testować wiele poziomów effort, a nie przenosić ustawienia starego modelu. Jest to tanie i prawie nikt tego nie robi, bo oznacza dwukrotne przeprowadzenie własnych ewaluacji.

Jedyne miejsce, w którym to połączenie się opłaca

Wzorzec, który uzasadnia utrzymywanie obu, to pętla doradcy: Opus 5.5 wykonuje pracę, a Fable 5.1 jest konsultowany przy trudnych decyzjach. Anthropic to zmierzyło i rzeczywiście zwiększa to dokładność — przy wyższym koszcie i większym opóźnieniu, co jest kompromisem, jakiego można oczekiwać, umieszczając wolniejszy model w pętli. Zmieniła się arytmetyka, która za tym stoi. Gdy luka kompetencyjna była większa, płacenie 10/50 USD za nadzorowanie workera kosztującego 5/25 USD było oczywiście warte zachodu. Teraz, gdy worker uzyskuje lepsze wyniki niż doradca w niezależnym indeksie, wkład doradcy zawęża się do konkretnych zadań, w których jego własne ewaluacje przebijają Opus 5.5, a te zadania musisz zidentyfikować sam. Pętla nadal ma sens w przypadku trudnego podzbioru; przestaje mieć sens jako konfiguracja stosowana bez wyjątku.

Oba są oddalone o jeden klawisz

Szczegół migracji, na którym drużyny się tu potykają, to nie powierzchnia API — chodzi o to, że są to modele tego samego dostawcy o różnych skalach wysiłku, różnych mnożnikach pamięci podręcznej i różnych domyślnych ustawieniach, a rzetelne ich porównanie oznacza uruchomienie obu na własnych promptach w dopasowanej konfiguracji. Claude Opus 5.5 jest dostępny w OrcaRouter w cenie Anthropic 4,00 USD / 20,00 USD, a Claude Fable 5.1 jest dostępny w OrcaRouter za 10,00 USD / 50,00 USD — cena katalogowa dostawcy przekazana z 0% marży, więc obie liczby zmieniają się tego samego dnia, w którym zmienia je Anthropic, i żadna z nich nie wiąże się z drugą umową ani drugim SDK.

A screenshot of OrcaRouter's own model page for anthropic/claude-fable-5.1, headed 'Claude Fable 5.1' and credited to Anthropic, showing $10.00 input and $50.00 output per 1M tokens and a PERFORMANCE panel with 65.8 output tokens per second, a 274.43s time to first token, 88M output tokens over 7 days and a 0.00% error rate.

To właśnie sprawia, że podział jest praktyczny, a nie teoretyczny. Kierowanie większości ruchu do Opus 5.5 i przypięcie reguły routingu, która eskaluje naprawdę trudne przypadki do Fable 5.1, to konfiguracja na jednym punkcie końcowym, a nie dwie integracje — a złożenie wywołania tak, by jeden model tworzył wersję wstępną, podczas gdy drugi weryfikuje, to jedna linia routing-DSL, a nie pipeline, który trzeba budować i utrzymywać. Jeśli ścieżka eskalacji okaże się niewłaściwa dla Twojego obciążenia, automatyczne przełączanie awaryjne sprawi, że żądanie trafi do modelu, którego charakterystykę już znasz, zamiast zakończyć się całkowitym niepowodzeniem.

Co by to rozstrzygnęło

Szczerze mówiąc, stan tego porównania jest taki, że Anthropic opublikowało jedną tabelę, w której tańszy model wygrywa w większości wierszy, Artificial Analysis opublikowało inną, w której wygrywa bezapelacyjnie, a obie powstały przy ustawieniach poziomu wysiłku, których nie wdrażasz. Żadna z nich nie jest kontrolowanym porównaniem bezpośrednim przy dopasowanych ustawieniach domyślnych i żadna strona trzecia takiego nie przeprowadziła. Luka, która mimo tego wszystkiego się utrzymuje — że Claude Opus 5.5 jest istotnie tańszy w każdej pozycji cennika, obsługuje tryb szybki, którego Fable 5.1 nie ma, i nie pozostaje w tyle w jedynym niezależnym wyniku, jaki ma którykolwiek z tych modeli — jest wystarczająco duża, że ciężar dowodu się przesunął. Jeśli domyślnie korzystasz z Fable 5.1, pytanie nie brzmi już, czy Opus 5.5 jest wystarczająco dobry; brzmi: które konkretne zadania w twoim obciążeniu zawodzą przy poziomie wysiłku medium, bo tylko za nie płacisz tę dopłatę.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie