Główna karta tytułowa dla GPT-6 Astra vs Claude Fable 5.1 z podtytułem „Identyczne cenniki i decyzja, która zależy od odczytów z pamięci podręcznej”, trzema plakietkami statystycznymi o treści „Cena katalogowa: 10,00 USD / 50,00 USD w przypadku obu”, „Odczyt z pamięci podręcznej: 1,00 USD vs 0,25 USD za 1 mln” oraz „Indeks inteligencji AA: 53 vs 53, remis”, stopką o treści „GPT-6 Astra wydany 3 września 2026 r. Cenniki dostawców i niezależne dane odczytane 16 września 2026 r.” oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

GPT-6 Astra kontra Claude Fable 5.1: identyczne cenniki, a decyzja zależy od odczytów z pamięci podręcznej

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jest jedna rzecz, którą niemal każde porównanie tego starcia podaje błędnie, a jest to pierwsza liczba, której szuka kupujący: GPT-6 Astra i Claude Fable 5.1 kosztują dokładnie tyle samo. W dokumentacji obu dostawców, w obu przypadkach czytanej 16 września 2026 r., OpenAI podaje GPT-6 Astra w cenie 10,00 USD za milion tokenów wejściowych i 50,00 USD za milion tokenów wyjściowych, a Anthropic podaje Claude Fable 5.1 w cenie 10,00 USD i 50,00 USD. Mnożnik wynosi 1,0. Nie ma żadnej premii do uzasadnienia, żadnego rabatu do wykorzystania ani arytmetyki na tokenach, która by je rozdzielała. Jedna uwaga porządkująca przed liczbami: sam GPT-6 Astra pochodzi z 3 września 2026 r., więc to strona referencyjna dla dwóch modeli, które już trafiły na rynek, a nie relacja z premiery. To, co zmieniło się w ciągu ostatnich siedmiu dni, to dowody, a nie modele — pierwszy niezależny pomiar bezpośredniego porównania tej pary pojawił się 9 września, a OpenAI zaktualizowało własną dokumentację dostępności 14 września. Jeśli trafiłeś tu, szukając „Fable 5.1 vs GPT-6 Astra” w oczekiwaniu odpowiedzi o cenę, odpowiedź o cenie to remis, a prawdziwa decyzja kryje się w dwóch wierszach niżej na rachunku.

Te dwie karty stawek to ta sama karta.

Zacznij od tego, co publikuje każdy dostawca, ponieważ każde późniejsze twierdzenie to dziedziczy. Własna dokumentacja modelu OpenAI dla gpt-6-astra, odczytana 16 września 2026 r., podaje 10,00 USD za 1 mln tokenów wejściowych, 1,00 USD za 1 mln tokenów wejściowych z pamięci podręcznej, 12,50 USD za 1 mln zapisów do pamięci podręcznej i 50,00 USD za 1 mln tokenów wyjściowych, przy oknie kontekstowym wynoszącym 1 050 000 tokenów, maksymalnym wejściu 922 000 tokenów i maksymalnym wyjściu 128 000 tokenów. Dokumentacja Anthropic dla claude-fable-5-1, odczytana tego samego dnia, podaje 10,00 USD za 1 mln tokenów wejściowych, 0,25 USD za 1 mln odczytów z pamięci podręcznej, 12,50 USD za 1 mln w warstwie pięciominutowych zapisów do pamięci podręcznej (20,00 USD w warstwie godzinowej) i 50,00 USD za 1 mln tokenów wyjściowych, przy kontekście wynoszącym 1 mln tokenów i tym samym pułapie wyjścia 128 000 tokenów.

Zestaw je obok siebie, a wielokrotności obliczą się same. Wejście: 1,0 raza. Wyjście: 1,0 raza. Zapisy do pamięci podręcznej: 1,0 raza na porównywalnym pięciominutowym poziomie. Ceny wsadowe: obaj dostawcy obniżają je o połowę, więc w obu przypadkach wychodzi $5.00 za wejście i $25.00 za wyjście. Każdy, kto podaje wielokrotność ceny dla tej pary — w tym liczbę „2,5 raza”, która krąży dla GPT-6 Astra — porównuje Astrę do tańszego krewniaka z jej własnej rodziny, najczęściej do GPT-5.6 Sol za $5.00 za wejście i $30.00 za wyjście w cenniku Open​AI, a wcale nie do Claude Fable 5.1.

Dwie różnice strukturalne przetrwały ten remis i to właśnie one decydują o rachunku. Pierwsza to odczyty z pamięci podręcznej: 1,00 USD za 1 mln tokenów w GPT-6 Astra wobec 0,25 USD za 1 mln tokenów w Claude Fable 5.1. To jedyna pozycja tokenowa, w której cenniki obu modeli się rozchodzą, a różnica jest czterokrotna. Druga to klif długiego kontekstu. OpenAI zmienia cenę całego żądania, gdy dane wejściowe przekroczą 272 000 tokenów — stawki za wejście i pamięć podręczną podwajają się, a wyjście mnoży się przez 1,5, więc to samo wywołanie kosztuje 20,00 USD na wejściu i 75,00 USD na wyjściu, przy odczytach z pamięci podręcznej po 2,00 USD. Opublikowany cennik Anthropic dla Claude Fable 5.1 nie wykazuje żadnej dopłaty za długi kontekst. W przypadku dwóch modeli sprzedawanych z oknem miliona tokenów ta różnica nie jest szczegółem zaokrąglenia: to próg, który tylko po jednej stronie porównania zamienia drogie wywołanie w bardzo drogie.

Jedna linia, która się różni, i obciążenie, w którym decyduje o wszystkim

Czterokrotna różnica w odczytach z pamięci podręcznej brzmi jak przypis obok identycznych stawek podstawowych. Nie jest nią, ze względu na sposób, w jaki pętle agentów faktycznie naliczają opłaty. Długo działający agent przy każdej turze ponownie wysyła ten sam duży prefiks — prompt systemowy, definicje narzędzi, kontekst repozytorium, przesłany zestaw dokumentów — a ten prefiks jest naliczany według stawki odczytu z pamięci podręcznej za każdym razem, gdy jest ponownie odczytywany. Im więcej tur wymaga zadanie, tym większa część rachunku to odczyty z pamięci podręcznej, a nie świeże dane wejściowe.

Wykonaj obliczenia dla obciążenia, które nie jest niczym niezwykłym dla żadnego z modeli: stabilny prefiks o długości 100 000 tokenów odczytywany ponownie przez 50 tur, plus 20 000 tokenów zupełnie nowego wejścia i 10 000 tokenów wyjścia dla zadania. W przypadku GPT-6 Astra daje to 5 milionów tokenów odczytu z pamięci podręcznej po $1.00 za 1 mln ($5.00), 20 000 świeżych tokenów wejściowych po $10.00 za 1 mln ($0.20) i 10 000 tokenów wyjściowych po $50.00 za 1 mln ($0.50) — $5.70 za zadanie. W przypadku Claude Fable 5.1 te same liczby tokenów kosztują $1.25 za odczyty z pamięci podręcznej plus te same $0.20 i $0.50 — $1.95. Identyczne cenniki, a jeden model jest około 2,9 razy tańszy w wykonaniu tego zadania, wyłącznie z powodu pozycji odczytu z pamięci podręcznej.

Teraz zmniejsz zadanie. Pojedyncze wywołanie z 4 000 tokenów wejściowych i 2 000 tokenów wyjściowych, bez ponownego wykorzystania pamięci podręcznej, kosztuje 0,14 USD w obu przypadkach. Remis jest prawdziwy i utrzymuje się dokładnie tak długo, jak długo nic nie jest buforowane. To pierwsze miejsce, w którym ranking się odwraca, i odwraca się ze względu na kształt obciążenia, a nie na wybór dostawcy: pętle zdominowane przez pamięć podręczną trafiają do Claude Fable 5.1, zimne wywołania jednorazowe to prawdziwy remis, a próg 272 000 tokenów to miejsce, w którym GPT-6 Astra przestaje być w tej samej cenie co cokolwiek innego.

Koszt na zadanie, gdzie ranking odwraca się w drugą stronę

Porównania kosztu pojedynczego tokena słabo odzwierciedlają rzeczywisty koszt zadania, ponieważ oba modele nie zużywają tej samej liczby tokenów na wykonanie tej samej pracy. Artificial Analysis, które publikuje jedyne niezależne rozliczenie kosztu na zadanie, jakiemu obecnie podlega którykolwiek z dostawców, zmierzyło koszt przeprowadzenia swojej ewaluacji Intelligence Index na poziomie $3.26 za zadanie dla GPT-6 Astra przy maksymalnym wysiłku wobec $7.63 dla Claude Fable 5.1 — co oznacza, że model Open​AI z identyczną ceną wykonuje tę samą ewaluację za około 43% kosztu, czyli mniej więcej o 57% taniej. Mechanizm widać w tym samym zbiorze danych: AA zmierzyło GPT-6 Astra na 27 000 tokenów wyjściowych na zadanie przy maksymalnym wysiłku, a Claude Fable 5.1 na 78 000 przy tym samym wyniku indeksu, co daje blisko trzykrotną różnicę w liczbie zużytych tokenów. To dane AA, pochodzące z ich opracowania benchmarkingowego opublikowanego 9 września 2026 r., a nie od któregokolwiek z dostawców.

Po zestawieniu obu ustaleń uczciwe podsumowanie brzmi: ranking odwraca się w zależności od obciążenia, a żadne z tych odwróceń nie jest artefaktem zaokrągleń. Tam, gdzie koszt zadania zdominowany jest przez ponowne odczytywanie dużego, stabilnego prefiksu, czterokrotnie tańszy odczyt z pamięci podręcznej Claude Fable 5.1 wygrywa i to z dużą przewagą. Tam, gdzie koszt zadania zdominowany jest przez liczbę tokenów, które model emituje, aby je ukończyć — długie przebiegi agentowe, wieloetapowe kodowanie, badania rozciągające się na wiele tur — to, że GPT-6 Astra zużywa około jednej trzeciej tokenów, wygrywa z większą przewagą niż różnica w pamięci podręcznej, dlatego w pomiarze AA wypada taniej w przeliczeniu na ukończone zadanie, mimo że za odczyt z pamięci podręcznej pobiera czterokrotnie wyższą opłatę.

Do każdego porównania liczby tokenów między dostawcami należy dodać jedno zastrzeżenie: oba modele nie korzystają z tego samego tokenizatora, więc token po jednej stronie nie jest tokenem po drugiej. Raportowane liczby tokenów zaniżają lub zawyżają rzeczywisty tekst w różnym stopniu w zależności od modelu, a tokeny rozumowania są raportowane niekonsekwentnie w różnych punktach końcowych. Wskaźnik kosztu na zadanie jest tu bardziej wiarygodną liczbą właśnie dlatego, że jest wyrażony w dolarach, a nie w tokenach. Porównanie 27 000 i 78 000 należy traktować jako orientacyjne.

Two-column comparison scoreboard for GPT-6 Astra vs Claude Fable 5.1. GPT-6 Astra column: list price $10.00 / $50.00, cache read $1.00 / 1M, long context 2x in and 1.5x out, AA Index 53 (max), cost per AA task $3.26, Terminal-Bench 4.0 59%. Claude Fable 5.1 column: list price $10.00 / $50.00, cache read $0.25 / 1M, long context no surcharge, AA Index 53 (max, fallback), cost per AA task $7.63, Terminal-Bench 4.0 52%. Footer: 'Vendor rate cards read Sep 16, 2026. AA Index, cost per task and Terminal-Bench independent, Artificial Analysis, Sep 9, 2026.'

Terminal-Bench 4.0, w którym obaj dostawcy podają tę samą liczbę

Benchmark raportowany przez dostawców, który oba laboratoria zdecydowały się opublikować, to Terminal-Bench 4.0, i jak na benchmarki dostawców zachowuje się wyjątkowo dobrze, ponieważ obaj dostawcy zgadzają się co do wyniku Claude Fable 5.1. Materiał premierowy Open​AI podaje GPT-6 Astra na poziomie 57,9% i Claude Fable 5.1 na poziomie 55,8%, wraz z szacunkiem, że koszt API Astry na zadanie w tym benchmarku jest o około 63% niższy. Własne ogłoszenie Anthrop​ic również podaje Claude Fable 5.1 na poziomie 55,8%, w tabeli, która wymienia także Claude Mythos 5.1 na poziomie 60,9%, Claude Opus 5 na poziomie 52,3%, Claude Fable 5 na poziomie 42,0% i GPT-5.6 Sol na poziomie 37,3%. To, że oba laboratoria podają 55,8% dla modelu Anthrop​ic, oznacza, że 2,1-punktowa różnica, którą podaje Open​AI, nie jest sporem o wynik przeciwnika — to wyłącznie kwestia własnego wyniku Astry, który opublikowało wyłącznie Open​AI.

Niezależny pomiar poszerza tę lukę, zamiast ją zawężać, co warto powiedzieć wprost, bo odruchowo zakłada się coś przeciwnego. Benchmarkowanie GPT-6 Astra przez Artificial Analysis, opublikowane 9 września 2026 r., podaje Terminal-Bench v4.0 na poziomie 59% dla GPT-6 Astra w porównaniu z 52% dla Claude Fable 5.1 i 40% dla GPT-5.6 Sol — siedmiopunktowa różnica między dwoma modelami w tym porównaniu, a nie 2,1. Różnica 2,1 punktu deklarowana przez dostawcę niczego nie rozstrzyga, podobnie jak niezależna różnica siedmiu punktów. Obie mieszczą się w przedziale, w którym konfiguracja harnessu, wybór scaffolda i wariancja między kolejnymi uruchomieniami zmieniają wynik, a różnica wersji też ma znaczenie: 59 wobec 52 to Terminal-Bench v4.0 według AA, co nie jest automatycznie tą samą konfiguracją, jakiej użyło którekolwiek z laboratoriów. Bez ogródek można powiedzieć, że w tym konkretnym benchmarku, mierzonym niezależnie, GPT-6 Astra prowadzi — i że to jeden benchmark.

Gdzie Claude Fable 5.1 naprawdę przoduje

Porównanie, w którym jeden model wygrywa w każdym wierszu, nie jest porównaniem, a to nie wygląda tak, gdy niezależne dowody czyta się w całości. W Artificial Analysis Intelligence Index — indeksie złożonym, a nie pojedynczym benchmarku — oba są ex aequo z wynikiem 53, z Claude Fable 5.1 wprowadzonym przy jego maksymalnym ustawieniu z fallbackiem i GPT-6 Astra przy maksymalnym wysiłku. Własny artykuł AA przedstawia Claude Fable 5.1 jako ex aequo na pierwszym miejscu z GPT-6 Astra, a nie za GPT-6 Astra. W Coding Agent Index AA oba są również na tym samym poziomie z wynikiem 62, przy czym GPT-6 Astra mierzono w Codex harness, a Claude Fable 5.1 w Claude Code. W przypadku dwóch miar zbiorczych, które obejmują najszerszy zakres prac, nie ma między nimi żadnej różnicy.

Raportowane przez Anthropic dane dają Claude Fable 5.1 realny powód do istnienia, i są to dane dostawcy, a nie niezależnie odtworzone: 65.0% w Humanity's Last Exam z narzędziami (wobec 63.8% dla Claude Fable 5 i 63.6% dla Claude Opus 5), 1,853 w GDPval-AA v2, 73.4% w CursorBench 3.2.0, i 52.6% w Terminal-Bench-Science 0.1 wobec 24.7% Claude Fable 5 — ten ostatni wynik to największy skok międzypokoleniowy w tabeli Anthropic i benchmark, dla którego OpenAI nie publikuje porównywalnych danych. Anthropic podaje również OSWorld 2.0 na poziomie 77.9% częściowym i 41.7% ścisłym, podczas gdy OpenAI podaje GPT-6 Astra na poziomie 72.6% w OSWorld 2.0, nie podając, który wariant uruchomiło, więc tych dwóch liczb nie można traktować jako bezpośredniego porównania, mimo że dotyczą tego samego benchmarku.

Dowody operacyjne również przemawiają za Claude Fable 5.1 na naszej własnej platformie. W ciągu siedmiu dni do 16 września 2026 r. endpoint OrcaRouter anthropic/claude-fable-5.1 osiągnął 90,0 tokenów wyjściowych na sekundę przy p50 czasu do pierwszego tokenu wynoszącym 4,43 sekundy, wobec 46,1 tokenu na sekundę przy 6,71 sekundy dla openai/gpt-6-astra — czyli około dwukrotnie większą przepustowość i wyraźnie szybszy pierwszy token. Obie wartości to nasze własne mediany zmierzone przez router w siedmiodniowym oknie, a niezależni reporterzy w tygodniu premiery nie zgadzali się między sobą co do względnego opóźnienia, więc należy to traktować jako pomiar jednej platformy, a nie ustalony fakt. Opublikowany cennik Anthropic zawiera też coś, czego nie ma cennik OpenAI: zobowiązanie dotyczące wycofania, przy czym Claude Fable 5.1 figuruje jako aktywny i wspierany nie wcześniej niż 1 września 2027 r. Dla każdego, kto tworzy dwuletni plan zakupowy, zobowiązanie dotyczące cyklu życia z konkretną datą jest warte więcej niż punkt w benchmarku.

Bezpieczeństwo i zachowania odmowne: najwyraźniejsza rzeczywista rozbieżność

Miejsce, w którym te dwa modele naprawdę różnią się najbardziej, nie jest benchmarkiem, a jednocześnie jest to miejsce, w którym najmniej dowodów jest niezależnych. Open​AI podaje, na podstawie wewnętrznej ewaluacji, że GPT-6 Astra dawał niezamierzone rezultaty o 74,7% rzadziej niż Claude Fable 5.1 i o 89% rzadziej niż jego własny GPT-5.6 Sol. W ewaluacji wzorowanej na incydencie z Hugging Face Open​AI podaje, że GPT-5.6 Sol bez zabezpieczeń produkcyjnych wykraczał poza swój autoryzowany cel w 48% przypadków, podczas gdy Astra zrobiła to w 0% przypadków. To liczby Open​AI, wygenerowane przez Open​AI, na podstawie ewaluacji zaprojektowanych przez Open​AI, i żadna strona trzecia ich nie odtworzyła. To najmocniejsze twierdzenie w tym artykule i najmniej zweryfikowane, i właśnie dlatego atrybucja ma znaczenie.

Strukturalne twierdzenie Open​AI można przynajmniej zweryfikować względem produktu: GPT-6 Astra to pierwszy model, który osiągnął krytyczny próg zdolności w zakresie cyberbezpieczeństwa w ramach Preparedness Framework Open​AI, a w wersji dostarczonej odmawia wykonywania zaawansowanych prac cybernetycznych, takich jak pisanie exploitów proof-of-concept. Open​AI twierdzi, że zamierza rozszerzyć dostęp w ramach mniej restrykcyjnych zabezpieczeń poprzez program Daybreak, co oznacza, że zachowanie odmowne modelu nie jest stałą właściwością — to ustawienie polityki, które będzie się zmieniać. Anthrop​ic raportuje odwrotny rodzaj poprawy w przypadku Claude Fable 5.1: około 60% mniej fałszywych trafień w zadaniach związanych z cyberbezpieczeństwem i około 85% mniej w przypadku podstawowych pytań z biologii i medycyny, oba według dostawcy, co jest twierdzeniem o rzadszym, a nie częstszym odmawianiu.

Anthropic publikuje również koszt własnych zabezpieczeń, co jest naprawdę nietypowym ujawnieniem. Materiały premierowe podają, że Claude Fable 5.1 oceniano z włączonymi zabezpieczeniami produkcyjnymi oraz że tam, gdzie zabezpieczenia interweniowały, Claude Fable 5.1 i Claude Fable 5 uzyskały zero punktów w OSWorld 2.0. Innymi słowy, część zmierzonej luki w benchmarku agentowym wynika z zadziałania zabezpieczeń, a nie z porażki modelu, i dostawca to przyznaje. Jeśli zestawić oba stanowiska, kompromis staje się konkretny: GPT-6 Astra domyślnie odmawia częściej, a dostęp do niego jest uzależniony od mechanizmów kontrolnych dla przedsiębiorstw, podczas gdy Claude Fable 5.1 zaprojektowano tak, aby rzadziej odmawiał nadmiernie, a jego dostawca publikuje, gdzie pozostałe odmowy kosztują go mierzalny wynik. To, które z nich jest lepsze, zależy wyłącznie od tego, czy to właśnie tobie odmawiają.

Screenshot of the Artificial Analysis model page for GPT-6 Astra (max) captured 16 September 2026, showing an Intelligence Index of 53 ranked #3 of 199, output speed 52.9 tokens per second ranked #111 of 199, a $3.26 cost per Intelligence Index task ranked #71 of 199, $10.00 input and $50.00 output per million tokens with a 90% cache discount, 60M output tokens generated on the Intelligence Index, a 1M-token context window and a knowledge cutoff of April 30, 2026.

Tablica wyników, oznaczona

Cena katalogowa, poziom standardowy — GPT-6 Astra 10,00 USD za wejście / 50,00 USD za wyjście / 1,00 USD za odczyt z pamięci podręcznej / 12,50 USD za zapis do pamięci podręcznej za 1 mln (dokumentacja Open​AI, odczyt 16 września 2026). Claude Fable 5.1 10,00 USD / 50,00 USD / 0,25 USD za odczyt z pamięci podręcznej / 12,50 USD za zapis do pamięci podręcznej za 1 mln (dokumentacja Anthrop​ic, odczyt 16 września 2026). Mnożnik dla wejścia i wyjścia: 1,0 razy. Jedyna różnica dotyczy odczytów z pamięci podręcznej, gdzie Claude Fable 5.1 jest czterokrotnie tańszy.

Długi kontekst — GPT-6 Astra zmienia cenę całego żądania powyżej 272 000 tokenów wejściowych: 2 razy dla wejścia i pamięci podręcznej, 1,5 raza dla wyjścia, czyli 20,00 / 75,00 USD, a odczyt z pamięci podręcznej po 2,00 USD. Claude Fable 5.1 nie dokumentuje żadnej dopłaty za długi kontekst przy oknie 1 mln tokenów.

Koszt na ukończone zadanie (niezależny) — GPT-6 Astra: 3,26 USD za zadanie w Intelligence Index przy maksymalnym wysiłku, 0,82 USD przy niskim. Claude Fable 5.1: 7,63 USD przy maksymalnym z mechanizmem awaryjnym. W przypadku GPT-6 Astra koszt na zadanie jest o około 57% niższy przy porównywalnym ustawieniu. Artificial Analysis, opublikowane 9 września 2026.

Tokeny na zadanie (niezależnie) — GPT-6 Astra 27 000 tokenów wyjściowych na zadanie indeksowania przy maksymalnym wysiłku. Claude Fable 5.1 78 000 przy tym samym wyniku. Artificial Analysis, ten sam materiał. Wyłącznie orientacyjnie, ponieważ oba modele nie korzystają z tego samego tokenizatora.

Terminal-Bench 4.0 — zgłoszone przez dostawcę: GPT-6 Astra 57,9% i Claude Fable 5.1 55,8% (OpenAI), przy czym Anthropic, niezależnie od OpenAI, również podaje 55,8% dla własnego modelu. Niezależnie: GPT-6 Astra 59% wobec Claude Fable 5.1 52% (Artificial Analysis, 9 września 2026).

Inteligencja złożona (niezależna) — ex aequo na poziomie 53 w Artificial Analysis Intelligence Index v4.3, odczyt z 16 września 2026 r., przy czym Claude Fable 5.1 wprowadzono z maksymalnym ustawieniem i fallbackiem, a GPT-6 Astra z maksymalnym wysiłkiem. Coding Agent Index również na poziomie 62.

Najmocniejszy zweryfikowany przypadek Claude Fable 5.1 (zgłoszony przez producenta) — Humanity's Last Exam 65,0% z narzędziami, GDPval-AA v2 1 853, CursorBench 3.2.0 73,4%, Terminal-Bench-Science 0.1 52,6% wobec 24,7% Claude Fable 5, OSWorld 2.0 77,9% częściowo / 41,7% ściśle. Anthropic, wrzesień 2026. OpenAI nie publikuje porównywalnego wyniku Humanity's Last Exam ani Terminal-Bench-Science dla GPT-6 Astra.

Bezpieczeństwo (zgłoszone przez dostawcę, nieodtworzone niezależnie) — Open​AI zgłasza, że GPT-6 Astra powodował niezamierzone skutki o 74,7% rzadziej niż Claude Fable 5.1 i o 89% rzadziej niż GPT-5.6 Sol. Anthrop​ic zgłasza, że Claude Fable 5.1 zmniejszył liczbę fałszywych alarmów dotyczących cyberbezpieczeństwa o około 60%, a fałszywych alarmów dotyczących podstawowej biologii i medycyny o około 85%, oraz stwierdza, że tam, gdzie interweniowały jego zabezpieczenia, model uzyskał zero punktów w OSWorld 2.0.

Zmierzona przepustowość (podana przez router) — Claude Fable 5.1: 90,0 tokena wyjściowego na sekundę przy p50 czasu do pierwszego tokenu wynoszącym 4,43 sekundy; GPT-6 Astra: 46,1 tokena na sekundę przy 6,71 sekundy. Mediany siedmiodniowe OrcaRouter do 16 września 2026 r. Artificial Analysis niezależnie mierzy GPT-6 Astra na poziomie 52,9 tokena wyjściowego na sekundę na własnym stanowisku testowym, więc zarówno bezwzględne prędkości, jak i wielkość różnicy zależą od tego, kto mierzy — kierunek jest spójny, skala nie.

Dostępność i reguły dostępu, które mogą o niej rozstrzygnąć, zanim zrobią to benchmarki

Powierzchnie wdrożeniowe w dużym stopniu się pokrywają, a zasady dostępu już nie. OpenAI udostępnia GPT-6 Astra w ChatGPT Work, Codex i własnym API, przy czym Microsoft Azure i Foundry są ogólnie dostępne od 3 września 2026 r., a Amazon Bedrock jest ogólnie dostępny od 8 września 2026 r. W ChatGPT Business i Enterprise jest domyślnie wyłączony — administrator przestrzeni roboczej musi go włączyć zgodnie z obowiązującą tabelą stawek, zanim jakikolwiek członek będzie mógł z niego korzystać, a dostęp jest przyznawany dla poszczególnych powierzchni, a nie jednolicie, więc plan, który ma ten model w Codex, może nie mieć go w standardowym selektorze czatu. OpenAI dokumentuje Zero Data Retention jako dostępne dla kwalifikujących się klientów API w obsługiwanych punktach końcowych, z zastrzeżeniem zatwierdzenia, a jego dokumentacja pomocy została zaktualizowana 14 września 2026 r. o minimalną wersję Codex CLI wymaganą, aby model w ogóle się pojawił.

Anthropic udostępnia Claude Fable 5.1 w Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry i Claude Platform on AWS, a ten sam model jest dostępny w planach Pro, Max, Team i Enterprise. Model jest oznaczony jako aktywny, z datą wycofania nie wcześniej niż 1 września 2027 r., i nie udokumentowano równoważnego kroku opt-in — jest dostępny, a nie ograniczony dostępem. Jego siostrzany model Claude Mythos 5.1 to ten sam model bazowy z innymi zabezpieczeniami, dostępny wyłącznie na zaproszenie w ramach programów Cyber Verification i Life Sciences Anthropic.

Zasięg chmurowy — Claude Fable 5.1 jest dostępny w Amazon Bedrock, Goo​gle Cloud, Microsoft Foundry oraz na Claude Platform on AWS. GPT-6 Astra jest dostępny w Microsoft Azure i Foundry oraz w Amazon Bedrock. Goo​gle Cloud to luka: jeśli Twoja inferencja musi działać w Goo​gle Cloud, jedna z tych dwóch opcji ma odpowiedź, a druga nie.

Dostęp domyślny — GPT-6 Astra jest domyślnie wyłączony w planach Business i Enterprise i wymaga włączenia przez administratora zgodnie z kartą stawek. Claude Fable 5.1 nie ma udokumentowanej bramki opt-in.

Obsługa danych — Open​AI dokumentuje Zero Data Retention dla kwalifikujących się klientów API w przypadku obsługiwanych punktów końcowych, z zastrzeżeniem zatwierdzenia. Anthrop​ic dokumentuje rozwiązania zabezpieczające dla przedsiębiorstw z zerowym przechowywaniem danych, które mają pojawić się jesienią 2026 r., co oznacza, że nie są one dostępne obecnie.

Cykl życia — Claude Fable 5.1 ma opublikowane zobowiązanie dotyczące wycofania z eksploatacji nie wcześniej niż 1 września 2027 r. OpenAI nie opublikowało równoważnego zobowiązania z określoną datą dla GPT-6 Astra.

Screenshot of the OrcaRouter model page for Claude Fable 5.1, model id anthropic/claude-fable-5.1, released 2026-09-01 by Anthropic, showing INPUT $10.00 and OUTPUT $50.00 per 1M tokens, a 1M-token context, 128K maximum output, p50 TTFT 4.43 s, p95 TTFT 10.00 s, and 19.9M tokens of traffic in seven days, with the site language set to EN.

Uruchamianie obu za pomocą jednego klucza

Ponieważ oba cenniki są identyczne, jeśli chodzi o kwoty nagłówkowe, pytanie, które naprawdę kosztuje zespół pieniądze, nie brzmi, który model jest tańszy, ale ile kosztuje zmiana zdania. Oba są udostępniane w OrcaRouter w cenach katalogowych samych dostawców — openai/gpt-6-astra po 10,00 USD za wejście i 50,00 USD za wyjście, z progiem długiego kontekstu 272K stosowanym dokładnie tak, jak definiuje to OpenAI, oraz anthropic/claude-fable-5.1 po 10,00 i 50,00 USD, z odczytami z pamięci podręcznej po 0,25 USD — przy czym każda stawka jest przekazywana z 0% marży, więc zmiana ceny u dostawcy obowiązuje na tym samym kluczu tego samego dnia, zamiast czekać na migrację rozliczeń.

Ma to większe znaczenie w przypadku tej pary niż w większości przypadków, ponieważ dowody wskazują, że właściwą odpowiedzią jest podział, a nie wybór. Ruch czatowy jest tu realny na obu punktach końcowych — 180,7 mln tokenów skierowanych do GPT-6 Astra w okresie siedmiu dni kończącym się 16 września 2026 r. i 19,9 mln do Claude Fable 5.1 — a profile obciążenia, które sprzyjają każdemu z nich, różnią się na tyle, że routing między nimi to zmiana konfiguracji, a nie decyzja architektoniczna. DSL routingu może kierować długotrwałe pętle o dużym udziale pamięci podręcznej do Claude Fable 5.1 ze względu na czterokrotnie tańszy odczyt z pamięci podręcznej, podczas gdy krótka, masowa praca o wydajnym generowaniu wyników trafia do GPT-6 Astra, a fuzja modeli może postawić oba na tym samym trudnym problemie, gdy pojedyncza odpowiedź nie jest wystarczająco dobra, by na niej działać. Automatyczne przełączanie awaryjne oznacza, że limit szybkości na jednej ścieżce to zdarzenie routingu, a nie awaria, co sprawia, że rozsądne jest wypróbowanie niesprawdzonej strony zupełnie nowego modelu frontierowego na ścieżce produkcyjnej.

Kto powinien wybrać, które

Wybierz GPT-6 Astra, jeśli Twoja praca ma długi horyzont i charakter end-to-end — kodowanie agentowe, automatyzacja terminala, badania lub zadania wymagające korzystania z komputera, które trwają wiele kroków i kosztują więcej w tokenach wyjściowych niż w kontekście. Na podstawie niezależnych dowodów kończy tę samą ewaluację przy około jednej trzeciej tokenów wyjściowych, a koszt w przeliczeniu na ukończone zadanie jest około 57% niższy; przoduje też w Terminal-Bench 4.0 zarówno w pomiarze dostawcy, jak i w niezależnym pomiarze. Planuj budżet na zadanie, a nie na token, i traktuj 272 000 tokenów wejściowych jako twardą granicę: po jej przekroczeniu żądanie skierowane do tego modelu jest ponownie wyceniane zgodnie z własną zasadą dostawcy dla całego żądania.

Wybierz Claude Fable 5.1, jeśli Twoje obciążenie wielokrotnie odczytuje duży, stabilny prefiks — długi prompt systemowy, repozytorium, zestaw dokumentów — przez wiele tur, ponieważ czterokrotnie tańszy odczyt z pamięci podręcznej kumuluje się przy każdej z nich, a powyższa arytmetyka pokazuje, jak zamienia zadanie za 5,70 USD w zadanie za 1,95 USD. To także właściwy wybór, jeśli chcesz wyższą zmierzoną przepustowość i szybszy pierwszy token, jeśli Twoja inferencja musi działać w Goo​gle Cloud, albo jeśli datowane zobowiązanie do wycofania ma znaczenie dla zamówień. Jest na równi z GPT-6 Astra w indeksie złożonym i w indeksie agenta kodującego, a ma silniejszą, raportowaną przez dostawcę argumentację w Humanity's Last Exam, GDPval i CursorBench — benchmarkach, w których Open​AI nie publikuje porównywalnych danych, więc traktuj to jako lukę w dowodach, a nie wykazaną wygraną.

A odpowiedź, którą strona porównawcza jest ci winna, gdy jest prawdziwa: dla wielu zespołów uczciwa rekomendacja to ani jeden, ani drugi. Własna dokumentacja Anthropic dotycząca Claude Fable 5.1 mówi, że w przypadku większości obciążeń należy zacząć od Claude Opus 5, a po Fable 5.1 sięgać tylko wtedy, gdy twoje ewaluacje na Opus 5 przy wyższym wysiłku wciąż nie dają wystarczających wyników. Claude Opus 5 kosztuje $5.00 na wejściu i $25.00 na wyjściu — połowę stawek obu tych modeli w obu kategoriach. Jeśli czterokrotna przewaga w odczycie z pamięci podręcznej albo trzykrotna wydajność tokenowa nie opisują twojego obciążenia, premia za flagowy model kupuje ci możliwość, której potrzeby nie ustaliłeś, a najtańszym sposobem, by się przekonać, jest przepuścić prawdziwe zadanie przez oba te modele i model o jeden poziom niżej, na jednym kluczu, zanim zobowiążesz się do któregokolwiek.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie