
Claude Sonnet 5.5: Przeciek ukrytego testu zbudowany z czterech liczb, które już istnieją
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 36 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 181 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
Cztery liczby opublikowano na X 24 września jako dowód, że Claude Sonnet 5.5 jest „już potajemnie testowany”: okno kontekstu 1 mln tokenów, maksymalna długość wyjścia 128 tys. tokenów, 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych. Wszystkie cztery znajdują się obecnie w cenniku samej firmy Anthropic, przypisane do Claude Sonnet 5 — modelu, który miałaby zastąpić wersja 5.5, ogólnie dostępnego od 30 czerwca 2026 r. Ten sam poziom cen 2 USD / 10 USD dotyczy również GPT-6 Sol, który OpenAI udostępniło 22 września, i to właśnie ta zbieżność sprawia, że wpis odczytuje się jako odpowiedź skierowana do OpenAI, a nie rutynowe odświeżenie poziomu: „Dla mnie to brzmi jak bezpośrednia odpowiedź na GPT-6-Sol. Ta sama cena i przypuszczalnie podobna wydajność.”
Nic z tego nie czyni tego twierdzenia błędnym. Czyni je niefalsyfikowalnym, co jest innym i bardziej użytecznym problemem do zapisania. Obserwacja z testu stealth jest warta tylko tyle, ile stojący za nią artefakt, a artefaktem stojącym za tą obserwacją jest karta specyfikacji nieodróżnialna od modelu, który Anthropic udostępnia od dwunastu tygodni.
Co faktycznie zostało opublikowane?
Źródłem jest pojedynczy post na X z konta @kimmonismus, datowany na 24 września 2026. Podaje on okno kontekstowe, limit wyjściowy i dwie ceny, porównuje ceny z GPT-6 Sol i wnioskuje, że Sonnet 5.5 jest testowany. Nie ma żadnego zrzutu ekranu, żadnego ciągu modelu, żadnej odpowiedzi API, żadnego zrzutu konsoli, żadnego opisu zachowania od testerów ani żadnego drugiego obserwatora powiązanego z którymkolwiek z tych elementów. Post jest twierdzeniem zawierającym liczby, a liczby te to publiczne limity tego poziomu.
To warto oddzielić od innego rodzaju przedpremierowej historii o Anthropic, ponieważ rok 2026 przyniósł oba ich typy, a nie są one do siebie podobne. Sierpniowe identyfikatory wczesnego dostępu claude-marshmallow-eap i claude-melon-eap były ciągami znaków, które istniały w żądaniach — brzydkimi, nieefektownymi i sprawdzalnymi. Historia Opus 5.2 ciągnąca się przez cały wrzesień to raport dotyczący routingu: programiści zauważają, że backend stojący za etykietą „Opus 5” odpowiadał inaczej, i opisują to zachowanie. Oba są artefaktami. „Jest już testowany po cichu” bez dołączonego artefaktu to podsumowanie tego, co warstwa Sonnet już sprzedaje.
W samym źródle widać też pewien wzorzec, który warto odnotować. To samo konto opublikowało 20 września podsumowanie, które zaczynało się od czterech modeli, o których twierdzono, że „już są testowane” — Claude Sonnet 5.2, Claude Opus 5.2, Claude Fable 5.2 i Gemini 4 Pro. Spośród tych czterech nazw wpisy Opus i Fable mają za sobą osobne, potwierdzone doniesienia, a wpis Gemini ma własne obserwacje. Wpis Sonnet miał miejsce na liście. Cztery dni później twierdzenie o Sonnecie obrosło w kartę specyfikacji, a ta karta specyfikacji dotyczy modelu, który już istnieje.
Cztery liczby to liczby Claude Sonnet 5
To jest ta część, której sprawdzenie zajmuje trzydzieści sekund, a prawie nikt tego nie sprawdził. Strona przeglądu modeli Anthropic, przeczytana dzisiaj, podaje Claude Sonnet 5 z oknem kontekstowym 1 mln tokenów, maksymalnym wyjściem 128 tys. i ceną $2 / $10 za milion tokenów. Zestaw ten przeciek z tym:
• Okno kontekstowe — 1 mln tokenów deklarowane dla Claude Sonnet 5.5; 1 mln tokenów opublikowane dla Claude Sonnet 5
• Maksymalna długość wyjścia — deklarowano 128K tokenów; opublikowano 128K tokenów
• Cena wejściowa — $2 za milion zgłoszonych; $2 za milion opublikowanych
• Cena wyjścia — $10 za milion zadeklarowanych; $10 za milion opublikowanych
• Identyfikator modelu — nic nie opublikowano dla Claude Sonnet 5.5; claude-sonnet-5 dla Claude Sonnet 5
• Niezależne wyniki — brak dla deklarowanego modelu; Artificial Analysis plasuje Claude Sonnet 5 z wynikiem 38 w Indeksie Inteligencji na 54. miejscu spośród 210 modeli, które mierzy, w konfiguracji rozumowania adaptacyjnego przy maksymalnym wysiłku

Sprawa cen ma drugie dno, które przeciek przedstawia na opak. Gdy Claude Sonnet 5 wchodził na rynek, $2 / $10 ogłoszono jako cenę wprowadzającą obowiązującą do 31 sierpnia 2026 r., z zaplanowanym wzrostem do $3 / $15 1 września. Do tego wzrostu nie doszło. Na stronie cennika Anthropic znajduje się teraz przypis, który stwierdza, że $2 / $10 „jest teraz standardową ceną”, a „wcześniej zaplanowany wzrost do $3 / $15 za milion tokenów wejściowych/wyjściowych 1 września 2026 r. nie nastąpi”. Tak więc cena, którą przeciek przedstawia jako broń konkurencyjną nowego modelu, jest stałą stawką obecnego modelu — co oznacza, że Sonnet 5.5 debiutujący przy $2 / $10 debiutowałby bez żadnego rabatu, w segmencie, który jest już wyceniany przeciwko GPT-6 Sol.
Jedyna rzecz, którą Anthropic faktycznie powiedziała
Odrzuć wszystko, co pochodzi od anonimowych leakerów, a przetrwa jedno zdanie od samej firmy. Kiedy Anthropic 22 września 2026 r. wypuściła Claude Opus 5.5, stwierdziła, że Claude Sonnet 5.5 i Claude Haiku 5.5 pojawią się „w nadchodzących tygodniach”, przynosząc porównywalne korzyści w zakresie wydajności, efektywności i bezpieczeństwa. To zdanie stanowi cały potwierdzony zapis. Nie zawiera identyfikatora modelu, okna kontekstowego, ceny, benchmarku ani daty — a w szczególności nie mówi nic o ukrytym teście, szarej ścieżce ani o jakimkolwiek testowaniu.
Reszta publicznej warstwy Anthropic zgadza się z tą interpretacją. Przegląd modeli wciąż wymienia cztery modele — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5 i Claude Haiku 4.5 — bez piątego wiersza, bez pozycji w cenniku i bez znacznika „nadchodzący” dla następcy Sonneta. Gdyby checkpoint klasy Sonnet był gdzieś udostępniany, gdzie deweloper mógłby do niego dotrzeć, identyfikator byłby pierwszą rzeczą, która by się ujawniła, ponieważ udostępniany model musi mieć nazwę w żądaniu. Nic się nie pojawiło.
Jedna rzecz, którą wrześniowe ogłoszenie rozstrzygnęło: zaprzeczyło ono wcześniejszemu przeciekowi, jakoby linia Haiku miała zostać wycofana, a generacja 5.5 miała przebudować ofertę. Haiku 5.5 nadchodzi, według Anthropic, co oznacza, że historia o przebudowie była błędna w kierunku, w którym przecieki rzadko się mylą — tania warstwa zostaje.
Sierpniowy wyciek mówił o 2 milionach tokenów. Ten mówi o 1 milionie.
Sześć tygodni przed wpisem z 24 września, 9 sierpnia, inne konto na X opublikowało arkusz specyfikacji „SONNET 5.5 LEAK” z dużo śmielszym twierdzeniem: okno kontekstowe o rozmiarze 2 milionów tokenów, dwukrotnie większe niż w Sonnet 5, szybsze wnioskowanie, lepsze korzystanie z narzędzi przeglądarki i terminala, wydajność zbliżona do Claude Fable 5 oraz premiera „w przyszłym miesiącu”. Ten przeciek zawierał grafikę stylizowaną na kartę zapowiedzi Anthropic. Towarzyszył mu też fatalny szczegół, na którym jego krytycy natychmiast się skupili: podany kryptonim „Fennec” był kryptonimem, który już pojawił się wraz z Claude Sonnet 5 30 czerwca. Kryptonim nie może być świeżym dowodem na istnienie następcy modelu, który go używał.
Więc dwie fale przecieków nie zgadzają się co do jednej najczęściej cytowanej liczby. Sierpień mówił o kontekście 2M. Wrzesień podaje 1M. Nie jest możliwe, by obie opisywały ten sam build. Najbardziej prawdopodobna interpretacja jest ta nudna: wrześniowy wpis opisuje publikowane limity poziomu Sonnet, bo tak właśnie wygląda model klasy Sonnet z zewnątrz, a sierpniowy wpis był przypuszczeniem, co odświeżenie prawdopodobnie podwoiłoby. Zauważ, w którą stronę przesunęła się liczba — w dół, ku temu, co już istnieje.
Wiԥc czy porównanie GPT-6 Sol jest prawidłowe?
W większości tak, a najciekawsze jest to, gdzie się to rozjeżdża. GPT-6 Sol zadebiutował 22 września 2026 r., tego samego dnia co Claude Opus 5.5, a jego cena katalogowa zaczyna się od 2 USD za milion tokenów wejściowych i 10 USD za milion tokenów wyjściowych — dokładnie taka jak stawka Sonnet 5 i dokładnie to, co przeciek podaje dla Sonnet 5.5. Obsługuje okno kontekstowe o rozmiarze 1 050 000 tokenów z pułapem wyjścia 128K; jedno i drugie tylko o włos odbiega od wartości Claude Sonnet 5. Tańszy brat, GPT-6 Luna, plasuje się na poziomie 0,10 USD / 0,50 USD.
Różnica tkwi w długim kontekście. GPT-6 Sol ma ceny w dwóch progach: $2 / $10 do 272 000 tokenów wejściowych, a powyżej tej wartości $4 / $15. Anthropic nie robi tego w linii Sonnet — Claude Sonnet 5 rozlicza pełne okno 1M według standardowych stawek, więc żądanie o rozmiarze 900K tokenów kosztuje tyle samo za token co żądanie o rozmiarze 9K. Prawdziwy Sonnet 5.5 w porównaniu z prawdziwym GPT-6 Sol to zatem remis cenowy przy zwykłych promptach i dwukrotna różnica w przypadku obciążeń związanych z długimi dokumentami i dużymi repozytoriami, na których opiera się sprzedaż obu modeli. „Ta sama cena” jest prawdą w nagłówku i nieprawdą przy obciążeniach, dla których wybiera się próg.
Drugie zastrzeżenie kryje się u podłoża całego porównania. Claude Sonnet 5 korzysta z nowszego tokenizera Anthropic, który dla tego samego tekstu generuje około 30% więcej tokenów niż poprzedni. Stawka z nagłówka to nie rachunek; rachunkiem są tokeny na zadanie, a tej liczby nie niósł żaden przeciek.
Co sprawiłoby, że Sonnet 5.5 miałby znaczenie?
Pomiń kwestię, czy to istnieje, i zapytaj, co by się zmieniło dla kogoś, kto płaci za tokeny. Cztery rzeczy — i żadna z nich nie jest specyfikacją techniczną.
Pierwsza to cena poniżej 2 USD / 10 USD. Ponieważ podwyżka z 1 września została anulowana, stawka obecnego gracza jest teraz stała — więc następca utrzymujący tę samą stawkę to ruch w bok, a jedyną wiadomością w segmencie Sonnet, która porusza pieniądze, jest obniżka.
Drugim jest kontekst powyżej 1M. Taka była właściwa propozycja sierpniowego przecieku i jest to jedyna luka w możliwościach, jaką ten przeciek może wskazać, a której dotychczasowy gracz jeszcze nie obejmuje.
Trzecia rzecz to liczba tokenów na zadanie. Adaptacyjne myślenie Claude Sonnet 5 jest domyślnie włączone, a niezależna analiza wykazała, że generuje ono istotnie więcej tokenów wyjściowych na zadanie niż jego poprzednik. Wersja, która utrzymałaby stawkę 2 USD / 10 USD i powstrzymała tę inflację, obniżyłaby rzeczywiste rachunki bardziej niż obniżka ceny z nagłówka.
Czwarty to identyfikator. Ciąg modelu API, wiersz dokumentacji, wpis w cenniku, karta modelu — każdy z nich kończy spór, a brak wszystkich czterech po tak jednoznacznym wycieku jest sam w sobie najbardziej wymownym faktem w tej historii.
Co możesz dziś nazwać
Claude Sonnet 5 nie jest rozwiązaniem tymczasowym na czas, aż poziom się wyklaruje. To model, na którym już działa większość ruchu w Claude API, z oknem 1 mln tokenów, wyjściem 128K i stawką 2 USD / 10 USD, która jest teraz standardem, a nie promocją.

Jest dostępny w OrcaRouter od czerwca w cenie samego Anthropic wynoszącej 2 USD / 10 USD, przekazywanej po cenie katalogowej dostawcy, bez marży, więc zmiana ceny dostawcy w linii Sonnet byłaby tu widoczna tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym. Ten sam klucz pozwala już sięgnąć po GPT-6 Sol w cenie 2 USD / 10 USD, co w tekście takim jak ten ma większe znaczenie niż zwykle: porównanie, na którym opiera się przeciek, to porównanie, które możesz przeprowadzić samodzielnie na jednym poświadczeniu zamiast dwóch umów.

To także najtańszy sposób, by odpowiedzieć na pytanie, które nasuwa przeciek. Jeśli Sonnet 5.5 się pojawi, trafi do katalogu jak wszystko inne, a ty kierujesz na niego część ruchu za automatycznym przełączeniem awaryjnym na Claude Sonnet 5 — bez drugiej integracji, bez renegocjacji i bez ścieżki produkcyjnej opartej na modelu, którego nikt nie przetestował niezależnie. Wypróbowanie nieprzetestowanego poziomu to decyzja o routingu, a nie projekt migracyjny.
Co obejrzeć zamiast kolejnego posta z przeciekiem
Trzy sygnały, w malejącej kolejności według tego, ile by ci powiedziały. Identyfikator jest rozstrzygający, ponieważ udostępniany model musi mieć nazwę w żądaniu i właśnie w ten sposób każda weryfikowalna przedpremierowa historia Anthropic w 2026 r. stała się weryfikowalna. Potwierdzenie od dostawcy — karta modelu, wiersz w dokumentacji, pozycja w cenniku albo samo pojawienie się modelu na własnej liście Anthropic — kończy sprawę definitywnie; zdanie „w nadchodzących tygodniach” oznacza, że jedno z nich jest naprawdę należne. Raport testera opisujący zachowanie, a nie specyfikacje, jest najsłabszy z tych trzech, a i tak jest czymś więcej niż to, co istnieje dzisiaj.
Dopóki jedno z nich nie trafi na rynek, uczciwe podsumowanie jest takie, że Anthropic obiecało odświeżenie modelu Sonnet w nadchodzących tygodniach, a jeden obserwator opisał je, używając liczb modelu, który ma zastąpić. Jeśli Twój stack już działa na claude-sonnet-5, nie ma na co czekać ani wokół czego planować. Jeśli rozważasz Claude Sonnet 5 kontra GPT-6 Sol, liczby, na których możesz się opierać, to te już opublikowane — i są to te same liczby, które przeciek próbuje sprzedać ci jako nowość.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
