
Przeciek "Kettle" dotyczący Claude Fable 5: Wewnętrzny identyfikator modelu ukryty w podpisanym myśleniu — co wiemy do tej pory
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
16 sierpnia o 23:29:45 czasu PDT na X pewien badacz opublikował twierdzenie, które zamieniło niepozorny zakątek API Anthropica w historię typu „co wiemy do tej pory”: odkoduj podpisaną przez serwer „sygnaturę”, która towarzyszy każdemu blokowi myślenia Claude’a, jak powiedzieli, a otrzymasz sześć nazw: model, który faktycznie ci odpowiedział. Według ich interpretacji odpowiedzi publicznie oznaczone jako claude-fable-5 — czyli Claude Fable 5 klasy Mythos, który Anthropic szeroko udostępnia od 9 czerwca 2026 roku w cenie 10/50 dolarów za milion tokenów — zaczęły przenosić wewnętrzny identyfikator, którego nie ma w publicznej dokumentacji Anthropica: claude-kettle-e2c95a10-v2-prod. Nic nie zmieniło się w etykiecie odpowiedzi. Nie wykazano również zmian w rozliczeniach, polu modelu najwyższego poziomu w API ani w gwarancji przypiętej migawki Anthropica. Zmienił się za to ciąg znaków ukryty w polu, którego — jak wprost stwierdza dokumentacja — deweloperzy nie powinni parsować.
To jest raport o wycieku, a nie werdykt. Ustalenie ma cztery dni, opiera się na dekodowaniu jednego badacza, które nie zostało niezależnie odtworzone, a Anthropic nie skomentował, do czego odnosi się „Kettle” — ani towarzysząca mu etykieta MYCRO_MODEL_MANATEE. Właściwe pytanie nie brzmi: „czy Anthropic podmienił Fable 5?” Dowody tego nie wykazują. Właściwe pytanie brzmi: co oznaczałoby, gdyby wewnętrzny identyfikator modelu pojawiający się pod publicznym identyfikatorem modelu był prawdziwy, a czego by nie oznaczał. Oto, co wiemy do tej pory.
Co faktycznie ujawnił przeciek
Sygnał to pojedynczy post na X od @chetaslua (status 2089783170896179632, opublikowany 16 sierpnia 2026), napisany w zwykłym dla tego konta stylu „first with proof". Twierdzenie w skrócie:
Bloki myślowe Claude'a przenoszą podpisany przez serwer protobuf w polu podpisu.
• Pole szóste tego protobufa, jak twierdzi badacz, zawiera identyfikator modelu, który faktycznie wygenerował odpowiedź.
• Począwszy od 16 sierpnia, godz. 23:29:45 czasu pacyficznego (PDT), 2 582 z 2 582 próbkowanych sygnatur miało tę samą wartość: claude-kettle-e2c95a10-v2-prod.
• Druga wewnętrzna etykieta, MYCRO_MODEL_MANATEE, również pojawiła się w tych samych metadanych.
„Liczba «2 582 z 2 582» pełni funkcję retoryczną: jest dowodem badacza, że nie był to jednorazowy przypadek ani wycinek testu A/B, lecz całkowite przełączenie tego, na co wskazuje identyfikator. Tego, czego we wpisie brakuje, to metoda stojąca za odkodowaniem — żadnych surowych podpisów, żadnego skryptu dekodującego, żadnego wywnioskowanego schematu protobuf ani pełnych metadanych odpowiedzi. Publiczny dowód to grafika podsumowująca. To sprawia, że ustalenie jest wiarygodne i jednocześnie na obecną chwilę niemożliwe do zweryfikowania.

Dlaczego podpis w ogóle ma „pole szóste"?
Każdy blok myślenia zwracany przez Claude'a zawiera pole podpisu. Zgodnie z dokumentacją myślenia Anthropica podpis ten to „zaszyfrowana kopia pełnego rozumowania”, którą należy przekazywać bez zmian w rozmowach wieloturowych i z użyciem narzędzi, a API używa go „do weryfikacji, że bloki myślenia zostały wygenerowane przez Claude'a”. W modelu Claude Fable 5 domyślne zachowanie sprawia, że podpis jest jedynym widocznym śladem: gdy parametr display jest ustawiony na „omitted” — co jest ustawieniem domyślnym w modelach Fable 5, Mythos 5, Opus 5 i Sonnet 5 — blok myślenia wraca z pustym polem thinking i jedynie wypełnionym podpisem.
Dokumentacja dodaje następnie zdanie, które ma znaczenie dla każdego wycieku zbudowanego na tym polu: „Pole podpisu jest nieprzezroczyste: nie interpretuj go ani nie parsuj". Parsowanie to właśnie robi twierdzenie Kettle. Nie jest to dowód na to, że twierdzenie jest błędne — podpis musi być czytelny maszynowo dla własnego stosu serwującego Anthropic — ale oznacza to, że dekodowanie zostało przeprowadzone wbrew wyraźnej instrukcji dostawcy, w oparciu o nieudokumentowany protokół, a rekonstrukcja tego protokołu przez badacza nie została opublikowana. Każde wnioskowanie oparte na stwierdzeniu „szóste pole oznacza model serwujący" dziedziczy tę niepewność.
Czego to nie dowodzi
Zacznij od tego, czym faktycznie są dowody: odpowiedź publicznie oznaczona jako claude-fable-5 zawierała niezgłaszany wcześniej wewnętrzny identyfikator. To całość. Sam identyfikator nie dowodzi, że Anthropic zastąpiło wagi Fable 5, że istnieje bardziej zdolny następca, że odpowiedzi stały się lepsze lub gorsze, ani że jakiekolwiek żądanie zostało skierowane do mniejszego modelu. „Kettle” może być wewnętrzną nazwą środowiska serwującego dla tego samego snapshotu Fable 5; może być nazwą komponentu routera; może być klasyfikatorem w warstwie bezpieczeństwa. Kryptonim nie pozwala tego rozróżnić.
Własna polityka wersjonowania Anthropica wyjaśnia, dlaczego wyciek jest zgodny z tym, że nic się nie zmieniło. Z dokumentacji „Model IDs and versioning" dwa stwierdzenia stoją obok siebie:
Anthropic nie aktualizuje wag ani konfiguracji istniejącego identyfikatora modelu. Gdy dostępna jest zaktualizowana wersja, jest wydawana pod nowym identyfikatorem modelu.
Wagi modelu są ustalone dla danego ID, ale infrastruktura serwująca wokół modelu może zmieniać się w czasie. Ta infrastruktura obejmuje komponenty takie jak router żądań, klasyfikatory bezpieczeństwa i logikę próbkowania.

To drugie zdanie stanowi całą koncepcyjną lukę między „Kettle to skandal” a „Kettle to zwykły poniedziałek”. Dokumentacja nawet przewiduje dryf behawioralny: „Od czasu do czasu aktualizacje infrastruktury powodują niewielkie różnice w obserwowalnym zachowaniu, nawet gdy identyfikator modelu i wagi nie uległy zmianie”. Nowy router lub wdrożenie serwujące o nazwie Kettle idealnie wpasowuje się w to zdanie. Aby przeciek był naprawdę obciążający, musiałby pokazywać albo nowy model za identyfikatorem mimo polityki, albo mechanizm naruszający poniższe zasady widoczności.
Udokumentowane routowanie zapasowe, które Fable 5 już ma
Claude Fable 5 już na starcie zawiera mechanizm przełączania modeli, który jest prawdziwy, udokumentowany i ma być widoczny. Klasyfikatory bezpieczeństwa sprawdzają zapytania i mogą kierować podzbiór — Anthropic wymienia ofensywne cyberbezpieczeństwo, biologię o podwójnym zastosowaniu, destylację modeli oraz część prac nad najbardziej zaawansowanymi chipami — do modelu Claude Opus 5. Na powierzchniach konsumenckich rozwiązanie zastępcze ma być wyraźnie widoczne: komunikat, nazwa obsługującego modelu przy odpowiedzi oraz przełączenie wybieraka modeli na Opus. W API odpowiedź ujawnia obsługujący model przez pole `model` na najwyższym poziomie oraz dedykowany blok treści fallback.
Twierdzenie o Kettle opisuje coś innego, a różnica jest właśnie tą częścią, która miałaby znaczenie: wewnętrzny identyfikator pojawiający się w odpowiedzi, która zachowała publiczną etykietę Fable 5. Post badacza nie pokazuje powiadomienia o mechanizmie awaryjnym, zmienionego pola modelu API ani bloku awaryjnego — gdyby to pokazywał, historia brzmiałaby „udokumentowany mechanizm awaryjny zadziałał”, a nie „Anthropic po cichu przekierowuje”. Bez tego przeciek nie wykazał, że jakakolwiek gwarancja widoczności została naruszona, ponieważ nie wykazał, czym jest Kettle.
Dlaczego to ma znaczenie, nawet jeśli nic się nie zmieniło
Przypięte identyfikatory modeli to mechanizm zaufania. Dokumentacja Anthropica obiecuje, że „gdy używasz identyfikatora modelu w żądaniu API, bazowy model pozostaje stały przez cały okres istnienia tego identyfikatora” — to właśnie powód, dla którego zespół może przeprowadzać benchmarki względem claude-fable-5 i oczekiwać, że wynik będzie coś znaczył w następnym kwartale. Ukryty identyfikator, który znajduje się pod tym ID — cokolwiek to jest — przypomina, że gwarancja obejmuje wagi i konfigurację, a nie całą ścieżkę od żądania do tokenu. Gdyby kiedykolwiek pod publicznym ID działał naprawdę inny model bez ujawnienia tego faktu, każdy eval, każda prognoza kosztów i każdy test regresji jakości powiązane z tym ID byłyby po cichu nieważne.
Aspekt rozliczeniowy wyostrza sprawę. Claude Fable 5 kosztuje 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych — to najwyższa opublikowana stawka Anthropica. Gdyby model obsługujący żądanie kiedykolwiek różnił się od identyfikatora rozliczeniowego, pojawia się pytanie, która stawka ma zastosowanie i kto o tym decyduje. Przeciek nie dostarcza dowodów, że tak się stało; chodzi tylko o to, że pole podpisu to miejsce, w którym w pierwszej kolejności szukałbyś oznak takiej sytuacji.
Warto też zwrócić uwagę na terminy. To już trzeci sygnał od Anthropica w ciągu dziewięciu dni: 7 sierpnia firma ogłosiła, że ponownie wytrenowała klasyfikator biologii w Fable 5, ograniczając związane z biologią odpowiedzi zastępcze o około 85% w testach wewnętrznych; 14 sierpnia jej Responsible Scaling Policy Risk Report przyznał, że istnieje niewydany wewnętrzny „Model 2”, który Anthropic nazywa „znaczną poprawą” w stosunku do Claude Mythos 5, i którego nie planuje wydać. Oba to oświadczenia dostawcy, ale razem pokazują, że Anthropic aktywnie zmienia systemy wokół Claude Fable 5 — klasyfikatory 7 sierpnia, uznany wewnętrzny następca 14 sierpnia — utrzymując stały identyfikator claude-fable-5. Kettle byłby opowieścią o tym samym kształcie, minus ujawnienie.
Co z tym zrobić
Dla osób wywołujących API praktyczne stanowisko jest nudne i poprawne: jeden identyfikator nie jest dowodem podmiany, a w wycieku nie ma jeszcze niczego, co można by wykorzystać. Co możesz zrobić, to zebrać własne dowody. Rejestruj pole modelu najwyższego poziomu oraz wszelkie bloki awaryjne w odpowiedziach, które faktycznie otrzymujesz, i obserwuj różnice w tokenach i kosztach przy stałym obciążeniu. Jeśli udokumentowany mechanizm awaryjny zadziała, będzie to widoczne dokładnie w tych miejscach. To jedyny test, który ma znaczenie dla Twojego obciążenia, i nie zależy od tego, czy ktokolwiek dekoduje format podpisu Anthropic.
Jeśli kierujesz ruch do Claude Fable 5 przez OrcaRouter, otrzymujesz ten sam kształt odpowiedzi, który zwraca Anthropic, a ponieważ przekazujemy ceny katalogowe dostawcy bez żadnej marży, nie ma drugiego zestawu cen do uzgodnienia — jeśli Anthropic kiedykolwiek zmieni stawkę Fable 5, nowa liczba jest dostępna po naszej stronie tego samego dnia. W przypadku niezweryfikowanej sytuacji, takiej jak ta, niskoryzykownym sposobem na dalsze korzystanie z modelu bez stawiania ścieżki produkcyjnej na plotce jest skierowanie fragmentu rzeczywistego ruchu do Claude Fable 5 z automatycznym przełączeniem awaryjnym na sprawdzone rozwiązanie zastępcze — Claude Opus 5 w cenie 5/25 dolarów za milion, lub tańszy model z warstwy kodowania — tak aby regresja jakości stała się decyzją routingową, a nie incydentem. Ten sam klucz, bez drugiej umowy, a przełączenie awaryjne to zmiana w routing-DSL, a nie przepisanie.

Co oglądamy
• Czy Anthropic skomentuje. Najczystszym rozwiązaniem jest jednowierszowe potwierdzenie tego, czym są Kettle i Manatee. Cisza sama w sobie jest informacyjna.
• Niezależna reprodukcja. Gdyby ktoś opublikował surowe podpisy, metodę dekodowania i wywnioskowany schemat protobuf, przeniosłoby to sprawę z czyjejś grafiki do weryfikowalnego twierdzenia. Do tego czasu jest to tylko stan obecnej wiedzy, a nie ustalenie.
• Powierzchnia widoczności. Jeśli odpowiedzi claude-fable-5 zaczną pokazywać powiadomienia o fallbacku, zmienione pole modelu API lub bloki fallbacku, interpretacja „udokumentowanego fallbacku” staje się silniejsza; jeśli nie – interpretacja „nieudokumentowanej trasy”.
• Nowy identyfikator modelu. Zasady wersjonowania Anthropica mówią, że prawdziwie nowa wersja jest wydawana pod nowym ID. Najbardziej jednoznacznym potwierdzeniem, że Kettle jest prawdziwym następcą, byłoby zatem wydanie czegoś przez Anthropica — a nie podmiana w miejscu. Należy wypatrywać claude-fable-5.1 lub podobnego.
• Czy „Manatee" zostanie wyjaśnione. Druga etykieta to wątek, którego nikt jeszcze nie pociągnął.
Często zadawane pytania
Czy Anthropic faktycznie kieruje Claude Fable 5 do innego modelu?
Niepotwierdzone. Wyciek pokazuje, że odpowiedzi oznaczone jako claude-fable-5 zawierały wewnętrzny identyfikator claude-kettle-e2c95a10-v2-prod w podpisanej sygnaturze myślenia. Nie pokazuje jednak, że zmieniono wagi, wdrożono następcę lub że jakiekolwiek żądanie zostało zdegradowane. „Kettle" może równie dobrze być nazwą wewnętrznego wdrożenia serwującego dla tego samego snapshotu Fable 5.
Jak znaleziono identyfikator Kettle?
Badacz @chetaslua twierdzi, że zdekodował protobuf w polu podpisu bloków myślowych Claude'a i odczytał identyfikator modelu z pola szóstego. Dokumentacja Anthropic nazywa podpis „nieprzezroczystym" i odradza programistom jego parsowanie, a metoda dekodowania badacza nie została opublikowana, więc twierdzenie to nie jest jeszcze niezależnie możliwe do odtworzenia.
Czy to narusza gwarancję przypiętego modelu Anthropic?
Nieznane. Dokumentacja wersjonowania firmy Anthropic mówi, że nigdy nie aktualizuje wag ani konfiguracji istniejącego ID modelu, a nowe wersje trafiają do obiegu pod nowym ID — ale wyraźnie pozwala na zmiany w infrastrukturze serwującej wokół modelu (router żądań, klasyfikatory bezpieczeństwa, logika próbkowania). Identyfikator Kettle mógłby być dokładnie taką zmianą, która nie naruszałaby gwarancji.
Skąd mam wiedzieć, czy model, który mnie obsługuje, się zmienił?
Obserwuj pole modelu najwyższego poziomu w odpowiedziach API, szukaj bloków treści zastępczej (fallback) i śledź różnice w tokenach i kosztach przy stałym obciążeniu. Udokumentowane mechanizmy fallback w Anthropic mają być widoczne w tych miejscach. Nie ma publicznego pola API, które ujawniałoby identyfikator Kettle.
Uczciwa ocena jest taka, że przeciek nadał czemuś nazwę, ale nie udowodnił, czym to jest. Identyfikator Kettle jest prawdziwy w jedynym sensie, w jakim może być prawdziwy przecieknięty ciąg znaków: badacz twierdzi, że tam jest, 2582 razy na 2582, począwszy od nocy 16 sierpnia. To, na co wskazuje — nowy model, przemianowane wdrożenie, komponent routera, klasyfikator — pozostaje niezweryfikowane, a własna dokumentacja Anthropic oferuje całkowicie przyziemne wyjaśnienie całej sprawy. To jest wartość tego tekstu i jego ograniczenie. Dopóki nie zostanie opublikowany surowy podpis lub Anthropic nie powie, czym jest Kettle, właściwą postawą jest traktowanie tego jako „stan wiedzy na dziś”: warto to obserwować, warto logować własny ruch, a nie warto zmieniać z tego powodu wyboru modelu — zwłaszcza gdy warstwa routingu pozwala zachować otwartą opcję w obie strony.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
