
Wyciek Claude Voice: ukryta karta „Podgląd” w aplikacji Claude i zgoda na dane głosowe, która pojawiła się obok niej
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów · 82 tok/s
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
W pewnym momencie przed 4 października 2026 r. w interfejsie webowym Claude pojawił się element nawigacji, który nie powinien być jeszcze widoczny: oddzielna zakładka Głos z wewnętrzną etykietą Podgląd. Nie ma dla niej żadnej zapowiedzi, żadnej karty modelu, żadnego wiersza cennika, żadnego wpisu w API ani daty. W tym samym okresie — co zgłoszono 5 października — dostawca po cichu dodał coś jeszcze, czego nie upublicznił: konsumencki opt-in, który pozwala użytkownikom przekazywać nagrania głosowe i dane z czatów głosowych „w celu ulepszania naszych modeli AI”, niezależnie od zgody, o którą już prosi w przypadku rozmów tekstowych. W ofercie wciąż są cztery modele generujące tekst — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 i Claude Haiku 5.5 — a firma nigdy nie wypuściła własnego modelu mowy. Zatem pożyteczne pytanie, które nasuwa ten przeciek, nie brzmi: „czy firma wprowadza model głosowy”. Jest węższe: zakładka dowodzi, że powstaje interfejs, a ten opt-in to pierwszy twardy dowód, jaki ktokolwiek posiada, że firma chce danych treningowych dotyczących mowy. To dwa różne twierdzenia i tylko drugie z nich można datować.
Wszystko poniżej zostało podzielone na to, co potwierdzone, co zgłoszone i niezweryfikowane oraz co jest wnioskiem. Anthropic nie wypowiedział się w ogóle na temat tej zakładki, co oznacza, że źródłem kluczowego faktu jest zrzut ekranu, a nie komunikat prasowy.
Co tak naprawdę zauważono i czego nam to nie mówi
Doniesienie pochodzi od @testingcatalog na X; zostało opublikowane 4 października 2026 r. i opisane w tym samym serwisie 10 października. Jak ujęto to w artykule: „w nawigacji internetowej Claude’a pojawił się osobny element Voice z wewnętrzną etykietą Preview”, a „jego możliwości i powszechna dostępność pozostają nieznane”. To całość bezpośrednich dowodów. W raporcie wyraźnie przedstawiono tę etykietę jako wskazującą na wewnętrzne środowisko podglądu, a nie na wdrożenie.
Z artefaktu wynikają trzy rzeczy i żadna z nich nie jest specyfikacją:
• Zakres — wewnętrzna etykieta podglądu mówi, że gdzieś wewnątrz Anthropic istnieje build. Nie mówi jednak, że ten build zawiera nowy model. Zakładka nawigacyjna to UI.
• Dostawca — raport zauważa, że Anthropic „nie potwierdził bazowego dostawcy usług głosowych”, nie udostępnił dedykowanych modeli zamiany tekstu na mowę za pośrednictwem swojego API i nie wprowadził natywnego, kompleksowego modelu audio działającego w czasie rzeczywistym. Dwa ostatnie stwierdzenia można zweryfikować i są prawdziwe. Publiczna dokumentacja modeli Anthropic wymienia cztery aktualne modele i opisuje wszystkie cztery w ten sam sposób: dane wejściowe tekstowe i obrazowe, dane wyjściowe tekstowe.
• Termin — nie podano ani nie zasugerowano żadnej daty. „Brak informacji o terminie publicznej dostępności" – jak wynika z opracowania.
Istnieje precedens, który warto znać, bo działa w obie strony. Anthropic już wcześniej wypuszczało rzeczy pod banerem wersji zapoznawczej — linia Mythos ukazała się jako wersja zapoznawcza przed ogólnym dostępem — więc wewnętrzna etykieta Preview nie jest automatycznie fałszywym tropem. Ale Anthropic miało też przez miesiące w kodzie produkcyjnym niewdrożone flagi trybu głosowego: wyciek pakietu źródłowego Claude Code z kwietnia 2026 r. ujawnił zestaw niewydanych flag funkcji, w tym tryb głosowy, obok prac nad bridge i agentami działającymi w tle. Głos jest widocznie rozwijany w Anthropic od dobrego roku, a model głosowy się nie pojawił. Ta zakładka jest zgodna z tą historią i nie posuwa jej naprzód.
Opt-in to sygnał z datą.
Druga połowa wycieku jest bardziej solidna, ponieważ to zmiana dotycząca prywatności, a nie zrzut ekranu. Jak 5 października 2026 r. podało kilka mediów, Anthropic dodał opcjonalne ustawienie, które pozwala użytkownikom przekazywać nagrania głosowe i dane z czatów głosowych w celu ulepszania modeli. Treść monitu, zgodnie z doniesieniami, brzmi: „Pozwól nam używać Twoich danych głosowych do ulepszania naszych modeli AI”, a towarzyszący tekst głosi, że dane audio i dane z czatów głosowych pomagają ulepszać sposób, w jaki modele obsługują mowę. Podane szczegóły, wszystkie z tego samego zbioru relacji:
• Gdzie to się znajduje — w Ustawieniach Claude'a, w sekcji Prywatność, jako wyraźny przełącznik zgody.
• Domyślne ustawienie — wyłączone. Użytkownicy są pytani; nie są zapisywani.
• Jego zakres — oddzielony od istniejącego mechanizmu wyrażania zgody na rozmowy tekstowe, co jest szczegółem, który ma największe znaczenie.
• Odwracalność — można ją później wyłączyć, a dane głosowe usunąć w ustawieniach, zgodnie z zakresem ochrony.
Dlaczego odrębna zgoda ma znaczenie: gdyby cały potok głosowy był integracją zewnętrznego dostawcy, w której nie uczestniczy żaden model Anthropic, naturalne miejsce do scentralizowania zgody już by istniało. Wydzielanie odrębnego kanału danych głosowych to coś, co robi się, gdy zamierza się trenować na mowie — na potrzeby nowego modelu albo wyspecjalizowanej warstwy mowy wewnątrz istniejącego. To argument z zakresu bodźców, a nie dowodów, i tak właśnie należy go odczytywać. Uczciwa kontrinterpretacja jest taka, że firma obsługująca funkcję głosową na dużą skalę potrzebuje własnego korpusu ewaluacyjnego i własnej analizy błędów niezależnie od tego, kto dostarcza dźwięk, a zgoda opt-in zaprojektowana tak, by można ją było później wyłączyć, jest też najtańszym sposobem zachowania zgodności na czas podejmowania decyzji.
Jeszcze jeden element kontekstu, bo sprawia, że zmiana wygląda na ostrzejszą, niż jest w rzeczywistości. Własna dokumentacja prywatności Anthropic dotycząca produktów komercyjnych stwierdza bez ogródek, w artykule z 16 marca 2026 r., że „nie używamy Twojego głosu do trenowania naszych modeli” oraz że po transkrypcji mowy nagranie audio jest usuwane. Artykuł ten dotyczy Claude for Work, Anthropic API i podobnych komercyjnych usług. Nowy opt-in to ustawienie po stronie konsumenta. Oba te stwierdzenia mogą być prawdziwe jednocześnie — i dokładnie taki jest obraz firmy, która po jednej stronie biznesu buduje potok danych treningowych, a po drugiej dotrzymuje obietnicy umownej.

Anthropic od roku ma produkt głosowy, ale przez cały ten czas nie ma modelu głosowego.
To jest ta część, którą relacje o przeciekach zwykle pomijają, i to jest kontekst potrzebny, aby poprawnie odczytać tę zakładkę.
Tryb głosowy Claude został uruchomiony w maju 2025 r. jako funkcja rozmowy głosowej w aplikacjach mobilnych. Od początku był nakładką: modele językowe Anthropic odpowiadały za rozumowanie, a sama mowa pochodziła z innego źródła. Stos nigdy nie został ujawniony. Gdy TechCrunch relacjonował aktualizację trybu głosowego z 23 lipca 2026 r., zauważył zarówno, że „Anthropic nie wprowadził żadnych zmian w modelu głosowym w tym wydaniu”, jak i że firma „nie ujawniła, jakiego rodzaju stos głosowy wykorzystuje”. Doniesienia od 2025 r. wskazywały na ElevenLabs jako dostawcę mowy, co wywnioskowano w dużej mierze z ujawnień Anthropic dotyczących podprocesorów, a nie z czegokolwiek, co Anthropic potwierdził. Dostawcę należy traktować jako niezweryfikowanego.
Aktualizacja z lipca 2026 r. jest pouczająca ze względu na to, czego nie zawierała. Dodała wybór modelu — można było wybierać między Claude Opus, Claude Sonnet i Claude Haiku zamiast tylko Haiku — a także konektory do Gmaila, Calendar, Slacka, Canvy i Notiona, dłuższe rozmowy oraz obsługę wielu języków, która trafiła jako wersja beta. Każda z tych zmian znajduje się na etapie poprzedzającym audio. Audio się nie zmieniło.
Jaki jest dziś tryb głosowy, w oficjalnej dokumentacji pomocy Anthropic:
• Modele — „Tryb głosowy może używać tych samych modeli Claude, których używasz w czacie tekstowym” i „zaczyna od modelu, którego ostatnio użyłeś w czacie tekstowym”. Wskazano jeden wyjątek: Claude Fable nie jest dostępny w trybie głosowym.
• Dostępność — funkcja beta we wszystkich planach, od Free po Enterprise, w Claude Mobile, Desktop i wersji internetowej, choć została zaprojektowana tak, aby działała najlepiej z telefonu.
• Głosy — „wstępnie ustawiony, ograniczony wybór”, wyraźnie po to, by zapobiec klonowaniu głosu lub podszywaniu się.
• Rozliczenia — rozmowy głosowe wliczają się do standardowych limitów Twojego planu. Nie ma osobnego licznika dla rozmów głosowych.
• Ograniczenia — dyktowanie istnieje w Claude Cowork i Claude Code, ale tryb głosowy nie.
• Języki — angielski oraz inne, przy czym zestaw języków innych niż angielski jest nadal oznaczony jako beta.
Każda z tych linii opisuje produkt owinięty wokół czyjejś mowy. Żadna z nich nie opisuje modelu mowy.
Trzy rzeczy, którymi może być zakładka Voice, i tylko jedna z nich jest modelem
Powodem, dla którego ten przeciek tak łatwo jest nadinterpretować, jest to, że wszystkie trzy prawdopodobne scenariusze wyglądają identycznie w pasku nawigacji.
• Zmiana interfejsu — dedykowany ekran głosowy, przycisk głosowy na pasku promptów, selektor głosu w ustawieniach. W lutym 2026 r. pojawiły się już doniesienia, że Anthropic przygotowuje coś takiego. Jeśli tylko na tym to polega, zakładka jest przeprojektowaniem, a bazowy stos audio pozostaje nietknięty.
• Podmiana dostawcy — ta sama architektura kaskadowa, inny dostawca mowy za nią. Niewidoczna z zewnątrz. To samo w sobie wyjaśniałoby zgodę na wykorzystanie danych treningowych, ponieważ nie można ocenić podmiany dostawcy bez audio, które wolno ci zachować.
• Natywny model mowy na mowę — Anthropic trenuje własny model audio i porzuca kaskadę. To kosztowna interpretacja, ta, która miałaby znaczenie dla każdego, kto buduje na Claude, i jedyna, która wymaga korpusu wypowiedzi objętych zgodą. To także interpretacja, której dowody jeszcze nie wspierają.
Karta nie potrafi ich rozróżnić. Zrobią to dwie kolejne rzeczy, które można sprawdzić: pojawienie się identyfikatora modelu audio na liście modeli Anthropic albo nowy wpis dotyczący mowy na jej stronie podprocesorów. Nie stało się ani jedno, ani drugie.
Gdzie nie ma Anthropic
Najczystszym sposobem, aby zobaczyć, jak daleko Anthropic jest od opanowania tej warstwy, jest spojrzenie na to, gdzie się nie pojawia, a następnie na to, co publikuje. Niezależne porównania mowy na mowę — Artificial Analysis prowadzi jedno obejmujące około czterdzieści modeli w zakresie rozumowania, dynamiki konwersacyjnej i wydajności agentowej — są zasilane przez natywne modele audio od Gemini 3.8 Live, GPT-Realtime-2 i GPT-Live-1, Qwen Audio 3.0 Realtime, Grok Voice Think Fast 2.0, StepAudio 3 Realtime, Nova 2.0 Sonic, NVIDIA, Kyutai i garść otwartych inicjatyw. Anthropic nie pojawia się nigdzie na tego typu liście. Osobny zestaw wpisów obejmuje kaskadowe potoki agentów głosowych — model zamiany mowy na tekst, LLM i model zamiany tekstu na mowę połączone razem — co jest architekturą, którą najbardziej przypomina własny tryb głosowy Anthropic. W przeciwieństwie do tego, dokumentacja modeli samego Anthropic jest jednoznaczna: cztery obecne modele, każdy z nich opisany w ten sam sposób — wejście tekstowe i obrazowe, wyjście tekstowe, bez żadnego identyfikatora modelu audio gdziekolwiek na stronie.

To nie jest krytyka produktu. To stwierdzenie o tym, gdzie dziś przechwytywana jest wartość, i wyjaśnia, dlaczego zakładka Voice jest w ogóle interesująca: mowa to jedyna modalność, w której każde inne czołowe laboratorium ma model własny, a Anthropic nie.
Co z tym zrobić w tym miesiącu, który niczym się nie różni
Praktyczny przekład tego wszystkiego jest taki, że dla dewelopera 4 października nic się nie zmieniło. Tryb głosowy to ten sam produkt, którym był w lipcu. Nie dodano ani nie wycofano żadnego identyfikatora modelu. Żadna cena się nie zmieniła. Jeśli dziś wdrażasz głos na Claude, wdrażasz kaskadę: model Claude do myślenia, osobny model do mówienia i klej pomiędzy nimi. Przeciek tego nie zmienia, a budowanie wokół zakładki z napisem Preview to sposób, w jaki zespoły kończą z zależnością w roadmapie od czyjejś wewnętrznej gałęzi.
To, za czym jednak przemawia, to utrzymanie wymienialności tej połowy stosu, która odpowiada za mowę, ponieważ to w kaskadzie naprawdę tkwi uzależnienie — nie w modelu Claude, który możesz wywołać skądkolwiek, lecz w kleju, który napisałeś do dostawcy mowy. Konkretnie, strona Claude już podlega routingowi: Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1 i Claude Haiku 4.5 znajdują się w katalogu OrcaRouter w cenie katalogowej Anthropic z marżą 0% — cena katalogowa dostawcy jest przekazywana dalej, więc jeśli Anthropic obniży cenę, u nas obowiązuje ona tego samego dnia — a modele zamiany tekstu na mowę, które byś z nimi łączył (m.in. podglądowe wersje TTS od Gemini, tts-1-hd), stoją za tym samym kluczem. Jeden endpoint dla obu połówek pipeline'u głosowego oznacza, że zmiana dostawcy to zmiana ciągu znaków modelu, a nie druga umowa, a automatyczne przełączanie awaryjne oznacza, że nieprzetestowana połowa twojego pipeline'u przechodzi na działający mechanizm zapasowy, zamiast doprowadzić do nieudanego połączenia.
Co by to faktycznie potwierdziło
Pomiń spekulacje i obserwuj cztery konkretne, sprawdzalne miejsca. Każde z nich to wydarzenie, które można opatrzyć datą, a każde z nich przenosi to z kategorii przecieku do wiadomości:
• Nowy wpis w dokumentacji modeli Anthropic lub na liście Models API z wejściem audio albo wyjściem audio. To jedyny artefakt, który dowodzi istnienia modelu mowy pierwszej strony.
• Dodatek dotyczący mowy na stronie podprocesorów Anthropic. To dowodzi czegoś przeciwnego — nowego zewnętrznego dostawcy, a nie modelu wewnętrznego.
• Zakładka Voice traci etykietę Preview w aplikacjach konsumenckich. To jest właśnie wdrożenie i moment, w którym funkcja staje się możliwa do oceny, a nie tylko do obserwacji.
• Wiersz cenowy. Anthropic wycenia to, co sprzedaje; cena za minutę mowy rozstrzygnęłaby kwestię architektury szybciej niż jakikolwiek benchmark.
Dopóki któraś z tych rzeczy nie zostanie wdrożona, trafne podsumowanie października 2026 r. brzmi tak: Anthropic buduje interfejs głosowy, po raz pierwszy zbiera za zgodą dane mowy i wciąż nie wypuściło żadnego modelu mowy. Zakładka to najmniej pouczający z tych trzech faktów i ta, która rozprzestrzeniła się najdalej.

Otwartym pytaniem nie jest to, czy Anthropic chce lepszego doświadczenia głosowego — odpowiada na to sam opt-in. Jest nim to, czy „lepszy głos” w Anthropic oznacza model, który sam posiada, czy dostawcę, którym zarządza staranniej. Te dwie ścieżki przez pewien czas wyglądają z zewnątrz tak samo, a potem nie wyglądają już wcale podobnie.
