Hero-titelkort med rubriken ”Claude Voice: en dold Preview-flik” och underrubriken ”Vad som är bekräftat, vad som rapporteras, vad som fortfarande är en slutledning”, och tre kort med texten ”Upptäckt: ett separat Voice-alternativ i Claudes webbnavigering, märkt Preview, rapporterat 4 oktober 2026”, ”Inte utsläppt: ingen talmodell, inget modellkort, ingen API-post, inget pris” och ”Daterbart: konsumenters opt-in för att dela röstdata för modellträning, rapporterat 5 oktober 2026”, med en sidfot som citerar rapportering om det synliga navigeringsobjektet och Anthropics hjälpdokumentation läst 11 oktober 2026, och OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Claude Voice-läcka: En dold "Preview"-flik i Claude-appen, och röstdata-opt-in:en som dök upp bredvid den

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Någon gång före den 4 oktober 2026 dök ett navigeringsobjekt som ännu inte borde ha varit synligt upp i Claudes webbgränssnitt: en separat Voice-flik med en intern Preview-etikett. Det finns inget meddelande om den, inget modellkort, ingen prisrad, ingen API-post och inget datum. Ungefär i samma tidsfönster – rapporterat den 5 oktober – lade leverantören tyst till något annat som den inte har offentliggjort: ett opt-in för konsumenter som låter användare lämna ifrån sig röstinspelningar och röstchattdata "för att förbättra våra AI-modeller", separat från det samtycke den redan begär för textkonversationer. Sortimentet som levereras består fortfarande av fyra modeller med textutdata – Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 och Claude Haiku 5.5 – och företaget har aldrig lanserat någon egen talmodell. Så den användbara frågan som den här läckan väcker är inte "lanserar företaget en röstmodell". Den är snävare: fliken bevisar att ett gränssnitt håller på att byggas, och opt-in-funktionen är det första konkreta beviset på att företaget vill ha träningsdata för tal. Det är två olika påståenden, och bara det andra går att datera.

Allt nedan är sorterat i sådant som är bekräftat, sådant som är rapporterat och obekräftat, och sådant som är slutsatser. Anthropic har inte sagt något alls om fliken, vilket innebär att källan till det centrala faktumet är en skärmbild och inte ett pressmeddelande.

Vad som faktiskt upptäcktes, och vad det inte säger oss

Fyndet kommer från @testingcatalog på X, publicerat den 4 oktober 2026, och skrevs om i samma kanal den 10 oktober. Med artikelns ord: "ett separat Voice-objekt har dykt upp i Claudes webbnavigering med en intern Preview-etikett", och "dess funktioner och offentliga tillgänglighet är fortfarande okända". Det är hela det direkta beviset. Rapporten beskriver uttryckligen etiketten som att den pekar på en intern förhandsvisningsmiljö snarare än en utrullning.

Tre saker följer av artefakten, och ingen av dem är en specifikation:

• Omfattningen – en intern förhandsgranskningsetikett säger att ett bygge finns någonstans inne i Anthropic. Den säger inte att bygget innehåller en ny modell. En navigeringsflik är UI.

• Leverantören – rapporten noterar att Anthropic "inte har bekräftat den underliggande röstleverantören", inte har släppt dedikerade text-till-tal-modeller via sitt API och inte har lanserat en nativ end-to-end-modell för realtidsljud. De två sista är kontrollerbara och sanna. Anthropics offentliga modelldokumentation listar fyra aktuella modeller och beskriver alla fyra på samma sätt: text- och bildinmatning, textutmatning.

• Tidsplanen — inget datum har rapporterats eller antytts. "Inget besked om tidsplanen för allmän tillgänglighet", enligt rapporten.

Det finns ett prejudikat värt att känna till, eftersom det kan slå åt båda hållen. Anthropic har tidigare släppt saker under en förhandsvisningsbanner – Mythos-serien släpptes som en förhandsvisning före allmän tillgång – så en intern Preview-etikett är inte automatiskt ett villospår. Men Anthropic har också haft röstlägesflaggor som legat osläppta i produktionskod i månader: en läcka i april 2026 av källkodspaketet för Claude Code avslöjade en uppsättning osläppta funktionsflaggor, inklusive ett röstläge, tillsammans med arbete med brygga och bakgrundsagent. Röst har varit synligt på gång hos Anthropic i väl över ett år utan att en röstmodell har dykt upp. Fliken stämmer överens med den historiken och för den inte framåt.

Opt-in är signalen som har ett datum på sig.

Den andra halvan av läckan är mer solid, eftersom det är en integritetsförändring snarare än en skärmdump. Rapporterat den 5 oktober 2026 av medier, lade Anthropic till en valfri inställning som låter användare bidra med röstinspelningar och röstchattdata för modellförbättring. Prompttexten enligt rapporten är "Tillåt oss att använda dina röstdata för att förbättra våra AI-modeller," med tillhörande språk som säger att ljud- och röstchattdata hjälper till att förbättra hur modellerna hanterar tal. Rapporterade detaljer, alla från samma kluster av bevakning:

• Var den finns — i Claudes inställningar, under Integritet, visas som en uttrycklig växlingsknapp för samtycke.

• Standardläget är av. Användare tillfrågas, de registreras inte automatiskt.

• Dess omfattning — separat från den befintliga samtyckesmekanismen för textkonversationer, vilket är den detalj som betyder mest.

• Reversibilitet – det kan stängas av i efterhand och röstdata kan raderas från inställningarna, enligt bevakningen.

Varför separat samtycke spelar roll: om hela röstpipelinen vore en leverantörsintegration utan någon Anthropic-modell inblandad, skulle den naturliga platsen att samla samtycke redan finnas. Att avskilja en separat kanal för röstdata är vad man gör när man avser att träna på tal — för en ny modell, eller för ett specialiserat tallager inuti en befintlig. Det är ett argument utifrån incitament, inte utifrån bevis, och det bör läsas så. Den ärliga motläsningen är att ett företag som driver en röstfunktion i stor skala behöver sin egen utvärderingskorpus och sin egen felanalys oavsett vem som levererar ljudet, och en opt-in som är designad för att stängas av senare är också det billigaste sättet att vara compliant medan man bestämmer sig.

Ytterligare en kontextupplysning, för den får förändringen att framstå som skarpare än den är. Anthropics egen integritetsdokumentation för kommersiella produkter säger rakt ut, i en artikel daterad den 16 mars 2026, att "vi använder inte din röst för att träna våra modeller" och att ljudinspelningen raderas efter att talet har transkriberats. Den artikeln gäller Claude for Work, Anthropic API och liknande kommersiella ytor. Den nya opt-in-funktionen är en inställning på konsumentsidan. Båda påståendena kan vara sanna samtidigt — och det är precis formen för ett företag som bygger upp en pipeline för träningsdata på ena sidan av verksamheten samtidigt som det håller det avtalsenliga löftet på den andra.

A single-column scoreboard titled 'Claude Voice - what is actually established' with six rows reading 'First-party speech model: none shipped', 'Underlying voice provider: not disclosed', 'Voice mode status: beta, all plans', 'Models in voice mode: same as text chat, Claude Fable excluded', 'Voice data for training: new consumer opt-in, off by default' and 'Speech-to-speech leaderboards: Anthropic absent', with a footer noting the provider is unconfirmed.

Anthropic har haft en röstprodukt i ett år och ingen röstmodell under någon del av den tiden.

Det här är delen som bevakningen av läckan tenderar att hoppa över, och det är sammanhanget du behöver för att läsa fliken korrekt.

Claudes röstläge lanserades i maj 2025 som en funktion för talad konversation i mobilapparna. Från början var det en wrapper: Anthropics språkmodeller skötte resonemanget, och själva talet kom från någon annanstans. Stacken har aldrig avslöjats. När TechCrunch rapporterade om uppgraderingen av röstläget den 23 juli 2026, påpekade man både att "Anthropic inte gjorde några ändringar i röstmodellen med den här versionen" och att företaget "inte har redogjort för vilken typ av röststack man använder". Rapportering sedan 2025 har pekat på ElevenLabs som röstleverantör, till stor del härlett från Anthropics upplysningar om underbiträden snarare än från något som Anthropic har bekräftat. Betrakta leverantören som obekräftad.

Uppgraderingen i juli 2026 är lärorik med tanke på vad den inte innehöll. Den lade till modellval – du kunde välja mellan Claude Opus, Claude Sonnet och Claude Haiku i stället för enbart Haiku – plus kopplingar till Gmail, Calendar, Slack, Canva och Notion, längre konversationer och flerspråkigt stöd som släpptes som beta. Var och en av dessa ändringar ligger uppströms ljudet. Ljudet stod still.

Vilket röstläge är det idag, i Anthropics egen hjälpdokumentation:

• Modellerna – "Röstläget kan använda samma Claude-modeller som du använder i textchatten", och det "börjar med den modell du senast använde i textchatten". Ett undantag: Claude Fable finns inte i röstläget.

• Tillgängligheten — en betafunktion på alla planer, från Free till Enterprise, i Claude Mobile, Desktop och webb, även om den är byggd för att fungera bäst från en telefon.

• Rösterna — "ett förinställt, begränsat urval", uttryckligen för att förhindra röstkloning eller imitering.

• Faktureringen – röstsamtal räknas mot dina vanliga abonnemangsgränser. Det finns ingen separat röstmätare.

• Begränsningarna — diktering finns i Claude Cowork och Claude Code, men röstläge gör det inte.

• Språken – engelska plus andra, där de icke-engelska fortfarande är märkta som beta.

Var och en av de där raderna beskriver en produkt som är uppbyggd kring någon annans tal. Ingen av dem beskriver en talmodell.

Tre saker en Voice-flik skulle kunna vara, och bara en av dem är en modell

Anledningen till att den här läckan är lätt att övertolka är att alla tre tänkbara framtider ser likadana ut i ett navigeringsfält.

• En gränssnittsändring – en dedikerad röstskärm, en röstknapp i promptfältet, en röstväljare i inställningarna. Anthropic rapporterades redan i februari 2026 förbereda något liknande. Om det är allt detta är, är fliken en omdesign och den underliggande ljudstacken är orörd.

• Ett leverantörsbyte – samma kaskadarkitektur, en annan talleverantör bakom. Osynligt utifrån. Det skulle i sig förklara ett opt-in för träningsdata, eftersom man inte kan utvärdera ett leverantörsbyte utan ljud som man får behålla.

• En nativ tal-till-tal-modell – Anthropic tränar sin egen ljudmodell och överger kaskaden. Detta är den dyra tolkningen, den som skulle spela roll för alla som bygger på Claude, och den enda som kräver en korpus av tal med samtycke. Det är också den tolkning som bevisen ännu inte stöder.

Fliken kan inte skilja dem åt. De nästa två kontrollerbara sakerna kommer att göra det: ett ljudmodell-ID som dyker upp i Anthropics modellista, eller en ny talpost på dess underbiträdessida. Inget av dem har inträffat.

Där Anthropic inte är

Det tydligaste sättet att se hur långt Anthropic är från att äga detta lager är att titta på var det inte förekommer, och sedan på vad det faktiskt publicerar. Oberoende tal-till-tal-jämförelser – Artificial Analysis har en som omfattar ungefär fyrtio modeller inom resonemang, samtalsdynamik och agentisk prestanda – fylls av nativa ljudmodeller från Gemini 3.8 Live, GPT-Realtime-2 och GPT-Live-1, Qwen Audio 3.0 Realtime, Grok Voice Think Fast 2.0, StepAudio 3 Realtime, Nova 2.0 Sonic, NVIDIA, Kyutai och en handfull öppna satsningar. Anthropic förekommer inte någonstans på den typen av lista. En separat uppsättning poster täcker kaskadkopplade röstagent-pipelines – en tal-till-text-modell, en LLM och en text-till-tal-modell som kopplats samman – vilket är den arkitektur som Anthropics eget röstläge mest liknar. I kontrast till detta är Anthropics egen modelldokumentation entydig: fyra aktuella modeller, alla beskrivs på samma sätt – text- och bildinmatning, textutmatning, och inget ljudmodell-ID finns någonstans på sidan.

Screenshot of the OrcaRouter model catalogue, showing the Models listing with 208 models across 16 providers on one API key, the Text / Image / Embeddings / Video / TTS modality filters, an OpenAI-compatible code sample for calling a model, and model cards including Anthropic Claude Sonnet 5.5.

Det är inte en kritik av produkten. Det är ett konstaterande om var värdet fångas upp i dag, och det förklarar varför en Voice-flik är intressant över huvud taget: tal är den enda modaliteten där alla andra frontier-labb har en förstapartsmodell och Anthropic inte har det.

Vad man ska göra åt det den här månaden, vilket inte är något annorlunda

Den praktiska innebörden av allt detta är att inget förändrades för en utvecklare den 4 oktober. Röstläget är samma produkt som det var i juli. Inget modell-ID lades till eller togs bort. Inget pris ändrades. Om du levererar röst på Claude i dag levererar du en kaskad: en Claude-modell för tänkandet, en separat modell för talandet och lim däremellan. Läckan ändrar inte det, och att bygga runt en flik där det står Preview är hur team till slut hamnar i ett färdplansberoende av någons interna gren.

Det den argumenterar för är att hålla tal-halvan av stacken utbytbar, eftersom det är i kaskaden inlåsningen faktiskt sitter — inte i Claude-modellen, som du kan anropa varifrån som helst, utan i limmet du skrev mot tal-leverantören. Konkret: Claude-sidan är redan routningsbar: Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1 och Claude Haiku 4.5 finns i OrcaRouter-katalogen till Anthropics listpris med 0 % påslag — leverantörens listpris förs vidare oförändrat, så om Anthropic sänker ett pris är det live hos oss samma dag — och de text-till-tal-modeller du skulle para ihop dem med (Geminis TTS-förhandsversioner, tts-1-hd, bland andra) finns bakom samma nyckel. En slutpunkt för båda halvorna av en röstpipeline innebär att ett leverantörsbyte blir en ändring av modellsträngen i stället för ett andra avtal, och automatisk redundansväxling innebär att den obeprövade halvan av din pipeline degraderas till en fungerande reserv i stället för att samtalet misslyckas.

Vad skulle faktiskt bekräfta det?

Hoppa över spekulationerna och håll koll på fyra specifika, kontrollerbara ställen. Var och en är en daterbar händelse, och vilken som helst av dem flyttar detta från läcka till nyhet:

• En ny post i Anthropics modelldokumentation eller i Models API-listan med ljudinmatning eller ljudutmatning. Det är den enda artefakten som bevisar att en förstaparts talmodell existerar.

• Ett röstrelaterat tillägg till Anthropics sida för underbiträden. Det bevisar motsatsen — en ny extern leverantör snarare än en intern modell.

• Fliken Voice förlorar sin förhandsgranskningsetikett i konsumentapparna. Det är utrullningen, och det är ögonblicket då funktionen blir granskningsbar snarare än observerbar.

• En prissättningsrad. Anthropic prissätter det de säljer; ett pris per minut för tal skulle avgöra arkitekturfrågan snabbare än något benchmark.

Till dess att ett av dem landar är den korrekta sammanfattningen av oktober 2026 följande: Anthropic bygger ett röstgränssnitt, samlar för första gången in taldata med samtycke och har fortfarande aldrig släppt en talmodell. Fliken är den minst informativa av dessa tre fakta och den som har färdats längst.

Screenshot of Anthropic's Claude Platform models overview page listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with their model IDs and pricing, alongside the line 'All current models support text and image input, text output, multilingual capabilities, vision, and tool use.'

Den öppna frågan är inte huruvida Anthropic vill ha en bättre röstupplevelse – det ger opt-in svaret på. Den är huruvida "bättre röst" hos Anthropic betyder en modell man äger eller en leverantör man hanterar mer noggrant. De två vägarna ser likadana ut utifrån sett ett tag, och sedan är de inte alls lika.