Tarjeta de título principal encabezada por «Claude Voice: una pestaña Preview oculta» con el subtítulo «Qué está confirmado, qué se reporta, qué sigue siendo inferencia», y tres tarjetas que dicen «Detectado: un elemento Voice independiente en la navegación web de Claude, etiquetado como Preview, reportado el 4 de octubre de 2026», «No lanzado: sin modelo de voz, sin tarjeta de modelo, sin entrada de API, sin precio» y «Fechable: aceptación voluntaria del consumidor para compartir datos de voz para el entrenamiento del modelo, reportado el 5 de octubre de 2026», con un pie de página que cita reportes sobre el elemento de navegación visible y la documentación de ayuda de Anthropic leída el 11 de octubre de 2026, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

Filtración de Claude Voice: una pestaña "Preview" oculta en la app de Claude y la opción de participación de voz que llegó junto a ella

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En algún momento antes del 4 de octubre de 2026, apareció en la interfaz web de Claude un elemento de navegación que aún no debería haber sido visible: una pestaña Voice separada con una etiqueta interna Preview. No hay anuncio al respecto, ni ficha de modelo, ni fila de precios, ni entrada de API, ni fecha. En la misma franja temporal —informado el 5 de octubre— el proveedor añadió discretamente algo más que no ha publicitado: una opción de participación voluntaria del consumidor que permite a los usuarios entregar grabaciones de voz y datos de chat de voz "para mejorar nuestros modelos de IA", independiente del consentimiento que ya solicita para las conversaciones de texto. La línea de productos actual sigue siendo de cuatro modelos de salida de texto — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 y Claude Haiku 5.5 — y nunca ha lanzado un modelo de voz propio. Así que la pregunta útil que plantea esta filtración no es "¿está la empresa lanzando un modelo de voz?". Es más concreta: la pestaña demuestra que se está construyendo una interfaz, y la opción de participación es la primera evidencia sólida de que la empresa quiere datos de entrenamiento de voz. Son dos afirmaciones diferentes, y solo la segunda es fechable.

Todo lo que sigue está clasificado en lo confirmado, lo reportado y no verificado, y lo que es inferencia. Anthropic no ha dicho absolutamente nada sobre la pestaña, lo que significa que la fuente del hecho central es una captura de pantalla y no un comunicado de prensa.

Lo que realmente se avistó, y lo que no nos dice

El hallazgo proviene de @testingcatalog en X, publicado el 4 de octubre de 2026, y reseñado en el mismo medio el 10 de octubre. En palabras de la reseña, "un elemento Voice independiente ha aparecido en la navegación web de Claude con una etiqueta interna Preview", y "sus capacidades y disponibilidad pública siguen siendo desconocidas". Esa es toda la evidencia directa. El informe enmarca explícitamente la etiqueta como algo que apunta a un entorno de vista previa interna en lugar de a un despliegue.

Tres cosas se derivan del artefacto, y ninguna de ellas es una especificación:

• El alcance — una etiqueta de vista previa interna indica que existe una compilación en algún lugar dentro de Anthropic. No dice que la compilación contenga un nuevo modelo. Una pestaña de navegación es interfaz de usuario.

• El proveedor — el informe señala que Anthropic “no ha confirmado el proveedor de voz subyacente”, no ha lanzado modelos dedicados de conversión de texto a voz a través de su API y no ha lanzado un modelo nativo de audio en tiempo real de extremo a extremo. Las dos últimas son verificables y verdaderas. La documentación pública de modelos de Anthropic enumera cuatro modelos actuales y describe los cuatro de la misma manera: entrada de texto e imagen, salida de texto.

• El momento — no se ha reportado ni insinuado ninguna fecha. "No hay información sobre el momento de disponibilidad pública", según el artículo.

Hay un precedente que conviene conocer, porque tiene doble filo. Anthropic ya ha lanzado cosas bajo un banner de vista previa antes —la línea Mythos salió como preview antes del acceso general—, así que una etiqueta Preview interna no es automáticamente una pista falsa. Pero Anthropic también ha tenido flags de modo de voz sin lanzar en el código de producción durante meses: una filtración de abril de 2026 del paquete de código fuente de Claude Code sacó a la luz un conjunto de flags de funciones no lanzadas, incluido un modo de voz, junto con trabajo en bridge y agentes en segundo plano. El modo de voz ha estado visiblemente en progreso en Anthropic durante más de un año sin que aparezca un modelo de voz. La pestaña concuerda con esa historia y no la hace avanzar.

El opt-in es la señal que lleva fecha.

La segunda mitad de la filtración es más sólida, porque se trata de un cambio de privacidad y no de una captura de pantalla. Según lo reportado el 5 de octubre de 2026 por varios medios, Anthropic añadió un ajuste opcional que permite a los usuarios aportar grabaciones de voz y datos de chat de voz para mejorar los modelos. El texto del aviso, según lo reportado, es «Permítenos usar tus datos de voz para mejorar nuestros modelos de IA», con un texto acompañante que indica que los datos de audio y de chat de voz ayudan a mejorar la forma en que los modelos manejan el habla. Los detalles reportados, todos del mismo grupo de cobertura informativa:

• Dónde se encuentra — en la Configuración de Claude, bajo Privacidad, mostrado como un interruptor de consentimiento explícito.

• Su valor predeterminado: desactivado. Se les pregunta a los usuarios; no se les inscribe.

• Su alcance — independiente del mecanismo de consentimiento existente para las conversaciones de texto, que es el detalle que más importa.

• Reversibilidad — se puede desactivar después y eliminar los datos de voz desde los ajustes, según la cobertura.

Por qué importa el consentimiento separado: si todo el pipeline de voz fuera una integración de proveedor sin ningún modelo de Anthropic involucrado, el lugar natural para consolidar el consentimiento ya existiría. Separar un canal distinto de datos de voz es lo que se hace cuando se pretende entrenar con habla —para un modelo nuevo o para una capa de voz especializada dentro de uno existente—. Ese es un argumento basado en incentivos, no en evidencia, y debería leerse así. La lectura contraria honesta es que una empresa que opera una función de voz a escala necesita su propio corpus de evaluación y su propio análisis de fallos, sin importar quién proporcione el audio, y un opt-in diseñado para desactivarse más adelante también es la forma más barata de cumplir mientras se decide.

Un contexto más, porque hace que el cambio parezca más tajante de lo que es. La propia documentación de privacidad de Anthropic para productos comerciales afirma sin rodeos, en un artículo fechado el 16 de marzo de 2026, que «no usamos su voz para entrenar nuestros modelos» y que, una vez transcrito el habla, se elimina la grabación de audio. Ese artículo está limitado a Claude for Work, la API de Anthropic y superficies comerciales similares. La nueva opción de adhesión es una configuración del lado del consumidor. Ambas afirmaciones pueden ser ciertas a la vez, y esa es precisamente la forma que tiene una empresa de montar una canalización de datos de entrenamiento en un lado del negocio mientras mantiene la promesa contractual en el otro.

A single-column scoreboard titled 'Claude Voice - what is actually established' with six rows reading 'First-party speech model: none shipped', 'Underlying voice provider: not disclosed', 'Voice mode status: beta, all plans', 'Models in voice mode: same as text chat, Claude Fable excluded', 'Voice data for training: new consumer opt-in, off by default' and 'Speech-to-speech leaderboards: Anthropic absent', with a footer noting the provider is unconfirmed.

Anthropic ha tenido un producto de voz durante un año y ningún modelo de voz durante todo ese tiempo

Esta es la parte que la cobertura de filtraciones suele omitir, y es el contexto que necesitas para leer la pestaña correctamente.

El modo de voz de Claude se lanzó en mayo de 2025 como una función de conversación hablada en las aplicaciones móviles. Desde el principio fue un envoltorio: los modelos de lenguaje de Anthropic se encargaban del razonamiento, y el habla en sí provenía de otro lugar. El stack nunca se ha divulgado. Cuando TechCrunch cubrió la actualización del modo de voz del 23 de julio de 2026, señaló tanto que «Anthropic no hizo ningún cambio en el modelo de voz con esta versión» como que la compañía «no ha detallado qué tipo de stack de voz utiliza». Los informes desde 2025 han apuntado a ElevenLabs como el proveedor de voz, inferido en gran medida de las divulgaciones de subencargados de Anthropic, más que de algo que Anthropic haya confirmado. Trata al proveedor como no verificado.

La actualización de julio destacó por lo que no incluyó. Añadió la opción de elegir modelo —se podía elegir entre Claude y Claude Haiku—, además de Gmail, Calendar, Slack y Miro, conversaciones más largas y soporte multilingüe que se lanzó como beta. Todos y cada uno de esos cambios. El audio no se movió.

¿Qué modo de voz hay hoy, en la propia documentación de ayuda de Anthropic:

• Los modelos — El modo de voz puede usar los mismos modelos de Claude que usas en el chat de texto, y "comienza con el modelo que usaste por última vez en el chat de texto". Una excepción es que Claude Fable no está disponible en el modo de voz.

• La disponibilidad: una función beta en todos los planes, desde Free hasta Enterprise, en Claude Mobile, Desktop y web, aunque está diseñada para funcionar mejor desde un teléfono.

• Las voces — «una selección predefinida y limitada», explícitamente para evitar la clonación de voz o la suplantación de identidad.

• La facturación — las conversaciones de voz cuentan contra los límites normales de tu plan. No hay un medidor de voz por separado.

• Los límites — el dictado existe en Claude Cowork y Claude Code, pero el modo de voz no.

• Los idiomas — inglés y otros, con el conjunto de idiomas distintos del inglés todavía etiquetado como beta.

Cada una de esas líneas describe un producto construido alrededor del habla de otra persona. Ninguna de ellas describe un modelo de habla.

Tres cosas que podría ser una pestaña de Voz, y solo una de ellas es un modelo

La razón por la que es fácil sobreinterpretar esta filtración es que los tres futuros plausibles se ven idénticos en una barra de navegación.

• Un cambio en la interfaz: una pantalla de voz dedicada, un botón de voz en la barra de solicitudes, un selector de voz en los ajustes. Ya se informó en febrero de 2026 de que Anthropic estaba preparando algo así. Si eso es todo lo que hay, la pestaña es un rediseño y la pila de audio subyacente permanece intacta.

• Un cambio de proveedor — la misma arquitectura en cascada, un proveedor de voz diferente detrás. Invisible desde fuera. Esto explicaría por sí solo una opción de participación en datos de entrenamiento, porque no se puede evaluar un cambio de proveedor sin audio que tengas permitido conservar.

• Un modelo nativo de voz a voz — Anthropic entrena su propio modelo de audio y abandona la cascada. Esta es la interpretación costosa, la que le importaría a cualquiera que construya sobre Claude, y la única que necesita un corpus de voz con consentimiento. También es la interpretación que las pruebas aún no respaldan.

La pestaña no puede distinguir entre ellos. Las dos próximas cosas verificables sí podrán: un ID de modelo de audio que aparezca en la lista de modelos de Anthropic, o una nueva entrada de voz en su página de subprocesadores. Ninguna de las dos ha ocurrido.

Donde Anthropic no está

La forma más clara de ver lo lejos que está Anthropic de dominar esta capa es fijarse en dónde no aparece y, luego, en lo que sí publica. Las comparativas independientes de voz a voz —Artificial Analysis mantiene una que abarca unos cuarenta modelos en razonamiento, dinámica conversacional y rendimiento agéntico— están compuestas por modelos de audio nativos de Gemini 3.8 Live, GPT-Realtime-2 y GPT-Live-1, Qwen Audio 3.0 Realtime, Grok Voice Think Fast 2.0, StepAudio 3 Realtime, Nova 2.0 Sonic, NVIDIA, Kyutai y un puñado de iniciativas abiertas. Anthropic no aparece en absoluto en ese tipo de lista. Otro conjunto de entradas cubre las canalizaciones en cascada de agentes de voz —un modelo de voz a texto, un LLM y un modelo de texto a voz conectados entre sí—, que es la arquitectura a la que más se parece el propio modo de voz de Anthropic. Frente a eso, la documentación de modelos de la propia Anthropic no deja lugar a dudas: cuatro modelos actuales, todos ellos descritos de la misma manera —entrada de texto e imagen, salida de texto—, sin ningún ID de modelo de audio en ninguna parte de la página.

Screenshot of the OrcaRouter model catalogue, showing the Models listing with 208 models across 16 providers on one API key, the Text / Image / Embeddings / Video / TTS modality filters, an OpenAI-compatible code sample for calling a model, and model cards including Anthropic Claude Sonnet 5.5.

Eso no es una crítica al producto. Es una afirmación sobre dónde se está capturando el valor hoy, y explica por qué una pestaña Voice es interesante en primer lugar: el habla es la única modalidad en la que todos los demás laboratorios de frontera tienen un modelo propio y Anthropic no.

Qué hacer al respecto este mes, que no es nada diferente

La traducción práctica de todo esto es que nada cambió para un desarrollador el 4 de octubre. El modo de voz es el mismo producto que era en julio. No se añadió ni se retiró ningún ID de modelo. Ningún precio cambió. Si hoy lanzas voz en Claude, estás lanzando una cascada: un modelo Claude para el pensamiento, un modelo aparte para el habla y pegamento entre medias. La filtración no altera eso, y construir alrededor de una pestaña que dice Preview es como los equipos acaban con una dependencia en su hoja de ruta respecto a la rama interna de alguien.

Lo que sí defiende es mantener intercambiable la mitad del stack correspondiente al habla, porque la cascada es donde reside realmente el lock-in —no en el modelo de Claude, al que puedes llamar desde cualquier sitio, sino en el glue que escribiste para el proveedor de voz. En concreto, el lado de Claude ya es enrutable: Claude Opus 5.5, Claude Sonnet 5.5, Claude Fable 5.1 y Claude Haiku 4.5 están en el catálogo de OrcaRouter al precio de lista de Anthropic con un 0 % de recargo — el precio de lista del proveedor se traslada tal cual, así que si Anthropic baja un precio, está activo en nuestro lado el mismo día — y los modelos de texto a voz que emparejarías con ellos (las previews de TTS de Gemini, tts-1-hd, entre otros) están detrás de la misma clave. Un único endpoint para ambas mitades de un pipeline de voz significa que cambiar de proveedor es un cambio de cadena de modelo en lugar de un segundo contrato, y la conmutación por error automática hace que la mitad no probada de tu pipeline degrade a un respaldo funcional en lugar de fallar la llamada.

¿Qué lo confirmaría realmente?

Deja de lado la especulación y presta atención a cuatro puntos concretos y verificables. Cada uno es un evento que se puede fechar, y cualquiera de ellos hace que esto pase de ser una filtración a ser noticia:

• Una nueva entrada en la documentación de modelos de Anthropic o en la lista de la API de Models con entrada de audio o salida de audio. Ese es el único artefacto que demuestra que existe un modelo de voz propio.

• Una adición relacionada con el habla a la página de subencargados de Anthropic. Eso demuestra lo contrario: un nuevo proveedor externo en lugar de un modelo interno.

• La pestaña Voice pierde su etiqueta Preview en las aplicaciones para consumidores. Ese es el despliegue, y es el momento en que la función se vuelve revisable en lugar de observable.

• Una polémica de precios. Anthropic fija el precio de lo que vende; un precio por minuto de voz resolvería la cuestión de la arquitectura más rápido que cualquier benchmark.

Hasta que uno de esos se materialice, el resumen preciso de octubre de 2026 es este: Anthropic está construyendo una interfaz de voz, está recopilando datos de voz con consentimiento por primera vez, y todavía no ha lanzado nunca un modelo de voz. La pestaña es el menos informativo de esos tres hechos y el que más lejos llegó.

Screenshot of Anthropic's Claude Platform models overview page listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with their model IDs and pricing, alongside the line 'All current models support text and image input, text output, multilingual capabilities, vision, and tool use.'

La pregunta que queda abierta no es si Anthropic quiere una mejor experiencia de voz: la opción de adhesión voluntaria responde eso. Es si “mejor voz” en Anthropic significa un modelo propio o un proveedor que gestiona con más cuidado. Esos dos caminos parecen iguales desde fuera durante un tiempo y, después, no se parecen en nada.