Una tarjeta de título principal para 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — la voz que escucha vs el rey de las arenas', con una tarjeta a la izquierda 'Cartesia Sonic 3.6 — Proveedor #1 · Elo 1.282 · $49 / 1M caracteres' y una tarjeta a la derecha 'Inworld Realtime TTS-2 — Controlado #1 · Elo 1.123 · $25 / 1M caracteres', un chip de estadística 'Coronas divididas — arenas de Proveedor vs Controlado', y el logotipo de OrcaRouter abajo a la derecha.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6: La voz que escucha contra el rey de las arenas

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay dos teorías contrapuestas sobre por qué una voz sintética se percibe como humana, y ahora mismo los dos mejores ejemplos comerciales de cada una son Inworld Realtime TTS-2 y Cartesia Sonic 3.6. La teoría de Cartesia es que la humanidad reside en el audio: haz que el timbre, la prosodia y el ritmo sean indistinguibles de los de una persona, y los oyentes te pondrán en primer lugar, que es lo que Sonic 3.6 hizo en agosto al saltar a la cima del Provider Voice arena de Artificial Analysis con un Elo de 1.282. La teoría de Inworld es que la humanidad reside en la escucha: TTS-2 condiciona su emisión al audio real de la conversación que la precede, de modo que no solo suena como una persona, sino que responde como tal. Esta semana las dos teorías chocaron en la clasificación: la misma repuntuación que colocó a Inworld Realtime TTS-2 en el puesto 2 del panel de proveedores, con un Elo de 1.252, también le dio el puesto 1 en el Controlled Voice arena — el panel que Cartesia había liderado — con 1.123 frente a los 1.119 de Sonic 3.6. Un modelo conserva la corona del panel de proveedores; el otro acaba de hacerse con la del Controlled Voice arena.

Este no es un enfrentamiento en el que un lado esté claramente equivocado. Los dos modelos fueron creados para tareas superpuestas pero no idénticas, y la diferencia de precio — Sonic 3.6 a $49.0 por millón de caracteres frente a $25 bajo demanda para Inworld Realtime TTS-2 — es lo suficientemente real como para que la decisión tenga un componente de presupuesto además de uno de calidad.

Dos teorías sobre una voz que suena humana

Cartesia lanzó Sonic 3.6 silenciosamente en agosto de 2026, una versión menor que mejoraba respecto a Sonic 3.5 sin cambiar el precio ni la narrativa de la arquitectura. La mejora apareció donde Cartesia la necesitaba: el modelo saltó a Elo 1.282 en el Provider Voice arena de Artificial Analysis — donde cada modelo usa sus propias voces nativas — y mantuvo el primer puesto del Controlled Voice arena durante todo agosto. En el marcador controlado, cada modelo se clona sobre los mismos ocho hablantes de referencia, por lo que esa corona es un veredicto sobre el propio motor de síntesis, independiente del talento vocal. Tras la nueva puntuación de disponibilidad general de Inworld esta semana, Cartesia sigue liderando el marcador de proveedores, pero Sonic 3.6 ahora ocupa el puesto #2 en el marcador controlado con Elo 1.119, cuatro puntos por detrás de Inworld Realtime TTS-2, que tiene 1.123.

Inworld Realtime TTS-2 viene de una tradición distinta. Su línea predecesora, TTS 1.5, se mantuvo a principios de 2026 cerca de la cima de los mismos escenarios, y la vista previa de investigación de TTS-2 registró un Elo de 1.209 en la tabla de proveedores en junio. El modelo GA ha subido desde entonces: en las tablas actuales se sitúa en 1.252 en Provider Voice (#2, detrás de Sonic 3.6, con 1.282) y en 1.123 en Controlled Voice (#1). El verdadero diferenciador del modelo insignia, sin embargo, no es su Elo; es que el modelo toma los turnos anteriores de una conversación como entrada de audio y deja que eso moldee cómo pronuncia la siguiente línea. Cartesia calibra la emoción a partir de la transcripción. Inworld escucha cómo se dijo lo último.

El marcador, etiquetado honestamente

Las cifras de Elo provienen de las arenas de voz de Artificial Analysis, leídas de los tableros en vivo en septiembre de 2026. Las cifras de latencia son las reportadas por el proveedor, salvo que se indique lo contrario, y no se ha publicado una auditoría de latencia independiente para ninguno de los dos modelos.

• Calidad independiente — Cartesia Sonic 3.6: Elo 1,282 (#1, Voz del proveedor) y 1,119 (#2, Voz controlada) frente a Inworld Realtime TTS-2: Elo 1,252 (#2, Voz del proveedor) y 1,123 (#1, Voz controlada)

• Precio por 1M de caracteres — $49.0 (según Artificial Analysis) frente a $25 bajo demanda, $20.8 combinado según Artificial Analysis, y hasta $12.50 por volumen (proveedor)

• Tiempo hasta el primer audio: menos de 90 ms (según el proveedor) frente a una mediana de menos de 200 ms y menos de 100 ms en el percentil 99 en las pruebas de lanzamiento de Inworld (según el proveedor); la respuesta de baja latencia de Inworld a Sonic es el nivel separado TTS-2 Flash, con ~25 ms de tiempo hasta el primer byte.

• Idiomas — 42 localizados vs. más de 100 idiomas para la orientación de la entrega, con la afirmación de voz-unificada de Inworld que se extiende a más de 200 configuraciones regionales (según el proveedor).

• Clonación instantánea de voz: aproximadamente 10 segundos de audio, frente a 5–15 segundos, además de una beta de clonación profesional que requiere unos 10 minutos de audio para generar clones de mayor fidelidad.

• Control de locución: etiquetas de transcripción integradas como [risa] y modulación de volumen y velocidad, frente al control mediante lenguaje natural como «[tranquilo, reconfortante]» o [susurro]; instrucciones a nivel de solicitud; y tres modos de estabilidad, desde Stable hasta Expressive.

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Por qué "escuchar la conversación" es un eje diferente Escuchar es fundamentalmente distinto de leer. La inferencia de un LLM se basa en tokens, no en audio. {{1}}Convertir una conversación completa en texto sin procesar{{/1}} hace que el contexto sea enormemente más largo{{2}} e introduce errores de transcripción, inflexiones perdidas y una profundidad semántica reducida{{/2}} — en esencia, degrada la señal antes de que el LLM siquiera la vea. {{3}}La comprensión del habla requiere procesar el audio como una señal de alta dimensión{{/3}}, no simplemente transcribirlo, y hacerlo bien exige un modelo de audio dedicado que{{4}} pueda manejar los matices de la conversación que el texto sin formato no puede capturar. {{KEEP}}Listen{{/KEEP}} no es una característica de transcripción; es un eje de modelo porque cambia qué información se retiene y cómo el LLM la procesa. En la práctica, {{5}}los modelos con un eje de audio dedicado superan consistentemente a los pipelines de transcripción{{/5}} en benchmarks conversacionales, incluso cuando las transcripciones son casi perfectas. {{6}}Esa brecha de rendimiento no se reduce con mejores modelos de transcripción{{/6}}, porque el problema no está en las palabras — está en el marco. La distinción importa en ambas direcciones. Así como los LLMs multimodales no son simplemente "traductores de imágenes a texto", un eje de escucha no es un "transcriptor de voz a texto". {{7}}La implementación puede usar componentes de ASR para el preprocesamiento{{/7}}, pero el producto final es diferente: interacción en tiempo real, memoria de conversación a largo plazo y {{8}}comprensión que escala con el audio, no a pesar de él.{{/8}} {{9}}Tratar "escuchar" como una función de transcripción oculta un problema de diseño fundamental: piensas en la entrada en lugar de en el modelo.{{/9}} Esa es la diferencia entre añadir una característica y construir un eje diferente.

El marcador anterior mide cómo suena una voz de forma aislada. La dimensión en la que los dos modelos realmente divergen no aparece en ninguna tabla de clasificación, porque solo existe a lo largo de múltiples turnos.

Inworld Realtime TTS-2 está diseñado para el caso en el que una persona acaba de decirle algo. El modelo ingiere el audio de turnos anteriores —no solo una transcripción de estos—, razona sobre el tono, el ritmo y el estado emocional, y selecciona un estado de respuesta antes de hablar. Si la persona que llama está frustrada, el modo de hablar cambia; si está relajada, vuelve a su tono normal. Por eso Inworld comercializa el modelo para agentes, acompañantes y juegos, más que para narración: la función no tiene sentido en una llamada única de texto a audio, pero sí lo tiene en una conversación.

Cartesia Sonic 3.6 funciona de manera diferente. Es un motor de streaming rápido y de alta calidad, y la propia afirmación de Cartesia es que tiene calibración emocional automática a partir de la transcripción: lee las palabras y modula en consecuencia. Lo que no hace es escuchar el audio de las intervenciones anteriores. Dentro de una sola emisión, los dos pueden sonar comparables; a lo largo de una conversación, Inworld está modelando algo que Sonic no intenta. Si tu producto es una locución de un solo turno, ese modelado es un gasto innecesario. Si es un agente en vivo, es el producto.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Velocidad, precio y la advertencia sobre Flash.

En cuanto a latencia pura, Cartesia ha tenido el derecho a presumir: el tiempo hasta el primer audio inferior a 90 ms es una cifra declarada por el proveedor, pero es la cifra que la compañía ha ofrecido desde la generación Sonic 3, y nadie ha publicado una auditoría que la contradiga. El buque insignia de Inworld responde en una clase conversacional similar con menos de 200 ms, lo cual es adecuado para agentes en vivo. La verdadera apuesta de Inworld en latencia es el nivel Flash, lanzado junto con el modelo GA: un modelo separado con un tiempo hasta el primer byte de ~25 ms, orientado a cargas de trabajo de alto volumen donde el costo y la latencia de clase Sonic importan más que la expresividad. La salvedad es que Flash es un miembro reducido de la familia: clonación instantánea y no verbales integrados, pero sin clonación profesional ni control completo en lenguaje natural.

Los recortes de precios van en la otra dirección. Sonic 3.6 cuesta $49.0 por millón de caracteres — aproximadamente el doble de la tarifa bajo demanda de $25 de Inworld, y casi cuatro veces el nivel superior de $12.50. La brecha de calidad entre ambos, en las tablas donde aparecen los dos, no justifica ese múltiplo para un comprador de alto volumen. Para un agente de voz en tiempo real que genera miles de caracteres por conversación, la diferencia por carácter es la diferencia entre una economía unitaria saludable y una muy ajustada.

¿Cuál elegir?

Elige Cartesia Sonic 3.6 si lo que quieres es la corona del ranking de proveedores — la voz mejor puntuada entre las que usan sus propias voces nativas, Elo 1,282, para frases breves y autocontenidas como respuestas de asistente, líneas de juego y lecturas de estado. A 49 dólares por millón de caracteres pagas por la corona, y sigue siendo el modelo a batir en esa tabla.

Elige Inworld Realtime TTS-2 si el producto es una conversación de varios turnos donde la voz debe responder a la persona al otro lado — llamadas de soporte, un acompañante, una entrevista, una sesión de tutoría. Ahora lidera la tabla controlada, donde cada modelo habla las mismas ocho voces de referencia, y lo hace por aproximadamente la mitad del precio mientras escucha el audio de la conversación.

Integra la conmutación en el enrutamiento si no puedes saber de antemano qué tipo de voz necesita una llamada. Ninguno de los dos modelos está en OrcaRouter al momento de escribir esto: a Sonic se accede a través de la API propia de Cartesia y de varias plataformas de terceros, y a Inworld a través de su propia API; pero una capa de enrutamiento es exactamente la estructura que permite que una conversación comience con una voz y pase a la otra en caso de fallo, con el precio de lista de cada proveedor trasladado con un margen del 0 %. El día en que una de estas tablas de clasificación vuelva a cambiar — y esta semana así fue — la decisión se convierte en un cambio de configuración, no en una reescritura.

La versión corta

Esto es una bifurcación real, y la respuesta honesta es que la bifurcación se trata de la alternancia de turnos, no de la calidad del audio. Si necesitas la voz independiente con mejor puntuación que use sus propias voces nativas, Cartesia Sonic 3.6 ostenta la corona entre los proveedores con un Elo de 1.282 y cobra 49 dólares por millón de caracteres. Si necesitas una voz que responda a cómo se le habla, Inworld Realtime TTS-2 salió a disponibilidad general esta semana a 25 dólares bajo demanda, lidera el panel controlado donde ambos se comparan con las mismas voces y ofrece una función de conciencia conversacional que ninguna arena mide por completo. Las tablas de clasificación quedan ahora divididas entre los dos modelos, lo cual es la imagen más honesta posible de un mercado donde «mejor» depende de la prueba.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.