
GPT-Live-1 vs Cartesia Sonic 3.6: El principal ranking de TTS no mide la interrupción
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Cartesia Sonic 3.6 lidera actualmente las dos arenas de texto a voz de Artificial Analysis: 1.275 Elo en la tabla Provider Voice y también el primer puesto en la tabla Controlled Voice, por delante de todos los motores comerciales que tienen una plataforma más grande a su alrededor. GPT-Live-1 no está clasificado en ninguna de las dos, porque no es un modelo de texto a voz. Ocupa el sexto puesto, empatado, de catorce en otra tabla de Artificial Analysis, el Speech to Speech Index, con un 70,3 %. Leídos juntos, esos dos hechos describen la verdadera división entre estos productos: es muy probable que Sonic 3.6 sea la mejor voz de las dos, y GPT-Live-1 es el único de los dos que puede oír al interlocutor empezar a hablar y detenerse.
Ambos están activos y ambos están disponibles comercialmente: Sonic 3.6 en la propia API de Cartesia desde que se publicó su instantánea estable el 27 de agosto de 2026, y GPT-Live-1 en la API para desarrolladores de OpenAI desde el 10 de septiembre de 2026, a $0.05 por minuto de voz. Elegir entre ellos no es una decisión de calidad. Es una decisión sobre qué mitad de un agente de voz estás comprando.
Dos arenas, dos preguntas y por qué la división es real
Artificial Analysis gestiona sus tableros de voz de una manera que vale la pena entender antes de que te citen cualquiera de los dos Elo. La arena Provider Voice clasifica los motores utilizando las voces nativas propias de cada proveedor — mide la voz que realmente obtienes de fábrica, que es el número que le importa a un comprador. La arena Controlled Voice clona cada modelo en las mismas ocho voces de referencia para que los oyentes comparen el motor de síntesis en lugar del talento vocal. Sonic 3.6 lidera ambos, lo cual es más raro de lo que parece: los dos tableros han tenido campeones diferentes durante la mayor parte de 2026.
Ninguno de los dos tableros contiene una sola muestra de un modelo siendo interrumpido. Miden cómo suena el habla, de forma aislada, para un oyente. El Speech to Speech Index se construye de manera diferente: pondera el razonamiento del habla, el rendimiento agéntico, la preferencia en la arena y el éxito en tareas en una sola cifra, y solo admite modelos que son nativamente de voz a voz. Cartesia no figura allí. No porque Sonic 3.6 sea malo, sino porque un motor de texto a voz no tiene nada que presentar.
Así que el 1.275 y el 70,3 % no son cifras que compitan entre sí, y cualquier comparación que las ponga en una misma línea te está mintiendo en silencio. Lo que ambas establecen en conjunto es que la calidad ha dejado de ser el eje sobre el que gira esta decisión.

Dimensión a dimensión
• Kind — GPT-Live-1: voz a voz dúplex completo, un solo modelo para todo el bucle frente a Cartesia Sonic 3.6: texto a voz en streaming, combinado con reconocimiento de voz Ink-2 para agentes
Calidad independiente — GPT-Live-1: 70,3 % en el Speech to Speech Index, empatado en el sexto puesto de catorce frente a Cartesia Sonic 3.6: 1.275 Elo en la tabla Provider Voice, a partir de 1.755 muestras, y también primero en la tabla Controlled Voice
• Manejo de interrupciones — GPT-Live-1: una propiedad del modelo, que decide muchas veces por segundo si ceder el turno frente a Cartesia Sonic 3.6: un patrón de integración, en el que el cliente cancela el contexto de síntesis y se basa en marcas de tiempo a nivel de palabra para cortar en el momento adecuado
• Precio — GPT-Live-1: $0.05 por minuto de voz, facturado por segundo, el backend de razonamiento se factura por separado frente a Cartesia Sonic 3.6: alrededor de $49 por millón de caracteres con planes de crédito, más $0.06 por minuto de duración de llamada del agente y $0.014 por minuto por un número de teléfono de Cartesia
• Latencia — GPT-Live-1: no se ha publicado ninguna cifra a nivel de modelo; la latencia de cambio de turno se indica como 0,798 segundos en las propias pruebas de OpenAI frente a Cartesia Sonic 3.6: menos de 90 milisegundos hasta el primer audio, según el proveedor y sin medición independiente de extremo a extremo
• Rendimiento — GPT-Live-1: sesiones concurrentes, limitadas a 25 en el nivel 1 y a 500 en el nivel 5, sin nivel gratuito, frente a Cartesia Sonic 3.6: aproximadamente 132 caracteres por segundo, casi el doble de la tasa de ElevenLabs v3 en la misma comparación, con un nivel gratuito de 20.000 créditos mensuales
• Idiomas — GPT-Live-1: fluidez desigual fuera de los idiomas principales en la cobertura de lanzamiento frente a Cartesia Sonic 3.6: 44 idiomas en 61 locales, con odiya y urdu añadidos en esta versión
• Control de voz — GPT-Live-1: doce preajustes, tono y ritmo mediante prompts, sin clonación, frente a Cartesia Sonic 3.6: más de 500 voces preajustadas, clonación instantánea, clonación profesional en niveles superiores, marcas de tiempo de palabras y fonemas, y sin SSML — el modelo adapta el ritmo a partir del propio texto

La interrupción es una característica de la arquitectura, no una casilla de verificación
Lo que los compradores más suelen malinterpretar en esta comparación es tratar el soporte de interrupción como un valor booleano. La documentación de Cartesia es franca sobre cómo funciona su versión: cuando quien llama habla por encima del agente, el cliente envía una cancelación para el contexto de síntesis actual, y las marcas de tiempo a nivel de palabra que se devuelven en la conexión WebSocket son lo que permite detener la reproducción en la sílaba correcta. Ese es un diseño competente y es así como la mayoría de los agentes de voz de producción manejan la interrupción hoy en día.
Sigue siendo un diseño en el que la decisión de dejar de hablar la tomaba tu aplicación, usando una señal de actividad de voz, con la latencia que permita el trayecto de ida y vuelta. GPT-Live-1 traslada esa decisión al interior del modelo. Está decidiendo continuamente si seguir escuchando, hacer una pausa, tomar el turno o cederlo, y por eso las propias cifras de OpenAI reportan un 80,1 % de interactividad frente a un 45,4 % de GPT-Realtime-2.1 en Full Duplex Bench v1.5, con una latencia de toma de turno de 0,798 segundos frente a 1,41. Esas cifras son de OpenAI, se publicaron con el lanzamiento y nadie fuera de la empresa las ha reproducido; pero la diferencia arquitectónica que hay detrás no está en disputa, y es lo único que una cascada no puede aproximar mediante ajustes.
Donde gana la cascada es en todo lo que viene después de la frase. El tiempo hasta el primer audio de menos de 90 milisegundos de Cartesia es una cifra del proveedor y mide el modelo, no la conversación: la cifra que experimenta la persona que llama también incluye el reconocimiento de voz, la detección de turno, el tiempo de generación del modelo de lenguaje, el tránsito por la red y el búfer de audio. Esa es exactamente la razón por la que vale la pena construir una cascada cuando necesitas controlar cada etapa: un modelo pequeño y rápido para turnos simples, un modelo de frontera para los difíciles y un sintetizador que nunca te haga esperar.
Esa etapa intermedia es la única parte de cualquiera de las dos pilas que es genuinamente portátil, y es la parte que decide tanto la calidad como el costo de la llamada. Aproximadamente 190 modelos de once proveedores upstream se encuentran detrás de una única clave de OrcaRouter al precio de lista del proveedor y sin ningún recargo, y el DSL de enrutamiento permite que un solo endpoint envíe turnos sencillos a un modelo barato y escale los complicados a un modelo de frontera —el patrón que un agente de voz realmente quiere, aplicado a la etapa que más varía. Ni Sonic 3.6 ni GPT-Live-1 son accesibles a través de una capa de enrutamiento; las capas de voz pertenecen a sus proveedores.

Manejando el dinero
Los dos modelos de precios no cuadran, así que vale la pena hacer bien la conversión. El habla fluye a unas 150 palabras por minuto, y el inglés promedia alrededor de cinco caracteres y medio por palabra, por lo que un minuto de salida hablada es de unos 800 a 900 caracteres. A $49 por millón de caracteres, la síntesis de Cartesia cuesta alrededor de cuatro centavos por minuto de audio.
Luego llega el resto de la cascada. Cartesia cobra $0.06 por minuto de duración de llamada del agente de voz y $0.014 por minuto si usas su número de teléfono, además de los caracteres. Añade reconocimiento de voz y un modelo de lenguaje para el texto, y ya superas los diez centavos por minuto antes de que nadie haya dicho nada difícil. Los $0.05 por minuto de voz de GPT-Live-1 cubren la escucha, la alternancia de turnos y el habla, con el razonamiento delegado facturado por separado a la tarifa normal del modelo de backend —lo que para una llamada de reserva con una búsqueda o dos asociadas es una cifra real, no un error de redondeo.
El punto de cruce se sitúa en el volumen y en la dificultad. Las llamadas cortas, repetitivas y de alto volumen —confirmaciones, notificaciones, consultas sencillas— favorecen la cascada, porque un modelo barato que responde a una pregunta predefinida es lo más económico de esta comparación. Las llamadas en las que el interlocutor se sale del guion, habla por encima del agente o cambia de opinión a mitad de frase favorecen el modelo de extremo a extremo, porque el modo de fallo de la cascada en esos casos no es una respuesta incorrecta, sino una incómoda.
¿Cuál elegir?
Elige Cartesia Sonic 3.6 si quieres la voz con mejor puntuación disponible y estás dispuesto a hacerte cargo tú mismo de la lógica de la conversación. Es la elección correcta para narración, para agentes con guion de alto volumen, para equipos con un pipeline de reconocimiento de voz ya existente y para cualquiera que necesite las marcas de tiempo a nivel de palabra que hacen posible un manejo preciso de las interrupciones. Obtienes un nivel gratuito, más de 500 voces, clonación, 44 idiomas y lo más alto de ambas tablas de calidad, y mantienes el control de cada etapa.
Elige GPT-Live-1 si la interrupción es el producto. Cualquier caso en el que ser interrumpido sea la norma en lugar de una excepción, y en el que un cambio de turno de 0,8 segundos supere a un inicio de 90 milisegundos en una frase que nadie había terminado de formular. Aceptas un modelo cerrado, alojado, por minuto, con doce voces y sin clonación, y aceptas que su puntuación de calidad independiente esté en la mitad de la tabla.
La tentación es leer 1.275 frente a 70,3 % y darlo por zanjado. No lo está, y la diferencia entre esas dos cifras es todo el argumento: una mide cómo suena una voz, la otra mide si merece la pena hablar con ella.
