Tarjeta de título principal para «GPT-Live-1 vs Cartesia Sonic 3.6», con el subtítulo «La voz que mejor suena no es la que puede oírte», con tres tarjetas que dicen «Cartesia Sonic 3.6: 1.275 Elo, n.º 1 en ambas arenas de voz de Artificial Analysis», «GPT-Live-1: 70,3 % en el Speech to Speech Index, empatado en el 6.º puesto de 14», «Diferentes marcadores, porque miden cosas diferentes», encima de una franja de pie de página que dice «Cifras de las arenas según Artificial Analysis; cifras de interactividad de GPT-Live-1 reportadas por OpenAI». El logotipo de OrcaRouter está integrado en la esquina inferior derecha.
Guides & Insights

GPT-Live-1 vs Cartesia Sonic 3.6: El principal ranking de TTS no mide la interrupción

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Cartesia Sonic 3.6 lidera actualmente las dos arenas de texto a voz de Artificial Analysis: 1.275 Elo en la tabla Provider Voice y también el primer puesto en la tabla Controlled Voice, por delante de todos los motores comerciales que tienen una plataforma más grande a su alrededor. GPT-Live-1 no está clasificado en ninguna de las dos, porque no es un modelo de texto a voz. Ocupa el sexto puesto, empatado, de catorce en otra tabla de Artificial Analysis, el Speech to Speech Index, con un 70,3 %. Leídos juntos, esos dos hechos describen la verdadera división entre estos productos: es muy probable que Sonic 3.6 sea la mejor voz de las dos, y GPT-Live-1 es el único de los dos que puede oír al interlocutor empezar a hablar y detenerse.

Ambos están activos y ambos están disponibles comercialmente: Sonic 3.6 en la propia API de Cartesia desde que se publicó su instantánea estable el 27 de agosto de 2026, y GPT-Live-1 en la API para desarrolladores de OpenAI desde el 10 de septiembre de 2026, a $0.05 por minuto de voz. Elegir entre ellos no es una decisión de calidad. Es una decisión sobre qué mitad de un agente de voz estás comprando.

Dos arenas, dos preguntas y por qué la división es real

Artificial Analysis gestiona sus tableros de voz de una manera que vale la pena entender antes de que te citen cualquiera de los dos Elo. La arena Provider Voice clasifica los motores utilizando las voces nativas propias de cada proveedor — mide la voz que realmente obtienes de fábrica, que es el número que le importa a un comprador. La arena Controlled Voice clona cada modelo en las mismas ocho voces de referencia para que los oyentes comparen el motor de síntesis en lugar del talento vocal. Sonic 3.6 lidera ambos, lo cual es más raro de lo que parece: los dos tableros han tenido campeones diferentes durante la mayor parte de 2026.

Ninguno de los dos tableros contiene una sola muestra de un modelo siendo interrumpido. Miden cómo suena el habla, de forma aislada, para un oyente. El Speech to Speech Index se construye de manera diferente: pondera el razonamiento del habla, el rendimiento agéntico, la preferencia en la arena y el éxito en tareas en una sola cifra, y solo admite modelos que son nativamente de voz a voz. Cartesia no figura allí. No porque Sonic 3.6 sea malo, sino porque un motor de texto a voz no tiene nada que presentar.

Así que el 1.275 y el 70,3 % no son cifras que compitan entre sí, y cualquier comparación que las ponga en una misma línea te está mintiendo en silencio. Lo que ambas establecen en conjunto es que la calidad ha dejado de ser el eje sobre el que gira esta decisión.

A screenshot of the Artificial Analysis Speech to Speech Index chart, ranking fourteen natively speech-to-speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success. Bars run left to right: Grok Voice Think Fast 2.0 High at 79.0%, GPT-Realtime-2.1 High at 73.9%, GPT-Realtime-2 High at 73.6%, Grok Voice Think Fast 1.0 at 72.3%, Gemini 3.1 Flash Live High at 71.5%, GPT-Live-1 Mini and GPT-Live-1 level at 70.3%, then GPT-Realtime-2.1 Minimal at 68.5%, Qwen-Audio-Omni-3.0-Realtime-Plus at 66.8%, Qwen-Audio-Omni-3.0-Realtime-Flash at 64.2%, Gemini 3.1 Flash Live Minimal at 63.9%, GPT-Realtime-2 Minimal at 62.7% and Gemini 2.5 Flash at 52.8%. A companion panel charts cost per hour of input audio across the same field.

Dimensión a dimensión

• Kind — GPT-Live-1: voz a voz dúplex completo, un solo modelo para todo el bucle frente a Cartesia Sonic 3.6: texto a voz en streaming, combinado con reconocimiento de voz Ink-2 para agentes

Calidad independiente — GPT-Live-1: 70,3 % en el Speech to Speech Index, empatado en el sexto puesto de catorce frente a Cartesia Sonic 3.6: 1.275 Elo en la tabla Provider Voice, a partir de 1.755 muestras, y también primero en la tabla Controlled Voice

• Manejo de interrupciones — GPT-Live-1: una propiedad del modelo, que decide muchas veces por segundo si ceder el turno frente a Cartesia Sonic 3.6: un patrón de integración, en el que el cliente cancela el contexto de síntesis y se basa en marcas de tiempo a nivel de palabra para cortar en el momento adecuado

• Precio — GPT-Live-1: $0.05 por minuto de voz, facturado por segundo, el backend de razonamiento se factura por separado frente a Cartesia Sonic 3.6: alrededor de $49 por millón de caracteres con planes de crédito, más $0.06 por minuto de duración de llamada del agente y $0.014 por minuto por un número de teléfono de Cartesia

• Latencia — GPT-Live-1: no se ha publicado ninguna cifra a nivel de modelo; la latencia de cambio de turno se indica como 0,798 segundos en las propias pruebas de OpenAI frente a Cartesia Sonic 3.6: menos de 90 milisegundos hasta el primer audio, según el proveedor y sin medición independiente de extremo a extremo

• Rendimiento — GPT-Live-1: sesiones concurrentes, limitadas a 25 en el nivel 1 y a 500 en el nivel 5, sin nivel gratuito, frente a Cartesia Sonic 3.6: aproximadamente 132 caracteres por segundo, casi el doble de la tasa de ElevenLabs v3 en la misma comparación, con un nivel gratuito de 20.000 créditos mensuales

• Idiomas — GPT-Live-1: fluidez desigual fuera de los idiomas principales en la cobertura de lanzamiento frente a Cartesia Sonic 3.6: 44 idiomas en 61 locales, con odiya y urdu añadidos en esta versión

• Control de voz — GPT-Live-1: doce preajustes, tono y ritmo mediante prompts, sin clonación, frente a Cartesia Sonic 3.6: más de 500 voces preajustadas, clonación instantánea, clonación profesional en niveles superiores, marcas de tiempo de palabras y fonemas, y sin SSML — el modelo adapta el ritmo a partir del propio texto

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Cartesia Sonic 3.6 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Voices: 12 presets, no cloning'. The right column, labelled Cartesia Sonic 3.6, reads 'Kind: streaming text-to-speech', 'Price: ~$49 per 1M characters, plus $0.06 per agent minute', 'Time to first audio: under 90 ms, vendor-stated', 'Throughput: ~132 characters per second', 'Independent score: 1,275 Elo, #1 on the AA Provider Voice arena', 'Voices: 500+ presets, cloning, word timestamps'. The footer reads 'Sonic 3.6 latency vendor-stated; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

La interrupción es una característica de la arquitectura, no una casilla de verificación

Lo que los compradores más suelen malinterpretar en esta comparación es tratar el soporte de interrupción como un valor booleano. La documentación de Cartesia es franca sobre cómo funciona su versión: cuando quien llama habla por encima del agente, el cliente envía una cancelación para el contexto de síntesis actual, y las marcas de tiempo a nivel de palabra que se devuelven en la conexión WebSocket son lo que permite detener la reproducción en la sílaba correcta. Ese es un diseño competente y es así como la mayoría de los agentes de voz de producción manejan la interrupción hoy en día.

Sigue siendo un diseño en el que la decisión de dejar de hablar la tomaba tu aplicación, usando una señal de actividad de voz, con la latencia que permita el trayecto de ida y vuelta. GPT-Live-1 traslada esa decisión al interior del modelo. Está decidiendo continuamente si seguir escuchando, hacer una pausa, tomar el turno o cederlo, y por eso las propias cifras de OpenAI reportan un 80,1 % de interactividad frente a un 45,4 % de GPT-Realtime-2.1 en Full Duplex Bench v1.5, con una latencia de toma de turno de 0,798 segundos frente a 1,41. Esas cifras son de OpenAI, se publicaron con el lanzamiento y nadie fuera de la empresa las ha reproducido; pero la diferencia arquitectónica que hay detrás no está en disputa, y es lo único que una cascada no puede aproximar mediante ajustes.

Donde gana la cascada es en todo lo que viene después de la frase. El tiempo hasta el primer audio de menos de 90 milisegundos de Cartesia es una cifra del proveedor y mide el modelo, no la conversación: la cifra que experimenta la persona que llama también incluye el reconocimiento de voz, la detección de turno, el tiempo de generación del modelo de lenguaje, el tránsito por la red y el búfer de audio. Esa es exactamente la razón por la que vale la pena construir una cascada cuando necesitas controlar cada etapa: un modelo pequeño y rápido para turnos simples, un modelo de frontera para los difíciles y un sintetizador que nunca te haga esperar.

Esa etapa intermedia es la única parte de cualquiera de las dos pilas que es genuinamente portátil, y es la parte que decide tanto la calidad como el costo de la llamada. Aproximadamente 190 modelos de once proveedores upstream se encuentran detrás de una única clave de OrcaRouter al precio de lista del proveedor y sin ningún recargo, y el DSL de enrutamiento permite que un solo endpoint envíe turnos sencillos a un modelo barato y escale los complicados a un modelo de frontera —el patrón que un agente de voz realmente quiere, aplicado a la etapa que más varía. Ni Sonic 3.6 ni GPT-Live-1 son accesibles a través de una capa de enrutamiento; las capas de voz pertenecen a sus proveedores.

A screenshot of Cartesia's official Sonic 3.6 product page, showing the post title 'Introducing Sonic-3.6' dated Aug 27, 2026, the claim that listeners preferred it in up to 93% of blind head-to-head tests across fifteen locales, and the statement that Sonic-3.6 'takes #1 on the Artificial Analysis leaderboard across both the controlled and provider voice boards'. Below it, an embedded Controlled Voice leaderboard lists Sonic 3.6 first ahead of Sonic 3.5, Eleven v3, StepAudio 2.5 and Realtime TTS 1.5.

Manejando el dinero

Los dos modelos de precios no cuadran, así que vale la pena hacer bien la conversión. El habla fluye a unas 150 palabras por minuto, y el inglés promedia alrededor de cinco caracteres y medio por palabra, por lo que un minuto de salida hablada es de unos 800 a 900 caracteres. A $49 por millón de caracteres, la síntesis de Cartesia cuesta alrededor de cuatro centavos por minuto de audio.

Luego llega el resto de la cascada. Cartesia cobra $0.06 por minuto de duración de llamada del agente de voz y $0.014 por minuto si usas su número de teléfono, además de los caracteres. Añade reconocimiento de voz y un modelo de lenguaje para el texto, y ya superas los diez centavos por minuto antes de que nadie haya dicho nada difícil. Los $0.05 por minuto de voz de GPT-Live-1 cubren la escucha, la alternancia de turnos y el habla, con el razonamiento delegado facturado por separado a la tarifa normal del modelo de backend —lo que para una llamada de reserva con una búsqueda o dos asociadas es una cifra real, no un error de redondeo.

El punto de cruce se sitúa en el volumen y en la dificultad. Las llamadas cortas, repetitivas y de alto volumen —confirmaciones, notificaciones, consultas sencillas— favorecen la cascada, porque un modelo barato que responde a una pregunta predefinida es lo más económico de esta comparación. Las llamadas en las que el interlocutor se sale del guion, habla por encima del agente o cambia de opinión a mitad de frase favorecen el modelo de extremo a extremo, porque el modo de fallo de la cascada en esos casos no es una respuesta incorrecta, sino una incómoda.

¿Cuál elegir?

Elige Cartesia Sonic 3.6 si quieres la voz con mejor puntuación disponible y estás dispuesto a hacerte cargo tú mismo de la lógica de la conversación. Es la elección correcta para narración, para agentes con guion de alto volumen, para equipos con un pipeline de reconocimiento de voz ya existente y para cualquiera que necesite las marcas de tiempo a nivel de palabra que hacen posible un manejo preciso de las interrupciones. Obtienes un nivel gratuito, más de 500 voces, clonación, 44 idiomas y lo más alto de ambas tablas de calidad, y mantienes el control de cada etapa.

Elige GPT-Live-1 si la interrupción es el producto. Cualquier caso en el que ser interrumpido sea la norma en lugar de una excepción, y en el que un cambio de turno de 0,8 segundos supere a un inicio de 90 milisegundos en una frase que nadie había terminado de formular. Aceptas un modelo cerrado, alojado, por minuto, con doce voces y sin clonación, y aceptas que su puntuación de calidad independiente esté en la mitad de la tabla.

La tentación es leer 1.275 frente a 70,3 % y darlo por zanjado. No lo está, y la diferencia entre esas dos cifras es todo el argumento: una mide cómo suena una voz, la otra mide si merece la pena hablar con ella.