
GPT-Live-1 vs Inworld Realtime TTS-2: una guerra de precios por las voces, una prima por la escucha
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencia69Código
Inworld Realtime TTS-2 alcanzó la disponibilidad general con algo que el mercado de la voz había estado echando en falta: una lista de precios publicada. El modelo insignia cuesta $25 por millón de caracteres bajo demanda, su hermano más rápido Inworld Realtime TTS-2 Flash cuesta $15, y ambos bajan por tramos de volumen hasta $12,50 y $7. Al situarse en Elo 1.244 y en segundo lugar en la arena de voz de Artificial Analysis, eso convierte al modelo insignia en aproximadamente la mitad del precio del líder actual de la arena y en una de las formas más baratas de comprar una de las cinco mejores voces. GPT-Live-1 es el otro modelo de esta comparación y la propuesta opuesta: $0,05 por minuto de voz, sin caracteres de por medio, y no hay forma de comprarlo sin comprar también la escucha, la toma de turnos y la gestión de interrupciones que vienen incluidas.
Lo interesante de compararlos es que la diferencia de precios parece enorme y luego, en gran medida, se desvanece. La síntesis está en una guerra de precios. La conversación, no.
Lo que Inworld realmente lanzó
La línea TTS-2 comenzó como una vista previa de investigación en mayo de 2026 con una afirmación concreta: que se trata de un modelo que no genera voz de forma aislada. Toma los turnos anteriores de una conversación como entrada de audio, razona sobre el tono y el ritmo, y ajusta cómo responde. Ese posicionamiento —conciencia conversacional en lugar de un audio más limpio— es lo que lo separó de los motores de narración que dominaron la conversión de texto a voz hasta 2025.
La disponibilidad general convirtió la vista previa en una familia y le añadió una lista de precios. Flash es la opción orientada al throughput, con Inworld citando alrededor de 20 milisegundos de tiempo hasta el primer byte del lado del servidor en el percentil 90, frente a los 100 milisegundos del modelo insignia y una mediana inferior a 200 milisegundos hasta el primer audio. Esas son cifras del proveedor según la propia documentación de Inworld; la única medición de terceros que circula, de Coval, sitúa a Flash en aproximadamente 25 milisegundos y al modelo insignia en la parte baja de los cientos. Ninguna de las dos ha sido auditada de forma independiente de principio a fin.
La característica que más merece la pena destacar no tiene nada que ver con la latencia. Inworld añadió un modo literal para que los números de pedido, los códigos de confirmación, las direcciones y los números de serie se lean carácter por carácter en lugar de normalizarse a algo que suena natural pero es incorrecto. Para un agente de voz que acaba de tomar una reserva, esa única etiqueta es la diferencia entre un producto que funciona y una demo que termina escalándose a una persona.

Dimensión a dimensión
• Tipo — GPT-Live-1: voz a voz full-duplex en un solo modelo vs Inworld Realtime TTS-2: un modelo de texto a voz, con dúplex disponible por separado a través de la API Realtime de Inworld
• Precio unitario — GPT-Live-1: $0,05 por minuto de voz, facturado por segundo, el backend de razonamiento se factura por separado, frente a Inworld Realtime TTS-2: $25 por millón de caracteres bajo demanda, $20 en el plan Creator y $12,50 en el nivel superior, con Flash a $15, $10 y $7
• Calidad independiente — GPT-Live-1: 70,3 % en el Speech to Speech Index, sexto empatado de catorce frente a Inworld Realtime TTS-2: Elo 1.244 de 1.091 muestras y segundo en la Artificial Analysis Provider Voice arena, con Flash en Elo 1.211 de 1.626 muestras y sexto
• Interrupción — GPT-Live-1: nativa, decidida dentro del modelo muchas veces por segundo frente a Inworld Realtime TTS-2: no es una propiedad del modelo TTS; la Realtime API de Inworld admite barge-in con una latencia de interrupción de aproximadamente 100 milisegundos, sobre un único socket que habla el protocolo OpenAI Realtime
• Latencia — GPT-Live-1: 0,798 segundos de latencia de cambio de turno en las pruebas propias de OpenAI, sin tiempo hasta el primer audio publicado frente a Inworld Realtime TTS-2: 100 milisegundos del lado del servidor en el percentil 90, Flash en 20, con una mediana inferior a un segundo hasta el primer fragmento de audio a lo largo de todo el pipeline de Realtime API
• Idiomas — GPT-Live-1: los idiomas principales están bien cubiertos, pero de forma desigual más allá de ellos, frente a Inworld Realtime TTS-2: más de 200 locales, con 15 en calidad de Nivel 1 y 79 más en Nivel 2, y una única identidad de voz conservada en todas ellas
• Voces y clonación — GPT-Live-1: doce preajustes, sin clonación frente a Inworld Realtime TTS-2: 282 voces integradas, clonación instantánea zero-shot a partir de 5 a 15 segundos de audio autorizado, clonación profesional y control total de la locución solo en el modelo insignia
• Despliegue — GPT-Live-1: solo alojado, un único endpoint, sin nivel gratuito, concurrencia limitada a entre 25 y 500 sesiones frente a Inworld Realtime TTS-2: API alojada más un contenedor local con acceso restringido que requiere una H100, y un nivel gratuito bajo demanda que incluye hasta aproximadamente 70 minutos de síntesis

La cuestión dúplex, respondida con precisión
Sería fácil escribir esta comparación como «uno escucha, el otro solo habla», y sería erróneo de una manera que importa. Los modelos de texto a voz de Inworld reciben texto y emiten audio. Pero Inworld también comercializa una API Realtime que funciona sobre una única conexión WebSocket, WebRTC o SIP y es full-duplex en el sentido que le importa a quien construye: incorpora detección semántica de actividad de voz con un ajuste de presteza regulable, admite control manual de turnos e interrumpe ante una barge-in en unos 100 milisegundos. Es compatible a nivel de protocolo con la interfaz Realtime de OpenAI, lo que convierte la migración en un ejercicio de configuración en lugar de una reescritura.
Lo que la API Realtime de Inworld no es, es un modelo nativo de voz a voz. Es una cascada —un modelo de reconocimiento de voz intercambiable, un modelo de lenguaje de tu elección y un sintetizador— orquestada dentro de una sola conexión. Esa es una elección arquitectónica legítima y es la misma que adoptan la mayoría de los agentes de voz en producción. Simplemente, es distinta a la de GPT-Live-1, donde un único modelo decide cuándo ceder el turno.
La diferencia práctica se hace evidente cuando quien llama interrumpe a mitad de una frase. En una cascada, se detecta la interrupción, se cancela la generación y comienza un nuevo turno: una secuencia que funciona bien y te cuesta un viaje de ida y vuelta. En el modelo de extremo a extremo, la decisión ya se estaba tomando de forma continua. El primer caso es un sistema que responde con rapidez. El segundo es un sistema que nunca dejó de escuchar.

Hacer los números, porque las unidades esconden la respuesta
El habla fluye a unas 150 palabras por minuto, y el inglés promedia alrededor de cinco caracteres y medio por palabra, así que un minuto de salida hablada equivale a unos 800 a 900 caracteres. A $25 por millón, Inworld Realtime TTS-2 genera un minuto de voz por aproximadamente dos centavos. Con Flash a $15, es menos de un centavo y medio.
Frente a los $0,05 por minuto de voz de GPT-Live-1, eso parece una paliza —hasta que calculas el costo del resto de lo que hace GPT-Live-1. La API Realtime de Inworld todavía necesita reconocimiento de voz y un modelo de lenguaje, ambos facturados por separado, y ambos con su propia latencia. Si los incluyes, el costo por minuto de la cascada supera los cinco centavos para cualquier llamada que implique una pregunta real. El sobreprecio del modelo de extremo a extremo no es por la voz. Es por la toma de turnos, y es aproximadamente el costo de la etapa de reconocimiento de voz que ya no compras.
Donde la cascada gana de forma decisiva es en el volumen sin conversación. Llamadas de notificación, confirmaciones de entrega, recordatorios de citas, IVR con guion: cualquier caso en el que el texto se conoce antes de que empiece la llamada y nadie va a interrumpir. Ahí, el precio por carácter, de $7 a $15 por millón, es simplemente más barato que el dúplex por minuto, y pagar por la toma de turnos que nunca usas es un desperdicio.
También existe un camino intermedio que el enfoque de dos modelos oculta. Si de todos modos vas a ensamblar una cascada, la capa de voz no tiene que provenir de un proveedor de voz dedicado: los propios modelos TTS de OpenAI y los modelos de vista previa de TTS de Gemini de Google son endpoints de API ordinarios, y están enrutados. Alrededor de 190 modelos de once proveedores upstream se encuentran detrás de una sola clave de OrcaRouter al precio de lista del proveedor sin margen adicional, por lo que un modelo de síntesis puede estar en el mismo catálogo, con la misma clave y la misma factura, que el modelo de razonamiento al que alimenta, con conmutación por error automática si un endpoint se degrada a mitad del despliegue. Es la etapa menos glamurosa de una pila de voz y la más fácil de consolidar. Ni el endpoint Realtime TTS-2 de Inworld ni el endpoint Live Sessions de GPT-Live-1 están disponibles de esa manera; esos dos pertenecen a sus proveedores.
¿Cuál elegir?
Elige Inworld Realtime TTS-2 si el volumen es lo importante y la conversación está guionizada. Agentes de alto rendimiento, notificaciones, productos multilingües en los que importan 200 locales y una identidad de voz preservada, o cualquier implementación que necesite el contenedor en las instalaciones. Obtienes una voz del top dos de la arena a aproximadamente la mitad del precio del líder, un nivel gratuito para prototipar, clonación que GPT-Live-1 no ofrece en absoluto, y una Realtime API que gestiona las interrupciones con solvencia en el patrón en cascada que probablemente ya ejecutas.
Elige GPT-Live-1 si la interrupción es el producto. Llamadas que se salen del guion, interlocutores que hablan por encima del agente, flujos de trabajo en los que la toma de turnos marca la diferencia entre una conversación y un menú. Pagas una tarifa por minuto que no baja cuando hablar se abarata, renuncias a la clonación y a 200 idiomas, y recuperas las costuras.
La guerra de precios en la síntesis de voz es real y son buenas noticias para cualquiera que esté construyendo un agente de voz: una voz entre las cinco mejores ahora cuesta una quinta parte de lo que costaba hace dieciocho meses. Simplemente no resuelve esta comparación, porque aquello por lo que cobra GPT-Live-1 no es lo que Inworld está descontando.
