
Gemini 3.8 TTS vs Inworld Realtime TTS-2: ¿Qué marcador crees que cambia la respuesta?
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Si se colocan Gemini 3.8 Flash TTS y Inworld Realtime TTS-2 uno junto al otro en el Artificial Analysis Provider Voice Arena, la respuesta parece obvia: el puesto 2 frente al puesto 4, Elo 1.260 frente a 1.245, 8 voces en la arena cada uno, y 16,50 $ normalizados por millón de caracteres frente a 20,80 $. El proveedor gana en posición y en precio, y la diferencia de 15 puntos queda, de todos modos, dentro de los intervalos de confianza de ambas filas.
Pasa a la otra tabla que publica Artificial Analysis y el orden se invierte. Inworld Realtime TTS-2 ocupa el primer puesto en la Controlled Voice Arena con un Elo de 1.123, mientras que su variante Flash está en 1.075. Eso no es una diferencia de redondeo: es otro modelo el que gana, y la razón es que las dos tablas no miden lo mismo. Si estás eligiendo una voz para un producto, saber cuál de esas dos preguntas se está planteando realmente en tu caso de uso es toda la decisión.

Dos consejos, dos preguntas diferentes
El {{1}}Provider Voice Arena{{/1}} puntúa las voces nativas propias de un modelo — las que el proveedor incluye y aloja. El {{2}}Controlled Voice Arena{{/2}} mantiene la voz constante y puntúa qué tan bien se desempeña cada modelo cuando se le pide hablar con una voz que no es la suya. Mismos jueces, mismo tipo de comparación a ciegas, variable diferente.
Esa distinción corresponde a dos trabajos diferentes:
• El ranking de proveedores responde a «¿suena bien este modelo nada más sacarlo de la caja?». Es la tabla correcta para un producto que se distribuye con un conjunto fijo de voces de narrador y que nunca clona nada.
• El ranking controlado responde a la pregunta «¿obedece este modelo a una especificación de voz?». Es el panel adecuado para un producto en el que la voz es la del cliente: una voz de marca clonada, un actor con licencia, una identidad por inquilino.
Los modelos de Google lideran la primera. Los de Inworld lideran la segunda. Ambas afirmaciones son verdaderas al mismo tiempo y ninguna es una contradicción, que es exactamente por lo que una única respuesta a «cuál es el mejor modelo TTS» suele ser señal de que quien escribe eligió un ranking y no miró el otro.

Qué implica en la práctica la posición número uno de Inworld
Un resultado Controlado en primer lugar es una afirmación sobre la fidelidad a una instrucción, y la fidelidad a una instrucción es la propiedad que decide si el clonaje es utilizable en absoluto.
La ruta de clonación de Inworld se presenta en dos formas. La clonación instantánea funciona a partir de una muestra corta —la cifra del proveedor es de 5 a 15 segundos de audio de referencia— y un nivel de clonación profesional se encuentra en fase beta y requiere del orden de diez minutos. Ambas cifras son reportadas por el proveedor, y ninguna está verificada de forma independiente por la arena; lo que la arena mide es el comportamiento del modelo una vez que tiene una voz, no la calidad del paso de clonación que la produjo.
Las afirmaciones de latencia asociadas a la familia están en la misma categoría. La cifra de primer byte de la variante Flash —25 milisegundos, reportada mediante una medición de terceros— y los números p99 del modelo completo son de la propia Inworld, y la arena no tiene nada que decir sobre ninguna de las dos. Son plausibles para un modelo orientado a tiempo real y no están verificadas, que es la manera correcta de sostenerlas.
Entonces, la lectura práctica es: si tu producto clona voces, el resultado Controlled de Inworld es el más relevante de las dos puntuaciones, y es la razón por la que un ranking de Provider más bajo no es descalificante. Si tu producto no clona, esa ventaja te resulta invisible y la tabla de Provider es la que hay que leer.
La escalera de precios tiene tres peldaños, y el barato es una suscripción
Comparar un precio con otro hace que esta comparación esté mal, porque Inworld no tiene un precio: tiene una escala.
• Bajo demanda — Realtime TTS-2 a $25.00 por millón de caracteres, Flash a $15.00. Esta es la tarifa que ve un usuario de pago por uso, y es la cifra publicada por el propio proveedor.
• Plan Creator: $20.00 y $10.00 por los mismos dos modelos, lo que supone un descuento del 20 % y del 33 % por comprometerse con un plan en lugar de pagar por uso. Reportado por el proveedor, y el escalón que más vale la pena volver a verificar en la página de precios en vivo antes de comprometerse, ya que las condiciones del plan cambian más rápido que las tarifas de lista.
• Normalizado — la conversión por millón de caracteres de la arena da $20,80 para Realtime TTS-2 y $10,40 para Flash, lo cual es la aritmética del tablero y no la cotización de ninguno de los proveedores.
Frente a eso, las tarifas de Google se basan en tokens y son promocionales: $0,50 por millón de tokens de texto de entrada y $9,00 por millón de tokens de audio de salida hasta el 31 de diciembre de 2026; después, $18,00; Flash-Lite TTS cuesta $0,50 y $6,00; después, $12,00. Normalizado, eso es $16,50 y $11,00.

Si se leen los dos en conjunto, el panorama es más interesante que «Google es más barato». Con las cifras tal como se publicaron hoy, Flash TTS es el más económico de los tres modelos y la variante Flash de Inworld es la segunda más económica; los dos modelos Flash están lo bastante cerca como para que un pequeño cambio en tu relación audio-texto pueda invertir cuál de los dos factura menos. El 1 de enero de 2027, cuando la tarifa de Google se duplique, el orden se asienta y Inworld pasa a ser la opción más económica en cada tramo de su escala. Quien compare estos dos en septiembre y se decida en diciembre está comparando las cifras equivocadas.
Donde cada uno es la mejor respuesta.
Los dos modelos son lo bastante cercanos en calidad como para que los diferenciadores sean estructurales, así que la versión honesta es una lista de condiciones en lugar de un veredicto.
Elige Gemini 3.8 Flash TTS cuando la voz sea tu elección. Diseño de voz a partir de una descripción escrita, diálogo de dos hablantes en una sola llamada, estilo por turno, y la cobertura de idiomas más amplia de los dos según el propio recuento de Google — nada de lo cual Inworld iguala en esta comparación. También es el modelo más barato hoy en día, y su hermano Flash-Lite te ofrece un segundo punto de precio dentro de la misma API.
Elige Inworld Realtime TTS-2 cuando la voz sea la del cliente. Una fila superior de Controlled Voice, una ruta de clonación instantánea medida en segundos de audio de referencia, un nivel de clonación profesional para los casos que necesitan más, y una orientación en tiempo real respaldada por afirmaciones de primer byte que publica el proveedor — con la salvedad de que las afirmaciones son del proveedor. Solo está en inglés según la propia documentación del proveedor, lo que es una restricción estricta si necesitas cualquier otra cosa.
Ninguno de estos modelos está alojado por OrcaRouter, y vale la pena decirlo en lugar de insinuar lo contrario: el lugar para llamar a Gemini 3.8 Flash TTS es la propia API de Google y las superficies que Google nombró el 23 de septiembre, y el lugar para llamar a Inworld Realtime TTS-2 es la propia plataforma de Inworld. Aquello para lo que sirve OrcaRouter es todo lo que rodea a esa elección — más de 200 modelos detrás de una sola clave a precio de lista del proveedor sin recargo, de modo que un cambio de tarifa de un proveedor como el ajuste de enero está activo de nuestro lado el mismo día, conmutación por error automática para que un modelo evaluado no tenga que ser una dependencia de producción, y un DSL de enrutamiento para componer modelos en una sola llamada cuando ninguna voz por sí sola lleva todo el trabajo.
La razón para mantener ambos en juego es que el cambio de tasas de enero y la distinción entre Controlled y Provider son dos razones separadas por las que la respuesta puede cambiar. Un pipeline que solo puede llamar a una de ellas no puede seguir a ninguna.
