
Eleven v4 vs OpenAI TTS-1 HD: Dos años de deriva en un solo tablero
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
OpenAI TTS-1 HD tiene una fecha de lanzamiento del 6 de noviembre de 2023. ElevenLabs Eleven v4 tiene una del 28 de septiembre de 2026. En la Provider Voice Arena de Artificial Analysis, esas dos fechas están separadas por 216 puntos Elo — TTS-1 HD ocupa el puesto 35 con 1,104 en 3,500 apariciones a $30.00 por millón de caracteres, mientras que Eleven v4 ocupa el puesto 1 con 1,319 en 1,674 apariciones a $80.00. Ambas cifras presentan intervalos estrechos, ±12 y ±19, así que el orden no está en duda. La pregunta interesante no es qué modelo es mejor, porque eso quedó resuelto antes de que este artículo existiera. Es por qué un endpoint de 2023 todavía tiene 3,500 apariciones en una clasificación donde un modelo de cinco días tiene 1,674, y qué te dice eso sobre la migración que se te pide considerar.
El marcador, y la única fila donde gana OpenAI
Cinco dimensiones deciden este enfrentamiento, y vale la pena leer ambos lados de cada una una al lado de la otra.
• Preferencia a ciegas, voces de proveedores — Eleven v4 puesto 1, Elo 1.319 (±19, 1.674 apariciones) vs. TTS-1 HD puesto 35, Elo 1.104 (±12, 3.500 apariciones). Una diferencia de 216 puntos que se mantiene incluso con los márgenes de error.
• Precio de tabla, por millón de caracteres — Eleven v4 $80.00 vs TTS-1 HD $30.00. OpenAI es 62% más barato a precio de lista, y aún más barato durante la promoción de ElevenLabs.
• Voces — Eleven v4 documenta la clonación instantánea a partir de diez segundos de audio más un nivel de clonación profesional; TTS-1 HD incluye un conjunto fijo de voces, nueve para la familia tts-1 en la documentación propia de OpenAI (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) y no admite clonación.
• Dirección de interpretación — Eleven v4 documenta etiquetas de audio en línea y prompts de dirección en lenguaje natural; TTS-1 HD acepta texto sin formato, y el parámetro steerable-instructions de OpenAI pertenece a su modelo TTS más reciente, no a este.
• Fecha de lanzamiento — Eleven v4 el 28 de septiembre de 2026 vs TTS-1 HD el 6 de noviembre de 2023.

El precio es la fila que gana OpenAI, y es una victoria más grande de lo que parece, porque la promoción de ElevenLabs es temporal. A $0,022 por cada 1.000 caracteres, Eleven v4 cuesta $22 por millón hasta el 12 de octubre, más barato que TTS-1 HD directamente. Después del 12 de octubre cuesta $80 por millón frente a los $30 de OpenAI, y se queda ahí.
Por qué un modelo de 2023 tiene el doble de muestras
Ese número es lo más útil de este tablero y es fácil malinterpretarlo. Las apariciones en Arena se acumulan con el tráfico, y el tráfico se acumula con integraciones que se construyeron una vez y nunca se volvieron a revisar. TTS-1 HD tiene 3.500 apariciones a sus espaldas porque ha sido el endpoint de voz predeterminado para todos los equipos que ya llaman a OpenAI para chat completions: la misma clave, el mismo SDK, la misma línea de facturación, una llamada más. Nada en esa frase tiene que ver con la calidad de voz, y el déficit de 216 puntos no lo detuvo.

Esto es lo que parece la deuda de migración en una tabla de clasificación. No es una señal de que el modelo más antiguo sea competitivo; es una señal de que cambiar cuesta algo, y de que un gran número de equipos ha decidido que ese algo vale más que 216 puntos Elo. Es una conclusión legítima para un informe de notificaciones y una mala conclusión para un producto en el que la voz es lo que oye el cliente.
El argumento a favor de permanecer en TTS-1 HD
Tres cosas lo mantienen defendible, y ninguna de ellas es la calidad.
El determinismo es lo primero. Un conjunto fijo de nueve voces produce una salida consistente entre versiones de una manera que un pipeline de clonación no, y una salida consistente es lo que quieres en una vía utilitaria donde nadie está escuchando en busca de arte. No hay ningún clon que pueda desviarse, ni una muestra de referencia que regrabar, ni un artefacto de consentimiento que mantener.
El costo de integración es el segundo, y es el que la arena no puede ponerle precio. Añadir un segundo proveedor de voz significa una nueva cuenta, una nueva lista de precios, un nuevo modo de fallo y una nueva cosa que monitorear. Para un equipo que ya está dentro del stack de OpenAI, eso es tiempo real de ingeniería, y 216 puntos Elo no lo pagan.
El volumen de gama baja es el tercero. A $30 por millón de caracteres, la factura mensual completa de voz de un producto pequeño es un error de redondeo, y no hay nada que optimizar. Este es el régimen donde la respuesta barata y la respuesta perezosa son la misma respuesta, y eso está bien.
Los argumentos a favor de mudarse y el contraargumento correspondiente
Cambia cuando la voz esté orientada al cliente. La clonación en diez segundos, la dirección de interpretación en línea, más de 90 idiomas y un límite de entrada de 10.000 caracteres por solicitud no son diferencias cosméticas frente a un conjunto fijo de nueve voces de 2023, y la brecha de 216 puntos de la arena es la versión comprimida de una brecha de capacidad mucho mayor. Si estás construyendo un agente, un asistente de marca o cualquier cosa en la que un oyente se forme una opinión de tu producto en la primera frase, el endpoint más antiguo es la opción predeterminada incorrecta.
El contraargumento es que «cambiar a Eleven v4» no es la única opción. OpenAI ha lanzado desde entonces un modelo TTS más nuevo con un parámetro de instrucciones dirigibles, y Gemini 3.8 Flash TTS de Google ocupa el tercer puesto en la misma tabla con 1.267 y un precio normalizado de 16,49 $ por millón — una ganancia de 163 puntos sobre TTS-1 HD a aproximadamente la mitad del precio de la tabla. Si tu limitación es permanecer dentro de tu proveedor actual, esa es la actualización más barata. Si es permanecer dentro de tu nube actual, es la única.
Dónde se sitúa realmente OrcaRouter en esta comparación
This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

ElevenLabs Eleven v4 no está en nuestro catálogo y no hay nada que llamar a través de nosotros: se accede a él mediante la propia API de ElevenLabs, con la propia tarifa de ElevenLabs. Lo que cambia una sola clave es la forma de la migración. Si la razón por la que no has probado al nuevo líder es que implica una segunda integración de proveedor, el coste de averiguarlo es una sola llamada a la API con una clave que ya tienes, en lugar de un ciclo de adquisición. Los precios de lista de los proveedores se repercuten con un 0 % de margen, por lo que un cambio de precio de un proveedor —incluida la reversión del 12 de octubre de ElevenLabs— está activo en nuestro lado el mismo día en que ocurre, y conmutación por error automáticasignifica que una vía de voz en evaluación no tiene que convertirse en una dependencia de producción mientras decides.
La aritmética que debería zanjarlo
Cinco millones de caracteres al mes, lo que constituye un producto de tamaño medio y aproximadamente 100 horas de voz. TTS-1 HD cuesta $150. Eleven v4 cuesta $110 durante la ventana promocional y $400 después del 12 de octubre. Gemini 3.8 Flash TTS, con la normalización del consejo, cuesta alrededor de $82.50.
Lee de nuevo esos cuatro números y la decisión se divide con claridad. Durante la ventana, el modelo más nuevo y mejor clasificado de la tabla es también el segundo más barato — más barato que el endpoint de 2023 al que supera por 216 puntos Elo. Después del 12 de octubre es la opción más cara de la lista por un factor de casi cinco. Nada de los modelos cambia en esa fecha; solo lo hace la factura.
Así que: si estás evaluando este mes, evalúa con la tarifa promocional y escribe la tarifa de lista en el caso de negocio. Si vas a lanzar el próximo trimestre, planifica a partir de $0.08 por 1000 caracteres y trata cualquier comparación que cite $0.022 como un documento con fecha de caducidad impresa. Y si usas TTS-1 HD y la razón honesta es la inercia de integración, el primer paso útil no es un plan de migración: es una única prueba A/B con tus propios scripts, a la tarifa que realmente estarás pagando en noviembre.
