
Eleven v4 encabeza la Voice Arena: lo que realmente ganó el nuevo buque insignia de ElevenLabs
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 983 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 196 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
ElevenLabs Eleven v4 llegó el 28 de septiembre y se colocó directamente en lo más alto de la Provider Voice Arena de Artificial Analysis con un Elo de 1.319 — 43 puntos por delante de Cartesia Sonic 3.6, con 1.276, y 52 por delante de Google Gemini 3.8 Flash TTS, con 1.267. También es, a 80,00 $ por millón de caracteres en esa misma tabla de clasificación, el modelo más caro de los diez primeros. Y en la segunda arena —la construida a partir de voces clonadas en lugar del conjunto de voces propio de cada proveedor— no gana en absoluto: queda en segundo lugar, por detrás de un modelo que cuesta una cuarta parte. Ambas cosas son ciertas, y la parte útil de este lanzamiento es determinar en cuál de las dos se sitúa tu caso de uso.
¿Qué se lanzó realmente el 28 de septiembre?
ElevenLabs puso dos modelos en disponibilidad general, no uno. ElevenLabs Eleven v4 es el modelo de síntesis insignia — la empresa lo califica como el más emotivo, y su documentación establece el límite de entrada en 10.000 caracteres por solicitud y la cobertura de idiomas en más de 90. ElevenLabs Eleven v4 Turbo es el hermano de baja latencia: los mismos más de 90 idiomas, un límite de 10.000 caracteres y compatibilidad con las etiquetas de audio en línea que te permiten escribir una indicación de entrega directamente en el guion — una risa, un susurro, un zumbido en la línea. Ambos están activos en las superficies de agente, creativa y API de la empresa desde el primer día, lo que supone un despliegue más rápido que el que tuvo la generación v3.
La página del anuncio es donde se encuentra la lista de características y, notablemente, no los precios. ElevenLabs describe una nueva arquitectura, un mejor manejo del tono, el ritmo y el carácter, un diálogo con varios hablantes más fiable con una identidad de hablante estable, una entrada mejorada de fonemas IPA y clones de voz instantáneos creados a partir de diez segundos de audio junto con el nivel existente de clones profesionales. El único número que contiene es una afirmación sobre los oyentes: el proveedor dice que las comparaciones a ciegas prefirieron v4 en aproximadamente tres cuartas partes de los casos. Esa es una cifra del proveedor, no reproducida, y debería leerse junto a las cifras del tablero que aparecen a continuación, no en lugar de ellas.
Dónde está realmente el precio — la página de precios de la API — es el documento de mayor trascendencia, y se trata más abajo. En resumen: este lanzamiento no es una subida de precios.
Dos placas, dos respuestas diferentes
Artificial Analysis dirige dos arenas de voz y no son variaciones una de otra. Provider Voice hace que los oyentes comparen las voces propias de cada proveedor. Controlled Voice clona las mismas ocho voces —cuatro de EE. UU., cuatro del Reino Unido— para cada participante, de modo que el hablante se mantiene constante y solo varía el modelo. Un modelo con un gran elenco de voces predeterminadas puede ganar la primera y perder la segunda. Eleven v4 hace exactamente eso.
• Voz de proveedor, Eleven v4 — puesto 1, Elo 1.319, 80,00 $ por millón de caracteres, 1.674 muestras, ocho voces de arena, septiembre de 2026
• Voz de proveedor, Cartesia Sonic 3.6 — rango 2, Elo 1.276, 49,00 $
• Voz del proveedor, Google Gemini 3.8 Flash TTS — puesto 3, Elo 1.267, $16,50
• Voz del proveedor, el anterior buque insignia ElevenLabs Eleven v3 — puesto 18, Elo 1.169, $100,00
• Voz controlada, Alibaba Qwen-Audio-3.1-TTS-Plus — puesto 1, Elo 1.178
• Voz controlada, Eleven v4 — puesto 2, Elo 1.157, 80,00 $
• Voz controlada, Cartesia Sonic 3.6 — puesto 4, Elo 1.138
• Voz controlada, ElevenLabs Eleven v3 — puesto 7, Elo 1.073
• Voz controlada, Google Gemini 3.8 Flash TTS — puesto 13, Elo 1.048
• Mejor entrada de pesos abiertos en Provider Voice — Breeze TTS 2, Elo 1.206, 34,00 $

El salto de linaje es el titular para cualquiera que ya esté en ElevenLabs: frente a su propio predecesor en la misma tabla, Eleven v4 gana 150 puntos Elo en Provider Voice y 84 en Controlled Voice. Eso es un avance generacional, no una simple pasada de ajuste, y la mejora es mayor en la tabla donde el proveedor puede elegir las voces, lo que es la forma honesta de decir que su nuevo elenco predeterminado es una parte real de la ganancia.

El tablero de pronunciación que no podemos cuantificar
Artificial Analysis sí tiene una sección de Robustez de Pronunciación, y vale la pena describirla adecuadamente porque el resumen de clasificación que circula describe a Eleven v4 como líder en ella. El panel mide la proporción de fragmentos resaltados que los revisores consideraron pronunciados correctamente, con hasta tres revisores por clip, y las indicaciones se envían exactamente como están escritas —sin expansión de números ni normalización de texto. Está dividida en subcategorías, y el objetivo del diseño es que un modelo que reescribe en silencio "Dr." o "$4.50" antes de hablar obtenga una mala puntuación a propósito.
Lo que la tabla no publica, en la representación que pudimos leer, es una puntuación numérica citable por modelo. Así que no hay cifra que citar para Eleven v4 allí, y el Elo de 1.319 corresponde a la preferencia de la arena —cuánto les gustó la voz a los oyentes—, no a la precisión de pronunciación. Si ves las dos cosas confundidas, esa es la confusión. La afirmación defendible de este lanzamiento es la que lleva números adjuntos: primero en Provider Voice con 1.319, segundo en Controlled Voice con 1.157.
El descuento de lanzamiento es la verdadera noticia para tu factura
ElevenLabs fijó nuevos precios para los nuevos modelos al mismo tiempo que los lanzó, y el descuento es lo suficientemente grande como para cambiar por sí solo una decisión de compra. En la página de precios de la API, Eleven v4 aparece a $0.022 por cada mil caracteres frente a un precio de lista declarado de $0.08 —una reducción del 72 %—, y Eleven v4 Turbo aparece a $0.011 frente a $0.04. Ambos tienen la misma vigencia: la promoción estará vigente hasta el 12 de octubre. Después de eso, las cifras vuelven a su valor anterior, y el precio de v4 una vez revertido es el doble de lo que cuesta hoy el propio v3 de ElevenLabs, a $0.08. Planifique a partir del precio posterior a la promoción, no del promocional.
La revisión de precios también desplaza la posición de v4 frente a la competencia sobre una base por carácter, que la normalización de la arena ya sitúa en $80.00 por millón. Sonic 3.6 cuesta allí $49.00, Breeze TTS 2 cuesta $34.00, Qwen-Audio-3.0-TTS-Plus cuesta $19.30 y Gemini 3.8 Flash TTS cuesta $16.50. Con la tarifa promocional, Eleven v4, a $22 por millón, es directamente más barato que Sonic 3.6. Con la tarifa de lista, es la voz más cara de la tabla por un amplio margen. Cualquiera que esté preparando un presupuesto para el primer trimestre debería fijarse en el segundo número.

Un mes calculado en detalle hace tangible la diferencia. Con cinco millones de caracteres —un producto de tamaño medio que lee aproximadamente cien horas de voz—, Eleven v4 durante la ventana cuesta $110. Con el precio revertido de $0.08, cuesta $400. Sonic 3.6 cuesta $245. Gemini 3.8 Flash TTS cuesta $82.50. Ese mismo mes en la propia v3 de ElevenLabs cuesta también $400, que es el hecho curioso que subyace a este lanzamiento: durante las próximas dos semanas, el nuevo buque insignia es más barato que el modelo al que reemplaza, y el día en que se cierra la ventana deja de ser más barato y pasa a ser simplemente mejor.
La afirmación sobre la latencia proviene del proveedor y depende del nivel contratado
ElevenLabs publica cifras de latencia por nivel, no por familia de modelos, y son mediciones realizadas por la empresa, no datos independientes. Para Eleven v4 Turbo se citan aproximadamente 100 ms de inferencia mediana y unos 150 ms de mediana de tiempo hasta el primer audio, medidos en septiembre de 2026. Para Eleven v3 Conversational se citan unos 280 ms, y para los antiguos niveles Flash y Turbo, unos 75 ms. La documentación no publica una cifra equivalente para Eleven v4 en sí, que es el nivel que querrías si estás creando un agente en tiempo real y leyendo una hoja de especificaciones en lugar de hacer pruebas.
Cartesia afirma una latencia inferior a 90 ms para Sonic y lo describe como clasificado primero en naturalidad, con clonación de voz a partir de diez segundos de audio, diccionarios de pronunciación personalizados y un conjunto de cumplimiento que abarca HIPAA, SOC 2 Type 2, GDPR y PCI. Esas son las propias afirmaciones del proveedor en su propia página de producto —la misma categoría de evidencia que las cifras de nivel de latencia de ElevenLabs, y no son intercambiables con el Elo de la arena. Donde los dos proveedores son directamente comparables es solo en las tablas de clasificación.
En qué te deja esto, y cómo probarlo
Si estás eligiendo una voz para un producto en el que el elenco predeterminado es lo que oyen tus usuarios, el resultado de Provider Voice es el que importa, y Eleven v4 acaba de llevárselo, con un descuento incluido durante dos semanas. Si estás clonando la voz de una persona concreta y a todos los modelos candidatos se les pide reproducir los mismos ocho hablantes, la tabla de Controlled Voice es la que importa, y Eleven v4 queda segundo: 21 puntos Elo por detrás del líder y, a precio de lista, más de cuatro veces el coste por carácter. Ninguno de los dos resultados es incorrecto; son respuestas a preguntas distintas, y la segunda es la pregunta que en realidad se plantea la mayoría del trabajo de clonación de voz en producción.
OrcaRouter no aloja ElevenLabs, Cartesia ni ninguno de los otros proveedores en estos paneles, así que aquí no hay nada que llamar a través de nosotros y no insinuaremos lo contrario. Lo que sí ofrecemos es la infraestructura que lo rodea si tu stack de voz termina abarcando varios proveedores: una sola clave de API para más de 200 modelos, con los precios de lista de los proveedores transferidos con un 0 % de recargo, así que una rebaja de precio de un proveedor —incluida una ventana promocional como esta— está activa de nuestro lado el mismo día, en lugar de en el siguiente ciclo de facturación. Cuando una ruta de voz es crítica para producción, la conmutación por error automática cambia a un upstream saludable cuando uno se degrada, que es la forma práctica de probar un endpoint completamente nuevo sin apostar un lanzamiento a él.
La fecha que hay que agendar es el 12 de octubre. Ese es el momento en que Eleven v4 deja de ser la voz buena más barata del panorama y pasa a ser la más cara, y cualquier comparativa escrita esta semana que cite $22 por millón sin decirlo es una comparativa que deberías rehacer dentro de tres semanas.
