![Una tarjeta hero generada para ElevenLabs Eleven v4 con dos paneles: a la izquierda, un bloque de guion que muestra etiquetas de audio en línea como [laughs], [whispers] y [said angrily in French accent]; a la derecha, un panel que indica puesto 1, Elo 1,319, $80.00 por 1M de caracteres y 1,674 apariciones en Provider Voice Arena de Artificial Analysis, con un pie de página que dice 'Clasificación de Provider Voice, Elo y precio según Artificial Analysis, septiembre de 2026; sintaxis de etiquetas y latencia documentadas por el proveedor'. El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Las Audio Tags de Eleven v4 y los clones de diez segundos: qué cambia en tu pipeline
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 197 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
Lo más trascendental de ElevenLabs Eleven v4 no es su Elo. Es que el modelo lee las indicaciones escritas en el guion — [risas], [susurra], [suspira], [dicho con enojo con acento francés], incluso [lluvia ligera] — y que ElevenLabs Eleven v4 Turbo, el hermano de baja latencia lanzado el mismo día, sigue las mismas etiquetas con un tiempo medio hasta la primera locución que el proveedor sitúa en alrededor de 150 ms. Ambos pasaron a disponibilidad general el 28 de septiembre de 2026. Provider Voice Arena de Artificial Analysis ya tiene a Eleven v4 en el puesto 1 con un Elo de 1.319 en 1.674 apariciones, a un precio de tabla de 80,00 $ por millón de caracteres. La clasificación es el titular. La sintaxis de indicaciones y la clonación de diez segundos son la parte que cambia lo que tienes que construir.
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
Dos modelos, un lanzamiento, distintas funciones
El 28 de septiembre de 2026, ElevenLabs lanzó dos endpoints, y no se trata del mismo producto con un interruptor de velocidad. ElevenLabs Eleven v4 es el modelo expresivo: más de 90 idiomas, un límite de 10.000 caracteres por solicitud, compatibilidad mejorada con el Alfabeto Fonético Internacional para pronunciaciones personalizadas y diálogo con varios hablantes que, según la compañía, preserva la identidad de cada hablante a lo largo de una escena. ElevenLabs Eleven v4 Turbo conserva los más de 90 idiomas y el límite de 10.000 caracteres, pero está optimizado para agentes: el anuncio cita una latencia de inferencia mediana de unos 100 ms y un tiempo medio hasta la primera locución de unos 150 ms, medidos por ElevenLabs en septiembre de 2026.

La pregunta reactiva —¿es el buque insignia lo suficientemente rápido para un agente telefónico?— no tiene respuesta publicada. ElevenLabs ofrece cifras de latencia para Turbo, no para Eleven v4 en sí, y los dos son endpoints distintos en lugar de un solo modelo bajo dos nombres. Si el presupuesto de tu agente es de 200 ms hasta el primer audio, Turbo es el endpoint en la documentación y el buque insignia no.
Las etiquetas son una interfaz real, y una dependencia real
Las etiquetas de audio en línea no son nuevas en la síntesis de voz, pero el cambio útil aquí es la precisión con la que se siguen. El anuncio afirma que Eleven v4 sigue las etiquetas de audio y las indicaciones de dirección en lenguaje natural con más precisión que los modelos anteriores, y que así es como se dirige una risa, un susurro o una interpretación con un acento específico sin editar el audio después.
De esto se derivan tres consecuencias prácticas, y importan más que los videos de demostración:
• Tu guion se convierte en un artefacto con plantilla, no en una cadena. Una etiqueta es un token en tu flujo de contenido: necesita escape si alguna vez se pasa texto no confiable a través de ella, y necesita sobrevivir a tu CMS, a tu capa de traducción y a tu revisión de diferencias. Un traductor que omite [susurra] ha cambiado una interpretación, en silencio.
• La adherencia a las etiquetas es una afirmación del proveedor con una versión asociada. La afirmación de que esta generación sigue las etiquetas mejor que la anterior es de ElevenLabs, probada por ElevenLabs, y no se cumplirá de forma idéntica en todos los idiomas. Valídala con tus propios guiones y tus propias configuraciones regionales antes de basar en ella una guía de estilo.
• Etiquetas de efectos de sonido como [lluvia ligera] o [zumbido de teléfono] trasladan una pequeña parte del trabajo de posproducción de audio al prompt de texto. Eso es un desplazamiento de costos que vale la pena medir: si una etiqueta reemplaza una pasada de foley, es barata; si no reemplaza nada y solo añade variabilidad, es un nuevo modo de fallo en tu control de calidad.
Diez segundos es la cifra que cambia el onboarding
La clonación de voz instantánea en esta versión captura una voz con alta fidelidad a partir de diez segundos de audio, con el nivel de clonación profesional aún disponible por encima. Diez segundos es lo suficientemente corto como para eliminar un paso del flujo de trabajo: la captura del consentimiento, la carga de la muestra y la primera síntesis pueden ocurrir en una sola sesión, en un teléfono, sin un estudio.
El problema del consentimiento no se reduce con la muestra. Crece, porque el listón para producir un clon convincente ha bajado a un clip que cualquiera puede grabar. Si estás clonando voces que no te pertenecen, la cuestión de cumplimiento ahora es enteramente tuya para responder antes de la llamada a la API — el modelo hará lo que le pidas. Trata la cifra de diez segundos como un umbral operativo, no como un permiso.
Lo que cuesta mientras la ventana está abierta
ElevenLabs cambió sus precios en el lanzamiento, y la tarifa promocional es la que aparece hoy en la página. En la tabla de precios de la API, Eleven v4 figura a $0.022 por 1.000 caracteres frente a un precio de lista declarado de $0.08, y Eleven v4 Turbo a $0.011 frente a $0.04. Ambos llevan la misma etiqueta: 72 % de descuento hasta el 12 de octubre. Esa misma página fija el precio del anterior buque insignia, Eleven v3, en $0.08 por 1.000 caracteres.
• Precio en la tabla de la arena, por millón de caracteres — Eleven v4 $80.00, el más alto del top diez de esa tabla.
• Tarifa del proveedor, por cada mil caracteres — $0.022 hasta el 12 de octubre, después $0.08.
• Lo que eso significa en la práctica — un mes de mucho uso de scripts con cinco millones de caracteres cuesta $110 durante la ventana y $400 después de ella, en el mismo endpoint y con el mismo código.

Cualquiera que esté presupuestando para el primer trimestre con base en la cifra que aparece hoy en la página está presupuestando con una cifra que vence en dos semanas. Usa $0.08.
Dónde un router se gana su lugar en un lanzamiento como este
OrcaRouter no aloja ElevenLabs, así que no hay nada en este lanzamiento que se pueda llamar a través de nosotros, y no vamos a insinuar lo contrario: el lugar para llamar a Eleven v4 es la propia API de ElevenLabs. Para lo que una sola clave es realmente útil en la quincena posterior a un lanzamiento es para la comparación. Si estás decidiendo si el nuevo buque insignia supera lo que ya ejecutas, querrás hacer una prueba A/B de los dos en tus propios scripts en lugar de en una tabla de clasificación, y hacer eso con dos proveedores significa dos cuentas, dos relaciones de facturación y dos rutas de integración antes de tener una respuesta.
Ese es el caso que gestionamos: una clave de API para más de 200 modelos con los precios de lista de los proveedores repercutidos con un 0 % de margen, de modo que un cambio de precio de un proveedor —incluida una ventana promocional con fecha de vencimiento— está activo de nuestro lado el mismo día en lugar de en el siguiente ciclo de facturación. Cuando una ruta de voz está orientada al cliente, la conmutación automática por error traslada el tráfico a un upstream saludable cuando un endpoint se degrada, que es como puedes probar un modelo totalmente nuevo sin apostar un lanzamiento a él.
Qué probar primero y qué ignorar
Tres comprobaciones te dirán más que cualquier ranking. Primero, pasa tu guion realista más largo por el límite de 10,000 caracteres y observa dónde quedan las costuras: el límite es por solicitud, y el diálogo con múltiples voces es la función que más probabilidades tiene de dividirse por él. Segundo, introduce cinco de tus propias frases con etiquetas tanto en v4 como en v4 Turbo y escucha si hay deriva en la adherencia entre el endpoint expresivo y el de baja latencia; son modelos separados, y una etiqueta que funciona en uno puede no funcionar igual en el otro. Tercero, calcula el precio de tu volumen real de caracteres mensual a $0.08 en lugar de $0.022, porque ese es el número con el que funcionará tu próximo trimestre.
La cifra de preferencia a ciegas del ~75 % en el anuncio es una medición de proveedor y no vamos a blanquearla para convertirla en otra cosa. La cifra independiente en este lanzamiento es la que está en la tabla: primer lugar con 1.319 Elo en 1.674 apariciones, y un intervalo de aproximadamente ±19 puntos alrededor de ella. Ese es un resultado sólido en una tabla real. No es una especificación, y no te dirá si tu sintaxis de etiquetas sobrevive a una pasada de traducción.
