
Eleven v4 vs Cartesia Sonic 3.6: una brecha de 43 puntos en Elo frente a una voz un 39 % más barata
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 982 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
ElevenLabs Eleven v4 se sitúa 43 puntos Elo por encima de Cartesia Sonic 3.6 en la Provider Voice Arena de Artificial Analysis —1.319 frente a 1.276—, y también se impone en el panel Controlled Voice, con un segundo puesto frente al cuarto de Sonic 3.6. Pierde en precio por un amplio margen, pero en la dirección contraria: 1.319 dólares frente a 49,00 dólares, y alrededor de nueve veces la tarifa por carácter durante la ventana de lanzamiento. Es uno de esos raros enfrentamientos en los que el marcador está claro y la decisión, aun así, no lo está, porque los dos modelos no compiten por el mismo trabajo.

Qué es cada modelo, en un párrafo cada uno
ElevenLabs Eleven v4 se lanzó el 28 de septiembre como el modelo insignia de síntesis de voz de la compañía, junto con Eleven v4 Turbo. La documentación le atribuye más de 90 idiomas, un límite de entrada de 10.000 caracteres por solicitud, diálogo con varios hablantes con identidad de hablante estable, soporte mejorado para fonemas IPA y directivas en línea que permiten escribir la forma de locución en el guion. La clonación de voz parte de diez segundos de audio para clones instantáneos, con un nivel profesional por encima de eso.
Cartesia Sonic 3.6 es la versión actual de una línea de modelos que Cartesia posiciona por su velocidad y naturalidad. Su propia página de producto lo califica como el modelo de texto a voz más rápido y natural, afirma una latencia inferior a 90 ms, funcionamiento multilingüe nativo en 44 idiomas, clonación de voz a partir de diez segundos de audio, diccionarios de pronunciación personalizados y un conjunto de cumplimiento que abarca HIPAA, SOC 2 Type 2, GDPR y PCI. Ambos proveedores publican cifras de latencia para sus propios modelos; ningún conjunto está verificado de forma independiente, y no se miden de la misma manera.
El marcador, dimensión por dimensión
• Preferencia a ciegas, las propias voces de cada proveedor — Eleven v4 puesto 1, Elo 1,319 vs Sonic 3.6 puesto 2, Elo 1,276. Una diferencia de 43 puntos.
• Preferencia a ciegas, voces clonadas emparejadas — Eleven v4 puesto 2, Elo 1.157 vs Sonic 3.6 puesto 4, Elo 1.138. Una brecha de 19 puntos, más estrecha que la primera.
• Normalización de precios de Arena, por millón de caracteres — Eleven v4 $80.00 frente a Sonic 3.6 $49.00. Sonic es un 39% más barato según el denominador común del tablero.
• Tarifa de proveedor, por cada mil caracteres — Eleven v4 $0.022 promocional, $0.08 después del 12 de octubre frente a Sonic 3.6 $0.049. Sonic es 39% más barato una vez finalizada la promoción.
• Cobertura de idiomas, documentada por el proveedor — Eleven v4 más de 90 frente a Sonic 3.6 44. Aproximadamente el doble.
• Límite de entrada por solicitud — Eleven v4 10.000 caracteres vs Sonic 3.6 no especificado en su página de producto.
• Latencia, según el proveedor — Eleven v4 Turbo, alrededor de 150 ms de mediana hasta el primer audio de voz, frente a Sonic 3.6, por debajo de 90 ms. Una vez más, pruebas distintas.
• Clonación de voz: ambos a partir de diez segundos de audio, ambos con un nivel profesional superior.
• Controles de enumeración — Eleven v4 documenta la entrada de fonemas IPA y un nivel de clonación profesional; Sonic 3.6 documenta diccionarios de pronunciación personalizados.
• Postura de cumplimiento — Sonic 3.6 declara HIPAA, SOC 2 Type 2, GDPR y PCI. ElevenLabs declara su cumplimiento por separado de la página del modelo y no coloca una lista equivalente junto a v4.

Dos de esas filas son las que deciden los proyectos reales. La diferencia de Elo es de 43 puntos en el panel de voces del proveedor y de 17 en el panel de voces clonadas: la línea de Sonic se cierra en más de la mitad cuando los hablantes se mantienen constantes. Esa es la firma de un modelo cuyo ajuste es competitivo y cuyo elenco de voces predeterminado no lo es, y te dice que el problema de Sonic en este enfrentamiento es de presentación y no de calidad de síntesis.
Por qué la diferencia de precio es más pequeña de lo que parece
La comparación de tarifas destacada es engañosa en ambos sentidos. Los $0,022 por cada mil caracteres de Eleven v4 son una cifra promocional con fecha de caducidad del 12 de octubre; la cifra que sobrevive a esa ventana es $0,08, más de un 60 % por encima del tarifario de Sonic 3.6. Pero la normalización de la arena no se preocupa por la promoción: fija el precio de los modelos según sus tarifas de lista y da como resultado $80,00 frente a $49,00, que es la comparación que seguirá siendo válida en noviembre.
Hay un segundo matiz. Cartesia no publica una tarifa por carácter en su página de producto, por lo que la cifra de $0.049 proviene de la normalización de la arena y no del proveedor, y es posible que los dos medidores no coincidan exactamente: la normalización hace suposiciones sobre cómo factura un proveedor. Trata el orden como fiable y los porcentajes precisos como aproximados.
Un mes calculado con cinco millones de caracteres: Eleven v4 con la tarifa promocional cuesta $110, y $400 después del 12 de octubre. Sonic 3.6 cuesta $245. Así que durante las próximas dos semanas, Eleven v4 cuesta menos de la mitad que Sonic, y después de eso cuesta un 63% más. Cualquiera que redacte hoy una comparación de adquisiciones y la entregue el mes que viene lo entenderá al revés, a menos que diga qué tarifa usó.
El segmento donde Sonic 3.6 es la respuesta correcta
Existen cargas de trabajo de voz en producción en las que los rankings de la arena no miden lo que realmente importa, y Sonic 3.6 está diseñado para ellas.
Los agentes conversacionales en tiempo real son el caso más claro. Una latencia inferior a 90 ms no es una cifra de marketing en un agente telefónico; es la diferencia entre que una interrupción se sienta atendida y que se sienta como una llamada cortada, y ElevenLabs no publica ninguna cifra equivalente para el propio Eleven v4 —solo para el nivel Turbo, con aproximadamente 150 ms de mediana hasta la primera locución. Si el presupuesto de sockets de tu agente es ajustado, los 43 puntos Elo pueden valer menos para ti que los milisegundos, y tus propias pruebas de barge-in lo resolverán más rápido que cualquier tabla de clasificación.
El despliegue regulado es el segundo. Cartesia declara HIPAA, SOC 2 Tipo 2, GDPR y PCI en la página del producto. Una lista de cumplimiento no es un Elo ni puede sustituirse por uno; si un revisor de salud o de pagos está en tu ruta de lanzamiento, esa fila del marcador pesa más que las otras nueve.

La pronunciación determinista es la tercera, y es más sutil. La entrada documentada de fonemas IPA de Eleven v4 es una fortaleza, pero los diccionarios de pronunciación personalizados de Sonic 3.6 son el flujo de trabajo que los equipos con grandes vocabularios de nombres de productos suelen haber creado ya. Portar un diccionario es trabajo real; el modelo que consume el artefacto que ya posees tiene ventaja.
Donde Eleven v4 es simplemente el mejor modelo
Dicho todo esto, los rankings miden algo y Eleven v4 ganó ambos. En Provider Voice, le lleva a Sonic 3.6 una ventaja de 43 puntos, con 1.674 muestras que respaldan la estimación, y el anterior buque insignia —ElevenLabs Eleven v3 con 1.169— se sitúa 107 puntos por detrás de Sonic 3.6, lo que significa que ElevenLabs cerró una brecha real en una sola generación en lugar de defender una ventaja.
El número de idiomas es la segunda victoria indiscutible. Más de 90 frente a 44 es aproximadamente el doble, y para un producto que se distribuye más allá del inglés y un puñado de idiomas europeos, eso es una cuestión de cobertura más que de calidad: es posible que Sonic 3.6 no tenga ninguna voz para algunas de tus configuraciones regionales. Y la gestión de diálogos con varios hablantes junto con las directivas de interpretación en línea son una diferencia de capacidad real: escribir una risa en el guion es un flujo de trabajo que Sonic 3.6 no documenta, y reproducir ese efecto en un modelo que carece de ello implica posprocesamiento o una segunda toma, lo que cuesta más de lo que sugiere la diferencia de Elo.
Ejecutar cualquiera de los dos, y la parte con la que no podemos ayudar
OrcaRouter no aloja ninguno de estos modelos. ElevenLabs y Cartesia no están en nuestro catálogo, así que nada de esta comparación puede llamarse a través de nosotros, y la respuesta honesta a «¿cómo lo consigo en OrcaRouter?» es que no puedes: acudes al proveedor. Lo que sí gestionamos es el caso en que un stack de voz acaba abarcando varios proveedores en lugar de uno solo: una única clave de API para más de 200 modelos, con los precios de lista de los proveedores trasladados con un margen del 0%, de modo que un cambio de precio de un proveedor está activo en nuestro lado el mismo día en que entra en vigor. Para una decisión que depende de si pagas 110 $ o 400 $ por los caracteres de un mismo mes, ese detalle de tiempo no es poca cosa.
Cuando una ruta de voz está orientada al cliente y no puede caerse, la conmutación por error automática traslada el tráfico a un upstream saludable cuando uno se degrada. Ese es el patrón que hace que valga la pena aprovechar una ventana promocional de dos semanas: puedes apuntar producción al modelo más barato durante quince días sin reescribir la integración, y volver atrás cuando la tarifa se revierta.
Quién debería cambiar, y quién debería esperar
Cambia a Eleven v4 si tu producto se juzga por cómo suena, si lo lanzas en más de un par de docenas de idiomas, o si tus usuarios escuchan la voz que el proveedor haya elegido para ellos; ese último grupo es exactamente al que representa el panel Provider Voice, y la brecha allí es la mayor de cualquier fila.
Quédese con Sonic 3.6 si ejecuta conversación en tiempo real con un presupuesto de latencia, si un revisor de cumplimiento da el visto bueno a su stack, o si tiene un diccionario de pronunciación que no puede permitirse reconstruir. En esas tres filas, Sonic no está por detrás; es la única opción con una respuesta publicada.
Espera: en cualquiera de los dos casos, si tu decisión depende del precio. Dentro de dos semanas, la tarifa de Eleven v4 cambia en un factor de casi cuatro y la de Sonic 3.6 no, y una comparación escrita hoy se leerá como incorrecta a mediados de octubre. El orden Elo seguirá siendo válido. El dinero no.
