Una tarjeta destacada generada para ElevenLabs Eleven v4 vs SpeechifyAI Simba 3.2 con dos tarjetas de puntuación: Eleven v4 con Elo 1,319, puesto 1 y $80.00 por 1 millón de caracteres; Simba 3.2 con Elo 1,240, puesto 7 y $6.58 por 1 millón de caracteres; con la leyenda '79 puntos de Elo frente a aproximadamente doce veces el precio'. Pie de página: 'Proveedor Voice Arena, según Artificial Analysis, septiembre de 2026.' El logotipo de OrcaRouter se encuentra en la esquina inferior derecha.
Guides & Insights

Eleven v4 vs Simba 3.2: la brecha de 79 puntos que cuesta doce veces más

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

En el Provider Voice Arena de Artificial Analysis, ElevenLabs Eleven v4 ocupa el primer lugar con un Elo de 1,319 y SpeechifyAI Simba 3.2 es séptimo con 1,240 — 79 puntos de diferencia, en una tabla donde los diez primeros apenas abarcan 113 puntos. Los precios no están ni de lejos tan cerca: $80.00 por millón de caracteres para el nuevo buque insignia de ElevenLabs, lanzado el 28 de septiembre de 2026, frente a $6.58 para Simba 3.2. Es una brecha de aproximadamente doce veces, y es la mayor diferencia entre precio y calidad entre dos modelos cualesquiera de los diez primeros. Que esa diferencia sea una ganga o una trampa depende enteramente de cuál de los dos estés reemplazando.

El tablero, leído correctamente

Las cifras que vale la pena llevar a una decisión no son solo los dos números principales. La posición en un tablero de preferencias es un blanco móvil; el intervalo alrededor de cada estimación es lo que te dice cuánto del orden es señal.

• ElevenLabs Eleven v4 — puesto 1, Elo 1.319, ±19, 1.674 apariciones, ocho voces de arena, 80,00 $ por millón de caracteres, lanzado el 28 de septiembre

• SpeechifyAI Simba 3.2 — puesto 7, Elo 1.240, ±14, 2.535 apariciones, ocho voces de arena, $6,58 por millón de caracteres, lanzado el 1 de julio de 2026

• SpeechifyAI Simba 3.0 — Elo 1,123, $6.58 por millón de caracteres, lanzado el 19 de febrero de 2026

A generated scoreboard comparing ElevenLabs Eleven v4 and SpeechifyAI Simba 3.2 across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 7 / 1,240), interval and samples (plus or minus 19 on 1,674 against plus or minus 14 on 2,535), board price ($80.00 against $6.58 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $6.58 per 1M unchanged), arena voices (8 against 8) and release date (September 28, 2026 against July 1, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis, Sept 2026.' The OrcaRouter logo sits in the bottom-right corner.

De eso se desprenden dos cosas. Primero, el intervalo de Eleventh v4 va aproximadamente de 1.300 a 1.338, y el de Simba 3.2 va de unos 1.226 a 1.254; los rangos están separados por unos 46 puntos de aire despejado, así que el orden no es una moneda al aire. Segundo, y más útil, Simba 3.2 mejoró exactamente 100 puntos de Elo con respecto a Simba 3.0 con un precio de tabla idéntico (1.240 frente a 1.140). SpeechifyAI lanzó una mejora generacional y no subió la tarifa, que es lo contrario de lo que hizo ElevenLabs con este lanzamiento.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard. ElevenLabs Eleven v4 is first at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices and $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276, Google Gemini 3.8 Flash TTS third at 1,267 and $16.5, Google Gemini 3.8 Flash-Lite TTS sixth at 1,241 and $11.0, and SpeechifyAI Simba 3.2 seventh at Elo 1,240 with an interval of plus or minus 14, 2,535 samples, eight arena voices, released Jul 2026 at $6.6 per 1M characters.

Lo que compra doce veces el precio, concretamente

El número Elo es la parte abstracta. Aquí está la parte que puedes poner en una línea de presupuesto. A cinco millones de caracteres al mes —aproximadamente 100 horas de habla finalizada—, la comparación se lee así:

• Eleven v4 durante la ventana de lanzamiento, a $0.022 por 1,000 caracteres — $110 al mes

• Eleven v4 a precio de lista, $0.08 por cada 1,000 caracteres después del 12 de octubre — $400 al mes

• Simba 3.2, al precio normalizado del consejo de 6,58 $ por millón — unos 33 $ al mes

• ElevenLabs Eleven v3, el anterior modelo insignia, a 0,08 $ por cada 1000 caracteres — 400 $ al mes

Durante dos semanas, la diferencia es de un factor de tres. Después del 12 de octubre, es de un factor de doce, y se mantiene ahí, porque los $80.00 por millón en el tablero son la tarifa de lista y no la promoción. Cualquier comparación escrita esta semana que cite la tarifa promocional como si fuera el precio permanente estará equivocada para mediados de octubre, y equivocada en la dirección que hace que ElevenLabs parezca barata.

Donde Simba 3.2 es la respuesta correcta

El séptimo en la tabla no es un mal modelo. Está por encima del Gemini 3.1 Flash TTS de Google, por encima del v3 Conversational de la propia ElevenLabs, con 1,197, y por encima del Sonic 3.5 de la generación anterior de Cartesia, con 1,185. Tres cargas de trabajo lo convierten en la elección obvia.

A screenshot of Artificial Analysis' Simba 3.2 model page, titled Simba 3.2 Quality Elo, Speed & Price Analysis, credited to SpeechifyAI with an Elo of 1,239.94. The Provider Voice Arena Preference Elo bar chart shows Simba 3.2 highlighted in blue at 1,240 in the middle of the row, with Eleven v4 at 1,319 at the left, and the model selector reads '27 of 96 models'.

El volumen de formato largo es lo primero. Los catálogos de audiolibros antiguos, los archivos de pódcast y las lecturas de accesibilidad se facturan por carácter y se juzgan por horas, no por segundos, y a 6,58 dólares por millón, el costo marginal de cien horas más es trivial de una manera en que nunca lo es a 80,00. La brecha de preferencia de 79 puntos es una diferencia que un oyente notaría en una comparación lado a lado; a lo largo de seis horas de narración, la mayoría de los oyentes nota menos la factura.

Las cargas de trabajo con reparto predeterminado son las segundas, y aquí es donde importa la construcción del ranking. Provider Voice mide a cada proveedor usando las voces propias de cada uno, así que el puesto de Simba 3.2 se ganó con ocho voces de arena que llevan su propio carácter. Si tu producto incluye la voz que el proveedor haya elegido, estás comprando exactamente lo que midió el ranking, y lo estás comprando a una séptima parte del precio de la alternativa mejor clasificada.

Las implementaciones de Simba ya integradas son la tercera. Si estás en Simba 3.0, la actualización a 3.2 son 100 puntos Elo por cero cambio en la tarifa y, presumiblemente, ningún cambio en la integración. Esa es la mejor jugada de relación precio-rendimiento de toda esta comparación, y no involucra ni a ElevenLabs ni a nosotros.

Donde las doce veces adicionales no son opcionales

La brecha que Simba 3.2 no cierra es la que la arena no puede puntuar. Dos diferencias de capacidad separan a estos modelos.

La dirección del guion es la más clara. Eleven v4 documenta etiquetas de audio integradas que te permiten escribir una interpretación en el texto — [se ríe], [susurra], [dicho con enojo y acento francés] — además de indicaciones de dirección en lenguaje natural y compatibilidad mejorada con el Alfabeto Fonético Internacional para pronunciaciones personalizadas. Reproducir eso en un modelo que no lo tiene significa una segunda toma, un editor humano o una voz diferente. Eso cuesta más por hora que el delta de caracteres.

La cobertura de idiomas es lo segundo. Eleven v4 documenta más de 90 idiomas frente a un límite de entrada de 10.000 caracteres. SpeechifyAI no publica un recuento equivalente para Simba 3.2 que hayamos podido verificar, así que trata la comparación como no demostrada a favor de ElevenLabs en lugar de como demostrada: si tu producto se distribuye en dos docenas de locales, confirma la cobertura en tu propia lista antes de asumir que cualquiera de los dos modelos tiene una voz para ellos.

Una tercera diferencia merece mencionarse porque es invisible en las tablas de clasificación: la clonación instantánea de Eleven v4 funciona a partir de diez segundos de audio. Si tu flujo de trabajo se basa en clonar a personas específicas en lugar de usar un elenco de voces de un proveedor, el umbral de duración de la muestra importa más que 79 puntos Elo, y es un dato específico de cada modelo que tienes que comprobar en lugar de una propiedad general de las API de voz.

La cuestión del enrutamiento, respondida con honestidad

Ni SpeechifyAI Simba 3.2 ni ningún modelo de ElevenLabs está en el catálogo de OrcaRouter. Aquí no hay nada que llamar a través de nosotros, y el lugar correcto para acceder a ambos es la propia API del proveedor: la de SpeechifyAI para Simba, la de ElevenLabs para Eleven v4. Preferimos decirlo con claridad antes que disfrazar una comparación como un argumento de venta.

Donde una sola clave realmente se justifica es en las dos semanas posteriores a un lanzamiento, cuando la respuesta sensata desde el punto de vista de la ingeniería es «ejecutar ambos con nuestros propios scripts y decidir a partir de eso». Hacerlo con dos proveedores normalmente implica dos cuentas, dos relaciones de facturación y dos formatos de solicitud antes de tener un solo punto de comparación. Una sola clave de API para más de 200 modelos con los precios de lista de los proveedores traspasados con un 0 % de recargo elimina ese coste de configuración, y la conmutación automática por error hace que el modelo que estás probando pueda situarse detrás de una ruta de producción sin convertirse en un punto único de fallo para ella.

Quién debería cambiar, y quién no debería moverse en absoluto

Cambia a Eleven v4 si la calidad de voz es el producto: si los usuarios oyen una voz predeterminada que no elegiste, si necesitas indicaciones de interpretación escritas en el guion, o si tu flujo de trabajo de clonación se mide en segundos de audio de origen. La brecha de 79 puntos es real y el delta de capacidad que hay detrás es mayor de lo que sugiere la cifra. Presupuesta $0.08 por cada 1000 caracteres, no $0.022.

Quédese en Simba 3.2 si produce en volumen: narración de formato largo, contenido de archivo, cualquier cosa en la que la tarifa por carácter se acumule a lo largo de horas de audio. Está renunciando a lo más alto de la tabla y conservando aproximadamente once doceavos del dinero. Y si está en Simba 3.0, actualice primero a 3.2 y vuelva a medir: 100 puntos Elo gratis son un mejor retorno que cualquier cosa que ofrezca cualquiera de los dos lados de esta comparación.

Lo que no deberías hacer es decidir basándote solo en este artículo. La limitación honesta de todo lo anterior es que la arena mide la preferencia ciega sobre voces de proveedores en un momento concreto, y la tarifa de ElevenLabs cambia el 12 de octubre. Vuelve a hacer los cálculos después de esa fecha, con tu propio recuento mensual de caracteres, antes de mover una ruta de producción.