Une carte hero générée pour ElevenLabs Eleven v4 vs SpeechifyAI Simba 3.2 avec deux cartes de score : Eleven v4 à l'Elo 1 319, rang 1 et 80,00 $ par million de caractères ; Simba 3.2 à l'Elo 1 240, rang 7 et 6,58 $ par million de caractères ; avec pour légende « 79 points d'Elo contre environ douze fois le prix ». Pied de page : « Fournisseur : Voice Arena, d'après Artificial Analysis, septembre 2026. » Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Eleven v4 vs Simba 3.2 : l’écart de 79 points qui coûte douze fois plus cher

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Sur la Provider Voice Arena d'Artificial Analysis, ElevenLabs Eleven v4occupe la première place avec un Elo de 1 319 et SpeechifyAI Simba 3.2la septième avec 1 240 — 79 points d'écart, sur un classement où les dix premiers s'étalent sur à peine 113 points. Les prix, eux, sont loin d'être aussi proches : 80,00 $ par million de caractères pour le nouveau fleuron d'ElevenLabs, sorti le 28 septembre 2026, contre 6,58 $ pour Simba 3.2. Soit un écart d'environ douze fois, et c'est le plus grand écart prix-qualité entre deux modèles du top dix. Que cet écart soit une bonne affaire ou un piège dépend entièrement duquel des deux on remplace.

Le tableau, lu correctement

Les chiffres qu’il vaut la peine d’emporter dans une décision ne sont pas les deux chiffres phares à eux seuls. Le rang sur un tableau de préférences est une cible mouvante ; l’intervalle autour de chaque estimation est ce qui vous dit quelle part du classement relève du signal.

• ElevenLabs Eleven v4 — rang 1, Elo 1 319, ±19, 1 674 apparitions, huit voix d’arène, 80,00 $ par million de caractères, sorti le 28 septembre 2026

• SpeechifyAI Simba 3.2 — rang 7, Elo 1 240, ±14, 2 535 apparitions, huit voix d’arène, 6,58 $ par million de caractères, sorti le 1er juillet 2026

• SpeechifyAI Simba 3.0 — Elo 1 123, 6,58 $ par million de caractères, sorti le 19 février 2026

A generated scoreboard comparing ElevenLabs Eleven v4 and SpeechifyAI Simba 3.2 across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 7 / 1,240), interval and samples (plus or minus 19 on 1,674 against plus or minus 14 on 2,535), board price ($80.00 against $6.58 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $6.58 per 1M unchanged), arena voices (8 against 8) and release date (September 28, 2026 against July 1, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis, Sept 2026.' The OrcaRouter logo sits in the bottom-right corner.

Deux choses en ressortent. Premièrement, l’intervalle d’Eleventh v4 se situe à peu près entre 1 300 et 1 338, et celui de Simba 3.2 entre environ 1 226 et 1 254 ; les plages sont séparées par environ 46 points d’écart net, donc l’ordre n’est pas une simple question de pile ou face. Deuxièmement, et plus utilement, Simba 3.2 a gagné exactement 100 points Elo par rapport à Simba 3.0 pour un prix de plateau identique (1 240 contre 1 140). SpeechifyAI a livré un gain générationnel sans augmenter son tarif, soit l’inverse de ce qu’ElevenLabs a fait avec ce lancement.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard. ElevenLabs Eleven v4 is first at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices and $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276, Google Gemini 3.8 Flash TTS third at 1,267 and $16.5, Google Gemini 3.8 Flash-Lite TTS sixth at 1,241 and $11.0, and SpeechifyAI Simba 3.2 seventh at Elo 1,240 with an interval of plus or minus 14, 2,535 samples, eight arena voices, released Jul 2026 at $6.6 per 1M characters.

Ce que l’on obtient pour douze fois le prix, concrètement

Le chiffre Elo est la partie abstraite. Voici la partie que vous pouvez mettre dans une ligne budgétaire. À cinq millions de caractères par mois — environ 100 heures de parole finalisée — la comparaison se présente comme ceci :

• Eleven v4 pendant la période de lancement, à 0,022 $ pour 1 000 caractères — 110 $ par mois

• Eleven v1 au tarif catalogue, 0,08 $ pour 1 000 caractères après le 12 octobre — 400 $ par mois

• Simba 3.2, au tarif normalisé du conseil de 6,58 $ par million — environ 33 $ par mois

• ElevenLabs Eleven v3, le précédent modèle phare, à 0,08 $ pour 1 000 caractères — 400 $ par mois

Pendant deux semaines, l'écart est d'un facteur trois. Après le 12 octobre, il est d'un facteur douze, et il reste à ce niveau, car les 80,00 $ par million affichés sont le tarif catalogue plutôt que la promotion. Toute comparaison rédigée cette semaine qui cite le tarif promotionnel comme s'il s'agissait du prix en vigueur sera erronée d'ici la mi-octobre, et erronée dans le sens qui fait paraître ElevenLabs bon marché.

Où Simba 3.2 est la bonne réponse

Septième au classement n’est pas un mauvais modèle. Il se situe au-dessus de Gemini 3.1 Flash TTS de Google, au-dessus de v3 Conversational d’ElevenLabs à 1 197, et au-dessus de Sonic 3.5 de génération précédente de Cartesia à 1 185. Trois charges de travail en font le choix évident.

A screenshot of Artificial Analysis' Simba 3.2 model page, titled Simba 3.2 Quality Elo, Speed & Price Analysis, credited to SpeechifyAI with an Elo of 1,239.94. The Provider Voice Arena Preference Elo bar chart shows Simba 3.2 highlighted in blue at 1,240 in the middle of the row, with Eleven v4 at 1,319 at the left, and the model selector reads '27 of 96 models'.

Le volume de contenu long format vient en premier. Les catalogues de livres audio, les archives de podcasts et les lectures d’accessibilité sont facturés au caractère et jugés sur des heures, pas des secondes, et à 6,58 $ par million, le coût marginal de cent heures supplémentaires est négligeable comme il ne l’est jamais à 80,00 $. L’écart de préférence de 79 points est une différence qu’un auditeur remarquerait dans une comparaison côte à côte ; sur six heures de narration, la plupart des auditeurs remarquent moins la facture.

Les charges de travail à distribution par défaut arrivent en deuxième position, et c'est là que la construction du classement importe. Provider Voice évalue chaque fournisseur à l'aide de ses propres voix, de sorte que le rang de Simba 3.2 a été obtenu avec huit voix d'arène portant son propre caractère. Si votre produit embarque la voix que le fournisseur a choisie, vous achetez exactement ce que le classement a mesuré, et vous l'achetez pour un septième du prix de l'alternative la mieux classée.

Les déploiements Simba déjà intégrés arrivent en troisième position. Si vous êtes sur Simba 3.0, la mise à niveau vers 3.2 apporte 100 points Elo pour zéro changement de tarif et, vraisemblablement, aucun changement d'intégration. C'est le meilleur choix prix-performance de toute cette comparaison, et il ne fait intervenir ni ElevenLabs ni nous.

Là où les douze fois supplémentaires ne sont pas facultatives

L'écart que Simba 3.2 ne comble pas est celui que l'arène ne peut pas mesurer. Deux différences de capacités séparent ces modèles.

La direction de script est la plus claire. Eleven v4 documente des balises audio intégrées qui vous permettent d'écrire une performance dans le texte — [rires], [chuchote], [dit avec colère avec un accent français] — ainsi que des consignes de direction en langage naturel et une prise en charge améliorée de l'alphabet phonétique international pour les prononciations personnalisées. Reproduire cela sur un modèle qui n'en dispose pas implique une seconde prise, un monteur humain ou une voix différente. Ces solutions coûtent plus cher par heure que le delta de caractères.

La couverture linguistique vient en second. Eleven v4 documente plus de 90 langues face à un plafond d’entrée de 10 000 caractères. SpeechifyAI ne publie pas de chiffre équivalent pour Simba 3.2 que nous puissions vérifier, donc considérez la comparaison comme non prouvée en faveur d’ElevenLabs plutôt que comme prouvée : si votre produit est disponible dans une vingtaine de locales, vérifiez la couverture sur votre propre liste avant de supposer que l’un ou l’autre modèle dispose d’une voix pour celles-ci.

Une troisième différence mérite d’être nommée, car elle est invisible dans les classements : le clonage instantané d’Eleven v4 fonctionne à partir de dix secondes d’audio. Si votre flux de travail repose sur le clonage de personnes précises plutôt que sur l’utilisation d’un casting de fournisseur, le seuil de longueur d’échantillon compte davantage que 79 points Elo, et c’est un fait propre à chaque modèle que vous devez vérifier plutôt qu’une propriété générale des API vocales.

La question du routage, traitée honnêtement

Ni SpeechifyAI Simba 3.2 ni aucun modèle ElevenLabs ne figure dans le catalogue OrcaRouter. Il n’y a rien ici à appeler par notre intermédiaire, et le bon endroit pour accéder aux deux est l’API propre au fournisseur — celle de SpeechifyAI pour Simba, celle d’ElevenLabs pour Eleven v4. Nous préférons le dire clairement plutôt que de déguiser une comparaison en argumentaire de vente.

Le moment où une clé unique vaut vraiment le coup, c'est la quinzaine qui suit un lancement, quand la réponse d'ingénierie raisonnable est « exécutez les deux sur nos propres scripts et décidez à partir de là ». Le faire avec deux fournisseurs implique normalement deux comptes, deux relations de facturation et deux formats de requête avant d'avoir un seul point de comparaison. Une seule clé API pour plus de 200 modèles avec les prix catalogue des fournisseurs répercutés à 0 % de marge, supprime ce coût de mise en place, et le basculement automatique signifie que le modèle que vous testez peut se trouver derrière un chemin de production sans devenir un point de défaillance unique pour celui-ci.

Qui devrait changer, et qui ne devrait pas bouger du tout

Passez à Eleven v4 par défaut si la qualité vocale est le produit : si les utilisateurs entendent une voix par défaut que vous n'avez pas choisie, si vous avez besoin d'indications de performance écrites dans le script, ou si votre flux de travail de clonage se mesure en secondes d'audio source. L'écart de 79 points est réel et le delta de capacité qu'il représente est plus important que le nombre ne le suggère. Prévoyez un budget de 0,08 $ par 1 000 caractères, pas 0,022 $.

Restez sur Simba 3.2 si vous produisez en volume : narration longue durée, contenu d’archives, tout ce où le tarif au caractère se cumule sur des heures d’audio. Vous renoncez au sommet du classement et conservez environ onze douzièmes de l’argent. Et si vous êtes sur Simba 3.0, passez d’abord à 3.2 et remesurez — 100 points Elo pour rien, c’est un meilleur rendement que tout ce que propose l’un ou l’autre côté de cette comparaison.

Ce qu’il ne faut pas faire, c’est décider à partir de cet article seul. La limitation honnête de tout ce qui précède, c’est que l’arène mesure la préférence à l’aveugle sur les voix de fournisseurs à un moment donné, et que la grille tarifaire d’ElevenLabs change le 12 octobre. Refaites le calcul après cette date, avec votre propre nombre mensuel de caractères, avant de basculer un flux de production.