
Eleven v4 vs Cartesia Sonic 3.6 : un écart Elo de 43 points contre une voix 39 % moins chère
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 982 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 195 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
ElevenLabs Eleven v4 se situe 43 points Elo au-dessus de Cartesia Sonic 3.6 sur le Provider Voice Arena d’Artificial Analysis — 1 319 à 1 276 — et il remporte aussi le classement Controlled Voice, en deuxième position contre la quatrième place de Sonic 3.6. Il perd en revanche sur le prix, avec un large écart en sens inverse : 80,00 $ par million de caractères contre 49,00 $, et environ neuf fois le tarif par caractère sur les grilles tarifaires des fournisseurs eux-mêmes pendant la fenêtre de lancement. C’est l’un de ces rares duels où le tableau de scores est limpide et où la décision ne l’est pas pour autant, car les deux modèles ne sont pas vraiment en concurrence pour la même tâche.

Ce qu’est chaque modèle, en un paragraphe chacun
ElevenLabs Eleven v4 est sorti le 28 septembre en tant que modèle phare de synthèse vocale de l'entreprise, aux côtés d'Eleven v4 Turbo. La documentation lui attribue plus de 90 langues, une limite de 10 000 caractères en entrée par requête, un dialogue multi-locuteurs avec une identité de locuteur stable, une prise en charge améliorée des phonèmes IPA et des directives en ligne qui permettent d'intégrer l'interprétation dans le script. Le clonage vocal fonctionne à partir de dix secondes d'audio pour des clones instantanés, avec un niveau professionnel au-dessus.
Cartesia Sonic 3.6 est la version actuelle d'une gamme de modèles que Cartesia positionne sur la vitesse et le naturel. Sa propre page produit le qualifie de modèle de synthèse vocale le plus rapide et le plus naturel, revendique une latence inférieure à 90 ms, un fonctionnement nativement multilingue dans 44 langues, le clonage vocal à partir de dix secondes d'audio, des dictionnaires de prononciation personnalisés et un ensemble de conformité couvrant HIPAA, SOC 2 Type 2, le RGPD et PCI. Les deux fournisseurs publient des chiffres de latence pour leurs propres modèles ; aucun des deux ensembles n'est vérifié de manière indépendante, et ils ne sont pas mesurés de la même manière.
Le tableau des scores, dimension par dimension
• Préférence à l'aveugle, les voix propres à chaque fournisseur — Eleven v4 rang 1, Elo 1 319 vs Sonic 3.6 rang 2, Elo 1 276. Un écart de 43 points.
• Préférence à l'aveugle, voix clonées appariées — Eleven v4 rang 2, Elo 1 157 vs Sonic 3.6 rang 4, Elo 1 138. Un écart de 19 points, plus serré que le premier.
Normalisation des prix de l’Arena, par million de caractères — Eleven v4 80,00 $ contre Sonic 3.6 49,00 $. Sonic est 39 % moins cher selon le dénominateur commun du classement.
• Grille tarifaire du fournisseur, pour mille caractères — Eleven v4 0,022 $ en promotion, 0,08 $ après le 12 octobre, contre Sonic 3.6 0,049 $. Une fois la promotion terminée, Sonic est 39 % moins cher.
• Couverture linguistique, documentée par le fournisseur — Eleven v4 plus de 90 contre Sonic 3.6 44. Environ le double.
• Plafond d’entrée par requête — Eleven v4 : 10 000 caractères, contre Sonic 3.6 : non indiqué sur sa page produit.
• Latence, annoncée par le fournisseur — Eleven v4 Turbo environ 150 ms en médiane jusqu’à la première parole, contre Sonic 3.6 sous les 90 ms. Là encore, des tests différents.
• Clonage vocal — les deux à partir de dix secondes d'audio, tous deux avec un palier professionnel supérieur.
• Contrôles d'énumération — Eleven v4 documente la saisie de phonèmes IPA et un niveau de clonage professionnel ; Sonic 3.6 documente les dictionnaires de prononciation personnalisés.
• Posture de conformité — Sonic 3.6 déclare HIPAA, SOC 2 Type 2, RGPD et PCI. ElevenLabs communique ses informations de conformité séparément de la page du modèle et n’affiche pas de liste correspondante à côté de v4.

Deux de ces lignes sont celles qui décident des projets réels. L’écart Elo est de 43 points dans le classement des voix de fournisseur et de 19 dans celui des voix clonées — l’écart de la ligne Sonic se réduit de plus de moitié lorsque les locuteurs sont maintenus constants. C’est la signature d’un modèle dont le réglage est compétitif et dont le casting vocal par défaut ne l’est pas, et cela vous dit que le problème de Sonic dans cette confrontation est la présentation plutôt que la qualité de synthèse.
Pourquoi l’écart de prix est plus petit qu’il n’y paraît
La comparaison des tarifs mise en avant est trompeuse dans les deux sens. Les 0,022 $ pour mille caractères d’Eleven v4 sont un chiffre promotionnel dont la date d’expiration est le 12 octobre ; le chiffre qui subsiste après cette fenêtre est de 0,08 $, soit plus de 60 % au-dessus de la grille tarifaire de Sonic 3.6. Mais la normalisation de l’arène ne tient pas compte de la promotion : elle évalue les modèles à leurs tarifs catalogue et aboutit à 80,00 $ contre 49,00 $, ce qui est la comparaison qui restera vraie en novembre.
Il y a un second écueil. Cartesia ne publie pas de tarif par caractère sur sa page produit, donc le chiffre de 0,049 $ provient de la normalisation de l’arena plutôt que du fournisseur, et les deux compteurs peuvent ne pas concorder exactement — la normalisation repose sur des hypothèses quant à la façon dont un fournisseur facture. Considérez l’ordre comme fiable et les pourcentages précis comme approximatifs.
Un mois calculé à cinq millions de caractères : Eleven v4 au tarif promotionnel coûte 110 $, puis 400 $ après le 12 octobre. Sonic 3.6 coûte 245 $. Ainsi, pendant les deux semaines à venir, Eleven v4 coûte moins de la moitié du prix de Sonic, et ensuite 63 % de plus. Toute personne qui rédige aujourd'hui un comparatif d'approvisionnement et le diffuse le mois prochain obtiendra l'inverse, à moins de préciser quel tarif elle a utilisé.
Le segment où Sonic 3.6 est la bonne réponse
Il existe des charges de travail vocales en production pour lesquelles les classements de l’arène ne mesurent pas ce qui compte, et Sonic 3.6 est conçu pour elles.
Les agents conversationnels en temps réel en sont le cas le plus évident. Une latence inférieure à 90 ms n’est pas un chiffre marketing dans un agent téléphonique ; c’est la différence entre une interruption qui semble gérée et une interruption qui ressemble à un appel coupé, et ElevenLabs ne publie aucun chiffre équivalent pour Eleven v4 lui-même — seulement pour l’offre Turbo, à environ 150 ms en médiane jusqu’à la première parole. Si le budget de sockets de votre agent est serré, les 43 points Elo peuvent valoir moins à vos yeux que les millisecondes, et vos propres tests de barge-in trancheront plus vite que n’importe quel classement.
Le déploiement réglementé est le deuxième. Cartesia déclare HIPAA, SOC 2 Type 2, le RGPD et PCI sur la page produit. Une liste de conformité n’est pas un Elo, et un Elo ne peut pas la remplacer ; si un évaluateur du secteur de la santé ou des paiements intervient dans votre processus de mise en production, cette ligne du tableau des scores l’emporte sur les neuf autres.

La prononciation déterministe est la troisième, et elle est plus subtile. L'entrée phonémique IPA documentée d'Eleven v4 est un atout, mais les dictionnaires de prononciation personnalisés de Sonic 3.6 sont le flux de travail que les équipes disposant de vastes vocabulaires de noms de produits ont tendance à déjà avoir construit. Porter un dictionnaire représente un vrai travail ; le modèle qui exploite l'artefact que vous possédez part avec une longueur d'avance.
Là où Eleven v4 est tout simplement le meilleur modèle
Cela dit, les classements mesurent quelque chose et Eleven v4 a remporté les deux. Sur Provider Voice, il devance Sonic 3.6 de 43 points, avec 1 674 échantillons à l’appui de l’estimation, et le précédent modèle phare — ElevenLabs Eleven v3 à 1 169 — se situe 107 points derrière Sonic 3.6, ce qui signifie qu’ElevenLabs a comblé un véritable écart en une seule génération plutôt que de défendre une avance.
Le nombre de langues est la deuxième victoire incontestable. Plus de 90 contre 44, c’est à peu près le double, et pour un produit commercialisé au-delà de l’anglais et d’une poignée de langues européennes, c’est une question de couverture plutôt que de qualité — Sonic 3.6 pourrait bien n’avoir aucune voix pour certaines de vos locales. Et la gestion des dialogues multi-locuteurs ainsi que les directives de diction intégrées constituent une véritable différence de capacités : écrire un rire dans le script est un flux de travail que Sonic 3.6 ne documente pas, et reproduire cet effet sur un modèle qui en est dépourvu implique un post-traitement ou une seconde prise, ce qui coûte plus cher que ne le suggère l’écart Elo.
Exécuter l'un ou l'autre, et la partie que nous ne pouvons pas prendre en charge
OrcaRouter n'héberge aucun de ces modèles. ElevenLabs et Cartesia ne figurent pas dans notre catalogue, donc rien dans cette comparaison ne peut être appelé via nous, et la réponse honnête à « comment l'obtenir sur OrcaRouter » est que c'est impossible — vous devez vous adresser au fournisseur. Ce que nous gérons, c'est le cas où une pile vocale finit par s'étendre sur plusieurs fournisseurs plutôt qu'un seul : une seule clé API pour plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés à 0 % de marge afin qu'un changement de prix d'un fournisseur soit effectif de notre côté le jour même où il prend effet. Pour une décision qui repose sur le fait de savoir si vous payez 110 $ ou 400 $ pour les caractères d'un même mois, ce facteur temporel n'est pas négligeable.
Lorsqu'un chemin vocal est exposé au client et ne peut pas être interrompu, la bascule automatique transfère le trafic vers un amont sain lorsque l'un d'eux se dégrade. C'est le schéma qui rend intéressant d'exploiter une fenêtre promotionnelle de deux semaines : vous pouvez diriger la production vers le modèle moins cher pendant quinze jours sans réécrire l'intégration, puis revenir en arrière lorsque le tarif revient à la normale.
Qui devrait basculer, et qui devrait attendre
Passez à Eleven v4 si votre produit est jugé sur sa qualité sonore, si vous le déployez dans plus de deux douzaines de langues, ou si vos utilisateurs entendent la voix que le fournisseur a choisie pour eux — ce dernier groupe est exactement celui que le tableau Provider Voice représente, et l’écart y est le plus important de toutes les lignes.
Restez sur Sonic 3.6 si vous faites tourner des conversations en temps réel sous contrainte de budget de latence, si un auditeur de conformité donne son aval à votre stack, ou si vous avez un dictionnaire de prononciation que vous ne pouvez pas vous permettre de reconstruire. Sur ces trois lignes, Sonic n’est pas en retard ; c’est la seule option avec une réponse publiée.
Attendez : dans un cas comme dans l'autre, si votre décision dépend du prix. Dans deux semaines, la grille tarifaire d'Eleven v4 changera d'un facteur de près de quatre, alors que celle de Sonic 3.6 ne bougera pas, et une comparaison rédigée aujourd'hui paraîtra fausse d'ici la mi-octobre. Le classement Elo tiendra toujours. L'argent, non.
