Une carte hero pour « ElevenLabs Eleven v4 vs Sesame Preview » avec deux cartes contrastées : ElevenLabs Eleven v4 décrit comme « un modèle que vous pouvez acheter », « API en direct, sur une grille tarifaire publiée », « Arena Elo 1 319, rang 1 » ; Sesame Preview décrit comme « une démo avec laquelle vous pouvez parler », « web uniquement, aucun endpoint à appeler », « absent de tout tableau d'arène » ; avec la légende « deux catégories, pas deux options ». Pied de page : « Pages fournisseurs et artificialanalysis.ai, sept. 2026. » Le logo OrcaRouter figure dans le coin inférieur droit.
Guides & Insights

Eleven v4 vs Sesame Preview : ce n’est pas la comparaison que vous croyez

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Rechercher ElevenLabs Eleven v4 face à Sesame Preview fait remonter une multitude de pages qui s'empresseront de les mettre dans un tableau. Presque toutes comparent un produit à un benchmark face à une démo, et le tableau est l'élément le moins utile de la page. Eleven v4 est un modèle de synthèse vocale en disponibilité générale, avec une API, une grille tarifaire et un classement d'arène publié. Sesame Preview est un assistant vocal grand public gratuit qui répond quand on clique sur un lien. Ce ne sont pas deux options pour le même achat, et la version honnête de cet article porte sur celui que vous voulez réellement — car la réponse dépend d'une question qu'aucune page marketing des deux fournisseurs ne pose.

A two-column card for ElevenLabs Eleven v4 and Sesame Preview. Eleven v4: model identifier Eleven v4; live API; $0.022 per 1K until Oct 12; Arena Elo 1,319 at rank 1; 10,000-character input cap; 90-plus languages. Sesame Preview: no announced model identifier; web demo only; free and not purchasable; not on any arena board; sessions capped around 30 minutes; English only. Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; Sesame Preview per its own site.'

Ce qu'est réellement Eleven v4

ElevenLabs a livré Eleven v4 et Eleven v4 Turbo le 28 septembre en tant qu’endpoints de production. Eleven v4 prend en charge plus de 90 langues, une limite de 10 000 caractères par requête, le dialogue multi-locuteur avec une identité de locuteur stable, des directives d’élocution en ligne, une prise en charge améliorée des phonèmes IPA et le clonage vocal instantané à partir de dix secondes d’audio. Il se classe premier sur le Provider Voice Arena d’Artificial Analysis avec un Elo de 1 319 et 1 674 échantillons à l’appui de l’estimation, et deuxième sur le tableau Controlled Voice avec 1 157. Sur la grille tarifaire de l’API, il est affiché à 0,022 $ pour mille caractères pendant une promotion qui se termine le 12 octobre, avant de revenir à 0,08 $ — le même tarif que celui appliqué par l’ElevenLabs Eleven v3 précédent.

Chaque élément de ce paragraphe est vérifiable. Il y a un identifiant de modèle, une limite d’entrée documentée, un prix publié par caractère, une note de dépréciation pour les anciens paliers Turbo, et une entrée indépendante dans un classement avec un intervalle de confiance. Voilà à quoi ressemble un modèle quand on peut l’acheter.

A screenshot of ElevenLabs' blog post announcing Eleven v4, captured in English and dated Sep 28, 2026, headed 'Introducing Eleven v4, our most emotive model' and credited to Mati Staniszewski and Piotr Dabkowski, showing the site-wide 'Introducing Eleven v4, our fastest and most emotive voice model' banner, a 'Listen to this article 10:32' control, the line 'Ranked #1 by Artificial Analysis, and preferred by ~75% of listeners in blind head-to-head tests over competing models', and a left-hand section list running from 'A new architecture built for performance' to 'Hear the difference for yourself'.

Ce qu'est réellement Sesame Preview

Sesame Preview est une démonstration grand public. C'est un assistant vocal auquel vous accédez via le site de l'entreprise, avec une petite distribution de voix nommées — Maya, Miles, Simone et Charlie — une mémoire conversationnelle qui persiste, le web, des notes et des rappels, et un résumé après l'appel. C'est gratuit. Les sessions connectées durent environ une demi-heure ; les sessions invitées, environ cinq minutes. Il ne prend en charge que l'anglais. Et Sesame indique clairement qu'il n'exécute pas de tâches : l'intérêt de la démo réside dans la texture conversationnelle, pas dans un agent qui réserve votre rendez-vous.

L’élément qui compte pour cette comparaison, c’est ce qui manque. Il n’y a pas d’identifiant de modèle, pas de point de terminaison, pas de grille tarifaire, pas de limite d’entrée sur laquelle concevoir, et aucune date annoncée pour le modèle de production. La ligne de recherche publiée de Sesame est une chose distincte — un modèle de parole conversationnel à poids ouverts avec un contexte de 4K — et ce n’est pas le même système que celui auquel vous parlez dans la Preview. Donc ce qui est nommé « Sesame Preview » sur chaque tableau comparatif est un produit avec lequel vous ne pouvez pas vous intégrer, et ce que vous pouvez télécharger n’est pas le produit.

Pourquoi ne peuvent-ils pas partager un tableau de scores

L'arène de la voix contrôlée sur Artificial Analysis est ce qui se rapproche le plus d'une mesure neutre dans ce domaine, et Sesame Preview n'y figure pas. Il n'est pas non plus sur le tableau des voix des fournisseurs. Il n'y a ni Elo, ni nombre de votes, ni normalisation des prix — et aucun moyen d'en produire une, car un classement nécessite un point de terminaison appelable et un prix par unité, et Sesame Preview n'a ni l'un ni l'autre.

Donc, tout tableau qui place ces deux éléments côte à côte remplit la colonne Sesame à partir d'une visite guidée du produit. Comparer un endpoint à 80 $ par million de caractères à une démo web gratuite sur la « naturalité » n'est pas une comparaison ; c'est une erreur de catégorie avec un trou en forme d'Elo dedans. Si une page déclare un gagnant dans cette confrontation, elle a inventé le fondement de cette affirmation.

Ce qu’on peut dire honnêtement, c’est ce que chacun essaie d’être. Eleven v4 est optimisé pour transformer un script en une performance, à grande échelle, via une API, avec la même voix à chaque fois. Sesame Preview est optimisé pour donner à un inconnu l’impression de parler à quelqu’un, une fois, dans un onglet de navigateur.

Le seul endroit où la comparaison est réelle

Il y a une vraie question sous-jacente à cette recherche, et elle porte sur les poids ouverts. Si ce que vous voulez vraiment, c’est un modèle vocal que vous pouvez télécharger et exécuter vous-même, le produit phare d’aucun des deux fournisseurs n’est la solution — la pile d’ElevenLabs est fermée, et le système Sesame que vous pouvez exécuter est le modèle de recherche avec un contexte de 4K, pas l’assistant.

Pour ce travail, le point de référence utile se trouve dans les classements de l’arène : Breeze TTS 2 est l’entrée à poids ouverts la mieux classée sur Provider Voice, avec un Elo de 1 206 et 34,00 $ par million de caractères, parmi 16 modèles à poids ouverts sur les 92 entrées de ce classement. Cela la place 113 points derrière Eleven v4 et bien devant la gamme Qwen3 TTS, à 944 et 930. Si votre projet doit s’exécuter sur votre propre matériel, la comparaison qui vaut la peine d’être faite est celle entre Eleven v4 et Breeze TTS 2 — pas avec une démo dans le navigateur — et le compromis est réel : vous abandonnez environ une centaine de points Elo et le flux de travail des balises audio, et vous gagnez le contrôle de toute la pile.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276, Google Gemini 3.8 Flash TTS third at Elo 1,267, and BreezeBlue Breeze TTS 2 tenth at Elo 1,206 with $34.0 per 1M chars and an Open Weights flag, over the Open Weights and Global Leaderboard filter tabs.

Choisir, étant donné à quoi sert chacun

• Si vous construisez un produit qui parle — Eleven v4, sur une API, sur une grille tarifaire. Rien de Sesame Preview n'est intégrable, donc cela n'entre pas dans cette décision.

• Si vous voulez une démo conversationnelle pour montrer à quelqu'un ce que l'IA vocale donne comme sensation — Sesame Preview, et c'est gratuit, ce qui constitue tout son argument.

• Si vous évaluez l’étendue émotionnelle avant de vous engager auprès d’un fournisseur — l’Elo 1 319 d’Eleven v4 sur le tableau des voix de fournisseurs et 1 157 sur le tableau des voix clonées sont les chiffres à retenir, avec la réserve que le second est celui qui décrit un produit à voix de marque clonée.

• Si vous avez besoin de synthèse vocale dans d'autres langues que l'anglais — Eleven v4 en documente plus de 90 ; Sesame Preview est exclusivement en anglais et le précise.

• Si vous avez besoin que le modèle fasse réellement quelque chose — aucun des deux, dans cette comparaison. Sesame Preview n’exécute délibérément pas de tâches, et Eleven v4 est un moteur de synthèse qui a besoin de votre propre stack autour de lui.

• Si vous devez l’exécuter localement — aucun des deux. Breeze TTS 2 est le point de référence à poids ouverts.

• Si le coût est le facteur décisif — Eleven v4 coûte 0,022 $ par millier de caractères jusqu'au 12 octobre et 0,08 $ ensuite, et Sesame Preview est gratuit, car ce n'est pas un produit que l'on peut acheter. Une démo gratuite n'est pas une option moins chère ; c'est une catégorie différente.

La seule chose que les deux ont en commun, c'est un problème de date. Le tarif promotionnel d'Eleven v4 expire le 12 octobre, ce qui fait varier son coût d'un facteur de près de quatre. Sesame n'a pas du tout donné de date pour le modèle de production, ce qui constitue un autre type d'incertitude — la Preview pourrait être supplantée dès le mois prochain ou rester inchangée pendant un an, et il n'y a aucun moyen de planifier en fonction d'un lancement que personne n'a programmé.

Si votre stack finit par couvrir plus d'un fournisseur vocal

OrcaRouter n'héberge ni ElevenLabs ni Sesame, il n'y a donc rien dans cet article à appeler via nous, et nous ne laisserons pas entendre le contraire. Ce que nous couvrons, c'est la couche située au-dessus d'une pile déjà multi-fournisseurs. Une seule clé API donne accès à plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte qu'un changement de prix en amont — la fenêtre promotionnelle de ce lancement en étant un exemple concret — arrive chez nous le jour même plutôt qu'à la prochaine facture. Lorsque le parcours vocal s'adresse aux clients, le basculement automatique redirige le trafic vers un amont sain lorsqu'un fournisseur se dégrade, ce qui vous permet de tester un nouveau point de terminaison sur du trafic réel sans miser une version dessus.

À retenir

Eleven v4 est un modèle que vous pouvez acheter, mesurer et sur lequel vous pouvez compter, et il occupe actuellement la première place du classement des voix de fournisseurs, avec une baisse de prix de deux semaines. Sesame Preview est une expérience gratuite de ressenti conversationnel, en anglais uniquement, limitée à trente minutes, et sur laquelle vous ne pouvez pas bâtir. La raison pour laquelle ils apparaissent dans les mêmes résultats de recherche est que tous deux sont des IA vocales et tous deux sont nouveaux — et non que l'un soit une alternative à l'autre.

Si vous êtes venu ici pour choisir entre eux, la reformulation utile est la suivante : vous ne choisissez pas un modèle vocal. Vous décidez si vous livrez un produit ou si vous essayez une démo, et une seule de ces décisions a une grille tarifaire associée. S’il s’agit du produit, lisez les chiffres d’Eleven v4 et relisez-les le 13 octobre, lorsque le tarif promotionnel expirera et que la comparaison avec tous les autres fournisseurs du tableau changera.