Une carte héros générée intitulée « HeyGen Voice vs Sesame Preview », mettant en contraste une API vocale documentée associée à un Elo mesuré et une démo grand public sans point de terminaison public, marquée de la date Artificial Analysis du 9 octobre 2026. Le logo OrcaRouter apparaît dans le coin inférieur droit.
Guides & Insights

HeyGen Voice vs Sesame Preview : la voix que vous pouvez acheter contre la voix à laquelle vous ne pouvez que parler

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ce n'est pas une comparaison de modèles, et prétendre le contraire serait la seule véritable erreur possible ici. HeyGen Voice est un moteur d'API — classé premier dans l'arène Controlled Voice d'Artificial Analysis avec 1 202 Elo, exposé via les endpoints v3 de HeyGen, vendu au crédit, clonable à partir d'un seul enregistrement. Sesame Preview est un assistant vocal grand public gratuit auquel on accède en ouvrant une page web et en parlant à l'une des quatre personas nommées, sans endpoint public, sans identifiant de modèle et sans prix auquel il peut être loué. L'un des deux, vous pouvez le livrer. L'autre est la raison pour laquelle vous savez à quoi ressemble une bonne voix conversationnelle, et jamais ce que vous déployez.

Ce que chacun est réellement

Sesame Preview est une démonstration de parole conversationnelle. On y accède via le site de l’entreprise ; on parle à Maya, Miles, Simone ou Charlie, et l’expérience est délibérément optimisée pour la convivialité et l’expressivité — l’entreprise le dit elle-même lorsqu’elle décrit pourquoi les compagnons se comportent comme ils le font. Elle est aujourd’hui uniquement en anglais, l’équipe notant que la capacité multilingue apparaît incidemment à cause de la contamination des données et « ne performe pas encore bien », et que l’extension au-delà de vingt langues est un projet futur. Le positionnement de l’entreprise elle-même est un travail en cours : « Nous n’y sommes pas encore. »

Sous la démo se trouve le Conversational Speech Model, une architecture multimodale texte-et-parole construite à partir de deux transformeurs autorégressifs de style Llama. Il est décliné en trois tailles — Tiny avec un backbone de 1B et un décodeur de 100M, Small à 3B et 250M, Medium à 8B et 300M — chacune entraînée sur une longueur de séquence de 2 048 tokens, soit environ deux minutes d’audio, pendant cinq époques sur environ un million d’heures de parole majoritairement anglaise. Les principaux composants de recherche sont publiés en open source sous Apache 2.0, et il existe un dépôt GitHub pour ceux-ci. La démo — ce dont les gens font réellement l’éloge — n’est pas cela. La démo n’a pas d’API publique.

HeyGen Voice, c'est la configuration inverse. Il n'y a pas d'application grand public gratuite pour l'essayer ; il existe une API documentée avec un catalogue de voix, un point de terminaison de synthèse vocale, des parcours de clonage et une facture. Ce que vous ne pouvez pas faire, c'est l'ouvrir dans un navigateur et converser avec elle sur un coup de tête.

Pourquoi les deux sont quand même comparés

On les compare parce que tous deux sont présentés comme la preuve que la parole synthétique a franchi un cap. Sesame Preview a redéfini les attentes quant à ce à quoi un audio conversationnel pouvait ressembler — les réactions lors de son lancement portaient sur sa capacité à ressembler à une personne plutôt qu’à un moteur de synthèse vocale. Le 1 202 de HeyGen Voice sur le classement contrôlé est la même affirmation sous forme numérique : première place parmi quarante-deux entrées lorsque chaque modèle prononce les mêmes huit voix de référence clonées.

La différence réside dans ce que l’on peut faire de l’affirmation par la suite. Une position au classement est reproductible, testable et rattachée à un point de terminaison. Une impression de démo ne présente rien de tout cela — et, surtout, Sesame Preview n’apparaît pas du tout sur le classement contrôlé, donc il n’y a pas d’Elo à comparer au 1 202. La comparaison que les gens veulent faire est indisponible, non pas parce que Sesame l’a perdue, mais parce que le modèle n’a jamais été inscrit.

Le tableau d'affichage

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Elo de voix contrôlée — HeyGen Voice : 1 202, n° 1 sur 42. Sesame Preview : non répertorié.

• Accès — HeyGen Voice : API v3 documentée, POST /v3/voices/speech. Sesame Preview : application web grand public et application iOS ; aucun point de terminaison public.

• Prix — HeyGen Voice : 30,00 $ par million de caractères selon la propre conversion des tarifs de crédits de l'arène ; HeyGen ne publie aucun tarif de voix. Sesame Preview : gratuit, et non achetable à aucun prix.

• Sélection de la voix — HeyGen Voice : plus de 300 voix prédéfinies, conception de voix décrite par texte, clonage instantané et professionnel. Sesame Preview : quatre personas fixes.

• Langues — HeyGen Voice : « des dizaines de langues », nombre non publié. Sesame Preview : anglais uniquement, avec un support multilingue qui, de l'aveu même de l'entreprise, est aujourd'hui en deçà des attentes.

• Poids ouverts — HeyGen Voice : aucun. Sesame Preview : CSM publié sous Apache 2.0 en tailles 1B, 3B et 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Le détail Apache 2.0 est celui qui compte.

Sous le verdict « pas d’API » se cache le fait que Sesame a mis le modèle de recherche en open source sous Apache 2.0 — une licence permissive, en trois tailles, avec une variante 1B assez petite pour tourner sans centre de données. C’est une proposition véritablement différente de la démo, et c’est la seule voie par laquelle quoi que ce soit ressemblant à la voix de Sesame Preview finit dans un produit commercialisé.

Deux mises en garde permettent de rester honnête. Les composants CSM diffusés sont des artefacts de recherche : l’entreprise note que les modèles gèrent le contenu de la parole, mais pas la structure de la conversation, et indique que les modèles entièrement duplex relèvent de travaux futurs — ainsi, les poids diffusés ne constituent pas l’expérience interactive. Et un backbone de 8B exécuté localement représente une structure de coûts différente de celle de 19,30 $ par million de caractères d’inférence hébergée, qui est ce que facture le rival le moins cher du haut de gamme sur l’arène. L’auto-hébergement n’a pas de facturation au caractère, mais en a une très réelle à l’heure de GPU.

Pour un développeur, cela recadre la question. Si ce qui vous a impressionné dans Sesame Preview, c’était la conversation, les poids ouverts ne vous la donnent pas. Si ce qui vous a impressionné, c’était la qualité vocale du modèle de parole lui-même, ils pourraient vous la donner — et c’est testable d’une manière qu’une démo ne l’est pas.

À quoi ressemble le lancement sur HeyGen Voice

Les différences pratiques sont celles habituelles. L'API de HeyGen prend une sélection de voix, du texte et, en option, la vitesse entre 0,5 et 1,5 et la hauteur sur ±50 demi-tons, avec un code BCP-47 de locale à titre indicatif. Les voix personnalisées sont obtenues de trois façons : une voie de conception pilotée par description qui renvoie jusqu'à trois options classées à partir d'une invite limitée à 1 000 caractères, un clonage instantané à partir d'un enregistrement, et un clonage professionnel entraîné sur vingt minutes ou plus. Le moteur de filtrage sur le point de terminaison des voix accepte aussi des moteurs autres que HeyGen, donc la plateforme n'est pas un jardin clos autour de son propre modèle.

Rien de tout cela n’existe du côté de Sesame, et ce n’est pas un défaut de Sesame Preview — c’est ce que c’est. Une démo optimisée pour montrer ce qui est possible ne devrait pas être assortie d’un SLA.

La facture, toutefois, est la moitié la plus douce. HeyGen vend des crédits — 600 pour 29 $/mois, 1 000 pour 49 $, 1 500 pour 149 $ — et indique que la consommation varie selon le modèle, la durée et la complexité, sans publier de tarif à la voix. Les 30,00 $ par million de caractères que l’arène répertorie correspondent à une conversion de ces crédits par Artificial Analysis, et non à un tarif communiqué par HeyGen. Ainsi, le modèle que vous pouvez livrer est tarifé, mais selon l’arithmétique de quelqu’un d’autre — ce qui plaide pour un pilote mesuré plutôt que pour une critique du moteur.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Que faire réellement d’une démo que vous admirez ?

La démarche utile consiste à séparer les deux choses que Sesame Preview démontre. Le comportement conversationnel — l’alternance des tours de parole, la mémoire, l’impression de parler à quelqu’un — est le produit d’un système qui n’a pas été publié et qui n’a pas de point de terminaison. La qualité vocale est la partie qui repose sur des poids Apache 2.0, et celle que vous pouvez évaluer sur votre propre audio sans demander la permission à qui que ce soit.

Pour tout ce qui se trouve entre les deux, le chemin de migration est banal : déployez sur un moteur qui dispose d’une API et d’un classement, et concevez les choses pour que l’adoption du modèle de Sesame, s’il est un jour commercialisé, soit un changement de configuration plutôt qu’une réécriture. Cela implique une abstraction au-dessus du fournisseur de voix dès le premier jour — une interface, une clé, un moteur sélectionné par configuration. La couche de routage d’OrcaRouter est conçue précisément pour cela : de nombreux fournisseurs derrière un point de terminaison unique, au prix catalogue des fournisseurs et sans marge, un basculement automatique lorsqu’un fournisseur défaille, et un DSL de routage qui vous permet de remplacer le moteur derrière une voix sans toucher au code de l’application. L’idée n’est pas qu’il héberge un modèle Sesame — ce n’est pas le cas — mais que le jour où une voix que vous admirez devient achetable, le coût pour l’essayer devrait se limiter à une ligne dans un fichier de configuration.

La conclusion honnête

Sesame Preview n'est pas un concurrent de HeyGen Voice et ne doit pas être évalué comme tel. C'est une démonstration gratuite, en anglais uniquement, à quatre personas, qui a par ailleurs redéfini les attentes en matière d'audio conversationnel et qui a par ailleurs publié des poids de recherche sous licence permissive en trois tailles. HeyGen Voice est le moteur le mieux classé sur le seul classement vocal qui maintient la voix constante, vendu via une API que vous pouvez appeler dès aujourd'hui, à un prix que vous ne pouvez pas encore calculer.

Si vous avez besoin d'une voix que vous pouvez livrer ce trimestre, la décision ne se situe pas entre ces deux-là — elle se situe entre HeyGen Voice et les autres moteurs payants de l'arène. Si vous attendez Sesame, attendez les poids, pas l'application.