
HeyGen Voice vs Sesame Preview : la voix que vous pouvez acheter contre la voix à laquelle vous ne pouvez que parler
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Ce n'est pas une comparaison de modèles, et prétendre le contraire serait la seule véritable erreur possible ici. HeyGen Voice est un moteur d'API — classé premier dans l'arène Controlled Voice d'Artificial Analysis avec 1 202 Elo, exposé via les endpoints v3 de HeyGen, vendu au crédit, clonable à partir d'un seul enregistrement. Sesame Preview est un assistant vocal grand public gratuit auquel on accède en ouvrant une page web et en parlant à l'une des quatre personas nommées, sans endpoint public, sans identifiant de modèle et sans prix auquel il peut être loué. L'un des deux, vous pouvez le livrer. L'autre est la raison pour laquelle vous savez à quoi ressemble une bonne voix conversationnelle, et jamais ce que vous déployez.
Ce que chacun est réellement
Sesame Preview est une démonstration de parole conversationnelle. On y accède via le site de l’entreprise ; on parle à Maya, Miles, Simone ou Charlie, et l’expérience est délibérément optimisée pour la convivialité et l’expressivité — l’entreprise le dit elle-même lorsqu’elle décrit pourquoi les compagnons se comportent comme ils le font. Elle est aujourd’hui uniquement en anglais, l’équipe notant que la capacité multilingue apparaît incidemment à cause de la contamination des données et « ne performe pas encore bien », et que l’extension au-delà de vingt langues est un projet futur. Le positionnement de l’entreprise elle-même est un travail en cours : « Nous n’y sommes pas encore. »
Sous la démo se trouve le Conversational Speech Model, une architecture multimodale texte-et-parole construite à partir de deux transformeurs autorégressifs de style Llama. Il est décliné en trois tailles — Tiny avec un backbone de 1B et un décodeur de 100M, Small à 3B et 250M, Medium à 8B et 300M — chacune entraînée sur une longueur de séquence de 2 048 tokens, soit environ deux minutes d’audio, pendant cinq époques sur environ un million d’heures de parole majoritairement anglaise. Les principaux composants de recherche sont publiés en open source sous Apache 2.0, et il existe un dépôt GitHub pour ceux-ci. La démo — ce dont les gens font réellement l’éloge — n’est pas cela. La démo n’a pas d’API publique.
HeyGen Voice, c'est la configuration inverse. Il n'y a pas d'application grand public gratuite pour l'essayer ; il existe une API documentée avec un catalogue de voix, un point de terminaison de synthèse vocale, des parcours de clonage et une facture. Ce que vous ne pouvez pas faire, c'est l'ouvrir dans un navigateur et converser avec elle sur un coup de tête.
Pourquoi les deux sont quand même comparés
On les compare parce que tous deux sont présentés comme la preuve que la parole synthétique a franchi un cap. Sesame Preview a redéfini les attentes quant à ce à quoi un audio conversationnel pouvait ressembler — les réactions lors de son lancement portaient sur sa capacité à ressembler à une personne plutôt qu’à un moteur de synthèse vocale. Le 1 202 de HeyGen Voice sur le classement contrôlé est la même affirmation sous forme numérique : première place parmi quarante-deux entrées lorsque chaque modèle prononce les mêmes huit voix de référence clonées.
La différence réside dans ce que l’on peut faire de l’affirmation par la suite. Une position au classement est reproductible, testable et rattachée à un point de terminaison. Une impression de démo ne présente rien de tout cela — et, surtout, Sesame Preview n’apparaît pas du tout sur le classement contrôlé, donc il n’y a pas d’Elo à comparer au 1 202. La comparaison que les gens veulent faire est indisponible, non pas parce que Sesame l’a perdue, mais parce que le modèle n’a jamais été inscrit.
Le tableau d'affichage

• Elo de voix contrôlée — HeyGen Voice : 1 202, n° 1 sur 42. Sesame Preview : non répertorié.
• Accès — HeyGen Voice : API v3 documentée, POST /v3/voices/speech. Sesame Preview : application web grand public et application iOS ; aucun point de terminaison public.
• Prix — HeyGen Voice : 30,00 $ par million de caractères selon la propre conversion des tarifs de crédits de l'arène ; HeyGen ne publie aucun tarif de voix. Sesame Preview : gratuit, et non achetable à aucun prix.
• Sélection de la voix — HeyGen Voice : plus de 300 voix prédéfinies, conception de voix décrite par texte, clonage instantané et professionnel. Sesame Preview : quatre personas fixes.
• Langues — HeyGen Voice : « des dizaines de langues », nombre non publié. Sesame Preview : anglais uniquement, avec un support multilingue qui, de l'aveu même de l'entreprise, est aujourd'hui en deçà des attentes.
• Poids ouverts — HeyGen Voice : aucun. Sesame Preview : CSM publié sous Apache 2.0 en tailles 1B, 3B et 8B.

Le détail Apache 2.0 est celui qui compte.
Sous le verdict « pas d’API » se cache le fait que Sesame a mis le modèle de recherche en open source sous Apache 2.0 — une licence permissive, en trois tailles, avec une variante 1B assez petite pour tourner sans centre de données. C’est une proposition véritablement différente de la démo, et c’est la seule voie par laquelle quoi que ce soit ressemblant à la voix de Sesame Preview finit dans un produit commercialisé.
Deux mises en garde permettent de rester honnête. Les composants CSM diffusés sont des artefacts de recherche : l’entreprise note que les modèles gèrent le contenu de la parole, mais pas la structure de la conversation, et indique que les modèles entièrement duplex relèvent de travaux futurs — ainsi, les poids diffusés ne constituent pas l’expérience interactive. Et un backbone de 8B exécuté localement représente une structure de coûts différente de celle de 19,30 $ par million de caractères d’inférence hébergée, qui est ce que facture le rival le moins cher du haut de gamme sur l’arène. L’auto-hébergement n’a pas de facturation au caractère, mais en a une très réelle à l’heure de GPU.
Pour un développeur, cela recadre la question. Si ce qui vous a impressionné dans Sesame Preview, c’était la conversation, les poids ouverts ne vous la donnent pas. Si ce qui vous a impressionné, c’était la qualité vocale du modèle de parole lui-même, ils pourraient vous la donner — et c’est testable d’une manière qu’une démo ne l’est pas.
À quoi ressemble le lancement sur HeyGen Voice
Les différences pratiques sont celles habituelles. L'API de HeyGen prend une sélection de voix, du texte et, en option, la vitesse entre 0,5 et 1,5 et la hauteur sur ±50 demi-tons, avec un code BCP-47 de locale à titre indicatif. Les voix personnalisées sont obtenues de trois façons : une voie de conception pilotée par description qui renvoie jusqu'à trois options classées à partir d'une invite limitée à 1 000 caractères, un clonage instantané à partir d'un enregistrement, et un clonage professionnel entraîné sur vingt minutes ou plus. Le moteur de filtrage sur le point de terminaison des voix accepte aussi des moteurs autres que HeyGen, donc la plateforme n'est pas un jardin clos autour de son propre modèle.
Rien de tout cela n’existe du côté de Sesame, et ce n’est pas un défaut de Sesame Preview — c’est ce que c’est. Une démo optimisée pour montrer ce qui est possible ne devrait pas être assortie d’un SLA.
La facture, toutefois, est la moitié la plus douce. HeyGen vend des crédits — 600 pour 29 $/mois, 1 000 pour 49 $, 1 500 pour 149 $ — et indique que la consommation varie selon le modèle, la durée et la complexité, sans publier de tarif à la voix. Les 30,00 $ par million de caractères que l’arène répertorie correspondent à une conversion de ces crédits par Artificial Analysis, et non à un tarif communiqué par HeyGen. Ainsi, le modèle que vous pouvez livrer est tarifé, mais selon l’arithmétique de quelqu’un d’autre — ce qui plaide pour un pilote mesuré plutôt que pour une critique du moteur.

Que faire réellement d’une démo que vous admirez ?
La démarche utile consiste à séparer les deux choses que Sesame Preview démontre. Le comportement conversationnel — l’alternance des tours de parole, la mémoire, l’impression de parler à quelqu’un — est le produit d’un système qui n’a pas été publié et qui n’a pas de point de terminaison. La qualité vocale est la partie qui repose sur des poids Apache 2.0, et celle que vous pouvez évaluer sur votre propre audio sans demander la permission à qui que ce soit.
Pour tout ce qui se trouve entre les deux, le chemin de migration est banal : déployez sur un moteur qui dispose d’une API et d’un classement, et concevez les choses pour que l’adoption du modèle de Sesame, s’il est un jour commercialisé, soit un changement de configuration plutôt qu’une réécriture. Cela implique une abstraction au-dessus du fournisseur de voix dès le premier jour — une interface, une clé, un moteur sélectionné par configuration. La couche de routage d’OrcaRouter est conçue précisément pour cela : de nombreux fournisseurs derrière un point de terminaison unique, au prix catalogue des fournisseurs et sans marge, un basculement automatique lorsqu’un fournisseur défaille, et un DSL de routage qui vous permet de remplacer le moteur derrière une voix sans toucher au code de l’application. L’idée n’est pas qu’il héberge un modèle Sesame — ce n’est pas le cas — mais que le jour où une voix que vous admirez devient achetable, le coût pour l’essayer devrait se limiter à une ligne dans un fichier de configuration.
La conclusion honnête
Sesame Preview n'est pas un concurrent de HeyGen Voice et ne doit pas être évalué comme tel. C'est une démonstration gratuite, en anglais uniquement, à quatre personas, qui a par ailleurs redéfini les attentes en matière d'audio conversationnel et qui a par ailleurs publié des poids de recherche sous licence permissive en trois tailles. HeyGen Voice est le moteur le mieux classé sur le seul classement vocal qui maintient la voix constante, vendu via une API que vous pouvez appeler dès aujourd'hui, à un prix que vous ne pouvez pas encore calculer.
Si vous avez besoin d'une voix que vous pouvez livrer ce trimestre, la décision ne se situe pas entre ces deux-là — elle se situe entre HeyGen Voice et les autres moteurs payants de l'arène. Si vous attendez Sesame, attendez les poids, pas l'application.
