
HeyGen Voice vs. Sesame Preview: Die Stimme, die man kaufen kann, gegen die Stimme, mit der man nur sprechen kann
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Dies ist kein Modellvergleich, und so zu tun, als wäre es einer, wäre der einzige echte Fehler, der hier möglich ist. HeyGen Voice ist eine API-Engine — in der Controlled-Voice-Arena von Artificial Analysis mit 1.202 Elo auf Platz eins, über die v3-Endpunkte von HeyGen zugänglich, pro Credit verkauft, aus einer einzigen Aufnahme klonbar. Sesame Preview ist ein kostenloser Verbraucher-Sprachassistent, den man erreicht, indem man eine Webseite öffnet und mit einer von vier namentlich genannten Personas spricht; ohne öffentlichen Endpunkt, ohne Modellkennung und ohne Preis, zu dem er gemietet werden kann. Eines davon lässt sich ausliefern. Das andere ist der Grund, warum man weiß, wie eine gute Konversationsstimme klingt, und niemals das, was man einsetzt.
Was jedes einzelne tatsächlich ist
Sesame Preview ist eine Demonstration konversationeller Sprache. Man erreicht es über die Website des Unternehmens, man spricht mit Maya, Miles, Simone oder Charlie, und das Erlebnis ist bewusst auf Freundlichkeit und Ausdrucksstärke optimiert – das Unternehmen sagt das selbst, wenn es beschreibt, warum sich die Begleiter so verhalten, wie sie es tun. Heute ist es nur auf Englisch verfügbar, wobei das Team anmerkt, dass Mehrsprachigkeit durch Datenkontamination beiläufig auftritt und „noch nicht gut funktioniert“, und dass die Erweiterung über zwanzig Sprachen hinaus ein Zukunftsplan ist. Die eigene Darstellung des Unternehmens ist ein Work in Progress: „Wir sind noch nicht so weit.“
Unter der Demo befindet sich das Conversational Speech Model, eine multimodale Text-und-Sprach-Architektur, die aus zwei autoregressiven Transformatoren im Llama-Stil aufgebaut ist. Es ist in drei Größen erhältlich – Tiny mit einem 1B-Backbone und 100M-Decoder, Small mit 3B und 250M, Medium mit 8B und 300M –, die jeweils mit einer Sequenzlänge von 2.048 Token, also ungefähr zwei Minuten Audio, über fünf Epochen auf etwa einer Million Stunden überwiegend englischer Sprache trainiert wurden. Zentrale Forschungskomponenten sind unter Apache 2.0 als Open Source freigegeben, und es gibt ein GitHub-Repository dafür. Die Demo – das, wofür die Leute tatsächlich Lob aussprechen – ist das nicht. Die Demo hat keine öffentliche API.
HeyGen Voice ist die umgekehrte Anordnung. Es gibt keine kostenlose Consumer-App zum Ausprobieren; es gibt eine dokumentierte API mit einem Stimmenkatalog, einem Speech-Endpunkt, Clone-Pfaden und einer Rechnung. Was man nicht tun kann, ist, es im Browser zu öffnen und sich aus einer Laune heraus mit ihm zu unterhalten.
Warum die beiden überhaupt verglichen werden
Sie werden verglichen, weil beide als Beweis dafür angeführt werden, dass synthetische Sprache eine Grenze überschritten hat. Sesame Preview hat die Erwartungen neu gesetzt, wie konversationelles Audio klingen könnte – die Reaktionen, als es erschien, drehten sich darum, wie sehr es wie eine Person klang statt wie eine Text-to-Speech-Engine. Die 1.202 von HeyGen Voice auf dem kontrollierten Board ist dieselbe Behauptung in numerischer Form: erster Platz unter zweiundvierzig Einträgen, wenn jedes Modell dieselben acht geklonten Referenzstimmen spricht.
Der Unterschied liegt darin, was man anschließend mit der Behauptung machen kann. Eine Board-Position ist reproduzierbar, testbar und an einen Endpunkt gebunden. Ein Demo-Eindruck ist nichts davon – und, wichtig, Sesame Preview erscheint überhaupt nicht auf dem kontrollierten Board, es gibt also keinen Elo-Wert, mit dem man ihn mit den 1.202 vergleichen könnte. Der Vergleich, den die Leute anstellen möchten, ist nicht verfügbar, nicht weil Sesame ihn verloren hätte, sondern weil das Modell nie eingetragen wurde.
Die Anzeigetafel

• Controlled Voice Elo — HeyGen Voice: 1.202, Nr. 1 von 42. Sesame Preview: nicht gelistet.
• Zugriff — HeyGen Voice: dokumentierte v3-API, POST /v3/voices/speech. Sesame Preview: Consumer-Web-App und iOS-App; kein öffentlicher Endpunkt.
• Preis — HeyGen Voice: 30,00 $ pro 1 Mio. Zeichen auf Basis der arenaeigenen Umrechnung der Credit-Preise; HeyGen veröffentlicht keinen Sprechtarif. Sesame Preview: kostenlos und zu keinem Preis käuflich zu erwerben.
• Stimmenauswahl — HeyGen Voice: über 300 vorgefertigte Stimmen, Voice-Design per Textbeschreibung, sofortiges und professionelles Klonen. Sesame Preview: vier feste Personas.
• Sprachen — HeyGen Voice: „Dutzende Sprachen“, Anzahl nicht veröffentlicht. Sesame Preview: nur Englisch, wobei die mehrsprachige Unterstützung nach eigener Aussage des Unternehmens derzeit hinterherhinkt.
• Offene Gewichte — HeyGen Voice: keine. Sesame Preview: CSM wurde unter Apache 2.0 in den Größen 1B, 3B und 8B veröffentlicht.

Das Detail zu Apache 2.0 ist das, was zählt.
Begraben unter dem Verdikt „keine API“ liegt die Tatsache, dass Sesame das Forschungsmodell unter Apache 2.0 als Open Source veröffentlicht hat – eine permissive Lizenz, in drei Größen, mit einer 1B-Variante, die klein genug ist, um ohne Rechenzentrum zu laufen. Das ist ein wirklich anderes Angebot als die Demo, und es ist der einzige Weg, auf dem so etwas wie die Stimme von Sesame Preview in einem ausgelieferten Produkt landet.
Zwei Vorbehalte sorgen für Ehrlichkeit. Die veröffentlichten CSM-Komponenten sind Forschungsartefakte: Das Unternehmen merkt an, dass die Modelle Sprachinhalte, aber nicht die Gesprächsstruktur verarbeiten, und verweist auf Vollduplex-Modelle als zukünftige Arbeit – die veröffentlichten Gewichte sind also nicht das interaktive Erlebnis. Und ein lokal laufendes 8B-Backbone hat eine andere Kostenstruktur als 19,30 US-Dollar pro Million Zeichen für gehostete Inferenz, was der günstigste Top-Tier-Konkurrent in der Arena verlangt. Selbsthosting hat keine Abrechnung pro Zeichen, aber eine sehr reale pro GPU-Stunde.
Für jemanden, der etwas baut, stellt das die Frage neu. Wenn dich an Sesame Preview die Konversation beeindruckt hat, geben dir die offenen Gewichte sie nicht. Wenn dich die Stimmqualität des Sprachmodells selbst beeindruckt hat, könnten sie es – und das lässt sich auf eine Weise testen, wie eine Demo es nicht kann.
So sieht der Versand bei HeyGen Voice aus
Die praktischen Unterschiede sind die üblichen. Die API von HeyGen nimmt eine Stimmauswahl, Text und optionale Geschwindigkeit zwischen 0,5 und 1,5 und Tonhöhe über ±50 Halbtöne, mit einem BCP-47-Locale-Hinweis. Benutzerdefinierte Stimmen gibt es auf drei Wegen: einen beschreibungsgesteuerten Design-Weg, der aus einem auf 1.000 Zeichen begrenzten Prompt bis zu drei Optionen in Rangfolge zurückgibt, einen Instant-Clone aus einer einzigen Aufnahme und einen professionellen Klon, der mit zwanzig Minuten oder mehr trainiert wurde. Der Engine-Filter auf dem Voices-Endpoint akzeptiert auch Nicht-HeyGen-Engines, sodass die Plattform kein Walled Garden um ihr eigenes Modell ist.
Nichts davon gibt es auf der Sesame-Seite, und das ist kein Mangel von Sesame Preview – es liegt in der Natur der Sache. Eine Demo, die darauf optimiert ist zu zeigen, was möglich ist, sollte kein SLA mit sich führen.
Die Rechnung ist allerdings der weichere Teil. HeyGen verkauft Credits – 600 für 29 $/Monat, 1.000 für 49 $, 1.500 für 149 $ – und gibt an, dass der Verbrauch je nach Modell, Dauer und Komplexität variiert, ohne einen Voice-Tarif zu veröffentlichen. Die 30,00 $ pro Million Zeichen, die die Arena auflistet, sind Artificial Analysis’ Umrechnung dieser Credits, kein Zitat von HeyGen. Das Modell, das Sie ausliefern können, hat also einen Preis, aber auf Grundlage der Rechenweise eines anderen – was ein Argument für einen maßvollen Pilotversuch ist, nicht für Kritik an der Engine.

Was man tatsächlich mit einer Demo anfangen soll, die man bewundert
Der nützliche Schritt ist, die beiden Dinge zu trennen, die Sesame Preview demonstriert. Das Gesprächsverhalten – Sprecherwechsel, Gedächtnis, das Gefühl, mit jemandem zu sprechen – ist das Produkt eines Systems, das nicht veröffentlicht wurde und keinen Endpunkt hat. Die Sprachqualität ist der Teil, hinter dem Apache-2.0-Gewichte stehen, und der Teil, den man anhand des eigenen Audios bewerten kann, ohne jemanden um Erlaubnis zu bitten.
Für alles dazwischen ist der Migrationspfad der unspektakuläre: auf einer Engine ausliefern, die eine API und einen Rang hat, und so entwerfen, dass die Übernahme von Sesames Modell – falls es jemals kommerziell verfügbar wird – eine Konfigurationsänderung statt einer Neuimplementierung ist. Das bedeutet vom ersten Tag an eine Abstraktion über den Voice-Provider – eine Schnittstelle, ein Schlüssel, die Engine per Konfiguration ausgewählt. Die Routing-Schicht von OrcaRouter ist genau dafür gebaut: viele Anbieter hinter einem einzigen Endpunkt zum Listenpreis des Anbieters ohne Aufschlag, automatisches Failover, wenn ein Anbieter ins Stocken gerät, und eine Routing-DSL, mit der Sie die Engine hinter einer Voice austauschen können, ohne Anwendungscode anzufassen. Der Punkt ist nicht, dass es ein Sesame-Modell hostet – das tut es nicht –, sondern dass an dem Tag, an dem eine Voice, die Sie bewundern, erwerbbar wird, die Kosten, sie auszuprobieren, eine Zeile in einer Konfigurationsdatei sein sollten.
Der ehrliche Abschluss
Sesame Preview ist kein Konkurrent von HeyGen Voice und sollte nicht als ein solcher bewertet werden. Es ist eine kostenlose, nur englischsprachige Demonstration mit vier Personas, die zufällig die Erwartungen an konversationelles Audio neu gesetzt hat und zufällig permissiv lizenzierte Forschungsgewichte in drei Größen veröffentlicht hat. HeyGen Voice ist die am höchsten eingestufte Engine auf dem einzigen Sprach-Leaderboard, das die Stimme konstant hält, verkauft über eine API, die man heute aufrufen kann, zu einem Preis, den man noch nicht berechnen kann.
Wenn du eine Stimme brauchst, die du dieses Quartal ausliefern kannst, liegt die Entscheidung nicht zwischen diesen beiden – sondern zwischen HeyGen Voice und den anderen kostenpflichtigen Engines in der Arena. Wenn du auf Sesame wartest, warte auf die Gewichte, nicht auf die App.
