Eine generierte Hero-Karte mit dem Titel „HeyGen Voice debütiert auf Platz 1 in der Controlled Voice Arena“ mit der Zeile „1.202 Elo – vor Qwen-Audio-3.1-TTS-Plus und Eleven v4 Turbo“ und dem Hinweis „Dieselben acht geklonten Referenzstimmen – Artificial Analysis, 9. Okt. 2026“. Das OrcaRouter-Logo erscheint in der unteren rechten Ecke.
Guides & Insights

HeyGen Voice debütiert auf Platz 1 der Controlled Voice TTS Arena – und schlägt Qwen und ElevenLabs bei geklonten Stimmen

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 9. Oktober 2026 hat Artificial Analysis HeyGen Voice in seine Controlled-Voice-Arena aufgenommen, und das Modell stieg direkt an deren Spitze. HeyGen Voice – das erste Text-to-Speech-Modell von HeyGen, das in der Bestenliste bewertet wird – erreichte 1.202 Elo und lag damit vor Qwen-Audio-3.1-TTS-Plus mit 1.186 und ElevenLabs' Eleven v4 Turbo mit 1.167. Cartesia Sonic 3.6, das die offene Provider-Voices-Bestenliste der Website anführt, liegt hier mit 1.143 auf Platz fünf. Das ist ein echtes Ergebnis auf einer Bestenliste, die darauf ausgelegt ist, den größten einzelnen Störfaktor bei der Stimmbewertung zu beseitigen, und es ist zugleich ein Ergebnis mit einer sehr spezifischen Bedeutung, die leicht überinterpretiert werden kann: HeyGen Voice ist die beste Stimme in dieser Arena bei acht geklonten Referenzstimmen – noch kein gemessener Sieger der Bestenliste mit 96 Modellen.

Was das Controlled Voice Board misst und warum es wichtig ist

Artificial Analysis betreibt zwei Sprach-Boards, die unterschiedliche Fragen beantworten. Die Provider-Voices-Arena ermöglicht es jedem Anbieter, seine eigenen nativen Stimmen bereitzustellen – die ausgefeilten Demo-Stimmen, die ein Unternehmen auswählt, um sich selbst zu präsentieren – und bewertet Modelle danach, wie gut diese klingen. Ihr Leaderboard ist breit und ausgereift: 96 Einträge, mit Eleven v4 Turbo auf Platz eins bei 1.328 Elo und Cartesia Sonic 3.6 auf Platz vier bei 1.280.

Die Controlled Voice arena macht etwas Engeres und – für alle, die ein Produkt ausliefern – Nützlicheres. Jedes Modell darin erzeugt Sprache aus denselben acht geklonten Stimmen – vier US- und vier UK-Stimmen –, sodass der Vergleich nicht lautet „Wessen Marketing-Stimme ist schöner?“, sondern „Wie geht jede Engine mit derselben Stimme, demselben Text und denselben Aufnahmebedingungen um?“. Es ist das, was der Branche einem Test der Engine unter gleichen Bedingungen statt eines Demo-Reels am nächsten kommt, und es ist das Board, auf das es ankommt, wenn man vorhat, eine Stimme zu klonen und sie einem TTS-Modell zu übergeben.

HeyGen Voice führt jetzt die Rangliste an. Der Vorsprung beträgt 16 Elo gegenüber Qwen-Audio-3.1-TTS-Plus und 35 gegenüber Eleven v4 Turbo, mit einem angegebenen 95-%-Konfidenzintervall von etwa 1.185 bis 1.219 für den HeyGen-Wert. Sechzehn Elo sind eine echte Lücke, aber keine Kluft – auf einem so dichten Leaderboard ist es der Unterschied zwischen dem Ersten und dem Zweiten, nicht zwischen brauchbar und unbrauchbar.

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

Wo HeyGen Voice noch nicht gerankt ist

Die ehrliche Einschränkung dieses Ergebnisses ist, dass HeyGen Voice gar nicht auf dem Provider Voices Board erscheint, und sein Fehlen ist kein Signal für die Qualität. Artificial Analysis weist darauf hin, dass Modelle ausgelassen werden können, weil sie noch nicht genügend Stimmen haben. Ein Modell, das erst wenige Tage alt ist und hinter sich nur eine einzige anders bewertete Arena hat, hat einfach noch nicht das Volumen an Blind-Hörer-Stimmen angesammelt, das das größere Board erfordert.

Die korrekte Lesart am 10. Oktober 2026 lautet also: HeyGen Voice ist die bestplatzierte Stimme im kontrollierten Vergleich geklonter Stimmen und zugleich eine unbekannte Größe gegenüber dem weiteren Feld. Wer aus dieser Zahl „das beste TTS-Modell der Welt" ableitet, beruft sich auf eine kleinere Rangliste, als der Satz nahelegt.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Die zwei Zahlen hinter dem Elo

• Kontrolliertes Voice-Elo — HeyGen Voice: 1.202 (95-%-KI ungefähr 1.185–1.219). Qwen-Audio-3.1-TTS-Plus: 1.186. Eleven v4 Turbo: 1.167.

• Elo der Anbieter-Stimmen — HeyGen Voice: nicht aufgeführt (zu wenige Stimmen). Eleven v4 Turbo: 1.328 auf Platz 1. Sonic 3.6: 1.280 auf Platz 4.

• Rang im kontrollierten Feld — HeyGen Voice: Nr. 1 von 42 bewerteten Einträgen (#42 ist OpenVoice v2 mit 812).

• Preis auf Basis der Arena — HeyGen Voice: 30,00 $ pro 1 Mio. Zeichen, die eigene Umrechnung der Credit-Preise von HeyGen durch die Arena. Qwen-Audio-3.1-TTS-Plus: 19,30 $ pro 1 Mio. Zeichen. Eleven v4 Turbo: 40,00 $ pro 1 Mio. Zeichen.

• Elo-Anker — OpenAudio S1 ist der feste Referenzpunkt bei 1.000, daher liegt HeyGen Voice 202 Punkte über dem Anker.

• Wer sonst noch in den Top Five steht — Eleven v4 mit 1.160 und Sonic 3.6 mit 1.143 vervollständigen die Top Five hinter den Führenden.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

Was HeyGen tatsächlich veröffentlicht hat

Die Engine hinter dem Eintrag ist HeyGens hauseigenes TTS, das über die v3-API des Unternehmens bereitgestellt wird. Ein GET /v3/voices-Aufruf nimmt einen engine-Filter entgegen, dessen Werte orca — HeyGens eigene Voice-Engine — neben starfish und einem Pass-through zu ElevenLabs-Stimmen umfassen. Die Sprachausgabe läuft über POST /v3/voices/speech; die Abstimmung pro Anfrage bietet speed von 0,5 bis 1,5 und pitch von −50 bis +50 Halbtönen, mit einem BCP-47-locale-Hinweis.

Der Katalog umfasst 300+ vorgefertigte Stimmen in Dutzenden Sprachen. Benutzerdefinierte Stimmen gibt es in drei Varianten: Text-zu-Stimme-Design, das aus einer auf 1.000 Zeichen begrenzten Beschreibung bis zu drei nach Rangfolge geordnete Optionen generiert, ein Instant-Clone aus einer einzigen Aufnahme und ein professioneller Clone, der mit zwanzig Minuten oder mehr Audio trainiert wird. Der letzte Punkt ist der, den das Controlled Voice Leaderboard effektiv einem Stresstest unterzieht – diese acht Referenzstimmen sind Clones, und die Clone-Qualität ist der Bereich, in dem sich TTS-Engines unterscheiden.

Engines werden in den Docs ebenfalls als pro Stimme auswählbar genannt, was bedeutet, dass HeyGen dich nicht zwingt, sein Modell zu verwenden: Du kannst über seine API zu einer Voice-Engine eines Drittanbieters routen, wenn dir eine lieber ist. Das ist ein Anbieter, der sich gegen sein eigenes Modell absichert, und es ist gut zu wissen, wenn du eine „#1 voice“-Behauptung über HeyGen liest.

Was sich dadurch für alle ändert, die eine Stimme auswählen

Aus dem Eintreffen eines Controlled-Voice-Ergebnisses folgen drei praktische Konsequenzen, und keine davon ist „alles umstellen".

Zunächst: Wenn Ihr Anwendungsfall eine geklonte Markenstimme ist – ein Sprecher, viele Zeilen –, ist dies jetzt das Board, das Sie lesen sollten, und HeyGen Voice ist das Modell, das Sie zuerst testen sollten. Eine Rangliste, die die Stimme konstant hält, misst genau das, was Sie tatsächlich tun werden.

Zweitens: Wenn Ihr Anwendungsfall ein breites Ensemble von muttersprachlich klingenden Charakteren in Sprachen umfasst, die Ihr Klon nicht abdeckt, sind das Provider Voices Board und seine sechsundneunzig Einträge nach wie vor die relevante Referenz, und HeyGen Voice hat dort noch keinen Rang. Nichts an einem Ergebnis mit geklonter Stimme verrät Ihnen, wie die Engine hundert unterschiedliche Stimmen handhabt.

Drittens: Der Preis hat jetzt eine Zahl, aber keine, die der Anbieter veröffentlicht hat. Die Arena listet HeyGen Voice mit 30,00 $ pro 1 Mio. Zeichen – eine Umrechnung von Artificial Analysis eines Credit-Systems, das HeyGens eigene Seite nie in einen Voice-Tarif übersetzt. Damit liegt der neue Spitzenreiter unter den 40,00 $ von Eleven v4 Turbo und über den 19,30 $ der Qwen-Stufe – ein Mittelfeldpreis, der an einen Erstplatzierungs-Score gekoppelt ist, und einer, der abgeleitet statt genannt wird.

Die Routing-Frage

Die Stimmauswahl hat eine Eigenschaft, die die meisten Modellentscheidungen nicht haben: Ein Fehlschlag ist für den Endnutzer innerhalb einer Silbe hörbar. Dadurch ist die Migration günstig zu testen und teuer, wenn sie in der Produktion schiefgeht. Eine neue Engine hinter derselben Schnittstelle wie der etablierte Anbieter laufen zu lassen – eine API-Oberfläche, ein Schlüssel, der Listenpreis des Anbieters wird durchgereicht statt aufgeschlagen, mit automatischem Failover zu einem zweiten Sprachanbieter, wenn eine Anfrage fehlschlägt – ist der Weg, eine echte Antwort über das eigene Audio zu bekommen, statt der Antwort eines Elo-Diagramms über acht Referenzstimmen. OrcaRouters Routing-Schicht existiert genau für diese Art von Entscheidung: Setze den Herausforderer auf einen Bruchteil des Traffics, halte den etablierten Anbieter warm, und lass Failover das Fenster abdecken, in dem das neue Modell noch nicht erprobt ist. Das Leaderboard sagt dir, wo du suchen musst. Es kann dir nicht sagen, wie dein Skript klingt.

Was als Nächstes ansehen

Zwei Zahlen werden diese Geschichte entscheiden. Die erste ist, ob HeyGen Voice genügend Stimmen sammelt, um in das Provider-Voices-Board aufgenommen zu werden, und wo es im Vergleich zu den 1.328 von Eleven v4 Turbo landet – einem Modell, das dieses Board anführt, in der kontrollierten Arena aber zurückliegt, was genau die Lücke ist, die die beiden Boards aufzeigen sollen. Die zweite ist, ob HeyGen einen eigenen Voice-Tarif veröffentlicht, sodass die von der Arena abgeleiteten $30.00 gegen eine Anbieterzahl geprüft werden können, statt aus Credits abgeleitet zu werden. Solange beides nicht existiert, ist ein #1-Debüt auf dem kontrollierten Board eine starke Aussage über die Qualität geklonter Stimmen und eine offene Frage in Bezug auf alles andere.