Eine generierte Hero-Karte mit dem Titel „HeyGen Voice vs Qwen-Audio-3.0-TTS“, die die 79-Punkte-Elo-Lücke bei kontrollierter Stimme gegenüber den beiden Preisen pro Million Zeichen zeigt, mit einem Hinweis, dass ein Preis vom Anbieter veröffentlicht wurde und der andere die vom Arena abgeleitete Umrechnung der Credit-Preisgestaltung ist, laut Artificial Analysis, 9. Oktober 2025. Das OrcaRouter-Logo erscheint unten rechts.
Engineering & Research

HeyGen Voice vs. Qwen-Audio-3.0-TTS: Was Sie für das Elo bezahlen, und welches Qwen-Tier Sie tatsächlich gebenchmarkt haben

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Rechnen wir zuerst nach, denn es ist weniger unausgewogen, als die Rangliste vermuten lässt. Qwen-Audio-3.0-TTS-Plus kostet 19,30 $ pro Million Zeichen auf der Model-Studio-Plattform – ein Tarif, den der Anbieter veröffentlicht. HeyGen Voice liegt bei 30,00 $ pro Million Zeichen in Artificial Analysis’ eigener Preistabelle, einer Zahl, die die Website aus HeyGens Credit-Preisgestaltung ableitet, weil HeyGens öffentliche Preisseite Credits verkauft, ohne anzugeben, wie viel eine Sprachgenerierung verbraucht. Der Unterschied bei kontrollierten Stimmen beträgt indes 79 Elo: HeyGen Voice erreichte 1.202 in der Arena, in der alle acht Referenzstimmen konstant gehalten werden, Qwen-Audio-3.0-TTS-Plus 1.123. Das günstigere Modell liegt also deutlich hinter dem besseren, das Verhältnis zwischen ihnen beträgt ungefähr 1,55×, und nur einer dieser beiden Preise ist eine Zahl, zu der der verkaufende Anbieter seinen Namen gesetzt hat.

Die Falle im Namen

Bevor du irgendetwas davon tust, wähle die richtige Leistungsstufe, denn das ist eine Familie, die dich nur zu gern das falsche Modell benchmarken lässt. Zwei Alibaba-Einträge sind hier von Bedeutung, und sie sind nicht austauschbar.

Qwen-Audio-3.0-TTS-Plus ist das Modell, mit dem dieser Artikel verglichen wird. Es erreicht 1.123 auf dem kontrollierten Board – Platz sieben von zweiundvierzig – und 1.264 auf dem Provider-Voices-Board, wo es Rang sechs von sechsundneunzig belegt. Es ist ein echtes, aktuelles Streaming-TTS-Produkt mit einem veröffentlichten Preis von 19,30 US-Dollar pro Million Zeichen.

Qwen-Audio-3.1-TTS-Plus ist dessen Nachfolgerstufe und diejenige, die mit 1.186 den zweiten Platz auf dem kontrollierten Board belegt – das Modell, das bei seinem Debüt am dichtesten davor stand, HeyGen Voice zu schlagen. Seine Rate wird mit denselben 19,30 $ angegeben, doch Alibabas Dokumentation warnt, dass unterschiedliche Modellversionen passende Stimmen erfordern, sodass „gleicher Preis, neuere Stufe“ nicht „Drop-in-Ersatz“ bedeutet.

Wer „#1 vor Qwen“ liest und dann Qwen-Audio-3.0-TTS benchmarkt, testet ein Modell, das 63 Elo schwächer ist als das, um das es in der Schlagzeile ging. Die Streitfrage um die Einstufung ist 63 Punkte wert, was mehr ist als der Abstand zwischen HeyGen Voice und dem dritten Platz.

Die Anzeigetafel

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Kontrolliertes Voice-Elo (dieselben 8 geklonten Stimmen) — HeyGen Voice: 1.202, Nr. 1 von 42. Qwen-Audio-3.0-TTS-Plus: 1.123, Nr. 7.

• Anbieterstimmen-Elo (native Stimmen) — Qwen-Audio-3.0-TTS-Plus: 1.264, #6 von 96. HeyGen Voice: nicht platziert.

• Preis pro 1 Mio. Zeichen — Qwen-Audio-3.0-TTS-Plus: 19,30 $, vom Anbieter veröffentlicht auf Alibaba Cloud. HeyGen Voice: 30,00 $ gemäß der eigenen Umrechnung der Credit-Preise durch die Arena; HeyGen veröffentlicht keinen Preis für Sprachausgabe.

• Kosten für 100 Stunden Sprachaufnahme — Qwen-Audio-3.0-TTS-Plus: etwa 926 $ bei ~480.000 Zeichen pro gesprochener Stunde. HeyGen Voice: etwa 1.440 $ bei der Umrechnung von 30,00 $ der Arena — abgeleitet, nicht zitiert.

• Stimmsteuerung — Qwen-Audio-3.0-TTS-Plus: Instruktionsparameter, Emotions- und Sprach-Tags, Stimmklonen und Stimmdesign. HeyGen Voice: Text-zu-Stimme-Design aus einer Beschreibung mit ≤1.000 Zeichen, Sofort-Klon, professioneller Klon, trainiert mit 20+ Minuten.

• Ausgabe — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 und Opus mit bis zu 48 kHz, mit anpassbarer Geschwindigkeit, Tonhöhe, Lautstärke und Bitrate. HeyGen Voice: Geschwindigkeit 0,5–1,5 und Tonhöhe ±50 Halbtöne pro Anfrage.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

Was Alibabas Engineering dir tatsächlich bietet

Die Qwen-Audio-3.0-TTS-Familie ist ein Streaming-Produkt, und die Dokumentation liest sich auch so. Anfragen laufen über ein WebSocket-Protokoll, das mit CosyVoice gemeinsam genutzt wird, mit dem run-task, continue-task und finish-task-Ereignisfluss und den task-started, result-generated, task-finished und task-failed-Antworten daneben. Der Abbruch wird für jedes Qwen-Audio-TTS-Modell sowohl in der Region Peking als auch in der Region Singapur über streaming_cancel(). Die Ausgabe erreicht 48 kHz, und zu den Formaten gehört Opus, was wichtig ist, wenn Sie Audio in einen Browser oder einen Telefonanruf statt in eine WAV-Datei übertragen.

Zwei Details in dieser Dokumentation sind leicht zu übersehen und teuer, wenn man sie erst spät entdeckt. Emotion- und Rich-Language-Tags gelten nur für die Tarife Plus und Flash – nicht für die gesamte Familie – und sie funktionieren nur im unidirektionalen Streaming-Modus. Und API-Schlüssel unterscheiden sich zwischen den Regionen Singapur und Peking, wobei Arbeitsbereiche über URLs der Form wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference adressiert werden. Regionale Schlüssel sind ein Provisionierungsdetail – bis zu dem Tag, an dem sie einen Ausfall bedeuten.

HeyGens Seite ist eine andere Art von Produkt: eine REST-artige v3-API, bei der POST /v3/voices/speech Sprache rendert, GET /v3/voices den Katalog hinter einem engine-Filter auflistet und Voice Design aus einem Text-Prompt bis zu drei gereihte Optionen samt Seed für die Reproduzierbarkeit zurückgibt. Die Dokumentation verrät außerdem, dass der engine-Filter Werte akzeptiert, die über HeyGens eigene hinausgehen – HeyGen leitet dich also bereitwillig über seine API zu einer Voice-Engine eines Drittanbieters weiter. Ein Anbieter, der das Modell eines Konkurrenten als auswählbare Option anbietet, verrät damit etwas darüber, wo er seine eigene Stärke sieht.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

Wohin die 79 Elo gehen

Ein Abstand von 79 Punkten auf einer kontrollierten Rangliste ist beträchtlich – größer als der Vorsprung von 16 Punkten, der HeyGen Voice vom zweiten Platz trennt, und entspricht in etwa dem Abstand zwischen dem dritten und achten Platz in diesem Feld. Er wird außerdem nur auf einer Achse gemessen.

Die kontrollierte Arena klont acht Stimmen und hält sie fest. Sie sagt nichts über die instruktionsgesteuerte Steuerungsoberfläche, die Qwen bereitstellt, nichts über 48-kHz-Opus-Ausgabe über einen abbrechbaren WebSocket und nichts über regionale Bereitstellung. Das sind technische Eigenschaften, und sie sind der Grund, warum ein Team, das ein mandarinsprachiges Contactcenter aufbaut, nicht zu einem Modell wechseln würde, das bei acht englischsprachigen Referenzstimmen 79 Punkte höher abschneidet.

Was das kontrollierte Ergebnis tatsächlich aussagt, ist enger gefasst und dennoch nützlich: Wenn beiden Engines dieselbe geklonte Stimme übergeben wird, bevorzugten die Zuhörer das Rendering von HeyGen Voice. Wenn Ihr Produkt Stimmen klont, ist das Ihre Achse. Wenn Ihr Produkt eine Stimme aus einem Katalog auswählt und sie in einen Anruf streamt, ist die Anbieter-Bestenliste näher an Ihrer Realität — und dort hat HeyGen Voice überhaupt keinen Rang, während Qwen-Audio-3.0-TTS-Plus auf Platz sechs von 96 steht.

Das Preisargument, ernst genommen

Bei 19,30 $ pro Million Zeichen kostet Qwen-Audio-3.0-TTS-Plus ungefähr halb so viel wie die 40-Dollar-Stufe von ElevenLabs und etwa 40 % der 49 Dollar von Cartesia Sonic 3.6. Für einen Arbeitsumfang von 100 Stunden Erzählung – bei einer typischen Sprechgeschwindigkeit etwa 48 Millionen Zeichen – sind das in der Größenordnung von 926 $. Dasselbe Volumen würde auf Eleven v4 Turbo etwa 1.920 $ und auf Sonic 3.6 etwa 2.352 $ kosten. HeyGen Voice liegt mit den 30,00 $ der Arena bei nahezu 1.440 $: zwischen der günstigen Preisstufe und den beiden etablierten Anbietern, näher an der Mitte als an der Spitze.

Diese Rechnung hat einen Vorbehalt, den die anderen nicht brauchen. 19,30 $ ist der von Alibaba selbst veröffentlichte Preis. 30,00 $ ist die Umrechnung von Artificial Analysis für ein Creditsystem, das HeyGen nie in Zeichen übersetzt hat; es handelt sich also um eine Schätzung nach bestem Wissen und Gewissen und nicht um eine Preisangabe. Wenn das tatsächliche Verhältnis von Zeichen pro Credit schlechter ist als im Diagramm angenommen, kostet der 79-Elo-Vorteil mehr als das 1,55-Fache, das er impliziert; ist es besser, weniger. Ein Modell, dessen Preis man erst erschließen muss, ist ein Modell, mit dem man auf einem gemessenen Verkehrsanteil pilotiert, statt sich darauf zu standardisieren. Das ist keine Kritik an der Engine – es ist eine Beschreibung der Informationen, die am 10. Oktober 2026 verfügbar waren.

Entscheiden

Nehmen Sie Qwen-Audio-3.0-TTS-Plus, wenn Kosten und Streaming-Infrastruktur die Entscheidung bestimmen. Unter 20 US-Dollar pro Million Zeichen, ein abbrechbarer WebSocket mit 48-kHz-Opus-Ausgabe, ein Instruction-Parameter und Emotion-Tags sowie ein sechster Platz im Anbieter-Board machen es zur wirtschaftlichsten gut bewerteten Stimme in diesem Vergleich. Nehmen Sie stattdessen die 3.1-Stufe, wenn Sie das Modell möchten, das auf dem kontrollierten Board tatsächlich Zweiter wurde, und prüfen Sie die Stimmenliste, bevor Sie annehmen, dass der Wechsel kostenlos ist.

Testen Sie HeyGen Voice, wenn Clone-Treue das Produkt ist. Ein Sprecher, viele Zeilen, eine Stimme, die jedes Mal *diese* Stimme sein muss – das ist die Achse, die das kontrollierte Board misst, und die Achse, auf der es das gesamte Feld anführt. Kalkulieren Sie eine Messperiode ein, denn das Credits-Modell bedeutet, dass Sie Ihre tatsächlichen Kosten erfahren, indem Sie Ihren eigenen Text laufen lassen, statt eine Preisliste zu lesen.

Und ignoriere den Vergleich vollständig, wenn die Arbeitslast chinesischsprachig ist und in Echtzeit läuft. Keine der beiden Elo-Zahlen wurde an deinen Stimmen, in deiner Sprache, bei deinem Latenzbudget gemessen.

Beide erreichbar halten

Dies ist eine der Paarungen, bei denen die Routing-Schicht ihren Platz verdient, statt nur ein Anhängsel zu sein. Ein einziger API-Schlüssel, der beide Anbieter abdeckt — der Listenpreis des Anbieters wird ohne Aufschlag durchgereicht, sodass Alibabas veröffentlichter Preis von 19,30 $ der Preis ist, den Sie zahlen, und eine Qwen-Preisänderung noch am selben Tag live ist — beseitigt die Notwendigkeit, sich für einen Gewinner zu entscheiden, bevor Sie Belege haben. Automatisches Failover deckt das offensichtliche Risiko in einer Voice-Pipeline ab, in der ein stockender Stream für den Zuhörer hörbar ist, und die Routing-DSL lässt Sie Massen-Narration an die günstige Engine senden und für das Klonen kritische Zeilen an diejenige, die 79 Punkte besser abschneidet — ohne zwei Client-Bibliotheken und zwei Abrechnungsbeziehungen. OrcaRouters Wert liegt hier nicht darin, dass es ein Voice-Modell hostet; er liegt darin, dass es die Kosten dafür, herauszufinden, welches Sie wollen, praktisch auf null senkt.

Die offenen Fragen

Drei Dinge würden das klären. Ein Voice-Preis auf HeyGens eigener Preisseite würde den Betrag von 30,00 $, den die Arena herleitet, in eine Zahl verwandeln, die man prüfen kann. Ein HeyGen-Eintrag auf dem Provider Voices Board würde uns sagen, ob der Vorsprung geklonter Stimmen gegenüber nativen Stimmen Bestand hat — den Test, den Qwen-Audio-3.0-TTS-Plus auf Platz sechs von sechsundneunzig besteht. Und ein Ergebnis mit kontrollierter Stimme für Qwen-Audio-3.1-TTS-Plus gegen HeyGen Voice nach weiteren Stimmen würde uns sagen, ob 16 Elo eine stabile Rangfolge ist. Bis dahin: Qwen ist die bepreiste, streamfähige, gut platzierte Option; HeyGen Voice ist die höher bewertete, nicht bepreisbare; und die Stufe, die man benchmarkt, ist wichtiger als die Schlagzeile, die man liest.