
Eleven v4 vs. Qwen Audio 3.1: Die günstigste Stimme im Feld hat gewonnen
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 982 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 197 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Auf dem Leaderboard, auf dem jeder Teilnehmer dieselben acht geklonten Stimmen erhält, Alibaba Qwen-Audio-3.1-TTS-Plus belegte mit Elo 1.178 den ersten Platz und ElevenLabs Eleven v4 belegte mit 1.157 den zweiten Platz. Das Modell, das gewonnen hat, kostet auf diesem Leaderboard 19,30 $ pro Million Zeichen. Das Modell, das Zweiter wurde, kostet 80,00 $. Das ist eine Qualitätslücke von 21 Punkten und ein vierfacher Preisunterschied, die in entgegengesetzte Richtungen weisen, und es ist das interessanteste Ergebnis der gesamten Launch-Woche – interessanter als der erste Platz, den ElevenLabs in der anderen Arena belegte, denn dort ist die Reihenfolge konventionell und der Gewinner ist die teuerste Stimme in den Top Ten.
Die beiden Ranglisten sind nicht austauschbar, und dass dieser Vergleich so ausfällt, liegt einzig und allein daran, welche man betrachtet. Bei Provider Voice beurteilen Hörer die eigenen Stimmen jedes Anbieters. Controlled Voice klont für jedes Modell dieselben acht Stimmen – vier US-amerikanische, vier britische –, sodass niemand allein aufgrund seiner standardmäßigen Stimmbesetzung gewinnen kann. ElevenLabs gewinnt die erste um 61 Punkte. Alibaba gewinnt die zweite um 21. Keine der beiden Ranglisten ist falsch, und die zweite ist diejenige, die ein Produkt vorhersagt, das mit einer geklonten Markenstimme auf den Markt kommt.

Das Scoreboard für kontrollierte Stimme, vollständig
• Blindpräferenz, gematchte Klone – Qwen-Audio-3.1-TTS-Plus Rang 1, Elo 1.178, 19,30 $ pro Million Zeichen vs. Eleven v4 Rang 2, Elo 1.157, 80,00 $.
Blinde Präferenz, die eigenen Stimmen jedes Anbieters — Eleven v4 auf Rang 1, Elo 1.319 gegenüber Qwen-Audio-3.0-TTS-Plus auf Rang 4, Elo 1.258. Ein Unterschied von 61 Punkten in die andere Richtung.
• Preis, Arena-Normalisierung — Qwen 19,30 $ vs. Eleven v4 80,00 $. Qwen ist 76 % günstiger.
• Preis, Anbieter-Preisliste – Eleven v4: 0,022 $ pro tausend Zeichen als Aktionspreis und 0,08 $ nach dem 12. Oktober. Die eigene Preisliste von Qwen Audio 3.1 konnten wir nicht einsehen, daher ist die Arena-Normalisierung der einzige Preis, den wir vergleichen können.
• Version auf jeder Platine — 3.1 bei Controlled Voice, 3.0 bei Provider Voice. Es handelt sich um unterschiedliche Modelle und die Platinen sind nicht untereinander austauschbar.
• Der 3.0-Eintrag bei Controlled Voice — Rang 5, Elo 1.124, gleicher Preis von 19,30 $. Das 3.1-Release ist bei identischem Preis 54 Elo mehr wert als der eigene Vorgänger.
• Frühere Qwen-Generationen auf Provider Voice — Qwen3 TTS Flash Rang 79, Elo 944; Qwen3 TTS Rang 82, Elo 930.
• ElevenLabs' eigenes vorheriges Flaggschiff bei Controlled Voice — Eleven v3 Rang 7, Elo 1.073.
• Plausibilitätscheck mit gruppierten Balken — die Acht-Wege-Spanne von Rang 1 bis Rang 10 bei Controlled Voice beträgt 121 Elo. Qwens 21-Punkte-Vorsprung vor Eleven v4 liegt unter einem Fünftel der Spannweite des gesamten Feldes, was die richtige Größenordnung ist, um ihn dort zu halten.

Zwei Zeilen dort erledigen den Großteil der Arbeit. Die erste ist der Vergleich 3.0 gegen 3.1: Alibaba legte mit einem einzigen Versionssprung um 54 Elo zu, ohne den Preis überhaupt zu ändern. Das ist eine schnellere Taktung als ElevenLabs' 84-Punkte-Sprung von v3 auf v4, und es bedeutet, dass die konkrete Rangfolge in diesem Artikel eine Momentaufnahme ist, die beide Anbieter aktiv durcheinanderwirbeln.
Das zweite ist die Gesamtspanne von 121 Punkten. Ein Abstand von 21 Punkten auf einem Board, dessen nutzbarer Bereich etwa 120 Punkte beträgt, ist ein realer, aber bescheidener Unterschied – ungefähr dieselbe Größenordnung wie der Abstand zwischen Qwens eigenem 3.1 und seinem 3.0. Wenn Ihr Anwendungsfall in einer Sprache liegt, auf die keines der beiden Modelle abgestimmt wurde, liegt diese Marge durchaus im Bereich dessen, was ein paar harte Testskripte umstoßen können.
Das Versionsproblem, das niemand anspricht
Das Ergebnis, das als „Eleven v4 ist bei Controlled Voice auf Platz zwei“ kursiert, ist zutreffend und unvollständig, und die Auslassung ist wichtig für alle, die darauf aufbauend planen. Das Modell, das auf diesem Board über Eleven v4 steht, ist Alibabas 3.1-Release. Der Qwen-Eintrag auf dem Provider Voice Board hingegen ist das 3.0-Release – das 3.1-Modell erscheint nach unserer Lesart nicht in den oberen Zeilen dieses Boards. Die beiden Schlagzeilen – „Eleven v4 ist Nummer eins“ und „Eleven v4 ist Nummer zwei“ – sind also Aussagen über zwei verschiedene Qwen-Modelle bei zwei verschiedenen Aufgaben, und die Qwen-Version, die es auf einem Board geschlagen hat, ist nicht die Qwen-Version, die es auf dem anderen geschlagen hat.
Das ist kein Trick, mit dem man einen der beiden Anbieter bloßstellen will; es ist ein Grund, jeder Ein-Satz-Zusammenfassung einer Woche wie dieser zu misstrauen. Wenn Sie zwischen diesen beiden Systemen wählen, ist der Vergleich, den Sie brauchen, 3.1 gegen v4 mit Ihrer eigenen geklonten Stimme, in Ihrer eigenen Sprache, und keiner der beiden Anbieter hat das veröffentlicht.
Was wir über Qwen Audio 3.1 sagen können und was nicht
Ehrlichkeit in Bezug auf die Belege ist hier mehr wert als eine vollständige Spezifikationstabelle, deshalb hier die Grenze dessen, worauf dieser Artikel beruht. Von den Arena-Boards haben wir für Qwen-Audio-3.1-TTS-Plus: einen Elo-Wert für kontrollierte Stimme von 1.178, eine Preisnormalisierung von 19,30 $ pro Million Zeichen und die Tatsache, dass es die aktuelle Veröffentlichung in einer Reihe ist, deren vorherige Version beim selben Preis 54 Punkte niedriger abschnitt.
Wir haben keine Angaben zu – und werden nicht raten bei: seiner Sprachabdeckung, seiner Latenz, seiner Eingabeobergrenze pro Anfrage, ob es Inline-Anweisungen zur Sprechweise unterstützt, ob es Voice-Cloning über die acht Stimmen der Arena hinaus bietet oder was es nach seiner eigenen Preisliste abrechnet. All diese Punkte sind für Eleven v4 dokumentiert – über 90 Sprachen, eine Obergrenze von 10.000 Zeichen, Audio-Tags, Zehn-Sekunden-Instant-Clones, IPA-Phonemunterstützung –, und ihr Fehlen auf der Qwen-Seite ist eine Lücke in dem, was öffentlich nachlesbar ist, kein Minuspunkt für das Modell. Eine Kaufentscheidung, die allein auf diesem Artikel basiert, wäre eine Entscheidung auf Grundlage von zwei Zahlen.

Ein Kontrast übersteht diese Einschränkung jedoch, weil beide Seiten vom Anbieter angegeben sind oder beide vom Board. Beim Preis ist die Board-Normalisierung der gemeinsame Nenner, und sie bevorzugt Qwen um 76 %. Bei der Qualität mit gematchten Sprechern bevorzugt dasselbe Board Qwen um 21 Elo. Diese beiden Zeilen sind vergleichbar. Alles andere hier ist es nicht, und der Artikel wird nicht so tun, als wäre es anders.
Warum ein kontrolliertes Board mehr Gewicht haben sollte als üblich
Die meisten Stimmvergleiche laufen standardmäßig darauf hinaus, dass ein Leaderboard das Modell, das man ohnehin bevorzugt, an die Spitze setzt. In diesem Duell gibt es einen wohlbegründeten Grund, Controlled Voice zu bevorzugen, und er ist spezifisch statt allgemein.
Alibaba und ElevenLabs konkurrieren mit grundverschiedenen Assets. ElevenLabs' Vorteil ist eine Stimmbibliothek, die über Jahre durch kuratiertes Casting aufgebaut wurde; Alibabas Vorteil ist eine Forschungsorganisation, die Modellversionen in schneller Folge veröffentlicht. Ein Leaderboard, auf dem jeder Teilnehmer eigene Stimmen mitbringen darf, misst die Bibliothek ebenso sehr wie den Synthesizer, und auf diesem Leaderboard gewinnt ElevenLabs mit 61 Punkten. Rechnet man die Bibliotheken heraus – dieselben acht geklonten Sprecher für alle –, wechselt der Vorteil die Seiten. Wenn die Stimme, die Ihre Nutzer hören, ein Klon einer bestimmten Person ist, kaufen Sie nicht ElevenLabs' Bibliothek, also ist das kontrollierte Leaderboard dasjenige, das Ihren Kauf beschreibt. Wenn Sie aus einem Menü von Standardstimmen auswählen, gilt das Gegenteil, und der 61-Punkte-Vorsprung von Eleven v4 ist die Zahl, die sich auszahlt.
Es gibt einen zweiten, unbequemeren Grund, das kontrollierte Ergebnis zu gewichten. Ein Board mit Anbieterstimmen belohnt eine unverwechselbare Standardbesetzung, und eine unverwechselbare Besetzung kann auf eine Weise polarisieren, die ein durchschnittlicher Elo-Wert verbirgt – was für den einen Hörer charaktervoll ist, ist für den anderen affektiert. Ein Board mit geklonten Stimmen und abgestimmten Sprechern eliminiert diese Variable vollständig, was es zur reproduzierbareren Messung der beiden macht.
Eines von beiden ausführen, und was wir tatsächlich routen
OrcaRouter hostet weder die Modelle von ElevenLabs noch die von Alibaba. Keiner der beiden Anbieter steht in unserem Katalog, es gibt also keine Möglichkeit, eines von beiden über uns aufzurufen, und dieser Artikel wird nichts anderes nahelegen – für beide wenden Sie sich an die API des jeweiligen Anbieters und mehrere Drittanbieter-Plattformen.
Was wir abdecken, ist die Ebene darüber. Wenn Ihr Sprach-Stack ein Knoten in einer größeren Pipeline ist, bieten wir über 200 Modelle hinter einem einzigen API-Schlüssel, mit den Listenpreisen der Anbieter, durchgereicht mit 0 % Aufschlag, sodass eine Preisänderung bei einem beliebigen Upstream – einschließlich des Aktionszeitraums von ElevenLabs und des deutlich höheren Listenpreises, der am 12. Oktober darauf folgt – bei uns am Tag des Inkrafttretens berücksichtigt wird und nicht erst zum nächsten Abrechnungszyklus. Bei einer Entscheidung, die von einem 4-fachen Preisverhältnis abhängt, ist dieses Timing der Unterschied zwischen einem Vergleich, der gut altert, und einem, der in drei Wochen schlicht falsch wirkt.
Und wo der Voice-Pfad nicht ausfallen darf, verlagert automatisches Failover den Traffic auf einen gesunden Upstream, statt die Anfrage fehlschlagen zu lassen. Bei einem Duell, das in Sachen Qualität so knapp und beim Preis so einseitig ausfällt, ist die vernünftige Architektur, beide Modelle hinter einem Endpoint zu betreiben und das Routing über die Aufteilung entscheiden zu lassen – statt einer dauerhaften Auswahl auf Basis eines Leaderboard-Schnappschusses, den beide Anbieter innerhalb eines Quartals entwerten werden.
Das Urteil und sein Ablaufdatum
Nimm Qwen-Audio-3.1-TTS-Plus, wenn du eine Stimme klonst und auf die Kosten achtest. Es steht an erster Stelle in der Rangliste, die die Sprecher konstant hält, es kostet ungefähr ein Viertel des Preises, und seine Linie bewegt sich schneller – 54 Elo in einem Versionsschritt bei unveränderter Rate legen nahe, dass die nächste Version auf dem Papier die bessere Wette ist als die aktuelle.
Nimm Eleven v4, wenn deine Nutzer Standardstimmen hören, wenn du Abdeckung in Sprachen brauchst, die du vor dem Ausliefern verifizieren kannst, oder wenn der dokumentierte Funktionsumfang – Audio-Tags, Phonemsteuerung, Anfragen mit 10.000 Zeichen, Zehn-Sekunden-Klone – in deinem Produkt Arbeit leistet, die die Arena-Boards nicht messen. Sein Vorsprung von 61 Punkten auf dem Vendor-Voice-Board ist nicht nichts, und die zwei Funktionen, die du in ein Skript schreiben kannst, sind Fähigkeiten, keine Punktzahlen.
Legen Sie ein Überprüfungsdatum fest. Alibaba hat in diesem Zyklus bei einem Versionssprung 54 Elo zugelegt, und ElevenLabs hat über eine vollständige Generation hinweg 84 Elo zugelegt; der Aktionspreis von Eleven v4 läuft am 12. Oktober aus. Was dieser Vergleich heute auch aussagt – die beiden Fakten, die ihn am wahrscheinlichsten kippen dürften, ein 3.2-Release und ein zurückgenommener Preis, fallen beide vor Ende des Quartals.
