Eine Hero-Karte für 'ElevenLabs Eleven v4 vs. Qwen-Audio-3.1-TTS-Plus' mit zwei Score-Karten: Qwen-Audio-3.1-TTS-Plus bei Elo 1.178, Rang 1 und 19,30 $ pro 1 Mio. Zeichen; ElevenLabs Eleven v4 bei Elo 1.157, Rang 2 und 80,00 $ pro 1 Mio. Zeichen; mit der Bildunterschrift '21 Elo-Punkte gegen einen vierfachen Preisunterschied'. Fußzeile: 'Controlled Voice Arena, laut Artificial Analysis, Sept. 2026.' Das OrcaRouter-Logo befindet sich in der unteren rechten Ecke.
Engineering & Research

Eleven v4 vs. Qwen Audio 3.1: Die günstigste Stimme im Feld hat gewonnen

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Auf dem Leaderboard, auf dem jeder Teilnehmer dieselben acht geklonten Stimmen erhält, Alibaba Qwen-Audio-3.1-TTS-Plus belegte mit Elo 1.178 den ersten Platz und ElevenLabs Eleven v4 belegte mit 1.157 den zweiten Platz. Das Modell, das gewonnen hat, kostet auf diesem Leaderboard 19,30 $ pro Million Zeichen. Das Modell, das Zweiter wurde, kostet 80,00 $. Das ist eine Qualitätslücke von 21 Punkten und ein vierfacher Preisunterschied, die in entgegengesetzte Richtungen weisen, und es ist das interessanteste Ergebnis der gesamten Launch-Woche – interessanter als der erste Platz, den ElevenLabs in der anderen Arena belegte, denn dort ist die Reihenfolge konventionell und der Gewinner ist die teuerste Stimme in den Top Ten.

Die beiden Ranglisten sind nicht austauschbar, und dass dieser Vergleich so ausfällt, liegt einzig und allein daran, welche man betrachtet. Bei Provider Voice beurteilen Hörer die eigenen Stimmen jedes Anbieters. Controlled Voice klont für jedes Modell dieselben acht Stimmen – vier US-amerikanische, vier britische –, sodass niemand allein aufgrund seiner standardmäßigen Stimmbesetzung gewinnen kann. ElevenLabs gewinnt die erste um 61 Punkte. Alibaba gewinnt die zweite um 21. Keine der beiden Ranglisten ist falsch, und die zweite ist diejenige, die ein Produkt vorhersagt, das mit einer geklonten Markenstimme auf den Markt kommt.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

Das Scoreboard für kontrollierte Stimme, vollständig

• Blindpräferenz, gematchte Klone – Qwen-Audio-3.1-TTS-Plus Rang 1, Elo 1.178, 19,30 $ pro Million Zeichen vs. Eleven v4 Rang 2, Elo 1.157, 80,00 $.

Blinde Präferenz, die eigenen Stimmen jedes Anbieters — Eleven v4 auf Rang 1, Elo 1.319 gegenüber Qwen-Audio-3.0-TTS-Plus auf Rang 4, Elo 1.258. Ein Unterschied von 61 Punkten in die andere Richtung.

• Preis, Arena-Normalisierung — Qwen 19,30 $ vs. Eleven v4 80,00 $. Qwen ist 76 % günstiger.

• Preis, Anbieter-Preisliste – Eleven v4: 0,022 $ pro tausend Zeichen als Aktionspreis und 0,08 $ nach dem 12. Oktober. Die eigene Preisliste von Qwen Audio 3.1 konnten wir nicht einsehen, daher ist die Arena-Normalisierung der einzige Preis, den wir vergleichen können.

• Version auf jeder Platine — 3.1 bei Controlled Voice, 3.0 bei Provider Voice. Es handelt sich um unterschiedliche Modelle und die Platinen sind nicht untereinander austauschbar.

• Der 3.0-Eintrag bei Controlled Voice — Rang 5, Elo 1.124, gleicher Preis von 19,30 $. Das 3.1-Release ist bei identischem Preis 54 Elo mehr wert als der eigene Vorgänger.

• Frühere Qwen-Generationen auf Provider Voice — Qwen3 TTS Flash Rang 79, Elo 944; Qwen3 TTS Rang 82, Elo 930.

• ElevenLabs' eigenes vorheriges Flaggschiff bei Controlled Voice — Eleven v3 Rang 7, Elo 1.073.

• Plausibilitätscheck mit gruppierten Balken — die Acht-Wege-Spanne von Rang 1 bis Rang 10 bei Controlled Voice beträgt 121 Elo. Qwens 21-Punkte-Vorsprung vor Eleven v4 liegt unter einem Fünftel der Spannweite des gesamten Feldes, was die richtige Größenordnung ist, um ihn dort zu halten.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Zwei Zeilen dort erledigen den Großteil der Arbeit. Die erste ist der Vergleich 3.0 gegen 3.1: Alibaba legte mit einem einzigen Versionssprung um 54 Elo zu, ohne den Preis überhaupt zu ändern. Das ist eine schnellere Taktung als ElevenLabs' 84-Punkte-Sprung von v3 auf v4, und es bedeutet, dass die konkrete Rangfolge in diesem Artikel eine Momentaufnahme ist, die beide Anbieter aktiv durcheinanderwirbeln.

Das zweite ist die Gesamtspanne von 121 Punkten. Ein Abstand von 21 Punkten auf einem Board, dessen nutzbarer Bereich etwa 120 Punkte beträgt, ist ein realer, aber bescheidener Unterschied – ungefähr dieselbe Größenordnung wie der Abstand zwischen Qwens eigenem 3.1 und seinem 3.0. Wenn Ihr Anwendungsfall in einer Sprache liegt, auf die keines der beiden Modelle abgestimmt wurde, liegt diese Marge durchaus im Bereich dessen, was ein paar harte Testskripte umstoßen können.

Das Versionsproblem, das niemand anspricht

Das Ergebnis, das als „Eleven v4 ist bei Controlled Voice auf Platz zwei“ kursiert, ist zutreffend und unvollständig, und die Auslassung ist wichtig für alle, die darauf aufbauend planen. Das Modell, das auf diesem Board über Eleven v4 steht, ist Alibabas 3.1-Release. Der Qwen-Eintrag auf dem Provider Voice Board hingegen ist das 3.0-Release – das 3.1-Modell erscheint nach unserer Lesart nicht in den oberen Zeilen dieses Boards. Die beiden Schlagzeilen – „Eleven v4 ist Nummer eins“ und „Eleven v4 ist Nummer zwei“ – sind also Aussagen über zwei verschiedene Qwen-Modelle bei zwei verschiedenen Aufgaben, und die Qwen-Version, die es auf einem Board geschlagen hat, ist nicht die Qwen-Version, die es auf dem anderen geschlagen hat.

Das ist kein Trick, mit dem man einen der beiden Anbieter bloßstellen will; es ist ein Grund, jeder Ein-Satz-Zusammenfassung einer Woche wie dieser zu misstrauen. Wenn Sie zwischen diesen beiden Systemen wählen, ist der Vergleich, den Sie brauchen, 3.1 gegen v4 mit Ihrer eigenen geklonten Stimme, in Ihrer eigenen Sprache, und keiner der beiden Anbieter hat das veröffentlicht.

Was wir über Qwen Audio 3.1 sagen können und was nicht

Ehrlichkeit in Bezug auf die Belege ist hier mehr wert als eine vollständige Spezifikationstabelle, deshalb hier die Grenze dessen, worauf dieser Artikel beruht. Von den Arena-Boards haben wir für Qwen-Audio-3.1-TTS-Plus: einen Elo-Wert für kontrollierte Stimme von 1.178, eine Preisnormalisierung von 19,30 $ pro Million Zeichen und die Tatsache, dass es die aktuelle Veröffentlichung in einer Reihe ist, deren vorherige Version beim selben Preis 54 Punkte niedriger abschnitt.

Wir haben keine Angaben zu – und werden nicht raten bei: seiner Sprachabdeckung, seiner Latenz, seiner Eingabeobergrenze pro Anfrage, ob es Inline-Anweisungen zur Sprechweise unterstützt, ob es Voice-Cloning über die acht Stimmen der Arena hinaus bietet oder was es nach seiner eigenen Preisliste abrechnet. All diese Punkte sind für Eleven v4 dokumentiert – über 90 Sprachen, eine Obergrenze von 10.000 Zeichen, Audio-Tags, Zehn-Sekunden-Instant-Clones, IPA-Phonemunterstützung –, und ihr Fehlen auf der Qwen-Seite ist eine Lücke in dem, was öffentlich nachlesbar ist, kein Minuspunkt für das Modell. Eine Kaufentscheidung, die allein auf diesem Artikel basiert, wäre eine Entscheidung auf Grundlage von zwei Zahlen.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Ein Kontrast übersteht diese Einschränkung jedoch, weil beide Seiten vom Anbieter angegeben sind oder beide vom Board. Beim Preis ist die Board-Normalisierung der gemeinsame Nenner, und sie bevorzugt Qwen um 76 %. Bei der Qualität mit gematchten Sprechern bevorzugt dasselbe Board Qwen um 21 Elo. Diese beiden Zeilen sind vergleichbar. Alles andere hier ist es nicht, und der Artikel wird nicht so tun, als wäre es anders.

Warum ein kontrolliertes Board mehr Gewicht haben sollte als üblich

Die meisten Stimmvergleiche laufen standardmäßig darauf hinaus, dass ein Leaderboard das Modell, das man ohnehin bevorzugt, an die Spitze setzt. In diesem Duell gibt es einen wohlbegründeten Grund, Controlled Voice zu bevorzugen, und er ist spezifisch statt allgemein.

Alibaba und ElevenLabs konkurrieren mit grundverschiedenen Assets. ElevenLabs' Vorteil ist eine Stimmbibliothek, die über Jahre durch kuratiertes Casting aufgebaut wurde; Alibabas Vorteil ist eine Forschungsorganisation, die Modellversionen in schneller Folge veröffentlicht. Ein Leaderboard, auf dem jeder Teilnehmer eigene Stimmen mitbringen darf, misst die Bibliothek ebenso sehr wie den Synthesizer, und auf diesem Leaderboard gewinnt ElevenLabs mit 61 Punkten. Rechnet man die Bibliotheken heraus – dieselben acht geklonten Sprecher für alle –, wechselt der Vorteil die Seiten. Wenn die Stimme, die Ihre Nutzer hören, ein Klon einer bestimmten Person ist, kaufen Sie nicht ElevenLabs' Bibliothek, also ist das kontrollierte Leaderboard dasjenige, das Ihren Kauf beschreibt. Wenn Sie aus einem Menü von Standardstimmen auswählen, gilt das Gegenteil, und der 61-Punkte-Vorsprung von Eleven v4 ist die Zahl, die sich auszahlt.

Es gibt einen zweiten, unbequemeren Grund, das kontrollierte Ergebnis zu gewichten. Ein Board mit Anbieterstimmen belohnt eine unverwechselbare Standardbesetzung, und eine unverwechselbare Besetzung kann auf eine Weise polarisieren, die ein durchschnittlicher Elo-Wert verbirgt – was für den einen Hörer charaktervoll ist, ist für den anderen affektiert. Ein Board mit geklonten Stimmen und abgestimmten Sprechern eliminiert diese Variable vollständig, was es zur reproduzierbareren Messung der beiden macht.

Eines von beiden ausführen, und was wir tatsächlich routen

OrcaRouter hostet weder die Modelle von ElevenLabs noch die von Alibaba. Keiner der beiden Anbieter steht in unserem Katalog, es gibt also keine Möglichkeit, eines von beiden über uns aufzurufen, und dieser Artikel wird nichts anderes nahelegen – für beide wenden Sie sich an die API des jeweiligen Anbieters und mehrere Drittanbieter-Plattformen.

Was wir abdecken, ist die Ebene darüber. Wenn Ihr Sprach-Stack ein Knoten in einer größeren Pipeline ist, bieten wir über 200 Modelle hinter einem einzigen API-Schlüssel, mit den Listenpreisen der Anbieter, durchgereicht mit 0 % Aufschlag, sodass eine Preisänderung bei einem beliebigen Upstream – einschließlich des Aktionszeitraums von ElevenLabs und des deutlich höheren Listenpreises, der am 12. Oktober darauf folgt – bei uns am Tag des Inkrafttretens berücksichtigt wird und nicht erst zum nächsten Abrechnungszyklus. Bei einer Entscheidung, die von einem 4-fachen Preisverhältnis abhängt, ist dieses Timing der Unterschied zwischen einem Vergleich, der gut altert, und einem, der in drei Wochen schlicht falsch wirkt.

Und wo der Voice-Pfad nicht ausfallen darf, verlagert automatisches Failover den Traffic auf einen gesunden Upstream, statt die Anfrage fehlschlagen zu lassen. Bei einem Duell, das in Sachen Qualität so knapp und beim Preis so einseitig ausfällt, ist die vernünftige Architektur, beide Modelle hinter einem Endpoint zu betreiben und das Routing über die Aufteilung entscheiden zu lassen – statt einer dauerhaften Auswahl auf Basis eines Leaderboard-Schnappschusses, den beide Anbieter innerhalb eines Quartals entwerten werden.

Das Urteil und sein Ablaufdatum

Nimm Qwen-Audio-3.1-TTS-Plus, wenn du eine Stimme klonst und auf die Kosten achtest. Es steht an erster Stelle in der Rangliste, die die Sprecher konstant hält, es kostet ungefähr ein Viertel des Preises, und seine Linie bewegt sich schneller – 54 Elo in einem Versionsschritt bei unveränderter Rate legen nahe, dass die nächste Version auf dem Papier die bessere Wette ist als die aktuelle.

Nimm Eleven v4, wenn deine Nutzer Standardstimmen hören, wenn du Abdeckung in Sprachen brauchst, die du vor dem Ausliefern verifizieren kannst, oder wenn der dokumentierte Funktionsumfang – Audio-Tags, Phonemsteuerung, Anfragen mit 10.000 Zeichen, Zehn-Sekunden-Klone – in deinem Produkt Arbeit leistet, die die Arena-Boards nicht messen. Sein Vorsprung von 61 Punkten auf dem Vendor-Voice-Board ist nicht nichts, und die zwei Funktionen, die du in ein Skript schreiben kannst, sind Fähigkeiten, keine Punktzahlen.

Legen Sie ein Überprüfungsdatum fest. Alibaba hat in diesem Zyklus bei einem Versionssprung 54 Elo zugelegt, und ElevenLabs hat über eine vollständige Generation hinweg 84 Elo zugelegt; der Aktionspreis von Eleven v4 läuft am 12. Oktober aus. Was dieser Vergleich heute auch aussagt – die beiden Fakten, die ihn am wahrscheinlichsten kippen dürften, ein 3.2-Release und ein zurückgenommener Preis, fallen beide vor Ende des Quartals.