Eine generierte Hero-Karte für „Gemini 3.8 TTS vs. Qwen Audio 3.0 TTS" auf weißem Hintergrund mit sanften blau- und cyanfarbenen Farbverlaufsakzenten. Die linke Karte „Qwen-Audio-3.0-TTS-Plus" listet Elo 1.259, 15 Arena-Stimmen, 16 Sprachen + 20 Dialekte und 27,6 $ pro 1 Mio. Zeichen auf; die rechte Karte „Gemini 3.8 Flash TTS" listet Elo 1.260, 8 Arena-Stimmen, 130 Sprachen und 33,0 $ pro 1 Mio. Zeichen. Eine Fußzeile lautet „Elo laut Artificial Analysis Provider Voice Arena, Sept. 2026". Das OrcaRouter-Logo ist in die untere rechte Ecke eingefügt.
Engineering & Research

Gemini 3.8 TTS vs. Qwen Audio 3.0 TTS: Zwei unterschiedliche Antworten auf „Es richtig klingen lassen“

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Ein Elo-Punkt trennt diese beiden Modelle in der Artificial Analysis Provider Voice Arena, und sie erreichen dies, indem sie völlig unterschiedliche Probleme lösen. Qwen-Audio-3.0-TTS-Plus liegt auf Rang 3 mit einem Elo von 1.259 über 1.447 Stichproben und 15 Arena-Stimmen, veröffentlicht im September 2026 und für 27,60 $ pro Million Zeichen gelistet. Gemini 3.8 Flash TTS liegt auf Rang 2 mit 1.260 über 1.999 Stichproben und 8 Arena-Stimmen, veröffentlicht am 23. September 2026 und für 33,00 $ pro Million Zeichen gelistet. Statistisch nicht unterscheidbar, zwanzig Prozent Preisunterschied und auf gegensätzlichen Theorien darüber aufgebaut, was synthetische Sprache gut macht.

Die Theorie ist der interessante Teil. Qwens Antwort ist Inline-Steuerung: 86 Vortrags-Tags, die Sie durch den Text streuen, damit das Modell weiß, wo es atmen, betonen und den Ton wechseln soll. Googles Antwort ist eine Regie-Ebene: Zeile-für-Zeile-Anweisungen, Inszenierung für zwei Sprecher und eine kleine Auswahl nonverbaler Hinweise. Wenn Sie bereits eine Pipeline gebaut haben, die SSML-ähnliche Annotationen ausgibt, passt eine davon und die andere nicht, und diese Kompatibilität ist wichtiger als ein einzelner Elo-Punkt.

Wo die beiden tatsächlich auf dem Brett sitzen

Um den Provider Voice Arena ehrlich zu lesen, muss man auf die Intervalle schauen, nicht auf die Ränge.

• Qwen-Audio-3.0-TTS-Plus — Rang 3, Elo 1.259, 1.447 Samples, 15 Arena-Stimmen, September 2026, 27,6 $ pro 1 Million Zeichen.

• Gemini 3.8 Flash TTS — Rang 2, Elo 1.260, 1.999 Samples, 8 Arena-Stimmen, September 2026, 33,0 $ pro 1 Mio. Zeichen.

• Cartesia Sonic 3.6 — Rang 1, Elo 1.273, 1.757 Samples, 8 Arena-Stimmen, August 2026, 49,0 $ pro 1 Mio. Zeichen.

Die ersten drei bilden eine Gruppe. Die veröffentlichten Intervalle für die beiden obersten erstrecken sich siebzehn Punkte in beide Richtungen, was breiter ist als die gesamte Spanne zwischen dem ersten und dem dritten Platz, sodass die Reihenfolge unter ihnen keine belastbare Evidenz ist. Was die Rangliste jedoch belegt, ist, dass alle drei zur Spitzengruppe gehören und dass nichts unter ihnen nahe herankommt — Rang 10, Gemini 3.1 Flash TTS, liegt bei 1.199.

Die einzige erwähnenswerte Asymmetrie ist die Stimmenzahl in der Arena. Qwen tritt mit 15 Stimmen gegen Gemini mit 8 an, sodass der Qwen-Score ein Durchschnitt über eine breitere Stichprobe des eigenen Produkts des Anbieters ist. Das hat zwei Seiten: Es ist eine fairere Schätzung dessen, wie Qwens Katalog insgesamt klingt, und es gibt Qwen mehr Gelegenheiten, eine schwache Stimme aufzustellen, die den Durchschnitt nach unten zieht. Keine der beiden Lesarten ändert die Schlussfolgerung, dass die beiden gleichauf liegen.

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 Auslieferungs-Tags gegen eine Richtungsebene

Dies ist der wesentliche Unterschied, und er entscheidet über die meisten Integrationen.

Qwen-Audio-3.0-TTS wird mit 86 Inline-Delivery-Tags ausgeliefert — Annotationen, die in den Text eingebettet sind und steuern, wie eine Passage gesprochen wird. Es ist ein Markup-Ansatz: Ihr Skript trägt die Performance. Das ist jedem vertraut, der schon mit SSML gearbeitet hat, und es lässt sich gut mit Tooling kombinieren, das Text programmatisch generiert, weil die Steuerungsoberfläche eine String-Transformation statt eines API-Aufrufs ist.

Gemini 3.8 Flash TTS geht den anderen Weg. Sie steuern eine Zeile so, wie Sie einen Schauspieler anleiten würden – Tempo, Betonung, emotionale Färbung – als separate Anweisung statt als Inline-Markup. Szenen mit zwei Sprechern lassen sich innerhalb eines einzigen Aufrufs inszenieren. Und eine kleine Auswahl nonverbaler Cues ist in das Skript geschrieben: <laughs>, <sigh>, <gasp> als Inline-Cues, plus |mhm| und |yeah| für Backchannel-Geräusche.

Also akzeptieren beide Modelle In-Text-Annotationen; der Unterschied liegt in der Größe des Vokabulars und darin, wo der Rest der Steuerung liegt. Qwens Vokabular ist breiter und flacher – 86 Tags, alle im Text. Googles Vokabular ist im Text enger und außerhalb breiter, mit Ausrichtungsanweisungen für die Sprachausgabe und Sprecher-Staging als Parameter auf Call-Ebene. Wenn Sie ein System portieren, das bereits umfangreiches Inline-Markup ausgibt, ist Qwen die kürzere Portierung. Wenn Sie die Ausrichtungslogik ohnehin im Anwendungscode aufbauen, ist Googles Aufteilung sauberer.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Sprachabdeckung versus Dialektabdeckung

Die Coverage-Zahlen sind nicht vergleichbar, und sie naiv zu vergleichen ist ein Fehler.

Gemini 3.8 Flash TTS deckt 130 Sprachen ab, die automatisch aus dem Text erkannt werden; Flash-Lite TTS deckt 101 ab. Das ist eine Breite über Sprachfamilien hinweg – genau das, was man für einen Lokalisierungsdurchlauf will, der einen langen Schwanz von Märkten erreichen muss.

Qwen-Audio-3.0-TTS deckt 16 Sprachen plus 20 chinesische Dialektregionen ab. Das ist Tiefe innerhalb einer Sprachfamilie. Zwanzig Dialektregionen sind nicht so, wie es aussieht, eine kleinere Zahl als 130 Sprachen – es ist eine andere Art von Aussage, und für ein Produkt, das chinesischsprachige Nutzer in den Festlandregionen bedient, ist sie die nützlichere. Ein Modell mit 130 Sprachen und einer einzigen Mandarin-Stimme bedient einen Nutzer in Sichuan nicht so, wie es ein Modell mit 20 Dialektregionen tut.

Was zählt, hängt ganz von Ihrer Zielgruppe ab. Wenn Ihre Anforderung „zumindest passabel in zwanzig Märkten“ lautet, Gemini. Wenn sie „im chinesischen Markt tatsächlich richtig“ lautet, Qwen.

Preis – und was die Zahl pro Zeichen verbirgt

• Qwen-Audio-3.0-TTS-Plus — 27,60 US-Dollar pro 1 Mio. Zeichen auf normalisierter Basis des Leaderboards; die Flash-Variante liegt bei rund 15 US-Dollar pro 1 Mio. Zeichen mit einer angegebenen Latenz bis zum ersten Paket von etwa 300 ms.

• Gemini 3.8 Flash TTS — 33,00 $ pro 1 Mio. normalisierte Zeichen; Abrechnung durch Google mit 0,50 $ pro Million Text-Token (Eingabe) und 9,00 $ pro Million Audio-Token (Ausgabe) bis zum 31. Dezember 2026, danach 1,00 $ und 18,00 $.

• Gemini 3.8 Flash-Lite TTS — 22,10 $ pro 1 Mio. normalisierte Zeichen auf Rang 6 mit einem Elo von 1.235; bis zum 31. Dezember 2026 abgerechnet mit 6,00 $ pro Million Audio-Tokens.

Beide Werte pro Zeichen sind Normalisierungen von Artificial Analysis, keine Listenpreise der Anbieter – Qwen rechnet über Alibaba Cloud Model Studio ab und Google rechnet in Tokens ab, und keiner von beiden veröffentlicht für diese Modelle einen Preis pro Zeichen. Verwenden Sie sie für das Verhältnis, das mit etwa 1,2x zugunsten von Qwen ausfällt, und nicht als Preisangaben.

Die Stufen unterscheiden sich in ihrer Ausgestaltung. Qwen teilt sich in Plus und Flash auf, wobei die Flash-Stufe Qualität gegen ein First-Packet-Versprechen von ~300 ms eintauscht. Google teilt sich in Flash und Flash-Lite auf und dann weiter in Standard, Batch und Flex sowie Priority — 4,50 $, 9,00 $ und 16,20 $ pro Million Audio-Tokens bei Flash TTS. Googles Modell belohnt es, die eigene Workload zu klassifizieren; Qwens Modell belohnt es, vorab eine Qualitätsstufe zu wählen.

Die Verfügbarkeit ist der andere wesentliche Unterschied. Gemini 3.8 Flash TTS ist allgemein über die Gemini Developer API verfügbar. Qwen-Audio-3.0-TTS ist geschlossen und nur als gehosteter Dienst verfügbar, wird über Alibaba Cloud Model Studio bereitgestellt und bietet keine offenen Gewichte. Wenn Sie das Modell selbst betreiben müssen, ist keines von beiden für Sie geeignet – aber wenn Ihre Infrastruktur bereits in der Alibaba Cloud läuft, ist das Qwen-Modell dasjenige, bei dem keine Egress-Frage zu klären ist.

Behauptungen der Anbieter auf beiden Seiten

Keines der beiden Modelle verfügt über einen unabhängigen Benchmark jenseits der Arena, und beide Anbieter haben Behauptungen veröffentlicht, die als solche gekennzeichnet werden sollten.

Googles Angaben für Gemini 3.8 Flash TTS: Platz eins im Hume AI Voice Design Benchmark mit 71,4, Platz eins bei der Akzentmodellierung mit 60,8, Platz eins und zwei im Hume Overall Quality Index für Flash und Flash-Lite sowie Spitzenplatzierungen bei Blindpräferenz-Tests, die für Japanisch, brasilianisches Portugiesisch, Vietnamesisch, Modernes Hocharabisch, mexikanisches Spanisch und Hindi beansprucht werden. Die Durchläufe sind nicht öffentlich.

Alibabas Angaben zu Qwen-Audio-3.0-TTS: das 86-Tag-Delivery-System, die 20 Dialektregionen und der ~300-ms-First-Packet-Wert bei der Flash-Variante. Ebenfalls nicht reproduziert.

Die Arena-Elo ist die einzige unabhängig erhobene Qualitätskennzahl in diesem Artikel, und sie besagt, dass die beiden an der Spitze der Rangliste gleichauf liegen.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

Was Gemini hinzufügt, was Qwen nicht bietet

Die Spracherstellung ist die deutlichste Lücke. Gemini 3.8 Flash TTS unterstützt Voice-Design anhand einer Beschreibung in natürlicher Sprache sowie Voice-Replikation aus einer 30-Sekunden-Probe, mit Einwilligungsprüfung und einem SynthID-Wasserzeichen plus C2PA-Credentials in der Ausgabe. Individuelle Stimmen gibt es in zwei Formen: 200 zustandsbehaftete Stimmen pro Projekt mit einer Gültigkeitsdauer von einem Jahr oder zustandslose Stimmen, die über einen voicekey_...-Handle adressiert werden und nach sieben Tagen ablaufen. Voice-Remixing ist als „demnächst verfügbar“ aufgeführt.

Die Steuerung des Ausgabeformats steht an zweiter Stelle. WAV 24 kHz Mono 16-Bit vorzeichenbehaftetes PCM am Unary-Endpunkt, headerloses PCM (audio/l16) am Streaming-Endpunkt, plus audio/mulaw und audio/alaw sowie eine konfigurierbare Abtastrate. Für Telefonie-nahe Arbeiten entfernt die mulaw-Unterstützung einen Transkodierungsschritt.

Welchen anrufen?

Wählen Sie Qwen-Audio-3.0-TTS, wenn Ihre Nutzer chinesischsprachig sind und Dialektabdeckung die Anforderung ist, wenn Sie ein umfangreiches Inline-Markup-Vokabular wünschen, das Ihr Generator direkt ausgeben kann, oder wenn Sie bereits Alibaba Cloud nutzen und den kürzesten Weg zu einem funktionierenden Endpunkt möchten. Es ist zudem das günstigere der beiden auf normalisierter Basis, und die Flash-Variante ist noch günstiger, wenn ~300 ms bis zum ersten Paket akzeptabel sind.

Wählen Sie Gemini 3.8 Flash TTS, wenn Sie Breite über viele Sprachen statt Tiefe in einer einzelnen benötigen, wenn Sie eine bestimmte Stimme erstellen oder replizieren müssen, wenn Sie mulaw- oder alaw-Ausgabe benötigen, oder wenn „allgemein verfügbar statt nur gehostet“ eine Beschaffungsanforderung ist.

Keine der beiden Optionen ist eine schlechte Wahl, und keine ist eindeutig besser – genau darum geht es bei einer Differenz von einem Elo-Punkt. Die Entscheidung ist eine Frage der Kompatibilität, nicht der Qualität.

Das ist auch das Argument dafür, sich noch nicht fest auf eines von beiden festzulegen. OrcaRouter bietet Ihnen über 200 Modelle hinter einem Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preisänderung eines der beiden Labore noch am selben Tag auf Ihrer Rechnung ankommt und nicht erst bei der Verlängerung, und automatisches Failover bedeutet, dass ein Synthese-Endpunkt, der unter Last ins Stocken gerät, auf einen anderen ausweicht, statt die Anfrage fallenzulassen. Wir hosten Qwen-Audio-3.0-TTS nicht – das läuft über Alibaba Cloud Model Studio – und wir hosten auch nicht die Gemini 3.8 TTS-Endpunkte, die aus der Google-API stammen. Was wir bereitstellen, ist die Textebene und das Routing darüber, und genau das ermöglicht es Ihnen, beide einen Monat lang mit echtem Traffic laufen zu lassen, bevor Sie sich entscheiden.

Die Zahl, auf die man achten muss, ist die nächste Arena-Revision. Mit 1.447 Stichproben bei Qwen und 1.999 bei Gemini sind beide Intervalle noch breit genug, dass ein einziger Monat an Stimmen sie trennen könnte – oder bestätigen könnte, dass der Gleichstand die Antwort ist.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert