
Gemini 3.8 Live vs. Qwen-Audio-3.1-TTS: Zwei Hälften eines Voice-Stacks, im Abstand von acht Tagen neu bepreist
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 36 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 181 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Gemini 3.8 Live ist Googles Speech-to-Speech-Modell und wurde am 15. September 2026 veröffentlicht als gemini-3.8-live und gemini-3.8-live-extended-thinking auf der Live API. Qwen-Audio-3.1-TTS ist Alibabas Text-to-Speech-Modell, angekündigt auf der Apsara-Konferenz in Hangzhou am 23. September 2026, acht Tage später, verbunden mit einer Preissenkung von rund 70 % bei der Sprachsynthese. Diese acht Tage Abstand sind der Grund, warum sich dieser Vergleich jetzt lohnt und nicht erst im Juli. An den Rollen der beiden Produkte hat sich nichts geändert – das eine hört zu und spricht, das andere liest Text laut vor –, doch beide Hälften einer produktiven Voice-Pipeline wurden innerhalb einer einzigen Zeitspanne von zwei Wochen neu gebaut oder neu bepreist, und die Rechnung, die dieses Duell früher entschied, hat sich still verschoben.
Zwei Hälften, im Abstand von acht Tagen aufgefrischt
Beginnen wir mit dem, was diese Paarung ungewöhnlich macht: Die beiden Modelle konkurrieren nicht. Ein Sprachprodukt hat einen Mund und es hat ein Ohr, und hier ist jedes der beiden eines davon. Gemini 3.8 Live schließt den Kreis — Audio und Video hinein, Audio hinaus, Unterbrechungen werden behandelt, Tool-Aufrufe laufen unter der Konversation. Qwen-Audio-3.1-TTS nimmt einen String und eine Referenzstimme und gibt eine Performance zurück. Es ist ein besserer Mund als alles andere, und es versucht nicht, ein Ohr zu sein.
Was den Zeitpunkt im September interessant macht, ist, dass die beiden Ankündigungen auf entgegengesetzte Enden derselben Budgetlinie zielen. Der Start von Google am 15. September war eine Geschichte über neue Fähigkeiten, ohne damit verbundene Preisänderung; die Ankündigung von Alibaba am 23. September war größtenteils eine Margengeschichte, bei der neue Fähigkeiten mitliefen. Ein Team, das im August eine hybride Pipeline aufgebaut hat, bekam binnen acht Tagen einen Grund, beide Stränge erneut zu prüfen – und nur einer dieser Stränge wurde günstiger.
Was das 3.1-Release auf der Qwen-Seite tatsächlich geändert hat
Alibaba hat am 23. September nicht nur ein Modell veröffentlicht. Die 3.1-Generation umfasst fünf Endpunkte — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next und Qwen-Audio-3.1-Realtime — und nur einer davon, die einfache TTS-Variante, ist ein direkter Ersatz für alle, die bereits das 3.0-TTS-Modell aufrufen.
Auf dieser Stufe änderten sich drei Dinge, und eines davon ist ein echter Migrationsaufwand. Die Steuerung der Sprechweise wurde von einem festen Vokabular aus 86 Inline-Tags auf natürlichsprachliche Anweisungen umgestellt: Sie beschreiben die gewünschte Emotion, das Tempo und den Stil, anstatt die richtige Klammer an der richtigen Position einzufügen. Der sprachübergreifende Timbre-Transfer hielt Einzug und ermöglichte es einer Referenzstimme, ihre Identität über Mandarin, Kantonesisch, Englisch und Japanisch hinweg beizubehalten. Und das Modell toleriert jetzt verrauschtes oder mit Echo behaftetes Referenzaudio direkt, ohne einen separaten Denoise-Schritt. Die Sprachabdeckung bleibt unverändert bei vom Anbieter angegebenen 16 Sprachen plus 20 chinesischen Dialektregionen, und – das ist erwähnenswert, weil es anderswo gern glattgebügelt wird – das eigene Material von Alibaba besagt, dass die 3.1-Stufe sieben Sprachen hinzufügt, was sich nicht mit den 16 deckt, die in der veröffentlichten Abdeckung der Juli-Generation aufgeführt waren. Betrachten Sie beide Angaben als vom Anbieter gemeldet, bis Sie die konkreten Sprachen, die Sie benötigen, mit Model Studio abgleichen.
Das wirklich neue Produkt in diesem Release ist Qwen-Audio-3.1-TTS-Next, das Alibaba als „Audiogen“-Modell bezeichnet: ein Durchlauf, der Stimme, Soundeffekte und Hintergrundatmosphäre zusammen erzeugt – für Multi-Sprecher-Dialoge, Podcast-Zusammenstellung und Szenenarbeit. Es wird auf dem Beijing-Knoten mit 0,848 $ pro Million Eingabe-Tokens und 1,696 $ pro Million Ausgabe-Tokens gelistet, begrenzt auf 3.000 Zeichen Eingabe, 240 Sekunden generiertes Audio für Podcasts und 120 Sekunden andernfalls, drei Anfragen pro Sekunde, wobei bis zu drei Referenzclips von jeweils 30 Sekunden akzeptiert werden. Es unterstützt nur Chinesisch und Englisch. Wenn Ihre Pipeline aus einem einzelnen Erzähler besteht, der ein Skript vorliest, ist dieses Produkt für Sie irrelevant; wenn sie aus zwei Hosts und einem Musikbett besteht, ist es der Grund, sich dieses Release überhaupt anzusehen.
Die Naht ist das, was Sie tatsächlich wählen.
Da die beiden Modelle nicht dieselbe Aufgabe erfüllen, ist die Entscheidung kein Bake-off. Es geht um die Frage, wo man die Übergabe ansetzt und wie viel man bereit ist dafür zu bezahlen, dass die Naht unsichtbar bleibt.
Es gibt zwei ehrliche Architekturen. Die erste ist ein einziges Netz: Gemini 3.8 Live übernimmt den gesamten Turn, hört den Anrufer, entscheidet, was zu sagen ist, und sagt es, und Sie akzeptieren die Stimme, die es Ihnen gibt – die Sie weder klonen noch mit Ihrer Marke versehen können. Die zweite ist eine Kaskade: Erkennung, dann Reasoning, dann Qwen-Audio-3.1-TTS als Mund, die Ihnen tausend Stimmen bietet, darunter eine, die von Ihrem eigenen Talent eingesprochen wurde, auf Kosten von Latenz über zwei oder drei Anbietergrenzen hinweg und der Prosodie, die verloren geht, wenn ein Satz über einen API-Aufruf hinweg aufgeteilt wird.
Die meisten Teams landen bei beidem, und das ist kein Mangel an Mut. Nutzen Sie das Echtzeitmodell dort, wo Latenz spürbar ist – Unterbrechung, Bestätigung, das „mm-hm“, das einem Anrufer sagt, dass Sie noch da sind – und das Synthesemodell dort, wo Qualität hörbar ist: das lange Zurücklesen einer Police, die Bestätigungsnummer, die in bedächtigem Tempo vorgelesen wird, die Markenstimme, die bei jedem einzelnen Anruf identisch sein muss. Der Hybrid ist die richtige Antwort für eine große Klasse von Produkten. Er ist auch der Punkt, an dem das Kostenmodell schwierig wird, weil Sie nun zwei verschiedene Einheiten messen.

Der Preis wird pro Audio-Stunde berechnet, der einzigen Einheit, in die beide passen.
Google rechnet die Live API nach Minuten ab; Alibaba rechnet die Qwen-TTS-Tarife nach Zeichen und nach Token ab. Um sie zu vergleichen, muss man einen Normalisierer wählen, und der einzige vertretbare für Stimme ist die Stunde fertig produzierten Audios.
• Abrechnung eingehend — Gemini 3.8 Live pro Minute Audio, 0,005 $ ein und 0,018 $ aus gegenüber Qwen-Audio-3.1-TTS pro Million Zeichen, wobei die 3.0-Plus-Stufe bei etwa 27,60 $ und die Flash-Stufe bei etwa 15 $ vor der Senkung liegt und die TTS-Flash-Stufe danach mit 1,5 Yuan pro Million Eingabe-Tokens und 12 Yuan pro Million Ausgabe-Tokens gelistet wird
• Abrechnung ausgehend — Gemini 3.8 Live Zwei-Wege-Gespräch kostet laut Listenpreis etwa 1,38 $ für eine Stunde Wanduhr-Gespräch, vor jeglichem Caching, gegenüber Qwen-Audio-3.1-TTS, einem Einweg-Stream, wobei die 3.1-Next-Stufe auf dem Peking-Knoten bei 0,848 $ pro Million Eingabe-Tokens und 1,696 $ pro Million Ausgabe liegt
• Hört den Anrufer — Gemini 3.8 Live ja, native Audio- und Videoeingabe gegenüber Qwen-Audio-3.1-TTS nein, Text rein und Audio raus
• Stimmen — Gemini 3.8 Live eine Stimme, nicht klonbar, nicht als Markenstimme nutzbar gegenüber Qwen-Audio-3.1-TTS über tausend, mit Zero-Shot-Klonen aus verrauschtem Referenzaudio
• Sprachen — Gemini 3.8 Live vom Anbieter angegebene 97, mitten im Gespräch umschaltbar gegenüber Qwen-Audio-3.1-TTS vom Anbieter angegebene 16 plus 20 chinesische Dialektregionen, mit Timbre-Übertragung über Mandarin, Kantonesisch, Englisch und Japanisch
• Steuerung der Sprechweise — Gemini 3.8 Live Prompt und Gesprächskontext gegenüber Qwen-Audio-3.1-TTS natürlichsprachliche Anweisung, die die 86 Inline-Tags der 3.0-Generation ersetzt
• Unabhängige Bewertung — Gemini 3.8 Live 82,6 im Artificial Analysis Speech to Speech Index für die Extended-Thinking-Variante und 76,0 für die Standardvariante gegenüber Qwen-Audio-3.1-TTS keine; die nächstliegende Qwen-Zahl ist 1.259 Elo für die 3.0-Plus-Stufe der vorherigen Generation in der Provider Voice Arena, was eine Bewertung des Vorgängers und nicht dieses Modells ist
Der prozentuale Abschlag gilt für Tarife, die je nach Region und Tarifstufe variieren, daher sind die plakativen 70 % kein Versprechen in Bezug auf Ihren Traffic, und Alibaba Cloud hat außerdem die Echtzeittranskription auf dem Singapur-Knoten von einer dauerbasierten auf eine tokenbasierte Abrechnung umgestellt – was eine weniger vorhersehbare Grundlage ist, da sowohl Stille als auch Multi-Turn-Kontext den Token-Verbrauch erhöhen. Vergleichen Sie die neue Preisliste mit Ihrem eigenen Audio.

Was das Upgrade auf 3.1 nicht klärt
Hier ist der Teil, bei dem man in beide Richtungen leicht danebenliegt. Die 3.1-Verbesserungen machen Qwen-Audio-3.1-TTS nicht zu einem Kandidaten für die Aufgabe, die Gemini 3.8 Live erledigt – instruktionsbasierte Steuerung, Timbre-Transfer und Toleranz gegenüber verrauschten Eingaben machen es allesamt zu einem besseren Mund, und keines davon gibt ihm ein Ohr. Ebenso sagt die Benchmark-Position von Gemini 3.8 Live nichts darüber aus, ob Ihre Markenstimme einen Satz auf Kantonesisch übersteht.
Es gibt außerdem eine Lücke in der Beweislage, die eine Preissenkung umso verlockender macht, zu ignorieren. Qwen-Audio-3.1-TTS hat keinen unabhängigen Score. Der Wert von 1.259 Elo, der neben dem Qwen-Namen in der Provider Voice Arena erscheint, gehört zu Qwen-Audio-3.0-TTS-Plus, dem Modell, das ersetzt wird, gemessen an 1.447 Stichproben. Die eigene Arena-Zeile des Nachfolgers existiert noch nicht. Wenn Ihr Freigabeprozess eine Kennzahl von Drittanbietern erfordert — und für eine Markenstimme sollte er das wahrscheinlich —, dann ist das neuere Modell das ohne eine solche, und die günstigere Tarifstufe ist die, die Sie noch nicht verteidigen können. Das einzige Ereignis, das dies entscheiden würde, ist das Erscheinen von Qwen-Audio-3.1-TTS auf einem Blind-Listening-Board.
Wo ein Schlüssel hilft und wo nicht
Eine Konsequenz der Version 3.1 lässt sich leicht übersehen, weil sie wie ein Detail des Prompt-Engineering und nicht wie eines der Infrastruktur aussieht. 86 fest codierte Tags durch frei formulierte Anweisungen zu ersetzen, macht deine Lieferanweisungen zu Textartefakten. Du generierst sie jetzt, versionierst sie und validierst jede einzelne erneut gegen die Interpretation des neuen Modells – und der Fehlermodus ist Drift, kein Fehler, weil zwei Formulierungen von „warm, aber nicht sentimental“ nicht identisch ankommen werden.
Das ist ein Textinferenzproblem, das um eine Sprachpipeline herumgebaut ist, und genau dafür sind wir nützlich. OrcaRouter routet weder Qwen-Audio-3.1-TTS noch irgendein Qwen-Audio-Modell, und auch die Gemini 3.8 Live-Endpunkte routen wir nicht — keine der beiden Hälften dieses Stacks ist über uns aufrufbar, und nichts hier sollte als Behauptung gelesen werden, dass dem so sei. Was wir anbieten, ist die Schicht, die den Anweisungstext schreibt und prüft: qwen/qwen3.8-flash und google/gemini-3.8-flash unter mehr als 200 Modellen über einen einzigen Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, mit einer Routing-DSL, die mehrere Modelle zu einem Aufruf zusammenfasst, und automatischem Failover, wenn ein Upstream degradiert. Wenn Sie gerade zehntausend Delivery-Prompts gegen ein Modell neu validieren möchten, das gerade geändert hat, wie es sie liest, dann ist das Erzeugen der Varianten und deren Bewertung auf Konsistenz der Teil, der ein einziger Vertrag sein sollte, nicht vier.
Was Sie messen sollten, bevor Sie sich entscheiden
Drei Experimente beantworten mehr als jedes Gremium. Nehmen Sie eine Referenzstimme und einen Absatz aus Ihrem eigenen Skript und schicken Sie sie durch Qwen-Audio-3.1-TTS, und hören Sie hin, ob die instruktionsbasierte Steuerung Ihnen zweimal dieselbe Darbietung liefert – das ist das Migrationsrisiko, und es ist billiger zu messen als darum herumzuplanen. Nehmen Sie eine echte Anrufaufnahme mit Ihren eigenen Hintergrundgeräuschen und schicken Sie sie durch Gemini 3.8 Live, und prüfen Sie, ob der Sprecherwechsel standhält, wenn der Anrufer mitten im Wort unterbricht – das ist es, was der Speech-to-Speech-Index zu quantifizieren versucht, und er übersteht den Kontakt mit einer echten Telefonleitung nicht zuverlässig genug, um ihm blind zu vertrauen. Und rechnen Sie die Zahlen für Ihr eigenes Volumen in Audio-Stunden durch statt in den Einheiten, in denen die beiden Anbieter abrechnen, denn bei dieser speziellen Paarung war der erwartete Preisunterschied zwischen „billigem chinesischem TTS“ und „Google-Flaggschiff“ nie so groß, wie es aussieht, und nach dem 23. September ist er noch kleiner.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
