
Qwen-Audio-3.1-TTS vs. Qwen-Audio-3.0-TTS: Was zwei Monate gebracht haben
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 495 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 186 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Qwen-Audio-3.0-TTS erschien am 20. Juli 2026 und landete direkt an der Spitze der unabhängigen Sprach-Bestenlisten – die Plus-Stufe erreichte 1.238 Elo im Provider Voice Arena Leaderboard von Artificial Analysis, Platz zwei in der Rangliste. Neun Wochen später, am 23. September 2026, kündigte der Anbieter auf der Apsara-Konferenz in Hangzhou Qwen-Audio-3.1-TTS an – verbunden mit einer Preissenkung von rund 70 %. Dieses Timing macht daraus einen ungewöhnlichen Vergleich: Das abgelöste Modell ist nicht veraltet, es ist benchmarkt, bewährt und noch immer ganz oben dabei. Die eigentliche Frage ist also nicht, welches der beiden besser ist. Sondern was sich konkret geändert hat, ob davon irgendetwas für Ihre Workload relevant ist und was mit der Punktzahl passiert, der Sie bereits vertrauen, wenn der Nachfolger überhaupt nicht bewertet wurde.
Zwei Monate, fünf Endpunkte, eine Familie
Alibaba hat nicht nur ein einziges Modell veröffentlicht. Die 3.1-Version umfasst fünf: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next und Qwen-Audio-3.1-Realtime. Für alle, die derzeit Qwen-Audio-3.0-TTS aufrufen, ist nur eines davon ein Drop-in-Ersatz – die einfache TTS-Stufe – und eines ist ein echtes neues Produkt statt eines Upgrades.
Das zweite ist es wert, verstanden zu werden, selbst wenn du es nie aufrufst. Qwen-Audio-3.1-TTS-Next ist das, was Alibaba ein „Audiogen“-Modell nennt: ein einzelner Durchlauf, der aus Text, Zeitstempeln und Referenzaudio gemeinsam Stimme, Soundeffekte und Hintergrundatmosphäre erzeugt. Mehrsprecher-Dialoge, Podcast-Zusammenstellung, Szenen-Klanglandschaften, 48-kHz-Ausgabe. Die Model Studio-Dokumentation von Alibaba Cloud listet seine Grenzen klar auf – 3.000 Zeichen Eingabe, 240 Sekunden generiertes Audio für Podcasts und 120 Sekunden ansonsten, 3 Anfragen pro Sekunde, Ausgabe in WAV, MP3 oder PCM, und es akzeptiert bis zu drei Referenzclips von je 30 Sekunden in WAV, MP3 oder OGG Opus. Rohe PCM-Referenzeingabe wird nicht unterstützt. Der Preis liegt bei 0,848 US-Dollar pro Million Eingabe-Tokens und 1,696 US-Dollar pro Million Ausgabe-Tokens auf dem Beijing-Knoten, Aktionspreise ausgenommen, und es verarbeitet nur Chinesisch und Englisch.
Wenn Sie 3.0-TTS einsetzen und Ihre Aufgabe darin besteht, „dieses Skript in eine Stimme zu verwandeln“, ändert nichts davon etwas an Ihrer Integration. Wenn Ihre Aufgabe darin besteht, „einen Zwei-Moderatoren-Podcast mit Musikbetten zusammenzustellen“, ist 3.1-TTS-Next eine andere Produktkategorie und möglicherweise überhaupt der Grund, sich dieses Release anzusehen.
Das Upgrade, Zeile für Zeile

• Sprachen — Qwen-Audio-3.1-TTS: vom Anbieter angegeben 16 Sprachen, sieben mehr als in der vorherigen Generation. Qwen-Audio-3.0-TTS: 16 Sprachen, wie in der veröffentlichten Berichterstattung zur Juli-Version aufgeführt.
• Chinesische Dialekte — Qwen-Audio-3.1-TTS: 20 Dialektregionen, übernommen. Qwen-Audio-3.0-TTS: 20 Dialektregionen.
• Sprachübergreifende Timbre-Übertragung — Qwen-Audio-3.1-TTS: ja, eine Stimme, die über Mandarin, Kantonesisch, Englisch und Japanisch hinweg getragen wird. Qwen-Audio-3.0-TTS: nicht angeboten.
• Vortragssteuerung — Qwen-Audio-3.1-TTS: instruktionsbasierte Steuerung von Emotion, Tempo und Stil. Qwen-Audio-3.0-TTS: 86 Inline-Vortrags-Tags.
• Verrauschte Referenzeingabe — Qwen-Audio-3.1-TTS: verarbeitet verrauschtes oder verhalltes Referenzaudio direkt, kein separater Denoise-Modus. Qwen-Audio-3.0-TTS: sauberes Referenzaudio erforderlich.
• Unabhängige Bewertung — Qwen-Audio-3.1-TTS: noch keine. Qwen-Audio-3.0-TTS-Plus: 1.238 Elo auf der Bestenliste der Provider Voice Arena von Artificial Analysis mit Stand August 2026.
Die Anzahl der Sprachen geht nicht auf, und das ist wichtig.
Das ist eine Kleinigkeit, die überall sonst glattgebügelt werden wird, deshalb lohnt es sich, sie zu erwähnen. In Alibabas Einführungsmaterial heißt es, die 3.1-TTS-Stufe füge sieben Sprachen hinzu. Die veröffentlichte Berichterstattung über die 3.0-Generation vom Juli – einschließlich unserer eigenen Vergleichsbeiträge aus jenem Monat – nannte 16 Sprachen für die 3.0-Stufe. Sieben plus sechzehn ergibt dreiundzwanzig, nicht sechzehn, und Alibaba hat keine Erklärung veröffentlicht, die die beiden Zahlen miteinander in Einklang bringt.
Mögliche Erklärungen sind wenig glamourös: Die Zahl für 3.1 könnte eine andere Menge erfassen, die 3.0-Angabe könnte beim Start zu hoch gewesen sein, oder „fügt sieben hinzu“ könnte sich eher auf die ASR-Ebene als auf TTS beziehen. Wir wissen nicht, welche zutrifft. Was wir wissen, ist, dass die Sprachanzahl auf beiden Seiten dieses Vergleichs eine vom Anbieter gemeldete Zahl ist, die nie unabhängig geprüft wurde, und dass jeder, der „16 Sprachen“ als harte Tatsache über eines der beiden Modelle zitiert, eine Marketingfolie zitiert. Prüfe die konkreten Sprachen, die du brauchst, anhand der Model Studio-Dokumentation, bevor du auf Grundlage einer Anzahl planst.

Die Anweisungssteuerung ist die Änderung, die tatsächlich im Code sichtbar wird.
Von allem im 3.1-TTS-Release ist dies dasjenige, das verändert, wie du deine Prompts schreibst. Die 3.0-Generation steuerte die Sprechweise über 86 Inline-Tags – ein festes Vokabular, das du lernen, an den richtigen Stellen einfügen musstest und das genau das tat, was es sagte, und nichts weiter. Die 3.1-Stufe ersetzt das durch natürlichsprachliche Anweisungen: Du beschreibst die Emotion, das Tempo, den Stil, den du möchtest, und das Modell interpretiert es.
Der praktische Unterschied ist Ausdrucksstärke versus Vorhersagbarkeit. Ein Tag-Vokabular ist ein Vertrag – dasselbe Tag erzeugt jedes Mal dieselbe Darbietung, und genau das will man in einer Produktionspipeline, in der eine Stimme über zehntausend Clips hinweg konsistent sein muss. Eine Freiform-Anweisung ist breiter, aber lockerer, und sie erbt das übliche Problem der Prompt-Empfindlichkeit: Zwei Formulierungen von „warm, aber nicht sentimental“ werden nicht identisch wirken, und zwei Aufrufe derselben Formulierung an unterschiedlichen Tagen ebenso wenig.
Wenn Ihre aktuelle Pipeline auf diesen 86 Tags aufbaut, ist das Upgrade nicht kostenlos. Sie tauschen eine deterministische Steuerungsoberfläche gegen eine probabilistische ein, und die Arbeit der Portierung ist nicht der API-Aufruf – es ist die erneute Validierung jeder Prompt-Vorlage, die Sie besitzen, gegen die Interpretation des neuen Modells. Planen Sie das ein, bevor Sie die Einsparungen einplanen.
Sprachübergreifende Timbre-Übertragung – und wofür sie eigentlich gut ist
Eine Referenzstimme, die über Mandarin, Kantonesisch, Englisch und Japanisch hinweg getragen wird und ihre Identität bewahrt, während sich die Sprache ändert. Auf dem Papier liest sich das wie ein Feature-Aufzählungspunkt. In der Praxis löst es ein konkretes und kostspieliges Problem: eine einzige präsentierende Person, die in mehr als einer Sprache existieren muss, ohne in jeder wie eine andere Person zu klingen.
Die traditionelle Notlösung besteht darin, pro Sprache eine separate Sprecherin oder einen separaten Sprecher zu engagieren und zu akzeptieren, dass Ihre Markenstimme nun aus vier Stimmen besteht, die sich ein Skript teilen. Die Alternative war, eine Sprecherin oder einen Sprecher in jede Sprache zu klonen – genau der Workflow, in dem geklonte Stimmen zum Abdriften neigen: Der Akzent bleibt erhalten, das Timbre wird dünner, und Zuhörende bemerken es innerhalb eines Satzes. Sprachübergreifende Timbre-Übertragung erhebt den Anspruch, dass keiner dieser Kompromisse notwendig ist.
Außerdem ist es derzeit vollständig unverifiziert. Es gibt keinen unabhängigen Hörtest zu Qwen-Audio-3.1-TTS in irgendeiner Sprache, und Alibabas eigene Demos sind der einzige Beleg dafür, dass die Übertragung funktioniert. Wenn diese Fähigkeit der Grund ist, warum Sie ein Upgrade in Erwägung ziehen, testen Sie sie mit Ihrem eigenen Referenzaudio, bevor Sie sich festlegen — das ist ein Fünf-Minuten-Experiment, und es ist das einzige, das die Frage beantwortet.
Welche Auswirkungen die Preissenkung auf eine 3.0-Rechnung hat
Alibaba senkte die Sprachpreise durchgängig: Synthese um etwa 70 %, Echtzeit um etwa 85 %, Erkennung um bis zu 95 %. Die Anpassung trat am 22. September 2026 um 00:00 Uhr Pekinger Zeit in Alibaba Cloud Model Studio in Kraft, umfasst die Regionen Peking und Singapur und gilt für die Endpunkte 3.1 TTS und 3.0 Echtzeit. Nach der Anpassung wird die TTS-Flash-Stufe mit 1,5 Yuan pro Million Eingabe-Tokens und 12 Yuan pro Million Ausgabe-Tokens gelistet; die Echtzeit-Flash-Stufe wird mit 1,5 für Texteingabe, 6 für Audioeingabe, 4,5 für Textausgabe und 12 für kombinierte Text-und-Audio-Ausgabe pro Million Tokens gelistet.
Hier ist der Teil, der zählt, wenn Sie bereits 3.0-TTS einsetzen. Der 3.0 Plus-Tarif lag bis August bei Artificial Analysis bei etwa 27,60 $ pro Million Zeichen, der Flash-Tarif bei etwa 15 $. Wenn die Reduzierung um rund 70 % auf den Tarif zutrifft, den Sie nutzen, sinkt Ihre Rechnung für dieselbe Arbeitslast auf ungefähr ein Drittel des bisherigen Betrags – ohne dass Sie auch nur eine Zeile Code ändern. Das ist das Ungewöhnliche an diesem Release: Für einen 3.0-Kunden ist die Preissenkung mehr wert als das Modell-Upgrade, und sie kommt, ob Sie migrieren oder nicht.
Zwei Einschränkungen, die man im Auge behalten sollte. Prozentuale Senkungen werden gegen Tarife angegeben, die sich je nach Region und Stufe unterscheiden, daher ist die Schlagzeile von 70 % kein Versprechen für Ihren konkreten Datenverkehr. Und Alibaba Cloud hat die Abrechnung für Echtzeit-Transkription auf dem Singapur-Knoten von einer dauerbasierten Messung auf eine tokenbasierte Messung umgestellt – 0,93 $ pro Million Input-Tokens und 0,70 $ pro Million Output-Tokens –, was eine weniger vorhersehbare Grundlage ist, wenn Stille, Rauschen und Multi-Turn-Kontext den Token-Verbrauch in die Höhe treiben. Vergleichen Sie die neue Preisliste mit Ihrem eigenen Audio, nicht mit der Pressemitteilung.
Wo Qwen-Audio-3.0-TTS immer noch die richtige Wahl ist
Drei Fälle, und es sind keine Randfälle.
Wenn Sie eine Zahl brauchen, die Sie verteidigen können. Qwen-Audio-3.0-TTS-Plus hat einen unabhängigen Elo-Wert von 1.238 – dieselbe Rangliste zeigt für dieses Modell im September 1.259, weiterhin auf Platz zwei, die Punktzahl ist also eher nach oben gedriftet als gesunken – aus einer Blindhör-Arena mit Tausenden von Stimmen dahinter. Qwen-Audio-3.1-TTS hat überhaupt keinen Arena-Wert. Wenn Ihr Freigabeprozess Nachweise von Drittanbietern erfordert, ist das ältere Modell dasjenige, das sie hat, und eine Preissenkung ändert daran nichts.

Wenn Determinismus Aussagekraft schlägt. Wenn Ihre Produktions-Pipeline auf der Steueroberfläche mit 86 Tags aufbaut, haben Sie ein System, dessen Ausgabe nachvollziehbar ist. Anweisungsbasierte Steuerung ist leistungsfähiger und weniger vorhersehbar, und die Migrationskosten sind real.
Wenn nichts am Upgrade deine Arbeitslast berührt. Wenn du Mandarin und Englisch in mäßiger Lautstärke mit einer sauberen Referenzstimme und einem festen Satz von Delivery-Tags synthetisierst, dann lösen Cross-Language-Timbre-Transfer, Robustheit bei verrauschtem Input und sieben zusätzliche Sprachen allesamt Probleme, die du nicht hast. Nimm die Preissenkung mit, behalte das Modell.
Beides ausführen, ohne zwei Integrationen auszuführen
Der unangenehme Teil an einem Wechsel von Generation zu Generation ist, dass man oft beide Modelle gleichzeitig live haben möchte — 3.0 für den Produktionspfad mit dem dahinterstehenden Score, 3.1 für die neuen Sprachen und die Transfer-Funktion, und eine Möglichkeit, Traffic zwischen ihnen zu verschieben, ohne neu zu deployen. Beide sind geschlossene gehostete APIs auf Alibaba Cloud Model Studio, also sind das zwei Endpunkte, zwei Rate Limits und zwei Fehlermodi hinter einem Feature.
Eine ehrliche Anmerkung zu unserer Position: OrcaRouter leitet weder Qwen-Audio-3.1-TTS noch irgendein Qwen-Audio-Modell weiter, und wir leiten Alibabas Speech-Endpunkte überhaupt nicht weiter. Was wir bereitstellen, ist die Text-Inferenzschicht rund um eine Pipeline wie diese – ein API-Schlüssel für über 200 Modelle bei 0 % Aufschlag, der Listenpreis des Anbieters wird direkt durchgereicht, sodass eine Preissenkung eines Anbieters noch am selben Tag bei uns ankommt und nicht erst nach einem Preisanpassungszyklus. Wenn der Dienst, der Ihre Sprachpipeline antreibt, ein Skriptgenerator, ein Summarizer oder ein Content-Planer ist, bedeutet das einen Vertrag statt mehrerer, automatisches Failover, wenn ein Upstream beeinträchtigt ist, und eine Routing-DSL, um Modelle in einem einzigen Aufruf zusammenzufassen. Es bedeutet nicht, dass Sie Qwens Stimme über uns aufrufen, und jede Seite, die etwas anderes suggeriert, liegt in Bezug auf unseren eigenen Katalog falsch.
Die ehrliche Zusammenfassung
Qwen-Audio-3.1-TTS ist ein echtes Upgrade mit drei Ergänzungen, die wirklich zählen – anweisungsbasierte Steuerung der Vortragsweise, sprachübergreifende Timbre-Übertragung und Robustheit gegenüber schlechtem Referenzaudio – plus einer Preissenkung, die mehr wert ist als jede einzelne davon. Qwen-Audio-3.0-TTS ist nicht in der Weise überholt, wie es bei einem zwei Monate alten Modell üblich ist: Es verfügt noch immer über einen unabhängigen Benchmark-Wert, den sein Nachfolger nicht erreicht hat, und es deckt weiterhin das Spektrum chinesischer Dialekte ab, auf dem der größte Teil der Differenzierung dieser Familie beruht.
Die Entscheidung ist also enger, als das Marketing suggeriert. Wenn Sie in großem Umfang generieren, ist die Preisänderung bereits auf Ihrer Seite. Wenn Sie die neuen Sprachen oder den Timbre-Transfer benötigen, migrieren Sie und validieren Sie die Funktion zuerst mit Ihrem eigenen Audio. Wenn Sie eine belastbare Qualitätskennzahl benötigen, warten Sie, bis Qwen-Audio-3.1-TTS in einer Blindhör-Arena auftaucht – das ist das einzige Ereignis, das dies entscheiden würde, und bis es dazu kommt, lautet die ehrliche Position, dass das neuere Modell das günstigere und das ältere Modell das bewährte ist.
