
Qwen-Audio-3.1 vs. ElevenLabs: Eine 70-prozentige Preissenkung trifft auf den Platzhirsch
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 177 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1323 tok/s
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
Der Anbieter senkte den Preis seiner Qwen-Audio-3.1-TTS-API am 23. September 2026 um rund 70 % – angekündigt auf der Bühne der Apsara Conference in Hangzhou, zusammen mit vier weiteren Sprachmodellen. Diese eine Zahl ist der Grund, warum sich dieser Vergleich lohnt: ElevenLabs Eleven v3 war für die meisten westlichen Teams die Standard-Produktionsstimme zu einem effektiven Preis von nahezu 100 US-Dollar pro Million Zeichen, und ein glaubwürdiger Herausforderer hat dieselbe Aufgabe gerade zu einem Bruchteil davon neu bepreist und gleichzeitig die Sprachabdeckung erweitert. Die beiden Systeme sind nicht gleichwertig – Qwen-Audio-3.1-TTS ist eine reine Hosted-API aus dem Tongyi Lab des Anbieters mit einem kleineren Stimmen-Ökosystem, während ElevenLabs eine vollständige Content-Plattform mit der umfangreichsten Stimmenbibliothek der Branche ist. Aber wenn bei Ihrer Entscheidung jemals die Rechnung den Ausschlag gegeben hat, dann hat sich die Kalkulation diese Woche geändert.
Was wurde am 23. September tatsächlich ausgeliefert?
Qwen-Audio-3.1 ist kein einzelnes Modell. Es ist eine Aktualisierung von Alibabas gesamtem Speech-Stack mit fünf Modellen, und die Stufen sind wichtig, weil sie unterschiedliche Preise und unterschiedliche Einsatzbereiche haben:
• Qwen-Audio-3.1-TTS — der direkte Nachfolger des Synthesemodells, das die meisten Teams verwenden. Fügt sieben Sprachen hinzu, insgesamt 16, behält die 20 chinesischen Dialektregionen bei, ergänzt natürliche sprachübergreifende Timbre-Übertragung (eine Stimme, die über Mandarin, Kantonesisch, Englisch und Japanisch hinweg trägt), instruktionsbasierte Steuerung von Emotion, Tempo und Vortragsstil und verarbeitet verrauschte, verhallte oder anderweitig schlechte Referenzaudios ohne separaten Denoising-Modus.
• Qwen-Audio-3.1-TTS-Next — eine neue Stufe und ein anderes Produkt. Alibaba nennt es ein „Audiogen“-Modell: Es erzeugt Stimme, Soundeffekte und Hintergrund-Ambiente in einem einzigen Durchlauf aus Text, Zeitstempeln und Referenzaudio. Mehrsprecher-Dialoge, Podcasts, Film- und Fernseh-Klanglandschaften, 48-kHz-Ausgabe. Laut der Model-Studio-Dokumentation von Alibaba Cloud nimmt es bis zu 3.000 Zeichen Eingabe entgegen, begrenzt die Länge des generierten Audios auf 240 Sekunden bei Podcasts und ansonsten auf 120 Sekunden, verarbeitet 3 Anfragen pro Sekunde und gibt WAV, MP3 oder PCM zurück.
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next und Qwen-Audio-3.1-Realtime — jeweils Erkennung, Audioverständnis (Emotion, Musik, Umgebungsgeräusche, Ereignislokalisierung) und Vollduplex-Konversation. Realtime ist die Variante, die Alibaba in Hardware vorantreibt: Qwen Office, Qoder, QwenNote A2, den Desktop-Roboter QwenNote Eva und die Qwen AI glasses.
Die Preissenkungen zogen sich durch die gesamte Produktlinie, nicht nur bei TTS: Synthese um etwa 70 % gesenkt, Echtzeit um etwa 85 %, Erkennung um bis zu 95 %. Alibaba hat außerdem Qwen-Audio-Agent als Open Source veröffentlicht, ein Framework zum Aufbau von Echtzeit-Sprachagenten, und Qwen3.8-LiveTranslate vorgestellt, bei dem die Latenz unter 2,5 Sekunden gedrückt wurde.

Die Anzeigetafel

• Preis — Qwen-Audio-3.1-TTS: rund 70 % unter der vorherigen Qwen-Audio-Generation, bei der die 3.0-Plus-Stufe bei etwa 27,60 $ pro 1 Mio. Zeichen und die Flash-Stufe bei etwa 15 $ lag. ElevenLabs Eleven v3: laut Artificial Analysis etwa 100 $ pro 1 Mio. Zeichen, wobei Flash bei ungefähr 50 $ liegt.
• Sprachen — Qwen-Audio-3.1-TTS: 16 Sprachen plus 20 chinesische Dialektregionen. ElevenLabs Eleven v3: 74 Sprachen.
• Gewichte — Qwen-Audio-3.1-TTS: geschlossen, nur auf Alibaba Cloud Model Studio gehostet. ElevenLabs Eleven v3: geschlossen, nur gehostet.
• Stimmbibliothek — Qwen-Audio-3.1-TTS: natives Klonen plus sprachübergreifende Timbre-Übertragung; kein vergleichbarer öffentlicher Marktplatz. ElevenLabs: die größte gemeinsame Stimmbibliothek der Branche, plus sofortiges Klonen aus rund 30 Sekunden Audio.
• Steuerung der Sprechweise — Qwen-Audio-3.1-TTS: instruktionsbasierte Emotion, Tempo und Stil, mit den 86 Inline-Tags für die Sprechweise, die mit 3.0 eingeführt wurden. ElevenLabs Eleven v3: Audio-Tags plus die umgebende Plattform (Dubbing, Agents, Studio).
• Unabhängiger Benchmark — Qwen-Audio-3.1-TTS: noch keine. ElevenLabs Eleven v3: 1.168 Elo in der Bestenliste „Provider Voice Arena" von Artificial Analysis mit Stand August 2026.
Wo der Herausforderer wirklich gewinnt
Drei Dinge, und nur eines davon ist der Preis.
Der Preis, natürlich. Eine Senkung um 70 % gegenüber einem etablierten Anbieter, der 100 US-Dollar pro Million Zeichen verlangt, ist kein Rundungsunterschied. Es ist der Unterschied zwischen einem Produkt, mit dem Sie Prototypen entwickeln, und einem Produkt, das Sie an jeden Nutzer ausliefern. Wenn Sie Narration in großem Umfang generieren, sind die jährlichen Einsparungen kein Posten, für den Sie intern argumentieren müssen – sie spricht für sich selbst.
Chinesisch, eindeutig. Zwanzig chinesische Dialektregionen sind ein Burggraben, an den nichts heranreicht, was ElevenLabs zu bieten hat. Wenn Ihr Produkt Nutzer im chinesischen Mutterland bedient, oder kantonesische Sprecher, oder ein Diaspora-Publikum, das mitten im Satz die Sprache wechselt, ist der Vergleich vorbei, bevor er begonnen hat.
Sprachübergreifender Timbre-Transfer. Qwen-Audio-3.1-TTS nimmt eine Stimme und trägt sie natürlich über Mandarin, Kantonesisch, Englisch und Japanisch hinweg. Das ist eine spezifische Fähigkeit mit einem spezifischen Anwendungsfall – eine einzige Markenstimme, die einen Sprachwechsel übersteht – und ein echtes Alleinstellungsmerkmal für alle, die einen einzelnen Sprecher lokalisieren, statt für jeden Markt einen neuen zu casten.
Wo ElevenLabs immer noch gewinnt – und das nicht knapp.
Die Sprachbreite ist das Erste – und sie ist das Größte. Vierundsiebzig Sprachen gegenüber sechzehn sind keine Lücke, die man mit einer Preisankündigung schließt. Wenn du auf Polnisch, Türkisch, Vietnamesisch und Portugiesisch auslieferst, deckt ElevenLabs dich heute ab und Qwen-Audio-3.1-TTS nicht.
Das Zweite ist das Ökosystem. ElevenLabs ist kein Synthese-Endpunkt; es ist eine Content-Plattform. Eine gemeinsame Stimmbibliothek, die man lizenzieren statt klonen kann, Dubbing-Workflows, Agenteninfrastruktur, ein Studio-Produkt, eine dokumentierte API-Oberfläche mit jahrelang gepflegten Client-Bibliotheken. Eine Migration weg davon ist ein Projekt, keine Konfigurationsänderung, und die Teams, die darauf aufgebaut haben, wissen genau, was sie aufgeben würden.
Das dritte ist etwas, das sich schwerer benennen lässt und dennoch eine Benennung verdient: die Wahrnehmung von Natürlichkeit bei einer einzelnen englischen Stimme. Die Synthese von Qwen war historisch hervorragend bei Chinesisch und nur sehr gut bei Englisch, und obwohl das Release 3.1 beansprucht, die mehrsprachige Wiedergabe zu verbessern, gibt es noch keinen unabhängigen Hörtest für das neue Modell. Wer Ihnen sagt, er wisse, wie die neue Qwen-Stimme auf Englisch klingt, rät.
Die Zahl, die noch niemand zitieren sollte
Dies ist der Teil der Geschichte, der in der Berichterstattung verfälscht werden wird, also hier ganz klar gesagt. Qwen-Audio-3.1-TTS hat keinen unabhängigen Benchmark-Wert. Sein Vorgänger, Qwen-Audio-3.0-TTS-Plus, stand Mitte August 2026 bei 1.234 Elo auf dem Provider Voice Arena-Leaderboard von Artificial Analysis und rangierte dort zwischen dem zweiten und fünften Platz. Qwen-Audio-3.1-TTS wurde noch in keine Arena aufgenommen. Jede Qualitätsaussage in Alibabas Startmaterialien ist anbieterseitig angegeben und nicht reproduziert.
Das macht die Behauptungen nicht falsch. Es macht sie unbestätigt, und es bedeutet, dass die ehrliche Darstellung dieses Vergleichs im Moment lautet: ein Modell mit einem Preis und ohne Ergebnis, gegen ein Modell mit einem Ergebnis und einem viel höheren Preis. Alles, was darüber hinausgeht, ist Spekulation im Gewand eines Benchmarks.

Dieselbe Disziplin gilt für die Latenz. Alibabas Schlagzeilenwert für das erste Token auf der ASR-Seite dieser Familie – 92 Millisekunden – stammt aus dem eigenen Hochparallelitäts-Benchmark des Unternehmens zu einer 0,6B-Spezifikation, nicht aus Tests durch Dritte, und seit dem Start veröffentlichte Analysen merken an, dass ASR und TTS separate Produkte in einer Pipeline sind statt eines End-to-End-Modells, und dass Berichte aus der Community beschreiben, dass sich die Latenz in langen Dialogen unter einem Pseudo-Streaming-Muster ansammelt. Betrachten Sie die Latenzangaben der Anbieter für diese ganze Familie als Obergrenzen, nicht als gemessene Erfahrung.
Was die Preissenkung in der Praxis wert ist
Nehmen wir eine realistische Arbeitslast: ein Produkt, das monatlich 20 Millionen Zeichen Erzähltext auf Englisch und Mandarin synthetisiert. Bei ElevenLabs Eleven v3 mit rund 100 US-Dollar pro Million Zeichen sind das etwa 2.000 US-Dollar pro Monat oder 24.000 US-Dollar pro Jahr. Beim Tarif von Qwen-Audio-3.0-TTS-Plus von rund 27,60 US-Dollar pro Million lag dasselbe Volumen bereits bei etwa 552 US-Dollar pro Monat. Rechnet man die rund 70-prozentige Senkung ein, die Alibaba am 23. September angekündigt hat, landet dieselbe Arbeitslast bei einem niedrigen dreistelligen Dollarbetrag pro Monat.
Keine dieser Zahlen ist ein Listenpreis, auf den man sich festlegen kann – ElevenLabs rechnet in Credits über Abonnementstufen ab, und Alibabas Rabatte sind prozentuale Reduzierungen auf Tarife, die sich je nach Region und Stufe unterscheiden. Doch die Form des Vergleichs ist eindeutig, und an dieser Form orientiert sich Ihre Budgetplanung.
Ein Vorbehalt, der für alle erwähnt werden sollte, die dies sorgfältig modellieren: Alibaba Cloud hat die Abrechnung für Echtzeit-Transkription auf dem Singapore-Knoten von dauerbasierter Messung auf tokenbasierte Messung umgestellt, und zwar auf 0,93 US-Dollar pro Million Eingabe-Tokens und 0,70 US-Dollar pro Million Ausgabe-Tokens. Die Token-Abrechnung ist weniger vorhersehbar als die Abrechnung nach Dauer, wenn Sie nicht kontrollieren, wie viele Tokens ein bestimmter Audioabschnitt ergibt, und Rauschen, Stille und Multi-Turn-Kontext erhöhen alle den Token-Verbrauch. Eine angekündigte Senkung um 70 % bedeutet nicht automatisch eine Ersparnis von 70 % bei Ihrem spezifischen Traffic.
Wie man den Switch tatsächlich ausführt
Wenn Sie dies bewerten, ist die nützlichste Information, was eine Migration Sie an Engineering-Zeit kostet. Beide Modelle sind geschlossene gehostete APIs, Sie integrieren also in jedem Fall gegen einen HTTP-Endpunkt, und die Arbeit besteht aus einem Client, einer Retry-Policy und einem Voice-Inventar – nicht aus einer Neuarchitektur.
Hier kommt die Ausrichtung von OrcaRouter zum Tragen – mit einem ehrlichen Vorbehalt vorweg: Wir routen Qwen-Audio-3.1-TTS oder irgendein Qwen-Audio-Modell nicht. Alibabas Sprach-Endpunkte liegen außerhalb unseres Zuständigkeitsbereichs, und dasselbe gilt für ElevenLabs. Was wir abdecken, ist die Inferenzschicht rund um sie – ein API-Schlüssel für über 200 Textmodelle bei 0 % Aufschlag, was bedeutet, dass der Listenpreis des Anbieters direkt weitergegeben wird, sodass eine Preissenkung eines Anbieters bei uns noch am selben Tag live ist und nicht erst nach einem Preisanpassungszyklus. Für Teams, die die Anwendung entwickeln: diese antreibt eine Sprachpipeline – den Summarizer, den Skriptgenerator, den Content-Planer –, so bedeutet das einen Vertrag statt mehrerer, automatisches Failover, wenn ein Upstream beeinträchtigt wird, und eine Routing-DSL, mit der sich Modelle zu einem einzigen Aufruf zusammensetzen lassen. Es bedeutet nicht, dass Sie Qwens Stimme über uns aufrufen. Wer Ihnen etwas anderes erzählt, hat den Katalog nicht gelesen.
Wer sollte umziehen, und wer sollte warten
Wechseln Sie jetzt, wenn Ihr Arbeitsaufkommen primär chinesisch ist, wenn Dialektabdeckung auf Ihrer Anforderungsliste steht, wenn die Volumenkosten die Einschränkung sind, die Sie bisher bei einer billigeren, aber schlechteren Stimme gehalten hat, oder wenn Sie eine einzige gebrandete Stimme brauchen, die einen Sprachwechsel übersteht. Die Preisgestaltung vom 23. September macht die Wirtschaftlichkeit schwer bestreitbar, und die Qualität der chinesischen Sprache war schon vorher wettbewerbsfähig.
Warten Sie, wenn Sie in mehr als etwa sechzehn Sprachen ausliefern, wenn Ihr Produkt eher von einer lizenzierbaren Stimmbibliothek als vom Klonen abhängt, wenn Sie tief in das Dubbing- oder Agent-Tooling einer Plattform eingebunden sind oder wenn Ihr Beschaffungsprozess vor der Freigabe einen unabhängigen Qualitäts-Score erfordert. Nichts davon ist ein dauerhaftes Hindernis, aber nichts davon wurde durch eine Preissenkung behoben.
Und achte ganz gezielt auf eine Sache: ob Qwen-Audio-3.1-TTS in einer Blindhör-Arena auftaucht. Sobald das geschieht, geht es in diesem Vergleich nicht mehr um den Preis und die Anzahl der Sprachen, sondern darum, ob die günstigere Stimme tatsächlich genauso gut ist. Das ist die Frage, die die Markteinführung nicht beantwortet hat.
