
GPT-Live-1 vs. Qwen-Audio-3.0-TTS: Ein Gespräch und ein Erzähler sind nicht derselbe Posten
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding

Setzt man GPT-Live-1 und Qwen-Audio-3.0-TTS beim Preis pro Audiostunde nebeneinander, wirkt der Abstand entscheidend: Qwen-Audio-3.0-TTS-Plus von Alibaba erzeugt Sprache für 27,6 $ pro Million Zeichen, also etwa 1,66 $ Audio pro Stunde, während GPT-Live-1 von OpenAI 3,00 $ für eine Stunde durchgehend offener Leitung berechnet. Der Erzähler ist billiger, also gewinnt der Erzähler — nur dass dies der falsche Vergleich ist, und der Grund, warum er falsch ist, ist das Nützlichste, was man aus diesem Duell mitnehmen kann. Qwen-Audio-3.0-TTS ist ein Text-to-Speech-Modell. GPT-Live-1 ist ein Voll-Duplex-Konversationsmodell. Das eine liest vor, was Sie geschrieben haben. Das andere muss mehrmals pro Sekunde entscheiden, ob Sie mit dem Sprechen fertig sind.
Einer rendert, einer konversiert
Text-to-Speech nimmt Text entgegen und gibt Audio zurück. Es gibt kein Eingabe-Audio, keinen Redezug zu übernehmen, keine Vorstellung davon, unterbrochen zu werden, und kein Transkript zurückzugeben, weil das Modell nie etwas gehört hat. Sein Kostenmodell ist eine Druckerpresse: Seiten rein, Audio raus; Qualität und Durchsatz sind die einzigen beiden Zahlen, die zählen, und beide lassen sich messen, bevor man ausliefert.
Ein Vollduplex-Konversationsmodell verarbeitet eingehendes Audio, während es ausgehendes Audio erzeugt. Zu seinen Aufgaben gehören die Teile eines Gesprächs, die nichts mit Worten zu tun haben – innezuhalten, wenn der Nutzer innehält, bei einem Backchannel wie „yeah" weiterzumachen, statt ihn als Unterbrechung zu behandeln, das Rederecht mitten im Satz abzugeben und einen Tool-Call auszulösen, ohne den Gesprächsfaden zu verlieren. GPT-Live-1 macht all das und liefert zusammen mit der Sitzung Transkripte der Spracherkennung, was es nur kann, weil es die ganze Zeit zugehört hat.
Wenn Ihr Produkt Artikel vorliest, Dokumentation in Audio umwandelt oder ein Video vertont, ist GPT-Live-1 das falsche Werkzeug – zum vierfachen Stundenpreis. Wenn Ihr Produkt Telefonanrufe entgegennimmt, ist Qwen-Audio-3.0-TTS nur ein Drittel einer Pipeline, die noch ein ASR-Modell und ein Sprachmodell braucht, um zu einem Gespräch zu werden.
Wo Qwen-Audio-3.0-TTS wirklich die beste Antwort ist
Was für Alibabas Modell spricht, ist kein Marketing. Veröffentlicht am 20. Juli 2026 von Alibabas Tongyi Lab und als gehostete, geschlossene API über Alibaba Cloud Model Studio verfügbar gemacht, erreichte die Plus-Stufe bei ihrem Erscheinen Platz eins in der Text-to-Speech-Arena von Artificial Analysis. Ein Leaderboard ist jedoch ein bewegliches Ziel, und dieses hat sich bewegt: Stand September 2026 steht Qwen-Audio-3.0-TTS-Plus mit einem Elo-Wert von 1.232 bei 2.306 Samples auf Platz vier der Provider Voice Arena, hinter Cartesia Sonic 3.6 mit 1.275, Inworld Realtime TTS-2 mit 1.244 und Speechifys Simba 3.2 mit 1.233 – drei Modelle aus August und Juli, die danach auf den Markt kamen. Platz vier von über zwanzig, mit verlorener Führung und intaktem Preisvorteil, ist immer noch eine starke Position. Es ist nur nicht die Position, die die Berichterstattung zum Marktstart beschrieben hat.

Es führt in 10 der 16 Sprachen, die es abdeckt, ergänzt 20 chinesische Dialektregionen, unterstützt Stimmklonen aus kurzen Proben, einschließlich sprachübergreifendem Klonen, und enthält 86 Inline-Tags für Emotion und Vortragsweise.
Die Einschränkungen sind konkret genug, um damit zu planen.
• Durchsatz — Plus erzeugt etwa 16 Zeichen pro Sekunde, gegenüber 30,2 bei Simba 3.2, 27 bei Gemini 3.1 Flash TTS und rund 120 bei Sonic 3.5. Beim Batch-Rendering ist das unsichtbar; bei einem Live-Produkt ist es die Zahl, die Ihren Puffer bestimmt.
• Preisdokumentation — die weithin zitierte Zahl von 27,6 US-Dollar pro Million Zeichen stimmt nicht in jedem Snapshot mit Alibabas eigener Preisseite überein, auf der zu bestimmten Zeitpunkten für beide Tarife niedrigere Werte aufgeführt wurden. Prüfen Sie die aktuelle Zahl auf Kontoebene, bevor Sie eine Prognose abgeben, nicht die des Leaderboards.
• Stimmbibliothek — trotz 16 unterstützter Sprachen sind die öffentlichen Preset-Stimmen fast ausschließlich Chinesisch und Englisch. Die übrigen vierzehn Sprachen sind eher über den Cloning-Workflow als von der Stange verfügbar.
• Feature-Gating — die 86 Inline-Emotion-Tags funktionieren nur im unidirektionalen Streaming-Modus, sodass die expressive Steuerung nicht über jeden Integrationspfad hinweg erhalten bleibt.
• Stufen — Flash zielt für Echtzeitnutzung auf eine First-Packet-Latenz von etwa 300 ms ab; Plus ist die Qualitätsstufe. Sie sind unterschiedliche Produkte mit demselben Namen, und die falsche zu wählen ist ein häufiger erster Fehler.
Die ehrliche Version des Cascade-Gesetzentwurfs
Das lässt der Vergleich pro Stunde aus. Ein konversationelles Produkt, das auf einem TTS-Modell aufbaut, ist eine Kaskade: Ein ASR-Modell wandelt die Sprache des Anrufers in Text um, ein Sprachmodell entscheidet, was gesagt werden soll, und das TTS-Modell spricht es aus. Drei Anbieter, drei Rechnungen, drei Latenzbudgets, die sich summieren, und an jeder Grenze eine Übergabe, bei der die Prosodie stirbt. Der TTS-Teil mag 1,66 US-Dollar pro Stunde Audio kosten. Die anderen beiden Teile sind dort, wo das Geld und die Fehler tatsächlich stecken — und das Kaskadenmodell kann keine Pause mitten in einem Satz hören, den es gerade spricht.
GPT-Live-1 fasst die drei Komponenten zu einer Sitzung und einem einzigen Abrechnungszähler zusammen, zu 0,05 $ pro Minute Sprache, wobei das Reasoning-Backend separat abgerechnet wird. Zwei Details sorgen dafür, dass diese Rechnung ehrlich bleibt. Bei der Sitzungsinitialisierung werden vorab 15 Sekunden Sprache berechnet, die auf die spätere Dauer angerechnet und nicht zu ihr addiert werden. Und das Backend ist ein zweiter Zähler: Jeder delegierte Reasoning-Aufruf, jeder Tool-Aufruf und jede Websuche werden zu den regulären Tarifen dieses Modells abgerechnet. Richtet man die Delegation also auf einen Frontier-Reasoner, der bei jedem Turn sucht, erzeugt das einen teuren Aufruf hinter einer günstigen Sprachschicht.
Was die unabhängigen Gremien über die beiden sagen, ist gerade deshalb aufschlussreich, weil sie unterschiedliche Dinge messen und keines seinem Gegenstand schmeichelt. Qwen-Audio-3.0-TTS-Plus liegt bei der Qualität auf Platz vier und beim Durchsatz nahe dem unteren Ende. GPT-Live-1 steht im Speech to Speech Index von Artificial Analysis mit 69,8 % auf Platz sieben von elf — hinter dem GPT-Realtime-2.1, das es ersetzt, mit 73,9 % — und wird dabei am unteren Ende der Kostenspanne des Index pro Stunde Eingabe-Audio berechnet: 4,42 $ gegenüber 10,75 $ für GPT-Realtime-2.1. Keines der beiden Modelle belegt den Spitzenplatz in seiner eigenen Kategorie. Beide sind günstiger als das, was sie schlagen sollten.

Dieser zweite Zähler ist der Punkt, an dem aus einer Routing-Schicht eine Designentscheidung wird statt einer Optimierung. OrcaRouter führt weder GPT-Live-1 noch Qwen-Audio-3.0-TTS — die Voice-Schicht liegt in beiden Fällen außerhalb unserer Reichweite, und wir routen nichts davon. Der Reasoning-Abschnitt hingegen nicht. Rund 190 Modelle von elf vorgelagerten Anbietern stehen hinter einem Schlüssel zum Listenpreis des Anbieters ohne Aufschlag, und eine Preissenkung eines Anbieters greift noch am selben Tag statt erst zur nächsten Vertragsverlängerung. Für eine Kaskade deckt das den mittleren Abschnitt vollständig ab: zwei ASR-Optionen und drei Reasoner hinter einem einzigen Endpunkt halten, sie im A/B-Test mit echtem Verkehr gegeneinander antreten lassen und automatisches Failover einen schlechten Nachmittag eines Upstream-Anbieters auffangen lassen, ohne dass ein Anruf abreißt.
Die Frage der Einwilligung schlägt in die andere Richtung aus
Voice-Cloning ist die kommerziell nützlichste Funktion von Qwen-Audio-3.0-TTS und zugleich die größte Compliance-Angriffsfläche. Zehn Sekunden Referenzaudio genügen, um einen Sprecher sprachübergreifend zu reproduzieren, was für die Lokalisierung transformativ ist und überall dort ein Risiko darstellt, wo Identität zählt. OpenAI brachte GPT-Live-1 ganz ohne Cloning und ohne eigene Stimmen auf den Markt – 12 API-Stimmen zur Auswahl, und das ist die Liste.
Diese Asymmetrie lässt sich in einem Funktionsvergleich leicht übergehen und in einer Risikoprüfung nur schwer. Ein Produkt, das ausschließlich in einer von zwölf Anbieterstimmen spricht, hat auf die Frage „Wessen Stimme ist das, und wer hat ihr zugestimmt?“ eine viel kürzere Antwort als ein Produkt, das jede Stimme aus einer Probe reproduzieren kann. Wenn Sie Klonen benötigen, ist die Entscheidung über die Pipeline bereits für Sie gefallen, und es stellt sich nur noch die Frage, was sie regelt. Wenn nicht, lohnt es sich, die Einschränkung von GPT-Live-1 als eine Kontrolle zu lesen, die Sie nicht selbst aufbauen mussten.
Welches soll ich kaufen?
Kaufen Sie Qwen-Audio-3.0-TTS, wenn die Ausgabe Inhalt ist: Narration, Lokalisierung, Audio für Barrierefreiheit, Synchronisation oder jeder Workflow, bei dem der Text vor dem Audio existiert und die Qualität pro gerenderter Stunde die Kennzahl ist. Beginnen Sie mit Flash, wenn Sie Echtzeit-Wiedergabe benötigen, wechseln Sie zu Plus, wenn die Stimme selbst das Endprodukt ist, und bepreisen Sie den Klon-Workflow getrennt von den voreingestellten Stimmen.
Kaufen Sie GPT-Live-1, wenn es sich bei der Eingabe um eine Person handelt. Support-Hotlines, Buchungsabläufe, Aufnahmegespräche – alles, bei dem die erste Silbe des Nutzers eintrifft, während das Modell mitten im Satz ist und das System sich wie ein Zuhörer statt wie ein Sprecher verhalten muss. Es kostet mehr pro Stunde Audio und ist das einzige der beiden, das unterbrochen werden kann.
Die beiden ergänzen sich weit häufiger, als dass sie Rivalen sind: Viele Produkte wollen, dass Qwen-Audio-3.0-TTS ein Dokument vorliest und ein Duplexmodell den darauffolgenden Anruf übernimmt. Was sie nicht gemeinsam haben sollten, ist ein Kostenmodell. Pro Stunde Audio ist genau für eines von ihnen die richtige Metrik.
