Eine generierte Hero-Titelkarte für StepAudio 3 TTS vs. Qwen-Audio-3.0-TTS mit dem Kicker „OrcaRouter · Model Radar — Head to Head", der Headline „StepAudio 3 TTS vs. Qwen-Audio-3.0-TTS" und dem Untertitel „Die eine hat einen Blindhören-Arena-Score. Die andere erschien sieben Wochen nach der letzten Abstimmung", über zwei abgerundeten Modellkarten beidseits eines Versus-Zeichens.
Guides & Insights

StepAudio 3 TTS vs. Qwen-Audio-3.0-TTS: Eines von beiden hat einen Arena-Score, und es ist nicht das neue.

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Hier ist der ganze Vergleich in einer Zeile. Qwen-Audio-3.0-TTS steht in der Text-to-Speech Arena mit einem Elo von 1.234 für seine Plus-Stufe – eine Punktzahl, die aus 2.502 blinden Hörvoten stammt. StepAudio 3 TTS, veröffentlicht von StepFun am 15. September 2026, ist gar nicht auf dieser Rangliste. Sein Vorgänger ist: StepAudio 2.5 TTS hält ein Elo von 1.209 aus 1.306 Stimmen.

Die ehrliche Frage lautet also nicht „was besser klingt“. Sie lautet, ob eine 25-Punkte-Elo-Lücke, gemessen an der vorherigen Generation, ein Release übersteht, von dem StepFun sagt, dass es die Prosodie verbessert und den Preis um mehr als die Hälfte gesenkt hat. Niemand hat diese Abstimmung bisher durchgeführt, und alles Folgende ist um diese Lücke in der Beweislage herum angeordnet, statt sie wegzureden.

Die Tafel, wie sie heute tatsächlich lautet

Es lohnt sich, die echten Platzierungen zu sehen, denn mehrere kursierende Berichte zitieren eine veraltete Version davon. Die Blindhör-Arena reiht Synthesemodelle danach ein, welches Sample die Abstimmenden bevorzugten. Lesen Sie oben in der Anbieter-Stimmtafel quer:

• Cartesia Sonic 3.6 — Elo 1.277, August 2026, 49,0 $ pro Million Zeichen

• Inworld Realtime TTS-2 — Elo 1.243, August 2026, 20,8 $ pro Million Zeichen

• SpeechifyAI Simba 3.2 — Elo 1.238, Juli 2026, 6,6 $ pro Million Zeichen

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, Juli 2026, 27,6 $ pro Million Zeichen, 8 Arena-Stimmen

• VUI Labs Luna TTS — Elo 1.229, Juni 2026, 80,0 $ pro Million Zeichen

• Inworld Realtime TTS-2 Flash — Elo 1.213, August 2026, 10,4 $ pro Million Zeichen

• StepFun StepAudio 2.5 TTS — Elo 1.209, August 2026, 85,0 $ pro Million Zeichen, 8 Arena-Stimmen

Google Gemini 3.1 Flash TTS — Elo 1.204, April 2026, 18,3 $ pro Million Zeichen

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

Zwei Dinge ergeben sich sofort aus dieser Liste. Das erste ist, dass Qwens Plus-Tier nicht der Spitzenreiter ist – es liegt auf Platz vier, hinter Cartesia, Inworld und Speechify, und die 1.234, die als Krone zitiert wird, ist ein Mittelfeldwert auf einem Ranking, das sich seitdem verändert hat. Das zweite ist, dass StepAudio 2.5 TTS im August 2026 erneut getestet wurde und auf Platz sieben landete, 25 Elo hinter Qwen, bei mehr als dreimal so hohem Preis.

Und ein Drittes, das wichtiger ist als alles davon: Schauen Sie sich die Konfidenzintervalle an. Qwens Plus-Stufe ist mit −14/+14 über 2.502 Stichproben angegeben. StepAudio 2.5 TTS ist mit −16/+16 über 1.306 angegeben. Diese Intervalle überschneiden sich. Ein Abstand von 25 Punkten zwischen zwei Modellen, deren Fehlerbalken 14 bzw. 16 Punkte in beide Richtungen reichen, ist kein belegter Qualitätsunterschied — es sind zwei Modelle, die die Arena derzeit nicht trennen kann, in einer Reihenfolge eingestuft, die ein paar hundert weitere Stimmen umkehren könnten.

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

Was der fehlende Datenpunkt Sie kostet

StepAudio 3 TTS ist das Modell, mit dem StepFun StepAudio 2.5 TTS ersetzt hat, und die Markteinführung verspricht Kontrolle über Klangfarbe, Intonation, Rhythmus und Atempausen sowie paralinguistisches Verhalten – Lachen, Zögern, Stottern, Wiederholung, Selbstkorrektur –, bereitgestellt über eine Streaming-Architektur, bei der Generierung und Wiedergabe überlappen.

Das ist genau die Gesamtheit der Eigenschaften, die die Arena misst. Es ist auch genau der Grund, warum das Fehlen eines Ergebnisses frustrierend statt fatal ist: Der Benchmark, der die Frage beantworten würde, existiert, wird öffentlich betrieben und wurde seit dem Erscheinen des neuen Modells einfach nicht erneut ausgeführt. Wer Ihnen sagt, StepAudio 3 TTS klinge besser als Qwen-Audio-3.0-TTS, extrapoliert von einem Vorgänger, der mit einem Abstand verlor, der innerhalb seiner eigenen Fehlerbalken lag.

Der Preis ist der Teil, der vollständig dokumentiert ist, und er hat sich stark bewegt

StepAudio 3 TTS wird auf StepFuns eigener Plattform mit 2,5 Yuan pro 10.000 Zeichen abgerechnet. StepAudio 2.5 TTS wurde mit 5,8 abgerechnet. In der eigenen zeichenbasierten Preisspalte der Arena lag das ältere Modell bei 85,00 $ pro Million Zeichen; 2,5 Yuan pro 10.000 Zeichen entsprechen bei aktuellen Wechselkursen ungefähr 35 $ pro Million – eine Umrechnung, die von uns stammt und keine veröffentlichte Zahl ist, und es lohnt sich, sie anhand Ihrer eigenen Region und Wechselkurse erneut durchzuführen. Das ist eine Senkung um fast 60 % auf denselben Posten.

Es liegt weiterhin über Qwen. Qwen-Audio-3.0-TTS-Plus ist mit 27,6 US-Dollar pro Million Zeichen gelistet, und der Flash-Tarif ist noch günstiger, wobei Alibaba Cloud Model Studio die Synthese nach Eingabezeichen statt nach erzeugtem Audio abrechnet – die Ausgabe wird nicht separat berechnet. Drittanbieter-Plattformen, die den Flash-Tarif aufführen, nennen Preise im oberen Zehnerbereich pro Million, wobei regionale Unterschiede jede einzelne plakative Zahl unzuverlässig machen.

Das Gesamtbild sieht also so aus: StepFun hat die Synthesekosten in etwa halbiert, den Großteil des Abstands zu Qwen aufgeholt und Qwen nicht überholt. Wenn der Preis pro Zeichen Ihre bindende Einschränkung ist, verengt sich das Argument, aber die Antwort ändert sich nicht. Ist sie es nicht, ist der Preis nicht länger der Grund, eines der beiden Modelle zu wählen.

Stimmangebot und Sprachabdeckung liegen nicht dicht beieinander

Hier hört der Vergleich auf, eine Ermessensfrage zu sein, und wird zu einer Spezifikationsfrage.

• Stimminventar — Qwen-Audio-3.0-TTS über 1.000 Stimmen über seine Stufen hinweg vs. StepAudio 3 TTS keine vergleichbare veröffentlichte Anzahl

• Sprachen — Qwen-Audio-3.0-TTS: 16 Sprachen plus 20 chinesische Dialekte, wobei die Flash-Stufe auf Sprachen mit geringen Ressourcen und Dialekt-Authentizität optimiert ist, gegenüber StepAudio 3 TTS, das chinesisch-zentriert ist und keinen vergleichbaren Abdeckungsanspruch erhebt.

• Anfragegröße — Qwen-Audio-3.0-TTS 20.000 Zeichen pro Anfrage vs. StepAudio 3 TTS nicht veröffentlicht

• Latenz — Qwen-Audio-3.0-TTS Flash strebt laut Alibabas eigener Dokumentation eine First-Packet-Latenz innerhalb von 200 ms an, im Vergleich zu StepAudio 3 TTS Streaming, für das keine veröffentlichte Zahl vorliegt

• Tiering – Qwen-Audio-3.0-TTS Plus für Ausdrucksstärke und Flash für Echtzeit, sechs Flaggschiff-Stimmen, die fest einer der beiden Stufen zugeordnet sind, im Vergleich zu StepAudio 3 TTS mit nur einer einzigen Stufe

• Steuerungsebene — natürlichsprachliche Sprech-/Vortragssteuerung bei Qwen-Audio-3.0-TTS plus im Eingabetext eingebettete Inline-Ausdrucks-Tags wie [excited], [laughing], [whispers] vs. vom StepAudio 3 TTS-Modell aus dem Kontext abgeleitete Prosodie

• Voice-Cloning — StepAudio 3 TTS kostet pauschal 9,9 Yuan pro geklonter Stimme über alle seine TTS-Tarifstufen hinweg vs. Klonen mit Qwen-Audio-3.0-TTS über Alibaba Cloud Model Studio

• Ausgabe — Qwen-Audio-3.0-TTS: Standard-Abtastrate 24 kHz vs. StepAudio 3 TTS: nicht veröffentlicht

Jene Zeile der Steuerungsoberfläche ist der eigentliche Designunterschied, und es ist keine Frage der Qualität. Qwens Expression-Tags sind explizit und synchron: Man schreibt die Emotion in den Text, und das Modell setzt sie um, was sie testbar und regressionstauglich macht. StepFuns Beschreibung bezieht sich auf ein Modell, das die passende Zögerung oder das passende Lachen aus dem Kontext ableitet, was besser klingt, wenn es richtig liegt, und viel schwerer festzunageln ist, wenn es falsch liegt. Entscheide dich danach, ob du die Performance lieber selbst gestaltest oder sie delegierst.

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

Wie man ohne die Messung entscheidet

Aus veröffentlichten Zahlen lässt sich keine Antwort herleiten, denn die entscheidende Zahl existiert nicht. Damit bleibt nur das Testen, und das Testen dieser beiden hat eine bestimmte Form, für die es sich lohnt, zu planen.

Beide sind ausschließlich gehostete kommerzielle APIs – Qwen-Audio-3.0-TTS über Alibaba Cloud Model Studio, StepAudio 3 TTS über die offene Plattform von StepFun. Keines von beiden ist Open Weights, daher gibt es keinen selbst gehosteten Weg zur Evaluierung. Um genau zu sein, was OrcaRouter hier abdeckt: Bei den Text-to-Speech-Modellen in unserem Katalog handelt es sich heute um die OpenAI tts-1-Familie, gpt-4o-mini-tts und Googles Gemini TTS-Vorschauen. Keines der in diesem Artikel genannten Modelle ist darin enthalten, und Qwen-Audio-3.0-TTS ebenfalls nicht – nichts hier sollte als Behauptung gelesen werden, dass wir sie anbieten.

Der Teil, der tatsächlich auf OrcaRouter läuft, ist die Text-Hälfte der Pipeline. Die Skripte, die Ihre Syntheseschicht liest, werden von einem Sprachmodell generiert, und das ist die Komponente, die sich am häufigsten ändert, am teuersten neu zu beauftragen ist und am leichtesten ungepinnt bleibt — fast 200 Textmodelle hinter einer API, automatisches Failover, eine Routing-DSL, die mehrere zu einem einzigen Aufruf zusammenfügt, und Modellfusion, bei der das Urteil eines einzelnen Modells nicht ausreicht, wobei der Listenpreis des Anbieters ohne Aufschlag durchgereicht wird. Wenn Sie eine Blindevaluation zwischen diesen beiden Synthesemodellen durchführen, generieren Sie das Korpus über einen einzigen Endpunkt, damit beide Kandidaten identische Eingaben lesen, und halten Sie die Syntheseschicht hinter einer Schnittstelle, die Sie austauschen können.

Was das für die Entscheidung bedeutet

Nehmen Sie heute Qwen-Audio-3.0-TTS, wenn Sie Breite brauchen – über tausend Stimmen, 16 Sprachen und 20 Dialekte, eine dokumentierte Obergrenze von 20.000 Zeichen pro Anfrage, eine Latenzstufe und eine Ausdrucksstufe, ein Ziel von 200 ms für das erste Paket und eine Rate, die unter der von StepFun liegt. Es ist das Modell mit einer Messung dahinter und der breiteren Oberfläche, und sein vierter Platz im Elo ist ein echtes Ergebnis, auch wenn es nicht die Krone ist, als die es zitiert wird.

Wählen Sie StepAudio 3 TTS, wenn Sie mit Fokus auf Chinesisch entwickeln, eine einzige Tarifstufe statt einer Entscheidung zur Tarifauswahl möchten, Klonen zu einer veröffentlichten Pauschalgebühr wünschen und bereit sind, bei einem Modell früh dabei zu sein, das nicht blind getestet wurde. Sie zahlen rund 27 % mehr pro Zeichen als bei der Plus-Tarifstufe von Qwen, im Austausch für eine Generation mit behaupteter Prosodie-Verbesserung gegenüber einem Modell, das 25 Elo zurücklag – mit überlappenden Fehlerbalken.

Was die Sache klären würde, wäre ein erneuter Durchlauf der Arena mit StepAudio 3 TTS im Teilnehmerfeld. Bis diese Abstimmung erfolgt, steht hier ein gemessenes Modell gegen ein ungemessenes, und die 25 Punkte, die ihre Vorgänger trennen, liegen im Rauschen — was kein Ranking ist und auch nicht als eines verkauft werden sollte.