Une carte de titre hero générée pour StepAudio 3 TTS vs Qwen-Audio-3.0-TTS, avec le sur-titre « OrcaRouter · radar des modèles — face-à-face », le titre principal « StepAudio 3 TTS vs Qwen-Audio-3.0-TTS » et le sous-titre « L'un a un score d'arène d'écoute en aveugle. L'autre est sorti sept semaines après le dernier vote », au-dessus de deux cartes de modèles arrondies de part et d'autre d'un symbole versus.
Guides & Insights

StepAudio 3 TTS vs Qwen-Audio-3.0-TTS : l’un des deux a un score Arena, et ce n’est pas le nouveau

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Voici toute la comparaison en une ligne. Qwen-Audio-3.0-TTS figure sur la Text-to-Speech Arena avec un Elo de 1 234 pour son niveau Plus — un score obtenu sur 2 502 votes d'écoute à l'aveugle. StepAudio 3 TTS, publié par StepFun le 15 septembre 2026, ne figure pas du tout dans ce classement. Son prédécesseur y figure : StepAudio 2.5 TTS détient un Elo de 1 209 avec 1 306 votes.

Donc, la question honnête n’est pas « lequel sonne mieux ». Elle est de savoir si un écart Elo de 25 points, mesuré sur la génération précédente, survit à une version dont StepFun affirme qu’elle a amélioré la prosodie et réduit le prix de plus de moitié. Personne n’a encore organisé ce vote, et tout ce qui suit est articulé autour de cette lacune dans les preuves plutôt que de faire comme si elle n’existait pas.

Le tableau, tel qu'il se lit réellement aujourd'hui.

Cela vaut la peine de voir le classement réel, car plusieurs analyses qui circulent en citent une version obsolète. L’arène d’écoute à l’aveugle classe les modèles de synthèse selon l’échantillon que les votants ont préféré. Parcourez la ligne du haut du tableau des voix des fournisseurs :

• Cartesia Sonic 3.6 — Elo 1 277, août 2026, 49,0 $ par million de caractères

• Inworld Realtime TTS-2 — Elo 1 243, août 2026, 20,8 $ par million de caractères

• SpeechifyAI Simba 3.2 — Elo 1 238, juillet 2026, 6,6 $ par million de caractères

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1 234, juillet 2026, 27,6 $ par million de caractères, 8 voix d’arène

• VUI Labs Luna TTS — Elo 1 229, juin 2026, 80,0 $ par million de caractères

• Inworld Realtime TTS-2 Flash — Elo 1 213, août 2026, 10,4 $ par million de caractères

• StepFun StepAudio 2.5 TTS — Elo 1 209, août 2026, 85,0 $ par million de caractères, 8 voix d’arène

• {{1}}Google Gemini 3.1 Flash TTS{{/1}} — Elo 1 204, avril 2026, 18,3 $ par million de caractères

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

Deux choses ressortent immédiatement de cette liste. La première est que l'offre Plus de Qwen n'est pas le leader — elle est quatrième, derrière Cartesia, Inworld et Speechify, et le chiffre de 1 234 que l'on cite comme une couronne est un score de milieu de tableau sur un classement qui a évolué depuis. La seconde est que StepAudio 2.5 TTS a été retesté en août 2026 et s'est classé septième, à 25 points Elo derrière Qwen, à plus de trois fois le prix.

Et une troisième chose qui compte plus que tout le reste : regardez les intervalles de confiance. Le niveau Plus de Qwen est indiqué à −14/+14 sur 2 502 échantillons. StepAudio 2.5 TTS est indiqué à −16/+16 sur 1 306. Ces intervalles se chevauchent. Un écart de 25 points entre deux modèles dont les barres d'erreur s'étendent sur 14 et 16 points dans un sens comme dans l'autre ne constitue pas une différence de qualité démontrée — ce sont deux modèles que l'arène ne peut actuellement pas distinguer, classés dans un ordre que quelques centaines de votes supplémentaires pourraient inverser.

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

Ce que le point de données manquant vous coûte

StepAudio 3 TTS est le modèle par lequel StepFun a remplacé StepAudio 2.5 TTS, et son lancement promet un contrôle sur le timbre, l'intonation, le rythme et les pauses respiratoires, ainsi qu'un comportement paralinguistique — rire, hésitation, bégaiement, répétition, autocorrection — le tout transmis via une architecture de streaming où génération et lecture se chevauchent.

C'est exactement l'ensemble des qualités que l'arène mesure. C'est aussi exactement pourquoi l'absence de score est frustrante plutôt que fatale : le benchmark qui répondrait à la question existe, est exécuté publiquement, et n'a tout simplement pas été relancé depuis la sortie du nouveau modèle. Quiconque vous affirme que StepAudio 3 TTS sonne mieux que Qwen-Audio-3.0-TTS extrapole à partir d'un prédécesseur qui a perdu d'une marge comprise dans ses propres barres d'erreur.

Le prix est la partie qui est entièrement documentée, et il a beaucoup évolué.

StepAudio 3 TTS est facturé 2,5 yuan pour 10 000 caractères sur la plateforme de StepFun elle-même. StepAudio 2.5 TTS était facturé à 5,8. Dans la colonne de tarification par caractère de l’arena elle-même, le modèle plus ancien était à 85,00 $ par million de caractères ; 2,5 yuan pour 10 000 caractères équivaut à environ 35 $ par million aux taux de change récents — une conversion qui est la nôtre plutôt qu’un chiffre publié, et qu’il vaut la peine de refaire en fonction de votre propre région et de vos taux de change. Cela représente une baisse de près de 60 % sur le même poste.

Il reste encore au-dessus de Qwen. Qwen-Audio-3.0-TTS-Plus est affiché à 27,6 $ par million de caractères, et l’offre Flash est encore moins chère, Alibaba Cloud Model Studio facturant la synthèse au caractère saisi plutôt qu’à l’audio produit — la sortie n’est pas facturée séparément. Les plateformes tierces qui référencent l’offre Flash annoncent des tarifs dans la fourchette des dix-sept à dix-neuf dollars par million, même si les variations régionales rendent peu fiable tout chiffre unique mis en avant.

La situation se présente donc ainsi : StepFun a à peu près réduit de moitié le coût de synthèse, a comblé la majeure partie de l’écart avec Qwen, sans le franchir. Si le prix par caractère est votre contrainte déterminante, l’argument se resserre, mais la réponse ne change pas. Dans le cas contraire, le prix a cessé d’être la raison de choisir l’un ou l’autre modèle.

L'inventaire des voix et la couverture linguistique ne sont pas proches.

C'est ici que la comparaison cesse d'être une question de jugement pour devenir une question de spécification.

• Inventaire vocal — Qwen-Audio-3.0-TTS avec plus de 1 000 voix réparties sur ses différents niveaux, contre StepAudio 3 TTS qui n'a aucun décompte publié comparable

• Langues — Qwen-Audio-3.0-TTS : 16 langues et 20 dialectes chinois, avec le niveau Flash optimisé pour les langues à faibles ressources et l’authenticité dialectale, par rapport à StepAudio 3 TTS, qui privilégie le chinois, sans revendication de couverture équivalente.

• Taille de requête — Qwen-Audio-3.0-TTS : 20 000 caractères par requête, contre StepAudio 3 TTS : non publiée

• Latence — Qwen-Audio-3.0-TTS Flash vise une latence du premier paquet inférieure à 200 ms selon la documentation propre à Alibaba, contre le streaming de StepAudio 3 TTS, pour lequel aucun chiffre n’est publié

• Hiérarchisation — Qwen-Audio-3.0-TTS Plus pour l’expressivité et Flash pour le temps réel, six voix phares verrouillées sur l’un ou l’autre niveau, contrairement à StepAudio 3 TTS qui n’a qu’un seul niveau

• Surface de contrôle — direction de restitution en langage naturel Qwen-Audio-3.0-TTS, plus balises d’expression intégrées telles que [excited], [laughing], [whispers] dans le texte d’entrée, par rapport à la prosodie déduite du contexte par le modèle StepAudio 3 TTS

• Clonage vocal — StepAudio 3 TTS : un tarif fixe de 9,9 yuans par voix clonée sur l'ensemble de ses paliers TTS, contre le clonage via Qwen-Audio-3.0-TTS par le biais d'Alibaba Cloud Model Studio

• Sortie — Qwen-Audio-3.0-TTS : taux d'échantillonnage par défaut de 24 kHz, contre StepAudio 3 TTS non publié

Cette ligne de la surface de contrôle est la véritable différence de conception, et ce n'est pas une question de qualité. Les balises d'expression de Qwen sont explicites et synchrones : vous écrivez l'émotion dans le texte et le modèle la restitue, ce qui les rend testables et adaptées aux tests de régression. La description de StepFun porte sur un modèle qui déduit du contexte l'hésitation ou le rire appropriés, ce qui sonne mieux lorsqu'il tombe juste et est bien plus difficile à cerner lorsqu'il se trompe. Choisissez selon que vous préférez concevoir la performance vous-même ou la déléguer.

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

Comment décider sans la mesure

Vous ne pouvez pas arriver à une réponse par le raisonnement à partir de chiffres publiés, car le chiffre décisif n’existe pas. Il ne reste donc que les tests, et tester ces deux-là présente une forme particulière qu’il vaut la peine de planifier.

Toutes deux sont des API commerciales uniquement hébergées — Qwen-Audio-3.0-TTS via Alibaba Cloud Model Studio, StepAudio 3 TTS via la plateforme ouverte de StepFun. Aucun des deux n’est à poids ouverts, il n’existe donc aucune option d’auto-hébergement pour les évaluer. Pour être précis sur ce qu’OrcaRouter couvre ici : les modèles de synthèse vocale de notre catalogue aujourd’hui sont la famille OpenAI tts-1, gpt-4o-mini-tts et les aperçus Gemini TTS de Google. Aucun des modèles de cet article n’y figure, et Qwen-Audio-3.0-TTS non plus — rien ici ne doit être interprété comme une affirmation que nous les proposons.

La partie qui repose bel et bien sur OrcaRouter est la moitié textuelle du pipeline. Les scripts que lit votre couche de synthèse sont générés par un modèle de langage, et c'est le composant qui change le plus souvent, qui coûte le plus cher à recontractualiser et qu'il est le plus facile de laisser non épinglé — près de 200 modèles textuels derrière une seule API, un basculement automatique, un DSL de routage qui en compose plusieurs en un seul appel, et une fusion de modèles là où le jugement d'un seul modèle ne suffit pas, avec le prix catalogue du fournisseur répercuté sans marge. Si vous lancez une évaluation à l'aveugle entre ces deux modèles de synthèse, générez le corpus via un seul point de terminaison afin que les deux candidats lisent une entrée identique, et gardez la couche de synthèse derrière une interface que vous pouvez remplacer.

Où cela laisse la décision

Choisissez Qwen-Audio-3.0-TTS dès aujourd’hui si vous avez besoin d’étendue — plus de mille voix, 16 langues et 20 dialectes, un plafond documenté de 20 000 caractères par requête, un palier de latence et un palier d’expressivité, un objectif de 200 ms pour le premier paquet, et un tarif inférieur à celui de StepFun. C’est le modèle qui dispose d’une mesure derrière lui et de la surface la plus large, et sa quatrième place à l’Elo est un vrai résultat, même s’il ne s’agit pas de la couronne qu’on lui attribue.

Choisissez StepAudio 3 TTS si vous développez en privilégiant le chinois, si vous voulez un seul palier plutôt que d’avoir à choisir un palier, si vous voulez le clonage à des frais forfaitaires publiés, et si vous êtes prêt à adopter tôt un modèle qui n’a pas été testé en aveugle. Vous payez environ 27 % de plus par caractère que le palier Plus de Qwen, en échange d’une génération d’amélioration de prosodie revendiquée par rapport à un modèle qui se situait 25 Elo derrière, avec des barres d’erreur qui se chevauchent.

Ce qui trancherait, c’est une nouvelle exécution de l’arène avec StepAudio 3 TTS dans le pool. Tant que ce vote n’a pas lieu, on compare un modèle mesuré à un modèle non mesuré, et les 25 points qui séparent leurs prédécesseurs se situent dans le bruit — ce qui n’est pas un classement et ne devrait pas être présenté comme tel.