Carte de titre principale pour « Realtime-Venus vs Qwen-Audio-3.0-TTS », sous-titrée « Un moteur de rendu et un auditeur ne sont pas le même achat », avec trois cartes indiquant « Qwen-Audio-3.0-TTS-Plus : Elo 1 259, deuxième sur l’Artificial Analysis Provider Voice Arena », « Realtime-Venus : aucun score de qualité vocale n’existe du tout », et « L’entrée fait toute la différence : texte uniquement, par rapport à audio, vidéo et texte », au-dessus d’un bandeau de pied de page indiquant « Chiffres Qwen d’après Artificial Analysis ; chiffres Realtime-Venus issus de son rapport technique, non reproduits. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Realtime-Venus vs Qwen-Audio-3.0-TTS : l’un lit votre script, l’autre doit vous entendre

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La comparaison tentante entre Realtime-Venus et Qwen-Audio-3.0-TTS est le prix par heure d'audio, et elle produit une réponse claire qui est entièrement fausse. Qwen-Audio-3.0-TTS-Plus synthétise la parole à environ 27,6 $ par million de caractères, ce qui revient à près de 1,66 $ pour une heure d'audio fini. Realtime-Venus, le système full-duplex 9B que l'équipe Venus d'Ant Group a construit avec l'Université Tsinghua, n'a pas de prix du tout car il n'a pas de service hébergé — mais en auto-hébergement, il vous coûterait un nœud GPU fonctionnant en continu, ce qui représente au moins un ordre de grandeur de plus par heure. Le moteur de rendu l'emporte sur le plan arithmétique. L'arithmétique mesure deux produits différents : Qwen-Audio-3.0-TTS prend du texte et renvoie de l'audio, et Realtime-Venus prend de l'audio et de la vidéo et renvoie une conversation. La question qui les sépare réellement n'est pas ce qu'ils produisent. C'est de savoir si quelque chose doit répondre.

L'entrée, c'est toute la différence

Qwen-Audio-3.0-TTS, publié par le laboratoire Tongyi d'Alibaba Cloud le 20 juillet 2026, est un modèle de synthèse vocale exposé sous la forme d'une API hébergée, sans poids ouverts. Le texte entre via un point de terminaison HTTP et l'audio en sort. Il n'existe aucun chemin d'entrée audio, aucun tour à prendre, aucune transcription à renvoyer et aucune notion d'interruption — le modèle n'a jamais rien entendu. Tout son modèle de coût est une presse à imprimer : des caractères en entrée, de l'audio en sortie.

Realtime-Venus, en revanche, écoute en permanence. Le checkpoint audiovisuel embarque un encodeur visuel SigLIP2 pour les trames en streaming et un encodeur audio Whisper-Medium alimentant un backbone Qwen3-8B, et les deux checkpoints exécutent une boucle d’interaction d’une seconde qui met continuellement à jour l’état conversationnel et décide s’il faut parler ou rester silencieux. Il produit la parole via des tokens S3 discrets et un décodeur flow-matching en streaming plutôt qu’une étape de synthèse distincte, et il peut renvoyer du texte en parallèle de la forme d’onde.

Ce n’est pas une différence de fonctionnalité. C’est la différence entre un composant et un système. Mettez les deux côte à côte : l’un d’eux peut être intégré à un pipeline qui comporte déjà un système de reconnaissance vocale et un modèle de langage en amont. L’autre remplace les trois.

Un cas pratique rend cela concret.

Prenez une ligne d'assistance. Un client appelle, décrit mal un problème, s'interrompt au milieu d'une phrase pour trouver un numéro de compte, est interrompu par une annonce en arrière-plan, puis pose une question de suivi avant que l'agent n'ait fini de répondre.

Un système construit sur Qwen-Audio-3.0-TTS gère cela comme trois fournisseurs et trois factures : un moteur de reconnaissance transforme la parole de l'appelant en texte, un modèle de langage décide quoi dire, et Qwen-Audio-3.0-TTS le prononce. Chaque saut ajoute de la latence, et chaque frontière est l'endroit où la prosodie meurt. La défaillance critique est structurelle — le segment TTS ne peut pas entendre la pause au milieu d'une phrase qu'il est déjà en train de prononcer, donc l'interruption doit être gérée par quelque chose en amont.

Realtime-Venus gère le même appel en tant que modèle unique, sans détecteur externe d'activité vocale ni relais. Ses chiffres pour Full-Duplex-Bench v1.5 — un taux de réponse aux interruptions de 75 % et des taux de continuation de 97 % en présence de backchannels, de 88 % en présence de parole adressée à autrui et de 86 % en présence de parole en arrière-plan — sont exactement les métriques qui décrivent ce scénario. Ils sont également autodéclarés, issus du rapport technique du modèle lui-même, sans réplication externe. Interprétez-les comme une affirmation de conception, et non comme une mesure.

Qualité vocale : l'un a un Elo, l'autre n'a rien.

C'est la partie la plus déséquilibrée de la comparaison, et elle favorise largement Alibaba.

• Score indépendant — Qwen-Audio-3.0-TTS-Plus se classe deuxième sur le Provider Voice Arena d'Artificial Analysis avec un Elo de 1 259 sur 1 544 échantillons au 18 septembre 2026, derrière Cartesia Sonic 3.6 à 1 277 et devant Inworld Realtime TTS-2 à 1 247 et Speechify Simba 3.2 à 1 241.

• Où cela a commencé — la propre colonne des sorties de l’arène répertorie ce modèle comme une entrée de septembre 2026, qui correspond au palier tel qu’il est actuellement noté plutôt qu’à la date de lancement du 20 juillet 2026. À chaque fois qu’il a changé de position, il est resté dans les deux premiers tout du long.

• Realtime-Venus — aucune entrée d’arène, aucune évaluation vocale par un tiers, rien. Son seul chiffre lié à la voix est un score VoiceBench AlpacaEval de 4,81 auto-déclaré que le rapport décrit comme correspondant au meilleur chiffre de comparaison.

• Ce que cela signifie — personne en dehors des auteurs n’a jugé si Realtime-Venus sonne bien. Ce n’est pas un point à sa charge ; c’est simplement inconnu, et inconnu est différent de mauvais. Mais si la qualité de la voix est le livrable, acheter un modèle classé Elo vaut mieux que de faire confiance à un modèle non classé.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured 18 September 2026, showing the ranked table: Cartesia Sonic 3.6 first at Elo 1,277 with 1,810 samples, released August 2026 at $49.0 per million characters; Alibaba's Qwen-Audio-3.0-TTS-Plus second at Elo 1,259 with 1,544 samples and $27.6 per million characters; Inworld Realtime TTS-2 third at Elo 1,247; SpeechifyAI Simba 3.2 fourth at Elo 1,241; VUI Labs Luna TTS fifth at Elo 1,231; Inworld Realtime TTS-2 Flash sixth at Elo 1,216; StepFun StepAudio 2.5 TTS seventh at Elo 1,209; and BreezeBlue Breeze TTS 2 eighth at Elo 1,207 with an Open Weights badge.A two-column comparison scoreboard titled 'Realtime-Venus vs Qwen-Audio-3.0-TTS — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Job: full-duplex conversation', 'Input: audio, video and text', 'Output: text and speech', 'Independent voice score: none', 'Availability: Apache-2.0 weights, no API', 'Price: none published'. The right column, labelled Qwen-Audio-3.0-TTS, reads 'Job: text-to-speech rendering', 'Input: text only', 'Output: audio', 'Independent voice score: Elo 1,259, second of 20-plus', 'Availability: hosted API since 20 July 2026', 'Price: about $27.6 per 1M characters'. The footer reads 'Qwen figures per Artificial Analysis and Alibaba Cloud documentation; Realtime-Venus figures from its technical report, unreproduced.'

Langue, voix et contrôle expressif

Le modèle d’Alibaba est conçu pour l’étendue de la restitution. Il embarque plus de mille voix, couvre seize langues, dont vingt régions dialectales chinoises, et expose 86 balises en ligne pour l’émotion et la diction — une surface de contrôle que vous écrivez directement dans le texte, ainsi que des instructions de diction en langage naturel. La sortie monte jusqu’à 48 kHz, contre 24 kHz pour la génération précédente, et une synthèse unique peut durer jusqu’à trois minutes. Le palier Flash vise environ 300 millisecondes jusqu’au premier paquet pour une lecture en temps réel ; le palier Plus est le palier de qualité et génère à environ seize caractères par seconde, ce qui est suffisamment lent pour compter dans un produit en direct et invisible en rendu par lots.

Realtime-Venus documente l’anglais et le chinois, livre une voix de référence avec les poids, et vous donne un décodeur token-vers-forme d’onde plutôt qu’une bibliothèque de voix. L’expressivité au sens de Qwen — balises, instructions, un millier de préréglages — n’a pas d’équivalent ici. Ce qu’il a à la place, c’est la capacité de modifier son élocution en réponse à ce qu’il entend, ce qui est un autre type de contrôle expressif et bien plus difficile à mettre sur une fiche technique.

Le coût de chaque chemin, honnêtement

Il y a un véritable bémol concernant le chiffre d’Alibaba avant que quiconque ne l’utilise pour établir un budget. Le montant de 27,6 $ par million de caractères, largement cité, ne correspond pas à la page de tarification d’Alibaba dans chaque relevé, et les paliers sont facturés séparément. Vérifiez le chiffre au niveau du compte plutôt que de vous fier à un tableau comparatif, y compris celui-ci.

Realtime-Venus n'a pas de prix catalogue, parce qu'il n'y a rien à acheter. Le coût, ce sont deux checkpoints 9B en BF16 — environ dix-huit gigaoctets de poids chacun, avant la mémoire d'activation — plus une boucle de streaming continue, autrement dit un nœud GPU facturé au mois, que quelqu'un appelle ou non. À volume régulier, c'est moins cher par conversation qu'une API vocale au compteur. À volume intermittent, c'est bien pire, et le point de bascule est la seule question financière qui compte.

Il existe une troisième voie sur laquelle beaucoup d'équipes finiront par tomber, et elle mérite d'être nommée parce qu'elle change la forme de la décision. Si vous conservez une cascade, le seul segment qui doive être un modèle hébergé est celui du milieu — le raisonnement. OrcaRouter ne propose ni Qwen-Audio-3.0-TTS ni Realtime-Venus ; les deux couches vocales sont en dehors de ce que nous servons, et nous préférons le dire plutôt que de laisser entendre le contraire. Le segment du raisonnement, en revanche, est bien ce que nous couvrons : près de 200 modèles de texte derrière une seule clé, au prix catalogue du fournisseur, sans marge, un basculement automatique entre les fournisseurs en amont pour qu'un mauvais après-midi chez l'un d'eux ne fasse pas tomber un appel en cours, un DSL de routage qui compose plusieurs modèles en un seul appel, et la fusion de modèles quand une décision mérite plus d'un avis. Dans une cascade, c'est le segment que vous voulez le plus pouvoir remplacer sans négocier un contrat, et celui où une baisse de prix d'un fournisseur arrive le jour même plutôt qu'au renouvellement.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge alongside the Any-to-Any, Safetensors, audio, video, streaming and full-duplex tags, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Le clonage est à double tranchant

Qwen-Audio-3.0-TTS peut cloner une voix à partir d'un court échantillon de référence, et ce d'une langue à l'autre, et est documenté comme robuste aux entrées bruitées ou réverbérantes. C'est la capacité la plus utile sur le plan commercial de la comparaison et la plus grande surface de conformité. Un produit capable de reproduire n'importe quel locuteur à partir de dix secondes d'audio a une réponse bien plus longue à « à qui appartient cette voix, et qui y a consenti » qu'un produit qui ne s'exprime jamais que dans les préréglages d'un fournisseur.

Realtime-Venus est livré avec une voix de référence accompagnée des poids. Vous pouvez cloner avec elle si vous disposez de l’audio et de l’exécution d’entraînement, mais rien dans la version publiée n’est conçu pour rendre cela facile — ce qui, pour un déploiement auto-hébergé à l’intérieur d’un périmètre de conformité, est sans doute l’option par défaut la plus sûre.

Lequel achetez-vous réellement ?

Achetez Qwen-Audio-3.0-TTS lorsque l’audio est le résultat. Narration, localisation, accessibilité, doublage, tout workflow où le texte existe avant le son et où la qualité par heure rendue est la métrique. Commencez avec Flash si la lecture est en direct, passez à Plus lorsque la voix elle-même est le produit, et tarifez le workflow de clonage séparément de la bibliothèque de presets.

Choisissez Realtime-Venus lorsque l'entrée est une personne et que le système doit se comporter comme un auditeur. Assistance consciente de la caméra, interaction mains libres, tout ce où un humain va interrompre au milieu d'une phrase et s'attendre à ce que le système gère cela. Le compromis est net : vous abandonnez une voix classée Elo, un millier de préréglages et toute option hébergée, et en échange, vous obtenez le seul des deux qui peut vous entendre.

La plupart des produits veulent les deux, à des endroits différents. Ce qu'ils ne doivent pas partager, c'est un modèle de coût — le prix par heure d'audio est la bonne métrique pour exactement l'un de ces deux modèles, et ce n'est pas celui qui tient la conversation.