Une carte hero générée pour « Gemini 3.8 Live vs Qwen-Audio-3.1-TTS » sur fond blanc, avec de doux dégradés bleu et cyan. Deux panneaux se trouvent sous un titre indiquant « Deux moitiés, actualisées à huit jours d'intervalle ». Le panneau de gauche porte sur « 15 sept. 2026 — Gemini 3.8 Live et Extended Thinking sur la Live API ». Le panneau de droite porte sur « 23 sept. 2026 — Qwen-Audio-3.1-TTS chez Apsara, synthèse réduite d'environ 70 % ». Une ligne de pied de page indique « Elles se rejoignent au milieu d'un pipeline, pas sur le même poste. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 Live vs Qwen-Audio-3.1-TTS : deux moitiés d’un stack vocal, au tarif révisé à huit jours d’écart

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 3.8 Live est le modèle parole-parole de Goog​le, publié le 15 septembre 2026 sous les noms gemini-3.8-live et gemini-3.8-live-extended-thinking sur la Live API. Qwen-Audio-3.1-TTS est le modèle de synthèse vocale d'Aliba​ba, annoncé à la conférence Apsara de Hangzhou le 23 septembre 2026, huit jours plus tard, accompagné d'une baisse de prix d'environ 70 % sur la synthèse vocale. Cet écart de huit jours explique pourquoi cette comparaison mérite d'être lue maintenant plutôt qu'en juillet. Rien n'a changé au rôle des deux produits — l'un écoute et parle, l'autre lit le texte à voix haute — mais les deux moitiés d'un pipeline vocal de production ont été reconstruites ou revalorisées en l'espace d'une seule quinzaine, et le calcul qui tranchait autrefois ce duel s'est discrètement déplacé.

Deux moitiés, renouvelées à huit jours d'intervalle

Commencez par ce qui rend ce couplage inhabituel : les deux modèles ne sont pas en concurrence. Un produit vocal a une bouche et il a une oreille, et chacun d'eux en est un. Gemini 3.8 Live ferme la boucle — audio et vidéo en entrée, audio en sortie, interruptions gérées, appels d'outils s'exécutant en arrière-plan de la conversation. Qwen-Audio-3.1-TTS prend une chaîne et une voix de référence et renvoie une performance. C'est davantage une bouche qu'autre chose, et il ne cherche pas à être une oreille.

Ce qui rend le timing de septembre intéressant, c'est que les deux annonces ciblent des extrémités opposées de la même ligne budgétaire. Le lancement du 15 septembre de Google mettait l'accent sur les capacités, sans mouvement de prix ; l'annonce du 23 septembre d'Alibaba portait essentiellement sur la marge, avec de nouvelles capacités en plus. Une équipe qui a mis en place un pipeline hybride en août s'est vu offrir, en l'espace de huit jours, une raison de réexaminer les deux volets — et un seul de ces volets a vu son prix baisser.

Ce que la version 3.1 a réellement changé du côté de Qwen

Alibaba n'a pas publié qu'un seul modèle le 23 septembre. La génération 3.1 couvre cinq points de terminaison — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next et Qwen-Audio-3.1-Realtime — et un seul d'entre eux, le palier TTS standard, constitue un remplacement direct pour quiconque appelle déjà le modèle TTS 3.0.

À ce niveau, trois choses ont changé et l'une d'elles représente un véritable coût de migration. Le contrôle de l'interprétation est passé d'un vocabulaire fixe de 86 balises en ligne à une instruction en langage naturel : vous décrivez l'émotion, le rythme et le style souhaités au lieu d'insérer la bonne balise à la bonne position. Le transfert de timbre inter-langues est arrivé, permettant à une voix de référence de transporter son identité à travers le mandarin, le cantonais, l'anglais et le japonais. Et le modèle tolère désormais directement un audio de référence bruité ou avec écho, sans étape de débruitage séparée. La couverture linguistique reste inchangée, à savoir 16 langues selon le fournisseur, plus 20 régions dialectales chinoises, et — cela vaut la peine de le signaler, car c'est passé sous silence ailleurs — les propres documents d'Alibaba indiquent que le niveau 3.1 ajoute sept langues, ce qui ne concorde pas avec les 16 que listait la couverture publiée de la génération de juillet. Considérez les deux chiffres comme déclarés par le fournisseur tant que vous n'avez pas vérifié les langues spécifiques dont vous avez besoin dans Model Studio.

Le produit véritablement nouveau de cette version est Qwen-Audio-3.1-TTS-Next, qu'Alibaba appelle un modèle « Audiogen » : une seule passe qui produit voix, effets sonores et ambiance de fond ensemble, pour des dialogues multi-locuteurs, l'assemblage de podcasts et le travail de scène. Il est affiché à 0,848 $ par million de jetons d'entrée et 1,696 $ par million de jetons de sortie sur le nœud de Pékin, plafonné à 3 000 caractères d'entrée, 240 secondes d'audio généré pour les podcasts et 120 secondes autrement, trois requêtes par seconde, acceptant jusqu'à trois clips de référence de 30 secondes chacun. Il ne gère que le chinois et l'anglais. Si votre pipeline est un narrateur unique lisant un script, ce produit ne vous concerne pas ; s'il s'agit de deux animateurs et d'un fond musical, c'est la raison même de s'intéresser à cette version.

La couture est ce que vous choisissez vraiment.

Parce que les deux modèles n’effectuent pas le même travail, la décision n’est pas un comparatif. C’est une question de savoir où vous placez la passation, et combien vous êtes prêt à payer pour que la jointure soit invisible.

Il existe deux architectures honnêtes. La première repose sur un seul réseau : Gemini 3.8 Live gère l’intégralité du tour de parole, écoute l’appelant, décide quoi dire et le dit, et vous acceptez la voix qu’il vous donne — que vous ne pouvez ni cloner ni marquer à votre image. La seconde est une cascade : la reconnaissance, puis le raisonnement, puis Qwen-Audio-3.1-TTS comme bouche, vous offrant mille voix, dont une enregistrée par votre propre talent, au prix d’une latence à travers deux ou trois frontières entre fournisseurs et de la prosodie qui se perd lorsqu’une phrase est coupée par un appel API.

La plupart des équipes finissent par avoir recours aux deux, et ce n'est pas un manque de cran. Utilisez le modèle temps réel là où la latence se fait sentir — l'interruption, l'acquiescement, le « mm-hm » qui indique à votre interlocuteur que vous êtes toujours là — et le modèle de synthèse là où la qualité s'entend : la longue relecture d'une politique, le numéro de confirmation énoncé à un rythme délibéré, la voix de marque qui doit être identique à chaque appel. L'hybride est la bonne réponse pour une vaste catégorie de produits. C'est aussi là que le modèle de coûts se complique, car vous mesurez désormais deux unités différentes.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

Tarifé à l’heure audio, la seule unité qui convienne aux deux.

Google facture l'API Live à la minute ; Alibaba facture les paliers Qwen TTS au caractère et au token. Pour les comparer, il faut choisir un normalisateur, et le seul défendable pour la voix est l'heure d'audio finalisé.

• Facturé à l'entrée — Gemini 3.8 Live par minute d'audio, 0,005 $ en entrée et 0,018 $ en sortie contre Qwen-Audio-3.1-TTS par million de caractères, avec le palier 3.0 Plus à environ 27,60 $ et le palier Flash à environ 15 $ avant la baisse de prix, et le palier TTS Flash affiché à 1,5 yuan par million de jetons d'entrée et 12 yuan par million de jetons de sortie après celle-ci
• Facturé à la sortie — Gemini 3.8 Live une conversation bidirectionnelle coûte environ 1,38 $ pour une heure de conversation en temps réel au tarif catalogue, avant toute mise en cache, contre Qwen-Audio-3.1-TTS un flux unidirectionnel, avec le palier 3.1-Next à 0,848 $ par million de jetons d'entrée et 1,696 $ par million de jetons de sortie sur le nœud de Pékin
• Entend l'appelant — Gemini 3.8 Live oui, entrée audio et vidéo native contre Qwen-Audio-3.1-TTS non, texte en entrée et audio en sortie
• Voix — Gemini 3.8 Live une voix, ni clonable, ni personnalisable contre Qwen-Audio-3.1-TTS plus de mille, avec clonage zero-shot à partir d'audio de référence bruité
• Langues — Gemini 3.8 Live 97 selon le fournisseur, changement en cours de conversation contre Qwen-Audio-3.1-TTS 16 selon le fournisseur plus 20 régions dialectales chinoises, avec transfert de timbre entre le mandarin, le cantonais, l'anglais et le japonais
• Contrôle de la diction — Gemini 3.8 Live invite et contexte de conversation contre Qwen-Audio-3.1-TTS instruction en langage naturel, remplaçant les 86 balises en ligne de la génération 3.0
• Score indépendant — Gemini 3.8 Live 82,6 sur l'Artificial Analysis Speech to Speech Index pour la variante Extended Thinking et 76,0 pour la variante standard contre Qwen-Audio-3.1-TTS aucun ; le chiffre Qwen le plus proche est 1 259 Elo pour le palier 3.0 Plus de la génération précédente sur le Provider Voice Arena, qui est une notation du prédécesseur et non de ce modèle

La baisse en pourcentage est annoncée par rapport à des tarifs qui varient selon la région et le palier, donc le 70 % mis en avant n’est pas une promesse concernant votre trafic, et Aliba​ba Cloud a également fait passer la transcription en temps réel sur le nœud de Singapour d’une facturation à la durée à une facturation au token — une base moins prévisible, car le silence et le contexte multi-tour gonflent tous deux la consommation de tokens. Comparez la nouvelle grille tarifaire à vos propres fichiers audio.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

Ce que la mise à niveau 3.1 ne règle pas

Voici la partie sur laquelle il est facile de se tromper dans les deux sens. Les améliorations de la version 3.1 ne font pas de Qwen-Audio-3.1-TTS un candidat pour le travail que fait Gemini 3.8 Live — le contrôle par instructions, le transfert de timbre et la tolérance aux entrées bruitées en font une meilleure bouche, et aucun de ces éléments ne lui donne une oreille. De même, la position de Gemini 3.8 Live dans les benchmarks ne vous dit rien sur la question de savoir si votre voix de marque survit à une phrase en cantonais.

Il y a aussi une lacune dans les preuves qu'une baisse de prix rend d'autant plus tentant d'ignorer. Qwen-Audio-3.1-TTS n'a pas de score indépendant. Le score Elo de 1 259 qui apparaît à côté du nom Qwen sur le Provider Voice Arena appartient à Qwen-Audio-3.0-TTS-Plus, le modèle remplacé, mesuré sur 1 447 échantillons. La ligne Arena propre au successeur n'existe pas encore. Si votre processus de validation exige un chiffre provenant d'un tiers — et pour une voix de marque, il le devrait probablement —, le modèle le plus récent est celui qui en est dépourvu, et l'offre la moins chère est celle que vous ne pouvez pas encore défendre. Le seul événement qui trancherait la question serait l'apparition de Qwen-Audio-3.1-TTS dans un classement d'écoute à l'aveugle.

Quand une clé aide et quand elle n'aide pas

Une conséquence de la 3.1 passe facilement inaperçue, car elle ressemble à un détail d’ingénierie de prompt plutôt qu’à un détail d’infrastructure. Remplacer 86 balises codées en dur par une instruction libre transforme vos consignes de livraison en artefacts textuels. Vous les générez désormais, les versionnez et revalidez chacune d’elles à l’aune de l’interprétation du nouveau modèle — et le mode de défaillance est la dérive, pas l’erreur, car deux formulations de « chaleureux mais pas sentimental » ne seront pas reçues de la même manière.

Il s'agit d'un problème d'inférence de texte greffé sur un pipeline vocal, et c'est là que nous sommes utiles. OrcaRouter ne route ni Qwen-Audio-3.1-TTS ni aucun modèle Qwen-Audio, et nous ne routons pas non plus les endpoints Gemini 3.8 Live — aucune des deux moitiés de cette pile n'est appelable via nous, et rien ici ne doit être lu comme une affirmation du contraire. Ce que nous portons, c'est la couche qui écrit et vérifie le texte de direction : qwen/qwen3.8-flash et google/gemini-3.8-flash parmi plus de 200 modèles depuis une clé unique au prix catalogue du fournisseur, sans marge, avec un DSL de routage qui compose plusieurs modèles en un seul appel et un basculement automatique lorsqu'un amont se dégrade. Quand vous vous apprêtez à revalider dix mille prompts de livraison contre un modèle qui vient de changer sa façon de les lire, générer les variantes et les noter pour leur cohérence est la partie qui devrait relever d'un seul contrat, et non de quatre.

Ce qu'il faut mesurer avant de choisir

Trois expériences en disent plus que n'importe quel comité de direction. Faites passer une voix de référence et un paragraphe de votre propre script dans Qwen-Audio-3.1-TTS et écoutez si le contrôle par instructions vous donne deux fois le même rendu — c'est là le risque de migration, et il est moins coûteux de le mesurer que de planifier autour. Faites passer un véritable enregistrement d'appel, avec votre propre bruit de fond, dans Gemini 3.8 Live et vérifiez si l'alternance des tours tient lorsque l'appelant interrompt au milieu d'un mot — c'est ce que l'indice parole-à-parole cherche à quantifier, et il ne résiste pas au contact d'une véritable ligne téléphonique de manière suffisamment fiable pour être pris pour argent comptant. Et faites le calcul sur votre propre volume en heures audio plutôt que dans les unités dans lesquelles les deux fournisseurs facturent, car, sur ce couplage particulier, l'écart de prix attendu entre le « TTS chinois bon marché » et le « fleuron de Google » n'a jamais été aussi important qu'il n'y paraît, et, après le 23 septembre, il est encore plus faible.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement