
GPT-Live-1 vs Qwen-Audio-3.0-TTS : une conversation et un narrateur ne sont pas le même poste budgétaire
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code

Mettez GPT-Live-1 et Qwen-Audio-3.0-TTS côte à côte sur le prix par heure d'audio, et l'écart paraît décisif : Qwen-Audio-3.0-TTS-Plus d'Alibaba rend la parole à 27,6 $ le million de caractères, soit environ 1,66 $ d'audio par heure, tandis que GPT-Live-1 d'OpenAI facture 3,00 $ pour une heure de ligne ouverte en continu. Le narrateur est moins cher, donc le narrateur gagne — sauf que c'est la mauvaise comparaison, et la raison pour laquelle elle est mauvaise est la chose la plus utile que quiconque puisse retirer de cette confrontation. Qwen-Audio-3.0-TTS est un modèle de synthèse vocale. GPT-Live-1 est un modèle conversationnel full-duplex. L'un lit ce que vous avez écrit. L'autre doit décider, plusieurs fois par seconde, si vous avez fini de parler.
L’un effectue le rendu, l’autre converse.
La synthèse vocale prend du texte et renvoie de l’audio. Il n’y a pas d’audio d’entrée, pas de tour de parole à prendre, aucune notion d’interruption et pas de transcription à renvoyer, car le modèle n’a jamais rien entendu. Son modèle de coût est une presse d’imprimerie : des pages en entrée, de l’audio en sortie, la qualité et le débit sont les deux seuls chiffres qui comptent, et vous pouvez mesurer les deux avant de livrer.
Un modèle conversationnel en duplex intégral traite l’audio entrant pendant qu’il produit l’audio sortant. Son rôle englobe les aspects d’une conversation qui n’ont rien à voir avec les mots — marquer une pause lorsque l’utilisateur s’arrête, poursuivre malgré un retour d’écoute comme « ouais » au lieu de le considérer comme une interruption, céder la parole au milieu d’une phrase et déclencher un appel d’outil sans perdre le fil. GPT-Live-1 fait tout cela et renvoie les transcriptions de reconnaissance vocale avec la session, ce qu’il ne peut faire que parce qu’il écoutait tout le temps.
Si votre produit lit des articles à voix haute, convertit de la documentation en audio ou narre une vidéo, GPT-Live-1 n’est pas l’outil qu’il faut, à un prix horaire quatre fois supérieur. Si votre produit prend un appel téléphonique, Qwen-Audio-3.0-TTS ne représente qu’un tiers d’un pipeline qui a encore besoin d’un modèle ASR et d’un modèle de langage pour devenir une conversation.
Là où Qwen-Audio-3.0-TTS est véritablement la meilleure réponse
L'argument en faveur du modèle d'Alibaba n'est pas du marketing. Lancé le 20 juillet 2026 par Tongyi Lab d'Alibaba et exposé sous la forme d'une API hébergée et fermée via Alibaba Cloud Model Studio, le niveau Plus a pris la première place de l'arène de synthèse vocale d'Artificial Analysis à son arrivée. Un classement est cependant une cible mouvante, et celui-ci a bougé : en septembre 2026, Qwen-Audio-3.0-TTS-Plus occupe la quatrième place du Provider Voice Arena avec un Elo de 1 232 sur 2 306 échantillons, derrière Cartesia Sonic 3.6 à 1 275, Inworld Realtime TTS-2 à 1 244 et Simba 3.2 de Speechify à 1 233 — trois modèles d'août et de juillet sortis après lui. Quatrième sur plus de vingt, avec la première place perdue mais l'avantage tarifaire intact, cela reste une position forte. Ce n'est simplement pas la position que décrivait la couverture médiatique du lancement.

Il est en tête dans 10 des 16 langues qu'il couvre, ajoute 20 régions dialectales chinoises, prend en charge le clonage vocal à partir de courts échantillons, y compris le clonage translinguistique, et embarque 86 balises intégrées d'émotion et d'élocution.
Les mises en garde sont suffisamment précises pour être prises en compte dans la planification.
• Débit — Plus génère environ 16 caractères par seconde, contre 30,2 pour Simba 3.2, 27 pour Gemini 3.1 Flash TTS et environ 120 pour Sonic 3.5. Pour le rendu par lots, c'est invisible ; pour un produit en direct, c'est le chiffre qui détermine votre tampon.
• Documentation tarifaire — le montant de 27,6 $ par million de caractères, largement cité, ne correspond pas à la page de tarification d’Alibaba dans toutes les captures, laquelle a parfois affiché des chiffres inférieurs pour les deux niveaux. Vérifiez le chiffre actuel au niveau du compte avant d’établir vos prévisions, et non celui du classement.
• Bibliothèque de voix — malgré 16 langues prises en charge, les voix prédéfinies publiques sont presque exclusivement en chinois et en anglais. Les quatorze autres langues existent via le flux de clonage plutôt que prêtes à l'emploi.
• Restriction de fonctionnalité — les 86 balises d'émotion en ligne ne fonctionnent qu'en mode de streaming unidirectionnel, de sorte que le contrôle expressif ne survit pas à toutes les voies d'intégration.
• Niveaux — Flash cible environ 300 ms de latence du premier paquet pour une utilisation en temps réel ; Plus est le niveau orienté qualité. Ce sont des produits différents qui portent le même nom, et choisir le mauvais est une erreur fréquente de débutant.
La version honnête du projet de loi sur la cascade
Voici ce que la comparaison horaire laisse de côté. Un produit conversationnel construit sur un modèle TTS est une cascade : un modèle ASR transforme la parole de l’appelant en texte, un modèle de langage décide quoi dire, et le modèle TTS le prononce. Trois fournisseurs, trois factures, trois budgets de latence qui s’additionnent, et un passage de relais à chaque frontière où la prosodie meurt. Le volet TTS peut coûter 1,66 $ par heure d’audio. Les deux autres volets sont là où se trouvent réellement l’argent et les erreurs — et le modèle en cascade ne peut pas entendre une pause au milieu d’une phrase qu’il est déjà en train de prononcer.
GPT-Live-1 réunit les trois volets en une seule session et un seul compteur, à 0,05 $ par minute de voix, le backend de raisonnement étant facturé séparément. Deux détails garantissent la sincérité de cette facture. L'initialisation de session facture d'entrée de jeu 15 secondes de voix, créditées sur la durée ultérieure plutôt qu'ajoutées à celle-ci. Et le backend est un second compteur : chaque appel de raisonnement délégué, chaque invocation d'outil et chaque recherche web est facturé aux tarifs normaux de ce modèle, si bien que diriger la délégation vers un raisonneur de pointe qui effectue une recherche à chaque tour produit un appel coûteux derrière une couche vocale bon marché.
Ce que les classements indépendants disent des deux est instructif précisément parce qu’ils mesurent des choses différentes et qu’aucun des deux ne flatte son sujet. Qwen-Audio-3.0-TTS-Plus est quatrième en qualité et proche du bas du classement en débit. GPT-Live-1 est septième sur onze au Speech to Speech Index d’Artificial Analysis, avec 69,8 % — derrière le GPT-Realtime-2.1 qu’il remplace, à 73,9 % — tout en étant facturé à l’extrémité inférieure de la fourchette de coût par heure d’audio d’entrée de l’indice, soit 4,42 $ contre 10,75 $ pour GPT-Realtime-2.1. Aucun des deux modèles ne décroche la première place de sa propre catégorie. Tous deux sont moins chers que ce qu’ils étaient conçus pour battre.

Ce second étage est le point où une couche de routage devient une décision de conception plutôt qu'une simple optimisation. OrcaRouter ne transporte ni GPT-Live-1 ni Qwen-Audio-3.0-TTS — la couche vocale, dans les deux cas, échappe à notre portée, et nous n'en routons rien. Le volet raisonnement, lui, n'est pas concerné. Environ 190 modèles issus de onze fournisseurs en amont se trouvent derrière une seule clé, au prix catalogue du fournisseur, sans marge, et une baisse de prix chez un fournisseur s'applique le jour même plutôt qu'au prochain renouvellement de contrat. Pour une cascade, cela couvre d'emblée l'étage intermédiaire : gardez deux options ASR et trois moteurs de raisonnement derrière un seul point de terminaison, comparez-les en A/B sur du trafic réel, et laissez le basculement automatique absorber une mauvaise journée d'un fournisseur en amont sans faire tomber un appel.
La question du consentement joue en sens inverse.
Le clonage vocal est la capacité la plus utile commercialement de Qwen-Audio-3.0-TTS et sa plus grande surface de conformité. Dix secondes d’audio de référence suffisent pour reproduire un locuteur, d’une langue à l’autre, ce qui est transformateur pour la localisation et un risque partout où l’identité compte. OpenAI a livré GPT-Live-1 sans clonage ni voix personnalisées du tout — 12 voix d’API au choix, et c’est toute la liste.
Cette asymétrie est facile à négliger dans une comparaison de fonctionnalités et difficile à négliger dans une revue des risques. Un produit qui ne s'exprime jamais que dans l'une des douze voix de fournisseurs a une réponse bien plus courte à « à qui est cette voix, et qui y a consenti » qu'un produit capable de reproduire n'importe quelle voix à partir d'un échantillon. Si vous avez besoin de clonage, la décision relative au pipeline est déjà prise pour vous, et la question devient de savoir ce qui le régit. Si vous n'en avez pas besoin, la limitation de GPT-Live-1 vaut la peine d'être lue comme un contrôle que vous n'avez pas eu à construire.
Lequel acheter
Achetez Qwen-Audio-3.0-TTS si le résultat est du contenu : narration, localisation, audio d’accessibilité, doublage, ou tout flux de travail où le texte existe avant l’audio et où la qualité par heure rendue est la métrique. Commencez avec Flash si vous avez besoin d’une lecture en temps réel, passez à Plus lorsque la voix elle-même est le livrable, et facturez le flux de clonage séparément des voix préréglées.
Achetez GPT-Live-1 si l'entrée est une personne. Lignes d'assistance, parcours de réservation, entretiens d'accueil, tout cas où la première syllabe de l'utilisateur arrive alors que le modèle est au milieu d'une phrase et où le système doit se comporter comme un auditeur plutôt que comme un locuteur. Il coûte plus cher par heure d'audio, et c'est le seul des deux qui peut être interrompu.
Les deux sont bien plus souvent complémentaires que rivaux : de nombreux produits veulent que Qwen-Audio-3.0-TTS lise un document et qu’un modèle duplex prenne en charge l’appel qui suit. Ce qu’ils ne devraient pas partager, c’est un modèle de coûts. La mesure par heure d’audio est la bonne métrique pour exactement l’un des deux.
