
GPT-Live-1 vs Cartesia Sonic 3.6 : le classement TTS numéro un ne mesure pas l'interruption
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Cartesia Sonic 3.6 occupe actuellement la première place dans les deux arènes de synthèse vocale d'Artificial Analysis — 1 275 Elo sur le tableau Provider Voice et également premier sur le tableau Controlled Voice, devant tous les moteurs commerciaux dotés d'une plateforme plus importante. GPT-Live-1 n'est classé dans aucune des deux, car ce n'est pas un modèle de synthèse vocale. Il occupe la sixième place ex æquo sur quatorze dans un autre tableau d'Artificial Analysis, le Speech to Speech Index, avec 70,3 %. Lus ensemble, ces deux faits décrivent la véritable différence entre ces produits : Sonic 3.6 est très probablement la meilleure voix, et GPT-Live-1 est le seul des deux à pouvoir entendre l'appelant commencer à parler et s'arrêter.
Tous deux sont actifs et tous deux sont disponibles commercialement — Sonic 3.6 sur l’API propre de Cartesia depuis que son snapshot stable est arrivé le 27 août 2026, GPT-Live-1 sur l’API développeur d’OpenAI depuis le 10 septembre 2026, à 0,05 $ la minute vocale. Le choix entre les deux n’est pas une décision de qualité. C’est une décision portant sur la moitié d’un agent vocal que vous achetez.
Deux arènes, deux questions, et pourquoi la division est réelle
Artificial Analysis gère ses classements vocaux d'une manière qu'il vaut la peine de comprendre avant qu'on ne vous cite l'un ou l'autre des Elo. L'arène Provider Voice classe les moteurs en utilisant les voix natives de chaque fournisseur — elle mesure la voix que vous obtenez réellement telle quelle, soit le chiffre qui importe à un acheteur. L'arène Controlled Voice clone chaque modèle sur les mêmes huit voix de référence afin que les auditeurs comparent le moteur de synthèse plutôt que le talent vocal. Sonic 3.6 arrive en tête des deux, ce qui est plus rare qu'il n'y paraît : les deux classements ont eu des champions différents pendant la majeure partie de 2026.
Aucun des deux classements ne contient le moindre exemple d’un modèle en train d’être interrompu. Ils mesurent la manière dont la parole sonne, isolément, pour un auditeur. Le Speech to Speech Index est conçu différemment — il agrège le raisonnement vocal, la performance agentique, la préférence d’arène et la réussite des tâches en un seul chiffre, et il n’admet que les modèles nativement speech-to-speech. Cartesia n’y figure pas. Non pas parce que Sonic 3.6 est mauvais, mais parce qu’un moteur de synthèse vocale n’a rien à soumettre.
Donc, le 1 275 et les 70,3 % ne sont pas des chiffres concurrents, et toute comparaison qui les met sur une même ligne vous ment discrètement. Ce qu'ils établissent ensemble, c'est que la qualité a cessé d'être l'axe sur lequel cette décision tourne.

Dimension par dimension
• Type — GPT-Live-1 : parole à parole en duplex intégral, un seul modèle pour toute la boucle vs Cartesia Sonic 3.6 : synthèse vocale en streaming, associée à la reconnaissance vocale Ink-2 pour les agents
• Qualité indépendante — GPT-Live-1 : 70,3 % sur le Speech to Speech Index, sixième ex æquo sur quatorze vs Cartesia Sonic 3.6 : 1 275 Elo sur le classement Provider Voice, d’après 1 755 échantillons, et premier sur le classement Controlled Voice également
• Gestion des interruptions — GPT-Live-1 : une propriété du modèle, qui décide plusieurs fois par seconde s'il faut céder la parole ou non, par opposition à Cartesia Sonic 3.6 : un patron d'intégration, où le client annule le contexte de synthèse et s'appuie sur des horodatages au niveau du mot pour couper au bon moment
• Prix — GPT-Live-1 : $0.05 par minute vocale, facturé à la seconde, le backend de raisonnement étant facturé séparément, contre Cartesia Sonic 3.6 : environ $49 par million de caractères avec les forfaits de crédits, plus $0.06 par minute de durée d'appel de l'agent et $0.014 par minute pour un numéro de téléphone Cartesia
• Latence — GPT-Live-1 : aucune donnée publiée au niveau du modèle ; latence de prise de parole indiquée à 0,798 seconde dans les propres tests d’OpenAI, contre Cartesia Sonic 3.6 : moins de 90 millisecondes de délai jusqu’au premier audio, selon le fournisseur et non mesuré indépendamment de bout en bout
• Débit — GPT-Live-1 : sessions simultanées, plafonnées à 25 sur le niveau 1 et à 500 sur le niveau 5, sans offre gratuite vs Cartesia Sonic 3.6 : environ 132 caractères par seconde, soit environ le double du débit d'ElevenLabs v3 dans la même comparaison, avec une offre gratuite de 20 000 crédits mensuels
• Langues — GPT-Live-1 : fluidité inégale en dehors des principales langues couvertes au lancement, contre Cartesia Sonic 3.6 : 44 langues réparties sur 61 locales, avec l’ajout de l’odia et de l’ourdou dans cette version
• Contrôle vocal — GPT-Live-1 : douze préréglages, ton et rythme via le prompting, pas de clonage vs Cartesia Sonic 3.6 : plus de 500 voix préréglées, clonage instantané, clonage professionnel sur les niveaux supérieurs, horodatages des mots et des phonèmes, et pas de SSML — le modèle adapte le rythme à partir du texte lui-même

Barge-in est une caractéristique de l’architecture, pas une case à cocher.
L’erreur la plus courante que commettent les acheteurs à propos de cette comparaison est de traiter la prise en charge de l’interruption comme un booléen. La documentation de Cartesia est franche sur le fonctionnement de sa version : lorsque l’appelant parle par-dessus l’agent, le client envoie une annulation pour le contexte de synthèse en cours, et les horodatages au niveau du mot renvoyés sur la connexion WebSocket sont ce qui permet d’arrêter la lecture sur la bonne syllabe. C’est une conception solide, et c’est ainsi que la plupart des agents vocaux en production gèrent l’interruption aujourd’hui.
Il s'agit encore d'une conception dans laquelle la décision d'arrêter de parler était prise par votre application, à l'aide d'un signal d'activité vocale, à la latence que permet l'aller-retour. GPT-Live-1 déplace cette décision à l'intérieur du modèle. Il décide en permanence s'il doit continuer à écouter, faire une pause, prendre la parole ou la céder, c'est pourquoi les propres chiffres d'OpenAI indiquent 80,1 % d'interactivité contre 45,4 % pour GPT-Realtime-2.1 sur Full Duplex Bench v1.5, avec une latence de prise de parole de 0,798 seconde contre 1,41. Ces chiffres sont ceux d'OpenAI, publiés à l'occasion de la sortie et non reproduits par quiconque en dehors de l'entreprise — mais la différence architecturale qui les sous-tend n'est pas contestée, et c'est la seule chose qu'une cascade ne peut pas approcher, même par réglage.
Là où la cascade l'emporte, c'est sur tout ce qui se trouve en aval de la phrase. Le temps jusqu'au premier audio inférieur à 90 millisecondes de Cartesia est un chiffre de fournisseur, et il mesure le modèle, pas la conversation : le nombre qu'un appelant perçoit inclut aussi la reconnaissance vocale, la détection des tours de parole, le temps de génération du modèle de langage, le transit réseau et la mise en mémoire tampon audio. C'est exactement pourquoi une cascade vaut la peine d'être construite lorsque vous devez contrôler chaque étape — un petit modèle rapide pour les tours simples, un modèle de pointe pour les plus difficiles, et un synthétiseur qui ne vous fait jamais attendre.
Cette étape intermédiaire est la seule partie de l'une ou l'autre pile qui soit véritablement portable, et c'est elle qui détermine à la fois la qualité et le coût de l'appel. Environ 190 modèles issus de onze fournisseurs en amont se trouvent derrière une seule clé OrcaRouter, au prix catalogue du fournisseur et sans aucune marge, et le DSL de routage permet à un seul point de terminaison d'envoyer les tours simples vers un modèle bon marché et de faire monter en gamme les plus complexes vers un modèle de pointe — le schéma que souhaite réellement un agent vocal, appliqué à l'étape qui varie le plus. Ni Sonic 3.6 ni GPT-Live-1 ne sont accessibles via une couche de routage ; les couches vocales appartiennent à leurs fournisseurs.

Gérer l'argent
Les deux modèles de tarification ne concordent pas, il vaut donc la peine de réaliser correctement la conversion. La parole se déroule à environ 150 mots par minute, et l’anglais compte en moyenne environ cinq caractères et demi par mot, de sorte qu’une minute de sortie vocale représente environ 800 à 900 caractères. À 49 $ par million de caractères, la synthèse de Cartesia coûte environ 4 cents par minute d’audio.
Puis le reste de la cascade arrive. Cartesia facture 0,06 $ par minute de durée d’appel d’un agent vocal et 0,014 $ par minute si vous utilisez son numéro de téléphone, en plus des caractères. Ajoutez la reconnaissance vocale et un modèle de langage pour le texte, et vous dépassez les dix cents la minute avant même que quiconque ait dit quoi que ce soit de difficile. Les 0,05 $ par minute vocale de GPT-Live-1 couvrent l’écoute, la gestion des tours de parole et la prise de parole, le raisonnement délégué étant facturé séparément au tarif normal du modèle backend — ce qui, pour un appel de réservation avec une ou deux recherches associées, représente un vrai montant, pas une erreur d’arrondi.
Le point de bascule se situe au niveau du volume et de la difficulté. Les appels courts, répétitifs et à fort volume — confirmations, notifications, recherches simples — favorisent la cascade, car un modèle bon marché qui répond à une question scénarisée est l'option la moins coûteuse de cette comparaison. Les appels où l'appelant sort du script, parle par-dessus l'agent ou change d'avis en pleine phrase favorisent le modèle de bout en bout, car le mode de défaillance de la cascade dans ce cas n'est pas une mauvaise réponse, mais une réponse maladroite.
Lequel choisir
Choisissez Cartesia Sonic 3.6 si vous voulez la voix la mieux notée disponible et que vous êtes prêt à prendre en charge vous-même la logique de conversation. C'est le bon choix pour la narration, pour les agents scriptés à grand volume, pour les équipes disposant déjà d'un pipeline de reconnaissance vocale, et pour quiconque a besoin des horodatages au niveau des mots qui rendent possible une gestion précise des interruptions. Vous bénéficiez d'un niveau gratuit, de plus de 500 voix, du clonage, de 44 langues et du sommet des deux classements de qualité, et vous gardez le contrôle de chaque étape.
Choisissez GPT-Live-1 si l’interruption est le produit. Pour tous les cas où se faire couper la parole est la norme plutôt qu’un cas limite, et où une passation de tour en 0,8 seconde l’emporte sur un démarrage en 90 millisecondes sur une phrase que personne n’avait fini de poser. Vous acceptez un modèle fermé, hébergé, facturé à la minute, avec douze voix et sans clonage, et vous acceptez que son score de qualité indépendant se situe en milieu de tableau.
La tentation est de lire 1 275 face à 70,3 % et de conclure que c’est réglé. Ça ne l’est pas, et l’écart entre ces deux chiffres constitue tout le débat : l’un mesure la façon dont une voix sonne, l’autre mesure si elle vaut la peine qu’on lui parle.
