Carte de titre principale pour « GPT-Live-1 vs Inworld Realtime TTS-2 », sous-titrée « La synthèse devient bon marché ; l’écoute reste coûteuse », comportant trois cartes indiquant « Inworld Realtime TTS-2 : 25 $ pour 1 million de caractères, dégressif jusqu’à 12,50 $ », « Inworld Realtime TTS-2 Flash : 15 $ pour 1 million de caractères, dégressif jusqu’à 7 $ », « GPT-Live-1 : 0,05 $ par minute de voix, plus le raisonnement qui l’explique », au-dessus d’une bande de pied de page indiquant « Tarification Inworld publiée par le fournisseur, septembre 2026 ; tarification GPT-Live-1 selon la documentation OpenAI. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

GPT-Live-1 vs Inworld Realtime TTS-2 : une guerre des prix sur les voix, une prime à l’écoute

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Inworld Realtime TTS-2 a atteint sa disponibilité générale avec ce qui manquait au marché de la voix : une grille tarifaire publiée. Le modèle phare coûte 25 $ par million de caractères à la demande, son homologue plus rapide Inworld Realtime TTS-2 Flash en coûte 15 $, et tous deux descendent, par paliers de volume, jusqu'à 12,50 $ et 7 $. Avec un score Elo de 1 244 et une deuxième place sur l'arène vocale d'Artificial Analysis, cela place le modèle phare à environ la moitié du prix du leader actuel de l'arène et en fait l'un des moyens les moins chers d'acheter une voix du top cinq. GPT-Live-1 est l'autre modèle de cette comparaison et la proposition opposée — 0,05 $ par minute de voix, aucun caractère impliqué, et aucun moyen de l'acheter sans acheter aussi l'écoute, la gestion des tours de parole et la gestion des interruptions qui y sont rattachées.

Ce qui est intéressant quand on les compare, c'est que l'écart de prix paraît énorme, puis se dissipe en grande partie. Synthesis est en guerre des prix. Conversation, non.

Ce qu'Inworld a réellement livré

La gamme TTS-2 a commencé comme un aperçu de recherche en mai 2026 avec une affirmation précise : qu'il s'agit d'un modèle qui ne génère pas de parole de manière isolée. Il prend les tours précédents d'une conversation comme entrée audio, raisonne sur le ton et le rythme, et ajuste sa manière de répondre. Ce positionnement — la conscience conversationnelle plutôt qu'un audio plus propre — est ce qui l'a distingué des moteurs de narration qui ont dominé la synthèse vocale jusqu'en 2025.

La disponibilité générale a transformé la préversion en une famille et y a joint une grille tarifaire. Flash est la solution axée sur le débit, Inworld annonçant environ 20 millisecondes de temps jusqu'au premier octet côté serveur au 90e percentile, contre 100 millisecondes pour le modèle phare, et une médiane inférieure à 200 millisecondes jusqu'au premier audio. Ce sont des chiffres du fournisseur, issus de la documentation propre d'Inworld ; la seule mesure tierce en circulation, de Coval, situe Flash à environ 25 millisecondes et le modèle phare dans les 100 et quelques millisecondes. Aucune des deux n'a fait l'objet d'un audit indépendant de bout en bout.

La fonctionnalité la plus digne d’intérêt n’a rien à voir avec la latence. Inworld a ajouté un mode verbatim pour que les numéros de commande, codes de confirmation, adresses et numéros de série soient relus caractère par caractère au lieu d’être normalisés en quelque chose qui sonne naturel mais qui est faux. Pour un agent vocal qui vient de prendre une réservation, ce simple marqueur fait la différence entre un produit fonctionnel et une démo qui finit par être escaladée vers un humain.

A screenshot of the OpenAI developer documentation page for GPT-Live 1, headed '< Models' with a 'Default' badge and the summary 'Our premier model for natural, expressive voice conversations with smooth interruption handling'. A price panel reads '$0.05 Per minute' against audio and text for both input and output, with performance and speed marked 'Not specified', and a knowledge cutoff of Jul 31, 2025. The body text reads 'GPT-Live 1 is a full-duplex voice model for real-time conversations. It can listen and speak at the same time, and delegate reasoning and tool use to a backend agent.' A pricing section states 'Voice sessions cost $0.05 per minute, billed per second. Backend model and tool usage is billed separately.'

Dimension par dimension

• Type — GPT-Live-1 : la conversion parole-à-parole full-duplex dans un seul modèle vs Inworld Realtime TTS-2 : un modèle de synthèse vocale, le duplex étant disponible séparément via l'API Realtime d'Inworld

• Prix unitaire — GPT-Live-1 : 0,05 $ par minute vocale, facturé à la seconde, backend de raisonnement mesuré séparément, vs Inworld Realtime TTS-2 : 25 $ par million de caractères à la demande, 20 $ sur le forfait Creator et 12,50 $ au niveau le plus élevé, avec Flash à 15 $, 10 $ et 7 $

• Qualité indépendante — GPT-Live-1 : 70,3 % sur le Speech to Speech Index, sixième ex æquo sur quatorze contre Inworld Realtime TTS-2 : Elo 1 244 sur 1 091 échantillons et deuxième sur l’arène Artificial Analysis Provider Voice, avec Flash à Elo 1 211 sur 1 626 échantillons et sixième

• Interruption — GPT-Live-1 : native, décidée à l'intérieur du modèle plusieurs fois par seconde, contre Inworld Realtime TTS-2 : pas une propriété du modèle TTS ; l'API Realtime d'Inworld prend en charge le barge-in avec une latence d'interruption d'environ 100 millisecondes, sur une seule socket qui parle le protocole Open​AI Realtime

• Latence — GPT-Live-1 : 0,798 seconde de latence d’alternance de parole dans les propres tests d’Open​AI, aucun délai avant le premier audio publié, contre Inworld Realtime TTS-2 : 100 millisecondes côté serveur au 90e percentile, Flash à 20, avec une médiane inférieure à une seconde jusqu’au premier segment audio sur l’ensemble du pipeline de la Realtime API

• Langues — GPT-Live-1 : les langues majeures sont bien servies, de façon inégale au-delà, vs Inworld Realtime TTS-2 : plus de 200 locales, avec 15 en qualité Tier 1 et 79 autres en Tier 2, et une identité vocale unique préservée sur l’ensemble de celles-ci

• Voix et clonage — GPT-Live-1 : douze préréglages, pas de clonage vs Inworld Realtime TTS-2 : 282 voix intégrées, clonage instantané zero-shot à partir de 5 à 15 secondes d’audio autorisé, clonage professionnel et contrôle complet de l’interprétation uniquement sur le modèle phare

• Déploiement — GPT-Live-1 : hébergé uniquement, un seul point de terminaison, pas d’offre gratuite, concurrence plafonnée à 25 à 500 sessions, contre Inworld Realtime TTS-2 : API hébergée plus un conteneur sur site à accès contrôlé nécessitant un H100, et une offre gratuite à la demande incluant jusqu’à environ 70 minutes de synthèse

A generated two-column comparison scoreboard titled 'GPT-Live-1 vs Inworld Realtime TTS-2 — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Kind: full-duplex speech-to-speech', 'Price: $0.05 per voice minute plus backend', 'Interactivity: 80.1%, vendor-reported', 'Turn-taking latency: 0.798 s, vendor testing', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Languages: major languages only'. The right column, labelled Inworld Realtime TTS-2, reads 'Kind: text-to-speech; duplex via the separate Realtime API', 'Price: $25 per 1M characters, from $12.50 on volume', 'Time to first byte: 100 ms p90, 20 ms for Flash (vendor)', 'Barge-in: ~100 ms, cascade-level', 'Independent score: Elo 1,244, #2 on the AA Provider Voice arena', 'Languages: 200+ locales, 15 at Tier 1 quality'. The footer reads 'Inworld latency and pricing vendor-published; GPT-Live-1 interactivity OpenAI-reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

La question du duplex, résolue avec précision

Il serait facile de formuler cette comparaison ainsi : « l’un écoute, l’autre ne fait que parler », et ce serait faux d’une manière qui compte. Les modèles de synthèse vocale d’Inworld prennent du texte en entrée et produisent de l’audio en sortie. Mais Inworld commercialise aussi une Realtime API qui fonctionne sur une seule connexion WebSocket, WebRTC ou SIP et est full-duplex au sens où un développeur l’entend : elle intègre une détection sémantique d’activité vocale avec un réglage d’empressement ajustable, prend en charge le contrôle manuel des tours de parole et interrompt en cas de barge-in en environ 100 millisecondes. Elle est compatible au niveau du protocole avec l’interface Realtime d’OpenAI, ce qui fait de la migration un exercice de configuration plutôt qu’une réécriture.

Ce que l'API Realtime d'Inworld n'est pas, c'est un modèle natif de parole à parole. C'est une cascade — un modèle de reconnaissance vocale interchangeable, un modèle de langage de votre choix et un synthétiseur — orchestrée au sein d'une seule connexion. C'est un choix architectural légitime, et c'est celui que font la plupart des agents vocaux en production. C'est simplement un choix différent de celui de GPT-Live-1, où un seul modèle décide quand céder le tour de parole.

La différence pratique apparaît lorsque l’appelant interrompt au milieu d’une proposition. Dans une cascade, l’interruption est détectée, la génération est annulée, et un nouveau tour commence — une séquence qui fonctionne bien et vous coûte un aller-retour. Dans le modèle de bout en bout, la décision était déjà prise en continu. Le premier est un système qui répond rapidement. Le second est un système qui n’a jamais cessé d’écouter.

A screenshot of Inworld AI's official pricing page, showing per-million-character rates for its speech models. The On-Demand column lists TTS-2 at $25 per 1M characters, TTS-2 Flash at $15, STT-1 at $0.15 per hour and LLMs at cost, alongside the inclusions 'Up to 70 min TTS included', '100 custom voices', 'Voice cloning & voice design', 'Realtime API access', '220+ LLM models via Router' and 'Commercial license'. The Creator column at $25 per month shows TTS-2 reduced to $20 and Flash to $10, with 500 custom voices and up to 33% off TTS and STT rates.

Je fais les calculs, parce que les unités cachent la réponse.

Le débit de parole est d'environ 150 mots par minute, et l'anglais fait en moyenne cinq caractères et demi par mot, donc une minute de sortie vocale équivaut à environ 800 à 900 caractères. À 25 $ le million, Inworld Realtime TTS-2 produit une minute de parole pour environ deux cents. À 15 $ pour Flash, c'est moins d'un cent et demi.

Face aux 0,05 $ par minute vocale de GPT-Live-1, cela ressemble à une déroute — jusqu'à ce que vous chiffriez le reste de ce que fait GPT-Live-1. L'API Realtime d'Inworld a toujours besoin de reconnaissance vocale et d'un modèle de langage, tous deux facturés séparément, et tous deux portant leur propre latence. Intégrez-les et le coût par minute de la cascade dépasse les cinq cents pour tout appel qui implique une vraie question. Le surcoût du modèle de bout en bout ne paie pas la voix. Il paie la gestion des tours de parole, et il correspond à peu près au coût de l'étape de reconnaissance vocale que vous n'achetez plus.

Là où la cascade l’emporte de manière décisive, c’est sur le volume sans conversation. Appels de notification, confirmations de livraison, rappels de rendez-vous, SVI scripté — tout ce dont le texte est connu avant le début de l’appel et que personne ne va interrompre. Là, la tarification au caractère à 7 à 15 $ le million est tout simplement moins chère que le duplex à la minute, et payer pour une alternance de parole que vous n’utilisez jamais est du gaspillage.

Il existe également une voie intermédiaire que le cadrage à deux modèles masque. Si vous assemblez de toute façon une cascade, la couche vocale n'a pas besoin de provenir d'un fournisseur vocal dédié : les modèles TTS d'Open​AI eux-mêmes et les modèles d'aperçu Gem​ini TTS de Goog​le sont des points de terminaison API ordinaires, et ils sont routés. Environ 190 modèles issus de onze fournisseurs en amont se trouvent derrière une seule clé OrcaRouter, au prix catalogue du fournisseur et sans marge — un modèle de synthèse peut donc figurer dans le même catalogue, sur la même clé et la même facture, que le modèle de raisonnement qu'il alimente, avec un basculement automatique si un point de terminaison se dégrade en cours de déploiement. C'est l'étape la moins glamour d'une pile vocale et la plus facile à consolider. Ni Realtime TTS-2 d'Inworld ni le point de terminaison Live Sessions de GPT-Live-1 n'est disponible de cette manière ; ces deux-là appartiennent à leurs fournisseurs.

Lequel choisir

Choisissez Inworld Realtime TTS-2 si le volume est l'objectif et que la conversation est scriptée. Agents à haut débit, notifications, produits multilingues où 200 locales et une seule identité vocale préservée comptent, ou tout déploiement qui a besoin du conteneur sur site. Vous obtenez une voix du top deux des arènes à environ la moitié du prix du leader, un niveau gratuit pour prototyper, un clonage que GPT-Live-1 n'offre pas du tout, et une Realtime API qui gère les interruptions avec compétence dans le schéma de cascade que vous utilisez probablement déjà.

Choisissez GPT-Live-1 si l'interruption est le produit. Des appels qui sortent du script, des interlocuteurs qui parlent par-dessus l'agent, des flux de travail où l'alternance des tours de parole fait la différence entre une conversation et un menu. Vous payez un tarif à la minute qui ne baisse pas quand la parole devient bon marché, vous renoncez au clonage et à 200 langues, et vous récupérez les coutures.

La guerre des prix dans la synthèse est bien réelle, et c’est une bonne nouvelle pour quiconque construit un agent vocal : une voix du top cinq coûte désormais un cinquième de ce qu’elle coûtait il y a dix-huit mois. Cela ne permet simplement pas de trancher cette comparaison, car ce que GPT-Live-1 facture n’est pas ce sur quoi Inworld applique une remise.