Un titre héroïque pour « Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — la voix qui écoute contre le roi des arènes », avec une carte à gauche « Cartesia Sonic 3.6 — Provider #1 · Elo 1 282 · 49 $ / 1M de caractères » et une carte à droite « Inworld Realtime TTS-2 — Contrôlé #1 · Elo 1 123 · 25 $ / 1M de caractères », une pastille statistique « Couronnes partagées — Arènes Provider vs Contrôlé », et le logo OrcaRouter en bas à droite.
Guides & Insights

Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 : La Voix qui écoute vs le Roi des Arènes

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Il existe deux théories concurrentes pour expliquer pourquoi une voix de synthèse semble humaine, et actuellement les deux meilleurs exemples commerciaux de chacune d’elles sont Inworld Realtime TTS-2 et Cartesia Sonic 3.6. La théorie de Cartesia est que l’humanité réside dans l’audio : rendez le timbre, la prosodie et le rythme impossibles à distinguer de ceux d’une personne, et les auditeurs vous classeront en première position — c’est ce que Sonic 3.6 a fait en août, en s’emparant de la première place de l’arène Provider Voice d’Artificial Analysis avec un Elo de 1 282. La théorie d’Inworld est que l’humanité réside dans l’écoute : TTS-2 conditionne sa prestation à l’audio réel de la conversation qui la précède, de sorte qu’il ne se contente pas de sonner comme une personne, il répond comme une personne. Cette semaine, les deux théories se sont affrontées au classement : le même recalcul qui a placé Inworld Realtime TTS-2 en deuxième position du classement des fournisseurs, avec un Elo de 1 252, l’a également placé en première position de l’arène Controlled Voice — le classement que Cartesia menait — avec 1 123 contre 1 119 pour Sonic 3.6. Un modèle conserve la couronne du classement des fournisseurs. L’autre vient de prendre celle du classement contrôlé.

Ce n'est pas un affrontement où un côté a manifestement tort. Les deux modèles ont été conçus pour des tâches qui se chevauchent sans être identiques, et la différence de prix — Sonic 3.6 à 49,0 $ par million de caractères contre 25 $ à la demande pour Inworld Realtime TTS-2 — est suffisamment réelle pour que la décision comporte une part de budget autant qu'une part de qualité.

Deux théories d'une voix qui sonne humaine

Cartesia a discrètement publié Sonic 3.6 en août 2026, une version mineure qui améliorait Sonic 3.5 sans en changer le prix ni le récit architectural. L'amélioration est apparue là où Cartesia en avait besoin : le modèle est passé à un Elo de 1 282 sur l'arène Provider Voice d'Artificial Analysis — où chaque modèle utilise ses propres voix natives — et il a conservé la première place de l'arène Controlled Voice tout au long du mois d'août. Sur le tableau contrôlé, chaque modèle est cloné sur les mêmes huit locuteurs de référence, si bien que cette couronne constitue un verdict sur le moteur de synthèse lui-même, indépendamment des talents vocaux. Après la réévaluation de la disponibilité générale d'Inworld cette semaine, Cartesia mène toujours le tableau des fournisseurs, mais Sonic 3.6 se situe désormais à la 2e place du tableau contrôlé avec un Elo de 1 119, quatre points derrière Inworld Realtime TTS-2 et ses 1 123.

Inworld Realtime TTS-2 vient d’une tradition différente. Sa lignée précédente, TTS 1.5, a passé le début de l’année 2026 près du sommet des mêmes arènes, et l’aperçu de recherche de TTS-2 affichait un Elo de 1,209 sur le tableau des fournisseurs en juin. Le modèle GA a grimpé depuis : sur les tableaux actuels, il se situe à 1,252 sur Provider Voice (#2, derrière Sonic 3.6 et ses 1,282) et à 1,123 sur Controlled Voice (#1). Le véritable différenciateur du produit phare, cependant, n’est pas son Elo ; c’est que le modèle prend les tours précédents d’une conversation comme entrée audio et s’en sert pour façonner sa façon de prononcer la réplique suivante. Cartesia calibre l’émotion à partir de la transcription. Inworld, lui, écoute comment la dernière chose a été dite.

Le tableau d'affichage, honnêtement étiqueté

Les scores Elo proviennent des arènes vocales d'Artificial Analysis, relevés sur les tableaux en direct en septembre 2026. Les valeurs de latence sont celles rapportées par les fournisseurs, sauf mention contraire, et aucun audit indépendant de la latence n'a été publié pour l'un ou l'autre modèle.

• Qualité indépendante — Cartesia Sonic 3.6 : Elo 1 282 (#1, Voix du fournisseur) et 1 119 (#2, Voix contrôlée) vs Inworld Realtime TTS-2 : Elo 1 252 (#2, Voix du fournisseur) et 1 123 (#1, Voix contrôlée)

• Prix par million de caractères — 49,0 $ (suivi par Artificial Analysis) contre 25 $ à la demande, 20,8 $ en prix mixte selon Artificial Analysis, jusqu’à 12,50 $ en volume (fournisseur)

• Délai avant premier audio — sous 90 ms (annoncé par le fournisseur) vs médiane sous 200 ms, sous 100 ms au p99 lors des tests de lancement d'Inworld (annoncé par le fournisseur) ; la réponse d'Inworld à faible latence face à Sonic est le niveau séparé TTS-2 Flash, avec un délai avant premier octet d'environ 25 ms.

• Langues — 42 langues localisées contre plus de 100 langues pour l'orientation de la livraison, avec la revendication d'identité vocale unique d'Inworld s'étendant à plus de 200 locales (selon le fournisseur)

• Clonage vocal instantané — ~10 secondes d'audio contre 5 à 15 secondes, plus une version bêta de clonage professionnel qui nécessite ~10 minutes d'audio pour des clones de meilleure fidélité.

• Contrôle du débit vocal — balises transcriptions inline comme [rire], avec modulation du volume et de la vitesse, face à une conduite en langage courant telle que « [calme, rassurant] » ou [chuchotement], instruction au niveau de la requête, et trois modes de stabilité, de « Stable » à « Expressif ».

A generated two-column scoreboard titled 'Inworld Realtime TTS-2 vs Cartesia Sonic 3.6 — the scoreboard'. Left column Inworld Realtime TTS-2: AA Provider Elo 1,252 (#2), AA Controlled Elo 1,123 (#1), Price $25/1M on demand ($20.8 AA), First audio sub-200 ms, Languages 100+ with 200+ locales claimed, Listening prior-turn audio input. Right column Cartesia Sonic 3.6: AA Provider Elo 1,282 (#1), AA Controlled Elo 1,119 (#2), Price $49.0/1M chars, First audio sub-90 ms, Languages 42 localized, Listening transcript only. Footer 'Elo per Artificial Analysis, September 2026; latency vendor-reported.' OrcaRouter logo bottom-right.

Pourquoi « écoute la conversation » est un axe différent.

Le tableau de scores ci-dessus mesure la qualité d'une voix isolée. La dimension où les deux modèles divergent véritablement n'apparaît sur aucun classement, car elle n'existe qu'à travers plusieurs tours de conversation.

Inworld Realtime TTS-2 est conçu pour le cas où une personne vient de lui dire quelque chose. Le modèle absorbe l’audio des tours de parole précédents — et non pas seulement leur transcription —, évalue le ton, le rythme et l’état émotionnel, puis sélectionne un état de réponse avant de parler. Si un appelant est frustré, le phrasé change ; s’il est détendu, il revient à la normale. C’est pourquoi Inworld commercialise ce modèle pour les agents, les compagnons et les jeux plutôt que pour la narration : la fonctionnalité n’a aucun sens dans un appel texte-audio isolé, mais tout son sens dans une conversation.

Cartesia Sonic 3.6 fonctionne différemment. C'est un moteur de streaming rapide et de haute qualité, et l'affirmation de Cartesia est un calibrage émotionnel automatique à partir de la transcription — il lit les mots et module en conséquence. Ce qu'il ne fait pas, c'est écouter l'audio des tours précédents. Au sein d'un même énoncé, les deux peuvent sembler comparables ; à travers une conversation, Inworld modélise quelque chose que Sonic ne tente pas. Si votre produit est une voix off en un seul tour, cette modélisation est superflue. S'il s'agit d'un agent en direct, c'est le produit.

A screenshot of Inworld's Realtime TTS-2 product page (captured September 3, 2026) headed 'General Availability — August 31, 2026 — Realtime TTS-2, a new frontier voice model that feels as human as it sounds', with copy explaining it hears the full audio of the exchange, picks up the user's tone, pacing and emotional state, and holds one voice identity across 100+ languages.

Vitesse, prix et la réserve concernant Flash

En matière de latence pure, Cartesia conserve la première place : un temps jusqu'au premier audio inférieur à 90 ms est annoncé par le fournisseur, mais c'est bien le chiffre que l'entreprise propose depuis la génération Sonic 3, et personne n'a publié d'audit contradictoire. Le produit phare d'Inworld répond dans une catégorie conversationnelle similaire, sous les 200 ms, ce qui convient aux agents en direct. Le véritable atout d'Inworld en matière de latence est le niveau Flash, lancé en même temps que le modèle GA — un modèle distinct avec un temps jusqu'au premier octet d'environ 25 ms, destiné aux charges de travail à fort volume où le coût et la latence de type Sonic comptent plus que l'expressivité. L'inconvénient est que Flash est un membre allégé de la famille : clonage instantané et non-verbaux intégrés, mais pas de clonage professionnel ni de pilotage complet en langage naturel.

Côté prix, c'est l'inverse. Sonic 3.6 coûte 49,0 $ par million de caractères — environ le double du tarif à la demande de 25 $ d'Inworld, et près de quatre fois le prix du palier supérieur de 12,50 $. L'écart de qualité entre les deux, sur les classements où ils figurent tous les deux, ne justifie pas ce multiple pour un acheteur à gros volume. Pour un agent vocal en temps réel générant des milliers de caractères par conversation, l'écart par caractère fait la différence entre une économie unitaire saine et une économie fragile.

Lequel choisir

Choisissez Cartesia Sonic 3.6 si vous visez la couronne du classement des fournisseurs — la voix la mieux notée utilisant ses propres voix natives, avec un Elo de 1 282, pour de courts énoncés autonomes comme les réponses d’assistant, les répliques de jeu et les annonces de statut. À 49 $ par million de caractères, vous payez pour la couronne, et il reste le modèle à battre sur ce classement.

Choisissez Inworld Realtime TTS-2si le produit est une conversation à plusieurs tours dont la diffusion doit répondre à la personne à l'autre bout — appels d'assistance, un compagnon, un entretien, une séance de tutorat. Il trône désormais en tête du classement contrôlé, où chaque modèle parle avec les huit mêmes voix de référence, et ce pour environ la moitié du prix, tout en écoutant l'audio de la conversation.

Intégrez la bascule dans le routage si vous ne pouvez pas savoir à l’avance quel type de voix un appel nécessite. Aucun des deux modèles n’est intégré à OrcaRouter à l’heure où nous écrivons — Sonic est accessible via l’API de Cartesia et plusieurs plateformes tierces, Inworld via sa propre API — mais une couche de routage est exactement la structure qui permet à une conversation de démarrer sur une voix et de basculer sur l’autre, avec le prix catalogue de chaque fournisseur répercuté sans marge (0 %). Le jour où l’un de ces classements s’inverse à nouveau — et c’est ce qui s’est passé cette semaine — le choix devient un changement de configuration plutôt qu’une réécriture.

La version courte

C'est une véritable bifurcation, et la réponse honnête est que la bifurcation porte sur le tour de parole, pas sur la qualité audio. Si vous avez besoin de la voix autonome la mieux notée utilisant ses propres voix natives, Cartesia Sonic 3.6 détient la couronne des fournisseurs avec un Elo de 1 282 et facture 49 $ par million de caractères. Si vous avez besoin d'une voix qui réagit à la façon dont on lui parle, Inworld Realtime TTS-2 est passé en disponibilité générale cette semaine à 25 $ à la demande, mène le classement contrôlé où les deux sont comparés avec des voix égales, et possède une fonctionnalité de conscience conversationnelle qu'aucune arène ne mesure pleinement. Les classements sont désormais partagés entre les deux modèles — ce qui est le reflet le plus honnête possible d'un marché où le « meilleur » dépend du test.

A screenshot of the Artificial Analysis Controlled Voice leaderboard (captured September 3, 2026) showing Inworld Realtime TTS-2 at rank 1 with Elo 1,123, Cartesia Sonic 3.6 at rank 2 with Elo 1,119, Cartesia Sonic 3.5 at rank 3, and Inworld Realtime TTS-2 Flash at rank 4.