Carte de titre principale pour « GPT-Live-1 vs ElevenLabs », avec le sous-titre « Un modèle unique de bout en bout face à une pile en cascade, mesuré là où ils se rencontrent réellement », comportant trois cartes indiquant « GPT-Live-1 : 0,05 $ par minute vocale, duplex intégral, sans clonage », « ElevenLabs Agents : Elo 937 sur la Speech Agent Arena, 90,5 % de réussite des tâches », « ElevenLabs Eleven v3 : plus de 70 langues, plus de 10 000 voix de bibliothèque », au-dessus d'un bandeau de pied de page indiquant « Chiffres Arena selon Artificial Analysis ; tarification selon la documentation des fournisseurs, septembre 2026. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

GPT-Live-1 vs ElevenLabs : un modèle qui écoute, une entreprise qui vend tout le reste

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le chiffre le plus utile dans cette comparaison est 90,5 %. Il s'agit du taux de réussite des tâches qu'Artificial Analysis a mesuré pour ElevenLabs Agents dans son Speech Agent Arena — le plus élevé parmi les six premiers de ce classement, obtenu par un système qui n'est pas du tout un modèle unique, mais une cascade de reconnaissance vocale, d'un modèle de langage et d'un synthétiseur assemblés par la propre logique de gestion des tours de parole d'ElevenLabs. GPT-Live-1, le modèle full-duplex de bout en bout d'Open​AI, n'apparaît pas dans ce classement, car il concourt dans un autre : le Speech to Speech Index, où il occupe la sixième place ex æquo sur quatorze avec 70,3 %. Pendant ce temps, ElevenLabs Eleven v3 reste la voix de production la plus largement déployée de l'industrie, avec plus de 10 000 voix dans sa bibliothèque et plus de 70 langues.

Le raccourci, c'est que d'un côté on vous vend une conversation et de l'autre une entreprise. Ce raccourci est en grande partie juste, et il dissimule la conclusion plus intéressante qui se trouve en dessous : une cascade bien conçue reste meilleure qu'un modèle full-duplex natif pour mener la tâche à bien.

Deux architectures, et la différence tient à l’endroit où se trouvent les coutures.

GPT-Live-1 est un modèle unique qui prend en entrée de l’audio et du texte et produit de l’audio et du texte en sortie. Il gère l’interruption nativement — les propres tests d’Open​AI, publiés à l’occasion de la sortie de l’API de septembre et non reproduits en dehors de l’entreprise, rapportent 80,1 % d’interactivité sur Full Duplex Bench v1.5 contre 45,4 % pour GPT-Realtime-2.1, et une latence de prise de tour de 0,798 seconde contre 1,41. Il n’y a pas de jointures, car il n’y a rien à joindre.

ElevenLabs Agents est le pari inverse, délibérément. La documentation d'ElevenLabs décrit un pipeline : une reconnaissance vocale affinée, un modèle de langue que vous choisissez ou apportez vous-même, un synthétiseur à faible latence — généralement quelque chose de la gamme Flash — et un modèle propriétaire de prise de tour au-dessus. Le barge-in est une configuration par agent exposant l'empressement de tour et les délais d'attente plutôt qu'une propriété du modèle. Dans la configuration par défaut benchmarkée d'Artificial Analysis, la pile utilise Scribe v2 Realtime pour la reconnaissance vocale, un modèle Gem​ini pour le raisonnement, et Eleven Flash v2 pour la synthèse.

Cette conception présente un énorme avantage et un coût structurel. L’avantage est que chaque étape est remplaçable : un modèle économique pour les tours de parole simples, un modèle de pointe pour les tours difficiles, un synthétiseur différent pour une locale différente. Le coût, c’est que la latence s’accumule à chaque point de jonction, et que la décision de prise de parole doit être prise de l’extérieur.

Dimension par dimension

• Architecture — GPT-Live-1 : un modèle de bout en bout unique, audio en entrée et en sortie, par opposition à ElevenLabs Agents : reconnaissance vocale, modèle de langage et synthèse en cascade avec une couche propriétaire de gestion des tours de parole

• Preuves indépendantes — GPT-Live-1 : 70,3 % sur l’Artificial Analysis Speech to Speech Index, sixième ex æquo sur quatorze, contre ElevenLabs Agents : Elo 937 sur la Speech Agent Arena avec un taux de réussite des tâches de 90,5 % sur 676 échantillons, le meilleur taux de réussite parmi les six premiers de ce classement

• Classements de qualité — GPT-Live-1 : non classé dans les arènes de synthèse vocale, car il s'agit d'un autre type de modèle que ceux d'ElevenLabs : Eleven v3 Conversational à 1 194 Elo et Eleven v3 à 1 166 dans le classement Provider Voice, au prix respectif de 50 $ et 100 $ par million de caractères

• Prix — GPT-Live-1 : 0,05 $ par minute vocale, facturé à la seconde, le raisonnement backend étant comptabilisé séparément ; par rapport à ElevenLabs : environ 50 $ par million de caractères pour Eleven v3 Conversational et environ 100 $ pour Eleven v3, avec des agents annoncés à environ 0,08 $ par minute, grimpant au-delà du plafond de concurrence, et les coûts de modèle de langage et de téléphonie facturés séparément

• Latence — GPT-Live-1 : aucun délai avant le premier audio au niveau du modèle n'est publié ; 0,798 seconde de latence de prise de parole lors des tests du fournisseur, contre ElevenLabs : environ 75 millisecondes pour Flash v2.5 et environ 280 millisecondes pour Eleven v3 Conversational, avec une recommandation du fournisseur de moins de 800 millisecondes avant le premier audio au niveau de l'agent

• Voix et clonage — GPT-Live-1 : douze préréglages d’API, aucun clonage par conception, contre ElevenLabs : plus de 10 000 voix dans la bibliothèque, clonage instantané à partir d’un court échantillon, clonage professionnel à partir de 30 à 180 minutes d’audio avec auto-vérification

• Langues — GPT-Live-1 : les principales langues sont bien couvertes, mais la fluidité est inégale au-delà dans la couverture de lancement ; face à ElevenLabs Eleven v3 : plus de 70 langues, contre 32 pour la gamme Flash et plus de 90 pour sa reconnaissance vocale

• Étendue — GPT-Live-1 : un point de terminaison, un ID de modèle, des paliers de concurrence de 25 à 500 sessions et aucun niveau gratuit vs ElevenLabs : synthèse, reconnaissance vocale, doublage, effets sonores, musique, une place de marché de voix et une plateforme d'agents sous un seul contrat, avec un niveau gratuit qui ne comporte pas de licence commerciale

A two-column comparison scoreboard titled 'GPT-Live-1 vs ElevenLabs — the scoreboard'. The left column, labelled GPT-Live-1, reads 'Architecture: one end-to-end full-duplex model', 'Price: $0.05 per voice minute plus backend', 'Independent score: 70.3% on the AA Speech to Speech Index, joint 6th of 14', 'Interactivity: 80.1% (vendor, unreproduced)', 'Voices: 12 presets, no cloning', 'Best at: interruption handling'. The right column, labelled ElevenLabs, reads 'Architecture: cascaded STT + LLM + TTS', 'Price: ~$50 to $100 per 1M characters; agents ~$0.08 per minute', 'Independent score: Elo 937 on the AA Speech Agent Arena, 90.5% task success', 'Latency: ~75 ms Flash v2.5, ~280 ms v3 Conversational (vendor)', 'Voices: 10,000+ library voices, cloning with verification', 'Best at: platform breadth and voice quality'. The footer reads 'ElevenLabs agent pricing is third-party reported; arena figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Artificial Analysis Speech Agent Arena leaderboard, ranking cascaded voice-agent systems by Elo and task success rate. The top rows read Gemini 3.1 Flash Live Minimal at 1,046 Elo over 768 samples with a 74.6% task success rate, Gemini 3.1 Flash Live High at 1,014 with 71.8%, GPT-Realtime-1.5 at 1,000 with 85.1%, GPT Realtime (Aug '25) at 944 with 89.4%, and ElevenLabs Agents, labelled 'Default Cascaded System', at Elo 937 over 676 samples with a task success rate of 90.5% — the highest in the top six. The board continues with Amazon Bedrock Nova 2.0 Sonic at 917 and Grok Voice Think Fast 2.0 High at 908 with a 94.7% success rate.

Là où ElevenLabs n'est pas seulement en avance, mais sans rival

Trois des écarts dans cette liste ne sont pas serrés, et toute comparaison qui leur accorde une phrase est injuste envers le sortant.

Le clonage vient en premier. GPT-Live-1 propose douze préréglages et, par conception, aucun clonage du tout — une posture de sécurité délibérée plutôt qu’une fonctionnalité manquante. ElevenLabs propose le clonage instantané à partir d’un court échantillon de référence et le clonage professionnel entraîné sur 30 à 180 minutes d’audio, réservés à certains niveaux de forfait et soumis à une étape d’auto-vérification. Si la voix de votre produit fait partie de son identité, ce n’est pas un axe sur lequel GPT-Live-1 rivalise.

La bibliothèque de voix est la deuxième. Plus de 10 000 voix, ainsi qu’une marketplace sous licence de voix emblématiques issues de successions et d’interprètes, constituent un atout qu’aucune sortie de modèle ne peut reproduire. C’est aussi l’élément que les acheteurs sous-estiment le plus souvent : le choix d’une voix est le dernier kilomètre d’un produit vocal, et le fait de disposer de dix mille voix parmi lesquelles choisir condense un exercice de branding en un après-midi.

Le troisième est l’étendue. Reconnaissance vocale, doublage, effets sonores, musique, une plateforme d’agents — une équipe qui a besoin de quatre de ces éléments signe un seul contrat au lieu de quatre. C’est un avantage stratégique, pas un avantage de qualité, et il subsiste même si l’autre camp remporte un benchmark.

Les deux entreprises soulèvent des questions de gouvernance qui relèvent d'un examen des achats plutôt que d'une note de bas de page. Le clonage professionnel d'ElevenLabs nécessite une auto-vérification et ses conditions interdisent de cloner la voix d'une autre personne, même avec son consentement ; l'entreprise fait également face à une série de recours collectifs déposés en mai 2026 concernant le consentement relatif aux données d'entraînement, dans lesquels les allégations ne sont pas prouvées. La position d'OpenAI est plus simple, car elle a supprimé la fonctionnalité qui génère le risque.

A screenshot of ElevenLabs' official models documentation page, describing Eleven v3 under a 'Flagship models' heading as 'Our most emotionally rich, expressive speech synthesis model', with the supporting lines 'Dramatic delivery and performance', '70+ languages supported', '5,000 character limit' and 'Support for natural multi-speaker dialogue'. The surrounding navigation lists ElevenLabs' wider product set, including text to speech, speech to text, music, text to dialogue, dubbing, sound effects, voices and voice agents.

La taxe en cascade, et où il vaut la peine de la payer

Les coûts d’une cascade se manifestent sous forme de latence et d’orchestration. Les recommandations du fournisseur pour ElevenLabs situent le délai avant le premier audio d’un agent sous 800 millisecondes à la médiane et sous 1,5 seconde au 95e percentile — des chiffres qui décrivent l’ensemble du pipeline, et non les 75 millisecondes du synthétiseur. S’y ajoutent le temps de génération du modèle de langage et le transit réseau. Une partie de cela peut être récupérée en choisissant soigneusement vos étapes ; rien de tout cela n’est gratuit.

La facture de l’orchestration est plus légère, mais bien réelle. Chaque étape supplémentaire est un endroit de plus où un appel peut échouer, un délai d’attente de plus à régler, un fournisseur de plus avec lequel rapprocher des factures. C’est la partie qu’un modèle natif de bout en bout supprime entièrement : il n’y a qu’une seule chose qui peut casser, et soit elle répond, soit elle ne répond pas.

Là où la cascade s'amortit, c'est à l'étape intermédiaire. Le modèle de langue derrière un agent vocal est le composant dont la qualité s'améliore le plus vite et dont le coût varie le plus, et pouvoir le remplacer sans toucher à la couche vocale vaut de l'argent bien réel sur la durée de vie d'un produit. Environ 190 modèles de onze fournisseurs en amont se trouvent derrière une seule clé OrcaRouter au prix catalogue du fournisseur, sans majoration, si bien qu'un changement de prix d'un fournisseur atteint cette couche le jour même, et le basculement automatique empêche un délai d'attente du backend de mettre fin à un appel en direct. Ni la pile d'agents d'ElevenLabs ni le point de terminaison Live Sessions de GPT-Live-1 ne sont accessibles de cette manière — les couches vocales appartiennent à leurs fournisseurs, et c'est la couche située en dessous d'elles.

Lequel choisir

Choisissez GPT-Live-1 si la mécanique de conversation est le produit et que vous voulez un seul contrat avec un seul mode de défaillance. Des lignes téléphoniques où les appelants parlent par-dessus l'agent, où un transfert naturel compte plus qu'une voix parfaite, et où douze bonnes voix suffisent. Vous acceptez un modèle hébergé fermé, l'absence de clonage, une qualité indépendante dans la moyenne, et aucune offre gratuite pour prototyper.

Choisissez ElevenLabs si la qualité vocale, le clonage ou l'étendue constituent la contrainte. Narration, doublage, produits multilingues, tout ce pour quoi la voix est la marque, tout ce qui nécessite la reconnaissance vocale dans le même contrat. Vous acceptez une cascade à faire fonctionner, des tarifs environ dix à vingt fois ceux de GPT-Live-1 par unité de parole, et le fait que c'est à vous de configurer la logique d'interruption — et à vous de la rater.

Le 90,5 % est l'élément qui vaut la peine d'être retenu. Il dit qu'une entreprise qui a assemblé trois modèles et une couche de gestion des tours de parole a battu une entreprise qui a entraîné un seul modèle à tout faire, sur la métrique la plus proche de la question de savoir si l'appel a fonctionné. Le full duplex est une véritable avancée architecturale et, selon les données actuelles, ce n'est pas ce qui détermine si l'appelant obtient ce qu'il voulait.