
Gemini 3.8 Live vs ElevenLabs : un modèle contre un pipeline
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ouvrez la documentation d’ElevenLabs pour sa plateforme d’agents et un modèle Gemini se trouve au beau milieu. ElevenLabs Agents est une cascade — un front-end de reconnaissance vocale, un modèle de langage et un back-end de synthèse vocale — et le modèle de langage de la pile publiée est un Gemini. C’est le bon point de départ pour une comparaison Gemini 3.8 Live vs ElevenLabs, car les deux choses comparées ne sont pas du même type d’objet. Gemini 3.8 Live est le modèle parole-à-parole, livré sur la Live API le 15 septembre 2026, facturé à la minute d’audio. ElevenLabs Eleven v3 est le modèle de synthèse phare d’une plateforme vocale qui vend aussi ElevenLabs Agents, et il est facturé au caractère, et non à la conversation. L’un est un composant que vous pouvez louer. L’autre est un système qui loue des composants — y compris, dans au moins une configuration publiée, ceux d’un modèle Gemini.
Cette asymétrie tranche la plupart des questions que les gens viennent réellement poser dans cette comparaison. Si vous vous demandez lequel appeler, la réponse honnête est qu’ils ne sont pas interchangeables : l’un est un modèle avec une grille tarifaire et sans téléphonie, l’autre est un produit avec téléphonie, limites de simultanéité et trois compteurs qui tournent en même temps. Lequel est le moins cher, le meilleur ou le plus rapide dépend entièrement de celle de ces deux formes à laquelle votre application correspond déjà.
Un modèle, ou trois modèles en séquence
Gemini 3.8 Live est un système natif de parole à parole. L'audio entre, l'audio sort, et le raisonnement se produit dans la même passe avant que celle qui génère la parole — un seul modèle, un seul budget de latence, une seule facture. Google l'a déployé en deux variantes le 15 septembre 2026 : gemini-3.8-live pour le travail conversationnel à grande échelle, et gemini-3.8-live-extended-thinking pour la même interface, avec un raisonnement multi-étapes en arrière-plan. Les deux gèrent 97 langues avec changement en cours de conversation, les deux traitent les entrées visuelles en quasi temps réel, les deux exécutent des appels d'outils et d'API en arrière-plan pendant que la conversation se poursuit, et les deux appliquent un filigrane SynthID à chaque seconde d'audio généré. Le tarif publié est de 0,005 $ par minute d'audio en entrée et de 0,018 $ par minute d'audio en sortie.
ElevenLabs Agents n’est pas cela. C’est un pipeline, et le pipeline est le produit. Un modèle de reconnaissance vocale en temps réel transcrit l’appelant, un modèle de langage décide quoi dire, et un modèle de synthèse — Eleven Flash v2 dans la configuration documentée par ElevenLabs — prononce la réponse. Chaque étape est facturée séparément, chaque étape peut être remplacée, et l’ensemble se trouve derrière une couche gérée qui prend en charge la téléphonie, la détection de tour de parole et la concurrence. ElevenLabs Eleven v3, le modèle de synthèse phare de l’entreprise, est encore un autre produit : un modèle de synthèse vocale à 100 $ le million de caractères, vendu pour la narration, le doublage et la conception de voix plutôt que pour tenir une conversation.
Donc, la première chose à bien comprendre, c'est que « Gemini 3.8 Live vs ElevenLabs Eleven v3 » n'est pas un duel entre deux modèles vocaux. Eleven v3 ne prend pas d'audio en entrée et ne tient pas une conversation. La comparaison qui a du sens, c'est Gemini 3.8 Live face à ElevenLabs Agents, avec Eleven v3 présent uniquement comme le plafond de qualité de synthèse autour duquel la plateforme est construite.
Où chacun se trouve réellement sur un plateau
Il n'existe aucun classement qui les oppose l'un à l'autre, et la raison en est instructive : ils ne cessent d'apparaître dans des classements différents, qui mesurent des choses différentes.

Sur l'indice Speech to Speech d'Artificial Analysis — qui combine raisonnement vocal, exécution de tâches agentiques, préférence d'arène et réussite des tâches en un seul chiffre — Gemini 3.8 Live obtient 76,0, la variante Extended Thinking se classant première avec 82,6. Il s'agit de mesures qu'Artificial Analysis réalise dans le cadre de son propre harnais d'évaluation, et non de chiffres publiés par Google, bien que l'annonce de Google elle-même cite des chiffres issus des mêmes composantes.
ElevenLabs n'apparaît pas du tout sur ce tableau, car il ne propose aucun modèle parole-à-parole à évaluer. Là où il apparaît, c'est dans la Speech Agent Arena, qui évalue des agents assemblés plutôt que des modèles, et le tableau y est véritablement contrasté : ElevenLabs Agents a été mesuré à 937 Elo avec un taux de réussite des tâches de 90,5 %, contre 1 046 Elo et 74,6 % de réussite des tâches pour un agent construit sur la génération précédente de Gemini Live, l'agent Gemini atteignant le premier audio en 0,96 seconde. Lisez attentivement ce duo. L'agent adossé à Gemini l'emporte sur la préférence et la vitesse ; l'agent ElevenLabs l'emporte sur l'accomplissement de la tâche. C'est une cascade qui bat un modèle natif sur la fiabilité, ce qui n'est pas le résultat que laisseraient présager les schémas d'architecture.
Deux réserves sur ces chiffres, et toutes deux comptent. Le volet Gemini de cette comparaison portait sur la génération Gemini Live du début 2026, et non sur 3.8 Live ; il ne dit donc rien du modèle dont traite cet article. Et le troisième classement en jeu — la Provider Voices speech arena d'Artificial Analysis, qui classe les modèles de synthèse — place ElevenLabs Eleven v3 à 1 177 Elo et sa variante conversationnelle, ElevenLabs v3 Conversational, à 1 219 Elo, contre 1 283 pour le leader, Cartesia Sonic 3.6. Ce classement mesure la qualité de la voix, et non la performance de l'agent, et c'est en mélangeant les deux qu'on finit par citer un score de synthèse comme preuve au sujet d'un système conversationnel.
Contraste des spécifications

• Architecture — Gemini 3.8 Live est un modèle natif parole-à-parole, tandis qu'ElevenLabs Agents est une cascade de reconnaissance vocale, d'un modèle de langage et de synthèse
• Entrée et sortie — {{1}}Gemini 3.8 Live{{/1}} prend de l'audio et renvoie de l'audio en une seule passe, tandis qu'{{2}}ElevenLabs{{/2}} fait passer l'audio par {{3}}Scribe v2 Realtime{{/3}} et le renvoie via {{4}}Eleven Flash v2{{/4}}, avec une transcription textuelle entre les deux
• Ce que vous pouvez remplacer — Gemini 3.8 Live : rien, le modèle est le modèle ; par rapport à ElevenLabs, chaque étape indépendamment, y compris le modèle de langage, qui, dans la stack documentée, est un modèle Google
• Langues — Gemini 3.8 Live 97 avec changement en cours de conversation vs ElevenLabs Eleven v3 74
• Tarification audio — Gemini 3.8 Live à 0,005 $ par minute en entrée et 0,018 $ par minute en sortie, contre ElevenLabs facturé sur les minutes d'agent, avec les jetons de modèle de langage comptés séparément en supplément
• Téléphonie — Gemini 3.8 Live : aucune solution propriétaire, vous apportez votre propre opérateur et la gestion de session, contre ElevenLabs, géré et propriétaire.
• Concurrence — Gemini 3.8 Live, selon ce que votre quota Live API permet, contre ElevenLabs vendu en paliers de concurrence
• Outillage d'agent — outil en arrière-plan Gemini 3.8 Live et exécution d'API à l'intérieur du modèle, contre ElevenLabs, une couche d'agent gérée avec détection des tours de parole, workflows et bibliothèque de voix
• Artefact ouvert — ni l’un ni l’autre. Les deux sont fermés, uniquement en cloud et propriétaires.
• Latence — Gemini 3.8 Live : 1,18 seconde jusqu’au premier audio pour le modèle standard et 1,35 pour Extended Thinking, selon Artificial Analysis, contrairement à ElevenLabs dont la latence n’est pas publiée sous forme de chiffre unique, car la latence d’une cascade est la somme de trois étapes
La dernière ligne est celle qui explique le mieux le choix d’architecture, mieux que toutes les autres. Un modèle natif n’a qu’un seul budget de latence. Une cascade en a trois, et la raison pour laquelle les équipes choisissent encore la cascade, c’est tout ce qui figure au-dessus : la transcription que l’on peut journaliser, l’étape que l’on peut remplacer, et le numéro de téléphone qui fonctionne tout simplement.
Ce que coûte une minute, dans les deux sens
Le calcul de Gemini 3.8 Live est inhabituellement simple, car il n'y a qu'un seul compteur. Une minute de conversation correspond à peu près à une minute d'audio de l'appelant plus une minute d'audio du modèle : 0,005 $ plus 0,018 $, soit environ 2,3 cents par minute au tarif publié. La colonne coût par heure d'Artificial Analysis, qui normalise le coût d'exécution d'un ensemble fixe de raisonnement audio en un montant horaire, situe le modèle standard à 0,84 $ par heure d'audio d'entrée — le tarif payant le moins cher de ce tableau — et la variante Extended Thinking à 3,50 $.

L'arithmétique d'ElevenLabs est plus difficile à suivre, et c'est précisément là l'essentiel plutôt qu'une critique. Une minute d'agent n'a pas un prix unique : il y a les frais de plateforme pour la minute d'agent elle-même, les jetons de modèle de langage consommés sur le segment intermédiaire, et les minutes de l'opérateur en dessous — trois compteurs, trois fournisseurs dans le pire des cas, et une facture qui bouge dès que l'un d'eux bouge. Le versant synthèse est plus lisible : ElevenLabs Eleven v3 à 100 $ par million de caractères représente environ 8 $ pour une heure de narration continue à un débit de parole ordinaire, contre environ 2,70 $ pour le concurrent open-weights le moins cher de la même arène. ElevenLabs facture un supplément pour la voix, et dans ce classement, ce supplément est bien réel — il se hisse au quatrième rang global.
Ce que ces deux structures de coûts signifient concrètement, c’est que Gemini 3.8 Live est moins cher par minute de conversation et bien moins cher par heure d’audio, tandis qu’ElevenLabs est plus cher et bien plus prévisible à exploiter. Une équipe sans ingénieurs ML et avec un numéro de téléphone à mettre en service dépensera moins avec ElevenLabs le premier mois, car l’alternative consiste à construire ce qu’ElevenLabs a déjà construit. Une équipe qui gère déjà sa propre gestion de sessions et son propre opérateur dépensera moins pour le modèle brut, car elle ne paie pas pour un pipeline qu’elle possède déjà.
Là où ElevenLabs est véritablement meilleur
Il serait facile de lire l'écart de prix comme un verdict. Ce n'est pas le cas, et les raisons sont précisément celles qu'une grille tarifaire ne montre jamais.
• Téléphonie. ElevenLabs vend des numéros de téléphone, du trunking SIP et la simultanéité nécessaire pour répondre aux appels. Google vend un modèle qui parle. Si votre produit est une ligne téléphonique, l’écart entre ces deux phrases représente des mois d’ingénierie.
Identité vocale. La Voice Library, le pipeline de clonage et le studio de doublage constituent une surface produit mature. Gemini 3.8 Live vous donne un modèle ; il ne vous donne pas de catalogue de voix sous licence ni de flux de travail pour localiser un enregistrement existant en neuf langues.
• Une transcription par défaut. Parce qu’une cascade transcrit avant de raisonner, vous obtenez gratuitement des journaux textuels de chaque appel — utiles pour la conformité, pour l’évaluation et pour le travail ingrat consistant à découvrir pourquoi l’agent s’est trompé. Un modèle natif parole-à-parole n’a pas un tel artefact, à moins que vous n’en construisiez un.
• Des composants interchangeables. Lorsqu’un meilleur modèle de langage est mis sur le marché, une cascade ElevenLabs peut l’adopter sans réentraîner quoi que ce soit. C’est exactement pourquoi la pile documentée comporte un modèle Google en son milieu — et c’est l’argument le plus fort en faveur de l’architecture en cascade.
Ce que le modèle brut vous apporte
La contre-argumentation ne porte pas sur le prix. Elle porte sur ce qu'une seule passe avant peut faire et que trois étapes ne peuvent pas faire.
Gemini 3.8 Live perçoit la prosodie, le ton et les hésitations directement, et non par le biais d'une transcription qui les a déjà écartés, ce qui lui permet de changer de langue en pleine phrase et explique pourquoi son score de dynamique conversationnelle — 96,1 % pour le modèle standard, selon Artificial Analysis — est la seule composante où il surpasse son propre homologue à forte dominante de raisonnement. Il exécute aussi des appels d'outils et d'API en arrière-plan tout en continuant à parler, de sorte qu'une recherche ne produit pas de silence. Et la variante Extended Thinking est une capacité véritablement différente, et non une version plus grande de la même : elle résout 68,6 % des scénarios de service client τ-Voice, contre 30,1 % pour le modèle standard, un écart de 38 points qui constitue le chiffre isolé le plus élevé de cette annonce et la raison pour laquelle Google a scindé la gamme en deux.
Si le travail de votre agent consiste à mener à bien une tâche en plusieurs étapes plutôt qu’à tenir une conversation agréable, cet écart de 38 points fait toute la décision, et cela coûte 3,50 $ l’heure au lieu de 0,84 $ — toujours en dessous de tous les modèles qu’il dépasse sur ce tableau.
Le segment du milieu est celui que vous pouvez réellement déplacer
Voici la jointure qu’il vaut la peine de nommer, car c’est là que la question d’architecture devient une question d’achat. Dans une cascade, la branche intermédiaire — celle qui décide quoi dire, appelle les outils et effectue le raisonnement — relève de l’inférence de texte ordinaire. C’est aussi la branche qui présente la plus grande variance de coûts, le plus fort verrouillage et le moins de raisons d’être liée à un fournisseur unique. La pile que documente ElevenLabs utilise justement un modèle Gemini à cet endroit. Elle n’y est pas obligée.
OrcaRouter couvre ce tronçon-là et non les deux extérieurs. Nous n'hébergeons pas les points de terminaison vocaux Gemini 3.8 Live — ceux-ci proviennent de l'API Live de Google elle-même — et nous n'hébergeons pas ElevenLabs, dont les couches de synthèse et d'agent constituent son propre produit. Ce que nous prenons en charge, c'est la couche texte en dessous : plus de 200 modèles derrière une seule clé, au prix catalogue du fournisseur et sans marge, de sorte qu'une baisse de prix venue d'un laboratoire en amont se répercute sur votre facture le jour même, et non au prochain renouvellement. Pour une pile vocale en particulier, trois de ces propriétés justifient leur présence. Le basculement automatique maintient un appel en cours lorsqu'un backend renvoie une erreur ou expire en pleine phrase, une défaillance que l'appelant remarque immédiatement. Le DSL de routage compose plusieurs modèles au sein d'un même appel, de sorte qu'un modèle bon marché peut gérer les tours d'accusé de réception et qu'un modèle plus puissant peut prendre en charge la transaction. Et la fusion de modèles permet à un panel de répondre collectivement sur les tours où le jugement d'un modèle unique n'est pas assez solide pour qu'on s'y fie seul. Changer le modèle qui se trouve au milieu d'une cascade relève d'un changement de configuration, et non d'une reconstruction — c'est précisément la raison d'être de l'architecture en cascade.
Lequel choisir
Choisissez ElevenLabs si vous déployez une ligne téléphonique et que vous ne voulez pas construire une pile vocale. Vous achetez de la téléphonie, un catalogue vocal, des transcriptions, la gestion des appels simultanés et un contrat de support, et le supplément facturé à la minute correspond au coût de ces éléments. Vous achetez aussi la capacité de changer de modèle en cours de route sans rien changer d’autre, ce qui vaut bien plus que cela n’en a l’air.
Choisissez Gemini 3.8 Live si la voix est une fonctionnalité de quelque chose que vous exploitez déjà. Vous obtenez le tarif parole à parole compétent le moins cher actuellement publié, 97 langues avec changement en cours de conversation, une exécution d'outils qui tourne pendant que le modèle continue de parler, et — si votre agent doit accomplir des tâches plutôt que simplement converser — l'écart agentique de 38 points que la variante Extended Thinking procure pour environ quatre fois le coût horaire de l'audio. Vous fournissez l'opérateur, le cycle de vie de session et les journaux.
À surveiller : si ElevenLabs publie un chiffre de latence unique pour une minute d’agent géré, car c’est ce chiffre qui rendrait cette comparaison quantitative plutôt que structurelle ; et si le résultat de Speech Agent Arena tient la route lorsqu’un agent construit sur 3.8 Live y est mesuré, car une cascade qui bat actuellement un modèle natif sur la réussite des tâches est la chose la plus intéressante de cette confrontation et la moins expliquée.
