
Gemini 3.8 Live Extended Thinking vs GPT-Live-1 : une égalité à 1,1 point et deux factures différentes
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sur le score composite, c'est une égalité. Gemini 3.8 Live Extended Thinking se situe à 82,6 sur l'indice Speech to Speech d'Artificial Analysis ; GPT-Live-1, dans son backend Astra avec un effort de raisonnement moyen, se situe à 81,5. Sur la composante agentique sous-jacente — l'accomplissement de tâches τ-Voice — l'écart est de 0,7 point, 68,6 % contre 67,9 %. Sur la composante de raisonnement, il est plus large et va dans l'autre sens : 97,7 % sur Big Bench Audio pour le modèle Gemini, 90,1 % pour GPT-Live-1. Rien dans cet écart ne résiste à une deuxième exécution du benchmark, et rien de tout cela ne doit fonder votre décision.
Ce qui sépare ces deux-là n’est pas la qualité. C’est qu’ils ne sont pas d’accord sur ce qu’est un agent vocal, qui fait la réflexion, et — la partie qui touche en premier une ligne budgétaire — comment la session est facturée. Gemini 3.8 Live Extended Thinking facture au jeton audio et raisonne dans le même modèle qui parle. GPT-Live-1 facture un tarif forfaitaire pour le temps de session, que quelqu’un parle ou non, et confie la réflexion proprement dite à un modèle texte distinct que vous sélectionnez et payez séparément. Ce sont deux produits différents qui portent le même score de benchmark, et celui qui convient dépend d’une question que le classement ne pose jamais : à quoi ressemble un appel moyen sur votre ligne ?
L'égalité à 1,1 point, et où elle se rompt réellement
Commencez par les chiffres, car c’est la minceur du titre qui est l’essentiel :
• Indice parole à parole — Gemini 3.8 Live Extended Thinking (High) 82,6 vs GPT-Live-1 (backend Astra, effort moyen) 81,5
• Performances agentiques (réalisation des tâches τ-Voice) — 68,6 % contre 67,9 %, avec GPT-Live-1 à 59,3 % lorsqu'il utilise le backend Sol en mode effort faible
• Raisonnement vocal (Big Bench Audio) — 97,7 % vs 90,1 %, le seul élément où l'écart n'est pas du bruit
• Flux de travail bancaires complexes (Sierra τ³-Banking, signalés par le fournisseur) — 35,1 % vs 32,0 %
• Délai avant le premier audio — 1,35 s contre 1,24–1,34 s via l’API
• Coût horaire mesuré — 3,50 $ contre 5,83 $ pour la configuration Astra, les deux selon la mesure de l'audio d'entrée d'Artificial Analysis
La lecture honnête, c’est que les deux modèles sont indistinguables sur le composite, distinguables sur le raisonnement vocal, où le modèle Gemini devance de près de huit points, et distinguables sur le coût, où il devance d’environ 40 %. Là où GPT-Live-1 prend l’avantage, c’est dans les parties de l’expérience qu’un benchmark a du mal à évaluer : il est véritablement en duplex intégral, écoute pendant qu’il parle, émet des signaux de retour et décide plusieurs fois par seconde s’il doit parler ou céder la parole. Gemini 3.8 Live Extended Thinking fonctionne en mode tour par tour. Il résout le même problème sous-jacent — un appelant laissé dans le silence pendant que l’agent travaille — en décrivant ce qu’il fait à la place, raisonnant et parlant en même temps avec des formules comme « Laissez-moi vérifier… » pendant que la tâche s’exécute.
Les deux approches maintiennent la ligne en vie. Elles donnent un ressenti différent. Une seule d'entre elles apparaît dans un index.

Deux modèles de facturation, et pourquoi la grille tarifaire induit en erreur
C’est la section qui détermine la plupart des déploiements, et c’est celle que la couverture omet.
Gemini 3.8 Live Extended Thinkingest facturé comme l'est un modèle à jetons. Via l'API Live, les tarifs publiés sont de 3,00 $ par million de jetons d'entrée audio — environ 0,005 $ par minute d'entrée audio — et de 12,00 $ par million de jetons de sortie audio, soit environ 0,018 $ par minute, les jetons de réflexion étant comptés dans cette sortie. Vous ne payez que pour l'audio qui circule. Un appelant qui fait une pause, réfléchit ou est mis en attente ne vous coûte rien tant qu'il reste silencieux.
GPT-Live-1 est facturé comme une ligne téléphonique. C'est un tarif fixe de 0,05 $ par minute de temps de session, facturé à la seconde, peu importe qui parle ou même si quelqu'un parle. Le backend de raisonnement n'est pas inclus : le modèle texte qui effectue la réflexion, ainsi que tous les outils qu'il appelle, sont facturés séparément, en plus. C'est ainsi qu'un prix affiché de 0,05 $ devient un coût global d'environ 4,47 $ par heure sur le backend Sol et de 5,83 $ par heure sur Astra medium, selon les mesures d'Artificial Analysis.
Mettez-les côte à côte et la comparaison naïve — 0,018 $ contre 0,05 $ par minute, un écart de 2,8× — est fausse dans les deux sens. Les chiffres horaires mesurés situent l'écart réel à 3,50 $ contre 5,83 $, plus proche de 1,7×. Mais le modèle de facturation à l'horloge de session change aussi la forme de votre facture, et pas seulement son niveau : sur GPT-Live-1, votre coût suit la durée des appels, donc une ligne avec de longs appels silencieux et peu de contenu — une file d'attente support, une étape de vérification, un transfert SVI — paie autant qu'une ligne dense. Du côté Gemini, le coût suit l'audio, donc le silence est gratuit et la verbosité ne l'est pas. Faites le calcul sur la durée moyenne de vos propres appels avant de le faire sur un tarif à la minute, car c'est ce chiffre qui détermine lequel de ces deux services est le moins cher pour vous, et la réponse n'est pas la même pour une ligne de réservation et une ligne de triage.
Là où la réflexion se produit
La deuxième différence structurelle est la délégation, et c'est elle qui détermine quelle part de cette pile vous pouvez réellement échanger.
GPT-Live-1 est un front-end. Il gère l'audio duplex et, lorsqu'une requête nécessite un véritable raisonnement, il confie le travail à un modèle backend distinct — GPT-5.5 et GPT-6 Astra sont tous deux documentés comme backends — avec des sélecteurs d'effort de raisonnement qui vous permettent de choisir quelle quantité de ce backend vous souhaitez acheter. C'est pourquoi le tableau liste GPT-Live-1 deux fois avec des scores différents : 81,5 sur Astra à effort moyen, 80,1 sur Sol à effort faible. Cet écart de 1,4 point entre ses deux propres configurations est plus important que l'écart de 1,1 point entre les deux modèles de cette confrontation, ce qui vous indique que du côté d'OpenAI, la configuration que vous choisissez compte plus que le fournisseur que vous choisissez.
Gemini 3.8 Live Extended Thinking raisonne dans le même modèle qui parle. Il n'y a pas de backend séparé à sélectionner ni de facture distincte pour celui-ci ; la contrepartie est que vous ajustez la profondeur avec des niveaux de réflexion — faible, moyen et élevé — sur le même modèle, et les chiffres 82,6 et 68,6 correspondent à la (Élevé) configuration. L'exécution des outils et de l'API en arrière-plan se fait de manière asynchrone des deux côtés, de sorte qu'aucun des deux modèles ne se bloque pendant qu'il travaille.
Une conséquence pratique : comme l’intelligence de GPT-Live-1 est un modèle textuel acheté derrière une façade vocale, son plafond de qualité évolue quand OpenAI sort un modèle textuel, pas quand elle sort un modèle vocal. Le plafond de Gemini 3.8 Live Extended Thinking évolue quand Google réentraîne le modèle audio. Si vous placez un pari sur deux ans sur une plateforme vocale, cette différence de rythme de mise à niveau mérite plus de réflexion que 1,1 point d’indice.
Ce que coûte le changement, quel que soit votre choix
Aucune de ces deux approches n'est un simple remplacement d'ID de modèle, et les équipes qui les traitent comme tel le découvrent en production. Passer à Gemini 3.8 Live Extended Thinking signifie accepter un contrat de tour différent : les appels de fonction sont toujours asynchrones, donc une déclaration d'outil bloquante renvoie une erreur dure plutôt que de se mettre en file d'attente, et les clients doivent lire interaction_status, le champ — IN_PROGRESS pendant que le raisonnement ou un outil est encore en cours d'exécution, IDLE uniquement lorsque toute la tâche est terminée — au lieu de se fier à turnComplete pour signifier que le travail est terminé. Passer à GPT-Live-1 signifie adopter sa mécanique de sélection de backend et une seconde surface de facturation, et composer avec une API qui n'est devenue généralement disponible pour les développeurs que le 10 septembre 2026, après ses débuts dans ChatGPT le 8 juillet — ainsi, l'outillage tiers, les SDK et l'observabilité autour d'elle ne datent que de quelques mois, pas d'années. Quelle que soit la direction que vous prenez, budgétisez le travail d'intégration à côté de la facture de tokens. Sur une pile vocale mature, la refactorisation est généralement la plus lourde des deux.
Comment effectuer une comparaison comme celle-ci sans parier dessus
La façon raisonnable de trancher une question de 1,1 point consiste à tester les deux sur votre propre trafic, et l'aspect délicat, c'est que cela suppose normalement deux intégrations, deux contrats et deux jeux d'identifiants. Cela n'implique pas pour autant deux architectures. Dans ces deux systèmes, le front-end vocal n'est qu'une fine couche au-dessus d'appels ordinaires à un modèle de texte — pour GPT-Live-1, c'est explicite, et côté Gemini, l'exécution d'outils en arrière-plan se résout de la même manière — et c'est dans cette couche texte que réside l'écart de coûts et que le changement coûte réellement peu.
OrcaRouter propose 190 modèles à partir d'une seule clé, au prix catalogue du fournisseur, sans marge, de sorte qu'un changement de prix en amont est effectif de notre côté le jour même, et non à la prochaine renouvellement de contrat. Pour une pile vocale, les deux propriétés qui comptent sont que la cible de délégation peut être permutée sur du trafic en direct sans toucher à l'intégration vocale, et que le basculement automatique maintient un appel en vie lorsqu'un backend renvoie une erreur ou expire — ce qui vous permet de tester une configuration non éprouvée sur du trafic réel sans y adosser une ligne de production. Pour être précis sur ce que nous hébergeons et ce que nous n'hébergeons pas : ni le point de terminaison Gemini 3.8 Live Extended Thinking ni le point de terminaison GPT-Live-1 ne figurent sur notre routeur — ceux-ci proviennent des API propres à Google et à OpenAI. Les modèles textuels vers lesquels ils délèguent le sont très souvent, Gemini 3.8 Flash compris.
Le haut du classement, et à quel point il se stabilise peu
La capture ci-dessous a été prise le 16 septembre 2026 :
• Gemini 3.8 Live Extended Thinking (High) — 82,6, première place
• GPT-Live-1 (backend Astra, effort moyen) — 81,5
• Grok Voice Think Fast 2.0 High — 81,3
• GPT-Live-1 (backend Sol, faible effort) — 80,1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73,9
• Gemini 3.1 Flash Live High — 71.5
Trois choses méritent d’être relevées. Premièrement, la 1re et la 3e place sont séparées par 1,3 point, et la 1re et la 5e par 6,6, donc le haut de ce classement est une mêlée, pas un classement. Deuxièmement, le modèle dans le titre de cette confrontation n’est pas l’entrée Gemini classée cinquième — il s’agit du Gemini 3.8 Live standard, un produit différent et bien moins cher qu’il ne faut pas confondre avec la variante de raisonnement comparée ici. Troisièmement, il existe un précédent pour considérer tout chiffre d’indice unique comme provisoire : xAI a rapporté 82,9 pour Grok Voice Think Fast 2.0 en juillet, et ce modèle affiche 81,3 sur ce classement. Les scores d’indice rapportés par les fournisseurs ne survivent pas toujours au contact d’un classement en direct. Les chiffres τ-Voice de 68,6 % et 67,9 % figurent désormais sur un classement public établi avec le propre harnais d’Artificial Analysis, ils sont donc corroborés plutôt que simplement revendiqués — mais une différence de 0,7 point entre deux modèles sur le même harnais n’est pas une différence. Vérifiez-le sur votre trafic ou ignorez-le.

Un chiffre de plus à intégrer dans la décision, car c’est le nombre le moins confortable de cette comparaison : Google annonce 35,1 % pour Gemini 3.8 Live Extended Thinking sur le classement τ³-Banking de Sierra, contre 32,0 % pour GPT-Live-1 Astra. Ces chiffres sont déclarés par les fournisseurs, non reproduits, et ils décrivent un monde où l’agent vocal de premier plan de ce classement échoue à environ deux tentatives sur trois de tâches bancaires réalistes. Si votre agent doit accomplir un travail réglementé en plusieurs étapes, aucun de ces deux modèles n’est abouti — et une avance de 3,1 points sur ce benchmark n’est pas une raison de choisir un fournisseur, c’est une raison de garder un humain dans la boucle.

Donc : si la naturalité de la conversation est le produit et que vos appels sont courts et denses, le comportement full-duplex de GPT-Live-1 est un véritable avantage que l'indice ne peut pas voir, et la facturation à l'horloge de session est tolérable pour cette durée d'appel. Si les appels sont longs, calmes ou variables, ou si le raisonnement vocal et le coût horaire dominent, Gemini 3.8 Live Extended Thinking est en avance sur les composants qui comptent et environ 40 % moins cher par heure tout en le faisant — avec la réserve qu'il fonctionne par tours, qu'il est toujours en préversion pour les entreprises et qu'il nécessite une refonte du client avant de pouvoir exécuter vos outils. Ce que rien de tout cela ne justifie, c'est de choisir l'un ou l'autre sur la base de 1,1 point d'indice. Au vu des éléments disponibles, la raison honnête de choisir entre ces deux options est le modèle de facturation et l'architecture sous-jacente, et l'un comme l'autre sont des choses que vous pouvez mesurer sur votre propre trafic cette semaine.
Sur OrcaRouter, le basculement automatique maintient un appel actif lorsqu'un backend renvoie une erreur ou dépasse le délai d'attente.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
