Carte de titre principale pour Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live, montrant les deux modèles séparés par un coût audio horaire 4x, 3,50 $ contre 0,84 $.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live : payer 4 fois plus pour les 38 points qui comptent

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux modèles, un lancement, une grille tarifaire, et une décision que la plupart des comptes rendus interprètent mal dans le même sens. Gemini 3.8 Live Extended Thinking et Gemini 3.8 Live sont sortis ensemble le 15 septembre 2026, tous deux bâtis sur Gemini 3 Pro, tous deux prenant en charge 97 langues avec basculement automatique en cours de conversation, tous deux acceptant une entrée visuelle quasi en temps réel, tous deux appliquant un filigrane SynthID à l’audio généré. Sur l’indice composite Speech to Speech Index que publie Artificial Analysis, ils sont séparés de 6,6 points — 82,6 contre 76,0. Sur le coût horaire de l’audio que ce même classement mesure, l’écart entre eux est d’un peu plus de quatre fois.

Aucun de ces deux nombres n'est celui qui devrait décider de votre architecture. Celui qui devrait le faire est 38 : l'écart entre les deux sur τ-Voice, le composant agentique d'accomplissement de tâches, où la variante de raisonnement résout 68,6 % des scénarios de service client répliqués et la variante standard en résout 30,1 %. Vous ne choisissez pas entre un bon modèle et un meilleur. Vous choisissez entre une interface conversationnelle et un système de raisonnement qui se trouve être capable de parler, et la différence de prix est l'aspect le moins intéressant de ce choix.

La fourchette de prix, dans les unités qui vous sont réellement facturées.

Commencez par la facture, car c'est la partie que les gens traitent correctement, puis à laquelle ils accordent trop de poids. Les deux modèles appliquent le même tarif publié via l'API Live : 0,005 $ par minute d'entrée audio et 0,018 $ par minute de sortie audio, et du côté Extended Thinking, ces tokens de sortie incluent la réflexion. Même fiche tarifaire, mêmes tarifs, pas de niveau premium distinct pour le raisonnement.

La divergence apparaît dès que l'on mesure le travail plutôt que les minutes. La colonne « coût par heure d'audio en entrée » d'Artificial Analysis — le coût pour traiter un sous-ensemble fixe de 40 questions de Big Bench Audio, normalisé en coût horaire — place les deux modèles dans des catégories totalement différentes :

Gemini 3.8 Live Extended Thinking (High) — 3,50 $ par heure d'audio en entrée, selon la propre mesure d'Artificial Analysis

Gemini 3.8 Live — 0,84 $ par heure, le taux de rémunération le plus bas sur ce tableau

• GPT-Live-1 (backend Astra, effort moyen) — 5,83 $ par heure, donc la variante de raisonnement reste environ 40 % moins chère que le modèle qu’elle surpasse

Grok Voice Think Fast 2.0 High — 4,80 $ par heure

• GPT-Realtime-2.1 High — 10,75 $ par heure

Voilà la bifurcation : quatre fois le coût horaire de l'audio, au même tarif public à la minute, parce que la variante de raisonnement consomme plus de tokens pour la même quantité d'écoute. Le 0,84 $ du modèle standard n'est pas une réduction : c'est le plancher de tout le tableau.

Ce que les 38 points rapportent

Décomposez le composite et les deux modèles cessent de ressembler à une paire :

Indice parole à parole — Gemini 3.8 Live Extended Thinking (High) 82,6 vs Gemini 3.8 Live 76,0

Performance agentique (réalisation de tâches τ-Voice) — 68,6 % vs 30,1 %

Raisonnement vocal (Big Bench Audio) — 98 % vs 92 %

Dynamique conversationnelle — 91,9 % vs 96,1 %

Préférence d'arène (Elo) — 990 vs 1083

Taux de réussite des tâches — 89,1 % contre 93,2 %

Délai avant le premier son — 1,35 s vs 1,18 s

Coût par heure d'audio d'entrée — 3,50 $ contre 0,84 $

Lisez cela honnêtement et le modèle le moins cher remporte quatre des huit lignes. Il atteint plus rapidement le premier audio, est préféré par l'arène, est plus susceptible de mener à bien une tâche superficielle et est mieux noté sur la dynamique conversationnelle — ce dernier point n'est pas un lot de consolation, car la dynamique conversationnelle est ce qu'un appelant remarque. Ce qu'il ne peut pas faire, c'est terminer un travail qui comporte des étapes. 30,1 % contre 68,6 % est le plus grand écart isolé dans toute cette version, et il se situe sur l'unique axe qui sépare un agent d'une interface.

Deux mises en garde sur ces lignes. Le chiffre de préférence d’arène à l’intérieur de l’indice est figé au moment où un modèle devient éligible à la publication ; il s’agit donc d’un instantané plutôt que d’un Elo glissant — à interpréter comme une note à un instant donné, et non comme le graphique en direct de Speech Agent Arena. Et le haut du classement τ-Voice est serré : la variante de raisonnement à 68,6 % devance GPT-Live-1 à 67,9 % (backend Astra, effort moyen) de 0,7 point, avec GPT-Live-1 (Sol, effort faible) à 59,3 % et Grok Voice Think Fast 2.0 High à 56,5 % derrière. L’avance de 0,7 point sur GPT-Live-1 se situe dans le bruit. L’écart de 38 points au sein de ce duo ne l’est pas.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

L'autre 4x : ce que le palier de raisonnement vous coûte en code

Il y a un deuxième fork dans cette version, et il n'apparaît sur aucun classement. Les deux modèles ne sont pas interchangeables directement, car la variante de raisonnement modifie le contrat que votre client doit honorer.

Sur le modèle standard, Gemini 3.8 Live se comporte comme un client de Live API s'y attend : les appels d'outils et d'API en arrière-plan s'exécutent pendant que le modèle continue de parler, et turnComplete: true marque toujours la fin d'un tour. Il n'y a pas de paramètre de niveau de réflexion à choisir, car il n'y a rien de séparé à configurer — le modèle répond, et lorsqu'il a répondu, le tour est terminé.

Sur Gemini 3.8 Live Extended Thinking, trois choses changent en même temps :

Les appels de fonction sont toujours asynchrones. Une déclaration d'outil bloquante ne fait pas la queue poliment — elle renvoie une erreur dure. Tout schéma d'outil que vous avez écrit pour le modèle standard doit être redéclaré comme non bloquant.

Un nouveau champ de statut porte l’état réel. Les clients doivent lire interaction_status au lieu de se fier à turnComplete : le champ indique IN_PROGRESS tant que le modèle est encore en train de raisonner ou qu’un outil est encore en cours d’exécution, et ne passe à IDLE que lorsque l’ensemble de la tâche est terminé. Un tour peut se terminer alors que la tâche n’est pas encore terminée.

La profondeur de réflexion est un réglage. Le modèle expose des niveaux de raisonnement configurables — faible, moyen et élevé — et les chiffres 82,6 et 68,6 au tableau correspondent à la (Élevé) configuration. Passer à faible modifie à la fois la qualité et la facture de tokens, et rien sur l'indice ne vous dit ce que le niveau faible vous coûte en termes d'achèvement des tâches.

Ce troisième point est le piège de la migration. Parce qu’Extended Thinking répond de la même manière sur le fil que le modèle standard tant qu’un appel d’outil n’entre pas en jeu, une équipe peut remplacer l’ID du modèle, voir une démo fonctionnelle et ne découvrir le contrat asynchrone qu’en production lorsqu’un outil de réservation renvoie une erreur au lieu d’un résultat. Prévoyez le remaniement du client en plus du tarif audio 4× ; sur une intégration mature, c’est le plus élevé des deux coûts.

Lequel votre charge de travail demande-t-elle réellement ?

La façon la plus propre de décider consiste à se demander à quoi sert la session, et non à quel point vous voulez qu’elle soit intelligente.

Choisissez Gemini 3.8 Live lorsque la conversation est le livrable. Répondre, tenir le fil, prendre un message, qualifier un appelant, être agréable, rapide et économique. À 0,84 $ l’heure d’audio en entrée, c’est le modèle vocal compétent le moins cher actuellement publié par quiconque, il est préféré par l’arène, il est plus fiable sur les tâches superficielles et il est 170 millisecondes plus rapide jusqu’au premier audio — une différence qu’un appelant ressent. La seule chose à accepter, c’est le plafond : 30,1 % sur l’achèvement de tâches à plusieurs étapes signifie qu’il ne terminera pas un travail qui comporte des étapes, et aucune quantité d’ingénierie de prompt ne fera bouger ce nombre.

Prenez Gemini 3.8 Live Extended Thinking lorsque la session a une tâche à accomplir. Réserver, modifier, annuler, résoudre un problème de compte, guider un appelant à travers un processus en plusieurs étapes pendant qu’il attend. C’est la ligne des 38 points, et elle vaut 3,50 $ de l’heure — ce qui, notez-le, reste moins cher que les deux modèles qu’il surpasse au score composite. Vous obtenez aussi le comportement de narration qui rend l’attente tolérable : ce modèle raisonne et parle en même temps, donc au lieu du silence pendant qu’il cherche une information, l’appelant entend « Laissez-moi vérifier… » et la progression au fur et à mesure. C’est le même problème que les architectures full-duplex résolvent en n’arrêtant jamais l’audio ; la réponse de Google consiste à continuer de parler pendant le travail.

Deux lignes de plus qui méritent d'être pesées. Google rapporte également 35,1 % pour le modèle Extended Thinking sur le classement τ³-Banking de Sierra, contre 32,0 % pour GPT-Live-1 Astra — un chiffre rapporté par le fournisseur, sans aucune lecture indépendante à l'appui, et qui donne à réfléchir en termes absolus, puisque 35,1 % signifie que le meilleur modèle de ce classement échoue à environ deux tentatives sur trois de tâches bancaires réalistes. Et la deuxième place du modèle standard dans la Speech Agent Arena, que Google cite dans ses propres supports, est un résultat bien réel sur un autre classement, qui mesure la préférence plutôt que l'achèvement des tâches. Les deux affirmations tiennent. Prises ensemble, elles disent que le modèle bon marché est très doué pour qu'on lui parle, et que le modèle coûteux est le seul des deux à qui l'on peut confier du travail.

Exécuter les deux, sans deux intégrations

L'objection pratique à tout cela, c'est que choisir en fonction de la charge de travail implique de maintenir deux chemins. Ce n'est pas nécessaire. Les deux variantes se trouvent devant la même classe de backend — l'exécution d'outils en arrière-plan et la planification en plusieurs étapes se résolvent en appels ordinaires à un modèle de texte — et c'est à cette couche que réside la variance de vos coûts et que le basculement est peu coûteux.

OrcaRouter met 190 modèles à disposition depuis une seule clé, au prix catalogue du fournisseur, sans marge, de sorte qu'un changement de prix d'un fournisseur est répercuté de notre côté le jour même plutôt qu'à la prochaine renégociation de contrat. Pour une pile qui route entre un palier conversationnel bon marché et un palier de raisonnement coûteux, les deux propriétés qui comptent sont que la cible de délégation peut être changée sur du trafic en direct sans toucher à l'intégration vocale, et qu'un basculement automatique maintient une session active lorsqu'un backend renvoie une erreur ou dépasse le délai d'attente. Pour être précis sur ce que nous hébergeons et ce que nous n'hébergeons pas : les points de terminaison Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking ne sont pas sur notre routeur — ils proviennent de l'API de Google elle-même, dans l'API Gemini, l'API Live et Google AI Studio. Les modèles textuels à qui ces agents confient très souvent leur travail sont de ceux-là, et Gemini 3.8 Flash en fait partie.

Où se situe chaque modèle sur le plateau

La capture ci-dessous a été prise le 16 septembre 2026, et le haut du Speech to Speech Index se lit comme suit :

Gemini 3.8 Live Extended Thinking (High) — 82,6, première place

• GPT-Live-1 (backend Astra, effort moyen) — 81,5

• Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (backend Sol, faible effort) — 80,1

Gemini 3.8 Live — 76,0, cinquième place

• GPT-Realtime-2.1 High — 73,9

• Gemini 3.1 Flash Live High — 71.5

Une note sur la nomenclature pendant que vous lisez cette liste : le (High) suffixe associé à ce modèle dans la couverture est une étiquette de configuration d'effort de raisonnement, et non une version distincte. C'est la même convention que celle qu'utilise le tableau pour Grok Voice Think Fast 2.0 High et GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Qu’est-ce qui n’est pas encore commité ?

Une chose à propos de ce duo est facile à mal interpréter, il vaut donc la peine de le dire clairement : aucun des deux modèles n’est en disponibilité générale au sens contractuel, même si les deux sont tarifés et documentés.

Les développeurs obtiennent Gemini 3.8 Live dans l'API Gemini, l'API Live et Google AI Studio sous l'ID gemini-3.8-live ; les entreprises obtiennent un aperçu privé dans Gemini Enterprise, avec Gemini Enterprise for Customer Experience annoncé comme bientôt disponible ; les consommateurs y ont accès dans Search Live. Gemini 3.8 Live Extended Thinking dispose de la même surface développeur sous gemini-3.8-live-extended-thinking, ainsi qu'un parcours consommateur plus large — Gemini Live, Docs Live pour les abonnés Google AI Pro et Ultra, et Gmail Live et Keep Live pour tous les abonnés Google AI. Les clients professionnels Workspace sont annoncés comme bientôt disponibles.

Ce qui manque, c'est ce dont une entreprise a besoin avant de mettre une ligne de revenus là-dessus : un engagement de disponibilité générale, un taux de disponibilité publié et un tarif que Google s'est engagé à maintenir. Les prix sont publiés, et les tarifs de préversion ont tendance à évoluer. Prototypez dès maintenant, planifiez la migration, et ne signez pas un objectif de disponibilité que l'on ne vous a pas donné.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

La décision que ce duo présente réellement est plus étroite que l'indice ne le laisse paraître, et ce n'est pas une échelle de qualité. Si le travail de votre agent est de parler, le modèle bon marché n'est pas un compromis — c'est le meilleur produit au prix le plus bas, et le tarif quatre fois moins cher est un bonus plutôt que l'argument. Si le travail de votre agent est de terminer quelque chose, la variante de raisonnement est la seule des deux à qui l'on peut confier la tâche, et 3,50 $ l'heure est une erreur d'arrondi face à une réservation qui échouerait autrement. L'erreur à éviter est de couper la poire en deux : payer pour de la profondeur de raisonnement sur une charge de travail qui n'a jamais eu besoin que d'une bonne conversation, ce qui se produit lorsqu'une équipe lit l'écart composite de 6,6 points et ne fait jamais défiler jusqu'au 38.