Une carte hero générée intitulée Gemini 3.8 Live, avec un badge UNVERIFIED en gras, le sous-titre « Deux slugs vocaux non publiés sur une page de quota Google Cloud – ce que nous savons pour l'instant », des pastilles indiquant « Source : X/@testingcatalog », « 15 sept. 2026 » et « Non public – aucune fiche de modèle », trois cartes indiquant « Slug signalé : Gemini 3.8 Live », « Slug signalé : Live Extended Thinking » et « Ligne live aujourd'hui : gemini-3.1-flash-live-preview, mars 2026 », et le pied de page « Les deux slugs ne sont pas vérifiés – Google n'a confirmé ni l'un ni l'autre. »
Guides & Insights

Fuite en direct de Gemini 3.8 : deux nouveaux slugs vocaux, et pourquoi « Live Extended Thinking » compte davantage

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux chaînes qui n'apparaissent dans aucune documentation publiée ont refait surface cette semaine sur une page de quotas GCP : Gemini 3.8 Live, et quelque chose appelé Live Extended Thinking. Elles ont été repérées par le compte de suivi des sorties @testingcatalog et publiées le 15 septembre, avec la mise en garde catégorique qu'aucune des deux n'est publique. C'est tout ce qui existe publiquement à ce jour — pas de fiche modèle, pas de ligne tarifaire, pas d'entrée dans le changelog de l'API, aucune confirmation. Mais les deux noms se trouvent au bout d'une ligne très lisible. Gemini 3.1 Flash Live reste le modèle que la documentation de l'entreprise elle-même recommande pour le travail avec la Live API, Gemini 3.5 Live et Gemini 3.5 Live Experimental sont arrivés le 26 août en tant que famille Gemini Audio, et le volet texte de cette même famille — Gemini 3.8 Flash — est disponible depuis le 2 septembre. Un « 3.8 Live » comblerait cet écart. Le second identifiant est le plus intéressant des deux.

D’abord les étiquettes, car un article sur une fuite tient ou s’effondre selon elles. Il ne s’agit pas d’un lancement. Aucun des deux noms de modèle n’a été annoncé, documenté, tarifé ni confirmé par Google, et la source est un seul compte qui suit les sorties. Tout ce qui suit concernant spécifiquement Gemini 3.8 Live et Live Extended Thinking n’est pas vérifié. Tout ce qui suit à propos des modèles déjà déployés — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — est documenté et vérifiable, et j’ai précisé au fil du texte ce qui est vérifié et ce qui ne l’est pas.

Ce que le signal dit, et ce qu'il ne dit pas

• Signalé — deux slugs, « Gemini 3.8 Live » et « Live Extended Thinking », apparaissant sur une page de quotas Google Cloud, publiés le 15 septembre avec la note qu’ils ne sont « pas publics »

• Non signalé — une annonce, une fiche de modèle, un prix, une fenêtre de contexte, une date de sortie, un identifiant d’API, un quelconque chiffre de benchmark, ou toute confirmation de Google

• Corroboration — aucune à l'heure où j'écris ces lignes. La page des modèles de l'API Gemini de Google, mise à jour pour la dernière fois le 4 septembre, répertorie exactement deux modèles Live conversationnels, gemini-3.1-flash-live-preview et gemini-3.5-live-translate-preview, et aucun des deux ne comporte de variante « Live Extended Thinking »

• Même note, affirmation distincte — le même billet du 15 septembre prévoyait également que Grok 4.7 « devrait se situer près d’Opus 5.0, et non de 5.1 » et que son travail multimodal « a encore besoin de travail ». Il s’agit du modèle d’un autre fournisseur et d’une prévision plutôt que d’un artefact ; ce n’est mentionné ici que pour l’exhaustivité de la source.

• L’implication du nom lui-même — les entrées de quota de Google Cloud sont des SKU par modèle, ce qui plaide en faveur d’un modèle d’API facturable plutôt que d’une fonctionnalité au sein de l’application Gemini grand public. Il s’agit d’une déduction à partir de la surface sur laquelle la chaîne est apparue, et non d’un fait confirmé

A generated six-row scoreboard titled 'Gemini 3.8 Live - the scoreboard', rows reading 'Status: leak - quota page only, not public', 'Reported slugs: Gemini 3.8 Live + Live Extended Thinking', 'Live line today: gemini-3.1-flash-live-preview, March 2026', 'Thinking control: thinkingLevel minimal/low/medium/high', 'Text sibling: Gemini 3.8 Flash, shipped Sept 2', 'Independent score: none - nothing to test', with the footer 'Gemini 3.8 Live and Live Extended Thinking unverified; Live-line details per Google's Gemini API docs.'

Pourquoi une page de quota est le premier endroit où un modèle fuit

Voici le point qui mérite d’être compris, car il explique pourquoi un artefact de deux mots mérite un article entier. Les pages de quotas ne sont pas des supports marketing. Elles constituent de l’infrastructure de facturation et de limitation de débit : chaque modèle qu’un client Cloud peut appeler nécessite une entrée de quota par projet avant que la première requête payante ne soit servie, et ces entrées sont provisionnées par le même travail d’ingénierie qui prépare un modèle pour la disponibilité générale. La présence d’un slug à cet endroit signifie que quelqu’un a construit la plomberie d’un SKU — et non que quelqu’un ait rédigé un communiqué de presse.

Cela joue dans les deux sens, et la lecture honnête est la plus prudente. Une entrée de quota est plus avancée qu’un nom de code dans un article de recherche, car elle implique une surface destinée aux clients. C’est aussi exactement le genre de chose que l’on crée, teste et renomme discrètement avant le lancement. Le versant texte de cette famille a évolué assez vite pour rendre cela concret : Gemini 3.6 Flash est arrivé le 21 juillet, Gemini 3.7 Flash le 13 août, et Gemini 3.8 Flash le 2 septembre — trois sorties de Flash en six semaines. Une gamme de modèles qui itère aussi rapidement est une gamme qui prépare plus de SKU qu’elle n’en commercialise sous ces noms.

La ligne Live tourne avec une version de retard.

Voici ce qui fait de « Gemini 3.8 Live » une véritable histoire plutôt qu'une simple curiosité de nommage : les modèles vocaux de Google n'ont pas du tout évolué au même rythme que ses modèles de texte.

• Modèle Live API recommandé aujourd'hui — gemini-3.1-flash-live-preview, dernière mise à jour en mars 2026, toujours décrit dans la documentation de Google elle-même comme le modèle à utiliser pour tous les cas d'utilisation de Live API

• Ses limites — 131 072 jetons d’entrée et 65 536 jetons de sortie, acceptant du texte, des images, de l’audio et de la vidéo en entrée, et renvoyant du texte et de l’audio en sortie

• La famille Gemini Audio, annoncée le 26 août — Gemini 3.5 Live, Gemini 3.5 Live Experimental et Gemini 3.5 Transcribe, les modèles Transcribe remplaçant Chirp 3 pour la transcription de la parole

• Pendant ce temps, la gamme textuelle — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash et Gemini 3.8 Flash — est passée par quatre versions publiques dans à peu près la même fenêtre

A screenshot of Google's Gemini API documentation page for gemini-3.1-flash-live-preview, captured September 15, 2026, showing the banner 'Gemini 3.8 Flash is now available', the heading 'Gemini 3.1 Flash Live preview' described as a low-latency audio-to-audio model, model code gemini-3.1-flash-live-preview, supported data types text/images/audio/video in and text and audio out, an input token limit of 131,072 and an output token limit of 65,536, and capability chips including Live API Supported and Thinking Supported.

Ainsi, la ligne audio se situe à la génération 3.5, tandis que la ligne texte est à la 3.8. Un slug « Gemini 3.8 Live » est la première preuve que Google a l’intention de remettre la voix sur la même génération que le texte — ce qui, pour quiconque développe un agent vocal, signifie que le raisonnement sous une session Live pourrait bondir de trois générations de modèle texte d’un coup plutôt que d’une seule.

Pourquoi « Live Extended Thinking » est le slug le plus intéressant

Aujourd'hui, sur un modèle Gemini Live, la réflexion est un réglage, pas un modèle. L'API Live expose un thinkingLevel paramètre avec quatre niveaux — minimal, low, medium et high — et la valeur par défaut est minimal, choisie explicitement pour optimiser la latence la plus faible. Ce choix par défaut vous dit à quoi sert le produit : une conversation dans laquelle une pause est un bug.

Un slug distinct appelé « Live Extended Thinking » implique que Google se prépare à scinder cela en deux produits plutôt qu’un seul réglage, et le raisonnement est simple. La latence et la délibération sont en tension directe dans un modèle vocal — on ne peut pas à la fois répondre instantanément et réfléchir longuement avant de répondre — donc un modèle unique avec un interrupteur force chaque appelant à choisir un point sur cette ligne pour chaque requête. Deux SKU permettent à un client d’acheminer le chemin rapide (gestion des interruptions, barge-in, recherches rapides) et le chemin lent (un agent vocal qui accomplit une tâche en plusieurs étapes) vers des points de terminaison réglés différemment, sans que l’un dégrade l’autre.

Le précédent existe déjà au sein du propre lancement d’août de Google. Gemini 3.5 Live Experimental était décrit comme la variante capable de « raisonner directement tout en parlant » et de narrer sa progression étape par étape pendant une tâche — un modèle vocal explicitement teinté de réflexion, livré sous son propre identifiant plutôt qu’en tant que paramètre. « Live Extended Thinking » se lit comme cet instinct qui passe d’une étiquette expérimentale à un produit nommé. Cela relève de l’inférence à partir d’une chaîne, et c’en est bien une — mais c’est le genre que cette ligne particulière a déjà récompensé par le passé.

Ce que vous pouvez réellement appeler aujourd'hui

Rien ici ne change ce à quoi vous pouvez accéder dès maintenant, et il vaut la peine d’être direct à ce sujet. Il n’existe aucun point de terminaison Gemini 3.8 Live à appeler, aucun paramètre Live Extended Thinking à activer, et aucun moyen d’acheter l’accès à l’un ou à l’autre. Tout compte qui vend « Gemini 3.8 Live access » aujourd’hui vend une étiquette, pas un modèle. Les modèles Live que vous pouvez réellement utiliser sont gemini-3.1-flash-live-preview et gemini-3.5-live-translate-preview, tous deux en aperçu via l’API de Google.

Le côté texte, c'est une autre histoire, et c'est la partie qui est réellement routable. Gemini 3.8 Flash — disponible depuis le 2 septembre à 0,75 $ par million de jetons d'entrée et 3,75 $ par million de jetons de sortie au tarif catalogue de Google lui-même, et dont le prix doit doubler pour passer à 1,50 $ et 7,50 $ le 1er janvier 2027 — tourne sur OrcaRouter à ce même tarif catalogue, sans aucune marge ajoutée. La tarification en répercussion compte plus que d'ordinaire pour un modèle dont la hausse est annoncée à l'avance : quand le tarif de janvier entre en vigueur, il change ici le jour même, sans second contrat à renégocier et sans la moindre modification de code à apporter.

The OrcaRouter model page for google/gemini-3.8-flash, showing the Google vendor name and the 2026-09-02 date, a 1M-token context window, 65K max output, text, image, video, file and audio input with text output, a p50 time-to-first-token of 3.46s, and pricing of $0.75 per 1M input tokens and $3.75 per 1M output tokens.

La gamme vocale n'est pas sur OrcaRouter aujourd'hui — aucun SKU Live ou native-audio ne l'est, quel que soit le fournisseur — donc rien ici ne doit être interprété comme signifiant que nous l'hébergeons. Ce à quoi une couche de routage sert vraiment, c'est l'autre moitié de cette histoire. Quand un modèle Live de génération 3.8 finira par arriver, et quand une seconde variante, orientée réflexion, arrivera à ses côtés, choisir entre une voie vocale rapide et une voie délibérative devient une décision de routage plutôt qu'une réécriture : deux points de terminaison derrière une seule clé, avec basculement automatique si l'identifiant de préversion sur lequel vous avez construit est retiré. Sur une gamme qui s'est déjà renommée une fois cette année, ce n'est pas hypothétique.

Qu'est-ce qui confirmerait cela — et qu'est-ce qui le tuerait ?

Un article de fuite devrait indiquer en quoi il pourrait se tromper. Pour Gemini 3.8 Live et Live Extended Thinking, les preuves à l’appui sont précises et vérifiables :

• L'entrée de quota qui devient publique — le même slug qui apparaît dans une liste de modèles Google Cloud ou Vertex AI avec une limite de débit associée, et non pas seulement dans une capture d'écran

• Une entrée du journal des modifications de l'API Gemini ou une ligne sur la page des modèles, qui s'arrête actuellement à gemini-3.1-flash-live-preview et gemini-3.5-live-translate-preview

• Une fiche de modèle DeepMind — les modèles audio d’août y étaient documentés sous le nom « Gemini 3.5 Audio » alors même que la couverture médiatique les appelait Live et Transcribe, donc la fiche est l’artefact qui tranche sur un nom

• Une ligne de tarification, la seule chose qui transforme un SKU en préparation en un produit que l’on peut acheter

• Infirmation — les slugs étant renommés, intégrés aux paramètres de réflexion du modèle existant, ou tout simplement ne réapparaissant jamais. Ces trois cas sont des résultats ordinaires pour une page de quota, et chacun d’eux signifie que ce texte était en avance plutôt que correct.

Ce qu'il faut surveiller, et qui doit agir

Si vous développez un agent vocal sur la Live API, rien dans votre architecture n’a besoin de changer cette semaine — le modèle sur lequel vous bâtiriez est toujours gemini-3.1-flash-live-preview, et le conseil honnête est de garder l’id du modèle derrière une valeur de configuration et de maintenir un second point de terminaison Live prêt, car cette ligne s’est déjà renommée une fois et pourrait bien le refaire. Si vous choisissez un modèle de texte, cette fuite ne vous concerne pas ; Gemini 3.8 Flash est en cours de déploiement, avec un prix et des mesures disponibles dès maintenant, et la question plus utile est le changement de prix de janvier plutôt qu’un slug vocal.

Ce qu’il faut vraiment surveiller, ce n’est pas le lancement. C’est de savoir si « Live Extended Thinking » arrive comme un deuxième modèle ou comme un cinquième réglage sur le premier. S’il s’agit d’une référence distincte, Google dit aux développeurs qu’un agent vocal qui réfléchit et un agent vocal qui parle sont des produits différents — et c’est une affirmation plus lourde de conséquences que n’importe quel numéro de version dans le nom.

Ce pour quoi une couche de routage est réellement utile, c'est l'autre moitié de cette histoire.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement