
Gemini 3.8 Live-lek: twee nieuwe stem-slugs, en waarom 'Live Extended Thinking' er meer toe doet
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Twee strings die in geen enkele gepubliceerde documentatie voorkomen, doken deze week op op een GCP-quotapagina: Gemini 3.8 Live, en iets dat Live Extended Thinking heet. Ze werden opgemerkt door het release-trackingaccount @testingcatalog en gepost op 15 september, met de botte kanttekening dat geen van beide openbaar is. Dat is tot nu toe het hele publieke record — geen modelkaart, geen prijsregel, geen API-changelogvermelding, geen bevestiging. Maar de twee namen staan aan het einde van een zeer leesbare lijn. Gemini 3.1 Flash Live is nog steeds het model dat de eigen documentatie van het bedrijf aanbeveelt voor Live API-werk, Gemini 3.5 Live en Gemini 3.5 Live Experimental kwamen op 26 augustus aan als de Gemini Audio-familie, en de tekstkant van dezelfde familie — Gemini 3.8 Flash — is sinds 2 september beschikbaar. Een "3.8 Live" zou die kloof dichten. De tweede slug is de interessantere van de twee.
Eerst de labels, want een lekartikel staat of valt ermee. Dit is geen lancering. Geen van beide slugs is aangekondigd, gedocumenteerd, geprijsd of bevestigd door Google, en de bron is één account dat releases volgt. Alles hieronder dat specifiek over Gemini 3.8 Live en Live Extended Thinking gaat, is niet geverifieerd. Alles hieronder over modellen die al op de markt zijn — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — is gedocumenteerd en controleerbaar, en ik heb door de hele tekst gemarkeerd wat wat is.
Wat het signaal zegt, en wat het niet zegt
• Gerapporteerd — twee slugs, "Gemini 3.8 Live" en "Live Extended Thinking", die op een Google Cloud-quotapagina verschenen, gepost op 15 september met de opmerking dat ze "niet openbaar" zijn
• Niet gerapporteerd — een aankondiging, een modelkaart, een prijs, een contextvenster, een releasedatum, een API-id, een benchmarkcijfer, of enige bevestiging van Google
• Bevestiging — geen op het moment van schrijven. De Gemini API-modellenpagina van Google, voor het laatst bijgewerkt op 4 september, vermeldt precies twee conversationele Live-modellen, gemini-3.1-flash-live-preview en gemini-3.5-live-translate-preview, en geen van beide heeft een "Live Extended Thinking"-variant
• Zelfde briefing, afzonderlijke bewering — hetzelfde bericht van 15 september voorspelde ook dat Grok 4.7 "in de buurt van Opus 5.0 zou moeten uitkomen, niet bij 5.1" en dat zijn multimodale werk "nog steeds verbetering nodig heeft." Dat is het model van een andere leverancier en een voorspelling in plaats van een artefact; het wordt hier alleen vermeld voor de volledigheid van de bron
• De implicatie van de naam zelf — de quota-items van Google Cloud zijn per-model-sku's, wat pleit voor een factureerbaar API-model in plaats van een functie in de consumenten-Gemini-app. Dat is een gevolgtrekking uit het oppervlak waarop de string verscheen, geen bevestigd feit

Waarom een quotapagina de plek is waar een model het eerst lekt
Dit is het deel dat het begrijpen waard is, want het verklaart waarom een artefact van twee woorden een heel artikel verdient. Quotapagina's zijn geen marketingoppervlakken. Het zijn facturatie- en rate-limitinfrastructuur: elk model dat een Cloud-klant kan aanroepen, heeft een quota-vermelding per project nodig voordat het eerste betalende verzoek wordt bediend, en die vermeldingen worden geprovisioneerd door hetzelfde engineeringwerk dat een model gereedmaakt voor algemene beschikbaarheid. Een slug die daar opduikt, betekent dat iemand de leidingen voor een SKU heeft aangelegd — niet dat iemand een persbericht heeft opgesteld.
Dat snijdt aan beide kanten, en de eerlijke lezing is de voorzichtige. Een quota-vermelding is verder gevorderd dan een codenaam in een onderzoekspaper, want het impliceert een beoogd klantgericht oppervlak. Het is ook precies het soort ding dat vóór de lancering wordt aangemaakt, getest en stilletjes hernoemd. De tekstkant van deze familie is snel genoeg gegaan om dat concreet te maken: Gemini 3.6 Flash verscheen op 21 juli, Gemini 3.7 Flash op 13 augustus en Gemini 3.8 Flash op 2 september — drie Flash-releases in zes weken. Een modellijn die zo snel itereert, is een lijn die meer SKU's voorbereidt dan ze onder die namen uitbrengt.
De Live-lijn loopt een versie achter
Dit is wat van "Gemini 3.8 Live" een echt verhaal maakt in plaats van een naamgevingscuriositeit: de spraakmodellen van Google hebben helemaal geen gelijke tred gehouden met zijn tekstmodellen.
• Aanbevolen Live API-model op dit moment — gemini-3.1-flash-live-preview, laatste update maart 2026, nog steeds in Google's eigen documentatie beschreven als het model voor alle Live API-gebruiksscenario's
• De grenzen ervan — 131.072 invoertokens en 65.536 uitvoertokens, met tekst, afbeeldingen, audio en video als invoer en tekst en audio als uitvoer
• De Gemini Audio-familie, aangekondigd op 26 augustus — Gemini 3.5 Live, Gemini 3.5 Live Experimental en Gemini 3.5 Transcribe, waarbij de Transcribe-modellen Chirp 3 vervangen voor spraak-naar-tekst
• Ondertussen doorliep de tekstregel — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash en Gemini 3.8 Flash — vier publieke versies in ongeveer hetzelfde tijdsbestek

Dus de audiolijn zit op generatie 3.5, terwijl de tekstlijn op 3.8 zit. Een "Gemini 3.8 Live"-slug is het eerste bewijs dat Google van plan is spraak weer op dezelfde generatie als tekst te zetten — wat, voor iedereen die een voice agent bouwt, betekent dat de reasoning onder een Live-sessie in één keer met drie tekstmodelgeneraties zou kunnen springen in plaats van met één.
Waarom "Live Extended Thinking" de interessantere slug is
Tegenwoordig is denken op een Gemini Live-model een draaiknop, geen model. De Live API biedt een thinkingLevel-parameter met vier instellingen — minimaal, laag, gemiddeld en hoog — en de standaardwaarde is minimal, expliciet gekozen om te optimaliseren voor de laagste latentie. Die standaardwaarde vertelt je waarvoor het product bedoeld is: een gesprek waarin een pauze een bug is.
Een aparte slug genaamd "Live Extended Thinking" impliceert dat Google dat gaat opsplitsen in twee producten in plaats van één knop, en de redenering is eenvoudig. Latentie en beraad staan in een spraakmodel direct op gespannen voet met elkaar — je kunt niet tegelijk onmiddellijk antwoorden en diep nadenken voordat je antwoordt — dus een enkel model met een schakelaar dwingt elke aanroeper om voor elk verzoek één punt op die lijn te kiezen. Twee SKU's laten een klant het snelle pad (omgaan met onderbrekingen, barge-in, snelle lookups) en het langzame pad (een spraakagent die een taak met meerdere stappen doorloopt) naar verschillend afgestemde endpoints routeren, zonder dat het ene het andere verslechtert.
Het precedent bestaat al binnen Google's eigen augustuslancering. Gemini 3.5 Live Experimental werd beschreven als de variant die "direct kan redeneren terwijl hij spreekt" en tijdens een taak stap voor stap verslag kan doen van zijn voortgang — een stemmodel met een uitgesproken denk-karakter, uitgebracht onder een eigen id in plaats van als een instelling. "Live Extended Thinking" klinkt alsof dat instinct promoveert van een experimenteel label naar een benoemd product. Dat is een gevolgtrekking op basis van een string, en het is een gevolgtrekking — maar wel het soort dat deze specifieke productlijn eerder heeft beloond.
Wat je vandaag daadwerkelijk kunt bellen
Niets hier verandert wat je op dit moment kunt bereiken, en het is de moeite waard daar duidelijk over te zijn. Er is geen Gemini 3.8 Live-endpoint om aan te roepen, geen Live Extended Thinking-instelling om in te schakelen, en geen manier om toegang tot een van beide te kopen. Elk account dat vandaag "Gemini 3.8 Live access" verkoopt, verkoopt een label, geen model. De Live-modellen die je echt kunt gebruiken zijn gemini-3.1-flash-live-preview en gemini-3.5-live-translate-preview, beide in preview via de eigen API van Google.
De tekstkant is een ander verhaal, en het is het deel dat daadwerkelijk routeerbaar is. Gemini 3.8 Flash — uitgebracht op 2 september voor $0,75 per miljoen inputtokens en $3,75 per miljoen output tegen de eigen lijstprijs van Google, gepland om op 1 januari 2027 te verdubbelen naar $1,50 en $7,50 — draait op OrcaRouter tegen diezelfde lijstprijs, met 0% opslag erbovenop. Het doorberekenen van prijzen is belangrijker dan gewoonlijk bij een model met een vooraf aangekondigde prijsstijging: wanneer het januarbedrag ingaat, verandert dat hier dezelfde dag, zonder een tweede contract te hoeven heronderhandelen en zonder een codewijziging te hoeven doorvoeren.

De spraaklijn staat vandaag niet op OrcaRouter — geen enkele Live- of native-audio-SKU staat erop, van welke leverancier dan ook — dus niets hier mag worden opgevat als dat wij die hosten. Waar een routeringslaag echt nuttig voor is, is de andere helft van dit verhaal. Wanneer er dan een Live-model van de 3.8-generatie opduikt, en wanneer daarnaast een tweede variant met een ‘thinking’-inslag opduikt, wordt de keuze tussen een snel spraakpad en een delibererend pad een routeringsbeslissing in plaats van een herschrijving: twee endpoints achter één sleutel, met automatische failover als de preview-id waartegen je hebt gebouwd, komt te vervallen. Op een lijn die zich dit jaar al eens heeft hernoemd, is dat geen hypothetisch scenario.
Wat zou dit bevestigen — en wat zou het weerleggen?
Een artikel over een lek zou je moeten vertellen hoe het fout zou kunnen zijn. Voor Gemini 3.8 Live en Live Extended Thinking is het bevestigende bewijs specifiek en controleerbaar:
• De quota-vermelding die openbaar wordt — dezelfde slug die in een Google Cloud- of Vertex AI-modellijst verschijnt met een gekoppelde rate limit, in plaats van alleen in een screenshot
• Een changelogvermelding voor de Gemini API of een rij op de modellenpagina, die momenteel stopt bij gemini-3.1-flash-live-preview en gemini-3.5-live-translate-preview
• Een DeepMind-modelkaart — de audiomodellen van augustus werden daar gedocumenteerd als "Gemini 3.5 Audio", terwijl de berichtgeving ze Live en Transcribe noemde, dus de kaart is het artefact dat bepaalt welke naam het is.
• Een prijsregel, het enige dat van een voorbereide SKU een product maakt dat iemand kan kopen
• Ontkrachting — de slugs worden hernoemd, opgenomen in de denk-instellingen van het bestaande model, of verschijnen simpelweg nooit meer. Alle drie zijn gewone uitkomsten voor een quotapagina, en elk ervan betekent dat dit stuk vroeg was in plaats van juist.
Waarop te letten, en wie moet handelen
Als je een voice-agent bouwt op de Live API, hoeft er deze week niets aan je architectuur te veranderen — het model waarop je zou bouwen is nog steeds gemini-3.1-flash-live-preview, en het eerlijke advies is om de model-id achter een configuratiewaarde te houden en een tweede Live-endpoint warm te houden, want deze lijn heeft zich al eens eerder hernoemd en zou dat opnieuw kunnen doen. Als je een tekstmodel kiest, is deze lek irrelevant voor jou; Gemini 3.8 Flash wordt nu uitgebracht, geprijsd en meetbaar, en de nuttigere vraag is de prijswijziging van januari in plaats van een voice-slug.
Waar je echt op moet letten, is niet de lancering. Het is de vraag of "Live Extended Thinking" komt als een tweede model of als een vijfde instelling op het eerste. Als het een aparte SKU is, zegt Google tegen ontwikkelaars dat een spraakagent die denkt en een spraakagent die praat verschillende producten zijn — en dat is een verstrekkender bewering dan welk versienummer in de naam dan ook.
Waar een routinglaag echt nuttig voor is, is de andere helft van dit verhaal.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
