
Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: 4x betalen voor de 38 punten die ertoe doen
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Twee modellen, één lancering, één tariefkaart, en een beslissing die de meeste verslagen in dezelfde richting verkeerd voorstellen. Gemini 3.8 Live Extended Thinking en Gemini 3.8 Live werden op 15 september 2026 samen uitgebracht, beide gebouwd op Gemini 3 Pro, beide ondersteunen ze 97 talen met automatische wisseling midden in een gesprek, beide accepteren ze bijna realtime visuele input, beide voorzien ze gegenereerde audio van een watermerk met SynthID. Op de samengestelde Speech to Speech Index die Artificial Analysis publiceert, liggen ze 6,6 punten uit elkaar — 82,6 tegenover 76,0. Op de kosten per uur voor audio die datzelfde dashboard meet, liggen ze iets meer dan vier keer uit elkaar.
Geen van beide is het getal dat je architectuur zou moeten bepalen. Het getal dat dat wel zou moeten zijn, is 38: het verschil tussen de twee op τ-Voice, de agentische taakvoltooiingscomponent, waarbij de redeneervariant 68,6% van de replica-klantenservicescenario's oplost en de standaardvariant 30,1%. Je kiest niet tussen een goed model en een beter model. Je kiest tussen een gespreksinterface en een redeneersysteem dat toevallig praat, en het prijsverschil is het minst interessante aspect van die keuze.
De prijsvork, in de eenheden waarin je daadwerkelijk wordt gefactureerd
Begin bij de rekening, want dat is het onderdeel dat mensen goed inschatten en vervolgens te zwaar laten wegen. Beide modellen hanteren hetzelfde gepubliceerde tarief via de Live API: $0,005 per minuut audio-invoer en $0,018 per minuut audio-uitvoer, en aan de Extended Thinking-kant omvatten die uitvoertokens ook het denkproces. Dezelfde kaart, dezelfde tarieven, geen aparte premiumcategorie voor redeneren.
Het uiteenlopen wordt zichtbaar zodra je werk meet in plaats van minuten. De kolom cost-per-hour-of-input-audio van Artificial Analysis — de kosten voor het voltooien van een vaste subset van 40 vragen uit Big Bench Audio, genormaliseerd naar een uurtarief — plaatst de twee modellen in volledig verschillende categorieën:
• Gemini 3.8 Live Extended Thinking (High) — $ 3,50 per uur aan invoeraudio, volgens de eigen meting van Artificial Analysis
• Gemini 3.8 Live — $0,84 per uur, het laagste betaalde tarief op dat prikbord
• GPT-Live-1 (Astra-backend, gemiddelde inspanning) — $5,83 per uur, dus de redeneervariant is nog steeds ongeveer 40% goedkoper dan het model dat hij verslaat
• Grok Voice Think Fast 2.0 High — $4,80 per uur
• GPT-Realtime-2.1 High — $10,75 per uur
Dat is de tweesprong: vier keer de uurlijkse audiokosten, tegen hetzelfde gepubliceerde tarief per minuut, omdat de redeneervariant meer tokens verbruikt voor dezelfde hoeveelheid luisteren. De $0,84 van het standaardmodel is geen korting, het is de ondergrens van het hele bord.
Wat de 38 punten opleveren
Haal de composiet uit elkaar en de twee modellen lijken niet langer een paar:
• Spraak-naar-spraakindex — Gemini 3.8 Live Extended Thinking (High) 82,6 versus Gemini 3.8 Live 76,0
• Agentische prestaties (τ-Voice-taakvoltooiing) — 68,6% vs. 30,1%
• Spraakredenering (Big Bench Audio) — 98% vs 92%
• Gespreksdynamiek — 91,9% vs 96,1%
• Arena-voorkeur (Elo) — 990 vs 1083
• Taaksuccespercentage — 89,1% vs 93,2%
• Tijd tot eerste audio — 1,35s vs 1,18s
• Kosten per uur aan inputaudio — $3,50 vs $0,84
Lees dat eerlijk en het goedkopere model wint vier van de acht regels. Het is sneller tot de eerste audio, krijgt de voorkeur in de arena, maakt meer kans om een oppervlakkige taak te voltooien en scoort beter op gespreksdynamiek — en dat laatste is geen troostprijs, want gespreksdynamiek is wat een beller merkt. Wat het niet kan, is een taak met stappen afmaken. Dertig komma één procent tegenover 68,6% is het grootste afzonderlijke verschil in deze release, en het valt op de enige as die een agent van een interface scheidt.
Twee kanttekeningen bij die rijen. Het arena-voorkeurcijfer in de index wordt bevroren op het moment dat een model in aanmerking komt voor publicatie, dus het is een momentopname in plaats van een doorlopende Elo — lees het als een rating op een bepaald moment en niet als de live Speech Agent Arena-grafiek. En de top van de τ-Voice-ranglijst ligt dicht bij elkaar: de reasoning-variant met 68,6% gaat met 0,7 punt voor op GPT-Live-1 met 67,9% (Astra-backend, medium effort), met GPT-Live-1 (Sol, low effort) op 59,3% en Grok Voice Think Fast 2.0 High op 56,5% daarachter. De voorsprong van 0,7 punt op GPT-Live-1 valt binnen de ruis. Het gat van 38 punten binnen dit paar niet.

De andere 4x: wat de reasoning-tier je in code kost
Er is een tweede fork in deze release, en die verschijnt op geen enkel leaderboard. De twee modellen zijn niet zomaar uitwisselbaar, omdat de reasoning-variant het contract verandert waaraan je client moet voldoen.
Bij het standaardmodel, Gemini 3.8 Live gedraagt zich zoals een Live API-client verwacht: achtergrondtool- en API-aanroepen worden uitgevoerd terwijl het model blijft praten, en turnComplete: true markeert nog steeds het einde van een beurt. Er is geen instelling voor denkniveau om te kiezen, want er is niets apart te configureren — het model antwoordt, en wanneer het heeft geantwoord, is de beurt voorbij.
Bij Gemini 3.8 Live Extended Thinking veranderen er drie dingen tegelijk:
• Functieaanroepen zijn altijd asynchroon. Een blokkerende tool-declaratie wordt niet netjes in de wachtrij geplaatst — deze retourneert een harde fout. Elk toolschema dat u voor het standaardmodel hebt geschreven, moet opnieuw worden gedeclareerd als niet-blokkerend.
• Een nieuw statusveld geeft de werkelijke toestand weer. Clients moeten interaction_status lezen in plaats van te vertrouwen op turnComplete: het veld staat op IN_PROGRESS terwijl het model nog aan het redeneren is of een tool nog draait, en pas overgaat naar IDLE wanneer de hele taak is voltooid. Een beurt kan eindigen terwijl de taak nog niet is voltooid.
• Denkdiepte is een instelling. Het model biedt configureerbare redeneerniveaus — laag, gemiddeld en hoog — en de 82,6- en 68,6-cijfers op het bord zijn de (Hoog) configuratie. Overstappen naar laag verandert zowel de kwaliteit als de tokenrekening, en niets op de index vertelt je wat laag je kost aan taakvoltooiing.
Dat derde punt is de migratieval. Omdat Extended Thinking op de wire hetzelfde antwoordt als het standaardmodel totdat er een toolaanroep in het spel is, kan een team de model-ID omwisselen, een werkende demo zien en pas in productie het async-contract ontdekken wanneer een boekings-tool een fout retourneert in plaats van een resultaat. Begroot de client-refactor naast het 4× audiotarief; bij een volwassen integratie is die van de twee kostenposten de grootste.
Welke je werkbelasting eigenlijk om vraagt
De zuivere manier om te beslissen is je af te vragen waarvoor de sessie dient, niet hoe slim je wilt dat hij is.
Kies Gemini 3.8 Livewanneer het gesprek het eindproduct is. Beantwoorden, een gesprek gaande houden, een boodschap aannemen, een beller kwalificeren, aangenaam en snel en goedkoop zijn. Voor $0,84 per uur inputaudio is het het goedkoopste competente stemmodel dat momenteel door iemand wordt gepubliceerd, het heeft de voorkeur van de arena, het is betrouwbaarder bij oppervlakkige taken, en het is 170 milliseconden sneller tot de eerste audio — een verschil dat een beller voelt. Het enige dat je moet accepteren, is het plafond: 30,1% bij het voltooien van taken met meerdere stappen betekent dat het werk met stappen niet afmaakt, en geen enkele hoeveelheid prompt engineering verandert dat getal.
Kies Gemini 3.8 Live Extended Thinking wanneer de sessie een taak heeft. Een afspraak boeken, wijzigen, annuleren, een accountprobleem oplossen, een beller door een proces met meerdere stappen leiden terwijl deze wacht. Dat is de 38-puntsgrens, en die is $3,50 per uur waard — wat, let op, nog steeds goedkoper is dan beide modellen die het op de samengestelde score overtreft. Je krijgt ook het vertelgedrag dat het wachten draaglijk maakt: dit model redeneert en spreekt tegelijk, dus in plaats van stilte terwijl het iets opzoekt, hoort de beller "Laat me dat even nakijken…" en de voortgang terwijl het vordert. Dat is hetzelfde probleem dat full-duplex-architecturen oplossen door de audio nooit te stoppen; Googles antwoord is om over het werk heen te blijven praten.
Nog twee rijen om af te wegen. Google rapporteert ook 35,1% voor het Extended Thinking-model op Sierra's τ³-Banking-ranglijst, tegenover 32,0% voor GPT-Live-1 Astra — een door de leverancier gerapporteerd cijfer zonder onafhankelijke meting erachter, en in absolute termen een ontnuchterend cijfer, want 35,1% betekent dat het beste model op die ranglijst bij ongeveer twee van elke drie pogingen tot een realistische banktaak faalt. En de tweede plaats van het standaardmodel in de Speech Agent Arena, die Google in zijn eigen materialen aanhaalt, is een echt resultaat op een andere ranglijst die voorkeur meet in plaats van taakvoltooiing. Beide beweringen houden stand. Samen zeggen ze dat het goedkope model heel goed is om mee te praten en dat het dure model van de twee het enige is waaraan werk kan worden gegeven.
Beide uitvoeren, zonder twee integraties
Het praktische bezwaar tegen dit alles is dat per workload kiezen betekent dat je twee paden moet onderhouden. Dat hoeft niet. Beide varianten zitten vóór dezelfde klasse van backend — uitvoering van tools op de achtergrond en meerstapsplanning komen neer op gewone tekstmodel-aanroepen — en die laag is waar je kostenvariantie zit en waar overstappen goedkoop is.
OrcaRouter biedt 190 modellen vanaf één sleutel tegen de lijstprijs van de provider, zonder markup, zodat een prijswijziging van een leverancier bij ons dezelfde dag live is in plaats van bij de volgende contractverlenging. Voor een stack die routeert tussen een goedkope gesprekslaag en een dure reasoning-laag zijn de twee eigenschappen die ertoe doen dat het delegatiedoel kan worden omgewisseld op live verkeer zonder de spraakintegratie aan te raken, en dat automatische failover een sessie in leven houdt wanneer een backend een fout geeft of een timeout krijgt. Om precies te zijn over wat we wel en niet hosten: de endpoints Gemini 3.8 Live en Gemini 3.8 Live Extended Thinking staan niet op onze router — die komen van Google's eigen API, in de Gemini API, de Live API en Google AI Studio. De tekstmodellen waaraan deze agents hun werk vaak overdragen zijn dat meestal wel, waaronder Gemini 3.8 Flash.
Waar elk model zich op het bord bevindt
De onderstaande opname is gemaakt op 16 september 2026, en de bovenkant van de Speech to Speech Index luidt als volgt:
• Gemini 3.8 Live Extended Thinking (High) — 82,6, eerste plaats
• GPT-Live-1 (Astra-backend, gemiddelde inspanning) — 81.5
• Grok Voice Think Fast 2.0 High — 81,3
• GPT-Live-1 (Sol-backend, lage inspanning) — 80.1
• Gemini 3.8 Live — 76.0, vijfde plaats
• GPT-Realtime-2.1 High — 73,9
• Gemini 3.1 Flash Live High — 71.5
Een opmerking over de naamgeving terwijl u die lijst leest: het (High) achtervoegsel dat in de berichtgeving aan dit model is gekoppeld, is een configuratielabel voor redeneerinspanning, geen afzonderlijke release. Het is dezelfde conventie die het bestuur gebruikt voor Grok Voice Think Fast 2.0 High en GPT-Realtime-2.1 High.

Wat is er nog niet vastgelegd?
Eén ding aan dit tweetal is gemakkelijk verkeerd te begrijpen, dus het is de moeite waard om het ronduit te zeggen: geen van beide modellen is in contractuele zin algemeen beschikbaar, ook al zijn beide geprijsd en gedocumenteerd.
Ontwikkelaars krijgen Gemini 3.8 Live in de Gemini API, de Live API en Google AI Studio onder de ID gemini-3.8-live; bedrijven krijgen een private preview in Gemini Enterprise, waarbij Gemini Enterprise for Customer Experience wordt vermeld als binnenkort beschikbaar; consumenten krijgen het in Search Live. Gemini 3.8 Live Extended Thinking heeft hetzelfde ontwikkelaarsoppervlak onder gemini-3.8-live-extended-thinking, plus een breder consumentenaanbod — Gemini Live, Docs Live voor Google AI Pro- en Ultra-abonnees, en Gmail Live en Keep Live voor alle Google AI-abonnees. Zakelijke Workspace-klanten worden vermeld als binnenkort beschikbaar.
Wat ontbreekt, is wat een onderneming nodig heeft voordat ze hier een omzetlijn op kan baseren: een toezegging voor algemene beschikbaarheid, een gepubliceerd uptimecijfer en een tarief dat Google heeft beloofd te handhaven. De prijzen zijn gepubliceerd, en previewprijzen hebben de neiging te veranderen. Maak nu een prototype, plan de migratie en verbind je niet aan een beschikbaarheidsdoel dat je niet is gegeven.

De beslissing die dit tweetal feitelijk voorlegt, is nauwer dan de index doet lijken, en het is geen kwaliteitsladder. Als het de taak van je agent is om te praten, is het goedkope model geen compromis — het is het betere product tegen de lagere prijs, en het vier keer zo goedkopere tarief is een bonus in plaats van het argument. Als het de taak van je agent is om iets af te maken, is de redeneervariant de enige van de twee die de taak überhaupt kan krijgen, en $3,50 per uur is een afrondingsfout tegenover een boeking die anders zou mislukken. De fout die je moet vermijden is een compromis te sluiten: betalen voor redeneerdiepte bij een werklast die nooit meer dan een goed gesprek nodig had, wat gebeurt wanneer een team de samengestelde kloof van 6,6 punten leest en nooit naar beneden scrolt naar de 38.
