
Gemini 3.8 Live Extended Thinking vs GPT-Live-1: een gelijkspel van 1,1 punt en twee verschillende rekeningen
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Op de samengestelde score is dit een gelijkspel. Gemini 3.8 Live Extended Thinkingstaat op 82,6 op de Speech to Speech Index van Artificial Analysis; GPT-Live-1, in zijn Astra-backend bij een gemiddelde reasoning-inspanning, staat op 81,5. Op de onderliggende agentische component — τ-Voice taakvoltooiing — bedraagt het verschil 0,7 punt, 68,6% tegenover 67,9%. Op de reasoning-component is het groter en wijst het de andere kant op: 97,7% op Big Bench Audio voor het Gemini-model, 90,1% voor GPT-Live-1. Niets in die spreiding overleeft een tweede benchmarkronde, en niets daarvan is waarop je je beslissing zou moeten baseren.
Wat deze twee scheidt, is niet de kwaliteit. Het is dat ze het oneens zijn over wat een voice-agent is, wie het denkwerk doet, en — het deel dat als eerste je budget raakt — hoe de sessie wordt gefactureerd. Gemini 3.8 Live Extended Thinking rekent per audiotoken en redeneert in hetzelfde model dat praat. GPT-Live-1 rekent een vast tarief voor de sessieduur, of er nu wel of niet iemand praat, en laat het eigenlijke denkwerk over aan een apart tekstmodel dat je zelf kiest en apart betaalt. Dat zijn twee verschillende producten met dezelfde benchmarkscore, en welke past, hangt af van een vraag die het leaderboard nooit stelt: hoe ziet een gemiddeld gesprek eruit op jouw lijn?
De 1,1-punts gelijkstand, en waar die daadwerkelijk breekt
Begin met de cijfers, want de dunheid van de kop is juist het punt:
• Spraak-naar-spraakindex — Gemini 3.8 Live Extended Thinking (hoog) 82,6 vs GPT-Live-1 (Astra-backend, gemiddelde inspanning) 81,5
• Agentische prestaties (τ-Voice-taakvoltooiing) — 68,6% vs 67,9%, waarbij GPT-Live-1 op 59,3% uitkomt wanneer het de Sol-backend met lage inspanning draait
• Spraakredenering (Big Bench Audio) — 97,7% vs 90,1%, de enige component waar het verschil geen ruis is
• Complexe bankworkflows (Sierra τ³-Banking, door leverancier gerapporteerd) — 35,1% vs 32,0%
• Tijd tot eerste audio — 1,35 s vs. 1,24–1,34 s via de API
• Gemeten kosten per uur — $3,50 vs $5,83 voor de Astra-configuratie, beide op basis van de input-audiometing van Artificial Analysis
De eerlijke lezing is dat de twee modellen niet van elkaar te onderscheiden zijn op de samengestelde score, wel op spraakredenering, waar het Gemini-model bijna acht punten voorloopt, en wel op kosten, waar het ongeveer 40% voorsprong heeft. Waar GPT-Live-1 vooroploopt, is in de delen van de ervaring die een benchmark moeilijk kan beoordelen: het is echt full-duplex, luistert terwijl het spreekt, zendt backchannels uit en beslist meerdere keren per seconde of het zal praten of het woord zal afstaan. Gemini 3.8 Live Extended Thinking is beurtgebaseerd. Het lost hetzelfde onderliggende probleem op — een beller die in stilte achterblijft terwijl de agent werkt — op door in plaats daarvan te vertellen, tegelijk te redeneren en te spreken met signalen zoals 'Laat me dat even nakijken…' terwijl de taak loopt.
Beide benaderingen houden de lijn in leven. Ze voelen anders. Slechts één ervan verschijnt op een index.

Twee factureringsmodellen, en waarom de tariefkaart misleidt
Dit is de sectie die de meeste deployments bepaalt, en het is juist degene die de coverage overslaat.
Gemini 3.8 Live Extended Thinking wordt gefactureerd zoals een tokenmodel wordt gefactureerd. Via de Live API zijn de gepubliceerde tarieven $3,00 per miljoen audio-invoertokens — ongeveer $0,005 per minuut aan audio-invoer — en $12,00 per miljoen audio-uitvoertokens, ongeveer $0,018 per minuut, waarbij de denktokens in die uitvoer worden meegeteld. Je betaalt voor audio die beweegt. Een beller die pauzeert, nadenkt of in de wacht wordt gezet, kost je niets zolang die stil is.
GPT-Live-1 wordt gefactureerd zoals een telefoonlijn wordt gefactureerd. Het is een vast tarief van $0,05 per minuut sessietijd, per seconde in rekening gebracht, ongeacht wie er spreekt of er überhaupt iemand spreekt. De redeneerbackend is niet inbegrepen: het tekstmodel dat het denkwerk doet, en alle tools die het aanroept, worden daarbovenop apart gefactureerd. Zo wordt een kop van $0,05 een alles-inbegrepen bedrag van ongeveer $4,47 per uur op de Sol-backend en $5,83 per uur op Astra medium, gemeten door Artificial Analysis.
Zet die naast elkaar en de naïeve vergelijking — $0,018 tegen $0,05 per minuut, een verschil van 2,8× — is in beide richtingen onjuist. De gemeten uurbedragen brengen het werkelijke verschil op $3,50 tegen $5,83, dichter bij 1,7×. Maar het sessieklokmodel verandert ook de vorm van je factuur, niet alleen het niveau: bij GPT-Live-1 volgen je kosten de gespreksduur, dus een lijn met lange, stille, inhoudsarme gesprekken — een supportwachtrij, een verificatiestap, een IVR-overdracht — betaalt hetzelfde als een inhoudsrijke. Aan de Gemini-kant volgen de kosten de audio, dus stilte is gratis en breedsprakigheid niet. Reken met je eigen gemiddelde gespreksduur voordat je met een tarief per minuut rekent, want dat is het getal dat bepaalt welke van deze voor jou goedkoper is, en het antwoord is niet hetzelfde voor een boekingslijn en een triagelijn.
Waar het denken gebeurt
Het tweede structurele verschil is delegatie, en dat is het verschil dat bepaalt hoeveel van deze stack je daadwerkelijk kunt vervangen.
GPT-Live-1 is een front-end. Het verwerkt de duplexaudio, en wanneer een query echt redeneerwerk vereist, draagt het de taak over aan een afzonderlijk backendmodel — GPT-5.5 en GPT-6 Astra zijn beide gedocumenteerd als backends — met selectors voor redeneerinspanning waarmee je kunt kiezen hoeveel van die backend je wilt afnemen. Daarom staat GPT-Live-1 tweemaal vermeld op de ranglijst met verschillende scores: 81,5 op Astra bij medium effort, 80,1 op Sol bij low. Die spreiding van 1,4 punt tussen zijn eigen twee configuraties is groter dan de kloof van 1,1 punt tussen de twee modellen in deze matchup, wat je vertelt dat aan de OpenAI-kant de configuratie die je kiest meer uitmaakt dan de leverancier die je kiest.
Gemini 3.8 Live Extended Thinkingredeneert in hetzelfde model dat spreekt. Er is geen aparte backend om te selecteren en geen aparte factuur daarvoor; de afweging is dat je de diepte afstemt met denkniveaus — laag, midden en hoog — op hetzelfde model, en de cijfers 82,6 en 68,6 de (Hoog) configuratie zijn. Het uitvoeren van tools en API's op de achtergrond gebeurt asynchroon aan beide zijden, zodat geen van beide modellen blijft hangen terwijl er wordt gewerkt.
Eén praktische consequentie: omdat de intelligentie van GPT-Live-1 een gekocht tekstmodel achter een spraakfront-end is, verschuift het kwaliteitsplafond ervan wanneer OpenAI een tekstmodel uitbrengt, niet wanneer het een spraakmodel uitbrengt. Het plafond van Gemini 3.8 Live Extended Thinking verschuift wanneer Google het audiomodel opnieuw traint. Als je een tweejarige weddenschap plaatst op een spraakplatform, is dat verschil in upgradecadans meer overdenking waard dan 1,1 indexpunten.
Wat de overstapkosten zijn, welke kant je ook op gaat
Geen van beide is een kwestie van simpelweg het model-ID omzetten, en teams die het als zodanig behandelen, komen daar in productie achter. De overstap naar Gemini 3.8 Live Extended Thinking betekent dat je een ander beurtcontract accepteert: functieaanroepen zijn altijd asynchroon, dus een blokkerende tool-declaratie geeft een harde fout in plaats van in de wachtrij te belanden, en clients moeten het interaction_statusveld IN_PROGRESS terwijl er nog wordt geredeneerd of een tool draait, IDLE pas wanneer de hele taak is voltooid — in plaats van te vertrouwen op turnComplete om te betekenen dat het werk klaar is. De overstap naar GPT-Live-1 betekent dat je de backend-selectie-infrastructuur en een tweede facturatieoppervlak overneemt, en dat je moet leven met een API die pas op 10 september 2026 algemeen beschikbaar kwam voor ontwikkelaars, na het debuut in ChatGPT op 8 juli — dus tooling van derden, SDK's en observability eromheen zijn maanden oud, niet jaren. In welke richting je ook gaat, begroot het integratiewerk naast de tokenrekening. Op een volwassen spraakstack is de refactor doorgaans de grootste van de twee.
Hoe je een dergelijke vergelijking uitvoert zonder erop te wedden
De verstandige manier om een kwestie van 1,1 punt te beslechten is beide op je eigen verkeer te draaien, en het lastige is dat dat normaal gesproken twee integraties, twee contracten en twee sets inloggegevens betekent. Het hoeft niet twee architecturen te betekenen. In beide systemen is de spraakfront-end een dunne laag boven gewone tekstmodelaanroepen — voor GPT-Live-1 is dat expliciet, en aan de Gemini-kant wordt de uitvoering van achtergrondtools op dezelfde manier opgelost — en die tekstlaag is waar je kostenverschil zit en waar overstappen echt goedkoop is.
OrcaRouter biedt 190 modellen via één sleutel tegen de listprijs van de provider, zonder opslag, zodat een upstream-prijswijziging dezelfde dag bij ons live staat in plaats van bij de volgende contractverlenging. Voor een spraakstack zijn de twee eigenschappen die ertoe doen dat het delegatiedoel kan worden gewisseld op liveverkeer zonder de spraakintegratie aan te raken, en dat automatische failover een oproep in leven houdt wanneer een backend een fout geeft of een timeout krijgt — waardoor je een onbewezen configuratie op echt verkeer kunt uitproberen zonder er een productielijn achter te zetten. Om precies te zijn over wat we wel en niet hosten: noch het Gemini 3.8 Live Extended Thinking-endpoint noch het GPT-Live-1-endpoint staat op onze router — die komen uit de eigen API's van Google en OpenAI. De tekstmodellen waarnaar ze delegeren staan er heel vaak wel op, waaronder Gemini 3.8 Flash.
De top van het bord, en hoe weinig het tot rust komt.
De onderstaande opname is gemaakt op 16 september 2026:
• Gemini 3.8 Live Extended Thinking (High) — 82,6, eerste plaats
• GPT-Live-1 (Astra-backend, gemiddelde inspanning) — 81,5
• Grok Voice Think Fast 2.0 High — 81,3
• GPT-Live-1 (Sol-backend, lage inspanning) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73,9
• Gemini 3.1 Flash Live High — 71.5
Drie dingen die opvallen. Ten eerste: de eerste en derde plaats liggen 1,3 punten uit elkaar en de eerste en de vijfde 6,6 punten, dus de top van deze ranglijst is een scrum, geen rangschikking. Ten tweede: het model in de titel van deze matchup is niet de Gemini-inzending op de vijfde plaats — dat is de standaard Gemini 3.8 Live, een ander en veel goedkoper product dat niet verward moet worden met de redeneervariant die hier wordt vergeleken. Ten derde: er is een precedent om elk afzonderlijk indexcijfer als voorlopig te beschouwen: xAI rapporteerde in juli 82,9 voor Grok Voice Think Fast 2.0, en dat model staat op 81,3 op deze ranglijst. Door leveranciers gerapporteerde indexscores overleven niet altijd het contact met een live leaderboard. De τ-Voice-cijfers van 68,6% en 67,9% staan nu op een openbare ranglijst die draait onder de eigen harness van Artificial Analysis, dus ze zijn bevestigd in plaats van alleen beweerd — maar een verschil van 0,7 punt tussen twee modellen op dezelfde harness is geen verschil. Verifieer het op je eigen verkeer of negeer het.

Nog een cijfer dat het waard is om in de beslissing mee te wegen, want het is het minst comfortabele getal in deze vergelijking: Google rapporteert 35,1% voor Gemini 3.8 Live Extended Thinking op Sierra's τ³-Banking leaderboard, tegenover 32,0% voor GPT-Live-1 Astra. Dat zijn door leveranciers gerapporteerde, niet-gereproduceerde cijfers, en ze beschrijven een wereld waarin de toonaangevende voice-agent op dat leaderboard ongeveer twee van de drie realistische banktaakpogingen niet haalt. Als uw agent gereguleerd, meerstaps werk moet voltooien, is geen van deze modellen klaar — en een voorsprong van 3,1 punt op die benchmark is geen reden om een leverancier te kiezen, het is een reden om een mens in het proces te houden.

Dus: als natuurlijkheid van gesprekken het product is en je gesprekken kort en compact zijn, is het full-duplexgedrag van GPT-Live-1 een echt voordeel dat de index niet ziet, en de facturering op sessieklok is bij die gespreksduur acceptabel. Als gesprekken lang, rustig of variabel zijn, of als spraakredenering en kosten per uur domineren, loopt Gemini 3.8 Live Extended Thinking voor op de componenten die ertoe doen en is het ongeveer 40% goedkoper per uur terwijl het dat doet — met de kanttekening dat het beurtgebaseerd is, nog in preview voor enterprise, en een clientrefactor vereist voordat het je tools kan uitvoeren. Wat niets hiervan rechtvaardigt, is een van beide kiezen op basis van 1,1 indexpunten. Op basis van het beschikbare bewijs is de eerlijke reden om tussen deze twee te kiezen het factureringsmodel en de architectuur eronder, en beide zijn dingen die je deze week op je eigen verkeer kunt meten.
Op OrcaRouterhoudt automatische failover een gesprek in stand wanneer een backend een fout vertoont of een time-out heeft.
Vergeleken in dit artikel2
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
