
GPT-Live-1 vs Gemini 3.5 Live Translate: Een uitgebrachte generalist tegen een preview-specialist
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Deze twee modellen worden met elkaar vergeleken omdat beide spraak in realtime via een API aanbieden, en de vergelijking valt uiteen zodra je de modelkaarten leest. GPT-Live-1 is een full-duplex spraakmodel voor algemene doeleinden dat OpenAI op 10 september 2026 naar de ontwikkelaars-API verplaatste, drie maanden nadat het op 8 juli in ChatGPT verscheen. Gemini 3.5 Live Translate is een audio-naar-audio-vertaalmodel voor één specifiek doel dat Google DeepMind op 9 juni 2026 uitbracht, en de model-ID bevat nog steeds het woord preview. Een van deze twee kun je vandaag aan betalende klanten aanbieden tegen een gepubliceerd tarief. De andere kan Google onder je vandaan veranderen zonder deprecatiemelding. Die asymmetrie, niet de benchmarktabel, is wat de keuze zou moeten bepalen.
Twee verschillende machines met hetzelfde label
Het is de moeite waard om ronduit te zijn over hoe weinig deze overlappen. Gemini 3.5 Live Translate verzorgt vertaling. Het neemt streamingaudio in de ene taal en levert streamingaudio in een andere taal terug, met behoud van de stem en toon van de spreker, over 70-plus talen en meer dan 2.000 taalparen, met automatische taalherkenning en bidirectionele werking. Het voert geen gesprek, roept geen functie aan en beantwoordt geen vraag. Het is een engine voor simultaan tolken.
GPT-Live-1 heeft de tegenovergestelde vorm. Het is een conversationeel model: het luistert en spreekt tegelijk, beslist vele malen per seconde of het moet blijven luisteren, pauzeren, onderbreken of een tool aanroepen, en draagt zwaar werk — webzoekopdrachten, diepere redeneringen, agentische taken — over aan een apart redeneermodel via de Responses API terwijl het gesprek doorgaat. OpenAI's eigen gepubliceerde WebRTC-voorbeeld koppelt die delegatie aan GPT-5.6 Terra. Vertaling is een van de dingen die het kan; het is geen functie waarvoor het model van Google in de andere richting een equivalent heeft.
De praktische vraag is dus beperkter dan de confrontatie in de koppen doet vermoeden: als je iets voor tolken bouwt, is het model van Google doelgebouwd en dat van OpenAI is voor algemeen gebruik. Als je een spraakagent bouwt die af en toe vertaalt, is GPT-Live-1 de enige van de twee die zelfs maar tot de juiste productcategorie behoort.
Wat elk ervan per minuut audio kost
Dit is waar de specialist zijn geld waard is, en de rekensom is ronduit ongemakkelijk voor OpenAI.
• GPT-Live-1 — $0,05 per minuut spraak, per seconde gefactureerd in plaats van afgerond naar de volgende hele minuut. Redeneringen en tool-aanroepen van de gedelegeerde backend worden apart gefactureerd tegen de normale tarieven van dat model.
• Gemini 3.5 Live Translate — $3,50 per miljoen audio-invoertokens en $21,00 per miljoen audio-uitvoertokens, met facturering berekend op 25 tokens per seconde audio. Gecombineerd komt dat neer op ongeveer $0,037 per minuut vertaalde audio.
Qua pure vertaalminuten is Google ongeveer een kwart goedkoper. Dat is op schaal geen afrondingsverschil: 10.000 getolkte minuten per maand kosten ongeveer $500 op de spraaklaag van GPT-Live-1, tegenover ongeveer $368 op Gemini 3.5 Live Translate. En het verschil is reëel, niet een artefact van de wijziging in de meting, omdat de twee modellen op werkelijk verschillende eenheden factureren.
Er zit een addertje onder het gras in de andere richting. De $0.05-headline voor GPT-Live-1 is alleen de prijs van de spraaklaag. Als je agent vertaalt en ook iets opzoekt, of een moeilijke zin escaleert naar een reasoningmodel, betaal je die delegatie bovenop — en het gedelegeerde model wordt per token geprijsd zoals elk ander frontiermodel. Een workload met alleen vertaling veroorzaakt dat nooit. Een workload met vertaling plus wat dan ook wel, en de winnaar van de vergelijking per minuut is niet langer vanzelfsprekend.

Het voorvertoningslabel is het risico dat niemand inprijst
Het model-ID van Gemini 3.5 Live Translate is gemini-3.5-live-translate-preview. Het is uitgebracht naar de Gemini Live API en Google AI Studio als openbare preview, en tegelijkertijd in de Google Translate-app op Android en iOS en als besloten preview in Google Meet voor een selecte groep Workspace-klanten. Preview betekent wat het bij Google altijd al heeft betekend: geen stabiliteitsgarantie, geen gepubliceerde deprecatieperiode, geen toezegging dat het tarief dat u betaalt de volgende release overleeft.
Voor een consumentenapp is dat prima. Voor de workloads waarop dit model eigenlijk is gericht — live-interpretatie in een callcenter, een vergaderproduct, een reisproduct — is het het allergrootste integratierisico in de stack. Je bouwt een productieafhankelijkheid op van een model waaraan Google zich expliciet niet heeft gecommitteerd.
GPT-Live-1 heeft het omgekeerde probleem, en het is kleiner maar niet nul. Het is algemeen beschikbaar, tegen een gepubliceerd tarief, met een gedocumenteerd endpoint, en het gaat niet verdwijnen. Maar zijn API-oppervlak is smal op een manier die teams verrast die aannemen dat het zonder meer in een bestaande OpenAI-integratie past: er is precies één model-ID, één endpoint, en geen pad via Chat Completions, Responses, Realtime, Batch, Assistants of fine-tuning. De enige manier naar binnen is het Live Sessions-endpoint op v1/live/sessions via WebRTC, met eventafhandeling op een datakanaal. Dat is een nieuwe integratie, geen parameterwijziging.

Talen, en waar de generalist eerlijk gezegd zwakker is
Het aantal van Google is meer dan 70 talen met behoud van stem en toon. De eigen documentatie van OpenAI is opvallend minder zelfverzekerd over de eigen dekking: in het lanceringsmateriaal staat dat het model voor bepaalde talen een niet-native accent kan hebben of hiaten in de vloeiendheid kan vertonen, en het publiceert geen aantal talen dat concurreert met dat van Google.
Dat is geen leverancier die geheimzinnig doet — het is hoe een generalistisch gespreksmodel eruitziet naast een specialist die op het probleem is getraind. Als de waardepropositie van je product is "wij interpreteren 40 talen goed", dan is de specialist de eerlijke keuze en zal de generalist je in de long tail voor schut zetten. Als je product een spraakagent is voor een Engelssprekende markt met een eraan vastgeschroefde vertaalfunctie, dan zullen de hiaten van de generalist op taalgebied nooit ter sprake komen.
Beide modellen voorzien gegenereerde audio van een watermerk met SynthID, wat van belang is als je je in een rechtsgebied bevindt of een klantcontract hebt dat herkomst van synthetische spraak vereist. Dat is lood om oud ijzer.

Waar de delegatiearchitectuur de build verandert
Het structurele verschil tussen deze twee is dat GPT-Live-1 eigenlijk twee modellen zijn met een naad in het midden. De spraaklaag houdt het gesprek gaande; een apart redeneermodel doet het denkwerk. Die naad is waar je engineeringinspanning naartoe gaat, en het is ook waar het kostenmodel ingewikkeld wordt.
Het is goed om te weten dat de gedelegeerde helft een gewoon tekstmodel is dat je net als elk ander kunt routeren. GPT-5.6 Terra, de backend in OpenAI's eigen voorbeeld, wordt via OrcaRouter geleverd tegen$2,00 per miljoen inputtokens en $12,00 per miljoen output, met een contextvenster van 1M tokens en zowel /v1/chat/completions als /v1/responses beschikbaar. Als je het redeneerbrein achter een voice-agent wilt vervangen — voor een goedkoper model bij eenvoudige gesprekken, of een sterker model bij escalaties — dan heeft die helft van de stack opties, want het is een normale API-aanroep die naastongeveer 190 andere modellen op één sleutel staat.
Het spraakgedeelte doet dat niet. GPT-Live-1 staat niet op OrcaRouter, en Gemini 3.5 Live Translate evenmin; beide zijn alleen beschikbaar bij de leverancier die ze heeft gemaakt. Waar een router in een architectuur als deze zijn plaats verdient, is alles stroomafwaarts van de audio: de tekstmodellen die het ophalen, het samenvatten, de CRM-terugschrijving en de escalatie doen, wat het deel van de rekening is dat je daadwerkelijk kunt consolideren op één sleutel en één factuur.
Wat je echt moet kiezen
• Kies Gemini 3.5 Live Translate als vertaling het product is, de prijs per minuut belangrijker is dan contractstabiliteit, en je kunt verdragen dat een previewmodel onder je verandert. Reken op ongeveer $0,037 per minuut en houd een abstractielaag over de oproep heen, zodat een GA-model het kan vervangen zonder herschrijving.
• Kies GPT-Live-1 als je een gespreksagent nodig hebt die toevallig ook vertaalt, als je functieaanroepen en toolgebruik binnen de spraakloop nodig hebt, of als een inkoopteam zal vragen wat er gebeurt wanneer het model wordt uitgefaseerd en je een beter antwoord nodig hebt dan "niets, waarschijnlijk."
• Kies geen van beide omdat het een benchmark heeft gewonnen. De benchmarks aan beide kanten zijn niet vergelijkbaar — de full-duplexcijfers van OpenAI zijn van henzelf, door geen enkele derde partij gereproduceerd, en de taalclaims van Google zijn niet getest tegen een generalist op dezelfde audioset.
Een vooruitkijkende opmerking: de twee oppervlakken naderen elkaar in plaats van te botsen. Googles vertaalmodel zit al in Gemini Live, en de spraaklaag van GPT-Live-1 is er expliciet op ontworpen om nieuwe frontier-modellen erachter te plaatsen. De redelijke verwachting is dat binnen een paar releasecycli de vertaling van de generalist verbetert en het integratieverhaal van de specialist minder een gok wordt. Als je vandaag bouwt en de beslissing is nipt, is dat een argument voor de goedkopere, beter vervangbare optie, en om het audiopad hoe dan ook geïsoleerd te houden achter een interface.
