Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — welke endpoint uw app moet aanroepen. Opnieuw gegenereerde illustratie.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: welke endpoint je app moet aanroepen

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Toen Go​ogle op 26 augustus 2026 de Ge​mini 3.5 Transcribe-familie lanceerde, leverde het twee modellen die een naam en een missie delen, maar die zijn gebouwd voor verschillende fasen van een gesprek: Ge​mini 3.5 Transcribe Live, het streaming-eindpunt dat via de Live API wordt bediend, en Ge​mini 3.5 Transcribe, het vooraf opgenomen eindpunt dat via de Interactions API wordt bediend. De fout die de meeste teams in de eerste week maken, is om dit als één model met twee knoppen te behandelen. Het zijn twee SKU's — verschillende API's, verschillende prijzen, verschillende harde limieten — en de nauwkeurigheidsvergelijking ertussen is geen eerlijk gevecht, omdat ze onder verschillende regels worden gemeten. Dit stuk zet de twee naast elkaar, zodat de beslissing afhangt van je workload, niet van een leaderboard.

De twee in één oogopslag

• API — Ge​mini 3.5 Transcribe Live draait op de Live API (WebSocket, bidirectionele streaming) versus Ge​mini 3.5 Transcribe op de Interactions API (bestand in, transcript uit).

• Taak — live-gesprek, ondertiteling, spraakagenten versus vergaderingen, gesprekslogs, gearchiveerde audio.

• Nauwkeurigheid — 4,0% WER voor streaming versus 2,6% WER voor niet-streaming, volgens Artificial Analysis, geciteerd door Google; verschillende meetregimes, niet direct vergelijkbaar.

• Latency — een definitief transcript 0,40s nadat de spraak is geëindigd versus batchverwerking van een compleet bestand.

Sessie — 10 minuten limiet per live-sessie versus bestanden tot 60 minuten (30 minuten met diarisatie en tijdstempels ingeschakeld).

• Sprekers — geen aan de streamingkant versus maximaal drie sprekers met tijdstempels op woordniveau aan de vooraf opgenomen kant.

• Prijs — ongeveer $0,009 per minuut gemengd versus ongeveer $0,005 per minuut gemengd.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

De architectuurbeslissing: Interactions API of Live API

Beide modellen vallen onder Go​ogle's Ge​mini Audio-familie en beide zijn in openbare preview. Het verschil begint bij het transport. gemini-3-5-transcribe-live opent een WebSocket en houdt die open: ruwe audio streamt continu binnen — de gebruikelijke framing is 16 kHz of 24 kHz 16-bit PCM-chunks — en het model retourneert gedeeltelijke transcripties terwijl je spreekt, en vervolgens een definitieve transcriptie voor elke uiting wanneer de spraak eindigt. gemini-3-5-transcribe neemt een compleet bestand, verwerkt het en retourneert de afgewerkte transcriptie met sprekerattributie en timestamps op woordniveau.

De transportbeslissing stuurt al het andere. Als uw product woorden weergeeft terwijl ze worden uitgesproken — een live ondertiteling, een voice-agent die de bedoeling midden in een zin voorleest, een gespreksassistent die handelt terwijl het gesprek live is — bevindt u zich op het Live-pad. Als uw product een verslag produceert — een vergadernotitie, een gesprekslogboek, een archief — bevindt u zich op het Interactions-pad. De verwarring is dat beide tekst produceren; het verschil is of de tekst een real-time toestand is of een definitief eindresultaat.

Nauwkeurigheid: de streamingbelasting is reëel

Artificial Analysis, het onafhankelijke benchmarkbedrijf waarvan {{1}}Go​ogle{{/1}} de cijfers aanhaalt in zijn lanceringsbericht, meet een gemiddeld woordfoutenpercentage van 4,0% voor het streaming-endpoint en 2,6% voor het niet-streaming-endpoint. Op de meertalige FLEURS-benchmark rapporteert {{2}}Go​ogle{{/2}} 5,50% voor streaming tegenover 5,04% voor niet-streaming. Het cijfer van 2,6% plaatst {{3}}Ge​mini{{/3}} 3.5 Transcribe bij lancering op #5 van AA's WER-ranglijst, achter ElevenLabs Scribe v2 met 2,2% en het MAI-Transcribe-1.5 van Microsoft met 2,4% — dat zijn AA's metingen, niet de beweringen van {{4}}Go​ogle{{/4}}.

De streamingscore is geen slechtere versie van dezelfde test. Het is een ander regime: het model legt zich vast op woorden voordat het het einde van de zin heeft gehoord, en dat moet het bekopen. Kies niet tussen de twee op basis van nauwkeurigheid alleen, want bij elke workload kan het verschil omslaan. Kies op basis van de beperkingen: het streaming-endpoint heeft een sessielimiet van 10 minuten, geen sprekerdiarisatie en geen tijdstempels; het pre-recorded endpoint verwerkt bestanden van een uur, kent tot drie sprekers toe en retourneert tijdstempels op woordniveau. Als je app sprekerlabels nodig heeft, kan het streamingmodel de klus simpelweg niet klaren, wat de WER ook is.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Wat ze delen

De twee endpoints delen de 'intelligente transcriptie'-engine, en bij de gedeelde functies is de keuze tussen beide neutraal:

• 85+ talen met automatische detectie, inclusief het wisselen van taal mid-stream op het Live-pad.

• Disfluentie-opruiming — vulwoorden weggelaten, zelfcorrecties opgelost ("dinsdag — nee, woensdag" wordt de gecorrigeerde dag).

• Automatische opmaak — interpunctie, hoofdlettergebruik en alineastructuur toegepast op de uitvoer.

• {{1}}Eigen woordenlijst{{/1}} — {{2}}tot 1.000 termen{{/2}} voor {{3}}jargon en productnamen{{/3}}, waarbij {{4}}de documentatie van Google ongeveer 100 aanbeveelt voor de beste resultaten{{/4}}.

Eén kanttekening die voor beide geldt: de 'slimme' opschoning die de uitvoer leesbaar maakt, is een ontwerpbeslissing die afbreuk doet aan woordelijke getrouwheid. Onhandige formuleringen worden gladgestreken; de tekst is de interpretatie van de intentie door het model, geen gerechtelijk verslag. Voor exacte transcripten heb je een letterlijke optie nodig waar die wordt aangeboden, en je zult het gedrag in beide gevallen op je eigen audio moeten verifiëren.

Kosten per minuut: de live premium

Google prijst audio in tokens tegen 25 audiotokens per seconde, met output op ongeveer 175 teksttokens per minuut transcript. Tegen catalogusprijzen zijn de gemengde kosten per minuut audio ongeveer $0,005 voor gemini-3-5-transcribe en ongeveer $0,009 voor gemini-3-5-transcribe-live — input tegen $2 versus $3,50 per miljoen tokens, output tegen $12 versus $21 per miljoen tokens. Beide hebben vandaag een gratis laag.

De premium koopt het real-time pad, niet meer nauwkeurigheid: je betaalt ruwweg 80% meer per minuut voor het streaming-endpoint, en het transcribeert met een hogere WER. Dat is het eerlijke kader. Het vooraf opgenomen model is zowel goedkoper als nauwkeuriger; het streamingmodel bestaat omdat sommige producten niet kunnen wachten tot het bestand klaar is.

Op welk endpoint moet je voortbouwen?

• Live-bijschriften en ondertitels — Ge​mini 3.5 Transcribe Live, en controleer de limiet zonder tijdstempels als je tijdgesynchroniseerde uitvoer nodig hebt.

• Spraakagenten — Ge​mini 3.5 Transcribe Live voor intentiedetectie midden in de zin; plan rond de 10-minutenlimiet voor lange sessies.

• Vergaderingen, interviews, archivering — Gemini 3.5 Transcribe, voor de 2,6% WER, sprekerstoewijzing en tijdstempels op woordniveau.

• Analyse na het gesprek — Ge​mini 3.5 Transcribe voor het definitieve verslag; Ge​mini 3.5 Transcribe Live alleen als de analyse tijdens het gesprek moet worden uitgevoerd.

• Lange ononderbroken audio — Gemini 3.5 Transcribe, omdat een bestand van 60 minuten beter is dan het handmatig aan elkaar rijgen van livesessies van tien minuten.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

De laag boven het transcript

OrcaRouter host geen van beide modellen — we routeren op dit moment geen spraak-naar-tekst, en voor beide eindpunten roep je rechtstreeks de API van Google aan. Wat een routeringslaag voor een spraakpijplijn doet, is boven het transcript zitten: de samenvatter, de entiteitsextractor, het actiepuntmodel dat een stroom omzet in een beslissing. Dat is de laag waar OrcaRouter zijn bestaansrecht bewijst: één API voor 200+ modellen tegen de lijstprijs van de provider, zonder opslag, automatische failover tussen providers, en een routerings-DSL die meerdere modellen combineert tot één enkele aanroep. Kies het transcriptie-eindpunt op basis van de workload en draai vervolgens het model dat het transcript leest achter één sleutel.

Kortom

Ge​mini 3.5 Transcribe Live en Ge​mini 3.5 Transcribe zijn dezelfde familie en verschillende producten. Kies Live wanneer het transcript moet bestaan voordat het gesprek eindigt en je genoegen neemt met een sessie van 10 minuten, zonder sprekerlabels en zonder tijdstempels. Kies Transcribe wanneer de uitvoer een verslag is en nauwkeurigheid en toeschrijving belangrijker zijn dan snelheid — het is goedkoper, nauwkeuriger en veel minder beperkt. De enige foute keuze is aannemen dat één endpoint beide doet.