
Intelligente transcriptie met Gemini 3.5 Transcribe
- 智谱NIEUWZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 per 1 mln tokens
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
Gemini 3.5 Transcribe ging op 26 augustus 2026 in openbare preview en is het eerste spraak-naar-tekstmodel van Google dat daadwerkelijk als een Gemini-model wordt verkocht: je roept het aan via de Gemini API met een model-ID, de audio wordt in tokens geprijsd, en Google vermeldt de kosten per minuut audio op zijn prijspagina. Dat laatste detail gaat aan de consumentenberichtgeving voorbij. De verhalen op de dag van de lancering gaan over het verwijderen van stopwoorden en spraakbewerking in Gboard, maar wat er voor ontwikkelaars daadwerkelijk veranderde, is dat transcriptie nu op hetzelfde API-oppervlak ligt als de rest van de Gemini-lijn, met sprekerattributie en tijdstempels op woordniveau in het basismodel in plaats van in een aparte add-on. Dit stuk leest als een API-referentie, omdat dat de leemte is die de eerste golf van berichtgeving openlaat.
Twee kanttekeningen vooraf, zodat de onderstaande cijfers niet misleidend zijn. Google noemt Gemini 3.5 Transcribe niet "het meest nauwkeurige spraak-naar-tekstmodel dat we hebben" — de claim is dat het het meest precieze model is voor intelligente steminteracties, wat een andere claim is, en dat verschil is belangrijk wanneer je de WER-cijfers leest. En alles hier beschrijft een openbare preview: de twee model-ID's, de prijzen en de benchmarkcijfers zijn wat Google vandaag levert, en alles kan nog wijzigen vóór GA.
De twee API-paden — en de model-ID's om te onthouden
Gemini 3.5 Transcribe wordt geleverd als twee endpoints, en het kiezen van de juiste is de eerste architectuurbeslissing die een team neemt:
• gemini-3-5-transcribe — het vooraf opgenomen pad via de Interactions API. Stuur een bestand en ontvang de transcriptie terug met sprekerattributie (tot drie sprekers; drie of meer is experimenteel) en tijdstempels op woordniveau. Dit is het batch- en asynchrone werkpaard.
• gemini-3-5-transcribe-live — {{1}}het realtimepad via de Live API{{/1}}. {{2}}Bidirectionele streaming met een latentie van onder een seconde{{/2}}, {{3}}gericht op livegesprekken, ondertiteling en spraakgestuurde interfaces{{/3}}.
De splitsing weerspiegelt hoe de rest van de Gemini Audio-familie is ingedeeld, en dat is belangrijk omdat 'live' een aparte SKU is met een eigen prijs. Verschillende vroege interpretaties van deze lancering gaan ervan uit dat één model beide doet; dat is niet zo.

Wat "intelligente transcriptie" eigenlijk betekent
De lanceringspost van Google presenteert dit als verder gaan dan fonetische nauwkeurigheid, richting begrip. De functies die uit die framing voortvloeien, zijn degenen om te evalueren in plaats van de framing zelf:
• Verwerking van onvloeiendheden — "ums" en "ahs" worden weggelaten en zelfcorrecties worden opgelost. "Laten we dinsdag afspreken — nee, woensdag" wordt getranscribeerd als de gecorrigeerde dag, niet als een transcriptie van een valse start. Dat is een beslissing die het model neemt, en in die zin noemt Google het intelligent.
Auto-opmaak — de uitvoer komt terug als verzorgde tekst: interpunctie, hoofdlettergebruik en alineastructuur toegepast, niet als een ruwe tokenstroom.
• Identificatie van meerdere sprekers — maximaal drie sprekers worden geïdentificeerd in vooraf opgenomen audio, met tijdstempels op woordniveau; drie of meer sprekers is experimenteel. Dit zit in het basismodel in plaats van een aparte diarisatieservice.
• Aangepaste vocabulaire — u kunt de herkenning bijsturen richting jargon, productnamen en ongebruikelijke spellingen door een vocabulaire aan te leveren; dit is het mechanisme voor verticale domeinen.
• 85+ talen — automatische detectie, met regionale accenten en dialecten die expliciet worden benoemd.
• Functies aanroepen — het model kan taken zoals beeldgeneratie of bestandsanalyse delegeren aan andere Gemini-modellen, waardoor transcriptie een onderdeel wordt van een grotere agent in plaats van een eindstap.
• Entiteitsvastlegging — Google beweert sterke prestaties op lawaaierige, real-world audio en op alfanumerieke entiteiten zoals postcodes en order-ID's.
Persberichten hebben ook melding gemaakt van een contextvenster van 96.000 tokens (ruwweg een uur aan vergaderaudio zonder te splitsen) en emotiedetectie. Beide zijn in lijn met de lancering, maar de modelcard die Google heeft gepubliceerd zet ze niet op de voorgrond, dus behandel ze als gerapporteerd in plaats van bevestigd totdat er een GA-specificatieblad verschijnt.

De nauwkeurigheidscijfers, gelabeld
De WER-cijfers die Google aanhaalt, komen van Artificial Analysis: een gemiddelde woordfoutfrequentie van 4,0% voor streaming en 2,6% voor niet-streaming transcriptie. Op de meertalige FLEURS-benchmark rapporteert Google 5,50% WER voor streaming en 5,04% voor niet-streaming. Google claimt ook een verbetering van 70% in tijd tot definitieve transcriptie ten opzichte van zijn voorganger, Chirp 3.
De eerlijke lezing: dit zijn onafhankelijke metingen in de zin dat Artificial Analysis geen Google is, maar het zijn door Google geselecteerde metingen, gepubliceerd in Googles eigen aankondiging, van een model dat pas een dag aanroepbaar is. Niemand buiten Google heeft het model nog adversarieel head-to-head getest tegen de open-weightmodellen waarmee de meeste teams het vergelijken, en het lanceringsmateriaal bevat geen directe vergelijking met de Whisper-familie of NVIDIA's Parakeet-lijn. Het cijfer van 70% sneller dan Chirp-3 is een bewering van de leverancier, punt. Behandel 2,6% en 4,0% als sterke vroege signalen, niet als vaststaande feiten.
Wat het kost
De prijspagina van Google vermeldt elk model in tokens en in geschatte minuten audio. Voor gemini-3-5-transcribe is de gemengde schatting ruwweg $0,005 per minuut audio tegen lijstprijzen — input ongeveer $0,003/min, output ongeveer $0,002/min. Voor gemini-3-5-transcribe-live is de gemengde schatting ongeveer $0,009 per minuut. Beide hebben vandaag een gratis laag.
Die per-minuutcijfers zijn schattingen op basis van een verondersteld tokenpercentage (25 audiotokens per seconde in, 175 teksttokens per minuut uit), dus ze verschuiven als Google de tokenberekening wijzigt. Wat vaststaat is het principe: de catalogusprijs is de prijs. Dat is precies het principe waar een doorgeefrouter als OrcaRouter op werkt — 0% opslag, de catalogusprijs van de provider wordt doorgegeven — dus als Google de transcriptieprijzen verlaagt tijdens het venster van preview naar GA, is die verlaging dezelfde dag live bij ons, niet pas nadat een reseller een prijslijst bijwerkt.
Waar het wordt uitgerold
Voor ontwikkelaars betekent de publieke preview vandaag twee toegangspunten: de {{1}}Gemini API in Google AI Studio{{/1}} en het {{2}}Gemini Enterprise Agent Platform{{/2}} voor enterprise-workloads. Aan de consumentenkant drijft {{3}}Gemini 3.5 Transcribe{{/3}} de {{4}}Rambler-dictatie{{/4}}functie al aan in {{5}}Gboard op Android{{/5}} en in de {{6}}Gemini-app op macOS{{/6}}. Chrome is de volgende — {{7}}spreek-om-te-typen in elk webveld{{/7}} — gevolgd door {{8}}Search Live, Gemini Live, Docs, Keep en Gmail{{/8}}. Voor een team dat het evalueert, is het praktische antwoord eenvoudiger: het is vandaag al aanroepbaar vanuit code, in het Engels, in de regio's waar de {{9}}Gemini API{{/9}} beschikbaar is.

Wat dit betekent voor jouw pipeline
Het werkelijk nieuwe is niet een WER-getal. Het is dat Google nu transcriptie verkoopt met de twee functies die teams voorheen zelf samenstelden — sprekerlabels en tijdstempels op woordniveau — in het basismodel, op een Gemini API-oppervlak dat function calling ondersteunt. Als je een gediariseerde pijplijn voor vergadernotulen opbouwde uit een gewone transcriber plus een aparte diarizer plus een opmaakstap, is dit het eerste Google-model dat die stappen samenvouwt. De open vraag is hoe de 2,6% niet-streaming WER standhoudt op je eigen audio, en totdat er een onafhankelijke reproductie verschijnt, is de verantwoorde stap voor een productieteam om een echt sample door de API te halen in plaats van te budgetteren op basis van Googles gekozen benchmarks. Voor het LLM-werk dat bovenop het transcript draait — samenvatting, gestructureerde extractie, actiepunten — is dat de laag waar routing zijn waarde bewijst, en het is de laag die OrcaRouter dekt: één API voor 200+ modellen, automatische failover tussen providers, en een routing-DSL die meerdere modellen samenvoegt tot één enkele aanroep. De transcriptiestap zelf moet je testen met je eigen audio voordat je het opzienbarende getal van wie dan ook vertrouwt.
