Hero-titelkaart voor 'Intelligente transcriptie met Gemini 3.5 Transcribe' met een geluidsgolf die overgaat in opgemaakte tekst, een wereldbol met 85+ talen, chips met sprekerlabels, de kopcijfers 2,6% WER non-streaming en ~$0,005/min blended, en het OrcaRouter-logo in de rechterbenedenhoek.
Engineering & Research

Intelligente transcriptie met Gemini 3.5 Transcribe

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Gemini 3.​5 Transcribe ging op 26 augustus 2026 in openbare preview en is het eerste spraak-naar-tekstmodel van Go​ogle dat daadwerkelijk als een G​emini-model wordt verkocht: je roept het aan via de G​emini API met een model-ID, de audio wordt in tokens geprijsd, en Go​ogle vermeldt de kosten per minuut audio op zijn prijspagina. Dat laatste detail gaat aan de consumentenberichtgeving voorbij. De verhalen op de dag van de lancering gaan over het verwijderen van stopwoorden en spraakbewerking in Gboard, maar wat er voor ontwikkelaars daadwerkelijk veranderde, is dat transcriptie nu op hetzelfde API-oppervlak ligt als de rest van de G​emini-lijn, met sprekerattributie en tijdstempels op woordniveau in het basismodel in plaats van in een aparte add-on. Dit stuk leest als een API-referentie, omdat dat de leemte is die de eerste golf van berichtgeving openlaat.

Twee kanttekeningen vooraf, zodat de onderstaande cijfers niet misleidend zijn. Go​ogle noemt Gemini 3.​5 Transcribe niet "het meest nauwkeurige spraak-naar-tekstmodel dat we hebben" — de claim is dat het het meest precieze model is voor intelligente steminteracties, wat een andere claim is, en dat verschil is belangrijk wanneer je de WER-cijfers leest. En alles hier beschrijft een openbare preview: de twee model-ID's, de prijzen en de benchmarkcijfers zijn wat Go​ogle vandaag levert, en alles kan nog wijzigen vóór GA.

De twee API-paden — en de model-ID's om te onthouden

Gemini 3.5 Transcribe wordt geleverd als twee endpoints, en het kiezen van de juiste is de eerste architectuurbeslissing die een team neemt:

• gemini-3-5-transcribe — het vooraf opgenomen pad via de Interactions API. Stuur een bestand en ontvang de transcriptie terug met sprekerattributie (tot drie sprekers; drie of meer is experimenteel) en tijdstempels op woordniveau. Dit is het batch- en asynchrone werkpaard.

• gemini-3-5-transcribe-live — {{1}}het realtimepad via de Live API{{/1}}. {{2}}Bidirectionele streaming met een latentie van onder een seconde{{/2}}, {{3}}gericht op livegesprekken, ondertiteling en spraakgestuurde interfaces{{/3}}.

De splitsing weerspiegelt hoe de rest van de G​emini Audio-familie is ingedeeld, en dat is belangrijk omdat 'live' een aparte SKU is met een eigen prijs. Verschillende vroege interpretaties van deze lancering gaan ervan uit dat één model beide doet; dat is niet zo.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Wat "intelligente transcriptie" eigenlijk betekent

De lanceringspost van Go​ogle presenteert dit als verder gaan dan fonetische nauwkeurigheid, richting begrip. De functies die uit die framing voortvloeien, zijn degenen om te evalueren in plaats van de framing zelf:

• Verwerking van onvloeiendheden — "ums" en "ahs" worden weggelaten en zelfcorrecties worden opgelost. "Laten we dinsdag afspreken — nee, woensdag" wordt getranscribeerd als de gecorrigeerde dag, niet als een transcriptie van een valse start. Dat is een beslissing die het model neemt, en in die zin noemt Go​ogle het intelligent.

Auto-opmaak — de uitvoer komt terug als verzorgde tekst: interpunctie, hoofdlettergebruik en alineastructuur toegepast, niet als een ruwe tokenstroom.

• Identificatie van meerdere sprekers — maximaal drie sprekers worden geïdentificeerd in vooraf opgenomen audio, met tijdstempels op woordniveau; drie of meer sprekers is experimenteel. Dit zit in het basismodel in plaats van een aparte diarisatieservice.

• Aangepaste vocabulaire — u kunt de herkenning bijsturen richting jargon, productnamen en ongebruikelijke spellingen door een vocabulaire aan te leveren; dit is het mechanisme voor verticale domeinen.

• 85+ talen — automatische detectie, met regionale accenten en dialecten die expliciet worden benoemd.

• Functies aanroepen — het model kan taken zoals beeldgeneratie of bestandsanalyse delegeren aan andere G​emini-modellen, waardoor transcriptie een onderdeel wordt van een grotere agent in plaats van een eindstap.

• Entiteitsvastlegging — Go​ogle beweert sterke prestaties op lawaaierige, real-world audio en op alfanumerieke entiteiten zoals postcodes en order-ID's.

Persberichten hebben ook melding gemaakt van een contextvenster van 96.000 tokens (ruwweg een uur aan vergaderaudio zonder te splitsen) en emotiedetectie. Beide zijn in lijn met de lancering, maar de modelcard die Go​ogle heeft gepubliceerd zet ze niet op de voorgrond, dus behandel ze als gerapporteerd in plaats van bevestigd totdat er een GA-specificatieblad verschijnt.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

De nauwkeurigheidscijfers, gelabeld

De WER-cijfers die Google aanhaalt, komen van Artificial Analysis: een gemiddelde woordfoutfrequentie van 4,0% voor streaming en 2,6% voor niet-streaming transcriptie. Op de meertalige FLEURS-benchmark rapporteert Google 5,50% WER voor streaming en 5,04% voor niet-streaming. Google claimt ook een verbetering van 70% in tijd tot definitieve transcriptie ten opzichte van zijn voorganger, Chirp 3.

De eerlijke lezing: dit zijn onafhankelijke metingen in de zin dat Artificial Analysis geen Go​ogle is, maar het zijn door Go​ogle geselecteerde metingen, gepubliceerd in Go​ogles eigen aankondiging, van een model dat pas een dag aanroepbaar is. Niemand buiten Go​ogle heeft het model nog adversarieel head-to-head getest tegen de open-weightmodellen waarmee de meeste teams het vergelijken, en het lanceringsmateriaal bevat geen directe vergelijking met de Whisper-familie of NVIDIA's Parakeet-lijn. Het cijfer van 70% sneller dan Chirp-3 is een bewering van de leverancier, punt. Behandel 2,6% en 4,0% als sterke vroege signalen, niet als vaststaande feiten.

Wat het kost

De prijspagina van Google vermeldt elk model in tokens en in geschatte minuten audio. Voor gemini-3-5-transcribe is de gemengde schatting ruwweg $0,005 per minuut audio tegen lijstprijzen — input ongeveer $0,003/min, output ongeveer $0,002/min. Voor gemini-3-5-transcribe-live is de gemengde schatting ongeveer $0,009 per minuut. Beide hebben vandaag een gratis laag.

Die per-minuutcijfers zijn schattingen op basis van een verondersteld tokenpercentage (25 audiotokens per seconde in, 175 teksttokens per minuut uit), dus ze verschuiven als Go​ogle de tokenberekening wijzigt. Wat vaststaat is het principe: de catalogusprijs is de prijs. Dat is precies het principe waar een doorgeefrouter als OrcaRouter op werkt — 0% opslag, de catalogusprijs van de provider wordt doorgegeven — dus als Go​ogle de transcriptieprijzen verlaagt tijdens het venster van preview naar GA, is die verlaging dezelfde dag live bij ons, niet pas nadat een reseller een prijslijst bijwerkt.

Waar het wordt uitgerold

Voor ontwikkelaars betekent de publieke preview vandaag twee toegangspunten: de {{1}}G​emini API in Go​ogle AI Studio{{/1}} en het {{2}}G​emini Enterprise Agent Platform{{/2}} voor enterprise-workloads. Aan de consumentenkant drijft {{3}}Gemini 3.​5 Transcribe{{/3}} de {{4}}Rambler-dictatie{{/4}}functie al aan in {{5}}Gboard op Android{{/5}} en in de {{6}}G​emini-app op macOS{{/6}}. Chrome is de volgende — {{7}}spreek-om-te-typen in elk webveld{{/7}} — gevolgd door {{8}}Search Live, G​emini Live, Docs, Keep en Gmail{{/8}}. Voor een team dat het evalueert, is het praktische antwoord eenvoudiger: het is vandaag al aanroepbaar vanuit code, in het Engels, in de regio's waar de {{9}}G​emini API{{/9}} beschikbaar is.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Wat dit betekent voor jouw pipeline

Het werkelijk nieuwe is niet een WER-getal. Het is dat Go​ogle nu transcriptie verkoopt met de twee functies die teams voorheen zelf samenstelden — sprekerlabels en tijdstempels op woordniveau — in het basismodel, op een G​emini API-oppervlak dat function calling ondersteunt. Als je een gediariseerde pijplijn voor vergadernotulen opbouwde uit een gewone transcriber plus een aparte diarizer plus een opmaakstap, is dit het eerste Go​ogle-model dat die stappen samenvouwt. De open vraag is hoe de 2,6% niet-streaming WER standhoudt op je eigen audio, en totdat er een onafhankelijke reproductie verschijnt, is de verantwoorde stap voor een productieteam om een echt sample door de API te halen in plaats van te budgetteren op basis van Go​ogles gekozen benchmarks. Voor het LLM-werk dat bovenop het transcript draait — samenvatting, gestructureerde extractie, actiepunten — is dat de laag waar routing zijn waarde bewijst, en het is de laag die OrcaRouter dekt: één API voor 200+ modellen, automatische failover tussen providers, en een routing-DSL die meerdere modellen samenvoegt tot één enkele aanroep. De transcriptiestap zelf moet je testen met je eigen audio voordat je het opzienbarende getal van wie dan ook vertrouwt.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube