
Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: moet de baseline worden vervangen?
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
{{1}}Whisper Large v3 Turbo{{/1}} is het model waarnaar de term 'speech-to-text' voor een groot deel van de industrie standaard verwijst, en {{2}}Gemini 3.5 Transcribe{{/2}} is het eerste Google-transcriptiemodel dat expliciet wordt verkocht als uitdager van die basislijn in plaats van als generieke spraak-API. {{2}}Gemini 3.5 Transcribe{{/2}}, sinds 26 augustus 2026 in openbare preview, herkadert transcriptie als een redeneertaak — het lost zelfcorrecties op, formatteert de uitvoer, kent sprekers toe en roept zelfstandig andere Gemini-modellen aan. {{1}}Whisper Large v3 Turbo{{/1}} is OpenAI's 809-miljoen-parameterdestillatie van Whisper Large-v3, MIT-gelicenseerd, zelf-hostbaar, 99-talig, en afhankelijk van de hardware ruwweg vier tot acht keer sneller dan het model waaruit het is gedestilleerd. Het ene is een beheerde intelligentielaag over audio; het andere is een gratis, goed begrepen component die je overal kunt draaien waar je wilt. De vraag die deze pagina wil beantwoorden is smaller en nuttiger dan 'wat is beter': wanneer is de basislijn niet langer goed genoeg?
De baseline, voor het geval je vergeten bent hoe goed het is
Whisper Large v3 Turbo verdient zijn standaardstatus, dus de argumentatie ervoor komt eerst:
• Het draait overal — MIT-licentie, open gewichten, installeerbaar op een laptop, één GPU of een serverless functie. Geen leverancier, geen meter, geen data die je netwerk verlaat.
• Het is snel — de gedistilleerde decoder (32 encoderlagen, 4 decoderlagen, teruggebracht van 32) maakt het ongeveer vier keer sneller dan Whisper Large-v3 op gangbare hardware, op sommige meer, terwijl het grootste deel van de nauwkeurigheid behouden blijft. OpenAI's eigen cijfer is ongeveer acht keer op een A100.
• Het ondersteunt 99 talen voor transcriptie, een uitgebreidere lijst dan de 85+ van Gemini 3.5 Transcribe.
• De nauwkeurigheid ervan is goed gedocumenteerd: 2.1% WER op LibriSpeech test-clean, 4.2% op test-other, 9.1% op Common Voice English — cijfers die al jarenlang in de community zijn gerepliceerd.
• Het ecosysteem is enorm — faster-whisper, whisper.cpp, ONNX-export en elk inferentieframework dat je al gebruikt. Als je een model kunt draaien, kun je dit ook draaien.

Voor batchtranscriptie van Engels en bijna-Engels op schaal is Whisper Large v3 Turbo om structurele redenen de gevestigde keuze die geen enkele benchmarkkloof gemakkelijk kan omverwerpen: het is gratis, het is van jou, en het is overal.

Wat Gemini 3.5 Transcribe nog meer toevoegt
De waarde van de managed challenger is niet dat hij de baseline verslaat op schoon Engels — dat is een strijd die de cijfers nog niet eens netjes kunnen beslechten. De waarde is het werk dat boven de woorden plaatsvindt, wat Whisper expliciet niet doet:
• Sprekerstoewijzing — tot drie sprekers met tijdstempels op woordniveau, in het basismodel. Whisper transcribeert één spraakstroom; het heeft geen notie van wie wat zei.
• Intelligente opmaak — haperingen verwijderd, zelfcorrecties opgelost, interpunctie en hoofdlettergebruik toegepast. Whisper geeft de woorden terug zoals ze gesproken zijn, inclusief de 'ums'.
• Aangepaste woordenschat — voorkeur voor jargon en ongebruikelijke spellingen. Whisper heeft geen dergelijk mechanisme; je moet nabewerken of fijn-tunen.
• Function calling — het transcript kan worden overgedragen aan andere Gemini-modellen, waardoor transcriptie een stap in een agentpipeline wordt in plaats van de uiteindelijke uitvoer.
• {{1}}Lange sessies{{/1}} — ongeveer een uur audio in één doorgang (door de pers gerapporteerde 96K-context) versus Whisper's praktische behoefte om lange bestanden op te delen en aan elkaar te naaien.
Dat is een ander product. Het is wat Google bedoelt met 'intelligente transcriptie', en het is het deel van de vergelijking dat niet afhangt van benchmark-rekenkunde.
De nauwkeurigheidsvraag die niemand nog helder kan beantwoorden
De headline-cijfers van de twee modellen staan niet echt tegenover elkaar. De 2,6% non-streaming WER van {{1}}Gemini 3.5 Transcribe{{/1}} is een Artificial Analysis-meting waarnaar {{2}}Google{{/2}} verwijst, berekend over 85+ talen. De 2,1% LibriSpeech test-clean van {{3}}Whisper Large v3 Turbo{{/3}} is een Engelse benchmark uit {{4}}OpenAI{{/4}}'s eigen distillatiepaper, die op grote schaal is gerepliceerd. Verschillende corpora, verschillende taaldekking, verschillende aanbieders. Wat er wél eerlijk over te zeggen valt: bij schoon Engels zitten de open baseline en de beheerde uitdager vermoedelijk in dezelfde orde van grootte, en het voordeel van het beheerde model zit in de meertalige en structurele kenmerken, niet in een aangetoonde Engelse WER-overwinning. De lanceringsmaterialen van {{5}}Google{{/5}} bevatten geen rechtstreekse vergelijking met modellen uit de Whisper-familie, en een onafhankelijke adversarial-vergelijking bestaat nog niet omdat {{6}}Gemini 3.5 Transcribe{{/6}} pas één dag openbaar is. Tot die er is, blijft de nauwkeurigheidstitel ongeclaimd, en elk artikel — dit artikel inbegrepen — dat op basis van deze twee cijfers een WER-winnaar uitroept, gaat te ver.

Kosten: gratis uit te voeren tegen $0,005 per minuut
Whisper Large v3 Turbo heeft een hardwarekost en geen meter. Draai het op een GPU die je al bezit en de marginale kosten per getranscribeerde minuut liggen bijna op nul; huur je een GPU, dan is het wat de instantie kost terwijl hij draait. Gemini 3.5 Transcribe rekent ruwweg $0.005 per minuut audio, gemengd, met de live-SKU rond $0.009 per minuut en een gratis laag. Bij duizend uur audio gaat dat om ongeveer $300 op de Gemini-meter tegenover een paar dollar aan GPU-tijd op de open baseline. Dat verschil is het echte kostenverhaal van deze vergelijking, en dat is de reden waarom de baseline zijn standaardstatus voor grootschalige Engelse batchverwerking nog lang zal behouden. De economie van het beheerde model wordt pas gunstig als de functies die het bundelt — diarisatie, opmaak, woordenschatbeheer — je zelf engineeringswerk zouden kosten om bovenop Whisper te bouwen.
Talen en streaming
Whisper Large v3 Turbo vermeldt 99 talen tegenover Gemini's 85+, maar het praktische meertalige verhaal is anders: Whisper transcribeert alle 99 in één keer zonder automatische detectie, en de nauwkeurigheid neemt het meest af bij talen met weinig bronmateriaal en met veel ruis — de afweging van een gedistilleerd model. Gemini detecteert automatisch onder zijn 85+ en Google benadrukt regionale accenten en dialecten. Voor streaming heeft Whisper geen native realtime-model; realtime-implementaties gebruiken faster-whisper en soortgelijke frameworks op je eigen hardware, terwijl Gemini 3.5 Transcribe een speciaal gebouwd live-eindpunt heeft met een geclaimde subsecondelatentie en een bijpassende prijs. Als je workload live en meertalig is, is het beheerde eindpunt eenvoudiger te beheren; als het batchgewijs en Engelstalig is, is de open basislijn goedkoper.
Het vonnis, hoe het ook zij.
Whisper Large v3 Turbo blijft de juiste standaard voor Engelse batchtranscriptie op schaal, voor alles dat op je eigen infrastructuur moet draaien, en voor teams die een bevroren, auditbaar artefact willen. Gemini 3.5 Transcribe is de juiste keuze wanneer het transcript meer moet zijn dan alleen woorden — sprekerlabels, nette opmaak, domeinwoordenschat, meertalige dekking of een agenthaak — en wanneer je bereid bent om per gebruik voor die functies te betalen. De twee bestaan naast elkaar, en het patroon dat het naast elkaar bestaan goedkoop maakt, is een routeringsgrens: de transcriber die bij de audio past, en daarna de LLM-laag die beslist wat er met de tekst gebeurt. Die laag wordt beheerd door OrcaRouter — één API voor meer dan 200 modellen, automatische failover tussen providers, en een routerings-DSL om meerdere modellen te combineren in één enkele aanroep. Geen van beide spraakmodellen wordt bij ons gehost; de transcriptiekeuze ligt tussen jouw GPU en de meter van Google, en beide zullen nog lang bestaan.
