Hero-titelkaart voor 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo' met ondertitel 'moet de basislijn worden vervangen?', met links een beheerde API-kaart met het label Gemini 3.5 Transcribe op 2,6% WER non-streaming en rechts een open-gewichtenkaart met het label Whisper Large v3 Turbo op 2,1% LibriSpeech clean met een MIT-badge en 809M-tag, en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: moet de baseline worden vervangen?

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

{{1}}Whisper Large v3 Turbo{{/1}} is het model waarnaar de term 'speech-to-text' voor een groot deel van de industrie standaard verwijst, en {{2}}Gemini 3.5 Transcribe{{/2}} is het eerste Go​ogle-transcriptiemodel dat expliciet wordt verkocht als uitdager van die basislijn in plaats van als generieke spraak-API. {{2}}Gemini 3.5 Transcribe{{/2}}, sinds 26 augustus 2026 in openbare preview, herkadert transcriptie als een redeneertaak — het lost zelfcorrecties op, formatteert de uitvoer, kent sprekers toe en roept zelfstandig andere G​emini-modellen aan. {{1}}Whisper Large v3 Turbo{{/1}} is Ope​nAI's 809-miljoen-parameterdestillatie van Whisper Large-v3, MIT-gelicenseerd, zelf-hostbaar, 99-talig, en afhankelijk van de hardware ruwweg vier tot acht keer sneller dan het model waaruit het is gedestilleerd. Het ene is een beheerde intelligentielaag over audio; het andere is een gratis, goed begrepen component die je overal kunt draaien waar je wilt. De vraag die deze pagina wil beantwoorden is smaller en nuttiger dan 'wat is beter': wanneer is de basislijn niet langer goed genoeg?

De baseline, voor het geval je vergeten bent hoe goed het is

Whisper Large v3 Turbo verdient zijn standaardstatus, dus de argumentatie ervoor komt eerst:

• Het draait overal — MIT-licentie, open gewichten, installeerbaar op een laptop, één GPU of een serverless functie. Geen leverancier, geen meter, geen data die je netwerk verlaat.

• Het is snel — de gedistilleerde decoder (32 encoderlagen, 4 decoderlagen, teruggebracht van 32) maakt het ongeveer vier keer sneller dan Whisper Large-v3 op gangbare hardware, op sommige meer, terwijl het grootste deel van de nauwkeurigheid behouden blijft. Ope​nAI's eigen cijfer is ongeveer acht keer op een A100.

• Het ondersteunt 99 talen voor transcriptie, een uitgebreidere lijst dan de 85+ van Gemini 3.5 Transcribe.

• De nauwkeurigheid ervan is goed gedocumenteerd: 2.1% WER op LibriSpeech test-clean, 4.2% op test-other, 9.1% op Common Voice English — cijfers die al jarenlang in de community zijn gerepliceerd.

• Het ecosysteem is enorm — faster-whisper, whisper.cpp, ONNX-export en elk inferentieframework dat je al gebruikt. Als je een model kunt draaien, kun je dit ook draaien.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Voor batchtranscriptie van Engels en bijna-Engels op schaal is Whisper Large v3 Turbo om structurele redenen de gevestigde keuze die geen enkele benchmarkkloof gemakkelijk kan omverwerpen: het is gratis, het is van jou, en het is overal.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Wat Gemini 3.5 Transcribe nog meer toevoegt

De waarde van de managed challenger is niet dat hij de baseline verslaat op schoon Engels — dat is een strijd die de cijfers nog niet eens netjes kunnen beslechten. De waarde is het werk dat boven de woorden plaatsvindt, wat Whisper expliciet niet doet:

• Sprekerstoewijzing — tot drie sprekers met tijdstempels op woordniveau, in het basismodel. Whisper transcribeert één spraakstroom; het heeft geen notie van wie wat zei.

• Intelligente opmaak — haperingen verwijderd, zelfcorrecties opgelost, interpunctie en hoofdlettergebruik toegepast. Whisper geeft de woorden terug zoals ze gesproken zijn, inclusief de 'ums'.

• Aangepaste woordenschat — voorkeur voor jargon en ongebruikelijke spellingen. Whisper heeft geen dergelijk mechanisme; je moet nabewerken of fijn-tunen.

• Function calling — het transcript kan worden overgedragen aan andere G​emini-modellen, waardoor transcriptie een stap in een agentpipeline wordt in plaats van de uiteindelijke uitvoer.

• {{1}}Lange sessies{{/1}} — ongeveer een uur audio in één doorgang (door de pers gerapporteerde 96K-context) versus Whisper's praktische behoefte om lange bestanden op te delen en aan elkaar te naaien.

Dat is een ander product. Het is wat Go​ogle bedoelt met 'intelligente transcriptie', en het is het deel van de vergelijking dat niet afhangt van benchmark-rekenkunde.

De nauwkeurigheidsvraag die niemand nog helder kan beantwoorden

De headline-cijfers van de twee modellen staan niet echt tegenover elkaar. De 2,6% non-streaming WER van {{1}}Gemini 3.​5 Transcribe{{/1}} is een Artificial Analysis-meting waarnaar {{2}}Go​ogle{{/2}} verwijst, berekend over 85+ talen. De 2,1% LibriSpeech test-clean van {{3}}Whisper Large v3 Turbo{{/3}} is een Engelse benchmark uit {{4}}Ope​nAI{{/4}}'s eigen distillatiepaper, die op grote schaal is gerepliceerd. Verschillende corpora, verschillende taaldekking, verschillende aanbieders. Wat er wél eerlijk over te zeggen valt: bij schoon Engels zitten de open baseline en de beheerde uitdager vermoedelijk in dezelfde orde van grootte, en het voordeel van het beheerde model zit in de meertalige en structurele kenmerken, niet in een aangetoonde Engelse WER-overwinning. De lanceringsmaterialen van {{5}}Go​ogle{{/5}} bevatten geen rechtstreekse vergelijking met modellen uit de Whisper-familie, en een onafhankelijke adversarial-vergelijking bestaat nog niet omdat {{6}}Gemini 3.​5 Transcribe{{/6}} pas één dag openbaar is. Tot die er is, blijft de nauwkeurigheidstitel ongeclaimd, en elk artikel — dit artikel inbegrepen — dat op basis van deze twee cijfers een WER-winnaar uitroept, gaat te ver.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Kosten: gratis uit te voeren tegen $0,005 per minuut

Whisper Large v3 Turbo heeft een hardwarekost en geen meter. Draai het op een GPU die je al bezit en de marginale kosten per getranscribeerde minuut liggen bijna op nul; huur je een GPU, dan is het wat de instantie kost terwijl hij draait. Gemini 3.​5 Transcribe rekent ruwweg $0.005 per minuut audio, gemengd, met de live-SKU rond $0.009 per minuut en een gratis laag. Bij duizend uur audio gaat dat om ongeveer $300 op de G​emini-meter tegenover een paar dollar aan GPU-tijd op de open baseline. Dat verschil is het echte kostenverhaal van deze vergelijking, en dat is de reden waarom de baseline zijn standaardstatus voor grootschalige Engelse batchverwerking nog lang zal behouden. De economie van het beheerde model wordt pas gunstig als de functies die het bundelt — diarisatie, opmaak, woordenschatbeheer — je zelf engineeringswerk zouden kosten om bovenop Whisper te bouwen.

Talen en streaming

Whisper Large v3 Turbo vermeldt 99 talen tegenover G​emini's 85+, maar het praktische meertalige verhaal is anders: Whisper transcribeert alle 99 in één keer zonder automatische detectie, en de nauwkeurigheid neemt het meest af bij talen met weinig bronmateriaal en met veel ruis — de afweging van een gedistilleerd model. G​emini detecteert automatisch onder zijn 85+ en Go​ogle benadrukt regionale accenten en dialecten. Voor streaming heeft Whisper geen native realtime-model; realtime-implementaties gebruiken faster-whisper en soortgelijke frameworks op je eigen hardware, terwijl Gemini 3.​5 Transcribe een speciaal gebouwd live-eindpunt heeft met een geclaimde subsecondelatentie en een bijpassende prijs. Als je workload live en meertalig is, is het beheerde eindpunt eenvoudiger te beheren; als het batchgewijs en Engelstalig is, is de open basislijn goedkoper.

Het vonnis, hoe het ook zij.

Whisper Large v3 Turbo blijft de juiste standaard voor Engelse batchtranscriptie op schaal, voor alles dat op je eigen infrastructuur moet draaien, en voor teams die een bevroren, auditbaar artefact willen. Gemini 3.5 Transcribe is de juiste keuze wanneer het transcript meer moet zijn dan alleen woorden — sprekerlabels, nette opmaak, domeinwoordenschat, meertalige dekking of een agenthaak — en wanneer je bereid bent om per gebruik voor die functies te betalen. De twee bestaan naast elkaar, en het patroon dat het naast elkaar bestaan goedkoop maakt, is een routeringsgrens: de transcriber die bij de audio past, en daarna de LLM-laag die beslist wat er met de tekst gebeurt. Die laag wordt beheerd door OrcaRouter — één API voor meer dan 200 modellen, automatische failover tussen providers, en een routerings-DSL om meerdere modellen te combineren in één enkele aanroep. Geen van beide spraakmodellen wordt bij ons gehost; de transcriptiekeuze ligt tussen jouw GPU en de meter van Google, en beide zullen nog lang bestaan.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube