
Gemini 3.5 Transcribe mot Whisper Large v3 Turbo: behöver baslinjen ersättas?
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Whisper Large v3 Turbo är den modell som frasen "speech-to-text" som standard syftar på för en stor del av branschen, och Gemini 3.5 Transcribe är den första Googles transkriberingsmodell som uttryckligen säljs som en utmanare till den baslinjen snarare än som ett generiskt tal-API. Gemini 3.5 Transcribe, som varit i publik förhandsvisning sedan 26 augusti 2026, omformulerar transkribering som en resoneringsuppgift – den löser självkorrigeringar, formaterar utdata, tillskriver talare och anropar andra Gemini-modeller på egen hand. Whisper Large v3 Turbo är OpenAIs 809-miljonersparameter-destillat av Whisper Large-v3, MIT-licensierad, självhostbar, med 99 språk, och ungefär fyra till åtta gånger snabbare än den modell den destillerades från beroende på hårdvara. Den ena är ett hanterat intelligenslager över ljud; den andra är en gratis, väletablerad komponent du kör var du vill. Frågan som denna sida finns för att besvara är smalare och mer användbar än "vilken är bättre": när slutar baslinjen att vara tillräckligt bra?
Baslinjen, ifall du glömde hur bra den är
Whisper Large v3 Turbo förtjänar sin standardstatus, så argumenten för den kommer först:
• Den körs var som helst — MIT-licens, öppna vikter, installerbart på en laptop, en enda GPU eller en serverlös funktion. Ingen leverantör, ingen mätning, ingen data som lämnar ditt nätverk.
• Den är snabb — den destillerade avkodaren (32 encoder-lager, 4 decoder-lager, ned från 32) gör den ungefär fyra gånger snabbare än Whisper Large-v3 på typisk hårdvara, mer på en del, samtidigt som den behåller större delen av sin noggrannhet. OpenAIs egen siffra är ungefär åtta gånger på en A100.
Den täcker 99 språk för transkription, en bredare lista än Gemini 3.5 Transcribes 85+.
Dess noggrannhet är väldokumenterad: 2.1% WER på LibriSpeech test-clean, 4.2% på test-other, 9.1% på Common Voice English — siffror som har replikerats inom communityn i åratal.
• Ekosystemet är enormt — faster-whisper, whisper.cpp, ONNX-exporteringar och alla inferensramverk du redan använder. Om du kan köra en modell, kan du köra den här.

För engelsk och nära-engelsk batchtranskribering i stor skala är Whisper Large v3 Turbo den etablerade standarden av strukturella skäl som ingen benchmarkskillnad lätt kan rubba: den är gratis, den är din, och den finns överallt.

Vad Gemini 3.5 Transcribe tillför därutöver
Den hanterade utmanarens värde ligger inte i att den slår baslinjen på ren engelska – det är en kamp som siffrorna inte ens kan avgöra rent ännu. Dess värde är arbetet som sker ovanför orden, vilket Whisper uttryckligen inte gör:
• Talartillskrivning — upp till tre talare med tidsstämplar på ordnivå, i grundmodellen. Whisper transkriberar en enda talström; det har inget begrepp om vem som sa vad.
• Intelligent formatering — disfluenser borttagna, självkorrigeringar åtgärdade, skiljetecken och skiftläge tillämpade. Whisper återger orden som de sades, med alla ”öh” och allt.
• Anpassad vokabulär — gynnar jargong och ovanliga stavningar. Whisper har ingen sådan mekanism; du efterbehandlar eller finjusterar.
• Funktionsanrop — transkriptet kan överlämnas till andra Gemini-modeller, vilket gör transkriberingen till ett steg i en agentpipeline snarare än det slutliga resultatet.
• Långa sessioner — ungefär en timme ljud i ett enda pass (pressrapporterad 96K-kontext) mot Whisper's praktiska behov av att dela upp och sy ihop långa filer.
Det är en annan produkt. Det är vad Google menar med "intelligent transkription", och det är den del av jämförelsen som inte beror på benchmark-aritmetik.
Noggrannhetsfrågan som ingen ännu kan svara rent på
De två modellernas huvudsiffror ställs inte direkt mot varandra. Gemini 3.5 Transcribes icke-strömmande WER på 2,6 % är en Artificial Analysis-mätning som citerats av Google och beräknats över 85+ språk. Whisper Large v3 Turbos 2,1 % på LibriSpeech test-clean är ett engelskt riktmärke från OpenAIs egen destillationsartikel, som replikerats i stor utsträckning. Olika korpusar, olika språktäckning, olika leverantörer. Vad som ärligt kan sägas: på ren engelska befinner sig den öppna baslinjen och den hanterade utmanaren rimligen i samma härad, och den hanterade modellens övertag ligger i dess flerspråkiga och strukturella funktioner, inte i en påvisad engelsk WER-seger. Googles lanseringsmaterial innehåller ingen direkt jämförelse med Whisper-modeller, och en oberoende, kontradiktorisk jämförelse finns ännu inte, eftersom Gemini 3.5 Transcribe bara varit offentlig i en dag. Tills en sådan dyker upp är noggrannhetskronan obesatt, och varje artikel — inklusive den här — som utser en WER-vinnare utifrån dessa två siffror går för långt.

Kostnad: gratis att köra jämfört med $0,005 per minut
Whisper Large v3 Turbo har en hårdvarukostnad men ingen mätare. Kör du det på en GPU du redan äger är marginalkostnaden per transkriberad minut nära noll; hyr du en GPU är den vad instansen kostar medan den arbetar. Gemini 3.5 Transcribe tar ut ungefär 0,005 USD per minut ljud i genomsnitt, med live-SKU:n runt 0,009 USD per minut och en kostnadsfri nivå. Vid tusen timmars ljud blir det cirka 300 USD på Geminis mätare mot några få dollar i GPU-tid på den öppna baslinjen. Det gapet är den verkliga kostnadsbilden i den här jämförelsen, och det är därför baslinjen kommer att behålla sin status som standard för storskaligt engelskt batcharbete under lång tid. Den hanterade modellens ekonomi går bara ihop när funktionerna den paketerar — diarisering, formatering, vokabulärkontroll — i sig skulle kosta dig utvecklingstid att bygga ovanpå Whisper.
Språk och streaming
Whisper Large v3 Turbo listar 99 språk jämfört med Geminis 85+, men den praktiska flerspråkiga bilden är en annan: Whisper transkriberar alla 99 i en enda körning utan automatisk detektering, och dess noggrannhet försämras mest för lågresursspråk och brusiga språk — en avvägning som följer med en destillerad modell. Gemini detekterar automatiskt bland sina 85+ och Google lyfter fram regionala accenter och dialekter. För strömning har Whisper ingen inbyggd realtidsmodell; realtidsdistributioner använder faster-whisper och liknande ramverk på din egen hårdvara, medan Gemini 3.5 Transcribe har en specialbyggd live-slutpunkt med påstådd latens under en sekund och ett pris därefter. Om din arbetsbelastning är live och flerspråkig är den hanterade slutpunkten enklare att driva; om den är batch och engelska är den öppna baslinjen billigare.
Domen, sådan den nu är.
Whisper Large v3 Turbo förblir det rätta standardvalet för engelsk batchtranskribering i stor skala, för allt som måste köras på din egen infrastruktur, och för team som vill ha en oföränderlig, granskningsbar artefakt. Gemini 3.5 Transcribe är rätt val när transkriptet måste vara mer än bara ord – talaretiketter, ren formatering, domänvokabulär, flerspråkig täckning eller en agentkoppling – och när du är villig att betala för dessa funktioner. De två samexisterar, och det mönster som gör samexistensen billig är en routinggräns: transkriberaren som passar ljudet, sedan LLM-lagret som bestämmer vad som händer med texten. Det lagret är vad OrcaRouter hanterar – ett API över 200+ modeller, automatisk växling mellan leverantörer, och en routing-DSL för att komponera flera modeller i ett enda anrop. Ingen av talmodellerna är hostad hos oss; transkriberingsvalet står mellan din GPU och Googles förbrukningsmätare, och båda kommer att finnas kvar under lång tid.
