
Intelligent transkribering med Gemini 3.5 Transcribe
- 智谱NYZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 per 1M tokens
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
Gemini 3.5 Transcribe gick in i offentlig förhandsvisning den 26 augusti 2026, och det är den första Google-modellen för tal-till-text som genuint säljs som en Gemini-modell: du anropar den via Gemini API:t med ett modell-ID, ljudet prissätts i tokens, och Google anger kostnaden per minut ljud på sin prissättningssida. Den sista detaljen är det konsumentbevakningen glider förbi. Lanseringens nyheter handlar om borttagning av fyllnadsord och röstredigering i Gboard, men vad som faktiskt förändrades för utvecklare är att transkribering nu ligger på samma API-yta som resten av Gemini-serien, med talartilldelning och tidsstämplar på ordnivå i basmodellen snarare än i ett separat tillägg. Den här texten läses som en API-referens, för det är det gap första vågens bevakning lämnar öppet.
Två förbehåll på förhand så att siffrorna nedan inte vilseleder. Google kallar inte Gemini 3.5 Transcribe för "den mest exakta tal-till-text-modellen vi har" – påståendet är den mest precisa modellen för intelligenta röstinteraktioner, vilket är ett annat påstående, och skillnaden spelar roll när du läser WER-siffrorna. Och allt här beskriver en offentlig förhandsvisning: de två modell-ID:n, priserna och benchmarksiffrorna är vad Google levererar idag, och allt kan ändras före GA.
De två API-sökvägarna — och modell-ID:na att komma ihåg.
Gemini 3.5 Transcribe levereras som två endpoints, och att välja rätt är det första arkitektoniska beslutet ett team fattar:
• gemini-3-5-transcribe — den förinspelade vägen via Interactions API. Skicka en fil och få tillbaka transkriptet med talartilldelning (upp till tre talare; tre eller fler är experimentellt) och tidsstämplar på ordnivå. Detta är arbetshästen för batch- och asynkronbearbetning.
• gemini-3-5-transcribe-live — realtidsvägen via Live API. Tvåvägsströmning med subsekundslatens, avsedd för livekonversation, undertextning och röststyrda gränssnitt.
Uppdelningen speglar hur resten av Gemini Audio-familjen är arrangerad, och det spelar roll eftersom "live" är en distinkt SKU med eget pris. Flera tidiga tolkningar av denna lansering antar att en modell gör båda; så är inte fallet.

Vad "intelligent transkribering" faktiskt betyder
Google's launch post frames this as moving beyond phonetic accuracy toward understanding. The features that follow from that framing are the ones to evaluate rather than the framing itself:
• Disfluenshantering — "ums" och "ahs" tas bort, och självkorrigeringar åtgärdas. "Vi ses på tisdag — nej, onsdag" transkriberas som den korrigerade dagen, inte som en utskrift av en felstart. Det är ett beslut som modellen fattar, och det är i den meningen som Google kallar det intelligent.
• Automatisk formatering — utdata returneras som polerad text: skiljetecken, skiftläge och styckestruktur tillämpas, inte en rå tokenström.
• Identifiering av flera talare — upp till tre talare kan tillskrivas i förinspelat ljud med tidsstämplar på ordnivå; tre eller fler talare är experimentellt. Detta ingår i basmodellen snarare än i en separat diarization-tjänst.
• Anpassat ordförråd — du kan styra igenkänningen mot fackspråk, produktnamn och ovanliga stavningar genom att tillhandahålla ett ordförråd, vilket är mekanismen för vertikala domäner.
• 85+ språk — automatisk identifiering, med regionala accenter och dialekter som anges uttryckligen.
• Funktionsanrop — modellen kan delegera arbete såsom bildgenerering eller filanalys till andra Gemini-modeller, vilket gör transkription till en komponent i en större agent snarare än ett slutsteg.
• Entitetsfångst — Google hävdar stark prestanda på brusigt, verkligt ljud och på alfanumeriska enheter som postnummer och ordernummer.
Pressbevakningen har också rapporterat ett kontextfönster på 96 000 tokens (ungefär en timmes mötesljud utan uppdelning) och känslodetektering. Båda stämmer med lanseringsbilden, men modellkortet som Google publicerade lyfter inte fram dem, så behandla dem som rapporterade snarare än bekräftade tills en GA-specifikation publiceras.

Noggrannhetssiffrorna, märkta
De WER-siffror som Google citerar kommer från Artificial Analysis: en genomsnittlig ordfelsfrekvens på 4,0 % för strömning och 2,6 % för transkribering utan strömning. På det flerspråkiga FLEURS-riktmärket rapporterar Google 5,50 % WER för strömning och 5,04 % för icke-strömning. Google hävdar också en 70-procentig förbättring av tiden till slutgiltig transkribering jämfört med sin föregångare, Chirp 3.
Den ärliga tolkningen: dessa är oberoende mätningar i den meningen att Artificial Analysis inte är Google, men de är Google-utvalda mätningar, publicerade i Googles eget tillkännagivande, av en modell som har kunnat anropas i en dag. Ingen utanför Google har ännu genomfört en adversariell head-to-head mot de öppna viktmodeller som de flesta team jämför den med, och lanseringsmaterialet innehåller ingen direkt jämförelse mot Whisper-familjen eller NVIDIAs Parakeet-serie. Siffran 70 % snabbare än Chirp-3 är ett leverantörspåstående, punkt slut. Behandla 2,6 % och 4,0 % som starka tidiga signaler, inte fastställda fakta.
Vad det kostar
Googles prissida anger varje modell i tokens och i uppskattade minuter av ljud. För gemini-3-5-transcribe är den sammanvägda uppskattningen ungefär 0,005 USD per minut ljud vid listpriser — input cirka 0,003 USD/min, output cirka 0,002 USD/min. För gemini-3-5-transcribe-live är den sammanvägda uppskattningen cirka 0,009 USD per minut. Båda har en gratisnivå idag.
Dessa per-minut-siffror är uppskattningar som baseras på en antagen tokenhastighet (25 ljudtokens per sekund in, 175 texttokens per minut ut), så de skiftar om Google ändrar tokenredovisningen. Det som är säkert är principen: listpriset är priset. Det är exakt den princip en pass-through-router som OrcaRouter arbetar efter — 0 % påslag, leverantörens listpris förs vidare — så om Google sänker transkriberingspriserna under preview-till-GA-fönstret, är sänkningen live hos oss samma dag, inte efter att en återförsäljare uppdaterar en prislista.
Där den rullas ut
För utvecklare innebär offentlig förhandsvisning idag två ytor: Gemini API:et i Google AI Studio och Gemini Enterprise Agent Platform för företagsarbetsbelastningar. På konsumentsidan driver Gemini 3.5 Transcribe redan Rambler-dikteringsfunktionen i Gboard på Android och Gemini-appen på macOS. Chrome är nästa – tala-för-att-skriva i vilket webbfält som helst – följt av Search Live, Gemini Live, Docs, Keep och Gmail. För ett team som utvärderar det är det praktiska svaret enklare: det kan anropas från kod idag, på engelska, i de regioner där Gemini API:et är tillgängligt.

Vad detta innebär för din pipeline
Det genuint nya är inte en WER-siffra. Det är att Google nu säljer transkribering med de två funktioner som team tidigare satte ihop själva — talareetiketter och tidsstämplar på ordnivå — i basmodellen, på en Gemini API-yta som stöder funktionsanrop. Om du byggde en pipeline för diariserade mötesanteckningar av en vanlig transkriberare plus en separat diariserare plus ett formateringssteg, är detta den första Google-modellen som slår samman dessa steg. Den öppna frågan är hur den icke-strömmande WER-siffran på 2,6 % håller måttet på ditt eget ljud, och tills en oberoende reproduktion dyker upp är det ansvarsfulla draget för ett produktionsteam att köra ett verkligt prov genom API:et snarare än att budgetera utifrån Googles valda riktmärken. För LLM-arbetet som körs ovanpå transkriptet — sammanfattning, strukturerad extrahering, åtgärdspunkter — är det i det lagret som routing gör skäl för sin existens, och det är just det lagret OrcaRouter täcker: ett API för 200+ modeller, automatisk failover mellan leverantörer och en routing-DSL som komponerar flera modeller till ett enda anrop. Själva transkriberingssteget bör du testa med ditt eget ljud innan du litar på någons rubriksiffra.
