Hero-titelkort för 'Intelligent transkribering med Gemini 3.5 Transcribe' som visar en ljudvågform som förvandlas till formaterad text, en jordglob märkt med 85+ språk, etiketter för talare, rubriksiffrorna 2,6 % WER (icke-strömmande) och ~0,005 USD/min blandat, samt OrcaRouter-logotypen i nedre högra hörnet.
Engineering & Research

Intelligent transkribering med Gemini 3.5 Transcribe

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Gemini 3.​5 Transcribe gick in i offentlig förhandsvisning den 26 augusti 2026, och det är den första Go​ogle-modellen för tal-till-text som genuint säljs som en G​emini-modell: du anropar den via G​emini API:t med ett modell-ID, ljudet prissätts i tokens, och Go​ogle anger kostnaden per minut ljud på sin prissättningssida. Den sista detaljen är det konsumentbevakningen glider förbi. Lanseringens nyheter handlar om borttagning av fyllnadsord och röstredigering i Gboard, men vad som faktiskt förändrades för utvecklare är att transkribering nu ligger på samma API-yta som resten av G​emini-serien, med talartilldelning och tidsstämplar på ordnivå i basmodellen snarare än i ett separat tillägg. Den här texten läses som en API-referens, för det är det gap första vågens bevakning lämnar öppet.

Två förbehåll på förhand så att siffrorna nedan inte vilseleder. Go​ogle kallar inte Gemini 3.​5 Transcribe för "den mest exakta tal-till-text-modellen vi har" – påståendet är den mest precisa modellen för intelligenta röstinteraktioner, vilket är ett annat påstående, och skillnaden spelar roll när du läser WER-siffrorna. Och allt här beskriver en offentlig förhandsvisning: de två modell-ID:n, priserna och benchmarksiffrorna är vad Go​ogle levererar idag, och allt kan ändras före GA.

De två API-sökvägarna — och modell-ID:na att komma ihåg.

Gemini 3.5 Transcribe levereras som två endpoints, och att välja rätt är det första arkitektoniska beslutet ett team fattar:

• gemini-3-5-transcribe — den förinspelade vägen via Interactions API. Skicka en fil och få tillbaka transkriptet med talartilldelning (upp till tre talare; tre eller fler är experimentellt) och tidsstämplar på ordnivå. Detta är arbetshästen för batch- och asynkronbearbetning.

• gemini-3-5-transcribe-live — realtidsvägen via Live API. Tvåvägsströmning med subsekundslatens, avsedd för livekonversation, undertextning och röststyrda gränssnitt.

Uppdelningen speglar hur resten av G​emini Audio-familjen är arrangerad, och det spelar roll eftersom "live" är en distinkt SKU med eget pris. Flera tidiga tolkningar av denna lansering antar att en modell gör båda; så är inte fallet.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Vad "intelligent transkribering" faktiskt betyder

Go​ogle's launch post frames this as moving beyond phonetic accuracy toward understanding. The features that follow from that framing are the ones to evaluate rather than the framing itself:

• Disfluenshantering — "ums" och "ahs" tas bort, och självkorrigeringar åtgärdas. "Vi ses på tisdag — nej, onsdag" transkriberas som den korrigerade dagen, inte som en utskrift av en felstart. Det är ett beslut som modellen fattar, och det är i den meningen som Go​ogle kallar det intelligent.

• Automatisk formatering — utdata returneras som polerad text: skiljetecken, skiftläge och styckestruktur tillämpas, inte en rå tokenström.

• Identifiering av flera talare — upp till tre talare kan tillskrivas i förinspelat ljud med tidsstämplar på ordnivå; tre eller fler talare är experimentellt. Detta ingår i basmodellen snarare än i en separat diarization-tjänst.

• Anpassat ordförråd — du kan styra igenkänningen mot fackspråk, produktnamn och ovanliga stavningar genom att tillhandahålla ett ordförråd, vilket är mekanismen för vertikala domäner.

• 85+ språk — automatisk identifiering, med regionala accenter och dialekter som anges uttryckligen.

• Funktionsanrop — modellen kan delegera arbete såsom bildgenerering eller filanalys till andra G​emini-modeller, vilket gör transkription till en komponent i en större agent snarare än ett slutsteg.

• Entitetsfångst — Go​ogle hävdar stark prestanda på brusigt, verkligt ljud och på alfanumeriska enheter som postnummer och ordernummer.

Pressbevakningen har också rapporterat ett kontextfönster på 96 000 tokens (ungefär en timmes mötesljud utan uppdelning) och känslodetektering. Båda stämmer med lanseringsbilden, men modellkortet som Go​ogle publicerade lyfter inte fram dem, så behandla dem som rapporterade snarare än bekräftade tills en GA-specifikation publiceras.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Noggrannhetssiffrorna, märkta

De WER-siffror som Go​ogle citerar kommer från Artificial Analysis: en genomsnittlig ordfelsfrekvens på 4,0 % för strömning och 2,6 % för transkribering utan strömning. På det flerspråkiga FLEURS-riktmärket rapporterar Go​ogle 5,50 % WER för strömning och 5,04 % för icke-strömning. Go​ogle hävdar också en 70-procentig förbättring av tiden till slutgiltig transkribering jämfört med sin föregångare, Chirp 3.

Den ärliga tolkningen: dessa är oberoende mätningar i den meningen att Artificial Analysis inte är Google, men de är Google-utvalda mätningar, publicerade i Googles eget tillkännagivande, av en modell som har kunnat anropas i en dag. Ingen utanför Google har ännu genomfört en adversariell head-to-head mot de öppna viktmodeller som de flesta team jämför den med, och lanseringsmaterialet innehåller ingen direkt jämförelse mot Whisper-familjen eller NVIDIAs Parakeet-serie. Siffran 70 % snabbare än Chirp-3 är ett leverantörspåstående, punkt slut. Behandla 2,6 % och 4,0 % som starka tidiga signaler, inte fastställda fakta.

Vad det kostar

Googles prissida anger varje modell i tokens och i uppskattade minuter av ljud. För gemini-3-5-transcribe är den sammanvägda uppskattningen ungefär 0,005 USD per minut ljud vid listpriser — input cirka 0,003 USD/min, output cirka 0,002 USD/min. För gemini-3-5-transcribe-live är den sammanvägda uppskattningen cirka 0,009 USD per minut. Båda har en gratisnivå idag.

Dessa per-minut-siffror är uppskattningar som baseras på en antagen tokenhastighet (25 ljudtokens per sekund in, 175 texttokens per minut ut), så de skiftar om Go​ogle ändrar tokenredovisningen. Det som är säkert är principen: listpriset är priset. Det är exakt den princip en pass-through-router som OrcaRouter arbetar efter — 0 % påslag, leverantörens listpris förs vidare — så om Go​ogle sänker transkriberingspriserna under preview-till-GA-fönstret, är sänkningen live hos oss samma dag, inte efter att en återförsäljare uppdaterar en prislista.

Där den rullas ut

För utvecklare innebär offentlig förhandsvisning idag två ytor: G​emini API:et i Go​ogle AI Studio och G​emini Enterprise Agent Platform för företagsarbetsbelastningar. På konsumentsidan driver Gemini 3.​5 Transcribe redan Rambler-dikteringsfunktionen i Gboard på Android och G​emini-appen på macOS. Chrome är nästa – tala-för-att-skriva i vilket webbfält som helst – följt av Search Live, G​emini Live, Docs, Keep och Gmail. För ett team som utvärderar det är det praktiska svaret enklare: det kan anropas från kod idag, på engelska, i de regioner där G​emini API:et är tillgängligt.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Vad detta innebär för din pipeline

Det genuint nya är inte en WER-siffra. Det är att Go​ogle nu säljer transkribering med de två funktioner som team tidigare satte ihop själva — talareetiketter och tidsstämplar på ordnivå — i basmodellen, på en G​emini API-yta som stöder funktionsanrop. Om du byggde en pipeline för diariserade mötesanteckningar av en vanlig transkriberare plus en separat diariserare plus ett formateringssteg, är detta den första Go​ogle-modellen som slår samman dessa steg. Den öppna frågan är hur den icke-strömmande WER-siffran på 2,6 % håller måttet på ditt eget ljud, och tills en oberoende reproduktion dyker upp är det ansvarsfulla draget för ett produktionsteam att köra ett verkligt prov genom API:et snarare än att budgetera utifrån Go​ogles valda riktmärken. För LLM-arbetet som körs ovanpå transkriptet — sammanfattning, strukturerad extrahering, åtgärdspunkter — är det i det lagret som routing gör skäl för sin existens, och det är just det lagret OrcaRouter täcker: ett API för 200+ modeller, automatisk failover mellan leverantörer och en routing-DSL som komponerar flera modeller till ett enda anrop. Själva transkriberingssteget bör du testa med ditt eget ljud innan du litar på någons rubriksiffra.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube