Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — vilken endpoint din app ska anropa. Regenererad illustration.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: vilken endpoint din app bör anropa

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

När Go​ogle lanserade Ge​mini 3.5 Transcribe-familjen den 26 augusti 2026, ingick två modeller som delar namn och uppdrag men är byggda för olika stadier av en konversation: Ge​mini 3.5 Transcribe Live, streamingändpunkten som levereras via Live API, och Ge​mini 3.5 Transcribe, den förinspelade ändpunkten som levereras via Interactions API. Misstaget de flesta team gör under den första veckan är att behandla detta som en modell med två knappar. Det är två SKU:er – olika API:er, olika priser, olika hårda gränser – och noggrannhetsjämförelsen mellan dem är inte en rättvis kamp, eftersom de mäts under olika regler. Denna artikel ställer de två sida vid sida så att beslutet beror på din arbetsbelastning, inte på en topplista.

De två i korthet

• API — Ge​mini 3.5 Transcribe Live körs på Live API (WebSocket, dubbelriktad strömning) jämfört med Ge​mini 3.5 Transcribe på Interactions API (fil in, transkript ut).

• Jobb — livekonversation, textning, röstassistenter vs möten, samtalsloggar, arkiverat ljud.

• Noggrannhet — 4,0 % WER för streaming jämfört med 2,6 % WER för icke-streaming, enligt Artificial Analysis, citerad av Go​ogle; olika mätmetoder, inte direkt jämförbara.

• Latens — ett slutligt transkript 0,40 s efter talets slut jämfört med batchbearbetning av en komplett fil.

• Session — max 10 minuter per livesession jämfört med upp till 60 minuter för filer (30 minuter med diarisering och tidsstämplar aktiverade).

• Talare — inga på streaming-sidan jämfört med upp till tre talare med tidsstämplar per ord på den förinspelade sidan.

• Pris — cirka $0,009 per minut blandat jämfört med cirka $0,005 per minut blandat.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

Arkitekturbeslutet: Interactions API eller Live API

Båda modellerna ingår i Googles Gemini Audio-familj och båda är i offentlig förhandsvisning. Skillnaden börjar vid transporten. gemini-3-5-transcribe-live öppnar en WebSocket och håller den öppen: rå ljuddata strömmar in kontinuerligt — vanligtvis i form av 16 kHz- eller 24 kHz-16-bitars PCM-block — och modellen returnerar partiella transkriptioner medan du talar, följt av en slutlig transkription för varje yttrande när talet avslutas. gemini-3-5-transcribe tar emot en komplett fil, bearbetar den och returnerar den färdiga transkriptionen med talarattribuering och tidsstämplar på ordnivå.

Transportbeslutet styr allt annat. Om din produkt återger ord medan de talas — en live-textning, en röstagent som läser av avsikten mitt i en mening, en samtalsassistent som agerar medan samtalet pågår — befinner du dig på Live-vägen. Om din produkt producerar en registrering — en mötesanteckning, en samtalslogg, ett arkiv — befinner du dig på Interaktionsvägen. Förvirringen ligger i att båda producerar text; skillnaden är om texten är ett realtidstillstånd eller en slutgiltig artefakt.

Noggrannhet: streaming-skatten är verklig.

Artificial Analysis, det oberoende benchmark-företaget vars siffror Go​ogle citerar i sitt lanseringsinlägg, mäter en genomsnittlig ordfelsfrekvens på 4,0 % för streamingändpunkten och 2,6 % för den icke-strömmande. På det flerspråkiga benchmark-testet FLEURS rapporterar Go​ogle 5,50 % för streaming jämfört med 5,04 % för icke-streaming. Siffran 2,6 % placerar Ge​mini 3.5 Transcribe på #5 i AA:s WER-topplista vid lanseringen, bakom ElevenLabs Scribe v2 på 2,2 % och Microsofts MAI-Transcribe-1.5 på 2,4 % — det är AA:s mätningar, inte Go​ogles påståenden.

Strömningsnumret är inte en sämre version av samma test. Det är en annan regim: modellen binder sig till ord innan den har hört slutet av meningen, och den betalar för det. Välj inte mellan de två enbart på noggrannhet, för på en given arbetsbelastning kan skillnaden slå om. Välj utifrån begränsningarna: strömningsslutpunkten har en sessionsgräns på 10 minuter, ingen talardiarisering och inga tidsstämplar; den förinspelade slutpunkten hanterar timslånga filer, tillskriver upp till tre talare och returnerar tidsstämplar på ordnivå. Om din app behöver talareetiketter kan strömningsmodellen helt enkelt inte utföra jobbet, oavsett dess WER.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Vad de delar

De två slutpunkterna delar motorn för "intelligent transkribering", och när det gäller de delade funktionerna är valet mellan dem neutralt:

• 85+ språk med automatisk detektering, inklusive språkväxling mitt i strömmen på Live-sökvägen.

Disfluensrensning — fyllnadsord tas bort, självkorrigeringar åtgärdas (”tisdag — nej, onsdag” blir den korrigerade dagen).

• Automatisk formatering — skiljetecken, skiftläge och styckestruktur som tillämpas på utdata.

• Anpassad vokabulär — upp till 1 000 termer för jargong och produktnamn, där Googles dokumentation rekommenderar ungefär 100 för bästa resultat.

En sak att notera som gäller båda: den "smarta" rensningen som gör utskriften läsbar är ett designval som sker på bekostnad av ordagrann trohet. Tafatta formuleringar poleras; texten är modellens tolkning av avsikten, inte ett rättegångsprotokoll. För exakta utskrifter vill du ha ett ordagrant alternativ där ett sådant erbjuds, och du bör verifiera beteendet på ditt eget ljudmaterial i vilket fall som helst.

Kostnad per minut: live premium

Google prissätter ljud i tokens med 25 ljudtokens per sekund, med utdata på ungefär 175 texttokens per minut transkript. Vid listpriser är den sammanvägda kostnaden per minut ljud cirka $0,005 för gemini-3-5-transcribe och cirka $0,009 för gemini-3-5-transcribe-live — inmatning till $2 jämfört med $3,50 per miljon tokens, utdata till $12 jämfört med $21 per miljon tokens. Båda har en gratisnivå idag.

Det du betalar extra för är realtidsvägen, inte högre noggrannhet: du betalar ungefär 80 % mer per minut för streamingändpunkten, och den transkriberar med en högre WER. Det är den ärliga beskrivningen. Den förinspelade modellen är både billigare och mer exakt; streamingmodellen finns eftersom vissa produkter inte kan vänta på att filen är klar.

Vilken endpoint bör du bygga vidare på?

• Live-textning och undertexter — Ge​mini 3.5 Transcribe Live, och kontrollera gränsen för inga tidsstämplar om du behöver tidsanpassad utdata.

• Röstagenter — Ge​mini 3.5 Transcribe Live för avsiktsigenkänning mitt i meningen; planera runt 10-minutersgränsen för långa sessioner.

• Möten, intervjuer, arkivering — Gemini 3.5 Transcribe, med 2,6 % WER, talarattribuering och tidsstämplar på ordnivå.

• Analys efter samtal — Ge​mini 3.5 Transcribe för den färdiga inspelningen; Ge​mini 3.5 Transcribe Live endast om analysen måste köras under samtalet.

• Lång kontinuerlig ljudinspelning — Ge​mini 3.5 Transcribe, eftersom en 60-minutersfil slår att sy ihop tio-minuters liveinspelningar för hand.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

Lagret ovanför transkriptet

Ingen av modellerna är något som OrcaRouter hostar — vi routar inte tal-till-text i dag, och du kommer att anropa Go​ogles API direkt för båda ändpunkterna. Vad ett routningslager gör för en röstpipeline är att ligga ovanför transkriptet: summeraren, entitetsextraktorn, åtgärdspunktsmodellen som omvandlar en ström till ett beslut. Det är där OrcaRouter gör rätt för sig — ett API för över 200 modeller till leverantörens listpris utan påslag, automatisk failover mellan leverantörer och en routnings-DSL som komponerar flera modeller till ett enda anrop. Välj transkriptionsändpunkt efter arbetsbelastning, kör sedan modellen som läser transkriptet med en enda nyckel.

Slutsats

Ge​mini 3.5 Transcribe Live och Ge​mini 3.5 Transcribe tillhör samma familj men är olika produkter. Välj Live när transkriptet måste finnas innan konversationen är slut och du kan acceptera en session på 10 minuter, utan talareetiketter och utan tidsstämplar. Välj Transcribe när resultatet är en dokumentation och noggrannhet och tillskrivning betyder mer än hastighet – det är billigare, mer exakt och betydligt mindre begränsat. Det enda felaktiga svaret är att anta att en enda slutpunkt gör båda.