
Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: vilken endpoint din app bör anropa
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligens49Kodning
När Google lanserade Gemini 3.5 Transcribe-familjen den 26 augusti 2026, ingick två modeller som delar namn och uppdrag men är byggda för olika stadier av en konversation: Gemini 3.5 Transcribe Live, streamingändpunkten som levereras via Live API, och Gemini 3.5 Transcribe, den förinspelade ändpunkten som levereras via Interactions API. Misstaget de flesta team gör under den första veckan är att behandla detta som en modell med två knappar. Det är två SKU:er – olika API:er, olika priser, olika hårda gränser – och noggrannhetsjämförelsen mellan dem är inte en rättvis kamp, eftersom de mäts under olika regler. Denna artikel ställer de två sida vid sida så att beslutet beror på din arbetsbelastning, inte på en topplista.
De två i korthet
• API — Gemini 3.5 Transcribe Live körs på Live API (WebSocket, dubbelriktad strömning) jämfört med Gemini 3.5 Transcribe på Interactions API (fil in, transkript ut).
• Jobb — livekonversation, textning, röstassistenter vs möten, samtalsloggar, arkiverat ljud.
• Noggrannhet — 4,0 % WER för streaming jämfört med 2,6 % WER för icke-streaming, enligt Artificial Analysis, citerad av Google; olika mätmetoder, inte direkt jämförbara.
• Latens — ett slutligt transkript 0,40 s efter talets slut jämfört med batchbearbetning av en komplett fil.
• Session — max 10 minuter per livesession jämfört med upp till 60 minuter för filer (30 minuter med diarisering och tidsstämplar aktiverade).
• Talare — inga på streaming-sidan jämfört med upp till tre talare med tidsstämplar per ord på den förinspelade sidan.
• Pris — cirka $0,009 per minut blandat jämfört med cirka $0,005 per minut blandat.

Arkitekturbeslutet: Interactions API eller Live API
Båda modellerna ingår i Googles Gemini Audio-familj och båda är i offentlig förhandsvisning. Skillnaden börjar vid transporten. gemini-3-5-transcribe-live öppnar en WebSocket och håller den öppen: rå ljuddata strömmar in kontinuerligt — vanligtvis i form av 16 kHz- eller 24 kHz-16-bitars PCM-block — och modellen returnerar partiella transkriptioner medan du talar, följt av en slutlig transkription för varje yttrande när talet avslutas. gemini-3-5-transcribe tar emot en komplett fil, bearbetar den och returnerar den färdiga transkriptionen med talarattribuering och tidsstämplar på ordnivå.
Transportbeslutet styr allt annat. Om din produkt återger ord medan de talas — en live-textning, en röstagent som läser av avsikten mitt i en mening, en samtalsassistent som agerar medan samtalet pågår — befinner du dig på Live-vägen. Om din produkt producerar en registrering — en mötesanteckning, en samtalslogg, ett arkiv — befinner du dig på Interaktionsvägen. Förvirringen ligger i att båda producerar text; skillnaden är om texten är ett realtidstillstånd eller en slutgiltig artefakt.
Noggrannhet: streaming-skatten är verklig.
Artificial Analysis, det oberoende benchmark-företaget vars siffror Google citerar i sitt lanseringsinlägg, mäter en genomsnittlig ordfelsfrekvens på 4,0 % för streamingändpunkten och 2,6 % för den icke-strömmande. På det flerspråkiga benchmark-testet FLEURS rapporterar Google 5,50 % för streaming jämfört med 5,04 % för icke-streaming. Siffran 2,6 % placerar Gemini 3.5 Transcribe på #5 i AA:s WER-topplista vid lanseringen, bakom ElevenLabs Scribe v2 på 2,2 % och Microsofts MAI-Transcribe-1.5 på 2,4 % — det är AA:s mätningar, inte Googles påståenden.
Strömningsnumret är inte en sämre version av samma test. Det är en annan regim: modellen binder sig till ord innan den har hört slutet av meningen, och den betalar för det. Välj inte mellan de två enbart på noggrannhet, för på en given arbetsbelastning kan skillnaden slå om. Välj utifrån begränsningarna: strömningsslutpunkten har en sessionsgräns på 10 minuter, ingen talardiarisering och inga tidsstämplar; den förinspelade slutpunkten hanterar timslånga filer, tillskriver upp till tre talare och returnerar tidsstämplar på ordnivå. Om din app behöver talareetiketter kan strömningsmodellen helt enkelt inte utföra jobbet, oavsett dess WER.

Vad de delar
De två slutpunkterna delar motorn för "intelligent transkribering", och när det gäller de delade funktionerna är valet mellan dem neutralt:
• 85+ språk med automatisk detektering, inklusive språkväxling mitt i strömmen på Live-sökvägen.
Disfluensrensning — fyllnadsord tas bort, självkorrigeringar åtgärdas (”tisdag — nej, onsdag” blir den korrigerade dagen).
• Automatisk formatering — skiljetecken, skiftläge och styckestruktur som tillämpas på utdata.
• Anpassad vokabulär — upp till 1 000 termer för jargong och produktnamn, där Googles dokumentation rekommenderar ungefär 100 för bästa resultat.
En sak att notera som gäller båda: den "smarta" rensningen som gör utskriften läsbar är ett designval som sker på bekostnad av ordagrann trohet. Tafatta formuleringar poleras; texten är modellens tolkning av avsikten, inte ett rättegångsprotokoll. För exakta utskrifter vill du ha ett ordagrant alternativ där ett sådant erbjuds, och du bör verifiera beteendet på ditt eget ljudmaterial i vilket fall som helst.
Kostnad per minut: live premium
Google prissätter ljud i tokens med 25 ljudtokens per sekund, med utdata på ungefär 175 texttokens per minut transkript. Vid listpriser är den sammanvägda kostnaden per minut ljud cirka $0,005 för gemini-3-5-transcribe och cirka $0,009 för gemini-3-5-transcribe-live — inmatning till $2 jämfört med $3,50 per miljon tokens, utdata till $12 jämfört med $21 per miljon tokens. Båda har en gratisnivå idag.
Det du betalar extra för är realtidsvägen, inte högre noggrannhet: du betalar ungefär 80 % mer per minut för streamingändpunkten, och den transkriberar med en högre WER. Det är den ärliga beskrivningen. Den förinspelade modellen är både billigare och mer exakt; streamingmodellen finns eftersom vissa produkter inte kan vänta på att filen är klar.
Vilken endpoint bör du bygga vidare på?
• Live-textning och undertexter — Gemini 3.5 Transcribe Live, och kontrollera gränsen för inga tidsstämplar om du behöver tidsanpassad utdata.
• Röstagenter — Gemini 3.5 Transcribe Live för avsiktsigenkänning mitt i meningen; planera runt 10-minutersgränsen för långa sessioner.
• Möten, intervjuer, arkivering — Gemini 3.5 Transcribe, med 2,6 % WER, talarattribuering och tidsstämplar på ordnivå.
• Analys efter samtal — Gemini 3.5 Transcribe för den färdiga inspelningen; Gemini 3.5 Transcribe Live endast om analysen måste köras under samtalet.
• Lång kontinuerlig ljudinspelning — Gemini 3.5 Transcribe, eftersom en 60-minutersfil slår att sy ihop tio-minuters liveinspelningar för hand.

Lagret ovanför transkriptet
Ingen av modellerna är något som OrcaRouter hostar — vi routar inte tal-till-text i dag, och du kommer att anropa Googles API direkt för båda ändpunkterna. Vad ett routningslager gör för en röstpipeline är att ligga ovanför transkriptet: summeraren, entitetsextraktorn, åtgärdspunktsmodellen som omvandlar en ström till ett beslut. Det är där OrcaRouter gör rätt för sig — ett API för över 200 modeller till leverantörens listpris utan påslag, automatisk failover mellan leverantörer och en routnings-DSL som komponerar flera modeller till ett enda anrop. Välj transkriptionsändpunkt efter arbetsbelastning, kör sedan modellen som läser transkriptet med en enda nyckel.
Slutsats
Gemini 3.5 Transcribe Live och Gemini 3.5 Transcribe tillhör samma familj men är olika produkter. Välj Live när transkriptet måste finnas innan konversationen är slut och du kan acceptera en session på 10 minuter, utan talareetiketter och utan tidsstämplar. Välj Transcribe när resultatet är en dokumentation och noggrannhet och tillskrivning betyder mer än hastighet – det är billigare, mer exakt och betydligt mindre begränsat. Det enda felaktiga svaret är att anta att en enda slutpunkt gör båda.
