Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — qual endpoint seu aplicativo deve chamar. Ilustração regenerada.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: qual endpoint seu aplicativo deve chamar

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Quando a Go​ogle lançou a família Ge​mini 3.5 Transcribe em 26 de agosto de 2026, ela disponibilizou dois modelos que compartilham nome e missão, mas são construídos para diferentes etapas de uma conversa: Ge​mini 3.5 Transcribe Live, o endpoint de streaming servido pela Live API, e Ge​mini 3.5 Transcribe, o endpoint de pré-gravado servido pela Interactions API. O erro que a maioria das equipes comete na primeira semana é tratar isso como um único modelo com dois botões. São dois SKUs — APIs diferentes, preços diferentes, limites rígidos diferentes — e a comparação de precisão entre eles não é uma disputa justa, porque eles são medidos sob regras diferentes. Este texto coloca os dois lado a lado para que a decisão dependa da sua carga de trabalho, e não de um ranking.

Os dois de relance

• API — O Ge​mini 3.5 Transcribe Live roda na Live API (WebSocket, streaming bidirecional) vs. Ge​mini 3.5 Transcribe na Interactions API (arquivo de entrada, transcrição de saída).

• Job — conversa ao vivo, legendagem, agentes de voz vs reuniões, registros de chamadas, áudio arquivado.

• Acurácia — 4,0% WER em streaming vs 2,6% WER em não streaming, segundo a Artificial Analysis, citada pelo Go​ogle; regimes de medição diferentes, não diretamente comparáveis.

• Latência — uma transcrição final 0,40s após o término da fala versus processamento em lote de um arquivo completo.

• Sessão — limite de 10 minutos por sessão ao vivo vs arquivos de até 60 minutos (30 minutos com diarização e timestamps habilitados).

• Falantes — nenhum no lado de streaming vs até três falantes com timestamps em nível de palavra no lado pré-gravado.

• Preço — cerca de $0,009 por minuto combinado vs cerca de $0,005 por minuto combinado.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

A decisão de arquitetura: Interactions API ou Live API

Ambos os modelos fazem parte da {{1}}família Gemini Audio do Google{{/1}} e ambos estão em prévia pública. A diferença começa no transporte. {{2}}gemini-3-5-transcribe-live{{/2}} abre um WebSocket e o mantém aberto: o áudio bruto entra continuamente — {{3}}o enquadramento comum é de blocos PCM de 16 bits em 16 kHz ou 24 kHz{{/3}} — e o modelo retorna transcrições parciais enquanto você fala e, em seguida, uma transcrição final para cada enunciado quando a fala termina. {{4}}gemini-3-5-transcribe{{/4}} recebe um arquivo completo, processa-o e retorna a transcrição final com atribuição de locutor e timestamps em nível de palavra.

A decisão de transporte determina todo o resto. Se o seu produto exibe palavras no momento em que são faladas — uma legenda ao vivo, um agente de voz interpretando a intenção no meio da frase, um assistente de chamada agindo enquanto a chamada está ao vivo — você está no caminho ao vivo. Se o seu produto gera um registro — uma ata de reunião, um log de chamada, um arquivo — você está no caminho de interações. A confusão é que ambos produzem texto; a diferença é se o texto é um estado em tempo real ou um artefato final.

Precisão: o imposto sobre streaming é real.

Artificial Analysis, a casa de benchmarks independente cujos números o Go​ogle cita em seu post de lançamento, mede uma taxa média de erro de palavras de 4,0% para o endpoint de streaming e 2,6% para o de não-streaming. No benchmark multilíngue FLEURS, o Go​ogle reporta 5,50% para streaming contra 5,04% para não-streaming. O índice de 2,6% coloca o Ge​mini 3.5 Transcribe em #5 no ranking WER da AA no lançamento, atrás do ElevenLabs Scribe v2 com 2,2% e do MAI-Transcribe-1.5 da Microsoft com 2,4% — essas são medições da AA, não afirmações do Go​ogle.

O número de streaming não é uma versão pior do mesmo teste. É um regime diferente: o modelo se compromete com as palavras antes de ouvir o fim da frase, e paga por isso. Não escolha entre os dois apenas com base na precisão, porque em qualquer carga de trabalho a diferença pode se inverter. Escolha com base nas restrições: o endpoint de streaming tem um limite de sessão de 10 minutos, sem diarização de locutores e sem carimbos de tempo; o endpoint pré-gravado lida com arquivos de uma hora, atribui até três locutores e retorna carimbos de tempo em nível de palavra. Se o seu aplicativo precisa de rótulos de locutor, o modelo de streaming simplesmente não consegue fazer o trabalho, seja qual for o seu WER.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

O que eles compartilham

Os dois endpoints compartilham o mecanismo de "intelligent transcription", e, nos recursos compartilhados, a escolha entre eles é neutra:

• Mais de 85 idiomas com detecção automática, incluindo troca de idioma no meio da transmissão no caminho Live.

• Limpeza de disfluências — eliminados os marcadores de hesitação, autocorreções resolvidas ("terça-feira — não, quarta-feira" resulta no dia corrigido).

• Auto-formatação — pontuação, maiúsculas/minúsculas e estrutura de parágrafos aplicadas à saída.

• Vocabulário personalizado — até 1.000 termos para jargões e nomes de produtos, com a documentação do Google recomendando cerca de 100 para melhores resultados.

Uma ressalva que se aplica a ambos: a limpeza "inteligente" que torna a saída legível é uma decisão de design que sacrifica a fidelidade literal. Frases estranhas são suavizadas; o texto é a leitura da intenção pelo modelo, não uma ata de tribunal. Para transcrições exatas, você vai querer uma opção verbatim quando houver uma disponível e, de qualquer forma, vai querer verificar o comportamento com seu próprio áudio.

Custo por minuto: o premium ao vivo

Go​ogle precifica áudio em tokens a 25 tokens de áudio por segundo, com saída de aproximadamente 175 tokens de texto por minuto de transcrição. Aos preços de tabela, o custo combinado por minuto de áudio é de cerca de $0.005 para gemini-3-5-transcribe e cerca de $0.009 para gemini-3-5-transcribe-live — entrada a $2 contra $3,50 por milhão de tokens, saída a $12 contra $21 por milhão de tokens. Ambos têm um nível gratuito hoje.

O prêmio compra o caminho em tempo real, não mais precisão: você paga cerca de 80% a mais por minuto pelo endpoint de streaming, e ele transcreve com uma WER mais alta. Esse é o quadro honesto. O modelo pré-gravado é ao mesmo tempo mais barato e mais preciso; o modelo de streaming existe porque alguns produtos não podem esperar o arquivo terminar.

Em qual endpoint você deve construir?

• Legendas ao vivo e subtítulos — Ge​mini 3.5 Transcribe Live, e verifique o limite sem timestamps se precisar de saída alinhada ao tempo.

• Agentes de voz — Gemini 3.5 Transcribe Live para intenção no meio da frase; planeje considerando o limite de 10 minutos para sessões longas.

• Reuniões, entrevistas, arquivamento — Ge​mini 3.5 Transcribe, para o WER de 2,6%, atribuição de falantes e timestamps em nível de palavra.

• Análises pós-chamada — Ge​mini 3.5 Transcribe para o registro concluído; Ge​mini 3.5 Transcribe Live apenas se a análise precisar ser executada durante a chamada.

• Áudio contínuo longo — Ge​mini 3.5 Transcribe, porque um arquivo de 60 minutos supera a emenda manual de sessões ao vivo de dez minutos.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

A camada acima da transcrição

Nenhum dos modelos é algo que a OrcaRouter hospeda — hoje não roteamos fala para texto, e você chamará a API do Go​ogle diretamente para qualquer um dos endpoints. O que uma camada de roteamento faz em um pipeline de voz é ficar acima da transcrição: o resumidor, o extrator de entidades, o modelo de itens de ação que transforma um fluxo em uma decisão. É nessa camada que a OrcaRouter justifica sua existência — uma única API para mais de 200 modelos pelo preço de tabela do provedor, sem margem de lucro, failover automático entre provedores e um DSL de roteamento que compõe vários modelos em uma única chamada. Escolha o endpoint de transcrição conforme a carga de trabalho e então execute o modelo que lê a transcrição por trás de uma única chave.

Conclusão

Ge​mini 3.5 Transcribe Live e Ge​mini 3.5 Transcribe são da mesma família, porém produtos diferentes. Escolha Live quando a transcrição precisar existir antes de a conversa terminar e você puder aceitar uma sessão de 10 minutos, sem rótulos de falante e sem marcações de tempo. Escolha Transcribe quando a saída for um registro e a precisão e a atribuição importarem mais do que a velocidade — é mais barato, mais preciso e muito menos limitado. A única resposta errada é presumir que um único endpoint faz as duas coisas.