
Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: qual endpoint seu aplicativo deve chamar
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligência49Código
Quando a Google lançou a família Gemini 3.5 Transcribe em 26 de agosto de 2026, ela disponibilizou dois modelos que compartilham nome e missão, mas são construídos para diferentes etapas de uma conversa: Gemini 3.5 Transcribe Live, o endpoint de streaming servido pela Live API, e Gemini 3.5 Transcribe, o endpoint de pré-gravado servido pela Interactions API. O erro que a maioria das equipes comete na primeira semana é tratar isso como um único modelo com dois botões. São dois SKUs — APIs diferentes, preços diferentes, limites rígidos diferentes — e a comparação de precisão entre eles não é uma disputa justa, porque eles são medidos sob regras diferentes. Este texto coloca os dois lado a lado para que a decisão dependa da sua carga de trabalho, e não de um ranking.
Os dois de relance
• API — O Gemini 3.5 Transcribe Live roda na Live API (WebSocket, streaming bidirecional) vs. Gemini 3.5 Transcribe na Interactions API (arquivo de entrada, transcrição de saída).
• Job — conversa ao vivo, legendagem, agentes de voz vs reuniões, registros de chamadas, áudio arquivado.
• Acurácia — 4,0% WER em streaming vs 2,6% WER em não streaming, segundo a Artificial Analysis, citada pelo Google; regimes de medição diferentes, não diretamente comparáveis.
• Latência — uma transcrição final 0,40s após o término da fala versus processamento em lote de um arquivo completo.
• Sessão — limite de 10 minutos por sessão ao vivo vs arquivos de até 60 minutos (30 minutos com diarização e timestamps habilitados).
• Falantes — nenhum no lado de streaming vs até três falantes com timestamps em nível de palavra no lado pré-gravado.
• Preço — cerca de $0,009 por minuto combinado vs cerca de $0,005 por minuto combinado.

A decisão de arquitetura: Interactions API ou Live API
Ambos os modelos fazem parte da {{1}}família Gemini Audio do Google{{/1}} e ambos estão em prévia pública. A diferença começa no transporte. {{2}}gemini-3-5-transcribe-live{{/2}} abre um WebSocket e o mantém aberto: o áudio bruto entra continuamente — {{3}}o enquadramento comum é de blocos PCM de 16 bits em 16 kHz ou 24 kHz{{/3}} — e o modelo retorna transcrições parciais enquanto você fala e, em seguida, uma transcrição final para cada enunciado quando a fala termina. {{4}}gemini-3-5-transcribe{{/4}} recebe um arquivo completo, processa-o e retorna a transcrição final com atribuição de locutor e timestamps em nível de palavra.
A decisão de transporte determina todo o resto. Se o seu produto exibe palavras no momento em que são faladas — uma legenda ao vivo, um agente de voz interpretando a intenção no meio da frase, um assistente de chamada agindo enquanto a chamada está ao vivo — você está no caminho ao vivo. Se o seu produto gera um registro — uma ata de reunião, um log de chamada, um arquivo — você está no caminho de interações. A confusão é que ambos produzem texto; a diferença é se o texto é um estado em tempo real ou um artefato final.
Precisão: o imposto sobre streaming é real.
Artificial Analysis, a casa de benchmarks independente cujos números o Google cita em seu post de lançamento, mede uma taxa média de erro de palavras de 4,0% para o endpoint de streaming e 2,6% para o de não-streaming. No benchmark multilíngue FLEURS, o Google reporta 5,50% para streaming contra 5,04% para não-streaming. O índice de 2,6% coloca o Gemini 3.5 Transcribe em #5 no ranking WER da AA no lançamento, atrás do ElevenLabs Scribe v2 com 2,2% e do MAI-Transcribe-1.5 da Microsoft com 2,4% — essas são medições da AA, não afirmações do Google.
O número de streaming não é uma versão pior do mesmo teste. É um regime diferente: o modelo se compromete com as palavras antes de ouvir o fim da frase, e paga por isso. Não escolha entre os dois apenas com base na precisão, porque em qualquer carga de trabalho a diferença pode se inverter. Escolha com base nas restrições: o endpoint de streaming tem um limite de sessão de 10 minutos, sem diarização de locutores e sem carimbos de tempo; o endpoint pré-gravado lida com arquivos de uma hora, atribui até três locutores e retorna carimbos de tempo em nível de palavra. Se o seu aplicativo precisa de rótulos de locutor, o modelo de streaming simplesmente não consegue fazer o trabalho, seja qual for o seu WER.

O que eles compartilham
Os dois endpoints compartilham o mecanismo de "intelligent transcription", e, nos recursos compartilhados, a escolha entre eles é neutra:
• Mais de 85 idiomas com detecção automática, incluindo troca de idioma no meio da transmissão no caminho Live.
• Limpeza de disfluências — eliminados os marcadores de hesitação, autocorreções resolvidas ("terça-feira — não, quarta-feira" resulta no dia corrigido).
• Auto-formatação — pontuação, maiúsculas/minúsculas e estrutura de parágrafos aplicadas à saída.
• Vocabulário personalizado — até 1.000 termos para jargões e nomes de produtos, com a documentação do Google recomendando cerca de 100 para melhores resultados.
Uma ressalva que se aplica a ambos: a limpeza "inteligente" que torna a saída legível é uma decisão de design que sacrifica a fidelidade literal. Frases estranhas são suavizadas; o texto é a leitura da intenção pelo modelo, não uma ata de tribunal. Para transcrições exatas, você vai querer uma opção verbatim quando houver uma disponível e, de qualquer forma, vai querer verificar o comportamento com seu próprio áudio.
Custo por minuto: o premium ao vivo
Google precifica áudio em tokens a 25 tokens de áudio por segundo, com saída de aproximadamente 175 tokens de texto por minuto de transcrição. Aos preços de tabela, o custo combinado por minuto de áudio é de cerca de $0.005 para gemini-3-5-transcribe e cerca de $0.009 para gemini-3-5-transcribe-live — entrada a $2 contra $3,50 por milhão de tokens, saída a $12 contra $21 por milhão de tokens. Ambos têm um nível gratuito hoje.
O prêmio compra o caminho em tempo real, não mais precisão: você paga cerca de 80% a mais por minuto pelo endpoint de streaming, e ele transcreve com uma WER mais alta. Esse é o quadro honesto. O modelo pré-gravado é ao mesmo tempo mais barato e mais preciso; o modelo de streaming existe porque alguns produtos não podem esperar o arquivo terminar.
Em qual endpoint você deve construir?
• Legendas ao vivo e subtítulos — Gemini 3.5 Transcribe Live, e verifique o limite sem timestamps se precisar de saída alinhada ao tempo.
• Agentes de voz — Gemini 3.5 Transcribe Live para intenção no meio da frase; planeje considerando o limite de 10 minutos para sessões longas.
• Reuniões, entrevistas, arquivamento — Gemini 3.5 Transcribe, para o WER de 2,6%, atribuição de falantes e timestamps em nível de palavra.
• Análises pós-chamada — Gemini 3.5 Transcribe para o registro concluído; Gemini 3.5 Transcribe Live apenas se a análise precisar ser executada durante a chamada.
• Áudio contínuo longo — Gemini 3.5 Transcribe, porque um arquivo de 60 minutos supera a emenda manual de sessões ao vivo de dez minutos.

A camada acima da transcrição
Nenhum dos modelos é algo que a OrcaRouter hospeda — hoje não roteamos fala para texto, e você chamará a API do Google diretamente para qualquer um dos endpoints. O que uma camada de roteamento faz em um pipeline de voz é ficar acima da transcrição: o resumidor, o extrator de entidades, o modelo de itens de ação que transforma um fluxo em uma decisão. É nessa camada que a OrcaRouter justifica sua existência — uma única API para mais de 200 modelos pelo preço de tabela do provedor, sem margem de lucro, failover automático entre provedores e um DSL de roteamento que compõe vários modelos em uma única chamada. Escolha o endpoint de transcrição conforme a carga de trabalho e então execute o modelo que lê a transcrição por trás de uma única chave.
Conclusão
Gemini 3.5 Transcribe Live e Gemini 3.5 Transcribe são da mesma família, porém produtos diferentes. Escolha Live quando a transcrição precisar existir antes de a conversa terminar e você puder aceitar uma sessão de 10 minutos, sem rótulos de falante e sem marcações de tempo. Escolha Transcribe quando a saída for um registro e a precisão e a atribuição importarem mais do que a velocidade — é mais barato, mais preciso e muito menos limitado. A única resposta errada é presumir que um único endpoint faz as duas coisas.
