Cartão hero de título para 'Transcrição inteligente com Gemini 3.5 Transcribe' mostrando uma forma de onda sonora se transformando em texto formatado, um globo marcado com 85+ idiomas, chips de identificação de falante, os números de destaque 2,6% WER sem streaming e ~US$ 0,005/min combinado, e o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

Transcrição inteligente com Gemini 3.5 Transcribe

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Gemini 3.​5 Transcribe entrou em pré-visualização pública em 26 de agosto de 2026, e é o primeiro modelo de fala para texto da Go​ogle que é genuinamente vendido como um modelo G​emini: você o invoca por meio da API G​emini com um ID de modelo, o áudio é precificado em tokens, e a Go​ogle informa o custo por minuto de áudio em sua página de preços. Esse último detalhe é o que a cobertura voltada ao consumidor ignora. As matérias do dia do lançamento falam sobre remoção de palavras de preenchimento e edição de voz no Gboard, mas o que realmente mudou para os desenvolvedores é que a transcrição agora está na mesma superfície de API que o restante da linha G​emini, com atribuição de locutor e timestamps no nível de palavra no modelo base, em vez de em um add-on separado. Este artigo soa como uma referência de API, porque é essa a lacuna que a primeira onda de cobertura deixa em aberto.

Duas ressalvas desde já para que os números abaixo não induzam a erro. A Go​ogle não chama o Gemini 3.​5 Transcribe de "o modelo de reconhecimento de fala mais preciso que temos" — a alegação é que é o modelo mais preciso para interações de voz inteligentes, o que é uma alegação diferente, e essa diferença importa quando você lê os números de WER. E tudo aqui descreve uma prévia pública: os dois IDs de modelo, os preços e os números de benchmark são o que a Go​ogle disponibiliza hoje, e tudo isso pode mudar antes da GA.

Os dois caminhos da API — e os IDs de modelo a lembrar

O Gemini 3.​5 Transcribe é disponibilizado como dois endpoints, e escolher o correto é a primeira decisão de arquitetura que uma equipe toma:

• gemini-3-5-transcribe — o caminho pré-gravado via a API Interactions. Envie um arquivo, receba a transcrição de volta com atribuição de falantes (até três falantes; três ou mais é experimental) e carimbos de tempo em nível de palavra. Este é o burro de carga do processamento em lote e assíncrono.

• gemini-3-5-transcribe-live — o caminho em tempo real via Live API. Streaming bidirecional com latência de menos de um segundo, voltado para conversas ao vivo, legendagem e interfaces orientadas por voz.

A divisão espelha como o restante da família G​emini Audio é organizado, e isso importa porque "live" é um SKU distinto com preço próprio. Várias leituras iniciais deste lançamento presumem que um único modelo faz as duas coisas; não faz.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

O que "transcrição inteligente" realmente significa

A publicação de lançamento do Go​ogle enquadra isso como ir além da precisão fonética em direção à compreensão. Os recursos que decorrem desse enquadramento são os que devem ser avaliados, em vez do enquadramento em si:

• Tratamento de disfluências — "ums" e "ahs" são descartados, e autocorreções são resolvidas. "Vamos nos encontrar na terça — não, na quarta" é transcrito como o dia corrigido, não como transcrição de um falso início. Essa é uma decisão que o modelo toma, e é nesse sentido que o Go​ogle a chama de inteligente.

• Autoformatação — a saída retorna como texto polido: pontuação, capitalização e estrutura de parágrafos aplicadas, não um fluxo bruto de tokens.

• Identificação de múltiplos falantes — até três falantes atribuídos em áudio pré-gravado com timestamps em nível de palavra; três ou mais falantes é experimental. Isso fica no modelo base, em vez de um serviço separado de diarização.

• Vocabulário personalizado — você pode direcionar o reconhecimento para jargões, nomes de produtos e grafias incomuns fornecendo um vocabulário, que é o mecanismo para domínios verticais.

• Mais de 85 idiomas — detecção automática, com sotaques regionais e dialetos identificados explicitamente.

• Chamada de funções — o modelo pode delegar tarefas como geração de imagens ou análise de arquivos a outros modelos Gemini, o que transforma a transcrição em um componente de um agente maior, em vez de uma etapa final.

• Captura de entidades — a Go​ogle afirma ter forte desempenho em áudio ruidoso do mundo real e em entidades alfanuméricas, como códigos postais e IDs de pedidos.

A cobertura da imprensa também relatou {{1}}uma janela de contexto de 96.000 tokens (aproximadamente uma hora de áudio de reunião sem dividir){{/1}} e {{2}}detecção de emoções{{/2}}. Ambos são consistentes com o enquadramento do lançamento, mas a ficha do modelo que o Go​ogle publicou não os destaca, então trate-os como {{3}}relatados em vez de confirmados{{/3}} até que a ficha de especificações do GA apareça.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Os números de precisão, rotulados

Os números de WER que o Go​ogle cita vêm da Artificial Analysis: uma taxa média de erro de palavras de 4,0% para transcrição em streaming e 2,6% para transcrição não streaming. No benchmark multilíngue FLEURS, o Go​ogle relata 5,50% de WER para streaming e 5,04% para não streaming. O Go​ogle também afirma uma melhoria de 70% no tempo até a transcrição final em relação ao seu antecessor, o Chirp 3.

A leitura honesta: estas são medições independentes no sentido de que a Artificial Analysis não é o Go​ogle, mas são medições selecionadas pelo Google, publicadas dentro do anúncio do próprio Go​ogle, de um modelo que está disponível para chamadas há um dia. Ninguém fora do Go​ogle ainda executou uma comparação adversária frente a frente contra os modelos de pesos abertos com os quais a maioria das equipes o compara, e os materiais de lançamento não contêm nenhuma comparação direta com a família Whisper ou com a linha Parakeet da NVIDIA. O valor de 70% mais rápido que o Chirp-3 é uma afirmação do fornecedor, ponto final. Trate os 2,6% e 4,0% como sinais iniciais fortes, não como fatos estabelecidos.

Quanto custa

A página de preços do Google apresenta cada modelo em tokens e em minutos estimados de áudio. Para gemini-3-5-transcribe, a estimativa combinada é de aproximadamente US$ 0,005 por minuto de áudio aos preços de tabela — entrada cerca de US$ 0,003/min, saída cerca de US$ 0,002/min. Para gemini-3-5-transcribe-live, a estimativa combinada é de cerca de US$ 0,009 por minuto. Ambos têm uma camada gratuita hoje.

Esses valores por minuto são estimativas derivadas de uma taxa de tokens presumida (25 tokens de áudio por segundo de entrada, 175 tokens de texto por minuto de saída), portanto, eles mudam se o Go​ogle alterar a contabilização de tokens. O que é sólido é o princípio: o preço de tabela é o preço. Esse é exatamente o princípio pelo qual um roteador pass-through como o OrcaRouter opera — margem de 0%, preço de tabela do provedor repassado — portanto, se o Go​ogle reduzir o preço da transcrição durante a janela de preview para GA, a redução entra em vigor no nosso lado no mesmo dia, não depois que um revendedor atualiza uma tabela de preços.

Onde está sendo implementado

Para desenvolvedores, a prévia pública hoje significa duas frentes: a API G​emini no Go​ogle AI Studio e a Plataforma de Agentes Empresariais G​emini para cargas de trabalho empresariais. No lado do consumidor, o Gemini 3.​5 Transcribe já potencializa o recurso de ditado Rambler no Gboard no Android e no aplicativo G​emini no macOS. O Chrome é o próximo — digitação por voz em qualquer campo da web — seguido por Search Live, G​emini Live, Docs, Keep e Gmail. Para uma equipe que esteja avaliando, a resposta prática é mais simples: ela pode ser chamada por código hoje, em inglês, nas regiões onde a API G​emini está disponível.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

O que isso significa para o seu pipeline.

O que é genuinamente novo não é um número de WER. É que o Go​ogle agora está vendendo transcrição com os dois recursos que as equipes antes montavam por conta própria — rótulos de falante e timestamps em nível de palavra — no modelo base, em uma superfície da API G​emini que suporta chamada de funções. Se você estava construindo um pipeline de notas de reunião diarizadas com um transcritor simples, um diarizador separado e uma etapa de formatação, este é o primeiro modelo do Go​ogle que elimina essas etapas. A questão em aberto é como o WER não streaming de 2,6% se sustenta no seu próprio áudio e, até que uma reprodução independente apareça, a atitude responsável para uma equipe de produção é rodar uma amostra real pela API em vez de fazer orçamento com base nos benchmarks escolhidos pelo Go​ogle. Para o trabalho de LLM que roda sobre a transcrição — sumarização, extração estruturada, itens de ação — é nessa camada que o roteamento se paga, e é a camada que o OrcaRouter cobre: uma API que abrange mais de 200 modelos, failover automático entre provedores e um DSL de roteamento que compõe vários modelos em uma única chamada. A etapa de transcrição em si você deve testar com seu próprio áudio antes de confiar no número de manchete de qualquer um.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube