
Transcrição inteligente com Gemini 3.5 Transcribe
- 智谱NOVOZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 por 1M de tokens
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
Gemini 3.5 Transcribe entrou em pré-visualização pública em 26 de agosto de 2026, e é o primeiro modelo de fala para texto da Google que é genuinamente vendido como um modelo Gemini: você o invoca por meio da API Gemini com um ID de modelo, o áudio é precificado em tokens, e a Google informa o custo por minuto de áudio em sua página de preços. Esse último detalhe é o que a cobertura voltada ao consumidor ignora. As matérias do dia do lançamento falam sobre remoção de palavras de preenchimento e edição de voz no Gboard, mas o que realmente mudou para os desenvolvedores é que a transcrição agora está na mesma superfície de API que o restante da linha Gemini, com atribuição de locutor e timestamps no nível de palavra no modelo base, em vez de em um add-on separado. Este artigo soa como uma referência de API, porque é essa a lacuna que a primeira onda de cobertura deixa em aberto.
Duas ressalvas desde já para que os números abaixo não induzam a erro. A Google não chama o Gemini 3.5 Transcribe de "o modelo de reconhecimento de fala mais preciso que temos" — a alegação é que é o modelo mais preciso para interações de voz inteligentes, o que é uma alegação diferente, e essa diferença importa quando você lê os números de WER. E tudo aqui descreve uma prévia pública: os dois IDs de modelo, os preços e os números de benchmark são o que a Google disponibiliza hoje, e tudo isso pode mudar antes da GA.
Os dois caminhos da API — e os IDs de modelo a lembrar
O Gemini 3.5 Transcribe é disponibilizado como dois endpoints, e escolher o correto é a primeira decisão de arquitetura que uma equipe toma:
• gemini-3-5-transcribe — o caminho pré-gravado via a API Interactions. Envie um arquivo, receba a transcrição de volta com atribuição de falantes (até três falantes; três ou mais é experimental) e carimbos de tempo em nível de palavra. Este é o burro de carga do processamento em lote e assíncrono.
• gemini-3-5-transcribe-live — o caminho em tempo real via Live API. Streaming bidirecional com latência de menos de um segundo, voltado para conversas ao vivo, legendagem e interfaces orientadas por voz.
A divisão espelha como o restante da família Gemini Audio é organizado, e isso importa porque "live" é um SKU distinto com preço próprio. Várias leituras iniciais deste lançamento presumem que um único modelo faz as duas coisas; não faz.

O que "transcrição inteligente" realmente significa
A publicação de lançamento do Google enquadra isso como ir além da precisão fonética em direção à compreensão. Os recursos que decorrem desse enquadramento são os que devem ser avaliados, em vez do enquadramento em si:
• Tratamento de disfluências — "ums" e "ahs" são descartados, e autocorreções são resolvidas. "Vamos nos encontrar na terça — não, na quarta" é transcrito como o dia corrigido, não como transcrição de um falso início. Essa é uma decisão que o modelo toma, e é nesse sentido que o Google a chama de inteligente.
• Autoformatação — a saída retorna como texto polido: pontuação, capitalização e estrutura de parágrafos aplicadas, não um fluxo bruto de tokens.
• Identificação de múltiplos falantes — até três falantes atribuídos em áudio pré-gravado com timestamps em nível de palavra; três ou mais falantes é experimental. Isso fica no modelo base, em vez de um serviço separado de diarização.
• Vocabulário personalizado — você pode direcionar o reconhecimento para jargões, nomes de produtos e grafias incomuns fornecendo um vocabulário, que é o mecanismo para domínios verticais.
• Mais de 85 idiomas — detecção automática, com sotaques regionais e dialetos identificados explicitamente.
• Chamada de funções — o modelo pode delegar tarefas como geração de imagens ou análise de arquivos a outros modelos Gemini, o que transforma a transcrição em um componente de um agente maior, em vez de uma etapa final.
• Captura de entidades — a Google afirma ter forte desempenho em áudio ruidoso do mundo real e em entidades alfanuméricas, como códigos postais e IDs de pedidos.
A cobertura da imprensa também relatou {{1}}uma janela de contexto de 96.000 tokens (aproximadamente uma hora de áudio de reunião sem dividir){{/1}} e {{2}}detecção de emoções{{/2}}. Ambos são consistentes com o enquadramento do lançamento, mas a ficha do modelo que o Google publicou não os destaca, então trate-os como {{3}}relatados em vez de confirmados{{/3}} até que a ficha de especificações do GA apareça.

Os números de precisão, rotulados
Os números de WER que o Google cita vêm da Artificial Analysis: uma taxa média de erro de palavras de 4,0% para transcrição em streaming e 2,6% para transcrição não streaming. No benchmark multilíngue FLEURS, o Google relata 5,50% de WER para streaming e 5,04% para não streaming. O Google também afirma uma melhoria de 70% no tempo até a transcrição final em relação ao seu antecessor, o Chirp 3.
A leitura honesta: estas são medições independentes no sentido de que a Artificial Analysis não é o Google, mas são medições selecionadas pelo Google, publicadas dentro do anúncio do próprio Google, de um modelo que está disponível para chamadas há um dia. Ninguém fora do Google ainda executou uma comparação adversária frente a frente contra os modelos de pesos abertos com os quais a maioria das equipes o compara, e os materiais de lançamento não contêm nenhuma comparação direta com a família Whisper ou com a linha Parakeet da NVIDIA. O valor de 70% mais rápido que o Chirp-3 é uma afirmação do fornecedor, ponto final. Trate os 2,6% e 4,0% como sinais iniciais fortes, não como fatos estabelecidos.
Quanto custa
A página de preços do Google apresenta cada modelo em tokens e em minutos estimados de áudio. Para gemini-3-5-transcribe, a estimativa combinada é de aproximadamente US$ 0,005 por minuto de áudio aos preços de tabela — entrada cerca de US$ 0,003/min, saída cerca de US$ 0,002/min. Para gemini-3-5-transcribe-live, a estimativa combinada é de cerca de US$ 0,009 por minuto. Ambos têm uma camada gratuita hoje.
Esses valores por minuto são estimativas derivadas de uma taxa de tokens presumida (25 tokens de áudio por segundo de entrada, 175 tokens de texto por minuto de saída), portanto, eles mudam se o Google alterar a contabilização de tokens. O que é sólido é o princípio: o preço de tabela é o preço. Esse é exatamente o princípio pelo qual um roteador pass-through como o OrcaRouter opera — margem de 0%, preço de tabela do provedor repassado — portanto, se o Google reduzir o preço da transcrição durante a janela de preview para GA, a redução entra em vigor no nosso lado no mesmo dia, não depois que um revendedor atualiza uma tabela de preços.
Onde está sendo implementado
Para desenvolvedores, a prévia pública hoje significa duas frentes: a API Gemini no Google AI Studio e a Plataforma de Agentes Empresariais Gemini para cargas de trabalho empresariais. No lado do consumidor, o Gemini 3.5 Transcribe já potencializa o recurso de ditado Rambler no Gboard no Android e no aplicativo Gemini no macOS. O Chrome é o próximo — digitação por voz em qualquer campo da web — seguido por Search Live, Gemini Live, Docs, Keep e Gmail. Para uma equipe que esteja avaliando, a resposta prática é mais simples: ela pode ser chamada por código hoje, em inglês, nas regiões onde a API Gemini está disponível.

O que isso significa para o seu pipeline.
O que é genuinamente novo não é um número de WER. É que o Google agora está vendendo transcrição com os dois recursos que as equipes antes montavam por conta própria — rótulos de falante e timestamps em nível de palavra — no modelo base, em uma superfície da API Gemini que suporta chamada de funções. Se você estava construindo um pipeline de notas de reunião diarizadas com um transcritor simples, um diarizador separado e uma etapa de formatação, este é o primeiro modelo do Google que elimina essas etapas. A questão em aberto é como o WER não streaming de 2,6% se sustenta no seu próprio áudio e, até que uma reprodução independente apareça, a atitude responsável para uma equipe de produção é rodar uma amostra real pela API em vez de fazer orçamento com base nos benchmarks escolhidos pelo Google. Para o trabalho de LLM que roda sobre a transcrição — sumarização, extração estruturada, itens de ação — é nessa camada que o roteamento se paga, e é a camada que o OrcaRouter cobre: uma API que abrange mais de 200 modelos, failover automático entre provedores e um DSL de roteamento que compõe vários modelos em uma única chamada. A etapa de transcrição em si você deve testar com seu próprio áudio antes de confiar no número de manchete de qualquer um.
