
Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: a linha de base precisa ser substituída?
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Whisper Large v3 Turbo é o modelo que a frase "speech-to-text" assume por padrão para grande parte da indústria, e o Gemini 3.5 Transcribe é o primeiro modelo de transcrição do Google que é explicitamente vendido como um desafiante dessa linha de base, em vez de uma API de fala genérica. O Gemini 3.5 Transcribe, em pré-visualização pública desde 26 de agosto de 2026, reformula a transcrição como uma tarefa de raciocínio — ele resolve autocorreções, formata a saída, atribui falantes e chama outros modelos Gemini por conta própria. O Whisper Large v3 Turbo é a destilação de 809 milhões de parâmetros do Whisper Large-v3 da OpenAI, licenciado sob MIT, auto-hospedável, com suporte a 99 idiomas e aproximadamente quatro a oito vezes mais rápido que o modelo do qual foi destilado, dependendo do hardware. Um é uma camada de inteligência gerenciada sobre o áudio; o outro é um componente gratuito e bem compreendido que você executa onde quiser. A pergunta que esta página existe para responder é mais restrita e mais útil do que "qual é melhor": quando a linha de base deixa de ser boa o suficiente?
A referência, caso você tenha esquecido como ela é boa
Whisper Large v3 Turbo merece seu status padrão, então o argumento a favor dele vem primeiro:
• Ele roda em qualquer lugar — licença MIT, pesos abertos, instalável em um laptop, uma única GPU ou uma função serverless. Sem fornecedor, sem medição, sem dados saindo da sua rede.
• É rápido — o decoder destilado (32 camadas de encoder, 4 camadas de decoder, reduzido de 32) o torna cerca de quatro vezes mais rápido que o Whisper Large-v3 em hardware típico, mais em alguns, mantendo a maior parte de sua precisão. O valor da própria OpenAI é cerca de oito vezes em um A100.
• Abrange 99 idiomas para transcrição, uma lista mais ampla do que os 85+ do Gemini 3.5 Transcribe.
• Sua precisão é bem documentada: 2,1% WER em LibriSpeech test-clean, 4,2% em test-other, 9,1% em Common Voice English — números que têm sido replicados em toda a comunidade há anos.
O ecossistema é enorme — faster-whisper, whisper.cpp, exports ONNX e todos os frameworks de inferência que você já usa. Se você consegue rodar um modelo, consegue rodar este.

Para transcrição em lote de inglês e quase-inglês em escala, o Whisper Large v3 Turbo é o padrão vigente por razões estruturais que nenhuma lacuna de benchmark consegue facilmente superar: é gratuito, é seu e está em toda parte.

O que o Gemini 3.5 Transcribe adiciona por cima
O valor do desafiante gerenciado não é superar a linha de base em inglês limpo — essa é uma disputa que os números ainda não conseguem resolver de forma clara. Seu valor está no trabalho que acontece acima das palavras, algo que o Whisper explicitamente não faz:
• Atribuição de falante — até três falantes com timestamps em nível de palavra, no modelo base. O Whisper transcreve um único fluxo de fala; ele não tem noção de quem disse o quê.
• Formatação inteligente — disfluências removidas, autocorreções resolvidas, pontuação e capitalização aplicadas. O Whisper retorna as palavras como faladas, incluindo os "ums" e tudo mais.
• Vocabulário personalizado — viés para jargões e grafias incomuns. O Whisper não possui tal mecanismo; você faz pós-processamento ou fine-tuning.
• Chamada de função — a transcrição pode ser repassada para outros modelos Gemini, tornando a transcrição uma etapa em um pipeline de agente em vez da saída terminal.
• Sessões longas — cerca de uma hora de áudio em uma única passada (contexto de 96K relatado pela imprensa) contra a necessidade prática do Whisper de dividir em blocos e unir arquivos longos.
Esse é um produto diferente. É o que o Google quer dizer com "transcrição inteligente", e é a parte da comparação que não depende da aritmética de benchmarks.
A questão da precisão que ninguém consegue responder claramente ainda.
Os números de destaque dos dois modelos não se confrontam de fato. O WER de 2,6% sem streaming do Gemini 3.5 Transcribe é uma medição da Artificial Analysis citada pelo Google, calculada sobre mais de 85 idiomas. O test-clean de 2,1% do LibriSpeech do Whisper Large v3 Turbo é um benchmark de inglês do próprio artigo de destilação da OpenAI, amplamente replicado. Corpora diferentes, cobertura de idiomas diferente, fornecedores diferentes. O que se pode dizer com honestidade: em inglês limpo, a linha de base aberta e o desafiante gerenciado estão plausivelmente na mesma faixa, e a vantagem do modelo gerenciado está nos seus recursos multilíngues e estruturais, não em uma vitória demonstrada de WER em inglês. Os materiais de lançamento do Google não contêm comparação frente a frente com os modelos da família Whisper, e uma comparação adversarial independente ainda não existe porque o Gemini 3.5 Transcribe está público há apenas um dia. Até que uma apareça, a coroa de precisão está sem dono, e qualquer artigo — inclusive este — que declare um vencedor de WER com base nesses dois números está exagerando.

Custo: gratuito para executar contra US$ 0,005 por minuto
Whisper Large v3 Turbo tem custo de hardware e não tem medidor. Execute-o em uma GPU que você já possui e o custo marginal por minuto transcrito fica próximo de zero; alugue uma GPU e o custo é o que a instância custar enquanto trabalha. O Gemini 3.5 Transcribe cobra cerca de US$ 0,005 por minuto de áudio na média, com o SKU ao vivo em cerca de US$ 0,009 por minuto e um nível gratuito. Em mil horas de áudio, isso dá cerca de US$ 300 no medidor do Gemini, contra alguns dólares de tempo de GPU na linha de base aberta. Essa diferença é a história real de custo deste confronto, e é por isso que a linha de base manterá seu status padrão para trabalho em lote de inglês em alto volume por muito tempo. A economia do modelo gerenciado só se aproxima quando os recursos que ele inclui — diarização, formatação, controle de vocabulário — custariam, por si só, tempo de engenharia para você montar em cima do Whisper.
Idiomas e streaming
O Whisper Large v3 Turbo lista 99 idiomas contra os 85+ do Gemini, mas a história prática do multilíngue é diferente: o Whisper transcreve todos os 99 em uma única passada, sem detecção automática, e sua precisão degrada mais em idiomas de baixos recursos e ruidosos — o trade-off de um modelo destilado. O Gemini detecta automaticamente entre seus 85+ e o Google destaca sotaques e dialetos regionais. Para streaming, o Whisper não tem modelo nativo em tempo real; implantações em tempo real usam faster-whisper e frameworks similares no seu próprio hardware, enquanto o Gemini 3.5 Transcribe tem um endpoint ao vivo dedicado, com latência sub-segundo alegada e um preço à altura. Se sua carga de trabalho é ao vivo e multilíngue, o endpoint gerenciado é mais simples de operar; se é em lote e em inglês, a linha de base aberta é mais barata.
O veredito, tal como é
O Whisper Large v3 Turbo continua sendo a escolha padrão certa para transcrição em lote de inglês em escala, para qualquer coisa que precise rodar na sua própria infraestrutura e para equipes que querem um artefato congelado e auditável. O Gemini 3.5 Transcribe é a escolha certa quando a transcrição precisa ser mais do que palavras — rótulos de falante, formatação limpa, vocabulário de domínio, cobertura multilíngue ou um gancho de agente — e quando você está disposto a pagar por esses recursos. Os dois coexistem, e o padrão que torna a coexistência barata é uma fronteira de roteamento: o transcritor que se ajusta ao áudio; depois, a camada de LLM que decide o que acontece com o texto. É essa camada que o OrcaRouter opera — uma API para mais de 200 modelos, failover automático entre provedores e uma DSL de roteamento para compor vários modelos em uma única chamada. Nenhum dos modelos de fala é hospedado do nosso lado; a escolha da transcrição fica entre a sua GPU e o medidor do Google, e ambos continuarão existindo por muito tempo.
