Cartão de título principal para 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo' com o subtítulo 'a linha de base precisa ser substituída?', mostrando um cartão de API gerenciada à esquerda, rotulado como Gemini 3.5 Transcribe, com 2,6% de WER sem streaming, e um cartão de pesos abertos à direita, rotulado como Whisper Large v3 Turbo, com 2,1% no LibriSpeech clean, com um selo MIT e etiqueta 809M, e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: a linha de base precisa ser substituída?

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Whisper Large v3 Turbo é o modelo que a frase "speech-to-text" assume por padrão para grande parte da indústria, e o Gemini 3.​5 Transcribe é o primeiro modelo de transcrição do Go​ogle que é explicitamente vendido como um desafiante dessa linha de base, em vez de uma API de fala genérica. O Gemini 3.​5 Transcribe, em pré-visualização pública desde 26 de agosto de 2026, reformula a transcrição como uma tarefa de raciocínio — ele resolve autocorreções, formata a saída, atribui falantes e chama outros modelos G​emini por conta própria. O Whisper Large v3 Turbo é a destilação de 809 milhões de parâmetros do Whisper Large-v3 da Ope​nAI, licenciado sob MIT, auto-hospedável, com suporte a 99 idiomas e aproximadamente quatro a oito vezes mais rápido que o modelo do qual foi destilado, dependendo do hardware. Um é uma camada de inteligência gerenciada sobre o áudio; o outro é um componente gratuito e bem compreendido que você executa onde quiser. A pergunta que esta página existe para responder é mais restrita e mais útil do que "qual é melhor": quando a linha de base deixa de ser boa o suficiente?

A referência, caso você tenha esquecido como ela é boa

Whisper Large v3 Turbo merece seu status padrão, então o argumento a favor dele vem primeiro:

• Ele roda em qualquer lugar — licença MIT, pesos abertos, instalável em um laptop, uma única GPU ou uma função serverless. Sem fornecedor, sem medição, sem dados saindo da sua rede.

• É rápido — o decoder destilado (32 camadas de encoder, 4 camadas de decoder, reduzido de 32) o torna cerca de quatro vezes mais rápido que o Whisper Large-v3 em hardware típico, mais em alguns, mantendo a maior parte de sua precisão. O valor da própria OpenAI é cerca de oito vezes em um A100.

• Abrange 99 idiomas para transcrição, uma lista mais ampla do que os 85+ do Gemini 3.5 Transcribe.

• Sua precisão é bem documentada: 2,1% WER em LibriSpeech test-clean, 4,2% em test-other, 9,1% em Common Voice English — números que têm sido replicados em toda a comunidade há anos.

O ecossistema é enorme — faster-whisper, whisper.cpp, exports ONNX e todos os frameworks de inferência que você já usa. Se você consegue rodar um modelo, consegue rodar este.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Para transcrição em lote de inglês e quase-inglês em escala, o Whisper Large v3 Turbo é o padrão vigente por razões estruturais que nenhuma lacuna de benchmark consegue facilmente superar: é gratuito, é seu e está em toda parte.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

O que o Gemini 3.​5 Transcribe adiciona por cima

O valor do desafiante gerenciado não é superar a linha de base em inglês limpo — essa é uma disputa que os números ainda não conseguem resolver de forma clara. Seu valor está no trabalho que acontece acima das palavras, algo que o Whisper explicitamente não faz:

• Atribuição de falante — até três falantes com timestamps em nível de palavra, no modelo base. O Whisper transcreve um único fluxo de fala; ele não tem noção de quem disse o quê.

• Formatação inteligente — disfluências removidas, autocorreções resolvidas, pontuação e capitalização aplicadas. O Whisper retorna as palavras como faladas, incluindo os "ums" e tudo mais.

• Vocabulário personalizado — viés para jargões e grafias incomuns. O Whisper não possui tal mecanismo; você faz pós-processamento ou fine-tuning.

• Chamada de função — a transcrição pode ser repassada para outros modelos G​emini, tornando a transcrição uma etapa em um pipeline de agente em vez da saída terminal.

• Sessões longas — cerca de uma hora de áudio em uma única passada (contexto de 96K relatado pela imprensa) contra a necessidade prática do Whisper de dividir em blocos e unir arquivos longos.

Esse é um produto diferente. É o que o Google quer dizer com "transcrição inteligente", e é a parte da comparação que não depende da aritmética de benchmarks.

A questão da precisão que ninguém consegue responder claramente ainda.

Os números de destaque dos dois modelos não se confrontam de fato. O WER de 2,6% sem streaming do Gemini 3.​5 Transcribe é uma medição da Artificial Analysis citada pelo Go​ogle, calculada sobre mais de 85 idiomas. O test-clean de 2,1% do LibriSpeech do Whisper Large v3 Turbo é um benchmark de inglês do próprio artigo de destilação da Ope​nAI, amplamente replicado. Corpora diferentes, cobertura de idiomas diferente, fornecedores diferentes. O que se pode dizer com honestidade: em inglês limpo, a linha de base aberta e o desafiante gerenciado estão plausivelmente na mesma faixa, e a vantagem do modelo gerenciado está nos seus recursos multilíngues e estruturais, não em uma vitória demonstrada de WER em inglês. Os materiais de lançamento do Go​ogle não contêm comparação frente a frente com os modelos da família Whisper, e uma comparação adversarial independente ainda não existe porque o Gemini 3.​5 Transcribe está público há apenas um dia. Até que uma apareça, a coroa de precisão está sem dono, e qualquer artigo — inclusive este — que declare um vencedor de WER com base nesses dois números está exagerando.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Custo: gratuito para executar contra US$ 0,005 por minuto

Whisper Large v3 Turbo tem custo de hardware e não tem medidor. Execute-o em uma GPU que você já possui e o custo marginal por minuto transcrito fica próximo de zero; alugue uma GPU e o custo é o que a instância custar enquanto trabalha. O Gemini 3.​5 Transcribe cobra cerca de US$ 0,005 por minuto de áudio na média, com o SKU ao vivo em cerca de US$ 0,009 por minuto e um nível gratuito. Em mil horas de áudio, isso dá cerca de US$ 300 no medidor do G​emini, contra alguns dólares de tempo de GPU na linha de base aberta. Essa diferença é a história real de custo deste confronto, e é por isso que a linha de base manterá seu status padrão para trabalho em lote de inglês em alto volume por muito tempo. A economia do modelo gerenciado só se aproxima quando os recursos que ele inclui — diarização, formatação, controle de vocabulário — custariam, por si só, tempo de engenharia para você montar em cima do Whisper.

Idiomas e streaming

O Whisper Large v3 Turbo lista 99 idiomas contra os 85+ do G​emini, mas a história prática do multilíngue é diferente: o Whisper transcreve todos os 99 em uma única passada, sem detecção automática, e sua precisão degrada mais em idiomas de baixos recursos e ruidosos — o trade-off de um modelo destilado. O G​emini detecta automaticamente entre seus 85+ e o Go​ogle destaca sotaques e dialetos regionais. Para streaming, o Whisper não tem modelo nativo em tempo real; implantações em tempo real usam faster-whisper e frameworks similares no seu próprio hardware, enquanto o Gemini 3.​5 Transcribe tem um endpoint ao vivo dedicado, com latência sub-segundo alegada e um preço à altura. Se sua carga de trabalho é ao vivo e multilíngue, o endpoint gerenciado é mais simples de operar; se é em lote e em inglês, a linha de base aberta é mais barata.

O veredito, tal como é

O Whisper Large v3 Turbo continua sendo a escolha padrão certa para transcrição em lote de inglês em escala, para qualquer coisa que precise rodar na sua própria infraestrutura e para equipes que querem um artefato congelado e auditável. O Gemini 3.​5 Transcribe é a escolha certa quando a transcrição precisa ser mais do que palavras — rótulos de falante, formatação limpa, vocabulário de domínio, cobertura multilíngue ou um gancho de agente — e quando você está disposto a pagar por esses recursos. Os dois coexistem, e o padrão que torna a coexistência barata é uma fronteira de roteamento: o transcritor que se ajusta ao áudio; depois, a camada de LLM que decide o que acontece com o texto. É essa camada que o OrcaRouter opera — uma API para mais de 200 modelos, failover automático entre provedores e uma DSL de roteamento para compor vários modelos em uma única chamada. Nenhum dos modelos de fala é hospedado do nosso lado; a escolha da transcrição fica entre a sua GPU e o medidor do Go​ogle, e ambos continuarão existindo por muito tempo.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube