Carte de titre héro pour « Gemini 3.5 Transcribe vs Whisper Large v3 Turbo » avec le sous-titre « faut-il remplacer la baseline ? », montrant une carte d'API gérée à gauche intitulée Gemini 3.5 Transcribe à 2,6 % de WER non-streaming et une carte open-weight à droite intitulée Whisper Large v3 Turbo à 2,1 % sur LibriSpeech clean avec un badge MIT et une étiquette 809M, et le logo OrcaRouter dans le coin inférieur droit.
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo : faut-il remplacer la référence ?

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Whisper Large v3 Turbo est le modèle auquel l'expression « speech-to-text » fait référence par défaut pour une grande partie de l'industrie, et Gemini 3.​5 Transcribe est le premier modèle de transcription de Go​ogle explicitement commercialisé comme un challenger de cette référence plutôt que comme une API vocale générique. Gemini 3.​5 Transcribe, en aperçu public depuis le 26 août 2026, reformule la transcription comme une tâche de raisonnement — il résout les auto-corrections, formate la sortie, attribue les locuteurs et fait appel à d'autres modèles G​emini de sa propre initiative. Whisper Large v3 Turbo est la distillation par Ope​nAI, forte de 809 millions de paramètres, de Whisper Large-v3, sous licence MIT, auto-hébergeable, prenant en charge 99 langues, et environ quatre à huit fois plus rapide que le modèle dont elle est dérivée, selon le matériel. L'un est une couche d'intelligence gérée au-dessus de l'audio ; l'autre est un composant gratuit, bien connu, que vous exécutez où vous voulez. La question à laquelle cette page cherche à répondre est plus étroite et plus utile que « lequel est le meilleur » : à partir de quand la référence cesse-t-elle d'être suffisante ?

La référence, au cas où vous auriez oublié à quel point elle est bonne.

Whisper Large v3 Turbo mérite son statut par défaut, donc l'argument en sa faveur vient en premier :

• Il fonctionne partout — licence MIT, poids ouverts, installable sur un ordinateur portable, un seul GPU ou une fonction serverless. Pas de fournisseur, pas de compteur, aucune donnée ne quitte votre réseau.

• C'est rapide — le décodeur distillé (32 couches d'encodeur, 4 couches de décodeur, contre 32) le rend environ quatre fois plus rapide que Whisper Large-v3 sur du matériel typique, voire plus sur certains, tout en conservant l'essentiel de sa précision. Le chiffre d'Ope​nAI lui-même est d'environ huit fois sur un A100.

• Il couvre 99 langues pour la transcription, une liste plus large que les 85+ de Gemini 3.​5 Transcribe.

• Sa précision est bien documentée : 2.1% WER sur LibriSpeech test-clean, 4.2% sur test-other, 9.1% sur Common Voice English — des chiffres qui ont été reproduits par la communauté depuis des années.

L'écosystème est énorme — faster-whisper, whisper.cpp, les exports ONNX, et tous les frameworks d'inférence que vous utilisez déjà. Si vous pouvez exécuter un modèle, vous pouvez exécuter celui-ci.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Pour la transcription par lots à grande échelle de l'anglais et des langues proches, Whisper Large v3 Turbo demeure la référence pour des raisons structurelles qu'aucun écart de benchmark ne peut facilement renverser : il est gratuit, il vous appartient, et il est partout.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Ce que Gemini 3.5 Transcribe apporte en plus

La valeur du challenger géré n'est pas qu'il batte la référence sur un anglais propre — c'est un combat que les chiffres ne peuvent même pas encore trancher clairement. Sa valeur réside dans le travail qui se fait au-dessus des mots, ce que Whisper ne fait explicitement pas :

• Attribution des locuteurs — jusqu'à trois locuteurs avec horodatages au niveau du mot, dans le modèle de base. Whisper transcrit un flux de parole ; il n'a aucune notion de qui a dit quoi.

• Formatage intelligent — disfluences supprimées, auto-corrections résolues, ponctuation et casse appliquées. Whisper renvoie les mots tels qu'ils sont prononcés, avec les euh et tout.

• Vocabulaire personnalisé — tendance à privilégier le jargon et les orthographes inhabituelles. Whisper ne dispose pas d'un tel mécanisme ; vous post-traitez ou affinez.

• Appel de fonction — la transcription peut être confiée à d'autres modèles G​emini, ce qui fait de la transcription une étape dans un pipeline d'agent plutôt qu'une sortie terminale.

• Longues sessions — environ une heure d'audio en une seule passe (contexte de 96K rapporté par la presse) face au besoin pratique de Whisper de découper et recoller les fichiers longs.

C'est un produit différent. C'est ce que Go​ogle entend par « transcription intelligente », et c'est la partie de la comparaison qui ne dépend pas de l'arithmétique des benchmarks.

La question de la précision à laquelle personne ne peut encore répondre clairement.

Les chiffres phares des deux modèles ne s'affrontent pas réellement. Le WER non-streaming de Gemini 3.​5 Transcribe est de 2,6 %, une mesure d'Artificial Analysis citée par Go​ogle, calculée sur plus de 85 langues. Whisper Large v3 Turbo, lui, obtient 2,1 % sur LibriSpeech test-clean, un benchmark en anglais issu du propre article de distillation d'Ope​nAI et largement reproduit. Des corpus différents, une couverture linguistique différente, des fournisseurs différents. Ce qu'on peut honnêtement dire : sur de l'anglais propre, la baseline ouverte et le challenger managé se situent vraisemblablement dans la même fourchette, et l'avantage du modèle managé tient à ses caractéristiques multilingues et structurelles, pas à une victoire démontrée sur le WER en anglais. Les supports de lancement de Go​ogle ne contiennent aucune comparaison directe avec les modèles de la famille Whisper, et aucune comparaison indépendante et contradictoire n'existe encore, car Gemini 3.​5 Transcribe n'est public que depuis un jour. Tant qu'aucune n'existe, la couronne de la précision n'est pas revendiquée, et tout article — y compris celui-ci — qui déclare un vainqueur du WER à partir de ces deux chiffres va trop loin.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Coût : gratuit à exécuter contre 0,005 $ la minute.

Whisper Large v3 Turbo a un coût matériel, mais pas de compteur. Exécutez-le sur un GPU que vous possédez déjà et le coût marginal par minute transcrite est proche de zéro ; louez un GPU et le coût est simplement celui de l'instance pendant qu'elle fonctionne. Gemini 3.​5 Transcribe facture environ 0,005 $ par minute d'audio en tarif mixte, avec l'offre live à environ 0,009 $ par minute et un niveau gratuit. Pour mille heures d'audio, cela fait environ 300 $ au compteur G​emini, contre quelques dollars de temps GPU sur la baseline ouverte. Cet écart est la véritable histoire de coûts de cette confrontation, et c'est pourquoi la baseline conservera son statut par défaut pour les travaux par lots en anglais à grand volume pendant longtemps. L'économie du modèle géré ne rejoint celle de la baseline que lorsque les fonctionnalités qu'il regroupe — diarisation, formatage, contrôle du vocabulaire — vous coûteraient elles-mêmes du temps d'ingénierie à assembler au-dessus de Whisper.

Langues et streaming

Whisper Large v3 Turbo répertorie 99 langues contre les 85+ de G​emini, mais la réalité pratique du multilinguisme est différente : Whisper transcrit les 99 en une seule passe sans auto-détection, et sa précision se dégrade le plus sur les langues à faibles ressources et bruitées — le compromis d'un modèle distillé. G​emini effectue une auto-détection parmi ses 85+ langues, et Go​ogle met en avant les accents et dialectes régionaux. Pour le streaming, Whisper ne dispose pas de modèle temps réel natif ; les déploiements en temps réel utilisent faster-whisper et des frameworks similaires sur votre propre matériel, tandis que Gemini 3.​5 Transcribe dispose d'un endpoint live spécialement conçu, avec une latence inférieure à la seconde annoncée et un prix à l'avenant. Si votre charge de travail est en temps réel et multilingue, l'endpoint géré est plus simple à exploiter ; si elle est par lots et en anglais, le modèle de base open source est moins cher.

Le verdict, tel qu'il est.

Whisper Large v3 Turbo reste le bon choix par défaut pour la transcription par lots en anglais à grande échelle, pour tout ce qui doit s'exécuter sur votre propre infrastructure, et pour les équipes qui souhaitent un artefact figé et auditable. Gemini 3.​5 Transcribe est le bon choix lorsque la transcription doit aller au-delà des mots — étiquettes de locuteurs, mise en forme propre, vocabulaire de domaine, couverture multilingue ou accroche d'agent — et lorsque vous êtes prêt à payer au compteur pour ces fonctionnalités. Les deux coexistent, et le schéma qui rend cette coexistence peu coûteuse est une frontière de routage : le transcripteur qui convient à l'audio, puis la couche LLM qui décide de ce qu'il advient du texte. C'est cette couche que pilote OrcaRouter — une API unique sur plus de 200 modèles, bascule automatique entre fournisseurs, et un DSL de routage pour composer plusieurs modèles en un seul appel. Aucun des deux modèles de reconnaissance vocale n'est hébergé chez nous ; le choix de la transcription se fait entre votre GPU et le compteur de Go​ogle, et les deux seront là pour longtemps.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube