Carte-titre hero pour « Transcription intelligente avec Gemini 3.5 Transcribe » montrant une forme d'onde sonore qui se transforme en texte formaté, un globe indiquant 85+ langues, des étiquettes d'intervenants, les chiffres clés 2,6 % WER non-streaming et ~0,005 $/min combiné, et le logo OrcaRouter dans le coin inférieur droit.
Engineering & Research

Transcription intelligente avec Gemini 3.5 Transcribe

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 3.5 Transcribe est passé en aperçu public le 26 août 2026, et c'est le premier modèle de reconnaissance vocale de Google réellement vendu comme un modèle Gemini : vous l'appelez via l'API Gemini avec un identifiant de modèle, l'audio est facturé en tokens, et Google indique le coût par minute d'audio sur sa page de tarification. Ce dernier détail est ce que la couverture grand public survole. Les articles du jour du lancement portent sur la suppression des mots de remplissage et l'édition vocale dans Gboard, mais ce qui a réellement changé pour les développeurs, c'est que la transcription se trouve désormais sur la même surface d'API que le reste de la gamme Gemini, avec l'attribution des locuteurs et des horodatages au niveau du mot dans le modèle de base plutôt que dans un module complémentaire séparé. Ce texte se lit comme une référence d'API, car c'est la lacune que la première vague de couverture laisse ouverte.

Deux mises en garde au préalable afin que les chiffres ci-dessous n’induisent pas en erreur. Go​ogle ne qualifie pas Gemini 3.​5 Transcribe de « modèle de reconnaissance vocale le plus précis que nous ayons » — l’affirmation porte sur le modèle le plus précis pour les interactions vocales intelligentes, ce qui est une affirmation différente, et cette différence compte lorsque vous lisez les chiffres WER. Et tout ce qui est décrit ici concerne un aperçu public : les deux identifiants de modèle, les prix et les chiffres de référence sont ce que Go​ogle propose aujourd’hui, et tout peut évoluer avant la disponibilité générale.

Les deux chemins d’API — et les identifiants de modèle à retenir

Gemini 3.5 Transcribe se décline en deux points de terminaison, et le choix du bon constitue la première décision d'architecture qu'une équipe doit prendre :

• gemini-3-5-transcribe — la voie pré-enregistrée via l'API Interactions. Envoyez un fichier, récupérez la transcription avec attribution des locuteurs (jusqu'à trois locuteurs ; au-delà de trois, c'est expérimental) et des horodatages au niveau du mot. C'est la bête de somme du traitement par lots et asynchrone.

• gemini-3-5-transcribe-live — la voie en temps réel via l'API Live. Streaming bidirectionnel avec une latence inférieure à la seconde, destiné aux conversations en direct, au sous-titrage et aux interfaces vocales.

Cette répartition reflète la manière dont le reste de la gamme G​emini Audio est organisé, et cela a son importance car « live » est un SKU distinct avec son propre prix. Plusieurs lectures initiales de ce lancement supposent qu'un seul modèle fait les deux ; ce n'est pas le cas.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Ce que signifie réellement la « transcription intelligente »

Le post de lancement de Go​ogle présente cela comme un dépassement de la précision phonétique vers la compréhension. Les fonctionnalités qui découlent de ce cadrage sont celles à évaluer plutôt que le cadrage lui-même :

• Gestion des disfluences — les « um » et « ah » sont supprimés, et les auto-corrections sont résolues. « Rencontrons-nous mardi — non, mercredi » est transcrit comme le jour corrigé, et non comme une transcription d’un faux départ. C’est une décision que prend le modèle, et c’est en ce sens que Go​ogle le qualifie d’intelligent.

• Mise en forme automatique — la sortie revient sous forme de texte poli : ponctuation, casse et structure des paragraphes appliquées, et non un flux brut de jetons.

• Identification multi-locuteur — jusqu'à trois locuteurs attribués dans un fichier audio pré-enregistré avec des horodatages au niveau du mot ; trois locuteurs ou plus est expérimental. Cela relève du modèle de base plutôt que d'un service de diarisation distinct.

• Vocabulaire personnalisé — vous pouvez orienter la reconnaissance vers le jargon, les noms de produits et les orthographes inhabituelles en fournissant un vocabulaire, ce qui est le mécanisme pour les domaines verticaux.

• Plus de 85 langues — détection automatique, avec accents régionaux et dialectes signalés explicitement.

• Appel de fonction — le modèle peut déléguer des tâches telles que la génération d'images ou l'analyse de fichiers à d'autres modèles Gemini, ce qui fait de la transcription un composant d'un agent plus vaste plutôt qu'une étape terminale.

• Capture d'entités — Go​ogle revendique de solides performances sur l'audio du monde réel bruité et sur les entités alphanumériques telles que les codes postaux et les identifiants de commande.

La couverture presse a également fait état d'une fenêtre de contexte de 96 000 jetons (environ une heure d'audio de réunion sans découpage) et d'une détection des émotions. Ces deux éléments sont cohérents avec le cadrage du lancement, mais la fiche technique publiée par Google ne les met pas en avant ; il convient donc de les considérer comme des informations rapportées plutôt que confirmées jusqu'à la publication d'une fiche de spécifications GA.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

Les chiffres de précision, étiquetés

Les chiffres de WER cités par Go​ogle proviennent d'Artificial Analysis : un taux d'erreur moyen de 4.0% pour la transcription en streaming et de 2.6% pour la transcription hors streaming. Sur le benchmark multilingue FLEURS, Go​ogle rapporte un WER de 5.50% pour le streaming et de 5.04% pour le hors streaming. Go​ogle revendique également une amélioration de 70% du temps de transcription finale par rapport à son prédécesseur, Chirp 3.

Lecture honnête : ce sont des mesures indépendantes dans le sens où Artificial Analysis n'est pas Go​ogle, mais ce sont des mesures sélectionnées par Go​ogle, publiées dans l'annonce même de Go​ogle, d'un modèle qui n'est appelable que depuis un jour. Personne en dehors de Go​ogle n'a encore mené de confrontation directe contre les modèles open-weight avec lesquels la plupart des équipes le comparent, et les documents de lancement ne contiennent aucune comparaison directe avec la famille Whisper ou la gamme Parakeet de NVIDIA. Le chiffre de 70 % plus rapide que Chirp-3 est une affirmation du fournisseur, point final. Traitez 2,6 % et 4,0 % comme de forts signaux précoces, pas comme des faits établis.

Ce que ça coûte

La page de tarification de Google présente chaque modèle en tokens et en minutes d’audio estimées. Pour gemini-3-5-transcribe, l’estimation combinée est d’environ 0,005 $ par minute d’audio au prix catalogue — entrée environ 0,003 $/min, sortie environ 0,002 $/min. Pour gemini-3-5-transcribe-live, l’estimation combinée est d’environ 0,009 $ par minute. Les deux disposent aujourd’hui d’un niveau gratuit.

Ces chiffres par minute sont des estimations dérivées d’un taux de tokens supposé (25 tokens audio par seconde en entrée, 175 tokens texte par minute en sortie), ils changent donc si Go​ogle modifie la comptabilité des tokens. Ce qui est solide, c’est le principe : le prix catalogue est le prix. C’est exactement le principe sur lequel fonctionne un routeur en transparence comme OrcaRouter — marge de 0 %, prix catalogue du fournisseur transmis tel quel — donc si Go​ogle réduit le prix de la transcription pendant la fenêtre entre l’aperçu et la disponibilité générale, la réduction est répercutée chez nous le jour même, et non après qu’un revendeur met à jour sa grille tarifaire.

Où il est déployé.

Pour les développeurs, l'aperçu public se traduit aujourd'hui par deux volets : l'API G​emini dans Go​ogle AI Studio et la G​emini Enterprise Agent Platform pour les charges de travail d'entreprise. Côté grand public, Gemini 3.​5 Transcribe alimente déjà la fonction de dictée Rambler dans Gboard sur Android et l'application G​emini sur macOS. Chrome est le prochain — la saisie vocale dans n'importe quel champ web — suivi de Search Live, G​emini Live, Docs, Keep et Gmail. Pour une équipe qui l'évalue, la réponse pratique est plus simple : on peut l'appeler depuis le code dès aujourd'hui, en anglais, dans les régions où l'API G​emini est disponible.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Ce que cela signifie pour votre pipeline

Ce qui est réellement nouveau, ce n'est pas un chiffre de WER. C'est que Google vend désormais la transcription avec les deux fonctionnalités que les équipes assemblaient auparavant elles-mêmes — étiquettes de locuteur et horodatage au niveau du mot — dans le modèle de base, sur une surface d'API Gemini prenant en charge l'appel de fonctions. Si vous construisiez un pipeline de notes de réunion avec diarisation à partir d'un simple transcripteur, d'un diariseur séparé et d'une passe de mise en forme, c'est le premier modèle Google qui condense ces étapes. La question ouverte est de savoir comment le WER non-streaming de 2,6 % se comporte sur votre propre audio ; tant qu'une reproduction indépendante n'a pas été publiée, la décision responsable pour une équipe de production est de faire passer un véritable échantillon par l'API plutôt que de budgéter sur la base des benchmarks choisis par Google. Pour le travail de LLM qui s'appuie sur la transcription — résumé, extraction structurée, points d'action — c'est la couche où le routage justifie sa place, et c'est la couche que couvre OrcaRouter : une API pour plus de 200 modèles, bascule automatique entre fournisseurs et un DSL de routage qui compose plusieurs modèles en un seul appel. Quant à l'étape de transcription elle-même, vous devriez la tester avec votre propre audio avant de vous fier au chiffre mis en avant par qui que ce soit.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube