
Transcription intelligente avec Gemini 3.5 Transcribe
- 智谱NOUVEAUZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 par million de tokens
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
Gemini 3.5 Transcribe est passé en aperçu public le 26 août 2026, et c'est le premier modèle de reconnaissance vocale de Google réellement vendu comme un modèle Gemini : vous l'appelez via l'API Gemini avec un identifiant de modèle, l'audio est facturé en tokens, et Google indique le coût par minute d'audio sur sa page de tarification. Ce dernier détail est ce que la couverture grand public survole. Les articles du jour du lancement portent sur la suppression des mots de remplissage et l'édition vocale dans Gboard, mais ce qui a réellement changé pour les développeurs, c'est que la transcription se trouve désormais sur la même surface d'API que le reste de la gamme Gemini, avec l'attribution des locuteurs et des horodatages au niveau du mot dans le modèle de base plutôt que dans un module complémentaire séparé. Ce texte se lit comme une référence d'API, car c'est la lacune que la première vague de couverture laisse ouverte.
Deux mises en garde au préalable afin que les chiffres ci-dessous n’induisent pas en erreur. Google ne qualifie pas Gemini 3.5 Transcribe de « modèle de reconnaissance vocale le plus précis que nous ayons » — l’affirmation porte sur le modèle le plus précis pour les interactions vocales intelligentes, ce qui est une affirmation différente, et cette différence compte lorsque vous lisez les chiffres WER. Et tout ce qui est décrit ici concerne un aperçu public : les deux identifiants de modèle, les prix et les chiffres de référence sont ce que Google propose aujourd’hui, et tout peut évoluer avant la disponibilité générale.
Les deux chemins d’API — et les identifiants de modèle à retenir
Gemini 3.5 Transcribe se décline en deux points de terminaison, et le choix du bon constitue la première décision d'architecture qu'une équipe doit prendre :
• gemini-3-5-transcribe — la voie pré-enregistrée via l'API Interactions. Envoyez un fichier, récupérez la transcription avec attribution des locuteurs (jusqu'à trois locuteurs ; au-delà de trois, c'est expérimental) et des horodatages au niveau du mot. C'est la bête de somme du traitement par lots et asynchrone.
• gemini-3-5-transcribe-live — la voie en temps réel via l'API Live. Streaming bidirectionnel avec une latence inférieure à la seconde, destiné aux conversations en direct, au sous-titrage et aux interfaces vocales.
Cette répartition reflète la manière dont le reste de la gamme Gemini Audio est organisé, et cela a son importance car « live » est un SKU distinct avec son propre prix. Plusieurs lectures initiales de ce lancement supposent qu'un seul modèle fait les deux ; ce n'est pas le cas.

Ce que signifie réellement la « transcription intelligente »
Le post de lancement de Google présente cela comme un dépassement de la précision phonétique vers la compréhension. Les fonctionnalités qui découlent de ce cadrage sont celles à évaluer plutôt que le cadrage lui-même :
• Gestion des disfluences — les « um » et « ah » sont supprimés, et les auto-corrections sont résolues. « Rencontrons-nous mardi — non, mercredi » est transcrit comme le jour corrigé, et non comme une transcription d’un faux départ. C’est une décision que prend le modèle, et c’est en ce sens que Google le qualifie d’intelligent.
• Mise en forme automatique — la sortie revient sous forme de texte poli : ponctuation, casse et structure des paragraphes appliquées, et non un flux brut de jetons.
• Identification multi-locuteur — jusqu'à trois locuteurs attribués dans un fichier audio pré-enregistré avec des horodatages au niveau du mot ; trois locuteurs ou plus est expérimental. Cela relève du modèle de base plutôt que d'un service de diarisation distinct.
• Vocabulaire personnalisé — vous pouvez orienter la reconnaissance vers le jargon, les noms de produits et les orthographes inhabituelles en fournissant un vocabulaire, ce qui est le mécanisme pour les domaines verticaux.
• Plus de 85 langues — détection automatique, avec accents régionaux et dialectes signalés explicitement.
• Appel de fonction — le modèle peut déléguer des tâches telles que la génération d'images ou l'analyse de fichiers à d'autres modèles Gemini, ce qui fait de la transcription un composant d'un agent plus vaste plutôt qu'une étape terminale.
• Capture d'entités — Google revendique de solides performances sur l'audio du monde réel bruité et sur les entités alphanumériques telles que les codes postaux et les identifiants de commande.
La couverture presse a également fait état d'une fenêtre de contexte de 96 000 jetons (environ une heure d'audio de réunion sans découpage) et d'une détection des émotions. Ces deux éléments sont cohérents avec le cadrage du lancement, mais la fiche technique publiée par Google ne les met pas en avant ; il convient donc de les considérer comme des informations rapportées plutôt que confirmées jusqu'à la publication d'une fiche de spécifications GA.

Les chiffres de précision, étiquetés
Les chiffres de WER cités par Google proviennent d'Artificial Analysis : un taux d'erreur moyen de 4.0% pour la transcription en streaming et de 2.6% pour la transcription hors streaming. Sur le benchmark multilingue FLEURS, Google rapporte un WER de 5.50% pour le streaming et de 5.04% pour le hors streaming. Google revendique également une amélioration de 70% du temps de transcription finale par rapport à son prédécesseur, Chirp 3.
Lecture honnête : ce sont des mesures indépendantes dans le sens où Artificial Analysis n'est pas Google, mais ce sont des mesures sélectionnées par Google, publiées dans l'annonce même de Google, d'un modèle qui n'est appelable que depuis un jour. Personne en dehors de Google n'a encore mené de confrontation directe contre les modèles open-weight avec lesquels la plupart des équipes le comparent, et les documents de lancement ne contiennent aucune comparaison directe avec la famille Whisper ou la gamme Parakeet de NVIDIA. Le chiffre de 70 % plus rapide que Chirp-3 est une affirmation du fournisseur, point final. Traitez 2,6 % et 4,0 % comme de forts signaux précoces, pas comme des faits établis.
Ce que ça coûte
La page de tarification de Google présente chaque modèle en tokens et en minutes d’audio estimées. Pour gemini-3-5-transcribe, l’estimation combinée est d’environ 0,005 $ par minute d’audio au prix catalogue — entrée environ 0,003 $/min, sortie environ 0,002 $/min. Pour gemini-3-5-transcribe-live, l’estimation combinée est d’environ 0,009 $ par minute. Les deux disposent aujourd’hui d’un niveau gratuit.
Ces chiffres par minute sont des estimations dérivées d’un taux de tokens supposé (25 tokens audio par seconde en entrée, 175 tokens texte par minute en sortie), ils changent donc si Google modifie la comptabilité des tokens. Ce qui est solide, c’est le principe : le prix catalogue est le prix. C’est exactement le principe sur lequel fonctionne un routeur en transparence comme OrcaRouter — marge de 0 %, prix catalogue du fournisseur transmis tel quel — donc si Google réduit le prix de la transcription pendant la fenêtre entre l’aperçu et la disponibilité générale, la réduction est répercutée chez nous le jour même, et non après qu’un revendeur met à jour sa grille tarifaire.
Où il est déployé.
Pour les développeurs, l'aperçu public se traduit aujourd'hui par deux volets : l'API Gemini dans Google AI Studio et la Gemini Enterprise Agent Platform pour les charges de travail d'entreprise. Côté grand public, Gemini 3.5 Transcribe alimente déjà la fonction de dictée Rambler dans Gboard sur Android et l'application Gemini sur macOS. Chrome est le prochain — la saisie vocale dans n'importe quel champ web — suivi de Search Live, Gemini Live, Docs, Keep et Gmail. Pour une équipe qui l'évalue, la réponse pratique est plus simple : on peut l'appeler depuis le code dès aujourd'hui, en anglais, dans les régions où l'API Gemini est disponible.

Ce que cela signifie pour votre pipeline
Ce qui est réellement nouveau, ce n'est pas un chiffre de WER. C'est que Google vend désormais la transcription avec les deux fonctionnalités que les équipes assemblaient auparavant elles-mêmes — étiquettes de locuteur et horodatage au niveau du mot — dans le modèle de base, sur une surface d'API Gemini prenant en charge l'appel de fonctions. Si vous construisiez un pipeline de notes de réunion avec diarisation à partir d'un simple transcripteur, d'un diariseur séparé et d'une passe de mise en forme, c'est le premier modèle Google qui condense ces étapes. La question ouverte est de savoir comment le WER non-streaming de 2,6 % se comporte sur votre propre audio ; tant qu'une reproduction indépendante n'a pas été publiée, la décision responsable pour une équipe de production est de faire passer un véritable échantillon par l'API plutôt que de budgéter sur la base des benchmarks choisis par Google. Pour le travail de LLM qui s'appuie sur la transcription — résumé, extraction structurée, points d'action — c'est la couche où le routage justifie sa place, et c'est la couche que couvre OrcaRouter : une API pour plus de 200 modèles, bascule automatique entre fournisseurs et un DSL de routage qui compose plusieurs modèles en un seul appel. Quant à l'étape de transcription elle-même, vous devriez la tester avec votre propre audio avant de vous fier au chiffre mis en avant par qui que ce soit.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
