
Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe : quel endpoint votre application devrait appeler
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligence49Code
Lorsque Google a lancé la famille Gemini 3.5 Transcribe le 26 août 2026, elle a livré deux modèles qui partagent un nom et une mission, mais qui sont conçus pour différentes étapes d’une conversation : Gemini 3.5 Transcribe Live, le endpoint de streaming servi via l’API Live, et Gemini 3.5 Transcribe, le endpoint pré-enregistré servi via l’API Interactions. L’erreur que la plupart des équipes commettent dès la première semaine est de traiter cela comme un seul modèle avec deux boutons. Il s’agit de deux SKU — des API différentes, des prix différents, des limites strictes différentes — et la comparaison de précision entre eux n’est pas un combat équitable, car ils sont mesurés selon des règles différentes. Cet article les met côte à côte afin que la décision repose sur votre charge de travail, et non sur un classement.
Les deux en un coup d'œil
• API — Gemini 3.5 Transcribe Live fonctionne sur l'API Live (WebSocket, streaming bidirectionnel), tandis que Gemini 3.5 Transcribe fonctionne sur l'API Interactions (fichier en entrée, transcription en sortie).
• Tâche — conversation en direct, sous-titrage, agents vocaux vs réunions, journaux d’appels, audio d’archives.
• Précision — 4,0 % WER en streaming vs 2,6 % WER non-streaming, selon Artificial Analysis, cité par Google ; différents régimes de mesure, non directement comparables.
• Latence — une transcription finale 0,40 s après la fin de la parole vs traitement par lots d'un fichier complet.
• Session — Limite de 10 minutes par session en direct, contre jusqu'à 60 minutes pour les fichiers (30 minutes avec la diarisation et les horodatages activés).
• Locuteurs — aucun du côté streaming contre jusqu'à trois locuteurs avec horodatages mot par mot du côté pré-enregistré.
• Prix — environ 0,009 $ par minute en tarif mixte contre environ 0,005 $ par minute en tarif mixte.

La décision d'architecture : Interactions API ou Live API
Les deux modèles font partie de la famille Audio Google Gemini, et tous deux sont en aperçu public. La différence commence au niveau du transport. gemini-3-5-transcribe-live ouvre un WebSocket et le maintient ouvert : le flux audio brut entre en continu — le format courant est des morceaux PCM 16 bits à 16 kHz ou 24 kHz — et le modèle renvoie des transcriptions partielles pendant que vous parlez, puis une transcription finale pour chaque énoncé lorsque la parole se termine. gemini-3-5-transcribe prend un fichier complet, le traite et renvoie la transcription finale avec attribution des locuteurs et horodatages au niveau des mots.
La décision de transport détermine tout le reste. Si votre produit restitue les mots tels qu'ils sont prononcés — un sous-titre en direct, un agent vocal qui lit l'intention en pleine phrase, un assistant d'appel qui agit pendant que l'appel est en direct — vous êtes sur le chemin Live. Si votre produit génère un enregistrement — une note de réunion, un journal d'appels, une archive — vous êtes sur le chemin Interactions. La confusion vient de ce que les deux produisent du texte ; la différence réside dans le fait que le texte est un état en temps réel ou un artefact final.
Précision : la taxe sur le streaming est bien réelle.
Artificial Analysis, la société de benchmarks indépendante dont Google cite les chiffres dans son article de lancement, mesure un taux d'erreur de mots moyen de 4,0 % pour le point de terminaison en streaming et de 2,6 % pour celui non-streaming. Sur le benchmark multilingue FLEURS, Google rapporte 5,50 % en streaming contre 5,04 % en non-streaming. Le chiffre de 2,6 % place Gemini 3.5 Transcribe en 5e position sur le classement WER d'AA au lancement, derrière ElevenLabs Scribe v2 à 2,2 % et le MAI-Transcribe-1.5 de Microsoft à 2,4 % — ce sont les mesures d'AA, et non les affirmations de Google.
Le nombre en streaming n'est pas une version moins bonne du même test. C'est un régime différent : le modèle s'engage sur des mots avant d'avoir entendu la fin de la phrase, et il en paie le prix. Ne choisissez pas entre les deux sur la seule précision, car sur une charge de travail donnée, l'écart pourrait s'inverser. Choisissez en fonction des contraintes : l'endpoint de streaming a une limite de session de 10 minutes, pas de diarisation des locuteurs et pas d'horodatage ; l'endpoint pré-enregistré gère des fichiers d'une heure, attribue jusqu'à trois locuteurs et renvoie des horodatages au niveau du mot. Si votre application a besoin d'étiquettes de locuteur, le modèle de streaming ne peut tout simplement pas faire le travail, quel que soit son WER.

Ce qu'ils partagent
Les deux points de terminaison partagent le moteur de "intelligent transcription", et sur les fonctionnalités partagées, le choix entre eux est neutre:
• Plus de 85 langues avec détection automatique, y compris la commutation de langue en cours de flux sur le chemin Live.
• Nettoyage des disfluences — les mots de remplissage sont supprimés, les auto-corrections sont résolues (« mardi — non, mercredi » donne le jour corrigé).
• Mise en forme automatique — ponctuation, casse et structure des paragraphes appliquées à la sortie.
Vocabulaire personnalisé — jusqu'à 1 000 termes pour le jargon et les noms de produits, la documentation de Google recommandant environ 100 pour de meilleurs résultats.
Une mise en garde s'applique aux deux : le nettoyage « intelligent » qui rend la sortie lisible est un choix de conception qui sacrifie la fidélité au texte original. Les formulations maladroites sont lissées ; le texte est la lecture de l'intention par le modèle, pas un procès-verbal. Pour des transcriptions exactes, vous voudrez une option mot à mot là où une telle option est proposée, et vous voudrez vérifier le comportement sur votre propre audio de toute façon.
Coût par minute : le premium en direct
Google facture l'audio en tokens à raison de 25 tokens audio par seconde, avec une sortie d'environ 175 tokens de texte par minute de transcription. Aux prix catalogue, le coût combiné par minute d'audio est d'environ 0,005 $ pour gemini-3-5-transcribe et d'environ 0,009 $ pour gemini-3-5-transcribe-live — entrée à 2 $ contre 3,50 $ par million de tokens, sortie à 12 $ contre 21 $ par million de tokens. Les deux disposent aujourd'hui d'un palier gratuit.
Le premium achète le chemin en temps réel, pas plus de précision : vous payez environ 80 % de plus par minute pour le point de terminaison de streaming, et il transcrit avec un WER plus élevé. C'est là le cadre honnête. Le modèle pour audio pré-enregistré est à la fois moins cher et plus précis ; le modèle de streaming existe parce que certains produits ne peuvent pas attendre la fin du fichier.
Sur quel endpoint devriez-vous construire
• Sous-titres en direct et sous-titres — Gemini 3.5 Transcribe Live, et vérifiez la limite sans horodatage si vous avez besoin d'une sortie alignée sur le temps.
• Agents vocaux — Gemini 3.5 Transcribe Live pour détecter l'intention en milieu de phrase ; planifiez en tenant compte de la limite de 10 minutes pour les longues sessions.
• Réunions, entretiens, archivage — Gemini 3.5 Transcribe, pour les 2,6 % de WER, l'attribution des locuteurs et l'horodatage au niveau du mot.
• Analyses post-appel — Gemini 3.5 Transcribe pour l'enregistrement terminé ; Gemini 3.5 Transcribe Live uniquement si l'analyse doit s'exécuter pendant l'appel.
• Audio continu long — Gemini 3.5 Transcribe, car un fichier de 60 minutes vaut mieux que d'assembler à la main des sessions live de dix minutes.

La couche au-dessus de la transcription
Aucun des deux modèles n'est hébergé par OrcaRouter — nous ne faisons pas de routage parole-texte aujourd'hui, et vous appellerez directement l'API de Google pour l'un ou l'autre endpoint. Ce qu'une couche de routage apporte à un pipeline vocal, c'est de se placer au-dessus de la transcription : le résumeur, l'extracteur d'entités, le modèle de points d'action qui transforme un flux en décision. C'est là qu'OrcaRouter apporte sa vraie valeur — une API pour plus de 200 modèles au prix catalogue des fournisseurs, sans marge, avec bascule automatique entre fournisseurs, et un DSL de routage qui compose plusieurs modèles en un seul appel. Choisissez l'endpoint de transcription selon la charge, puis exécutez le modèle qui lit la transcription derrière une seule clé.
En résumé
Gemini 3.5 Transcribe Live et Gemini 3.5 Transcribe appartiennent à la même famille, mais ce sont des produits différents. Choisissez Live lorsque la transcription doit exister avant la fin de la conversation et que vous pouvez accepter une session de 10 minutes, sans étiquettes de locuteur ni horodatages. Choisissez Transcribe lorsque la sortie est un enregistrement et que la précision et l'attribution priment sur la vitesse — c'est moins cher, plus précis et bien moins contraint. La seule mauvaise réponse est de supposer qu'un seul point de terminaison fait les deux.
