Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — quel endpoint votre application doit-elle appeler. Illustration régénérée.
Guides & Insights

Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe : quel endpoint votre application devrait appeler

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Lorsque Go​ogle a lancé la famille Ge​mini 3.5 Transcribe le 26 août 2026, elle a livré deux modèles qui partagent un nom et une mission, mais qui sont conçus pour différentes étapes d’une conversation : Ge​mini 3.5 Transcribe Live, le endpoint de streaming servi via l’API Live, et Ge​mini 3.5 Transcribe, le endpoint pré-enregistré servi via l’API Interactions. L’erreur que la plupart des équipes commettent dès la première semaine est de traiter cela comme un seul modèle avec deux boutons. Il s’agit de deux SKU — des API différentes, des prix différents, des limites strictes différentes — et la comparaison de précision entre eux n’est pas un combat équitable, car ils sont mesurés selon des règles différentes. Cet article les met côte à côte afin que la décision repose sur votre charge de travail, et non sur un classement.

Les deux en un coup d'œil

• API — Ge​mini 3.5 Transcribe Live fonctionne sur l'API Live (WebSocket, streaming bidirectionnel), tandis que Ge​mini 3.5 Transcribe fonctionne sur l'API Interactions (fichier en entrée, transcription en sortie).

• Tâche — conversation en direct, sous-titrage, agents vocaux vs réunions, journaux d’appels, audio d’archives.

• Précision — 4,0 % WER en streaming vs 2,6 % WER non-streaming, selon Artificial Analysis, cité par Go​ogle ; différents régimes de mesure, non directement comparables.

• Latence — une transcription finale 0,40 s après la fin de la parole vs traitement par lots d'un fichier complet.

• Session — Limite de 10 minutes par session en direct, contre jusqu'à 60 minutes pour les fichiers (30 minutes avec la diarisation et les horodatages activés).

• Locuteurs — aucun du côté streaming contre jusqu'à trois locuteurs avec horodatages mot par mot du côté pré-enregistré.

• Prix — environ 0,009 $ par minute en tarif mixte contre environ 0,005 $ par minute en tarif mixte.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

La décision d'architecture : Interactions API ou Live API

Les deux modèles font partie de la famille Audio Go​ogle Ge​mini, et tous deux sont en aperçu public. La différence commence au niveau du transport. gemini-3-5-transcribe-live ouvre un WebSocket et le maintient ouvert : le flux audio brut entre en continu — le format courant est des morceaux PCM 16 bits à 16 kHz ou 24 kHz — et le modèle renvoie des transcriptions partielles pendant que vous parlez, puis une transcription finale pour chaque énoncé lorsque la parole se termine. gemini-3-5-transcribe prend un fichier complet, le traite et renvoie la transcription finale avec attribution des locuteurs et horodatages au niveau des mots.

La décision de transport détermine tout le reste. Si votre produit restitue les mots tels qu'ils sont prononcés — un sous-titre en direct, un agent vocal qui lit l'intention en pleine phrase, un assistant d'appel qui agit pendant que l'appel est en direct — vous êtes sur le chemin Live. Si votre produit génère un enregistrement — une note de réunion, un journal d'appels, une archive — vous êtes sur le chemin Interactions. La confusion vient de ce que les deux produisent du texte ; la différence réside dans le fait que le texte est un état en temps réel ou un artefact final.

Précision : la taxe sur le streaming est bien réelle.

Artificial Analysis, la société de benchmarks indépendante dont Go​ogle cite les chiffres dans son article de lancement, mesure un taux d'erreur de mots moyen de 4,0 % pour le point de terminaison en streaming et de 2,6 % pour celui non-streaming. Sur le benchmark multilingue FLEURS, Go​ogle rapporte 5,50 % en streaming contre 5,04 % en non-streaming. Le chiffre de 2,6 % place Ge​mini 3.5 Transcribe en 5e position sur le classement WER d'AA au lancement, derrière ElevenLabs Scribe v2 à 2,2 % et le MAI-Transcribe-1.5 de Microsoft à 2,4 % — ce sont les mesures d'AA, et non les affirmations de Go​ogle.

Le nombre en streaming n'est pas une version moins bonne du même test. C'est un régime différent : le modèle s'engage sur des mots avant d'avoir entendu la fin de la phrase, et il en paie le prix. Ne choisissez pas entre les deux sur la seule précision, car sur une charge de travail donnée, l'écart pourrait s'inverser. Choisissez en fonction des contraintes : l'endpoint de streaming a une limite de session de 10 minutes, pas de diarisation des locuteurs et pas d'horodatage ; l'endpoint pré-enregistré gère des fichiers d'une heure, attribue jusqu'à trois locuteurs et renvoie des horodatages au niveau du mot. Si votre application a besoin d'étiquettes de locuteur, le modèle de streaming ne peut tout simplement pas faire le travail, quel que soit son WER.

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

Ce qu'ils partagent

Les deux points de terminaison partagent le moteur de "intelligent transcription", et sur les fonctionnalités partagées, le choix entre eux est neutre:

• Plus de 85 langues avec détection automatique, y compris la commutation de langue en cours de flux sur le chemin Live.

• Nettoyage des disfluences — les mots de remplissage sont supprimés, les auto-corrections sont résolues (« mardi — non, mercredi » donne le jour corrigé).

• Mise en forme automatique — ponctuation, casse et structure des paragraphes appliquées à la sortie.

Vocabulaire personnalisé — jusqu'à 1 000 termes pour le jargon et les noms de produits, la documentation de Google recommandant environ 100 pour de meilleurs résultats.

Une mise en garde s'applique aux deux : le nettoyage « intelligent » qui rend la sortie lisible est un choix de conception qui sacrifie la fidélité au texte original. Les formulations maladroites sont lissées ; le texte est la lecture de l'intention par le modèle, pas un procès-verbal. Pour des transcriptions exactes, vous voudrez une option mot à mot là où une telle option est proposée, et vous voudrez vérifier le comportement sur votre propre audio de toute façon.

Coût par minute : le premium en direct

Go​ogle facture l'audio en tokens à raison de 25 tokens audio par seconde, avec une sortie d'environ 175 tokens de texte par minute de transcription. Aux prix catalogue, le coût combiné par minute d'audio est d'environ 0,005 $ pour gemini-3-5-transcribe et d'environ 0,009 $ pour gemini-3-5-transcribe-live — entrée à 2 $ contre 3,50 $ par million de tokens, sortie à 12 $ contre 21 $ par million de tokens. Les deux disposent aujourd'hui d'un palier gratuit.

Le premium achète le chemin en temps réel, pas plus de précision : vous payez environ 80 % de plus par minute pour le point de terminaison de streaming, et il transcrit avec un WER plus élevé. C'est là le cadre honnête. Le modèle pour audio pré-enregistré est à la fois moins cher et plus précis ; le modèle de streaming existe parce que certains produits ne peuvent pas attendre la fin du fichier.

Sur quel endpoint devriez-vous construire

• Sous-titres en direct et sous-titres — Ge​mini 3.5 Transcribe Live, et vérifiez la limite sans horodatage si vous avez besoin d'une sortie alignée sur le temps.

• Agents vocaux — Ge​mini 3.5 Transcribe Live pour détecter l'intention en milieu de phrase ; planifiez en tenant compte de la limite de 10 minutes pour les longues sessions.

• Réunions, entretiens, archivage — Ge​mini 3.5 Transcribe, pour les 2,6 % de WER, l'attribution des locuteurs et l'horodatage au niveau du mot.

• Analyses post-appel — Ge​mini 3.5 Transcribe pour l'enregistrement terminé ; Ge​mini 3.5 Transcribe Live uniquement si l'analyse doit s'exécuter pendant l'appel.

• Audio continu long — Ge​mini 3.5 Transcribe, car un fichier de 60 minutes vaut mieux que d'assembler à la main des sessions live de dix minutes.

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

La couche au-dessus de la transcription

Aucun des deux modèles n'est hébergé par OrcaRouter — nous ne faisons pas de routage parole-texte aujourd'hui, et vous appellerez directement l'API de Go​ogle pour l'un ou l'autre endpoint. Ce qu'une couche de routage apporte à un pipeline vocal, c'est de se placer au-dessus de la transcription : le résumeur, l'extracteur d'entités, le modèle de points d'action qui transforme un flux en décision. C'est là qu'OrcaRouter apporte sa vraie valeur — une API pour plus de 200 modèles au prix catalogue des fournisseurs, sans marge, avec bascule automatique entre fournisseurs, et un DSL de routage qui compose plusieurs modèles en un seul appel. Choisissez l'endpoint de transcription selon la charge, puis exécutez le modèle qui lit la transcription derrière une seule clé.

En résumé

Ge​mini 3.5 Transcribe Live et Ge​mini 3.5 Transcribe appartiennent à la même famille, mais ce sont des produits différents. Choisissez Live lorsque la transcription doit exister avant la fin de la conversation et que vous pouvez accepter une session de 10 minutes, sans étiquettes de locuteur ni horodatages. Choisissez Transcribe lorsque la sortie est un enregistrement et que la précision et l'attribution priment sur la vitesse — c'est moins cher, plus précis et bien moins contraint. La seule mauvaise réponse est de supposer qu'un seul point de terminaison fait les deux.