
GPT-Live-1 vs Gemini 3.5 Live Translate : un généraliste livré face à un spécialiste en préversion
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Ces deux modèles sont comparés parce que tous deux intègrent la parole en temps réel dans une API, et la comparaison s'effondre dès que vous lisez les fiches de modèle. GPT-Live-1 est un modèle vocal full-duplex généraliste qu'OpenAI a intégré à l'API développeur le 10 septembre 2026, trois mois après son lancement dans ChatGPT le 8 juillet. Gemini 3.5 Live Translate est un modèle de traduction audio-à-audio dédié à une seule tâche que Google DeepMind a publié le 9 juin 2026, et son ID de modèle porte encore le mot preview. L'un de ces modèles, vous pouvez le mettre devant des clients payants dès aujourd'hui à un tarif publié. L'autre, Google peut le modifier sous vos pieds sans avis de dépréciation. C'est cette asymétrie, et non la fiche de benchmarks, qui devrait décider du choix.
Deux machines différentes portant la même étiquette
Il faut être franc sur le peu de recoupement entre les deux. Gemini 3.5 Live Translate fait de la traduction. Il prend de l’audio en streaming dans une langue et renvoie de l’audio en streaming dans une autre, en préservant la voix et le ton de la personne qui parle, dans plus de 70 langues et plus de 2 000 paires de langues, avec détection automatique de la langue et fonctionnement bidirectionnel. Il ne tient pas de conversation, n’appelle pas de fonction et ne répond pas à une question. C’est un moteur d’interprétation simultanée.
GPT-Live-1 est de forme opposée. C'est un modèle conversationnel : il écoute et parle en même temps, décide plusieurs fois par seconde s'il doit continuer d'écouter, faire une pause, interrompre ou appeler un outil, et confie le travail lourd — recherche web, raisonnement plus poussé, tâches agentiques — à un modèle de raisonnement distinct via l'API Responses pendant que la conversation se poursuit. L'exemple WebRTC publié par OpenAI lui-même relie cette délégation à GPT-5.6 Terra. La traduction est l'une des choses qu'il peut faire ; ce n'est pas une fonctionnalité dont le modèle de Google possède un équivalent dans l'autre sens.
Donc la question pratique est plus étroite que ne le suggère l’affiche du match : si ce que vous construisez relève de l’interprétation, le modèle de Google est conçu pour cet usage précis et celui d’OpenAI est généraliste. Si ce que vous construisez est un agent vocal qui traduit occasionnellement, GPT-Live-1 est le seul des deux à être ne serait-ce que dans la bonne catégorie de produit.
Combien coûte chacun par minute d’audio
C'est ici que le spécialiste justifie son utilité, et l'arithmétique est réellement délicate pour OpenAI.
• GPT-Live-1 — 0,05 $ par minute de voix, facturé à la seconde plutôt qu’arrondi à la minute entière suivante. Le raisonnement et les appels d’outils effectués par le backend délégué sont facturés séparément aux tarifs normaux de ce modèle.
• Gemini 3.5 Live Translate — 3,50 $ par million de jetons d’entrée audio et 21,00 $ par million de jetons de sortie audio, la facturation étant calculée à 25 jetons par seconde d’audio. Au total, cela revient à environ 0,037 $ par minute d’audio traduit.
Sur les minutes de traduction pure, Google est environ un quart moins cher. Ce n'est pas une différence d'arrondi à grande échelle : 10 000 minutes interprétées par mois coûtent environ 500 $ sur la couche vocale de GPT-Live-1, contre environ 368 $ sur Gemini 3.5 Live Translate. Et l'écart est réel, et non un artefact du changement de mesure, car les deux modèles facturent selon des unités véritablement différentes.
Il y a un hic dans l’autre sens. Le tarif affiché de 0,05 $ pour GPT-Live-1 ne concerne que la couche vocale. Si votre agent traduit et va aussi chercher une information, ou escalade une phrase difficile vers un modèle de raisonnement, vous payez cette délégation en plus — et le modèle délégué est facturé au token comme n’importe quel autre modèle de pointe. Une charge de travail de traduction seule ne déclenche jamais cela. Une charge de travail qui combine traduction et autre chose, elle, le fait, et le gagnant de la comparaison par minute cesse d’être évident.

L'étiquette d'aperçu est le risque que personne n'intègre dans les prix.
L'ID de modèle de Gemini 3.5 Live Translate est gemini-3.5-live-translate-preview. Il a été déployé dans l'API Gemini Live et Google AI Studio en tant qu'aperçu public, et simultanément dans l'application Google Translate sur Android et iOS, ainsi qu'en aperçu privé dans Google Meet pour certains clients Workspace. Aperçu signifie ce qu'il a toujours signifié chez Google : aucune garantie de stabilité, aucune fenêtre de dépréciation publiée, aucun engagement que le tarif que vous payez survive à la prochaine version.
Pour une application grand public, cela convient. Pour les charges de travail auxquelles ce modèle est réellement destiné — l’interprétation en direct dans un centre d’appels, un produit de réunion, un produit de voyage —, il s’agit du plus grand risque d’intégration de la pile. Vous construisez une dépendance de production sur un modèle que Google n’a explicitement pas pris l’engagement de soutenir.
GPT-Live-1 a le problème inverse, et il est plus petit mais pas nul. Il est généralement disponible, à un tarif publié, avec un point de terminaison documenté, et il ne disparaîtra pas. Mais sa surface d'API est étroite d'une manière qui surprend les équipes qui supposent qu'il s'intègre dans une intégration OpenAI existante : il y a exactement un ID de modèle, un point de terminaison, et aucun chemin via Chat Completions, Responses, Realtime, Batch, Assistants ou fine-tuning. Le seul moyen d'entrer est le point de terminaison Live Sessions à v1/live/sessions via WebRTC, avec la gestion des événements sur un canal de données. C'est une nouvelle intégration, pas un changement de paramètre.

Langages, et où le généraliste est honnêtement plus faible
Le nombre de langues de Google est de plus de 70, avec préservation de la voix et du ton. La documentation d'OpenAI elle-même est nettement moins confiante quant à sa propre couverture : le matériel de lancement indique que pour certaines langues, le modèle peut avoir un accent non natif ou présenter des lacunes de fluidité, et OpenAI ne publie pas de décompte de langues qui rivalise avec celui de Google.
Ce n'est pas un fournisseur qui joue au timide — c'est ce à quoi ressemble un modèle conversationnel généraliste à côté d'un spécialiste entraîné sur le problème. Si la proposition de valeur de votre produit est « nous interprétons bien 40 langues », le spécialiste est le choix honnête et le généraliste vous fera honte dans la longue traîne. Si votre produit est un agent vocal pour un marché anglophone avec une fonction de traduction greffée après coup, les lacunes linguistiques du généraliste ne se manifesteront jamais.
Les deux modèles appliquent un filigrane SynthID à l’audio généré, ce qui compte si vous relevez d’une juridiction ou d’un contrat client qui exige la provenance de la parole synthétique. Là-dessus, match nul.

Là où l'architecture de délégation modifie le build
La différence structurelle entre ces deux est que GPT-Live-1 est en réalité deux modèles avec une couture au milieu. La couche vocale maintient la conversation en vie ; un modèle de raisonnement distinct fait le travail de réflexion. C’est à cette couture que se concentre votre effort d’ingénierie, et c’est aussi là que le modèle de coûts se complique.
Il est bon de savoir que la moitié déléguée est un modèle de texte ordinaire que vous pouvez acheminer comme n'importe quel autre. GPT-5.6 Terra, le backend de l'exemple d'OpenAI, est servi via OrcaRouter à 2,00 $ par million de tokens d'entrée et 12,00 $ par million de tokens de sortie, avec une fenêtre de contexte d'un million de tokens et les deux points d'accès /v1/chat/completions et /v1/responses exposés. Si vous voulez remplacer le cerveau de raisonnement derrière un agent vocal — par un modèle moins cher lors des appels simples, ou un modèle plus puissant lors des escalades — cette moitié de la pile a des options, car il s'agit d'un appel API normal qui se trouve aux côtés de environ 190 autres modèles sur une seule clé.
La moitié vocale, elle, ne le fait pas. GPT-Live-1 n’est pas sur OrcaRouter, et Gemini 3.5 Live Translate non plus ; tous deux ne sont disponibles qu’auprès du fournisseur qui les a créés. Là où un routeur gagne sa place dans une architecture comme celle-ci, c’est tout ce qui se trouve en aval de l’audio : les modèles textuels qui font la récupération, la synthèse, l’écriture en retour dans le CRM et l’escalade, ce qui représente la moitié de la facture que vous pouvez réellement consolider sur une seule clé et une seule facture.
Ce qu’il faut vraiment choisir
• Choisissez Gemini 3.5 Live Translate si la traduction est le produit, si le prix par minute compte plus que la stabilité contractuelle et si vous pouvez absorber qu’un modèle en préversion change sous vos pieds. Prévoyez environ 0,037 $ la minute et conservez une couche d’abstraction au-dessus de l’appel afin qu’un modèle GA puisse le remplacer sans réécriture.
• Choisissez GPT-Live-1 si vous avez besoin d’un agent conversationnel qui se trouve aussi faire de la traduction, si vous avez besoin d’appel de fonctions et d’utilisation d’outils au sein de la boucle vocale, ou si une équipe d’approvisionnement vous demandera ce qui se passe lorsque le modèle est retiré et que vous devez fournir une meilleure réponse que « rien, probablement ».
• Ne choisissez ni l’un ni l’autre parce qu’il a remporté un benchmark. Les benchmarks des deux côtés ne sont pas comparables — les chiffres full-duplex d’OpenAI sont les siens, non reproduits par un tiers, et les affirmations linguistiques de Google n’ont pas été testées face à un généraliste sur le même ensemble audio.
Une remarque prospective : les deux surfaces convergent plutôt qu’elles n’entrent en collision. Le modèle de traduction de Google vit déjà à l’intérieur de Gemini Live, et la couche vocale de GPT-Live-1 est explicitement conçue pour que de nouveaux modèles de pointe soient déployés derrière elle. L’attente raisonnable est que, d’ici quelques cycles de publication, la traduction du généraliste s’améliore et que l’histoire d’intégration du spécialiste devienne moins hasardeuse. Si vous construisez aujourd’hui et que la décision est serrée, cela plaide pour l’option la moins chère et la plus remplaçable, et pour garder le chemin audio isolé derrière une interface dans tous les cas.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
