Une carte de titre principale affichant « GPT-Live-1 contre Gemini 3.5 Live Translate », avec le sous-titre « Un généraliste livré face à un spécialiste en préversion » et la ligne « GA à 0,05 $ par minute contre une préversion à environ 0,037 $ par minute », au-dessus de deux panneaux : celui de gauche montrant une forme d’onde audio full-duplex avec des flèches courbées dans les deux directions et un badge « GA » plein, celui de droite montrant un globe avec deux bulles de dialogue et un badge « PREVIEW » avec contour, avec le logo OrcaRouter incrusté dans le coin.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate : un généraliste livré face à un spécialiste en préversion

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ces deux modèles sont comparés parce que tous deux intègrent la parole en temps réel dans une API, et la comparaison s'effondre dès que vous lisez les fiches de modèle. GPT-Live-1 est un modèle vocal full-duplex généraliste qu'Ope​nAI a intégré à l'API développeur le 10 septembre 2026, trois mois après son lancement dans ChatGPT le 8 juillet. Gem​ini 3.5 Live Translate est un modèle de traduction audio-à-audio dédié à une seule tâche que Goo​gle DeepMind a publié le 9 juin 2026, et son ID de modèle porte encore le mot preview. L'un de ces modèles, vous pouvez le mettre devant des clients payants dès aujourd'hui à un tarif publié. L'autre, Goo​gle peut le modifier sous vos pieds sans avis de dépréciation. C'est cette asymétrie, et non la fiche de benchmarks, qui devrait décider du choix.

Deux machines différentes portant la même étiquette

Il faut être franc sur le peu de recoupement entre les deux. Gem​ini 3.5 Live Translate fait de la traduction. Il prend de l’audio en streaming dans une langue et renvoie de l’audio en streaming dans une autre, en préservant la voix et le ton de la personne qui parle, dans plus de 70 langues et plus de 2 000 paires de langues, avec détection automatique de la langue et fonctionnement bidirectionnel. Il ne tient pas de conversation, n’appelle pas de fonction et ne répond pas à une question. C’est un moteur d’interprétation simultanée.

GPT-Live-1 est de forme opposée. C'est un modèle conversationnel : il écoute et parle en même temps, décide plusieurs fois par seconde s'il doit continuer d'écouter, faire une pause, interrompre ou appeler un outil, et confie le travail lourd — recherche web, raisonnement plus poussé, tâches agentiques — à un modèle de raisonnement distinct via l'API Responses pendant que la conversation se poursuit. L'exemple WebRTC publié par Ope​nAI lui-même relie cette délégation à GPT-5.6 Terra. La traduction est l'une des choses qu'il peut faire ; ce n'est pas une fonctionnalité dont le modèle de Goo​gle possède un équivalent dans l'autre sens.

Donc la question pratique est plus étroite que ne le suggère l’affiche du match : si ce que vous construisez relève de l’interprétation, le modèle de Google est conçu pour cet usage précis et celui d’OpenAI est généraliste. Si ce que vous construisez est un agent vocal qui traduit occasionnellement, GPT-Live-1 est le seul des deux à être ne serait-ce que dans la bonne catégorie de produit.

Combien coûte chacun par minute d’audio

C'est ici que le spécialiste justifie son utilité, et l'arithmétique est réellement délicate pour Ope​nAI.

• GPT-Live-1 — 0,05 $ par minute de voix, facturé à la seconde plutôt qu’arrondi à la minute entière suivante. Le raisonnement et les appels d’outils effectués par le backend délégué sont facturés séparément aux tarifs normaux de ce modèle.

• Gem​ini 3.5 Live Translate — 3,50 $ par million de jetons d’entrée audio et 21,00 $ par million de jetons de sortie audio, la facturation étant calculée à 25 jetons par seconde d’audio. Au total, cela revient à environ 0,037 $ par minute d’audio traduit.

Sur les minutes de traduction pure, Goo​gle est environ un quart moins cher. Ce n'est pas une différence d'arrondi à grande échelle : 10 000 minutes interprétées par mois coûtent environ 500 $ sur la couche vocale de GPT-Live-1, contre environ 368 $ sur Gem​ini 3.5 Live Translate. Et l'écart est réel, et non un artefact du changement de mesure, car les deux modèles facturent selon des unités véritablement différentes.

Il y a un hic dans l’autre sens. Le tarif affiché de 0,05 $ pour GPT-Live-1 ne concerne que la couche vocale. Si votre agent traduit et va aussi chercher une information, ou escalade une phrase difficile vers un modèle de raisonnement, vous payez cette délégation en plus — et le modèle délégué est facturé au token comme n’importe quel autre modèle de pointe. Une charge de travail de traduction seule ne déclenche jamais cela. Une charge de travail qui combine traduction et autre chose, elle, le fait, et le gagnant de la comparaison par minute cesse d’être évident.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

L'étiquette d'aperçu est le risque que personne n'intègre dans les prix.

L'ID de modèle de Gemini 3.5 Live Translate est gemini-3.5-live-translate-preview. Il a été déployé dans l'API Gemini Live et Google AI Studio en tant qu'aperçu public, et simultanément dans l'application Google Translate sur Android et iOS, ainsi qu'en aperçu privé dans Google Meet pour certains clients Workspace. Aperçu signifie ce qu'il a toujours signifié chez Google : aucune garantie de stabilité, aucune fenêtre de dépréciation publiée, aucun engagement que le tarif que vous payez survive à la prochaine version.

Pour une application grand public, cela convient. Pour les charges de travail auxquelles ce modèle est réellement destiné — l’interprétation en direct dans un centre d’appels, un produit de réunion, un produit de voyage —, il s’agit du plus grand risque d’intégration de la pile. Vous construisez une dépendance de production sur un modèle que Goo​gle n’a explicitement pas pris l’engagement de soutenir.

GPT-Live-1 a le problème inverse, et il est plus petit mais pas nul. Il est généralement disponible, à un tarif publié, avec un point de terminaison documenté, et il ne disparaîtra pas. Mais sa surface d'API est étroite d'une manière qui surprend les équipes qui supposent qu'il s'intègre dans une intégration OpenAI existante : il y a exactement un ID de modèle, un point de terminaison, et aucun chemin via Chat Completions, Responses, Realtime, Batch, Assistants ou fine-tuning. Le seul moyen d'entrer est le point de terminaison Live Sessions à v1/live/sessions via WebRTC, avec la gestion des événements sur un canal de données. C'est une nouvelle intégration, pas un changement de paramètre.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Langages, et où le généraliste est honnêtement plus faible

Le nombre de langues de Google est de plus de 70, avec préservation de la voix et du ton. La documentation d'OpenAI elle-même est nettement moins confiante quant à sa propre couverture : le matériel de lancement indique que pour certaines langues, le modèle peut avoir un accent non natif ou présenter des lacunes de fluidité, et OpenAI ne publie pas de décompte de langues qui rivalise avec celui de Google.

Ce n'est pas un fournisseur qui joue au timide — c'est ce à quoi ressemble un modèle conversationnel généraliste à côté d'un spécialiste entraîné sur le problème. Si la proposition de valeur de votre produit est « nous interprétons bien 40 langues », le spécialiste est le choix honnête et le généraliste vous fera honte dans la longue traîne. Si votre produit est un agent vocal pour un marché anglophone avec une fonction de traduction greffée après coup, les lacunes linguistiques du généraliste ne se manifesteront jamais.

Les deux modèles appliquent un filigrane SynthID à l’audio généré, ce qui compte si vous relevez d’une juridiction ou d’un contrat client qui exige la provenance de la parole synthétique. Là-dessus, match nul.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Là où l'architecture de délégation modifie le build

La différence structurelle entre ces deux est que GPT-Live-1 est en réalité deux modèles avec une couture au milieu. La couche vocale maintient la conversation en vie ; un modèle de raisonnement distinct fait le travail de réflexion. C’est à cette couture que se concentre votre effort d’ingénierie, et c’est aussi là que le modèle de coûts se complique.

Il est bon de savoir que la moitié déléguée est un modèle de texte ordinaire que vous pouvez acheminer comme n'importe quel autre. GPT-5.6 Terra, le backend de l'exemple d'Ope​nAI, est servi via OrcaRouter à 2,00 $ par million de tokens d'entrée et 12,00 $ par million de tokens de sortie, avec une fenêtre de contexte d'un million de tokens et les deux points d'accès /v1/chat/completions et /v1/responses exposés. Si vous voulez remplacer le cerveau de raisonnement derrière un agent vocal — par un modèle moins cher lors des appels simples, ou un modèle plus puissant lors des escalades — cette moitié de la pile a des options, car il s'agit d'un appel API normal qui se trouve aux côtés de environ 190 autres modèles sur une seule clé.

La moitié vocale, elle, ne le fait pas. GPT-Live-1 n’est pas sur OrcaRouter, et Gem​ini 3.5 Live Translate non plus ; tous deux ne sont disponibles qu’auprès du fournisseur qui les a créés. Là où un routeur gagne sa place dans une architecture comme celle-ci, c’est tout ce qui se trouve en aval de l’audio : les modèles textuels qui font la récupération, la synthèse, l’écriture en retour dans le CRM et l’escalade, ce qui représente la moitié de la facture que vous pouvez réellement consolider sur une seule clé et une seule facture.

Ce qu’il faut vraiment choisir

• Choisissez Gemini 3.5 Live Translate si la traduction est le produit, si le prix par minute compte plus que la stabilité contractuelle et si vous pouvez absorber qu’un modèle en préversion change sous vos pieds. Prévoyez environ 0,037 $ la minute et conservez une couche d’abstraction au-dessus de l’appel afin qu’un modèle GA puisse le remplacer sans réécriture.

• Choisissez GPT-Live-1 si vous avez besoin d’un agent conversationnel qui se trouve aussi faire de la traduction, si vous avez besoin d’appel de fonctions et d’utilisation d’outils au sein de la boucle vocale, ou si une équipe d’approvisionnement vous demandera ce qui se passe lorsque le modèle est retiré et que vous devez fournir une meilleure réponse que « rien, probablement ».

• Ne choisissez ni l’un ni l’autre parce qu’il a remporté un benchmark. Les benchmarks des deux côtés ne sont pas comparables — les chiffres full-duplex d’OpenAI sont les siens, non reproduits par un tiers, et les affirmations linguistiques de Google n’ont pas été testées face à un généraliste sur le même ensemble audio.

Une remarque prospective : les deux surfaces convergent plutôt qu’elles n’entrent en collision. Le modèle de traduction de Goo​gle vit déjà à l’intérieur de Gem​ini Live, et la couche vocale de GPT-Live-1 est explicitement conçue pour que de nouveaux modèles de pointe soient déployés derrière elle. L’attente raisonnable est que, d’ici quelques cycles de publication, la traduction du généraliste s’améliore et que l’histoire d’intégration du spécialiste devienne moins hasardeuse. Si vous construisez aujourd’hui et que la décision est serrée, cela plaide pour l’option la moins chère et la plus remplaçable, et pour garder le chemin audio isolé derrière une interface dans tous les cas.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement