Carte de titre principale pour Gemini 3.8 Live vs GPT-Live-1, avec le surtitre « OrcaRouter · radar des modèles — face-à-face » et le sous-titre « Full-duplex contre tour par tour — l'argument architectural, à relire. » Deux cartes indiquent « Gemini 3.8 Live — tour par tour, vision disponible dès aujourd'hui, 97 langues, minutes moins chères » et « GPT-Live-1 — full-duplex, canaux de retour, délègue à un backend de pointe », avec des pastilles pour Index 76,0 vs 81,5, 0,018 $ vs 0,05 $ par minute, et la vidéo bientôt disponible sur OpenAI. Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 Live vs GPT-Live-1 : duplex intégral vs le modèle qui pense tout en parlant

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Pendant environ deux mois, le débat a été tranché par l'architecture. GPT-Live-1est véritablement full-duplex — il écoute pendant qu'il parle, produit des signaux d'écoute comme « mhmm » et « got it », et décide plusieurs fois par seconde s'il doit parler ou céder la parole. Gemini 3.8 Live, annoncé le 15 septembre 2026, est un modèle à tours de parole. Dans l'ancien cadre, cela rendait la comparaison facile, et c'est désormais une mauvaise façon de la lire.

Ce qui a changé, ce n'est pas que Google ait égalé le full-duplex. C'est que Google a livré ce que le full-duplex servait à compenser : un modèle vocal capable de soutenir une conversation pendant qu'une tâche à plusieurs étapes s'exécute en arrière-plan, et une seconde variante qui raisonne à voix haute pendant qu'elle travaille. La différence architecturale est réelle. Simplement, ce n'est plus l'axe qui décide de l'achat.

Deux façons de maintenir une conversation vivante

Le pari du duplex intégral, c’est que la qualité de la conversation est le produit. GPT-Live-1 traite l’audio d’entrée et de sortie de façon continue et synchrone au sein d’un seul modèle, plutôt que d’enchaîner la reconnaissance vocale, puis un modèle de langage, puis la synthèse vocale. Cela élimine la perte d’information entre les étapes et produit le comportement que les gens remarquent réellement : on peut l’interrompre au milieu d’une réponse et il s’adapte ; il ne confond pas une pause ou un bruit de fond avec la fin de votre tour de parole ; il reste silencieux jusqu’à ce qu’on lui donne la parole.

Le pari du tour de parole, que formule Gemini 3.8 Live, est que la conversation est un échafaudage pour le travail. Ses fonctionnalités visent à garder la session productive plutôt qu’à préserver un rythme naturel : traitement des entrées visuelles en quasi-temps réel, transition automatique entre 97 langues prises en charge en pleine conversation, et exécution en arrière-plan d’outils et d’API qui accuse réception d’une demande et continue de parler pendant que l’appel se termine.

Les deux modèles refusent de raccrocher pendant qu’ils réfléchissent. Ils refusent simplement différemment. GPT-Live-1 le fait en n’arrêtant jamais le flux audio. Google le fait en parlant pendant que le travail se fait.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

Ce que l’index dit vraiment

Artificial Analysis tient à jour un Speech to Speech Index — un composite pondéré de raisonnement vocal, de performance agentique, de préférence d’arène et de taux de réussite des tâches. Lisez attentivement le tableau capturé le 16 septembre 2026, car le titre cache la structure :

Gemini 3.8 Live Extended Thinking — 82,6 (premier)

• GPT-Live-1 (backend Astra, effort moyen) — 81,5

Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (backend Sol, faible effort) — 80,1

Gemini 3.8 Live — 76,0

• GPT-Realtime-2.1 High — 73,9

• Gemini 3.1 Flash Live High — 71.5

Trois choses découlent de ce classement. Premièrement, Google occupe la première place, mais avec la variante coûteuse, pas celle que la plupart des gens déploieront. Deuxièmement, GPT-Live-1 apparaît deux fois, car Artificial Analysis évalue l’ensemble du système plutôt que le front-end vocal — et l’écart de 1,4 point entre ses deux configurations est sept fois plus grand que l’écart de 0,2 point entre la première et la deuxième place. Troisièmement, le modèle cité dans le titre de cette confrontation, Gemini 3.8 Live, se classe cinquième, derrière les deux configurations de GPT-Live-1.

Si vous comparez à périmètre comparable — le niveau standard contre le niveau standard — GPT-Live-1 remporte cette confrontation sur l’indice composite, et l’écart n’est pas mince. Le 82,6 revient à Gemini 3.8 Live Extended Thinking, un produit différent, à un prix différent, avec un déploiement différent.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

Où GPT-Live-1 est encore en avance

Le full-duplex n'est pas une distinction marketing, et la répartition des benchmarks montre où il se convertit en avantage réel :

Performance agentique — GPT-Live-1 mène nettement sur τ-Voice avec 67,9 % contre 56,5 % pour Grok. Google n'a pas publié de chiffre τ-Voice comparable pour Gemini 3.8 Live, seulement 68,6 % pour la variante Extended Thinking.

Dynamique conversationnelle — la prise de parole en full-duplex reste la référence en matière de naturel, et les modèles à tours de parole ont historiquement été à la traîne sur ce point.

Profondeur de délégation — GPT-Live-1 transmet les requêtes complexes à un modèle textuel de pointe, avec GPT-5.5 et GPT-6 Astra tous deux documentés comme backends, et expose des sélecteurs d’effort de raisonnement.

Sourcing — les transcriptions vocales de ChatGPT comportent des liens de citation, ce qui reste rare dans les interactions vocales en général.

Le contrepoids, c'est que GPT-Live-1 est à la traîne sur le raisonnement vocal brut : 90,1 % sur Big Bench Audio, contre 97,2 % pour Grok. Et son chiffre de latence phare de 0,798 seconde sur Full Duplex Bench est une mesure différente du temps jusqu'au premier audio de l'API, qui se situe entre 1,24 et 1,34 seconde.

Là où Gemini 3.8 Live est en avance

Les avantages de Google tiennent moins à la conversation qu'à ce que la session peut faire :

Vision, aujourd'hui — Gemini prend en charge l'entrée caméra et le partage d'écran depuis un certain temps déjà. GPT-Live-1 a été lancé sans vidéo ni partage d'écran, OpenAI indiquant qu'ils arrivent et citant l'ancien Advanced Voice Mode comme solution provisoire. Gemini 3.8 Live y ajoute un traitement visuel quasi en temps réel.

Couverture linguistique — 97 langues prises en charge avec changement automatique en cours de conversation, contre un éventail bien plus restreint du côté d’OpenAI.

Coût — le tarif annoncé est de 0,005 $ par minute d’entrée audio et de 0,018 $ par minute de sortie audio. GPT-Live-1 est facturé à 0,05 $ par minute vocale pour le front-end seul, avec un coût mesuré tout compris d’environ 4,47–5,83 $ par heure une fois les tokens du backend comptabilisés.

Un second niveau qui raisonne à voix haute — Gemini 3.8 Live Extended Thinking narre sa progression avec des amorces comme « Laissez-moi vérifier… », ce qui constitue une réponse au problème du silence différente de celle qu'offre le full-duplex.

La comparaison des coûts qui compte

Les tarifs de front-end ressemblent à une déroute — 0,018 $ contre 0,05 $ par minute — et les chiffres horaires sont encore plus frappants. Le graphique du coût par heure d'audio d'entrée d'Artificial Analysis place Gemini 3.8 Live à 1,50 $ par heure, contre 4,14 $ pour GPT-Realtime-2 High et 10,75 $ pour GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 se situe à 4,80 $.

Le piège, c'est qu'aucun de ces deux chiffres ne correspond à la facture réelle. Les 0,05 $ par minute de GPT-Live-1 ne couvrent que le front-end vocal ; le modèle de texte backend qui effectue le raisonnement proprement dit est facturé séparément, et c'est ainsi qu'un tarif affiché de 0,05 $ se transforme en 4,47 $ à 5,83 $ de l'heure, tout compris. Gemini 3.8 Live présente la même structure — l'exécution d'outils en arrière-plan relève du travail du modèle de texte — et Google n'a pas publié ce que cela coûte.

Donc, l’interprétation honnête est que Gemini 3.8 Live est bien moins cher au tarif d’entrée, et que la comparaison tous frais compris reste inconnue pour les deux tant que vous n’avez pas mesuré votre propre charge de travail. Ce n’est pas une esquive ; c’est l’état réel de l’information.

La couche à laquelle tous les deux délèguent

Voici le fait structurel qui rend ce match-up moins une décision d’enfermement qu’il n’y paraît. Les deux modèles délèguent. GPT-Live-1 transmet par conception les requêtes difficiles à un modèle textuel backend, et l’exécution d’outils en arrière-plan du côté de Gemini se résout en appels de modèle ordinaires. Dans les deux cas, l’interface vocale n’est qu’une fine couche au-dessus d’un modèle textuel qui effectue le raisonnement — et c’est dans cette couche textuelle que réside la variance de vos coûts et que le basculement est peu coûteux.

OrcaRouter donne accès à 190 modèles derrière une seule clé, au prix catalogue du fournisseur, sans marge, de sorte qu'une baisse de prix en amont arrive de notre côté le jour même plutôt qu'au prochain renouvellement de contrat. Pour une pile vocale, les deux propriétés qui comptent sont que la cible de délégation peut être changée sur du trafic en direct sans toucher à l'intégration vocale, et que le basculement automatique maintient un appel en vie lorsqu'un backend renvoie une erreur ou dépasse le délai. Une précision, car il est facile de laisser entendre le contraire : nous n'hébergeons pas les points de terminaison vocaux Gemini 3.8 Live ni GPT-Live-1 — ceux-ci proviennent des API propres des fournisseurs. Les modèles texte auxquels ils confient généralement le travail se trouvent sur le routeur.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

Comment choisir

Choisissez GPT-Live-1 si la qualité de la conversation est le produit — gestion naturelle des interruptions, signaux d'écoute, et le sentiment que vous parlez à quelque chose plutôt que de l'utiliser — et si vous pouvez absorber le coût total, qui est nettement plus élevé que ne le suggère le tarif affiché. Notez que son API n'est devenue disponible qu'en septembre 2026, de sorte que l'écosystème d'outils tiers autour d'elle est encore jeune.

Choisissez Gemini 3.8 Live si vous avez besoin de vision dès maintenant, si vous avez besoin de plus de deux douzaines de langues, ou si l'économie à la minute domine votre modèle. Acceptez que vous achetez le niveau standard, qui se classe cinquième à l'indice composite plutôt que premier, et que le 82,6 que tout le monde citera appartient à la variante Extended Thinking.

Choisissez Gemini 3.8 Live Extended Thinking si le raisonnement est l'essentiel et que vous voulez le leader actuel de l'indice — mais vérifiez d'abord son déploiement, car son parcours de distribution via Gemini Live, Docs, Gmail et Keep est plus large que celui du modèle standard et sa disponibilité en entreprise est encore en préversion privée.

Ce qu’il faut surveiller au cours du prochain trimestre, c’est de savoir si le full-duplex reste un fossé concurrentiel. Les modèles à tours de parole comblent l’écart conversationnel par une autre voie — en gardant l’audio occupé par de la narration pendant que le travail s’accomplit — et si cela tient le coup sous un trafic réel, la distinction architecturale qui définit cette catégorie depuis un an cessera d’être ce sur quoi les acheteurs se renseignent.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement