
GPT-Live-1 arrive en tête de l’indice Speech to Speech avec 81,5 — mais le classement revient à son backend
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, le modèle vocal full-duplex lancé pour la première fois dans ChatGPT le 8 juillet 2026, occupe désormais la première place de l'Artificial Analysis Speech to Speech Index avec 81,5 — une ligne qui n'existe que parce que le modèle a été branché sur GPT-6 Astra pour réfléchir. En exécutant le même front-end vocal avec GPT-5.6 Sol comme backend délégué à faible effort de raisonnement, on obtient 80,1, soit la troisième place. La deuxième place, avec 81,3, revient à Grok Voice Think Fast 2.0 High.
Deux mises au point honnêtes avant les chiffres. Le modèle n’est pas nouveau : GPT-Live-1 est arrivé sur l’API développeur le 10 septembre 2026, après deux mois comme voix par défaut de ChatGPT. Ce qui est nouveau, mesuré le 15 septembre, c’est qu’un évaluateur externe l’a noté — l’élément qui manquait à toutes les analyses de ce modèle jusqu’ici, y compris la nôtre, où les seuls chiffres disponibles étaient ceux qu’OpenAI avait publiés sur elle-même. Et l’écart de 0,2 point avec la deuxième place est inférieur à l’écart de 1,4 point entre les deux configurations de GPT-Live-1 lui-même, qui est le chiffre le plus utile du tableau.
Ainsi, le titre « GPT-Live-1 est le meilleur modèle vocal » ne correspond pas tout à fait à ce que dit l'indice. Il indique que GPT-Live-1 avec GPT-6 Astra à effort moyen l'est, d'un cinquième de point, et que le choix du backend influe sur le résultat plus que ne le fait n'importe quel modèle concurrent.
Ce que l'indice mesure réellement
Artificial Analysis construit le Speech to Speech Index comme un composite à pondération égale de quatre éléments : le raisonnement vocal, mesuré par Big Bench Audio ; la performance agentique, mesurée par τ-Voice ; la préférence d’arène, un Elo de préférence humaine établi par comparaisons par paires ; et le taux de réussite des tâches. Seuls les modèles pour lesquels les quatre composantes sont disponibles obtiennent une valeur d’indice — tout le reste affiche un tiret, ce qui explique pourquoi le tableau comporte bien plus de lignes que de scores. L’indice lui-même a été lancé le 23 juin 2026 et a été révisé deux fois depuis, plus récemment pour remplacer Conversational Dynamics par Task Success, de sorte qu’un score issu d’une révision n’est pas strictement comparable à un score issu d’une autre.
Deux autres détails méthodologiques comptent lorsque vous lisez le classement. L'Elo Arena est figé à la valeur qu'il avait lorsqu'un modèle est devenu publiable pour la première fois, de sorte que la composante de préférence récompense l'arrivée précoce plutôt que le fait d'être le meilleur aujourd'hui. Et l'indice évalue un système entier plutôt qu'un modèle unique : pour GPT-Live-1, le chiffre couvre l'interface vocale ainsi que le modèle backend auquel il transmet le travail. Il s'agit d'un choix de conception délibéré, et c'est la raison pour laquelle le même modèle apparaît deux fois avec des scores différents.
Le sommet du domaine, tel que publié :
• GPT-Live-1 (Astra, medium) — indice 81,5, premier
• Grok Voice Think Fast 2.0 High — indice 81,3, deuxième
• GPT-Live-1 (Sol, low) — index 80.1, troisième
• GPT-Realtime-2.1 High — indice 73,9, quatrième
• GPT-Realtime-2 High — indice 73.6, cinquième
• Grok Voice Think Fast 1.0 — indice 72,3, sixième
• Gemini 3.1 Flash Live High — index 71.5, septième

Pour donner un ordre de grandeur, le modèle que GPT-Live-1 remplace se situe 7,6 points en dessous de lui. C’est un véritable écart générationnel, et ce n’est pas contesté.
La victoire de 0,2 point provient d’exactement une composante.
Décomposez le composite, et les deux leaders cessent de ressembler au même type de modèle. Sur les composantes, d’après Artificial Analysis :
• Performance agentique (τ-Voice) — GPT-Live-1 67,9 % vs Grok Voice Think Fast 2.0 High 56,5 %
• Raisonnement vocal (Big Bench Audio) — 90 % vs 97 %
• Taux de réussite des tâches — 87,4 % vs 94,6 %
• Elo d’Arène — 1048 contre 1011
• Temps jusqu'au premier son — 1,34 s vs 0,70 s
• Coût par heure, backend inclus — 5,83 $ vs 4,80 $

GPT-Live-1 remporte deux des six lignes et en perd quatre, mais prend la tête de l'indice. L'arithmétique n'a rien de mystérieux : l'écart τ-Voice est de 11,4 points, bien plus important que tout autre écart du tableau, et à pondération égale, il tire le score composite au-delà de la ligne. En termes simples, GPT-Live-1 est le meilleur agent et Grok Voice Think Fast 2.0 High est le meilleur à l'écoute et le plus rapide — et il se trouve que l'indice pondère suffisamment fortement ce dans quoi GPT-Live-1 excelle pour le placer en tête.
Si votre produit est un agent vocal qui réserve, résout ou effectue des transactions, l'avance de 11,4 points sur τ-Voice est le chiffre qui prédit votre expérience. Si votre produit est une conversation qui doit sembler instantanée et ne jamais parler par-dessus l'utilisateur, le temps de 0,70 seconde jusqu'au premier audio est le chiffre qui prédit votre expérience, et Grok l'emporte d'environ un facteur deux. Sur l'exécution de tâches réglementées, il y a un deuxième avertissement : le taux de réussite de 94,6 % de Grok est le plus élevé du tableau visible, et les 87,4 % de GPT-Live-1 signifient qu'environ une tâche sur huit ne se termine pas. Les deux sont des améliorations par rapport à la génération précédente. Aucun des deux n'est un problème résolu.
La ligne n°1 est une configuration de routage, pas un modèle
Voici la partie qui mérite plus d’attention que la position au classement. GPT-Live-1 est une couche vocale full-duplex qui gère elle-même l’écoute, la parole, l’interruption et l’alternance des tours de parole, et délègue le raisonnement, les appels d’outils et la recherche à un modèle backend distinct pendant que la conversation se poursuit. Artificial Analysis a évalué deux de ces appariements comme des entrées distinctes. Astra en effort moyen a produit 81,5. Sol en effort faible a produit 80,1.
Cet écart de 1,4 point, c’est toute l’histoire. L’écart entre la première et la deuxième place est de 0,2 point. L’écart entre les deux configurations évaluées de GPT-Live-1 est sept fois plus grand. Rien n’a changé dans le modèle vocal entre ces lignes — seuls le modèle qui effectuait la réflexion et le niveau d’effort ont changé. Un classement de systèmes vous dit, avec justesse, que la configuration est le produit.
Il révise aussi notre propre couverture. Le 11 septembre 2026, nous avons enregistré GPT-Live-1 à 69,8 % sur cet indice, derrière GPT-Realtime-2.1 et Grok. C’était la lecture disponible à l’époque, et elle étayait une conclusion raisonnable : OpenAI avait construit la meilleure mécanique conversationnelle, et non le meilleur agent vocal. L’indice comporte désormais deux configurations déléguées de GPT-Live-1, à 81,5 et 80,1. Artificial Analysis ne publie pas de journal des modifications, et elle a révisé les composants de l’indice en août, de sorte que nous ne pouvons pas dire avec certitude si le chiffre antérieur correspondait à une configuration non notée ou partiellement notée, ou à une exécution selon l’ancienne pondération ; ce qui est observable, c’est que les appariements délégués apparaissent désormais comme leurs propres lignes complètes, et que la réponse a changé quand ceux-ci sont apparus.
La conséquence pratique est que « quel modèle vocal » est la mauvaise question et que « quel modèle vocal, plus quel backend, à quel niveau d’effort » est la bonne. C’est une question de routage, et c’est précisément celle à laquelle notre propre produit a vocation à répondre. OrcaRouter expose le backend de délégation de GPT-Live-1, GPT-6 Astra, via le même point de terminaison compatible OpenAI que plus de 200 autres modèles, donc remplacer la couche de réflexion est un changement d’ID de modèle plutôt qu’une intégration. Le DSL de routage compose plusieurs modèles en un seul appel, et le basculement automatique signifie qu’un appariement non éprouvé n’est pas un pari de production — si le backend se dégrade, la requête atterrit ailleurs au lieu d’échouer. Pour être précis sur ce que nous ne faisons pas : GPT-Live-1 lui-même n’est pas dans notre catalogue et nous ne le servons pas. Le backend auquel il délègue est une autre histoire.
Combien coûte une heure de ceci
Le front-end de GPT-Live-1 est facturé 0,05 $ par minute vocale, à la seconde, soit 3,00 $ pour une heure de ligne ouverte. Ce n'est pas toute la facture : le raisonnement délégué, les appels d'outils et la recherche web sont facturés séparément, au tarif appliqué par le modèle backend. Artificial Analysis a mesuré le montant tout compris, c'est pourquoi sa colonne de coûts est celle à utiliser :
• GPT-Live-1 (Sol, faible) — 4,47 $ par heure
• Grok Voice Think Fast 2.0 High — 4,80 $ par heure
• GPT-Live-1 (Astra, medium) — 5,83 $ par heure
• GPT-Realtime-2.1 High — 10,75 $ par heure
Le gagnant du classement est le plus cher des trois choix actuels, et la configuration qui l’a emporté coûte 30 % de plus par heure que la configuration classée troisième. Lue dans l’autre sens, la répartition est instructive : 3,00 $ de chaque heure revient à la couche vocale, et le reste — 1,47 $ sur Sol, 2,83 $ sur Astra — correspond à des jetons backend. La couche de réflexion représente entre un tiers et la moitié de votre facture, ce qui est une part importante pour un composant que le classement traite comme une note de bas de page.

Par rapport au modèle remplacé, toutefois, l’ensemble de la famille est à peu près à moitié prix — le front-end à 0,05 $ la minute constitue une véritable baisse, et non un simple reconditionnement. Comme les tokens de back-end sont facturés aux tarifs des back-ends, le coût d’un déploiement de GPT-Live-1 dépend principalement du modèle de raisonnement vers lequel vous routez, et les back-ends peuvent être des modèles d’OpenAI ou de tiers. Sur OrcaRouter, ces back-ends sont répercutés au prix catalogue du fournisseur, avec 0 % de marge, de sorte qu’une modification tarifaire d’un fournisseur sur la couche de raisonnement est effective le jour même, plutôt qu’au cycle de facturation suivant.
Ce que l'indice ne tranche pas
Trois réserves, énoncées par la source plutôt que déduites. Il est signalé que les deux entrées GPT-Live-1 et Grok Voice Think Fast 2.0 High reposent sur un seul essai, ce qui est mince pour une décision à 0,2 point — une nouvelle exécution pourrait réordonner la première et la deuxième place sans que rien ne change pour l’un ou l’autre modèle. L’Arena Elo, comme indiqué, a été figée à la première mesure publiable de chaque modèle. Et l’indice ne comporte aucune entrée sur la façon dont ces systèmes se comportent lors d’un appel de longue durée : les composants sont à horizon court par construction, tandis que le mode de défaillance qui tue réellement les agents vocaux en production est la dérive au fil d’une conversation de vingt minutes.
Séparément, et de la part du fournisseur plutôt que de l’index : l’API de GPT-Live-1 a été livrée sans entrée d’image ou de vidéo, sans sorties structurées et sans offre gratuite, et ses limites de débit sont comptées en sessions simultanées plutôt qu’en requêtes par minute. Ce sont des contraintes du jour du lancement qui ont peut-être déjà évolué ; vérifiez-les avant de concevoir en fonction d’elles.
Que faire de ceci
Si vous choisissez une architecture cette semaine plutôt qu’un modèle, l’index récompense le schéma délégué sur le travail agentique et le schéma en cascade sur la latence. GPT-Live-1 à 81,5 est la preuve la plus solide à ce jour que séparer la conversation du raisonnement est la bonne forme pour les agents vocaux qui accomplissent des tâches. Grok Voice Think Fast 2.0 High à 81,3, avec 0,70 seconde jusqu’au premier audio et un taux de réussite des tâches de 94,6 %, est la preuve la plus solide que le schéma délégué n’est pas le seul qui fonctionne — et qu’il n’est pas encore le plus rapide.
La décision qui découle des chiffres est moins coûteuse qu’elle n’en a l’air. Les deux configurations de GPT-Live-1, ainsi que le modèle qui l’a battu sur quatre des six composantes, s’écartent de moins de 1,36 $ l’heure l’une de l’autre. À cet écart, le bon réflexe est d’arrêter de consulter les classements et de faire passer vos propres transcriptions par les deux. L’indice vous indique la forme du compromis ; il ne peut pas vous dire de quel côté vos utilisateurs se trouvent.
Questions que le nombre suscite
GPT-Live-1 est-il désormais le meilleur modèle vocal ?
Au score composite, oui — de 0,2 point et avec un seul essai derrière. Par composantes, cela dépend entièrement de ce que vous construisez : il mène sur la performance agentique et la préférence d’arène, et il est à la traîne sur le raisonnement vocal, le taux de réussite des tâches et le temps jusqu’au premier audio. Une avance composite de 0,2 point reposant sur un seul avantage de 11,4 points sur une composante constitue une première place défendable, pas une place décisive.
Faut-il utiliser GPT-6 Astra pour obtenir le 81,5 ?
Pour cette ligne précise, oui — le 81,5 revient à GPT-Live-1 configuré avec Astra à un effort de raisonnement moyen. Sol en effort faible est une alternative documentée à 80,1 et coûte 1,36 $ de moins par heure, et OpenAI prend en charge l'utilisation de modèles tiers comme backend, de sorte que les entrées du classement sont deux points sur une courbe plutôt que les seules options. Quel couplage est le meilleur pour votre charge de travail, ce n'est pas à un index public de répondre à votre place.
Pourquoi le même modèle a-t-il obtenu 69,8 dans notre précédente publication et 81,5 maintenant ?
Les deux chiffres ne portent pas sur la même chose. Le relevé précédent plaçait GPT-Live-1 dans l’indice comme une entrée unique ; le tableau actuel présente ses deux configurations déléguées comme des lignes distinctes, entièrement notées, avec l’association Astra à 81,5 et l’association Sol à 80,1. Artificial Analysis a révisé les composants de l’indice en août et ne publie pas de journal des modifications ; considérez donc l’écart comme un changement de ce qui a été mesuré, et non comme une preuve que le modèle s’est amélioré — et considérez tout score composite pris isolément pour un modèle qui délègue comme une affirmation au sujet d’une configuration.
