Carte de titre principale de l'article « La Journée plateforme de septembre d'OpenAI », sous-titrée « GPT-Live-1 arrive dans l'API, l'Agents API s'ouvre en bêta », portant un badge indiquant « Les deux annonces datées du 10 septembre 2026 » et trois cartes indiquant « GPT-Live-1 dans l'API : 0,05 $ par minute de voix, point de terminaison Live Sessions, un seul ID de modèle », « Agents API : bêta publique, harness Codex, sandboxes hébergés ou les vôtres » et « Pourquoi c'est important : le modèle devient un composant que vous choisissez, le harness devient un produit que vous louez », au-dessus d'un bandeau de pied de page indiquant « Chiffres vocaux rapportés par OpenAI et non reproduits ; la tarification de l'Agents API est répercutée sans marge. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Platform Day de septembre d’Ope​nAI : GPT-Live-1 arrive dans l’API tandis que l’API Agents s’ouvre en bêta

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux choses ont quitté la plateforme d’Ope​nAI le 10 septembre 2026, et la plus discrète a le plus grand rayon d’impact. GPT-Live-1 — le modèle vocal full-duplex qui tourne dans ChatGPT depuis le 8 juillet — peut désormais être appelé par les développeurs à 0,05 $ par minute de voix. À ses côtés, et bien moins mentionnée dans la couverture, l’API Agents est entrée en bêta publique : le même harnais qui fait tourner Codex, exposé comme produit hébergé avec des bacs à sable gérés. L’un est une meilleure voix. L’autre, c’est Ope​nAI qui vend ce qui était autrefois la partie difficile de la création d’un agent.

Tous deux ont été tirés des sources primaires de cet article : l'annonce de l'API Agents d'Ope​nAI, sa publication dans la communauté des développeurs présentant GPT-Live-1 dans l'API, et la documentation développeur pour les deux. Lorsqu'un chiffre provient d'Ope​nAI plutôt que d'un évaluateur externe, il est étiqueté comme tel ci-dessous — et un chiffre provient bel et bien de l'extérieur, ce qui change légèrement le récit.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis a commencé à publier un indice Speech to Speech cette année, et GPT-Live-1 y figure : 69,8 %, une moyenne pondérée du raisonnement vocal, des performances agentiques, des préférences dans l'arène et de la réussite des tâches. Cela le place septième des onze modèles évalués — derrière GPT-Realtime-2.1 à 73,9 %, qui est le modèle qu'il remplace, et derrière Gr​ok Voice Think Fast 2.0 à 79,0 %. Le tableau de bord indépendant et le propre tableau de référence d'Ope​nAI ne racontent pas la même histoire, et les deux sont vrais.

Ce qui a été livré, dans l’ordre où cela transformera votre architecture

• Voix — GPT-Live-1 est disponible dans l'API sous le nom de gpt-live-1, facturé à 0,05 $ par minute de voix, à la seconde, le modèle de raisonnement backend étant facturé séparément selon ses propres tarifs.

• Agents — l’API Agents est en bêta publique. OpenAI indique qu’il n’y a pas de frais supplémentaires pour l’API elle-même ; vous payez pour les tokens de modèle, les outils et le temps de conteneur sandbox hébergé.

• Bacs à sable — OpenAI héberge désormais l’environnement d’exécution, en réutilisant la même infrastructure de sandboxing que Codex et ChatGPT, configurable avec des fichiers, des paquets, des compétences et des plugins.

• Environnements — outre le sandbox propre à Ope​nAI, les équipes peuvent diriger des agents vers leur propre infrastructure ou vers des fournisseurs tiers de sandbox figurant dans la liste des partenaires bêta.

La sortie vocale est une histoire de modèle. L'API Agents est une histoire de plateforme, et les histoires de plateforme sont celles qui réorientent discrètement une base de code.

L’API Agents : un agent en un seul POST

L'appel central est POST /v1/agents/sessions, envoyé avec un Ope​nAI-Beta: agents=v1 en-tête, et la promesse est que la tâche, le modèle, les outils et l'environnement suffisent pour obtenir un agent en cours d'exécution. Les SDK couvrent Python, TypeScript/JavaScript, Go, Java et Ruby.

Ce qui en fait plus qu'un simple wrapper, c'est que Ope​nAI exploite le harnais plutôt que de le distribuer. Le harnais AgentKit est open source et inspectable, mais la version en fonctionnement est celle d'Ope​nAI — compaction du contexte sur de longues sessions, recherche d'outils, appel programmatique d'outils, prise en charge de MCP, fonctions personnalisées, recherche web intégrée et orchestration de sous-agents avec concurrence configurable. Les capacités versionnées du harnais arrivent en même temps que les lancements de modèles, ce qui est l'engagement intéressant : l'échafaudage évolue au même rythme que les modèles.

Pour quiconque a passé un trimestre à maintenir une boucle — logique de nouvelle tentative, élagage du contexte, routage des outils, diffusion en éventail des sous-agents qui laisse toujours fuiter l'état — c'est ça, le vrai produit. Pas l'appel au modèle. La tuyauterie autour, que vous n'écrivez plus.

Les sandboxes hébergées sont la partie qui vient avec une facture.

Les agents qui exécutent du code ont besoin d’un endroit où l’exécuter, et la bêta embarque la propre réponse d’Ope​nAI : une sandbox managée qui exécute du code, manipule des fichiers et produit des artefacts, configurable avec des packages, des compétences et des plugins. Les développeurs qui disposent déjà d’un environnement d’exécution durci ne sont pas obligés de l’adopter — l’apport de votre propre infrastructure et un ensemble de partenaires de sandbox nommés figurent tous les deux dans la bêta.

Deux réserves opérationnelles méritent d’être consignées avant que vous ne vous appuyiez dessus. La résidence des données dans la version bêta est limitée aux États-Unis, et Zero Data Retention n’est pas pris en charge. Pour une charge de travail réglementée, ces deux lignes déterminent s’il s’agit d’un pilote ou d’une voie de production, et ce sont les détails qui ont tendance à être découverts tardivement.

GPT-Live-1 dans l’API : la facturation forfaitaire à la minute est le véritable changement

Le modèle vocal lui-même n’est pas nouveau — il a remplacé Advanced Voice Mode dans ChatGPT le 8 juillet — mais sa forme commerciale l’est. Dans la gamme Realtime, l’audio était facturé en tokens, ce qui signifiait que prévoir un appel exigeait de modéliser la consommation audio : combien de tokens coûte une seconde de silence, comment le fait qu’un appelant parle par-dessus l’agent modifie la longueur de sortie. Un tarif fixe de 0,05 $ par minute vocale réduit cela à une multiplication. Une heure de ligne ouverte en continu coûte 3,00 $. Une moyenne de quatre minutes sur mille appels par jour représente environ 200 $ par jour.

Les sessions s'exécutent depuis un point de terminaison Live Sessions avec un seul ID de modèle et aucune capture datée à épingler. La documentation couvre WebRTC, WebSockets et la téléphonie/SIP comme voies de connexion, et le démarrage rapide publié met en œuvre celle reposant sur WebRTC. La facturation comporte deux compteurs, et un seul d'entre eux concerne la voix : chaque appel de raisonnement délégué, chaque invocation d'outil et chaque recherche web est facturé aux tarifs normaux du modèle backend.

L'architecture repose sur la délégation. GPT-Live-1 gère la conversation — décidant plusieurs fois par seconde s'il faut continuer à écouter, marquer une pause, interrompre ou déléguer le travail — et transmet tout ce qui exige un véritable raisonnement, au-delà d'une frontière asynchrone, à un backend distinct qui continue de fonctionner pendant que la conversation vocale se poursuit. La documentation définit deux modes : la délégation Responses, où Ope​nAI appelle pour vous un modèle Responses pris en charge et fournit le contexte de la conversation, et la délégation côté client, où votre propre application fournit le backend et garde la main sur l'exécution, le contexte et les résultats qui parviennent à la couche vocale. Dans l'exemple Responses publié, ce backend est GPT-5.6 Terra, nommé dans un delegation objet aux côtés de ses propres instructions et outils. Lors du lancement grand public de juillet, il s'agissait de GPT-5.5 ; les articles de la communauté publiés depuis ont pointé vers GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Tous les chiffres phares de la couche vocale sont ceux d'OpenAI lui-même et, au moment de la rédaction, n'ont été reproduits de manière indépendante par personne : 80,1 % d'interactivité sur Full Duplex Bench v1.5 contre 45,4 % pour GPT-Realtime-2.1, une latence de prise de tour de 0,798 seconde contre 1,41 seconde, 87 % de réussite des appels d'outils, et un taux de réussite de 32 % à une évaluation de support vocal bancaire contre 12,4 % pour le modèle qu'il remplace. Ce dernier couple est le plus honnête — une nette amélioration, et pourtant un système qui échoue sur environ deux tiers d'un processus réglementé. Il existe des preuves clients tierces, mais elles sont minces et partiales : Yelp pour les réservations téléphoniques, EliseAI et la plateforme d'apprentissage Speak rapportent près de 80 % d'interruptions en moins par rapport à leur précédente architecture basée sur les tours.

Le résultat indépendant est moins flatteur, et mérite d’être placé à côté de la liste ci-dessus plutôt qu’en dessous. Sur l’Artificial Analysis Speech to Speech Index — un score composite couvrant le raisonnement vocal, la performance agentique, la préférence d’arène et la réussite des tâches — GPT-Live-1 se situe à 69,8 %, en dessous des 73,9 % de GPT-Realtime-2.1 et bien en dessous des 79,0 % de Grok Voice Think Fast 2.0. En lisant les deux ensemble, la nature du produit devient évidente : OpenAI a construit la meilleure mécanique conversationnelle disponible et n’a pas construit le meilleur agent vocal, parce que le raisonnement est délégué à un modèle que l’indice évalue séparément.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

Les deux annonces ne sont qu'une seule annonce.

Lues ensemble, les versions décrivent la même réorganisation sous deux angles. L’Agents API déplace la boucle, le bac à sable et la gestion du contexte dans un produit hébergé. GPT-Live-1 déplace la surface conversationnelle dans une interface légère qui délègue sa réflexion ailleurs. Dans les deux cas, le modèle cesse d’être l’élément autour duquel on construit pour devenir un composant que l’on sélectionne — et dans les deux cas, la sélection est une ligne de configuration plutôt qu’un engagement architectural.

C'est exactement la jointure dans laquelle s'insère une couche de routage. OrcaRouter ne prend pas en charge gpt-live-1 : le point de terminaison Live Sessions est propre à Ope​nAI, et nous n'en acheminons rien. La moitié déléguée est une autre histoire. Le backend auquel la couche vocale confie le travail parle l'API Responses, et il s'agit d'un appel de modèle normal — le modèle que l'exemple d'Ope​nAI lui-même nomme, GPT-5.6 Terra, est disponible via OrcaRouter au prix catalogue d'Ope​nAI de 2,00 $ par million de jetons d'entrée et de 12,00 $ par million de jetons de sortie, avec le point de terminaison Responses exposé. La délégation côté client va plus loin : elle permet à votre application de fournir le backend directement, ce qui signifie que le modèle derrière la voix peut être n'importe quel point de terminaison que vous contrôlez. Il en va de même pour l'emplacement de modèle de l'API Agents : le harnais est celui d'Ope​nAI, mais le modèle qu'il contient est un choix qui vous appartient, et environ 190 modèles issus de onze fournisseurs en amont se trouvent derrière une seule clé au prix catalogue du fournisseur, sans marge ajoutée.

Concrètement, trois choses en découlent. Les backends peuvent être testés en A/B sur du trafic réel en modifiant une seule ligne, ce qui permet de savoir si un raisonneur bon marché est suffisamment performant avant de lui affecter une ligne téléphonique. Le basculement peut se situer sous le modèle de délégation, de sorte qu’un après-midi difficile en amont n’entraîne pas la conversation dans sa chute. Et une tâche peut être exécutée sur plusieurs backends en un seul appel via le DSL de routage, ou traitée par un panel de modèles à la fois grâce à la fusion de modèles — utile dès l’instant où la sortie d’un agent doit être digne de confiance plutôt que simplement générée.

Ce qui ne figure dans aucune des deux versions

• Pas d'entrée d'image ou de vidéo sur GPT-Live-1 — la surface vocale multimodale que les anciens modes ChatGPT possèdent reste encore non traitée.

• Pas de sorties structurées sur la couche vocale, donc les arguments d'outil validés par schéma doivent être imposés dans le modèle backend.

• Aucun accès à GPT-Live-1 dans l’offre gratuite, et les limites de débit sont exprimées en sessions simultanées — 25 pour le Tier 1, et jusqu’à 500 au Tier 5.

• Pas de Zero Data Retention ni de résidence des données en dehors des États-Unis dans la bêta de l'Agents API.

• Aucune reproduction indépendante de quelque chiffre de benchmark de GPT-Live-1.

Le pari qu’Ope​nAI a fait le 10 septembre, c’est que les développeurs veulent acheter le harnais et choisir le cerveau séparément. La première moitié de ce pari est désormais une ligne budgétaire. La seconde moitié est l’endroit où se fera sentir la pression concurrentielle des douze prochains mois — car un harnais hébergé avec un emplacement de modèle interchangeable ne vaut que par les modèles que l’on peut y mettre, et aujourd’hui, c’est la seule partie de la pile qu’Ope​nAI ne contrôle pas seul.

La partie délégation, c'est une autre histoire — le backend auquel la couche vocale confie le travail est un appel de modèle classique, et GPT-5.6 Terra est disponible via OrcaRouter au prix catalogue d'Ope​nAI, avec l'endpoint Responses exposé.