Tarjeta de título destacada para el artículo 'Día de la Plataforma de Septiembre de OpenAI', subtitulada 'GPT-Live-1 llega a la API, la Agents API abre en beta', con una insignia que dice 'Ambos anuncios fechados el 10 de septiembre de 2026' y tres tarjetas que dicen 'GPT-Live-1 en la API: $0.05 por minuto de voz, endpoint de Live Sessions, un ID de modelo', 'Agents API: beta pública, arnés de Codex, sandboxes alojados o trae los tuyos' y 'Por qué importa: el modelo se convierte en un componente que eliges, el arnés se convierte en un producto que alquilas', sobre una franja de pie de página que dice 'Cifras de voz reportadas por OpenAI y no reproducidas; el precio de Agents API se repercute tal cual.' El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

OpenAI's Día de la Plataforma de septiembre: GPT-Live-1 llega a la API mientras la Agents API se abre en beta

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Dos cosas salieron de la plataforma de Ope​nAI el 10 de septiembre de 2026, y la que pasó más desapercibida tiene el mayor radio de impacto. GPT-Live-1 —el modelo de voz dúplex completo que se ha ejecutado dentro de ChatGPT desde el 8 de julio— ahora es invocable por los desarrolladores a $0.05 por minuto de voz. Junto a él, y mencionada mucho menos en la cobertura, la Agents API entró en beta pública: el mismo entorno de ejecución que corre Codex, expuesto como un producto alojado con sandboxes gestionados. Una es una mejor voz. La otra es Ope​nAI vendiendo lo que solía ser la parte difícil de construir un agente.

Ambos se leyeron de las fuentes primarias para este artículo: el anuncio de la API de Agents de Ope​nAI, su publicación en la comunidad de desarrolladores que presenta GPT-Live-1 en la API, y la documentación para desarrolladores de ambos. Cuando una cifra proviene de Ope​nAI en lugar de un evaluador externo, se etiqueta como tal a continuación — y una cifra sí proviene de fuera, lo que cambia un poco la historia.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

Artificial Analysis comenzó a publicar este año un índice Speech to Speech, y GPT-Live-1 tiene una fila en él: 69,8%, un promedio ponderado de razonamiento de voz, rendimiento agéntico, preferencia en arena y éxito en tareas. Eso lo sitúa en séptimo lugar de los once modelos evaluados —por detrás de GPT-Realtime-2.1, con 73,9%, que es el modelo al que reemplaza, y por detrás de Grok Voice Think Fast 2.0, con 79,0%. La tabla de puntuaciones independiente y la propia tabla de referencia de OpenAI no cuentan la misma historia, y ambas son ciertas.

Lo que se lanzó, en el orden en que cambiará tu arquitectura

• Voz — GPT-Live-1 ya está disponible en la API como gpt-live-1, facturado a $0.05 por minuto de voz, cobrado por segundo, y el modelo de razonamiento backend se factura por separado según sus propias tarifas.

• Agentes — la API de Agentes está en beta pública. OpenAI dice que no hay una tarifa adicional por la API en sí; pagas por los tokens del modelo, las herramientas y el tiempo de contenedor del sandbox alojado.

• Sandboxes — OpenAI ahora aloja el entorno de ejecución, reutilizando la misma infraestructura de sandboxing que Codex y ChatGPT, configurable con archivos, paquetes, habilidades y complementos.

• Entornos — además del propio sandbox de OpenAI, los equipos pueden dirigir agentes a su propia infraestructura o a proveedores externos de sandbox en la lista de socios beta.

El lanzamiento de voz es una historia de modelo. La Agents API es una historia de plataforma, y las historias de plataforma son las que reorientan silenciosamente una base de código.

La API de Agents: un agente en un solo POST

La llamada principal es POST /v1/agents/sessions, enviada con una cabecera Ope​nAI-Beta: agents=v1, y la propuesta es que la tarea, el modelo, las herramientas y el entorno bastan para obtener de vuelta un agente en funcionamiento. Los SDK cubren Python, TypeScript/JavaScript, Go, Java y Ruby.

Lo que lo convierte en algo más que un wrapper es que Ope​nAI opera el harness en lugar de distribuirlo. El harness de AgentKit es de código abierto y se puede inspeccionar, pero la copia en ejecución es de Ope​nAI: compactación de contexto en sesiones largas, búsqueda de herramientas, llamada programática a herramientas, compatibilidad con MCP, funciones personalizadas, búsqueda web integrada y orquestación de subagentes con concurrencia configurable. Las capacidades versionadas del harness llegan junto con los lanzamientos de modelos, que es el compromiso interesante: el andamiaje avanza al mismo ritmo que los modelos.

Para cualquiera que haya pasado un trimestre manteniendo un bucle —lógica de reintentos, recorte de contexto, enrutamiento de herramientas, la distribución en abanico de subagentes que siempre tiene fugas de estado—, ese es el producto real. No la llamada al modelo. La fontanería que lo rodea y que ya no escribes.

Los sandboxes alojados son la parte que trae factura

Los agentes que ejecutan código necesitan un lugar donde hacerlo, y la beta incluye la propia respuesta de OpenAI: un sandbox gestionado que ejecuta código, trabaja con archivos y produce artefactos, y que se puede configurar con paquetes, habilidades y complementos. Los desarrolladores que ya cuentan con un entorno de ejecución reforzado no se ven obligados a usarlo: tanto la opción de traer tu propia infraestructura como un conjunto de socios de sandbox con nombre propio están disponibles en la beta.

Merece la pena registrar dos advertencias operativas antes de construir sobre esto. La residencia de datos en la beta es exclusiva de EE. UU. y Zero Data Retention no es compatible. Para una carga de trabajo regulada, esas dos líneas deciden si esto es un piloto o una vía de producción, y son los detalles que tienden a descubrirse tarde.

GPT-Live-1 en la API: la facturación plana por minuto es el verdadero cambio

El modelo de voz en sí no es nuevo —reemplazó a Advanced Voice Mode dentro de ChatGPT el 8 de julio—, pero su forma comercial sí lo es. En la línea Realtime, el audio se medía en tokens, lo que significaba que pronosticar una llamada requería modelar el consumo de audio: cuántos tokens cuesta un segundo de silencio, cómo cambia la longitud de salida cuando quien llama habla por encima del agente. Una tarifa plana de $0.05 por minuto de voz reduce eso a una multiplicación. Una hora de línea abierta continua cuesta $3.00. Un promedio de cuatro minutos en mil llamadas al día es aproximadamente $200 al día.

Las sesiones se ejecutan desde un endpoint de Live Sessions con un único ID de modelo y sin snapshots fechados que fijar. La documentación cubre WebRTC, WebSockets y telefonía/SIP como rutas de conexión, y el quickstart publicado construye la de WebRTC. La facturación tiene dos medidores, y solo uno de ellos es la voz: cada llamada de razonamiento delegada, invocación de herramienta y búsqueda web se factura a las tarifas normales del modelo de backend.

La arquitectura es delegación. GPT-Live-1 maneja la conversación — decidiendo muchas veces por segundo si seguir escuchando, pausar, interrumpir o delegar el trabajo — y pasa cualquier cosa que necesite razonamiento real a través de una frontera asíncrona a un backend separado, que sigue funcionando mientras la conversación hablada continúa. Los documentos definen dos modos: delegación de Responses, donde Ope​nAI llama a un modelo de Responses compatible por ti y proporciona contexto de conversación, y delegación de cliente, donde tu propia aplicación proporciona el backend y mantiene el control de la ejecución, el contexto y qué resultados llegan a la capa de voz. En el ejemplo publicado de Responses, ese backend es GPT-5.6 Terra, nombrado en un objeto de delegación junto con sus propias instrucciones y herramientas. En el lanzamiento para consumidores de julio, era GPT-5.5; los artículos de la comunidad desde entonces han apuntado a GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Todas las cifras destacadas de la capa de voz son de la propia OpenAI y, en el momento de escribir esto, nadie las ha reproducido de forma independiente: 80,1 % en interactividad de Full Duplex Bench v1.5 frente a 45,4 % de GPT-Realtime-2.1, una latencia de cambio de turno de 0,798 segundos frente a 1,41 segundos, 87 % de éxito en llamadas a herramientas y una tasa de aprobación del 32 % en una evaluación de soporte de voz bancario frente al 12,4 % del modelo al que reemplaza. Ese último par es el sincero —una gran mejora, y aun así un sistema que falla en aproximadamente dos tercios de un flujo de trabajo regulado. Existen pruebas de clientes terceros, pero son escasas y con intereses propios: Yelp para reservas telefónicas, EliseAI y la plataforma de aprendizaje Speak, que informan de casi un 80 % menos de interrupciones que con su anterior pila basada en turnos.

El resultado independiente es menos halagador, y vale la pena ponerlo junto a la lista anterior en lugar de debajo de ella. En el Artificial Analysis Speech to Speech Index —una puntuación compuesta sobre razonamiento de voz, rendimiento agéntico, preferencia en arena y éxito en tareas—, GPT-Live-1 se sitúa en 69,8%, por debajo del 73,9% de GPT-Realtime-2.1 y muy por debajo del 79,0% de Gr​ok Voice Think Fast 2.0. Si se leen ambos en conjunto, la forma del producto se vuelve clara: Ope​nAI construyó las mejores mecánicas conversacionales disponibles y no construyó el mejor agente de voz, porque el razonamiento se delega a un modelo que el índice puntúa por separado.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

Los dos anuncios son un solo anuncio

Leídos en conjunto, los lanzamientos describen la misma reorganización desde dos direcciones. La API de Agents traslada el bucle, el sandbox y la gestión de contexto a un producto alojado. GPT-Live-1 traslada la superficie conversacional a un front end ligero que delega su pensamiento en otro lugar. En ambos, el modelo deja de ser aquello en torno a lo cual se construye y pasa a ser un componente que se selecciona; y en ambos, la selección es una línea de configuración en lugar de un compromiso arquitectónico.

Esa es exactamente la costura en la que encaja una capa de enrutamiento. OrcaRouter no transporta gpt-live-1: el endpoint de Live Sessions es exclusivo de Ope​nAI, y no enrutamos nada de él. La mitad de la delegación es otra historia. El backend al que la capa de voz le entrega el trabajo habla la Responses API, y esa es una llamada de modelo normal — el modelo que nombra el propio ejemplo de Ope​nAI, GPT-5.6 Terra, está disponible a través de OrcaRouter al precio de lista de Ope​nAI de $2.00 por millón de tokens de entrada y $12.00 por millón de salida, con el endpoint de Responses expuesto. La delegación de cliente va más allá: permite que tu aplicación proporcione el backend directamente, lo que significa que el modelo detrás de la voz puede ser cualquier endpoint que controles. Lo mismo ocurre con el espacio de modelo de la Agents API: el harness es de Ope​nAI, pero el modelo que contiene es una elección que tú conservas, y aproximadamente 190 modelos de once proveedores upstream están detrás de una sola clave al precio de lista del proveedor sin ningún margen añadido por encima.

En concreto, de eso se derivan tres cosas. Se pueden someter los backends a pruebas A/B con tráfico en vivo editando una sola línea, que es como se averigua si un razonador barato es suficientemente bueno antes de asignarle una línea telefónica. La conmutación por error puede residir bajo el modelo de delegación, de modo que una mala tarde del upstream no se lleve consigo la conversación. Y se puede ejecutar una tarea contra varios backends en una sola llamada mediante el DSL de enrutamiento, o recibir respuesta de un panel de modelos a la vez con fusión de modelos: algo útil en cuanto haya que confiar en la salida de un agente en lugar de simplemente generarla.

¿Qué no está en ninguna de las dos versiones?

• Sin entrada de imagen ni video en GPT-Live-1 — la superficie de voz multimodal que ofrecen los modos anteriores de ChatGPT sigue sin abordarse.

• Sin salidas estructuradas en la capa de voz, por lo que los argumentos de herramientas validados por esquema deben aplicarse en el modelo de backend.

• Sin acceso de nivel gratuito a GPT-Live-1, y los límites de velocidad se expresan en sesiones concurrentes: 25 en el Nivel 1, y aumentan a 500 en el Nivel 5.

• Sin Zero Data Retention y sin residencia de datos fuera de EE. UU. en la beta de Agents API.

• No reproducción independiente de ninguna cifra de referencia de GPT-Live-1.

La apuesta que OpenAI hizo el 10 de septiembre es que los desarrolladores quieren comprar el entorno de ejecución y elegir el cerebro por separado. La primera mitad de eso ya es una partida propia. La segunda mitad es donde se hará sentir la presión competitiva de los próximos doce meses — porque un entorno de ejecución alojado con una ranura de modelo intercambiable solo es tan bueno como los modelos que puedas poner en él, y ahora mismo esa es la única parte del stack que OpenAI no controla por sí sola.

La parte de la delegación es otra historia: el backend al que la capa de voz le entrega el trabajo es una llamada normal a un modelo, y GPT-5.6 Terraestá disponible a través de OrcaRouter al precio de lista de Ope​nAI con el endpoint Responses expuesto.