Cartão de título principal do artigo "Dia da Plataforma de Setembro da OpenAI", com o subtítulo "GPT-Live-1 chega à API, a Agents API abre em beta", exibindo um selo com os dizeres "Ambos os anúncios datados de 10 de setembro de 2026" e três cartões com os dizeres "GPT-Live-1 na API: US$ 0,05 por minuto de voz, endpoint Live Sessions, um ID de modelo", "Agents API: beta pública, harness do Codex, sandboxes hospedados ou traga o seu" e "Por que isso importa: o modelo se torna um componente que você escolhe, o harness se torna um produto que você aluga", acima de uma faixa de rodapé com os dizeres "Números de voz reportados pela OpenAI e não reproduzidos; o preço da Agents API é repasse." O logotipo da OrcaRouter está composto no canto inferior direito.
Guides & Insights

Dia da Plataforma de setembro da OpenAI: GPT-Live-1 chega à API enquanto a Agents API entra em beta

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Duas coisas saíram da plataforma da OpenAI em 10 de setembro de 2026, e a mais discreta tem o maior raio de impacto. O GPT-Live-1 — o modelo de voz full-duplex que roda dentro do ChatGPT desde 8 de julho — agora pode ser chamado por desenvolvedores a US$ 0,05 por minuto de voz. Ao lado dele, e mencionada muito menos na cobertura, a Agents API entrou em beta público: o mesmo harness que executa o Codex, exposto como um produto hospedado com sandboxes gerenciados. Uma é uma voz melhor. A outra é a OpenAI vendendo aquilo que costumava ser a parte difícil de construir um agente.

Ambos foram extraídos das fontes primárias desta matéria: o anúncio da Agents API da Ope​nAI, sua publicação na comunidade de desenvolvedores que introduz o GPT-Live-1 na API, e a documentação para desenvolvedores de ambos. Quando um número vem da Ope​nAI em vez de um avaliador externo, ele é identificado como tal abaixo — e um número vem de fora, o que muda um pouco a história.

A two-column scoreboard titled 'September 10, 2026 — what Ope​nAI shipped'. The left column, labelled GPT-Live-1 in the API, reads 'What it is: full-duplex voice model', 'Access: Live Sessions API, one model ID', 'Price: $0.05 per voice minute', 'Status: generally available since Sept 10, 2026', 'Independent score: 69.8% on the Artificial Analysis Speech to Speech Index', 'Catch: delegates its thinking to a backend model'. The right column, labelled Agents API, reads 'What it is: hosted agent runtime', 'Access: public beta, Codex harness', 'Price: no API fee; sandbox time is billed', 'Status: public beta since Sept 10, 2026', 'Evidence: Ope​nAI documentation only, no independent evaluation', 'Catch: US-only data residency, no Zero Data Retention'. The footer reads 'GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced; the AA index figure is independently run.' The OrcaRouter logo is composited in the bottom-right corner.

A Artificial Analysis começou a publicar este ano um Índice de Fala para Fala, e o GPT-Live-1 tem uma linha nele: 69,8%, uma média ponderada de raciocínio de fala, desempenho agêntico, preferência na arena e sucesso em tarefas. Isso o coloca em sétimo lugar entre os onze modelos avaliados — atrás do GPT-Realtime-2.1, com 73,9%, que é o modelo que ele substitui, e atrás do Gr​ok Voice Think Fast 2.0, com 79,0%. O placar independente e a própria tabela de benchmarks da Ope​nAI não contam a mesma história, e ambas são verdadeiras.

O que foi lançado, na ordem em que vai mudar sua arquitetura

• Voz — GPT-Live-1 já está disponível na API como gpt-live-1, cobrado a US$ 0,05 por minuto de voz, com cobrança por segundo, e o modelo de raciocínio de back-end é cobrado separadamente, com suas próprias tarifas.

• Agentes — a API Agents está em beta público. A OpenAI diz que não há taxa adicional pela própria API; você paga pelos tokens do modelo, pelas ferramentas e pelo tempo de contêiner de sandbox hospedado.

• Sandboxes — A OpenAI agora hospeda o ambiente de execução, reutilizando a mesma infraestrutura de sandboxing do Codex e do ChatGPT, configurável com arquivos, pacotes, habilidades e plugins.

• Ambientes — além do sandbox da própria Ope​nAI, as equipes podem direcionar agentes para sua própria infraestrutura ou para fornecedores terceirizados de sandbox na lista de parceiros beta.

O lançamento de voz é uma história de modelo. A API Agents é uma história de plataforma, e histórias de plataforma são as que reapontam silenciosamente uma base de código.

A Agents API: um agente em um único POST

A chamada principal é POST /v1/agents/sessions, enviada com um Ope​nAI-Beta: agents=v1 cabeçalho, e a proposta é que tarefa, modelo, ferramentas e ambiente bastam para obter de volta um agente em execução. Os SDKs abrangem Python, TypeScript/JavaScript, Go, Java e Ruby.

O que o torna mais do que um wrapper é que a Ope​nAI opera o harness em vez de distribuí-lo. O harness do AgentKit é de código aberto e inspecionável, mas a cópia em execução é da Ope​nAI — compactação de contexto ao longo de sessões longas, busca de ferramentas, chamada programática de ferramentas, suporte a MCP, funções personalizadas, busca na web integrada e orquestração de subagentes com concorrência configurável. Capacidades versionadas do harness chegam junto com os lançamentos de modelos, o que é o compromisso interessante: a estrutura de suporte avança na mesma cadência que os modelos.

Para quem já passou um trimestre mantendo um loop — lógica de retentativa, corte de contexto, roteamento de ferramentas, o fan-out de subagentes que sempre vaza estado — esse é o produto de verdade. Não a chamada ao modelo. O encanamento em volta disso que você não escreve mais.

Os sandboxes hospedados são a parte que vem com uma fatura.

Agentes que executam código precisam de um lugar para executá-lo, e o beta traz a resposta da própria OpenAI: um sandbox gerenciado que executa código, trabalha com arquivos e produz artefatos, configurável com pacotes, habilidades e plugins. Desenvolvedores que já possuem um ambiente de execução fortificado não são forçados a adotá-lo — tanto a opção de trazer a própria infraestrutura quanto um conjunto de parceiros de sandbox nomeados estão no beta.

Vale a pena registrar duas ressalvas operacionais antes de construir em cima disso. A residência de dados na beta é exclusiva dos EUA, e o Zero Data Retention não é suportado. Para uma carga de trabalho regulamentada, essas duas linhas decidem se isto é um piloto ou um caminho de produção, e são os detalhes que costumam ser descobertos tarde.

GPT-Live-1 na API: a cobrança fixa por minuto é a verdadeira mudança

O modelo de voz em si não é novo — ele substituiu o Advanced Voice Mode dentro do ChatGPT em 8 de julho —, mas o formato comercial sim. Na linha Realtime, o áudio era medido em tokens, o que significava que prever uma chamada exigia modelar o consumo de áudio: quantos tokens custa um segundo de silêncio, como um chamador falando por cima do agente altera o comprimento da saída. Uma tarifa fixa de US$ 0,05 por minuto de voz reduz isso a uma multiplicação. Uma hora de linha aberta contínua custa US$ 3,00. Uma média de quatro minutos em mil chamadas por dia é aproximadamente US$ 200 por dia.

As sessões são executadas a partir de um endpoint Live Sessions com um único ID de modelo e sem snapshots datados para fixar. A documentação aborda WebRTC, WebSockets e telefonia/SIP como caminhos de conexão, e o quickstart publicado monta o de WebRTC. O faturamento tem dois medidores, e apenas um deles é a voz: cada chamada de raciocínio delegada, invocação de ferramenta e pesquisa na web é cobrada pelas tarifas normais do modelo de backend.

A arquitetura é a delegação. O GPT-Live-1 conduz a conversa — decidindo várias vezes por segundo se deve continuar ouvindo, pausar, interromper ou repassar o trabalho — e transfere tudo o que exige raciocínio de verdade, através de uma fronteira assíncrona, para um backend separado, que continua trabalhando enquanto a conversa falada prossegue. A documentação define dois modos: a delegação por Responses, em que a OpenAI chama um modelo Responses compatível para você e fornece o contexto da conversa, e a delegação pelo cliente, em que seu próprio aplicativo fornece o backend e mantém o controle da execução, do contexto e de quais resultados chegam à camada de voz. No exemplo publicado de Responses, esse backend é o GPT-5.6 Terra, nomeado em um delegação objeto, junto com suas próprias instruções e ferramentas. No lançamento para consumidores em julho, era o GPT-5.5; textos da comunidade desde então vêm apontando para o GPT-6 Astra.

A screenshot of Ope​nAI's developer documentation page 'Agents' under the API section, headed 'Choose a runtime, connect tools, and manage multi-step work', showing a routing row reading 'Run an agent with the Codex harness managed by Ope​nAI — Agents API', and a comparison table with columns Agents API, Agents SDK and Responses API whose rows read 'Where the agent runs: Ope​nAI runs a managed Codex harness', 'State between tasks: saved session configuration, turns, and items' and 'Execution environment: Ope​nAI hosted sandbox, self-hosted sandbox, or no sandbox'.

Todo número de destaque da camada de voz é da própria Ope​nAI e, no momento em que escrevo, não foi reproduzido de forma independente por ninguém: 80,1% de interatividade no Full Duplex Bench v1.5 contra 45,4% do GPT-Realtime-2.1, latência de troca de turno de 0,798 segundo contra 1,41 segundo, 87% de sucesso em chamadas de ferramentas e uma taxa de aprovação de 32% em uma avaliação de suporte de voz bancário contra 12,4% do modelo que ele substitui. Esse último par é o honesto — uma grande melhoria e, ainda assim, um sistema que falha em cerca de dois terços de um fluxo de trabalho regulamentado. Há evidências de clientes terceiros, mas são escassas e de interesse próprio: Yelp para reservas por telefone, EliseAI e a plataforma de aprendizado Speak relatando quase 80% menos interrupções do que sua pilha anterior baseada em turnos.

O resultado independente é menos lisonjeiro, e vale a pena colocá-lo ao lado da lista acima, em vez de abaixo dela. No Artificial Analysis Speech to Speech Index — uma pontuação composta que abrange raciocínio de fala, desempenho agêntico, preferência de arena e sucesso em tarefas — o GPT-Live-1 está em 69,8%, abaixo dos 73,9% do GPT-Realtime-2.1 e bem abaixo dos 79,0% do Gr​ok Voice Think Fast 2.0. Leia os dois em conjunto e a forma do produto fica clara: a Ope​nAI construiu a melhor mecânica conversacional disponível e não construiu o melhor agente de voz, porque o raciocínio é delegado a um modelo que o índice avalia separadamente.

A screenshot of the Artificial Analysis Speech to Speech Index chart, updated September 2026, ranking eleven speech models by a weighted average of speech reasoning, agentic performance, arena preference and task success rate. Bars run left to right: Grok Voice Think Fast 2.0 at 79.0%, GPT-Realtime-2.1 at 73.9%, GPT-Realtime-2 at 73.6%, Grok Voice Think Fast at 72.3%, Gemini 3.1 Flash Live at 71.5%, GPT-Live-1 mini at 70.3%, GPT-Live-1 at 69.8%, Qwen-Audio-Omni at 66.8%, RealTime Omni at 64.2%, Qwen 3.x Omni at 63.9% and Gemini 2.5 Flash at 52.6%. Companion charts show time to first audio, where GPT-Live-1 sits mid-pack at 0.78 seconds, and cost per hour of input audio, where GPT-Live-1 is $4.42 against GPT-Realtime-2.1 at $10.75.

Os dois anúncios são um único anúncio

Lidos em conjunto, os lançamentos descrevem a mesma reorganização a partir de duas direções. A Agents API move o loop, o sandbox e a gestão de contexto para um produto alojado. O GPT-Live-1 move a superfície conversacional para um front end fino que delega o seu pensamento noutro lugar. Em ambos, o modelo deixa de ser aquilo à volta do qual se constrói e passa a ser um componente que se seleciona — e, em ambos, a seleção é uma linha de configuração e não um compromisso arquitetural.

É exatamente nessa emenda que uma camada de roteamento se encaixa. O OrcaRouter não transporta gpt-live-1: o endpoint Live Sessions é exclusivo da Ope​nAI, e não roteamos nada disso. A metade da delegação é outra história. O backend para o qual a camada de voz entrega trabalho fala a Responses API, e isso é uma chamada de modelo normal — o modelo que o próprio exemplo da Ope​nAI nomeia, GPT-5.6 Terra, está disponível pelo OrcaRouter ao preço de tabela da Ope​nAI de US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de saída, com o endpoint Responses exposto. A delegação do cliente vai além: permite que sua aplicação forneça o backend diretamente, o que significa que o modelo por trás da voz pode ser qualquer endpoint que você controla. O mesmo vale para o slot de modelo da Agents API: o harness é da Ope​nAI, mas o modelo dentro dele é uma escolha que você mantém, e cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave ao preço de tabela do provedor sem nenhuma margem em cima.

Concretamente, três coisas decorrem disso. Os backends podem ser testados em A/B com tráfego real editando uma única linha, que é como se descobre se um raciocinador barato é suficientemente bom antes de lhe dedicar uma linha telefónica. O failover pode ficar por baixo do modelo de delegação, para que uma tarde má a montante não derrube a conversa com ele. E uma tarefa pode ser executada contra vários backends numa só chamada através da DSL de encaminhamento, ou respondida por um painel de modelos em simultâneo com fusão de modelos — útil no momento em que a saída de um agente tem de ser fidedigna e não apenas gerada.

O que não está em nenhum dos dois lançamentos?

• Sem entrada de imagem ou vídeo no GPT-Live-1 — a superfície de voz multimodal que os modos mais antigos do ChatGPT possuem ainda não foi abordada.

• Não há saídas estruturadas na camada de voz, portanto argumentos de ferramentas validados por esquema precisam ser impostos no modelo de backend.

• Sem acesso ao GPT-Live-1 no nível gratuito, e os limites de taxa são expressos em sessões simultâneas — 25 no Nível 1, chegando a 500 no Nível 5.

• Sem Zero Data Retention e sem residência de dados fora dos EUA na versão beta da API de Agentes.

• Nenhuma reprodução independente de qualquer valor de benchmark do GPT-Live-1.

A aposta que a OpenAI fez em 10 de setembro é que os desenvolvedores querem comprar o harness e escolher o cérebro separadamente. A primeira metade disso agora é um item de linha. A segunda metade é onde a pressão competitiva dos próximos doze meses vai recair — porque um harness hospedado com um slot de modelo trocável só é tão bom quanto os modelos que você pode colocar nele, e neste momento essa é a única parte da stack que a OpenAI não controla sozinha.

A parte da delegação é outra história — o backend ao qual a camada de voz entrega o trabalho é uma chamada de modelo normal, e GPT-5.6 Terra está disponível por meio do OrcaRouter pelo preço de tabela da OpenAI com o endpoint Responses exposto.