
Dia da Plataforma de setembro da OpenAI: GPT-Live-1 chega à API enquanto a Agents API entra em beta
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Duas coisas saíram da plataforma da OpenAI em 10 de setembro de 2026, e a mais discreta tem o maior raio de impacto. O GPT-Live-1 — o modelo de voz full-duplex que roda dentro do ChatGPT desde 8 de julho — agora pode ser chamado por desenvolvedores a US$ 0,05 por minuto de voz. Ao lado dele, e mencionada muito menos na cobertura, a Agents API entrou em beta público: o mesmo harness que executa o Codex, exposto como um produto hospedado com sandboxes gerenciados. Uma é uma voz melhor. A outra é a OpenAI vendendo aquilo que costumava ser a parte difícil de construir um agente.
Ambos foram extraídos das fontes primárias desta matéria: o anúncio da Agents API da OpenAI, sua publicação na comunidade de desenvolvedores que introduz o GPT-Live-1 na API, e a documentação para desenvolvedores de ambos. Quando um número vem da OpenAI em vez de um avaliador externo, ele é identificado como tal abaixo — e um número vem de fora, o que muda um pouco a história.

A Artificial Analysis começou a publicar este ano um Índice de Fala para Fala, e o GPT-Live-1 tem uma linha nele: 69,8%, uma média ponderada de raciocínio de fala, desempenho agêntico, preferência na arena e sucesso em tarefas. Isso o coloca em sétimo lugar entre os onze modelos avaliados — atrás do GPT-Realtime-2.1, com 73,9%, que é o modelo que ele substitui, e atrás do Grok Voice Think Fast 2.0, com 79,0%. O placar independente e a própria tabela de benchmarks da OpenAI não contam a mesma história, e ambas são verdadeiras.
O que foi lançado, na ordem em que vai mudar sua arquitetura
• Voz — GPT-Live-1 já está disponível na API como gpt-live-1, cobrado a US$ 0,05 por minuto de voz, com cobrança por segundo, e o modelo de raciocínio de back-end é cobrado separadamente, com suas próprias tarifas.
• Agentes — a API Agents está em beta público. A OpenAI diz que não há taxa adicional pela própria API; você paga pelos tokens do modelo, pelas ferramentas e pelo tempo de contêiner de sandbox hospedado.
• Sandboxes — A OpenAI agora hospeda o ambiente de execução, reutilizando a mesma infraestrutura de sandboxing do Codex e do ChatGPT, configurável com arquivos, pacotes, habilidades e plugins.
• Ambientes — além do sandbox da própria OpenAI, as equipes podem direcionar agentes para sua própria infraestrutura ou para fornecedores terceirizados de sandbox na lista de parceiros beta.
O lançamento de voz é uma história de modelo. A API Agents é uma história de plataforma, e histórias de plataforma são as que reapontam silenciosamente uma base de código.
A Agents API: um agente em um único POST
A chamada principal é POST /v1/agents/sessions, enviada com um OpenAI-Beta: agents=v1 cabeçalho, e a proposta é que tarefa, modelo, ferramentas e ambiente bastam para obter de volta um agente em execução. Os SDKs abrangem Python, TypeScript/JavaScript, Go, Java e Ruby.
O que o torna mais do que um wrapper é que a OpenAI opera o harness em vez de distribuí-lo. O harness do AgentKit é de código aberto e inspecionável, mas a cópia em execução é da OpenAI — compactação de contexto ao longo de sessões longas, busca de ferramentas, chamada programática de ferramentas, suporte a MCP, funções personalizadas, busca na web integrada e orquestração de subagentes com concorrência configurável. Capacidades versionadas do harness chegam junto com os lançamentos de modelos, o que é o compromisso interessante: a estrutura de suporte avança na mesma cadência que os modelos.
Para quem já passou um trimestre mantendo um loop — lógica de retentativa, corte de contexto, roteamento de ferramentas, o fan-out de subagentes que sempre vaza estado — esse é o produto de verdade. Não a chamada ao modelo. O encanamento em volta disso que você não escreve mais.
Os sandboxes hospedados são a parte que vem com uma fatura.
Agentes que executam código precisam de um lugar para executá-lo, e o beta traz a resposta da própria OpenAI: um sandbox gerenciado que executa código, trabalha com arquivos e produz artefatos, configurável com pacotes, habilidades e plugins. Desenvolvedores que já possuem um ambiente de execução fortificado não são forçados a adotá-lo — tanto a opção de trazer a própria infraestrutura quanto um conjunto de parceiros de sandbox nomeados estão no beta.
Vale a pena registrar duas ressalvas operacionais antes de construir em cima disso. A residência de dados na beta é exclusiva dos EUA, e o Zero Data Retention não é suportado. Para uma carga de trabalho regulamentada, essas duas linhas decidem se isto é um piloto ou um caminho de produção, e são os detalhes que costumam ser descobertos tarde.
GPT-Live-1 na API: a cobrança fixa por minuto é a verdadeira mudança
O modelo de voz em si não é novo — ele substituiu o Advanced Voice Mode dentro do ChatGPT em 8 de julho —, mas o formato comercial sim. Na linha Realtime, o áudio era medido em tokens, o que significava que prever uma chamada exigia modelar o consumo de áudio: quantos tokens custa um segundo de silêncio, como um chamador falando por cima do agente altera o comprimento da saída. Uma tarifa fixa de US$ 0,05 por minuto de voz reduz isso a uma multiplicação. Uma hora de linha aberta contínua custa US$ 3,00. Uma média de quatro minutos em mil chamadas por dia é aproximadamente US$ 200 por dia.
As sessões são executadas a partir de um endpoint Live Sessions com um único ID de modelo e sem snapshots datados para fixar. A documentação aborda WebRTC, WebSockets e telefonia/SIP como caminhos de conexão, e o quickstart publicado monta o de WebRTC. O faturamento tem dois medidores, e apenas um deles é a voz: cada chamada de raciocínio delegada, invocação de ferramenta e pesquisa na web é cobrada pelas tarifas normais do modelo de backend.
A arquitetura é a delegação. O GPT-Live-1 conduz a conversa — decidindo várias vezes por segundo se deve continuar ouvindo, pausar, interromper ou repassar o trabalho — e transfere tudo o que exige raciocínio de verdade, através de uma fronteira assíncrona, para um backend separado, que continua trabalhando enquanto a conversa falada prossegue. A documentação define dois modos: a delegação por Responses, em que a OpenAI chama um modelo Responses compatível para você e fornece o contexto da conversa, e a delegação pelo cliente, em que seu próprio aplicativo fornece o backend e mantém o controle da execução, do contexto e de quais resultados chegam à camada de voz. No exemplo publicado de Responses, esse backend é o GPT-5.6 Terra, nomeado em um delegação objeto, junto com suas próprias instruções e ferramentas. No lançamento para consumidores em julho, era o GPT-5.5; textos da comunidade desde então vêm apontando para o GPT-6 Astra.

Todo número de destaque da camada de voz é da própria OpenAI e, no momento em que escrevo, não foi reproduzido de forma independente por ninguém: 80,1% de interatividade no Full Duplex Bench v1.5 contra 45,4% do GPT-Realtime-2.1, latência de troca de turno de 0,798 segundo contra 1,41 segundo, 87% de sucesso em chamadas de ferramentas e uma taxa de aprovação de 32% em uma avaliação de suporte de voz bancário contra 12,4% do modelo que ele substitui. Esse último par é o honesto — uma grande melhoria e, ainda assim, um sistema que falha em cerca de dois terços de um fluxo de trabalho regulamentado. Há evidências de clientes terceiros, mas são escassas e de interesse próprio: Yelp para reservas por telefone, EliseAI e a plataforma de aprendizado Speak relatando quase 80% menos interrupções do que sua pilha anterior baseada em turnos.
O resultado independente é menos lisonjeiro, e vale a pena colocá-lo ao lado da lista acima, em vez de abaixo dela. No Artificial Analysis Speech to Speech Index — uma pontuação composta que abrange raciocínio de fala, desempenho agêntico, preferência de arena e sucesso em tarefas — o GPT-Live-1 está em 69,8%, abaixo dos 73,9% do GPT-Realtime-2.1 e bem abaixo dos 79,0% do Grok Voice Think Fast 2.0. Leia os dois em conjunto e a forma do produto fica clara: a OpenAI construiu a melhor mecânica conversacional disponível e não construiu o melhor agente de voz, porque o raciocínio é delegado a um modelo que o índice avalia separadamente.

Os dois anúncios são um único anúncio
Lidos em conjunto, os lançamentos descrevem a mesma reorganização a partir de duas direções. A Agents API move o loop, o sandbox e a gestão de contexto para um produto alojado. O GPT-Live-1 move a superfície conversacional para um front end fino que delega o seu pensamento noutro lugar. Em ambos, o modelo deixa de ser aquilo à volta do qual se constrói e passa a ser um componente que se seleciona — e, em ambos, a seleção é uma linha de configuração e não um compromisso arquitetural.
É exatamente nessa emenda que uma camada de roteamento se encaixa. O OrcaRouter não transporta gpt-live-1: o endpoint Live Sessions é exclusivo da OpenAI, e não roteamos nada disso. A metade da delegação é outra história. O backend para o qual a camada de voz entrega trabalho fala a Responses API, e isso é uma chamada de modelo normal — o modelo que o próprio exemplo da OpenAI nomeia, GPT-5.6 Terra, está disponível pelo OrcaRouter ao preço de tabela da OpenAI de US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de saída, com o endpoint Responses exposto. A delegação do cliente vai além: permite que sua aplicação forneça o backend diretamente, o que significa que o modelo por trás da voz pode ser qualquer endpoint que você controla. O mesmo vale para o slot de modelo da Agents API: o harness é da OpenAI, mas o modelo dentro dele é uma escolha que você mantém, e cerca de 190 modelos de onze provedores upstream ficam atrás de uma única chave ao preço de tabela do provedor sem nenhuma margem em cima.
Concretamente, três coisas decorrem disso. Os backends podem ser testados em A/B com tráfego real editando uma única linha, que é como se descobre se um raciocinador barato é suficientemente bom antes de lhe dedicar uma linha telefónica. O failover pode ficar por baixo do modelo de delegação, para que uma tarde má a montante não derrube a conversa com ele. E uma tarefa pode ser executada contra vários backends numa só chamada através da DSL de encaminhamento, ou respondida por um painel de modelos em simultâneo com fusão de modelos — útil no momento em que a saída de um agente tem de ser fidedigna e não apenas gerada.
O que não está em nenhum dos dois lançamentos?
• Sem entrada de imagem ou vídeo no GPT-Live-1 — a superfície de voz multimodal que os modos mais antigos do ChatGPT possuem ainda não foi abordada.
• Não há saídas estruturadas na camada de voz, portanto argumentos de ferramentas validados por esquema precisam ser impostos no modelo de backend.
• Sem acesso ao GPT-Live-1 no nível gratuito, e os limites de taxa são expressos em sessões simultâneas — 25 no Nível 1, chegando a 500 no Nível 5.
• Sem Zero Data Retention e sem residência de dados fora dos EUA na versão beta da API de Agentes.
• Nenhuma reprodução independente de qualquer valor de benchmark do GPT-Live-1.
A aposta que a OpenAI fez em 10 de setembro é que os desenvolvedores querem comprar o harness e escolher o cérebro separadamente. A primeira metade disso agora é um item de linha. A segunda metade é onde a pressão competitiva dos próximos doze meses vai recair — porque um harness hospedado com um slot de modelo trocável só é tão bom quanto os modelos que você pode colocar nele, e neste momento essa é a única parte da stack que a OpenAI não controla sozinha.
A parte da delegação é outra história — o backend ao qual a camada de voz entrega o trabalho é uma chamada de modelo normal, e GPT-5.6 Terra está disponível por meio do OrcaRouter pelo preço de tabela da OpenAI com o endpoint Responses exposto.
