Um card de título hero com o texto 'GPT-Live-1 chega à API', com o subtítulo '$0,05 por minuto para voz full-duplex' e a linha 'O modelo é de 8 de julho de 2026; a API do desenvolvedor foi lançada em 10 de setembro de 2026', ao lado de duas formas de onda de áudio sobrepostas com setas curvando-se em ambas as direções, com o logotipo da OrcaRouter composto no canto.
Guides & Insights

GPT-Live-1 chega à API: voz full-duplex a US$ 0,05 por minuto, sem caminho de substituição direta a partir do GPT-Realtime-2.1

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O GPT-Live-1 está na API desde 10 de setembro, e o número que realmente reformulará os orçamentos não é um benchmark — é a unidade de cobrança. O modelo de voz full-duplex da OpenAIOpe​nAI agora é cobrado a uma taxa fixa de US$ 0,05 por minuto de voz, cobrado por segundo, enquanto o modelo com o qual ele está sendo comparado, GPT-Realtime-2.1, era medido em tokens de áudio a US$ 32 por milhão na entrada e US$ 64 por milhão na saída. O modelo em si não é novo: o GPT-Live-1 foi lançado dentro do ChatGPT em 8 de julho de 2026, como substituto do Advanced Voice Mode. O que é novo é que os desenvolvedores finalmente podem chamá-lo — e que chamá-lo se parece quase nada com a integração Realtime que a maioria das equipes já tem. A própria documentação da OpenAIOpe​nAI combina a camada de voz com um backend de raciocínio separado, e no exemplo de WebRTC publicado esse backend é o GPT-5.6 Terra.

O que foi lançado em 10 de setembro, e o que não foi

A superfície da API é estreita por conceção. Existe exatamente um ID de modelo, gpt-live-1, que é também o seu próprio snapshot predefinido — sem variantes datadas para fixar. Existe exatamente um endpoint, o endpoint Live Sessions em v1/live/sessions. Tudo o resto na plataforma da OpenAIOpe​nAI está desativado para este modelo: sem Chat Completions, sem Responses, sem Realtime (incluindo as variantes de tradução e transcrição), sem Assistants, sem Batch, sem fine-tuning, sem embeddings, sem geração de imagens ou vídeo, sem endpoints de fala ou transcrição de áudio, sem moderação.

Entradas e saídas são áudio e texto. Streaming e chamada de funções são compatíveis; saídas estruturadas, ajuste fino e saídas previstas não são. A entrada de imagem e vídeo não tem suporte explícito — portanto, a superfície "voz com vídeo" que a OpenAIOpeAI vem insinuando não faz parte deste lançamento. O nível gratuito não consegue chamá-la de forma alguma, e os limites de taxa são medidos em sessões simultâneas, e não em solicitações por minuto: 25 no Nível 1, subindo para 50, 200, 300 e 500 nos Níveis 2 a 5.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Esse enquadramento de concorrência é a primeira pista de que este não é um substituto plug-in. Limites de taxa expressos em conversas simultâneas ao vivo mostram o que a OpenAIOpe​nAI espera que seja a unidade de escala: uma linha telefônica, não uma requisição.

A mudança de preços é a história mais silenciosa e mais significativa.

A cobrança fixa por minuto é uma mudança genuína. Com a medição por tokens, você precisava modelar o consumo de áudio — quantos tokens custa um segundo de silêncio, como um interlocutor que fala por cima do agente altera o comprimento da saída — antes de conseguir prever uma única chamada. A $0,05 por minuto, a aritmética se reduz a uma multiplicação:

• Uma chamada de suporte de 5 minutos — US$ 0,25 de tempo de voz

• Uma chamada de 10 minutos — $0,50

• Uma média de 4 minutos em 1.000 chamadas por dia — US$ 200 por dia, cerca de US$ 6.000 por mês

• Uma hora de linha aberta contínua — $3,00

Três detalhes aguçam isso. Primeiro, a duração não é arredondada para cima, para o próximo minuto inteiro, então uma chamada de 40 segundos custa cerca de 3,3 centavos em vez de cinco centavos completos. Segundo, a inicialização da sessão cobra 15 segundos de duração de voz antecipadamente — mas isso é creditado contra cobranças de duração posteriores, não somado por cima, então uma chamada mais curta que 15 segundos ainda fica no preço de 15 segundos. Terceiro, a voz é apenas metade da conta. O modelo de raciocínio de backend, suas chamadas de ferramentas e qualquer pesquisa na web são cobrados separadamente pelas tarifas normais desse modelo, o que significa que um "modelo de voz barato" ainda pode produzir uma chamada cara se você direcionar a delegação para um raciocinador de fronteira e deixá-lo pesquisar a cada turno.

Essa estrutura de dois metros é onde o roteamento deixa de ser um mero capricho. No OrcaRouter, a metade de backend de uma sessão GPT-Live-1 é apenas mais uma chamada de modelo — cerca de 190 modelos de onze provedores upstream por trás de uma única chave, pelo preço de lista do provedor repassado sem nenhuma margem, e com failover automático caso o backend escolhido dê erro ou expire. Você não pode rotear a própria camada de voz; o endpoint Live Sessions é exclusivo da OpenAIOpenAI. Você pode, sem dúvida, rotear tudo o que a camada de voz delega, que é justamente a metade que escala conforme a intensidade com que seus interlocutores pensam.

Apenas WebRTC — por que seu código do Realtime não será portado

Este é o custo prático da migração, e a maior parte da cobertura de lançamento ignora isso. As sessões do GPT-Live-1 usam WebRTC, não o transporte WebSocket sobre o qual muitas integrações Realtime existentes são construídas. Testar o caminho mais antigo com um ID de modelo GPT-Live retorna um erro que diz, sem rodeios, que as sessões exigem WebRTC.

O handshake, conforme o guia WebRTC da OpenAIOpe​nAI: seu navegador abre uma RTCPeerConnection, anexa faixas de microfone, abre um canal de dados e registra listeners antes de enviar a oferta, define a descrição local, aguarda a coleta de ICE e envia a oferta para o seu próprio servidor. Seu servidor então chama POST /v1/live/sessions com a configuração da sessão mais transport: { type: "webrtc", sdp: ... }. Um sucesso retorna HTTP 201 contendo session.id e transport.sdp, que o navegador aplica como descrição remota. A mídia trafega pelas faixas negociadas; o canal de dados — rótulo oai-events — carrega transcrições, atualizações de sessão e trabalho delegado. Para encerrar, você envia session.close e continua lendo até que session.closed chegue.

Duas pegadinhas que vale a pena colar no monitor. A chamada HTTP em si inicia a sessão, então você também não deve enviar session.start no canal de dados. E você não deve acrescentar áudio de entrada nem aguardar deltas de áudio de saída nesse canal — deixe audio.format fora da configuração e deixe o SDP cuidar disso. Os exemplos do servidor limitam o corpo da requisição a 64 KB, aplicam timeout à coleta de ICE após 10 segundos e à finalização da sessão após 15.

Nada disso é difícil. Tudo isso é código novo. Se seu produto é um agente de tempo real baseado em turnos, migrar para o GPT-Live-1 é uma reescrita de transporte mais uma reescrita de delegação, não uma troca de ID de modelo — vale a pena orçar como uma sprint, e não como uma tarde.

Os benchmarks, e quem executou cada um deles

Todos os números abaixo são do próprio OpenAIOpe​nAI, publicados com o lançamento da API e não reproduzidos de forma independente por ninguém no momento em que escrevo. Essa ressalva importa mais do que o habitual aqui, porque os deltas são grandes o suficiente para convidar a serem citados como fato consolidado.

A two-column comparison scoreboard titled 'GPT-Live-1 vs GPT-Realtime-2.1 — the scoreboard'. The GPT-Live-1 column lists price $0.05 per minute, billing unit per second, interactivity 80.1%, turn-taking latency 0.8 s, tool-calling accuracy 87%, and endpoint 'Live Sessions only'. The GPT-Realtime-2.1 column lists price $32 / $64 per 1M audio tokens, billing unit per audio token, interactivity 45.4%, turn-taking latency 1.4 s, tool-calling accuracy 60%, and endpoint 'Realtime + WebSocket'. A footer reads 'GPT-Live-1 figures are OpenAI's own, unreproduced; Realtime-2.1 pricing per OpenAI API docs.'

• Interatividade full-duplex — GPT-Live-1 80,1% vs 45,4% para o GPT-Realtime-2.1

• Latência de troca de turno — 0,8s vs 1,4s

• Precisão de chamadas de ferramentas — 87% vs 60%

• Benchmark de suporte por voz no setor bancário, taxa de aprovação — 32% vs 12,4%

Leia a última linha duas vezes. Uma taxa de aprovação de 32% é uma grande melhoria em relação a 12,4% e ainda significa que o sistema falhou em aproximadamente dois terços das tarefas dessa avaliação. Os saltos de interatividade e de chamada de ferramentas são os que descrevem um produto genuinamente diferente; o número do setor bancário é o honesto sobre o quão longe os agentes de voz ainda estão de lidar com um fluxo de trabalho regulamentado sem supervisão.

As evidências de clientes são mais escassas do que a tabela de benchmark e apontam na mesma direção. O Yelp está usando o GPT-Live-1 para reservas por telefone, com o CTO Alex Levy citado sobre a melhoria no atendimento das chamadas. A plataforma de aprendizado de idiomas Speak relatou quase 80% menos interrupções do que seu sistema anterior baseado em turnos — um número autorrelatado por uma empresa com interesse no resultado e, ainda assim, o número de implantação mais concreto disponível.

A camada de voz é um front end; você escolhe o cérebro

A aposta arquitetural é a delegação, e é a parte deste lançamento na qual uma camada de roteamento se encaixa naturalmente. O GPT-Live-1 não faz o raciocínio profundo. Quando um chamador pergunta algo que exige raciocínio, recuperação ou uma ferramenta, o modelo entrega a tarefa, através de uma fronteira assíncrona, a um backend separado que continua trabalhando enquanto a conversa falada prossegue, e então reintegra a resposta quando ela estiver pronta.

A configuração é explícita, e vale a pena ler o exemplo da documentação atentamente. Ao lado de model: "gpt-live-1" e das instruções, a sessão carrega um delegation que é do tipo responses, cujo bloco interno responses nomeia o modelo de backend, suas próprias instruções, suas ferramentas — o exemplo usa web_search — e um tool_choice. No exemplo WebRTC publicado da OpenAIOpe​nAI, esse modelo de backend é GPT-5.6 Terra.

A screenshot of the OrcaRouter model page for GPT-5.6 Terra, showing the model ID openai/gpt-5.6-terra, OpenAI as the provider with a 2026-07-09 release date, a 1M-token context window with 128K max output, pricing of $2.00 per 1M input tokens and $12.00 per 1M output tokens, a p50 TTFT of 2.38 s, and the exposed endpoints /v1/chat/completions and /v1/responses.

Essa é a verdadeira proposta do design: troque o backend e a experiência de voz fica mais inteligente sem retreinar o modelo de fala. Também significa que o backend de delegação é portátil de um modo que a camada de voz não é. O OrcaRouter não oferece o gpt-live-1 — o endpoint Live Sessions é exclusivo da OpenAI, e não roteamos nada dele. Mas a metade de delegação fala a Responses API, e essa metade é inteiramente sua para escolher. O GPT-5.6 Terra está disponível no OrcaRouter pelo preço de tabela da OpenAIOpe​nAI — $2.00 por milhão de tokens de entrada e $12.00 por milhão de saída, com o endpoint Responses exposto — então o modelo exato do próprio exemplo da OpenAIOpe​nAI está a uma chamada de distância, sem um segundo contrato ou SDK.

Na prática, isso transforma a escolha de backend em configuração. Você pode fazer A/B de um raciocinador barato contra um de ponta em tráfego de chamadas ao vivo editando uma linha e acompanhando a conta por chamada, ou manter o modelo de delegação atrás de failover automático para que uma tarde ruim no upstream não derrube sua linha telefônica junto. A camada de voz pela qual você paga US$ 0,05 por minuto permanece onde está; tudo o que ela delega passa por uma única chave entre cerca de 190 modelos de onze provedores upstream, pelo preço de tabela do provedor, sem nenhum markup.

O que ainda falta

• Nenhuma entrada de imagem ou vídeo — imagens estáticas e compartilhamento de tela não fazem parte desta versão, de modo que a superfície de voz multimodal que os modos mais antigos do ChatGPT ainda mantêm continua sem solução

• Sem saídas estruturadas — se o seu agente precisa de argumentos de ferramenta validados por esquema, essa validação tem de ficar no seu modelo de backend, não na camada de voz

• Sem acesso ao nível gratuito e sem ajuste fino — custo e personalização só começam nos níveis pagos

• Nenhuma avaliação independente de qualquer número principal — todos os valores acima são apurados pelo fornecedor

• Um limite de simultaneidade de 25 sessões em simultâneo no Tier 1 — generoso para um piloto, apertado para um call centre no primeiro dia

Quem deve se mover e quem deve esperar

Mude agora se você está construindo telefonia — linhas de reservas, agendamento de consultas, suporte de primeiro nível — e sua stack atual é a clássica cascata ASR-para-LLM-para-TTS. A latência e o tratamento de interrupções são exatamente o que esse pipeline perde, o preço por minuto é previsível o bastante para colocar numa planilha, e a própria documentação da OpenAI​OpeAI agora inclui um exemplo de servidor no formato do Twilio para copiar. Mude agora também se você já está em um modelo Realtime e seu produto é genuinamente conversacional em vez de baseado em turnos, porque o tratamento de interrupções é justamente o ponto em que o GPT-Realtime-2.1 era pior.

Espere se a sua integração for baseada em turnos e estiver funcionando. A reescrita do transporte é trabalho de verdade, o endpoint não oferece suporte a mais nada, e não há caminho de migração que preserve seu código WebSocket existente. Espere também se o seu caso de uso depender de saídas estruturadas de ferramentas ou de entrada de vídeo, ambos ausentes aqui.

O que observar nas próximas semanas: a primeira reprodução independente do número de interatividade de 80,1%, se a tarifa de US$ 0,05 é introdutória, se um GPT-Live-1 mini menor chega à API como chegou no lado do consumidor, e se a entrada de imagem e tela fecha a lacuna. Até que um laboratório externo execute essa avaliação, o resumo honesto é que este é o modelo de voz mais capaz que alguém já lançou para desenvolvedores, com o recibo dessa alegação escrito pelas pessoas que o estão vendendo.