
GPT-Live-1 chega à API: voz full-duplex a US$ 0,05 por minuto, sem caminho de substituição direta a partir do GPT-Realtime-2.1
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O GPT-Live-1 está na API desde 10 de setembro, e o número que realmente reformulará os orçamentos não é um benchmark — é a unidade de cobrança. O modelo de voz full-duplex da OpenAIOpenAI agora é cobrado a uma taxa fixa de US$ 0,05 por minuto de voz, cobrado por segundo, enquanto o modelo com o qual ele está sendo comparado, GPT-Realtime-2.1, era medido em tokens de áudio a US$ 32 por milhão na entrada e US$ 64 por milhão na saída. O modelo em si não é novo: o GPT-Live-1 foi lançado dentro do ChatGPT em 8 de julho de 2026, como substituto do Advanced Voice Mode. O que é novo é que os desenvolvedores finalmente podem chamá-lo — e que chamá-lo se parece quase nada com a integração Realtime que a maioria das equipes já tem. A própria documentação da OpenAIOpenAI combina a camada de voz com um backend de raciocínio separado, e no exemplo de WebRTC publicado esse backend é o GPT-5.6 Terra.
O que foi lançado em 10 de setembro, e o que não foi
A superfície da API é estreita por conceção. Existe exatamente um ID de modelo, gpt-live-1, que é também o seu próprio snapshot predefinido — sem variantes datadas para fixar. Existe exatamente um endpoint, o endpoint Live Sessions em v1/live/sessions. Tudo o resto na plataforma da OpenAIOpenAI está desativado para este modelo: sem Chat Completions, sem Responses, sem Realtime (incluindo as variantes de tradução e transcrição), sem Assistants, sem Batch, sem fine-tuning, sem embeddings, sem geração de imagens ou vídeo, sem endpoints de fala ou transcrição de áudio, sem moderação.
Entradas e saídas são áudio e texto. Streaming e chamada de funções são compatíveis; saídas estruturadas, ajuste fino e saídas previstas não são. A entrada de imagem e vídeo não tem suporte explícito — portanto, a superfície "voz com vídeo" que a OpenAIOpeAI vem insinuando não faz parte deste lançamento. O nível gratuito não consegue chamá-la de forma alguma, e os limites de taxa são medidos em sessões simultâneas, e não em solicitações por minuto: 25 no Nível 1, subindo para 50, 200, 300 e 500 nos Níveis 2 a 5.

Esse enquadramento de concorrência é a primeira pista de que este não é um substituto plug-in. Limites de taxa expressos em conversas simultâneas ao vivo mostram o que a OpenAIOpenAI espera que seja a unidade de escala: uma linha telefônica, não uma requisição.
A mudança de preços é a história mais silenciosa e mais significativa.
A cobrança fixa por minuto é uma mudança genuína. Com a medição por tokens, você precisava modelar o consumo de áudio — quantos tokens custa um segundo de silêncio, como um interlocutor que fala por cima do agente altera o comprimento da saída — antes de conseguir prever uma única chamada. A $0,05 por minuto, a aritmética se reduz a uma multiplicação:
• Uma chamada de suporte de 5 minutos — US$ 0,25 de tempo de voz
• Uma chamada de 10 minutos — $0,50
• Uma média de 4 minutos em 1.000 chamadas por dia — US$ 200 por dia, cerca de US$ 6.000 por mês
• Uma hora de linha aberta contínua — $3,00
Três detalhes aguçam isso. Primeiro, a duração não é arredondada para cima, para o próximo minuto inteiro, então uma chamada de 40 segundos custa cerca de 3,3 centavos em vez de cinco centavos completos. Segundo, a inicialização da sessão cobra 15 segundos de duração de voz antecipadamente — mas isso é creditado contra cobranças de duração posteriores, não somado por cima, então uma chamada mais curta que 15 segundos ainda fica no preço de 15 segundos. Terceiro, a voz é apenas metade da conta. O modelo de raciocínio de backend, suas chamadas de ferramentas e qualquer pesquisa na web são cobrados separadamente pelas tarifas normais desse modelo, o que significa que um "modelo de voz barato" ainda pode produzir uma chamada cara se você direcionar a delegação para um raciocinador de fronteira e deixá-lo pesquisar a cada turno.
Essa estrutura de dois metros é onde o roteamento deixa de ser um mero capricho. No OrcaRouter, a metade de backend de uma sessão GPT-Live-1 é apenas mais uma chamada de modelo — cerca de 190 modelos de onze provedores upstream por trás de uma única chave, pelo preço de lista do provedor repassado sem nenhuma margem, e com failover automático caso o backend escolhido dê erro ou expire. Você não pode rotear a própria camada de voz; o endpoint Live Sessions é exclusivo da OpenAIOpenAI. Você pode, sem dúvida, rotear tudo o que a camada de voz delega, que é justamente a metade que escala conforme a intensidade com que seus interlocutores pensam.
Apenas WebRTC — por que seu código do Realtime não será portado
Este é o custo prático da migração, e a maior parte da cobertura de lançamento ignora isso. As sessões do GPT-Live-1 usam WebRTC, não o transporte WebSocket sobre o qual muitas integrações Realtime existentes são construídas. Testar o caminho mais antigo com um ID de modelo GPT-Live retorna um erro que diz, sem rodeios, que as sessões exigem WebRTC.
O handshake, conforme o guia WebRTC da OpenAIOpenAI: seu navegador abre uma RTCPeerConnection, anexa faixas de microfone, abre um canal de dados e registra listeners antes de enviar a oferta, define a descrição local, aguarda a coleta de ICE e envia a oferta para o seu próprio servidor. Seu servidor então chama POST /v1/live/sessions com a configuração da sessão mais transport: { type: "webrtc", sdp: ... }. Um sucesso retorna HTTP 201 contendo session.id e transport.sdp, que o navegador aplica como descrição remota. A mídia trafega pelas faixas negociadas; o canal de dados — rótulo oai-events — carrega transcrições, atualizações de sessão e trabalho delegado. Para encerrar, você envia session.close e continua lendo até que session.closed chegue.
Duas pegadinhas que vale a pena colar no monitor. A chamada HTTP em si inicia a sessão, então você também não deve enviar session.start no canal de dados. E você não deve acrescentar áudio de entrada nem aguardar deltas de áudio de saída nesse canal — deixe audio.format fora da configuração e deixe o SDP cuidar disso. Os exemplos do servidor limitam o corpo da requisição a 64 KB, aplicam timeout à coleta de ICE após 10 segundos e à finalização da sessão após 15.
Nada disso é difícil. Tudo isso é código novo. Se seu produto é um agente de tempo real baseado em turnos, migrar para o GPT-Live-1 é uma reescrita de transporte mais uma reescrita de delegação, não uma troca de ID de modelo — vale a pena orçar como uma sprint, e não como uma tarde.
Os benchmarks, e quem executou cada um deles
Todos os números abaixo são do próprio OpenAIOpenAI, publicados com o lançamento da API e não reproduzidos de forma independente por ninguém no momento em que escrevo. Essa ressalva importa mais do que o habitual aqui, porque os deltas são grandes o suficiente para convidar a serem citados como fato consolidado.

• Interatividade full-duplex — GPT-Live-1 80,1% vs 45,4% para o GPT-Realtime-2.1
• Latência de troca de turno — 0,8s vs 1,4s
• Precisão de chamadas de ferramentas — 87% vs 60%
• Benchmark de suporte por voz no setor bancário, taxa de aprovação — 32% vs 12,4%
Leia a última linha duas vezes. Uma taxa de aprovação de 32% é uma grande melhoria em relação a 12,4% e ainda significa que o sistema falhou em aproximadamente dois terços das tarefas dessa avaliação. Os saltos de interatividade e de chamada de ferramentas são os que descrevem um produto genuinamente diferente; o número do setor bancário é o honesto sobre o quão longe os agentes de voz ainda estão de lidar com um fluxo de trabalho regulamentado sem supervisão.
As evidências de clientes são mais escassas do que a tabela de benchmark e apontam na mesma direção. O Yelp está usando o GPT-Live-1 para reservas por telefone, com o CTO Alex Levy citado sobre a melhoria no atendimento das chamadas. A plataforma de aprendizado de idiomas Speak relatou quase 80% menos interrupções do que seu sistema anterior baseado em turnos — um número autorrelatado por uma empresa com interesse no resultado e, ainda assim, o número de implantação mais concreto disponível.
A camada de voz é um front end; você escolhe o cérebro
A aposta arquitetural é a delegação, e é a parte deste lançamento na qual uma camada de roteamento se encaixa naturalmente. O GPT-Live-1 não faz o raciocínio profundo. Quando um chamador pergunta algo que exige raciocínio, recuperação ou uma ferramenta, o modelo entrega a tarefa, através de uma fronteira assíncrona, a um backend separado que continua trabalhando enquanto a conversa falada prossegue, e então reintegra a resposta quando ela estiver pronta.
A configuração é explícita, e vale a pena ler o exemplo da documentação atentamente. Ao lado de model: "gpt-live-1" e das instruções, a sessão carrega um delegation que é do tipo responses, cujo bloco interno responses nomeia o modelo de backend, suas próprias instruções, suas ferramentas — o exemplo usa web_search — e um tool_choice. No exemplo WebRTC publicado da OpenAIOpenAI, esse modelo de backend é GPT-5.6 Terra.

Essa é a verdadeira proposta do design: troque o backend e a experiência de voz fica mais inteligente sem retreinar o modelo de fala. Também significa que o backend de delegação é portátil de um modo que a camada de voz não é. O OrcaRouter não oferece o gpt-live-1 — o endpoint Live Sessions é exclusivo da OpenAI, e não roteamos nada dele. Mas a metade de delegação fala a Responses API, e essa metade é inteiramente sua para escolher. O GPT-5.6 Terra está disponível no OrcaRouter pelo preço de tabela da OpenAIOpenAI — $2.00 por milhão de tokens de entrada e $12.00 por milhão de saída, com o endpoint Responses exposto — então o modelo exato do próprio exemplo da OpenAIOpenAI está a uma chamada de distância, sem um segundo contrato ou SDK.
Na prática, isso transforma a escolha de backend em configuração. Você pode fazer A/B de um raciocinador barato contra um de ponta em tráfego de chamadas ao vivo editando uma linha e acompanhando a conta por chamada, ou manter o modelo de delegação atrás de failover automático para que uma tarde ruim no upstream não derrube sua linha telefônica junto. A camada de voz pela qual você paga US$ 0,05 por minuto permanece onde está; tudo o que ela delega passa por uma única chave entre cerca de 190 modelos de onze provedores upstream, pelo preço de tabela do provedor, sem nenhum markup.
O que ainda falta
• Nenhuma entrada de imagem ou vídeo — imagens estáticas e compartilhamento de tela não fazem parte desta versão, de modo que a superfície de voz multimodal que os modos mais antigos do ChatGPT ainda mantêm continua sem solução
• Sem saídas estruturadas — se o seu agente precisa de argumentos de ferramenta validados por esquema, essa validação tem de ficar no seu modelo de backend, não na camada de voz
• Sem acesso ao nível gratuito e sem ajuste fino — custo e personalização só começam nos níveis pagos
• Nenhuma avaliação independente de qualquer número principal — todos os valores acima são apurados pelo fornecedor
• Um limite de simultaneidade de 25 sessões em simultâneo no Tier 1 — generoso para um piloto, apertado para um call centre no primeiro dia
Quem deve se mover e quem deve esperar
Mude agora se você está construindo telefonia — linhas de reservas, agendamento de consultas, suporte de primeiro nível — e sua stack atual é a clássica cascata ASR-para-LLM-para-TTS. A latência e o tratamento de interrupções são exatamente o que esse pipeline perde, o preço por minuto é previsível o bastante para colocar numa planilha, e a própria documentação da OpenAIOpeAI agora inclui um exemplo de servidor no formato do Twilio para copiar. Mude agora também se você já está em um modelo Realtime e seu produto é genuinamente conversacional em vez de baseado em turnos, porque o tratamento de interrupções é justamente o ponto em que o GPT-Realtime-2.1 era pior.
Espere se a sua integração for baseada em turnos e estiver funcionando. A reescrita do transporte é trabalho de verdade, o endpoint não oferece suporte a mais nada, e não há caminho de migração que preserve seu código WebSocket existente. Espere também se o seu caso de uso depender de saídas estruturadas de ferramentas ou de entrada de vídeo, ambos ausentes aqui.
O que observar nas próximas semanas: a primeira reprodução independente do número de interatividade de 80,1%, se a tarifa de US$ 0,05 é introdutória, se um GPT-Live-1 mini menor chega à API como chegou no lado do consumidor, e se a entrada de imagem e tela fecha a lacuna. Até que um laboratório externo execute essa avaliação, o resumo honesto é que este é o modelo de voz mais capaz que alguém já lançou para desenvolvedores, com o recibo dessa alegação escrito pelas pessoas que o estão vendendo.
