Cartão de título para o artigo do Índice de Fala para Fala GPT-Live-1 mostrando as três principais pontuações: GPT-Live-1 com GPT-6 Astra em esforço médio com 81.5, Grok Voice Think Fast 2.0 High com 81.3, e GPT-Live-1 com GPT-5.6 Sol em esforço baixo com 80.1
Guides & Insights

GPT-Live-1 lidera o Speech to Speech Index com 81,5 — mas a classificação pertence ao seu backend

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

GPT-Live-1, o modelo de voz full-duplex que foi lançado pela primeira vez dentro do ChatGPT em 8 de julho de 2026, agora está em primeiro lugar no Artificial Analysis Speech to Speech Index, com 81,5 — uma linha que só existe porque o modelo foi apontado ao GPT-6 Astra para fazer o seu raciocínio. Execute o mesmo front end de voz com o GPT-5.6 Sol como backend delegado em esforço de raciocínio baixo e ele obtém 80,1, o que é o terceiro lugar. O segundo lugar, com 81,3, pertence ao Grok Voice Think Fast 2.0 High.

Duas verdades antes dos números. O modelo não é novo: o GPT-Live-1 chegou à API de desenvolvedores em 10 de setembro de 2026, após dois meses como voz padrão do ChatGPT. O que é novo, medido em 15 de setembro, é que um avaliador externo o pontuou — a única coisa que faltava em todos os textos sobre esse modelo até agora, inclusive nos nossos, em que os únicos números disponíveis eram os que a OpenAI publicou sobre si mesma. E a margem de 0,2 ponto sobre o segundo lugar é menor que a diferença de 1,4 ponto entre as duas configurações do próprio GPT-Live-1, que é o número mais útil do quadro.

Então, a manchete “GPT-Live-1 é o melhor modelo de voz” não é bem o que o índice diz. Ele diz que GPT-Live-1 com GPT-6 Astra em esforço médio fica à frente, por um quinto de ponto, e que a escolha do backend influencia o resultado mais do que qualquer modelo concorrente.

O que o índice realmente mede

Artificial Analysis constrói o Speech to Speech Index como um compósito de pesos iguais de quatro partes: Raciocínio de Fala, medido pelo Big Bench Audio; Desempenho Agêntico, medido pelo τ-Voice; Preferência na Arena, um Elo de preferência humana em pares; e Taxa de Sucesso em Tarefas. Apenas modelos com todos os quatro componentes disponíveis recebem um valor de índice — todo o resto mostra um traço, e é por isso que a tabela tem muito mais linhas do que pontuações. O índice em si foi lançado em 23 de junho de 2026 e foi revisado duas vezes desde então, mais recentemente para substituir Dinâmica Conversacional por Sucesso em Tarefas, de modo que uma pontuação de uma revisão não é estritamente comparável com uma pontuação de outra.

Dois detalhes adicionais de metodologia importam quando você lê o ranking. O Arena Elo fica congelado no valor que tinha quando um modelo se tornou publicável pela primeira vez, de modo que o componente de preferência recompensa chegar cedo em vez de ser o melhor hoje. E o índice avalia um sistema inteiro, e não um único modelo: para o GPT-Live-1, o número abrange o front end de voz mais qualquer modelo de backend para o qual ele encaminhe trabalho. Essa é uma escolha de design deliberada, e é a razão pela qual o mesmo modelo aparece duas vezes com pontuações diferentes.

O topo do campo, conforme publicado:

• GPT-Live-1 (Astra, médio) — índice 81,5, primeiro

• Grok Voice Think Fast 2.0 High — índice 81,3, segundo

• GPT-Live-1 (Sol, low) — índice 80.1, terceiro

• GPT-Realtime-2.1 High — índice 73,9, quarto

• GPT-Realtime-2 High — índice 73,6, quinto

• Grok Voice Think Fast 1.0 — índice 72,3, sexto

• Gemini 3.1 Flash Live High — índice 71,5, sétimo

Artificial Analysis Speech to Speech leaderboard showing GPT-Live-1 with Astra at medium effort first at 81.5, Grok Voice Think Fast 2.0 High second at 81.3, and GPT-Live-1 with Sol at low effort third at 80.1, with the rest of the field from GPT-Realtime-2.1 High at 73.9 down to GPT-Realtime-2.1 Mini Minimal at 52.8

Para se ter uma ideia da escala, o modelo que o GPT-Live-1 substitui fica 7,6 pontos abaixo dele. Essa é uma diferença geracional real, e não está em disputa.

A vitória de 0,2 ponto vem de exatamente um componente.

Separe o composto e os dois líderes deixam de parecer o mesmo tipo de modelo. Nos componentes, segundo a Artificial Analysis:

• Desempenho agêntico (τ-Voice) — GPT-Live-1 67,9% vs Grok Voice Think Fast 2.0 High 56,5%

• Raciocínio de fala (Big Bench Audio) — 90% vs 97%

• Taxa de sucesso de tarefas — 87,4% vs 94,6%

• Arena Elo — 1048 vs 1011

• Tempo até o primeiro áudio — 1,34s vs 0,70s

• Custo por hora, backend incluído — $5,83 vs $4,80

Comparison scoreboard for GPT-Live-1 with Astra at medium effort against Grok Voice Think Fast 2.0 High, contrasting their Speech to Speech Index scores of 81.5 and 81.3, agentic performance of 67.9% and 56.5%, speech reasoning of 90% and 97%, task success of 87.4% and 94.6%, time to first audio of 1.34 and 0.70 seconds, and cost per hour of $5.83 and $4.80

GPT-Live-1 vence duas das seis linhas e perde quatro, mas ainda assim assume o topo do índice. A aritmética não é mistério: a diferença no τ-Voice é de 11,4 pontos, muito maior do que qualquer outra separação na tabela, e, sob ponderação igual, arrasta o compósito para além da linha. Em termos simples, o GPT-Live-1 é o melhor agente e o Grok Voice Think Fast 2.0 High é o melhor ouvinte e o mais rápido — e o índice acaba por atribuir justamente àquilo em que o GPT-Live-1 é bom um peso suficientemente elevado para o colocar em primeiro lugar.

Se o seu produto é um agente de voz que agenda, resolve ou realiza transações, a vantagem de 11,4 pontos no τ-Voice é o número que prediz a sua experiência. Se o seu produto é uma conversa que precisa parecer instantânea e nunca falar por cima do usuário, o tempo de 0,70 segundo até o primeiro áudio é o número que prediz a sua experiência, e o Grok vence nesse quesito por aproximadamente um fator de dois. Na execução de tarefas regulamentadas, há um segundo alerta: a taxa de sucesso de tarefas do Grok, de 94,6%, é a mais alta da tabela visível, e os 87,4% do GPT-Live-1 significam que aproximadamente uma tarefa em cada oito não é concluída. Ambos são melhorias em relação à geração anterior. Nenhum dos dois é um problema resolvido.

A linha #1 é uma configuração de roteamento, não um modelo

Aqui está a parte que merece mais atenção do que a posição na classificação. O GPT-Live-1 é uma camada de voz full-duplex que trata ela própria da escuta, da fala, da interrupção e da alternância de turnos, e delega o raciocínio, as chamadas de ferramentas e a pesquisa a um modelo de backend separado enquanto a conversa continua. A Artificial Analysis avaliou duas dessas combinações como entradas separadas. O Astra em esforço médio produziu 81,5. O Sol em esforço baixo produziu 80,1.

Essa diferença de 1,4 pontos é o que conta. A diferença entre o primeiro e o segundo lugar é de 0,2 pontos. A diferença entre as duas configurações pontuadas do GPT-Live-1 é sete vezes maior. Nada no modelo de voz mudou entre essas linhas — apenas qual modelo estava fazendo o raciocínio, e em que nível de esforço. Um ranking que classifica sistemas está dizendo, com precisão, que a configuração é o produto.

Ele também revisa nossa própria forma de reportar. Em 11 de setembro de 2026, registramos o GPT-Live-1 com 69,8% neste índice, atrás tanto do GPT-Realtime-2.1 quanto do Grok. Essa era a leitura disponível na época, e sustentava uma conclusão razoável — a de que a OpenAI havia construído a melhor mecânica conversacional, e não o melhor agente de voz. O índice agora traz duas configurações delegadas do GPT-Live-1, com 81,5 e 80,1. A Artificial Analysis não publica um registro de alterações, e revisou os componentes do índice em agosto, então não podemos afirmar com certeza se o número anterior era uma configuração não pontuada ou parcialmente pontuada, ou uma execução sob a ponderação anterior; o que é observável é que os emparelhamentos delegados agora aparecem como suas próprias linhas completas, e que a resposta mudou quando isso aconteceu.

A consequência prática é que "qual modelo de voz" é a pergunta errada e "qual modelo de voz mais qual backend, com qual esforço" é a certa. Essa é uma questão de roteamento, e é exatamente a que nosso próprio produto existe para responder. O OrcaRouter expõe o backend de delegação do GPT-Live-1, o GPT-6 Astra, por meio do mesmo endpoint compatível com OpenAI que mais de 200 outros modelos, de modo que trocar a camada de raciocínio é uma mudança de ID de modelo, e não uma integração. A DSL de roteamento compõe vários modelos em uma única chamada, e o failover automático significa que um pareamento não comprovado não é uma aposta de produção — se o backend degradar, a solicitação chega a outro lugar em vez de falhar. Para ser preciso sobre o que não fazemos: o próprio GPT-Live-1 não está em nosso catálogo e não o servimos. O backend ao qual ele delega é outra questão.

Quanto custa uma hora disto

O front end do GPT-Live-1 é cobrado a US$ 0,05 por minuto de voz, cobrado por segundo, o que dá US$ 3,00 por uma hora de linha aberta. Essa não é a conta inteira: raciocínio delegado, chamadas de ferramentas e busca na web são medidos separadamente pelo que o modelo de backend cobrar. A Artificial Analysis mediu o valor total, e é por isso que a coluna de custos dela é a que deve ser usada:

• GPT-Live-1 (Sol, baixo) — $4,47 por hora

• Grok Voice Think Fast 2.0 High — US$ 4,80 por hora

• GPT-Live-1 (Astra, medium) — $5,83 por hora

• GPT-Realtime-2.1 High — $10,75 por hora

O vencedor do ranking é o mais caro das três opções atuais, e a configuração que venceu custa 30% mais por hora do que a configuração que ficou em terceiro lugar. Lendo pelo outro lado, a divisão é reveladora: US$ 3,00 de cada hora são a camada de voz, e o restante — US$ 1,47 no Sol, US$ 2,83 no Astra — são tokens de backend. A camada de raciocínio representa algo entre um terço e metade da sua conta, o que é uma parcela grande para um componente que o ranking trata como uma nota de rodapé.

OrcaRouter model page for GPT-6 Astra showing the model id openai/gpt-6-astra, a 1M-token context window, 128K max output, a p50 time to first token of 6.75 seconds, and pricing of $10.00 per million input tokens and $50.00 per million output tokens

Em comparação com o modelo que ele substitui, porém, toda a família custa aproximadamente metade do preço — o front-end de US$ 0,05 por minuto é uma redução genuína, não um reempacotamento. Como os tokens de backend são cobrados a tarifas de backend, o custo de uma implantação do GPT-Live-1 é, em grande parte, função de para qual modelo de raciocínio você roteia, e os backends podem ser modelos da própria OpenAI ou de terceiros. No OrcaRouter, esses backends são repassados pelo preço de tabela do provedor, com 0% de markup, de modo que uma alteração de preço do fornecedor na camada de raciocínio entra em vigor no mesmo dia, em vez de no próximo ciclo de cobrança.

O que o índice não resolve

Três ressalvas, declaradas pela fonte em vez de inferidas. Tanto as entradas do GPT-Live-1 quanto o Grok Voice Think Fast 2.0 High estão sinalizados como baseados em um único teste, o que é pouco robusto para uma decisão de 0,2 ponto — uma nova execução poderia reordenar primeiro e segundo sem que nada mudasse em qualquer um dos modelos. O Arena Elo, como observado, foi congelado na primeira medição publicável de cada modelo. E o índice não tem nenhuma entrada sobre como esses sistemas se comportam em uma ligação longa: os componentes são de horizonte curto por construção, enquanto o modo de falha que realmente mata agentes de voz em produção é a deriva ao longo de uma conversa de vinte minutos.

Separadamente, e do fornecedor em vez do índice: a API do GPT-Live-1 foi lançada sem entrada de imagem ou vídeo, sem saídas estruturadas e sem nível gratuito, e os limites de taxa dela são contados em sessões simultâneas, e não em solicitações por minuto. Essas são restrições do dia do lançamento que podem já ter mudado; verifique-as antes de projetar com base nelas.

O que fazer com isto

Se você está escolhendo uma arquitetura esta semana em vez de um modelo, o índice recompensa o padrão delegado no trabalho agêntico e o padrão em cascata na latência. O GPT-Live-1 com 81,5 é a evidência mais forte até agora de que separar conversa de raciocínio é o formato certo para agentes de voz que concluem tarefas. O Grok Voice Think Fast 2.0 High com 81,3, com 0,70 segundo até o primeiro áudio e uma taxa de sucesso em tarefas de 94,6%, é a evidência mais forte de que o formato delegado não é o único que funciona — e de que ainda não é o mais rápido.

A decisão que decorre dos números é mais barata do que parece. Ambas as configurações do GPT-Live-1, e o modelo que o superou em quatro dos seis componentes, estão a menos de US$ 1,36 por hora de diferença entre si. Com essa diferença, a atitude certa é parar de ler rankings e testar suas próprias transcrições nos dois. O índice mostra o formato do trade-off; ele não consegue dizer de que lado dele seus usuários estão.

Perguntas que o número suscita

O GPT-Live-1 é o melhor modelo de voz agora?

No composto, sim — por 0,2 pontos e com um único teste por trás. Nos componentes, depende inteiramente do que você está construindo: lidera em desempenho agêntico e preferência na arena, e fica atrás em raciocínio de fala, taxa de sucesso em tarefas e tempo até o primeiro áudio. Uma liderança de 0,2 pontos no composto, apoiada em uma vantagem de 11,4 pontos em um único componente, é um primeiro lugar defensável, não decisivo.

Você precisa usar o GPT-6 Astra para conseguir o 81.5?

Para essa linha exata, sim — o 81,5 pertence ao GPT-Live-1 configurado com Astra em esforço de raciocínio médio. O Sol com esforço baixo é uma alternativa documentada, em 80,1 e US$ 1,36 mais barata por hora, e a OpenAI oferece suporte a usar modelos de terceiros como backend, então as entradas do ranking são dois pontos numa curva, e não as únicas opções. Qual combinação é melhor para a sua carga de trabalho não é algo que um índice público possa responder por você.

Por que o mesmo modelo obteve 69,8 na nossa cobertura anterior e 81,5 agora?

Os dois valores cobrem coisas diferentes. A leitura anterior colocava o GPT-Live-1 no índice como uma única entrada; a tabela atual traz suas duas configurações delegadas como linhas separadas, com pontuação completa, com o emparelhamento Astra em 81,5 e o emparelhamento Sol em 80,1. A Artificial Analysis revisou os componentes do índice em agosto e não publica um registro de alterações, portanto, trate o delta como uma mudança naquilo que foi medido, e não como evidência de que o modelo melhorou — e trate qualquer pontuação composta única para um modelo que delega como uma declaração sobre uma configuração.