
GPT-Live-1 lidera o Speech to Speech Index com 81,5 — mas a classificação pertence ao seu backend
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-Live-1, o modelo de voz full-duplex que foi lançado pela primeira vez dentro do ChatGPT em 8 de julho de 2026, agora está em primeiro lugar no Artificial Analysis Speech to Speech Index, com 81,5 — uma linha que só existe porque o modelo foi apontado ao GPT-6 Astra para fazer o seu raciocínio. Execute o mesmo front end de voz com o GPT-5.6 Sol como backend delegado em esforço de raciocínio baixo e ele obtém 80,1, o que é o terceiro lugar. O segundo lugar, com 81,3, pertence ao Grok Voice Think Fast 2.0 High.
Duas verdades antes dos números. O modelo não é novo: o GPT-Live-1 chegou à API de desenvolvedores em 10 de setembro de 2026, após dois meses como voz padrão do ChatGPT. O que é novo, medido em 15 de setembro, é que um avaliador externo o pontuou — a única coisa que faltava em todos os textos sobre esse modelo até agora, inclusive nos nossos, em que os únicos números disponíveis eram os que a OpenAI publicou sobre si mesma. E a margem de 0,2 ponto sobre o segundo lugar é menor que a diferença de 1,4 ponto entre as duas configurações do próprio GPT-Live-1, que é o número mais útil do quadro.
Então, a manchete “GPT-Live-1 é o melhor modelo de voz” não é bem o que o índice diz. Ele diz que GPT-Live-1 com GPT-6 Astra em esforço médio fica à frente, por um quinto de ponto, e que a escolha do backend influencia o resultado mais do que qualquer modelo concorrente.
O que o índice realmente mede
Artificial Analysis constrói o Speech to Speech Index como um compósito de pesos iguais de quatro partes: Raciocínio de Fala, medido pelo Big Bench Audio; Desempenho Agêntico, medido pelo τ-Voice; Preferência na Arena, um Elo de preferência humana em pares; e Taxa de Sucesso em Tarefas. Apenas modelos com todos os quatro componentes disponíveis recebem um valor de índice — todo o resto mostra um traço, e é por isso que a tabela tem muito mais linhas do que pontuações. O índice em si foi lançado em 23 de junho de 2026 e foi revisado duas vezes desde então, mais recentemente para substituir Dinâmica Conversacional por Sucesso em Tarefas, de modo que uma pontuação de uma revisão não é estritamente comparável com uma pontuação de outra.
Dois detalhes adicionais de metodologia importam quando você lê o ranking. O Arena Elo fica congelado no valor que tinha quando um modelo se tornou publicável pela primeira vez, de modo que o componente de preferência recompensa chegar cedo em vez de ser o melhor hoje. E o índice avalia um sistema inteiro, e não um único modelo: para o GPT-Live-1, o número abrange o front end de voz mais qualquer modelo de backend para o qual ele encaminhe trabalho. Essa é uma escolha de design deliberada, e é a razão pela qual o mesmo modelo aparece duas vezes com pontuações diferentes.
O topo do campo, conforme publicado:
• GPT-Live-1 (Astra, médio) — índice 81,5, primeiro
• Grok Voice Think Fast 2.0 High — índice 81,3, segundo
• GPT-Live-1 (Sol, low) — índice 80.1, terceiro
• GPT-Realtime-2.1 High — índice 73,9, quarto
• GPT-Realtime-2 High — índice 73,6, quinto
• Grok Voice Think Fast 1.0 — índice 72,3, sexto
• Gemini 3.1 Flash Live High — índice 71,5, sétimo

Para se ter uma ideia da escala, o modelo que o GPT-Live-1 substitui fica 7,6 pontos abaixo dele. Essa é uma diferença geracional real, e não está em disputa.
A vitória de 0,2 ponto vem de exatamente um componente.
Separe o composto e os dois líderes deixam de parecer o mesmo tipo de modelo. Nos componentes, segundo a Artificial Analysis:
• Desempenho agêntico (τ-Voice) — GPT-Live-1 67,9% vs Grok Voice Think Fast 2.0 High 56,5%
• Raciocínio de fala (Big Bench Audio) — 90% vs 97%
• Taxa de sucesso de tarefas — 87,4% vs 94,6%
• Arena Elo — 1048 vs 1011
• Tempo até o primeiro áudio — 1,34s vs 0,70s
• Custo por hora, backend incluído — $5,83 vs $4,80

GPT-Live-1 vence duas das seis linhas e perde quatro, mas ainda assim assume o topo do índice. A aritmética não é mistério: a diferença no τ-Voice é de 11,4 pontos, muito maior do que qualquer outra separação na tabela, e, sob ponderação igual, arrasta o compósito para além da linha. Em termos simples, o GPT-Live-1 é o melhor agente e o Grok Voice Think Fast 2.0 High é o melhor ouvinte e o mais rápido — e o índice acaba por atribuir justamente àquilo em que o GPT-Live-1 é bom um peso suficientemente elevado para o colocar em primeiro lugar.
Se o seu produto é um agente de voz que agenda, resolve ou realiza transações, a vantagem de 11,4 pontos no τ-Voice é o número que prediz a sua experiência. Se o seu produto é uma conversa que precisa parecer instantânea e nunca falar por cima do usuário, o tempo de 0,70 segundo até o primeiro áudio é o número que prediz a sua experiência, e o Grok vence nesse quesito por aproximadamente um fator de dois. Na execução de tarefas regulamentadas, há um segundo alerta: a taxa de sucesso de tarefas do Grok, de 94,6%, é a mais alta da tabela visível, e os 87,4% do GPT-Live-1 significam que aproximadamente uma tarefa em cada oito não é concluída. Ambos são melhorias em relação à geração anterior. Nenhum dos dois é um problema resolvido.
A linha #1 é uma configuração de roteamento, não um modelo
Aqui está a parte que merece mais atenção do que a posição na classificação. O GPT-Live-1 é uma camada de voz full-duplex que trata ela própria da escuta, da fala, da interrupção e da alternância de turnos, e delega o raciocínio, as chamadas de ferramentas e a pesquisa a um modelo de backend separado enquanto a conversa continua. A Artificial Analysis avaliou duas dessas combinações como entradas separadas. O Astra em esforço médio produziu 81,5. O Sol em esforço baixo produziu 80,1.
Essa diferença de 1,4 pontos é o que conta. A diferença entre o primeiro e o segundo lugar é de 0,2 pontos. A diferença entre as duas configurações pontuadas do GPT-Live-1 é sete vezes maior. Nada no modelo de voz mudou entre essas linhas — apenas qual modelo estava fazendo o raciocínio, e em que nível de esforço. Um ranking que classifica sistemas está dizendo, com precisão, que a configuração é o produto.
Ele também revisa nossa própria forma de reportar. Em 11 de setembro de 2026, registramos o GPT-Live-1 com 69,8% neste índice, atrás tanto do GPT-Realtime-2.1 quanto do Grok. Essa era a leitura disponível na época, e sustentava uma conclusão razoável — a de que a OpenAI havia construído a melhor mecânica conversacional, e não o melhor agente de voz. O índice agora traz duas configurações delegadas do GPT-Live-1, com 81,5 e 80,1. A Artificial Analysis não publica um registro de alterações, e revisou os componentes do índice em agosto, então não podemos afirmar com certeza se o número anterior era uma configuração não pontuada ou parcialmente pontuada, ou uma execução sob a ponderação anterior; o que é observável é que os emparelhamentos delegados agora aparecem como suas próprias linhas completas, e que a resposta mudou quando isso aconteceu.
A consequência prática é que "qual modelo de voz" é a pergunta errada e "qual modelo de voz mais qual backend, com qual esforço" é a certa. Essa é uma questão de roteamento, e é exatamente a que nosso próprio produto existe para responder. O OrcaRouter expõe o backend de delegação do GPT-Live-1, o GPT-6 Astra, por meio do mesmo endpoint compatível com OpenAI que mais de 200 outros modelos, de modo que trocar a camada de raciocínio é uma mudança de ID de modelo, e não uma integração. A DSL de roteamento compõe vários modelos em uma única chamada, e o failover automático significa que um pareamento não comprovado não é uma aposta de produção — se o backend degradar, a solicitação chega a outro lugar em vez de falhar. Para ser preciso sobre o que não fazemos: o próprio GPT-Live-1 não está em nosso catálogo e não o servimos. O backend ao qual ele delega é outra questão.
Quanto custa uma hora disto
O front end do GPT-Live-1 é cobrado a US$ 0,05 por minuto de voz, cobrado por segundo, o que dá US$ 3,00 por uma hora de linha aberta. Essa não é a conta inteira: raciocínio delegado, chamadas de ferramentas e busca na web são medidos separadamente pelo que o modelo de backend cobrar. A Artificial Analysis mediu o valor total, e é por isso que a coluna de custos dela é a que deve ser usada:
• GPT-Live-1 (Sol, baixo) — $4,47 por hora
• Grok Voice Think Fast 2.0 High — US$ 4,80 por hora
• GPT-Live-1 (Astra, medium) — $5,83 por hora
• GPT-Realtime-2.1 High — $10,75 por hora
O vencedor do ranking é o mais caro das três opções atuais, e a configuração que venceu custa 30% mais por hora do que a configuração que ficou em terceiro lugar. Lendo pelo outro lado, a divisão é reveladora: US$ 3,00 de cada hora são a camada de voz, e o restante — US$ 1,47 no Sol, US$ 2,83 no Astra — são tokens de backend. A camada de raciocínio representa algo entre um terço e metade da sua conta, o que é uma parcela grande para um componente que o ranking trata como uma nota de rodapé.

Em comparação com o modelo que ele substitui, porém, toda a família custa aproximadamente metade do preço — o front-end de US$ 0,05 por minuto é uma redução genuína, não um reempacotamento. Como os tokens de backend são cobrados a tarifas de backend, o custo de uma implantação do GPT-Live-1 é, em grande parte, função de para qual modelo de raciocínio você roteia, e os backends podem ser modelos da própria OpenAI ou de terceiros. No OrcaRouter, esses backends são repassados pelo preço de tabela do provedor, com 0% de markup, de modo que uma alteração de preço do fornecedor na camada de raciocínio entra em vigor no mesmo dia, em vez de no próximo ciclo de cobrança.
O que o índice não resolve
Três ressalvas, declaradas pela fonte em vez de inferidas. Tanto as entradas do GPT-Live-1 quanto o Grok Voice Think Fast 2.0 High estão sinalizados como baseados em um único teste, o que é pouco robusto para uma decisão de 0,2 ponto — uma nova execução poderia reordenar primeiro e segundo sem que nada mudasse em qualquer um dos modelos. O Arena Elo, como observado, foi congelado na primeira medição publicável de cada modelo. E o índice não tem nenhuma entrada sobre como esses sistemas se comportam em uma ligação longa: os componentes são de horizonte curto por construção, enquanto o modo de falha que realmente mata agentes de voz em produção é a deriva ao longo de uma conversa de vinte minutos.
Separadamente, e do fornecedor em vez do índice: a API do GPT-Live-1 foi lançada sem entrada de imagem ou vídeo, sem saídas estruturadas e sem nível gratuito, e os limites de taxa dela são contados em sessões simultâneas, e não em solicitações por minuto. Essas são restrições do dia do lançamento que podem já ter mudado; verifique-as antes de projetar com base nelas.
O que fazer com isto
Se você está escolhendo uma arquitetura esta semana em vez de um modelo, o índice recompensa o padrão delegado no trabalho agêntico e o padrão em cascata na latência. O GPT-Live-1 com 81,5 é a evidência mais forte até agora de que separar conversa de raciocínio é o formato certo para agentes de voz que concluem tarefas. O Grok Voice Think Fast 2.0 High com 81,3, com 0,70 segundo até o primeiro áudio e uma taxa de sucesso em tarefas de 94,6%, é a evidência mais forte de que o formato delegado não é o único que funciona — e de que ainda não é o mais rápido.
A decisão que decorre dos números é mais barata do que parece. Ambas as configurações do GPT-Live-1, e o modelo que o superou em quatro dos seis componentes, estão a menos de US$ 1,36 por hora de diferença entre si. Com essa diferença, a atitude certa é parar de ler rankings e testar suas próprias transcrições nos dois. O índice mostra o formato do trade-off; ele não consegue dizer de que lado dele seus usuários estão.
Perguntas que o número suscita
O GPT-Live-1 é o melhor modelo de voz agora?
No composto, sim — por 0,2 pontos e com um único teste por trás. Nos componentes, depende inteiramente do que você está construindo: lidera em desempenho agêntico e preferência na arena, e fica atrás em raciocínio de fala, taxa de sucesso em tarefas e tempo até o primeiro áudio. Uma liderança de 0,2 pontos no composto, apoiada em uma vantagem de 11,4 pontos em um único componente, é um primeiro lugar defensável, não decisivo.
Você precisa usar o GPT-6 Astra para conseguir o 81.5?
Para essa linha exata, sim — o 81,5 pertence ao GPT-Live-1 configurado com Astra em esforço de raciocínio médio. O Sol com esforço baixo é uma alternativa documentada, em 80,1 e US$ 1,36 mais barata por hora, e a OpenAI oferece suporte a usar modelos de terceiros como backend, então as entradas do ranking são dois pontos numa curva, e não as únicas opções. Qual combinação é melhor para a sua carga de trabalho não é algo que um índice público possa responder por você.
Por que o mesmo modelo obteve 69,8 na nossa cobertura anterior e 81,5 agora?
Os dois valores cobrem coisas diferentes. A leitura anterior colocava o GPT-Live-1 no índice como uma única entrada; a tabela atual traz suas duas configurações delegadas como linhas separadas, com pontuação completa, com o emparelhamento Astra em 81,5 e o emparelhamento Sol em 80,1. A Artificial Analysis revisou os componentes do índice em agosto e não publica um registro de alterações, portanto, trate o delta como uma mudança naquilo que foi medido, e não como evidência de que o modelo melhorou — e trate qualquer pontuação composta única para um modelo que delega como uma declaração sobre uma configuração.
