
GPT-Live-1 vs Grok Voice Think Fast 2.0: Duas APIs de voz seguindo direções opostas de preço
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O fato mais útil sobre este confronto é uma direção, não um número. Quando a xAI lançou o Grok Voice Think Fast 2.0 no final de julho de 2026, ela aumentou a tarifa de áudio por minuto em 60%, dos US$ 0,05 que o Think Fast 1.0 cobrava para US$ 0,08. Seis semanas depois, em 10 de setembro de 2026, a OpenAI disponibilizou o GPT-Live-1 na API para desenvolvedores exatamente pelo preço que a xAI acabara de abandonar. Isso cria a rara situação em que as duas principais APIs de voz full-duplex podem ser comparadas diretamente por preço, e em que a concorrente mais recente é a mais barata — enquanto o modelo mais antigo e mais caro é o que tem pontuações de benchmark de terceiros por trás.
O livro-razão, antes de quaisquer benchmarks
Ambos são modelos de fala para fala criados para cargas de trabalho no formato de telefonia: uma conversa ao vivo com um cliente, uma interrupção, uma chamada de ferramenta e uma conta medida em minutos. Além disso, eles divergem rapidamente.
• Preço por minuto de áudio — GPT-Live-1 $0.05 vs Grok Voice Think Fast 2.0 $0.08
• Unidade de cobrança — GPT-Live-1 cobra por segundo, sem arredondamento para o próximo minuto inteiro; Grok Voice Think Fast 2.0 tem preço por minuto de áudio e equivale a cerca de US$ 4,80 por hora
• Lançamento — GPT-Live-1 foi lançado dentro do ChatGPT em 8 de julho de 2026 e chegou à API em 10 de setembro de 2026; Grok Voice Think Fast 2.0 foi anunciado por volta de 29–30 de julho de 2026, aproximadamente três meses após o Think Fast 1.0
• Endpoints — GPT-Live-1 é apenas Live Sessions, em v1/live/sessions, via WebRTC; o Grok Voice Think Fast 2.0 roda na API Speech-to-Speech da xAI tanto por WebSocket quanto por WebRTC
• Superfície de ferramentas — GPT-Live-1 delega a um modelo de raciocínio de back-end por meio da API Responses; o Grok Voice Think Fast 2.0 tem pesquisa na web, pesquisa no X, pesquisa em arquivos, servidores MCP e funções do lado do cliente disponíveis dentro da sessão
• Portabilidade de voz — GPT-Live-1 usa o conjunto remasterizado de doze vozes da OpenAI; Grok Voice Think Fast 2.0 suporta vozes integradas e personalizadas
A linha do WebSocket é menor do que parece e importa mais do que deveria. Uma grande parcela da infraestrutura de telefonia — o encanamento de fluxo de mídia dentro da maioria dos produtos CPaaS — fala WebSocket, não WebRTC. O Grok Voice Think Fast 2.0 atende essa infraestrutura onde ela está; o GPT-Live-1 não atende, e chegar ao WebRTC a partir de um caminho de chamada somente WebSocket é um verdadeiro trabalho de engenharia, e não uma flag de configuração.

A assimetria do benchmark é o que realmente importa
É aqui que a comparação deixa de ser um empate, e onde a maioria das análises inverte tudo ao tratar os dois conjuntos de números como o mesmo tipo de evidência.
As pontuações de destaque do Grok Voice Think Fast 2.0 vêm do Speech-to-Speech Quality Index da Artificial Analysis, uma medição de terceiros que coloca o modelo em 82,9%, acima dos 75,7% da versão 1.0, à frente do GPT-Realtime-2.1 com 79,1% e do Gemini 3.1 Flash com 69,5%. A xAI também relata o primeiro lugar no τ-voice Bench para comportamento agêntico, com 56,5%, à frente do GPT-Realtime-2.1 com 45,7%. Essas são medições realizadas externamente do modelo da xAI.
As pontuações de destaque do GPT-Live-1 são da própria OpenAI. A empresa relata interatividade full-duplex de 80,1% contra 45,4% do GPT-Realtime-2.1, latência de alternância de turnos reduzida de 1,4 segundos para 0,8 segundos, e precisão de chamada de ferramentas aumentada de 60% para 87%. Todos esses números são informados pelo fornecedor, não foram reproduzidos por um laboratório independente, e comparam o novo modelo da OpenAI com o modelo anterior da própria OpenAI, em vez de com um concorrente.
Isso não é motivo para descartar os números — a direção da trajetória é consistente com o que os primeiros implementadores relatam — mas significa que a única comparação entre fornecedores atualmente disponível favorece o modelo da xAI em testes executados de forma independente, enquanto o único número disponível para a vantagem de latência da OpenAI é o da própria OpenAI. Não trate 0,8 segundos e 0,70 segundos como uma disputa real; apenas um desses dois números foi medido por alguém sem interesse no resultado.

A armadilha do alias, e por que o aumento de preço pegou as pessoas de surpresa
O aumento de 60% teria sido um erro de arredondamento na maioria das notas de versão se a xAI também não o tivesse lançado por meio de um alias. Aplicações que apontavam para o alias grok-voice-latest herdaram automaticamente tanto o novo modelo quanto a tarifa mais alta em 5 de agosto de 2026, a menos que tivessem fixado explicitamente grok-voice-think-fast-1.0. Essa é uma decisão de design que vale a pena entender, e não uma reclamação: aliases flutuantes oferecem atualizações gratuitas e também alteram sua economia unitária sem pedir licença.
A solução óbvia é mais fraca do que parece. O Grok Voice Think Fast 1.0 — o modelo a US$ 0,05 por minuto, lançado em 23 de abril de 2026 — agora está marcado como obsoleto na própria lista de modelos da xAI. Fixá-lo protege você da atualização automática e compra tempo, em vez de representar um caminho mais barato permanente, porque um modelo obsoleto tem uma data de retirada em algum momento futuro. Planeje a migração conforme o seu próprio cronograma, e não o do alias.
Vale a pena ler com atenção a própria apresentação de preços antes de você se comprometer com um número. A página de modelos da xAI lista explicitamente as tarifas versionadas — grok-voice-think-fast-2.0 a $0.08 por minuto de áudio, $4.80 por hora, mais $0.004 por entrada de texto —, enquanto o cartão separado da Voice API na mesma página anuncia um preço de agente "a partir de $0.05 por minuto", que é o ponto de entrada, e não a tarifa cobrada pelo modelo 2.0. Se o seu planejamento de capacidade foi feito com base no número de marketing, ele está cerca de 60% subestimado.
O modelo da OpenAI não tem esse problema da mesma forma, porque não há nada para onde flutuar. O GPT-Live-1 tem exatamente um ID de modelo, gpt-live-1, que também é seu próprio snapshot padrão — não há variantes datadas para fixar e, portanto, nenhum alias que possa alterar silenciosamente o modelo ou o preço. A contrapartida é que você também não pode congelar um comportamento comprovadamente bom e mantê-lo enquanto algo novo se assenta.
Ambos os modelos cobram a camada de raciocínio separadamente da camada de voz, e é aqui que a tarifa anunciada deixa de ser o custo total. As chamadas Responses delegadas do GPT-Live-1 são cobradas às tarifas normais por token do modelo de back-end configurado. A xAI acrescenta $0,004 por entrada de texto na sessão de voz, mais chamadas de ferramentas, um número de telefone provisionado a cerca de $0,01 por minuto quando for necessário, telefonia e armazenamento, somando-se à tarifa de áudio por minuto. Um agente de voz que ouve na maior parte do tempo e ocasionalmente consulta algo ficará próximo da sua tarifa anunciada; um que aciona ferramentas a cada turno não o fará, e os dois não divergirão na mesma direção, porque o design de back-end delegado e o design de ferramentas em sessão queimam tokens em lugares diferentes.
Do nosso lado, o motivo pelo qual mudanças na tarifa por minuto merecem ser acompanhadas de perto é que a OrcaRouter repassa o preço de tabela do provedor sem nenhuma margem. Quando um fornecedor altera uma tarifa publicada, o número do nosso lado muda no mesmo dia, e não no próximo ciclo de contrato.

O que a divisão de delegação custa a você em engenharia
Se você está escolhendo entre esses dois com base na arquitetura, e não no preço, a questão decisiva é onde fica a costura.
O modelo da xAI mantém as ferramentas dentro da sessão. Isso é mais simples de entender — uma conexão, uma conversa, um único lugar onde uma chamada de função acontece — e significa que o modelo pode decidir no meio da frase que precisa pesquisar e continuar falando enquanto espera.
O modelo da OpenAI empurra esse trabalho para fora. A camada de voz mantém a conversa viva e entrega a tarefa a um modelo de raciocínio separado por meio da Responses API, o que significa que suas definições de ferramentas, sua recuperação e sua lógica de negócios ficam em uma integração normal com um modelo de texto, em vez de dentro de um fluxo de eventos de sessão. São mais peças móveis, e também é mais portável: a metade delegada é uma chamada de API comum que você pode trocar, precificar e fazer failover de forma independente da camada de voz.
Isso importa por exatamente um motivo. Nem o GPT-Live-1 nem o Grok Voice Think Fast 2.0 são servidos por ninguém além do próprio fornecedor — ambos são de fonte única, e um roteador não pode ajudar você com a metade de áudio. O que um roteador pode fazer é consolidar a metade que você pode realmente escolher. O GPT-5.6 Terra, o backend no próprio exemplo de delegação da OpenAI, está disponível através do OrcaRouter a US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de saída com ambos /v1/chat/completions e /v1/responses expostos, ao lado de cerca de 190 outros modelos em uma única chave. Se o seu agente de voz chama um modelo de raciocínio a cada turno, esse é o item de linha com alavancagem de roteamento.
O veredito, dividido por carga de trabalho
• Escolha o GPT-Live-1 se o preço por minuto for a restrição, se o seu caminho de chamada já fala WebRTC ou se você quiser que o cérebro de raciocínio por trás da voz seja um modelo de texto intercambiável, em vez de uma parte fixa da sessão.
• Escolha Grok Voice Think Fast 2.0 se você precisar de qualidade verificada de forma independente na mesa antes de se comprometer, se sua pilha de telefonia for nativa de WebSocket, ou se ferramentas em sessão — a busca no X em particular — forem centrais para o produto, e não incidentais.
• Fique de olho no alias se você já está no xAI. Fixar um ID de modelo versionado é a única coisa que separa você da próxima mudança automática de taxa, e vale a pena aplicar a mesma disciplina em qualquer lugar onde apareça um alias flutuante.
O resumo incômodo é que o modelo mais barato é o que não tem comprovação de terceiros por trás, e o modelo mais bem documentado é o que acabou de ficar 60% mais caro. Se você ainda estiver cedo o suficiente no desenvolvimento para que nenhuma das integrações esteja definida, a medida de menor risco é criar protótipos com os dois — a parte de áudio tem algumas centenas de linhas de qualquer forma — e deixar a qualidade da sua própria transcrição decidir, porque as evidências públicas no momento não resolvem isso.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
