
Gemini 3.8 Live Extended Thinking vs. GPT-Live-1: Um Empate de 1,1 Ponto e Duas Faturas Diferentes
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Na pontuação composta, isto é um empate. Gemini 3.8 Live Extended Thinking fica em 82,6 no Speech to Speech Index da Artificial Analysis; GPT-Live-1, em seu backend Astra com esforço de raciocínio médio, fica em 81,5. No componente agêntico subjacente — conclusão de tarefas do τ-Voice — a diferença é de 0,7 ponto, 68,6% contra 67,9%. No componente de raciocínio, ela é maior e vai na direção oposta: 97,7% no Big Bench Audio para o modelo Gemini, 90,1% para o GPT-Live-1. Nada nessa variação sobrevive a uma segunda execução de benchmark, e nada disso é o que você deve levar em conta para decidir.
O que separa esses dois não é a qualidade. É que eles discordam sobre o que é um agente de voz, quem faz o raciocínio e — a parte que primeiro pesa no orçamento — como a sessão é cobrada. O Gemini 3.8 Live Extended Thinking cobra por token de áudio e raciocina no mesmo modelo que conversa. O GPT-Live-1 cobra uma taxa fixa pelo tempo de sessão, esteja alguém falando ou não, e entrega o raciocínio propriamente dito a um modelo de texto separado que você escolhe e paga à parte. São dois produtos diferentes usando a mesma pontuação de benchmark, e qual deles se encaixa depende de uma pergunta que o ranking nunca faz: como é uma chamada média na sua linha?
O empate de 1,1 ponto, e onde ele realmente se rompe
Comece pelos números, porque a magreza da manchete é justamente o ponto:
• Índice de Fala para Fala — Gemini 3.8 Live Extended Thinking (Alto) 82,6 vs GPT-Live-1 (backend Astra, esforço médio) 81,5
• Desempenho agêntico (conclusão de tarefas τ-Voice) — 68,6% vs 67,9%, com o GPT-Live-1 em 59,3% quando executa o backend Sol em esforço baixo
• Raciocínio de fala (Big Bench Audio) — 97,7% vs 90,1%, o único componente em que a diferença não é ruído
• Fluxos de trabalho bancários complexos (Sierra τ³-Banking, reportado pelo fornecedor) — 35,1% vs 32,0%
• Tempo até o primeiro áudio — 1,35s vs 1,24–1,34s pela API
• Custo medido por hora — $3,50 vs $5,83 para a configuração Astra, ambos na medição de áudio de entrada da Artificial Analysis
A leitura honesta é que os dois modelos são indistinguíveis no resultado composto, distinguíveis no raciocínio de fala, em que o modelo Gemini lidera por quase oito pontos, e distinguíveis no custo, em que lidera por cerca de 40%. Onde o GPT-Live-1 sai na frente é nas partes da experiência que um benchmark tem dificuldade em pontuar: ele é genuinamente full-duplex, ouvindo enquanto fala, emitindo sinais de retorno e decidindo várias vezes por segundo se deve falar ou ceder a vez. O Gemini 3.8 Live Extended Thinking é baseado em turnos. Ele resolve o mesmo problema subjacente — um chamador deixado em silêncio enquanto o agente trabalha — narrando em vez disso, raciocinando e falando ao mesmo tempo com sinais como "Deixe-me verificar isso…" enquanto a tarefa é executada.
Ambas as abordagens mantêm a linha viva. Elas parecem diferentes. Apenas uma delas aparece em um índice.

Dois modelos de cobrança, e por que a tabela de preços engana
Esta é a seção que decide a maioria das implantações, e é justamente a que a cobertura ignora.
Gemini 3.8 Live Extended Thinking é cobrado da mesma forma que um modelo de tokens. Por meio da Live API, as tarifas publicadas são de US$ 3,00 por milhão de tokens de entrada de áudio — aproximadamente US$ 0,005 por minuto de entrada de áudio — e US$ 12,00 por milhão de tokens de saída de áudio, cerca de US$ 0,018 por minuto, com os tokens de raciocínio contabilizados nessa saída. Você paga pelo áudio que flui. Um interlocutor que faz pausas, pensa ou fica em espera não custa nada enquanto está em silêncio.
GPT-Live-1 é cobrado da mesma forma que uma linha telefônica. É um valor fixo de US$ 0,05 por minuto de tempo de sessão, cobrado por segundo, independentemente de quem está falando ou se alguém está falando. O backend de raciocínio não está incluído: o modelo de texto que faz o raciocínio, e quaisquer ferramentas que ele chame, são cobrados separadamente, por cima disso. É assim que um preço anunciado de US$ 0,05 se transforma num valor total de aproximadamente US$ 4,47 por hora no backend Sol e US$ 5,83 por hora no Astra medium, segundo medições da Artificial Analysis.
Coloque os dois lado a lado e a comparação ingênua — US$ 0,018 contra US$ 0,05 por minuto, uma diferença de 2,8× — está errada nas duas direções. Os números horários medidos colocam a diferença real em US$ 3,50 contra US$ 5,83, mais próxima de 1,7×. Mas o modelo de relógio de sessão também muda a forma da sua conta, e não apenas o seu patamar: no GPT-Live-1, seu custo acompanha a duração da chamada, de modo que uma linha com chamadas longas, silenciosas e de baixo conteúdo — uma fila de suporte, uma etapa de verificação, uma transferência de URA — paga o mesmo que uma densa. Do lado do Gemini, o custo acompanha o áudio, então o silêncio é gratuito e a verbosidade não. Faça as contas com a duração média das suas próprias chamadas antes de fazê-las com uma tarifa por minuto, porque é esse número que decide qual destes sai mais barato para você, e a resposta não é a mesma para uma linha de reservas e uma linha de triagem.
Onde o pensamento acontece
A segunda diferença estrutural é a delegação, e é ela que determina quanto deste stack você pode realmente trocar.
GPT-Live-1 é um front-end. Ele lida com o áudio duplex e, quando uma consulta exige raciocínio de verdade, passa o trabalho para um modelo de back-end separado — GPT-5.5 e GPT-6 Astra estão ambos documentados como back-ends — com seletores de esforço de raciocínio que permitem escolher quanto desse back-end você quer comprar. É por isso que o quadro lista o GPT-Live-1 duas vezes com pontuações diferentes: 81,5 no Astra com esforço médio, 80,1 no Sol com esforço baixo. Essa diferença de 1,4 ponto entre as suas próprias duas configurações é maior que a lacuna de 1,1 ponto entre os dois modelos neste confronto, o que mostra que, no lado da OpenAI, a configuração que você escolhe importa mais do que o fornecedor que você escolhe.
Gemini 3.8 Live Extended Thinking raciocina no mesmo modelo que fala. Não há um backend separado para selecionar nem uma cobrança separada por ele; o trade-off é que você ajusta a profundidade com níveis de pensamento — baixo, médio e alto — no mesmo modelo, e os números 82,6 e 68,6 são a configuração (Alto). A execução de ferramentas e API em segundo plano roda de forma assíncrona nos dois lados, então nenhum dos modelos trava enquanto trabalha.
Uma consequência prática: como a inteligência do GPT-Live-1 é um modelo de texto comprado por trás de um front-end de voz, seu teto de qualidade muda quando a OpenAI lança um modelo de texto, não quando lança um modelo de voz. O teto do Gemini 3.8 Live Extended Thinking muda quando o Google retreina o modelo de áudio. Se você está fazendo uma aposta de dois anos em uma plataforma de voz, essa diferença no ritmo de atualização merece mais reflexão do que 1,1 ponto de índice.
Quais são os custos de mudança, seja qual for o caminho que você escolher
Nenhuma dessas opções é uma simples troca de ID de modelo, e as equipes que as tratam como tal só descobrem isso em produção. Migrar para Gemini 3.8 Live Extended Thinking significa aceitar um contrato de turno diferente: as chamadas de função são sempre assíncronas, então uma declaração de ferramenta bloqueante retorna um erro imediato em vez de enfileirar a chamada, e os clientes precisam ler o campo interaction_status — IN_PROGRESS enquanto o raciocínio ou uma ferramenta ainda está em execução, IDLE somente quando toda a tarefa é concluída — em vez de confiar em turnComplete para significar que o trabalho terminou. Migrar para GPT-Live-1 significa adotar sua engrenagem de seleção de backend e uma segunda superfície de cobrança, e conviver com uma API que só se tornou disponível de forma geral para desenvolvedores em 10 de setembro de 2026, depois de estrear no ChatGPT em 8 de julho — então ferramentas de terceiros, SDKs e observabilidade em torno dela têm meses de idade, não anos. Qualquer que seja a direção que você escolher, inclua no orçamento o trabalho de integração junto com a conta de tokens. Em uma stack de voz madura, a refatoração costuma ser a maior das duas.
Como realizar uma comparação como esta sem apostar nela
A maneira sensata de resolver uma questão de 1,1 ponto é executar ambos no seu próprio tráfego, e a parte incômoda é que fazer isso normalmente significa duas integrações, dois contratos e dois conjuntos de credenciais. Não precisa significar duas arquiteturas. Em ambos esses sistemas, o front-end de voz é uma camada fina sobre chamadas comuns a modelos de texto — para o GPT-Live-1, isso é explícito, e, do lado do Gemini, a execução de ferramentas em segundo plano se resolve da mesma forma — e é nessa camada de texto que reside a variação dos seus custos e onde a troca é realmente barata.
O OrcaRouter disponibiliza 190 modelos a partir de uma única chave pelo preço de lista do provedor, sem sobretaxa, portanto uma alteração de preço upstream entra em vigor do nosso lado no mesmo dia, em vez de na próxima renovação de contrato. Para uma stack de voz, as duas propriedades que importam são que o alvo de delegação pode ser trocado em tráfego em tempo real sem mexer na integração de voz, e que o failover automático mantém uma chamada ativa quando um backend apresenta erro ou atinge o tempo limite — o que permite testar uma configuração não comprovada em tráfego real sem colocar uma linha de produção por trás dela. Para ser preciso sobre o que hospedamos e o que não hospedamos: nem o endpoint Gemini 3.8 Live Extended Thinking nem o endpoint GPT-Live-1 estão no nosso roteador — esses vêm das próprias APIs do Google e da OpenAI. Os modelos de texto para os quais eles delegam com muita frequência estão no nosso roteador, e o Gemini 3.8 Flash está entre eles.
O topo da tabela, e quão pouco ele se estabiliza.
A captura abaixo foi feita em 16 de setembro de 2026:
• Gemini 3.8 Live Extended Thinking (High) — 82,6, primeiro lugar
• GPT-Live-1 (backend Astra, esforço médio) — 81,5
• Grok Voice Think Fast 2.0 High — 81,3
• GPT-Live-1 (backend Sol, esforço baixo) — 80.1
• Gemini 3.8 Live — 76,0
• GPT-Realtime-2.1 Alto — 73.9
• Gemini 3.1 Flash Live High — 71,5
Três coisas que merecem atenção. Primeiro, o primeiro e o terceiro lugares estão separados por 1,3 pontos, e o primeiro e o quinto por 6,6, então o topo deste placar é um aglomerado, não um ranking. Segundo, o modelo no título deste confronto não é a entrada Gemini em quinto lugar — trata-se do Gemini 3.8 Live padrão, um produto diferente e muito mais barato que não deve ser confundido com a variante de raciocínio que está sendo comparada aqui. Terceiro, há um precedente para tratar qualquer valor isolado de índice como provisório: a xAI relatou 82,9 para o Grok Voice Think Fast 2.0 em julho, e esse modelo aparece com 81,3 neste placar. Pontuações de índice divulgadas por fornecedores nem sempre sobrevivem ao contato com um ranking ao vivo. Os números de 68,6% e 67,9% do τ-Voice agora figuram em um placar público executado sob o próprio harness da Artificial Analysis, de modo que são corroborados, e não apenas alegados — mas uma diferença de 0,7 ponto entre dois modelos no mesmo harness não é uma diferença. Verifique no seu tráfego ou ignore.

Mais um número que merece entrar na decisão, porque é o dado mais incômodo desta comparação: o Google reporta 35,1% para o Gemini 3.8 Live Extended Thinking no leaderboard τ³-Banking da Sierra, contra 32,0% do GPT-Live-1 Astra. São números informados pelos próprios fornecedores, não reproduzidos, e descrevem um cenário em que o agente de voz líder nesse ranking falha em cerca de duas de cada três tentativas realistas de tarefas bancárias. Se o seu agente precisa concluir trabalho regulado e de várias etapas, nenhum desses modelos está pronto — e uma vantagem de 3,1 pontos nesse benchmark não é motivo para escolher um fornecedor, é motivo para manter um humano no circuito.

Então: se a naturalidade da conversa é o produto e as suas chamadas são curtas e densas, o comportamento full-duplex do GPT-Live-1 é uma vantagem real que o índice não consegue ver, e a cobrança pelo relógio de sessão é tolerável nessa duração de chamada. Se as chamadas são longas, silenciosas ou variáveis, ou se o raciocínio de fala e o custo por hora dominam, o Gemini 3.8 Live Extended Thinking está à frente nos componentes que importam e cerca de 40% mais barato por hora enquanto o faz — com a ressalva de que é baseado em turnos, ainda em preview para empresas e exige uma refatoração do cliente antes de executar as suas ferramentas. O que nada disto justifica é escolher um ou outro com base na força de 1,1 pontos de índice. Com as evidências disponíveis, a razão honesta para escolher entre estes dois é o modelo de cobrança e a arquitetura por baixo dele, e ambos são coisas que pode medir no seu próprio tráfego esta semana.
No OrcaRouter, o failover automático mantém uma chamada ativa quando um backend apresenta erro ou excede o tempo limite.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
