Cartão de título de destaque para Gemini 3.8 Live Extended Thinking vs. GPT-Live-1, mostrando os dois modelos de voz separados por 1,1 pontos no índice, com modelos de cobrança diferentes.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs. GPT-Live-1: Um Empate de 1,1 Ponto e Duas Faturas Diferentes

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Na pontuação composta, isto é um empate. Gemini 3.8 Live Extended Thinking fica em 82,6 no Speech to Speech Index da Artificial Analysis; GPT-Live-1, em seu backend Astra com esforço de raciocínio médio, fica em 81,5. No componente agêntico subjacente — conclusão de tarefas do τ-Voice — a diferença é de 0,7 ponto, 68,6% contra 67,9%. No componente de raciocínio, ela é maior e vai na direção oposta: 97,7% no Big Bench Audio para o modelo Gemini, 90,1% para o GPT-Live-1. Nada nessa variação sobrevive a uma segunda execução de benchmark, e nada disso é o que você deve levar em conta para decidir.

O que separa esses dois não é a qualidade. É que eles discordam sobre o que é um agente de voz, quem faz o raciocínio e — a parte que primeiro pesa no orçamento — como a sessão é cobrada. O Gemini 3.8 Live Extended Thinking cobra por token de áudio e raciocina no mesmo modelo que conversa. O GPT-Live-1 cobra uma taxa fixa pelo tempo de sessão, esteja alguém falando ou não, e entrega o raciocínio propriamente dito a um modelo de texto separado que você escolhe e paga à parte. São dois produtos diferentes usando a mesma pontuação de benchmark, e qual deles se encaixa depende de uma pergunta que o ranking nunca faz: como é uma chamada média na sua linha?

O empate de 1,1 ponto, e onde ele realmente se rompe

Comece pelos números, porque a magreza da manchete é justamente o ponto:

Índice de Fala para Fala — Gemini 3.8 Live Extended Thinking (Alto) 82,6 vs GPT-Live-1 (backend Astra, esforço médio) 81,5

Desempenho agêntico (conclusão de tarefas τ-Voice) — 68,6% vs 67,9%, com o GPT-Live-1 em 59,3% quando executa o backend Sol em esforço baixo

Raciocínio de fala (Big Bench Audio) — 97,7% vs 90,1%, o único componente em que a diferença não é ruído

Fluxos de trabalho bancários complexos (Sierra τ³-Banking, reportado pelo fornecedor) — 35,1% vs 32,0%

Tempo até o primeiro áudio — 1,35s vs 1,24–1,34s pela API

Custo medido por hora — $3,50 vs $5,83 para a configuração Astra, ambos na medição de áudio de entrada da Artificial Analysis

A leitura honesta é que os dois modelos são indistinguíveis no resultado composto, distinguíveis no raciocínio de fala, em que o modelo Gemini lidera por quase oito pontos, e distinguíveis no custo, em que lidera por cerca de 40%. Onde o GPT-Live-1 sai na frente é nas partes da experiência que um benchmark tem dificuldade em pontuar: ele é genuinamente full-duplex, ouvindo enquanto fala, emitindo sinais de retorno e decidindo várias vezes por segundo se deve falar ou ceder a vez. O Gemini 3.8 Live Extended Thinking é baseado em turnos. Ele resolve o mesmo problema subjacente — um chamador deixado em silêncio enquanto o agente trabalha — narrando em vez disso, raciocinando e falando ao mesmo tempo com sinais como "Deixe-me verificar isso…" enquanto a tarefa é executada.

Ambas as abordagens mantêm a linha viva. Elas parecem diferentes. Apenas uma delas aparece em um índice.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Dois modelos de cobrança, e por que a tabela de preços engana

Esta é a seção que decide a maioria das implantações, e é justamente a que a cobertura ignora.

Gemini 3.8 Live Extended Thinking é cobrado da mesma forma que um modelo de tokens. Por meio da Live API, as tarifas publicadas são de US$ 3,00 por milhão de tokens de entrada de áudio — aproximadamente US$ 0,005 por minuto de entrada de áudio — e US$ 12,00 por milhão de tokens de saída de áudio, cerca de US$ 0,018 por minuto, com os tokens de raciocínio contabilizados nessa saída. Você paga pelo áudio que flui. Um interlocutor que faz pausas, pensa ou fica em espera não custa nada enquanto está em silêncio.

GPT-Live-1 é cobrado da mesma forma que uma linha telefônica. É um valor fixo de US$ 0,05 por minuto de tempo de sessão, cobrado por segundo, independentemente de quem está falando ou se alguém está falando. O backend de raciocínio não está incluído: o modelo de texto que faz o raciocínio, e quaisquer ferramentas que ele chame, são cobrados separadamente, por cima disso. É assim que um preço anunciado de US$ 0,05 se transforma num valor total de aproximadamente US$ 4,47 por hora no backend Sol e US$ 5,83 por hora no Astra medium, segundo medições da Artificial Analysis.

Coloque os dois lado a lado e a comparação ingênua — US$ 0,018 contra US$ 0,05 por minuto, uma diferença de 2,8× — está errada nas duas direções. Os números horários medidos colocam a diferença real em US$ 3,50 contra US$ 5,83, mais próxima de 1,7×. Mas o modelo de relógio de sessão também muda a forma da sua conta, e não apenas o seu patamar: no GPT-Live-1, seu custo acompanha a duração da chamada, de modo que uma linha com chamadas longas, silenciosas e de baixo conteúdo — uma fila de suporte, uma etapa de verificação, uma transferência de URA — paga o mesmo que uma densa. Do lado do Gemini, o custo acompanha o áudio, então o silêncio é gratuito e a verbosidade não. Faça as contas com a duração média das suas próprias chamadas antes de fazê-las com uma tarifa por minuto, porque é esse número que decide qual destes sai mais barato para você, e a resposta não é a mesma para uma linha de reservas e uma linha de triagem.

Onde o pensamento acontece

A segunda diferença estrutural é a delegação, e é ela que determina quanto deste stack você pode realmente trocar.

GPT-Live-1 é um front-end. Ele lida com o áudio duplex e, quando uma consulta exige raciocínio de verdade, passa o trabalho para um modelo de back-end separado — GPT-5.5 e GPT-6 Astra estão ambos documentados como back-ends — com seletores de esforço de raciocínio que permitem escolher quanto desse back-end você quer comprar. É por isso que o quadro lista o GPT-Live-1 duas vezes com pontuações diferentes: 81,5 no Astra com esforço médio, 80,1 no Sol com esforço baixo. Essa diferença de 1,4 ponto entre as suas próprias duas configurações é maior que a lacuna de 1,1 ponto entre os dois modelos neste confronto, o que mostra que, no lado da OpenAI, a configuração que você escolhe importa mais do que o fornecedor que você escolhe.

Gemini 3.8 Live Extended Thinking raciocina no mesmo modelo que fala. Não há um backend separado para selecionar nem uma cobrança separada por ele; o trade-off é que você ajusta a profundidade com níveis de pensamento — baixo, médio e alto — no mesmo modelo, e os números 82,6 e 68,6 são a configuração (Alto). A execução de ferramentas e API em segundo plano roda de forma assíncrona nos dois lados, então nenhum dos modelos trava enquanto trabalha.

Uma consequência prática: como a inteligência do GPT-Live-1 é um modelo de texto comprado por trás de um front-end de voz, seu teto de qualidade muda quando a OpenAI lança um modelo de texto, não quando lança um modelo de voz. O teto do Gemini 3.8 Live Extended Thinking muda quando o Google retreina o modelo de áudio. Se você está fazendo uma aposta de dois anos em uma plataforma de voz, essa diferença no ritmo de atualização merece mais reflexão do que 1,1 ponto de índice.

Quais são os custos de mudança, seja qual for o caminho que você escolher

Nenhuma dessas opções é uma simples troca de ID de modelo, e as equipes que as tratam como tal só descobrem isso em produção. Migrar para Gemini 3.8 Live Extended Thinking significa aceitar um contrato de turno diferente: as chamadas de função são sempre assíncronas, então uma declaração de ferramenta bloqueante retorna um erro imediato em vez de enfileirar a chamada, e os clientes precisam ler o campo interaction_statusIN_PROGRESS enquanto o raciocínio ou uma ferramenta ainda está em execução, IDLE somente quando toda a tarefa é concluída — em vez de confiar em turnComplete para significar que o trabalho terminou. Migrar para GPT-Live-1 significa adotar sua engrenagem de seleção de backend e uma segunda superfície de cobrança, e conviver com uma API que só se tornou disponível de forma geral para desenvolvedores em 10 de setembro de 2026, depois de estrear no ChatGPT em 8 de julho — então ferramentas de terceiros, SDKs e observabilidade em torno dela têm meses de idade, não anos. Qualquer que seja a direção que você escolher, inclua no orçamento o trabalho de integração junto com a conta de tokens. Em uma stack de voz madura, a refatoração costuma ser a maior das duas.

Como realizar uma comparação como esta sem apostar nela

A maneira sensata de resolver uma questão de 1,1 ponto é executar ambos no seu próprio tráfego, e a parte incômoda é que fazer isso normalmente significa duas integrações, dois contratos e dois conjuntos de credenciais. Não precisa significar duas arquiteturas. Em ambos esses sistemas, o front-end de voz é uma camada fina sobre chamadas comuns a modelos de texto — para o GPT-Live-1, isso é explícito, e, do lado do Gemini, a execução de ferramentas em segundo plano se resolve da mesma forma — e é nessa camada de texto que reside a variação dos seus custos e onde a troca é realmente barata.

O OrcaRouter disponibiliza 190 modelos a partir de uma única chave pelo preço de lista do provedor, sem sobretaxa, portanto uma alteração de preço upstream entra em vigor do nosso lado no mesmo dia, em vez de na próxima renovação de contrato. Para uma stack de voz, as duas propriedades que importam são que o alvo de delegação pode ser trocado em tráfego em tempo real sem mexer na integração de voz, e que o failover automático mantém uma chamada ativa quando um backend apresenta erro ou atinge o tempo limite — o que permite testar uma configuração não comprovada em tráfego real sem colocar uma linha de produção por trás dela. Para ser preciso sobre o que hospedamos e o que não hospedamos: nem o endpoint Gemini 3.8 Live Extended Thinking nem o endpoint GPT-Live-1 estão no nosso roteador — esses vêm das próprias APIs do Google e da OpenAI. Os modelos de texto para os quais eles delegam com muita frequência estão no nosso roteador, e o Gemini 3.8 Flash está entre eles.

O topo da tabela, e quão pouco ele se estabiliza.

A captura abaixo foi feita em 16 de setembro de 2026:

Gemini 3.8 Live Extended Thinking (High) — 82,6, primeiro lugar

GPT-Live-1 (backend Astra, esforço médio) — 81,5

Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (backend Sol, esforço baixo) — 80.1

• Gemini 3.8 Live — 76,0

• GPT-Realtime-2.1 Alto — 73.9

• Gemini 3.1 Flash Live High — 71,5

Três coisas que merecem atenção. Primeiro, o primeiro e o terceiro lugares estão separados por 1,3 pontos, e o primeiro e o quinto por 6,6, então o topo deste placar é um aglomerado, não um ranking. Segundo, o modelo no título deste confronto não é a entrada Gemini em quinto lugar — trata-se do Gemini 3.8 Live padrão, um produto diferente e muito mais barato que não deve ser confundido com a variante de raciocínio que está sendo comparada aqui. Terceiro, há um precedente para tratar qualquer valor isolado de índice como provisório: a xAI relatou 82,9 para o Grok Voice Think Fast 2.0 em julho, e esse modelo aparece com 81,3 neste placar. Pontuações de índice divulgadas por fornecedores nem sempre sobrevivem ao contato com um ranking ao vivo. Os números de 68,6% e 67,9% do τ-Voice agora figuram em um placar público executado sob o próprio harness da Artificial Analysis, de modo que são corroborados, e não apenas alegados — mas uma diferença de 0,7 ponto entre dois modelos no mesmo harness não é uma diferença. Verifique no seu tráfego ou ignore.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Mais um número que merece entrar na decisão, porque é o dado mais incômodo desta comparação: o Google reporta 35,1% para o Gemini 3.8 Live Extended Thinking no leaderboard τ³-Banking da Sierra, contra 32,0% do GPT-Live-1 Astra. São números informados pelos próprios fornecedores, não reproduzidos, e descrevem um cenário em que o agente de voz líder nesse ranking falha em cerca de duas de cada três tentativas realistas de tarefas bancárias. Se o seu agente precisa concluir trabalho regulado e de várias etapas, nenhum desses modelos está pronto — e uma vantagem de 3,1 pontos nesse benchmark não é motivo para escolher um fornecedor, é motivo para manter um humano no circuito.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Então: se a naturalidade da conversa é o produto e as suas chamadas são curtas e densas, o comportamento full-duplex do GPT-Live-1 é uma vantagem real que o índice não consegue ver, e a cobrança pelo relógio de sessão é tolerável nessa duração de chamada. Se as chamadas são longas, silenciosas ou variáveis, ou se o raciocínio de fala e o custo por hora dominam, o Gemini 3.8 Live Extended Thinking está à frente nos componentes que importam e cerca de 40% mais barato por hora enquanto o faz — com a ressalva de que é baseado em turnos, ainda em preview para empresas e exige uma refatoração do cliente antes de executar as suas ferramentas. O que nada disto justifica é escolher um ou outro com base na força de 1,1 pontos de índice. Com as evidências disponíveis, a razão honesta para escolher entre estes dois é o modelo de cobrança e a arquitetura por baixo dele, e ambos são coisas que pode medir no seu próprio tráfego esta semana.

No OrcaRouter, o failover automático mantém uma chamada ativa quando um backend apresenta erro ou excede o tempo limite.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente