Cartão de título principal para Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live, mostrando os dois modelos separados por um custo de áudio horário 4 vezes maior, $3.50 contra $0.84.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs. Gemini 3.8 Live: Pagar 4x pelos 38 Pontos que Importam

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois modelos, um lançamento, uma tabela de preços e uma decisão que a maioria das análises erra na mesma direção. Gemini 3.8 Live Extended Thinking e Gemini 3.8 Live foram lançados juntos em 15 de setembro de 2026, ambos construídos sobre o Gemini 3 Pro, ambos lidando com 97 idiomas com troca automática no meio da conversa, ambos aceitando entrada visual quase em tempo real, ambos aplicando marca d'água em áudio gerado com SynthID. No índice composto Speech to Speech Index publicado pela Artificial Analysis, há 6,6 pontos de diferença entre eles — 82,6 contra 76,0. No custo horário de áudio medido por esse mesmo painel, há uma diferença de pouco mais de quatro vezes entre eles.

Nenhum desses é o número que deveria decidir a sua arquitetura. O número que deveria é 38: a diferença entre os dois no τ-Voice, o componente agêntico de conclusão de tarefas, em que a variante de raciocínio resolve 68,6% dos cenários replicados de atendimento ao cliente e a variante padrão resolve 30,1%. Você não está escolhendo entre um modelo bom e um modelo melhor. Você está escolhendo entre uma interface conversacional e um sistema de raciocínio que por acaso fala, e a diferença de preço é a coisa menos interessante dessa escolha.

A bifurcação de preços, nas unidades em que você realmente é cobrado

Comece pela conta, porque é a parte que as pessoas acertam e depois dão peso demais. Ambos os modelos têm a mesma tarifa publicada pela Live API: US$ 0,005 por minuto de entrada de áudio e US$ 0,018 por minuto de saída de áudio, e, no lado do Extended Thinking, esses tokens de saída incluem o raciocínio. Mesmo cartão, mesmas tarifas, sem nível premium separado para raciocínio.

A divergência aparece quando se mede trabalho em vez de minutos. A coluna de custo por hora de áudio de entrada da Artificial Analysis — o custo de concluir um subconjunto fixo de 40 perguntas do Big Bench Audio, normalizado para um valor por hora — coloca os dois modelos em faixas completamente diferentes:

Gemini 3.8 Live Extended Thinking (High) — $3,50 por hora de áudio de entrada, segundo a própria medição da Artificial Analysis

Gemini 3.8 Live — $0,84 por hora, a taxa de remuneração mais baixa nesse quadro

• GPT-Live-1 (backend Astra, esforço médio) — $5,83 por hora, então a variante de raciocínio ainda custa cerca de 40% menos que o modelo que supera

Grok Voice Think Fast 2.0 High — US$ 4,80 por hora

• GPT-Realtime-2.1 High — $10,75 por hora

É essa a bifurcação: quatro vezes o custo por hora de áudio, com a mesma tarifa publicada por minuto, porque a variante de raciocínio gasta mais tokens para fazer a mesma quantidade de escuta. Os US$ 0,84 do modelo padrão não são um desconto: são o piso de toda a tabela.

O que os 38 pontos compram

Separe o composto e os dois modelos deixam de parecer um par:

Índice de Fala para Fala — Gemini 3.8 Live Extended Thinking (High) 82,6 vs Gemini 3.8 Live 76,0

Desempenho agêntico (conclusão de tarefas do τ-Voice) — 68,6% vs 30,1%

Raciocínio de fala (Big Bench Audio) — 98% vs 92%

Dinâmica conversacional — 91,9% vs 96,1%

Preferência de arena (Elo) — 990 vs 1083

Taxa de sucesso das tarefas — 89,1% vs 93,2%

Tempo até o primeiro áudio — 1,35s vs 1,18s

Custo por hora de áudio de entrada — $3,50 vs $0,84

Leia isso com honestidade e o modelo mais barato vence quatro das oito linhas. Ele é mais rápido até o primeiro áudio, é o preferido pela arena, tem mais chance de concluir uma tarefa superficial e é avaliado melhor em dinâmica conversacional — e este último ponto não é prêmio de consolação, porque a dinâmica conversacional é o que quem liga percebe. O que ele não consegue fazer é terminar um trabalho que tenha etapas. Trinta e um vírgula um por cento contra 68,6% é a maior diferença isolada em qualquer ponto deste lançamento, e recai sobre o único eixo que separa um agente de uma interface.

Duas ressalvas sobre essas linhas. O valor de preferência da arena dentro do índice fica congelado no momento em que um modelo se torna elegível para publicação, portanto é um instantâneo, e não um Elo contínuo — leia-o como uma avaliação pontual e não como o gráfico ao vivo do Speech Agent Arena. E o topo do ranking τ-Voice está acirrado: os 68,6% da variante de raciocínio lideram o GPT-Live-1, com 67,9% (backend Astra, esforço médio), por 0,7 ponto, com GPT-Live-1 (Sol, esforço baixo) a 59,3% e Grok Voice Think Fast 2.0 High a 56,5%, atrás. A vantagem de 0,7 ponto sobre o GPT-Live-1 está dentro do ruído. A diferença de 38 pontos dentro deste par não está dentro do ruído.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

O outro 4x: o que o nível de raciocínio custa a você em código

Há um segundo fork nesta versão, e ele não aparece em nenhum ranking. Os dois modelos não são intercambiáveis sem alterações, porque a variante de raciocínio muda o contrato que o seu cliente tem de cumprir.

No modelo padrão, Gemini 3.8 Live se comporta como um cliente da Live API espera: chamadas de ferramentas e APIs em segundo plano são executadas enquanto o modelo continua falando, e turnComplete: true ainda marca o fim de um turno. Não há configuração de nível de pensamento para escolher, porque não há nada separado para configurar — o modelo responde e, quando tiver respondido, o turno termina.

No Gemini 3.8 Live Extended Thinking, três coisas mudam ao mesmo tempo:

As chamadas de função são sempre assíncronas. Uma declaração de ferramenta de bloqueio não entra em fila educadamente — ela retorna um erro grave. Qualquer esquema de ferramenta que você escreveu para o modelo padrão precisa ser redeclarado como não bloqueante.

Um novo campo de status carrega o estado real. Os clientes precisam ler interaction_status em vez de confiar em turnComplete: o campo fica como IN_PROGRESS enquanto o modelo ainda está raciocinando ou uma ferramenta ainda está em execução, e só se estabiliza em IDLE quando toda a tarefa é concluída. Um turno pode terminar enquanto a tarefa ainda não terminou.

A profundidade de pensamento é um ajuste. O modelo expõe níveis de raciocínio configuráveis — baixo, médio e alto — e os valores 82,6 e 68,6 no quadro são a (Alta) configuração. Mudar para baixo altera tanto a qualidade quanto o custo de tokens, e nada no índice informa o que o nível baixo custa em termos de conclusão de tarefas.

Esse terceiro ponto é a armadilha da migração. Como o Extended Thinking responde da mesma forma na rede que o modelo padrão até que uma chamada de ferramenta entre em jogo, uma equipe pode trocar o ID do modelo, ver uma demonstração funcional e só descobrir o contrato assíncrono em produção quando uma ferramenta de reserva retorna um erro em vez de um resultado. Reserve orçamento para a refatoração do cliente junto com a taxa de áudio 4×; em uma integração madura, ela é o maior dos dois custos.

Qual deles sua carga de trabalho está realmente pedindo?

A forma mais simples de decidir é perguntar para que serve a sessão, não quão inteligente você quer que ela seja.

Escolha o Gemini 3.8 Live quando a conversa for o entregável. Responder, manter o fio da conversa, anotar um recado, qualificar quem liga, ser agradável, rápido e barato. A US$ 0,84 por hora de áudio de entrada, é o modelo de voz competente mais barato publicado atualmente por qualquer pessoa, é o preferido pela arena, é mais confiável em tarefas superficiais e é 170 milissegundos mais rápido até o primeiro áudio — uma diferença que quem liga sente. A única coisa a aceitar é o teto: 30,1% na conclusão de tarefas com várias etapas significa que ele não concluirá trabalho que tenha etapas, e nenhuma quantidade de engenharia de prompt muda esse número.

Escolha Gemini 3.8 Live Extended Thinking quando a sessão tiver uma tarefa. Agendar, alterar, cancelar, resolver um problema de conta, conduzir um interlocutor por um processo de várias etapas enquanto ele espera. Essa é a linha de 38 pontos, e vale US$ 3,50 por hora — o que, veja bem, ainda é mais barato que ambos os modelos que ele supera na pontuação composta. Você também obtém o comportamento de narração que torna a espera tolerável: este modelo raciocina e fala ao mesmo tempo, então, em vez de silêncio enquanto consulta algo, o interlocutor ouve "Deixe-me verificar isso…" e o progresso conforme avança. Esse é o mesmo problema que as arquiteturas full-duplex resolvem ao nunca interromper o áudio; a resposta do Google é continuar falando durante o trabalho.

Mais duas linhas que merecem ponderação. O Google também relata 35,1% para o modelo Extended Thinking no leaderboard τ³-Banking da Sierra, contra 32,0% do GPT-Live-1 Astra — um número informado pelo fornecedor, sem nenhuma medição independente por trás dele, e preocupante em termos absolutos, já que 35,1% significa que o melhor modelo desse leaderboard falha em cerca de duas de cada três tentativas realistas de tarefas bancárias. E o segundo lugar do modelo padrão na Speech Agent Arena, que o Google cita em seus próprios materiais, é um resultado real em um leaderboard diferente, que mede preferência e não conclusão de tarefas. Ambas as afirmações se sustentam. Juntas, elas dizem que o modelo barato é muito bom quando se conversa com ele e que o modelo caro é o único dos dois ao qual se pode dar trabalho.

Executando ambos, sem duas integrações

A objeção prática a tudo isso é que escolher por carga de trabalho significa manter dois caminhos. Não precisa ser assim. Ambas as variantes ficam à frente da mesma classe de backend — a execução de ferramentas em segundo plano e o planejamento em várias etapas se resolvem em chamadas comuns a modelos de texto — e é nessa camada que reside a variação de custo e onde a troca é barata.

A OrcaRouter disponibiliza 190 modelos a partir de uma única chave, pelo preço de tabela do provedor e sem margem adicional, de modo que uma alteração de preços do fornecedor entra em vigor do nosso lado no mesmo dia, e não na próxima renovação de contrato. Para uma stack que encaminha entre um nível conversacional barato e um nível de raciocínio caro, as duas propriedades que importam são que o alvo da delegação pode ser trocado com tráfego ativo sem mexer na integração de voz, e que o failover automático mantém uma sessão ativa quando um backend dá erro ou expira o tempo limite. Para ser preciso quanto ao que hospedamos e ao que não hospedamos: os endpoints Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking não estão no nosso roteador — eles vêm da própria API do Google, na Gemini API, na Live API e no Google AI Studio. Os modelos de texto para os quais esses agentes delegam o seu trabalho muitas vezes estão, e o Gemini 3.8 Flash é um deles.

Onde cada modelo se situa no tabuleiro

A captura abaixo foi tirada em 16 de setembro de 2026, e o topo do Speech to Speech Index diz o seguinte:

Gemini 3.8 Live Extended Thinking (High) — 82,6, primeiro lugar

• GPT-Live-1 (backend Astra, esforço médio) — 81,5

• Grok Voice Think Fast 2.0 High — 81,3

• GPT-Live-1 (backend Sol, esforço baixo) — 80.1

Gemini 3.8 Live — 76,0, quinto lugar

• GPT-Realtime-2.1 Alto — 73.9

• Gemini 3.1 Flash Live High — 71,5

Uma nota sobre nomenclatura enquanto você lê essa lista: o (High) sufixo anexado a este modelo na cobertura é um rótulo de configuração de esforço de raciocínio, não um lançamento separado. É a mesma convenção que o board usa para Grok Voice Think Fast 2.0 High e GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

O que ainda não foi commitado

Há uma coisa neste par que é fácil de interpretar mal, por isso vale a pena dizer claramente: nenhum dos modelos está disponível em geral no sentido contratual, mesmo que ambos tenham preço e documentação.

Desenvolvedores recebem Gemini 3.8 Live na Gemini API, na Live API e no Google AI Studio com o ID gemini-3.8-live; empresas têm prévia privada no Gemini Enterprise, com o Gemini Enterprise for Customer Experience listado como "em breve"; consumidores o recebem no Search Live. Gemini 3.8 Live Extended Thinking tem a mesma superfície para desenvolvedores com gemini-3.8-live-extended-thinking, além de um caminho mais amplo para consumidores — Gemini Live, Docs Live para assinantes do Google AI Pro e Ultra, e Gmail Live e Keep Live para todos os assinantes do Google AI. Clientes empresariais do Workspace estão listados como "em breve".

O que falta é aquilo de que uma empresa precisa antes de pôr uma linha de receita nisto: um compromisso de disponibilidade geral, um valor de uptime publicado e uma tarifa que a Google prometeu manter. Os preços são publicados, e os preços de pré-visualização têm por hábito mudar. Faça o protótipo agora, planeie a migração e não assine um objetivo de disponibilidade que não lhe tenha sido dado.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

A decisão que este par realmente apresenta é mais estreita do que o índice faz parecer, e não é uma escada de qualidade. Se o trabalho do seu agente é conversar, o modelo barato não é um meio-termo — é o melhor produto pelo preço mais baixo, e a tarifa quatro vezes mais barata é um bônus, e não o argumento. Se o trabalho do seu agente é concluir algo, a variante de raciocínio é a única das duas que pode sequer receber a tarefa, e US$ 3,50 por hora é um erro de arredondamento diante de uma reserva que, de outra forma, falha. O erro a evitar é dividir a diferença: pagar por profundidade de raciocínio em uma carga de trabalho que só precisava de uma boa conversa, que é o que acontece quando uma equipe lê a lacuna composta de 6,6 pontos e nunca rola a página até o 38.