
Gemini 3.8 Live vs GPT-Live-1: Full-Duplex vs o Modelo Que Pensa Enquanto Fala
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Durante cerca de dois meses, a discussão foi resolvida pela arquitetura. GPT-Live-1 é genuinamente full-duplex — ele ouve enquanto fala, produz backchannels como "mhmm" e "entendi", e decide várias vezes por segundo se fala ou cede a vez. Gemini 3.8 Live, anunciado em 15 de setembro de 2026, é um modelo baseado em turnos. Sob o enquadramento antigo, isso tornava a comparação fácil, e agora é a maneira errada de interpretá-la.
O que mudou não é que o Google tenha alcançado o full-duplex. É que o Google lançou aquilo que o full-duplex estava sendo usado para compensar: um modelo de voz capaz de manter uma conversa enquanto uma tarefa de várias etapas roda em segundo plano, e uma segunda variante que raciocina em voz alta enquanto trabalha. A diferença arquitetural é real. Ela simplesmente já não é o eixo que decide a compra.
Duas maneiras de manter uma conversa viva
A aposta do full-duplex é que a qualidade da conversa é o produto. O GPT-Live-1 processa o áudio de entrada e de saída de forma contínua e síncrona dentro de um único modelo, em vez de encadear fala para texto, depois um modelo de linguagem e depois texto para fala. Isso elimina a perda de informação entre as etapas e gera o comportamento que as pessoas realmente notam: você pode interromper no meio da resposta e ele se adapta; ele não confunde uma pausa ou um ruído de fundo com o fim da sua vez; ele permanece em silêncio até ser chamado.
A aposta baseada em turnos que o Gemini 3.8 Live faz é que a conversa é o andaime para o trabalho. Seus recursos visam manter a sessão produtiva, em vez de manter o ritmo natural: processamento de entrada visual quase em tempo real, transição automática entre 97 idiomas suportados no meio da conversa, e execução de ferramentas e APIs em segundo plano que reconhece uma solicitação e continua falando enquanto a chamada é concluída.
Ambos os modelos se recusam a desligar na sua cara enquanto pensam. Eles só se recusam de maneiras diferentes. O GPT-Live-1 faz isso nunca interrompendo o fluxo de áudio. O Google faz isso falando por cima do trabalho.

O que o índice realmente diz
A Artificial Analysis mantém um Speech to Speech Index — um composto ponderado de raciocínio de fala, desempenho agêntico, preferência de arena e taxa de sucesso em tarefas. Leia com atenção o quadro capturado em 16 de setembro de 2026, porque a manchete esconde a estrutura:
• Gemini 3.8 Live Pensamento Estendido — 82,6 (primeiro)
• GPT-Live-1 (backend Astra, esforço médio) — 81,5
• Grok Voice Think Fast 2.0 High — 81,3
• GPT-Live-1 (backend Sol, esforço baixo) — 80.1
• Gemini 3.8 Live — 76,0
• GPT-Realtime-2.1 Alto — 73.9
• Gemini 3.1 Flash Live High — 71,5
Três coisas decorrem dessa ordenação. Primeiro, o Google ocupa o primeiro lugar, mas ocupa-o com a variante cara, e não com a que a maioria das pessoas vai implantar. Segundo, o GPT-Live-1 aparece duas vezes, porque a Artificial Analysis avalia o sistema inteiro, e não o front-end de voz — e a diferença de 1,4 pontos entre as suas duas configurações é sete vezes maior do que a diferença de 0,2 pontos entre o primeiro e o segundo lugar. Terceiro, o modelo que dá título a este confronto, Gemini 3.8 Live, está em quinto lugar, abaixo de ambas as configurações do GPT-Live-1.
Se você está comparando em condições iguais — o nível padrão contra o nível padrão —, o GPT-Live-1 vence este confronto no índice composto, e não é por pouco. O 82,6 pertence ao Gemini 3.8 Live Extended Thinking, que é um produto diferente, com um preço diferente e uma implantação diferente.

Onde o GPT-Live-1 ainda está à frente
Full-duplex não é um diferencial de marketing, e a divisão do benchmark mostra onde ele se traduz em vantagem real:
• Desempenho agêntico — O GPT-Live-1 lidera decisivamente no τ-Voice, com 67,9% contra os 56,5% do Grok. O Google não publicou um valor comparável de τ-Voice para o Gemini 3.8 Live, apenas 68,6% para a variante Extended Thinking.
• Dinâmica conversacional — a tomada de turnos em full-duplex continua sendo a referência de naturalidade, e os modelos baseados em turnos historicamente ficaram atrás nesse aspecto.
• Profundidade de delegação — O GPT-Live-1 encaminha consultas difíceis para um modelo de texto de fronteira, com GPT-5.5 e GPT-6 Astra ambos documentados como backends, e expõe seletores de esforço de raciocínio.
• Obtenção de fontes — as transcrições de voz do ChatGPT trazem links de citação, o que continua incomum em interações de voz em geral.
O contrapeso é que o GPT-Live-1 fica atrás no raciocínio de fala bruto: 90,1% no Big Bench Audio contra 97,2% do Grok. E seu número de latência de destaque de 0,798 segundo no Full Duplex Bench é uma medição diferente do tempo até o primeiro áudio da API, que fica entre 1,24 e 1,34 segundos.
Onde o Gemini 3.8 Live está à frente
As vantagens do Google são menos sobre conversação e mais sobre o que a sessão pode fazer:
• Visão, hoje — O Gemini já oferece suporte a entrada de câmera e compartilhamento de tela há um bom tempo. O GPT-Live-1 foi lançado sem vídeo ou compartilhamento de tela, com a OpenAI afirmando que esses recursos estão por vir e apontando o antigo Advanced Voice Mode como solução temporária. O Gemini 3.8 Live acrescenta a isso o processamento de entrada visual quase em tempo real.
• Cobertura de idiomas — 97 idiomas suportados com troca automática no meio da conversa, contra uma oferta muito mais restrita do lado da OpenAI.
• Custo — a tarifa anunciada é de US$ 0,005 por minuto de entrada de áudio e US$ 0,018 por minuto de saída de áudio. O GPT-Live-1 é cobrado a US$ 0,05 por minuto de voz apenas pelo front-end, com um custo total medido de aproximadamente US$ 4,47–US$ 5,83 por hora depois de contabilizar os tokens de back-end.
• Uma segunda camada que raciocina em voz alta — o Gemini 3.8 Live Extended Thinking narra o progresso com indicações como "Deixe-me verificar…", o que é uma resposta diferente ao problema do silêncio do que o full-duplex.
A comparação de custos que importa
As tarifas do front-end parecem uma goleada — US$ 0,018 contra US$ 0,05 por minuto — e os números por hora são ainda mais gritantes. O gráfico de custo por hora de áudio de entrada da Artificial Analysis coloca o Gemini 3.8 Live em US$ 1,50 por hora, contra US$ 4,14 para o GPT-Realtime-2 High e US$ 10,75 para o GPT-Realtime-2.1 High. O Grok Voice Think Fast 2.0 fica em US$ 4,80.
O problema é que nenhum dos dois números é a conta real. Os $0.05 por minuto do GPT-Live-1 cobrem apenas o front-end de voz; o modelo de texto de backend que faz o raciocínio de fato é cobrado separadamente, e é assim que um preço anunciado de $0.05 se transforma em $4.47–$5.83 por hora, com tudo incluído. O Gemini 3.8 Live tem a mesma forma estrutural — a execução de ferramentas em segundo plano é trabalho de modelo de texto — e o Google não publicou quanto isso custa.
Então, a leitura honesta é que o Gemini 3.8 Live é mais barato já de entrada, por uma margem ampla, e a comparação de custo total é desconhecida para ambos até você medir sua própria carga de trabalho. Isso não é uma esquiva; é o estado atual da informação.
A camada para a qual ambos delegam
Aqui está o fato estrutural que faz esta comparação ser uma decisão de lock-in menos definitiva do que parece. Ambos os modelos delegam. O GPT-Live-1 encaminha consultas difíceis para um modelo de texto de back-end por design, e a execução de ferramentas em segundo plano do lado do Gemini resulta em chamadas comuns de modelo. Em ambos os casos, o front-end de voz é uma camada fina sobre um modelo de texto que faz o raciocínio — e é nessa camada de texto que reside a variação dos seus custos e onde a troca é barata.
O OrcaRouter oferece 190 modelos por trás de uma única chave, pelo preço de tabela do provedor e sem markup, então um corte de preço upstream chega ao nosso lado no mesmo dia, em vez de só na próxima renovação de contrato. Para uma pilha de voz, as duas propriedades que importam são que o alvo de delegação pode ser trocado em tráfego ao vivo sem tocar na integração de voz, e que o failover automático mantém uma chamada ativa quando um backend dá erro ou atinge o tempo limite. Um esclarecimento, porque é fácil dar a entender o contrário: não hospedamos os endpoints de voz Gemini 3.8 Live ou GPT-Live-1 — eles vêm das próprias APIs dos fornecedores. Os modelos de texto aos quais eles encaminham trabalho geralmente estão no roteador.

Como escolher
Escolha o GPT-Live-1 se a qualidade da conversa é o produto — tratamento natural de interrupções, backchannels e a sensação de que você está falando com algo em vez de estar operando-o — e se você puder absorver o custo total, que é substancialmente mais alto do que a tarifa anunciada sugere. Observe que sua API só ficou disponível em setembro de 2026, então as ferramentas de terceiros em torno dela ainda são recentes.
Escolha o Gemini 3.8 Live se você precisa de visão agora, se precisa de mais de duas dúzias de idiomas, ou se a economia por minuto domina o seu modelo. Aceite que você está comprando o nível padrão, que fica em quinto lugar no índice composto, e não em primeiro, e que o 82,6 que todo mundo vai citar pertence à variante Extended Thinking.
Escolha Gemini 3.8 Live Extended Thinking se o raciocínio é o ponto e você quer o atual líder do índice — mas verifique sua implantação primeiro, porque seu caminho de distribuição pelo Gemini Live, Docs, Gmail e Keep é mais amplo do que o do modelo padrão, e sua disponibilidade empresarial ainda está em prévia privada.
O que observar no próximo trimestre é se o full-duplex continua sendo um fosso competitivo. Modelos baseados em turnos estão fechando a lacuna conversacional por um caminho diferente — mantendo o áudio ocupado com narração enquanto o trabalho acontece — e, se isso se sustentar sob tráfego real, a distinção arquitetural que definiu esta categoria por um ano deixará de ser aquilo sobre o que os compradores perguntam.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
