
GPT-Live-1 vs Gemini 3.5 Live Translate: Um Generalista Lançado Contra um Especialista em Pré-visualização
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Esses dois modelos são comparados porque ambos colocam fala em tempo real em uma API, e a comparação desmorona no momento em que você lê as fichas técnicas dos modelos. O GPT-Live-1 é um modelo de voz full-duplex de uso geral que a OpenAI migrou para a API de desenvolvedores em 10 de setembro de 2026, três meses depois de ser lançado dentro do ChatGPT em 8 de julho. O Gemini 3.5 Live Translate é um modelo de tradução de áudio para áudio de finalidade única que o Google DeepMind lançou em 9 de junho de 2026, e seu ID de modelo ainda carrega a palavra preview. Um deles você pode colocar diante de clientes pagantes hoje, a um preço publicado. O outro, o Google pode mudar debaixo dos seus pés sem um aviso de descontinuação. É essa assimetria, e não a planilha de benchmark, que deve decidir a escolha.
Duas máquinas diferentes com o mesmo rótulo
Vale a pena ser franco sobre o quão pouco eles se sobrepõem. O Gemini 3.5 Live Translate faz tradução. Ele recebe áudio em streaming em um idioma e retorna áudio em streaming em outro, preservando a voz e o tom do falante, em mais de 70 idiomas e mais de 2.000 pares de idiomas, com detecção automática de idioma e operação bidirecional. Ele não mantém uma conversa, não chama uma função nem responde a uma pergunta. É um mecanismo de interpretação simultânea.
O GPT-Live-1 tem a forma oposta. É um modelo conversacional: ouve e fala ao mesmo tempo, decide muitas vezes por segundo se continua ouvindo, se faz uma pausa, se interrompe ou se chama uma ferramenta, e entrega o trabalho pesado — busca na web, raciocínio mais profundo, tarefas agênticas — a um modelo de raciocínio separado por meio da API Responses enquanto a conversa continua. O exemplo de WebRTC publicado pela própria OpenAI vincula essa delegação ao GPT-5.6 Terra. A tradução é uma das coisas que ele consegue fazer; não é um recurso para o qual o modelo da Google tenha qualquer equivalente na direção oposta.
Portanto, a questão prática é mais restrita do que o confronto de manchete sugere: se o que você está construindo é interpretação, o modelo do Google é feito especificamente para isso, enquanto o da OpenAI é de propósito geral. Se o que você está construindo é um agente de voz que traduz ocasionalmente, o GPT-Live-1 é o único dos dois que está sequer na categoria correta de produto.
Quanto custa cada um por minuto de áudio
É aqui que o especialista prova o seu valor, e a aritmética é verdadeiramente incómoda para a OpenAI.
• GPT-Live-1 — $0.05 por minuto de voz, faturado ao segundo em vez de arredondado para o minuto inteiro seguinte. Raciocínio e chamadas de ferramentas feitas pelo backend delegado são cobrados separadamente às tarifas normais desse modelo.
• Gemini 3.5 Live Translate — US$ 3,50 por milhão de tokens de entrada de áudio e US$ 21,00 por milhão de tokens de saída de áudio, com a cobrança calculada a 25 tokens por segundo de áudio. No total, isso resulta em aproximadamente US$ 0,037 por minuto de áudio traduzido.
Em minutos de tradução pura, o Google é cerca de um quarto mais barato. Isso não é uma diferença de arredondamento em escala: 10.000 minutos interpretados por mês custam cerca de US$ 500 na camada de voz do GPT-Live-1, contra aproximadamente US$ 368 no Gemini 3.5 Live Translate. E a diferença é real, e não um artefato da mudança de medição, porque os dois modelos cobram por unidades genuinamente diferentes.
Há um porém na direção oposta. O valor de destaque de US$ 0,05 para o GPT-Live-1 é o preço apenas da camada de voz. Se o seu agente traduz e também consulta algo, ou escala uma frase difícil para um modelo de raciocínio, você está pagando por essa delegação além disso — e o modelo delegado é cobrado por token como qualquer outro modelo de ponta. Uma carga de trabalho apenas de tradução nunca aciona isso. Uma carga de trabalho de tradução mais qualquer outra coisa aciona, e o vencedor da comparação por minuto deixa de ser óbvio.

O rótulo de pré-visualização é o risco que ninguém precifica
O ID do modelo do Gemini 3.5 Live Translate é gemini-3.5-live-translate-preview. Ele foi lançado para a API Gemini Live e o Google AI Studio como uma prévia pública e, simultaneamente, no aplicativo Google Translate no Android e no iOS e em uma prévia privada no Google Meet para clientes selecionados do Workspace. Prévia significa o que sempre significou no Google: nenhuma garantia de estabilidade, nenhuma janela de descontinuação publicada, nenhum compromisso de que a tarifa que você está pagando sobreviva ao próximo lançamento.
Para um app de consumidor, isso é aceitável. Para as cargas de trabalho às quais este modelo realmente se destina — interpretação ao vivo em um call center, um produto de reuniões, um produto de viagens —, esse é o maior risco de integração da stack. Você está criando uma dependência de produção de um modelo com o qual o Google não se comprometeu explicitamente.
GPT-Live-1 tem o problema inverso, e é menor, mas não zero. Ele está em disponibilidade geral, a um preço publicado, com um endpoint documentado, e não vai desaparecer. Mas sua superfície de API é estreita de uma forma que surpreende equipes que assumem que ela se encaixa em uma integração OpenAI existente: há exatamente um ID de modelo, um endpoint, e nenhum caminho por meio de Chat Completions, Responses, Realtime, Batch, Assistants ou fine-tuning. A única forma de entrada é o endpoint Live Sessions em v1/live/sessions via WebRTC, com tratamento de eventos em um canal de dados. Isso é uma nova integração, não uma mudança de parâmetro.

Linguagens, e onde o generalista é honestamente mais fraco
A contagem do Google é de mais de 70 idiomas, com preservação de voz e tom. A documentação da própria OpenAI é notavelmente menos confiante sobre sua própria cobertura: o material de lançamento observa que, para certos idiomas, o modelo pode ter um sotaque não nativo ou apresentar lacunas de fluência, e não publica uma contagem de idiomas que concorra com a do Google.
Isso não é um fornecedor sendo evasivo — é o que um modelo conversacional generalista parece ao lado de um especialista treinado no problema. Se a proposta de valor do seu produto é "interpretamos 40 idiomas bem", o especialista é a escolha honesta e o generalista vai te deixar em situação embaraçosa na cauda longa. Se o seu produto é um agente de voz para um mercado de língua inglesa com um recurso de tradução encaixado à força, as lacunas de idioma do generalista nunca vão surgir.
Ambos os modelos inserem marca d'água no áudio gerado com o SynthID, o que importa se você estiver em uma jurisdição ou tiver um contrato de cliente que exija proveniência de fala sintética. Nesse ponto, não há diferença.

Onde a arquitetura de delegação altera o build
A diferença estrutural entre esses dois é que o GPT-Live-1 é, na verdade, dois modelos com uma costura no meio. A camada de voz mantém a conversa viva; um modelo de raciocínio separado faz o pensamento. É nessa costura que vai o seu esforço de engenharia, e também é onde o modelo de custos fica complicado.
Vale a pena saber que a metade delegada é um modelo de texto comum que você pode rotear como qualquer outro. O GPT-5.6 Terra, o backend no próprio exemplo da OpenAI, é servido via OrcaRouter a US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de tokens de saída, com uma janela de contexto de 1M tokens e tanto /v1/chat/completions quanto /v1/responses expostos. Se você quiser trocar o cérebro de raciocínio por trás de um agente de voz — por um modelo mais barato em chamadas simples, ou um mais forte em escalações — essa metade da pilha tem opções, porque é uma chamada de API normal que fica ao lado de cerca de 190 outros modelos em uma única chave.
A parte de voz não. O GPT-Live-1 não está no OrcaRouter, e o Gemini 3.5 Live Translate também não; ambos estão disponíveis apenas no fornecedor que os criou. Onde um roteador conquista seu lugar em uma arquitetura como esta é em tudo o que vem depois do áudio: os modelos de texto que fazem a recuperação, a sumarização, a gravação de retorno no CRM e o escalonamento, que é a metade da conta que você pode realmente consolidar em uma única chave e uma única fatura.
O que realmente escolher
• Escolha Gemini 3.5 Live Translate se a tradução for o produto, se o preço por minuto importar mais do que a estabilidade contratual e se você puder absorver um modelo de prévia mudando sob seus pés. Orce cerca de US$ 0,037 por minuto e mantenha uma camada de abstração sobre a chamada para que um modelo GA possa substituí-lo sem uma reescrita.
• Escolha o GPT-Live-1 se você precisa de um agente conversacional que, por acaso, também traduz; se precisa de chamada de funções e uso de ferramentas dentro do loop de voz; ou se uma equipe de compras vai perguntar o que acontece quando o modelo for descontinuado e você precisa de uma resposta melhor que "nada, provavelmente".
• Não escolha nenhum dos dois só porque ele venceu um benchmark. Os benchmarks de ambos os lados não são comparáveis — os números full-duplex da OpenAI são próprios dela, não reproduzidos por nenhum terceiro, e as alegações de linguagem da Google não foram testadas contra um generalista no mesmo conjunto de áudio.
Uma nota prospectiva: as duas superfícies estão convergindo, em vez de colidir. O modelo de tradução do Google já vive dentro do Gemini Live, e a camada de voz do GPT-Live-1 foi projetada explicitamente para que novos modelos de fronteira sejam colocados por trás dela. A expectativa razoável é que, dentro de alguns ciclos de lançamento, a tradução do generalista melhore e a narrativa de integração do especialista se torne menos uma aposta. Se você está construindo hoje e a decisão está equilibrada, isso é um argumento a favor da opção mais barata e mais substituível, e de manter o caminho de áudio isolado atrás de uma interface de qualquer forma.
