Um cartão de título hero com os dizeres 'GPT-Live-1 vs Gemini 3.5 Live Translate', com o subtítulo 'Um generalista lançado contra um especialista em prévia' e a linha 'GA a $0.05 por minuto vs prévia a cerca de $0.037 por minuto', acima de dois painéis: o da esquerda mostrando uma forma de onda de áudio full-duplex com setas curvando-se em ambas as direções e um selo 'GA' sólido, o da direita mostrando um globo com dois balões de fala e um selo 'PREVIEW' contornado, com o logotipo da OrcaRouter composto no canto.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate: Um Generalista Lançado Contra um Especialista em Pré-visualização

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esses dois modelos são comparados porque ambos colocam fala em tempo real em uma API, e a comparação desmorona no momento em que você lê as fichas técnicas dos modelos. O GPT-Live-1 é um modelo de voz full-duplex de uso geral que a OpenAI migrou para a API de desenvolvedores em 10 de setembro de 2026, três meses depois de ser lançado dentro do ChatGPT em 8 de julho. O Gemini 3.5 Live Translate é um modelo de tradução de áudio para áudio de finalidade única que o Google DeepMind lançou em 9 de junho de 2026, e seu ID de modelo ainda carrega a palavra preview. Um deles você pode colocar diante de clientes pagantes hoje, a um preço publicado. O outro, o Google pode mudar debaixo dos seus pés sem um aviso de descontinuação. É essa assimetria, e não a planilha de benchmark, que deve decidir a escolha.

Duas máquinas diferentes com o mesmo rótulo

Vale a pena ser franco sobre o quão pouco eles se sobrepõem. O Gem​ini 3.5 Live Translate faz tradução. Ele recebe áudio em streaming em um idioma e retorna áudio em streaming em outro, preservando a voz e o tom do falante, em mais de 70 idiomas e mais de 2.000 pares de idiomas, com detecção automática de idioma e operação bidirecional. Ele não mantém uma conversa, não chama uma função nem responde a uma pergunta. É um mecanismo de interpretação simultânea.

O GPT-Live-1 tem a forma oposta. É um modelo conversacional: ouve e fala ao mesmo tempo, decide muitas vezes por segundo se continua ouvindo, se faz uma pausa, se interrompe ou se chama uma ferramenta, e entrega o trabalho pesado — busca na web, raciocínio mais profundo, tarefas agênticas — a um modelo de raciocínio separado por meio da API Responses enquanto a conversa continua. O exemplo de WebRTC publicado pela própria Ope​nAI vincula essa delegação ao GPT-5.6 Terra. A tradução é uma das coisas que ele consegue fazer; não é um recurso para o qual o modelo da Goo​gle tenha qualquer equivalente na direção oposta.

Portanto, a questão prática é mais restrita do que o confronto de manchete sugere: se o que você está construindo é interpretação, o modelo do Goo​gle é feito especificamente para isso, enquanto o da Ope​nAI é de propósito geral. Se o que você está construindo é um agente de voz que traduz ocasionalmente, o GPT-Live-1 é o único dos dois que está sequer na categoria correta de produto.

Quanto custa cada um por minuto de áudio

É aqui que o especialista prova o seu valor, e a aritmética é verdadeiramente incómoda para a OpenAI.

• GPT-Live-1 — $0.05 por minuto de voz, faturado ao segundo em vez de arredondado para o minuto inteiro seguinte. Raciocínio e chamadas de ferramentas feitas pelo backend delegado são cobrados separadamente às tarifas normais desse modelo.

• Gemini 3.5 Live Translate — US$ 3,50 por milhão de tokens de entrada de áudio e US$ 21,00 por milhão de tokens de saída de áudio, com a cobrança calculada a 25 tokens por segundo de áudio. No total, isso resulta em aproximadamente US$ 0,037 por minuto de áudio traduzido.

Em minutos de tradução pura, o Goo​gle é cerca de um quarto mais barato. Isso não é uma diferença de arredondamento em escala: 10.000 minutos interpretados por mês custam cerca de US$ 500 na camada de voz do GPT-Live-1, contra aproximadamente US$ 368 no Gem​ini 3.5 Live Translate. E a diferença é real, e não um artefato da mudança de medição, porque os dois modelos cobram por unidades genuinamente diferentes.

Há um porém na direção oposta. O valor de destaque de US$ 0,05 para o GPT-Live-1 é o preço apenas da camada de voz. Se o seu agente traduz e também consulta algo, ou escala uma frase difícil para um modelo de raciocínio, você está pagando por essa delegação além disso — e o modelo delegado é cobrado por token como qualquer outro modelo de ponta. Uma carga de trabalho apenas de tradução nunca aciona isso. Uma carga de trabalho de tradução mais qualquer outra coisa aciona, e o vencedor da comparação por minuto deixa de ser óbvio.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

O rótulo de pré-visualização é o risco que ninguém precifica

O ID do modelo do Gem​ini 3.5 Live Translate é gemini-3.5-live-translate-preview. Ele foi lançado para a API Gem​ini Live e o Goo​gle AI Studio como uma prévia pública e, simultaneamente, no aplicativo Goo​gle Translate no Android e no iOS e em uma prévia privada no Goo​gle Meet para clientes selecionados do Workspace. Prévia significa o que sempre significou no Goo​gle: nenhuma garantia de estabilidade, nenhuma janela de descontinuação publicada, nenhum compromisso de que a tarifa que você está pagando sobreviva ao próximo lançamento.

Para um app de consumidor, isso é aceitável. Para as cargas de trabalho às quais este modelo realmente se destina — interpretação ao vivo em um call center, um produto de reuniões, um produto de viagens —, esse é o maior risco de integração da stack. Você está criando uma dependência de produção de um modelo com o qual o Google não se comprometeu explicitamente.

GPT-Live-1 tem o problema inverso, e é menor, mas não zero. Ele está em disponibilidade geral, a um preço publicado, com um endpoint documentado, e não vai desaparecer. Mas sua superfície de API é estreita de uma forma que surpreende equipes que assumem que ela se encaixa em uma integração OpenAI existente: há exatamente um ID de modelo, um endpoint, e nenhum caminho por meio de Chat Completions, Responses, Realtime, Batch, Assistants ou fine-tuning. A única forma de entrada é o endpoint Live Sessions em v1/live/sessions via WebRTC, com tratamento de eventos em um canal de dados. Isso é uma nova integração, não uma mudança de parâmetro.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Linguagens, e onde o generalista é honestamente mais fraco

A contagem do Goo​gle é de mais de 70 idiomas, com preservação de voz e tom. A documentação da própria Ope​nAI é notavelmente menos confiante sobre sua própria cobertura: o material de lançamento observa que, para certos idiomas, o modelo pode ter um sotaque não nativo ou apresentar lacunas de fluência, e não publica uma contagem de idiomas que concorra com a do Goo​gle.

Isso não é um fornecedor sendo evasivo — é o que um modelo conversacional generalista parece ao lado de um especialista treinado no problema. Se a proposta de valor do seu produto é "interpretamos 40 idiomas bem", o especialista é a escolha honesta e o generalista vai te deixar em situação embaraçosa na cauda longa. Se o seu produto é um agente de voz para um mercado de língua inglesa com um recurso de tradução encaixado à força, as lacunas de idioma do generalista nunca vão surgir.

Ambos os modelos inserem marca d'água no áudio gerado com o SynthID, o que importa se você estiver em uma jurisdição ou tiver um contrato de cliente que exija proveniência de fala sintética. Nesse ponto, não há diferença.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Onde a arquitetura de delegação altera o build

A diferença estrutural entre esses dois é que o GPT-Live-1 é, na verdade, dois modelos com uma costura no meio. A camada de voz mantém a conversa viva; um modelo de raciocínio separado faz o pensamento. É nessa costura que vai o seu esforço de engenharia, e também é onde o modelo de custos fica complicado.

Vale a pena saber que a metade delegada é um modelo de texto comum que você pode rotear como qualquer outro. O GPT-5.6 Terra, o backend no próprio exemplo da OpenAI, é servido via OrcaRouter a US$ 2,00 por milhão de tokens de entrada e US$ 12,00 por milhão de tokens de saída, com uma janela de contexto de 1M tokens e tanto /v1/chat/completions quanto /v1/responses expostos. Se você quiser trocar o cérebro de raciocínio por trás de um agente de voz — por um modelo mais barato em chamadas simples, ou um mais forte em escalações — essa metade da pilha tem opções, porque é uma chamada de API normal que fica ao lado de cerca de 190 outros modelos em uma única chave.

A parte de voz não. O GPT-Live-1 não está no OrcaRouter, e o Gem​ini 3.5 Live Translate também não; ambos estão disponíveis apenas no fornecedor que os criou. Onde um roteador conquista seu lugar em uma arquitetura como esta é em tudo o que vem depois do áudio: os modelos de texto que fazem a recuperação, a sumarização, a gravação de retorno no CRM e o escalonamento, que é a metade da conta que você pode realmente consolidar em uma única chave e uma única fatura.

O que realmente escolher

• Escolha Gem​ini 3.5 Live Translate se a tradução for o produto, se o preço por minuto importar mais do que a estabilidade contratual e se você puder absorver um modelo de prévia mudando sob seus pés. Orce cerca de US$ 0,037 por minuto e mantenha uma camada de abstração sobre a chamada para que um modelo GA possa substituí-lo sem uma reescrita.

• Escolha o GPT-Live-1 se você precisa de um agente conversacional que, por acaso, também traduz; se precisa de chamada de funções e uso de ferramentas dentro do loop de voz; ou se uma equipe de compras vai perguntar o que acontece quando o modelo for descontinuado e você precisa de uma resposta melhor que "nada, provavelmente".

• Não escolha nenhum dos dois só porque ele venceu um benchmark. Os benchmarks de ambos os lados não são comparáveis — os números full-duplex da Ope​nAI são próprios dela, não reproduzidos por nenhum terceiro, e as alegações de linguagem da Goo​gle não foram testadas contra um generalista no mesmo conjunto de áudio.

Uma nota prospectiva: as duas superfícies estão convergindo, em vez de colidir. O modelo de tradução do Google já vive dentro do Gemini Live, e a camada de voz do GPT-Live-1 foi projetada explicitamente para que novos modelos de fronteira sejam colocados por trás dela. A expectativa razoável é que, dentro de alguns ciclos de lançamento, a tradução do generalista melhore e a narrativa de integração do especialista se torne menos uma aposta. Se você está construindo hoje e a decisão está equilibrada, isso é um argumento a favor da opção mais barata e mais substituível, e de manter o caminho de áudio isolado atrás de uma interface de qualquer forma.