
GPT-Live-1 vs SeedRealtime: SeedRealtime é o modelo mais ambicioso, e você não pode comprá-lo
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
A comparação entre GPT-Live-1 e SeedRealtime em termos de capacidade produz uma resposta desconfortável, porque os dois modelos não estão competindo nas mesmas condições. GPT-Live-1 é o modelo de voz full-duplex da OpenAI, lançado dentro do ChatGPT em 8 de julho de 2026 e aberto a desenvolvedores por meio da API Live Sessions em 10 de setembro de 2026, com 12 vozes, uma tarifa por minuto publicada e uma lacuna significativa: não há suporte explícito para entrada de imagem e vídeo. SeedRealtime, lançado pela equipe Seed da ByteDance em 5 de agosto de 2026, foi construído inteiramente em torno dessa lacuna. É um modelo full-duplex audiovisual nativo que observa, escuta e fala em uma única arquitetura ponta a ponta — e está disponível apenas dentro do aplicativo de consumidor Doubao, sem API pública, sem pesos abertos, sem relatório técnico e sem número de parâmetros divulgado.
O que cada um pode realmente perceber
A maneira mais clara de perceber a lacuna é perguntar o que cada modelo sabe sobre a sala em que está.
O GPT-Live-1 ouve. Essa é toda a superfície de entrada. Áudio e texto entram, áudio e texto saem, e a documentação da OpenAI lista imagem e vídeo como não suportados. Ele lida extremamente bem com a mecânica conversacional da escuta — decide várias vezes por segundo se continua ouvindo, se pausa, se interrompe ou se chama uma ferramenta, e mantém full duplex, de modo que segue processando o áudio que chega enquanto fala. Ele também retorna transcrições de reconhecimento de fala junto com o áudio, o tipo de detalhe pouco glamouroso que economiza uma semana de trabalho de integração.
SeedRealtime ouve e vê, em um único modelo, em vez de um pipeline. A ByteDance descreve uma arquitetura unificada que lida com áudio, vídeo e texto em conjunto, resolvendo ambiguidade com contexto visual — distinguindo homófonos, entendendo a que "isto" se refere a partir da cena, do gesto, do olhar e da ação anterior — e executando percepção, compreensão, tomada de decisão e expressão em paralelo, em vez de em sequência. As demonstrações publicadas pela ByteDance incluem um jantar de grupo barulhento no qual o modelo tem de associar vozes a identidades, uma visita a um museu, a correção de um fluxo de preparo de espresso e a supressão de interferência em um aeroporto enquanto mantém memória fora da tela e faz uma consulta on-line.
• Entradas — GPT-Live-1 apenas áudio e texto, imagem e vídeo explicitamente sem suporte, vs. SeedRealtime com áudio, vídeo e texto fundidos em um único modelo
• Alternância de turnos — GPT-Live-1 decide internamente, muitas vezes por segundo, enquanto SeedRealtime move a alternância de turnos para dentro do modelo e elimina completamente o detector externo de atividade de voz
• Comportamento proativo — GPT-Live-1 responde, delega e chama ferramentas, enquanto o SeedRealtime é descrito como intervindo espontaneamente quando um objeto-alvo aparece no campo de visão
• Disponibilidade — GPT-Live-1 com disponibilidade geral na API da OpenAI a US$ 0,05 por minuto vs. SeedRealtime grátis dentro do Doubao, sem API e sem previsão de quando haverá uma

A qualidade das evidências segue o sentido oposto ao da ambição.
É aqui que a comparação deixa de ser favorável à ByteDance.
A OpenAI publica números. São os seus próprios, comparam o GPT-Live-1 com o GPT-Realtime-2.1, em vez de com um concorrente, e nenhum laboratório independente os reproduziu — 80,1% em interatividade full-duplex contra 45,4%, latência de troca de turnos reduzida de 1,4 segundos para 0,8, precisão de chamada de ferramentas de 60% para 87%. Realizado pelo fornecedor e não reproduzido é uma ressalva real, e é uma ressalva que você pode pelo menos associar a um número.
A ByteDance quase não publica nada. A alegação central sobre o SeedRealtime é uma avaliação humana ponta a ponta que diz que ele reduz pela metade os problemas de ritmo conversacional audiovisual em relação a sistemas em cascata de ASR mais visão mais TTS — menos interrupções no meio da frase, menos respostas lentas após uma pausa, menos disparos falsos causados por conversa de fundo. Não há tamanho de amostra, nem metodologia, nem número exato para a melhoria, e nenhum número de latência. Também não há contagem de parâmetros nem relatório técnico.
O resultado é que o modelo com a arquitetura mais interessante é o que você consegue avaliar menos. Isso não é o mesmo que dizer que ele tem um desempenho pior — as demonstrações são genuinamente impressionantes, e a documentação de engenharia sobre entrada audiovisual em blocos e geração em streaming sugere um sistema real, e não uma demo — mas significa que qualquer comparação entre esses dois em qualidade é, atualmente, uma comparação entre um modelo documentado e um vídeo impressionante.
Por que a lacuna da API não é um detalhe
O SeedRealtime foi totalmente disponibilizado no Doubao desde 5 de agosto de 2026, tanto em voz quanto em vídeo, gratuitamente. Ele não tem endpoint do Volcano Engine nem do BytePlus, não tem plano pago, nenhuma cota publicada e nenhum prazo declarado para abrir acesso a desenvolvedores. O roadmap da ByteDance menciona latência mais baixa, rastreamento de falante mais preciso e tarefas conectadas a ferramentas; não menciona uma data.
Há uma ressalva de acesso que agrava a situação. O Doubao é um produto prioritariamente para a China continental e normalmente exige um número de telefone móvel da China continental para o registo, sem versão localizada em inglês anunciada. Para uma equipa fora da China, o SeedRealtime não só não foi lançado como API — como também não é acessível enquanto produto.
Compare isso com a própria carga de integração do GPT-Live-1 e o trade-off se torna concreto. A API da OpenAI é restrita de maneiras que surpreendem as pessoas: um ID de modelo, um endpoint em v1/live/sessions, transporte WebRTC com tratamento de eventos em um canal de dados, e nenhum caminho por meio de Chat Completions, Responses, Realtime, Batch ou dos endpoints de fine-tuning. Os limites de taxa são definidos em sessões simultâneas — 25 no Tier 1, subindo para 50, 200, 300 e 500 — em vez de solicitações por minuto, e o nível Free não pode chamar o modelo de forma alguma. Isso é uma nova integração, e ainda é uma integração que você pode começar hoje à tarde.

Duas respostas para o mesmo problema de delegação
Ambos os modelos rejeitam o antigo design em cascata, no qual reconhecimento de fala, um modelo de linguagem e síntese de fala são executados em sequência, com cerca de 1,7 segundo de silêncio entre os turnos. Eles o rejeitam de maneiras diferentes, e a diferença revela qual deles foi feito para uma chamada telefônica e qual foi feito para uma sala.
GPT-Live-1 divide o trabalho verticalmente. Uma camada de voz rápida sustenta a conversa; qualquer coisa mais pesada — busca na web, raciocínio mais profundo, trabalho agêntico — é repassada a um modelo de raciocínio separado por meio da Responses API, enquanto a conversa continua. O exemplo WebRTC publicado da OpenAI conecta esse backend ao GPT-5.6 Terra. A consequência é que a metade pensante é uma chamada comum de modelo de texto, precificada por token e, portanto, algo que você pode escolher, trocar e rotear independentemente da camada de voz. Para uma linha de suporte, esse é o formato certo: a voz é a interface e o raciocínio é o produto.
SeedRealtime mantém tudo em uma única rede, e é isso que lhe permite olhar para um gesto enquanto ele está no meio de uma frase. É também o que o torna impossível de decompor — você não pode trocar a metade do raciocínio, porque não há metade do raciocínio, e você não pode executá-lo em lugar algum, porque não há lugar algum para executá-lo.
Se você está construindo um agente de voz hoje, essa distinção é a decisão inteira. Apenas um desses dois é um componente que você pode colocar em uma arquitetura. GPT-5.6 Terra, o backend no exemplo de delegação da OpenAI, é servido pelo OrcaRouter a $2,00 por milhão de tokens de entrada e $12,00 por milhão de saída com um contexto de 1M de tokens e tanto /v1/chat/completions quanto /v1/responses expostos — junto com cerca de 190 outros modelos em uma única chave, para que a camada de raciocínio por trás de um agente de voz possa ser dividida, precificada e ter failover sem tocar no caminho de áudio. Nem o GPT-Live-1 nem o SeedRealtime são servidos pelo OrcaRouter; eles são de fonte única de seus próprios fornecedores, e nenhum roteador pode mudar isso.

O que mudaria a resposta
Três coisas, por ordem de probabilidade.
• Uma API de desenvolvedor da ByteDance. Se a SeedRealtime aparecer no Volcano Engine ou no BytePlus com um preço publicado, ela deixa de ser um estudo de caso e se torna um produto genuinamente diferenciado — full duplex audiovisual sem concorrente hospedado no Ocidente. Esse é o sinal a acompanhar, e ele ainda não apareceu.
• Visão chegando a uma API de voz hospedada. A documentação do GPT-Live-1 é explícita ao afirmar que imagem e vídeo não são compatíveis, o que soa menos como um descuido do que como um limite deliberado de primeiro lançamento. Se a OpenAI lançar a superfície de vídeo que vem demonstrando em outros lugares no ChatGPT, a lacuna de capacidades que torna o SeedRealtime interessante diminui consideravelmente.
• Qualquer medição independente do SeedRealtime. Um número de latência de terceiros ou uma contagem de parâmetros permitiria comparar os dois com base em algo além de ambição.
O veredito prático para quem está construindo agora é curto. O GPT-Live-1 é o único dos dois que você pode implantar e, a US$ 0,05 por minuto cobrado por segundo, com doze vozes e um endpoint documentado, é uma opção padrão razoável para voz conversacional. O SeedRealtime é o modelo mais interessante e pode muito bem ser o mais capaz; também é, por enquanto, uma demonstração de como é uma arquitetura audiovisual convergida, e não um produto que você pode colocar diante de um cliente. Arquive-o na categoria do que observar, não do que servir de base para construir.
