
Tavus Griffin vs HeyGen Video 1: Separados por trinta e seis horas, e apenas um pode ser comprado
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Dois lançamentos chegaram com trinta e seis horas de diferença um do outro, no mesmo canto do mercado, e o calendário é a coisa mais interessante deste emparelhamento. O HeyGen Video entrou em funcionamento a 30 de setembro de 2026, a 0,01 dólares por segundo durante outubro, afinado a partir do MiniMax H3 e lançado sob o identificador heygen-video-1O Tavus Griffin foi anunciado a 1 de outubro de 2026, com um estudo em direto, cara a cara, no qual 26 de 54 participantes acreditaram que o seu interlocutor era uma pessoa real, e está disponível apenas a alguns testadores de confiança, mediante um formulário de pedido, sem identificador, sem endpoint e sem preço. Ambos têm como objetivo gerar um ser humano convincente. A razão honesta para comparar Tavus Griffin e HeyGen Video 1 não é que um comprador fosse escolher entre eles — hoje só um deles pode ser comprado — mas sim que a diferença explica para que foi construído cada um e quanto vale, na realidade, um segundo de humano gerado.
Um vende um clipe, o outro vende uma conversa.
O HeyGen Video é um modelo de vídeo de propósito geral que, por acaso, é excepcionalmente bom com pessoas. Ele recebe um prompt, ou um prompt mais uma imagem, ou um prompt mais até nove imagens de referência, três vídeos de referência e três clipes de áudio de referência, e retorna um clipe de 5 a 15 segundos, em 480p ou 768p, 24 fps, com áudio AAC a 32 kHz estéreo contendo diálogo, ambiência e efeitos gerados. Três modos cobrem o condicionamento — text_to_video, image_to_video e reference_to_video, que é o padrão — e a ordem da lista se torna o rótulo que você usa no prompt, então a primeira entrada de reference_images é <Picture 1>. Campos desconhecidos na requisição são rejeitados em vez de ignorados, e uma seed é um inteiro sem sinal de 32 bits que torna uma tomada repetível quando você a mantém e altera uma cláusula de cada vez. É uma ferramenta de produção com um envelope determinístico.
Griffin inverte quase todas essas propriedades. Ele gera 720p em blocos de 320 ms a 25 fps a partir de uma única fotografia de referência e reproduz cada bloco à medida que o decodifica, de modo que não há duração de clipe a especificar nem arquivo algum a devolver. Um motor de Continuous Conversational Modeling ingere áudio e vídeo e reavalia a interação em intervalos inferiores a um segundo, escolhendo se permanece em silêncio, se sinaliza, se faz backchannel ou se assume o turno, e seus controles expressivos acionam um gerador de fala em streaming e um gerador de vídeo em streaming em paralelo. Uma decisão tomada no meio da frase aparece na voz e no rosto dentro do mesmo mini-turno. Você não escreve um prompt; você fala com ele, e ele responde a uma pausa, a um desviar o olhar ou a uma interrupção.
É por isso que os dois não são substitutos, embora ambos gerem um humano. Pergunta-se ao HeyGen Video como é um momento descrito. Pergunta-se ao Griffin o que deve acontecer a seguir.
Quanto custa cada segundo, naquele em que se pode comprar segundos
O preço de lançamento do HeyGen Video é de $0.01 por segundo até outubro, e o próprio texto da HeyGen descreve isso como 50% de desconto sobre um preço padrão de $0.02. O gráfico de custos na mesma página, com nota de rodapé indicando preço de tabela por segundo em 768p com áudio antes das promoções de lançamento, indica $0.03. Trata-se de uma diferença de 50% entre o texto e o gráfico no próprio material de lançamento de um fornecedor e, até que a HeyGen publique uma página de preços da API, a leitura segura é que $0.01 está confirmado por estar em vigor, e que o valor pós-outubro fica em algum ponto entre $0.02 e $0.03.
Faça as contas para mil segundos — cem clipes de dez segundos — que é a unidade em que uma equipe de produção em massa realmente pensa:
• Vídeo HeyGen em outubro — $10 a $0,01 por segundo.
• Vídeo do HeyGen após outubro — $20 a $0,02, ou $30 ao $0,03 do gráfico.
• MiniMax H3, o modelo base a partir do qual foi ajustado — US$ 80 ao preço de tabela da MiniMax de US$ 0,08 por segundo.
• Kling 3.0 Pro — $168 a $0.168 por segundo.
• Veo 3.1 — $400 a $0,40 por segundo.
A razão pela qual a aritmética é o destaque do lançamento da HeyGen é a taxa de descarte. Equipes que fazem cortes para redes sociais, variações de anúncios e loops de produto geram muito mais do que publicam, e a US$ 0,10 por tentativa de dez segundos a economia de jogar candidatos fora muda completamente de forma. O problema é o teto: 768p a 24 fps não é um formato de entrega 2K, e o MiniMax H3 alcança 2K por meio de um módulo de regeneração separado na API hospedada da própria MiniMax a US$ 0,13 por segundo, sem equivalente no HeyGen Video. Se sua meta de entrega estiver acima de 768p, o segundo barato não é o segundo de que você precisa.
A coluna de Griffin nessa lista está vazia, e não de uma forma promissora. A Tavus não publicou um preço, porque o Griffin-Lite é uma prévia de pesquisa que, segundo o próprio anúncio, não estará disponível para uso de clientes no momento e não está na plataforma Tavus. Em um modelo de mil segundos, não há nada a registrar. Qualquer pessoa que cite um número para o Griffin está inventando.
Os números de qualidade, e quem está avaliando
Nenhum desses modelos tem uma pontuação independente, o que vale a pena afirmar desde já, porque ambos os fornecedores têm gráficos.
A da HeyGen é uma tabela Elo com o HeyGen Video normalizado para 1000, depois o Dreamina Seedance 2.0 a 955, a família H3 Max distribuída de 952 a 860, o Kling 3.0 Pro a 857 e o Veo 3.1 a 744. A nota de rodapé faz a maior parte do trabalho: as pontuações vêm de um conjunto de avaliação interno de consultas do Artificial Analysis Arena com 4.800 votos, e a própria pontuação da HeyGen é normalizada para 1000 para facilitar a comparação. Um fornecedor que se normaliza para o topo do seu próprio gráfico é uma escolha de apresentação, não evidência de que lidera. O espaçamento relativo abaixo dela é a parte informativa.
Mais útil é o confronto direto, que é o único lugar onde a HeyGen testa contra algo que não desenvolveu. A HeyGen afirma que testadores cegos preferiram seu modelo ao H3 Max post-train apresentado no gráfico em 55,8% das comparações em 650 votos, com uma faixa de 49–62%. Essa faixa é o detalhe honesto: na extremidade inferior, ela fica em torno de 50%, então, nos próprios números do fornecedor, a preferência sobre esse rival não está claramente separada do ruído. A divisão por eixo é mista de um modo que soa como um perfil de falha específico — 65% em fidelidade à imagem de origem e 66% em timing, contra 43% em consistência e 45% em música.
Os números do Griffin vêm de um instrumento criado por outra pessoa, e é essa a diferença que importa. O VideoFDB da NVIDIA é um benchmark para conversa audiovisual full-duplex, pontuado em duas trilhas, e foi a NVIDIA que o criou e conduz a avaliação com seu próprio juiz, com base em uma rubrica publicada. O Griffin-Lite obteve 3,83 de 5 em geração, contra uma referência humana de 3,92 e 2,80 do próximo sistema publicado mais bem colocado, e 3,73 em percepção, contra uma referência humana de 4,20. A Tavus também relata 0,43 segundo de latência real de áudio para vídeo do gerador, contra quatro baselines publicados de difusão em streaming em H100s. As ressalvas ainda se aplicam — uma diferença de 0,09 ponto em relação ao humano em uma rubrica de cinco pontos avaliada por modelo de linguagem é "próximo", não "igual", e parte da liderança em percepção é medida contra sistemas que rodam sem entrada de vídeo —, mas o avaliador não é o fornecedor.
• Pontuações de qualidade independentes — nenhum dos dois tem. O HeyGen Video não aparece em nenhum dos três rankings de vídeo da Artificial Analysis em 2 de outubro de 2026, e o Griffin também não. O Griffin pode nunca vir a aparecer: a votação de preferência pareada em clipes curtos não consegue avaliar uma conversa ao vivo.
As mesmas tabelas realmente incluem o modelo base. O MiniMax H3 ocupa o 4º lugar em texto para vídeo (com áudio), com Elo 1.139, e o 2º lugar em imagem para vídeo, com 1.181, ambos a US$ 4,80/min — então o pós-treino da HeyGen está competindo em um substrato que uma arena independente já avalia como estando perto do topo, o que é o argumento mais forte a seu favor: o fato de a própria HeyGen não o ter publicado.

Ambos são baratos ou não têm preço pelo mesmo motivo.
O fato estrutural por trás dos dois lançamentos é que produzir um humano convincente ficou barato, e a vantagem de custo de nenhuma das empresas vem daquilo que ela está vendendo.
HeyGen Video é um pós-treino do MiniMax H3, que a MiniMax lançou com pesos disponíveis sob sua própria licença comunitária. Isso transformou o H3 em um substrato que outras empresas podem especializar e revender, e a HeyGen é o segundo produto a fazer isso em cinco semanas para um setor diferente — vídeo empresarial, demonstrações de produtos, treinamento, visitas guiadas a imóveis. Esse padrão é o motivo pelo qual a HeyGen consegue cobrar abaixo do preço da base: ela não está arcando com o custo do modelo base, e a base é o lançamento de pesos abertos de terceiros.
Griffin é a aposta oposta. A Tavus construiu todo o sistema — o codec, o gerador de fala em streaming, o gerador de vídeo em streaming, o modelo conversacional — em torno da própria interação, destilando um grande professor de difusão bidirecional em um gerador autorregressivo de poucos passos em três estágios, para que rollouts longos não sofram deriva. Isso é pesquisa cara, com uma base aberta na qual se apoiar, e é uma parte plausível da razão pela qual o lançamento é restrito: não há um substrato barato por baixo dele para amortizar.
Ambas as empresas também chegam ao mesmo lugar desconfortável por caminhos diferentes. A própria documentação da HeyGen lista aquilo em que o modelo é pior, o que é raro e vale a pena ler: texto longo na tela, movimento orgânico suave como pétalas, papel e cabelo, e trabalho de mãos em close, como montar ou operar equipamentos. Ele é melhor em planos curtos e contidos — um sujeito, um lugar, uma ação, uma câmera fixa ou quase parada. A limitação do Griffin não é uma lista de modos de falha, mas um problema de segurança não resolvido: a Tavus afirma claramente que as propriedades que tornam um modelo de interação humana uma interface melhor também o tornam melhor em convencer alguém de que está falando com um humano, e que está segurando a prévia enquanto constrói mecanismos de divulgação.
O que um comprador pode realmente fazer hoje
O HeyGen Video agora pode ser chamado. Ele roda em POST /v3/models/videos com um x-api-key cabeçalho, apenas em chaves de API pagas, com links de download assinados e que expiram — então o polling os atualiza — e callbacks tentados uma vez por job, o que a própria HeyGen diz para você tratar como uma otimização de latência, e não como uma garantia. Se você estiver testando neste mês, o segundo promocional de US$ 0,01 está ativo, o teto de saída é 768p, e o modo de aprimoramento de prompt é uma alavanca de custo real: turbo por padrão, quality para uma passagem mais longa, disabled para enviar seu texto sem alterações.
Griffin não é chamável. O acesso é um formulário de solicitação e uma prévia de pesquisa. Não há chave, nem identificador, nem endpoint e nem SLA, e a única declaração publicada sobre disponibilidade é que ela virá quando a Tavus tiver descoberto como lançá-lo com segurança.
Uma coisa que ambos têm em comum é que nenhum dos dois é um modelo que um roteador possa ajudar você a alcançar e, no caso do Griffin, isso é um problema de categoria, e não um problema temporário — uma sessão full-duplex em tempo real não é uma chamada de requisição-resposta. O que um roteador ajuda a fazer em qualquer um dos pipelines é a camada ao redor do vídeo. Expansão de prompt, inventário de imagens de referência, descrições de planos, geração de legendas e sumarização de avaliações são todas chamadas de texto, e os da OpenAI, Google e demais ficam no catálogo do OrcaRouter atrás de um endpoint compatível com OpenAI, com 200+ modelos na mesma chave,pelo preço de tabela do provedor, com 0% de markup adicionado, então uma mudança de preço do fornecedor entra no ar no mesmo dia. No que diz respeito ao modelo de vídeo em si, há um fato útil: MiniMax H3 — a base a partir da qual o HeyGen Video foi ajustado, e cujo preço por segundo o $0.01 do HeyGen está abaixo — é roteado aqui como minimax/minimax-h3 a $0.08 por segundo, com 2K a $0.13. O próprio HeyGen Video não está em nosso catálogo, e o Griffin também não; ambos são servidos por meio das APIs de seus próprios fornecedores e de várias plataformas de terceiros.

Qual deles, e para quem?
• Use o HeyGen Video se o entregável for uma filmagem curta, contida e centrada em pessoas, com som integrado, e você puder aceitar 768p a 24 fps. Orce a tarifa pós-outubro em algo entre US$ 0,02 e US$ 0,03 por segundo, em vez da promoção de dez centavos, e teste a fundo textos longos na tela e trabalho de mãos em close antes de comprometer um fluxo de trabalho com ele, porque a HeyGen já avisou que é nesses pontos que ele falha.
• Não planeje em torno do Griffin. Solicite acesso se a sua pergunta for se uma pessoa consegue distinguir um humano gerado de um real em uma chamada de um minuto, ou se você precisa ver para onde uma camada de interação em tempo real está caminhando antes de comprometer um roadmap com clipes renderizados.
• Fique de olho na questão da divulgação, porque é a única coisa que moverá ambas. Os clientes do HeyGen Video têm uma resposta direta disponível — o modelo é um pós-treino de uma base de pesos abertos e a saída é um arquivo com proveniência conhecida — enquanto a Tavus está retendo um modelo especificamente porque ainda não tem uma. A empresa que publicar o melhor mecanismo de divulgação terá resolvido o problema mais valioso.

