Cartão de título principal para 'Tavus Griffin vs MiniMax H3' com o subtítulo 'Um Modelo Conversacional Duplex Encontra um Gerador de Vídeo Lançado', acima de quatro chips: prévia de pesquisa Tavus Griffin, apenas para testadores; MiniMax H3 pesos abertos, lançado; MiniMax H3 $0.08/s em 768P; Griffin: sem API, sem preço.
Guides & Insights

Tavus Griffin vs MiniMax H3: Um Modelo Conversacional Duplex Encontra um Gerador de Vídeo Lançado

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tavus Griffin e MiniMax H3 colocam ambos na tela um humano que se move e fala, e, além dessa primeira impressão, mal estão na mesma categoria de produto. Griffin é um Modelo de Interação Humana — um sistema de vídeo para vídeo criado para manter uma conversa bidirecional em tempo real, anunciado pela Tavus em outubro de 2026 e atualmente limitado a um grupo seleto de testadores iniciais. MiniMax H3 é um gerador de vídeo omni-modal: você fornece a ele um prompt e, opcionalmente, imagens, vídeos e referências, e ele retorna um clipe finalizado. Um está sendo avaliado a portas fechadas; o outro está disponível para download, licenciamento e cobrança há meses. Essa diferença — não a resolução ou a taxa de quadros — é o que decide qual deles pertence à sua stack.

O que cada um realmente é

Griffin é a tentativa da Tavus de construir um modelo que se comporta como um participante, e não como um renderizador. A empresa o descreve como o primeiro Human Interaction Model, e a arquitetura que publicou divide o trabalho em duas partes: Modelagem Conversacional Contínua, que decide o que a persona deve fazer a cada momento, e Geração Audiovisual, que transmite a fala e o rosto correspondentes. Crucialmente, ele é duplex total — observa e escuta enquanto fala, por isso pode ser interrompido, pode reagir no meio da fala e não espera um sinal claro de fim de turno antes de responder. A própria Tavus enquadra a questão assim: os sistemas anteriores aprenderam a gerar rostos; Griffin foi criado para aprender comportamento conversacional com pessoas.

O MiniMax H3 é a geração Hailuo 3, lançado em 31 de julho de 2026 e com código aberto em 3 de agosto de 2026 sob a Licença Comunitária MiniMax H3, com as variantes H3-Base-FL2VA e H3-Base-Ref2VA publicadas abertamente. Ele lê referências de texto, imagem, vídeo e áudio como um único contexto unificado e retorna um clipe de 4 a 15 segundos em 768P ou 2K com áudio estéreo nativo, gerado por um pipeline de três estágios (H3-Context-IR, depois H3-Base em 768p, depois H3-Regenerate-2K). É um gerador com uma superfície de entrada excepcionalmente ampla e uma licença genuinamente permissiva — tudo o que o Griffin atualmente não é.

As especificações, lado a lado

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

Por que "duplex" é a palavra interessante

Todo gerador de vídeo, incluindo o H3, é julgado pelo que um clipe parece depois de finalizado. O Griffin é julgado por algo que um clipe não pode mostrar: o que acontece nos 200 milissegundos após você interrompê-lo. Esse é o problema que o enquadramento do Modelo de Interação Humana está apontando, e é por isso que os números principais da Tavus são comportamentais em vez de visuais.

O dado mais citado é que 48% das pessoas acreditavam que Griffin era uma pessoa real após uma chamada de vídeo de um minuto — 26 de 54 participantes — contra 2,4% da stack anterior da Tavus, composta por Phoenix-4.5, Sparrow-2 e Raven-1, que conseguiu 1 de 41. A Tavus também relata que as pessoas que não ficaram convencidas tendiam a suspeitar nos primeiros 20 segundos, o que é um detalhe mais útil do que a manchete: significa que a ilusão ou se sustenta logo no início ou desmorona logo no início.

O segundo conjunto de números vem do benchmark VideoFDB da NVIDIA, pontuado em setembro de 2026, no qual a Tavus afirma que o Griffin ficou em primeiro lugar num teste independente de IA cara a cara. No lado da geração, o Griffin obteve 3,83 contra 2,80 da linha de base mais forte reportada (uma configuração Gemini 2.5 mais Anam), com uma referência humana de 3,92, e uma taxa de objetivos de tarefa de 62,8%. Na percepção, obteve 3,73 contra 3,44 do MiniCPM-o 4.5, 3,17 do Gemini 2.5 Flash Native e 2,97 de uma configuração OpenAI gpt-realtime somente áudio, contra uma referência humana de 4,20 e uma taxa de objetivos de tarefa de 73,8%, em quinze modelos avaliados. A Tavus também afirma que o Griffin lidera por 37% sobre o próximo melhor sistema a reagir no momento. Estes são números reportados pelo fornecedor e baseados em um benchmark criado pela NVIDIA, e devem ser lidos dessa forma — mas os pontos de comparação humana são os que vale a pena manter, porque um 3,83 contra uma pontuação humana de 3,92 é uma diferença muito menor do que a geração de vídeo tem mostrado historicamente.

O que você pode comprar hoje

Aqui, os dois modelos deixam de ser comparáveis de todo.

MiniMax H3 é um produto. Ele é hospedado, tem preço por segundo de saída gerada, e suas variantes abertas estão em um hub de modelos à espera de serem baixadas. Se você quiser um clipe de quinze segundos, em 2K e com áudio estéreo de algo que não existe, pode ter um hoje à tarde, e pode executar os pesos você mesmo se preferir não alugá-los.

O Tavus Griffin não é um produto. A Tavus deixa explícito no texto sobre o Griffin que o Griffin-Lite, a prévia de pesquisa, está disponível hoje para um grupo seleto de testadores iniciais, que um lançamento mais amplo de um modelo mais poderoso virá na sequência, e que o Griffin ainda não está na plataforma Tavus e só chegará depois que a empresa tiver descoberto como lançá-lo com segurança. Esse é um grau incomum de franqueza de um fornecedor em relação ao seu próprio resultado mais chamativo, e isso é importante para o planejamento: não dá para colocar o Griffin em um roadmap de produto como dependência, nem dá para atribuir um preço a ele, porque não existe um.

Então, a pergunta honesta de planejamento não é "qual é melhor", mas "qual deles existe na camada de que preciso".

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

Onde o OrcaRouter se encaixa

O MiniMax H3 está no nosso catálogo. A página do modelo fica em minimax/minimax-h3, e a cobrança é feita da forma como o provedor cobra: US$ 0,08 por segundo de saída gerada em 768P e US$ 0,13 por segundo em 2K. A OrcaRouter repassa os preços de tabela do provedor com 0% de margem, então uma mudança de preço da MiniMax aparece no nosso card no mesmo dia em que é anunciada, em vez de no próximo ciclo de faturamento. O Griffin não está no catálogo e não estará até que a Tavus o disponibilize aos clientes — não hospedamos um modelo que não podemos atender, e uma prévia de pesquisa limitada a testadores selecionados não é algo para o qual um roteador consiga rotear.

A consequência prática é que um desses dois modelos está a uma linha de código de distância da sua aplicação, e o outro é um artigo de pesquisa com um número de telefone. Se você já roteia vários modelos de vídeo e de linguagem, a cobrança por segundo do H3 também faz dele o tipo de rota que vale a pena colocar atrás de failover automático: uma requisição que atinge um provedor saturado é repetida contra um provedor saudável em vez de gerar um timeout, e uma DSL de roteamento permite fixar tarefas em 2K a um provedor específico enquanto deixa rascunhos em 768P caírem onde a capacidade for mais barata. A fusão de modelos é a outra alavanca que vale mencionar aqui — o preço por segundo do H3 é baixo o suficiente para que gastar um modelo de texto para reescrever e recortar um prompt antes da geração costuma ser mais barato do que os segundos desperdiçados com uma primeira tentativa ruim.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Onde a comparação poderia se inverter

Três coisas mudariam essa comparação, e apenas três.

Primeiro, se a Tavus colocar o Griffin numa API comercial com um preço publicado, todo o enquadramento "conversa versus clipe" passa a ser uma verdadeira decisão de compra em vez de uma decisão de agendamento, e a cifra de 48% de interação face a face começa a competir diretamente com a qualidade do resultado generativo. Segundo, se a narrativa de tempo real do H3 melhorar — e a MiniMax tem lançado novidades de forma agressiva —, um gerador por segundo que consiga fazer streaming atenuaria a vantagem central do Griffin. Terceiro, se a NVIDIA ou outra parte neutra voltar a executar o VideoFDB com o H3 ou o seu sucessor incluído, a afirmação de que o Griffin é o primeiro em IA face a face deixa de ser infalsificável. A Tavus diz que prevê lançar o Griffin muito em breve, assim que as suas preocupações de segurança forem resolvidas; essa frase é todo o cronograma.

Conclusão

MiniMax H3 e Tavus Griffin não são rivais no momento, porque apenas um deles está disponível para compra. O H3 é um gerador omni-modal já lançado, de pesos abertos, cobrado por segundo, com preço publicado e uma janela de saída de 4 a 15 segundos; Griffin é um modelo conversacional duplex com os melhores números de conversa cara a cara que alguém já publicou, sem API, sem preço e com uma declaração explícita de seu próprio fornecedor de que os clientes ainda não podem usá-lo. Se você precisa de geração de vídeo hoje, o H3 é a resposta e é mensurável em centavos por segundo. Se você precisa de um rosto em tempo real que possa ser interrompido, fique de olho na Tavus — mas construa o resto do produto primeiro, porque a data de lançamento é uma frase, não uma data.