
Tavus Griffin vs MiniMax H3: Um Modelo Conversacional Duplex Encontra um Gerador de Vídeo Lançado
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Tavus Griffin e MiniMax H3 colocam ambos na tela um humano que se move e fala, e, além dessa primeira impressão, mal estão na mesma categoria de produto. Griffin é um Modelo de Interação Humana — um sistema de vídeo para vídeo criado para manter uma conversa bidirecional em tempo real, anunciado pela Tavus em outubro de 2026 e atualmente limitado a um grupo seleto de testadores iniciais. MiniMax H3 é um gerador de vídeo omni-modal: você fornece a ele um prompt e, opcionalmente, imagens, vídeos e referências, e ele retorna um clipe finalizado. Um está sendo avaliado a portas fechadas; o outro está disponível para download, licenciamento e cobrança há meses. Essa diferença — não a resolução ou a taxa de quadros — é o que decide qual deles pertence à sua stack.
O que cada um realmente é
Griffin é a tentativa da Tavus de construir um modelo que se comporta como um participante, e não como um renderizador. A empresa o descreve como o primeiro Human Interaction Model, e a arquitetura que publicou divide o trabalho em duas partes: Modelagem Conversacional Contínua, que decide o que a persona deve fazer a cada momento, e Geração Audiovisual, que transmite a fala e o rosto correspondentes. Crucialmente, ele é duplex total — observa e escuta enquanto fala, por isso pode ser interrompido, pode reagir no meio da fala e não espera um sinal claro de fim de turno antes de responder. A própria Tavus enquadra a questão assim: os sistemas anteriores aprenderam a gerar rostos; Griffin foi criado para aprender comportamento conversacional com pessoas.
O MiniMax H3 é a geração Hailuo 3, lançado em 31 de julho de 2026 e com código aberto em 3 de agosto de 2026 sob a Licença Comunitária MiniMax H3, com as variantes H3-Base-FL2VA e H3-Base-Ref2VA publicadas abertamente. Ele lê referências de texto, imagem, vídeo e áudio como um único contexto unificado e retorna um clipe de 4 a 15 segundos em 768P ou 2K com áudio estéreo nativo, gerado por um pipeline de três estágios (H3-Context-IR, depois H3-Base em 768p, depois H3-Regenerate-2K). É um gerador com uma superfície de entrada excepcionalmente ampla e uma licença genuinamente permissiva — tudo o que o Griffin atualmente não é.
As especificações, lado a lado

Por que "duplex" é a palavra interessante
Todo gerador de vídeo, incluindo o H3, é julgado pelo que um clipe parece depois de finalizado. O Griffin é julgado por algo que um clipe não pode mostrar: o que acontece nos 200 milissegundos após você interrompê-lo. Esse é o problema que o enquadramento do Modelo de Interação Humana está apontando, e é por isso que os números principais da Tavus são comportamentais em vez de visuais.
O dado mais citado é que 48% das pessoas acreditavam que Griffin era uma pessoa real após uma chamada de vídeo de um minuto — 26 de 54 participantes — contra 2,4% da stack anterior da Tavus, composta por Phoenix-4.5, Sparrow-2 e Raven-1, que conseguiu 1 de 41. A Tavus também relata que as pessoas que não ficaram convencidas tendiam a suspeitar nos primeiros 20 segundos, o que é um detalhe mais útil do que a manchete: significa que a ilusão ou se sustenta logo no início ou desmorona logo no início.
O segundo conjunto de números vem do benchmark VideoFDB da NVIDIA, pontuado em setembro de 2026, no qual a Tavus afirma que o Griffin ficou em primeiro lugar num teste independente de IA cara a cara. No lado da geração, o Griffin obteve 3,83 contra 2,80 da linha de base mais forte reportada (uma configuração Gemini 2.5 mais Anam), com uma referência humana de 3,92, e uma taxa de objetivos de tarefa de 62,8%. Na percepção, obteve 3,73 contra 3,44 do MiniCPM-o 4.5, 3,17 do Gemini 2.5 Flash Native e 2,97 de uma configuração OpenAI gpt-realtime somente áudio, contra uma referência humana de 4,20 e uma taxa de objetivos de tarefa de 73,8%, em quinze modelos avaliados. A Tavus também afirma que o Griffin lidera por 37% sobre o próximo melhor sistema a reagir no momento. Estes são números reportados pelo fornecedor e baseados em um benchmark criado pela NVIDIA, e devem ser lidos dessa forma — mas os pontos de comparação humana são os que vale a pena manter, porque um 3,83 contra uma pontuação humana de 3,92 é uma diferença muito menor do que a geração de vídeo tem mostrado historicamente.
O que você pode comprar hoje
Aqui, os dois modelos deixam de ser comparáveis de todo.
MiniMax H3 é um produto. Ele é hospedado, tem preço por segundo de saída gerada, e suas variantes abertas estão em um hub de modelos à espera de serem baixadas. Se você quiser um clipe de quinze segundos, em 2K e com áudio estéreo de algo que não existe, pode ter um hoje à tarde, e pode executar os pesos você mesmo se preferir não alugá-los.
O Tavus Griffin não é um produto. A Tavus deixa explícito no texto sobre o Griffin que o Griffin-Lite, a prévia de pesquisa, está disponível hoje para um grupo seleto de testadores iniciais, que um lançamento mais amplo de um modelo mais poderoso virá na sequência, e que o Griffin ainda não está na plataforma Tavus e só chegará depois que a empresa tiver descoberto como lançá-lo com segurança. Esse é um grau incomum de franqueza de um fornecedor em relação ao seu próprio resultado mais chamativo, e isso é importante para o planejamento: não dá para colocar o Griffin em um roadmap de produto como dependência, nem dá para atribuir um preço a ele, porque não existe um.
Então, a pergunta honesta de planejamento não é "qual é melhor", mas "qual deles existe na camada de que preciso".

Onde o OrcaRouter se encaixa
O MiniMax H3 está no nosso catálogo. A página do modelo fica em minimax/minimax-h3, e a cobrança é feita da forma como o provedor cobra: US$ 0,08 por segundo de saída gerada em 768P e US$ 0,13 por segundo em 2K. A OrcaRouter repassa os preços de tabela do provedor com 0% de margem, então uma mudança de preço da MiniMax aparece no nosso card no mesmo dia em que é anunciada, em vez de no próximo ciclo de faturamento. O Griffin não está no catálogo e não estará até que a Tavus o disponibilize aos clientes — não hospedamos um modelo que não podemos atender, e uma prévia de pesquisa limitada a testadores selecionados não é algo para o qual um roteador consiga rotear.
A consequência prática é que um desses dois modelos está a uma linha de código de distância da sua aplicação, e o outro é um artigo de pesquisa com um número de telefone. Se você já roteia vários modelos de vídeo e de linguagem, a cobrança por segundo do H3 também faz dele o tipo de rota que vale a pena colocar atrás de failover automático: uma requisição que atinge um provedor saturado é repetida contra um provedor saudável em vez de gerar um timeout, e uma DSL de roteamento permite fixar tarefas em 2K a um provedor específico enquanto deixa rascunhos em 768P caírem onde a capacidade for mais barata. A fusão de modelos é a outra alavanca que vale mencionar aqui — o preço por segundo do H3 é baixo o suficiente para que gastar um modelo de texto para reescrever e recortar um prompt antes da geração costuma ser mais barato do que os segundos desperdiçados com uma primeira tentativa ruim.

Onde a comparação poderia se inverter
Três coisas mudariam essa comparação, e apenas três.
Primeiro, se a Tavus colocar o Griffin numa API comercial com um preço publicado, todo o enquadramento "conversa versus clipe" passa a ser uma verdadeira decisão de compra em vez de uma decisão de agendamento, e a cifra de 48% de interação face a face começa a competir diretamente com a qualidade do resultado generativo. Segundo, se a narrativa de tempo real do H3 melhorar — e a MiniMax tem lançado novidades de forma agressiva —, um gerador por segundo que consiga fazer streaming atenuaria a vantagem central do Griffin. Terceiro, se a NVIDIA ou outra parte neutra voltar a executar o VideoFDB com o H3 ou o seu sucessor incluído, a afirmação de que o Griffin é o primeiro em IA face a face deixa de ser infalsificável. A Tavus diz que prevê lançar o Griffin muito em breve, assim que as suas preocupações de segurança forem resolvidas; essa frase é todo o cronograma.
Conclusão
MiniMax H3 e Tavus Griffin não são rivais no momento, porque apenas um deles está disponível para compra. O H3 é um gerador omni-modal já lançado, de pesos abertos, cobrado por segundo, com preço publicado e uma janela de saída de 4 a 15 segundos; Griffin é um modelo conversacional duplex com os melhores números de conversa cara a cara que alguém já publicou, sem API, sem preço e com uma declaração explícita de seu próprio fornecedor de que os clientes ainda não podem usá-lo. Se você precisa de geração de vídeo hoje, o H3 é a resposta e é mensurável em centavos por segundo. Se você precisa de um rosto em tempo real que possa ser interrompido, fique de olho na Tavus — mas construa o resto do produto primeiro, porque a data de lançamento é uma frase, não uma data.
