Um cartão de destaque para "Tavus Griffin vs Google Veo 3.1" com três chips: "Veo 3.1 — SynthID em cada quadro", "Griffin — enganou 48% de um estudo ao vivo" e "Veo 3.1 Standard — a partir de US$ 0,40 por segundo", acima de seis linhas: proveniência do Griffin: nenhuma publicada; proveniência do Veo: SynthID mais C2PA; preço do Griffin: nenhum publicado; preço do Veo: US$ 0,40 por segundo; status do Griffin: prévia de pesquisa; status do Veo: disponibilidade geral. Rodapé: "As tarifas do Veo 3.1 são preços de tabela da API Google Gemini; o Griffin é uma prévia de pesquisa sem preços definidos."
Guides & Insights

Tavus Griffin vs. Google Veo 3.1: Um insere marca d'água em cada quadro, o outro enganou 48% de uma sala

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque Tavus Griffin e Google Veo 3.1 lado a lado e a comparação convencional — preço por segundo, Elo, duração do clipe — desmorona imediatamente, porque só um deles tem preço e só um deles é pontuado com base em algo que um comprador possa consultar. Mas há um eixo real por baixo disso, e não é a qualidade. A resposta do Google à mídia sintética é torná-la detectável: cada resultado do Veo 3.1 carrega o SynthID, uma marca-d'água invisível gravada nos pixels quadro a quadro e no espectro de áudio, além das C2PA Content Credentials que registram a proveniência do arquivo, e o Google incluiu um detector no aplicativo Gemini para que o usuário possa perguntar se um clipe foi feito pelo Google AI. A razão declarada para o Tavus Griffin existir em prévia em vez de como produto é a imagem espelhada: no próprio estudo ao vivo da Tavus, 26 de 54 participantes terminaram uma chamada de vídeo de um minuto acreditando que o parceiro era uma pessoa real, contra 1 de 41 na stack anterior da empresa, e a Tavus diz que está segurando o modelo até descobrir como divulgar o que ele é. Um desses fornecedores vende detecção. O outro é atualmente a razão pela qual a detecção importa, e sabe disso.

Dois produtos construídos sobre pressupostos opostos

O Veo 3.1 é um gerador de clipes com um envelope deliberadamente estreito. Na API Gemini da Google, produz 4, 6 ou 8 segundos por passagem a 24, nativamente em 720p, com 1080p e 4K a chegar através de uma passagem de upscaling adicionada numa atualização de janeiro de 2026. A extensão acrescenta sete segundos por passagem e pode repetir-se até vinte vezes, para um teto teórico de cerca de 148 segundos, mas a entrada tem de ser um clipe gerado pelo Veo com no máximo 141 segundos em 720p, em 16:9 ou 9:16, e a duração de oito segundos é obrigatória para a extensão, para a entrada de imagem de referência e para qualquer coisa acima de 720p. Não é possível criar um clipe de quatro segundos em 1080p. A saída é um ficheiro que lhe pertence, com marca de água, com um registo assinado anexado.

Griffin não produz um arquivo. Ele conduz uma conversa. Um mecanismo de Modelagem Conversacional Contínua recebe áudio e vídeo e reavalia a troca em intervalos de menos de um segundo, escolhendo entre permanecer em silêncio, sinalizar, fazer backchannel ou assumir o turno, e emite controles expressivos que acionam em conjunto um gerador de fala em streaming e um gerador de vídeo em streaming. O gerador de vídeo produz 720p em blocos de 320 ms, um latente por vez, a 25 fps, a partir de uma única fotografia de referência, e reproduz cada bloco conforme o decodifica. Não há duração de clipe porque não há clipe; há uma sessão que continua até alguém parar de falar.

Essa distinção decide quase todas as outras linhas nesta comparação. O envelope do Veo 3.1 é um conjunto de restrições em torno das quais um pipeline de produção pode planejar — listas de planos de oito segundos, uma escada de extensão para tomadas mais longas, 24 fps fixos, uma escada de resoluções conhecida. A saída do Griffin não é passível de storyboard de antemão de forma alguma, porque o que ele renderiza depende do que a pessoa faz em seguida.

Quanto custa o Veo 3.1, em cada nível

As tarifas publicadas da API Gemini do Google incluem áudio, são por segundo de saída, e não existe escalão gratuito em nenhum nível do Veo 3.1. O áudio não pode ser desativado nessa API — é gerado em todos os pedidos — o que é importante porque fontes terceiras descrevem uma tabela de tarifas da Vertex AI em que o vídeo silencioso fica a cerca de metade do valor com áudio incluído. A documentação da própria Google não expõe essa opção. Se uma tarifa sem áudio for importante para a sua fatura, confirme-a na sua própria faturação da Vertex, em vez de numa página de comparação, incluindo esta.

Veo 3.1 Standard — $0,40/s em 720p e 1080p, $0,60/s em 4K.

• Veo 3.1 Fast — $0,10/s em 720p, $0,12/s em 1080p, $0,30/s em 4K.

• Veo 3.1 Lite — $0.05/s a 720p, $0.08/s a 1080p, sem opção 4K.

Aplique a regra dos oito segundos a essas tarifas e o custo por tentativa é o que uma equipe criativa realmente orça: 32 centavos por uma tomada de oito segundos em 1080p no Standard, 80 centavos por uma de quatro segundos na mesma resolução, porque o piso de oito segundos não se aplica abaixo de 720p, e US$ 4,80 por uma única tomada de oito segundos em 4K. É nesse último número que vale a pena parar para pensar, porque uma busca de quatro tentativas por uma tomada 4K utilizável fica pouco abaixo de vinte dólares, e a exigência de oito segundos significa que você não pode testar a ideia com metade da duração por metade do preço.

Griffin não tem preço, não tem plano gratuito e não tem qualquer tipo de tabela de preços. O Griffin-Lite está disponível para testadores confiáveis selecionados como prévia de pesquisa mediante formulário de solicitação, não está na plataforma Tavus, e o anúncio deixa explícito que ele não estará disponível para uso por clientes neste momento. A frase de encerramento da Tavus na página é que o Griffin chegará quando a empresa tiver descoberto como lançá-lo com segurança. Toda afirmação neste artigo que compara os dois em qualquer coisa que se assemelhe a uma decisão de compra tem uma lacuna na metade correspondente a Griffin, e nenhuma quantidade de pesquisa a preenche.

O que os dois placares realmente medem

Os dois modelos foram avaliados por instrumentos diferentes pela mesma razão pela qual é difícil precificá-los um em relação ao outro.

O Veo 3.1 está na arena de vídeo do Artificial Analysis, onde o Elo vem da preferência humana cega em pares sobre clipes curtos. Leia em 2 de outubro de 2026 no ranking de texto para vídeo com áudio:

• Veo 3.1 — 18.º–21.º, Elo 968 (±11) em 2.857 votos, $24,00/min.

• Veo 3.1 Fast — 18–21, Elo 961 (±10) em 3.595 votos, $7,20/min.

• Veo 3.1 Lite — 21º–24º, Elo 949 (±11) em 2.762 votos, US$ 4,80/min. • Veo 3.1 em imagem para vídeo (com áudio) — 11º de 34, Elo 1.082 em 7.049 votos, US$ 24,00/min. É a sua melhor colocação em qualquer ranking e a que tem mais votos.

Duas coisas decorrem disso. Todos os três níveis ficam dentro de dezenove pontos Elo uns dos outros, com intervalos de confiança sobrepostos, de modo que o preço por segundo quatro vezes maior do nível padrão não compra uma preferência mensurável em teste cego. E a linha mais recente Gemini Omni Flash da própria Google supera todos os níveis do Veo 3.1 no mesmo ranking — 7º–8º, com Elo 1.117 em 7.801 votos e US$ 9,12/min, à frente de todos os três níveis, embora custe entre um quarto e um quinto do preço por minuto deles — o que é uma pergunta que todo comprador do Veo 3.1 deveria estar fazendo, e que este artigo não é o lugar para responder.

Os números do Griffin vêm do VideoFDB da NVIDIA, um benchmark para conversa audiovisual full-duplex que a NVIDIA criou e avaliou de forma independente em setembro de 2026. O Griffin-Lite obteve 3,83 de 5 na trilha de geração, contra uma referência humana de 3,92 e 2,80 para o próximo sistema publicado mais bem colocado, e 3,73 na trilha de percepção, contra uma referência humana de 4,20. A Tavus também relata 0,43 segundos de latência real de áudio para vídeo do gerador, em comparação com quatro baselines publicados de difusão em streaming em H100s, descrevendo-a como metade da do próximo mais rápido.

Nenhum dos dois conjuntos se transfere. Um Elo proveniente da votação de preferência em clipes curtos não diz nada sobre se um modelo pode ser interrompido; a pontuação de um juiz numa rubrica de conversação não diz nada sobre se um clipe tem a aparência correta em 4K. E as ressalvas valem nas duas direções: a diferença de 0,09 ponto entre o Griffin e a referência humana é pequena o bastante, numa rubrica de cinco pontos avaliada por um modelo de linguagem, para que "próximo do humano" seja a leitura honesta, e parte de sua vantagem em percepção é medida em relação a sistemas que operam sem qualquer entrada de vídeo.

A screenshot of the middle of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026, covering rows eleven to twenty-four: grok-imagine-video-1.5 at Elo 1,046, HappyHorse-1.1 at 1,045, Wan2.7-260612 at 1,032 with 4,645 votes and $9.00/min, HappyHorse-1.0 at 1,026, Kling 3.0 Omni 1080p Pro at 1,018, Kling 3.0 1080p Pro at 1,000 with 4,844 votes, PixVerse V6 at 987, Veo 3.1 at 968 with 2,857 votes and $24.00/min, Veo 3.1 Fast at 961 with 3,595 votes and $7.20/min, MAGI-2 Preview (0912) at 960, LTX-2.5 Fast at 950, Veo 3.1 Lite at 949 with 2,762 votes and $4.80/min, LTX-2.5 Pro at 944 and Vidu Q3 Pro at 941.

Proveniência, que é o verdadeiro diferencial do produto.

Para uma empresa com qualquer obrigação de divulgação, esta é a única seção que importa, e não é nem de longe.

A saída do Veo 3.1 carrega o SynthID quadro a quadro nos pixels e no espectro de áudio, projetado para sobreviver à compressão, redimensionamento, recorte e gravação de tela, e o C2PA Content Credentials registra a proveniência do arquivo e o histórico de edição, interoperável com as implementações da Adobe e da Microsoft. O Google lançou a detecção no aplicativo Gemini, para que um usuário possa enviar um vídeo e perguntar se foi a IA do Google que o criou, com a detecção informando qual seção da faixa de áudio ou de vídeo continha a marca. O limite é real e vale a pena declarar: esse detector reconhece apenas os modelos do Google. Nada no portfólio da Alibaba ou da Kuaishou é comparável, e nada da Tavus também é.

A screenshot of Google DeepMind's SynthID page, captured 2 October 2026: the Google DeepMind wordmark, the "SynthID" heading, the strapline "A tool to watermark and identify content generated through AI", the section tabs Overview / How it works / Hands-on, the heading "What is SynthID?", and a "Build with Gemini" panel with a Try Gemini link.

A Tavus não publicou uma marca d'água, um detector, nem um pipeline de credenciais de conteúdo para o Griffin. O que ela publicou é a razão pela qual precisa de um. O estudo frente a frente é excepcionalmente direto sobre o modo de falha: mais da metade dos participantes disse que a possibilidade de um IA não lhes tinha passado pela cabeça durante a chamada, quase todos desse grupo concluíram que o parceiro era real, e as pessoas que suspeitaram tendiam a descobrir nos primeiros vinte segundos. Os crentes tinham em média 79% de confiança e os duvidosos 81%. Esse é um modelo cuja capacidade de engano não é um efeito colateral da qualidade de geração — é a qualidade de geração.

A resposta da Tavus está no anúncio, e não em uma nota de rodapé: as mesmas propriedades que tornam os Human Interaction Models interfaces poderosas para a comunicação natural permitem que enganem um humano, levando-o a acreditar que não é IA; são necessários mais procedimentos de alinhamento e segurança para um lançamento seguro, e a empresa está trabalhando em recursos de divulgação segura e com organizações que lidam com segurança de IA. É por isso que a barreira existe. O Griffin-Lite não estará disponível para uso por clientes neste momento.

Os termos empresariais que a Google traz e a Tavus não

O Veo 3.1 é disponibilizado através do Vertex AI, com a infraestrutura regional, o IAM e a superfície de contratação empresarial que isso implica, e a Google restringe aquilo que o modelo faz por jurisdição: através de um parâmetro de geração de pessoas, a UE, o Reino Unido, a Suíça e o MENA permitem apenas sujeitos adultos, enquanto outras regiões podem permitir todos. Trata-se de uma superfície de política documentada e sensível à região e, para um comprador regulamentado, pode pesar mais do que uma posição numa tabela de classificações.

Há um custo na forma como isto se apresenta. Os IDs de modelo do Veo 3.1 na Gemini API continuam a ser IDs de pré-visualização — veo-3.1-generate-preview e os seus congéneres —, enquanto o SKU do Vertex tem nomenclatura de disponibilidade geral, e relatórios de terceiros situam a quota de pré-visualização em cerca de um quinto da quota de produção. A Google retirou os SKUs mais antigos do Veo 3.0 em 30 de junho de 2026, o que revela como é gerida a rotatividade entre gerações e vale a pena ter em conta no preço de qualquer coisa construída sobre um ID de pré-visualização. A superfície de consumo também está genuinamente restringida: o Flow exige uma subscrição Google AI Pro ou Ultra e está bloqueado na UE, no Reino Unido, na Índia, na Indonésia, na China continental e na Rússia, sem que seja oferecida qualquer solução alternativa através de VPN.

Griffin não tem termos de serviço para ler, porque não há serviço. O acesso é um formulário de solicitação e uma prévia de pesquisa. A Tavus disse que está trabalhando com organizações de segurança em avaliações e quer que as pessoas participem delas, o que é uma postura de pesquisa, e não comercial.

Conseguir qualquer um deles

O Veo 3.1 está acessível através da API Gemini, do Vertex AI, do Google AI Studio e do Flow, e através da aplicação Gemini apenas a 720p. Fora da China, é de longe o mais fácil dos dois para obter uma chave, o que contraria o argumento de qualidade acima e é a principal razão pela qual esta comparação continua interessante apesar dos números.

Griffin pode ser acessado enviando uma solicitação de acesso e sendo selecionado como testador confiável. Esse é todo o caminho de aquisição.

Onde um roteador realmente ajuda em um pipeline do Veo é ao lado do modelo de vídeo, e não dentro dele. Os modelos de texto do Google — Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash e o restante da linha — estão no catálogo do OrcaRouter e podem ser chamados no mesmo endpoint compatível com OpenAI que mais de 200 outros modelos ao preço de tabela do provedor, com 0% de markup adicionado. Listas de planos, expansão de prompts, geração de legendas, notas de continuidade entre segmentos de oito segundos e sumarização de revisões são todo trabalho de texto, e é nessa camada que poder colocar um modelo barato em uma passagem em lote e um modelo de fronteira na passagem final custa uma mudança de configuração em vez de uma migração. O próprio Veo 3.1 nós não roteamos, e o Griffin também não; vale a pena ser explícito quanto a isso em vez de deixar um parágrafo como este sugerir o contrário.

Qual deles, honestamente?

• Escolha o Veo 3.1 quando o entregável exigir uma trilha de procedência, quando o comprador for regulamentado, quando a distribuição tiver de ser um arquivo com credenciais anexadas, ou quando 4K não for negociável. Reserve orçamento para o piso de oito segundos em todo modelo de custos e verifique o ciclo de vida do ID de pré-visualização antes de construir sobre ele um caminho voltado ao cliente.

• Não escolha o Griffin, porque você não consegue. Solicite acesso se a sua pergunta for se uma pessoa consegue distinguir uma IA de um humano em uma chamada de um minuto, ou se você precisa saber para onde a camada de interação está indo antes de comprometer um roadmap para a camada de clipe.

• Fique atento ao detector, não à demo. Se a Tavus publicar um mecanismo de divulgação que sobreviva a uma conversa casual, a diferença entre esses dois fornecedores diminui consideravelmente. Se não o fizer, o Griffin é um resultado que vale a pena citar, e o Veo 3.1 continua sendo o único dos dois que você pode colocar diante de uma equipe de conformidade.

A two-column scoreboard titled "Tavus Griffin vs Google Veo 3.1 — the scoreboard". Left column "Tavus Griffin": Provenance: none published; Price: none published; Clip length: no clip - a session; Resolution: 720p at 25 fps; Loop: full duplex; Status: research preview. Right column "Google Veo 3.1": Provenance: SynthID plus C2PA; Price: $0.40 per second; Clip length: 4, 6 or 8 seconds; Resolution: 720p native; Loop: one generation; Status: generally available. Footer: "Veo 3.1 per Google's Gemini API pricing, 2 October 2026."