
Tavus Griffin vs Google Veo 3.1 : L'un appose un filigrane sur chaque image, l'autre a trompé 48 % d'une salle
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Mettez Tavus Griffin et Google Veo 3.1 côte à côte, et la comparaison classique — prix à la seconde, Elo, durée du clip — s'effondre aussitôt, car un seul des deux a un prix et un seul des deux est évalué sur un critère que l'acheteur peut vérifier. Mais il existe un véritable axe sous-jacent, et ce n'est pas la qualité. La réponse de Google aux médias synthétiques consiste à les rendre détectables : chaque sortie de Veo 3.1 porte SynthID, un filigrane invisible inscrit dans les pixels image par image et dans le spectre audio, ainsi que les Content Credentials C2PA qui consignent la provenance du fichier ; et Google a intégré un détecteur dans l'application Gemini pour qu'un utilisateur puisse demander si une séquence a été produite par l'IA de Google. La raison déclarée pour laquelle Tavus Griffin existe en aperçu plutôt qu'en tant que produit est exactement l'inverse : dans la propre étude en conditions réelles de Tavus, 26 des 54 participants ont terminé un appel vidéo d'une minute en croyant que leur interlocuteur était une personne réelle, contre 1 sur 41 avec la précédente pile technique de l'entreprise, et Tavus affirme qu'elle retient le modèle tant qu'elle n'a pas déterminé comment divulguer ce qu'il est. L'un de ces fournisseurs vend de la détection. L'autre est actuellement la raison pour laquelle la détection compte, et il le sait.
Deux produits construits sur des hypothèses opposées
Veo 3.1 est un générateur de clips à l'enveloppe délibérément étroite. Sur l'API Gemini de Google, il produit 4, 6 ou 8 secondes par passe à 24 fps, nativement en 720p, le 1080p et la 4K arrivant par une passe de mise à l'échelle ajoutée dans une mise à jour de janvier 2026. L'extension ajoute sept secondes par passe et peut se répéter jusqu'à vingt fois, pour un plafond théorique d'environ 148 secondes, mais l'entrée doit être un clip généré par Veo d'au plus 141 secondes en 720p, en 16:9 ou 9:16, et la durée de huit secondes est obligatoire pour l'extension, pour l'entrée d'image de référence et pour tout ce qui dépasse le 720p. Vous ne pouvez pas créer un clip de quatre secondes en 1080p. La sortie est un fichier qui vous appartient, avec filigrane, auquel est joint un enregistrement de provenance signé.
Griffin ne produit pas de fichier. Il mène une conversation. Un moteur Continuous Conversational Modeling prend en entrée de l’audio et de la vidéo et réévalue l’échange à des intervalles inférieurs à la seconde, en choisissant de rester silencieux, d’émettre un signal, de faire du backchannel ou de prendre la parole, et émet des contrôles expressifs qui pilotent ensemble un générateur de parole en streaming et un générateur vidéo en streaming. Le générateur vidéo produit de la 720p par blocs de 320 ms, un latent à la fois, à 25 i/s à partir d’une seule photographie de référence, et lit chaque bloc au fur et à mesure qu’il le décode. Il n’y a pas de longueur de clip, car il n’y a pas de clip ; il y a une session qui se poursuit jusqu’à ce que quelqu’un arrête de parler.
Cette distinction détermine presque toutes les autres lignes de cette comparaison. L’enveloppe de Veo 3.1 est un ensemble de contraintes qu’un pipeline de production peut intégrer à sa planification — des listes de plans de huit secondes, une échelle d’extension pour les prises plus longues, un 24 fps fixe, une échelle de résolutions connue. La sortie de Griffin ne peut pas du tout être storyboardée à l’avance, car ce qu’il génère dépend de ce que la personne fait ensuite.
Combien coûte Veo 3.1, à chaque niveau tarifaire
Les tarifs publiés de l'API Gemini de Google incluent l'audio, par seconde de sortie, et il n'existe aucun palier gratuit à aucun niveau de Veo 3.1. L'audio ne peut pas être désactivé sur cette API — il est généré à chaque requête — ce qui a son importance, car des sources tierces décrivent une grille tarifaire Vertex AI où la vidéo silencieuse revient à environ la moitié du montant incluant l'audio. La documentation de Google elle-même n'expose pas cette option. Si un tarif sans audio compte pour votre facture, vérifiez-le par rapport à votre propre facturation Vertex plutôt que sur une page de comparaison, y compris celle-ci.
• Veo 3.1 Standard — 0,40 $/s en 720p et 1080p, 0,60 $/s en 4K.
• Veo 3.1 Fast — 0,10 $/s en 720p, 0,12 $/s en 1080p, 0,30 $/s en 4K.
• Veo 3.1 Lite — 0,05 $/s en 720p, 0,08 $/s en 1080p, sans palier 4K.
Appliquez la règle des huit secondes à ces tarifs, et le coût par tentative est ce qu’une équipe créative budgétise réellement : 32 cents pour une prise 1080p de huit secondes sur Standard, 80 cents pour une prise de quatre secondes à la même résolution parce que le minimum de huit secondes ne s’applique pas en dessous de 720p, et 4,80 $ pour une seule prise 4K de huit secondes. C’est ce dernier chiffre qu’il faut retenir, car une recherche en quatre tentatives pour un seul plan 4K utilisable coûte un peu moins de vingt dollars, et l’exigence de huit secondes signifie que vous ne pouvez pas tester l’idée à moitié de la longueur pour moitié du prix.
Griffin n'a pas de prix, pas d'offre gratuite et aucune grille tarifaire d'aucune sorte. Griffin-Lite est disponible pour une sélection de testeurs de confiance sous forme d'aperçu de recherche, sur formulaire de demande, n'est pas sur la plateforme Tavus, et l'annonce précise explicitement qu'il ne sera pas disponible pour une utilisation par les clients pour le moment. La phrase de conclusion de Tavus sur la page est que Griffin arrivera une fois que l'entreprise aura déterminé comment le publier en toute sécurité. Chaque affirmation de cet article qui compare les deux sur quoi que ce soit ressemblant à une décision d'achat comporte un trou dans sa moitié consacrée à Griffin, et aucune quantité de recherche ne le comble.
Ce que mesurent réellement les deux tableaux de scores
Les deux modèles ont été évalués par des instruments différents pour la même raison qu'il est difficile de les valoriser l'un par rapport à l'autre.
Veo 3.1 évolue au sein de l’arène vidéo d’Artificial Analysis, où l’Elo provient de la préférence humaine en aveugle, par comparaison par paires, sur des clips courts. À lire le 2 octobre 2026 sur le classement texte-vers-vidéo avec audio :
• Veo 3.1 — 18e–21e, Elo 968 (±11) sur 2 857 votes, 24,00 $/min.
• Veo 3.1 Fast — 18e–21e, Elo 961 (±10) sur 3 595 votes, 7,20 $/min.
• Veo 3.1 Lite — 21e–24e, Elo 949 (±11) sur 2 762 votes, 4,80 $/min. • Veo 3.1 en image-to-video (avec audio) — 11e sur 34, Elo 1 082 sur 7 049 votes, 24,00 $/min. Son meilleur classement tous tableaux confondus, et celui qui compte le plus de votes derrière lui.
Deux choses en découlent. Les trois niveaux se situent à moins de dix-neuf points Elo les uns des autres, avec des intervalles de confiance qui se chevauchent, de sorte que le prix par seconde quatre fois plus élevé du niveau standard n'achète pas de préférence à l'aveugle mesurable. Et la gamme Gemini Omni Flash, plus récente et propre à Google, surclasse tous les niveaux de Veo 3.1 sur le même classement — 7e–8e à 1 117 Elo sur 7 801 votes et 9,12 $/min, devant les trois niveaux tout en coûtant entre un quart et un cinquième de leur prix par minute — ce qui est une question que tout acheteur de Veo 3.1 devrait se poser, et à laquelle cet article n'est pas le lieu de répondre.
Les chiffres de Griffin proviennent de VideoFDB de NVIDIA, un benchmark pour la conversation audio-visuelle en duplex intégral que NVIDIA a créé et évalué indépendamment en septembre 2026. Griffin-Lite a obtenu 3,83 sur 5 sur le volet génération, contre une référence humaine de 3,92 et 2,80 pour le deuxième système publié le plus performant, et 3,73 sur le volet perception, contre une référence humaine de 4,20. Tavus rapporte également une latence réelle audio-vers-vidéo de 0,43 seconde pour le générateur, face à quatre bases de référence de diffusion en streaming publiées sur des H100, et la décrit comme la moitié de celle du système le plus rapide suivant.
Aucun des deux ensembles ne se transfère. Un Elo issu d’un vote de préférence sur des clips courts ne dit rien sur la capacité d’un modèle à être interrompu ; la note d’un juge selon une grille d’évaluation sur la conversation ne dit rien sur le fait qu’un clip rende correctement en 4K. Et les réserves valent dans les deux sens : l’écart de 0,09 point de Griffin par rapport à la référence humaine est suffisamment faible sur une grille d’évaluation à cinq points notée par un modèle de langage pour que « proche de l’humain » soit la lecture honnête, et une partie de son avance en perception est mesurée face à des systèmes fonctionnant sans aucune entrée vidéo.

Provenance, qui est la véritable différence du produit
Pour une entreprise soumise à une quelconque obligation de divulgation, c’est la seule section qui compte, et de loin.
La sortie de Veo 3.1 porte SynthID image par image dans les pixels et dans le spectre audio, conçu pour survivre à la compression, au redimensionnement, au recadrage et à l'enregistrement d'écran, et les Content Credentials C2PA enregistrent la provenance du fichier et l'historique des modifications, interopérables avec les implémentations d'Adobe et de Microsoft. Google a intégré la détection dans l'application Gemini, de sorte qu'un utilisateur peut téléverser une vidéo et demander si Google AI l'a générée, la détection indiquant quelle section de la piste audio ou vidéo portait la marque. La limite est réelle et vaut la peine d'être énoncée : ce détecteur ne reconnaît que les modèles de Google. Rien dans les comptes d'Alibaba ou de Kuaishou n'est comparable, et rien de Tavus non plus.

Tavus n'a pas publié de filigrane, de détecteur, ni de pipeline de justificatifs de contenu pour Griffin. Ce qu'elle a publié, c'est la raison pour laquelle elle en a besoin. L'étude en face à face est d'une franchise inhabituelle quant au mode de défaillance : plus de la moitié des participants ont déclaré que la possibilité d'une IA ne leur avait pas traversé l'esprit pendant l'appel, presque tous les membres de ce groupe ont conclu que leur interlocuteur était bien réel, et les personnes qui ont effectivement soupçonné quelque chose ont généralement compris dans les vingt premières secondes. Les convaincus affichaient en moyenne 79 % de confiance, et les sceptiques 81 %. C'est un modèle dont le caractère trompeur n'est pas un effet secondaire de la qualité de génération — c'est la qualité de génération.
La réponse de Tavus figure dans l’annonce plutôt que dans une note de bas de page : les mêmes propriétés qui font des Human Interaction Models de puissantes interfaces pour la communication naturelle leur permettent de tromper un humain en lui faisant croire qu’il ne s’agit pas d’une IA ; des procédures supplémentaires d’alignement et de sécurité sont nécessaires pour une mise à disposition sûre, et l’entreprise travaille sur des fonctionnalités de divulgation sûres et avec des organisations qui travaillent sur la sécurité de l’IA. C’est pourquoi cette barrière existe. Griffin-Lite ne sera pas disponible pour une utilisation par les clients pour le moment.
Les conditions d’entreprise que Google apporte et que Tavus n’apporte pas
Veo 3.1 est fourni via Vertex AI avec l’infrastructure régionale, l’IAM et la surface contractuelle d’entreprise que cela implique, et Google limite ce que le modèle fera selon la juridiction : au moyen d’un paramètre de génération de personnes, l’UE, le Royaume-Uni, la Suisse et la région MENA n’autorisent que des sujets adultes, tandis que d’autres régions peuvent tout autoriser. Il s’agit d’une surface de politiques documentée et sensible aux régions, et pour un acheteur réglementé, elle peut peser plus lourd qu’une position dans un classement.
La configuration a un coût. Les identifiants de modèle de Veo 3.1 sur l’API Gemini sont encore des identifiants de préversion — veo-3.1-generate-preview et ses déclinaisons — tandis que la référence Vertex porte une dénomination de disponibilité générale, et des rapports tiers situent le quota de préversion à environ un cinquième du quota de production. Google a retiré les anciennes références Veo 3.0 le 30 juin 2026, ce qui indique comment le renouvellement générationnel est géré et mérite d’être pris en compte dans le calcul du coût de tout ce qui repose sur un identifiant de préversion. L’offre grand public est également réellement limitée : Flow nécessite un abonnement Google AI Pro ou Ultra et est bloqué dans l’UE, au Royaume-Uni, en Inde, en Indonésie, en Chine continentale et en Russie, sans qu’aucun contournement par VPN ne soit proposé.
Griffin n’a aucune condition d’utilisation à lire, car il n’y a aucun service. L’accès se fait par un formulaire de demande et un aperçu de recherche. Tavus a déclaré travailler avec des organisations de sécurité sur des évaluations et souhaite que les gens y participent, ce qui relève d’une posture de recherche plutôt que commerciale.
Obtenir l’un ou l’autre
Veo 3.1 est accessible via l’API Gemini, Vertex AI, Google AI Studio et Flow, ainsi que via l’application Gemini, mais uniquement en 720p. En dehors de la Chine, c’est de loin le plus facile des deux pour obtenir une clé, ce qui va à l’encontre de l’argument de qualité ci-dessus et constitue la principale raison pour laquelle cette comparaison reste intéressante malgré les chiffres.
Griffin est accessible en soumettant une demande d'accès et en étant sélectionné comme testeur de confiance. C'est tout le processus d'acquisition.
Là où un routeur aide véritablement dans un pipeline Veo, c’est en périphérie du modèle vidéo plutôt qu’en son sein. Les modèles texte de Google — Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash et le reste de la gamme — figurent au catalogue OrcaRouter et sont appelables sur le même point de terminaison compatible OpenAI que plus de 200 autres modèles au prix catalogue du fournisseur, sans majoration de 0 %. Les listes de plans, l’expansion de prompts, la génération de légendes, les notes de continuité entre segments de huit secondes et la synthèse des retours sont autant de tâches textuelles, et c’est à ce niveau que pouvoir confier un lot massif à un modèle économique et la passe finale à un modèle de pointe tient à un changement de configuration plutôt qu’à une migration. Veo 3.1 lui-même n’est pas routé par nos soins, et Griffin non plus ; il vaut la peine de le préciser explicitement plutôt que de laisser un paragraphe comme celui-ci sous-entendre le contraire.
Lequel, honnêtement ?
• Choisissez Veo 3.1 lorsque le livrable exige une traçabilité de provenance, lorsque l’acheteur est soumis à une réglementation, lorsque la distribution doit se faire sous forme de fichier avec des identifiants joints, ou lorsque la 4K est non négociable. Prévoyez le seuil plancher de huit secondes dans chaque modèle de coûts, et vérifiez le cycle de vie des preview-ID avant de bâtir un parcours client qui en dépend.
• Ne choisissez pas Griffin, car vous ne le pouvez pas. Demandez l'accès si votre question est de savoir si une personne peut distinguer une IA d'un humain lors d'un appel d'une minute, ou si vous devez savoir où va la couche d'interaction avant d'engager une feuille de route sur la couche de clip.
• Surveillez le détecteur, pas la démo. Si Tavus publie un mécanisme de divulgation qui survit à une conversation informelle, l’écart entre ces deux fournisseurs se réduit considérablement. Sinon, Griffin est un résultat qui vaut la peine d’être cité et Veo 3.1 reste le seul des deux que vous pouvez présenter à une équipe de conformité.

