Una tarjeta destacada para "Tavus Griffin vs Google Veo 3.1" con tres chips que dicen "Veo 3.1 — SynthID en cada fotograma", "Griffin — 48% de un estudio en vivo engañado" y "Veo 3.1 Standard — desde $0.40 por segundo", sobre seis filas: Procedencia de Griffin: ninguna publicada; procedencia de Veo: SynthID más C2PA; precio de Griffin: ninguno publicado; precio de Veo: $0.40 por segundo; estado de Griffin: vista previa de investigación; estado de Veo: disponibilidad general. Pie de página: "Las tarifas de Veo 3.1 son precios de lista de la API Google Gemini; Griffin es una vista previa de investigación sin precios."
Guides & Insights

Tavus Griffin vs. Google Veo 3.1: uno le pone marca de agua a cada fotograma, el otro engañó al 48 % de una sala

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

PonTavus Griffin y Google Veo 3.1 uno al lado del otro y la comparación convencional —precio por segundo, Elo, duración del clip— se desmorona de inmediato, porque solo uno de ellos tiene precio y solo uno de ellos está puntuado según algo que un comprador pueda consultar. Pero debajo hay un eje real, y no es la calidad. La respuesta de Google a los medios sintéticos es hacerlos detectables: cada resultado de Veo 3.1 lleva SynthID, una marca de agua invisible escrita en los píxeles fotograma a fotograma y en el espectro de audio, además de C2PA Content Credentials, que registra la procedencia del archivo, y Google ha incorporado un detector en la aplicación Gemini para que un usuario pueda preguntar si un clip lo creó Google AI. La razón declarada por la que Tavus Griffin existe en versión preliminar en lugar de como producto es la imagen especular: en el propio estudio en vivo de Tavus, 26 de 54 participantes terminaron una videollamada de un minuto creyendo que su interlocutor era una persona real, frente a 1 de 41 con el stack anterior de la empresa, y Tavus dice que está frenando el modelo hasta haber resuelto cómo divulgar lo que es. Uno de estos proveedores vende detección. El otro es actualmente la razón por la que la detección importa, y lo sabe.

Dos productos construidos sobre supuestos opuestos

Veo 3.1 es un generador de clips con un margen deliberadamente estrecho. En la API Gemini de Google produce 4, 6 u 8 segundos por pasada a 24 fps, de forma nativa a 720p, y 1080p y 4K llegan mediante una pasada de escalado añadida en una actualización de enero de 2026. La extensión añade siete segundos por pasada y puede repetirse hasta veinte veces para un techo teórico de unos 148 segundos, pero la entrada debe ser un clip generado por Veo de no más de 141 segundos a 720p en 16:9 o 9:16, y la duración de ocho segundos es obligatoria para la extensión, para la entrada de imagen de referencia y para cualquier cosa por encima de 720p. No se puede crear un clip de cuatro segundos en 1080p. La salida es un archivo que te pertenece, con marca de agua, con un registro de procedencia firmado adjunto.

Griffin no produce un archivo. Ejecuta una conversación. Un motor de modelado conversacional continuo recibe audio y video y reevalúa el intercambio en intervalos de menos de un segundo, eligiendo si permanecer en silencio, emitir una señal, hacer backchannel o tomar el turno, y emite controles expresivos que impulsan en conjunto a un generador de voz en streaming y a un generador de video en streaming. El generador de video produce 720p en fragmentos de 320 ms, un latente a la vez, a 25 fps a partir de una sola fotografía de referencia, y reproduce cada fragmento a medida que se decodifica. No hay duración de clip porque no hay clip; hay una sesión que continúa hasta que alguien deja de hablar.

Esa distinción decide casi todas las demás líneas de esta comparación. El alcance de Veo 3.1 es un conjunto de restricciones en torno a las cuales un pipeline de producción puede planificar —listas de planos de ocho segundos, una escalera de extensión para tomas más largas, 24 fps fijos, una escalera de resoluciones conocida. La salida de Griffin no se puede representar en un storyboard de antemano en absoluto, porque lo que renderiza depende de lo que la persona haga a continuación.

Cuánto cuesta Veo 3.1, en cada nivel

Las tarifas publicadas de la API Gemini de Google incluyen audio, por segundo de salida, y no hay nivel gratuito en ningún nivel de Veo 3.1. El audio no se puede desactivar en esa API —se genera en cada solicitud—, lo cual es importante porque fuentes de terceros describen una tarifa de Vertex AI en la que el video silencioso cuesta aproximadamente la mitad de la cifra con audio incluido. La documentación propia de Google no expone esa opción. Si una tarifa sin audio es importante para tu factura, confírmala con tu propia facturación de Vertex en lugar de con una página comparativa, incluida esta.

• Veo 3.1 Standard — 0,40 $/s a 720p y 1080p, 0,60 $/s a 4K.

• Veo 3.1 Fast — $0.10/s a 720p, $0.12/s a 1080p, $0.30/s a 4K.

• Veo 3.1 Lite — $0,05/s a 720p, $0,08/s a 1080p, sin nivel 4K.

Si aplicas la regla de los ocho segundos a esas tarifas, el costo por intento es lo que un equipo creativo realmente presupuesta: 32 centavos por una toma de ocho segundos en 1080p en Standard, 80 centavos por una de cuatro segundos en la misma resolución porque el mínimo de ocho segundos no aplica por debajo de 720p, y $4.80 por una sola toma de ocho segundos en 4K. Ese último número es con el que hay que quedarse, porque una búsqueda de cuatro intentos para una sola toma utilizable en 4K está justo por debajo de veinte dólares, y el requisito de ocho segundos significa que no puedes probar la idea con la mitad de duración por la mitad del precio.

Griffin no tiene precio, ni nivel gratuito, ni tarifa de ningún tipo. Griffin-Lite está disponible para probadores de confianza seleccionados como vista previa de investigación mediante formulario de solicitud, no está en la plataforma Tavus, y el anuncio es explícito en que no estará disponible para uso de clientes en este momento. La frase final de Tavus en la página es que Griffin llegará una vez que la empresa haya resuelto cómo lanzarlo de forma segura. Toda afirmación en este artículo que compare a los dos en algo que se parezca a una decisión de compra tiene un agujero en la mitad de Griffin, y ninguna cantidad de investigación lo llena.

Lo que realmente miden los dos marcadores

Los dos modelos han sido evaluados con instrumentos diferentes por la misma razón por la que es difícil compararlos en precio entre sí.

Veo 3.1 está en la arena de vídeo de Artificial Analysis, donde el Elo proviene de la preferencia humana ciega por pares sobre clips cortos. Leer el 2 de octubre de 2026 en el tablero de texto a vídeo con audio:

• Veo 3.1 — 18.º–21.º, Elo 968 (±11) con 2.857 votos, $24,00/min.

• Veo 3.1 Fast — 18.º–21.º, Elo 961 (±10) con 3.595 votos, 7,20 $/min.

• Veo 3.1 Lite — 21.º–24.º, Elo 949 (±11) con 2.762 votos, $4,80/min. • Veo 3.1 en imagen a vídeo (con audio) — 11.º de 34, Elo 1.082 con 7.049 votos, $24,00/min. Su mejor puesto en cualquier clasificación, y el que más votos tiene detrás.

De eso se desprenden dos cosas. Los tres niveles se sitúan dentro de diecinueve puntos Elo entre sí, con intervalos de confianza superpuestos, así que el precio por segundo cuatro veces mayor del nivel estándar no compra una preferencia ciega medible. Y la nueva línea Gemini Omni Flash de la propia Google supera en la misma tabla a todos los niveles de Veo 3.1 —en el puesto 7.º–8.º con 1.117 de Elo en 7.801 votos y $9,12/min, por delante de los tres niveles aunque cuesta entre un cuarto y un quinto de lo que cuestan por minuto—, lo cual es una pregunta que todo comprador de Veo 3.1 debería hacerse, y una que este artículo no es el lugar para responder.

Los números de Griffin provienen de VideoFDB de NVIDIA, un benchmark para la conversación audiovisual full-duplex que NVIDIA creó y puntuó de forma independiente en septiembre de 2026. Griffin-Lite obtuvo 3,83 sobre 5 en la pista de generación frente a una referencia humana de 3,92 y 2,80 para el siguiente sistema publicado con mayor puntuación, y 3,73 en la pista de percepción frente a una referencia humana de 4,20. Tavus también reporta 0,43 segundos de latencia real de audio a vídeo para el generador frente a cuatro líneas base publicadas de difusión en streaming en H100, y lo describe como la mitad del siguiente más rápido.

Ninguno de los dos conjuntos se transfiere. Un Elo procedente de la votación de preferencias sobre clips cortos no dice nada sobre si se puede interrumpir a un modelo; la puntuación de rúbrica de un juez sobre conversación no dice nada sobre si un clip se ve bien en 4K. Y las salvedades van en ambos sentidos: la diferencia de 0,09 puntos de Griffin con la referencia humana es lo bastante pequeña en una rúbrica de cinco puntos evaluada por un modelo de lenguaje como para que «cercano a humano» sea la lectura honesta, y parte de su ventaja en percepción se mide contra sistemas que se ejecutan sin ninguna entrada de vídeo.

A screenshot of the middle of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026, covering rows eleven to twenty-four: grok-imagine-video-1.5 at Elo 1,046, HappyHorse-1.1 at 1,045, Wan2.7-260612 at 1,032 with 4,645 votes and $9.00/min, HappyHorse-1.0 at 1,026, Kling 3.0 Omni 1080p Pro at 1,018, Kling 3.0 1080p Pro at 1,000 with 4,844 votes, PixVerse V6 at 987, Veo 3.1 at 968 with 2,857 votes and $24.00/min, Veo 3.1 Fast at 961 with 3,595 votes and $7.20/min, MAGI-2 Preview (0912) at 960, LTX-2.5 Fast at 950, Veo 3.1 Lite at 949 with 2,762 votes and $4.80/min, LTX-2.5 Pro at 944 and Vidu Q3 Pro at 941.

La procedencia, que es la verdadera diferencia del producto

Para una empresa con cualquier obligación de divulgación, esta es la única sección que importa, y no hay punto de comparación.

La salida de Veo 3.1 lleva SynthID fotograma a fotograma en los píxeles y en el espectro de audio, diseñado para sobrevivir a la compresión, el redimensionado, el recorte y la grabación de pantalla, y C2PA Content Credentials registra la procedencia del archivo y el historial de ediciones, interoperable con las implementaciones de Adobe y Microsoft. Google ha incorporado la detección en la aplicación Gemini, de modo que un usuario puede subir un video y preguntar si lo ha creado Google AI, y la detección informa qué sección de la pista de audio o de video llevaba la marca. El límite es real y merece mencionarse: ese detector solo reconoce los modelos de Google. Nada de lo que ofrecen Alibaba o Kuaishou es comparable, y nada de Tavus tampoco.

A screenshot of Google DeepMind's SynthID page, captured 2 October 2026: the Google DeepMind wordmark, the "SynthID" heading, the strapline "A tool to watermark and identify content generated through AI", the section tabs Overview / How it works / Hands-on, the heading "What is SynthID?", and a "Build with Gemini" panel with a Try Gemini link.

Tavus no ha publicado una marca de agua, un detector ni una canalización de credenciales de contenido para Griffin. Lo que sí ha publicado es la razón por la que necesita uno. El estudio cara a cara es inusualmente directo sobre el modo de fallo: más de la mitad de los participantes dijo que la posibilidad de que fuera una IA no se les había pasado por la cabeza durante la llamada, casi todos los de ese grupo concluyeron que su interlocutor era real, y quienes sí sospechaban solían darse cuenta en los primeros veinte segundos. Los creyentes tenían, en promedio, un 79 % de confianza, y los escépticos, un 81 %. Ese es un modelo cuyo engaño no es un efecto secundario de la calidad de generación — es la calidad de generación.

La respuesta de Tavus está en el anuncio y no en una nota al pie: las mismas propiedades que convierten a Human Interaction Models en interfaces potentes para la comunicación natural permiten que engañen a una persona haciéndole creer que no es IA; se requieren procedimientos adicionales de alineación y seguridad para un lanzamiento seguro, y la empresa está trabajando en funciones de divulgación segura y con organizaciones que abordan la seguridad de la IA. Por eso existe la barrera. Griffin-Lite no estará disponible para uso de clientes en este momento.

Los términos empresariales que Google aporta y Tavus no

Veo 3.1 se sirve a través de Vertex AI con la infraestructura regional, IAM y la superficie de contrato empresarial que eso implica, y Google restringe lo que el modelo hará según la jurisdicción: mediante un parámetro de generación de personas, la UE, el Reino Unido, Suiza y MENA permiten solo sujetos adultos, mientras que otras regiones pueden permitir todos. Esa es una superficie de política documentada y consciente de la región, y para un comprador regulado puede superar una posición en la tabla de clasificación.

Hay un costo en la forma en que está estructurado. Los IDs de modelo de Veo 3.1 en la API de Gemini siguen siendo IDs de vista previa — veo-3.1-generate-preview y sus similares — mientras que el SKU de Vertex lleva una denominación de disponibilidad general, y los informes de terceros sitúan la cuota de vista previa en aproximadamente una quinta parte de la cuota de producción. Google retiró los SKU más antiguos de Veo 3.0 el 30 de junio de 2026, lo que te dice cómo se maneja la rotación generacional y vale la pena tenerlo en cuenta al fijar el precio de cualquier cosa construida sobre un ID de vista previa. La vertiente de consumo también está realmente restringida: Flow requiere una suscripción a Google AI Pro o Ultra y está bloqueado en la UE, el Reino Unido, India, Indonesia, China continental y Rusia, sin que se ofrezca una solución alternativa con VPN.

Griffin no tiene términos de servicio que leer, porque no hay servicio. El acceso es un formulario de solicitud y una vista previa de investigación. Tavus ha dicho que está trabajando con organizaciones de seguridad en evaluaciones y quiere que la gente participe en ellas, lo cual es una postura de investigación más que comercial.

Consiguiendo cualquiera de los dos

Se puede acceder a Veo 3.1 a través de la API de Gemini, Vertex AI, Google AI Studio y Flow, y a través de la aplicación Gemini solo a 720p. Fuera de China es, por un amplio margen, el más fácil de los dos para obtener una clave, lo que va en contra del argumento de calidad anterior y es la principal razón por la que esta comparación sigue siendo interesante a pesar de las cifras.

Se puede acceder a Griffin enviando una solicitud de acceso y siendo seleccionado como probador de confianza. Ese es todo el proceso de adquisición.

Donde un router realmente ayuda en un pipeline de Veo es en las partes adyacentes al modelo de vídeo, no dentro de él. Los modelos de texto de Google — Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 3.6 Flash y el resto de la línea — están en el catálogo de OrcaRouter y se pueden invocar en el mismo endpoint compatible con OpenAI que otros más de 200 modelos a precio de lista del proveedor con un 0 % de recargo añadido. Las listas de planos, la expansión de prompts, la generación de subtítulos, las notas de continuidad entre segmentos de ocho segundos y la síntesis de revisiones son todo trabajo de texto, y esa es la capa donde poder poner un modelo barato en una pasada masiva y un modelo de frontera en la pasada final cuesta un cambio de configuración en lugar de una migración. A Veo 3.1 en sí no lo enrutamos, y a Griffin tampoco; merece la pena ser explícitos sobre esto en lugar de dejar que un párrafo como este insinúe lo contrario.

Cuál, honestamente

• Elija Veo 3.1 cuando el entregable necesite un rastro de procedencia, cuando el comprador esté sujeto a regulación, cuando la distribución tenga que ser un archivo con credenciales adjuntas o cuando 4K no sea negociable. Presupueste el mínimo de ocho segundos en todos los modelos de costos y verifique el ciclo de vida del preview-ID antes de construir sobre él una ruta orientada al cliente.

• No elijas Griffin, porque no puedes. Solicita acceso si tu pregunta es si una persona puede distinguir a una IA de un humano en una llamada de un minuto, o si necesitas saber hacia dónde va la capa de interacción antes de comprometer una hoja de ruta con la capa de clip.

• Fíjate en el detector, no en la demo. Si Tavus publica un mecanismo de divulgación que sobreviva a una conversación informal, la brecha entre estos dos proveedores se reduce considerablemente. Si no lo hace, Griffin es un resultado que vale la pena citar y Veo 3.1 sigue siendo el único de los dos que puedes poner delante de un equipo de cumplimiento.

A two-column scoreboard titled "Tavus Griffin vs Google Veo 3.1 — the scoreboard". Left column "Tavus Griffin": Provenance: none published; Price: none published; Clip length: no clip - a session; Resolution: 720p at 25 fps; Loop: full duplex; Status: research preview. Right column "Google Veo 3.1": Provenance: SynthID plus C2PA; Price: $0.40 per second; Clip length: 4, 6 or 8 seconds; Resolution: 720p native; Loop: one generation; Status: generally available. Footer: "Veo 3.1 per Google's Gemini API pricing, 2 October 2026."