Una tarjeta destacada para "Tavus Griffin vs Alibaba Wan 2.7", con dos chips que dicen "Tavus Griffin — sin precio publicado" y "Alibaba Wan 2.7 — $9.00 por minuto a 1080p", sobre seis filas: Hace: una conversación en vivo; En contra: un clip de 2 a 15 segundos; Precio de Griffin: ninguno publicado; Precio de Wan 2.7: $9.00 por minuto; Estado de Griffin: vista previa de investigación; Estado de Wan 2.7: disponibilidad general. Pie de página: "Las tarifas de Wan 2.7 son precios de lista de Alibaba Cloud; Griffin es una vista previa de investigación sin tarifario."
Guides & Insights

Tavus Griffin vs Alibaba Wan 2.7: un modelo conversacional frente a uno generativo

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La tentadora forma de comparar Tavus Griffin y Alibaba Wan 2.7 es por segundo de vídeo, y esa comparación no se puede hacer. Wan 2.7 tiene una tarifa publicada —9,00 USD por minuto a 1080p en los endpoints internacionales de Alibaba Cloud en Singapur, con un nivel más barato en Pekín y Tokio—, y Tavus Griffin no tiene ninguna tarifa publicada, porque Griffin-Lite se lanzó el 1 de octubre de 2026 como vista previa de investigación para probadores de confianza seleccionados tras un formulario de solicitud. Lo que ambos sí comparten es una palabra: vídeo. Más allá de eso, son respuestas a preguntas diferentes. A uno se le pregunta qué debería ocurrir después en una conversación; al otro se le pregunta cómo se ve una escena descrita. La comparación interesante no es la calidad, sino qué necesita cada uno de ti antes de producir algo, y qué recibes de vuelta.

La diferencia es el bucle, no la resolución.

Wan 2.7 genera clip a clip a partir de un prompt. Escribes una descripción, obtienes un fragmento de metraje, lo miras y escribes otra. Wan 2.7 es una suite de cuatro modelos —texto a vídeo, imagen a vídeo, referencia a vídeo y edición de vídeo—, y la interacción es fundamentalmente transaccional: una entrada, una salida renderizada y una decisión sobre si conservarla. Nada de ello se ejecuta mientras todavía estás decidiendo qué pedir.

Griffin está construido al revés. Es un sistema full-duplex: un motor de modelado conversacional continuo que ingiere audio y video y reevalúa la conversación en intervalos de menos de un segundo, decidiendo si permanecer en silencio, señalizar, dar retroalimentación o tomar el turno, y emitiendo controles expresivos que impulsan en paralelo un generador de voz en streaming y un generador de video en streaming. Genera 720p en fragmentos de 320 ms a partir de una sola fotografía de referencia, y la afirmación que importa es que una decisión tomada a mitad de frase se refleja en la voz y el rostro dentro del mismo mini-turno. El punto de referencia para esto no es una tabla de clasificación de clips. Es si puedes interrumpirlo.

En términos simples: Wan 2.7 responde a la pregunta "¿cómo se ve esta escena en movimiento?", mientras que Griffin responde "¿qué deberían hacer este rostro y esta voz en los próximos doscientos milisegundos, dado que la persona acaba de hacer una pausa?".

Precio, en el lado donde haya uno.

Las tarifas publicadas de Wan 2.7 son por segundo de vídeo generado, y los niveles no son uniformes en toda la suite, que es el detalle que la mayoría de las páginas de comparación omiten.

• wan2.7-t2v y wan2.7-i2v — se facturan únicamente por la duración de salida. Singapur internacional: $0.10/s a 720p y $0.15/s a 1080p, que es la cifra de $9.00/min que aparece en las tablas de clasificación. Pekín y Tokio indican $0.086/s y $0.143/s por el mismo trabajo.

• wan2.7-r2v (referencia a vídeo): se factura según la duración del vídeo de entrada, con un máximo de cinco segundos, más la salida. Introduce una referencia de cinco segundos en una generación de quince segundos y se te facturará por veinte segundos.

• wan2.7-videoedit — se factura solo por la salida, con el material de entrada gratis.

Junto a esas cifras hay dos datos de ciclo de vida que conviene tener en cuenta. Alibaba aplicó un descuento de lanzamiento del 30 % por tiempo limitado en sus propias plataformas Bailian y Qwen Cloud, vigente hasta el 23 de septiembre de 2026, fecha que ya ha pasado. Y el aviso de retirada de Model Studio de Alibaba Cloud (ID 118434) deja fuera de línea varios modelos más antiguos el 10 de octubre de 2026, entre ellos wan2.7-r2v y wan2.7-image. Se trata de una retirada a nivel de variante, no de toda la generación —wan2.7-t2v y wan2.7-i2v siguen listados con tarifas vigentes y con páginas actualizadas tan recientemente como el 11 de septiembre—, pero si el reference-to-video es el motivo por el que estabas mirando la 2.7, esa ruta ya tiene fecha.

La comparación con Griffin tiene una sola línea honesta: no hay ningún precio que poner junto al de Wan 2.7, porque Tavus no ha publicado ninguno. Griffin-Lite no está en la plataforma de Tavus, el anuncio dice que no estará disponible para uso de clientes en este momento, y la frase de cierre de la propia empresa es que Griffin llegará cuando haya resuelto cómo lanzarlo de forma segura. No hay tarifa por segundo, ni tarifa por solicitud, ni nivel gratuito, ni nivel empresarial. Cualquiera que cite un precio para Griffin se lo está inventando.

Puntuaciones de calidad: dos tableros que no cumplen

Los dos modelos se han puntuado con instrumentos completamente distintos, y por eso no existe ninguna comparación Elo entre ellos.

Wan 2.7 tiene dos entradas en la arena de vídeo de Artificial Analysis, y no están en el mismo lugar — esa es la trampa que supone citar un único número para él. El Elo que aparece allí se deriva de votos ciegos de preferencia humana por pares, una metodología diseñada para clips generados cortos, y ambas lecturas que figuran a continuación provienen de tableros consultados el 2 de octubre de 2026.

• Wan2.7-260612 (la versión de junio) en texto a video (con audio) — 13.º–14.º, Elo 1.032 (±10) sobre 4.645 votos, 9,00 $/min.

• Wan 2.7 (versión de abril) en imagen a video (con audio) — 12.º de 34, Elo 1.077 con 4.571 votos, $9,00/min, una tabla que tiene aproximadamente el mismo número de votos pero lo sitúa sustancialmente más alto.

• Wan 3.0, el hermano más nuevo — 1.º en Elo 1.157 en texto a vídeo y 6.º con 1.164 en imagen a vídeo, ambos a $12.00/min. Ese es el número que vale la pena conocer antes de comparar Wan 2.7 con cualquier cosa: la propia siguiente generación de Alibaba encabeza la tabla y 2.7 es una versión de media tabla.

A screenshot of the top of Artificial Analysis's "AA-Video-T2V v2.0" leaderboard, text-to-video with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157 with 7,575 votes and $12.00/min; Utopai X (based on MiniMax H3) second at 1,150; Dreamina Seedance 2.5 third at 1,144; MiniMax H3 (768p) fourth at 1,139 and $4.80/min; MiniMax H3 Max fifth at 1,134; FLUX 3 sixth at 1,127; Gemini Omni Flash eighth at 1,117 and $9.12/min; Wan2.7-260612 thirteenth at 1,032 with 4,645 votes and $9.00/min; and the two Kling 3.0 1080p tiers sixteenth, at Elo 1,018 and Elo 1,000.

Griffin se basa en VideoFDB de NVIDIA, un benchmark para la conversación audiovisual de dúplex completo que NVIDIA creó y puntuó de forma independiente en septiembre de 2026, utilizando un juez basado en un modelo de lenguaje con una rúbrica de cero a cinco. Griffin-Lite obtuvo 3,83 en la pista de generación frente a una referencia humana de 3,92 y 2,80 para el siguiente sistema publicado con mayor puntuación, y 3,73 en la pista de percepción frente a una referencia humana de 4,20. Tavus también reporta 0,43 segundos de latencia real de audio a video para el generador frente a cuatro bases de referencia publicadas de difusión en streaming sobre H100s.

Ambos conjuntos de números son legítimos y ninguno de los dos es extrapolable. El Elo en la arena es un recuento de votos sobre la preferencia de clips; VideoFDB es la puntuación de rúbrica de un juez sobre el comportamiento conversacional. No hay puente entre ellos, y la trampa de las muestras pequeñas también va en el otro sentido: la banda de ±10 de la arena en Wan 2.7 es lo bastante amplia como para que su posición frente a los vecinos no esté firmemente resuelta, y la brecha de 0,09 puntos en generación de NVIDIA frente al humano es lo bastante pequeña en una rúbrica de cinco puntos como para que «cerca de la referencia humana» sea la lectura honesta, no «al nivel humano». La comparación de percepción tampoco se hace en igualdad de condiciones: varios de los sistemas que quedan por detrás de Griffin, incluidos gpt-realtime de OpenAI y MiniCPM-o 4.5, se puntúan en configuraciones solo de audio, mientras que Griffin también percibe vídeo. Parte de la ventaja de 0,29 puntos mide el hecho de tener ojos.

Lo que cada uno necesita de ti

Aquí es donde la comparación se vuelve útil, porque los insumos son los productos.

• Entrada — Wan 2.7 toma texto, una imagen, un video y audio. Griffin capta a una persona en vivo mediante cámara y micrófono, y no genera ningún clip cuando se le solicita.

• Salida — Wan 2.7 produce un archivo de video, de 2 a 15 segundos por generación, hasta 1080p, con audio nativo. Griffin produce una conversación continua: video 720p a 25 fps en fragmentos de 320 ms, generado en tiempo real y reproducido a medida que se decodifica.

• Qué lo guía: Wan 2.7 se guía por el prompt y por hasta cinco imágenes del sujeto y cinco clips de referencia, dentro de un límite de diez recursos de referencia por solicitud. Griffin se guía por lo que hace la persona: una pausa, una mirada hacia otro lado, un gesto, una interrupción.

• Horizonte temporal — La unidad de trabajo de Wan 2.7 es un clip de como máximo quince segundos, que luego ensamblas. La unidad de trabajo de Griffin es una conversación, y por eso la arquitectura tuvo que resolver la deriva —la destilación en tres etapas hacia un generador autorregresivo, entrenado con su propio historial generado para que las ejecuciones prolongadas se mantengan estables— en lugar de pelear por una única generación más larga.

• Contenedor de salida — Wan 2.7 devuelve un archivo que te pertenece y puedes editar, etalonar y distribuir. Griffin devuelve una sesión renderizada. No hay archivo que editar, porque los píxeles se generan por fragmento a partir de una foto de referencia y del propio historial del modelo, y el fondo, las sombras y la silla en la que se sienta la persona forman parte de la generación.

Una diferencia estructural que vale la pena mencionar: los costos de Wan 2.7 escalan con la duración de la salida y su calidad escala con lo específico que sea tu prompt. Los costos de Griffin no están medidos y su calidad escala con lo natural que sea la persona al otro lado. Puedes mejorar uno escribiendo mejores briefs y el otro solo usándolo con personas reales.

A screenshot of the top of Artificial Analysis's "AA-Video-I2V v1.0" leaderboard, image-to-video with audio, captured 2 October 2026: MiniMax H3 Max first at Elo 1,195; MiniMax H3 second at 1,181; Gemini Omni Flash third at 1,178; Dreamina Seedance 2.0 720p fourth at 1,176; HiDream-O1-Video-1.0 fifth at 1,175; Wan 3.0 sixth at 1,164 with 9,302 votes and $12.00/min; Veo 3.1 eleventh at 1,082; and Wan 2.7 twelfth at Elo 1,077 with 4,571 votes and $9.00/min. A note above the table says "AA-Video-I2V v2.0 is coming soon".

Referencia y consistencia, donde ambos diseños chocan

Wan 2.7 controla la consistencia del sujeto mediante referencias proporcionadas: cinco imágenes del sujeto, cinco clips de referencia, diez recursos en total. Es un enfoque fotográfico: le muestras cómo se ve el sujeto y mantiene esa apariencia a lo largo de la generación.

Griffin controla lo mismo, pero a la inversa. Genera cada píxel de cada fotograma a partir de una única imagen de referencia en tiempo real, y el anuncio deja claro que controla toda la escena en lugar del rostro: los brazos y los dedos, el movimiento de la silla, las sombras proyectadas y el fondo que hay detrás. La consistencia allí se logra convirtiendo el entorno en un objetivo de generación en lugar de una placa compuesta.

Ninguno de los dos enfoques es estrictamente mejor y fallan de manera distinta. La generación condicionada por referencia falla al alejarse del sujeto proporcionado a lo largo de un clip largo. La generación por fragmentos con un historial autorregresivo falla al divagar a lo largo de una sesión larga si el manejo de la deriva es incorrecto, que es exactamente el fallo que la tercera etapa de destilación existe para prevenir. Wan 2.7 es la opción más segura cuando el entregable es una persona específica con un aspecto específico. Griffin no compite por ese encargo.

Seguridad, procedencia y la postura de lanzamiento

Wan 2.7 no incluye ningún sistema de procedencia publicado comparable a una marca de agua que sobreviva a la compresión; el anuncio señala la calidad de audio y la precisión del texto en pantalla como áreas que aún requieren trabajo, lo cual es una advertencia de fidelidad más que de seguridad.

La historia de seguridad de Griffin está invertida: la razón declarada por Tavus para mantenerlo en preview es que las mismas propiedades que lo convierten en una mejor interfaz lo hacen mejor para persuadir a alguien de que está hablando con un humano, y los números respaldan la preocupación. En el propio estudio en vivo de la empresa, 26 de 54 participantes creyeron que su interlocutor era una persona real, frente a 1 de 41 con la combinación anterior Phoenix-4.5 / Raven-1 / Sparrow-2. Los participantes que sí sospechaban tendían a sospechar en los primeros veinte segundos. Tavus afirma que se requiere más trabajo de alineación y divulgación antes del lanzamiento, que está creando funciones de divulgación y que está colaborando con organizaciones en evaluaciones de seguridad. Eso es lo más sustancial que alguien ha publicado sobre este modelo, y también es la razón por la que no hay ningún producto que comprar.

Para cualquiera que compare los dos como herramientas, la consecuencia práctica es simple: uno se puede generar a demanda y entregar hoy, y el otro es un objetivo de evaluación cuyo lanzamiento está condicionado a un problema que el proveedor aún no ha resuelto.

¿Cuál, para qué?

• Elige Wan 2.7 si el entregable es metraje. La edición basada en instrucciones de material existente es la carga de trabajo donde resulta inusualmente sólido y inusualmente económico, porque la variante de edición factura solo por la salida y trata el material de entrada como gratuito. Merece la pena comprobar su variante reference-to-video frente a la retirada del 10 de octubre antes de comprometerte con ella.

• No elijas Griffin para nada este trimestre, porque no puedes. Solicita acceso si necesitas saber si una persona puede notarlo, o si tu hoja de ruta depende de la capa de interacción en lugar de la capa de metraje.

• Vigila la brecha, no a ninguno de los dos modelos. La llegada de Griffin convierte la comparación más interesante en una futura: un sistema que genera toda la conversación frente a una suite que genera toda la escena. El primer producto que haga ambas cosas será aquel con el que valdrá la pena releer esto.

Dónde encaja un router y dónde no

Ninguno de estos modelos está en el catálogo de OrcaRouter, y vale la pena decirlo antes que cualquier otra cosa en esta sección. Se puede acceder a Wan 2.7 a través de las propias plataformas de Alibaba —Model Studio en Alibaba Cloud y Qwen Cloud— y mediante herramientas creativas de terceros que lo integraron después de su lanzamiento; a Tavus Griffin solo se puede acceder mediante formulario de solicitud. Si alguno de los dos llega a ser enrutable, aparecerá al precio de lista del proveedor.

La parte de un pipeline de video que constituye un problema de enrutamiento es el texto que lo rodea. Las listas de planos, la expansión de prompts, la generación de subtítulos, los resúmenes de revisión de calidad y el trabajo de transcripción o diálogo que alimenta una pasada de referencia a video son todas llamadas de texto, y estas se ejecutan en el mismo endpoint compatible con OpenAI de OrcaRouter que otros más de 200 modelos al precio de lista del proveedor con un 0% de margen añadido, de modo que un recorte de precios del proveedor se aplica el mismo día en lugar de después de un ciclo de contrato. Dividir un modelo barato para una pasada masiva y un modelo de frontera para la pasada final es allí un cambio de configuración en lugar de una segunda relación con un proveedor, que es el mismo argumento que se aplica a la capa de generación, una vez que la capa de generación es algo que se puede invocar.

Qué hay que observar: si las variantes de referencia y edición de la suite Wan 2.7 sobreviven sin cambios a la retirada de Model Studio del 10 de octubre, y si la barrera de seguridad de Griffin produce una ficha de modelo publicada con un endpoint en ella. Esos dos acontecimientos son los que convertirían esta comparación de un ensayo de diseño en una decisión de compra.

A two-column scoreboard titled "Tavus Griffin vs Alibaba Wan 2.7 — the scoreboard". Left column "Tavus Griffin": Makes: a live conversation; Price: none published; Output: 720p in 320 ms chunks; Input: a person on camera; Clip length: none - a session; Score: VideoFDB 3.83 of 5. Right column "Alibaba Wan 2.7": Makes: 2 to 15 second clips; Price: $9.00 per minute; Output: up to 1080p; Input: text, image, video; Clip length: 2 to 15 seconds; Score: arena Elo 1,032. Footer: "Wan rates per Alibaba Cloud; Elo per Artificial Analysis, 2 October 2026. Griffin figures Tavus-reported."