
Tavus Griffin vs Kling 3: Una conversación en tiempo real contra un clip de diez segundos
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
La forma honesta de este enfrentamiento es una asimetría de enrutamiento. Kling 3 es un modelo invocable con un precio, una superficie de parámetros y una entrada en nuestro propio catálogo; Tavus Griffin es una vista previa de investigación para probadores de confianza seleccionados mediante formulario de solicitud, anunciada el 1 de octubre de 2026 sin identificador, sin endpoint y sin tarifa publicada. Kling 3.0 está en el catálogo de OrcaRouter como kling/kling-v3, con un precio de $0.084 por solicitud, con el precio de lista del proveedor pasado tal cual y sin añadir nada. Griffin no es enrutable, y no porque nadie se haya puesto a ello — una sesión dúplex completo en tiempo real en la que el modelo genera 720p en fragmentos de 320 milisegundos mientras escucha no es una llamada de solicitud-respuesta, y no encajaría en la misma forma aunque Tavus abriera las puertas mañana. Así que esta no es una comparación que un comprador resuelva por precio. Es una comparación de dos respuestas a la pregunta de para qué sirve un humano generado.
Qué es Kling 3.0 realmente
Kling 3.0 se lanzó el 5 de febrero de 2026 como una serie de cuatro modelos: Video 3.0, Video 3.0 Omni, Image 3.0 e Image 3.0 Omni. Su característica distintiva es la secuenciación automática de múltiples planos: el modelo planifica por sí mismo las transiciones entre planos, y un modo personalizado permite establecer el número de planos y la duración de cada uno, y los reseñadores informan de secuencias utilizables de hasta unos seis planos distintos a partir de un único prompt, pudiendo especificarse por plano el tamaño de plano, el movimiento de cámara y el compás narrativo. El límite máximo es de 15 segundos por generación, con un mínimo de tres segundos. En el lado de OrcaRouter aparece como un modelo insignia de texto a vídeo e imagen a vídeo con control de múltiples planos, del sujeto y del movimiento, clips de 3 a 15 segundos y hasta 4K nativo según lo declarado, servido en POST /v1/video/generations.
El audio se genera en la misma pasada, de forma nativa. La versión de Kuaishou admite chino, inglés, japonés, coreano y español, maneja diálogos en varios idiomas dentro de un clip, asigna una voz distinta a cada personaje en escenas con múltiples personajes y ofrece acentos regionales: inglés estadounidense, británico e indio; chino del noreste, de Pekín, taiwanés, cantonés y sichuanés. La consistencia del lip-sync es la debilidad más señalada en reseñas prácticas independientes: una prueba reportó que aproximadamente dos de cada cinco clips de diálogo necesitaban repetirse, y los artefactos reportados se concentran en torno al diálogo en ambientes ruidosos, donde los fondos de agua y viento dejan el habla apagada.
Qué es Griffin en realidad, en un párrafo
Griffin no es un generador de vídeo con modo de conversación. Son dos motores que se ejecutan simultáneamente. Un motor de modelado conversacional continuo ingiere el audio y el vídeo de una persona, reevalúa el intercambio en intervalos de menos de un segundo y decide en cada uno si permanecer en silencio, señalar, hacer backchannel o tomar el turno —emitiendo controles expresivos que transmiten sincronización temporal, postura, expresión facial y gestos, no solo palabras. Un motor de generación audiovisual convierte esos controles en sonido y píxeles a la vez: un transformer de difusión autorregresivo que genera habla un fragmento latente a la vez a partir de un prefijo de hablante codificado, y un generador de vídeo autorregresivo de pocos pasos que produce 720p en fragmentos de 320 ms a 25 fps a partir de una única fotografía de referencia. No hay prompt, ni duración de clip, ni archivo. En cuanto al audio, reporta 0,43 segundos de latencia real de audio a vídeo en H100 frente a cuatro líneas base publicadas de difusión en streaming, lo que Tavus describe como la mitad del siguiente método más rápido.
Precio y la tabla unilateral
El precio de Kling 3.0 es el único lugar en este artículo donde hay un número concreto en ambos lados de una comparación y un lado está vacío.
• Kling 3.0 en OrcaRouter — 0,084 $ por solicitud, precio de lista del proveedor repercutido con un 0 % de margen, por lo que un cambio de tarifa de Kuaishou o un recorte promocional se aplica aquí el mismo día, en lugar de tras un ciclo de contrato.
• Kling 3.0 en la arena independiente — la tabla de texto a video con audio consultada el 2 de octubre de 2026 incluye el nivel Pro 1080p a $10.08/min y el nivel Omni 1080p Pro a $8.40/min. La misma tabla clasifica los cuatro niveles de Kling 3.0 en cuatro precios diferentes, por lo que "el precio de Kling 3.0" no es una única cifra.
• Griffin: sin precio. Griffin-Lite está disponible para algunos evaluadores de confianza como vista previa de investigación, no está en la plataforma de Tavus y su propio anuncio indica que no estará disponible para uso de clientes en este momento. No hay tarifa por solicitud, ni tarifa por segundo, ni nivel gratuito que cotizar, y el modelo llegará solo después de que Tavus haya resuelto cómo lanzarlo de forma segura.
Esa es toda la sección de precios, y es honesto dejarlo ahí en lugar de inventar una estimación por segundo a partir de la huella de cómputo.
Los marcadores miden cosas diferentes y no coinciden.
Ambos modelos han sido puntuados por alguien distinto de su proveedor, con instrumentos que no pueden compararse.
Kling 3.0 se encuentra en la arena de vídeo de Artificial Analysis, donde el Elo proviene de la preferencia humana ciega por pares sobre clips cortos. Dos lecturas del mismo día cuentan historias distintas, y esa es la trampa que vale la pena nombrar: en la tabla de texto a vídeo con audio, los niveles de Kling se sitúan en la mitad de la tabla, mientras que en la tabla de imagen a vídeo con audio se sitúan sustancialmente más arriba, pero los niveles de Kling no aparecen todos en ambas. Solo las versiones Pro y Omni Pro 1080p están en la tabla de texto; el nivel Standard de 720p se puntúa en imagen a vídeo y en ningún otro lugar.
• Kling 3.0 en texto a video (con audio) — 1080p Pro en el puesto 16.º, Elo 1.000 con 4.844 votos, $10,08/min; Omni 1080p Pro en el puesto 16.º, Elo 987 con 2.741 votos, $6,90/min. El más caro de los dos niveles obtiene una puntuación más baja, que es el mismo resultado nulo que muestra la diferencia entre niveles en todo el resto de esta tabla.
• Kling 3.0 en imagen a vídeo (con audio) — 1080p Pro en los puestos 18.º a 20.º, Elo 1.055 (±6) con 14.896 votos, $20,16/min; 720p Standard en los puestos 18.º a 20.º, Elo 1.051 (±6) con 14.692 votos, $15,60/min; Omni 1080p Pro en los puestos 21.º a 22.º, Elo 1.044 (±8) con 2.945 votos, $16,80/min; Omni 720p Standard en los puestos 21.º a 24.º, Elo 1.036, $13,44/min.
La interpretación es que Kling 3.0 es más fuerte cuando parte de una imagen proporcionada que cuando parte de texto, y la tabla de imagen a vídeo tiene el triple de votos, así que su ubicación ahí es la mejor resuelta. Ese es también el modo que más usa el trabajo comercial. Fíjate en lo que aportan los cuatro niveles: dentro de imagen a vídeo abarcan dieciséis puntos Elo en un rango de precios de $13.44 a $20.16 por minuto, y el más barato de los cuatro no es el peor clasificado. Pagar más por Kling 3.0 no lo hace ascender en esta tabla.

Las puntuaciones de Griffin provienen de VideoFDB de NVIDIA, que puntúa conversaciones audiovisuales full-duplex en dos pistas y fue construido y ejecutado por NVIDIA con su propio juez según una rúbrica publicada. Griffin-Lite obtuvo 3.83 de 5 en generación frente a una referencia humana de 3.92 y 2.80 para el siguiente sistema publicado con mayor puntuación, y 3.73 en percepción frente a una referencia humana de 4.20, con una alineación de tasa de toma de control del 62.8% y 73.8%. Esos números no dicen nada sobre si un clip se ve bien a 1080p, y el Elo de Kling no dice nada sobre si se puede interrumpir a un modelo a mitad de frase. El único uso honesto de cualquiera de los dos es dentro de su propia pregunta.
La brecha que nadie está midiendo: la latencia frente a la longitud
Aquí hay un contraste de ingeniería real que ninguna tabla de clasificación capta, y es lo más útil de esta comparación para cualquiera que planifique un producto.
Kling 3.0 optimiza la duración y la estructura dentro de una generación acotada: hasta quince segundos, hasta unos seis planos planificados, control por plano. Su costo escala con la duración de salida, y su calidad escala con lo específico que sea el prompt. Nada de ello se ejecuta mientras el usuario todavía está hablando, y eso no es un defecto: es la forma de la categoría.
Griffin optimiza para la latencia dentro de una sesión sin límites: fragmentos de 320 milisegundos, 25 fps, una decisión tomada cada intervalo inferior a un segundo, ningún clip que planificar porque la conversación no tiene fin. Su costo, sea el que sea, escalaría con la duración de la conversación en lugar de con los segundos renderizados, y su calidad escala con lo natural que sea la persona al otro lado en lugar de con el brief. La destilación en tres etapas hacia un generador autorregresivo entrenado con su propia historia existe precisamente porque el modo de fallo de esta arquitectura es la deriva a lo largo de una ejecución prolongada, y no una mala toma.
Pon los dos uno al lado del otro y la consecuencia práctica es que fallan en direcciones opuestas. Kling 3.0 falla de forma visible y temprana: una toma al límite que puedes eliminar y regenerar por un par de centavos, con el presupuesto de repeticiones integrado en el flujo de trabajo. Griffin, si funcionara como se informa, fallaría de forma invisible y tardía, al no ser lo que parece ser, que es la razón por la que Tavus lo está reteniendo.
Dónde ayuda de verdad un router y dónde no
Kling 3.0 está en el catálogo de OrcaRouter como kling/kling-v3 a $0.084 por solicitud, en la misma clave y el mismo endpoint compatible con OpenAI que más de 200 otros modelos. Eso es una diferencia real con respecto a tener una cuenta de Kuaishou más una integración aparte para cualquier modelo de texto que necesite tu pipeline: como no añadimos nada al precio del proveedor, un cambio de tarifa de Kuaishou se aplica en nuestro lado el mismo día, y si el proveedor upstream se degrada o aplica límites de tasa, el failover automático mueve la solicitud antes de que comience la respuesta en lugar de devolver un error a tu aplicación. Para un pipeline de vídeo en el que una llamada puede costar más de mil llamadas de texto, que la solicitud sobreviva a un mal minuto upstream vale más que el sobreprecio que no pagas.
Griffin no está en nuestro catálogo, no está en el catálogo de nadie y no puede estarlo: un modelo de sesión full-duplex no es una solicitud enrutada. Solo se puede acceder a él enviando una solicitud de acceso. Que el propio Tavus dirija a los posibles desarrolladores hacia sus modelos más antiguos en lugar de hacia Griffin es la señal reveladora: los tres predecesores impulsan los PAL que ya utilizan 150.000 desarrolladores y empresas, y Griffin no está entre ellos.

¿Cuál, para qué?
• Elige Kling 3.0 para secuencias planificadas de múltiples tomas a partir de un solo prompt, para trabajo de imagen a video donde su posición en la arena sin audio es fuerte y muy votada, para diálogo multilingüe con vinculación de voz por personaje en cinco idiomas, para consistencia de elementos a través de movimientos de cámara, y para 4K si confirmas el nivel por escrito — la propia documentación de Kuaishou afirma 4K nativo mientras que su guía de usuario solo lista 720p y 1080p, y las tarifas de créditos de terceros para 4K varían en más de un factor de dos entre fuentes.
• Prueba primero Kling 3.0 en sincronización labial si el diálogo es lo importante, porque ahí es donde las reseñas prácticas independientes dicen que falla, y es el fallo que más repeticiones de tomas cuesta.
• No planifiques en torno a Griffin. Solicita acceso si la pregunta que necesitas resolver es si una persona puede distinguir a un humano generado de uno real en una llamada de un minuto, o si saber hacia dónde va la capa de interacción debería moldear lo que construyes sobre la capa de clips ahora.
• Vigila dos cosas, no una. Del lado de Kling, si la diferencia entre niveles empieza a corresponder con el precio, porque los cuatro niveles actualmente se encuentran dentro de diecinueve puntos Elo entre sí en imagen a video, mientras que difieren en precio en un 50 % más, y el nivel más barato no es el peor situado. Del lado de Griffin, si llegan un mecanismo de divulgación y una tarjeta de modelo; si lo hacen, la comparación deja de ser un ensayo de diseño y pasa a ser una decisión de adquisición, y este artículo tendrá que reescribirse.

