
Tavus Griffin vs Kling 3 : une conversation en temps réel face à un clip de dix secondes
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La forme honnête de cette confrontation est une asymétrie de routage. Kling 3 est un modèle appelable avec un prix, une surface de paramètres et une entrée dans notre propre catalogue ; Tavus Griffin est un aperçu de recherche destiné à certains testeurs de confiance, derrière un formulaire de demande, annoncé le 1er octobre 2026 sans identifiant, sans endpoint et sans tarif publié. Kling 3.0 figure dans le catalogue OrcaRouter sous kling/kling-v3, au prix de 0,084 $ par requête, avec le prix catalogue du fournisseur répercuté et rien ajouté. Griffin n'est pas routable, et ce n'est pas faute d'avoir eu le temps de s'en occuper — une session temps réel en duplex intégral dans laquelle le modèle génère du 720p par tranches de 320 millisecondes tout en écoutant n'est pas un appel requête-réponse, et elle ne correspondrait pas à la même forme même si Tavus ouvrait les portes demain. Il ne s'agit donc pas d'une comparaison qu'un acheteur tranche par le prix. C'est une comparaison de deux réponses à la question de savoir à quoi sert un humain généré.
Ce qu'est réellement Kling 3.0
Kling 3.0 a été lancé le 5 février 2026 sous la forme d'une série de quatre modèles — Video 3.0, Video 3.0 Omni, Image 3.0 et Image 3.0 Omni. Sa caractéristique déterminante est le séquençage multi-plans automatique : le modèle planifie lui-même les transitions entre les plans, et un mode personnalisé permet de définir le nombre de plans ainsi que la durée de chacun, des évaluateurs rapportant des séquences exploitables allant jusqu'à environ six plans distincts à partir d'un seul prompt, la taille de plan, le mouvement de caméra et le temps narratif pouvant être spécifiés par plan. Le plafond est de 15 secondes par génération, avec un plancher de trois secondes. Du côté d'OrcaRouter, il apparaît comme un modèle phare de texte-vers-vidéo et d'image-vers-vidéo avec multi-plans, contrôle du sujet et du mouvement, des clips de 3 à 15 secondes et jusqu'à la 4K native, servi sur POST /v1/video/generations.
L’audio est généré nativement dans la même passe. La version de Kuaishou prend en charge le chinois, l’anglais, le japonais, le coréen et l’espagnol, gère les dialogues multilingues au sein d’un même clip, attribue une voix distincte à chaque personnage dans les scènes à plusieurs personnages, et propose des accents régionaux — anglais américain, britannique et indien ; chinois du Nord-Est, de Pékin, taïwanais, cantonais et sichuanais. La cohérence de la synchronisation labiale est la faiblesse la plus souvent signalée dans les tests pratiques indépendants, un test rapportant qu’environ deux clips de dialogue sur cinq ont nécessité une reprise, et les artefacts signalés se concentrant autour des dialogues dans des ambiances bruyantes où des bruits de fond d’eau et de vent rendent la parole assourdie.
Ce qu'est réellement Griffin, en un paragraphe
Griffin n'est pas un générateur vidéo doté d'un mode conversationnel. C'est deux moteurs qui tournent simultanément. Un moteur de modélisation conversationnelle continue ingère l'audio et la vidéo d'une personne, réévalue l'échange à des intervalles inférieurs à la seconde et décide, à chacun d'eux, s'il doit rester silencieux, émettre un signal, faire un retour de canal ou prendre la parole — en émettant des contrôles expressifs qui portent le timing, la posture, l'expression faciale et le geste, pas seulement les mots. Un moteur de génération audiovisuelle transforme ces contrôles en son et en pixels simultanément : un transformateur de diffusion autorégressif qui génère la parole un fragment latent à la fois à partir d'un préfixe de locuteur encodé, et un générateur vidéo autorégressif à quelques étapes qui produit du 720p par tranches de 320 ms à 25 i/s à partir d'une seule photographie de référence. Il n'y a pas de prompt, pas de durée de clip, pas de fichier. Côté audio, il annonce 0,43 seconde de latence réelle entre l'audio et la vidéo sur des H100, face à quatre références publiées de diffusion en streaming, ce que Tavus décrit comme la moitié de la méthode la plus rapide suivante.
Price, et la table à un seul côté
Le tarif de Kling 3.0 est le seul endroit de cet article où il y a un chiffre précis des deux côtés d'une comparaison et où un côté est vide.
• Kling 3.0 sur OrcaRouter — 0,084 $ par requête, prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'une modification tarifaire de Kuaishou ou une baisse promotionnelle est appliquée ici le jour même, et non après un cycle contractuel.
• Kling 3.0 sur l’arène indépendante — le classement texte-vers-vidéo avec audio consulté le 2 octobre 2026 indique le palier 1080p Pro à 10,08 $/min et le palier Omni 1080p Pro à 8,40 $/min. Ce même classement note les quatre paliers de Kling 3.0 sur quatre prix différents, donc « le prix de Kling 3.0 » n’est pas un chiffre unique.
• Griffin — aucun prix. Griffin-Lite est disponible pour certains testeurs de confiance dans le cadre d'un aperçu de recherche, n'est pas sur la plateforme Tavus, et sa propre annonce indique qu'il ne sera pas disponible pour une utilisation par les clients pour le moment. Il n'y a pas de tarif par requête, pas de tarif par seconde et pas d'offre gratuite à citer, et le modèle n'arrivera qu'une fois que Tavus aura déterminé comment le publier en toute sécurité.
C'est là toute la section des prix, et il est honnête de s'en tenir là plutôt que d'inventer une estimation par seconde à partir de l'empreinte de calcul.
Les tableaux de bord mesurent des choses différentes et ne se rejoignent pas.
Les deux modèles ont été notés par quelqu'un d'autre que leur fournisseur, sur des instruments qui ne peuvent pas être comparés.
Kling 3.0 figure dans l’arène vidéo d’Artificial Analysis, où l’Elo provient de préférences humaines en aveugle par comparaison par paires sur de courts extraits. Deux relevés effectués le même jour racontent des histoires différentes, et c’est là un piège qu’il vaut la peine de nommer : sur le tableau texte-vers-vidéo avec audio, les paliers Kling se classent en milieu de tableau, tandis que sur le tableau image-vers-vidéo avec audio, ils se classent nettement plus haut — mais les paliers Kling n’apparaissent pas tous sur les deux. Seules les versions Pro et Omni Pro 1080p figurent sur le tableau texte ; le palier 720p Standard est évalué sur image-vers-vidéo et nulle part ailleurs.
• Kling 3.0 en texte-vidéo (avec audio) — 1080p Pro à la 16e place, Elo 1 000 sur 4 844 votes, 10,08 $/min ; Omni 1080p Pro à la 16e place, Elo 987 sur 2 741 votes, 6,90 $/min. Le plus cher des deux niveaux obtient le score le plus bas, ce qui est le même non-résultat que celui que l'écart entre les niveaux révèle partout ailleurs sur ce tableau.
• Kling 3.0 en image-vers-vidéo (avec audio) — 1080p Pro à la 18e–20e place, Elo 1 055 (±6) sur 14 896 votes, 20,16 $/min ; 720p Standard à la 18e–20e place, Elo 1 051 (±6) sur 14 692 votes, 15,60 $/min ; Omni 1080p Pro à la 21e–22e place, Elo 1 044 (±8) sur 2 945 votes, 16,80 $/min ; Omni 720p Standard à la 21e–24e place, Elo 1 036, 13,44 $/min.
L'interprétation est que Kling 3.0 est plus performant lorsqu'il part d'une image fournie que lorsqu'il part d'un texte, et le classement image-vers-vidéo compte trois fois plus de votes, donc sa position y est la mieux résolue. C'est aussi le mode qu'utilisent la plupart des travaux commerciaux. Notez ce que les quatre paliers apportent : au sein de l'image-vers-vidéo, ils couvrent seize points Elo sur une fourchette de prix allant de 13,44 $ à 20,16 $ la minute, et le moins cher des quatre n'est pas le moins bien classé. Payer plus cher pour Kling 3.0 ne le fait pas monter dans ce classement.

Les scores de Griffin proviennent du VideoFDB de NVIDIA, qui évalue une conversation audio-visuelle en duplex intégral sur deux pistes et a été construit et exécuté par NVIDIA avec son propre juge selon une grille d'évaluation publiée. Griffin-Lite a obtenu 3,83 sur 5 en génération face à une référence humaine de 3,92 et 2,80 pour le système publié le plus performant suivant, et 3,73 en perception face à une référence humaine de 4,20, avec un alignement du taux de prise de parole de 62,8 % et 73,8 %. Ces chiffres ne disent rien sur le fait de savoir si un clip est correct en 1080p, et l'Elo de Kling ne dit rien sur la capacité d'un modèle à être interrompu au milieu d'une phrase. La seule utilisation honnête de l'un ou de l'autre est dans sa propre question.
L’écart que personne ne mesure : la latence face à la longueur
Il y a ici un véritable contraste d'ingénierie qu'aucun classement ne restitue, et c'est l'élément le plus utile de cette comparaison pour quiconque planifie un produit.
Kling 3.0 optimise la longueur et la structure dans le cadre d'une génération bornée : jusqu'à quinze secondes, jusqu'à environ six plans planifiés, un contrôle par plan. Son coût évolue avec la durée de sortie, et sa qualité évolue avec la précision du prompt. Rien ne s'exécute pendant que l'utilisateur est encore en train de parler, et ce n'est pas un défaut — c'est la nature même de cette catégorie.
Griffin optimise la latence au sein d'une session non bornée : des segments de 320 millisecondes, 25 images/s, une décision prise à chaque intervalle inférieur à la seconde, aucun clip à planifier car la conversation n'a pas de fin. Son coût, quel qu'il s'avère être, évoluerait avec la durée de la conversation plutôt qu'avec les secondes de rendu, et sa qualité évolue avec le naturel de la personne à l'autre bout plutôt qu'avec le brief. La distillation en trois étapes vers un générateur autorégressif entraîné sur son propre historique existe précisément parce que le mode de défaillance de cette architecture est une dérive sur un long rollout plutôt qu'un mauvais plan.
Mettez les deux côte à côte et la conséquence pratique est qu’ils échouent dans des directions opposées. Kling 3.0 échoue visiblement et tôt — une prise limite que vous pouvez supprimer et régénérer pour quelques centimes, avec le budget de reprises intégré au flux de travail. Griffin, s’il fonctionnait comme annoncé, échouerait de façon invisible et tardive, en n’étant pas ce qu’il paraît être, ce qui explique pourquoi Tavus le retient.
Là où un routeur est vraiment utile, et là où il ne l'est pas
Kling 3.0 figure dans le catalogue OrcaRouter sous kling/kling-v3 à 0,084 $ par requête, sur la même clé et le même point de terminaison compatible OpenAI que plus de 200 autres modèles. C'est une vraie différence par rapport au fait de détenir un compte Kuaishou plus une intégration distincte pour le modèle de texte dont votre pipeline a besoin : comme nous n'ajoutons rien au prix du fournisseur, toute évolution des tarifs de Kuaishou est répercutée chez nous le jour même, et si le fournisseur en amont se dégrade ou limite le débit, le basculement automatique déplace la requête avant même que la réponse ne commence, au lieu de renvoyer une erreur à votre application. Pour un pipeline vidéo où un seul appel peut coûter plus de mille appels de texte, le fait qu'une requête survive à une mauvaise minute en amont vaut plus que la marge que vous ne payez pas.
Griffin ne figure pas dans notre catalogue, ne figure dans le catalogue de personne, et ne peut pas y figurer — un modèle de session full-duplex n’est pas une requête routée. Il n’est accessible qu’en soumettant une demande d’accès. Le fait que Tavus oriente elle-même les aspirants constructeurs vers ses anciens modèles plutôt que vers Griffin est l’indice révélateur : les trois prédécesseurs alimentent les PALs que 150 000 développeurs et entreprises utilisent déjà, et Griffin n’en fait pas partie.

Lequel, pour quoi
• Choisissez Kling 3.0 pour les séquences multi-plans planifiées à partir d'un seul prompt, pour le travail image-vers-vidéo où son positionnement dans l'arène sans audio est solide et fortement voté, pour le dialogue multilingue avec liaison vocale par personnage sur cinq langues, pour la cohérence des éléments lors des mouvements de caméra, et pour la 4K si vous confirmez le palier par écrit — la documentation de Kuaishou elle-même revendique une 4K native alors que son guide utilisateur ne mentionne que le 720p et le 1080p, et les tarifs de crédits tiers pour la 4K varient de plus d'un facteur deux selon les sources.
• Testez d'abord Kling 3.0 sur la synchronisation labiale si le dialogue est l'essentiel, car c'est là que des tests pratiques indépendants disent que ça casse, et c'est l'échec qui coûte le plus de reprises.
• Ne planifiez pas en fonction de Griffin. Demandez l’accès si la question à laquelle vous avez besoin de répondre est de savoir si une personne peut distinguer un humain généré d’un humain réel lors d’un appel d’une minute, ou si le fait de savoir où va la couche d’interaction doit influencer ce que vous construisez maintenant sur la couche de clips.
• Surveillez deux choses, pas une. Du côté de Kling, si l’écart entre les paliers commence à suivre le prix, car les quatre paliers se situent actuellement à moins de dix-neuf points Elo d’écart entre eux en image-to-video, alors que leurs prix diffèrent de moitié en plus, et le palier le moins cher n’est pas le plus mal placé. Du côté de Griffin, si un mécanisme de divulgation et une fiche de modèle arrivent ; s’ils arrivent, la comparaison cesse d’être un essai de conception et devient une décision d’approvisionnement, et cet article devra être réécrit.

