Une carte de titre générée affichant « Kandinsky 6.0 Video vs Grok Imagine Video » avec le sous-titre « Le classement s'est inversé », au-dessus d'une rangée d'icônes intitulée « Génération vidéo », « Audio synchronisé » et « Déploiement open-weight ». Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Kandinsky 6.0 Video vs Grok Imagine Video : le classement a été bouleversé

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

En janvier 2026, lorsque Grok Imagine Video a été lancé, il a dominé l'arène vidéo Artificial Analysis dans les deux modes. Aujourd'hui, le même classement place sa version actuelle onzième ou douzième en texte-vers-vidéo. Ce n'est pas un scandale et ce n'est pas un échec — c'est ce qui arrive à une catégorie qui évolue vite en neuf mois, et c'est la raison honnête pour comparer le modèle de génération de xAI à Kandinsky 6.0 Video en ce moment. L'un d'eux est un service optimisé pour la vitesse à laquelle vous pouvez produire un autre clip ; l'autre est un checkpoint sous licence MIT, 29 milliards de paramètres dans la version Pro et 3 milliards dans la version Lite, publié par le Kandinsky Lab de Sber lors de la première semaine d'octobre 2026, générant cinq secondes de vidéo avec un audio synchronisé en 44 kHz et une synchronisation labiale. La question intéressante n'est pas de savoir lequel est en tête dans un classement — mais ce que chacun est structurellement capable de faire ensuite.

La planche qui a bougé sous lui

Grok Imagine Video est le modèle de génération de xAI, sorti pour la première fois le 29 janvier 2026 et stable en version 1.5 depuis le 16 juin. Sur le classement texte-vidéo d’Artificial Analysis, sa version 1.5 occupe la 11e–12e place avec un Elo de 1 045 (±9) sur 4 056 votes, affiché à 15,00 $ par minute. La version d’origine ne figure pas dans ce classement.

L'image vers vidéo est le domaine où la famille est la plus forte, et où les deux builds se distinguent d'une manière qui mérite une lecture attentive :

• grok-imagine-video-1.5 — 7e–9e, Elo 1 098 (±8), 5 267 votes, 8,40 $/min.

• grok-imagine-video (la version de janvier) — 12e–17e, Elo 1 072 (±7), 14 371 votes, 4,20 $/min.

• Pour donner un ordre de grandeur, le sommet de ce classement I2V — MiniMax H3 Max — se situe à 1 195 points Elo (±9) avec 5 894 votes, et Wan 3.0 est sixième à 1 164.

Deux lectures s’ensuivent, et toutes deux sont vraies. La version plus récente de xAI devance véritablement son propre prédécesseur en image-vers-vidéo, de 26 Elo, et il en coûte deux fois plus cher par minute pour l’être. Et le récit de la semaine de lancement — un modèle arrivé au sommet — n’a pas tenu : le domaine a bougé, l’arène a accumulé des dizaines de milliers de votes sur une douzaine de systèmes plus récents, et une position en milieu de tableau est là où neuf mois de compétition placent un générateur rapide et polyvalent.

Kandinsky 6.0 Video n'a aucun Elo sur aucun classement. Ses éléments de preuve sont une exécution VABench et une évaluation humaine menée en laboratoire, toutes deux publiées par Sber, et aucune reproduite en dehors. Placer un modèle ouvert non audité à côté d'un modèle commercial noté est exactement le type de comparaison à traiter avec prudence : la position du modèle noté est réelle et peu flatteuse, et la position du modèle non noté est inconnue. « Inconnu » ne signifie pas « meilleur ».

Deux sortes de rapidité, et une seule d’entre elles se mesure en secondes

L'objectif de conception de Grok Imagine Video est le débit par créateur. Il est intégré à X, il renvoie un clip fini avec son, et son ensemble de fonctionnalités ressemble à une liste de ce que les gens font réellement dans un fil : plusieurs ratios d'aspect, mouvement de caméra, ajout, suppression et remplacement d'objets, transfert de style, génération conditionnée par référence à partir de plusieurs images pour la cohérence des personnages, audio natif avec dialogues, effets et musique. La durée des clips va jusqu'à quinze secondes, la résolution plafonne à 1080p. Tout le produit est conçu pour qu'une seconde tentative vous coûte quelques minutes et quelques centimes.

Kandinsky 6.0 Video est rapide dans un autre sens — non pas par tentative, mais par unité de possession. Rien n'est instantané avec lui. Les temps d'exécution propres au dépôt pour le modèle non distillé, après échauffement et en excluant le chargement des poids et l'encodage MP4, situent un clip Pro Full HD de cinq secondes à environ 402 secondes sur une H100, 854 sur une RTX 5090, 1 247 sur une RTX 4090 et 3 530 sur une RTX 5060 Ti. Lite Full HD est à 284 secondes sur une H100. L'outil qui rend cela supportable est le checkpoint distillé, que l'article a mesuré à parité avec le modèle complet — préféré ou à égalité sur la majorité des critères, préférence moyenne de 51 % contre 49 %, aucune différence individuelle n'atteignant le seuil de signification. Ce que vous obtenez en échange du rendu lent, c'est un modèle sur votre propre disque, sans aucun compteur par clip en marche.

Voilà la véritable physionomie de ce duel. Grok Imagine Video optimise le coût de la dixième tentative. Kandinsky 6.0 Video optimise le coût de la dix-millième, et vous fait payer en matériel et en patience pour la première.

Les deux génèrent de l’audio — et ce n’est pas la même affirmation.

C'est l'axe où une comparaison paresseuse dirait « égalité » et se tromperait.

Grok Imagine Video produit de l'audio natif avec dialogues, effets et musique, et ce n'est qu'une fonctionnalité parmi tant d'autres. C'est un générateur polyvalent qui se trouve intégrer du son.

Kandinsky 6.0 Video est construit autour du son. L'architecture est un CrossDiT à double flux qui associe un flux vidéo initialisé à partir de Kandinsky 5.0 Video à un flux audio entraîné de zéro sur de grands corpus audio, reliés par une attention croisée bidirectionnelle et entraînés conjointement. La sortie est en 44 kHz avec synchronisation labiale explicite, et l'étape d'apprentissage par renforcement de l'article réduirait de 47 % le taux d'erreur sur les mots de la parole générée — mesuré avec Whisper-large-v3, qui est l'un des modèles de récompense du RL, un détail qui compte car l'article rapporte un second WER, non comparable, aux côtés de VABench à l'aide de Qwen3-ASR-1.7B. C'est sur la parole que le modèle a été post-entraîné.

En revanche, l'étude de Sber elle-même est franche sur les domaines où il perd. Dans l'évaluation comparative du laboratoire, MiniMax H3 et Dreamina Seedance 2.0 sont préférés sur les critères visuels avec des marges significatives, et le modèle est décrit comme compétitif plutôt qu'en avance. L'affirmation qui mérite d'être prise au sérieux est plus étroite et plus utile : face à Kling 2.6 et Veo 3.1 Fast, les résultats s'échangent critère par critère, et Kandinsky 6.0 Video reste compétitif sur la qualité de la parole et la synchronisation audio-vidéo, où une grande fraction des comparaisons sont des égalités.

Quinze secondes contre cinq, et ce qu’il en coûte pour atteindre chacune.

• Durée max. du clip — Grok Imagine Video : jusqu’à 15 s. Kandinsky 6.0 Video : 5 s fixe, 121 images à 24 i/s, pas de mode d’extension dans cette version.

• Résolution — Grok Imagine Video : jusqu'à 1080p. Kandinsky 6.0 Video : SD, HD et Full HD via un modèle dédié de super-résolution, des agrandissements x2, x4 ou x2,25 de clips de cinq secondes.

• Entrée de référence — Grok Imagine Video : génération conditionnée par référence à partir de plusieurs images pour la cohérence des personnages, plus ajout/suppression/échange d’objets. Kandinsky 6.0 Video : une seule image, appliquée comme image de fin masquée.

• Tarification — Grok Imagine Video : par seconde de sortie, du bas de la fourchette jusqu'à 0,30 $/s en 1080p, avec un coût supplémentaire par image en entrée ; l'accès gratuit est réservé aux niveaux d'abonnement X. Kandinsky 6.0 Video : aucun — pas de service, pas de tarif, seulement le temps GPU que vous fournissez.

• Poids — Grok Imagine Video : non. Kandinsky 6.0 Video : MIT, Pro et Lite, avec intégration diffusers.

Le supplément pour la version plus récente de Grok est le chiffre à entourer. Passer de la version de janvier à la 1.5 coûte deux fois plus par minute sur le classement image-vers-vidéo et rapporte 26 Elo. C’est une véritable amélioration à un prix réel, et c’est le même compromis que tous les fournisseurs de vidéo demandent actuellement aux acheteurs de faire.

Là où un routeur a sa place, et où il ne l'a pas

OrcaRouter ne sert pas Grok Imagine Video ni Kandinsky 6.0 Video, et rien ici ne prétend le contraire : Kandinsky est à télécharger et à exécuter de votre côté, Grok Imagine Video est accessible via les propres interfaces de xAI. Ce dont un pipeline construit sur l'un ou l'autre de ces modèles a besoin de la part d'un routeur, c'est le texte qui entoure le rendu — la liste des plans, l'expansion de prompt qui transforme une idée en la légende longue ou courte sur laquelle ces modèles ont été entraînés, le travail de légendage et de transcription, et les résumés d'évaluation qui décident quelle génération est conservée. Ces éléments tournent sur un seul point de terminaison compatible OpenAI, donnant accès à plus de 200 modèles de texte au prix catalogue du fournisseur, avec 0 % de marge, donc une baisse de prix d'un fournisseur est active sur la même clé le jour où elle est mise en place, avec basculement automatique pour qu'un appel échoué au milieu d'une file de rendu soit réacheminé au lieu de bloquer le lot. L'orchestration autour d'un modèle vidéo est un problème de routage même lorsque le modèle vidéo lui-même n'est pas routable, ce qui est le cas pour ces deux modèles aujourd'hui.

Lequel, et pour quoi ?

Tournez-vous vers Grok Imagine Video quand le travail se compte en volume : clips pour les réseaux sociaux, itérations rapides, un plan que vous regénérerez six fois avant qu'il soit bon, et une échéance impossible à repousser. Ce qui fait le produit, c'est son prix par tentative, et le fait qu'il se situe désormais en milieu de tableau plutôt qu'en tête est le coût normal d'une catégorie qui évolue aussi vite.

Recourez à Kandinsky 6.0 Video lorsque le travail est un pipeline : une unité fixe de cinq secondes que vous pouvez traiter par lots, une passe image-vers-vidéo où la fidélité à une image fixe fournie est ce qui importe, une parole que vous souhaitez intelligible, et un livrable que vous préférez ne pas louer. Prévoyez le budget pour le rendu, attendez-vous à ce qu’il soit lent sur tout matériel grand public, et considérez chaque chiffre de qualité dans cet article comme provenant de Sber lui-même jusqu’à ce que quelqu’un en dehors du laboratoire l’évalue.

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

Ce qui rend ce duo digne d’être suivi, c’est de savoir lequel des deux peut encaisser un mauvais trimestre. Si Grok Imagine Video chute encore plus bas dans l’arène, la réponse est un meilleur modèle et un nouveau prix — c’est ainsi que fonctionne la catégorie, et xAI a déjà montré qu’elle en livrerait un. Si Kandinsky 6.0 Video s’avère être en milieu de tableau une fois évalué, le checkpoint existe toujours, tourne toujours et peut toujours être fine-tuné ; rien dans la licence ne change avec le nombre. Ce sont des formes différentes de durabilité, et une seule d’entre elles est mesurée par Elo.

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.