
Kandinsky 6.0 Video vs Grok Imagine Video : le classement a été bouleversé
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 150 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
En janvier 2026, lorsque Grok Imagine Video a été lancé, il a dominé l'arène vidéo Artificial Analysis dans les deux modes. Aujourd'hui, le même classement place sa version actuelle onzième ou douzième en texte-vers-vidéo. Ce n'est pas un scandale et ce n'est pas un échec — c'est ce qui arrive à une catégorie qui évolue vite en neuf mois, et c'est la raison honnête pour comparer le modèle de génération de xAI à Kandinsky 6.0 Video en ce moment. L'un d'eux est un service optimisé pour la vitesse à laquelle vous pouvez produire un autre clip ; l'autre est un checkpoint sous licence MIT, 29 milliards de paramètres dans la version Pro et 3 milliards dans la version Lite, publié par le Kandinsky Lab de Sber lors de la première semaine d'octobre 2026, générant cinq secondes de vidéo avec un audio synchronisé en 44 kHz et une synchronisation labiale. La question intéressante n'est pas de savoir lequel est en tête dans un classement — mais ce que chacun est structurellement capable de faire ensuite.
La planche qui a bougé sous lui
Grok Imagine Video est le modèle de génération de xAI, sorti pour la première fois le 29 janvier 2026 et stable en version 1.5 depuis le 16 juin. Sur le classement texte-vidéo d’Artificial Analysis, sa version 1.5 occupe la 11e–12e place avec un Elo de 1 045 (±9) sur 4 056 votes, affiché à 15,00 $ par minute. La version d’origine ne figure pas dans ce classement.
L'image vers vidéo est le domaine où la famille est la plus forte, et où les deux builds se distinguent d'une manière qui mérite une lecture attentive :
• grok-imagine-video-1.5 — 7e–9e, Elo 1 098 (±8), 5 267 votes, 8,40 $/min.
• grok-imagine-video (la version de janvier) — 12e–17e, Elo 1 072 (±7), 14 371 votes, 4,20 $/min.
• Pour donner un ordre de grandeur, le sommet de ce classement I2V — MiniMax H3 Max — se situe à 1 195 points Elo (±9) avec 5 894 votes, et Wan 3.0 est sixième à 1 164.
Deux lectures s’ensuivent, et toutes deux sont vraies. La version plus récente de xAI devance véritablement son propre prédécesseur en image-vers-vidéo, de 26 Elo, et il en coûte deux fois plus cher par minute pour l’être. Et le récit de la semaine de lancement — un modèle arrivé au sommet — n’a pas tenu : le domaine a bougé, l’arène a accumulé des dizaines de milliers de votes sur une douzaine de systèmes plus récents, et une position en milieu de tableau est là où neuf mois de compétition placent un générateur rapide et polyvalent.
Kandinsky 6.0 Video n'a aucun Elo sur aucun classement. Ses éléments de preuve sont une exécution VABench et une évaluation humaine menée en laboratoire, toutes deux publiées par Sber, et aucune reproduite en dehors. Placer un modèle ouvert non audité à côté d'un modèle commercial noté est exactement le type de comparaison à traiter avec prudence : la position du modèle noté est réelle et peu flatteuse, et la position du modèle non noté est inconnue. « Inconnu » ne signifie pas « meilleur ».
Deux sortes de rapidité, et une seule d’entre elles se mesure en secondes
L'objectif de conception de Grok Imagine Video est le débit par créateur. Il est intégré à X, il renvoie un clip fini avec son, et son ensemble de fonctionnalités ressemble à une liste de ce que les gens font réellement dans un fil : plusieurs ratios d'aspect, mouvement de caméra, ajout, suppression et remplacement d'objets, transfert de style, génération conditionnée par référence à partir de plusieurs images pour la cohérence des personnages, audio natif avec dialogues, effets et musique. La durée des clips va jusqu'à quinze secondes, la résolution plafonne à 1080p. Tout le produit est conçu pour qu'une seconde tentative vous coûte quelques minutes et quelques centimes.
Kandinsky 6.0 Video est rapide dans un autre sens — non pas par tentative, mais par unité de possession. Rien n'est instantané avec lui. Les temps d'exécution propres au dépôt pour le modèle non distillé, après échauffement et en excluant le chargement des poids et l'encodage MP4, situent un clip Pro Full HD de cinq secondes à environ 402 secondes sur une H100, 854 sur une RTX 5090, 1 247 sur une RTX 4090 et 3 530 sur une RTX 5060 Ti. Lite Full HD est à 284 secondes sur une H100. L'outil qui rend cela supportable est le checkpoint distillé, que l'article a mesuré à parité avec le modèle complet — préféré ou à égalité sur la majorité des critères, préférence moyenne de 51 % contre 49 %, aucune différence individuelle n'atteignant le seuil de signification. Ce que vous obtenez en échange du rendu lent, c'est un modèle sur votre propre disque, sans aucun compteur par clip en marche.
Voilà la véritable physionomie de ce duel. Grok Imagine Video optimise le coût de la dixième tentative. Kandinsky 6.0 Video optimise le coût de la dix-millième, et vous fait payer en matériel et en patience pour la première.
Les deux génèrent de l’audio — et ce n’est pas la même affirmation.
C'est l'axe où une comparaison paresseuse dirait « égalité » et se tromperait.
Grok Imagine Video produit de l'audio natif avec dialogues, effets et musique, et ce n'est qu'une fonctionnalité parmi tant d'autres. C'est un générateur polyvalent qui se trouve intégrer du son.
Kandinsky 6.0 Video est construit autour du son. L'architecture est un CrossDiT à double flux qui associe un flux vidéo initialisé à partir de Kandinsky 5.0 Video à un flux audio entraîné de zéro sur de grands corpus audio, reliés par une attention croisée bidirectionnelle et entraînés conjointement. La sortie est en 44 kHz avec synchronisation labiale explicite, et l'étape d'apprentissage par renforcement de l'article réduirait de 47 % le taux d'erreur sur les mots de la parole générée — mesuré avec Whisper-large-v3, qui est l'un des modèles de récompense du RL, un détail qui compte car l'article rapporte un second WER, non comparable, aux côtés de VABench à l'aide de Qwen3-ASR-1.7B. C'est sur la parole que le modèle a été post-entraîné.
En revanche, l'étude de Sber elle-même est franche sur les domaines où il perd. Dans l'évaluation comparative du laboratoire, MiniMax H3 et Dreamina Seedance 2.0 sont préférés sur les critères visuels avec des marges significatives, et le modèle est décrit comme compétitif plutôt qu'en avance. L'affirmation qui mérite d'être prise au sérieux est plus étroite et plus utile : face à Kling 2.6 et Veo 3.1 Fast, les résultats s'échangent critère par critère, et Kandinsky 6.0 Video reste compétitif sur la qualité de la parole et la synchronisation audio-vidéo, où une grande fraction des comparaisons sont des égalités.
Quinze secondes contre cinq, et ce qu’il en coûte pour atteindre chacune.
• Durée max. du clip — Grok Imagine Video : jusqu’à 15 s. Kandinsky 6.0 Video : 5 s fixe, 121 images à 24 i/s, pas de mode d’extension dans cette version.
• Résolution — Grok Imagine Video : jusqu'à 1080p. Kandinsky 6.0 Video : SD, HD et Full HD via un modèle dédié de super-résolution, des agrandissements x2, x4 ou x2,25 de clips de cinq secondes.
• Entrée de référence — Grok Imagine Video : génération conditionnée par référence à partir de plusieurs images pour la cohérence des personnages, plus ajout/suppression/échange d’objets. Kandinsky 6.0 Video : une seule image, appliquée comme image de fin masquée.
• Tarification — Grok Imagine Video : par seconde de sortie, du bas de la fourchette jusqu'à 0,30 $/s en 1080p, avec un coût supplémentaire par image en entrée ; l'accès gratuit est réservé aux niveaux d'abonnement X. Kandinsky 6.0 Video : aucun — pas de service, pas de tarif, seulement le temps GPU que vous fournissez.
• Poids — Grok Imagine Video : non. Kandinsky 6.0 Video : MIT, Pro et Lite, avec intégration diffusers.
Le supplément pour la version plus récente de Grok est le chiffre à entourer. Passer de la version de janvier à la 1.5 coûte deux fois plus par minute sur le classement image-vers-vidéo et rapporte 26 Elo. C’est une véritable amélioration à un prix réel, et c’est le même compromis que tous les fournisseurs de vidéo demandent actuellement aux acheteurs de faire.
Là où un routeur a sa place, et où il ne l'a pas
OrcaRouter ne sert pas Grok Imagine Video ni Kandinsky 6.0 Video, et rien ici ne prétend le contraire : Kandinsky est à télécharger et à exécuter de votre côté, Grok Imagine Video est accessible via les propres interfaces de xAI. Ce dont un pipeline construit sur l'un ou l'autre de ces modèles a besoin de la part d'un routeur, c'est le texte qui entoure le rendu — la liste des plans, l'expansion de prompt qui transforme une idée en la légende longue ou courte sur laquelle ces modèles ont été entraînés, le travail de légendage et de transcription, et les résumés d'évaluation qui décident quelle génération est conservée. Ces éléments tournent sur un seul point de terminaison compatible OpenAI, donnant accès à plus de 200 modèles de texte au prix catalogue du fournisseur, avec 0 % de marge, donc une baisse de prix d'un fournisseur est active sur la même clé le jour où elle est mise en place, avec basculement automatique pour qu'un appel échoué au milieu d'une file de rendu soit réacheminé au lieu de bloquer le lot. L'orchestration autour d'un modèle vidéo est un problème de routage même lorsque le modèle vidéo lui-même n'est pas routable, ce qui est le cas pour ces deux modèles aujourd'hui.
Lequel, et pour quoi ?
Tournez-vous vers Grok Imagine Video quand le travail se compte en volume : clips pour les réseaux sociaux, itérations rapides, un plan que vous regénérerez six fois avant qu'il soit bon, et une échéance impossible à repousser. Ce qui fait le produit, c'est son prix par tentative, et le fait qu'il se situe désormais en milieu de tableau plutôt qu'en tête est le coût normal d'une catégorie qui évolue aussi vite.
Recourez à Kandinsky 6.0 Video lorsque le travail est un pipeline : une unité fixe de cinq secondes que vous pouvez traiter par lots, une passe image-vers-vidéo où la fidélité à une image fixe fournie est ce qui importe, une parole que vous souhaitez intelligible, et un livrable que vous préférez ne pas louer. Prévoyez le budget pour le rendu, attendez-vous à ce qu’il soit lent sur tout matériel grand public, et considérez chaque chiffre de qualité dans cet article comme provenant de Sber lui-même jusqu’à ce que quelqu’un en dehors du laboratoire l’évalue.


Ce qui rend ce duo digne d’être suivi, c’est de savoir lequel des deux peut encaisser un mauvais trimestre. Si Grok Imagine Video chute encore plus bas dans l’arène, la réponse est un meilleur modèle et un nouveau prix — c’est ainsi que fonctionne la catégorie, et xAI a déjà montré qu’elle en livrerait un. Si Kandinsky 6.0 Video s’avère être en milieu de tableau une fois évalué, le checkpoint existe toujours, tourne toujours et peut toujours être fine-tuné ; rien dans la licence ne change avec le nombre. Ce sont des formes différentes de durabilité, et une seule d’entre elles est mesurée par Elo.

