
Odyssey-3 vs Kandinsky 6.0 Video : poids ouverts et audio face à un aperçu interactif fermé
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Kandinsky 6.0 Video est arrivé le 6 octobre 2026 avec ce que les sorties de modèles ouverts obtiennent rarement dès le premier jour : le support dans Diffusers, ComfyUI, vLLM-Omni, SGLang et FastVideo, tous documentés dans le journal de mises à jour du dépôt, aux côtés d'un rapport arXiv soumis le 4 octobre et de checkpoints sous licence MIT sur Hugging Face. Odyssey-3 est arrivé deux jours plus tard, le 8 octobre, en tant qu'aperçu de recherche public d'un transformer de diffusion autorégressif qui construit un environnement à partir d'une invite et prédit les changements en temps réel au fur et à mesure que vous le parcourez. L'un est un modèle de 29 milliards de paramètres que vous pouvez télécharger et exécuter sur votre propre GPU ce soir. L'autre est un système interactif auquel vous ne pouvez accéder que via l'aperçu navigateur d'Odyssey et un formulaire de contact. Ils sont les deux pôles de ce que « modèle vidéo » signifiait dans la même semaine d'octobre 2026, et le choix entre eux est moins une question de benchmarks que de savoir qui détient les poids.
Ils attendent aussi de vous des choses différentes. Kandinsky 6.0 Video est un modèle de génération : une invite en entrée, un clip de cinq secondes avec audio synchronisé en sortie. Odyssey-3 est un modèle de prédiction : agissez, et regardez le monde réagir. Ni l'un ni l'autre ne remplace l'autre, et le fait qu'ils soient sortis à 48 heures d'intervalle est le contexte le plus utile dont l'un ou l'autre dispose.
Les deux architectures, dans les termes mêmes des fournisseurs
Kandinsky 6.0 Video est une famille de modèles de diffusion de fondation pour la génération audio-vidéo synchronisée, comprenant Kandinsky 6.0 Video Lite à 3 milliards de paramètres et Kandinsky 6.0 Video Pro à 29 milliards. Les deux génèrent des clips de cinq secondes avec un audio synchronisé à 44 kHz, y compris la synchronisation labiale, dans les modes texte-vers-audio-vidéo et image-vers-audio-vidéo, et un modèle de super-résolution enfichable porte la sortie en Full HD 1920×1080. La technique repose sur un CrossDiT à double flux qui relie un flux vidéo préentraîné à un flux audio nouvellement entraîné via une attention croisée bidirectionnelle, de sorte que les deux modalités s'alignent dans le temps et la sémantique plutôt que d'être générées séparément puis multiplexées. La recette d'entraînement est continue : le flux audio est entraîné à partir de zéro sur de grands corpus audio, puis les deux flux sont entraînés conjointement sur des données audio-vidéo appariées tout en préservant la fidélité unimodale, suivie d'un affinage supervisé, d'un post-entraînement par apprentissage par renforcement et d'une distillation.
Odyssey-3 est un transformer de diffusion autorégressif décrit par Odyssey comme un modèle de diffusion vidéo multi-étapes étendu par teacher forcing et masquage causal, entraîné à continuer à partir des observations précédentes et à prédire les états futurs conditionnés par les entrées d'action, puis distillé par appariement de distribution et distillation adversariale en une variante à quelques étapes suffisamment rapide pour interagir avec. Il tourne en 832×480, avec Odyssey-3 Pro en 1280×720, ne produit aucun audio, et tout son intérêt réside dans le fait que sa sortie dépend de ce que vous avez fait un instant auparavant.
Le support dès le premier jour, c'est la différence que personne ne mesure

Relisez le journal des mises à jour de Kandinsky 6.0, car c’est le fait le plus concret de cette comparaison. Le 6 octobre, le projet a consigné la disponibilité dans Diffusers, le registre de nœuds ComfyUI, vLLM-Omni, SGLang et FastVideo, ainsi qu’un Hugging Face Space pour le modèle Pro distillé. Cela fait cinq piles d’inférence indépendantes en une seule journée. Pour quiconque a attendu des mois qu’un checkpoint parvienne à un framework de service, c’est le chiffre qui détermine si le modèle est utilisable.
Maintenant, mettez-le en regard de l'histoire d'accès d'Odyssey-3. L'aperçu tourne sur experience.odyssey.systems avec une navigation à la première personne, une navigation à la troisième personne et un mouvement de caméra indépendant. L'accès à l'API se fait par un formulaire de contact. Il n'y a pas de page de tarifs, pas de documentation sur les limites de débit et pas de clé en libre-service. Les conditions d'utilisation de l'API du site ont été mises à jour pour la dernière fois le 2026-01-22 et régissent encore « le prototype de l'API Odyssey-2 » — la surface commerciale n'a pas été réécrite pour le modèle livré ce mois-ci.
• Où cela s’exécute — vos propres GPU, avec les poids et le code sous licence MIT, contre les serveurs d’Odyssey uniquement.
• Comment vous l'intégrez — pipeline Diffusers, nœuds ComfyUI, vLLM-Omni, SGLang, FastVideo, face à un aperçu dans le navigateur et un formulaire de contact.
• Ce que vous pouvez inspecter — l’architecture, la recette d’entraînement et la taille des checkpoints dans un rapport public, par rapport à une description du fournisseur du pipeline d’entraînement, sans poids ni article.
• Ce que vous pouvez modifier — fine-tunes, LoRAs, quantification et distillation, que la communauté publiait déjà sur Hugging Face dès le lendemain de la sortie, face à rien du tout.
Dimension par dimension

• Sortie — des clips de cinq secondes avec audio synchronisé à 44 kHz pour les deux niveaux de Kandinsky, contre un environnement interactif sans audio pour Odyssey-3.
• Résolution — Full HD 1920×1080 via le modèle de super-résolution plug-in pour Kandinsky 6.0 Video, contre 832×480 pour Odyssey-3 et 1280×720 pour Odyssey-3 Pro.
• Modalités d'entrée — texte et image pour Kandinsky, en modes texte-vers-audio-vidéo et image-vers-audio-vidéo ; un prompt accompagné d'une entrée de contrôle en direct pour Odyssey-3.
• Paramètres — 3B et 29B publiés pour les niveaux Lite et Pro, contre non divulgués pour les deux niveaux Odyssey-3.
• Matériel — un GPU NVIDIA et Python 3.13 ou 3.14, avec des préréglages fournis pour les cartes H100/H200 jusqu’aux cartes de classe RTX 5090 pour Kandinsky ; un navigateur pour Odyssey-3.
• Prix — 0 $ par clip pour Kandinsky 6.0 Video si vous disposez du GPU, contre aucun prix publié, quel qu'il soit, pour Odyssey-3. Les estimations de coût normalisées du classement pour Odyssey-3 et Odyssey-3 Pro sont de 0,139 $ et 0,267 $ par vidéo générée, hors traitement du prompt.
• Notation par des tiers — la génération propre d'aucun des deux modèles ne fait l'objet d'une comparaison directe indépendante. Le rapport de Kandinsky s'appuie sur une évaluation humaine comparative côte à côte face à son prédécesseur ; les chiffres d'Odyssey-3 proviennent d'une soumission à un benchmark ainsi que d'une évaluation réalisée par le fournisseur.
• Licence — MIT pour Kandinsky 6.0 Video, contre aucune licence publiée car il n'y a pas de poids à licencier.
Ce que les benchmarks disent et ne disent pas
Kandinsky 6.0 Video n'apparaît pas sur Physics-IQ Verified, le tableau d'Anates Labs et DeepMind qui évalue les continuations de véritables expériences physiques sur 41 modèles. Le partenaire d'Odyssey-3 dans cette confrontation directe n'y figure pas non plus, car le tableau évalue des modèles qui génèrent des clips, et ces deux-là en génèrent. Ce que le tableau contient, en revanche, c'est la gamme antérieure de modèles du monde de Kandinsky, Kandinsky-WM 1.0, au 20e rang et à −8,02 pp par rapport à la moyenne de la piste — une famille différente, un objectif différent, et la seule entrée Kandinsky du tableau.
Les lignes d’Odyssey-3, par contraste : classées 8es à +2,15 pp sur les prompts propres du benchmark, et 0,129 $ par vidéo, puis classées 3es à +9,99 pp sur des prompts personnalisés, avec Odyssey-3 Pro deuxième au classement général à +11,15 pp. Ce sont de meilleurs chiffres que tout ce que la gamme Kandinsky a sur ce test particulier, et ils mesurent aussi une capacité différente — Odyssey-3 est évalué sur ce qu’il prédit après une perturbation, ce qui est exactement ce que sa preview vend.
La preuve apportée par Kandinsky elle-même est l'évaluation humaine figurant dans le rapport technique : Kandinsky 6.0 Video Pro surpasse nettement son prédécesseur Kandinsky 5.0 Video Pro, et reste compétitif face aux principaux modèles de génération audio-vidéo, en particulier sur la qualité de la parole. Il s'agit d'une comparaison côte à côte menée par le fournisseur, et c'est le genre d'affirmation qu'un checkpoint publié permet à quiconque possède une 5090 et un après-midi de vérifier. L'affirmation équivalente d'Odyssey-3 ne peut être vérifiée par personne sans clé API.

Les atteindre
OrcaRouter n'héberge ni l'un ni l'autre de ces modèles, et ne laissera jamais entendre le contraire : Odyssey-3 n'a aucun tarif publié permettant à quiconque de le router, et Kandinsky 6.0 Video est en poids ouverts, ce qui signifie que la bonne façon de l'exécuter est la configuration propre au dépôt sur votre propre GPU, et non un point de terminaison hébergé.
Là où une clé OrcaRouter trouve sa place, c'est dans la couche qui entoure l'expérience. Le dépôt de Kandinsky suppose que vous fournissez le GPU, l'environnement et la comparaison ; ce qu'il ne fournit pas, c'est un moyen d'appeler les modèles avec lesquels vous voulez le comparer. Plus de 200 modèles se trouvent derrière une seule clé OrcaRouter, au prix catalogue du fournisseur, avec 0 % de marge — dont minimax/minimax-h3, le modèle vidéo à poids ouverts publié par MiniMax le 31 juillet 2026, à 0,08 $ par seconde de sortie 768P — ainsi, une modification tarifaire d'un fournisseur se répercute sur votre facture le jour même, le basculement automatique évite qu'une campagne d'évaluation ne meure à cause d'une mauvaise heure chez un fournisseur en amont, et le DSL de routage vous permet de placer un modèle vidéo hébergé et un modèle de vision derrière une seule interface lorsque la tâche consiste à générer puis à noter. Vous clonez toujours le dépôt et exécutez l'installation vous-même. Vous n'avez simplement pas à construire l'autre moitié du dispositif.
Lequel tu veux vraiment ?
Si vous avez besoin d’une production que vous pouvez maîtriser — des conditions commerciales que vous pouvez lire, des poids que vous pouvez affiner, un pipeline qui fonctionne sans dépendre de la disponibilité de l’API d’un tiers — Kandinsky 6.0 Video est la réponse, et la prise en charge des frameworks dès le premier jour signifie que vous ne pariez pas sur un artefact de recherche. Si vous avez besoin de son sur la vidéo, c’est le seul des deux à en générer.
Si le problème est la prédiction plutôt que la production — une politique qui doit réagir, un environnement d’entraînement, tout cas où l’état suivant dépend de la dernière action —, Odyssey-3 est le seul des deux à le faire, et c’est aussi celui que vous ne pouvez pas acheter. Telle est la forme honnête de cette confrontation la semaine où les deux sont sortis : un modèle ouvert que vous pouvez télécharger et un modèle interactif que vous pouvez seulement essayer, les preuves des benchmarks favorisant le modèle fermé et les preuves pratiques favorisant le modèle ouvert.
