Odyssey-3 対 Kandinsky 6.0 Video のタイトルカード。左パネルには Odyssey-3 という見出しで、インタラクティブ環境、2026年10月8日に公開されたリサーチプレビュー、832x480 または 1280x720 Pro、重みなし、価格なしと表示される。右パネルには Kandinsky 6.0 Video という見出しで、2026年10月6日に MIT ライセンスの下でオープンウェイト、44 kHz 音声付きの5秒クリップ、フル HD 1920x1080、Physics-IQ は未提出と表示される。
Guides & Insights

Odyssey-3 対 Kandinsky 6.0 Video:オープンウェイトと音声、クローズドなインタラクティブプレビューへの挑戦

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Kandinsky 6.0 Videoは2026年10月6日に登場し、オープンモデルのリリースが初日にはめったに得られないものを備えていた。Diffusers、ComfyUI、vLLM-Omni、SGLang、FastVideoでのサポートだ。それらはすべてリポジトリ自身の更新ログに記録され、10月4日に提出されたarXivレポートやHugging Face上のMITライセンスのチェックポイントと並んでいた。Odyssey-3は2日後の10月8日に、プロンプトから環境を構築し、その中を移動する際の変化をリアルタイムで予測する自己回帰拡散トランスフォーマーの公開研究プレビューとして登場した。一方は290億パラメータのモデルで、今夜自分のGPUでダウンロードして実行できる。もう一方は、Odysseyのブラウザプレビューと問い合わせフォームを通じてしかアクセスできないインタラクティブシステムだ。これらは、2026年10月の同じ週に「動画モデル」が意味したものの両極であり、そのどちらを選ぶかは、ベンチマークよりも、誰が重みを保持するかに関するものだ。

両者はあなたに求めるものも異なっている。Kandinsky 6.0 Video は生成モデルだ。プロンプトを入力すると、音声が同期した5秒のクリップが出力される。Odyssey-3 は予測モデルだ。行動すれば、世界が反応するのを見られる。どちらも他方の代わりにはならず、両者が48時間違いでリリースされたという事実こそ、どちらにとっても最も有用な文脈だ。

ベンダー自身の言葉で言えば、2つのアーキテクチャ

Kandinsky 6.0 Videoは、音声と映像を同期させて生成する基盤拡散モデルのファミリーであり、30億パラメータのKandinsky 6.0 Video Liteと290億パラメータのKandinsky 6.0 Video Proで構成されています。両モデルとも、44 kHzの同期音声を含む5秒のクリップを、テキストから音声・映像への生成(text-to-audio-video)モードと画像から音声・映像への生成(image-to-audio-video)モードで生成し、プラグインの超解像モデルによって出力をフルHD 1920×1080に引き上げます。その技法はデュアルストリームのCrossDiTで、事前学習済みの映像ストリームと新たに学習した音声ストリームを双方向クロスアテンションで接続するため、2つのモダリティは別々に生成して多重化されるのではなく、時間的・意味的に整合します。学習レシピは継続的で、まず音声ストリームを大規模な音声コーパスでゼロから学習し、次に単一モダリティの忠実性を保ちながら両ストリームをペアの音声・映像データで共同学習し、続いて教師ありファインチューニング、強化学習によるポストトレーニング、蒸留を行います。

Odyssey-3は、Odysseyが説明するところの自己回帰拡散トランスフォーマーであり、教師強制と因果マスキングによって拡張された多段階ビデオ拡散モデルで、先行する観測から継続し、行動入力に条件付けられた将来の状態を予測するよう訓練され、その後、分布マッチングと敵対的蒸留によって蒸留され、対話できるほど高速な数ステップの変種となった。832×480で動作し、Odyssey-3 Proは1280×720で動作し、音声は生成せず、その目的のすべては、出力がほんの少し前に行った操作に依存するということにある。

初日からのサポートこそ、誰もベンチマークしない違いだ

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

Kandinsky 6.0のアップデートログをもう一度読んでほしい。これがこの比較の中で最も具体的な事実だからだ。10月6日、プロジェクトはDiffusers、ComfyUIノードレジストリ、vLLM-Omni、SGLang、FastVideo、および蒸留版Proモデル向けのHugging Face Spaceで利用可能になったことを記録した。これは1日で5つの独立した推論スタックだ。チェックポイントがサービングフレームワークに到達するのを何か月も待ってきた人にとって、それはそのモデルが使えるかどうかを決める数字だ。

では、これをOdyssey-3のアクセス事情と並べて見てみましょう。プレビューはexperience.odyssey.systemsで動作し、一人称視点のナビゲーション、三人称視点のナビゲーション、独立したカメラ移動を備えています。APIアクセスは問い合わせフォームです。料金ページも、レート制限のドキュメントも、セルフサービスキーもありません。サイトのAPI規約は2026-01-22に最終更新され、依然として「Odyssey-2 APIのプロトタイプ」を規定しています——今月出荷されたモデル向けに、商用面は書き直されていません。

• 実行場所 — コードとコードを使い、あなた自身のGPで、OdysseyのOdysseyのものに対して

• どのように統合するか — ブラウザプレビューとお問い合わせフォームに対して、Diffusers パイプライン、ComfyUI ノード、vLLM-Omni、SGLang、FastVideo。

• 何を検査できるか — 公開レポートにあるアーキテクチャ、学習レシピ、チェックポイントのサイズを、重みも論文もないベンダーによる学習パイプラインの説明と突き合わせること。

• あなたが変更できるもの — ファインチューニング、LoRA、量子化と蒸留。これらはすべて、リリースの翌日にはコミュニティがすでにHugging Faceで公開していたものだ。それに対して、何もない。

次元ごとに

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

出力 — Kandinskyの両ティアには、44 kHzの同期音声付き5秒クリップ、Odyssey-3には音声なしのインタラクティブ環境。

• 解像度 — Kandinsky 6.0 Video用のプラグイン超解像モデルによるフルHD 1920×1080(Odyssey-3は832×480、Odyssey-3 Proは1280×720)

• 入力モダリティ — Kandinskyにはテキストと画像を、テキストから音声・動画、および画像から音声・動画のモードで。Odyssey-3にはプロンプトとライブ制御入力。

• パラメータ — Lite と Pro ティアでは 3B および 29B が公開されているのに対し、Odyssey-3 の両ティアでは非公開。

• ハードウェア — NVIDIA GPU と Python 3.13 または 3.14(Kandinsky 用には H100/H200 から RTX 5090 クラスのカードまでのプリセットが同梱)、Odyssey-3 用のブラウザ。

• 価格 — GPU を持っていれば Kandinsky 6.0 Video はクリップあたり $0 であるのに対し、Odyssey-3 にはいかなる公開価格もありません。ボードによる Odyssey-3 と Odyssey-3 Pro の正規化されたコスト推定は、プロンプト処理を除いて、生成動画あたり $0.139 と $0.267 です。

• サードパーティによるスコアリング — どちらのモデルも、自身の生成物が独立した一対一比較で評価されているわけではない。Kandinskyの報告は前世代モデルとのサイドバイサイドの人手評価に依拠しており、Odyssey-3の数値はベンチマークへの提出に加え、ベンダーが実施した評価から得られたものである。

• ライセンス — Kandinsky 6.0 VideoにはMIT、ライセンス対象となる重みが存在しないため公開ライセンスはなし。

ベンチマークが示すこと、示さないこと

Kandinsky 6.0 Videoは、41モデルにわたる実際の物理実験の続きを採点するAnates LabsとDeepMindのボード、Physics-IQ Verifiedには登場しない。ここでのOdyssey-3の直接対決の相手も同様だ。このボードはクリップを生成するモデルを採点しており、これら両方ともクリップを生成するからである。ボードに実際に掲載されているのは、Kandinskyの以前のワールドモデル系列であるKandinsky-WM 1.0で、順位は20位、トラック平均に対して−8.02 pp——異なるファミリー、異なる目的であり、ボード上で唯一のKandinskyエントリーだ。

対照的に、Odyssey-3の行はこうだ。ベンチマーク自体のプロンプトでは+2.15 ppで8位、動画1本あたり$0.129、カスタムプロンプトでは+9.99 ppで3位、Odyssey-3 Proは総合で+11.15 ppの2位。これらは、その特定のテストでKandinsky系列が記録したどの数値よりも良く、しかも測定している能力も異なる——Odyssey-3は、撹乱後に何を予測するかで採点されており、それは同モデルのプレビューが売りにしているものと同じである。

Kandinsky自身の根拠は、技術レポートにおける人間による評価です。Kandinsky 6.0 Video Proは、前身のKandinsky 5.0 Video Proを明らかに上回り、特に音声品質において、主要な音声動画生成モデルと互角に渡り合っています。それはベンダーが実施したサイドバイサイド比較であり、公開されたチェックポイントと照らし合わせれば、5090と午後の時間さえあれば誰でも検証できる類の主張です。Odyssey-3の同等の主張は、APIキーがなければ誰も検証できません。

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

彼らに到達する

OrcaRouterはどちらのモデルもホストしておらず、そうであるかのように示唆することも決してありません。Odyssey-3には誰かがルーティングできるような公開レートが存在せず、Kandinsky 6.0 Videoはオープンウェイトです。つまり、それを実行する正しい方法は、ホスト型エンドポイントではなく、リポジトリ自体のセットアップを自分のGPU上で行うことです。

1つのOrcaRouterキーがどこに収まるかといえば、それは実験を取り巻く層です。Kandinskyのリポジトリは、GPU、環境、比較対象を用意することを前提としていますが、提供していないのは、ベンチマークしたいモデルを呼び出す手段です。200を超えるモデルが、単一のOrcaRouterキーの背後に、プロバイダー定価・マークアップ0%でそろっています — たとえばminimax/minimax-h3。MiniMaxが2026年7月31日に公開したオープンウェイトの動画モデルで、768P出力1秒あたり$0.08です — つまりベンダーの価格変更はその日のうちに請求書へ反映され、自動フェイルオーバーによって、あるアップストリームの不調な1時間で評価スイープが止まってしまうことを防ぎ、ルーティングDSLを使えば、生成してから採点するという作業のときに、ホスト型の動画モデルとビジョンモデルを1つのインターフェースの背後に置けます。リポジトリのクローンとセットアップは自分で行う必要は依然としてあります。ただ、リグの残り半分を組み立てずに済むだけです。

実際にどっちが欲しいの?

自分で所有できる出力——読んで理解できる商用条件、微調整できる重み、他人のAPIが稼働しているかに依存せずに動くパイプライン——が必要なら、Kandinsky 6.0 Videoが答えです。初日からのフレームワーク対応により、研究用の成果物に賭ける必要はありません。動画に音声が必要なら、2つの中で音声を生成するのはこれだけです。

問題が生成ではなく予測である場合——反応しなければならないポリシー、学習環境、次の状態が直前の行動に依存するあらゆるもの——2つのうちそれを実現するのはOdyssey-3だけで、しかもそれは購入できない方でもある。これが、両者が登場した週におけるこの対決の正直な姿だ。ダウンロードできるオープンモデルと、試すことしかできないインタラクティブモデル、そしてベンチマークの証拠はクローズドな方を支持し、実用的な証拠はオープンな方を支持している。