生成されたタイトルカードは「Kandinsky 6.0 Video vs Grok Imagine Video」と表示し、サブタイトルは「リーダーボードが逆転」。その上には「動画生成」「同期オーディオ」「オープンウェイト配備」とラベルされたアイコン行が並ぶ。OrcaRouterのロゴは右下隅にある。
Guides & Insights

Kandinsky 6.0 Video 対 Grok Imagine Video:リーダーボードが逆転

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年1月、Grok Imagine Videoが登場したとき、それは両モードでArtificial Analysisの動画アリーナの首位に立った。今日、同じボードでは、その現在のビルドはテキストからの動画生成で11位か12位に位置づけられている。それはスキャンダルでも失敗でもない——急速に動くカテゴリーで9か月で起きることなのだ。そして、xAIの生成モデルを比較すべき正直な理由でもある。比較相手はKandinsky 6.0 Videoだ。今こそ、一方は、どれだけ素早くもう1本のクリップを生成できるかに最適化されたサービスだ。もう一方は、MITライセンスのチェックポイントで、Proサイズで29Bパラメータ、Liteで3B、2026年10月の第1週にSberのKandinsky Labによって公開され、同期した44 kHz音声とリップシンク付きの5秒動画を生成する。興味深い問いは、どちらがボードで先行しているかではない——それぞれが次に構造的に何をできるかだ。

その下で動いた板

Grok Imagine VideoはxAIの生成モデルで、2026年1月29日に初リリースされ、6月16日以降はバージョン1.5で安定している。Artificial Analysisのテキスト・トゥ・ビデオ・リーダーボードでは、その1.5ビルドは4,056票でElo 1,045(±9)の11~12位に位置し、1分あたり$15.00と記載されている。元のビルドはそのリーダーボードには掲載されていない。

Image-to-videoは、ファミリーがより強みを発揮する領域であり、2つのビルドが注意深く読む価値のある形で分かれる領域でもある:

• grok-imagine-video-1.5 — 7位~9位、Elo 1,098(±8)、5,267票、毎分$8.40。

• grok-imagine-video(1月版)— 12位~17位、Elo 1,072(±7)、14,371票、$4.20/分

規模感を示すと、そのI2Vボードの首位 — MiniMax H3 Max — は5,894票でElo 1,195(±9)に位置し、Wan 3.0は1,164で6位です。

次の2つの読み方があり、どちらも正しい。xAIのより新しいビルドは、画像から動画の生成において、自社の前世代モデルより実際に26 Elo上回っており、その状態にあるには1分あたり2倍のコストがかかる。そして、ローンチ週の物語――トップに立って登場したモデル――は保たれなかった。競争の場は動き、アリーナには12のより新しいシステムにまたがる数万票が蓄積され、中位の順位こそ、9か月の競争が高速な汎用ジェネレーターを置く場所なのだ。

Kandinsky 6.0 VideoはどのリーダーボードでもEloを持っていない。その根拠はVABenchの実行とラボ内で実施された人間評価で、どちらもSberが公開したものであり、外部で再現されたものではない。監査されていないオープンモデルを、スコアが付いた商用モデルの隣に置くことは、まさに慎重に扱うべき比較だ。スコアが付いたモデルの位置は現実であり、決して好意的なものではない。そして、スコアが付いていないモデルの位置は不明である。「不明」は「より良い」ではない。

速さには2種類ある。秒で測られるのは、そのうちの1つだけだ。

Grok Imagine Videoの設計目標は、クリエイター1人あたりのスループットです。これはXに組み込まれており、音声付きの完成したクリップを返し、その機能セットは、人々が実際にフィードで行うことのリストのように並んでいます。複数のアスペクト比、カメラモーション、オブジェクトの追加・削除・入れ替え、スタイル転送、キャラクターの一貫性を保つための複数画像からの参照条件付き生成、セリフ、エフェクト、音楽を備えたネイティブオーディオ。クリップの長さは最長15秒、解像度は最大1080pです。製品全体は、2回目の試行に数分と数セントしかかからないように作られています。

Kandinsky 6.0 Video は別の意味で高速です — 試行ごとではなく、所有単位あたりで。その何一つとして瞬時ではありません。リポジトリ自身の非蒸留モデルの作業時間(ウォームアップ後、重みの読み込みと MP4 エンコードを除く)では、5 秒の Pro Full HD クリップは H100 で約 402 秒、RTX 5090 で 854 秒、RTX 4090 で 1,247 秒、RTX 5060 Ti で 3,530 秒です。Lite Full HD は H100 で 284 秒です。それを耐えられるものにするツールが蒸留チェックポイントで、論文ではフルモデルと同等と測定されました — 大多数の基準で好まれるか同等、平均選好率は 51% 対 49%、個々の差は有意に達しませんでした。遅いレンダリングと引き換えに得られるのは、自分のディスク上にあるモデルで、クリップごとのメーターが一切回りません。

それが、この対決の本当の姿だ。Grok Imagine Video は10回目の試行にかかるコストを最適化する。Kandinsky 6.0 Video は1万回目の試行にかかるコストを最適化し、最初の1回の分をハードウェアと忍耐で支払わせる。

どちらも音声を生成する——だが、それは同じ主張ではない

これは、安易な比較なら「引き分け」と判断して間違える軸です。

Grok Imagine Videoは、数ある機能の一つとして、台詞、効果音、音楽を備えたネイティブ音声を生成する。たまたま音声を含んでいる汎用ジェネレーターだ。

Kandinsky 6.0 Videoは音を中心に構築されている。アーキテクチャはデュアルストリームのCrossDiTであり、Kandinsky 5.0 Videoから初期化された映像ストリームと、大規模な音声コーパスでゼロから学習された音声ストリームを組み合わせ、双方向クロスアテンションで結びつけ、共同で学習する。出力は44 kHzで、明示的なリップシンクを備えており、論文の強化学習段階は、生成された音声の単語誤り率を47%削減すると報告されている——Whisper-large-v3で測定され、これはRL報酬モデルの一つである。この詳細が重要なのは、論文がQwen3-ASR-1.7Bを用いたVABenchと並べて、比較不能な第二のWERを報告しているからだ。音声こそが、このモデルがポストトレーニングされた対象である。

それに対して、Sber自身の調査は、どこで劣っているかについて率直だ。ラボの比較評価では、MiniMax H3とDreamina Seedance 2.0が視覚基準で大きな差をつけて好まれており、このモデルは優位というより競争力があると評されている。真剣に受け止める価値のある主張は、より限定的で、より有用だ。Kling 2.6とVeo 3.1 Fastに対しては、結果は基準ごとに一進一退し、Kandinsky 6.0 Videoは、比較の大部分が引き分けとなる音声品質と音声・映像同期において競争力を保っている。

15秒対5秒、そしてそれぞれに到達するためにかかるコスト

• 最大クリップ — Grok Imagine Video:最長15秒。Kandinsky 6.0 Video:5秒固定、24 fpsで121フレーム、リリース版には延長モードなし。

• 解像度 — Grok Imagine Video:最大1080p。Kandinsky 6.0 Video:専用の超解像モデルによるSD、HD、フルHD、および5秒のクリップのx2、x4、またはx2.25アップスケール。

• 参照入力 — Grok Imagine Video: キャラクターの一貫性のために複数の画像から参照条件付き生成、さらにオブジェクトの追加/削除/入れ替え。Kandinsky 6.0 Video: 1枚の画像を、マスクされた末尾フレームとして適用。

• 価格 — Grok Imagine Video:出力1秒あたり、範囲の下限から1080pで最大$0.30/秒まで、さらに画像入力ごとに追加料金がかかります。無料アクセスはXのサブスクリプション階層の背後にあります。Kandinsky 6.0 Video:なし — サービスも料金もなく、あなたが提供するGPU時間のみです。

• 重み — Grok Imagine Video:なし。Kandinsky 6.0 Video:MIT、Pro および Lite、diffusers 統合あり。

新しいGrokビルドの割増料金こそ、丸を付けるべき数字だ。1月のビルドから1.5に移行すると、画像から動画のボードでは1分あたりのコストが2倍になり、26 Eloを得られる。それは実際の価格に見合う本物の改善であり、今すべての動画ベンダーが購入者に求めているのと同じ取引だ。

ルーターが適する場合と、適さない場合

OrcaRouterはGrok Imagine VideoやKandinsky 6.0 Videoを提供しておらず、ここにそれ以外を主張する記述はありません。Kandinskyはご自身でダウンロードして実行するものであり、Grok Imagine VideoにはxAI自身のサーフェスを通じてアクセスします。どちらかのモデル上に構築されたパイプラインがルーターに求めるのは、レンダリングを囲むテキストです — ショットリスト、アイデアをこれらのモデルが学習した長文または短文のキャプションに変えるプロンプト拡張、キャプション付けと文字起こしの作業、そしてどの生成を残すかを決めるレビュー要約です。これらは200以上のテキストモデルにわたる1つのOpenAI互換エンドポイント上で実行されますプロバイダー定価・マークアップ0%で。そのため、ベンダーの値下げは適用された当日に同じキーで有効になり、自動フェイルオーバーにより、レンダーキューの途中で失敗した呼び出しはバッチを停滞させるのではなく再ルーティングされます。動画モデル周辺のオーケストレーションは、動画モデル自体がルーティング可能でない場合でもルーティングの問題です。今日のこれら2つはどちらもそのケースです。

どれで、何のために?

量をこなす仕事――ソーシャルクリップ、素早い反復、納得のいくまで6回は作り直すカット、そして延びることのない締め切り――に取り組むときは、Grok Imagine Videoの出番だ。試行1回あたりの価格こそがこの製品の売りであり、今はトップではなく中位に位置しているという事実も、これほど速く動くカテゴリにつきもののコストにすぎない。

作業がパイプラインであるときは、Kandinsky 6.0 Videoに手を伸ばそう。バッチ処理できる固定5秒の単位、提供されたスチルへの忠実さが肝心な画像から動画へのパス、聞き取れることを意図した音声、そしてレンタルしたくない成果物——そういうときだ。レンダリングのための予算を確保し、コンシューマー向けのものなら遅くなることを覚悟し、本記事のあらゆる品質数値は、ラボの外の誰かが採点するまではSber自身のものとして扱ってほしい。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Grok Imagine Video — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'T2V Elo: not scored', 'I2V Elo: not scored', 'Audio: 44 kHz, always on', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Grok Imagine Video column reads 'Max clip: up to 15s', 'T2V Elo: 1,045, 11th', 'I2V Elo: 1,098, 7th', 'Audio: native, optional', 'Weights: none', 'Price: $4.20 to $15.00/min'. A footer reads 'Grok figures per Artificial Analysis; Kandinsky unscored. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-I2V V1.0 leaderboard, ranking image-to-video models by Elo from pairwise human preference votes with audio. MiniMax H3 Max is first at 1,195 over 5,894 samples at $4.80 per minute (Aug 2026); MiniMax H3 is second at 1,181 over 7,284 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,178 over 12,327 samples at $6.00 per minute (May 2026); Wan 3.0 is sixth at 1,164 over 9,302 samples at $12.00 per minute (Aug 2026); grok-imagine-video-1.5 is eighth at 1,098 over 5,267 samples at $8.40 per minute (May 2026); Wan 2.7 is twelfth at 1,077 over 4,571 samples at $9.00 per minute (Apr 2026); grok-imagine-video is thirteenth at 1,072 over 14,371 samples at $4.20 per minute (Jan 2026). The board carries a note that AA-Video-I2V v2.0 is coming soon.

この組み合わせが注目に値するのは、どちらが不調な四半期を吸収できるかという点にある。Grok Imagine Videoがアリーナでさらに順位を下げるなら、答えはより良いモデルと新しい価格だ——それがこのカテゴリの仕組みであり、xAIはすでにそれを投入すると示している。Kandinsky 6.0 Videoが採点されて中位にとどまるとしても、チェックポイントは依然として存在し、依然として動作し、依然としてファインチューニングできる。ライセンスはその数字によって変わることはない。これらは異なる種類の耐久性であり、Eloで測られるのはそのうちの一つだけだ。

A screenshot of OrcaRouter's own model page for kling/kling-v3-omni, titled 'kling/kling-v3-omni' with a FLAGSHIP badge and credited to Kling, showing the route endpoint /v1/video/generations and a per-request price of $0.08, with a description reading that Kling 3.0 Omni is a unified text-to-video and image-to-video API with multi-shot, subject control and video-reference, 3-15 second clips and up to native 4K.