
Kandinsky 6.0 Video 対 Grok Imagine Video:リーダーボードが逆転
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
2026年1月、Grok Imagine Videoが登場したとき、それは両モードでArtificial Analysisの動画アリーナの首位に立った。今日、同じボードでは、その現在のビルドはテキストからの動画生成で11位か12位に位置づけられている。それはスキャンダルでも失敗でもない——急速に動くカテゴリーで9か月で起きることなのだ。そして、xAIの生成モデルを比較すべき正直な理由でもある。比較相手はKandinsky 6.0 Videoだ。今こそ、一方は、どれだけ素早くもう1本のクリップを生成できるかに最適化されたサービスだ。もう一方は、MITライセンスのチェックポイントで、Proサイズで29Bパラメータ、Liteで3B、2026年10月の第1週にSberのKandinsky Labによって公開され、同期した44 kHz音声とリップシンク付きの5秒動画を生成する。興味深い問いは、どちらがボードで先行しているかではない——それぞれが次に構造的に何をできるかだ。
その下で動いた板
Grok Imagine VideoはxAIの生成モデルで、2026年1月29日に初リリースされ、6月16日以降はバージョン1.5で安定している。Artificial Analysisのテキスト・トゥ・ビデオ・リーダーボードでは、その1.5ビルドは4,056票でElo 1,045(±9)の11~12位に位置し、1分あたり$15.00と記載されている。元のビルドはそのリーダーボードには掲載されていない。
Image-to-videoは、ファミリーがより強みを発揮する領域であり、2つのビルドが注意深く読む価値のある形で分かれる領域でもある:
• grok-imagine-video-1.5 — 7位~9位、Elo 1,098(±8)、5,267票、毎分$8.40。
• grok-imagine-video(1月版)— 12位~17位、Elo 1,072(±7)、14,371票、$4.20/分
規模感を示すと、そのI2Vボードの首位 — MiniMax H3 Max — は5,894票でElo 1,195(±9)に位置し、Wan 3.0は1,164で6位です。
次の2つの読み方があり、どちらも正しい。xAIのより新しいビルドは、画像から動画の生成において、自社の前世代モデルより実際に26 Elo上回っており、その状態にあるには1分あたり2倍のコストがかかる。そして、ローンチ週の物語――トップに立って登場したモデル――は保たれなかった。競争の場は動き、アリーナには12のより新しいシステムにまたがる数万票が蓄積され、中位の順位こそ、9か月の競争が高速な汎用ジェネレーターを置く場所なのだ。
Kandinsky 6.0 VideoはどのリーダーボードでもEloを持っていない。その根拠はVABenchの実行とラボ内で実施された人間評価で、どちらもSberが公開したものであり、外部で再現されたものではない。監査されていないオープンモデルを、スコアが付いた商用モデルの隣に置くことは、まさに慎重に扱うべき比較だ。スコアが付いたモデルの位置は現実であり、決して好意的なものではない。そして、スコアが付いていないモデルの位置は不明である。「不明」は「より良い」ではない。
速さには2種類ある。秒で測られるのは、そのうちの1つだけだ。
Grok Imagine Videoの設計目標は、クリエイター1人あたりのスループットです。これはXに組み込まれており、音声付きの完成したクリップを返し、その機能セットは、人々が実際にフィードで行うことのリストのように並んでいます。複数のアスペクト比、カメラモーション、オブジェクトの追加・削除・入れ替え、スタイル転送、キャラクターの一貫性を保つための複数画像からの参照条件付き生成、セリフ、エフェクト、音楽を備えたネイティブオーディオ。クリップの長さは最長15秒、解像度は最大1080pです。製品全体は、2回目の試行に数分と数セントしかかからないように作られています。
Kandinsky 6.0 Video は別の意味で高速です — 試行ごとではなく、所有単位あたりで。その何一つとして瞬時ではありません。リポジトリ自身の非蒸留モデルの作業時間(ウォームアップ後、重みの読み込みと MP4 エンコードを除く)では、5 秒の Pro Full HD クリップは H100 で約 402 秒、RTX 5090 で 854 秒、RTX 4090 で 1,247 秒、RTX 5060 Ti で 3,530 秒です。Lite Full HD は H100 で 284 秒です。それを耐えられるものにするツールが蒸留チェックポイントで、論文ではフルモデルと同等と測定されました — 大多数の基準で好まれるか同等、平均選好率は 51% 対 49%、個々の差は有意に達しませんでした。遅いレンダリングと引き換えに得られるのは、自分のディスク上にあるモデルで、クリップごとのメーターが一切回りません。
それが、この対決の本当の姿だ。Grok Imagine Video は10回目の試行にかかるコストを最適化する。Kandinsky 6.0 Video は1万回目の試行にかかるコストを最適化し、最初の1回の分をハードウェアと忍耐で支払わせる。
どちらも音声を生成する——だが、それは同じ主張ではない
これは、安易な比較なら「引き分け」と判断して間違える軸です。
Grok Imagine Videoは、数ある機能の一つとして、台詞、効果音、音楽を備えたネイティブ音声を生成する。たまたま音声を含んでいる汎用ジェネレーターだ。
Kandinsky 6.0 Videoは音を中心に構築されている。アーキテクチャはデュアルストリームのCrossDiTであり、Kandinsky 5.0 Videoから初期化された映像ストリームと、大規模な音声コーパスでゼロから学習された音声ストリームを組み合わせ、双方向クロスアテンションで結びつけ、共同で学習する。出力は44 kHzで、明示的なリップシンクを備えており、論文の強化学習段階は、生成された音声の単語誤り率を47%削減すると報告されている——Whisper-large-v3で測定され、これはRL報酬モデルの一つである。この詳細が重要なのは、論文がQwen3-ASR-1.7Bを用いたVABenchと並べて、比較不能な第二のWERを報告しているからだ。音声こそが、このモデルがポストトレーニングされた対象である。
それに対して、Sber自身の調査は、どこで劣っているかについて率直だ。ラボの比較評価では、MiniMax H3とDreamina Seedance 2.0が視覚基準で大きな差をつけて好まれており、このモデルは優位というより競争力があると評されている。真剣に受け止める価値のある主張は、より限定的で、より有用だ。Kling 2.6とVeo 3.1 Fastに対しては、結果は基準ごとに一進一退し、Kandinsky 6.0 Videoは、比較の大部分が引き分けとなる音声品質と音声・映像同期において競争力を保っている。
15秒対5秒、そしてそれぞれに到達するためにかかるコスト
• 最大クリップ — Grok Imagine Video:最長15秒。Kandinsky 6.0 Video:5秒固定、24 fpsで121フレーム、リリース版には延長モードなし。
• 解像度 — Grok Imagine Video:最大1080p。Kandinsky 6.0 Video:専用の超解像モデルによるSD、HD、フルHD、および5秒のクリップのx2、x4、またはx2.25アップスケール。
• 参照入力 — Grok Imagine Video: キャラクターの一貫性のために複数の画像から参照条件付き生成、さらにオブジェクトの追加/削除/入れ替え。Kandinsky 6.0 Video: 1枚の画像を、マスクされた末尾フレームとして適用。
• 価格 — Grok Imagine Video:出力1秒あたり、範囲の下限から1080pで最大$0.30/秒まで、さらに画像入力ごとに追加料金がかかります。無料アクセスはXのサブスクリプション階層の背後にあります。Kandinsky 6.0 Video:なし — サービスも料金もなく、あなたが提供するGPU時間のみです。
• 重み — Grok Imagine Video:なし。Kandinsky 6.0 Video:MIT、Pro および Lite、diffusers 統合あり。
新しいGrokビルドの割増料金こそ、丸を付けるべき数字だ。1月のビルドから1.5に移行すると、画像から動画のボードでは1分あたりのコストが2倍になり、26 Eloを得られる。それは実際の価格に見合う本物の改善であり、今すべての動画ベンダーが購入者に求めているのと同じ取引だ。
ルーターが適する場合と、適さない場合
OrcaRouterはGrok Imagine VideoやKandinsky 6.0 Videoを提供しておらず、ここにそれ以外を主張する記述はありません。Kandinskyはご自身でダウンロードして実行するものであり、Grok Imagine VideoにはxAI自身のサーフェスを通じてアクセスします。どちらかのモデル上に構築されたパイプラインがルーターに求めるのは、レンダリングを囲むテキストです — ショットリスト、アイデアをこれらのモデルが学習した長文または短文のキャプションに変えるプロンプト拡張、キャプション付けと文字起こしの作業、そしてどの生成を残すかを決めるレビュー要約です。これらは200以上のテキストモデルにわたる1つのOpenAI互換エンドポイント上で実行されますプロバイダー定価・マークアップ0%で。そのため、ベンダーの値下げは適用された当日に同じキーで有効になり、自動フェイルオーバーにより、レンダーキューの途中で失敗した呼び出しはバッチを停滞させるのではなく再ルーティングされます。動画モデル周辺のオーケストレーションは、動画モデル自体がルーティング可能でない場合でもルーティングの問題です。今日のこれら2つはどちらもそのケースです。
どれで、何のために?
量をこなす仕事――ソーシャルクリップ、素早い反復、納得のいくまで6回は作り直すカット、そして延びることのない締め切り――に取り組むときは、Grok Imagine Videoの出番だ。試行1回あたりの価格こそがこの製品の売りであり、今はトップではなく中位に位置しているという事実も、これほど速く動くカテゴリにつきもののコストにすぎない。
作業がパイプラインであるときは、Kandinsky 6.0 Videoに手を伸ばそう。バッチ処理できる固定5秒の単位、提供されたスチルへの忠実さが肝心な画像から動画へのパス、聞き取れることを意図した音声、そしてレンタルしたくない成果物——そういうときだ。レンダリングのための予算を確保し、コンシューマー向けのものなら遅くなることを覚悟し、本記事のあらゆる品質数値は、ラボの外の誰かが採点するまではSber自身のものとして扱ってほしい。


この組み合わせが注目に値するのは、どちらが不調な四半期を吸収できるかという点にある。Grok Imagine Videoがアリーナでさらに順位を下げるなら、答えはより良いモデルと新しい価格だ——それがこのカテゴリの仕組みであり、xAIはすでにそれを投入すると示している。Kandinsky 6.0 Videoが採点されて中位にとどまるとしても、チェックポイントは依然として存在し、依然として動作し、依然としてファインチューニングできる。ライセンスはその数字によって変わることはない。これらは異なる種類の耐久性であり、Eloで測られるのはそのうちの一つだけだ。

