生成されたタイトルカードには「Kandinsky 6.0 Video vs Alibaba Wan 2.7」と表示され、サブタイトルは「Open weights against a four-model suite」です。OrcaRouterのロゴは右下隅に配置されています。
Guides & Insights

Kandinsky 6.0 Video 対 Alibaba Wan 2.7:オープンウェイトか、4モデルスイートか

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Kandinsky 6.0 Videoは、ダウンロードできる29Bパラメータのチェックポイントと、その見返りとして5秒のクリップを提供します。Wan 2.7は、タスク特化型の4つのバリアント、最大15秒のクリップ、そして秒単位の請求を提供します。この2文が比較のすべてであり、それを書き留めておく価値があるのは、ほとんどの直接対決の比較ページが両者を視覚的な品質で比べているものの、どちらにも決着をつけられる独立したスコアがなく、そして両者が本当に分かれる軸——それぞれがあなたに何を持ち込むことを期待しているか——を飛ばしているからです。

Sber の Kandinsky Lab は、2026年10月の第1週に Kandinsky 6.0 Video を MIT ライセンスでオープンソース化した。2つのサイズ — Pro は29B、Lite は3B — で、コード、チェックポイント、diffusers 統合を備えている。Alibaba の Wan 2.7 は、2026年4月3日にスイートとして提供開始された。テキストから動画、画像から動画、参照から動画、動画編集を備え、生成された動画の秒単位で課金される。一方は自分で動かすモデルであり、もう一方は購入するサービスだ。興味深い問いは、どちらが優れているかではなく、その仕事にとってどちらの形が適しているかだ。

両者が直接比較できる唯一の軸

どちらのモデルも、音声付きの動画を生成します。あとから音を当てる動画ではありません。これは言葉の印象以上に珍しいことで、この2つがそもそも一緒に取り上げられる理由でもあります。この分野の大半は今なお無音のMP4を出力し、音声は別の工程に任せているのです。

Kandinsky 6.0 Video は、デュアルストリームの CrossDiT でこれを実現します。Kandinsky 5.0 Video のチェックポイントから初期化されたビデオストリーム、大規模な音声コーパスでゼロから学習された音声ストリーム、それらを結ぶ双方向クロスアテンションを備え、連続的な事前学習段階を経た後に共同で学習されます。出力は、テキストプロンプト(T2AV)または参照画像(I2AV)からの、リップシンク付き 44 kHz 音声です。

Wan 2.7もネイティブ音声を生成しますが、その仕組みを同じレベルまで詳細に公開してはいません。同社のドキュメント自体が、依然として改善が必要な2つの領域として音声品質と画面上のテキスト精度を挙げています。これはレビュアーの推測ではなくベンダー自身が述べていることなので、心に留めておく価値のある忠実性に関する注意点です。

類似点はそこまでです。この線より下はすべて相違であり、順位づけではありません。

5秒対15秒、そしてそれがショットリストに与える影響

Kandinsky 6.0 Video は 121 フレーム、24 fps、つまり 5 秒で学習されており、このリリースには拡張モードが含まれていません。論文、vLLM-Omni にマージされたサービングレシピ、リポジトリのパフォーマンス表は、すべてこの単一のクリップ長を前提に構築されています。30 秒の作品は 6 回の生成と 5 回の結合であり、その結合部分を隠すのはあなたの役目です。

Wan 2.7は1回の生成で2秒から15秒をカバーし、それはリクエストごとに決まる。トーキングヘッドのクリップ、商品の挿入カット、あるいは1回のカメラムーブにとって、その違いは便利さの問題ではない——1回のレンダリングで済むか、組み立て工程が1つ増えるかの違いなのだ。ショット単位で組み立てていくものにとっては、5秒はごく普通の作業単位であり、その差はほとんど消えてしまう。

• 最大クリップ — Kandinsky 6.0 Video:5秒、固定、24 fpsで121フレーム。Wan 2.7:2~15秒、リクエストごとに設定。

• 解像度 — Kandinsky 6.0 Video: 別途の超解像モデルによるSD、HD、フルHD(1920×1080)。Wan 2.7: 最大1080p。

• リファレンスコンディショニング — Kandinsky 6.0 Video:画像1枚を、マスクされた末尾フレームとして適用。Wan 2.7:最大5枚の被写体画像と5本の参照クリップ、1リクエストあたり10アセット。

• タスク — Kandinsky 6.0 Video: T2AV と I2AV。Wan 2.7: テキストから動画、画像から動画、参照から動画、動画編集を、それぞれ別のバリアントとして個別に課金。

• 重み — Kandinsky 6.0 Video: MIT、ダウンロード可能、Pro および Lite。Wan 2.7: なし。

4つのタスク対2つのモード

タスク数は、比較表でWan 2.7が過小評価されがちな部分です。なぜなら、それは品質の主張ではなく、適用範囲の主張だからです。既存映像に対する指示ベースの編集——変更内容を記述すると、その変更が適用された同じショットが返ってくる——は、Kandinsky 6.0 Videoがまったく手がけていないワークロードです。提供された演技が生成される被写体を動かす参照から動画への変換も、同様にその2つのモードの範囲外です。

その課金体系は範囲を反映している。Wan 2.7のテキスト→動画および画像→動画の各バリアントは、出力時間のみに基づいて課金される——国際シンガポールエンドポイントでは720pで$0.10/秒、1080pで$0.15/秒であり、北京と東京では同じ作業に対して$0.086/秒と$0.143/秒が表示されている。参照→動画バリアントは入力動画にも課金し、上限は5秒なので、5秒の参照で15秒の生成を行うと、20秒分の作業として課金される。動画編集バリアントは出力のみに課金し、入力映像は無料として扱う——これはこのファミリー内で最も有利な料金であり、2.7が真に安価なのは編集である理由でもある。

これらの数字のそばには、ライフサイクルに関する2つの事実を添えるべきです。Alibabaは自社のBailianとQwen Cloudのサーフェスに期間限定の30%ローンチ割引を設定しましたが、それは2026年9月23日に終了しました。別途、Alibaba CloudのModel Studioの廃止通知(ID 118434)により、2026年10月10日にいくつかの旧モデルがオフラインになります。そしてwan2.7-r2vとwan2.7-imageがそのリストに載っています。これは世代全体の停止ではなくバリアント単位の話です — wan2.7-t2vとwan2.7-i2vは引き続き掲載され、料金も有効です — ただし、2.7を検討していた理由がreference-to-videoだったなら、そのルートは残り4日です。

独立した委員会が示すものと示さないもの

このセクションでは、これら2つのモデルの比較のほとんどが密かにずるをしているので、何が存在するのかを正確に述べておく価値がある。

Wan 2.7は、3つの別々のArtificial Analysis動画ボード上でそれぞれ独立したスコアを持っており、測定している内容が異なるため、それらは互いに一致していません:

• テキストから動画 — Wan2.7-260612(6月ビルド)は、5,571票でElo 1,030(±9)の13~14位、毎分$9.00。

• 画像から動画 — Wan 2.7(4月ビルド)は、4,571票でElo 1,077(±8)の12位、$9.00/分。

• 動画編集 — Wan 2.7 は 17,988 票で Elo 1,077(±5)の 5 位、$16.90/分。

その3つを合わせて読んで得られる有益な結論は、「Wan 2.7は動画で12番目」ではない。それぞれのために作られたリーダーボードにおいて、このモデルは生成よりも編集のほうが著しく強いということ、そしてそれについて単一の数値を引用するのはどちらの方向であれ誤りだということだ。

Kandinsky 6.0 Videoは、そのいずれにおいてもスコアを持っていない。公表されているエビデンスはベンダー側のものであり、それが正確には何なのかを明言する価値がある。すなわち、実験室が、評価対象の3システム——他の2つは自社のLiteモデルとLTX 2.5——の中でProが音声品質、オーディオ美学、テキスト-動画および音声-動画の整合性、リップシンク精度、非同期、視覚的リアリズムで首位に立っていると報告するVABench実行と、基準ごとに約200件以上のペアワイズ比較を行った実験室実施のサイドバイサイド人間評価であり、そこではProはKling 2.6およびVeo 3.1 Fastと競合し、視覚基準ではMiniMax H3とDreamina Seedance 2.0に後れを取り、音声品質と音声-動画同期では競争力を維持している。そのいずれもSberの外部で再現されておらず、またブラインド公開ボード上のEloでもない。正しい解釈は「有望だが未監査」であり、「Veoに匹敵する」ではない。

それぞれの費用を、各当事者が用いる条件で示したもの

2つの価格モデルを1つの数値に還元することはできない。そうでないかのように装うことこそ、チームが誤った判断を下す原因だ。

Wan 2.7は秒単位の料金です。15秒の1080pクリップで約$2.25。30秒の作品は2回の生成と編集1回 — 生の生成が$4.50、そこに組み立て作業の時間が加わります。編集バリアントが作業を担う場合はもっと安く済みます。入力分の課金がないからです。

Kandinsky 6.0 Videoには料金が一切ありません。購入できるサービスが存在しないからです。あるのは、自分で用意するGPU時間あたりのコストです。リポジトリ自体の数値が下限を示しています。ProフルHDの5秒クリップは、ウォームアップ後、H100で約402秒、RTX 5090で854秒、RTX 4090で1,247秒の作業時間です。蒸留チェックポイント — 論文ではフルモデルと同等と測定され、平均選好は51%対49%で、有意に達する基準はなかった — が、実際に提供することになるものです。ピーク割り当てが72.8 GiB未満のものはブロックオフロードが必要で、16 GBプリセットはテキストエンコーダをNF4に量子化しますが、論文が確認しているとおり、これがクリップ自体を変える唯一のプリセット変更です。

はっきり言えば、Wan 2.7 のコストは請求書に載る一行で、予測できる。Kandinsky 6.0 Video のコストは、自分が所有するマシン、5秒ごとに数分かかるレンダリング、そしてファインチューニングする選択肢 — 義務ではない — だ。

この中でルーターがどこに位置するか

OrcaRouterはKandinsky 6.0 VideoもAlibaba Wan 2.7も提供していませんし、ここでそのような主張をしているわけでもありません。Kandinskyはご自身でダウンロードして実行するもので、Wan 2.7はAlibaba独自のプラットフォームを通じて利用します。どちらのモデルで構築されたパイプラインであっても、ルーターに求めるのはレンダリングを囲むテキスト層です。つまり、ショットの説明を、これらのモデルが学習した長いまたは短いキャプションに変換するプロンプト拡張、画像から動画へのパスに供給するキャプションと対話の作業、そして複数の生成結果のうちどれを採用するかを決めるレビュー要約です。これらは通常のテキスト呼び出しであり、200以上のモデルにわたる単一のOpenAI互換エンドポイント上で、プロバイダーの定価を0%のマークアップでそのまま提供して実行されるため、ベンダーの値下げは契約サイクルを待たずにその日のうちに反映されます。自動フェイルオーバーは、チャットのワークロードよりもここでこそ価値があります。Q&Aセッションの4分時点で失敗したキャプション呼び出しは、レンダリングを失うのではなく、再ルーティングされるべきだからです。

決断は、それぞれ一行で

成果物が音声付きの完成クリップで、自分でGPUを持ちたくないのであれば、2つのうちそれを提供してくれるのはWan 2.7だけであり、その編集バリアントは、入手可能な証拠を見る限り、このファミリーの中で最も強力なものだ。reference-to-videoに踏み切る前に、10月10日の提供終了を確認しておこう。

成果物が自分で制御するパイプラインであり、5秒単位がショットリストに合い、ファインチューニングやオフライン実行を望むなら、Kandinsky 6.0 Video は二者のうちそれを可能にする唯一のものである——ただし、コンシューマーハードウェアでは遅いレンダリングと、依然として完全にラボ自身によるものにすぎない品質主張という代償を伴う。その側で注視すべき出来事は単純だ:Elo だ。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Alibaba Wan 2.7 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Tasks: text and image to AV', 'Reference input: one image', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Alibaba Wan 2.7 column reads 'Max clip: 2 to 15s', 'Resolution: up to 1080p', 'Tasks: four variants', 'Reference input: ten assets', 'Weights: none', 'Price: $0.10 to $0.15/s'. A footer reads 'Kandinsky figures vendor-reported; Wan pricing per Alibaba. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-Editing V1.0 leaderboard, ranking video-editing models by Elo from pairwise human preference votes with audio kept. Wan 3.0 is first at 1,156 over 5,255 samples at $12.00 per minute (Aug 2026); MiniMax H3 is second at 1,132 over 12,043 samples at $7.80 per minute (Jul 2026); Gemini omni Flash is third at 1,125 over 14,815 samples at $6.00 per minute (May 2026); HappyHorse-1.0 is fourth at 1,089 over 21,673 samples at $27.04 per minute (Apr 2026); Wan 2.7 is fifth at 1,077 over 17,988 samples at $16.90 per minute (Apr 2026); Dreamina Seedance 2.0 720p is sixth at 1,034 over 21,507 samples at $5.57 per minute (Mar 2026); Aleph 2.0 is seventh at 1,012 over 19,183 samples at $16.80 per minute (May 2026); Kling 3.0 Omni 1080p (Pro) is eighth at 1,000 over 17,447 samples at $10.91 per minute (Feb 2026); SkyReels V4 is ninth at 953 over 14,441 samples at $37.50 per minute (Mar 2026).

締めくくる前に、一つの非対称性に触れておく価値がある。それは両モデルよりも長く残るからだ。Wan 2.7 の上限は、契約上も技術上も Alibaba が設定するものである。スイートの各バリアントが廃止されたり価格改定されたりすれば、あなたのパイプラインはその決定を引き継ぐことになる。Kandinsky 6.0 Video の上限はあなた自身のハードウェアであり、MITライセンスは、フォークがラボのロードマップより長く存続し得ることを意味する。カタログからモデルが消えることに苦い思いをしたチームは、選択した当日よりも1年後のほうが、その違いをより重く見る傾向がある。

A screenshot of OrcaRouter's own model page for minimax/minimax-h3, titled 'MiniMax-H3' and credited to MiniMax, showing the route endpoint /v1/video/generations, a price of $0.08 per second at 768P and $0.13 at 2K, and a description explaining that MiniMax-H3 is MiniMax's omni-modal video generation model (the Hailuo 3 generation), released July 31 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio.