
Kandinsky 6.0 Video 対 Seedance 2.5:論文に書かれているバージョンは、あなたが買うバージョンではない
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
この対決で最も引用される一文は、誤ったモデルとの比較だ。2026年10月6日に公開され、MITライセンスで重みがリリースされたKandinsky 6.0 Videoの技術レポートは、Dreamina Seedance 2.0——前世代——をベンチマーク対象としている。Seedance 2.5はByteDanceの現行の映像・音声モデルで、2026年7月31日から提供されており、現在販売されているのはこちらだ。したがって、レポートがSeedanceについて「視覚基準で好まれており、全体的な視覚品質、アーティファクト、モーションのリアリズム、視覚的プロンプト追従において統計的に有意な差で優れている」と結論づけるとき、それは今日ライセンスすることのできないビルドを説明しており、それを評価したのはKandinsky 6.0 Videoを執筆したラボである。この文のどちらの半も重要であり、どちらもこの比較を無視する理由にはならない——バージョンの隔たりは、そこから何をどれだけ学べるかの下限を定め、その枠組みは、何を誰に信頼すべきかを教えてくれる。
2つのSeedanceバージョンの間で何が変わりましたか
2.0から2.5へのステップは単なる塗り直しではない。まさにそれが、この置き換えが見た目だけのものではない理由だ。Seedance 2.5は1回のパスで最大30秒を生成する。これは報告書に登場するモデルの許容量の6倍であり、Kandinsky 6.0 Videoの固定5秒の6倍でもある。タイムスタンプ単位のターゲティングと、領域単位の生成後編集を追加しており、つまりクリップ全体を再生成するのではなく、クリップのある時間区間やフレームの一部分に変更を適用できる。1回のリクエストで、テキストとともに約30枚の画像、10本の動画、10個の音声クリップを参照素材として読み込む。Kandinsky 6.0 Videoの単一のマスクされた末尾フレームに対してである。さらに、対話付きの同期音声を生成する。これが、この2つがそもそも同じ記事に属する唯一の理由だ。
それらはいずれも、そのレポートの評価がテストしなかった能力である。したがって、視覚基準の結果が示しているのは、Kandinsky 6.0 Video が総合的な視覚品質、アーティファクト、モーションのリアリズム、プロンプト追従性において、Seedance の前世代に後れを取ったということだ。それは現在のビルドがどうなるかを示すものではなく、率直な想定としては、新しい世代が、自らのリリースノートが強調する軸において悪化することはない、というものである。
報告書自体の評価が何を立証し、何を立証しないか
その手法は、吟味するのに十分なほど詳細に開示されている。同じプロンプトから2つのモデルによって生成された並置ペア、両方のクリップの匿名化、タスクごとの左右位置のランダム化、タスク順のシャッフル、視覚に関する質問ではまず音声を無効化し、音声に関する質問では有効化、対称的な引き分けオプション、基準を判断できない場合の明示的なN/Aオプション、アノテーター間での多数決集約、そして評価対象の各基準について約200件以上の一対比較。
その手法では、Seedance 2.0 の結果は、同じレポートの Kling 比較を読んだ人なら見覚えのある形で分かれる。視覚基準は、有意性を明確に上回る差で Seedance に軍配が上がる。音声領域ははるかに接近しており、音声と映像の同期はほぼ互角に落ち着き、音声品質では Kandinsky 6.0 Video Pro が優勢だ。これら二つの記述の間に決定全体が位置する。なぜなら、それは最新のオープンな音声・映像チェックポイントが、クリップの見た目では測定可能なほど遅れを取り、その中の音声の聞こえ方では測定可能なほど進んでいることを意味するからだ。
その結果に課された限界はありふれたもので、どれも結果にとって致命的ではない。それはKandinskyの著者たちが自分たちで選んだプロンプトに対し、自分たちが募集したアノテーターを用いて実施したものだ。公開のブラインドアリーナでKandinsky 6.0 Videoを評価しているものは皆無なので、第三者のプロンプトがその分かれ方を再現するかどうかを外部で検証したものは何もない。報告書はまた、それが基準として測っている上限も開示している。すなわち、最大5秒のクリップ、SD解像度での基本生成(フルHDは超解像段階を経て到達)、そして視覚品質と全体的な音声品質において最強のプロプライエタリシステムとの間に残る差、である。
どのベンチマークも捉えられない3つの構造的ギャップ
尺は最初にして最もあからさまな違いだ。Kandinsky 6.0 Video は121フレームで学習・評価され、121フレームで推論を実行する。24 fpsで5秒であり、拡張モードを備えていない——30秒の作品は6回の生成、5回のつなぎ合わせ、そしてあなたが負う連続性リスクになる。Seedance 2.5 は30秒を1パスで処理する。1回の対話のやり取り、製品ウォークスルー、あるいはつなぎ目が見えてしまうあらゆるものにとって、それはベンチマークの違いではない。その作業が1回のレンダリングで済むのか、組み立て工程になるのかという違いなのだ。
2つ目は参照条件付けであり、その非対称性は際立っている。Kandinsky 6.0 Video は参照画像を1枚だけ受け取り、それをマスクされた末尾フレームとして適用する——補間の目標となるキーフレームだ。Seedance 2.5 は約30枚の画像、10本の動画クリップ、10本の音声クリップからなるワーキングセットを1つのコンテキストとして受け取る。シーケンス全体にわたるキャラクターの一貫性、ムードボードからのスタイル転送、既存クリップから持ち込まれるパフォーマンス——これらは参照数が可能にするワークロードであり、単一フレームモードが試みることのないものである。
3つ目は編集可能性であり、これは単発のショットではなくワークフローを変える要素だ。領域レベルおよびタイムスタンプレベルの編集とは、欠陥のある3秒間のウィンドウをその場で修復できるということだ。Kandinsky 6.0 Videoには編集サーフェスが存在しない——不出来な5秒は再生成され、それが他の4つと結合されていたなら、結合部も再検討される。再レンダリングを常習とするチームは、その違いを後になって発見するのではなく、モデル選定の段階で見積もりに織り込むべきだ。
• 長さ — Kandinsky 6.0 Video: 5秒固定、24 fpsで121フレーム、延長モードなし。Seedance 2.5: 1回の生成で最大30秒。
• 参照コンディショニング — Kandinsky 6.0 Video: 画像1枚を、マスクされた末尾フレームとして適用。Seedance 2.5: 1リクエストあたりおよそ画像30枚、動画10本、音声クリップ10個。
• 編集 — Kandinsky 6.0 Video:なし、再生成して再結合。Seedance 2.5:タイムスタンプ単位のターゲティングと、領域単位の生成後編集。
• 解像度 — Kandinsky 6.0 Video:SD は 512×768、フル HD 1920×1080 は内蔵の超解像ステージを経由。Seedance 2.5:モード依存で、クリップあたりの価格は選択した解像度によって決まります。
• オーディオ — Kandinsky 6.0 Video:リップシンク付き44 kHz、映像と同時に生成。Seedance 2.5:会話を含む同期オーディオを映像とともに生成。
• ウェイト — Kandinsky 6.0 Video:MIT、Lite 3B と Pro 29B、コードと diffusers 統合付き。Seedance 2.5:なし。
互いに変換できない2つのメーター
Seedance 2.5はトークン単位で課金され、480pの5秒クリップでおよそ$0.51、720pでおよそ$1.16になります。これを毎秒レートではなくこのように述べる理由は、トークン数が映像の長さに応じて増えるためです。つまり30秒の生成は固定レートの30秒ではなく、同じ設定での5秒の6倍のトークンであり、編集操作は触れる対象に基づいて価格が決まります。習慣的に再生成するパイプラインでは、メーターがその習慣に反応することがわかります。
Kandinsky 6.0 Video には課金メーターがない。購入するものが何もないからだ。そのコストはマシンと時間であり、レポートがその時間を示している。Pro Full HD の5秒クリップ1本につき、H100 で約402秒、RTX 5090 で854秒、RTX 4090 で1,247秒の作業時間。72.8 GiB のピーク割り当てを下回る場合はブロックオフロードが必要で、テキストエンコーダーを NF4 に量子化する 16 GB VRAM プリセットもある——レポートがクリップ自体を変えると述べている唯一のプリセット変更だ。蒸留チェックポイントは、完全モデルと同等(平均選好率51%対49%、統計的有意性に達する評価基準はなし)と測定されており、これらの数値を実用的にするものだ。
• 5秒あたりのコスト — Kandinsky 6.0 Video:定価なし。カードによってはGPU 1台で6~21分。Seedance 2.5:トークン換算で480pは約$0.51、720pは約$1.16。
その2行の中に、同じ尺度で比較できるものは何もない。そして、それらを単一の数値に還元しようとするいつもの試み――GPU時間単価を5秒クリップで割る――は、完全稼働、アイドル時間ゼロ、そしてすでにカードを所有していることを暗黙の前提にしている。より有用な比較は定性的だ。Seedance 2.5 のコストは生成する量に応じて増え、やめれば消える。Kandinsky 6.0 Video のコストは、生成するかどうかに関係なく発生する。

それぞれがどこで到達可能か
どちらのモデルもOrcaRouter上にはなく、どちらの主張もなされていない。Seedance 2.5はベンダー自身のプラットフォームおよび複数のサードパーティサービスを通じて利用でき、Kandinsky 6.0 VideoはMITの下でダウンロードして自分のハードウェアで実行するチェックポイントである。どちらもマルチモデルプラットフォーム上で1回のAPI呼び出しで利用できると述べているページは、別のモデルについて説明している。
Kandinsky や Seedance のパイプラインでルーティング層が依然として言及に値する理由は、これらのシステムが呼び出し回数の面では主にテキスト、コストの面では動画であるからだ。プロンプト拡張は、ショットのメモを T2AV モデルが期待する長い構造化キャプションに変える。台詞はリップシンクのパスが試みる前に起草され、そのパスが台詞を台無しにした場合には書き直される。同じビートの6つの候補生成がレビューされ、1つが選ばれる——動画の成果物に関するテキスト判断であり、これは高コストな判断を正しく下すための最も安価な方法である。プロバイダーの定価をマークアップ0%でそのまま適用する、200以上のモデルにまたがる単一のOpenAI互換エンドポイントで、それらの呼び出しはプロバイダーが請求する額しかかからず、ベンダーが料金を変更した翌日であっても同様である。ルーティングDSLは、安価なレビュアーと慎重なレビュアーが同じ呼び出し箇所で異なるモデルであるべき場合にその価値を発揮し、自動フェイルオーバーは、6つのうち4つ目のクリップをレンダリングしている最中にキャプションが停止した場合、セッションを終了させるのではなく再ルーティングすべきであるため、その価値を発揮する。
何がこの対戦カードを動かすのだろうか
バージョン間の隔たりが事態のすべてであり、同時にそれを解決する最短経路でもある。Seedance 2.5をKandinsky 6.0 Videoと対決させれば、報告書が2.0に対して記録した視覚基準での敗北が拡大したのか、縮小したのか、それとも逆転したのかを決着させられるだろう——報告書はそれに答えられず、その著者たちにも答えようがなかった。今のところ、擁護できる立場はどちらの側のマーケティングが望むよりも狭い。モデル自身の研究所が公表した証拠に基づけば、クリップの見た目ではSeedanceが優位に立ち、その中の発話の聞こえ方ではKandinsky 6.0 Videoが優位に立つ。そして、その主張の根拠となるSeedanceのバージョンは、あなたが購入することになるものより1世代前である。
状況に応じて選べ。作業が長く、参照資料が多く、編集主導なら、品質が問われる前に構造上の差が勝敗を決める。5秒のトーキングショットで、セリフが一発で正しく聞こえなければならないなら、Kandinsky 6.0 Video の測定された優位性はまさにその基準にあり、MITライセンスであることは、答えが誰かのロードマップに依存しないことを意味する。注目すべきはリーダーボードではない。それは、そのレポートが決して実行できなかった比較の再実行だ。


高価な呼び出しを正しく実行する最も安価な方法:ステージごとにレビュアーを差し替えるルーティングDSL。自動フェイルオーバーを備えているので、キャプションが死んでもクリップを失うことはない。
