生成されたタイトルカードには「Kandinsky 6.0 Video vs Google Veo 3.1」と書かれており、サブタイトルは「3つのティア 対 2つのサイズ」。OrcaRouterのロゴが右下隅にあります。
Guides & Insights

Kandinsky 6.0 Video 対 Google Veo 3.1:3つのティア 対 2つのサイズ

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Sberの技術レポートを開いてKandinsky 6.0 Videoの直接対決セクションを探せば、比較ページが見落としていることに気づくだろう。対戦相手はVeo 3.1ではない。Veo 3.1 Fast なのだ。Sberが人間評価を行ったのは、Veoの3つの階層のうち中間のものだった。そしてこのたった一つの選択が、この対決についてどんな品質面の主張よりも多くを物語っている。Veo 3.1は2025年11月17日から3つのサービス階層で一般提供されており、Kandinsky 6.0 Videoは2026年10月の第1週に、ダウンロード可能な2つのサイズ——29BのProと3BのLite——としてMITの下で登場した。一方は秒単位で購入するサービスであり、もう一方は自分で動かすチェックポイントだ。そして実際に判断を分けるのは、品質の問いではなく、この階層の問いなのである。

Veo 3.1は、一つの名前をまとった3つの製品だ

GoogleのモデルはStandard、Fast、Liteで一般提供されており、3つすべてが同じフォーマットファミリーを生成します。720p、1080p、およびネイティブ4K(24 fps)に対応し、ネイティブの長さは4秒、6秒、8秒で、より長い出力は1080pで報告され、それを超える場合はシーン拡張の連鎖が可能です。キャラクターとシーンの一貫性を保つための最大3枚の参照画像、さらにシードとネガティブプロンプトの制御を備えています。出力にはSynthIDとC2PAの来歴メタデータが付与されます。

ティアを分けているのは価格と速度であり、独立系のボードはその差について何か不快なことを告げている。Artificial Analysisのテキストto動画リーダーボードでは、この3つは互いに14 Elo以内に位置している — Veo 3.1は2,998票で962(±10)、Veo 3.1 Fastは4,325票で961(±10)、Veo 3.1 Liteは2,903票で948(±10) — 一方、表示されている料金は毎分$24.00、$7.20、$4.80である。これらを合わせて読むと、このアリーナは、好みに基づいてティアを確実に区別することはできないと告げている。それはティアが同一であることを意味しない。購入者の本当の問いは、どのティアが自分の基準を満たすかであり、好みのボードは購入者に代わってそれに答えてはくれないからだ。

Kandinsky 6.0 Videoはバリエーションに対して逆のアプローチを取ります。サイズは2つ——Proが29B、Liteが3B——で、1つのアーキテクチャと1つの固定出力フォーマットを共有します。5秒、24 fpsで121フレーム、リップシンク付きの同期44 kHzオーディオ、テキストまたは参照画像から生成し、別個の超解像モデルが結果をFull HDに引き上げます。Fastバリアントはなく、拡張モードもありません。サイズとGPUを選びます。

ラボ自身の評価が実際に主張していること

これは、これら2つのシステム間に存在する唯一の直接比較データであり、スラッシュの両側ともベンダー報告です——Sberが実施し、Sberが公表し、Sberの外部でそれを再現した者はいません。それを好意的に述べることよりも、正確に述べることのほうが重要です。

テキストから音声・動画へのモードでは、レポートによると、Kandinsky 6.0 Video Pro がアーティファクトとカメラモーションにおいて統計的に有意な差で選好され、同点が支配的な分野の中でモーションのリアリズムではわずかに先行しています。Veo 3.1 Fast は、視覚プロンプト追従、音声品質、音声と動画の同期、全体的な音声品質、サウンドプロンプト追従、ユーザータスク解決でリードしており、音声以外はすべて有意に達しています。全体的な視覚品質はほぼ互角で、Veo にわずかな優位があります。

画像から動画の場合、その傾向は視覚面で逆転します。Kandinsky 6.0 Video Pro は、全体的な視覚品質、参照画像との整合性、アーティファクト、カメラモーションのすべてで優れており、いずれも有意です。Veo 3.1 Fast は依然として、視覚プロンプトの追従、音声と映像の同期、全体的な音声品質、サウンドプロンプトの追従、ユーザータスクの解決でリードしており、これらも有意です。モーションのリアリズムと音声品質はほぼ同等です。

2つのことが続く。画像から動画への結果こそが本物の知見だ。ラボ自身の研究で、オープンモデルが参照画像との対応と全体的な視覚品質においてGoogleのティアより好まれるというのは、検討に値する確かな主張である。そして音声の結果では、モードに関係なくVeoが優位を保っている——ここで、誰も言及しないフラグに行き着く。

その評価が公正かどうかを決めるオーディオフラグ

Veo 3.1 は、ネイティブの 48 kHz ステレオ音声 — セリフ、環境音、フォーリー — を映像と同時に生成します。これはこのモデルで最も強力な機能の一つです。ただし API では、audio パラメータのデフォルトは off となっており、無音生成の価格は音声付き生成より低く設定されています。Google が公開している Standard ティアでは、無音が 1 秒あたり約 $0.20、音声ありが 1 秒あたり約 $0.40 です。

Kandinsky 6.0 Video にはそのようなスイッチはありません。音声は出力の一部であり、vLLM-Omni に統合されたサービングパイプラインはデフォルトで 44.1 kHz の AAC を出力します。つまり、この 2 つのモデルは同じデフォルトに直面しているわけではありません。一方は音声優先で、もう一方は無音優先で、音はアップグレード要素なのです。

その非対称性は、比較において特定のコストを伴う。音声のないVeo 3.1と、常に音声付きで提供される競合製品を直接対決させ、そのペアを音声対応のベンチマークで採点するような比較は、デフォルト設定という偶然によってVeoにハンデを与えている。上記のSberの数値——あるいは他の誰のものであれ——を読むとき、まず問うべきは、Veo側で音声がオンになっていたかどうかだ。次に問うべきは価格差がどれほどだったかである。Standardティアでは、音声をオンにすると価格が2倍になるからだ。

5秒対8秒、そして1080p対ネイティブ4K

フォーマットのギャップは、2つのモデルのデザインブリーフが可視化される場所である。

• クリップの長さ — Kandinsky 6.0 Video:5秒固定、24 fpsで121フレーム、延長なし。Veo 3.1:ネイティブで4、6、8秒、1080pではより長く、それを超える場合はシーン拡張の連鎖。

• 解像度 — Kandinsky 6.0 Video: 超解像処理によるSD、HD、フルHD(1920×1080)。Veo 3.1: 720p、1080p、ネイティブ4K。

• プロベナンス — Kandinsky 6.0 Video: リリースには何も記載されていない。Veo 3.1: 出力にSynthIDとC2PAメタデータ。

• 参照入力 — Kandinsky 6.0 Video: 画像1枚を、マスクされたテールフレームとして適用。Veo 3.1: 最大3枚の参照画像に加えて、シードとネガティブプロンプト。

• フォーマット — Kandinsky 6.0 Video: 映像とともに44.1 kHz AAC、常時オン。Veo 3.1: 48 kHzステレオ、オプション、2通りの価格設定。

プロベナンスの行こそ、調達上の帰結を伴う項目だ。成果物にトレーサビリティが求められる場合——ブランド関連の制作物、放送、法務チームが目を通すようなあらゆるもの——Veo 3.1は映像が生成されたことを示すメタデータを付与するが、Kandinsky 6.0 Videoは付与しない。それは品質の違いではなく、ベンチマークにも現れない。しかし、それだけでベンダーを決める要件であり、それを必要とするチームにとって、それが欠けたオープンモデルはそのまま差し替えられる代替にはならない。

4Kのラインも同じように、そして同じ理由で重要です。Kandinsky 6.0 VideoのフルHDは本物です——専用のSRモデルがあり、リポジトリのSRパッケージは5秒クリップのx2、x4、x2.25アップスケールを処理します——しかし、Veo 3.1のネイティブパスがその上限から始まる地点で頭打ちになります。大画面での作業では、その上限は譲れません。

各サイドでクリップにかかる費用

Veo 3.1は秒単位の課金です。Standardティアでは、音声付きの5秒1080pクリップが約2.00ドル、同じクリップを無音にすると約1.00ドルです。FastとLiteはその下に位置し、それらのアリーナスコアはStandardの信頼区間内に収まるため、証拠に基づけば、より安価なティアに反対するのは難しいです。

Kandinsky 6.0 Videoに請求書はない。あるのはGPU時間だ。非蒸留モデルについて、ウォームアップ後に重み読み込みとMP4エンコードを除外して測定したリポジトリの数値では、5秒のPro Full HDクリップはH100で約402秒、RTX 5090で854秒、RTX 4090で1,247秒、RTX 5060 Tiで3,530秒かかる。Lite Full HDはH100で284秒だ。Pro SD実行時のピーク割り当ては72.8 GiBに達するため、それ未満のものにはブロックオフロードが必要であり、16 GBプリセットはテキストエンコーダをNF4に量子化する。これは、丸めレベルのノイズをもたらすのではなくクリップ自体を変化させると論文が確認している唯一のプリセット変更だ。

その2つのコスト構造は比較にならない。一方は完成した1秒単位で予測する請求であり、もう一方は購入するマシン、分単位で測られるレンダリング、そしてファインチューニングのオプションだ——それをVeo 3.1はどのティアでも提供していない。

ティアの問いはルーティングの問いである

OrcaRouterはGoogle Veo 3.1もKandinsky 6.0 Videoも提供しておらず、ここでそれらを示唆するものでもありません——Veo 3.1はGoogle自身のサーフェスを通じて利用され、Kandinskyはご自身でダウンロードするものです。しかし、Veoの意思決定の構造は名付ける価値があります。なぜなら、それは私たちのルーティング層がテキスト側で解決するために存在する問題だからです。独立したスコアが区別できず、価格が5倍異なる3つのティアは、まさに「安い方をルーティングし、基準が満たされないときだけエスカレーションする」が「フラッグシップに標準化する」に勝るケースです。OrcaRouterのアダプティブルーティングとルーティングDSLは、それを1つのOpenAI互換エンドポイント上の200以上のテキストモデルにわたる設定ポリシーとして表現します、プロバイダー定価でマークアップ0%、ルートがダウンしたときの自動フェイルオーバー付きです。同じ直感を動画支出に適用する——デフォルトではFast、重要なショットにはStandard——ことは、ルーターなしでも今日できる調達上の意思決定です。

どれを、誰のために

成果物で音声を真剣に扱う必要がある場合、4K または5秒を超えるクリップが必要な場合、あるいは下流の誰かが来歴メタデータを必要とする場合は、Veo 3.1 を選びましょう。Standard を既定にするのではなく、ティアを意識して選択し、請求書で初めて気づくのではなく、音声フラグの予算を確保しましょう。

Kandinsky 6.0 Videoを選ぶべきなのは、重みが欲しい場合、5秒という長さが作業単位に合う場合、そして提供されたスチルに対するimage-to-videoの忠実度こそが求められている仕事である場合だ——ラボ自身の調査が、それをVeoのあるティアより有意な差で上回るとしている唯一の側面である。音声は常にオンで、来歴はなく、品質に関する主張は完全に、その著者自身が書いたレポートに依拠していることを承知の上で臨んでほしい。

A generated two-column scoreboard titled 'Kandinsky 6.0 Video vs Google Veo 3.1 — the scoreboard'. The Kandinsky 6.0 Video column reads 'Max clip: 5s fixed', 'Resolution: Full HD plus SR', 'Audio: 44.1 kHz, always on', 'Provenance: none stated', 'Weights: MIT, Pro and Lite', 'Price: GPU time only'. The Google Veo 3.1 column reads 'Max clip: 4, 6 or 8s', 'Resolution: up to native 4K', 'Audio: 48 kHz, optional', 'Provenance: SynthID and C2PA', 'Weights: none', 'Price: $4.80 to $24.00/min'. A footer reads 'Veo rates and Elo per Artificial Analysis; Kandinsky vendor-reported. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.

保持すべき非対称性はこうだ。Veo 3.1 は11か月間本番運用されてきたため、今月リリースされたオープンモデルには持ち得ないものを蓄積している。すなわち、ユーザーがすでに公表した障害モードのマッピング済みセットと、財務チームがモデル化できる価格曲線だ。これに対して、Kandinsky の MIT ライセンスは、あなたのディスク上のモデルが誰かのロードマップに依存しないことを意味する。どちらがより価値があるかは、ベンチマークの問いではない。

A screenshot of OrcaRouter's own model page for kling/kling-3-turbo, titled 'Kling 3.0 Turbo', credited to Kling and dated 2026-06-17, showing the route endpoint /v1/video/generations and a price of $0.11 per request, with a description explaining that Kling 3.0 Turbo is Kuaishou's speed-optimized model in the Kling 3.0 generation with native audio bundled in, handling text-to-video and image-to-video, and multi-shot storyboarding of up to six shots in a single generation.