
Vidu Q4 Preview vs Seedance 2.5:本当の違いはリファレンスの予算ではない
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
公開されている参照予算は、Seedance 2.5にとって明らかな圧勝のように見える。最大30枚の画像、10本の動画、10個の音声クリップに対して、Vidu Q4 Previewは15枚の画像と3個の音声クリップだ。これは画像では2倍、音声では3倍であり、それだけでも決着がつくはずだ。しかしそうはならない。重要なのは数ではなく、第2のモダリティだからだ。Seedance 2.5は動画を入力参照として受け付ける。Vidu Q4 Previewは画像と音声を受け付けるが、既存のクリップを取り込む方法は文書化されていない。
Seedance 2.5は2026年7月31日に、ByteDanceの長尺向け製品として登場した。1回の実行で30秒のクリップを生成し、より長いシーケンスに対してはマルチターン拡張で対応する。Vidu Q4 Previewは2026年10月7日にShengshu Technologyから、次世代フラッグシップのプレビューとして登場し、Image-to-VideoとReference-to-Videoという2つのモードと、文書化された2つのAPIエンドポイントを備えている。どちらも参照情報を多用するモデルだ。両者は異なるものを保持するために作られた。
各入力モダリティが実際に可能にするもの
画像を参照として取り込むモデルは、キャストとルックを保持できる。Vidu Q4 Previewのドキュメントでは、キャラクター、シーン、スタイルにまたがる1~15枚の画像を組み合わせることで、マルチショットのテイクを通じて被写体の一貫性を保ち、さらに最大3つの3~12秒のmp3音声参照によって声をクローンし、話し方を揃えられると説明されている。1つのシーンのキャスト、衣装、小道具、ライティングにまたがる15のスロットは、首尾一貫した配分であり、それがこのモデルが画像から動画への選好ボードで首位タイを維持している理由である。
動画も参照として受け取れるモデルは、映像素材に向けて指示できる。Seedance 2.5 が最大10本の動画入力と、30枚の画像、10個の音声クリップを受け付けられるということは、参照セットに、プロンプトで説明するのではなく、既存のクリップから取り出した動き、テンポ、カメラの挙動を含められることを意味する。それは同じ能力の拡大版ではなく別の能力であり、それこそが Seedance 2.5 を Artificial Analysis の動画編集ボードに載せている理由だ — 2026年10月8日時点で、5,162票で1,161 Elo の2位 — 音声を保持したままテキスト指示から動画を編集する。Vidu Q4 Preview はそのボードに載っていない。理由はスコアではなく、そのエンドポイントのリストにある。
実用的な対比:
• 画像参照 — Vidu Q4 Preview は最大15枚、Seedance 2.5 は最大30枚
• 動画リファレンス — Vidu Q4 Preview は記載なし、Seedance 2.5 は最大10
• 音声参照 — Vidu Q4 Preview は最大3つの3~12秒のmp3クリップ、対して Seedance 2.5 は最大10
• 単一実行あたりの長さ — Vidu Q4 PreviewはImage-to-Videoで3~16秒、Reference-to-Videoで1~16秒であるのに対し、Seedance 2.5は1回の実行で30秒、さらにそれを超えてマルチターン拡張が可能
• モード — Vidu Q4 Preview の画像→動画と参照→動画 対 Seedance 2.5 のテキスト→動画、参照→動画、動画入力参照、ボード上の編集ルート付き
• 出力解像度 — Vidu Q4 Preview は540pから4Kまでを価格設定された生成ティアとして提供し、2Kと4Kは10ビットカラー。これに対し Seedance 2.5 は、その設定を公開しているホスト上で480pと720pを提供し、上位ティアはアップスケールによって納品解像度に到達する
それらを並べてみれば、両モデルが同じブリーフを奪い合っているわけではないことがわかる。15リファレンスの4K・16秒テイクと、動画入力を伴う30リファレンスの720p・30秒テイクは、異なる2つの制作上の問いへの答えなのだ。
価格単位は変換されず、それだけの話です。
ここが、これら二つの比較のほとんどが誤るところであり、その原因は計算そのものではなく単位にある。
Seedance 2.5 は、そのベンダーによって秒単位で販売されているわけではありません。ByteDance は公式の料金表上でこのモデルを動画トークンで計量しており、中国では Volcano Engine Ark を通じて、国際的には BytePlus ModelArk を通じて公開されています。クリップのコストは解像度、長さ、実際のトークン使用量によって決まるため、秒あたりの数字は特定の1つの解像度と1つの長さに対してのみ有効です。また、失敗したテイクも成功したものと同じように課金されます。Seedance 2.5 を公開しているサードパーティのホストは、自社のマージンを上乗せし、独自の秒単位またはクリップ単位の料金を公開しています。そのため、十数ページが十数通りの異なる数字を示しており、そのどれもがベンダーのものではありません。
Vidu Q4 Previewは料金体系が逆で、選択した解像度ティアによってのみ変動する1秒あたりの定額クレジットレートをShengshuが公然と公開している。540pで毎秒9クレジット、720pで19、1080pで24、2Kで38、4Kで78で、公表されているプラットフォームのクレジットレートは$0.005、現在、最大30%の期間限定バンドル割引が実施中だ。定価レートでは、その曲線は540pの毎秒およそ$0.045から4Kの約$0.39まで及ぶ。ローンチ発表の毎秒$0.014という数字は、割引を適用した540pティアのものだ。
つまり、この2つの料金表を1行ずつ突き合わせて比較することはできず、それをやっているページは、ベンダーの公開価格表とホスト側のマークアップを比べているにすぎない。比較できるのは、それぞれの料金の形について各ベンダーが公表している内容だ。Viduのコストは解像度と動画の長さに応じて変動し、生成ボタンを押す前に把握できる。Seedanceのほうはトークン従量制なので、モデルがあなたのプロンプトにどれだけトークンを使うかによって決まる。一方は予測可能で、もう一方は従量制だ。どちらが間違っているわけでもないが、適した買い手は異なる。そして予算を立てるうえでより危険なのは後者のほうだ。ばらつきがベンダー側にあるからである。
独立系のボード上では、記録された1分あたりの数値は桁数を把握する程度に読む価値がある。Artificial Analysis は、画像から動画のボードで Vidu Q4 Preview を1分あたり7.20ドル、テキストから動画で Dreamina Seedance 2.5 を1分あたり34.12ドル、編集で40.82ドルと記録している。これらの列は、各モデルのデフォルト設定で1080pを1分出力するコストだ。そして Seedance 2.5 は、その料金表が価格設定している、より長くより重い構成をデフォルトとしている一方、Vidu Q4 Preview のデフォルトは1回生成のクリップだ。それらは異なるデフォルト動作を測定しているのであって、4~5倍の効率差を測っているのではない。
16秒対30秒は実に大きな違いだ
単位の問題を生き延びる比較が一つだけあり、それが長さだ。1回の実行で30秒というのは、Vidu Q4 Previewの16秒という上限のほぼ2倍であり、Seedance 2.5のマルチターン拡張を使えば、それを超えてシーケンスを構築できる。物語的な制作——弧のあるシーン、振りとオチのある広告——にとって、16秒と30秒の違いは、ショットとシーンの違いにほかならない。
細かい側では、それは逆に作用する。Vidu Q4 Previewは3秒から生成でき、その540pティアの価格は自身の720p料金の約3分の1に設定されているため、フル解像度のレンダリングに踏み切る前にコンポジションのブロッキングを安価に行える。公開されているSeedance 2.5の料金体系には、その役割を果たすものがない。その480pホストティアは720pより安いが、ベンダー自身の課金はトークンベースであるため、短い低解像度テストには、計画の基準にできる明確な公開価格が存在しない。
手短に言うと、どちらですか
すでに手持ちの映像素材が関わる仕事では、Seedance 2.5 を選んでください。既存クリップの延長、リスタイル、再編集を行う場合、あるいは参照セットが外観だけでなく動きも担う必要がある場合、決め手となる能力は動画入力であり、Vidu Q4 Preview では代用できません。さらに30秒のシングルランを加えれば、より長いアークを伴うナラティブおよび広告の仕事では判断は明快です。
キャストを維持しなければならず、納品仕様が720pを超える案件なら、Vidu Q4 Previewを選ぼう。ネイティブ2Kおよび4K生成を10ビットカラーで行えるのは、Seedance 2.5がベンダーレベルでは公表していないティアであり、秒単位の価格によって4Kテイクは、計測不能な未知数ではなく、実際に予算化できる数量になる。15点の画像リファレンスと3点のボイスリファレンスは単一シーンのキャストには十分で、540pのブロッキングティアによって反復作業を安価にできる。
これを変えるものは何か。動画入力モダリティを追加するVidu Q4の正式リリースは、構造的差異を解消し、この2つを直接の競合にするだろう。そしてShengshu自身の資料は、プレビュー版が最終ビルドを形作るフィードバックを集めるためにまさに存在すると述べている。一方で、ByteDanceがより多くの設定でトークン料金の例表を公開すれば、従量制か予測可能かという非対称性を計画に織り込むのがずっと容易になる。どちらかが実現するまでは、「参照数30対15」の正しい解釈は、これらのモデルの一方が動画を入力として受け取り、もう一方は受け取らない、ということだ。
実際に呼び出せる動画モデルに対応する1つのキー
OrcaRouterは、動画モデルと言語モデルを、1つのキーで単一のOpenAI互換エンドポイントの背後に配置し、プロバイダーの定価をマークアップなしでそのまま適用するため、ベンダーの料金改定は更新時ではなく当日に反映されます。Vidu Q4 PreviewとSeedance 2.5は現在OrcaRouterのルートではなく、このページはそう示唆するものではありません。実際に提供している動画ルートは — Kling 3.0とそのTurboおよびv2.6バリアントを含み — 同じエンドポイントと同じリクエスト形式で言語モデルの隣に位置し、モデルごとに個別の契約を結ぶのではなく、ルート間で自動フェイルオーバーが行われます。
こうした構造があるからこそ、この種の比較は最後までたどり着ける。候補たちを自分のブリーフで、自分の設定で走らせ、単位の異なる2枚の料金表ではなく、合格率に決めさせるのだ。



