Vidu Q4 Previewの生成タイトルカード。サブタイトルは「初日にして画像から動画のリーダーボードで3位」、カードには「AA-Video-I2V v1.0: #3、Elo 1,179」と「Vidu Q3 Pro: #19、Elo 1,056」と表示され、スペックタイルの列には「最大クリップ: 16秒」「最大解像度: 4K」「参照画像: 最大15枚」「テキストから動画: 提供なし」と書かれている。OrcaRouterのロゴは右下の余白付きストリップにある。
Guides & Insights

Vidu Q4 Preview、Image-to-Videoボードで3位に初登場——そしてもう一方のボードには不在

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Vidu Q4 Previewは、Artificial AnalysisのAA-Video-I2V v1.0リーダーボードにElo 1,179で3位で登場した。そして、Viduの最上位エントリーとしてこのモデルに取って代わられたVidu Q3 Proは、1,056で19位につけている。これは1回のリリースでの123ポイントの変動であり、信頼区間がおよそ20ポイント幅しかないボード上での話だ。しかもそれは、旧モデルが抱える9.60ドルではなく、生成動画1分あたり7.20ドルという価格で起きた。Shengshu Technologyは2026年10月7日、次世代フラッグシップの最初の公開プレビューとしてVidu Q4 Previewを出荷した。これは明確にフルQ4モデルに先立つもので、最終リリースがまだ形作られている最中に、クリエイターへ実際のプロジェクトで使うよう呼びかけている。

初登場の数字は見出しだ。より興味深い事実は、その不在である。そしてそれこそが、これがグラフではなく記事である理由だ。

10月7日に実際に出荷されたもの

Vidu Q4 Previewは、ネイティブ音声を備えた動画生成モデルで、Vidu自社のWeb製品およびAPIプラットフォームを通じて販売されています。Shengshuの発表資料では、三つの領域の取り組みが説明されています。キャラクターの演技(表情、感情、身体の動き、声を重ねるのではなく連動させること)、高速なアクションにおけるカメラとカットの一貫性、そして視覚効果——爆発、粒子、花火——がシーンの上に乗るのではなく、シーンの内側に存在することです。

仕様は、ベンダーが述べるところによれば:

• 最大解像度 — 4K。2K と 4K は 10 ビット色深度に対応。解像度の全段階は 540p、720p、1080p、2K、4K

• 最大クリップ長 — 16秒、不均等に分割: Image-to-Video は3~16秒、Reference-to-Video は1~16秒

• 参照枠 — 最大15枚の参照画像(キャラクター、衣装、小道具、製品、環境を1回の設定で)および最大3つの参照音声クリップ

• ローンチ価格 — 1秒あたり$0.014から。これはベンダーの提示額であり、明示的にプロモーション用です。

また同ベンダーは、容易にはその裏づけを取れない比較的主張も行っている。すなわち、同等の出力仕様および課金条件の下では、Vidu Q4 Preview が「同じ予算で最大5倍の出力」を実現するという主張だ。これは品質ではなく効率に関する主張であり、その一文では「同等の出力仕様および課金条件」という表現がすべての役割を果たしているため、誰かが再現するまではマーケティング上の修辞として扱う価値がある。併せて公表された Shengshu 自身の注意書きでは、最終価格、対応解像度、機能の利用可否、利用条件は、プランや地域によって異なる場合があるとしている。

A generated single-column scoreboard titled 'Vidu Q4 Preview — the scoreboard' with six rows reading 'AA I2V rank: 3rd, Elo 1,179', 'Max resolution: 4K at 10-bit', 'Max clip: 16 seconds', 'Reference images: up to 15', 'Reference audio: up to 3' and 'Measured rate: $7.20 per minute', with a footer reading 'Elo, rank and rate per Artificial Analysis, 8 October 2026; resolution and clip length are vendor-stated.' The OrcaRouter logo sits in the bottom-right padded strip.

2つのボードは、このモデルが何のためのものかについて意見が一致していない

Artificial Analysisは、それぞれ別個のEloスケールと別個の投票プールを備えた、別々の動画リーダーボードを運営しており、その違いこそがここでの話のすべてです。

AA-Video-I2V v1.0 — 画像から動画、音声を保持したままのペアワイズな人間選好投票によるランキング — では、Vidu Q4 Previewが5,543サンプルで1,179 ±10の3位、日付は2026年10月、価格は1分あたり7.20ドル。その上にあるのは2モデルだけ:MiniMax H3 Maxが5,894サンプルで1,195 ±9(1分あたり4.80ドル、2026年8月)、MiniMax H3が7,284サンプルで1,181 ±8(1分あたり7.80ドル、2026年7月)。Gem​ini Omni Flashは12,327サンプルで1,178 ±7の4位。このボード自体の告知によると、過去30日間に2つのモデルが追加された:Vidu Q4 PreviewとHiDream-O1-Video-1.0で、後者は1,175 ±10の6位。

AA-Video-T2V v2.0 — テキストから動画、異なるユースケース分類に基づいて構築された別のボード — では、Vidu Q4 Preview はまったく登場しません。そこでの最高の Vidu エントリは Vidu Q3 Pro で、4,088 サンプル中 941 ±10 の25位です。Wan 3.0 がそのボードを 1,156 ±9 でリードしています。

その2つの文を合わせて読めば、このリリースの形がはっきりしてくる。これは画像と参照のモデルだ。Vidu自身の製品ページには、Image-to-VideoとReference-to-Videoというちょうど2つのモードだけが掲載されており、text-to-videoタブはなく、APIドキュメントも一致している。ベンダーのマーケティングでは汎用フラッグシップに見えるローンチも、独立系の掲示板では狙いを絞ったものだ。

ランクそのものについて、もう1点注意があります。I2Vボードの10ポイント間隔は3位から6位にかけて大きく重なっており——1,179、1,178、1,176、1,175——つまり「3位」はノイズの範囲内の位置であり、4位との明確な分離ではありません。ノイズの範囲内ではないのは、置き換えたモデルとの差です。Vidu Q3 ProとVidu Q4 Previewの間の123 Eloは、ボードのトップ6全体の広がりよりも大きいのです。

The Artificial Analysis image-to-video board on 8 October 2026, with Vidu Q4 Preview third at Elo 1,179 and Vidu Q3 Pro nineteenth at 1,056.

実際に何を呼び出すのか、そしてそれにいくらかかるのか

APIは地味で具体的です。Image-to-Videoは/ent/v2/img2videoに、モデル名viduq4-previewを指定してPOSTし、開始フレーム画像を1枚(png、jpeg、jpgまたはwebp、最大50MB)、最大20,000文字のプロンプト、3~16秒(デフォルト5秒)の長さ、540p~4K(デフォルト720p)の解像度を受け取ります。Reference-to-Videoは/ent/v2/reference2videoにPOSTし、1~15枚の画像に加えて各3~12秒のmp3音声参照を0~3個受け取り、アスペクト比1:1、9:16、16:9、3:4、4:3を提供し、デフォルトは16:9です。

注目すべきパラメータはaudioで、デフォルトはtrueです。Vidu Q4 Preview はデフォルトで画像とともに音声を生成します——セリフや効果音も含まれます——これを意図的にオフに切り替える形になります。返される作成 URL は24時間有効で、バッチで生成して後からレンダリングする場合には無視できないほど短い期間です。

価格について正直に計算すると、取り沙汰されている2つの数字——「1秒あたり$0.014」と、Artificial Analysisが記録している1分あたり$7.20——は同じ製品のものではない。1秒あたり$0.014は1分あたり$0.84で、これはリーダーボード上の数値のおよそ9分の1だ。最低解像度でのプロモーション価格の下限が、本番向け解像度で測定された料金の隣に置かれると、こう見えるということである。ローンチ時の数字から予算を組むものは何であれ、見出しの数字からではなく、自分の解像度と利用時間から再計算すべきだ。

Vidu's own API documentation for the Image-to-Video and Reference-to-Video endpoints behind Vidu Q4 Preview.

プレビューSKUの実用上の問題

ベンダー自身の位置づけによれば、Vidu Q4 Previewは完成品ではない。パフォーマンス、クリエイティブコントロール、日々の制作ニーズに関するフィードバックを最終リリースに反映させるため、Q4より早く出荷されたのだ。価格はプロモーション価格。機能の提供状況はプランと地域によって異なる。APIドキュメントには誤字のエイリアスまで載っている——viduq4-previerwは、正しいviduq4-previewと並んでモデルパラメータの説明に登場する——これは小さなことだが、このビルドがパイプラインのどこに位置するかを如実に物語っている。

それは、それを使うことへの反論ではない。プロモーション価格が終わったとき、あるいはプレビュービルドが置き換えられたときにどうなるかの計画もなしに、それをクリティカルパスに載せることへの反論だ。このようにリリースされたモデルでは、それは四半期ではなく数週間の問題である。

本番パイプラインを賭けずに試してみたいなら、OrcaRouter はまさにそうしたケースのために作られています:200以上のモデルに対応する単一の OpenAI 互換エンドポイント、プロバイダーをまたぐ自動フェイルオーバー、そしてプロバイダーの定価をマークアップなしでそのまま反映。プレビュービルドでは、フェイルオーバーの役割はいつも以上に重要です。プレビューのルートが使えないときに、同じキーで安定したモデルへリクエストをルーティングできるのはこれがあるからです。ルーティングについて率直に言えば、Vidu Q4 Preview は現在 OrcaRouter のルートではありません。私たちが実際に提供している動画モデル——このボードで首位の MiniMax H3 を含む——はテキストモデルと同じエンドポイントで呼び出せますし、秒単位の動画料金は明細の一行であって、別契約ではありません。

何を見るべきか

この話を動かすものは3つある。

まず、テキストから動画へのボードです。Artificial Analysisは、AA-Video-I2V v2.0が登場すると述べており、T2V v2.0の分類体系に沿い、全体を通して1080p動画をカバーします。Vidu Q4 Previewが画像および参照モデルであれば、そこにも登場しないでしょう — そしてもし登場すれば、それはShengshuがプレビューが示唆するよりも広範なモデルを出荷したことを示しています。

第二に、Q4の完全リリースです。プレビューから最終版へと移行する段階は、通常プロモーション価格が終わりを迎えるところであり、機能セットがそのまま維持されるか、あるいはひっそりと縮小されるかの分かれ目でもあります。15枚の画像と3つの音声という参照の上限は、仕様の中で最も生き残る可能性が高い部分です。なぜなら、それはローンチ全体の基盤となっている差別化要因だからです。

第三に、サンプル数。5,543票は実際の測定値だが、まだ若い。ボードが埋まるにつれて区間は狭まり、順位はどちらにでも動く。「3位」を確定した事実として引用する人は、それを読んだ日付を添えるべきだ。

引き留めておく価値のある問いは、マーケティングが示唆するよりも狭い。Vidu Q4 Preview は、測定可能な限りにおいて、Vidu がこれまでに生み出した中で最良の画像から動画へのモデルであり、その差はリーダーボード自体のトップ6の得点幅よりも大きく、前身よりも低い1分あたりの料金を実現している。それが持続的な地位となるのか、それともプレビューによる一時的な押し上げにすぎないのかは、現在のどの数値にも答えられるものではない。