生成されたタイトルカードには「Vidu Q4 Preview vs MiniMax H3」と表示され、サブタイトルは「Elo差は16、ボード3つ分の差」。3つの統計タイルには「1,195 MiniMax H3 Max」「1,181 MiniMax H3」「1,179 Vidu Q4 Preview」と表示され、それぞれに「image-to-video Elo」というキャプションが付く。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Vidu Q4 Preview vs MiniMax H3:ボードの首位は同点で、両者のうち片方だけが3つのボードに載っている

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

The image-to-video board at Artificial Analysis, read 8 October 2026, puts MiniMax H3 Max first at 1,195 Elo, MiniMax H3 second at 1,181, and Vidu Q4 Preview third at 1,179. Sixteen points separate first from third, on intervals of roughly ±10 and ±11, across 5,894, 7,284 and 5,543 votes respectively. That is a statistical tie dressed as a podium, and any page that opens by declaring a winner on this board is reading noise.

つまり、興味深い問いは、この2つのモデルのどちらが優れているかではない。両方が登場する唯一のボードから一歩降りたとき、その比較がどうなるかだ——なぜなら MiniMax H3 は2026年7月31日に、テキスト、画像、動画、音声の参照を単一のコンテキストとして読み込むオムニモーダルモデルとしてリリースされ、Vidu Q4 Preview は2026年10月7日に、2つの入力モードと2つのAPIエンドポイントを備えて登場したからだ。一方は3か所で測定されている。もう一方は1か所で測定されている。

三者同率が意味することと意味しないこと

MiniMaxの両エントリーとViduのビルドは互いの区間内に収まっている。したがって、正直に言えば、上位3つの画像から動画へのモデルは、現在のサンプルサイズでは人間の選好によって区別できない。2つの細部が、その引き分けを、聞こえほど誰にとっても好ましいものではないものにしている。

第一の点は時期です。MiniMax H3の投票は2026年7月のもので、H3 Maxのものは8月、Vidu Q4 Previewのものは10月です。より大きく、より古い投票プールは、異なる競争環境と異なる対戦相手の集合に対して測定されており、これは諸刃の剣です。よりよく測定されている一方で、わずかに異なる問いについてのものでもあります。ここでのどちら向きの16ポイント差も、証拠にはなりません。

2つ目は価格の列です。Artificial AnalysisはこのボードでMiniMax H3を1分あたり7.80ドル、H3 Maxを1分あたり4.80ドルと記録しています。Vidu Q4 Previewは7.20ドルと記録されています。これらをランキングとして読むと、H3 Maxは3つの中でコストパフォーマンスに優れた選択肢に見えます — しかし、基になっているベンダーの料金はそのラベルを矛盾させるどころか説明しています。当社のモデルカードでは、MiniMax-H3を768Pで1秒あたり0.08ドル、2Kで1秒あたり0.13ドルとして掲載しており、これは1分あたり4.80ドルと7.80ドルになります。ボード上の2つのMiniMaxの数値は、同じモデルを2つの解像度ティアで価格設定したものであり、プレミアムティアと低価格ティアではありません。選好ボードの分あたりの列は、桁違いの比較には役立ちますが、それより細かいことには危険です。

MiniMax H3 は表示されるが、Vidu Q4 Preview は表示されない場所

これは、引き分けでも生き残るマッチアップの部分であり、質の違いではなく構造上の違いです。

MiniMax H3 (768p) は、テキスト・トゥ・ビデオのボードで 8,315 票で Elo 1,137 の 4 位、H3 Max が 5,719 票で 1,130 の 5 位。動画編集のボードでも 7,023 票で 1,119 の 4 位で、このボードは音声を保持したままテキスト指示から動画を編集する点でモデルをランク付けする。Vidu Q4 Preview はどちらにも登場しない。

その不在は測定の空白ではない——それがこの製品そのものなのだ。Vidu Q4 PreviewのAPIには2つのエンドポイント、/ent/v2/img2videoと/ent/v2/reference2videoが記載されており、製品ページにはImage-to-VideoとReference-to-Videoの2つのモードが挙げられている。ドキュメントにテキスト-to-ビデオの経路はない。ビデオ編集の経路も同様になく、つまりこのモデルは既存のクリップを取り込んでその中の何かを変更することはできない。MiniMax H3はその両方をこなし、テキスト・画像・ビデオ・音声の参照を1つのコンテキストに収めるそのオムニモーダルな枠組みこそが、それを可能にしている理由なのである。

オーディオ面については正確に述べておく価値があります。なぜなら、両モデルともネイティブオーディオに対応していますが、両者は同じものではないからです。Vidu Q4 Previewはオーディオと動画を同時に生成し、オーディオパラメータが画像から動画へのエンドポイントにあり、セリフと効果音付きの動画を出力します。また、キャラクターの声を一貫させるために、最大3つの参照オーディオクリップを受け付けます。MiniMax H3はネイティブのステレオオーディオを出力し、画像や動画と並んでオーディオを入力モダリティとして受け付けます。参照音声のユースケースはVidu固有の強みであり、あらゆるものを参照するユースケースはMiniMaxの強みです。

秒単位の計算、ティアごとに

どちらのモデルも生成される出力の1秒単位で課金されるため、これは料金表を換算なしにそのまま突き合わせて比較できる、珍しいケースです。

• 540p — Vidu Q4 Preview のみ:1秒あたり9クレジット、プラットフォームが公表している標準クレジットレート $0.005 では約 $0.045

• 720P / 768P — Vidu Q4 Preview は1秒あたり19クレジット、約$0.095、これに対し MiniMax-H3 は1秒あたり$0.08

• 1080p — Vidu Q4 Preview は毎秒24クレジット、約0.12ドル、MiniMax-H3 には公開された 1080p ティアなし

• 2K — Vidu Q4 Preview は毎秒38クレジット、約0.19ドル、MiniMax-H3 は毎秒0.13ドル

• 4K — Vidu Q4 Preview のみ:1秒あたり78クレジット、約$0.39

そこから浮かび上がるパターンは「どちらか一方が安い」ということではない。Vidu Q4 Previewの下限は本当に低い——その540pティアは、フル解像度のレンダリングにお金を払う前にコンポジションを確認するという、まさにその用途に合わせて価格設定されたブロッキングティアであり、MiniMaxの料金表にはその役割を果たすものは何もない。MiniMax H3は、両モデルが共有する最上位ティアである2Kでは約3分の1安い。そしてViduの4Kティアは、この比較で唯一の4K生成ティアであり、そのことを反映した価格になっている。

Viduの発表に伴って示された1秒あたり0.014ドルの導入価格は、割引クレジットレートでの540p階層のものであり、一般レートではありません。Shengshuのプラットフォームでは現在、クレジットバンドルに対して最大30%の期間限定パッケージ割引を実施しており、これは曲線の形を変えるのではなく、すべての階層をまとめて引き下げます。比較には定価レートの曲線を用い、割引は一時的な相殺分として扱ってください。

当社側では、MiniMax-H3 をルーティングしています。これは公開モデル API 上で稼働しています:minimax/minimax-h3。生成出力の秒単位で課金され、ベンダーの定価をそのまま適用し、一切の上乗せはありません。当社が提供するすべてのテキストモデルと同じ OpenAI 互換エンドポイントから呼び出せます。Vidu Q4 Preview は OrcaRouter のルートではなく、このページもそう主張しているわけではありません — 当社が実際に提供している動画モデルは、言語モデルと同じ 1 つのキーと 1 つのリクエスト形式の上に並んでおり、これが複数のモデルを安価に比較できるようにする仕組みです。パススルー価格設定の実用的な帰結のひとつ:ベンダーが秒単位の料金を変更した場合、その変更は契約更新時ではなくその日のうちにルート上で確認できます。

実際のリクエストで「omni-modal」がもたらすもの

MiniMax H3の統合コンテキストは、機能リストとして読むと、エンジニアリング上の違いを見落としやすい。動画を入力参照として受け付けるモデルなら、既存のショットを指定し、その続きを生成したり、延長したり、スタイルを変更したりするよう指示できる。動画入力のないモデルにはそれができない。これが、H3が編集ボード上に存在する背景にある仕組みであり、また、このモデルの4~15秒という出力範囲が、その数字が示すほどには制約ではない理由でもある——マルチターンでの延長が、そこからより長いシーケンスを組み立てる通常の方法だからだ。

Vidu Q4 Previewの16秒という上限も生成ごとのものであり、そのReference-to-Videoモードは、その時間枠内でのマルチショット型ストーリーテリング向けに作られています。ドキュメントでは、インテリジェントなカメラ切り替えと、複数のカメラ位置にわたる一貫性について説明されています。それに欠けているのは、すでに撮影したクリップを受け取って変更するための経路です。ワークフローがスチルや参照セットではなく映像素材から始まるなら、これら2つのモデルのうち一方は単純に利用できず、どんなEloの数値もその差を埋めることはありません。

職種別でどれですか?

入力が画像または参照セット以外の場合は、MiniMax H3 を選んでください。テキストから動画、動画から動画の編集、音声入力、15秒を超えるマルチターン延長、あるいはモデルが3つの異なるボード分のユースケースを担う必要があるパイプライン——それは H3 の領域であり、2つのうちそれらを備えているのは H3 だけです。また、2K の料金も、両者が共有する最上位ティアにおいては H3 のほうが安価です。

キャストとボイスの一貫性が求められる仕事なら、4K生成ティアが必要なら、あるいは本番に進む前にショットを反復するための安価な540pブロッキングパスが欲しいなら、Vidu Q4 Previewを選ぼう。15枚の画像参照と3つの音声参照は、MiniMaxが公表している参照枠よりも大きく、この比較の中でネイティブに4K生成するモデルは他にない。その代償となるのが、より狭いモードセットだ。

これを変えるものは何か。テキストから動画へのエンドポイントを追加するVidu Q4の完全リリースなら、2つのモデルを同じボードに載せ、これを真っ向勝負に変えるだろう。AA-Video-I2V v2.0は、全体を通して1080pを備え、能力分類体系を改訂すると発表されており、ボード上位の票を並べ替えるのではなく置き換えるだろう。そして、現在の三つ巴の同点が同点なのか、それとも測定限界なのかを決着させるだろう。それまでは、覚えておくべき数字は16で、その横にボード名と日付を添えておく。

表彰台そのものから持ち帰る価値がある唯一のこと:3位より16 Elo上に位置する1位が、これほど広い区間では、ランキングであるはずがない。それは、人間の投票者が区別できない3つのモデルであり、それらの間の決定は、このページのほかのすべてから導かれなければならない。

A generated two-column scoreboard titled 'Vidu Q4 Preview vs MiniMax H3 - the scoreboard'. The left column reads: Image-to-video Elo 1,179 (3rd); Text-to-video not present; Video editing not present; Max resolution 4K generation tier; Clip length 1-16 seconds; Price at 2K about 0.19 USD per second. The right column reads: Image-to-video Elo 1,181 (2nd); Text-to-video 4th, 1,137; Video editing 4th, 1,119; Max resolution 2K; Clip length 4-15 seconds; Price at 2K 0.13 USD per second. A footer reads 'All Elo and rank figures per Artificial Analysis, 8 Oct 2026; prices per vendor rate cards.'A screenshot of the Vidu API documentation for Vidu Q4 Preview, showing the left navigation with the Vidu Q4 Preview entry selected and the 'Image to Video' page open, including the Create Task endpoint, the Authorization header and a cURL request example whose body sets model to viduq4-preview with a duration and resolution and the audio parameter set true.A screenshot of the OrcaRouter model page for minimax/minimax-h3, showing MiniMax-H3 described as MiniMax's omni-modal video generation model and the Hailuo 3 generation, released July 31, 2026, reading text, image, video and audio references as one unified context and generating 4-15 second videos at 768P or 2K with native stereo audio, billed per second of generated output at $0.08/s at 768P and $0.13/s at 2K, with an OpenAI-compatible code sample and a per-second price of $0.0800.