タイトルカードには「Utopai X、テキスト・トゥ・ビデオ部門で第2位にデビュー」と表示され、サブタイトルは「映画スタジオによるMiniMax H3のポストトレーニング - Elo 1,150、Wan 3.0に次ぐ第2位」、ピル型ラベルには「Elo 1,150」「5,455票」「APIなし」と表示されている。
Guides & Insights

Utopai Xがテキスト-to-ビデオで第2位にデビュー:映画スタジオによるMiniMax H3のポストトレーニングの内幕

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Utopai Xは、先週には存在しなかった動画モデルであり、フロンティアラボによってゼロから学習されたものでも、APIを通じて販売されているものでもありません——そして現在、テキスト・トゥ・ビデオにおいて世界第2位にランクされています。このモデルは、マウンテンビューに拠点を置くAIネイティブの映画・テレビスタジオであるUtopai Studiosによるもので、MiniMax H3(MiniMaxのオムニモーダル動画モデル)のポストトレインです。音声付きのArtificial Analysisテキスト・トゥ・ビデオリーダーボード(Artificial Analysisが現在AA-Video-T2V v2.0、2026年9月29日の結果としてラベル付けしているボード)では、Utopai XはElo 1,150に位置し、Aliba​sbaのWan 3.0の1,157に次ぐ2位、ByteDanceのDreamina Seedance 2.5の1,143と、MiniMax H3 (768p)ベースモデル(チューニング元)の1,138を上回っています。2026年9月30日、リーダーボードが更新されたのと同じ日に登場し、利用できる場所はただ一つ、Utopai自身の制作プラットフォームであるPAIの中だけです。公開APIはなく、Artificial Analysisの当該行の価格欄には「No API available.」と記されています。

その組み合わせ――世界2位、配信チャネルは1つ、通常の意味での秒単位の料金表はなし――がすべてを物語っている。映画を制作するスタジオが、他者の基盤モデルを手に取り、自社の制作判断に照らして調整し、順番を飛び越えたのだ。それが持続的な成果なのか、それともまったく新しい競技場の一断面にすぎないのかは、問う価値のある問題であり、答えはプレスリリースではなくリーダーボードを読むことにかかっている。

ボードが実際に示すもの

Artificial Analysisは、ブラインドのペアワイズ人間選好投票から導出したEloを用いて動画モデルをランク付けしています。投票者は、同じプロンプトから生成された2つのクリップを見て、どちらのモデルが生成したかを知らずに、好みの方を選びます。投票が蓄積されるにつれてボードは変化し、各行には、その順位がどれだけ変動し得るかを示す信頼区間が付いています。2026-10-01時点の、音声付きテキストto動画ボードは次のとおりです:

A scoreboard card reading 'Utopai X (based on MiniMax H3) - the scoreboard', with rows for text-to-video rank #2 (board range #1-3), Elo 1,150 (+/-11), votes 5,455, parent model MiniMax H3 (768p), parent model Elo 1,138 (+/-10), and availability PAI subscribers only with no API.

• #1 Wan 3.0 — Elo 1,157(±10)、サンプル数6,391、2026年8月リリース、$12.00/分。

• # Utopai X(MiniMaxベース) — Elo 1,150(±11)、5,455サンプル、2026年9月リリース、APIは利用できません。

• #3 Dreamina Seedance 2.5 — Elo 1,143(±10)、6,375 サンプル、2026年7月リリース、$34.12/分。

• #4 MiniMax H3(768p) — Elo 1,138(±10)、6,343サンプル、2026年7月リリース、$4.80/分。

• #5 FLUX 3 — Elo 1,129(±10)、5,628サンプル、2026年7月リリース、$17.40/分。

順位そのものより重要な細部が二つある。第一に、1位と2位の差はEloポイントで7点であり、しかも二つの区間は明示的に重なっている——Artificial AnalysisはUtopai Xの範囲を1,139~1,161として示しており、これはWan 3.0の点推定値1,157を含んでいる。リーダーボードはUtopai Xの順位を固定の位置ではなく、#1–3という範囲として表示している。第二に、Utopai Xと、その事後学習元となったモデルとの差は12ポイントで、同じ重なり問題がある。したがって「事後学習モデルは親モデルを上回る」は方向性としては正しいが、統計的には弱い。Utopai自身の解説は、この点についてほとんどのローンチ記事より慎重である。そこではEloの結果が「生成された映像に人々がどう反応するかについての独立した評価を提供する」と述べており、これは人間の選好アリーナが測るものについての妥当な読み方であり、映画制作についての主張ではない。

対照的に、ベンダー報告のレイヤーは自信を示している。Utopaiは、反射とコースティクス——光が反射または屈折するときに形成される集中パターン——における強み、およびクリップ内の空間的一貫性における強みを説明している。これらはいずれも、ベンチマーク結果ではなく開発目標である。それはベンダーの言葉であり、Artificial Analysisの測定値ではない。

ラボの代わりにスタジオ

Utopai Studiosは、自社の映画・テレビプロジェクトを開発し、資金を調達し、制作しており、そのモデルを事業の傍らではなく、その事業の内部で構築している。説明されている仕組みはフィードバックだ。制作によって脚本、承認されたキャラクターとロケーションのデザイン、ショットプラン、連続するテイクが生み出され、スタジオの監督、撮影監督、アーティストは、どのテイクが採用されたかだけでなく、なぜほかのテイクが却下されたかも記録する。その記録は訓練と評価のシグナルになる。研究チームはさらに、人間の選好評価と視覚言語モデルによる自動投票を組み合わせた社内Eloシステムを運用しており、人間側にはアーティストが参加している。

それはもっともらしい優位性であり、外部からは検証不可能なものである。ポストトレーニングは、基盤モデルを置き換えることなく、汎用動画モデルを映画や広告ユーザーの嗜好に近づけることができる——その点はリーダーボードと一致している。MiniMax H3に対する12ポイントの改善のうち、どれだけがトレーニングデータ、選好最適化、プロンプト処理、推論設定、またはサービング時の変更によるものかは、ローンチ資料には書かれていない。Utopaiは、ポストトレーニングデータの開示、最適化手法、計算予算、安全性評価のいずれも公表していない。独立した研究者はこの改善を再現できず、議論の対象となる技術レポートも存在しない。

配信レイヤーは、スタジオのテーゼが具体化される場所だ。PAI — Production Assistive Intelligence — は、Utopaiがモデルとともに立ち上げたプラットフォームで、プロジェクトのコンテキストを保持している。すなわち、脚本をシーンとショットに分解すること、キャラクターやロケーション、オブジェクトの制作ライブラリ、バージョン履歴、エンタープライズチーム向けの共有承認、そしてPremiere ProやDaVinci Resolveにエクスポートできるタイムラインだ。売り文句は、クリップの生成は安価な部分であり、ショットを作品の残りの部分と一貫させることこそが高価な部分だ、というものだ。Utopai Xはそのワークスペース内で、同社自身の言い回しによれば「映像制作者によって選択されたときに」映像素材を生成する——このモデルはPAIで利用可能な複数の画像・動画・音声モデルのうちの1つの選択肢であり、唯一のものではない。

Utopai Xの費用と、その読み方

The Artificial Analysis Video Arena text-to-video leaderboard, last updated September 29, 2026, listing Wan 3.0 at Elo 1,157, Utopai X at 1,150, Dreamina Seedance 2.5 at 1,143, MiniMax H3 (768p) at 1,138 and FLUX 3 at 1,129, each with sample counts, release months and price per minute.

PAIは、1秒あたりのAPI課金ではなく、クレジット制のサブスクリプションとして販売されています。公開されている料金プランは、1,000クレジットで月額15ドル、3,500クレジットで月額49ドル、10,000クレジットで月額129ドル、35,000クレジットで月額379ドルで、年払いにすると約8~10%の割引が適用され、さらに1,000クレジットあたり15ドルでトップアップできます。Utopai Xは、PAIのクレジット表で独自の行を持っています。1080pの動画1秒あたり93クレジットです。同プラットフォームの他の動画モデルはもっと低く、標準ティアでは1080pで1秒あたり50クレジット、プロティアでは76クレジットです。

それを1分あたりの数字に換算するのは誰にでもできる算術であり、ほとんど誰も価格として提示すべきではない。毎秒93クレジットでは、Utopai Xの出力1分は5,580クレジットになる。入門の$15プランでは月に1,000クレジットを購入でき、すべてのクレジットをこのモデルに使うなら、およそ10.8秒の映像に相当する。入門クレジットレートを線形にスケールすると、示唆されるコストは生成動画1分あたり$80超のオーダーになる。その数字は、注意書きを添えて初めて述べる価値がある。つまり、クレジットからドルへの厳密に線形な換算を前提としており、クレジットがPAI内のすべてのモデルで共有され、期限切れになったり未使用のままになったりすることを無視し、年間割引やトップアップバンドルを無視し、解像度や長さの制限については何も述べていない。UtopaiはUtopai Xについてそれらを別途指定していない。これは有用な桁感覚であり、料金表ではない。

比較すると、同じ Artificial Analysis のボードでは、MiniMax H3(768p)は1分あたり$4.80、Wan 3.0 は$12.00と掲載されている一方、Dreamina Seedance 2.5 は$34.12と掲載されている。これらは各ベンダー自身のAPIからの自動価格フィードであり、サブスクリプションから導き出した推定値ではないため、この比較はせいぜい方向性を示すにすぎない — しかし方向性は明確だ。エントリー層では、クレジット制のスタジオプラットフォーム内での生成は、秒単位のAPI価格とは競合していない。購入者が支払っているのは、モデルの限界的な一秒ではなく、モデルを囲むワークスペースなのだ。

公開されていない部分

3つのギャップは名指しする価値がある。それぞれが異なる意思決定を妨げているからだ。

• APIなし、統合経路もなし。Utopai Xには現在、直接的な統合経路がありません。パイプライン内で呼び出したいプロダクトチームは、それを呼び出せません。Artificial Analysisは「API利用不可」と記載しており、ローンチ資料にも開発者アクセスの記載はありません。

• 個別の仕様はありません。MiniMax H3は最大2Kで4~15秒のクリップを、ネイティブステレオ音声付きで生成します。UtopaiはUtopai Xについて、独自の最大再生時間や解像度を公表していません。そのため、クレジット表にある1080pという数値が利用可能な唯一の解像度に関する記述であり、クリップの長さは不明です。

• アリーナ以外での評価はない。 Eloの結果は、短いクリップに対する人間の嗜好を測ったものであり、映像が意図したショットとして機能するか、編集に組み込めるか、修正に耐えるかを測るものではない。Utopaiの投稿もこの点を直接認めている——「評価はクリップが生成された後も続く」——これはローンチとしては異例なほど正直な言い回しであり、同時にこのランキングがどこまで通用するかについての警告でもある。

スタジオ側には、さらに指摘すべき歴史がある。Utopaiは2026年6月2日にPAI 2.0を発表し、その時点で、4月のデビューから2か月足らずでプラットフォームの年間経常収益が1,100万ドルに達したと述べた。これは制作会社への商用ライセンス販売によるものだ。同社は、2027年に公開予定の劇場映画3本とシリーズ2本を抱えており、PAIとUtopai Xを自社制作作品に適用しているとしている。その中にはThe Most Serious Fartも含まれる。マイク・ベンダーが脚本・監督を務めるアニメーション長編だ。これらは同スタジオの数値であり同スタジオのスケジュールであり、APIのないポストトレーニングがそもそも記事にする価値がある理由でもある。つまり、このモデルは同社が公開を意図する映画の制作に使われており、それはリーダーボードよりも厳しい試練なのだ。

ベースモデルが依然として実用的な選択肢である場合

The OrcaRouter model page for MiniMax H3, showing the 0% markup badge, a description of omni-modal 4-to-15-second video generation at up to 2K with native stereo audio, a $0.08 per second price panel, a performance panel with p50 latency, and a release date of 7/31/2026.

今週実際に動画を生成する必要がある人にとって、このファミリーの中でルーティング可能なのはベースモデルです。MiniMax H3はOrcaRouterでプロバイダーの定価で利用できます — 768pで毎秒0.08ドル、つまり毎分4.80ドルで、これはArtificial Analysisが掲載している数値と同じです — マークアップは0%なので、ベンダーの値下げは再価格設定サイクルを待たずに当日に反映され、自動フェイルオーバーがプロバイダー間で機能するため、単一のエンドポイント障害でパイプラインが停止することはありません。テキスト、画像、動画、音声の参照を1つの統合コンテキストとして受け取り、768Pまたは2Kでネイティブステレオ音声付きの4〜15秒のクリップを返し、生成された出力の秒単位で課金されます。

Utopai X はルーティングされておらず、本記事のいかなる記述も、それがルーティングされているという主張として読まれるべきものではありません。ベースモデルが提供するのは、H3 ファミリーの美的特性とモーション特性をテストする手段です。それは、Utopai がどのようなポストトレーニングを施す前の時点で出発点としたのと同じ基盤であり、PAI サブスクリプションなしで、1 つの API キーを通じて、200 を超える他のモデルと並んで利用できます。Utopai X がルーティング可能なプロバイダーに到達することがあれば、その当日に定価で登場し、ベンダーの料金は上乗せされるのではなくそのまま転嫁されるでしょう。それまでは、正直な線引きはこうです。Utopai X は PAI 内のスタジオ向け、MiniMax H3 はパイプラインを組み立てるすべての人向けです。

これがデビューなのか、それともモーメントなのかを決めるのは何なのか

次の四半期に注目すべきことが3つある。第一に、首位の7ポイント差がさらに数千票を経ても残るかどうか——今日は区間が重なっており、新たな比較の束が届くたびに順位表が入れ替わるようでは、何も確定していない。第二に、Utopaiが開発者アクセスを一切開放するかどうか。世界2位にランクされるモデルをPAI購読者しか呼び出せないのは製品上の判断であり、撤回可能だ。第三に、競争が逆方向に動くかどうか。Wan 3.0はすでにネイティブ音声付きの1080pを最大30秒生成し、テキスト、画像、動画、音声、文書、ウェブページを参照として受け付け、ユースケース別の内訳では照明、素材、カメラ制御で首位に立っている。ベースモデルに対するポストトレーニングでの12ポイント向上は示唆的だが、より広い入力範囲を持つ基盤モデルに対して2位を維持するのは別の課題だ。

ここで本当に新しいのはEloではない。新しいのは主張の形だ。制作パイプラインを持つスタジオが、映像素材の背後にある決定——どのテイクか、どの参照か、どのリビジョンか——を所有することは、事前学習の実行を所有することよりも価値があると論じている。その主張は検証可能であり、2027年のラインナップの興行収入はその検証の一つである。