Groo Imagine Video 1.5 Liteのローンチ用タイトルカード。モデル名を「AA-Video-T2V v2.0リーダーボードで17位」と「Elo 993・$8.40/分」の行の上に置き、テキストの背後にフラットな線画の棒グラフを配したもの。
Guides & Insights

Grok Imagine Video 1.5 Lite、Artificial Analysis Video Boardで初登場17位——親モデルよりEloで52ポイント低いが44%低コスト

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok Imagine Video 1.5 Liteを正当化する数字は2つあり、しかもどちらもローンチ時の告知が最初に持ち出す数字ではありません。Artificial AnalysisのAA-Video-T2V v2.0ボードで、新しいGrok Imagine Video 1.5 Liteは17位、Elo 993(±10、5,715サンプル)に掲載され、1分あたり8.40ドル(1080pのデフォルト設定時)と記載されています。その親モデルであるGrok Imagine Video 1.5は7行上、11位 — Elo 1045、1分あたり15.00ドルです。これは1分あたり6.60ドルで52 Eloという差であり、動画生成においては異例のトレードオフです。通常、フラッグシップの下位ティアはフラッグシップとほぼ同じ価格で、できることが少ないだけだからです。Grok Imagine Video 1.5 Liteはそうではありません。実際に割引が適用された蒸留モデルであり、その割引こそがこの話の核心です。

何が届いたのか、そしてそれはいつなのか

G​rok Imagine Video 1.5 Lite is S​paceXAI's cheaper, faster cut of G​rok Imagine Video 1.5, and it is a distinct model with its own listing rather than a cheaper serving tier of the same weights. The interface has not changed: it takes text-to-video and image-to-video requests, 1-to-15-second durations in whole seconds, the seven aspect ratios the family supports (16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3), a first-frame image and additional reference images, and a callback URL for asynchronous completion. Generation is a two-step protocol — POST a request, get a job id and a polling URL back with a 202, then poll until the status flips to done and pull the bytes from a content endpoint. Failed generations are not billed.

タイミングは、このランキングをどう読むかに影響する。Artificial Analysisはこのモデルを2026年8月と日付付けしているが、ボードへの登録自体はもっと新しく、それをボードに載せた発表こそが、これを夏の脚注ではなく今週の話題にしている。モデルはひっそりとリリースされ、後になってニュースになることがある。独立系ボードがそれを位置づけるのに十分なブラインド比較をようやく得たときだ——今回の場合は5,715件のサンプルで、動画ボードとしてはかなりの規模のパネルである。

ボードが2枚、そのうち1枚は検証済み

The announcement states that G​rok Imagine Video 1.5 Lite lands 17th on both the with-audio and the no-audio variants of the AA-Video-T2V v2.0 board, and that it takes a position on the board's quality-versus-price frontier. Of those claims we could confirm the with-audio row directly from the published leaderboard: rank 17, Elo 993, a 95% interval of 983 to 1003, price $8.40 per minute, credited to S​paceXAI. The no-audio placement and the frontier framing come from the announcement itself and we have not reproduced them independently.

ここで「パレートフロンティア」という言葉が読者に何をもたらすのかを正確に述べておく価値がある。なぜなら、この表現はあちこちで軽々しく使われるからだ。品質対価格のグラフでは、他に、より優れていて同時により安いものが存在しないとき、そのモデルはフロンティア上にある。G​rok Imagine Video 1.5 LiteはElo 993、1分あたり$8.40で、複数のモデルがひしめく一帯で競合している。PixVerse V6はElo 985、$6.90で1行下に位置し、Kling 3.0 1080p (Pro)はElo 1000、$10.08で1行上に位置する。興味深い主張は、Liteがそれらのどれか一つを上回るということではなく、この価格で上位のモデルに十分近く、その席に値するということだ。

A single-column scoreboard for Grok Imagine Video 1.5 Lite listing board rank #17 of 29, Elo 993 (±10), $8.40 per minute, 1–15 second clip length, 720p upscaled to 1080p resolution, and audio not documented, with a footer noting which figures come from Artificial Analysis and which are vendor-reported.

割引はどこから来たのか

Liteには3つの安い点があり、そのうち価格表に現れるのは1つだけです。

1つ目は、掲載ページがずばり明記している数字です:1080p出力は720pでレンダリングされ、アップスケールされます。これはそのモデル自身の説明文の中で最も有用な一文であり、価格表をざっと見る購入者が見落としてしまう一文でもあります。1080pでリクエストされたLiteクリップは、720pでレンダリングされたものを1080pの解像度まで引き上げたものです。SNS向けの納品では、それは多くの場合気づかれません。グレーディング、クロップ、キー合成が行われる用途では、それは映像そのものと映像の近似値との違いであり、1分あたりの価格が親モデルの56%に収まり得る理由でもあります。

2つ目は蒸留です。Liteは、G​rok Imagine Video 1.5から蒸留された、より高速で安価な動画生成だと説明されています——小型言語モデルが、模倣するために訓練された大規模モデルに対して持つ関係と同じです。蒸留はレイテンシとコストを手に入れる代わりに、少しの品質を返上します。まさにそれがこの表に示されているとおりで、Eloにして52です。

第三は、ボードには見えないものだ。蒸留された動画モデルは、総合的な嗜好投票で単に精度が低いだけではない。多くの場合、エッジ——長いプロンプト、珍しいカメラの動き、フルバージョンがより広くサポートしている参照画像による条件付け——での信頼性が低い。ブラインドのペア比較投票は、そうした失敗を平均化して単一のEloに押し込めてしまい、単一のEloは、あなたが必要とする特定のショットが出力されるかどうかを予測するには乏しい指標でしかない。

A capture of the xAI documentation models page, listing the Grok model line and its capability notes.

数字が立証しないもの

993は好みのスコアであり、忠実度のスコアではない。パネルは、どのモデルが生成したかを知らないままクリップ間で投票した。そのためこれは、人がどのクリップを好むかを測る強力な指標であり、クリップがブリーフに合致しているかどうかを測る弱い指標である。モデルはより美しい色合いで票を獲得しながら、依頼されたショットを逃すことがある。

一方、価格は、明示された解像度とデフォルト設定における1分あたりの料金として提示される。どちらかを変えれば比較は変わる。下位ティアに落とせば秒あたりの料金は下がり、クリップを延長すれば合計は上がる。単一の1分あたりの数字で予算を組む人は、自分のワークロードではなく、デフォルトで予算を組んでいることになる。

そして、アリーナの外で G​rok Imagine Video 1.5 Lite を第三者評価したものは存在しない——公開されたプロンプトスイートも、再現可能な品質評価ハーネスも、独立したレイテンシベンチマークもない。Elo だけが独立した数値だ。モデルに関するそれ以外のすべては、解像度の挙動も含め、ベンダーから提供されたものだ。

A capture of the LMArena text-to-video leaderboard showing grok-imagine-video-1.5-720p in seventh place among models including wan-3.0-720p-audio, gemini-omni-flash and flux-3-video-20260811.

実際に切り替えるべきなのは誰か

この判断は、ローンチ時の見せ方が示唆するよりも選択の幅が狭い。もしあなたの出力が1080p以下の短尺ソーシャル動画で、予算が決定的な制約になっているなら、Liteの1分あたり$8.40は、フルモデルの$15.00と比べて、ほぼ無料のアップグレードに近い。ファミリーのインターフェース、その尺、参照画像入力を維持したまま、ほとんどの視聴者が気づくことのない選好スコアの数パーセントを犠牲にするだけだ。

出力が最終的にグレーディング、クロップ、コンポジット、納品仕様のいずれかになるなら、アップスケールされた1080pのディテールは失格要因となり、このファミリーで求めるべきモデルは依然としてフルの G​rok Imagine Video 1.5 です。

どちらを先に試すべきかというご質問であれば、それはコミットメントの問題ではなくフェイルオーバーの問題です。どちらのモデルも OrcaRouter では提供していません — Grok Imagine Video 1.5 も Grok Imagine Video 1.5 Lite も当社がホストしているわけではなく、どちらもベンダー自身の API および複数のサードパーティ製プラットフォームを通じてアクセスするものです。ルーターが担うのは、その周辺のレイヤーです。プロンプトの書き換え、ショットリストの生成、キャプションとメタデータの処理、そしてどのクリップを残すかを決めるモデル呼び出しです。そのレイヤーは OrcaRouter 上で200 以上のモデルをプロバイダー定価・マークアップ 0% でカバーする単一の APIとして動作し、プロバイダー間の自動フェイルオーバーとルーティング DSLを備えており、複数のモデルを 1 回の呼び出しに組み合わせることができます。動画の秒単位の料金がこの請求に影響することは決してなく、まさにそのため、ルーティングの判断がそれ自体で元を取れるのはテキスト側なのです。

次に見るもの

未解決の疑問に決着をつけるものは2つある。1つ目は音声なしボードでの順位であり、これにより音声チャンネルを取り除いたときにLiteの順位が維持されるかどうかが確認できる——そこでの親モデルとの差が急激に広がるなら、LiteのEloを支えているのは映像よりも音声トラックのほうが大きいということになる。2つ目は、アップスケールされた1080p出力に関する何らかの独立した評価だ。というのも、1分8.40ドルの動画モデルの価値提案のすべては、720pレンダーを1080pに持ち上げたものが、それが売り込まれている配信パイプラインを通過できるかどうかにかかっているからだ。

それまでは、正直な要約は限定的なものになる。Grok Imagine Video 1.5 Lite は、誰かが測定した中で Grok Imagine Video ファミリーに最も安く入れる方法であり、その代わりに 52 Elo を犠牲にし、ネイティブ 1080p の細部も犠牲にしている——ソーシャル優先のチームのほとんどが取るべきで、映像を仕上げる人は取るべきでないトレードオフだ。