比較用のタイトルカード。上部に「Grok Imagine Video 1.5 Lite vs Grok Imagine Video」、その下の行に「1分あたり$6.60で52 Elo」と「$8.40/分 vs $15.00/分」を表示し、2つのフラットなアウトラインのカード形状が仕切りで分割されている。
Guides & Insights

Grok Imagine Video 1.5 Lite 対 Grok Imagine Video:1分6ドルで52 Elo

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これが結論を一文で言い切ったものです。G​rok Imagine Video 1.5 Lite は1分あたり8.40ドルで、Artificial Analysis の AA-Video-T2V v2.0 ボードで Elo 993 を獲得しています。G​rok Imagine Video 1.5 は1分あたり15.00ドルで、Elo 1045 です。同じファミリー、同じインターフェース、同じ1~15秒のクリップ長、同じ7つのアスペクト比——そして1分あたり6.60ドルの差が、52ポイントの選好スコアと、どちらの見出し数値にも現れない1つの隠れた違いをもたらします。G​rok Imagine Video 1.5 はオリジナルです。x​AI の高速生成モデルで、2026年1月29日に初リリースされ、2026年6月16日からバージョン1.5で安定しており、ネイティブ音声とネイティブ1080pを備えています。G​rok Imagine Video 1.5 Lite は蒸留された兄弟モデルで、ボード上では2026年8月付け、設計上より高速で安価です。このページが答える問いは、どちらのモデルが優れているかではありません——それはすでにボードが決めています——そうではなく、あなたの出力に実際に必要なのはどちらかです。

価格表が隠している唯一の違い

箇条書きの前に、Eloの差よりも多くの実際の導入を左右する一文がある。G​rok Imagine Video 1.5 Liteでは、1080p出力は720pでレンダリングされ、アップスケールされる。G​rok Imagine Video 1.5では、1080pは1080pです。

それがすべてだ。Lite のクリップは、1080p で要求されても、720p レンダーにアップスケール処理を重ねたものになる。スマホのフィード上では、SNS 向けビットレートで、どうせ差を潰してしまう圧縮工程を経るなら、これは見えない。しかし、そのクリップがクロップ、キーイング、コンポジット、リフレーム、グレーディングを行うパイプラインに入った瞬間、失われたディテールは編集者が最初に気づくものであり、最後まで修正できないものでもある。フルモデルにはこの問題がなく、それが1分あたりの価格がほぼ2倍である主な理由だ。

次元ごとに

• 価格 — Grok Imagine Video 1.5 は1080pのデフォルト設定で毎分15.00ドル、Grok Imagine Video 1.5 Lite は毎分8.40ドル(いずれも Artificial Analysis による見積もり)。フルモデルで公表されている秒単位の料金は、480pで0.096ドル、720pで0.168ドル、1080pで0.300ドル、さらに画像入力1件につき0.05ドル。

• ボード順位 — 音声付き AA-Video-T2V v2.0 ボード上で、フルモデルが Elo 1045 で #11 なのに対し、Lite は Elo 993 で #17。Lite の区間は 983 から 1003 で、±10 の幅であり、7 行上にある親の位置とは重ならない。

• 実効解像度 — ネイティブ1080p と、1080pコンテナにアップスケールされた720pレンダーの対比。このリストで最も影響が大きい行。

• クリップの長さ — どちらも1~15秒(整数秒)。チャットインターフェースでは、フルモデルのデフォルトは10秒です。より長い時間が使えるのはAPIです。

• アスペクト比 — どちらも同じ7種類:16:9、9:16、1:1、4:3、3:4、3:2、2:3。

• 音声 — フル版の G​rok Imagine Video 1.5 は、セリフ、効果音、音楽を含むネイティブ音声を搭載しています。Lite 自身の掲載情報には音声チャンネルが別途記載されておらず、発表ではボードの音声なしバリアントにも位置づけられているため、サウンドトラックが成果物にとって不可欠なのであれば、コミットする前に Lite で確認してください。

• 入力と条件付け — ファミリーAPIは先頭フレーム画像と追加の参照画像を受け取り、フルモデルはキャラクターの一貫性のために最大7枚の画像からの参照条件付き生成向けに文書化されています。Liteの掲載内容では、テキストから動画および画像から動画への対応が説明されています。

• 成熟度 — フルモデルは2026年6月16日以降、1.5で安定しており、ローンチ時にArtificial Analysisアリーナのテキストto動画と画像to動画の両方で首位に立ち、LMArenaの画像to動画部門で約1,400 Eloの1位を維持しています。Liteは2026年8月のボード掲載予定で、そのスコアの背景には5,715件のブラインド比較があります。

A two-column scoreboard comparing Grok Imagine Video 1.5 Lite ($8.40/min, rank #17, Elo 993, 720p upscaled to 1080p, 1–15 second clips, audio not documented) with Grok Imagine Video 1.5 ($15.00/min, rank #11, Elo 1045, native 1080p, 1–15 second clips, native audio), with a footer separating the Artificial Analysis figures from the vendor-reported details.

法案、解決済み

抽象的な分単位の料金設定は行動に移しにくいので、実際のブリーフに照らし合わせて考えてみましょう。たとえば、1か月に完成済みの10秒クリップが20本必要だとします。

• Grok Imagine Video 1.5 Liteでは毎分$8.40なので、10秒はその6分の1、つまり生成クリップ1本あたり$1.40です。20本なら月$28.00、リトライは別です。

• G​rok Imagine Video 1.5では、1分あたり$15.00で、同じ10秒なら$2.50、20クリップなら月額$50.00です。

その差は月額22ドル、年間にすればおよそ264ドルで、年に150本ほどのクリップに対する金額です。

安いティアが逆方向の丸め誤差のように見えてしまう数字であり、率直に言う価値がある。このボリュームでは、価格差はLiteを選ぶ理由ではない。Liteを選ぶ理由は反復の速さだ。Liteがより速くドラフトを返すなら、上の20本のクリップは実際には60回か80回の生成であり、その3分の2は捨てられる。同じ$22の計算は、本当に違う1か月になる。秒あたりの価格は目に見えるレバーであり、生成あたりの実時間こそが請求額を動かすレバーだ。

これは、選択を価格の問題ではなくワークフローの問題として捉え直すものです。フェイルオーバーは、より安価な兄弟モデルのもう1つの実用的な用途です。一次パスをLiteにルーティングし、残すものだけをフル品質で再実行するのは、リクエストが指定するモデルを変える2行の変更であり、納品日をその答えに賭けることなく、Liteが自分のコンテンツに十分かどうかを知る最も安価な方法です。どちらのモデルもOrcaRouterでは提供していません — 当社はG​rok Imagine Video 1.5もG​rok Imagine Video 1.5 Liteもホストしておらず、どちらもベンダー自身のAPIおよびいくつかのサードパーティプラットフォームを通じて利用できます — しかし、何を生成するかを決め、プロンプトを書き、出力を保存する層はテキスト作業であり、テキスト作業こそOrcaRouterがカバーするものです:200以上のモデルに対応する単一のAPI(プロバイダー定価、マークアップ0%)、自動フェイルオーバー、および複数のモデルを1回の呼び出しに組み合わせるルーティングDSL。

安価なモデルが誤った選択となるのはどんなときか

その失敗モードは具体的で、名付ける価値がある。なぜなら、誰でも簡単に陥ってしまうからだ。チームはコストのために Lite を採用し、その上に1か月分の作業を積み上げ、最初の成果物の時点で、1080p の映像がクロップに耐えないことに気づく。

Lite は、クリップの送り先がフィード、ストーリー、ソーシャル投稿、社内レビューなど、出力が生成時のサイズで視聴される場面に適したモデルです。反復作業中で、採用するものもいずれフル品質で再生成される場合に適したモデルです。量が多く、重要な制約が単価コストである場合に適したモデルです。

クリップが異なるアスペクト比でより長い尺に切り出される場合、コンポジターがマットやキーを抜く場合、フッテージがグレーディングされる場合、あるいは納品物に契約に付随する解像度仕様が付いている場合、それは誤ったモデルです。そうしたケースではいずれも、節約した1分6.60ドルは、誰かがすべてを再生成しなければならなくなる時点で支払いに回され、Eloの差は問題ではありません。

A capture of the LMArena text-to-video leaderboard showing grok-imagine-video-1.5-720p in seventh place, behind wan-3.0-720p-audio, gemini-omni-flash, flux-3-video-20260811 and dreamina-seedance-2.5-720p.

ボードを正直に読む

上記の数値には2つの注意点があります。1つ目はアリーナスコアにいつも付きまとう注意点です。993と1045はブラインドのペアワイズ嗜好投票であり、クリップが依頼内容に合っているかを測る指標ではありません。モデルは色で投票に勝ち、ショットでは負けることがあります。2つ目はこの組み合わせに固有のもので、両モデルの差は、読者が距離ではなく順序として扱うべきほど小さいものです。52 Elo は、Lite が親モデルとの比較で勝つより負ける方が多いという意味です。Lite があなたのショットで5%劣るという意味ではありませんし、たまたま依頼内容を見事に捉えた Lite のクリップが、それを外したフルモデルのクリップより劣るなどという意味では決してありません。

ボードが確かに示すのは、トレードオフの方向と大きさだ。Liteは表のその帯域で最安のモデルでも最高のモデルでもない。PixVerse V6はその1行下にElo 985、1分6.90ドルで位置し、Kling 3.0 1080p(Pro)はその1行上にElo 1000、10.08ドルで位置する。異例なのは、自身の親モデルとの差だ——44%オフで52 Eloというのは、フラッグシップの1段下のティアの割引が通常犠牲にする品質よりも小さく、その比率こそが発表におけるフロンティア主張の根拠になっている。また、それが、これがマーケティング上のティアではなく本当の選択肢である理由でもある。

A capture of the OrcaRouter models page, showing the model catalogue with vendor groupings and model entries.

出力でいうと、どちらですか。

クリップが生成されるその場——ソーシャル、モバイル、レビュー、イテレーション——で視聴されるなら、Grok Imagine Video 1.5 Lite はまず始めるべきバージョンであり、1分あたり8.40ドルという料金は、100回の実験が完成品20本より安くつくことを意味します。生き残ったものが昇格するようなら、それらをフルモデルで再生成しましょう。

クリップが視聴用ではなく完成品になっている場合 — クロップ、キーイング、グレーディング、仕様どおりの納品まで済んでいる場合 — は、Lite を完全に飛ばして $15.00 を支払ってください。Grok Imagine Video 1.5 は、2つの中でネイティブ 1080p を返す唯一のモデルであり、再生成が必要な納品物があれば、1秒あたりで節約したコストがどれほどあっても無意味です。

ほとんど誰も、両方を同時に必要とはしない。大量に生成する人は皆、結局は両方を使うことになる。その順番は——Lite でカットを見つけ、フルモデルでそれを残す、という流れだ。