Odyssey-3 vs Grok Imagine Video のタイトルカード。左パネルは「Odyssey-3」という見出しで、インタラクティブ環境、公開価格なし、832x480 または 1280x720 Pro、音声なしと記載;右パネルは「Grok Imagine Video」という見出しで、xAI Imagine API、秒単位の従量課金、あなたが制作するクリップ、バージョン1.5 でネイティブ 1080p、Physics-IQ -4.04 pp、13位と記載。
Guides & Insights

Odyssey-3 対 Grok Imagine Video:従量課金制の動画API 対 価格未定のシミュレーター

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok Imagine Videoには価格表があるが、それを操作する方法はない。Odysseyが2026年10月8日に公開研究プレビューとして公開したOdyssey-3には、操作する方法があるが、価格表はまったくない。どのベンチマークの行よりも、この非対称性こそがこの対決の本当の姿だ。xAIは生成動画を秒単位で販売し、すべての解像度について公表価格を設けている。一方、Odyssey-3はブラウザで操作できるインタラクティブなワールドモデルとして提供され、まだ購入することはできない。このうち一方は今日の午後にも製品に組み込める。もう一方は評価することしかできない。

彼らはまた、動画生成が何のためのものかについても意見を異にしており、その不一致はベンダーのページにはっきりと表れている。G​rok Imagine Videoのドキュメントは、参照画像、ピン留めされたフレーム、リップシンクされた音声、音声参照を前面に押し出している——制作管理の語彙だ。Odyssey-3が前面に出すのは、その中を移動したりイベントをトリガーしたりすると次に何が起こるかを予測する環境だ。どちらも動画を出力する拡散ベースの生成器だ。その一文を除けば、ほとんど重なりはない。

それぞれが何か

Odyssey-3は自己回帰拡散トランスフォーマーです。Odysseyは、教師強制と因果マスキングによって自己回帰的に拡張された多段階動画拡散モデルだと説明しており、先行する観測から継続して、行動入力に条件付けられた将来状態を予測し、その後、分布マッチングと敵対的蒸留によって蒸留され、リアルタイム相互作用が可能な少数ステップ変種になります。832×480で動作し、Odyssey-3 Proは1280×720で、公開プレビューでは一人称ナビゲーション、三人称ナビゲーション、独立したカメラ移動が利用できます。音声はありません。

Grok Imagine Videoは、Imagine APIにおけるxAIの動画モデルです。現在の世代はGrok Imagine Video 1.5で、xAIのリリースノートには、テキストから動画、画像から動画、参照から動画をサポートし、最初の2つではオプションのプリセット音声とネイティブ1080pに対応すると記載されています。なお、テキストから動画は内部的にはテキストから画像を生成した後に画像から動画を生成する形で実装されています。最大14枚の参照画像と3つの音声参照を受け付け、固定フレームとリップシンク音声をサポートし、生成出力の1秒単位で課金されます。以前のgrok-imagine-videoは、現在もドキュメントに記載され、価格も設定されていますが、480pでは毎秒$0.05、720pでは毎秒$0.07で、入力動画は毎秒$0.01、入力画像は$0.002で課金されます。

料金表、つまり実際に計画を立てる際に頼りにできる部分です

xAI's Grok API documentation page for grok-imagine-video, read 9 October 2026, showing the model header with a “Latest” badge, an at-a-glance table listing modalities as text, image and video under the heading “Text > Video”, a pricing heading, and release notes tabs, with the navigation marked “APIs / Grok / Build”.

• 価格 — G​rok Imagine Video は秒単位で課金されます。オリジナルモデルでは 480p が $0.05/秒、720p が $0.07/秒、G​rok Imagine Video 1.5 は 480p、720p、1080p を通じて $0.08/秒からです。G​rok Imagine Video 1.5 Lite は最大 1080p・15 秒までで $0.02/秒からです。Odyssey-3 には公表価格が一切なく、唯一の公開コスト数値はリーダーボードによる正規化推定値で、Odyssey-3 は生成動画あたり $0.139、Odyssey-3 Pro は $0.267 です。

• 10秒のクリップを計算すると — Grok Imagine Videoでは480pで0.50ドル、720pで0.70ドル。Grok Imagine Video 1.5では0.80ドル。Liteティアでは0.20ドル。Odyssey-3はこの方法では価格を出せません。その10秒分を購入することができないからです。

• 解像度 — G​rok Imagine Video 1.5 はテキストから動画と画像から動画でネイティブ 1080p に対応。Odyssey-3 は Pro ティアで最大 1280×720 です。

• 再生時間 — G​rok Imagine Video 1.5 Lite は15秒に達する。Odyssey-3 の単位はクリップではなくセッションであり、プレビューが予測の一貫性を保ち続けられる時間によって区切られる。

• 音声 — Grok Imagine Video はリップシンクした音声を生成し、音声参照を受け付けます。Odyssey-3 は生成しません。

• 制御 — 参照画像、固定フレーム、最初と最後のフレーム、音声参照。これらはすべて生成前に指定される。これに対し、生成中のライブナビゲーションと生成途中のイベント。G​rokのはオーサリング、Odyssey-3のはインタラクション。

• 提供状況 — Grok Imagine Video 向けのセルフサービス API キーを本日提供。Odyssey-3 向けの問い合わせフォームとブラウザプレビュー。

物理演算がそれらを配置する場所

Physics-IQ Verifiedは、Anates LabsとDeepMindによるベンチマークで、実際の物理実験の続きを採点するものであり、現在41のモデルをランク付けしている。そしてこの2つはどちらもそこに含まれている——つまりここは、両者を比較できる唯一のサードパーティ製の場である。

• Grok Imagine Video — 13位、トラック平均に対する純改善幅は −4.04 pp、ベンチマーク自体のプロンプト使用時、24 fps、動画あたりの正規化コスト $0.352。

• Odyssey-3 — 同じプロンプトセットでは8位(+2.15 pp、$0.129)、カスタムプロンプトでは3位(+9.99 pp)。

その差は小さくなく、解像度によるアーティファクトでもない。このボードは、入力が許す場合にはコストを24 fpsかつ幅1280の出力に正規化しており、行ごとにプロンプト方式も示している。負の純改善スコアは、G​rok Imagine Video が悪い動画を生成するという意味ではない——明らかにそうではなく、使いやすい価格で実運用されている。これは、物理実験を正しく継続するという特定のタスクにおいて、同モデルがこのボード上の平均的モデルより成績が悪い一方、Odyssey-3 は2つの異なるプロンプト方式の下で、このボード上の平均的モデルを二度とも上回っている、という意味である。

Odyssey-3 自身の目玉の主張はさらに強力だ。Odyssey-3 Pro の video-to-video トラックでは 66.1 で、これは Odyssey が報告する最高スコアであり、同じティアの image-to-video ではさらに 54.7 を記録している。これらは独立した実行ではなく Odyssey の記述から来ており、そのように読むべきである。

Two-column scoreboard headed “Odyssey-3 vs Grok Imagine Video — the scoreboard” with six shared dimension labels. Odyssey-3: published price none; 832x480, 1280x720 Pro; a session, not a clip; no audio; Physics-IQ board prompts +2.15 pp rank 08; custom prompts +9.99 pp rank 03. Grok Imagine Video: $0.05/sec at 480p and $0.07/sec at 720p; native 1080p on version 1.5; up to 15 seconds on the Lite tier; lip-synced speech and voice references; Physics-IQ -4.04 pp rank 13; no custom-prompt entry. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Grok Imagine Video rates per xAI documentation; Physics-IQ Verified board read Oct 9 2026”.

価格表がカバーしていないもの

秒単位の料金の背後には、名前をつける価値のある範疇の違いが隠れている。それが、これらのうちどちらを選ぶべきかを決めるからだ。

G​rok Imagine Videoの課金モデル — 出力1秒あたりのドル — は、スループットに関する約束だ。1ドルごとに決まった分量の完成動画が買え、唯一の問いは、リップシンク付き1080pの15秒が1.20ドルに見合うかどうかである。広告ユニット、ソーシャルテンプレート、マーケティングパイプラインにとって、それは明快な答えの得られる絶好の問いであり、$0.02/秒のLiteティアは、たいていの場合その答えを簡単にしてくれる。

Odyssey-3はそのようには課金されておらず、そのようには課金できません。その出力が固定量ではないからです。インタラクティブな環境は、その中に人がどれだけ長く留まるか、何度心変わりするかによって消費されるため、秒単位のモデルは無意味になります。Odysseyが価格を公表するとき——それがいつになるかを示す兆しはありませんが——それはセッション価格、コンピュート価格、あるいはこのカテゴリ向けにまだ発明されていない何かでなければならないでしょう。それはOdyssey-3に反対する論拠ではありません。それこそが、開発者が現時点でこの2つを比較し終えることを不可能にしている理由です。

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

今日、従量制のものに到達する

G​rok Imagine Videoはx​AI自身のAPIであり、OrcaRouterはそれをホストしていません。Odyssey-3は、当社が確認できるいかなるホスト型プラットフォーム上にも存在せず、たとえ存在したとしても、誰かがルーティングするための公開された料金はありません。

1つのOrcaRouterキーで到達できるのは、この比較の土台として構築する動画・モデルスタックの残りの部分です。768P出力1秒あたり$0.08のMiniMax-H3、K​lingの動画ラインナップ、そして単一エンドポイントの背後に200以上のモデルをプロバイダの定価・マークアップ0%で——つまり、ラボが秒単位の料金を引き下げれば、次回の契約更新時ではなくその日のうちにあなたの利用状況へ反映されます。プロバイダ間の自動フェイルオーバーにより、複数の動画モデルを混在させたバッチが、ある上流の不調な1時間で失敗するのを防ぎます。さらにルーティングDSLを使えば、ホスト型の動画モデルとテキストまたはビジョンモデルを1つのインターフェースの背後に置けます。これは、生成してから評価するパイプラインにまさに必要なことです。Odyssey-3もG​rok Imagine Videoも、現時点でそのカタログには含まれていません。

どっちが欲しい?

音声付きの動画出力を1080pで、表計算ソフトに載せられる価格で必要で、しかも今週中にそれが要るなら、G​rok Imagine Videoは使える答えであり、Odyssey-3は候補になりません——音声がなく、解像度の上限も低く、購入する方法もないからです。

もし、アクションの後に何が起こるかを予測する必要があるもの——ポリシー、制御ループ、トレーニング環境——を構築しているなら、価格表は無関係であり、物理ボードは無関係ではない。Odyssey-3 はまさにその能力で評価されており、ボードの上位に近い。G​rok Imagine Video は、完成したショットを生み出すことにかけては優れているが、同じテストではトラック平均を下回っている。問いが異なれば、答えが重なることはない。