「フロンティア研究 vs 本番運用」と題された生成タイムラインインフォグラフィック。Google Veo 3.1 の GA 2025-11-17 のマーカーには「本番運用から10か月」、Odyssey-3 の 2026-09-15 プレビュー時点のマーカーには「価格なし、日付なし」とキャプションが付き、さらに Veo 3.1(ネイティブ4K、48kHz音声はオプション、1秒あたり約$0.20~$0.40)と Odyssey-3(状態をシミュレート、ハードウェアを駆動、価格未公表)の概要行がある。
Guides & Insights

Odyssey-3対Google Veo 3.1:最先端の物理演算と10ヶ月の制作期間

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Odyssey-3 と Veo 3.1 の比較は、実際には二つの日付の比較だ。Veo 3.1 は 2025年11月17日から一般提供されており、10か月間の本番利用、公開された秒単位の料金、ネイティブ4K、そして少なくとも一度はエンタープライズレビューを通過したサービングスタックを備えている。Odyssey-3 は Odyssey によって 2026年9月15日にプレビューされ、公開価格もなく、APIドキュメントもなく、独立したベンチマークもなく、リリース時期は「今後数週間」だ。それでも両者を並べて比較する価値はある。両者が一緒に言及される理由は実際に存在するからだ。Veo 3.1 は美しい動画をレンダリングし、Odyssey-3 は制御下で正しく振る舞う世界をシミュレートしようとしている。これらはチームが「動画」という言葉の下で混同し続けている二つの異なる製品であり、そして両者の間のギャップこそが、購買判断の分かれ目なのだ。

10か月間の出荷がもたらすもの

Veo 3.1の強みは機能ではなく、積み重ねられた時間にある。このモデルは、2025年10月からプレビューとして、11月17日からはGA製品として有料顧客の手に渡っており、2026年3月31日にはLiteティア、4月2日には無料ティアが追加された。その歴史は、プレビューでは生み出せないものを生む。文書化されたAPIサーフェス、実務家がすでに把握している確立された障害モード群、そして財務チームがモデル化できるコスト曲線である。

仕様表も同じ成熟度を反映している。Veo 3.1は720p、1080p、ネイティブ4Kで、毎秒24フレーム、4秒、6秒、8秒のネイティブ尺で生成し、より長い出力は1080pで報告され、それを超えるシーン拡張チェーンにも対応する。キャラクターとシーンの一貫性のために最大3枚の参照画像を受け付け、さらにシードとネガティブプロンプトの制御を備える。出力にはSynthIDとC2PAの来歴メタデータが含まれる。ブランド、放送、大画面の仕事にとって、ネイティブ4Kの経路は、競合の大半が単純に持っていない唯一の能力であり、Veo 3.1が価格では勝てないプロジェクトで勝ち続ける理由でもある。

A generated two-column scoreboard for Odyssey-3 vs Google Veo 3.1 sharing six dimension labels: output, max resolution, clip length, audio, price, availability. Odyssey-3 reads world state + actions, not a renderer, continuous rollout, none, not published, preview only. Google Veo 3.1 reads rendered clip, native 4K, 4/6/8s native, 48kHz stereo off by default, ~$0.20/s silent and ~$0.40/s with audio, GA 2025-11-17. Footer: "Odyssey-3 vendor-reported and unreleased; Veo 3.1 figures per Google's published rates."

あらゆる比較を静かに歪めるオーディオのデフォルト

Veo 3.1 はネイティブの48kHzステレオ音声——会話、環境音、フォーリー——を映像と同時に生成し、これは本当にその最も強力な特徴の一つです。しかし API 上では、audio パラメータはデフォルトでオフになっており、無音生成は音声付き生成より安く価格設定されています。Google が公開している Standard ティアでは、無音なら毎秒約 $0.20、音声付きなら毎秒約 $0.40 となります。そこから二つの帰結が生じます。第一に、Veo クリップの実効価格は、ほとんどの人が決して変えないフラグに完全に依存するため、「毎秒 $0.20」という数字と「毎秒 $0.40」という数字が同じモデルに対してどちらも正しいということになり得ます。第二に、より微妙な点として、あなたが読んだ多くの直接比較テストは、無音の Veo 3.1 を、音声が常にオンの競合と対戦させ、その後、音声を考慮したリーダーボードで採点していたということです。出力に音声が必要なら、計画の基準にすべき正直な数字は、音声を有効にした場合のものです。

Odyssey-3 が実際に主張していること

Odyssey-3はより優れた動画生成ツールではなく、そう主張しているわけでもない。これは世界の視覚的観察に基づいて訓練された自己回帰拡散トランスフォーマーであり、発表の中心にある能力はアクションデコーダー、つまり「世界モデルに付随する学習済み出力コンポーネント」で、モデルの内部シーン表現を特定のハードウェア向けのモーターコマンドに変換する。Odysseyの報告では、数十時間のデモンストレーションからロボットアームを制御し、Flexionで構築されたヒューマノイドポリシーをリアルタイムで駆動し、20時間のシミュレーションデータで訓練された凍結バックボーンから閉ループの運転ウェイポイントを生成し、屋内で障害物を避けてドローンを飛行させ、Grand Theft Auto Vをプレイし、それらのゲームでは追加のポリシー訓練なしにRed Dead Redemption 2やSleeping Dogsへ転移させている。公表された唯一の比較数値は、シミュレーションで訓練された運転ポリシーが、安全ドライバーによる介入と介入の間に走行した距離が、実写映像で訓練されたポリシーの約77%だったというものだ。

それらがどの種類の主張なのかに注目してほしい。どれも出力がどう見えるかについてではない。すべて、モデルの下流にあるプログラムがそれを使って何ができるかについてだ。

重複しないディメンション

出力 — Google Veo 3.1:レンダリングされたクリップ。最大ネイティブ4Kまで対応し、オプションで48kHzステレオ音声も利用可能。Odyssey-3:シミュレートされた世界状態に加え、アクションデコーダーを介したモーターアクション。

コンシューマー — Google Veo 3.1:視聴者または編集者。Odyssey-3:ロボットコントローラー、運転ポリシー、またはトレーニングループ。

クリップ長 — Google Veo 3.1:ネイティブで4/6/8秒、1080pではより長く、延長チェーンでさらにその先も可能。Odyssey-3:連続ロールアウトで、クリップという概念なし。

価格 — Google Veo 3.1:無音で約$0.20/秒、Standardで音声付き約$0.40/秒、FastおよびLiteティアはそれより低価格。Odyssey-3:公開情報なし。

提供状況 — Google Veo 3.1: 2025-11-17よりGA(一般提供)。Odyssey-3: 2026-09-15にプレビュー公開、一般提供は「数週間以内」。

根拠 — Google Veo 3.1:10か月にわたる制作現場での使用実績と、独立系リーダーボードでの評価。Odyssey-3:ベンダーによるデモのみで、ベンチマーク表もテクニカルレポートもなし。

物理学の主張が実際に成果を上げる場面 — そしてそうでない場面

より優れた物理演算を持つモデルがより良い動画を生み出すと想定したくなるが、Odysseyが売りにしているのはそれではない。動画制作チームの問題は、クリップ内の世界が物理的に矛盾していることなどほとんどなく、むしろショットが4Kである必要があるとか、キャラクターが3つの異なるセットアップで同じに見える必要があるとか、納品物に法務が承認する前に来歴メタデータを添付する必要がある、といったことだ。Veo 3.1は今日それらの問いに答える。物理的に正確なシミュレーターは別の問いに答える:ここで訓練した何かが外の世界で機能するかどうか。何も訓練していないなら、Odyssey-3の物理的な正確さは、あなたのワークフローに買い手のいない機能である。

両者が真に重なるのはプリビジュアライゼーションだ。空間をインタラクティブに探索したい監督 — セットの中をカメラで歩き、ブロッキングの選択を変え、その結果を見る — が求めているのは、まさにワールドモデルが提供するものであり、レンダリングされたクリップにはできないことだ。なぜならクリップは生成された瞬間に固定されるからだ。これは実際のユースケースであり、未公開のプレビューがまだ選択肢にならないケースでもある。

単一のエンドポイントに賭けることなく、これを本番環境で実行する

制作チームがモデルを取り巻くアーキテクチャを気にかけるのは、動画パイプラインが1回の呼び出しで済むことはめったにないからだ。プロンプトモデルがショットリストの下書きを作り、画像モデルが開始フレームを生成し、ビジョンモデルが結果をブリーフと照合し、文字起こしモデルがナレーションを担当する。これらはいずれも午前2時に障害を起こしうる依存関係であり、個別に購入すればそれぞれが別々の統合になる。そのレイヤーをプロバイダー定価でマークアップ0%、200以上のモデルを横断する単一のAPIに載せれば統合が集約され、自動フェイルオーバーがあれば、プロンプトモデルの障害時にはレンダーキューが滞るのではなく経路が切り替わる。ルーティングDSLの重要性は、単一モデルのワークフローよりもここでこそ大きい。なぜなら、複数のモデルを1回の呼び出しに組み合わせることでこそ、多段のパイプラインが全体としてではなくステージごとに優雅に失敗できるようになるからだ。範囲を明確にしておくと、OrcaRouterはGoogle Veo 3.1やOdyssey-3を提供しておらず、どちらのモデルもこれを通じて利用することはできない。

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

誰が今すぐ行動すべきで、誰が待つべきなのか

締め切りが今四半期にあり、成果物がファイルなら、Google Veo 3.1 は正当化できる選択です。そしてその価格——音声付き1080pで1秒あたり約0.40ドル、FastおよびLiteティアならそれより安い——は、退屈に感じられるほど長く本番運用されてきたモデルのコストです。音声フラグは、後から気づくのではなく、意図的に予算に見込んでおきましょう。

あなたの問題がハードウェア上で機能しなければならないポリシーであるなら、Odyssey-3 はあなたを対象にしており、それでもまだ購入できるものは何もない。待つべきは三つだ。公表された価格、幅ではなく日付として示されたリリース日、そして独立した数字が一つ。77% という sim-to-real の数値は Odyssey 自身によるもので、社外の誰かがそれを再実行するまでは、正しい姿勢は計画ではなく関心だ。当面、周辺スタックこそがあなたが構築できる部分であり、後から新しいモデルを差し込めるように構築することが、最も安く取れる立場だ。

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.