Odyssey-3のタイトルカード。副題は「Odysseyのインタラクティブ世界モデル、公開研究プレビューを2026年10月8日に開始」。2つの統計パネルを掲載。Odyssey-3:ベースティアで832x480、16 fps、Physics-IQ +9.99ポイント、カスタムプロンプトで3位、正規化コストは動画1本あたり0.139ドル。Odyssey-3 Pro:Proティアで1280x720、Physics-IQ +11.15ポイント、2位、ビデオtoビデオトラックで66.1、正規化コストは動画1本あたり0.267ドル。
Guides & Insights

Odyssey-3:Odysseyの新たなワールドモデルがPhysics-IQの王座を獲得、パブリックプレビューを公開

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Odyssey-3 ProはPhysics-IQ Verifiedのvideo-to-videoトラックで66.1を獲得し、Odysseyは2026年10月8日、その数字を、開発者にとって実際に重要なもの——Odyssey-3の公開リサーチプレビュー——の隣に公開した。Odyssey-3は、プロンプトから環境を生成し、誰かがその中を歩き、カメラを動かし、またはイベントをトリガーする間、リアルタイムで予測を続けるように作られた自己回帰拡散トランスフォーマーだ。Odyssey-3がモデル本体で、Odyssey-3 Proはその720pティアであり、ベースモデルの832×480に対して1280×720で動作する。両方は同じ日に公開され、experience.odyssey.systemsで自分で操作できるプレビューに登場する。APIアクセスには別途の連絡経路がある。

その組み合わせこそが、これを単なるベンチマーク記事以上のものにしている。インタラクティブな世界モデルはこの2年間デモウェアにすぎなかった。固定された軌道上で、もっともらしい動きを数フレーム生成するものは、コントロールをいじった後も予測の一貫性を保つモデルとは同じ成果物ではない。Odysseyは後者を主張しており、誰でもその主張を検証できるようにしている。

正確には、何がリリースされましたか

2つのチェックポイント、1つのアーキテクチャ、重みなし。

• Odyssey-3 — 480p ティア。出力は 832×480、ベンチマークハーネスで 16 fps、リーダーボードの正規化コスト列では生成動画 1 本あたり $0.139 と記載。

• Odyssey-3 Pro — 720pティア、1280×720、同じ基準で1本あたり$0.267で記載されています。

• アクセス — ブラウザでのリサーチプレビューで、一人称視点ナビゲーション、三人称視点ナビゲーション、独立したカメラ操作が可能です。API アクセスはセルフサービスキーではなく、お問い合わせフォームです。

• オープン性 — なし。重みも、ライセンスも、トークンあたりの価格も公開されていない。同一サイトのAPI利用規約ページは2026-01-22に最終更新されており、今なお「Odyssey-2 APIのプロトタイプ」を対象としている。これは、この商業的な提供面がいかに新しいかを示している。

このアーキテクチャは、Odyssey自身の記述によれば、教師強制と因果マスキングによって自己回帰的に拡張された多段階動画拡散トランスフォーマーであり、事後学習パイプラインは分布マッチングと敵対的蒸留を組み合わせて数ステップの蒸留版を生み出す——それによって初めてリアルタイム対話が可能になる部分だ。拡散は忠実度をもたらす。自己回帰は行動系列に耐えるモデルをもたらす。蒸留は動作速度をもたらす。この三つはいずれも不可欠であり、いずれもベンダー自身による自社システムの説明であって、独立した説明ではない。

取締役会が実際に読むのと同じ読み方で読んだベンチマーク

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified は Anates Labs が DeepMind と共同で運営しており、攻略するのが本当に厄介なベンチマークだ。モデルに実際の物理実験——流体力学、光学、固体力学、磁気、熱力学——の動画を見せ、その続きを実際に起きたことと照らして採点する。現在、16 のラボから 41 モデルをランク付けしている。Odyssey-3 Pro の 66.1 は、Odyssey が報告する動画対動画トラックにおける最高の素点であり、同じボードの純改善列——トラック平均に対する改善をパーセントポイントで測る——は、微妙に異なる話を語っている:

• トラック平均に対する純改善 — FLUX 3 [large]が+12.27 ppで首位、Odyssey-3 Proが+11.15 ppで2位、Odyssey-3が+9.99 ppで3位。

• 生成動画1本あたりのコスト — Odyssey-3 Pro $0.267、Odyssey-3 $0.139。これに対して FLUX 3 [large] は $0.868、Seedance 2.5 は $2.838。(コストは、リーダーボードが可能な範囲で 24 fps および幅1280の出力に正規化されているため、同じフレームレートでないモデル間でも比較できます。)

• サブ指標での首位 — Odyssey-3 は時空間サブ指標で 44.70 を記録して 1 位、42.97 の Odyssey-3 Pro を上回る。FLUX 3 [large] は空間で 64.36、重み付き空間で 53.25 を獲得し、Odyssey の 2 エントリは空間で 2 位と 4 位。

つまり正直に読めば、「Odyssey-3は世界最高の動画モデルだ」ということではない。そうではなく、インタラクション向けに作られたワールドモデルが、これまでは映画的な生成モデルの領分だった物理的妥当性のボードでトップ付近に食い込み、しかもそれをFLUX 3の正規化コストのおよそ3分の1で成し遂げた、ということだ。Odysseyの別個の主張——image-to-videoトラックでのOdyssey-3 Proの54.7、best-of-8——も同じボード上にあり、同じ但し書きが当てはまる。これらは自己申告の構成であり、リーダーボードはカスタムプロンプトで提出されたエントリと、ベンチマーク自身のプロンプトで実行されたエントリを混在させている。Odysseyは両方の列に現れており、これは異例なほど透明であると同時に、その2つの行が同じものを測定しているわけではないことも意味している。

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

なぜ「世界モデル」は「ビデオモデル」の同義語ではないのか

この違いは製品の主張そのものなので、率直に述べておく価値がある。クリップ生成器はプロンプトを受け取り、固定されたオブジェクトを返す。出力は誰が求めても同じだ。Odyssey-3はプロンプトを受け取り、あなたがその中で行動するシステムを返す——プレビューの一人称および三人称カメラモードと、生成の途中でイベントを受け付けられる能力が、プロンプトに書かれたことではなく、あなたが今行ったことに基づいて次に何が起きるかを予測する仕組みである。

その特性こそが、Odysseyのローンチ資料にある物理システムの結果を、あのような見え方にしている。同社は、凍結された世界モデルに取り付けた行動デコーダが、数十時間のロボット実演で訓練され、実演には決してなかった復帰行動を生み出したと報告している——掴み損ねた後にグリッパーの向きを変える、異常な向きで落とした物体を回収する、といった行動だ。同社は、FlexionがOdyssey-3上に構築したヒューマノイドポリシーが、数十時間の遠隔操作データで訓練され、比較対象のVLAベースラインを破綻させるような照明変化の下でも実行を続けたと報告している。同社は、20時間のシミュレーションデータで訓練した運転ポリシーが、実道路で閉ループ走行し、安全ドライバーによる介入間の走行距離が、実映像で訓練したポリシーの約77%だったと報告している。同社は、シミュレーション飛行データからのドローン航法とGTA Vでのゲームプレイが、追加訓練なしに、移動をRed Dead Redemption 2に、バイク走行をSleeping Dogsに転移させたと報告している。

それらはすべて、独立した再現のないベンダー報告の結果であり、そのうち2つはOdysseyによって測定ではなく定性的観察として明示的に位置づけられている。しかし、それらはその主張にとって適切な種類の証拠である。興味深いのは、モデルが訓練されたタスクを実行できることではない。凍結されたバックボーンと小さなアダプターが、数十時間程度のデータから意味のある振る舞いを引き出し、時にはそれを超えて汎化することだ。

何がまだ証明されていないのか

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

三つのこと、しかもどれも小さくない。

まず、Odyssey-3を実行した独立の評価者は誰もいない。Physics-IQへのエントリーは提出物であり、Odyssey自身の記述における2つ目の採点源——WorldMarkでは、Odyssey-3が4つのスプリットのうち3つで1位になっている——は、ベンチマーク自身のキャプションを使ったベンダー評価であり、Odysseyの言い回しを借りれば「報告された13の指標スコアの平均」だ。それは、他社のデータセット上で自社が自らを採点しているということにほかならない。それは大半のローンチが提供するものよりは多い。しかし、第三者ではない。

第二に、その評価でOdyssey-3が勝てていない唯一の部門は、マーケティング上の主張に最も近い部門です。一人称の実環境では80.6で3位となり、84.4のLyra 2.0と83.0のAlayaWorldに後れを取っています。同じ評価におけるこのモデルの強みは、様式化された環境と三人称環境に集中しています——一人称の様式化環境では77.2、三人称の実環境では79.0、三人称の様式化環境では76.3です。フォトリアルな一人称の身体性向けに構築しているなら、注目すべきランキングは、Odyssey-3が首位に立っていないものです。

第三に、利用可能性です。あの一文では「Research preview」が実際に効いています。料金ページも、レート制限のドキュメントも、セルフサービスで取得できるキーもありません。これを製品に組み込みたいなら、順番待ちです。

2つ目の契約なしでそれを比較すること

こういうローンチには現実的な問題がある。Odyssey-3は今週の動画生成で最も興味深いものだが、それでもまだ呼び出すことはできない。実際に比較検討すべきモデルたちは、また別の話だ。

OrcaRouterはOdyssey-3をホストしておらず、たとえホストしていてもパススルーできる公表価格はありません。1つのキーで実際に利用できるのは、比較対象セットの残り — 768Pで生成動画1秒あたり$0.08のminimax/minimax-h3、K​lingの動画ラインナップ、そして単一のエンドポイントの背後にある200を超えるモデル — プロバイダーのリスト価格で、マークアップは0%。そのためベンダーの価格変更は次回の更新時ではなく、その日のうちに請求書へ反映されます。 プロバイダー間の自動フェイルオーバーにより、あるアップストリームが一時的に不調でも評価スイープが止まることはなく、ルーティングDSLを使えば複数のモデルを1つのインターフェースの背後に置けるため、直接比較は2つ目の統合ではなく設定変更で済みます。OdysseyがセルフサービスAPIを公開するなら、それが組み込みたい形です。

それを解決するものは何だろう

Odyssey-3を、自らが選んだのではないハーネス上で独立に実行すること。プレビューアクセスを持つ十数名の実務家が、1分間の激しいカメラワークの後も環境がどこで破綻せず持ちこたえるか、どこで持ちこたえないかを説明すること。価格。それらのいずれかがあれば、これは強いローンチから基準点へと変わる。

すでに事実であることは、より限定的ではあるが、依然として注目に値する。生成モデルが写真映えするかどうかではなく、物理学を理解しているかどうかを測る唯一の公開リーダーボードで、インタラクションを目的とするモデルが2位と3位につけており、その正規化コストは1位のモデルを下回っている。