Odyssey-3 的標題卡,副標題為「Odyssey 的互動式世界模型,公開研究預覽於 2026 年 10 月 8 日開放」,內含兩個數據面板:Odyssey-3 在基礎方案下為 832x480 與 16 fps,於自訂提示上 Physics-IQ +9.99 pp、排名 03,每部影片正規化成本為 $0.139;以及 Odyssey-3 Pro 在 Pro 方案下為 1280x720,Physics-IQ +11.15 pp、排名 02,並在影片轉影片項目上達到 66.1,每部影片正規化成本為 $0.267。
Guides & Insights

Odyssey-3:Odyssey 的全新世界模型奪下 Physics-IQ 王冠,並開放公開預覽

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Odyssey-3 Pro 在 Physics-IQ Verified 的 video-to-video 項目中拿下 66.1 分,而 Odyssey 於 2026 年 10 月 8 日公布了這個數字,並在同一則消息中發布了對開發者真正重要的事物:Odyssey-3 的公開研究預覽版。Odyssey-3 是一款自迴歸擴散 Transformer,旨在根據提示生成一個環境,接著在有人走過其中、移動攝影機或觸發事件時,即時持續對其進行預測。Odyssey-3 是模型本身;Odyssey-3 Pro 則是其 720p 等級版本,以 1280×720 執行,而基礎模型為 832×480。兩者同日上線,進入一個你可自行在 experience.odyssey.systems 操作的預覽版,並另設聯絡管道以供 API 存取。

這種搭配正是讓它不只是一篇基準測試文章的原因。互動式世界模型兩年來一直只是展示品;那些能在固定軌跡上生成幾格看似合理動作的模型,和一個在你猛按控制項後仍能保持預測連貫的模型,並不是同一種產物。Odyssey 聲稱的是後者,而且它讓任何人都能測試這項說法。

具體來說,發布了什麼

兩個檢查點,一個架構,沒有權重。

• Odyssey-3 — 480p 等級,832×480 輸出,在基準測試工具上為 16 fps,於排行榜的標準化成本欄中列為每支生成影片 $0.139。

• Odyssey-3 Pro — 720p 級別,1280×720,以相同基準計,每部影片標價 $0.267。

• 存取 — 瀏覽器中的研究預覽版,具備第一人稱導覽、第三人稱導覽,以及獨立鏡頭移動。API 存取是透過聯絡表單,而非自助式金鑰。

• 開放性——無。沒有公開權重、沒有授權條款,也沒有公布每 token 的價格。同一網站上的 API 條款頁面上次更新於 2026-01-22,且仍規範「Odyssey-2 API 的原型」,這說明了這個商業面向有多新。

這套架構在 Odyssey 自家的技術文件中被描述為一個多步驟影片擴散 Transformer,透過教師強制與因果遮罩以自迴歸方式延伸,並搭配一套後訓練流程,將分布匹配與對抗蒸餾結合成少步驟的蒸餾變體——正是這一部分讓即時互動得以成立。擴散帶來擬真度;自迴歸帶來能在動作序列中存續的模型;蒸餾則帶來時脈速度。這三者都不可或缺,而這三者全都是供應商對自家系統的說法,並非獨立來源。

這個基準,以董事會實際解讀的方式來看

The Physics-IQ Verified leaderboard from Anates Labs and Google DeepMind, headed “Dynamic ranking of video models by how well they understand physical principles”, read 9 October 2026, with separate image-to-video and video-to-video columns. The visible ranking runs FLUX 3 [large] at 01, Odyssey-3 Pro at 02, Odyssey-3 at 03, then Cosmos-class entries at 04 to 06, Seedance 2.5 at 07, Odyssey-3 at 08, MiniMax H3 at 09, Cosmos3 Nano at 10 and MiniMax H3 Max in the low teens.

Physics-IQ Verified 由 Anates Labs 與 DeepMind 共同運作,而它是一個真的很難從中鑽營取巧的基準測試:它會向模型展示真實物理實驗的影片——流體力學、光學、固體力學、磁學、熱力學——並依據實際發生的結果為模型的後續預測評分。它目前將來自 16 個實驗室的 41 個模型排名。Odyssey-3 Pro 的 66.1 是 Odyssey 所回報的影片轉影片賽道中最高的原始分數,而同一張排行榜上的淨改進欄位——衡量相對於該賽道平均值、以百分點計的增益——則講述了一個微妙不同的故事:

• 相較於賽道平均值的淨提升 — FLUX 3 [large] 以 +12.27 個百分點領先;Odyssey-3 Pro 以 +11.15 個百分點位居第二;Odyssey-3 以 +9.99 個百分點位居第三。

• 每支生成影片的成本——Odyssey-3 Pro 為 $0.267、Odyssey-3 為 $0.139,相較之下 FLUX 3 [large] 為 $0.868、Seedance 2.5 為 $2.838。(在排行榜能力所及之處,成本已標準化為 24 fps 與 1280 寬的輸出,因此可在影格率不同的模型之間進行比較。)

• 子指標領先地位 — Odyssey-3 以 44.70 在時空子指標拿下第一,領先 42.97 的 Odyssey-3 Pro;FLUX 3 [large] 以 64.36 在空間指標奪冠,並以 53.25 在加權空間指標居首,而兩款 Odyssey 機型在空間指標分別排名第二與第四。

所以,誠實的解讀並不是「Odyssey-3 是全世界最強的影片模型」。而是:一個為互動而打造的世界模型,登上了物理合理性排行榜的前段班——這個榜單過去一向是電影級生成器的地盤——而且它做到這件事的成本,大約只有 FLUX 3 標準化成本的三分之一。Odyssey 另一項說法——Odyssey-3 Pro 在圖生影片賽道拿下 54.7,best-of-8——同樣在這個榜上,也同樣適用那個但書:這些都是自行提交的配置,而這個排行榜混雜了用自訂提示詞提交的項目,以及用基準測試自身提示詞跑出的項目。Odyssey 同時出現在兩個欄位,這種透明程度並不尋常,也意味著它的兩列數字衡量的並不是同一件事。

Single-column scoreboard headed “Odyssey-3 — the scoreboard” with six rows: Access — browser preview plus contact form; Sizes — 832x480, 1280x720 Pro; Independent scoring — none yet; Physics-IQ, custom prompts — +9.99 pp base, +11.15 pp Pro; Physics-IQ, board prompts — +2.15 pp, rank 08; Published price — none. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Physics-IQ Verified board read Oct 9 2026”.

為什麼「世界模型」不是「影片模型」的同義詞

這個區別就是整個產品論述的核心,因此值得直白說明。影片片段生成器接收提示詞並回傳一個固定物件;對每個提出要求的人來說,輸出都一模一樣。Odyssey-3 接收提示詞,回傳的則是一個你能在其中行動的系統——預覽的第一人稱與第三人稱攝影機模式,以及它在生成過程中接收事件的能力,正是它預測接下來會發生什麼的機制:依據的是你剛剛做了什麼,而不是提示詞說了什麼。

那個特性正是使得 Odyssey 發布資料中的物理系統結果呈現出那樣面貌的原因。該公司報告,一個附加到凍結世界模型上、以數十小時機器人演示訓練的動作解碼器,產生了從未出現在演示中的恢復行為——例如在抓取失敗後重新調整夾爪的方向,或取回以不尋常方向掉落的物體。它報告了一個由 Flexion 在 Odyssey-3 之上構建、使用數十小時遠端操作數據的人形策略,該策略在光照變化下仍持續執行,而這些光照變化破壞了它所對比的 VLA 基線。它報告了一個以 20 小時模擬數據訓練的駕駛策略,該策略在真實道路上以閉環方式駕駛,在安全駕駛員介入之間的行駛距離約為以真實影像訓練策略的 77%。它報告了從模擬飛行數據中學習的無人機導航,以及在 GTA V 中的遊戲玩法,能將移動轉移到 Red Dead Redemption 2,並將摩托車騎行轉移到 Sleeping Dogs,而無需進一步訓練。

這些全都是廠商自行報告的結果,沒有獨立重現驗證,而且其中兩項被 Odyssey 明確界定為質性觀察,而非測量。但對這個主張來說,它們正是合適的證據類型:有趣之處不在於模型能做它受訓過的任務。而在於一個凍結的骨幹加上小型適配器,能從數十小時的資料中展現出有意義的行為,偶爾還能泛化到這些資料之外。

什麼仍未被證實?

Odyssey's own launch post, “Meet Odyssey-3: Our Most Powerful Foundation World Model”, dated October 8 2026 and credited to Oliver Cameron and other authors, with the Odyssey site navigation (About, News, Careers, Contact) and the opening line “Today we're launching Odyssey-3, our most powerful foundation world model yet.”

三件事,而且它們都不小。

首先,沒有任何獨立評估者執行過 Odyssey-3。Physics-IQ 的參賽項目是一份提交,而 Odyssey 自家說明中的第二個評分來源——WorldMark,Odyssey-3 在其中四個分組裡有三個排名第一——是廠商評估,使用該基準本身的說明文字,且用 Odyssey 的說法,是「其 13 項回報指標分數的平均值」。那等於這家公司拿別人的資料集來替自己打分。這比大多數產品發布所提供的還多,但它不是第三方。

其次,Odyssey-3 在那項評估中唯一沒拿第一的分項,正是最貼近行銷宣稱的那一項。在第一人稱真實環境中,它以 80.6 排名第三,落後於 84.4 的 Lyra 2.0 和 83.0 的 AlayaWorld。該模型在同一項評估中的優勢集中在風格化與第三人稱環境——第一人稱風格化為 77.2,第三人稱真實為 79.0,第三人稱風格化為 76.3。如果你正在打造照片級寫實的第一人稱具身化應用,你該在乎的排名,是 Odyssey-3 並未位居榜首的那一個。

第三,可用性。「研究預覽」這個詞在那句話裡可是發揮了實際作用。沒有定價頁面、沒有速率限制說明文件,也沒有自助式金鑰。如果你想把它用在產品中,就得排隊等候。

在沒有第二份合約的情況下比較它

像這樣的發表,實際問題在於:Odyssey-3 是這週影片生成領域最有趣的東西,而你仍然無法呼叫它。你真正會拿來與它做基準比較的模型,則是另一回事。

OrcaRouter 並未託管 Odyssey-3,而且就算我們有託管,也沒有公開價格可轉嫁。一把金鑰真正能觸及的是比較清單中的其餘部分——minimax/minimax-h3,在 768P 下每生成一秒影片 0.08 美元、Kling 影片系列,以及單一端點後方超過 200 個模型——以供應商定價、0% 加價提供,因此供應商的價格變動會當天顯示在你的帳單上,而不是等到下一次續約。跨供應商的自動容錯移轉意味著評估掃描不會因為某個上游一時出狀況而中斷,而路由 DSL 讓你能把數個模型放在同一個介面後方,因此一對一比較只是改個設定,而不是再做一次整合。如果 Odyssey 開放自助式 API,那就是你會想把它安插進去的形式。

什麼能讓它塵埃落定

在一個並非由它挑選的測試框架上,獨立跑一次 Odyssey-3。十二位擁有預覽權限的實務工作者,描述這個環境在歷經一分鐘激烈運鏡後,哪些地方仍能維持完整,哪些地方則會崩解。一個價格。上述任何一項,都能讓這一切從一次強勢的發表,變成一個參考基準。

目前已經成立的情況較為有限,但仍值得注意:在唯一一個衡量生成式模型是否理解物理、而非是否拍得好看的公開榜單上,一個以互動為目的的模型正位居第二與第三,且其正規化成本低於排名第一的模型。