為 Odyssey-3 生成的標題卡,副標題為「一個會行動、而非只會渲染的世界模型」,以及六張標示卡片——機械手臂、人形機器人、駕駛、無人機、遊戲、訓練——每張卡片都連接到一個標記為「單一主幹」的節點,並附有註腳:「2026-09-15 預覽;由廠商提供,未經獨立基準測試。」
Engineering & Research

Odyssey-3 預覽:Odyssey 的世界模型從觀看世界轉向在世界中行動

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Odyssey-3 是 Odyssey 最新的基礎世界模型,由該公司於 2026 年 9 月 15 日公開預覽,並在其自家公告中描述為一款旨在驅動「機器人、駕駛汽車、訓練 AI、操控無人機,甚至玩電子遊戲」的模型。這份預覽值得細讀之處,不在於那一串機體清單,而在於機制本身。Odyssey-3 是一種自迴歸擴散 Transformer,經訓練可從視覺觀察模擬多樣情境,而該公司會附加一個已學習的動作解碼器到它上面,這個元件會把模型對場景的內部表徵轉譯成特定硬體所需的馬達指令。這正是「生成一段看似合理的機械手臂影片」的模型,與「被要求實際移動機械手臂」的模型之間的差別。Odyssey 將這類因此得以實現的系統稱為「實體代理」——用該公司的說法,這些模型「說的是世界的語言」。如果這種框架聽起來接近預覽報導中流傳的「物理代理」標籤,那對同一項主張而言是一種合理的解讀,儘管這不是 Odyssey 自己的用語,而且在現階段,這只是意圖的描述,而非經測量的結果。

Odyssey 究竟宣布了什麼

這則貼文是預告,不是正式發布。Odyssey 表示「很期待在接下來幾週內公開發布」,但沒有給出日期、價格,也沒有說明取得管道。公告中沒有連結到任何 Odyssey-3 技術報告——該頁面唯一指向的論文是該公司的強化學習研究成果 PROWL-1,而唯一的 PDF 則是 Starchild-1 的。這個缺漏值得直說,因為它形塑了以下所有內容:本文中的每一項能力宣稱都來自 Odyssey,未經重現,而且至今沒有任何第三方發表過 Odyssey 並未提供的 Odyssey-3 數據。

這篇貼文確實說明了架構與一套訓練哲學。這個模型是一個自迴歸擴散 Transformer。它的訓練依據是對世界的視覺觀察,而非特定任務的標籤;Odyssey 主張,這讓它習得對「物理、動態、因果關係、人類行為」的掌握——而且依其說法,其資料需求量低於未以這種方式預訓練的系統。這背後的賭注,正是整個世界模型領域所下的同一個賭注:在大規模尺度上預測場景的下一個狀態,會迫使模型內化物理物件實際的運作方式,因為一個把物理搞錯的模型,在長時間推演中會逐漸失序而無法回復。

A generated single-column scoreboard for Odyssey-3 listing: what it is, foundation world model; output, world state plus motor actions; embodiments, arms, humanoid, car, drone, games; price, not published; availability, preview in the coming weeks; independent benchmarks, none yet. The footer reads "All figures Odyssey-reported; no independent evaluation published."

一個骨幹,六個身體

這份公告中最具體的證據,是由同一個基礎模型所驅動的具身形態日益擴散。Odyssey 報導:

機械手臂 — 學會從「僅數十小時的機器人示範」中控制各種手臂並完成複雜任務,包括示範中完全沒有的復原行為,例如在抓取失敗後重新調整夾爪的方向。

人形機器人——與 Flexion 合作完成的工作,其策略以數十小時的人形機器人遙操作資料為基礎,並即時運行;Odyssey 聲稱,相較於其測試過的視覺—語言—動作基準模型,這套方法在光照變化下的泛化表現更好。

駕駛 — 一個凍結的主幹網路,為閉環駕駛產生即時路徑點,僅以「20 小時的模擬駕駛資料」訓練而成。

無人機 — 從數十小時的模擬飛行資料中學習避障室內飛行,以及在主幹網路凍結下的定性推演。

電子遊戲 — 長時間的《俠盜獵車手 V》遊玩時段,並可移轉至《碧血狂殺 2》與《香港秘密警察》,而無需在這些作品中進行任何額外的策略訓練。

AI 訓練環境 — 作為其他代理訓練場的生成世界,與 PROWL-1 工作相關。

那些橫列之間的模式才是真正的主張:並非 Odyssey-3 在其中任何一項上表現卓越,而是同一組權重,搭配一個小型且可學習的輸出適配器,就能達到所有這些項目。一個關於世界如何運動的通用模型,與針對個別機器人的策略是截然不同的資產,而這正是這次預覽之所以得到如此結果的原因。

那個數字,以及它無法證明的事

Odyssey 針對 Odyssey-3 恰好只公布了一個比較數字:純粹在模擬中訓練的駕駛策略,在安全駕駛員介入之間行駛的距離,大約是以真實影像訓練的策略的 77%,且使用的是同樣 20 小時的模擬資料。這是一個 sim-to-real 的數字,而且確實很有意思——即便只是縮小模擬訓練與真實資料訓練駕駛之間的部分差距,也是這個問題最困難的地方。這也是該篇文章中唯一的數字。

這裡沒有準確率表格、沒有成功率、沒有跨形體的基準測試,也沒有在共同評估中與另一個具名世界模型的比較。頁面的頁尾卡片聲稱 Odyssey-3 推進了「世界模型物理準確性的最新技術水準」,但頁面上沒有任何數字能支持這一點。Odyssey 也提及其與 Poke & Wiggle 的評估合作,涵蓋「不同的形體、視角與控制方式」——而且尚未公布任何相關結果。這裡的一切都是廠商聲稱,在外部第三方重新驗證之前,77% 這個數字就應該被如此看待。

缺失的基準測試表意味著什麼

把缺乏基準測試解讀為警訊固然容易,但更好的解讀方式是將其視為這個領域的現況。世界模型目前還沒有相當於 MMLU 或 GPQA 的東西——一套共通的、成本低廉、廣受信任、人人都拿來對照報告的評估標準。Odyssey 自己的說法也從另一個方向承認了規模問題:那篇文章指出,前沿世界模型仍「落後語言模型大約兩個數量級」。當評估標準本身都還未底定時,一篇以架構與具身化範疇為開頭、而非先端出成績表的預覽文章,正是在誠實描述前沿現況,讀者應把其中的質性主張視為方向性的指引,而非已成定論。Poke & Wiggle 的合作才是值得關注的重點:一項跨形體、跨視角的評估,若能公布數據,將是對這一切的首份獨立判讀。

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

「在接下來的幾週內」才是真正的新聞頭條

對任何在本季需要做決定的人來說,公告中最關鍵的一句是關於可用性的那句。Odyssey-3 尚未正式開放使用,沒有公布價格,沒有 API 文件,也沒有說明日期——只說「未來幾週」。這使它與你今天就能評估的模型屬於不同類別。這也意味著,那些勢必會針對它撰寫的比較頁面,目前是在比較一個已推出的產品與一個研究預覽版;這是實質差異,而非技術細節:預覽版可以很出色,卻仍然不是你週一就能放進管線裡的東西。

時機之所以重要,還有第二個原因。Odyssey 以 14.5 億美元估值完成了 3.1 億美元的 B 輪融資,而 AWS 成為其首選雲端供應商——該公司擁有足夠的算力來推進前沿世界模型,而在公開發布前幾個月登場的預覽,正是展示這項工作的方式。請把這則公告解讀為對發展軌跡的宣示,而非對能力的宣示。

如果你今天就要打造這個,該怎麼辦?

Odyssey-3 本身不是你能呼叫的東西,而 OrcaRouter 也不提供它——沒有任何路由層提供,因為目前還沒有東西可以路由。現在值得做的是把這個決定拆成兩個部分。第一部分是世界模型,而對此,誠實的答案是等待公開發布以及第一份獨立評估。第二部分則是圍繞它的一切:把任務轉換成策略能取用內容的語言模型、解讀場景的視覺模型、為已錄製示範貼上標註的轉錄模型。那個周邊技術堆疊屬於普通的路由工作,而且今天就能透過涵蓋 200 多個模型的單一 API,以供應商定價、0% 加成取得,並提供自動容錯移轉,在供應商效能下降時

同樣值得以最便宜的方式,讓世界模型的問題保持開放。當像 Odyssey-3 這樣的模型真的進入有路由的供應商時,它會在同一天以供應商牌價出現,因此試用它只需一次 API 呼叫,而不是一份合約。把周邊的管道建置好,讓新模型能夠直接插進來,就是對仍在變動的前沿所做的實際準備。

什麼會改變這個解讀?

有三件事能把這次預覽變成板上釘釘的事實。一份已發表、載明架構與訓練細節的技術報告,將讓外部團隊得以重現任何結果。一份首開先例的獨立基準測試——最好是 Poke & Wiggle 的跨體研究——將以他人實測的數字,取代供應商的一方之言。而一場有明確日期與定價的公開發布,則會讓每一項與 Odyssey-3 的比較,都成為讀者真正能運行之物之間的比較。

在那之前,站得住腳的總結是這樣:Odyssey-3 是對一件真正困難之事——一個世界模型、多個形體、控制而非渲染——的可信宣稱,來自一間資金充裕、在該領域有實績的實驗室,卻幾乎沒有提出任何數字,也沒有可用日期。這就是前沿預覽的模樣。把能力宣稱視為方向性的,把架構視為有趣的部分,而把發布日期視為唯一會改變你計畫的那一行。

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.