一張生成的雙卡資訊圖,標題為「一個可進入的世界,或一個可評分的檔案」。左側卡片標題為 Luma Ray 3.2,圖說為「一份完成的交付成果」,列出 ACES2065-1 EXR,10/12/16 位元,最高 1080p,含 5 秒與 10 秒片段,且無原生音訊。右側卡片標題為 Odyssey-3,圖說為「一個執行中的環境」,列出模擬狀態與連續推演、供硬體使用的馬達動作,以及價格未公布。
Guides & Insights

Odyssey-3 對比 Luma Ray 3.2:一個可進入的世界,還是一個待調色的檔案

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Luma Ray 3.2 做到了影片生成領域幾乎沒有其他工具能做到的事:它以 ACES2065-1 EXR 標準提供 10、12 和 16 位元 HDR 影格,這正是調色師真正想要的格式,也是這個模型以目前形式存在的理由。Odyssey-3 則做到了完全沒有任何影片模型能做到的事:它將動作作為輸入,預測世界接下來會發生什麼,再將該預測轉換成機械手臂、人形機器人、汽車或無人機的馬達指令。Luma Ray 3.2 由 Luma AI 於 2026 年 6 月 9 日發布,是一款接近後期製作階段的生成工具,並附有開發者 API。Odyssey-3 由 Odyssey 於 2026 年 9 月 15 日預覽,是一款尚未發布的基礎世界模型,既無定價也無發布日期。比較這兩者,與其說是一場烘焙大賽,不如說是藉此追問:你的工作流程真正欠缺的,究竟是這兩種截然不同產出中的哪一種——一幀經過調色的畫面,還是一個能回應控制的世界。

Ray 3.2 以可交付成果為核心打造。

Ray 3.2 版本的發布,其引人注目之處與其說在於生成品質,不如說在於它止步之處。它能生成 540p、720p 和 1080p 的內容,提供 5 秒或 10 秒的片段,涵蓋直式、方形與寬螢幕的六種長寬比,並接受文字、起始影格、結束影格,或既有影片進行修改。HDR 路徑是差異化關鍵,而它伴隨著值得精確說明的實際限制:採用 ACES2065-1 EXR 的 10、12 與 16 位元 HDR 輸出,僅在 720p 與 1080p 提供,且僅限 5 秒片段。EXR 匯出必須透過啟用 HDR 來要求。標準輸出為 MP4。無縫循環適用於 5 秒片段。每個片段最多 16 個關鍵影格,提供更接近動畫而非提示詞的鏡頭層級控制,而臉部表演追蹤最多可涵蓋八張臉。

另外兩個事實會影響購買決策。Ray 3.2 是 Ray 系列中首款具備完整開發者 API 的模型——先前的 Ray 模型僅提供訂閱制——並拆分為隨用隨付的 Build 方案,以及具備 SLA 的預留輸送量 Scale 方案。而且它不會為文字轉影片或圖像轉影片的工作生成同步音訊;音訊僅保留在修改與重新取景路徑中。Luma 進行了自家評估,聲稱與 Google 的 Veo 3 並駕齊驅,並領先數個競爭對手,但那些都是供應商自行進行的比較,並未公布數值分數,應解讀為定位宣傳,而非實測結果。

A generated two-column scoreboard for Odyssey-3 vs Luma Ray 3.2 sharing six dimension labels: output, max resolution, clip length, audio, price, availability. Odyssey-3 reads world state + actions, not a renderer, continuous rollout, none, not published, preview only. Luma Ray 3.2 reads MP4 + ACES2065-1 EXR, 1080p, 5s or 10s, no audio for text-to-video, about $0.30 per 5s at 720p, released 2026-06-09. Footer: "Odyssey-3 vendor-reported and unreleased; Luma Ray 3.2 figures per Luma and third-party listings."

Odyssey-3 是圍繞控制器打造的

Odyssey-3 的設計核心位於整條管線的另一端。它是一個以視覺觀察世界訓練而成的自迴歸擴散 Transformer,而其最具特色的組件是學習得來的動作解碼器——用 Odyssey 的說法,是「附加於世界模型上的學習輸出組件」,負責將模型的內部表徵轉譯為特定硬體所需的動作。Odyssey 報告指出,同一個主幹網路能從數十小時的示範中控制機械手臂、即時驅動以 Flexion 打造的人形策略、從以 20 小時模擬資料訓練的凍結主幹產生閉環駕駛路徑點、在室內繞過障礙物飛行無人機,以及遊玩 Grand Theft Auto V 並移轉至 Red Dead Redemption 2 和 Sleeping Dogs,且在該處無需額外的策略訓練。

Odyssey 公布的唯一一項比較數字是:以模擬訓練的駕駛策略在安全駕駛介入之間行駛的距離,約為以真實影像訓練之策略的 77%。沒有基準測試表、沒有 Odyssey-3 技術報告、沒有獨立評估,也沒有任何推出日期,除了「未來幾週」之外。它是一項預覽,而且定價為零,因為它買不到。

對比,逐個維度來看

輸出內容 — Luma Ray 3.2:MP4,以及啟用 HDR 時的 10/12/16 位元 ACES2065-1 EXR。Odyssey-3:模擬的世界狀態加上馬達動作。

格式上限 — Luma Ray 3.2:720p 與 1080p 的 ACES2065-1 EXR,僅限 5 秒片段。Odyssey-3:並非檔案格式;其輸出為階段性推出。

解析度與長度 — Luma Ray 3.2:最高 1080p,5 秒或 10 秒(僅 10 秒支援文字轉影片)。Odyssey-3:可連續生成,速率依部署需求而定。

音訊 — Luma Ray 3.2:T2V/I2V 無;在修改與重新取景時保留。Odyssey-3:無;它並非媒體生成器。

價格 — Luma Ray 3.2:依解析度、動態範圍與時長按影片計費,HDR 與 EXR 匯出會使片段成本倍增;第三方刊登的價格顯示,5 秒 720p 片段約為 $0.30,1080p 則約為 $1.20。Odyssey-3:未公布。

供應情況 — Luma Ray 3.2:已於 2026-06-09 發布,提供 Build 與 Scale API 方案層級。Odyssey-3:預覽版,「將於未來數週內推出」。

交付成果與環境的對比

這個配對之所以具有啟發性而非任意為之,原因在於這兩個模型最終落腳的地方不同。Ray 3.2 最終產出的是一個會交到調色師、合成師或後期製作公司手上的檔案——EXR 這條路徑之所以存在,正是為了讓生成的影像在被調色、合成、再次調色之後仍能維持完整、不致崩解。這是一項工作流程上的決定,也正是為什麼 Ray 3.2 更直接地與後期製作工具競爭,而非與其他生成器競爭。

Odyssey-3 在檔案的意義上根本不會終止。它的輸出是一種持續運作的模擬狀態,而它的消費者是一個程式。判斷它是否奏效的檢驗,不在於影格看起來正不正確,而在於其中訓練出的策略能否移轉到硬體上。這些是由不同人衡量、不同的成功標準,而且無論哪一方再怎麼提高解析度,都無法讓它們變得可相比。

它們可能交會之處,在於從預視覺化到後期完製的流程。世界模型是互動式探索空間的天然工具——調整攝影機運動、重新安排場面走位、立即看到結果,而這正是固定的生成片段做不到的事。像 Ray 3.2 這樣的模型,則是把選定的結果轉換成能以 HDR 交付之成品的天生工具。如今這條路徑中段有個缺口,因為 Odyssey-3 並不可用,也不會產生任何後期完製流程能取用的檔案格式。

繞過他們兩者

Luma Ray 3.2 與 Odyssey-3 皆非由 OrcaRouter 提供服務,而本文也未主張兩者任一有被提供。值得留意的是,像這樣的流程中,有很大一部分其實都不是這兩個模型。負責草擬鏡頭描述的文字提示模型、對照簡報檢查畫格的視覺模型、從參考音軌還原對話的轉錄模型——這些持續在運作,成本僅為影片模型每段剪輯成本的一小部分,而它們正是會在尷尬時段出問題的部分。將它們跑在橫跨 200 多個模型、以供應商定價、0% 加價的單一 API上,能讓這一層只靠一組金鑰與一份帳單運作,而自動容錯移轉則意味著當某個提示端點效能退化時會改道,而不是讓佇列卡在它後面。當某家供應商調降影片模型價格時,這種直接傳遞意味著降價當天這裡就同步生效——但僅限於我們實際提供服務的模型,而目前並不包括這兩個模型中的任何一個。

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

每個值得等待的是什麼

Ray 3.2 現已推出,而選擇它的理由很明確:如果你的交付成果會經過色彩管線,ACES2065-1 EXR 這條路徑是多數生成器根本不具備的能力,而解析度與時長限制——1080p 上限、HDR 僅 5 秒片段、沒有原生音訊——就是入場的代價。如果你需要同步音效,這款模型並不適合你,應該去找一款能生成音訊的。

Odyssey-3 值得關注只有一個理由,而這個理由不是 Ray 3.2 的任何一個維度。如果同一組權重真的能驅動機械臂、人形機器人、一輛車、一架無人機,以及三款遊戲,而且每項各自只用數十小時的資料,那就是一項關於泛化性的主張,沒有任何渲染器會提出這種主張,而這也是當前領域中上檔空間最大的主張。問題在於,今天支持它的證據,是 Odyssey 自家的示範影片,以及單一項模擬到真實的數字。能改變判讀的不是更好的示範——而是一個價格、一個日期,以及一個由不在那裡工作的人測出的數字。

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.