
Odyssey-3 vs FLUX 3 Video:模擬器與渲染器並非同一種工具
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Odyssey-3 和 FLUX 3 Video 之所以常被拿來比較,是因為兩者都能生成不存在之世界的影片,而相似之處大致也就到此為止。FLUX 3 Video 是 Black Forest Labs 的生成模型,自 2026 年 8 月 4 日起全面開放使用,可將提示詞或起始影格轉換為最長二十秒、帶有原生音訊的 1080p SDR MP4,並依輸出秒數計價。Odyssey-3 則是 Odyssey 的基礎世界模型,於 2026 年 9 月 15 日搶先亮相,目前尚未公開發布;它模擬場景在動作作用下如何演變,並附加一個學習而成的解碼器,把該模擬轉換成機械手臂、人形機器人、汽車或無人機的馬達指令。一個是渲染器:產生供人觀看的觀測結果。另一個是模擬器:產生程式可據以行動的狀態。儘管如此,把兩者放在一起對比仍有用處——不是為了選出贏家,而是因為它們輸出的這兩種東西,正是許多團隊目前試圖用同一筆預算購買的兩種不同事物。
差別在於模型輸出什麼
要最清晰地掌握這一區別,最好的方式就是 World Labs 為世界模型發布的分類法,它依系統輸出感知—行動迴路的哪一部分來分類。渲染器輸出觀察結果——像素,供人眼觀看,以視覺逼真度來評判。模擬器輸出狀態——一種對世界的表徵,其在幾何與物理上足夠忠實,讓人與程式都能據以進行運算。規劃器輸出動作。FLUX 3 Video 完全是個渲染器,而且是非常出色的一個。Odyssey-3 則瞄準模擬器那一欄,但一隻腳已踏進規劃器那一欄,因為動作解碼器正是讓模擬得以驅動硬體的關鍵。
這不是行銷上的區別,而且它有一個實際的測試。用影片模型渲染出一個房間,把你的視點走出房間,然後轉過身:家具可能已經不在你離開時的位置,因為模型是逐幀預測,從未維持一個持久的世界。對模擬器提出同樣的要求,答案應該是穩定的,因為模型的重點在於影格底下的狀態。Odyssey 自己的發布說明也倚重這一點——打造動力學模型而非影片生成器的原因在於,在其中訓練的策略可以被評估與改進,而不只是被觀看。

FLUX 3 Video,具體來說
Black Forest Labs 於 2026 年 8 月 4 日推出 FLUX 3 Video,其規格表鎖定的是實際製作產出,而非模擬。它能在單次生成中產出最長二十秒、最高 1080p、SDR、MP4 格式的影片,並伴隨畫面生成原生音訊。定價按生成影片的每秒計費:草稿 720p 級別為每秒 0.06 美元,標準 720p 級別為每秒 0.17 美元,1080p 為每秒 0.29 美元,而影片轉影片作業的定價高於這些級別。這些都是廠商公布的數字。
Black Forest Labs 為它附上的唯一一項基準數字,是文字轉影片的內部 Elo 1,135,這是由廠商自行執行的評估,尚未經過獨立重現——FLUX 3 Video 目前並未出現在獨立的影片排行榜上。請把這項排名視為一種宣稱。不容質疑的是交付能力:一套已定價、具備文件、按秒計費的 API,今天就能回傳檔案。
具體來說,是 Odyssey-3
Odyssey-3 是一個具有架構但無價格的預覽版本。它是一個在視覺觀察上訓練的自迴歸擴散 Transformer,其顯著特徵是動作解碼器——Odyssey 稱之為「附加於世界模型上的學習輸出元件」——在觀察-動作配對上訓練,將模型的內部表徵轉譯為特定硬體所需的動作。Odyssey 報告它可從數十小時的示範中驅動機械手臂、使用 Flexion 即時建立的人形策略、從 20 小時模擬資料進行閉環駕駛、室內避障無人機飛行,以及在 Grand Theft Auto V 中長時間遊玩,並轉移至 Red Dead Redemption 2 和 Sleeping Dogs,而無需在那些遊戲中進行額外的策略訓練。該公司還報告了一個比較數據:模擬訓練的駕駛策略在安全駕駛介入之間的行駛距離約為以真實影像訓練的策略的 77%。沒有獨立基準測試,沒有 Odyssey-3 的技術報告,也沒有發布日期,除了「未來幾週」。每個數字都是 Odyssey 自己的。
對比,逐個維度來看
• 它輸出什麼 — FLUX 3 Video:一個由像素組成的 MP4 檔案。Odyssey-3:一個模擬的世界狀態,以及透過動作解碼器輸出的馬達動作。
• 誰會使用它 — FLUX 3 Video:觀看的人,或完成剪輯的剪輯師。Odyssey-3:機器人控制器、駕駛策略,或正在訓練中的 RL 代理。
• 最大輸出 — FLUX 3 Video:單次生成最長 20 秒、最高 1080p SDR、原生音訊。Odyssey-3:只要模擬能持續維持,即可連續推演,影格率完全依部署需求而定。
• 價格 — FLUX 3 Video:草稿 720p 每秒 $0.06、720p 每秒 $0.17、1080p 每秒 $0.29(廠商)。Odyssey-3:未公布。
• 可用性 — FLUX 3 Video:自 2026-08-04 起正式推出(GA)。Odyssey-3:預覽階段,對外表示「將於未來數週內」推出。
• 基準測試 — FLUX 3 Video:廠商自稱 Elo 1,135 T2V,未經重現,也未見於獨立排行榜。Odyssey-3:沒有基準測試表,僅有一項廠商提供的 sim-to-real 數據。
價格不對稱才是誠實的頭條。
這兩者之中,一個有標價,另一個沒有,而光是這個事實,就比任何能力宣稱更能告訴你該如何在這兩者之間做選擇。FLUX 3 Video 有按輸出秒數計量的成本,因此團隊可以在生成第一段影片之前,就算出一百段影片的成本。Odyssey-3 沒有公布價格、沒有 API、也沒有日期,因此目前無法得知使用它的成本——而帳單的樣貌同樣無從得知。Odyssey 所描述的那類世界模型,計費方式通常與影片生成截然不同:不是按美麗像素的秒數計費,而是按模擬時數計費,因為其使用者是可能運行數百萬步的訓練迴圈。拿每秒 $0.29 去跟「什麼都沒有」相比並不構成比較,而任何把它當成比較來呈現的頁面,都只是在用猜測填補空白。
他們實際上會碰面的地方
這兩者並非彼此的替代品,更有趣的問題在於它們能否相互組合。FLUX 3 Video 在最終交付物是人類觀看的檔案時,都是更好的工具:產品鏡頭、廣告變體、社群短版、預視覺化。Odyssey-3 若能兌現承諾,則在最終交付物是必須在實體世界中運作的政策,或是程式必須據以推理的場景時,是更好的工具。在電影或遊戲的製作流程中,合理的安排並非二選一——世界模型生成互動式環境,渲染器則產出離開工作室的精緻畫面。
目前那個合成確實有實質限制,而這項限制就是 SDR。FLUX 3 Video 輸出 SDR MP4。Odyssey-3 輸出的是模擬環境,而非已調色的檔案。兩者都不是 HDR 後期製作工具,因此若工作流程最終要產出廣播或院線交付成品,在兩者之後仍需要一個母帶製作步驟。
路由,以及它在這裡涵蓋與不涵蓋的內容
目前這兩款模型都無法透過 OrcaRouter 進行路由。FLUX 3 Video 由 Black Forest Labs 自家的 API 以及數個第三方平台提供;Odyssey-3 則因尚未發布,任何人都還拿不到。在這樣的流程中,路由層真正證明自身價值的地方,在於影片模型之上的那一層——負責草擬分鏡清單的語言模型、拿生成畫面與需求簡報比對的視覺模型、把錄製好的旁白轉成字幕的轉錄模型。這些都是再普通不過的路由工作負載,而它們都跑在單一 API,涵蓋 200 多款模型,以供應商定價計費、零加成,因此供應商降價當天就會反映在你的帳單上,而不必等到下一次合約續約。對多階段流程而言,真正關鍵的是路由 DSL:把多個模型組合成單一次呼叫,並在供應商服務劣化時自動容錯移轉,這樣渲染步驟就不會因為提示詞模型的端點當天狀況不佳而失敗。上述這些都無法託管 FLUX 3 Video 或 Odyssey-3,本文也從未如此宣稱。

哪一個,給誰?
如果你的交付成果是一個檔案——一段片段、一個精簡版、一份預視覺化——FLUX 3 Video 就是你今天就能買到的選擇,有公開的每秒計價,具備原生音訊與二十秒單次生成的輸出,而廠商宣稱的 Elo 分數是合理的加分項,而不是選擇它的理由。如果你的交付成果是一個必須在硬體上運作的控制器,Odyssey-3 才是針對你的問題而設計的,而誠實的建議是:再等等。目前沒有價格、沒有日期,也沒有任何獨立的數據,而且 77% 的 sim-to-real 數字是 Odyssey 自家提供的,尚未被重現。
值得關注的不是哪個模型勝出,因為它們並不是在競速。而是當外部團隊能運行 Odyssey-3 之後,它的動作解碼器是否能泛化到公告所列出的六種具身型態。若這點成立,那是潛在收益最大的主張,而目前支持它的證據是一連串示範,而不是一項量測。

