一張生成的時間軸資訊圖,標題為「前沿研究 vs 生產」,其中有一個標記指向 Google Veo 3.1 於 2025-11-17 正式推出(GA),標註文字為「投入生產十個月」,另一個標記指向 Odyssey-3 於 2026-09-15 預覽,標註文字為「無價格、無日期」,另有 Veo 3.1 的摘要列(原生 4K、可選 48kHz 音訊、約每秒 $0.20-$0.40)以及 Odyssey-3 的摘要列(模擬狀態、驅動硬體、價格未公布)。
Guides & Insights

Odyssey-3 對決 Google Veo 3.1:前沿物理學對上十個月的製作

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Odyssey-3 與 Veo 3.1 之間的比較,其實是兩個日期之間的比較。Veo 3.1 自 2025 年 11 月 17 日起已全面可用——已有十個月的正式環境使用、已公布按秒計價、原生 4K,以及一套至少經歷過一次企業審查的服務堆疊。Odyssey-3 則由 Odyssey 於 2026 年 9 月 15 日發布預覽,沒有公布價格、沒有 API 文件、沒有獨立基準測試,發布時程是「未來幾週」。將它們並列仍然值得,因為它們被一起提及的原因是真實的:Veo 3.1 能渲染出精美的影片,而 Odyssey-3 試圖模擬一個在控制下正確運作的世界。這正是團隊不斷在「影片」這個詞下混為一談的兩種不同產品,而它們之間的差距,正是採購決策的所在。

十個月的出貨能為你帶來什麼

Veo 3.1 的優勢不在於某項功能,而在於時間的累積。這款模型自 2025 年 10 月起以預覽版形式交付付費客戶使用,並自 11 月 17 日起成為正式發行(GA)產品,隨後於 2026 年 3 月 31 日新增 Lite 方案,並於 4 月 2 日推出免費方案。這樣的歷程能造就預覽版無法提供的東西:一份有完整文件記錄的 API 介面、一套從業人員已經摸清的既有失效模式,以及財務團隊可以據以建模的成本曲線。

規格表也反映出同樣的成熟度。Veo 3.1 能以 720p、1080p 和原生 4K 生成,影格率為每秒 24 格,原生時長為 4、6 或 8 秒,更長的輸出則據稱可達 1080p,並可在此之上串接場景延伸。它接受最多三張參考圖像,以維持角色與場景的一致性,另外還有種子值與負向提示的控制項。輸出帶有 SynthID 與 C2PA 的來源追溯中介資料。對於品牌、廣播或大螢幕作品而言,原生 4K 這條路徑是大多數競爭對手根本沒有的單一能力——而這正是 Veo 3.1 能持續拿下那些並非靠價格勝出的專案的原因。

A generated two-column scoreboard for Odyssey-3 vs Google Veo 3.1 sharing six dimension labels: output, max resolution, clip length, audio, price, availability. Odyssey-3 reads world state + actions, not a renderer, continuous rollout, none, not published, preview only. Google Veo 3.1 reads rendered clip, native 4K, 4/6/8s native, 48kHz stereo off by default, ~$0.20/s silent and ~$0.40/s with audio, GA 2025-11-17. Footer: "Odyssey-3 vendor-reported and unreleased; Veo 3.1 figures per Google's published rates."

悄悄讓每一次比較都失準的音訊預設

Veo 3.1 會與畫面同步生成原生 48kHz 立體聲音訊——對白、環境音、擬音——這確實是它最強大的功能之一。不過在 API 上,音訊參數預設為關閉,而且無聲生成的價格低於含音訊生成。在 Google 公布的 Standard 方案中,換算下來大約是無聲每秒 $0.20,對比含音訊每秒約 $0.40。這帶來兩個結果。第一,Veo 片段的實際價格完全取決於一個大多數人從不更改的旗標,因此「每秒 $0.20」和「每秒 $0.40」這兩個數字,對同一個模型來說都可能正確。第二,而且更微妙的是,這意味著你讀過的許多正面對決測試,都是拿無聲的 Veo 3.1 去對上音訊始終開啟的競爭對手,然後在一個會將音訊納入評分的排行榜上為它們打分。如果你的輸出需要聲音,那麼該據以規劃的誠實數字,是音訊開啟的那一個。

Odyssey-3 究竟在聲稱什麼

Odyssey-3 並不是更好的影片生成器,也無意自稱如此。它是一個自迴歸擴散 Transformer,以對世界的視覺觀察進行訓練,而本次發布的核心能力是一個動作解碼器——「附加於世界模型上的學習式輸出元件」,可將模型的內部場景表徵轉換為特定硬體的馬達指令。Odyssey 報告指出,它能從數十小時的示範資料中學會控制機械手臂、即時驅動以 Flexion 打造的人形機器人策略、從以 20 小時模擬資料訓練而成的凍結主幹模型產生閉環駕駛路徑點、讓無人機在室內繞過障礙物飛行,還能遊玩 Grand Theft Auto V,並可移轉至 Red Dead Redemption 2 與 Sleeping Dogs,而無需在那些遊戲中額外進行策略訓練。官方公布的唯一一項比較數字是:以模擬資料訓練的駕駛策略,在安全駕駛員介入之間的行駛距離,約為以真實影像訓練之策略的 77%。

注意那些是哪種類型的主張。它們沒有一項是在講輸出看起來如何。每一項都是在講,模型下游的程式能用它做什麼。

不重疊的維度

輸出 — Google Veo 3.1:一段算繪完成的影片片段,最高可達原生 4K,並可選擇搭配 48kHz 立體聲音訊。Odyssey-3:模擬的世界狀態,以及透過動作解碼器產生的動作指令。

消費者 — Google Veo 3.1:檢視者或編輯器。Odyssey-3:機器人控制器、駕駛策略,或訓練迴圈。

片段長度 — Google Veo 3.1:原生 4/6/8 秒,1080p 可更長,並可透過延伸鏈繼續延長。Odyssey-3:連續生成,沒有片段概念。

價格 — Google Veo 3.1:Standard 等級無聲約 $0.20/秒,含音訊約 $0.40/秒;Fast 與 Lite 等級則更低。Odyssey-3:未公布。

可用性 — Google Veo 3.1:自 2025-11-17 起正式推出。Odyssey-3:2026-09-15 預覽,公開版「預計在未來幾週內」推出。

證據 — Google Veo 3.1:十個月的實際生產使用經驗,以及獨立排行榜的排名。Odyssey-3:僅有廠商演示,沒有基準測試表,也沒有技術報告。

物理學主張真正奏效的地方——以及不奏效的地方

人們很容易假設,物理表現更好的模型就能做出更好的影片,而這並不是 Odyssey 在推銷的東西。影片團隊的問題幾乎從來不是影片裡的世界在物理上不一致——而是鏡頭需要 4K,或者角色在三種不同拍攝設定中必須看起來一模一樣,或者交付成品必須在法務簽核前附上出處中繼資料。Veo 3.1 今天就能回答這些問題。物理精確的模擬器回答的則是另一個問題:我能不能在這裡訓練出某個東西,讓它在那裡也能運作。如果你沒有在訓練任何東西,Odyssey-3 的物理精確度在你的工作流程中,就是一項找不到買家的功能。

兩者真正交會之處在於預視覺化。導演若想以互動方式探索一個空間——帶著攝影機走過片場、改變走位調度、看見隨之而來的結果——他所要的正是世界模型所能提供、而算圖影片片段無法提供的,因為影片片段在生成的那一刻就已固定。這是真實的應用情境,而且也是尚未發布的預覽版本仍無法派上用場的一種情境。

在正式環境中執行這個,而不押注於單一端點

製作團隊之所以在意模型周邊的架構,是因為影片管線很少只靠一次呼叫。提示詞模型草擬鏡頭清單,圖像模型產生起始畫面,視覺模型依據簡報檢查結果,轉錄模型處理旁白。這些每一個都是可能在凌晨兩點故障的相依項目,而且如果你分開購買,每一個都是各自獨立的整合工程。把這一層放到涵蓋 200 多個模型、以供應商定價、0% 加成的一組 API上,就能收斂這些整合工程,而自動容錯移轉意味著提示詞模型故障時會改道,而不是讓算圖佇列停擺。路由 DSL 在這裡比在單一模型工作流程中更為重要,因為將多個模型組合成一次呼叫,正是讓多階段管線能逐階段優雅地失敗、而非整體崩潰的關鍵。明確說明範圍:OrcaRouter 不提供 Google Veo 3.1 或 Odyssey-3,這兩個模型都無法透過它存取。

A screenshot of Odyssey's own announcement page for Odyssey-3, dated September 15th 2026, headed "Introducing Odyssey-3: A General-Purpose Physical Intelligence", with the summary line that Odyssey-3 is a foundation world model that can power robots, drive cars, train AIs, pilot drones, and even play video games.

誰應該現在行動,而誰應該等待?

若你的截止期限就在本季,而交付成果是一個檔案,那麼 Google Veo 3.1 就是站得住腳的選擇;而它的價格——1080p 含音訊約每秒 $0.40,Fast 與 Lite 等級則更低——是一個已在正式環境運行得夠久、久到令人覺得乏味的模型所該付出的成本。請刻意把音訊旗標納入預算,而不是事後才發現它。

如果你的問題是一個必須在硬體上運作的策略,Odyssey-3 就是衝著你來的,而且至今仍然沒有東西可買。等三件事:一個公布的價格、一個是日期而非時間區間的上市日期,以及一個獨立的數字。77% 的 sim-to-real 數據是 Odyssey 自家發布的,在外部人士重新跑過之前,正確的姿態是保持關注,而非著手規劃。在此期間,周邊的技術堆疊才是你能打造的部分,而把它打造得能讓新模型日後直接套入,是成本最低的立足點。

A screenshot of Artificial Analysis's Video Model Comparisons page, showing the Video Arena Quality Elo chart and the representative price-per-minute chart across 15 of 37 video models, including Kling 3.0 at 720p and 1080p, Wan 3.0, MiniMax H3 Max and Gemini Omni Flash.