Odyssey-3 對比 Grok Imagine Video 的標題卡,左側面板標題為 Odyssey-3,標示互動式環境、未公布價格、832x480 或 1280x720 Pro、無音訊;右側面板標題為 Grok Imagine Video,標示 xAI Imagine API、按秒計費、由你製作的片段、1.5 版原生 1080p、Physics-IQ -4.04 pp 排名第 13。
Guides & Insights

Odyssey-3 vs Grok Imagine Video:按量計費的影片 API 對上未定價的模擬器

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Grok Imagine Video 附有價目表,卻沒有任何操控它的方法。Odyssey-3——Odyssey 於 2026 年 10 月 8 日以公開研究預覽形式推出——附有操控它的方法,卻完全沒有價目表。這種不對稱,而非任何一列基準測試數據,才是這場對決的真正樣貌:xAI 按秒販售生成影片,並針對每種解析度公佈費率;而 Odyssey-3 則以互動式世界模型的形式推出,你可以在瀏覽器中驅動它,目前還無法購買。其中一個,你今天下午就能放進產品裡。另一個,你只能評估。

他們也對影片生成的用途看法不一,而這種分歧也反映在廠商的頁面上。Grok Imagine Video 的說明文件以參考圖像、釘選影格、對嘴語音和聲音參考為開頭——這是製作控制的詞彙。Odyssey-3 的開頭則是一個環境,會在你穿梭其中或觸發事件時預測接下來會發生什麼。兩者都是輸出影片的擴散式生成器。除了這句話之外,兩者幾乎沒有重疊。

每一項是什麼

Odyssey-3是一款自迴歸擴散 Transformer。Odyssey 將其描述為一個多步驟影片擴散模型,以教師強制與因果遮罩進行自迴歸式延伸,因此它能從先前的觀察結果接續,並在動作輸入的條件下預測未來狀態,接著透過分佈匹配與對抗式蒸餾,被蒸餾成可即時互動的少步數變體。它以 832×480 運行,Odyssey-3 Pro 則為 1280×720,公開預覽版提供第一人稱導航、第三人稱導航以及獨立鏡頭移動。沒有音訊。

Grok Imagine Video是 xAI 在 Imagine API 中的影片模型。目前世代為 Grok Imagine Video 1.5,xAI 的發行說明記載其支援文字轉影片、圖像轉影片與參考轉影片,並可選用預設語音,且前兩者原生支援 1080p——其中文字轉影片在底層是以文字轉圖像再接圖像轉影片的方式實作。它最多接受十四張參考圖像與三個語音參考,支援固定影格與脣形同步語音,並按生成輸出的每秒計費。較早的 grok-imagine-video 仍有文件記載且仍有定價,480p 為每秒 $0.05,720p 為每秒 $0.07,輸入影片以每秒 $0.01 計費,輸入圖像則為 $0.002。

費率表,也就是你實際上可以據以規劃的部分

xAI's Grok API documentation page for grok-imagine-video, read 9 October 2026, showing the model header with a “Latest” badge, an at-a-glance table listing modalities as text, image and video under the heading “Text > Video”, a pricing heading, and release notes tabs, with the navigation marked “APIs / Grok / Build”.

• 價格 — G​rok Imagine Video 按秒計費:原始模型在 480p 為每秒 $0.05、720p 為每秒 $0.07,而 G​rok Imagine Video 1.5 在 480p、720p 與 1080p 下自每秒 $0.08 起。G​rok Imagine Video 1.5 Lite 最高支援 1080p 與十五秒,起價為每秒 $0.02。Odyssey-3 完全沒有公布價格;其唯一公開的成本數字,是排行榜的標準化估算值:Odyssey-3 每支生成影片為 $0.139,Odyssey-3 Pro 則為 $0.267。

• 一支十秒的短片,換算下來——在 Grok Imagine Video 上,480p 是 $0.50,720p 是 $0.70;Grok Imagine Video 1.5 是 $0.80;Lite 方案則是 $0.20。Odyssey-3 無法用這種方式定價,因為你買不到它的十秒。

• 解析度 — Grok Imagine Video 1.5 在文字轉影片與圖像轉影片上原生支援 1080p。Odyssey-3 在 Pro 方案中最高僅達 1280×720。

• 時長 — G​rok Imagine Video 1.5 Lite 可達十五秒。Odyssey-3 的單位不是一段短片,而是一次工作階段,其長度取決於預覽能讓其預測保持連貫多久。

• 音訊 — Grok Imagine Video 會生成脣形同步的語音,並接受語音參考。Odyssey-3 則完全不生成。

• 控制 — 參考圖像、釘選影格、第一幀與最後一幀,以及語音參考,全部在生成前指定。相對於生成期間的即時導覽與生成中途事件。Grok 的是創作;Odyssey-3 的是互動。

• 可用性 — 現在可自助取得 Gro​k Imagine Video 的 API 金鑰。Odyssey-3 則提供聯絡表單與瀏覽器預覽。

物理委員會把它們放在哪裡

Physics-IQ Verified 是 Anates Labs 與 DeepMind 推出的基準測試,用來為真實物理實驗的續接預測評分,目前收錄了 41 個模型的排名,而這兩者都名列其中——這也讓它成為唯一能讓兩者同場比較的第三方平台。

• G​rok Imagine Video — 排名第 13,相較於賽道平均值,淨改善為 −4.04 個百分點;在使用該基準測試自身提示詞、24 fps 的情況下,每部影片的標準化成本為 $0.352。

• Odyssey-3 — 在同一提示集上以 +2.15 個百分點與 $0.129 排名第 8,並在自訂提示上以 +9.99 個百分點排名第 3。

這個差距並不小,而且也不是解析度造成的假象:在輸入允許的情況下,排行榜會將成本標準化為 24 fps 與 1280 寬的輸出,並且列出每一列的提示模式。負的淨改善分數並不表示 Grok Imagine Video 會產生糟糕的影片——它顯然不會,而且它已在生產環境中使用,價格也讓它易於採用。這表示在正確延續一項物理實驗的特定任務上,它的表現比該排行榜上的平均模型更差,而 Odyssey-3 在兩種不同的提示模式下,都優於該排行榜上的平均模型,可謂雙重勝出。

Odyssey-3 自家最引人注目的說法還要更強:Odyssey-3 Pro 在影片轉影片項目上拿下 66.1,是 Odyssey 所報告的最高分,而同級別在圖片轉影片上還有 54.7。這些數字來自 Odyssey 自家的說明,而非獨立跑分,因此也應該以這種角度來解讀。

Two-column scoreboard headed “Odyssey-3 vs Grok Imagine Video — the scoreboard” with six shared dimension labels. Odyssey-3: published price none; 832x480, 1280x720 Pro; a session, not a clip; no audio; Physics-IQ board prompts +2.15 pp rank 08; custom prompts +9.99 pp rank 03. Grok Imagine Video: $0.05/sec at 480p and $0.07/sec at 720p; native 1080p on version 1.5; up to 15 seconds on the Lite tier; lip-synced speech and voice references; Physics-IQ -4.04 pp rank 13; no custom-prompt entry. Footer: “Odyssey-3 figures vendor-reported and unreproduced; Grok Imagine Video rates per xAI documentation; Physics-IQ Verified board read Oct 9 2026”.

價目表未涵蓋的事項

每秒費率背後隱藏著一種值得點名的類別差異,因為它決定了你真正想要的是其中哪一個。

Grok Imagine Video 的計費模式——按輸出每秒計價——是對吞吐量的承諾。每一美元都買到固定數量的完成影片,而唯一的問題是,1080p 且具備唇形同步的十五秒影片是否值 1.20 美元。對於廣告單元、社群範本、行銷管道而言,這是個絕佳的問題,且答案乾淨俐落;而每秒 0.02 美元的 Lite 方案,讓答案在大多數情況下都變得容易。

Odyssey-3 並不是以那種方式計費,也不可能如此,因為它的產出並不是固定量。互動式環境的消耗取決於某人在其中停留多久,以及他們改變心意多少次,而這讓按秒計費的模式變得毫無意義。當 Odyssey 公布價格時——目前沒有任何跡象顯示會是何時——那勢必會是工作階段價格、運算價格,或是這個類別尚未發明出來的某種東西。這並不是反對 Odyssey-3 的論點。這正是目前無法完成這兩者之開發者比較的原因。

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

今天去那個按錶計費的

Grok Imagine Video 是 xAI 自家的 API,而 OrcaRouter 並未託管它。Odyssey-3 不在任何我們能驗證的託管平台上,而且即使它在,也沒有公開的費率可供任何人路由。

一把 OrcaRouter 金鑰所能觸及的,是你會用來建構這項比較的其餘影片與模型堆疊:以每秒 0.08 美元提供 768P 輸出的 MiniMax-H3、Kling 影片系列,以及單一端點後方的 200 多個模型,全數以供應商定價、0% 加價提供——因此當某家實驗室調降每秒費率時,你的用量當天就會反映這項變更,而不必等到下一次合約續約。跨供應商的自動容錯移轉可讓混合多種影片模型的批次作業,不會因為某個上游的糟糕時段而失敗;而路由 DSL 讓你能把一個託管的影片模型與一個文字或視覺模型放在同一個介面之後,這正是先產生再評估的流程實際所需。目前該目錄中既沒有 Odyssey-3,也沒有 G​rok Imagine Video。

你想要哪一個?

如果你需要帶有聲音的 1080p 影片輸出,價格要能放進試算表,而且本週就要拿到,那麼 G​rok Imagine Video 是可行的答案,而 Odyssey-3 不是候選——它沒有音訊、解析度上限更低,也無處可買。

如果你正在打造任何必須預測某個行動之後會發生什麼事的東西——一個策略、一個控制迴路、一個訓練環境——價目表無關緊要,物理排行榜則不然。Odyssey-3 正是依這項能力接受評分,而且它在排行榜上名列前茅;Grok Imagine Video 很擅長產出完成度高的成品鏡頭,卻在同一項測試中低於該賽道平均。問題不同,而答案並不重疊。