Odyssey-3 對比 Kandinsky 6.0 Video 的標題卡,左側面板標題為 Odyssey-3,內容寫著一個互動式環境,是 2026 年 10 月 8 日開放的研究預覽,832x480 或 1280x720 Pro,沒有權重,也沒有價格;右側面板標題為 Kandinsky 6.0 Video,內容寫著 2026 年 10 月 6 日以 MIT 授權開放權重,5 秒短片搭配 44 kHz 音訊,Full HD 1920x1080,Physics-IQ 未提交。
Guides & Insights

Odyssey-3 對比 Kandinsky 6.0 Video:開放權重與音訊,對抗封閉的互動式預覽

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Kandinsky 6.0 Video 於 2026 年 10 月 6 日推出,帶來開源模型發布首日罕見的東西:Diffusers、ComfyUI、vLLM-Omni、SGLang 和 FastVideo 的支援,全都記錄在該儲存庫自己的更新日誌中,同時還有 10 月 4 日提交的 arXiv 報告,以及 Hugging Face 上以 MIT 授權的檢查點。Odyssey-3 於兩天後、10 月 8 日登場,作為一個自迴歸擴散 Transformer 的公開研究預覽,它能從提示詞建構環境,並在你穿梭其中時即時預測變化。一個是 290 億參數的模型,你今晚就能下載並在自己的 GPU 上執行。另一個則是互動式系統,只能透過 Odyssey 的瀏覽器預覽和聯絡表單才能使用。它們是 2026 年 10 月同一週裡「影片模型」意義的兩個極端,而兩者之間的選擇,與其說關乎基準測試,不如說關乎誰掌握權重。

它們對你的要求也各不相同。Kandinsky 6.0 Video 是生成模型:輸入提示詞,輸出帶有同步音訊的五秒短片。Odyssey-3 是預測模型:你採取行動,世界隨之回應。這兩者無法互相取代,而它們相隔 48 小時推出這一事實,是它們所能提供的最有用脈絡。

這兩種架構,以廠商自己的說法

Kandinsky 6.0 Video是一系列用於同步音視訊生成的基礎擴散模型,包含 3B 參數的 Kandinsky 6.0 Video Lite 與 29B 的 Kandinsky 6.0 Video Pro。兩者皆能在文字轉音視訊與圖像轉音視訊模式下,生成五秒長、具備同步 44 kHz 音訊(含脣形同步)的短片,並可透過外掛的的超解析度模型將輸出提升至 Full HD 1920×1080。其技術核心為雙串流 CrossDiT,透過雙向交叉注意力將預先訓練的視訊串流與新訓練的音訊串流連接起來,使兩種模態在時間與語意上相互對齊,而非分別生成後再進行混流。訓練流程是連續式的:音訊串流先在大規模音訊語料庫上從頭訓練,接著在配對的音視訊資料上聯合訓練兩條串流,同時維持單一模態的保真度,之後再進行監督式微調、強化學習後訓練與蒸餾。

Odyssey-3 是 Odyssey 所描述的一種自迴歸擴散 Transformer,它是一個多步影片擴散模型,透過教師強制和因果遮罩加以擴展,經訓練可從先前的觀察繼續,並以動作輸入為條件預測未來狀態,接著再透過分佈匹配與對抗蒸餾,將其蒸餾成一個步驟極少、快到足以互動的變體。它以 832×480 運行,Odyssey-3 Pro 則為 1280×720,不產生音訊,而它的全部目的就在於其輸出取決於你片刻之前的操作。

首日支援,是沒有人會納入基準比較的差異。

The kandinsky-6 repository on GitHub, read 9 October 2026, showing the kandinsky-lab organisation, main branch and 2 branches, 0 tags, a fix/comfyui-lite-distill commit, folders for assets, comfyui, kandinsky, scripts and tests, and repository files including JUSTFILE, LICENSE, README.md, pyproject.toml and uv.lock under an MIT license badge.

再次閱讀 Kandinsky 6.0 更新日誌,因為它是這項比較中最具體的事實。10 月 6 日,該專案記錄了它已在 Diffusers、ComfyUI 節點註冊表、vLLM-Omni、SGLang 與 FastVideo 中可用,以及為蒸餾版 Pro 模型提供的 Hugging Face Space。那是一天內五個獨立的推論堆疊。對於任何曾等待數月、希望某個檢查點能進入服務框架的人來說,那正是決定模型是否可用的數字。

現在把它和 Odyssey-3 的存取故事放在一起對照。預覽版在 experience.odyssey.systems 上運行,具備第一人稱導覽、第三人稱導覽與獨立相機移動。API 存取方式是一份聯絡表單。沒有定價頁面、沒有速率限制文件,也沒有自助式金鑰。該網站的 API 條款最後更新於 2026-01-22,至今仍規範「Odyssey-2 API 的原型」——商業層面並未針對本月推出的模型改寫。

• 運行位置 — 你自己的 GPU,權重與程式碼採 MIT 授權,僅對照 Odyssey 的伺服器。

• 你如何整合它 — Diffusers 管線、ComfyUI 節點、vLLM-Omni、SGLang、FastVideo,對比瀏覽器預覽與聯絡表單。

• 你可以檢視什麼——公開報告中的架構、訓練配方與檢查點大小,相對於廠商對訓練流程的描述,而後者既沒有權重,也沒有論文。

• 你可以修改的部分——微調、LoRA、量化與蒸餾,而這些社群在發布隔天就已經在 Hugging Face 上發布了——對比之下,什麼都沒有。

逐維度地

Two-column scoreboard headed “Odyssey-3 vs Kandinsky 6.0 Video — the scoreboard” with six shared dimension labels. Odyssey-3: an interactive environment; 832x480, 1280x720 Pro; a world that responds; no published price; no licence and no weights; Physics-IQ +9.99 pp rank 03. Kandinsky 6.0 Video: five-second clip with audio; Full HD 1920x1080; 3B Lite and 29B Pro parameters; $0 per clip on your own GPU; MIT with weights on Hugging Face; Physics-IQ not submitted. Footer: “Odyssey-3 figures vendor-reported and unreproduced on Physics-IQ Verified; Kandinsky 6.0 Video absent from that board”.

• 輸出 — 兩個 Kandinsky 層級皆提供附有同步 44 kHz 音訊的五秒片段,而 Odyssey-3 則是無音訊的互動環境。

• 解析度 — 透過 Kandinsky 6.0 Video 的外掛程式超解析度模型,可達 Full HD 1920×1080,相較之下 Odyssey-3 為 832×480,Odyssey-3 Pro 則為 1280×720。

• 輸入模態 — Kandinsky 接受文字與圖像,以及文字轉音訊視訊與圖像轉音訊視訊模式;Odyssey-3 則接受提示詞與即時控制輸入。

• 參數 — Lite 與 Pro 層級公佈為 3B 和 29B,而 Odyssey-3 的兩個層級則未公開。

• 硬體 — 一張 NVIDIA GPU 與 Python 3.13 或 3.14,並隨附供 Kandinsky 使用、適用於 H100/H200 到 RTX 5090 等級顯示卡的預設集;以及供 Odyssey-3 使用的瀏覽器。

• 價格 — 如果你有 GPU,Kandinsky 6.0 Video 每段影片為 $0;相較之下,Odyssey-3 完全沒有公布任何價格。該排行榜對 Odyssey-3 與 Odyssey-3 Pro 的標準化成本估計分別為每支生成影片 $0.139 和 $0.267,不包括提示處理。

• 第三方評分——兩款模型自身的生成結果都未納入獨立的正面對決。Kandinsky 的報告仰賴與其前代進行的並排人工評估;Odyssey-3 的數據則來自一項基準測試提交,外加一場由廠商執行的評估。

• 授權條款 — Kandinsky 6.0 Video 採用 MIT 授權,相較之下並未發布任何授權條款,因為沒有可供授權的權重。

基準測試能說些什麼,又不能說些什麼

Kandinsky 6.0 Video 並未出現在 Physics-IQ Verified 上——這個由 Anates Labs 與 DeepMind 設立、為 41 個模型評分其對真實物理實驗續接表現的排行榜,也沒有收錄它。Odyssey-3 在此的正面對決搭檔同樣不在榜上,因為該排行榜評分的是會生成影片片段的模型,而這兩者都符合。這個排行榜確實收錄的,是 Kandinsky 較早的世界模型系列 Kandinsky-WM 1.0,排名第 20,且相較賽道平均值為 −8.02 pp——那是不同的家族、不同的用途,也是榜上唯一的 Kandinsky 條目。

Odyssey-3 的資料列,作為對照:在基準測試自身的提示上排名第 8,達 +2.15 個百分點,每部影片 $0.129;在自訂提示上排名第 3,達 +9.99 個百分點,而 Odyssey-3 Pro 整體排名第二,達 +11.15 個百分點。這些數字比 Kandinsky 系列在那項特定測試上的任何結果都更好,而且它們測量的也是不同的能力——Odyssey-3 的評分依據是它在受到擾動後預測出什麼,而這正是其預覽所推銷的同一件事。

Kandinsky 自己的證據是技術報告中的人類評估:Kandinsky 6.0 Video Pro 明顯優於前代 Kandinsky 5.0 Video Pro,並且在與領先的音訊視訊生成模型競爭時仍具競爭力,尤其是在語音品質方面。那是廠商自行進行的並排比較,而這類主張是任何擁有 5090 和一個下午的人都能拿已發布的檢查點來驗證的。Odyssey-3 的同等主張則無法讓任何沒有 API 金鑰的人驗證。

OrcaRouter's own model page for minimax/minimax-h3, showing the model header “text + image + video + audio”, output video, a p50 time-to-first-token of 406 ms, performance and vision/audio badges, and a Python code sample on the left with the model list and playground navigation above.

聯繫他們

OrcaRouter 並未託管這兩個模型,也永遠不會暗示相反的情況:Odyssey-3 沒有公開的費率可供任何人路由,而 Kandinsky 6.0 Video 是開放權重,這表示正確的執行方式是在你自己的 GPU 上使用該儲存庫本身的設定,而不是託管端點。

一把 OrcaRouter 金鑰能派上用場的地方,就是實驗外圍的那一層。Kandinsky 的儲存庫假設你自備 GPU、環境與比較基準;它沒提供的,是讓你呼叫想用來與它對照評測的模型的方法。超過 200 款模型藏在一把 OrcaRouter 金鑰之後,以供應商原價、零加成提供——包括 minimax/minimax-h3,這是 MiniMax 於 2026 年 7 月 31 日發布的開放權重影片模型,768P 輸出每秒 0.08 美元——所以供應商調價當天就會反映在你的帳單上,自動容錯移轉讓一輪評估掃描不會因為某家上游的糟糕時刻而中斷,而路由 DSL 讓你能在任務是先生成、再評分時,把一個代管影片模型和一個視覺模型放在同一個介面後面。你仍然得自己複製儲存庫並執行設定。你只是不必再打造這套設備的另一半。

你真正想要哪一個?

如果你需要你能擁有的輸出——你可以讀懂的商業條款、你可以微調的權重、不需要別人的 API 處於上線狀態就能運行的管線——Kandinsky 6.0 Video 就是答案,而首日框架支援意味著你不是在賭一個研究產物。如果你需要影片有聲音,它是兩者中唯一會生成聲音的。

如果問題在於預測,而不是產出——一個必須做出反應的策略、一個訓練環境、任何下一個狀態取決於上一個動作的情況——Odyssey-3 是兩者中唯一能做到的,而它也是你買不到的那一個。這就是這兩者在雙雙問世的那一週,這場對決最誠實的樣貌:一個你可以下載的開放模型,以及一個你只能試用的互動式模型,而且基準測試證據偏向封閉的那一個,實際應用證據則偏向開放的那一個。