
Odyssey-3 对决 Kandinsky 6.0 Video:以开放权重和音频对抗封闭的交互式预览
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Kandinsky 6.0 Video 于 2026 年 10 月 6 日发布,带来了开源模型发布首日难得一见的东西:对 Diffusers、ComfyUI、vLLM-Omni、SGLang 和 FastVideo 的支持,全部记录在该仓库自己的更新日志中,同时还有 10 月 4 日提交的 arXiv 报告,以及 Hugging Face 上以 MIT 许可发布的检查点。Odyssey-3 两天后的 10 月 8 日到来,是一个自回归扩散 Transformer 的公开研究预览版,它能根据提示词构建环境,并在你穿行其中时实时预测变化。一个是 290 亿参数的模型,今晚你就能下载并在自己的 GPU 上运行。另一个是交互式系统,只能通过 Odyssey 的浏览器预览和联系表单访问。它们是 2026 年 10 月同一周里"视频模型"这个词所代表的两个极端,而在这两者之间做选择,与其说关乎基准测试,不如说关乎谁掌握着权重。
它们对你的诉求也各不相同。Kandinsky 6.0 Video 是一个生成模型:输入提示词,输出一段带同步音频的五秒视频片段。Odyssey-3 则是一个预测模型:你采取行动,然后观察世界如何回应。两者无法相互替代,而它们相隔 48 小时发布这一事实,是二者各自所能提供的最有用的背景信息。
两种架构,用供应商自己的话说
Kandinsky 6.0 Video 是一个用于同步音视频生成的基础扩散模型系列,包含 3B 参数的 Kandinsky 6.0 Video Lite 和 29B 参数的 Kandinsky 6.0 Video Pro。两者都能生成带有同步 44 kHz 音频的五秒片段,包括唇形同步,支持文本到音视频和图像到音视频模式,并可通过一个插件式超分辨率模型将输出提升至 Full HD 1920×1080。其技术核心是双流 CrossDiT,它通过双向交叉注意力将预训练的视频流与新训练的音频流连接起来,使两种模态在时间和语义上实现对齐,而不是分别生成后再合流。训练方案是连续式的:音频流首先在大规模音频语料上从零开始训练,然后两条流在配对的音视频数据上联合训练,同时保持单模态保真度,随后进行监督微调、强化学习后训练和蒸馏。
Odyssey-3 是一种自回归扩散 transformer,Odyssey 将其描述为一个多步视频扩散模型,通过教师强制与因果掩码加以扩展,训练它从先前的观测继续,并以动作输入为条件预测未来状态,随后再通过分布匹配与对抗蒸馏,蒸馏成一个步数极少、快到足以与之实时交互的变体。它以 832×480 运行,Odyssey-3 Pro 则为 1280×720,不生成音频,而它的全部意义就在于:其输出取决于你片刻之前做了什么。
首日支持,是无人衡量的差异

再读一遍 Kandinsky 6.0 的更新日志,因为它是这次比较中最具体的事实。10 月 6 日,该项目记录了在 Diffusers、ComfyUI 节点注册表、vLLM-Omni、SGLang 和 FastVideo 中的可用性,以及一个用于蒸馏版 Pro 模型的 Hugging Face Space。那是一天之内五个独立的推理栈。对于任何曾等待某个检查点数月才进入某个服务框架的人来说,正是这个数字决定了该模型是否可用。
现在把它和 Odyssey-3 的访问情况放在一起看。预览版运行在 experience.odyssey.systems,提供第一人称导航、第三人称导航和独立摄像机移动。API 访问方式是一个联系表单。没有定价页面,没有速率限制文档,也没有自助获取的密钥。该网站的 API 条款最后更新于 2026-01-22,并且仍然管辖“Odyssey-2 API 的原型”——商业层面尚未针对本月发布的模型重写。
• 运行位置——你自己的 GPU,权重和代码采用 MIT 许可,仅与 Odyssey 的服务器配合使用。
• 你如何集成它——Diffusers pipeline、ComfyUI 节点、vLLM-Omni、SGLang、FastVideo,对照浏览器预览与联系表单。
• 你能检查的内容——公开报告中的架构、训练配方和检查点大小,对比供应商对训练流程的描述:既没有权重,也没有论文。
• 你能修改的是什么——微调、LoRA、量化与蒸馏,而这些社区在发布次日就已经在 Hugging Face 上发布了——与之相对的,则是完全无从修改。
逐个维度

• 输出——为两个 Kandinsky 层级生成带同步 44 kHz 音频的五秒片段,而 Odyssey-3 面对的是无音频的交互式环境。
• 分辨率 — 通过适用于 Kandinsky 6.0 Video 的插件超分辨率模型实现全高清 1920×1080,而 Odyssey-3 为 832×480,Odyssey-3 Pro 为 1280×720。
• 输入模态 — Kandinsky 为文本和图像,采用文本到音频-视频和图像到音频-视频模式;Odyssey-3 则为提示词加实时控制输入。
• 参数量 — Lite 和 Pro 两个层级已公布 3B 和 29B,而 Odyssey-3 的两个层级均未披露。
• 硬件 — 一块 NVIDIA GPU 以及 Python 3.13 或 3.14,并针对 Kandinsky 提供了从 H100/H200 到 RTX 5090 级显卡的预设;Odyssey-3 则需要一个浏览器。
• 价格 — 如果你有 GPU,Kandinsky 6.0 Video 每个视频片段为 $0;而 Odyssey-3 则没有任何形式的公开价格。该榜单对 Odyssey-3 和 Odyssey-3 Pro 的归一化成本估算分别为每个生成视频 $0.139 和 $0.267,不包括提示词处理。
• 第三方评分——两个模型自身的生成结果都没有参与独立的正面交锋。Kandinsky 的报告依赖的是与其前代产品进行的并排人工评估;Odyssey-3 的数据则来自一次基准测试提交以及一项由厂商自行开展的评估。
• 许可证 — Kandinsky 6.0 Video 采用 MIT 许可证,而后者没有已发布的许可证,因为没有可供许可的权重。
基准测试能说明什么,不能说明什么
Kandinsky 6.0 Video 没有出现在 Physics-IQ Verified 上,这是 Anates Labs 和 DeepMind 的榜单,对 41 个模型在真实物理实验延续任务上的表现进行评分。Odyssey-3 在这里的正面交锋对象也没有出现,因为该榜单评分的对象是能生成片段的模型,而这两者也都能生成片段。榜单上确实收录的是 Kandinsky 更早的世界模型系列 Kandinsky-WM 1.0,排名第 20,较赛道均值为 −8.02 个百分点——属于不同的家族、不同的用途,也是榜单上唯一的 Kandinsky 条目。
相比之下,Odyssey-3 的各行数据为:在基准测试自带的提示词上以 +2.15 个百分点排名第 8,且每条视频 $0.129;在自定义提示词上以 +9.99 个百分点排名第 3,而 Odyssey-3 Pro 以 +11.15 个百分点位列总榜第二。这些数字优于 Kandinsky 系列在那项特定测试上的任何表现,而且它们衡量的还是一种不同的能力——Odyssey-3 的评分依据的是它在受到扰动后预测出的内容,而这正是其预览所宣传的卖点。
Kandinsky 自身的证据是技术报告中的人工评估:Kandinsky 6.0 Video Pro 明显优于其前代 Kandinsky 5.0 Video Pro,并且与领先的音视频生成模型相比仍具竞争力,尤其是在语音质量方面。那是厂商进行的并排对比,而这类说法,任何有一块 5090 和一个下午的人都可以拿已发布的检查点来核验。Odyssey-3 的同类说法,则任何没有 API 密钥的人都无法核验。

联系他们
OrcaRouter 并不托管这两款模型中的任何一款,也绝不会暗示自己托管了它们:Odyssey-3 没有公布任何可供路由的费率,而 Kandinsky 6.0 Video 是开放权重,这意味着运行它的正确方式是在你自己的 GPU 上按照该仓库自带的配置进行部署,而不是使用托管端点。
一个 OrcaRouter 密钥所契合的位置,正是实验外围的那一层。Kandinsky 的仓库假定你自备 GPU、环境和对比基准;它没有提供的,是调用你想用来与它做基准对比的那些模型的方式。超过 200 个模型汇集在单个 OrcaRouter 密钥之后,按提供商标价、0% 加价提供——其中包括 minimax/minimax-h3,这是 MiniMax 于 2026 年 7 月 31 日发布的开权重视频模型,768P 输出每秒 0.08 美元——因此供应商的价格变动当天就会落到你的账单上,自动故障转移让一轮评估扫描不会因为某个上游的一小时故障而中断,而当任务是先做生成、再做打分时,路由 DSL 能让你把托管视频模型和视觉模型放在同一个接口之后。你仍然得自己克隆仓库并运行安装配置。你只是不必再去搭建这套装备的另一半。
你到底想要哪一个?
如果你需要能真正拥有的输出——你能读懂商业条款、能微调权重、无需依赖别人的 API 在线就能运行的流水线——Kandinsky 6.0 Video 就是答案,而且首日框架支持意味着你押注的不是一件研究样品。如果你需要视频有声音,它是这两者中唯一能生成声音的那个。
如果问题在于预测而非生产——一个必须做出反应的策略、一个训练环境、任何下一个状态取决于上一个动作的场景——那么 Odyssey-3 是两者中唯一能做到这一点的,而它同时也是你买不到的那一个。这就是这两者在双双发布的这一周里,这场对决的真实面貌:一个你可以下载的开源模型,和一个你只能试用的交互式模型;基准测试的证据偏向闭源的那一个,而实际应用的证据偏向开源的那一个。
