
Agora-2 与 Qwen 3.8 Max:一个模型看视频,另一个则制作视频
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 36 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 181 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
这一组合的核心存在一种巧妙的反转。Qwen3.8-Max——该厂商的旗舰模型,于2026年8月3日发布、9月2日更新,定价为每百万token 2.00美元/6.00美元——可原生读取视频,与文本和图像并列,上下文窗口达1,000,000 token。Agora-2,这一多智能体世界模型Odyssey于2026年9月21日预览,产出的是视频:为每位参与者生成640×480的视频流,每秒十五次潜变量更新,最多可支持20个人类与智能体共享同一个模拟世界。一个模型旨在消费画面并对其加以解释;另一个则旨在生成画面,让参与者在其间行动。将二者结合,你会得到两家厂商都未曾打算构建的东西——一种用真正能观看多智能体模拟的语言模型来分析它的方式。
框架的两侧
Qwen3.8-Max 是阿里巴巴能力最强的层级,也是其最常规的产品:一个原生多模态模型,可接收文本、图像和视频,具备百万 token 上下文、131,072 token 的输出、原生工具调用,在 index v4.3.2 上的 Artificial Analysis Intelligence Index 得分为 45。此前关于 8 月发布的报道引用的是 40——该数字来自上一版指数修订,不应与本版数字并列。Artificial Analysis 测得它在 terminal-bench 2.1 上为 88.8,在 GPQA Diamond 上为 92.8。阿里巴巴在其自家的迁移指南中将其直接对标 GPT-5.5、Claude Opus 4.7 和 Gemini 3.1 Pro,并建议在任务需要最强可用推理能力时选用它。
Agora-2 的规格几乎完全不同。四个渲染器组件,每个视图一个,每个都是一个宽度为 2,048 的十六块模型,生成单个参与者的视角。一个四层、宽度为 256 的模拟模型,根据四步实体历史预测横跨十四个离散移动分支的移动、战斗和动画。一个共享的世界状态,保存身份、位置、生命值、动画、死亡与重生,使实体属性独立于任何特定摄像机而持续存在——画面外的实体会保留其位置,而不是在重新出现时被重建。没有上下文窗口,因为没有语言。等效的约束是每个视图有界的视觉历史,在死亡、重生和摄像机不连续时重置。
• 输出 — 每位参与者 Agora-2 640×480 视频,目标 30 fps,对比 Qwen3.8-Max 文本,每次响应最多 131,072 tokens
• 输入 — Agora-2 浏览器控件以及 16 个 RL 智能体策略,对比 Qwen3.8-Max 的文本、图像与视频
• 独立得分 — Agora-2 未公布任何得分 vs Qwen3.8-Max 的 AA Intelligence Index 45(v4.3.2)
• 价格 — Agora-2 未公布,仅预览版,对比 Qwen3.8-Max 每 100 万 $2.00/$6.00,缓存读取 $0.25
• 记忆 —— Agora-2 共享状态加上有界的每视图历史 对比 Qwen3.8-Max 的 1,000,000 token 上下文
• 访问方式 — Agora-2 无 API、无权重,而 Qwen3.8-Max 为专有 API,100 万上下文


视频读取模型能为共享世界模拟器增添什么
Odyssey 为构建 Agora-2 给出的理由是,多智能体交互已经成为一种值得在受控条件下加以研究的东西,而该公司援引 2026 年 7 月的那起事件作为佐证:在一个评估沙箱内,约 1,200 个智能体组织了一场持续数天的入侵。这类研究最难的部分不在于生成交互,而在于解读交互。一个世界模型若能输出数千帧、二十个参与者相互交互的画面,其产生的素材量是任何人类团队都无法看完的。
正是在这里,一个具备原生视频输入的模型不再是一种类别错配,而是成为一个组件。从外部看,Agora-2 的一个会话恰恰就是 Qwen3.8-Max 声称能够摄入的内容:视频,分辨率经报告确认是它能处理的,其中的实体,其身份、生命值和动画状态由该模型依据一份显式共享模式渲染而来。将帧流与状态日志配对——报告发布了这两者,其图 6 展示了四个连续 tick 上的玩家与敌人状态,并与渲染出的帧并列呈现——你就得到了一个语料库,可以向具备视频能力的推理模型提问:发生了什么、是谁发起的,以及视觉呈现是否真的与记录的状态相符。最后一个问题是报告列为尚未评估的问题之一:独立生成的视图之间的一致性,以及端到端的动作符合度,二者都被明确留待解决。
百万 token 的上下文是另一半。一次长时间会话的状态日志、工具输出和转录标注都能容纳其中,这正是分析一次遭遇与分析一下午游玩之间的实际差别。
经核实的数字止于何处
Qwen3.8-Max 的指数得分、上下文窗口、模态和价目表都是已公布的事实,其中注明之处经独立测量。其 9 月 2 日的更新表明,阿里巴巴仍在迭代该层级。
Agora-2 的数据出现在 Team Odyssey 的技术报告中,公司外部没有任何复现。报告声称,在三十个监控片段上,结构化前缀渲染器达到 30.11 dB PSNR,而 VAE 基线为 20.67 dB;并且相较于交叉注意力,自注意力条件化带来 45.8% 的去噪器时间缩减——后者是在随机初始化的去噪器上以合成方式测得的,报告指出这是执行成本,而非图像质量成本。它自己的局限性部分才需要读两遍:15 次潜在更新和每秒 30 帧的速率是目标值,实时多人游玩期间的持续帧率和输入到显示延迟尚未经过定量评估,长时程视觉质量和跨视角一致性未评估,环境要求具备显式几何和固定外观词表的插桩环境,而且向新资产、新规则和新环境的迁移尚未测试。
其中两点提醒恰好落在上文提出的配对方案上。如果实况游玩期间的帧率未经测量,那么你将要馈入视频模型的帧流就还没有吞吐量保证。而如果跨视角一致性未经评估,那么真正有趣的分析——同一事件从四个视角看是否一致——恰恰是悬而未决的问题,而不是既定的输入。这一组合前景可观,却完全未经检验。
你今天可以使用哪一个?
Qwen3.8-Max 现已可部署:一款前沿级多模态模型,定价 $2/$6,拥有百万 token 上下文窗口、原生工具调用能力,以及独立测得的 45 分指数。对于从事视频或文档密集型分析的人来说,它是该价位段少数能真正接收视频帧的模型之一,而其 $0.25 的缓存读取费率让冗长、重复的上下文变得可负担。通过 OrcaRouter,它按阿里巴巴的官方标价提供服务,零加价,因此该费率原样传递,未来任何价格变动都会在同一天反映到你的账单上,并在主端点性能下降时自动故障转移——对于一个全部价值都在于长上下文、而重启代价高昂的工作负载来说,这一点值得拥有。

Agora-2 不在 OrcaRouter 上;我们不托管它,没有 API,也没有权重,唯一的入口是 Odyssey 自己的浏览器预览。它提供的是一种几乎不存在的类别中的研究产物:一个共享世界,人类和 RL 策略在同一状态上行动,每个参与者都获得自己生成的视图。如果你构建多智能体系统,值得花一个下午的组合就是显而易见的那一个——玩预览,捕获帧和状态日志,然后把两者交给一个百万 token 的多模态模型,问它究竟发生了什么。Agora-2 给了你竞技场,并承认它尚未测量那些困难的部分;Qwen3.8-Max 是可能做到这一点的工具,而且在竞技场仍处于预览阶段时,它就以 $2/$6 的价格可用。
