
Nex-N2.5 Pro 对决 Claude Opus 5:Nex-AGI 选择了标尺,而标尺赢了
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
Nex-AGI 挑中了这把标尺,结果却是标尺赢了。这个总部位于上海的开放模型联盟于 2026 年 9 月 8 日发布 Nex-N2.5 Pro 时,模型卡上的 computer-use(计算机使用)对比表把 Claude Opus 5 放在对照栏、把 Nex-N2.5 Pro 放在挑战者栏:Claude Opus 5 在 OSWorld-2 上得分 68.3,Nex-N2.5 Pro 得分 56.4,两个数字与 Nex-AGI 印在自己模型卡上的分毫不差。此后,独立排行榜上的差距非但没有缩小,反而越拉越大——BenchLM 于 8 月 29 日发布的 OSWorld 2.0 快照在其收录的 15 个模型中将 Claude Opus 5 排在第一,得分 70.6。在自己选择拿出来发布的基准上落后领跑者 12 分,并不是常见的发布编排;正因如此,Nex-N2.5 Pro 对 Claude Opus 5 的看点并不在于这个分数,而在于这组分数的双方究竟是什么:一边是拥有 3970 亿参数的开放计算机使用模型,联盟之外至今没有人能够运行或验证;另一边是 Anthropic 的闭源旗舰模型,它领跑该基准,自 7 月下旬起便一直承载着生产流量。
坦率地说在前头:这不是两个经过测量的事物之间的较量,因为除了制造者之外,只有其中一方被其他人实测过。Nex-N2.5 Pro 是一个稀疏混合专家模型,总参数约 397B,活跃参数约 170 亿,基于 Qwen3.5 谱系进行后训练,目标直指带视觉反馈回路的长时间跨度计算机与浏览器操作。目前它正通过模型卡上 Nex-AGI 链接的免费托管端点对外提供服务,而该模型家族所依据的 Apache-2.0 权重仍标注着“即将推出”,没有任何日期。Claude Opus 5 是 Anthropic 面向高难度推理、编程和智能体任务的生产级旗舰——一款闭源模型,拥有 1M token 上下文、自适应思考调节、明确的标价,以及背后数周的公开排行榜成绩与生产流量。这场对比中的每一项优势都归因于两种事实之一:一个模型可运行、可验证,而另一个两者都做不到。
双方都同意的基准
计算机使用基准测试所奖励的,正是这些模型被构建出来所要推销的行为:一个智能体查看屏幕、决定动作、执行动作,再读取变化后的屏幕来检查动作是否生效。Nex-N2.5 Pro 的架构正是围绕这一循环构建的——视觉并不是事后附加到它身上的输入模态,而是智能体用来校验动作的反馈通道。Claude Opus 5 将同一循环仅视作众多工作负载之一,但它恰好极其擅长于此,这正是 Nex-AGI 最初以其作为参照点的原因。
严格来说,这两个数字并非来自同一测试框架。Nex-AGI 的 OSWorld-2 数据是通过其自有的 NexCUA 评估框架得出的,该公司表示将开源该框架,但尚未发布;而 Nex-N2.5 Pro 的 56.4 分是未经复现的厂商输出。Claude Opus 5 在 BenchLM 上的 70.6 分是 OSWorld 2.0 的第三方快照,日期为 2026 年 8 月 29 日,这与 Nex-AGI 自己引用的排行榜来源 68.3 分一致。不同的测试框架和略有差异的基准版本意味着,确切的差距——在 Nex-AGI 自己的卡片上是 12 分,在 BenchLM 上接近 14 分——应被视为方向性的。但无可争议的是,根据双方可得的最佳数据,Nex-N2.5 Pro 仍低于当前前沿的计算机使用智能体。

关于“我今天能运行它吗”的两个回答

这才是真正决定一支实干团队胜负的分叉,而且它并不偏向新入局者。Nex-N2.5 Pro 的 Hugging Face 模型卡上仍醒目地宣称,权重将以 Apache-2.0 许可“即将发布”,却没有附上任何发布日期。目前仅有的在线构建版本,是 Nex-AGI 从模型卡上链接出来的免费托管端点——可以调用,但归他人所有:没有标价,没有团队可以据此规划的服务条款,也无法在你自己的硬件上复现哪怕一个基准分数。即便权重真的落地,文档记载的部署方式也就是单节点八块 H100,跑在定制版 SGLang 镜像上——对 397B 的 MoE 来说,这是真实但也常规的规模,而这恰恰是 17B 激活参数设计让人感兴趣的原因。在那之前,Nex-N2.5 Pro 只是一个你可以查询的预览版,而不是一个你可以依托开发的模型。
Claude Opus 5 在上述每一项上都截然相反。自7月24日起,它已通过Anthropic的API和路由平台提供服务,价格公开稳定,权重闭源且将保持闭源,其任何数据都可以在今天通过实际运行来验证。周边的生态系统——Claude Code、MCP工具,以及六周来对它进行高强度测试的大量生产级智能体——正是一个刚发布一天的模型所无法拥有的积累记录。对于一个要求"模型在下个季度必须能正常运作"的团队来说,这份记录就是全部胜负手。
那份规格说明书,也就那样了。
将两个信封并排摆放:
• 发布 — Nex-N2.5 Pro:2026年9月8日(托管端点已上线,权重待发布)。Claude Opus 5:2026年7月24日,全面可用。
• 规模 — Nex-N2.5 Pro:总参数量 397B / MoE 激活约 17B。Claude Opus 5:参数量未披露。
• 模态 — Nex-N2.5 Pro:输入文本和图像,输出文本,视觉是其计算机使用循环的核心。Claude Opus 5:输入文本和图像,输出文本,具有强大的视觉分析能力。
• 上下文/输出——Nex-N2.5 Pro:上下文 262,144 token,文档记录的服务长度。Claude Opus 5:上下文 1M token,输出上限 128K token。
• 推理控制 — Nex-N2.5 Pro:提供 reasoning_effort 开关,选项为 none / medium(自适应,默认)/ high。Claude Opus 5:默认采用自适应思考,并提供从低到最高力度的显式调节旋钮。
• 权重 — Nex-N2.5 Pro:Apache-2.0,即将推出,日期未定。Claude Opus 5:闭源。
• 每百万 Token 价格 — Nex-N2.5 Pro:免费托管层级,未公布标价。Claude Opus 5:输入 $5.00 / 输出 $25.00,缓存读取 $0.50,缓存写入 $6.25。
两者的性能边界差异显著,规格参数因此确实能说明问题:Opus 5 为长时间智能体会话提供百万 token 的上下文窗口和 128K 的输出上限,而 Nex-N2.5 Pro 的 262K 上下文和免费层级则更契合范围较小、以屏幕驱动的自动化场景。任何一方的规格都无法取代另一方;两款模型对智能体如何消耗上下文有着不同的理解。
诚实地解读 Nex-AGI 自己的记分牌
卡片其余部分也值得用同样的审慎视角去阅读。Nex-N2.5 Pro 的其他计算机使用(computer-use)指标——OSWorld-G 87.4、OSWorld-Verified 82.2、WebArena-Verified 67.6、WebTest 52.8、Vision2Web 68.2——以及它的编码指标——Terminal-Bench 2.1 为 82.7、SWE-Bench Pro 为 61.2、BrowseComp 为 89.7——全部是厂商通过该联盟自有测试框架测出的数据,在发布后 48 小时内未获独立复现。中立读者能从此卡片得出的唯一结论是:Nex-AGI 认为 Nex-N2.5 Pro 是一款强大的中端计算机使用模型,只是在最关键的指标上落后于前沿智能体。对于一个 397B 的开源模型来说,这是一种自洽、甚至保守的定位。但同时,这也是一项在等待第二个实验室来验证的主张。
金钱,当一方没有价格时。
这里没有诚实的比价可供参考,因为只有一方标了价格。Nex-N2.5 Pro 的免费托管层根本说明不了这个模型值多少钱——免费预览端点本来就是供应商收集流量和反馈的方式,而且 Nex-AGI 尚未公布该系列任何按 token 计费的付费价格。Claude Opus 5 在 Anthropic 的目录价格中,每百万输入 token 收费 5.00 美元,每百万输出 token 收费 25.00 美元,缓存读取则按每百万 0.50 美元计算,而这才是预算必须消化掉的数字。如果你今天正在为计算机使用智能体支付这笔账单,并且想知道一个 17B 激活参数的开源模型能不能用更低成本完成同样的工作,答案是:有可能,但要等权重发布、并由独立方跑过测试之后才能知道。价格比较只是被推迟了,并没有尘埃落定;把免费端点当作廉价的证据,属于范畴错误。

你今天能做的,就是为它成为可能的那一天设置好 A/B 测试。Claude Opus 5 已在 OrcaRouter 上架,按 Anthropic 的标价销售——同样是 $5.00 / $25.00,不加价转售,因此这里的账单与 Anthropic 完全一致,并会在 Anthropic 调价的那一天同步调整。一个 API 密钥就能让它与 200 多个其他模型共用同一端点;如果某个提供商出现故障,会自动故障转移;如果你想让 Opus 处理困难调用、让更便宜的模型处理常规调用,还可以使用路由 DSL。Nex-N2.5 Pro 尚未上架 OrcaRouter——撰写本文前我们查过模型目录,目前还没有列出任何 nex-agi 模型。一旦有提供商按标价提供它,它当天就会出现在这里;而本文目前无法进行的诚实对比,到时会变成一个路由规则,而不是一次迁移。
谁该行动,谁该等待
如果你的团队如今正在运行生产级的 computer-use 或 agentic-coding 工作负载,需要一个定价明确、失败模式已知且具备独立验证记录的模型,那么在这场对决中,Claude Opus 5 是理性的选择——Nex-N2.5 Pro 发布后 48 小时内发生的一切都不会改变这一点。如果你的团队正在为未来的构建评估开源的 computer-use 模型,Nex-N2.5 Pro 就该被列入观察名单:一款 397B 参数的多模态 MoE,自托管占用合理,基准分数位于中游且说得通——这正是那种能改写成本曲线的开源模型,前提是权重真的如期放出,且模型卡上的数字经得起独立复测。理性的立场是两者兼而有之:让久经验证的领先者继续留在关键路径上,同时把“是否值得一试”的决定权交给权重发布的那一天。那才是这场对决中唯一还没发生的比较——也恰恰是真正要紧的那一项。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
