Nex-N2.5 Pro 对比 Claude Opus 5 的主视觉图——一张生成的标题卡上写着“Nex-N2.5 Pro 对比 Claude Opus 5”,副标题为“免费开放的计算机使用预览版,对比当下即可路由的基准测试领跑者”,并带有眉题“Anthropic 对比 Nex-AGI——2026年9月”。
Guides & Insights

Nex-N2.5 Pro 对决 Claude Opus 5:Nex-AGI 选择了标尺,而标尺赢了

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Nex-AGI 挑中了这把标尺,结果却是标尺赢了。这个总部位于上海的开放模型联盟于 2026 年 9 月 8 日发布 Nex-N2.5 Pro 时,模型卡上的 computer-use(计算机使用)对比表把 Claude Opus 5 放在对照栏、把 Nex-N2.5 Pro 放在挑战者栏:Claude Opus 5 在 OSWorld-2 上得分 68.3,Nex-N2.5 Pro 得分 56.4,两个数字与 Nex-AGI 印在自己模型卡上的分毫不差。此后,独立排行榜上的差距非但没有缩小,反而越拉越大——BenchLM 于 8 月 29 日发布的 OSWorld 2.0 快照在其收录的 15 个模型中将 Claude Opus 5 排在第一,得分 70.6。在自己选择拿出来发布的基准上落后领跑者 12 分,并不是常见的发布编排;正因如此,Nex-N2.5 Pro 对 Claude Opus 5 的看点并不在于这个分数,而在于这组分数的双方究竟是什么:一边是拥有 3970 亿参数的开放计算机使用模型,联盟之外至今没有人能够运行或验证;另一边是 Anthropic 的闭源旗舰模型,它领跑该基准,自 7 月下旬起便一直承载着生产流量。

坦率地说在前头:这不是两个经过测量的事物之间的较量,因为除了制造者之外,只有其中一方被其他人实测过。Nex-N2.5 Pro 是一个稀疏混合专家模型,总参数约 397B,活跃参数约 170 亿,基于 Qwen3.5 谱系进行后训练,目标直指带视觉反馈回路的长时间跨度计算机与浏览器操作。目前它正通过模型卡上 Nex-AGI 链接的免费托管端点对外提供服务,而该模型家族所依据的 Apache-2.0 权重仍标注着“即将推出”,没有任何日期。Claude Opus 5 是 Anthropic 面向高难度推理、编程和智能体任务的生产级旗舰——一款闭源模型,拥有 1M token 上下文、自适应思考调节、明确的标价,以及背后数周的公开排行榜成绩与生产流量。这场对比中的每一项优势都归因于两种事实之一:一个模型可运行、可验证,而另一个两者都做不到。

双方都同意的基准

计算机使用基准测试所奖励的,正是这些模型被构建出来所要推销的行为:一个智能体查看屏幕、决定动作、执行动作,再读取变化后的屏幕来检查动作是否生效。Nex-N2.5 Pro 的架构正是围绕这一循环构建的——视觉并不是事后附加到它身上的输入模态,而是智能体用来校验动作的反馈通道。Claude Opus 5 将同一循环仅视作众多工作负载之一,但它恰好极其擅长于此,这正是 Nex-AGI 最初以其作为参照点的原因。

严格来说,这两个数字并非来自同一测试框架。Nex-AGI 的 OSWorld-2 数据是通过其自有的 NexCUA 评估框架得出的,该公司表示将开源该框架,但尚未发布;而 Nex-N2.5 Pro 的 56.4 分是未经复现的厂商输出。Claude Opus 5 在 BenchLM 上的 70.6 分是 OSWorld 2.0 的第三方快照,日期为 2026 年 8 月 29 日,这与 Nex-AGI 自己引用的排行榜来源 68.3 分一致。不同的测试框架和略有差异的基准版本意味着,确切的差距——在 Nex-AGI 自己的卡片上是 12 分,在 BenchLM 上接近 14 分——应被视为方向性的。但无可争议的是,根据双方可得的最佳数据,Nex-N2.5 Pro 仍低于当前前沿的计算机使用智能体。

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

关于“我今天能运行它吗”的两个回答

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

这才是真正决定一支实干团队胜负的分叉,而且它并不偏向新入局者。Nex-N2.5 Pro 的 Hugging Face 模型卡上仍醒目地宣称,权重将以 Apache-2.0 许可“即将发布”,却没有附上任何发布日期。目前仅有的在线构建版本,是 Nex-AGI 从模型卡上链接出来的免费托管端点——可以调用,但归他人所有:没有标价,没有团队可以据此规划的服务条款,也无法在你自己的硬件上复现哪怕一个基准分数。即便权重真的落地,文档记载的部署方式也就是单节点八块 H100,跑在定制版 SGLang 镜像上——对 397B 的 MoE 来说,这是真实但也常规的规模,而这恰恰是 17B 激活参数设计让人感兴趣的原因。在那之前,Nex-N2.5 Pro 只是一个你可以查询的预览版,而不是一个你可以依托开发的模型。

Claude Opus 5 在上述每一项上都截然相反。自7月24日起,它已通过Anthropic的API和路由平台提供服务,价格公开稳定,权重闭源且将保持闭源,其任何数据都可以在今天通过实际运行来验证。周边的生态系统——Claude Code、MCP工具,以及六周来对它进行高强度测试的大量生产级智能体——正是一个刚发布一天的模型所无法拥有的积累记录。对于一个要求"模型在下个季度必须能正常运作"的团队来说,这份记录就是全部胜负手。

那份规格说明书,也就那样了。

将两个信封并排摆放:

发布 — Nex-N2.5 Pro:2026年9月8日(托管端点已上线,权重待发布)。Claude Opus 5:2026年7月24日,全面可用。

规模 — Nex-N2.5 Pro:总参数量 397B / MoE 激活约 17B。Claude Opus 5:参数量未披露。

模态 — Nex-N2.5 Pro:输入文本和图像,输出文本,视觉是其计算机使用循环的核心。Claude Opus 5:输入文本和图像,输出文本,具有强大的视觉分析能力。

上下文/输出——Nex-N2.5 Pro:上下文 262,144 token,文档记录的服务长度。Claude Opus 5:上下文 1M token,输出上限 128K token。

推理控制 — Nex-N2.5 Pro:提供 reasoning_effort 开关,选项为 none / medium(自适应,默认)/ high。Claude Opus 5:默认采用自适应思考,并提供从低到最高力度的显式调节旋钮。

权重 — Nex-N2.5 Pro:Apache-2.0,即将推出,日期未定。Claude Opus 5:闭源。

每百万 Token 价格 — Nex-N2.5 Pro:免费托管层级,未公布标价。Claude Opus 5:输入 $5.00 / 输出 $25.00,缓存读取 $0.50,缓存写入 $6.25。

两者的性能边界差异显著,规格参数因此确实能说明问题:Opus 5 为长时间智能体会话提供百万 token 的上下文窗口和 128K 的输出上限,而 Nex-N2.5 Pro 的 262K 上下文和免费层级则更契合范围较小、以屏幕驱动的自动化场景。任何一方的规格都无法取代另一方;两款模型对智能体如何消耗上下文有着不同的理解。

诚实地解读 Nex-AGI 自己的记分牌

卡片其余部分也值得用同样的审慎视角去阅读。Nex-N2.5 Pro 的其他计算机使用(computer-use)指标——OSWorld-G 87.4、OSWorld-Verified 82.2、WebArena-Verified 67.6、WebTest 52.8、Vision2Web 68.2——以及它的编码指标——Terminal-Bench 2.1 为 82.7、SWE-Bench Pro 为 61.2、BrowseComp 为 89.7——全部是厂商通过该联盟自有测试框架测出的数据,在发布后 48 小时内未获独立复现。中立读者能从此卡片得出的唯一结论是:Nex-AGI 认为 Nex-N2.5 Pro 是一款强大的中端计算机使用模型,只是在最关键的指标上落后于前沿智能体。对于一个 397B 的开源模型来说,这是一种自洽、甚至保守的定位。但同时,这也是一项在等待第二个实验室来验证的主张。

金钱,当一方没有价格时。

这里没有诚实的比价可供参考,因为只有一方标了价格。Nex-N2.5 Pro 的免费托管层根本说明不了这个模型值多少钱——免费预览端点本来就是供应商收集流量和反馈的方式,而且 Nex-AGI 尚未公布该系列任何按 token 计费的付费价格。Claude Opus 5 在 Anthropic 的目录价格中,每百万输入 token 收费 5.00 美元,每百万输出 token 收费 25.00 美元,缓存读取则按每百万 0.50 美元计算,而这才是预算必须消化掉的数字。如果你今天正在为计算机使用智能体支付这笔账单,并且想知道一个 17B 激活参数的开源模型能不能用更低成本完成同样的工作,答案是:有可能,但要等权重发布、并由独立方跑过测试之后才能知道。价格比较只是被推迟了,并没有尘埃落定;把免费端点当作廉价的证据,属于范畴错误。

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

你今天能做的,就是为它成为可能的那一天设置好 A/B 测试。Claude Opus 5 已在 OrcaRouter 上架,按 Anthropic 的标价销售——同样是 $5.00 / $25.00,不加价转售,因此这里的账单与 Anthropic 完全一致,并会在 Anthropic 调价的那一天同步调整。一个 API 密钥就能让它与 200 多个其他模型共用同一端点;如果某个提供商出现故障,会自动故障转移;如果你想让 Opus 处理困难调用、让更便宜的模型处理常规调用,还可以使用路由 DSL。Nex-N2.5 Pro 尚未上架 OrcaRouter——撰写本文前我们查过模型目录,目前还没有列出任何 nex-agi 模型。一旦有提供商按标价提供它,它当天就会出现在这里;而本文目前无法进行的诚实对比,到时会变成一个路由规则,而不是一次迁移。

谁该行动,谁该等待

如果你的团队如今正在运行生产级的 computer-use 或 agentic-coding 工作负载,需要一个定价明确、失败模式已知且具备独立验证记录的模型,那么在这场对决中,Claude Opus 5 是理性的选择——Nex-N2.5 Pro 发布后 48 小时内发生的一切都不会改变这一点。如果你的团队正在为未来的构建评估开源的 computer-use 模型,Nex-N2.5 Pro 就该被列入观察名单:一款 397B 参数的多模态 MoE,自托管占用合理,基准分数位于中游且说得通——这正是那种能改写成本曲线的开源模型,前提是权重真的如期放出,且模型卡上的数字经得起独立复测。理性的立场是两者兼而有之:让久经验证的领先者继续留在关键路径上,同时把“是否值得一试”的决定权交给权重发布的那一天。那才是这场对决中唯一还没发生的比较——也恰恰是真正要紧的那一项。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新