一张为‘Nex-N2.5 Pro vs Kimi K3’生成的主视觉标题卡,副标题为‘这场对决由新手自己的基准测试卡来担任裁判’,其中有一个标有‘厂商基准测试卡’的圆角大文档,包含两列模型,文档上方是‘Pro 在大多数共享行上落后于 K3’一行字,右下角合成有 OrcaRouter 标志。
Guides & Insights

Nex-N2.5 Pro vs Kimi K3:一场由新手自己的基准卡担任裁判的对决

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

看看Nex-N2.5 Pro与Kimi K3共有的数据,你就会注意到是谁提供了这些数字。Nex-AGI的Nex-N2.5 Pro——一个3970亿参数、约170亿活跃参数的多模态智能体,于2026年9月8日发布,权重仍标注为“即将推出”——发布了一张基准测试表,将Moonshot AI的Kimi K3直接列在同一列中。Kimi K3是Moonshot于2026年7月16日发布的2.8万亿参数开放权重旗舰模型,支持百万级token上下文,十一天后以修改版MIT许可证提供完整权重,在Artificial Analysis Intelligence Index上获得57分,使其成为榜单上排名第一的开放权重模型。而在那张表格的一行又一行中,Nex-N2.5 Pro都落后于Kimi K3:Terminal-Bench 2.1得82.7,K3为88.3;BrowseComp 89.7对91.2;SWE-Bench Pro 61.2对63.3;AutomationBench 44.2对46.7。当一个厂商把自己模型的成绩印在当前开放权重领先者旁边,而自家模型在大部分行上都落败时,这场对比中最有意思的地方在于:这张表很可能是在说真话。

这正是此次对比的不寻常之处。通常,要看一个新人如何炒作,去看它的那张参数卡就行;但在这里,这张卡反而是两款模型各自最接近诚实裁判的东西,因为 Nex-AGI 完全没理由发布一张让自家 Pro 级别掉价的表格——而且 Pro 确实胜过 K3 的那几行,恰好就是一个小型、专用的电脑使用模型理应打败一个庞大通用模型的那几行。所以,这个页面真正回答的问题比“哪个更好”更窄,也更有用:Nex-N2.5 Pro 自称的细分定位——以大约六分之一的激活参数实现接近 K3 的智能体性能——在 Kimi K3 已经存在、权重已经放出、并且已经是那个需要被击败的模型这一事实面前,还能不能站得住脚?

对手,全貌

Kimi K3 并非小众模型,这正是它适合作衡量基准的原因。它是 Moonshot 的旗舰产品:采用 Stable LatentMoE 设计,总参数量 2.8T、激活参数 104B;上下文窗口为 1M token,输出预算与之匹配;原生支持文本、图像与视频理解;推理功能始终开启;开放权重,任何拥有足够硬件的人都能实际运行。它的独立地位十分扎实——Artificial Analysis 智能指数 57 分,位居所有开放权重模型之首;在 Frontend Code Arena 上取得 1,679 Elo,领先于 Claude Fable 5GPT-5.6 Sol。同时它的价格——每百万输入 token 3.00 美元、每百万输出 token 15.00 美元、缓存输入每百万 0.30 美元——处于开放权重级别的高端。Kimi K3 就是厂商不在规模上做妥协时“前沿且开放”的样子:它的输出按 token 计价比 GPT-5.6 Sol 等闭源对手更贵,服务成本高昂,而且在排行榜上的成绩几乎无可置疑。

挑战者的算术

Nex-N2.5 Pro 的目标不是在参数量上超越 Kimi K3,而是在服务能力上胜过它。Nex-AGI 基于 Qwen3.5 系列底座,将 Pro 层后训练成一个原生视觉智能体,用于操控计算机和浏览器;它的卖点是效率:总参数 397B / 激活约 17B,262K 上下文,以及单节点 8×H100 的部署方案——反观 K3,总参数 2.8T / 激活 104B,以及这种体量模型所需的整套推理服务集群。其隐含论点在于:一个 17B 激活参数、专门针对视觉反馈智能体循环训练的特化模型,能够以极低的推理成本实现 104B 激活参数的通用模型大部分智能体性能。在 Nex-AGI 自己的评测卡上,这一说法看似合理,但只覆盖了部分维度:Pro 在 OSWorld-G(87.4 对 79.6)和 OmniDoc(92.2 对 91.1)上超越或持平 K3,其余重合项目则以个位数分差落败——一个 397B 模型在编程和浏览任务上输给 2.8T 模型 3 到 6 分,如果属实,恰恰就是 Nex 想讲述的效率故事。

如果属实。这些数字中的每一个都是 Nex-AGI 自己的,至少部分是通过其内部 NexCUA 测试工具产生的,而 Nex-N2.5 Pro 今天无法独立验证,因为其权重不可下载——Hugging Face 仓库里只有一个 README、一个图片文件夹和一个写着"权重即将发布"的横幅,仅此而已。同样的注意事项也适用于模型卡上公布的 K3 相关数据,其中大部分是 Nex 根据 Moonshot 已发布的报告汇编的,而非自行测量。Nex-AGI 的表格所确定的不是谁赢了;而是 Nex-AGI 自己的工程师在自行选择基准和测试工具的情况下,仍无法让他们的 Pro 版本在大多数共同测试项上击败 Kimi K3。这比任何单一分数都更有用,因为它为营销宣传可能夸大其词的程度设定了一个上限。

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

重要的行,并排对比

规模——Nex-N2.5 Pro:总参数 397B / 激活约 17B,Qwen3.5 系列多模态。Kimi K3:总参数 2.8T / 激活 104B,Stable LatentMoE,多模态。

权重——Nex-N2.5 Pro:承诺但未发布(卡片上标注“即将推出”)。Kimi K3:于 7 月 27 日以 Modified MIT 许可证发布——今日即可下载。

上下文——Nex-N2.5 Pro:262K。Kimi K3:1M tokens,统一定价。

价格 — Nex-N2.5 Pro:尚无费率卡;托管预览免费。Kimi K3:每百万 $3.00 / $15.00,缓存输入 $0.30。

Independent standing — Nex-N2.5 Pro: none yet. Kimi K3: AA Intelligence Index 57, top open-weight model on the board.

编码(厂商卡片)——Nex-N2.5 Pro:Terminal-Bench 2.1 为 82.7,SWE-Bench Pro 为 61.2。Kimi K3 在相同行中则分别为 88.3 和 63.3。

GUI / 计算机使用——Nex-N2.5 Pro:OSWorld-G 87.4(在K3自己的卡上击败K3),OSWorld-2 56.4。Kimi K3:OSWorld-G 79.6,OSWorld-2 58.3(Nex 编译)。

自托管规模——Nex-N2.5 Pro:权重落地后,单节点 8×H100 即可。Kimi K3:2.8T——需要的是一个服务集群,而非单节点。

每列中“open”的含义有何不同

“开放”这个词在两边发挥着截然不同的作用,而它比任何基准测试都更能决定这场对决的胜负。Kimi K3 的开放,是运营层面真正要紧的那种开放:权重托管在 hub 上,采用较为宽松的 Modified MIT 许可证;推理轨迹通过流式 API 暴露在外;受数据治理约束的企业可以在自己掌控的硬件上运行它,并审计模型当时的思考过程。这种开放是需要付出代价的——2.8T 规模的模型需要相当庞大的基础设施——但该选项如今就已存在。Nex-N2.5 Pro 的开放则停留在意图层面:Nex-AGI 表示整个系列的权重将以开源形式发布,同门较小的 Nex-N2.5 Mini 也的确在发布当天提供了 Apache-2.0 权重。Pro 的权重尚未发布;其许可证虽已在规格卡上公布,却尚未对任何可下载内容构成约束。在检查点(checkpoint)问世之前,“开放”只是一个路线图条目,而非模型本身的属性。对于要在两者之间做出选择的团队而言,这绝非一个脚注——而是“这个月就能拥有的模型”与“被承诺终将拥有的模型”之间的分野。

无需等待下载按钮即可评估

你不必把这个决定冻结到 Nex-N2.5 Pro 权重发布之后;路由层正是你低成本开展实验的地方。Kimi K3 已上线 OrcaRouter,按 Moonshot 的标价提供——$3.00 / $15.00,0% 加价,价格直接透传,Moonshot 调价当天即同步更新——因此,这位开源权重领跑者距离你只有一个 key,就在目录中其他 200 多个模型旁边。Nex-N2.5 Pro 不通过我们提供,所以今天要试用它,只能先用 Nex-AGI 托管的预览版;等权重日后发布,再跑在你自己的 8×H100 环境上。合适的做法是:把长上下文和审计密集型任务放到 Kimi K3 上,走你现有的同一个端点;把一条测试分支指向 Nex-N2.5 Pro 的预览版;再让自动故障转移绕开表现变差的那一方——这正是拿一个已发布的前沿模型与一个权重待发布的挑战者做对比的方式,且不必把生产路径押在二者中的任何一个上。等 Pro 的权重真正发布后,验证也很简单:运行独立实验室也能复现的共享评测样本,看看 17B 激活参数的高效叙事在 Nex-AGI 自家评测框架之外是否依然成立。

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

这场对决的结果如何

面对有史以来发布的最大开源权重模型,Nex-N2.5 Pro 无须赢得通用能力之争就足以值得关注——它需要赢下的是服务成本之争,而它自己的规格表也表明,这一论点成立但尚待验证。Kimi K3 是当下安全且真正强大的选择:开源权重、开源权重指数榜首、百万 token 上下文、可纳入预算的价格,代价是随模型增长只会越来越难的基础设施。Nex-N2.5 Pro 是一次效率押注:根据某厂商提供的一张关于尚未发布模型的表格,它在单个节点上以六分之一的活跃参数取得了接近 K3 的智能体测试成绩。当你想要的是如今就能真正拥有并审计的前沿模型,选 Kimi K3。请盯紧 Nex-N2.5 Pro,等待其权重发布、独立方运行相同基准序列的那一天——因为若一款 170 亿活跃参数的智能体在计算机使用场景中确实与 1040 亿活跃参数的旗舰仅差几个点,这个结果将改写此后每一款开源智能体的服务成本算式。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新