为“Nex-N2.5 Mini”设计的主视觉标题卡,副标题为“开放权重在发布时即上线——小型计算机使用智能体”,标签为“APACHE-2.0”、“35B TOTAL / ~3B ACTIVE”和“262K CONTEXT”,并带有横幅“IMAGE + TEXT INPUT - 2x H100 REFERENCE”,OrcaRouter 标志合成于右下角。
Guides & Insights

Nex-N2.5 Mini:发布即开放权重——Nex-AGI 最小的计算机操作智能体即是入口

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

如今,要想知道开放的计算机使用智能体是否已经就绪,只需一个在发布当天就能拉取的模型。Nex-AGI 于 2026 年 9 月 8 日发布了 Nex-N2.5 系列——包含三个智能体层级:Nex-N2.5 Mini、Nex-N2.5 Pro 和 Nex-N2.5 Max——其中真正做到下载即运行的是最小的那一档。Nex-N2.5 Mini 的 Apache-2.0 权重已上线 Hugging Face,分为十六个 BF16 分片,约有 350 亿参数,据报道每个 token 激活约 30 亿参数,并提供双 H100 参考部署。其更大的多模态兄弟型号 Nex-N2.5 Pro 截至本文撰写时仍标注“即将推出”;纯文本的 1.6 万亿参数 Nex-N2.5 Max 也已上线,但需要跨两个节点的十六块 H200 才能运行。对任何想要验证该系列背后论点的人而言——即开放的智能体模型能在长期计算机使用中撑住场面,而不仅仅是回答问题——Mini 就是入门之选。

Nex-AGI 是谁?这个名字是新的,这次发布带有首次公开发布的味道。有关公告的报道称,这项工作是由上海多家机构合作完成的——包括上海创智学院、上海期智知风、墨斯智能和夸父科技——该模型系列被定位为开源,团队则以 @NexEcosystem 账号运营。模型卡将 Nex-N2.5-mini 和 Nex-N2.5-Pro 视为延续了“Nex-N2 的多模态基础”,即权重已开放的早期 Nex 版本。这里真正新颖的是其定位:Nex-AGI 表示,它构建这些模型是为了在真实环境中执行长周期任务——操作计算机、驱动浏览器、执行和测试代码,并根据屏幕所见纠正方向——而且它公开了权重,使这一说法可以被检验。

三层级,一次公告

该家族按规模和模态分裂,而差异比共有的名称更重要:

• Nex-N2.5 Mini — 总参数量约35B / 激活参数约3B,一个支持图像和文本输入的多模态模型,面向视觉计算机使用、浏览以及需要界面反馈的任务。参考部署为单个双H100节点。

• Nex-N2.5 Pro — 报告称总参数397B / 激活参数约17B,同为多模态模型,面向更重的计算机使用工作负载。参考部署配置为八块H100。其权重在发布时不可下载。

• Nex-N2.5 Max — 总参数1.6T / 激活参数约49B,纯文本模型。据Nex-AGI称,这是其“首次在万亿参数规模上完成的完整后训练工作”。模型卡显示其基于DeepSeek-V4-Pro-Base构建。参考部署为跨两个节点的16×H200。

这三款都是混合专家(MoE)模型。Mini 和 Pro 属于 Qwen3.5 模型家族——Nex-AGI 的发布材料称两者均由 Qwen3.5 变体后训练而来,且 Mini 自身的配置带有 qwen3_5_moe 架构标签——而 Max 则是基于 DeepSeek 的另类。因此,这个家族并非“一种配方、三种尺寸”,而是两种配方:具备多模态“在屏幕上操作”能力的档位共享同一条血脉,文本推理巨擘则另属一脉。

已发货的 Nex-N2.5 Mini 实际上是啥

nex-agi/Nex-N2.5-mini 的 Hugging Face 仓库是一个真实、可下载的检查点,并非占位符——共 16 个 safetensors 分片,总计约 70 GB,BF16 格式,采用 Apache-2.0 许可证,首次创建于 9 月 8 日。其配置文件足够具体,可作为设计依据:

• 架构 — Qwen3_5MoeForConditionalGeneration,属于 qwen3_5_moe 系列,带视觉栈:模型卡片将其标注为 image-text-to-text,仓库随文本配置一并提供了 preprocessor_config.json。

• 形状 — 40层,隐藏层大小2048,分组查询注意力机制(16个查询头,2个KV头),词表大小248,320。

• MoE — 256 个路由专家,每个 token 激活 8 个,外加一个共享专家,中间尺寸 512 —— 这种稀疏激活的配置使一个约 3B 活跃参数的“35B 级”模型能够在两块 H100 上运行。

• 上下文——发布配置中的max_position_embeddings为262,144个token,与该系列部署方案中出现的262K数值相同。

权重与许可证——BF16、Apache-2.0,无访问限制;该仓库还指向 ModelScope 镜像及一个 GitHub 组织(nex-agi),其中包含该模型系列的部署方案。

Nex-AGI 的部署文档是大多数开源发布最常搞砸的部分,而这一份却出奇地做对了。Mini 通过自定义的 SGLang Docker 镜像(nexagi/sglang:v0.5.18-nex-patch)在单个节点上提供服务,该节点配备两块 H100,使用张量并行度 2。推荐的采样参数为 temperature 0.7、top_p 0.95、top_k 40。工具调用通过 SGLang 的 qwen3_coder 解析器运行,模型通过 reasoning_effort 字段暴露三种推理模式——"none" 表示非思考模式,"medium"(自适应的默认值)表示自适应思考,"high" 表示始终开启的思考模式。对于小型智能体模型而言,这种思考模式控制正是可用智能体循环与缓慢循环之间的分水岭,而且它被直接内置到服务方案中,而不是留给用户自行调配。

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

权重:实际可下载的有哪些?

三个层级在发布当天的状态值得准确说明,因为公告与代码仓库并不完全一致。截至本文撰写时,Mini 已可在 Apache-2.0 许可下完整下载——本文正是基于该版本撰写。Nex-N2.5 Max 也已上线,其 Hugging Face 仓库包含 644 个 safetensors 分片,不过要复现其万亿参数体量属于 16×H200 级别的项目。Nex-N2.5 Pro 则是尚未发布的那一个:其 Hugging Face 仓库虽然存在,但只包含 README 和图片,没有模型分片,模型卡上仍写着权重即将发布。如果你关心的层级是那个大型多模态版本,那这就是需要盯住的缺口——发布材料将 Pro 描述为该系列中最强的计算机使用模型,而它恰恰是当前还无法在本地运行的那个。

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Nex-AGI 报告的数字——以及随之而来的告诫

Nex-AGI 的模型卡中包含 Mini 的完整基准测试表,其中每一项数据均为厂商自己的报告。截至撰写本文时,尚无独立运行结果发布;该模型卡明确说明,分数来自官方基准排行榜和可获得的最新评测报告,其他情况则来自 Nex-AGI 自己的评测。编程结果使用该团队的 NexAU 测试框架生成;计算机使用和浏览器使用结果则使用了 NexCUA 测试框架,模型卡称该框架将开源。在中立第三方复现这些结果之前,应将标题行视为厂商的最佳情况。

基于这一框架,Mini 报告的成绩如下:在文本与编码类任务方面,Terminal-Bench 2.1 为 73.4,SWE-Bench Pro 为 43.8,DeepSWE v1.1 为 36.1,AutomationBench v1.0.6 为 32.3,Toolathlon Verified 为 54.6,BrowseComp 为 83.4,GDPval-AA v2 得分为 1446。在多模态/计算机使用方面,亮眼成绩包括:OSWorld-Verified 为 71.2,WebArena-Verified 为 63.4,WebTest 为 48.6(以 oracle 模式对照真值检查清单运行),OSWorld-G 为 82.9,OmniDoc 为 89.7;此外还有相对平平的 OSWorld-2(30.5)和 Vision2Web(52.9)结果。

两条阅读说明。首先,OSWorld-Verified 与 OSWorld-2 是两套不同的基准——前者是根据最终环境状态进行评分的已验证子集,后者则是更新且通常更严苛的测试——因此在一套上得 71.2、在另一套上得 30.5 并不矛盾;它们是不同的测试,Nex 自己的表格也将它们分列于不同栏中。其次,在家族表格的每一行里,Mini 的得分都低于 Pro 和 Max,而每一栏的顶端都归属于某个现有前沿模型,如 Claude Opus 5GPT-5.6 Sol。Mini 的故事不在于打败前沿模型;而在于一个激活参数约 3B 的开源模型,在仅占用两台 H100 的算力规模下,就能在计算机使用基准上报出有竞争力的分数。这一点能否成立,恰恰就是开源权重让你能自行解答的问题。

今天运行 Nex-N2.5 Mini

双H100配置方案使Mini成为亲自体验该系列核心主张的最经济方式。由于架构是标准的Qwen3.5-MoE,搭配qwen3_coder工具调用解析器,它可以直接加载到Nex-AGI的SGLang分支中,无需自定义推理代码,而且推荐设置是公开的,无需逆向工程去摸索。开始之前应设定的合理预期是:仅发布一天的检查点加上全新的测试框架,属于实验性质,而非稳定依赖。撰写本文时,Mini仓库的下载量仍停留在个位数,也没有第三方发布过独立评测——这对昨天刚发布的模型来说是常态,也正因如此,双H100的规模才至关重要:你可以本周就亲自运行这项实验,而不是等待别人代劳。

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

如果你更愿意在它自己的基准表中将 Mini 与前沿智能体(frontier agents)对比,而不是手工调优单个部署,那么路由层就体现出了它的价值。当托管提供商列出 Nex-N2.5 Mini,而且与之对比的现有模型已经可以通过路由器访问时,一个覆盖 200 多个模型的 API——提供商列表价格以 0% 加价直接传递,并具备自动故障转移——就是无需第二次集成、即可对多个模型运行同一任务的低成本方式。在 OrcaRouter 上,这是我们路由的每一个模型的标准配置:相同的密钥、相同的调用形式、厂商自己的价格,不加任何额外费用。这一点对于像这样尚未得到验证的模型来说尤为重要,因为故障转移让你可以在真实路径上试用它,而不必把整条路径押在它身上。

谁应该拉这些重物?

如果你的工作涉及计算机使用代理、浏览器自动化或基于视觉的工具使用,并且你想要一个宽松许可、可自托管的模型来与托管式领先模型做基准对比,那就把它们拉下来吧。Apache-2.0 许可消除了中国实验室发布时的常见摩擦,两张 H100 的资源占用对一支认真的智能体团队来说触手可及;推理强度控制加上真正的工具调用解析器,使它成为可信的基准测试平台,而不是玩具。如果你需要的是该系列中最强的计算机使用模型,那就再等等——那是 Pro 的定位,而 Pro 的权重仍未发布。另外,在每个基准测试行上保留厂商标签,直到独立复现确认这些结果;一个约 30 亿激活参数的开源模型在 OSWorld-Verified 上拿到 71.2 分,这是相当惊人的说法,而这种说法恰恰值得你先在自己的测试框架里验证,再在此基础上构建。

接下来值得关注的是。Pro 权重的发布是最大的单一信号——它把这个系列从“Mini 加上一个万亿参数庞然大物”变成发布材料所描述的完整产品线。其次是 NexCUA 测试框架的开源,没有它,computer-use 评测结果就无法在相同协议下被独立复现。第三是来自 Artificial Analysis、某个大学实验室或一位公开其 OSWorld-Verified 复现结果的从业者的首次中立运行。当这三者中有任何一项落地时,这次发布所提出的问题——开放智能体模型是否真正缩小了与托管式 computer-use 技术栈之间的差距——就不再是厂商表格所能决定的事情了。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

providers@orcarouter.ai

加入我们的社区

Discordsupport@orcarouter.aiXGitHubYouTube