Nex-N2.5 Pro vs GPT-5.6 Sol 主视觉——一张生成的标题卡,上面写着“Nex-N2.5 Pro vs GPT-5.6 Sol”,副标题为“发布仅一天的开源模型 vs 行业中最深厚的生产纪录”,并且顶部带有“OpenAI vs Nex-AGI — 2026 年 9 月”眉题。
Guides & Insights

Nex-N2.5 Pro 对比 GPT-5.6 Sol:新兴者的厂商编号落后于在位者的独立编号

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

把双方都有分数的那个基准并排摆出来,就会发现这次发布在操作顺序上就搞错了。Nex-AGI 的规格页给 Nex-N2.5 Pro 在 OSWorld-2 上打出 56.4,这是在该联盟自家的 NexCUA 测试框架上测得的,而公众从未见过这套框架。BenchLM 的 OSWorld 2.0 排行榜(8月29日更新)将 GPT-5.6 Sol 列为 62.6——一个独立数字,直接压过了新来者的厂商自报数字。在这个发布仅一天的模型的主场上——屏幕读取与电脑操作,也就是它唯一被专门打造去做的事——它所被拿来比较的成熟通用模型,连一个星号注释都不需要就能胜出。Nex-N2.5 Pro 对比 GPT-5.6 Sol,在任何一个由新来者厂商以外的人实测过的维度上,都不是一场势均力敌的较量。这是一个关于生产记录价值几何的案例研究,单凭这一点就值得一读。

这两款模型在定位上几乎算不上竞争对手。Nex-N2.5 Pro于2026年9月8日发布,是一款拥有3970亿参数的稀疏混合专家模型,激活参数约170亿,支持多模态(文本与图像输入,文本输出),基于Qwen3.5系列后训练而来,专为通过视觉反馈回路操作计算机和浏览器而构建。其Apache-2.0权重在Hugging Face上仍标注为"即将推出",目前唯一已上线运行的版本是Nex-AGI从其模型卡中链接出来的免费托管端点。GPT-5.6 Sol是OpenAI主打"最艰巨任务"的旗舰模型——深度多步推理、大规模软件工程和长周期智能体工作流——自7月9日起已在API中提供,采用闭源权重,并且曾作为前沿参照基准的分量一直延续到OpenAI于9月3日推出GPT-6 Astra为止。如果说Nex-N2.5 Pro是一个尚未发布自身权重的专精选手,那么GPT-5.6 Sol则是一个久经考验的通用选手,已面向业界要求最严苛的生产流量稳定交付了两个月。

GPT-5.6 Sol 是带有文件的模型

先说说 Sol 拥有而 Nex-N2.5 Pro 没有的东西:一份测试记录。自 7 月 9 日以来,GPT-5.6 Sol 已在独立测试框架中运行,经受安全研究人员的反复考验,并被纳入智能体框架和 Codex 工作流。它的独立测量数据深入且公开:在最大推理设置下,Artificial Analysis Intelligence Index 得分为 61;在同一独立测试框架下,Terminal-Bench 2.1 得分为 88.0,DeepSWE 得分为 73.0;实测输出速度约为每秒 71 个 token,每个 Intelligence Index 任务的成本约为 0.95 美元。这些都不意味着它不可战胜——OpenAI 后来将 GPT-6 Astra 定位在它之上——但其中每一个数字都是 OpenAI 之外的第三方测得的。Nex-N2.5 Pro 在任何地方都没有独立的评测记录,这有一个结构性原因:联盟之外没有人能运行它。

两者都有数字的那个基准

OSWorld 对比是目前能获得的最清晰参照,因此在采用之前,有必要先说明其注意事项。Nex-N2.5 Pro 的 56.4 是 Nex-AGI 通过其 NexCUA 测试框架在 OSWorld-2 上自行测得的结果。GPT-5.6 Sol 的 62.6 则来自 BenchLM 的 OSWorld 2.0 排行榜;该榜单为第三方快照,日期为 2026 年 8 月 29 日,共列出 15 个模型,其中 Claude Opus 5 以 70.6 居首,GPT-5.6 Sol 以 62.6 位居第二,GPT-5.6 Terra 以 50.2 位居第三。“OSWorld-2”和“OSWorld 2.0”是近亲,但尚未被证明完全相同,因此四到六分的具体差距应视为方向性参考,而非精确数值。经过这些注意事项过滤后依然成立的是排序:按照双方各自能给出的最佳数字,独立的 Sol 成绩在 Nex 自己选择发布的基准测试上战胜了 Nex 的厂商自测成绩。一个后来者,如果自己的数字低于现有者的独立数字,就无法给出令人信服的切换理由。

A two-column scoreboard titled 'Nex-N2.5 Pro vs GPT-5.6 Sol — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Weights Apache-2.0 pending; OSWorld 2.0 56.4 vendor-reported; AA Index no score yet; Context 262,144; Price free hosted / no list. Right column GPT-5.6 Sol: Released Jul 9 2026; Weights closed; OSWorld 2.0 62.6 independent; AA Index 61 (max); Context ~1.05M; Price $4.00 / $20.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Sol OSWorld per BenchLM Aug 29 and Index per Artificial Analysis.'

规格信封

规格表的其余部分也遵循同样的方向:

已发布 — Nex-N2.5 Pro:2026年9月8日(托管端点已上线,权重待发布)。GPT-5.6 Sol:2026年7月9日,正式可用。

规模 — Nex-N2.5 Pro:总参数397B / 约17B激活参数的MoE。GPT-5.6 Sol:参数数量未公开。

模态 — Nex-N2.5 Pro:文本和图像输入,文本输出,计算机使用视觉循环。GPT-5.6 Sol:文本、图像和文件输入,文本输出,具备工具调用和 JSON 模式。

上下文 / 输出 — Nex-N2.5 Pro:262,144 Token 上下文。GPT-5.6 Sol:~1.05M Token 上下文,128K 输出上限。

推理控制——Nex-N2.5 Pro:无 / 中(自适应,默认)/ 高。GPT-5.6 Sol:推理力度最高可达上限,另设独立的快速处理层级。

权重 — Nex-N2.5 Pro:Apache-2.0 许可,即将推出。GPT-5.6 Sol:闭源。

每100万Token价格 — Nex-N2.5 Pro:免费托管层级,无标价。GPT-5.6 Sol:自8月21日起促销标价为$4.00 / $20.00,缓存输入$0.40,超过272K输入Token后重新分层为$8.00 / $30.00。

Sol 约 105 万 token 的上下文和 128K 的输出上限,让 Nex-N2.5 Pro 的 262K 窗口在长周期任务中相形见绌;而且 Sol 的价格虽然远称不上便宜,却是一个预算可以建模的已定数字。Nex-N2.5 Pro 的免费层级是其唯一拿得出手的数字,而那并不是一个价格。

一天前的分数价值几何

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

每一项附着于 Nex-N2.5 Pro 的基准测试声明——OSWorld-2 得分 56.4,Terminal-Bench 2.1 得分 82.7,SWE-Bench Pro 得分 61.2,BrowseComp 得分 89.7——都有一个共同属性:它们出自 Nex-AGI,经由联盟声称将开源却尚未开源的测试框架得出。这些数字中没有一项被独立复现过,因为根本无从复现:权重无法下载,“即将推出”的横幅上也没有任何日期。这一点在这场对决中比在大多数场合都更关键,因为与 Nex-N2.5 Pro 对垒的模型拥有业内最悠久的独立验证记录。当挑战者的全部证据基础均系自我报告,而在位者并非如此时,举证责任完全落在挑战者一方,免费端点并不能免除这一责任。当碎片落地、独立实验室运行起 Nex-N2.5 Pro 的那一刻,这篇文章中的数字才变得可核查,比较才算真正成立。在那之前,“隔日分数”才是准确的表述——一个无法运行、因此也无法被核查的模型上的分数。

价格、路线与决策的形态

在成本方面,双方最不具有可比性,因为只有一方有成本。GPT-5.6 Sol 的 $4.00 / $20.00 费率是 OpenAI 自 8 月 21 日起生效的促销标价,据称至少持续到 11 月 21 日,较此前 $5.00 / $30.00 有所下调——这一降价使旗舰模型在大规模智能体工作负载下大幅变得更加实惠,而传递式路由会在 OpenAI 调整的当天就予以反映。Sol 以该标价上线 OrcaRouter,无任何加价,批处理层级与快速层级与 200 多个其他模型共用同一个 API 密钥即可使用,因此团队可以将需要 OpenAI 深度能力的请求路由到 Sol,而将其他一切请求交给更便宜的模型。Nex-N2.5 Pro 没有标价,只有其免费的托管端点——用来评估模型尚可,但作为生产预算的依据则很不靠谱。你无法围绕一个不存在的数字来规划支出,也无法围绕尚未发布的权重来规划架构。

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), marked FEATURED, showing the header stats $4.00 input and $20.00 output per million tokens and the byline 'by OpenAI - 2026-07-09'.

这场对决真正迫使你做出的决定,关乎风险,而非能力。如果你需要的是一个下个季度仍然在线的模型——价格透明、故障特征明确,并且背后有数月的对抗性测试——那么GPT-5.6 Sol是理性的选择;而OpenAI在其之上推出GPT-6 Astra,只会让这个选择更加站得住脚,因为Sol如今已是经过验证的主力模型,其降价也直指生产规模。如果你正基于开放权重构建计算机使用智能体,并且等得起一个可以验证的方案,那么Nex-N2.5 Pro值得关注——一个17B激活参数的多模态专家模型,正是那种屡次在成本上击穿封闭前沿的模型形态。但“关注”一词才是重点。在除其制造者之外的任何人所测量的每一个维度上,Nex-N2.5 Pro都落后于有据可查的那个模型;在权重开放之前,比较就只能到此为止。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新