
Nex-N2.5 Pro vs Gemini 3.1 Pro:上线一天的开放模型 vs 上线七个月的预览版
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0247智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82代码
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75代码
- obsidianQwen3.8 27B2026-08-1541智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69代码
- grokSpaceXAI: Grok 4.62026-08-1251智能77代码
- metaMeta: Muse Spark 1.22026-08-0547智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0347智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49代码
这场对决中最奇特的对称性在于:两款模型在官方意义上都尚未完成,而每一方都以对方无法做到的方式证明了这一点。Gemini 3.1 Pro Preview——谷歌的闭源多模态旗舰——自2026年2月19日起便处于预览状态,至今已有七个月,对一款前沿模型来说堪称漫长,而其开发商仍未宣布全面可用。Nex-N2.5 Pro,来自Nex-AGI开放模型联盟的3970亿参数计算机使用模型,截至本文写作时仅诞生一天,却已在处理来自免费托管端点的流量——然而其Apache-2.0权重在Hugging Face上仍标注“即将推出”,这使它成为另一种意义上的未完成。一个是除供应商不愿承认外、各方面都已完成的产品;另一个是除供应商愿意发布外、各方面都未完成的产品。
这两种不完整性会改变下文每个数字的解读方式。Gemini 3.1 Pro 是谷歌目前的旗舰推理模型——支持文本、图像、音频、视频和文件的多模态输入,拥有 1M token 的上下文窗口、65K 的输出上限,定价为每百万输入 token 2.00 美元、每百万输出 token 12.00 美元,一旦请求超过 200K 输入 token,价格即会上调。Nex-N2.5 Pro 是一个稀疏混合专家模型,总参数量 397B,激活参数约 17B,支持文本和图像输入、文本输出,拥有 262,144 token 的上下文窗口,并内置专为操作计算机和浏览器而设计的视觉循环。它们同处“高级智能体模型”的价格相邻区间,但在其他几乎所有方面都意见相左,而且两家厂商都不会宣称自家产品已经完成。
规格表:两个多模态 1M 级模型
将信封并排放置:
• 状态 — Nex-N2.5 Pro:已于2026年9月8日发布,托管端点已上线,权重待发布。Gemini 3.1 Pro:自2026年2月19日起为预览版,尚未正式发布(GA)。
• 规模—— Nex-N2.5 Pro:总计397B / 活跃参数约17B的MoE模型,基于Qwen3.5系列进行后训练。Gemini 3.1 Pro:参数量未公开。
• 模态——Nex-N2.5 Pro:文本和图像输入,文本输出;视觉是计算机使用的反馈通道。Gemini 3.1 Pro:文本、图像、音频、视频和文件输入,文本输出。
• 上下文 / 输出 — Nex-N2.5 Pro:262,144 token 上下文,有文档记录的服务长度。Gemini 3.1 Pro:1M token 上下文,65K 输出上限。
• 推理控制 — Nex-N2.5 Pro:无 / 中(自适应,默认)/ 高。Gemini 3.1 Pro:可调思考预算;没有公开的“max”档位噱头。
• 权重 — Nex-N2.5 Pro:Apache-2.0,即将推出。Gemini 3.1 Pro:未开放。
• 每百万 Token 价格 — Nex-N2.5 Pro:免费托管层级,未公布公开标价。Gemini 3.1 Pro:$2.00 / $12.00,输入超过 200K token 后升至 $4.00 / $18.00,缓存输入为 $0.20。
这两份规格说明书除“长上下文、多模态、构建成本高昂”之外,几乎没有多少一致之处。真正重要的差异在于:Gemini 方面有 200K 输入附加费,Nex 方面是免费但无法验证的定价模式,而且只有 Nex-N2.5 Pro 是围绕读取屏幕进行架构的。

两种不同的未完成方式
Google:七个月预览作为产品决策
Gemini 3.1 Pro 的预览状态并非表面文章,反而正日益成为关于该模型最重要的事实。谷歌的 Pre-GA 条款允许将其用于生产环境,但同时保留更改行为或弃用端点的权利——对于将旗舰模型置于关键路径上的团队来说,这是一个真实的风险。该模型的发展轨迹丝毫没有消除这一风险:它于 2 月上线,当时以 57 分成为市场上得分最高的模型(即当时的 Artificial Analysis Intelligence Index 得分),但此后在更严格的指数标尺上被重新评测,得分约为 48;而其原定继任者 Gemini 3.5 Pro 则从 5 月的发布宣告陷入一再跳票,并出现可能被取消的传闻。与此同时,谷歌在 8 月以 $0.75 / $3.75 的价格推出了 Gemini 3.7 Flash,9 月初推出了 Gemini 3.8 Flash,而价格更低的 Flash 系列已在独立指数上超越 Pro 旗舰。如今采用 Gemini 3.1 Pro,意味着选择这样一款旗舰模型:其供应商让它停留在预览状态,更便宜的同类产品在排名上超过了它,而它的继任者则悬而未决。
Nex-AGI:以“即将推出”作为交付状态的一天

Nex-N2.5 Pro 的不完整表现在相反的方向上:除了让它真正落地成为现实的那件事,其他一切都已就绪。托管端点已经上线且免费,OpenAI 兼容调用可以正常使用,模型卡上满是基准测试数字——OSWorld-2 为 56.4,Terminal-Bench 2.1 为 82.7,SWE-Bench Pro 为 61.2,全部通过该联盟自己的 NexCUA 测试框架测得,而联盟声称将开源该框架,却至今未开源。然而,权重文件无法下载,宣传横幅上没有附带发布日期,也没有任何独立实验室运行过该模型,因为根本没有人能运行它。如果说 Gemini 3.1 Pro 是“可衡量但未承诺”,那么 Nex-N2.5 Pro 就是“已承诺但不可衡量”。这两种状态都应当让生产团队停下来三思,尽管原因各不相同。
独立证据所在之处
在这场对决中,独立的公开记录几乎完全属于一方。Gemini 3.1 Pro 背后有六个月的公开测试:独立实验室对它的基准进行过评测,生产团队反复压测过它,并且它在当前 Artificial Analysis Intelligence Index 上的读数接近48——作为旗舰模型并不算亮眼,这也是Google更便宜的Flash模型超越它的原因,但这是由供应商以外的第三方得出的实际测量结果。Nex-N2.5 Pro 则没有这样的记录。它唯一的分数来自Nex-AGI自己,而且是在一个外界从未见过的测试框架上得出的。因此,真正重要的比较不是"48对空白"——而是"一个弱点有据可查的模型"对阵"一个优点全凭宣称的模型"。对于那些答错代价高昂的工作负载来说,无论数字如何,这种不对称往往才是决定性的。
长上下文法案是什么样的
两款模型都宣称支持长上下文,但它们的收费方式却显露出各自的真实意图。Gemini 3.1 Pro 的 100 万 token 窗口标价为 $2.00 / $12.00,一旦请求超过 20 万输入 token,费率就跳到 $4.00 / $18.00——相当于约 60% 的输入溢价和 50% 的输出溢价,而且恰恰是加在 100 万窗口为之存在的那类工作负载上。假若在 Agent 会话的每一轮中,你都给它喂入 50 万 token 的代码库上下文,那么每一次调用都会背上这笔溢价。Nex-N2.5 Pro 的 26.2 万上下文则较为克制,但其托管层免费,Nex-AGI 也根本没有公布任何付费费率,所以既不存在可供建模的长上下文溢价,也没有任何价格信号来指示这款模型的价值。Google 正在精确地告诉你它的窗口成本,而这个价格很高;Nex-AGI 则什么都不告诉你,这并不等同于便宜。
目前您可以路由的内容

在这里,对一个真正在干活的团队来说,两者的界线一目了然:Gemini 3.1 Pro 以 Google 的公开标价上线 OrcaRouter——仍然是 $2.00 / $12.00,超过 200K 的档位也原样透传——而它的预览状态恰恰说明应当绕开它、而不是把关键路径押在它身上:自动故障转移意味着,预览模型一旦出现故障或被弃用,就会在无需改动代码的情况下重定向到备用模型;路由 DSL 则让你可以把需要 Google 多模态能力的请求发给 Gemini,同时让更便宜的模型承接常规流量。Nex-N2.5 Pro 则不在 OrcaRouter 上——我们的目录中没有列出任何 nex-agi 模型——因为它目前仅有的实时构建版本,就是 Nex-AGI 从其模型卡片上链接出来的免费端点。等哪天有提供商以真正的公开标价提供服务,它就会以那个价格、零加价地出现在这里,届时这场对比就不再只是理论推演,而是可以真正运行起来验证的。
谁应该接触哪个
诚实的答案取决于你能承受哪种类型的风险。如果你当下就需要大规模多模态推理能力,并且能容忍一家厂商在路线图不断调整的同时让旗舰产品一直停留在预览阶段,那么 Gemini 3.1 Pro 是可用数据衡量的选择——六个月的独立测试是实实在在的资产,Flash 系列兄弟模型的崛起是选择接入该产品线的理由,而不是避开该产品线的理由。如果你正在基于开放权重构建计算机操作智能体,并且愿意等待可验证的方案,那么 Nex-N2.5 Pro 是更有意思的长期押注——但目前你还无法下注,因为你无法运行它、无法复现它的分数,也无法签署依赖它的合同。无论做出哪个选择,最满意的团队都是把两个模型看作其本来面目的团队:一个是已发布七个月、被所有人测试过的预览版,另一个是刚发布一天、还没有被任何人测试过的预览版。
