
Nex-N2.5 Pro vs GPT-5.6 Sol:新進者的廠商編號落後於現任者的獨立編號
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
我們就來說那個唯一能讓兩邊分數並排擺放的基準測試,以及它為何作為發佈依據時,操作次序根本就是錯的。Nex-AGI 的模型卡為 Nex-N2.5 Pro 在 OSWorld-2 上給出 56.4 分,量測是在聯盟自家開發、外界從未見過的 NexCUA 測試平台上完成。BenchLM 在 8 月 29 日更新的 OSWorld 2.0 排行榜則把 GPT-5.6 Sol 放在 62.6 分——這是個獨立數字,直接壓過新進者的廠商自報分數。即便是在這個才推出一天的新模型主場——也就是螢幕讀取與電腦操作,這正是它量身打造的唯一用途——那款被拿來對比的成熟通用模型,連加註星號都不用就能超前。Nex-N2.5 Pro 對上 GPT-5.6 Sol,在由新進者製造商以外的人所量測的任何層面上,都不是一場勢均力敵的比賽。這是一則說明正式生產紀錄究竟有何價值的個案研究;光是這一點,就值得一讀。
這兩款模型在意圖上幾乎算不上是競爭對手。Nex-N2.5 Pro 於 2026 年 9 月 8 日發布,是一款擁有 3970 億參數的稀疏混合專家模型,活躍參數約 170 億,支援多模態(文字與影像輸入、文字輸出),源自 Qwen3.5 系譜並經後訓練,專為透過視覺回饋迴路操作電腦與瀏覽器而打造。其 Apache-2.0 權重在 Hugging Face 上仍標示為「即將推出」,目前唯一上線的版本是 Nex-AGI 從其模型卡連結的免費代管端點。GPT-5.6 Sol 是 OpenAI 為「最艱鉅任務」打造的旗艦模型——涵蓋深度多步驟推理、大規模軟體工程與長程自主代理工作流程——自 7 月 9 日起於 API 提供,採封閉權重,如今背負著曾是業界前沿參考基準的重擔,直到 OpenAI 於 9 月 3 日推出 GPT-6 Astra。Nex-N2.5 Pro 是尚未釋出自身權重的專家型模型,而 GPT-5.6 Sol 則是已通過驗證的通才型模型,兩個月來持續承載著業界最嚴苛的生產流量。
GPT-5.6 Sol 是帶有檔案的模型
先從 Sol 有而 Nex-N2.5 Pro 沒有的東西說起:一份實測紀錄。自 7 月 9 日起,GPT-5.6 Sol 就一直在獨立測試框架中運行,接受安全研究人員的密集考驗,並被整合進 Agent 框架與 Codex 工作流程。其獨立量測結果既深入且公開:在最大推理設定下,Artificial Analysis Intelligence Index 為 61;同一獨立測試框架測得 Terminal-Bench 2.1 為 88.0、DeepSWE 為 73.0;實測輸出速度約每秒 71 個 token,每個 Intelligence Index 任務的成本約為 0.95 美元。這些都不代表它無法被擊敗——OpenAI 之後已將 GPT-6 Astra 置於其之上——但其中每一個數字,都是 OpenAI 以外的人所測得的。Nex-N2.5 Pro 在任何地方都沒有獨立評測紀錄,其原因在於結構性限制:聯盟之外沒有人能運行它。
兩者都有數字的那一個基準
OSWorld 的比較是目前可取得最清晰的參考數據,因此在採用之前,有必要先說明其前提限制。Nex-N2.5 Pro 的 56.4 分,是 Nex-AGI 透過自家 NexCUA 測試框架,在 OSWorld-2 上自行測得的結果。GPT-5.6 Sol 的 62.6 分則來自 BenchLM 的 OSWorld 2.0 排行榜,這份第三方快照的日期為 2026 年 8 月 29 日,榜上列出十五個模型,其中 Claude Opus 5 以 70.6 分居首,GPT-5.6 Sol 以 62.6 分居次,GPT-5.6 Terra 以 50.2 分排第三。「OSWorld-2」與「OSWorld 2.0」關係密切,但尚未被證明完全相同,因此確切的四到六分差距應視為方向性參考,而非精確數值。在排除這些前提限制後依然成立的是排序:就雙方各自能提出的最佳數字而言,獨立的 Sol 分數勝過了 Nex 在自己選擇公布的基準測試上提出的 Nexus 自家分數。一個新進者若自家的數字低於現任者的獨立數字,就很難提出令人信服的理由來說服用戶轉換。

規格信封
規格表的其餘部分也遵循同樣的方向:
• 已發布 — Nex-N2.5 Pro:2026年9月8日(託管端點已上線,權重待發布)。GPT-5.6 Sol:2026年7月9日,全面可用。
• 規模 — Nex-N2.5 Pro:總參數397B/MoE活躍參數約17B。GPT-5.6 Sol:參數數量未公開。
• 模態 — Nex-N2.5 Pro:文字與影像輸入、文字輸出、電腦操作視覺迴圈。GPT-5.6 Sol:文字、影像與檔案輸入、文字輸出,具備工具呼叫與 JSON 模式。
• 上下文/輸出 — Nex-N2.5 Pro:262,144 token 上下文。GPT-5.6 Sol:約 1.05M token 上下文,128K 輸出上限。
• 推理控制 — Nex-N2.5 Pro:無 / 中(適應性,預設)/ 高。GPT-5.6 Sol:推理強度可達最大,另有一個獨立的快速處理層級。
• 權重 — Nex-N2.5 Pro:Apache-2.0,即將推出。GPT-5.6 Sol:封閉。
• 每1M tokens的價格— Nex-N2.5 Pro:免費代管層級,無定價。GPT-5.6 Sol:自8月21日起促銷牌價 $4.00 / $20.00,快取輸入 $0.40,當輸入超過272K tokens時,重新分級至 $8.00 / $30.00。
Sol 的約 1.05M-token 上下文與 128K 輸出上限,在長期任務上讓 Nex-N2.5 Pro 的 262K 視窗相形見絀;而 Sol 的價格雖然遠說不上便宜,卻是一個預算能掌握的既定數字。Nex-N2.5 Pro 的免費方案是它唯一站得住腳的數字,但那並非價格。
一天前分數的價值

Nex-N2.5 Pro 的每一項基準測試宣稱——OSWorld-2 的 56.4、Terminal-Bench 2.1 的 82.7、SWE-Bench Pro 的 61.2、BrowseComp 的 89.7——都共享一個特性:它們都由 Nex-AGI 產生,透過的是聯盟聲稱將開源、但迄今尚未開源的一套測試框架。這些數字沒有一項被獨立重現過,因為根本無從重現:權重無法下載,「即將推出」的橫幅上也沒有任何日期。在這次對決中,這一點比多數情況都更關鍵,因為 Nex-N2.5 Pro 被拿來比較的對象,擁有業界最長的獨立實測紀錄。當挑戰者的整個證據基礎都是自我申報,而現任者卻不是如此時,舉證責任完全落在挑戰者身上;免費的端點並不能免除這項責任。等到分片落地、獨立實驗室真正跑起 Nex-N2.5 Pro,本文的數字就變得可查核,這番比較才算數。在那之前,「隔夜分數」才是最準確的說法——這個分數無法檢視,因為它出自一個無法運行的模型。
價格、路線與決策的形態
成本正是雙方最難比較的面向,因為只有一方有成本。GPT-5.6 Sol 的 $4.00 / $20.00 費率是 OpenAI 自 8 月 21 日起生效的促銷牌價,官方表示至少會持續到 11 月 21 日,較先前的 $5.00 / $30.00 調降——這項降價讓旗艦模型在大規模代理(agentic)工作負載上變得容易負擔許多,而無加價轉發(pass-through)的路由服務也會在 OpenAI 調價當天同步反映。Sol 在 OrcaRouter 上以該牌價供應、完全不加成,批次(batch)與快速(fast)兩種層級也都與其他 200 多個模型一樣,可用同一組 API key 存取;如此一來,團隊可以把需要 OpenAI 深度能力的請求導向 Sol,其餘請求則交給更便宜的模型。Nex-N2.5 Pro 沒有牌價,只有免費的託管端點——這對評估模型來說是很好的方式,但作為生產環境預算的依據卻很糟。你無法圍繞一個不存在的數字來規劃支出,也無法以尚未釋出的權重來規劃架構。

這次對決真正迫使你做出的決定關乎風險,而非能力。如果你需要一個下一季仍會存在、價格已知、故障樣態已知,且背後有數月對抗性測試的模型,GPT-5.6 Sol 是理性之選——而 OpenAI 在其之上推出 GPT-6 Astra,反而更強化這個論點,因為 Sol 如今是價格調降後直接瞄準生產規模的成熟主力。若你以開放權重建構電腦使用代理,且能等待可驗證的成果,Nex-N2.5 Pro 值得關注——一個 17B 啟用參數的多模態專家,正是那種一再在成本上壓過封閉前沿的模型形態。但「關注」才是關鍵詞。在製造者以外的任何人所衡量的每個維度上,Nex-N2.5 Pro 都落後於持有檔案的那個模型;在權重釋出之前,比較就到此為止。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
