「Nex-N2.5 Pro vs Claude Opus 5」主視覺 — 一張生成的標題卡,寫著『Nex-N2.5 Pro vs Claude Opus 5』,副標題為『免費的開放式電腦操作預覽版 vs 你今日即可路由的基準測試領先者』,並加上『Anthropic vs Nex-AGI — 2026 年 9 月』的眉題。
Guides & Insights

Nex-N2.5 Pro 對決 Claude Opus 5:Nex-AGI 選擇了標尺,而標尺勝出

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Nex-AGI 挑選了這把量尺,而量尺贏了。當這家總部位於上海的開放模型聯盟於 2026 年 9 月 8 日推出 Nex-N2.5 Pro 時,模型卡片的電腦操作對照表把 Claude Opus 5 放在比較欄、Nex-N2.5 Pro 放在競爭者欄位:在 OSWorld-2 上,Claude Opus 5 為 68.3,Nex-N2.5 Pro 為 56.4,這兩個數字與 Nex-AGI 在自己卡片上印的完全一致。此後,獨立排行榜的差距不減反增——BenchLM 在 8 月 29 日的 OSWorld 2.0 快照中,將 Claude Opus 5 排在所列 15 個模型之首,分數 70.6。在自己選擇公布的基準上落後榜首 12 分,並非常見的發布套路。因此,Nex-N2.5 Pro 對決 Claude Opus 5 的有趣之處不在分數,而在於這分數兩邊的真實身分:一是 3970 億參數的開放式電腦操作模型,聯盟之外至今無人能執行或驗證;二是 Anthropic 的封閉式旗艦模型,領先該基準且自 7 月底起已承載正式環境流量。

開門見山的誠實總結:這不是兩個可測量數值之間的對決,因為其中只有一方曾被製造者以外的人測量過。Nex-N2.5 Pro 是一個稀疏混合專家模型,總參數約 3970 億,活躍參數約 170 億,基於 Qwen3.5 系列進行後訓練,目標明確鎖定具視覺回饋迴路的長期電腦與瀏覽器操作。目前它透過模型卡上 Nex-AGI 的免費託管端點提供服務,而該系列所依據的 Apache-2.0 權重則仍標示為「即將推出」,且未註明日期。Claude Opus 5 是 Anthropic 專為高要求推理、編碼與代理式工作打造的生產級旗艦模型——封閉模型,具備 100 萬 token 的上下文長度、自適應思考調節鈕、明碼標價,背後還有數週的公開排行榜成績與實際生產流量。在這場對決中,所有優勢都歸屬於下列兩個事實之一:一個模型可運行且可驗證,另一個則兩者皆非。

雙方都同意的基準

電腦操作基準(computer-use benchmarks)所獎勵的,正是這些模型被打造來銷售的行為:一個代理程式觀看螢幕、決定動作、執行動作,然後讀取變化後的螢幕來確認動作是否成功。Nex-N2.5 Pro 正是圍繞這個迴圈所設計——視覺並非事後附加的輸入模態,而是代理程式用以驗證的回饋通道。Claude Opus 5 把同樣的迴圈當作眾多工作負載之一,但它恰好非常擅長此道,這正是 Nex-AGI 最初以它作為參考基準的原因。

這兩個數字嚴格來說並非來自同一套評測框架。Nex-AGI 的 OSWorld-2 數據是透過其自家的 NexCUA 評測框架產出,該框架據稱將開源但尚未釋出,而 Nex-N2.5 Pro 的 56.4 分是未經複現的廠商輸出。Claude Opus 5 在 BenchLM 上的 70.6 分則是 OSWorld 2.0 的第三方快照,日期為 2026 年 8 月 29 日,且與 Nex-AGI 自身引用的排行榜來源中的 68.3 分一致。不同框架與略微不同的基準版本意味著實際差距——在 Nex-AGI 自家數據上為十二個百分點,在 BenchLM 上則接近十四個百分點——應視為方向性參考。但無可爭議的是,根據雙方可得的最佳數據,Nex-N2.5 Pro 仍低於當前最先進的電腦使用代理。

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

「我今天可以運行它嗎」的兩個答案

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

對一個真正在運作的團隊來說,這個 fork 才是真正決定勝負的關鍵,而它對新手並不友善。Nex-N2.5 Pro 的 Hugging Face 卡片上仍標示著權重「即將推出」,並以 Apache-2.0 授權釋出,但沒有附上任何發佈日期。唯一實際可用的版本,是卡片上由 Nex-AGI 連出去的免費託管端點——可以呼叫,但擁有者是別人;沒有定價,沒有團隊可以據以規劃的服務條款,也無法讓你在自己的硬體上重現任何一項效能基準數據。等到權重真的釋出時,文件記載的部署方式是單一節點搭配八張 H100,並使用客製化的 SGLang 映像檔——對一個 397B 的 MoE 來說,這是實際但常見的配置,也正因如此,17B 活躍(17B-active)參數的設計才值得關注。在那之前,Nex-N2.5 Pro 只是一個你可以查詢的預覽版,而不是一個你可以據以建構產品的模型。

Claude Opus 5 在那些比較項目的每一項上都是相反的情況。自 7 月 24 日起,它就一直透過 Anthropic 的 API 和路由平台提供服務,價格公開且穩定,權重不公開且將持續不公開,而它的任何數據今天都可以透過實際執行來驗證。圍繞它的生態系——Claude Code、MCP 工具,以及六週來不斷對它施壓的大量生產環境代理程式——正是一個剛推出一天的模型無法宣稱的累積紀錄。對於一個要求是「模型在下個季度必須依然可用」的團隊來說,這份紀錄就是整個勝負所在。

所謂的規格表,也就這樣了。

將兩個信封並排擺放:

發布 — Nex-N2.5 Pro:2026年9月8日(託管端點已上線,權重待發布)。Claude Opus 5:2026年7月24日,全面上市。

規模 — Nex-N2.5 Pro:總參數 397B / 約 17B 啟用參數(MoE)。Claude Opus 5:參數數量未公開。

模態 — Nex-N2.5 Pro:文字與影像輸入、文字輸出,視覺在其電腦使用迴圈中居於核心。Claude Opus 5:文字與影像輸入、文字輸出,具備強大的視覺分析能力。

上下文 / 輸出 — Nex-N2.5 Pro:262,144 個 token 的上下文,已記錄的服務長度。Claude Opus 5:100 萬個 token 的上下文,128K token 的輸出上限。

推理控制 — Nex-N2.5 Pro:提供 reasoning_effort 開關,選項為 none / medium(自適應,預設)/ high。Claude Opus 5:預設採用自適應思考,並帶有從低到最高(low-to-max)的明確努力調節。

權重 — Nex-N2.5 Pro:Apache-2.0,即將推出,日期未定。Claude Opus 5:封閉。

每1M tokens的價格 — Nex-N2.5 Pro:提供免費託管層級,未公佈定價。Claude Opus 5:輸入 $5.00 / 輸出 $25.00,快取讀取 $0.50,快取寫入 $6.25。

這些規格的差異足以讓規格表真正派上用場:Opus 5 為長時間的 agent 會話帶來一百萬 token 的上下文窗口與 128K 輸出上限,而 Nex-N2.5 Pro 的 262K 上下文與免費方案則更適合範圍較小、以螢幕驅動的自動化。這兩項規格都不會讓另一方變成多餘;這兩個模型對於 agent 該把上下文花在何處,意見並不一致。

誠實解讀 Nex-AGI 自家的記分板

卡片的其餘部分也值得用同樣的濾鏡來閱讀。Nex-N2.5 Pro 的其他電腦使用數據列——OSWorld-G 87.4、OSWorld-Verified 82.2、WebArena-Verified 67.6、WebTest 52.8、Vision2Web 68.2——以及其編碼數據列——Terminal-Bench 2.1 為 82.7、SWE-Bench Pro 為 61.2、BrowseComp 為 89.7——全都是透過該聯盟自家測試框架取得的廠商測量結果,且在最初 48 小時內未經第三方重現。中立讀者能從這張卡得出的唯一結論是:Nex-AGI 認為 Nex-N2.5 Pro 是一款強勁的中階電腦使用模型,但在最關鍵的指標上仍落後於前沿智能體。對一個 397B 的開放模型來說,這是連貫甚至保守的定位。同時,這也是一個等待第二個實驗室來驗證的主張。

金錢,當一方沒有價格時

這裡沒有誠實的價格比較可做,因為只有一方有價格。Nex-N2.5 Pro 的免費託管方案無法告訴你這個模型真實價值——免費預覽端點是供應商蒐集流量與回饋的方式,而 Nex-AGI 尚未公布該系列的付費每 token 費率。Claude Opus 5 在 Anthropic 的牌價是每百萬輸入 tokens 5.00 美元、每百萬輸出 tokens 25.00 美元,快取讀取為 0.50 美元;這正是預算必須吸收的數字。如果你今天正在為 computer-use agents 支付這筆帳單,並想知道一個 17B-active 的開源模型能否以更低成本完成同樣工作,答案是:可能,但在權重公布且有人獨立執行測試之前,你無從得知。價格比較是延後了,而非已定案;把免費端點視為模型便宜的證據,屬於範疇錯誤。

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

你今天能做的,就是為它成為可能的那一天預先設定好 A/B 測試。Claude Opus 5 已在 OrcaRouter 上,以 Anthropic 的牌價提供——同樣是 $5.00 / $25.00,不加價直接轉傳,所以這裡的帳單與 Anthropic 一致,且價格會在 Anthropic 調動的同一天跟著調動。一個 API 金鑰就能讓它與 200 多個其他模型共用同一個端點;若某個供應商出問題便自動容錯轉移;若你想讓 Opus 處理棘手的請求、讓較便宜的模型處理例行請求,也有路由 DSL 可供使用。Nex-N2.5 Pro 目前不在 OrcaRouter 上——我們在撰寫前已查閱過模型目錄,上面還沒有列出任何 nex-agi 模型。一旦有供應商以牌價提供該模型,它當天就會出現在這裡;而這篇文章目前無法進行的誠實比較,屆時將變成一道路由規則,而非一場遷移。

誰應該行動,誰應該等待

如果你的團隊目前正在運行生產環境級的電腦使用或代理式編碼工作負載,而且需要一個價格已知、失敗特徵已知、並具備獨立實績紀錄的模型,那麼在這場對決中,Claude Opus 5 是理性的選擇,而 Nex-N2.5 Pro 上市頭 48 小時的任何表現都不會改變這一點。如果你的團隊正在為未來的建置評估開放的電腦使用模型,Nex-N2.5 Pro 就該列入觀察名單——一個 397B 的多模態 MoE,具備合理的自架設資源足跡,以及可信的中階基準測試表現,正是那種能重塑成本曲線的開放模型——前提是權重真的釋出,且官方規格表上的數字能通過獨立驗證。理性的立場是兩者並行:讓經過實證的領先者留在關鍵路徑上,同時讓權重釋出的那一天來決定這個新來者是否值得一試。那才是這場對決中尚未發生的比較——而它才是真正重要的比較。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新