「Nex-N2.5 Mini」的英雄標題卡,副標題為「Open weights landed at launch – 小型電腦使用代理」,標籤包含「APACHE-2.0」、「35B TOTAL / ~3B ACTIVE」和「262K CONTEXT」,並有一條橫幅「圖片 + 文字輸入 – 2x H100 參考配置」,右下角合成 OrcaRouter 標誌。
Guides & Insights

Nex-N2.5 Mini:發布即開放權重 — Nex-AGI 最小的電腦操作代理正是入門之選

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

要了解開放式電腦使用代理是否成熟,現在的方法是在發布當天就能下載的模型。Nex-AGI 於 2026 年 9 月 8 日推出 Nex-N2.5 系列——三個代理層級:Nex-N2.5 Mini、Nex-N2.5 Pro 和 Nex-N2.5 Max——其中具備「下載即可執行」特性的層級是最小的那個。Nex-N2.5 Mini 的 Apache-2.0 權重已上架 Hugging Face,共十六個 BF16 分片,約 350 億個參數,據報導每個 token 約有 30 億個活躍參數,並提供雙 H100 參考部署。其較大的多模態同系列模型 Nex-N2.5 Pro 截至本文撰寫時仍標示「即將推出」,而純文字的 1.6 兆參數 Nex-N2.5 Max 也已上線,但需要兩節點共十六張 H200 才能執行。對任何想驗證該系列背後論點的人——即開放式代理模型能承受長時間跨度的電腦使用,而非僅能回答問題——Mini 就是入門起點。

Nex-AGI 是誰?這個名字很新,這次發布也給人初次公開亮相的感覺。相關報導指出,這項成果是上海多家機構合作的結晶——包括 Shanghai Innovation Institute、Shanghai Qiji Zhifeng、Mosi Intelligence 與 Kuafu Technology——其模型家族定位為開源,團隊則以 @NexEcosystem 帳號運作。模型卡將 Nex-N2.5-mini 與 Nex-N2.5-Pro 描述為延續「Nex-N2 的多模態基礎」;Nex-N2 是 Nex 先前已開放權重的版本。真正新鮮的是它的定位框架:Nex-AGI 表示,這些模型是為真實世界環境中的長期任務而生——操作電腦、驅動瀏覽器、執行與測試程式碼,並根據螢幕上的所見修正方向——而且公開權重,正是為了讓這項主張能被驗證。

三個層級,一次公告

這個家族按規模和模態區分,而這些差異比共同名稱更為重要:

• Nex-N2.5 Mini — 總計約 35B / 啟用約 3B,一個接受影像與文字的多模態模型,旨在支援視覺化電腦操作、瀏覽,以及需要介面回饋的任務。參考部署為單一雙 H100 節點。

• Nex-N2.5 Pro — 據報導總參數為 397B / 活躍參數約 17B,同樣具備多模態能力,適用於更重的 computer-use 工作負載。參考部署為八顆 H100。其權重在發布時無法下載。

• Nex-N2.5 Max — 總計1.6T / 約49B活化參數,僅限文字,且依Nex-AGI所述,此為其「首度完成兆級參數規模的完整後訓練」。規格卡指出其建構於DeepSeek-V4-Pro-Base基礎之上。參考部署為跨兩個節點的16×H200。

這三者都是混合專家(MoE)模型。Mini 和 Pro 屬於 Qwen3.5 模型家族——Nex-AGI 的發布資料將兩者描述為由 Qwen3.5 變體後訓練而來,Mini 自身的配置也帶有 qwen3_5_moe 架構標籤——而 Max 則是基於 DeepSeek 的異類。因此,這個家族並非「一個配方、三種尺寸」,而是「兩種配方」:多模態的「在螢幕上執行動作」等級共享同一血統,文字推理巨頭則屬於另一譜系。

實際出貨的 Nex-N2.5 Mini 究竟是什麼

nex-agi/Nex-N2.5-mini 的 Hugging Face 儲存庫是一個真實且可下載的檢查點,並非佔位符——共有 16 個 safetensors 分片,總計約 70 GB,使用 BF16,授權為 Apache-2.0,首次建立於 9 月 8 日。設定檔的內容相當具體,足以作為設計依據:

• 架構 — Qwen3_5MoeForConditionalGeneration,屬於 qwen3_5_moe 系列,配備視覺模組:模型卡將其標記為 image-text-to-text(影像-文字轉文字),且儲存庫隨文字配置檔一同提供 preprocessor_config.json。

• 形狀 — 40 層,隱藏大小 2048,採用分組查詢注意力(grouped-query attention),具 16 個查詢頭與 2 個 KV 頭,詞彙量為 248,320。

• MoE — 256 個路由專家,每個 token 啟用 8 個,另加一個共享專家,中間大小 512 — 這種稀疏啟用架構,讓約 3B 啟用參數的「35B 級」模型可在兩張 H100 上運行。

• 上下文 — 發布配置中的 max_position_embeddings 為 262,144 個 token,與該系列部署配方中出現的 262K 數字相同。

• 權重與授權 — BF16、Apache-2.0、無需申請;該儲存庫也連結至 ModelScope 鏡像,以及一個 GitHub 組織(nex-agi),其中含有此系列的部署配方。

Nex-AGI 的部署文件是多數開源釋出會搞錯的部分,而這一份卻異常地做對了。Mini 是透過自訂的 SGLang Docker 映像檔(nexagi/sglang:v0.5.18-nex-patch)提供服務,運行於單一節點、兩張 H100,採用 tensor parallelism 2。建議取樣參數為 temperature 0.7、top_p 0.95、top_k 40。工具呼叫透過 SGLang 的 qwen3_coder parser 運行,且模型透過 reasoning_effort 欄位提供三種推理模式:「none」代表非思考,「medium」是自適應預設值,「high」代表永遠開啟的思考。對小型 agentic 模型而言,思考模式的控制決定了 agent 迴圈是好用還是緩慢,而它已內建於服務配方中,而非留給使用者自行處理。

A single-column scoreboard titled 'Nex-N2.5 Mini - the scoreboard' with rows 'Params: 35B total / ~3B active (vendor-reported)', 'Architecture: qwen3_5_moe MoE - 256 experts / 8 active', 'Context: 262,144 tokens', 'Input: image + text', 'License: Apache-2.0 - BF16 weights live' and 'OSWorld-Verified: 71.2 (vendor-reported)', with a footer 'Specs from the HF config; benchmarks are Nex-AGI-reported, no independent run yet.'

權重:實際可下載的內容為何?

這三個等級在上市日的狀態值得精確說明,因為公告與儲存庫之間並不完全一致。截至撰寫本文時,Mini 已可在 Apache-2.0 授權下完整下載——本文正是基於此版本。{{1}}Nex-N2.5 Max 也已上線,其 Hugging Face 儲存庫包含 644 個 safetensors 分片{{/1}},{{2}}不過要重現其萬億參數規模是一項需要 16×H200 的專案{{/2}}。Nex-N2.5 Pro 則仍在觀望:{{3}}其 Hugging Face 儲存庫確實存在,但僅包含 README 和圖表,沒有任何模型分片,且模型卡仍寫著權重即將推出{{/3}}。若你在意的是大型多模態等級,{{4}}那正是值得關注的缺口——上市資料將 Pro 描述為該系列中最強大的電腦使用模型{{/4}},{{5}}而它正是目前無法在本機執行的一款{{/5}}。

A screenshot of the Hugging Face repository page for nex-agi/Nex-N2.5-mini (captured September 9, 2026), showing the model header with Text Generation / Transformers / Safetensors / qwen3_5_moe / image-text-to-text / conversational tags and 'License: apache-2.0', and the Files & versions tree for the main branch listing config.json, README.md, chat_template.jinja and the figures directory.

Nex-AGI 報告的數字——以及隨之而來的警示

Nex-AGI 的模型卡中包含 Mini 的完整基準測試表,其中每一項數據都是廠商自行報告的。截至撰寫本文時,尚未有任何獨立評測發布;模型卡也明確說明,分數來自官方基準排行榜、可取得的最新評測報告,以及 Nex-AGI 在其他地方的自家評測。編碼結果是使用團隊的 NexAU 測試框架產生;電腦與瀏覽器操作結果則使用 NexCUA 測試框架,模型卡表示該框架將以開源方式釋出。在第三方中立機構重現這些結果之前,應將頭條列數據視為廠商的最佳情境。

在這個框架下,Mini 回報的數據列為:在文字與程式碼工作方面,Terminal-Bench 2.1 為 73.4、SWE-Bench Pro 為 43.8、DeepSWE v1.1 為 36.1、AutomationBench v1.0.6 為 32.3、Toolathlon Verified 為 54.6、BrowseComp 為 83.4,以及 GDPval-AA v2 分數 1446。在多模態/電腦使用方面,引人注目的成績有 OSWorld-Verified 的 71.2、WebArena-Verified 的 63.4、WebTest 的 48.6(以 oracle 模式並對照真實清單執行)、OSWorld-G 的 82.9 與 OmniDoc 的 89.7,另外還有較為普通的 OSWorld-2(30.5)與 Vision2Web(52.9)結果。

兩則閱讀筆記。第一,OSWorld-Verified 與 OSWorld-2 是兩套不同的測試——前者是以最終環境狀態評分的驗證子集,後者則是較新且普遍更嚴苛的評測——所以在其中一項拿 71.2、另一項拿 30.5 並不矛盾;它們是不同測試,Nex 自己的表格也把它們放在不同欄位。第二,在系列模型的每一列中,Mini 的分數都低於 Pro 和 Max,而每欄的榜首都屬於既有前沿模型,如 Claude Opus 5GPT-5.6 Sol。Mini 的賣點不是打敗前沿模型,而是:一個活躍參數約 3B 的開放模型,以兩張 H100 的運算規模,在電腦使用基準上繳出競爭力十足的成績。這是否經得起考驗,正是開放權重讓你可以親自驗證的問題。

今天運行 Nex-N2.5 Mini

雙 H100 配置讓 Mini 成為親身體驗該系列核心主張的最便宜方式。由於其架構是標準的 Qwen3.5-MoE,搭配 qwen3_coder 工具呼叫解析器,因此可直接載入 Nex-AGI SGLang fork,無需自訂推論程式碼,且建議設定已公開,而非留待逆向工程。開始之前你應抱持的誠實期望是:一天的 checkpoint 配上全新的 harness,是一場實驗,而非依賴。截至本文撰寫時,Mini repo 的下載次數仍在個位數,也尚無第三方發布過獨立評測——這對昨日才發布的模型來說是正常狀態,也正是雙 H100 規模之所以重要的原因:你可以本週就親自執行這場實驗,而不必等別人來做。

A screenshot of the nex-agi collections page on Hugging Face (captured September 9, 2026), showing the Nex-N2.5 collection 'updated about 7 hours ago' with the three model entries nex-agi/Nex-N2.5-Max (Text Generation, 1.6T), nex-agi/Nex-N2.5-Pro and nex-agi/Nex-N2.5-mini, alongside the earlier Nex-N2, Nex-N1.1 and Nex-N1 collections listed on the left.

如果你寧可把 Mini 放進它自己的基準測試表中,與前沿代理模型比較,也不願動手微調單一部署,那麼路由層的價值就在這裡體現。當某家託管供應商列出 Nex-N2.5 Mini,而與它比較的既有模型已可透過路由器存取時,一個涵蓋 200 多個模型的 API——供應商牌價以 0% 加價如實轉傳,並具備自動故障轉移——便是以低成本對其中好幾個模型執行同一任務的途徑,無需另做一次整合。在 OrcaRouter 上,這就是我們路由每個模型時的標準配置:同一個金鑰、同一種呼叫格式、供應商自己的定價,不加任何費用。這對像這樣一個尚未經過驗證的模型尤其重要,因為故障轉移讓你能在真實路徑上試用它,而不必把整條路徑押在它身上。

這些重量該由誰來拉?

如果你的工作涉及電腦使用代理(computer-use agents)、瀏覽器自動化,或視覺導向的工具使用,而你希望有一個寬鬆授權、可自行架設的模型,來與那些代管式的頂尖模型進行基準比對,那就把它拉下來用吧。Apache-2.0 授權消除了中國實驗室發布版本常見的採用摩擦;兩張 H100 的運算規模,對一個正規的 agent 團隊來說也在負擔範圍之內;加上可調控的推理強度與真正的工具呼叫解析器,讓它成為一個可信的測試平台,而不是玩具。如果你需要的是該系列中最強的電腦使用模型,那就先等等——那是 Pro 的定位,而至今仍未釋出權重的,正是 Pro。此外,在獨立測試結果出爐之前,請在每一列基準數據上保留「廠商自報」的標籤:一個活躍參數約 3B 的開源模型在 OSWorld-Verified 上拿下 71.2 分,是很令人震撼的說法,而這種說法,正是你應該先在自己搭建的測試環境中驗證、再決定是否以此為基礎繼續發展的。

接下來該關注什麼。Pro 權重釋出是最重大的單一信號——它讓這個系列從「Mini 加上一個兆級參數的巨獸」,變成發表資料中所描述的完整產品陣容。第二個是 NexCUA 測試框架的開源;少了它,電腦使用能力的數字就無法在相同協議下被獨立重現。第三個是第一份中立的評測,來自 Artificial Analysis、某個大學實驗室,或發布自身 OSWorld-Verified 再現成果的從業者。當這三者任一成為事實,這次發表所提出的問題——開放式代理模型是否真的拉近了與託管式電腦使用技術棧之間的差距——就不再是廠商表格所能決定的事了。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube