一張為「Nex-N2.5 Pro vs Kimi K3」生成的主視覺標題卡,副標題為「由新人自家基準測試卡擔任裁判的對決」;畫面主體是一張標示著「供應商基準測試卡」的大型圓角文件,內含兩個模型欄,欄位上方寫著「Pro 在多數共有列中落後 K3」;右下角合成 OrcaRouter 標誌。
Guides & Insights

Nex-N2.5 Pro 對上 Kimi K3:由新秀自家基準測試卡當裁判的對決

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

查看 Nex-N2.5 Pro 與 Kimi K3 共有的數據,你就會注意到是誰提供了這些數據。Nex-AGI 的 Nex-N2.5 Pro——這款於 2026 年 9 月 8 日推出、擁有 3,970 億參數、約 170 億活化參數的多模態代理,權重至今仍標示為「即將推出」——發布了一張基準測試表,直接將 Moonshot AI 的 Kimi K3 列在相同的欄位中。Kimi K3 是 Moonshot 於 2026 年 7 月 16 日發布的 2.8 兆參數開放權重旗艦模型,具備百萬 token 的上下文長度;十一天後,完整權重以修改版 MIT 授權發布,並在 Artificial Analysis Intelligence Index 上獲得 57 分,使其成為榜上排名第一的開放權重模型。而在該表格的一行又一行中,Nex-N2.5 Pro 均落後於 Kimi K3:Terminal-Bench 2.1 得分 82.7,對比 K3 的 88.3;BrowseComp 89.7,對比 91.2;SWE-Bench Pro 61.2,對比 63.3;AutomationBench 44.2,對比 46.7。當一個廠商將自家模型的數據印在當前開放權重領先者旁邊,而自家模型在多數列中落敗時,這場對決中最有趣的一點在於:這張表很可能說的是實話。

這就是這場比較之所以不尋常的地方。通常,新來者的規格表正是尋找誇大宣傳的地方。但在這裡,這份規格表反而是兩款模型之間最接近公正裁判的東西,因為 Nex-AGI 沒有理由發布一張貶低自家 Pro 等級的表格——而 Pro 確實勝過 K3 的那幾列,恰好就是小型、專為電腦操作設計的模型理應勝過大型通用模型的那幾列。因此,這個頁面真正回答的問題,比「哪個比較好」更狹窄、也更有用:Nex-N2.5 Pro 所宣稱的利基——以約莫六分之一的活躍參數達到接近 K3 的代理效能——在面對 Kimi K3 早已存在、權重早已釋出、而且早已是眾人亟欲擊敗的目標這個事實時,是否還能經得起考驗?

完整的對手

Kimi K3 並非小眾機型,正因如此,它才是合適的標竿。它是 Moonshot 的旗艦產品:總參數 2.8T,在 Stable LatentMoE 架構下活躍參數為 104B,提供 1M token 的上下文與相稱的輸出預算,原生支援文字、影像與影片理解,具備常駐推理能力,並開放權重——任何握有足夠硬體的人都能實際執行。它獨立地位穩固:智慧指數 57(Artificial Analysis)領先所有其他開放權重模型,並在 Frontend Code Arena 拿下 1,679 Elo,領先 Claude Fable 5GPT-5.6 Sol;而其定價——每百萬輸入 token 3.00 美元、每百萬輸出 token 15.00 美元,快取輸入每百萬 0.30 美元——位居開放權重層級的高階價位。Kimi K3 正是供應商不在規模上妥協時,『前沿且開放』應有的樣貌:它的輸出 token 單價高於 GPT-5.6 Sol 等封閉對手,服務成本高昂,而在排行榜上的成績,也很難讓人有異議。

挑戰者的算術

Nex-N2.5 Pro 的目標不是要在規模上超越 Kimi K3,而是要在服務上勝出。Nex-AGI 以 Qwen3.5 血統的基礎模型進行後訓練,將 Pro 等級打造成一個原生視覺的智慧體,用於操作電腦和瀏覽器;它的賣點是效率:總參數 397B、活躍參數約 17B,具備 262K 上下文,以及單節點 8×H100 的部署方案,對照的是 K3 的 2.8T 總參數、104B 活躍參數,以及這種規模模型所需的那種伺服器群。其言下之意是:一個 17B 活躍參數的專精模型,經由專為視覺回饋智慧體迴圈訓練,就能以極低的伺服成本,達成 104B 活躍參數通用模型大部分的操作效能。在 Nex-AGI 自家的數據卡上,這個說法看似合理,但僅屬片面:Pro 在 OSWorld-G(87.4 對 79.6)和 OmniDoc(92.2 對 91.1)上勝過或追平 K3,其餘共同項目則以個位數差距落敗——一個 397B 模型在程式編寫和瀏覽上輸給 2.8T 模型 3 到 6 分,若屬實,那正是 Nex 想講的效率故事。

如果屬實。那些數字每一個都是 Nex-AGI 自己產出的,至少部分透過其內部 NexCUA 測試框架產生,而 Nex-N2.5 Pro 今天無法被獨立驗證,因為其權重無法下載——Hugging Face 倉庫裡只有一份 README、一個圖表資料夾,以及一條「權重即將推出」的橫幅,僅此而已。同樣的警語也適用於該技術卡上印出的 K3 端數字,其中大部分是 Nex 從 Moonshot 公布的報告中彙編而來,而非自行量測。Nex-AGI 的表格所確立的不是誰勝出;而是 Nex-AGI 自己的工程師,在自行挑選基準測試與測試框架的情況下,仍無法讓其 Pro 級別在多數共同項目上擊敗 Kimi K3。比起任何單一分數,這是一個更有用的數據點,因為它為行銷宣傳可能誇大的程度設定了上限。

A comparison scoreboard for Nex-N2.5 Pro and Kimi K3: Nex-N2.5 Pro rows 'Total / active: 397B / ~17B', 'Weights: coming soon', 'Context: 262K', 'Price: no rate card (free preview)', 'Terminal-Bench 2.1: 82.7 (Nex-reported)', 'OSWorld-2: 56.4 (Nex-reported)'; Kimi K3 rows 'Total / active: 2.8T / 104B', 'Weights: open, Modified MIT', 'Context: 1M', 'Price: $3 / $15, cache $0.30', 'Terminal-Bench 2.1: 88.3 (Moonshot)', 'OSWorld-2: 58.3 (Nex-compiled)'; footer 'All figures vendor-reported; Kimi K3 AA Index 57 per Artificial Analysis.'

重要的資料列,並排呈現

規模 — Nex-N2.5 Pro:總參數量 397B / 活躍參數約 17B,Qwen3.5 系列多模態。Kimi K3:總參數量 2.8T / 活躍參數 104B,採用 Stable LatentMoE,多模態。

權重 — Nex-N2.5 Pro:已承諾,但尚未出貨(卡片上標示「即將推出」)。Kimi K3:已於 7 月 27 日以修改版 MIT 授權發布——今日即可下載。

上下文 — Nex-N2.5 Pro:262K。Kimi K3:100 萬 tokens,固定價格。

價格 — Nex-N2.5 Pro:尚未有費率表;託管預覽免費。Kimi K3:每百萬 $3.00 / $15.00,快取輸入 $0.30。

獨立排名 — Nex-N2.5 Pro:暫無。Kimi K3:AA Intelligence Index 57,排行榜上領先的開放權重模型。

程式編寫(廠商卡片) — Nex-N2.5 Pro:Terminal-Bench 2.1 為 82.7,SWE-Bench Pro 為 61.2。Kimi K3 在相同評測項目上則為 88.3 和 63.3。

GUI / 電腦使用 — Nex-N2.5 Pro:OSWorld-G 87.4(在 K3 自家項目上擊敗 K3),OSWorld-2 56.4。Kimi K3:OSWorld-G 79.6,OSWorld-2 58.3(由 Nex 彙整)。

自托管所需規模 — Nex-N2.5 Pro:權重釋出後,單節點 8×H100 方案即可。Kimi K3:2.8T — 需要服務集群,而非單一節點。

「open」在各欄位中的含義有何不同

「開放」這個詞在兩邊所承載的意義截然不同,而它比任何基準測試都更能決定這場對決的勝負。Kimi K3 在營運面上是開放的:權重放在 hub 上,採用相當寬鬆的修改版 MIT 授權;推理軌跡在串流 API 中暴露;而且有資料治理限制的公司,可以在自己掌控的硬體上運行,並稽核模型當時的思考內容。這種開放需要你付出代價——一個 2.8T 的模型需要可觀的基礎設施——但這個選項如今已經存在。Nex-N2.5 Pro 的開放則是意圖層面的:Nex-AGI 表示家族權重將以開源形式釋出,而且較小的姊妹模型 Nex-N2.5 Mini 確實在發布當天就提供了 Apache-2.0 授權的權重。Pro 的權重尚未釋出,其授權雖然在規格卡上宣布,但尚未對任何可下載內容構成約束;在檢查點出現之前,「開放」只是路線圖上的項目,而非模型本身的屬性。對要在兩者之間做選擇的團隊來說,這不是附註——而是「這個月就能擁有的模型」與「被承諾可以擁有的模型」之間的差別。

無需等待下載按鈕,即可評估

你不必等到 Nex-N2.5 Pro 的權重釋出後才把這個決定定案;路由層正是你低成本進行實驗的地方。Kimi K3 已上架 OrcaRouter,以 Moonshot 的定價供應——$3.00 / $15.00、0% 加成、原價轉售,並在 Moonshot 調整價格當天同步更新——所以這個開放權重領先者就在目錄中其他 200 多個模型旁,只差一個 key 的距離。Nex-N2.5 Pro 並未透過我們提供,因此今天要試用,意味著得先用 Nex-AGI 的代管預覽版,之後再跑自己那八卡 H100 的環境。最合適的做法是:把長上下文與稽核量大的工作,經由你已在使用的單一端點放到 Kimi K3 上;將測試分支指向 Nex-N2.5 Pro 的預覽版;再讓自動容錯移轉繞過任何一方表現劣化的模型——這正是比較一個已上市的前沿模型與一個權重尚未公布的挑戰者時該有的作法,而且不必把生產路徑押在任一方。等 Pro 的權重真的釋出後,驗證很簡單:執行一組共享資料列,讓獨立實驗室也能重現,看看 17B 活化參數的效率說法在 Nex-AGI 自家評測框架之外是否依然成立。

A screenshot of the Hugging Face 'Files and versions' tab for nex-agi/Nex-N2.5-Pro (captured September 9, 2026), showing the model header with Text Generation and Transformers tags, 'License: apache-2.0', and a file tree listing only figures, .gitattributes and README.md - no model weight shards, confirming the Pro checkpoint is not yet published.A screenshot of the OrcaRouter model page for kimi/kimi-k3 (captured September 9, 2026), showing the Kimi K3 card under vendor MoonshotAI with model id kimi/kimi-k3, a 1M-token context, text + image input and text output, vision/tools/reasoning chips, and a 'Public benchmarks by MoonshotAI' note dated 2026-07-15.

這場對決最終如何收尾

面對有史以來出貨的最大型開放權重模型,Nex-N2.5 Pro 不需要在通用能力戰爭中勝出才值得關注——它需要在服務成本論點上勝出,而它自己的規格說明顯示,這個論點真實存在但尚未獲得證實。Kimi K3 是當今穩妥且真正強大的選擇:開放權重、位居開放權重指數榜首、百萬 token 的上下文長度,以及你可以據以編列預算的價格;代價是基礎設施只會隨模型成長而變得更加艱難。Nex-N2.5 Pro 則是一場效率賭注:根據供應商針對一款尚未出貨的模型所提供的規格表,它能在單一節點上以六分之一的有效參數,達到接近 K3 的代理型成績。當你想要的是一款可以立刻真正擁有並審核的前沿模型時,選擇 Kimi K3。請持續關注 Nex-N2.5 Pro,等待其權重發布並由獨立人士執行相同基準的那一天——因為如果一個 17B 有效參數的代理,真的能在電腦使用任務上與 104B 有效參數的旗艦模型維持在數個百分點以內,那麼這個結果將改變其後每個開放代理模型的服務成本算式。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新