
Nex-N2.5 Pro 與 MiniMax M3:宣稱的 34 分差距,以及你實際上能下載的模型
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
這場對決中最引人注目的數字是 56.4 對 22.3——也是最難驗證的。這兩個是 Nex-AGI 的 Nex-N2.5 Pro 與 MiniMax M3 在該新模型自家基準卡上記載的 OSWorld-2 分數:Pro 為 56.4,MiniMax 的 M3 為 22.3,在長程電腦操作基準上出現 34 分的差距,而這個基準如今是所有認真的 GUI 代理都必須接受評量的標準。Nex-N2.5 Pro 於 2026 年 9 月 8 日發表,是參數總量 397B/活躍參數約 17B 的多模態代理,其權重目前仍「即將推出」。MiniMax M3 於 2026 年 6 月 1 日釋出,是參數總量 428B/活躍參數約 23B 的開放權重多模態旗艦模型,也接受影片輸入,在 MiniMax Sparse Attention 上支援 100 萬 token 的上下文,且自 6 月初起即可下載。這兩款模型中,有一款你可以從 hub 拉下來今晚就運行。另一款則是附帶承諾的代管預覽版。而讓這場對決值得一讀的 34 分差距,是由你無法運行的那款模型的廠商所公布的,而且其所依據的基準,連現任者的數字也是由廠商自行申報的。
所以這一頁真正的重點在於:你該如何權衡一個驚人但無法驗證的領先幅度,與一個溫和但部分可驗證的領先幅度——同時也在於便宜模型的存在,對昂貴模型的推銷話術造成了什麼影響。MiniMax M3 正是每個權重尚未釋出的廠商都必須拿來辯駁的制衡力量:它已經能勝任大部分工作、成本幾乎為零,而且它的檔案就在你的硬碟裡。若要讓 Nex-N2.5 Pro 具有意義,那 34 分的宣稱就必須通過接下來這三項檢驗。
首先檢查:這些數字衡量的真的是同一件事嗎?
OSWorld-2 是原始 OSWorld 基準測試在長時程、真實世界上的延伸——代理要在多步驟任務中操作真實的桌面軟體,評分標準是它有沒有真正完成實際工作,而不是有沒有點對按鈕。它比前代難上非常多,而 Nex-AGI 宣稱,正是在這個基準測試上,自家的 Pro 等級能從一眾多模態模型中脫穎而出。不過,請看看這兩列數據的來源。Nex-N2.5 Pro 的 56.4,是 Nex-AGI 透過內部 NexCUA 評測框架自行量測的結果,而該卡上寫道這套框架將「很快」開源。MiniMax M3 的 22.3,則是 Nex-AGI 為競爭對手模型印上的數字——MiniMax 自己從未發布 OSWorld-2 的成績,M3 對外公開的電腦操作數據是較舊、也較簡單的 OSWorld-Verified;Nex 的同一張卡也列出 M3 在該項目為 75.2,Pro 則為 82.2。在那個 56.4 對 22.3 的醒目對比中,兩列數據出自同一個評測框架、由同一家廠商在同一天執行,對象一個是它自家擁有的模型,一個是它不擁有的模型。這並不表示這個差距是假的——評測框架存在的意義,正是在完全相同的條件下比較模型。但這確實表示,這個數字只是單一廠商控制下的比較結果,而非任何外部實驗室已確認的成果;而這個差距有多可信,完全取決於產出它的評測框架。
第二項檢查:你實際能運行的模型能提供什麼?
MiniMax M3 並不需要靠它在 OSWorld-2 那一欄才有價值,因為它的立論基礎在於那些你下載後就能自行驗證的事。它的總參數量為 428B、啟用參數量約 23B,建立在 MiniMax Sparse Attention 之上,具備 100 萬 token 的上下文與 51.2 萬 token 的輸出預算;它接受文字、圖片與影片輸入,並回傳文字;其權重從 6 月第一週起就已放在 Hugging Face 上;而 MiniMax API 的公開定價為每百萬輸入 token 0.30 美元、每百萬輸出 token 1.20 美元,快取輸入則為 0.06 美元——大約是最便宜封閉式旗艦模型輸出價格的五分之一,影片另計。它的獨立定位真實但有限:在 Artificial Analysis Intelligence Index 上拿下 44 分,使其位居旗艦模型的中段班,低於封閉式領先者所佔據的 56 至 61 分區間。它最引人注目的 Agent 數據——Nex 卡片上彙整的 75.2 OSWorld-Verified、MiniMax 自家報告約 70、BrowseComp 83.5——皆為廠商自行通報且未經重現,與 Nex 背後那個星號如出一轍。差別在於 M3 的主張指向一個你可以親自執行並重新測試的模型,這正是「廠商通報」在擁有可下載權重的那一方,殺傷力較小的原因。

第三項檢查:每一項你實際上會怎麼用?
• 今日可購買 — MiniMax M3:真實權重、價目表、可用的 API。Nex-N2.5 Pro:免費的託管預覽與路線圖。
• 電腦使用 — MiniMax M3:通用型代理,能處理截圖與影片,GUI 評測成績居於中段。Nex-N2.5 Pro:專為視覺回饋迴圈打造的原生視覺代理,宣稱在 OSWorld-2 名列同級榜首。
• 價格 — MiniMax M3:$0.30 / $1.20,快取 $0.06 — 便宜到足以投入長時間的智能體迴圈。Nex-N2.5 Pro:尚未公布價格;其效率論點(在單一 8×H100 節點上啟動 17B 參數)是預測,而非實際帳單。
• 上下文 — MiniMax M3:1M tokens,超過 512K 的請求以 2 倍計費。Nex-N2.5 Pro:262K 系列配置。
• 輸入 — MiniMax M3:原生支援文字、圖片與影片。Nex-N2.5 Pro:圖片與文字,著重於螢幕層級感知。
• 可驗證性 — MiniMax M3:可自行部署,因此任何宣稱都能在內部測試驗證。Nex-N2.5 Pro:未提供權重,因此每項宣稱都只是 Nex-AGI 自家的說法。
• 獨立指數 — MiniMax M3:44(AA)。Nex-N2.5 Pro:暫無。
為何低價的現任業者是更難對付的對手
Nex-AGI 之所以選擇將 MiniMax M3 印在其多模態比較表上,而不是忽略它,是有原因的:M3 正是那個價格錨點,讓電腦操作專家的溢價難以成立。如果一個定價 $0.30/$1.20、可接受影片輸入的通用模型,能做到專用 GUI agent 所宣稱能力的 70–75%,那後者就必須在實際任務上明顯更強,才能證明自己的價值——而 Nex-N2.5 Pro 的規格卡宣稱,它在 OSWorld-2 上確實做到了,領先 34 分。不過,這 34 分的領先是挑戰者為其尚未出貨的模型印出的數字,終究只是假設;M3 的 44 Index、其開放權重和價格,才是你可以依賴的事實。因此在經濟上理性的立場,不是否定這個假設,而是堅持它必須先通過獨立的實測,才能讓任何人為它掏錢。
在您自己的金鑰上執行比較
路由層正是讓這類以價格為錨的比較,得以在不必對任何一方作出承諾的情況下接受考驗的地方。MiniMax M3 已可在 OrcaRouter 上使用,價格是 MiniMax 的牌價——$0.30 / $1.20,以 0% 加價直接轉傳;因此 MiniMax 調價當天,變動就會在你原本用來取用目錄其餘部分的同一個金鑰上即時生效。Nex-N2.5 Pro 並未透過我們提供,所以在承諾釋出的權重現身之前,你得透過 Nex-AGI 所代管的預覽來使用它。真正能回答這個對戰組合的實驗是:把你高流量、長上下文的 agent 流量,透過那一個端點指向 MiniMax M3;同時對 Nex-N2.5 Pro 的預覽跑一個較小的評估分支;再在你自己的工作任務組合上比較兩者,並讓自動容錯轉移使雙方都無法灌水——廠商宣稱的 34 分領先,價值只等同於你親自重現的結果;而 M3 夠便宜,重現測試幾乎不用成本。等到 Pro 的權重正式釋出,真正該檢視的交付物是那套八顆 H100 的 recipe:當執行者不是 Nex-AGI 時,這個 17B 活躍參數的專門模型是否還能維持它在 OSWorld-2 上的領先。


證據支持的裁決
在所有目前可實際執行的事情上,MiniMax M3 在這場對決中不戰而勝:它可以下載,定價只有前沿標準的五分之一,支援影片輸入,擁有獨立的 Index,而且它對電腦使用的宣稱——雖然是廠商自行通報——所指涉的模型,你本週就能在自己的技術棧中重新測試。Nex-N2.5 Pro 是更有趣的模型,但卻是更糟的購買選擇:一個原生視覺的電腦使用專家,其自家模型卡宣稱擁有同級最佳的 OSWorld-2 分數,但權重目前還不存在。請把 56.4 對 22.3 的差距視為關於電腦使用走向的現有最佳假設,而不是一個你可以付諸行動的結果——並把 MiniMax M3 視為原因:那個專家模型最終出貨時,必須在別人的測試框架上證明這個差距,才有理由收取任何高於 $0.30/$1.20 的價格。
