
Nex-N2.5 Pro 對比 Gemini 3.1 Pro:推出僅一天的開放模型 vs 已推七個月的預覽版
- openai新OpenAI: GPT-6 Astra2026-09-0455智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0247智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0247智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0157智能82程式
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2646智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1849智能75程式
- obsidianQwen3.8 27B2026-08-1541智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242智能69程式
- grokSpaceXAI: Grok 4.62026-08-1251智能77程式
- metaMeta: Muse Spark 1.22026-08-0547智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0347智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2140智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128智能49程式
這場對決中最奇特的對稱性在於,兩款模型都尚未正式完成,而且每一方都以對方無法做到的方式證明這點。Gemini 3.1 Pro Preview 是 Google 的封閉多模態旗艦模型,自 2026 年 2 月 19 日起便一直處於預覽狀態——七個月,對前沿模型而言堪稱永恆——而其開發者至今仍未宣布正式發布。Nex-N2.5 Pro 是來自 Nex-AGI 開放模型聯盟、擁有 3970 億參數的電腦操作模型,截至本文撰寫時才剛發布一天,卻已在回應來自免費託管端點的流量——然而其 Apache-2.0 權重在 Hugging Face 上仍標示為「即將推出」,這使它成為另一種意義上的未完成。前者除了廠商不願公開確認外,各方面都是成品;後者除了廠商願意出貨外,各方面都還未完成。
這兩種不完整性的樣態,會改變以下每個數字的解讀方式。Gemini 3.1 Pro 是 Google 目前旗艦級的推理模型——可處理文字、圖像、音訊、視訊與檔案等多模態輸入,具備 1M token 的上下文長度、65K 的輸出上限,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元;一旦請求超過 200K 輸入 token,價格便會調升。Nex-N2.5 Pro 則是總參數量 397B、活躍參數約 17B 的稀疏混合專家模型,輸入支援文字與圖像,輸出為文字,具備 262,144 token 的上下文長度,並配有專為操作電腦與瀏覽器而設計的視覺迴圈。兩者同屬「高階代理型模型」這個價格相近的區間,但幾乎在其他所有方面都意見相左,而且兩者都沒有廠商願意宣稱已臻完備。
規格表:兩款多模態 1M 級模型
將信封並排放在一起:
• 狀態 — Nex-N2.5 Pro:2026年9月8日發布;託管端點已上線,權重待發布。Gemini 3.1 Pro:自2026年2月19日起為預覽版,尚未正式發布(GA)。
• 規模——Nex-N2.5 Pro:總參數397B/MoE活躍參數約17B,由Qwen3.5系列後續訓練而成。Gemini 3.1 Pro:參數量未公開。
• 模態Nex-N2.5 Pro:文字與影像輸入,文字輸出;視覺是電腦操作的反饋通道。Gemini 3.1 Pro:文字、影像、音訊、視訊及檔案輸入,文字輸出。
• 上下文 / 輸出 — Nex-N2.5 Pro:262,144 token 的上下文(文件記載之服務長度)。Gemini 3.1 Pro:1M token 的上下文,輸出上限為 65K。
• 推理控制 — Nex-N2.5 Pro:無 / 中等(適應性,預設)/ 高。Gemini 3.1 Pro:可調整的思考預算;沒有公開「max」等級的爭議。
• 權重 — Nex-N2.5 Pro:Apache-2.0,即將推出。Gemini 3.1 Pro:閉源。
• 每1M個token的價格 — Nex-N2.5 Pro:免費託管方案,未公佈官方定價。Gemini 3.1 Pro:$2.00 / $12.00,超過200K個輸入token後調整為$4.00 / $18.00,快取輸入為$0.20。
這兩份規格表除了「長上下文、多模態、建置成本高昂」之外,幾乎沒有共識。關鍵差異在於:Gemini 一方對 200K 輸入有額外收費;Nex 一方則是在經濟性上免費但無法驗證;以及只有 Nex-N2.5 Pro 是以讀取螢幕為核心來設計架構的。

兩種不同的未完成方式
Google:七個月的預覽作為一項產品決策
Gemini 3.1 Pro 的預覽狀態並非徒具形式,而且日益成為關於這款模型最重要的事實。Google 的 Pre-GA 條款允許在生產環境中使用,同時保留變更行為或棄用端點的權利——對於將旗艦模型置於關鍵路徑上的團隊而言,這是真實存在的風險。該模型的發展軌跡完全沒有消除這項風險:它於 2 月推出時是市場上得分最高的模型,在當時的 Artificial Analysis Intelligence Index 上獲得 57 分;之後以更嚴格的指數標準重新衡量,分數約為 48 分。與此同時,其預定後繼者 Gemini 3.5 Pro 在 5 月宣布後便一再延遲,甚至傳出可能取消的消息。其間,Google 於 8 月以 $0.75 / $3.75 的價格推出 Gemini 3.7 Flash,並於 9 月初推出 Gemini 3.8 Flash;價格較低的 Flash 系列已在獨立指數上超越 Pro 旗艦。如今採用 Gemini 3.1 Pro,等於採用一款供應商持續將其置於預覽狀態、較便宜的兄弟產品排名更高、後繼者又前途未卜的旗艦模型。
Nex-AGI:將「即將推出」視為交付狀態的一天

Nex-N2.5 Pro 的不完整性走向另一個極端:除了讓它真正成真的東西之外,一切都已出貨。託管端點已上線且免費,OpenAI 相容的呼叫能正常運作,模型卡上也滿是基準測試數據——OSWorld-2 56.4、Terminal-Bench 2.1 82.7、SWE-Bench Pro 61.2——皆是透過聯盟自家的 NexCUA 測試框架所測得,而聯盟宣稱會開源該框架,卻迄未兌現。但模型權重無法下載,橫幅上沒有標示任何發布日期,也沒有任何獨立實驗室執行過該模型,因為根本無從執行。若說 Gemini 3.1 Pro 是「可衡量卻未承諾」,那麼 Nex-N2.5 Pro 便是「已承諾卻無法衡量」。無論是前者還是後者,都足以讓生產團隊卻步,只是原因各有不同。
獨立證據所在之處
這個對戰組合的獨立紀錄幾乎完全倒向一方。Gemini 3.1 Pro 背後有六個月的公開測試:獨立實驗室為它做過基準測試,生產團隊對它嚴加操練,而它目前的人工分析智慧指數(Artificial Analysis Intelligence Index)讀數接近 48——以旗艦模型來說並不出眾,也正是 Google 較便宜的 Flash 系列模型已超越它的原因,但這是一項由供應商以外的人所產生的實際量測。Nex-N2.5 Pro 則沒有這類紀錄。它僅有的分數出自 Nex-AGI 自家,所採用的測試框架公眾從未見過。因此,真正重要的比較不是「48 對 0」——而是「缺點已有文件記載的模型」對上「優點僅憑宣稱的模型」。對於一個答錯代價高昂的工作負載來說,這種不對稱往往具有決定性,無論數字如何。
長上下文法案的樣貌
這兩個模型都宣稱支援長上下文,但收費方式卻洩漏了真實意圖。Gemini 3.1 Pro 的 1M token 視窗採用 $2.00 / $12.00 的費率,一旦請求超過 200K 輸入 token,費率便調升至 $4.00 / $18.00——約等於 60% 的輸入溢價與 50% 的輸出溢價,且正好套用在那些需要 1M 視窗的工作負載上。若在 agent 工作階段的每一輪都餵入 500K token 的儲存庫上下文,每一次呼叫都會背上這筆溢價。Nex-N2.5 Pro 的 262K 上下文較為保守,但其代管層級免費,而且 Nex-AGI 完全沒有公布任何付費費率,因此沒有長上下文溢價可以建模——同時也沒有價格訊號來顯示這個模型值多少。Google 明確地告訴你它的視窗成本,而且價格高昂;Nex-AGI 什麼都不說,這並不等同於便宜。
目前可路由的內容

在這裡,雙方的分野對一個實際運作的團隊而言乾淨俐落。Gemini 3.1 Pro 以 Google 的牌價上架 OrcaRouter——同樣是 $2.00 / $12.00,超過 200K 的計費級距也原封不動地通過——而它的預覽狀態,正是繞開它而不是把關鍵路徑押在它身上的理由:自動容錯移轉代表預覽模型一旦出狀況或遭到棄用,便會在無須變更程式碼的情況下重新導向至備援模型;路由 DSL 則讓你能把需要 Google 多模態能力的請求導向 Gemini,同時讓較便宜的模型吸收例行流量。Nex-N2.5 Pro 不在 OrcaRouter 上——我們的目錄中沒有列出任何 nex-agi 模型——因為它目前僅有的正式建置,正是 Nex-AGI 從其卡片上連結出去的那些免費端點。等到有供應商以真實牌價提供它的那一天,它便會以該價格、不加任何價差地出現在這裡,而這份比較也將從紙上談兵變成真正可執行。
誰該碰哪個
誠實的答案取決於你能承受哪一種風險。如果你今天就需要大規模多模態推理,而且能容忍一個將旗艦產品維持在預覽狀態、路線圖不斷變動的供應商,那麼 Gemini 3.1 Pro 就是可衡量的選擇——六個月的獨立測試是真正的資產,而 Flash 兄弟系列的崛起是調整路由策略的理由,而不是避開該家族的理由。如果你正在以開放權重建構電腦使用代理,而且願意等待可驗證的成果,Nex-N2.5 Pro 是更有趣的長期賭注——但它還不是你能下的注,因為你無法執行它、無法重現它的分數,也無法簽署依賴它的合約。對任何一種決定都會最滿意的團隊,是那些把兩種模型都當作它們真實樣貌來看待的團隊:一個是歷經七個月預覽、已被所有人測試過;另一個則是剛滿一天的預覽、還沒被任何人測試過。
