「Nex-N2.5 Pro vs Gemini 3.1 Pro」的主視覺:一張生成的標題卡,眉題是「Google vs Nex-AGI —— 2026年9月」,主標題是「Nex-N2.5 Pro vs Gemini 3.1 Pro」,副標題是「兩款未完成的旗艦機型——一款已預覽七個月,一款才發布一天、權重尚未釋出」。
Guides & Insights

Nex-N2.5 Pro 對比 Gemini 3.1 Pro:推出僅一天的開放模型 vs 已推七個月的預覽版

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這場對決中最奇特的對稱性在於,兩款模型都尚未正式完成,而且每一方都以對方無法做到的方式證明這點。Gemini 3.1 Pro PreviewGoogle 的封閉多模態旗艦模型,自 2026 年 2 月 19 日起便一直處於預覽狀態——七個月,對前沿模型而言堪稱永恆——而其開發者至今仍未宣布正式發布。Nex-N2.5 Pro 是來自 Nex-AGI 開放模型聯盟、擁有 3970 億參數的電腦操作模型,截至本文撰寫時才剛發布一天,卻已在回應來自免費託管端點的流量——然而其 Apache-2.0 權重在 Hugging Face 上仍標示為「即將推出」,這使它成為另一種意義上的未完成。前者除了廠商不願公開確認外,各方面都是成品;後者除了廠商願意出貨外,各方面都還未完成。

這兩種不完整性的樣態,會改變以下每個數字的解讀方式。Gemini 3.1 Pro 是 Google 目前旗艦級的推理模型——可處理文字、圖像、音訊、視訊與檔案等多模態輸入,具備 1M token 的上下文長度、65K 的輸出上限,定價為每百萬輸入 token 2.00 美元、每百萬輸出 token 12.00 美元;一旦請求超過 200K 輸入 token,價格便會調升。Nex-N2.5 Pro 則是總參數量 397B、活躍參數約 17B 的稀疏混合專家模型,輸入支援文字與圖像,輸出為文字,具備 262,144 token 的上下文長度,並配有專為操作電腦與瀏覽器而設計的視覺迴圈。兩者同屬「高階代理型模型」這個價格相近的區間,但幾乎在其他所有方面都意見相左,而且兩者都沒有廠商願意宣稱已臻完備。

規格表:兩款多模態 1M 級模型

將信封並排放在一起:

狀態 — Nex-N2.5 Pro:2026年9月8日發布;託管端點已上線,權重待發布。Gemini 3.1 Pro:自2026年2月19日起為預覽版,尚未正式發布(GA)。

規模——Nex-N2.5 Pro:總參數397B/MoE活躍參數約17B,由Qwen3.5系列後續訓練而成。Gemini 3.1 Pro:參數量未公開。

模態Nex-N2.5 Pro:文字與影像輸入,文字輸出;視覺是電腦操作的反饋通道。Gemini 3.1 Pro:文字、影像、音訊、視訊及檔案輸入,文字輸出。

上下文 / 輸出 — Nex-N2.5 Pro:262,144 token 的上下文(文件記載之服務長度)。Gemini 3.1 Pro:1M token 的上下文,輸出上限為 65K。

推理控制 — Nex-N2.5 Pro:無 / 中等(適應性,預設)/ 高。Gemini 3.1 Pro:可調整的思考預算;沒有公開「max」等級的爭議。

權重 — Nex-N2.5 Pro:Apache-2.0,即將推出。Gemini 3.1 Pro:閉源。

每1M個token的價格 — Nex-N2.5 Pro:免費託管方案,未公佈官方定價。Gemini 3.1 Pro:$2.00 / $12.00,超過200K個輸入token後調整為$4.00 / $18.00,快取輸入為$0.20。

這兩份規格表除了「長上下文、多模態、建置成本高昂」之外,幾乎沒有共識。關鍵差異在於:Gemini 一方對 200K 輸入有額外收費;Nex 一方則是在經濟性上免費但無法驗證;以及只有 Nex-N2.5 Pro 是以讀取螢幕為核心來設計架構的。

A two-column scoreboard titled 'Nex-N2.5 Pro vs Gemini 3.1 Pro — the scoreboard'. Left column Nex-N2.5 Pro: Status announced Sep 8 2026; Modality text + image; Context 262,144; Weights Apache-2.0 pending; AA Index no score yet; Price free hosted / no list. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Modality text / image / audio / video; Context 1M / 65K output; Weights closed; AA Index ~48; Price $2.00 / $12.00 (200K step). Footer: 'Nex unmeasured independently; Gemini figures per Artificial Analysis.'

兩種不同的未完成方式

Google:七個月的預覽作為一項產品決策

Gemini 3.1 Pro 的預覽狀態並非徒具形式,而且日益成為關於這款模型最重要的事實。Google 的 Pre-GA 條款允許在生產環境中使用,同時保留變更行為或棄用端點的權利——對於將旗艦模型置於關鍵路徑上的團隊而言,這是真實存在的風險。該模型的發展軌跡完全沒有消除這項風險:它於 2 月推出時是市場上得分最高的模型,在當時的 Artificial Analysis Intelligence Index 上獲得 57 分;之後以更嚴格的指數標準重新衡量,分數約為 48 分。與此同時,其預定後繼者 Gemini 3.5 Pro 在 5 月宣布後便一再延遲,甚至傳出可能取消的消息。其間,Google 於 8 月以 $0.75 / $3.75 的價格推出 Gemini 3.7 Flash,並於 9 月初推出 Gemini 3.8 Flash;價格較低的 Flash 系列已在獨立指數上超越 Pro 旗艦。如今採用 Gemini 3.1 Pro,等於採用一款供應商持續將其置於預覽狀態、較便宜的兄弟產品排名更高、後繼者又前途未卜的旗艦模型。

Nex-AGI:將「即將推出」視為交付狀態的一天

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

Nex-N2.5 Pro 的不完整性走向另一個極端:除了讓它真正成真的東西之外,一切都已出貨。託管端點已上線且免費,OpenAI 相容的呼叫能正常運作,模型卡上也滿是基準測試數據——OSWorld-2 56.4、Terminal-Bench 2.1 82.7、SWE-Bench Pro 61.2——皆是透過聯盟自家的 NexCUA 測試框架所測得,而聯盟宣稱會開源該框架,卻迄未兌現。但模型權重無法下載,橫幅上沒有標示任何發布日期,也沒有任何獨立實驗室執行過該模型,因為根本無從執行。若說 Gemini 3.1 Pro 是「可衡量卻未承諾」,那麼 Nex-N2.5 Pro 便是「已承諾卻無法衡量」。無論是前者還是後者,都足以讓生產團隊卻步,只是原因各有不同。

獨立證據所在之處

這個對戰組合的獨立紀錄幾乎完全倒向一方。Gemini 3.1 Pro 背後有六個月的公開測試:獨立實驗室為它做過基準測試,生產團隊對它嚴加操練,而它目前的人工分析智慧指數(Artificial Analysis Intelligence Index)讀數接近 48——以旗艦模型來說並不出眾,也正是 Google 較便宜的 Flash 系列模型已超越它的原因,但這是一項由供應商以外的人所產生的實際量測。Nex-N2.5 Pro 則沒有這類紀錄。它僅有的分數出自 Nex-AGI 自家,所採用的測試框架公眾從未見過。因此,真正重要的比較不是「48 對 0」——而是「缺點已有文件記載的模型」對上「優點僅憑宣稱的模型」。對於一個答錯代價高昂的工作負載來說,這種不對稱往往具有決定性,無論數字如何。

長上下文法案的樣貌

這兩個模型都宣稱支援長上下文,但收費方式卻洩漏了真實意圖。Gemini 3.1 Pro 的 1M token 視窗採用 $2.00 / $12.00 的費率,一旦請求超過 200K 輸入 token,費率便調升至 $4.00 / $18.00——約等於 60% 的輸入溢價與 50% 的輸出溢價,且正好套用在那些需要 1M 視窗的工作負載上。若在 agent 工作階段的每一輪都餵入 500K token 的儲存庫上下文,每一次呼叫都會背上這筆溢價。Nex-N2.5 Pro 的 262K 上下文較為保守,但其代管層級免費,而且 Nex-AGI 完全沒有公布任何付費費率,因此沒有長上下文溢價可以建模——同時也沒有價格訊號來顯示這個模型值多少。Google 明確地告訴你它的視窗成本,而且價格高昂;Nex-AGI 什麼都不說,這並不等同於便宜。

目前可路由的內容

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the header stats $2.00 input and $12.00 output per million tokens and the byline 'by Google - 2026-02-19'.

在這裡,雙方的分野對一個實際運作的團隊而言乾淨俐落。Gemini 3.1 Pro 以 Google 的牌價上架 OrcaRouter——同樣是 $2.00 / $12.00,超過 200K 的計費級距也原封不動地通過——而它的預覽狀態,正是繞開它而不是把關鍵路徑押在它身上的理由:自動容錯移轉代表預覽模型一旦出狀況或遭到棄用,便會在無須變更程式碼的情況下重新導向至備援模型;路由 DSL 則讓你能把需要 Google 多模態能力的請求導向 Gemini,同時讓較便宜的模型吸收例行流量。Nex-N2.5 Pro 不在 OrcaRouter 上——我們的目錄中沒有列出任何 nex-agi 模型——因為它目前僅有的正式建置,正是 Nex-AGI 從其卡片上連結出去的那些免費端點。等到有供應商以真實牌價提供它的那一天,它便會以該價格、不加任何價差地出現在這裡,而這份比較也將從紙上談兵變成真正可執行。

誰該碰哪個

誠實的答案取決於你能承受哪一種風險。如果你今天就需要大規模多模態推理,而且能容忍一個將旗艦產品維持在預覽狀態、路線圖不斷變動的供應商,那麼 Gemini 3.1 Pro 就是可衡量的選擇——六個月的獨立測試是真正的資產,而 Flash 兄弟系列的崛起是調整路由策略的理由,而不是避開該家族的理由。如果你正在以開放權重建構電腦使用代理,而且願意等待可驗證的成果,Nex-N2.5 Pro 是更有趣的長期賭注——但它還不是你能下的注,因為你無法執行它、無法重現它的分數,也無法簽署依賴它的合約。對任何一種決定都會最滿意的團隊,是那些把兩種模型都當作它們真實樣貌來看待的團隊:一個是歷經七個月預覽、已被所有人測試過;另一個則是剛滿一天的預覽、還沒被任何人測試過。