「Qwen 4 Max 對上 Gemini 3.1 Pro」的主視覺標題卡,副標為「未曾發表的旗艦,對上永不結束的預覽版」,三個藥丸形徽章分別寫著「自 2026 年 2 月 19 日起預覽」、「1,048,576 詞元上下文」與「1M 下 26.3% 檢索率」,頁尾一行寫著「阿里巴巴於 2026 年 9 月 22 日發表;Google 於 2026 年 2 月 19 日開放預覽」,右下角則有 OrcaRouter 標誌。
Engineering & Research

Qwen 4 Max 對決 Gemini 3.1 Pro:未發表的旗艦,對上永不結束的預覽版

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

大多數比較都是拿已推出的產品去對比已推出的產品。這次卻很不尋常:Qwen 4 Max 於 2026 年 9 月 22 日在杭州雲棲大會上首度亮相,沒有發布日期、沒有價格,也沒有模型權重;而 Gemini 3.1 Pro 自 2026 年 2 月 19 日起就處於預覽階段,七個月後依然在預覽,既未公布正式推出日期,其淘汰時程表上也沒有停用日期。這場對決中的兩個模型,都不是已定案的產品。這不是跳過比較的理由。這正是這場比較本身,也是其中唯一真正具有資訊價值的一點。

七個月的預覽

預覽標籤本應是短暫的狀態。Gemini 3.1 Pro 如今已歷經同一實驗室的三次 Flash 發布仍保有這個標籤,包括 2026 年 9 月 2 日的 Gemini 3.8 FlashGoogle 稱其為最聰明的 Flash 模型。在獨立綜合評測中,該模型目前得分高於 3.1 Pro。Google 的 Pro 系列沒有更新的成員:沒有 Gemini 3.8 Pro,而 3.5 Pro 世代被延遲,據報導已被擱置。實際效果是,掛著 Pro 名稱的模型不再是自家廠商中得分最高的模型。

Google 在目錄項目上自行加註的限制說明建議要為預覽版淘汰做好規劃,這才是解讀該狀態的誠實方式。一個沒有 GA 日期、也沒有終止服務日期的預覽版,是你可以據以建構、卻無法據以安排時程的模型。

Qwen 這邊是符號相反的鏡像。Qwen 4 Max 並非處於長期預覽階段;它處於預覽前階段,完全沒有發布任何內容。這兩種失敗模式正好相反:Gemini 3.1 Pro 是真實存在的端點,但其長期是否存在並未指定;而 Qwen 4 Max 是已指定的路線圖項目,卻沒有端點。

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

比較,以及決定結果的長上下文圖表

Gemini 3.1 Pro 的規格是公開且具體的。Qwen 4 Max 的則是空白。值得細究的是 Gemini 那一欄中的某一列,因為那是那種會被人引用、卻不該被引用的數字:

• 狀態 — Gemini 3.1 Pro 自 2026 年 2 月 19 日起處於預覽階段,相較之下,Qwen 4 Max 於 2026 年 9 月 22 日宣布,但未公布日期

• 輸入價格 — Gemini 3.1 Pro 每 1M 個 token 為 $2.00,提示詞最高 200K;超過則為 $4.00,而 Qwen 4 Max 未公佈。

• 輸出價格 — Gemini 3.1 Pro 每 1M 為 $12.00(最高 200K),超過則為 $18.00;相較之下,Qwen 4 Max 未公布

• 快取輸入 — Gemini 3.1 Pro 每次快取讀取每 1M 為 $0.20,相較之下 Qwen 4 Max 未公布

• 上下文 — Gemini 3.1 Pro 為 1,048,576 個 token,相較之下 Qwen 4 Max 未公佈

• 輸出上限 — Gemini 3.1 Pro 為 65,536 個 token,而 Qwen 4 Max 則未公布

• 模態 — Gemini 3.1 Pro 支援文字、圖像、影片、音訊與 PDF 輸入並輸出文字,相較之下 Qwen 4 Max 尚未發布

• 推理控制 — Gemini 3.1 Pro 提供低、中、高三種思考等級,而 Qwen 4 Max 則未公布

• 長上下文檢索——Gemini 3.1 Pro 廠商報告的 MRCR v2 在 128K 下八個 needle 的平均值為 84.9%,但在百萬 token 的逐點設定下為 26.3%,相較之下,Qwen 4 Max 則未報告任何數據

• 廠商報告的分數 — Gemini 3.1 Pro 的 SWE-bench Verified 為 80.6%,GPQA Diamond 為 94.3%,ARC-AGI-2 為 77.1%,Humanity's Last Exam 在未使用工具下為 44.4%,而 Qwen 4 Max 則未報告任何數據

• 獨立評分——Gemini 3.1 Pro 在 Artificial Analysis Intelligence Index v4.3.2 上獲得 30 分,而 Qwen 4 Max 則不存在獨立評估

長脈絡的那一列才是真正該帶走的重點。1,048,576 個 token 的脈絡視窗只是行銷數字;在百萬 token 設定下達到 26.3% 檢索率,才是同一家廠商在測量該視窗最遠端時所回報的數字。這兩個數字都來自 Google,這使得這個落差是在說明模型本身,而不是評估者。如果你的工作負載取決於在百萬 token 提示中接近尾端找到某個被埋藏的事實,那麼標題上的脈絡數字對你毫無用處,而這一列幾乎說明了一切。

指數動了,模型卻沒有。

Gemini 3.1 Pro 於 2026 年 2 月 19 日推出,在 Artificial Analysis Intelligence Index 上獲得 57 分,位居該領域第一。在 2026 年 9 月 19 日發布的指數修訂版 v4.3.2 之下,其讀數為 30。在這兩個日期之間,該模型本身沒有任何改變。那把尺被重新打造了,而且是在阿里巴巴發布 Qwen 4 的四天前重建的。

那個巧合比數字本身更有價值。在這批比較的四個模型中,有三個——Gemini 3.1 Pro、Claude Opus 5,以及 Qwen 3.8 旗艦款——其獨立分數都在同一版修訂下出現變動,而且每一次的變動幅度都大到足以逆轉排名。這個月寫成的任何比較,只要引用單一指數數值卻未註明是哪一版修訂,就等於拿不同的尺去量分數再互相比較,而讀者根本看不出這個錯誤。

對 Qwen 4 Max 而言,後果就是目標不斷變動。當阿里巴巴最終發布時,在這個指數上要超越的分數,將會是當天現行修訂版本所載的數字,而該修訂版本在過去一週內至少已變更過一次。

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

營運數字所揭示的內容,包括那個令人不安的數字

Gemini 3.1 Pro 可在 OrcaRouter 上以 google/gemini-3.1-pro-preview 進行路由,帶有 Flagship 與 Featured 徽章,且沒有發佈前預告橫幅,並採用 Google 的牌價:每百萬詞元 2.00 美元與 12.00 美元,零加成。路由本身是誠實的——頁面上的費率就是 Google 所公佈的費率。截至 9 月 22 日的這七天期間,營運數據同樣值得列出而非略過:首字延遲 p50 為 10.00 秒、輸出速度約每秒 632 個詞元,以及該期間 77.5% 的錯誤率。那個錯誤率不是附註。對於一個沒有正式發佈(GA)日期的預覽級模型來說,它是頁面上與決策最相關的單一數字,而只引用價格卻不提它的比較,是在推銷而不是在告知。

同一份目錄收錄了近 200 個模型,全都位在同一個與 OpenAI 相容的端點上,並具備自動容錯移轉與路由 DSL,而這正是讓那樣的錯誤率得以承受、而非致命的機制:降級的供應商路徑可以被容錯移轉,而不是直接下線。Qwen 3.8 系列 —— Qwen3.8-MaxQwen3.8-Flash 與 Qwen3.8-27B —— 與 Gemini 3.1 Pro Preview 位於同一個端點,因此本文真正要談的替換、也就是你今天就能做出的替換,是一項路由政策的變更,而不是一項遷移專案。Qwen 4 Max 並不在該目錄上,Qwen 4 的任何層級也都不在;等到有產品推出時,那就是它會出現的地方。

這個決定,如果算得上是個決定的話

這裡的兩個模型都不是你能夠承諾投入的產品,而誠實的建議是:兩者都應據此看待。Gemini 3.1 Pro 今天就能以公開的價格呼叫,有公開的上下文視窗與公開的評估紀錄,包括在該視窗最遠端出現的檢索弱點;它同時也是預覽版,供應商要你為日後淘汰做好準備,而且其錯誤率高到若作為正式生產環境的依賴項目將無法接受。Qwen 4 Max 沒有這些問題,因為它根本沒有這些特性。

如果你現在就需要一個模型,那選擇並不在這兩者之間。而是在 Gemini 3.1 Pro 與已正式推出的 Qwen 旗艦模型之間;就目前可得的證據來看,這是在長脈絡檢索品質與 2.00 美元輸入費率加上公開權重之間的抉擇。如果你能等,要觀察的不是一件事,而是兩件事:Qwen 4 Max 的模型卡,以及 Gemini 3.1 Pro 的正式全面推出日期。哪一個先出現,就告訴你 Alibaba 與 Google 實際上優先推動的是這兩條路線圖中的哪一條。

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新