
Qwen 4 Max 對決 Gemini 3.1 Pro:未發表的旗艦,對上永不結束的預覽版
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
大多數比較都是拿已推出的產品去對比已推出的產品。這次卻很不尋常:Qwen 4 Max 於 2026 年 9 月 22 日在杭州雲棲大會上首度亮相,沒有發布日期、沒有價格,也沒有模型權重;而 Gemini 3.1 Pro 自 2026 年 2 月 19 日起就處於預覽階段,七個月後依然在預覽,既未公布正式推出日期,其淘汰時程表上也沒有停用日期。這場對決中的兩個模型,都不是已定案的產品。這不是跳過比較的理由。這正是這場比較本身,也是其中唯一真正具有資訊價值的一點。
七個月的預覽
預覽標籤本應是短暫的狀態。Gemini 3.1 Pro 如今已歷經同一實驗室的三次 Flash 發布仍保有這個標籤,包括 2026 年 9 月 2 日的 Gemini 3.8 Flash,Google 稱其為最聰明的 Flash 模型。在獨立綜合評測中,該模型目前得分高於 3.1 Pro。Google 的 Pro 系列沒有更新的成員:沒有 Gemini 3.8 Pro,而 3.5 Pro 世代被延遲,據報導已被擱置。實際效果是,掛著 Pro 名稱的模型不再是自家廠商中得分最高的模型。
Google 在目錄項目上自行加註的限制說明建議要為預覽版淘汰做好規劃,這才是解讀該狀態的誠實方式。一個沒有 GA 日期、也沒有終止服務日期的預覽版,是你可以據以建構、卻無法據以安排時程的模型。
Qwen 這邊是符號相反的鏡像。Qwen 4 Max 並非處於長期預覽階段;它處於預覽前階段,完全沒有發布任何內容。這兩種失敗模式正好相反:Gemini 3.1 Pro 是真實存在的端點,但其長期是否存在並未指定;而 Qwen 4 Max 是已指定的路線圖項目,卻沒有端點。

比較,以及決定結果的長上下文圖表
Gemini 3.1 Pro 的規格是公開且具體的。Qwen 4 Max 的則是空白。值得細究的是 Gemini 那一欄中的某一列,因為那是那種會被人引用、卻不該被引用的數字:
• 狀態 — Gemini 3.1 Pro 自 2026 年 2 月 19 日起處於預覽階段,相較之下,Qwen 4 Max 於 2026 年 9 月 22 日宣布,但未公布日期
• 輸入價格 — Gemini 3.1 Pro 每 1M 個 token 為 $2.00,提示詞最高 200K;超過則為 $4.00,而 Qwen 4 Max 未公佈。
• 輸出價格 — Gemini 3.1 Pro 每 1M 為 $12.00(最高 200K),超過則為 $18.00;相較之下,Qwen 4 Max 未公布
• 快取輸入 — Gemini 3.1 Pro 每次快取讀取每 1M 為 $0.20,相較之下 Qwen 4 Max 未公布
• 上下文 — Gemini 3.1 Pro 為 1,048,576 個 token,相較之下 Qwen 4 Max 未公佈
• 輸出上限 — Gemini 3.1 Pro 為 65,536 個 token,而 Qwen 4 Max 則未公布
• 模態 — Gemini 3.1 Pro 支援文字、圖像、影片、音訊與 PDF 輸入並輸出文字,相較之下 Qwen 4 Max 尚未發布
• 推理控制 — Gemini 3.1 Pro 提供低、中、高三種思考等級,而 Qwen 4 Max 則未公布
• 長上下文檢索——Gemini 3.1 Pro 廠商報告的 MRCR v2 在 128K 下八個 needle 的平均值為 84.9%,但在百萬 token 的逐點設定下為 26.3%,相較之下,Qwen 4 Max 則未報告任何數據
• 廠商報告的分數 — Gemini 3.1 Pro 的 SWE-bench Verified 為 80.6%,GPQA Diamond 為 94.3%,ARC-AGI-2 為 77.1%,Humanity's Last Exam 在未使用工具下為 44.4%,而 Qwen 4 Max 則未報告任何數據
• 獨立評分——Gemini 3.1 Pro 在 Artificial Analysis Intelligence Index v4.3.2 上獲得 30 分,而 Qwen 4 Max 則不存在獨立評估
長脈絡的那一列才是真正該帶走的重點。1,048,576 個 token 的脈絡視窗只是行銷數字;在百萬 token 設定下達到 26.3% 檢索率,才是同一家廠商在測量該視窗最遠端時所回報的數字。這兩個數字都來自 Google,這使得這個落差是在說明模型本身,而不是評估者。如果你的工作負載取決於在百萬 token 提示中接近尾端找到某個被埋藏的事實,那麼標題上的脈絡數字對你毫無用處,而這一列幾乎說明了一切。
指數動了,模型卻沒有。
Gemini 3.1 Pro 於 2026 年 2 月 19 日推出,在 Artificial Analysis Intelligence Index 上獲得 57 分,位居該領域第一。在 2026 年 9 月 19 日發布的指數修訂版 v4.3.2 之下,其讀數為 30。在這兩個日期之間,該模型本身沒有任何改變。那把尺被重新打造了,而且是在阿里巴巴發布 Qwen 4 的四天前重建的。
那個巧合比數字本身更有價值。在這批比較的四個模型中,有三個——Gemini 3.1 Pro、Claude Opus 5,以及 Qwen 3.8 旗艦款——其獨立分數都在同一版修訂下出現變動,而且每一次的變動幅度都大到足以逆轉排名。這個月寫成的任何比較,只要引用單一指數數值卻未註明是哪一版修訂,就等於拿不同的尺去量分數再互相比較,而讀者根本看不出這個錯誤。
對 Qwen 4 Max 而言,後果就是目標不斷變動。當阿里巴巴最終發布時,在這個指數上要超越的分數,將會是當天現行修訂版本所載的數字,而該修訂版本在過去一週內至少已變更過一次。

營運數字所揭示的內容,包括那個令人不安的數字
Gemini 3.1 Pro 可在 OrcaRouter 上以 google/gemini-3.1-pro-preview 進行路由,帶有 Flagship 與 Featured 徽章,且沒有發佈前預告橫幅,並採用 Google 的牌價:每百萬詞元 2.00 美元與 12.00 美元,零加成。路由本身是誠實的——頁面上的費率就是 Google 所公佈的費率。截至 9 月 22 日的這七天期間,營運數據同樣值得列出而非略過:首字延遲 p50 為 10.00 秒、輸出速度約每秒 632 個詞元,以及該期間 77.5% 的錯誤率。那個錯誤率不是附註。對於一個沒有正式發佈(GA)日期的預覽級模型來說,它是頁面上與決策最相關的單一數字,而只引用價格卻不提它的比較,是在推銷而不是在告知。
同一份目錄收錄了近 200 個模型,全都位在同一個與 OpenAI 相容的端點上,並具備自動容錯移轉與路由 DSL,而這正是讓那樣的錯誤率得以承受、而非致命的機制:降級的供應商路徑可以被容錯移轉,而不是直接下線。Qwen 3.8 系列 —— Qwen3.8-Max、Qwen3.8-Flash 與 Qwen3.8-27B —— 與 Gemini 3.1 Pro Preview 位於同一個端點,因此本文真正要談的替換、也就是你今天就能做出的替換,是一項路由政策的變更,而不是一項遷移專案。Qwen 4 Max 並不在該目錄上,Qwen 4 的任何層級也都不在;等到有產品推出時,那就是它會出現的地方。
這個決定,如果算得上是個決定的話
這裡的兩個模型都不是你能夠承諾投入的產品,而誠實的建議是:兩者都應據此看待。Gemini 3.1 Pro 今天就能以公開的價格呼叫,有公開的上下文視窗與公開的評估紀錄,包括在該視窗最遠端出現的檢索弱點;它同時也是預覽版,供應商要你為日後淘汰做好準備,而且其錯誤率高到若作為正式生產環境的依賴項目將無法接受。Qwen 4 Max 沒有這些問題,因為它根本沒有這些特性。
如果你現在就需要一個模型,那選擇並不在這兩者之間。而是在 Gemini 3.1 Pro 與已正式推出的 Qwen 旗艦模型之間;就目前可得的證據來看,這是在長脈絡檢索品質與 2.00 美元輸入費率加上公開權重之間的抉擇。如果你能等,要觀察的不是一件事,而是兩件事:Qwen 4 Max 的模型卡,以及 Gemini 3.1 Pro 的正式全面推出日期。哪一個先出現,就告訴你 Alibaba 與 Google 實際上優先推動的是這兩條路線圖中的哪一條。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
