一張生成的主視覺標題卡,標題為「Gemini 3.1 Pro vs Qwen3.8-27B」,副標題為「為期七個月的預覽版 vs 一個你可以下載的模型檢查點」,並搭配兩張卡片:Gemini 3.1 Pro,自 2026 年 2 月 19 日起處於預覽階段,每 100 萬個 token 輸入 $2.00、輸出 $12.00,Artificial Analysis 智慧指數為 29.7;對比 Qwen3.8-27B,自 2026 年 8 月 14 日起開放權重,每 100 萬個 token 輸入 $0.50、輸出 $3.00,指數為 33.7;兩者之間有一個 VS 圓形徽章,右下角則是 OrcaRouter 標誌。頁尾:「Artificial Analysis 智慧指數 v4.3.2,擷取於 2026-09-23;價格為供應商牌價。」
Guides & Insights

Gemini 3.1 Pro 對比 Qwen3.8-27B:提前七個月的預覽,對上可下載的檢查點

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

2026年9月18日,該廠商自家 AI 開發者論壇上的使用者開始回報,Gemini 3.1 Pro已從 AI Studio 的模型選擇器中消失——付費帳號也不例外,清除快取和無痕視窗都於事無補。那則要求廠商說明這究竟是「錯誤還是刻意為之」的討論串,到了9月21日仍未平息。沒有下架公告、沒有遷移路徑,也沒有任何官方人員回覆。與此同時,Qwen3.8-27B是該實驗室於8月14日以 Apache 2.0 授權開源的,任何人只要下載了它,就誰也奪不走。這場對決真正取決的正是這種不對稱——而非真實存在但幅度不大的基準測試差距——這也是為什麼這兩個模型其實並非在爭奪同一個位置,儘管比較表格把它們並列在一起。

以下針對現有數字進行正面對比,並逐一標明來源:Artificial Analysis 取自 2026 年 9 月 23 日擷取的數據、阿里巴巴自家的模型卡、Google 的發布文章,以及我們自家的路由遙測資料,並全程分開呈現。凡未經測量之處,本頁會如實說明,而非憑空猜測。

這一週發生了什麼,以及它意味著什麼、又不意味著什麼

這些報導內容具體,而且來自 Google 自家的論壇,而非競爭對手的部落格。一篇標題為「Gemini 3.1 Pro 自 2026-09-18 起從 AI Studio 消失——是錯誤還是刻意為之?」的討論串描述付費用戶在毫無公告的情況下失去該模型、Google One 支援服務提供不相關的疑難排解步驟,以及 Google 狀態頁面顯示沒有任何問題。第二篇討論串「Gemini 3.1 Pro Preview 模型無法在 AI Studio 中用來建置 App」也匯集了相同的抱怨,其中包括一名用戶,其程式設計助理數個月來都是以該預覽版為基礎建置的,並表示 Flash 會讓她们的程式碼庫「只會產出垃圾」。

三個坦白的但書。這是開發人員主控台上的消失,並非已確認的 API 中斷:Gemini 3.1 Pro 在我們自家目錄中仍被列出且可路由,過去七天內在該處處理了 9,470 萬個 token。這是使用者回報的——Google 什麼都沒說,因此 Google 以外沒有人能把「悄悄淘汰」與「容量問題」與「主控台錯誤」區分開來。而且這個時機並不討喜,因為這個模型預覽階段自 2026 年 2 月 19 日起——七個月了,卻未公布 GA 日期,而 Google 還在其之下推出了一系列 Flash 模型。另外,GitHub Copilot 在 2026 年 9 月 1 日以 30 天通知期終止了 Gemini 3.1 Pro,這是不同且無關的事件,但指向同一方向:一個沒有 GA 承諾的預覽端點,是你有理由感到不安的依賴項。

我們這邊有一個數字值得與那段背景並列,因為我們無法解釋它,寧可直說。我們對 Gemini 3.1 Pro 目錄項目的七日遙測顯示 80.5% 的錯誤率;同一個早上我們查核的鄰近模型——Qwen3.8-Max、Claude Fable 5.1——分別落在 5.9% 與 6.9%。我們不知道那是不是論壇所回報的同一個問題、某家上游供應商的糟糕一週,還是儀器量測的假象。把它當作在你正式採用前先跑一次金絲雀部署的理由,而不是對該模型的最終判定。

同一把尺,兩種不同的分數

這是大多數比較頁面都會弄錯的部分,因此值得審慎處理。Artificial Analysis 以 Intelligence Index v4.3.2 為這兩款模型評分。我們在 2026 年 9 月 23 日擷取了這兩個頁面,而兩者標示的修訂版本相同——因此,有別於大多數跨模型的索引宣稱,這項比較是同一個快照下的比較,差距確實存在。

• Qwen3.8-27B (xhigh) — 智慧指數 33.7

• Gemini 3.1 Pro Preview — 智慧指數 29.7

Qwen 在目前的標尺上以四分領先。更難的問題是這代表什麼,因為這把標尺本身今年至少已變動三次。二月時,Artificial Analysis 發表文章稱 Gemini 3.1 Pro Preview 是「AI 的新領導者」,領先 Claude Opus 4.6 四分,而當時的媒體報導稱其在當時的 Index v4.0 上得分為 57。在 v4.3.2 上,分數則是 29.7。Artificial Analysis 於 2026 年 9 月 7 日宣布 v4.3,距離 v4.2 僅四天;這次修訂以難度高出許多的 66 項任務 Terminal-Bench 4.0 取代 Terminal-Bench 2.1,並以 AutomationBench-AA 取代 τ³-Banking。Gemini 3.1 Pro 在二月的強項,落在新指數已淘汰或重新加權的評測上。所以:模型沒有變差,是考試變了。但如果你今天要挑選模型,今天的數字才是你真正能據以行動的數字,而今天的數字對 Qwen 有利。

兩者真正分歧之處

彙總分數會掩蓋差異的形狀,而形狀才是有用的部分。以下每張圖表都來自同一次 9 月 23 日的快照,擷取自 Artificial Analysis 為這兩個模型、同一個修訂版本所建立的 v4.3.2 頁面。

• 推理與知識 — Gemini 明顯領先。GPQA Diamond 94.1 對 90.5;Humanity's Last Exam 47.0 對 33.9;SciCode 58.7 對 46.6;CritPt 17.7 對 5.4。

• 真實世界的職業任務 — Qwen 領先,而且差距很大。GDPval 標準化後為 45.4% 對 13.8%。

• 代理式銀行業務與交易 —— Qwen 領先。τ-Banking 48.0 對比 Gemini 的 21.4。

• 通用基準測試上的代理式工具使用 — 在 Qwen 未被測量的項目上,Gemini 領先。Gemini 的 τ²-Bench 為 95.6;並無 Qwen3.8-27B 的數據。

• 終端機相關工作——兩者接近,但在新基準測試上都表現很差。Terminal-Bench 2.1:Qwen 79.8,Gemini 73.8。Terminal-Bench 4.0:Qwen 5.6%,Gemini 4.0%——兩者都是個位數。

• 校準——兩頁之間最劇烈的落差。在 AA-Omniscience 上,Gemini 得分 31.9,準確率 54.9%,幻覺率 50.9%;Qwen 得分 −10.0,準確率 15.6%,幻覺率 30.3%。Gemini 懂得更多,也有超過一半的時間在憑空編造;Qwen 則經常拒絕作答,而在它確實回答的部分中,約有三分之一會出現幻覺。

• 長上下文——在長上下文召回上完全打成平手,各為 82.0。在多模態長上下文召回上,Qwen 為 21.7%,Gemini 則為 15.6%。

把「未測量」的條目照其實際情況來解讀。Gemini 沒有已公布的 GDPval-AA 標準化數值,可對比 Qwen 的 45.4%;而 Qwen 也沒有 τ²-Bench、IFBench、Terminal-Bench Hard 或 ITBench-SRE 的數值,可對比 Gemini 的 77.1、53.8 與 30.3。這些空白中的每一個,都是摘要表會悄悄安插贏家的地方。

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

決定預算的分歧:運行索引的成本相同

Qwen3.8-27B 每 token 的價格便宜得多。根據 Artificial Analysis 公布的市場數據,它每百萬輸入 token 為 $0.50、每百萬輸出 token 為 $3.00,並有 80% 的快取折扣,混合 7:2:1 費率為 $0.47。Gemini 3.1 Pro Preview 則為 $2.00 和 $12.00——輸入價格是四倍,輸出價格也是四倍——並有 90% 的快取折扣,混合費率為 $1.74。

接著是沒有人會印出來的數字:Artificial Analysis 自家的計算顯示,跑完整個 Intelligence Index 的成本為Gemini 3.1 Pro Preview 是 $1,310.21,Qwen3.8-27B 是 $1,335.92。Qwen 跑起來並沒有比較便宜。它其實還稍微貴一點,因為它花更久的時間才達到同樣的結果。在 Qwen 的輸出帳單中,$512.36 是推理詞元,而實際答案只占 $82.51;Gemini 則是 $691.82 花在推理上,$113.08 才是答案。每詞元價格是一個費率,不是一張帳單。

還有兩個比較表會漏掉的定價事實。首先,Gemini 3.1 Pro 的價格依每次請求的輸入大小分級:輸入權杖 200K 以內為 $2.00/$12.00,超過此上限則為 $4.00/$18.00,而快取讀取費用從 $0.20 倍增至 $0.40。百萬權杖的上下文視窗是真的,但其中最後 800,000 個權杖的費用加倍。其次,我們自家型錄中 Qwen3.8-27B 的條目——以 block-FP8 提供服務,視覺塔採全精度——列出輸入 $0.40、輸出 $4.21,輸入比上述市場數字便宜,輸出則更貴,而且完全沒有公布任何快取權杖費率。不同供應商,費率切分也不同。請確認你實際會被計費的費率。

兩個模型都可透過單一 OrcaRouter 金鑰,以供應商牌價加 0% 加成存取,因此供應商價格一有變動,當天就會反映到我們這端,而不是經過一輪重新定價週期之後才發生——當兩者之一的層級界線正好落在 200K token 時,這一點比平時更加重要。

延遲:最快的首個 token,屬於較慢的模型

這是整份比較中最具誤導性的一對數字,也是最可能讓讀者據以做出錯誤行動的一組。

• 首個區塊時間——Qwen 4.04 秒對上 Gemini 28.37 秒。Qwen 看起來快了七倍。

• 實際答案的耗時 — Gemini 28.37 秒 vs Qwen 52.52 秒。Gemini 約以 1.8 倍勝出,因為 Qwen 在第一個區塊與第一個答案 token 之間花了 48.48 秒思考。

• 輸出速度 — Gemini 每秒 116.5 個 token,Qwen 則是 41.3。Gemini 一旦開始撰寫,速度就快上 2.8 倍,而 Artificial Analysis 將比較基準的中位數設在每秒 95.4 個 token。Qwen 自家頁面稱其「明顯緩慢」。

如果你的產品會向使用者串流第一個 token,那麼 Qwen 主打的延遲數字,就是個你只會騙自己一次的謊言。如果你的產品要等到完整答案才輸出,Gemini 才是更快的模型。這兩個數字都是 Artificial Analysis 的實測結果;兩者都是在 Qwen 的 xhigh 努力程度設定下測得,而這正是模型卡的預設值。

這個預設值在實務工作者之間始終是熱議的抱怨,而模型卡也半默認了這一點。Qwen3.8-27B 揭露了一個reasoning_effort參數,具備三個層級——xhigh(預設值,「適用於需要徹底分析的複雜任務」)、medium,以及low。截至九月的社群文章回報,xhigh會產生非常冗長的思考階段,並建議降到 medium 或 low,同時為推理預算設定上限。阿里自家的模型卡也提出告誡:在多輪代理式工作中,降低投入程度「並不總是能縮短整體任務完成時間」——這對模型卡來說是很坦率的說法,同時也是個警告:顯而易見的修正方法,並不一定是真正的修正方法。

上下文:1M 對比 262K,以及實際上能容納什麼

Gemini 3.1 Pro 搭載 1,000,000 個詞元的上下文視窗,最大輸出為 65,536 個詞元。Qwen3.8-27B 原生支援 262,144 個詞元,並可透過 YaRN 擴展至 1,000,000 個詞元;建議在其中劃分各自的額度:推理內容最多 262,144 個詞元,最終回應最多 131,072 個詞元。

兩則誠實的註腳。Artificial Analysis 的規格表把 Qwen 的視窗列為 256,000,但其本身的常見問題說明寫的是 260K,而模型卡寫的是 262,144——這些都是同一個數字在四捨五入上的差異,不過請引用 262,144,因為那才是模型卡所寫的。而擴展到 1M 是一種縮放技術,與原生百萬 token 視窗並不是同一回事:在 YaRN 擴展模型上 1M 的長上下文召回,並不是 82.0 AA-LCR 這個數字所衡量的東西。沒有人發表過 Qwen3.8-27B 的 1M 上下文召回分數。請把 Gemini 的視窗視為在完整長度下有實測行為的那一個,而把 Qwen 的視窗視為你在圍繞它設計之前應該自行測試的那一個——並且記住,輸入 token 超過 200K 之後,Gemini 的價格會加倍。

代理式工作與工具呼叫

這場對決真正勝負未定的地方就在這裡,而在這裡硬要炮製出一個贏家既容易又不正確。Qwen3.8-27B 擁有 Gemini 所欠缺的實測代理分數,反之亦然。

Qwen 的論點建立在一個強而有力的獨立數據,以及一個強而有力的廠商數據之上。獨立數據是 τ-Banking 的 48.0,對比 Gemini 的 21.4——在同一版本上,在同一份關於銀行環境內多步驟工具使用的基準測試中,高出超過一倍。廠商數據則是阿里巴巴自家的成績單,列出 OSWorld-Verified 84.3、WebArena-Verified 64.8、AndroidWorld 81.9、CoWorkBench 70.7、JobBench 33.4,以及 Agents' Last Exam 20.4 Pass@1。那些都是阿里巴巴的評測,未經其他人重跑,而且它們正好落在獨立測得的 GDPval 結果(經正規化為 45.4%,相較之下為 13.8%)指向同一方向的那些類別裡。

Gemini 的論點在於,它是這項比較中唯一擁有高絕對代理能力分數的一方——τ²-Bench 95.6——而 Qwen 完全沒有 τ²-Bench 分數。它在指令遵循方面也有 IFBench 77.1,而 Qwen 這邊同樣是一片空白。而且它擁有七個月的正式環境實績,這是問世僅五週的開放權重版本所沒有的。

決定勝負的關鍵不是分數,而是你的拓撲結構。Qwen 在代理能力上的優勢,是在模型必須運作於一個它並未設計、早已存在的大型軟體系統內的基準測試上衡量。Gemini 的優勢則是在模型必須長時間精確遵循指令的基準測試上衡量。這些是不同的技能,而兩者都是真實的。

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

編程

程式編寫的表現也呈現同樣的分歧,這正是為什麼「哪個寫程式比較強」在這裡沒有乾淨俐落的答案。Gemini 在科學運算這一端領先——SciCode 58.7 對 46.6——而它在我們產品目錄頁上的 AA Coding Index 為 68.8,與 Qwen 的 68.1 差距僅在捨入誤差之內,遠遠落在任何值得一提的信賴區間裡。在代理式終端機工作上,兩者在較舊的基準測試中相當接近,Terminal-Bench 2.1 上 Qwen 79.8 對 Gemini 73.8,而在較新的基準測試中則難分軒輊,兩者都掉到個位數。

阿里巴巴的模型卡宣稱的數字高出許多——SWE-bench Pro 61.7、LiveCodeBench v6 90.3、QwenSWEBench 79.0——但那些都是廠商自行回報的,而且模型卡註明 SWE-bench Pro 與 QwenSWEBench 是在 Claude Code 測試框架中跑的,那並不是競爭對手數字會採用的測試框架。穩妥的說法是,在第三方唯一同時測量過兩家實驗室模型的程式碼基準上,兩者在 Terminal-Bench 2.1 上相差四點,在 Terminal-Bench 4.0 上相差 1.6 點,而且兩者在較難的那個上表現都很差。

開放權重對比預覽端點

這是兩者完全無法相提並論的面向,也是實際影響最大的那一項。

Qwen3.8-27B 採用 Apache 2.0 授權,擁有 270 億稠密參數、64 層,並以約 3:1 的比例混合 Gated DeltaNet 線性注意力與全注意力——正是這樣的設計,讓 262K 的脈絡視窗在服務成本上變得可負擔。它真的能跑。量化到 4 位元後,它約只需 17GB,恰好是一張消費級 GPU;短短五週內,圍繞它便長出一整套壓縮生態系,從 Unsloth 的 Dynamic V3 量化(其中包括一個 1 位元版本,Unsloth 稱其能在 8GB 中運行、準確率約為原始模型的 77%),到九月中 PrismML 的 Ternary Bonsai 2 27B。你可以微調它、稽核它,還能在拔掉網路的筆電上運行它。

Gemini 3.1 Pro 是封閉預覽端點,已推出七個月,沒有正式推出(GA)日期,模型卡明確警告預覽版可能缺乏穩定版本的穩定性、可用性與支援,而且——截至本週——它似乎已悄悄從某個開發者主控台下架。你無法下載它,無法鎖定版本,也無法將它容錯移轉到你自己的系統。

如果你想要的是誠實的路由答案,而不是一個判決:開放檢查點的存在,正是讓 Gemini 依賴得以存續的關鍵。把 Qwen3.8-27B 放在本地或自架路徑上作為備援,讓 Gemini 3.1 Pro 留在主要路徑,負責它可量測地更擅長的推理密集型工作,並把兩者放在同一個具備自動容錯移轉的端點後面,這樣一來,它從別人的主控台無聲消失,就只會是你的路由層吸收掉的事故,而不是你的使用者看到的服務中斷。這不是在推銷某個產品——這是唯一能讓本週這則新聞不會害你賠上一個週末的組態。

選擇 Gemini 3.1 Pro,如果

• 你最艱鉅的工作是知識密集型推理,而非長時程工具使用——它在 GPQA Diamond 以 94.1 領先 90.5,Humanity's Last Exam 47.0 領先 33.9,SciCode 58.7 領先 46.6,CritPt 17.7 領先 5.4。

• 你需要真正長的輸入。一個經過實測的百萬 token 視窗,且召回行為經過充分測試,勝過靠技術擴展的 262K 視窗——前提是你能接受輸入 token 超過 200K 後價格翻倍。

• 完成答案的時間比首個字符的時間更重要,而且你要的是每秒116.5個字符,而不是41.3個。

• 你需要廣泛的多模態能力:音訊、檔案、影像、文字和影片輸入,相較於 Qwen 的文字、影像和影片。

• 你願意接受預覽風險,而且你有自己能掌控的備援方案。

若……就選 Qwen3.8-27B

• 你的代理在大型既有系統內運作——τ-Banking 48.0 到 21.4,以及 GDPval 標準化後的 45.4% 到 13.8%,是這份比較中任何地方最大的兩項單一模型優勢。

• 你需要一個誠實而非自信的答案。相較於 Gemini 的 50.9%,30.3% 的幻覺率是截然不同的產品。

• 授權或資料駐留規定排除了封閉式 API,或者你需要用自己的資料進行微調。

• 你想要每 token 費用只有 Gemini 四分之一的帳單,並接受你會把差額花在思考 token 上——這個索引在兩者上執行的成本相同。

• 你已準備好調降 reasoning_effort,從其 xhigh 預設值調低,而不是直接照原樣發布。

我們無法驗證的內容

必須說明的是,也因為比較頁面的價值取決於它留白之處:針對 Qwen3.8-27B 在降低推理投入下的表現,目前尚未有獨立評測發表,因此它在mediumlow之下的速度與品質取捨仍未被測量。針對 YaRN 擴展的 1M 配置,並不存在長上下文召回分數。Gemini 3.1 Pro 沒有已發表的 GDPval-AA 正規化分數,而 Qwen3.8-27B 在 τ²-Bench、IFBench 或 ITBench-SRE 上也都沒有。而且沒有人——包括 Google——說明過 Gemini 3.1 Pro 為何在 9 月 18 日從 AI Studio 選單中消失。上述任何一項有所改變時,我們都會更新本頁。

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新