文章《Gemini 3.7 Flash vs Gemini 3.1 Pro》的主視覺標題卡片,副標題為「Google 的 Flash 等級是否讓自家的旗艦產品過時了?」,膠囊徽章顯示「AA Index 56 對 48」、「/bin/bash.75 / .75 對 / 2」、「穩定版 對 預覽版」,右下角為 OrcaRouter 標誌。
Guides & Insights

Gemini 3.7 Flash 對比 Gemini 3.1 Pro:Google 的 Flash 等級是否讓自家旗艦產品過時了?

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 Google 2026 年的機型陣容中,存在一個令人不安的問題,而這個問題是針對每個團隊,目前付費使用Gemini 3.1 Pro:為什麼便宜的 Flash 機型能在這個獨立指數上勝過旗艦機型?Gemini 3.7 Flash 於 2026 年 8 月 13 日發布,輸入 tokens 每百萬 $0.75,輸出 tokens 每百萬 $3.75,在高推理模式下,於 Artificial Analysis Intelligence Index 上獲得 56 分。Gemini 3.1 Pro 是 Google 於 2026 年 2 月 19 日推出的預覽版,定價為 $2.00 / $12.00,超過 200K 上下文時的價格為 $4.00 / $18.00,目前在同一指數上約落在 40 多分的高段。這款在發布時高居該指數榜首的旗艦機型,已被自家的實用主力級別超越,而這篇文章要探討的,正是這件事對這兩款機型,以及對那些必須在兩者之間做出選擇的團隊,分別意味著什麼。

前提:Google 的旗艦級產品卡在預覽階段

背景脈絡比數字更重要。Gemini 3.1 Pro 自 2026 年 2 月起便一直處於預覽階段——截至本文撰寫時已歷時七個月——而它的後繼機型 Gemini 3.5 Pro 雖於 5 月的 Google I/O 大會上宣布「下個月推出」,卻錯過了 6 月、7 月和 8 月。截至 9 月初,旗艦產品線既沒有已發布的後繼機型,也沒有具體日期,甚至傳出可能取消的消息。與此同時,Flash 產品線在同一時間內推出了三代產品:Gemini 3.6 Flash於 7 月 21 日推出,Gemini 3.7 Flash 於 8 月 13 日推出,9 月 1 日又為兩者加入了代理式影片理解能力。這與其說是「Pro 對 Flash」的比較,不如說是「Google 正在出貨的產品線」與「Google 已停止出貨的產品線」之間的對照。

規格對比

• 價格 — Gemini 3.7 Flash 每 100 萬個 token 為 $0.75 / $3.75(促銷至 2026 年 12 月 31 日,之後為 $1.50 / $7.50),而 Gemini 3.1 Pro 在 200K 上下文以內為 $2.00 / $12.00,超過 200K 則調漲至 $4.00 / $18.00。在推理層級控制之前,牌價便宜三到四倍。

• 上下文 / 最大輸出 — 1M / 64K 對比 1M / 64K。上限相同。

• 輸入 — 包括文字、圖像、音訊、影片、PDF。多模態介面相同;差異在於模型如何處理影片(如下)。

• 推理控制 — Gemini 3.7 Flash 低 / 中 / 高思考。Gemini 3.1 Pro 低 / 中 / 高,預設開啟動態思考。

• 獨立評分 — Gemini 3.7 Flash 在 Artificial Analysis Intelligence Index 上得到 56 分,而 Gemini 3.1 Pro 在當前指數版本上為 40 多分(它在先前版本下發佈時得分為 57)。

• 輸出速度 — Gemini 3.7 Flash 在高推理模式下約為每秒 285 個 token,而 Gemini 3.1 Pro 約為每秒 112–125 個 token — 速度快了約兩倍半。

• 狀態 — Gemini 3.7 Flash 穩定版,正式發布。Gemini 3.1 Pro 預覽版,預覽版的棄用窗口較短。

指數,以及其底下的基準亂象

標題就是指標:獨立跨供應商評測機構 Artificial Analysis 現將 Gemini 3.7 Flash 評為 56 分,而 Gemini 3.1 Pro 則落在 40 分後段——實用型主力型號領先旗艦型號,與 3.1 Pro 發表時以 57 分高居榜首的位置形成逆轉。這是兩者對決中唯一最重要的事實,且資料來源獨立,並非廠商自行申報。

在索引之下,基準測試總表混雜著各種無法相互比較的測試框架,若直接照字面解讀會得到錯誤答案。Gemini 3.1 Pro 的公開成績——SWE-bench Verified 80.6%、ARC-AGI-2 77.1%、GPQA Diamond 94.3%、LiveCodeBench Pro 2887 Elo——是 Google 在二月發表時所公佈的,使用的基準測試版本與 Flash 的數字不同,且從未被一致地重現。Gemini 3.7 Flash 在 FrontierCode 1.1 的 43.6%、DeepSWE v1.1 的 65.3%,以及網頁開發競技場的 1588 Elo,同樣是廠商在較新的測試框架上自行回報的數據。在兩者重疊的獨立綜合指標——AA Index——上,Flash 勝出。任何告訴你「Pro 在 SWE-bench 上擊敗 Flash」的人,都是在比較兩個不同測試的兩個不同版本,卻沒有說明這一點。

A two-column scoreboard titled 'Gemini 3.7 Flash vs Gemini 3.1 Pro — the scoreboard'. Left column 'Gemini 3.7 Flash': 'Price /bin/bash.75 / .75 (promo)', 'AA Index 56', 'Speed ~285 tok/s (high)', 'Status stable, GA', 'Agentic video understanding: yes', 'Released Aug 13, 2026'. Right column 'Gemini 3.1 Pro': 'Price .00 / 2.00 ( / 8 above 200K)', 'AA Index upper-40s (57 at launch)', 'Speed ~112-125 tok/s', 'Status preview', 'Agentic video understanding: no', 'Released Feb 19, 2026'. Footer: 'AA figures per Artificial Analysis; component benchmarks vendor-reported, unreproduced.'Screenshot of the Artificial Analysis model page for Gemini 3.7 Flash at high reasoning, showing an Intelligence Index of 56 (ranked #20 of 187 models), an output speed of 285 tokens per second in the high-reasoning configuration, and a price of /bin/bash.75 per 1M input and .75 per 1M output tokens.

影片能力差距

讓這種比較顯得失衡的能力是影片。Google 於 2026 年 9 月 1 日發布的新代理式影片理解模式,適用於 Gemini 3.7 Flash、Gemini 3.6 FlashGemini 3.5 Flash-Lite。Gemini 3.1 Pro 不在名單上。Flash 模型以新模式定義的方式「讀取」影片:模型自行決定要看什麼、以什麼速度,以及透過影格、音訊或逐字稿來讀取,只載入相關片段;據供應商回報,成本最多可節省 66%,token 最多可節省 88%。Gemini 3.1 Pro 技術上接受影片輸入,但使用的是較舊的靜態取樣路徑,完全沒有獲得任何新工具。對旗艦機型的使用者而言,Gemini 系列最新的影片功能卻先在較便宜的機型上推出,而 Pro 等級目前尚未公布接收此功能的日期。

速度,以及預覽風險問題

速度會像在每一場 Gemini 3.7 Flash 的對決中那樣,擴大價格差距:在一個價格原本就只有三分之一的模型上,輸出速率約為其三倍。但第二個差異才是團隊忘記納入成本考量的部分:狀態。Gemini 3.1 Pro 是預覽版,而預覽版在後繼版本推出時,只會有很短的下架預告期。在預覽模型上運行正式環境的工作負載,等於持續承擔模型 ID 變更、定價調整或功能轉移而幾乎沒有預警的風險。Gemini 3.7 Flash 已是 GA——穩定、有完整文件,且不會說換就換,即使 Google 近乎每月推出 Flash 版本的節奏,意味著 3.8 Flash 可能很快就會跟進。3.1 Pro 預覽版的下架風險並非假設;這正是其後繼版本已延宕三個月的產品線目前所處的真實狀態。

Gemini 3.1 Pro 依然勝出的地方

支持 3.1 Pro 的誠實論點有三根支柱,而沒有一根是原始能力。第一,自訂工具端點:Gemini 3.1 Pro 配備了 Flash 無法比擬的專屬 bash/自訂工具 API 介面,而且已經針對它打造 agent 工具的團隊,如今已擁有可運作的系統。第二,調校過的工作負載:一條已經針對 3.1 Pro 的動態思考預設值、快取模式與評估分數調校好的管線,本身就是個移動的目標;即使目的地更快、更便宜,轉換仍要付出實際的工程時間。第三,那些 Pro 擁有更長生產紀錄、而 Flash 仍無對應物的特定任務——也就是 Flash 從未被評測過的發表世代基準,例如 GPQA 與 ARC-AGI-2。如果你的工作負載屬於其中一類,「Flash 在指標上勝過 Pro」並不能解決你的問題;只有在你自己的評估上測試才算數。

裁決:Flash 級收購意味著什麼

方向十分明確。對於今日的新工作負載,Gemini 3.7 Flash 是更理想的預設 Gemini:更便宜、更快、GA 穩定版、在獨立評測指標上表現更高,而且率先獲得新的影片功能。Gemini 3.1 Pro 仍保有其真實但狹窄的用戶群——自訂工具使用者、經過調校的管線,以及其舊版基準紀錄仍然適用的任務。整體而言,Google 的旗艦產品線已陷入停滯,而其主力產品線才是該公司真正在競爭的地方——而那些仍為 3.1 Pro 支付旗艦價格的團隊,是在為一個連公司自己都已不再捍衛的地位付費。

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview showing a 1M-token context window, .00 per 1M input and 2.00 per 1M output tokens, and Vision/Audio/Tools/JSON/Reasoning capability chips.

「對於想要在沒有專案的情況下進行遷移的團隊而言,Gemini 模型之間的轉換只是模型名稱的變更,而非整合。Gemini 3.1 Pro 在 OrcaRouter 上提供,其 $2.00 / $12.00 的定價以 0% 加成轉嫁,與 Gemini 3.6 Flash 及其他可路由的 Gemini 層級一起共用同一組金鑰——因此工作負載可以將一部分流量傳送至 Flash 模型,將 3.1 Pro 保留為仍具優勢任務的備援,並讓自動容錯移轉吸收任一 Google 模型變更的風險。Gemini 3.7 Flash 本身可透過 Google 自家 API 及多個第三方平台取得。路由 DSL 與模型融合正是你在切換之前,於自己的評測中對兩個 Gemini 模型進行同級比較的方式。這個產品線所要引導你做出的選擇很明確:預設使用 Flash 層級,並只在 Pro 確實能證明其溢價的少數情況下才保留 Pro。」

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube