主視覺標題卡:DeepSeek V4.1 Flash vs Gemini 3.1 Pro — 其中一款仍只是預覽版
Guides & Insights

DeepSeek V4.1 Flash 與 Gemini 3.1 Pro:其中一款仍處於預覽階段

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

最值得了解的一件事DeepSeek V4.1 Flash對上Gemini 3.1 Pro並不會印在任何一份規格表上。DeepSeek V4.1 Flash 是已正式推出(GA)的模型,於 2026 年 9 月 10 日發布,並附上以 MIT 授權、可自行下載的權重。Gemini 3.1 Pro 自 2026 年 2 月 19 日起便處於預覽階段,約七個月後仍以預覽版組建名稱提供服務。這種不對稱並不決定哪個模型更好,但它決定了當你以其中一個模型為基礎來開發時,你所做的是什麼樣的承諾,而這也是以下所有內容的框架。

兩者都能容納一百萬個 token 的上下文。兩者都接受圖片。真正讓它們有所區別的,是輸入 token 超過 200,000 之後的價格曲線、輸入模態、輸出上限,以及這兩者之中,一個是你可以實際擁有的檔案,另一個則是 API。

這兩者實際上究竟處於什麼立場

• 每 100 萬個 token 的價格,最高 200K 上下文 — DeepSeek V4.1 Flash 輸入 $0.15 / 輸出 $0.60,對比 Gemini 3.1 Pro 輸入 $2.00 / 輸出 $12.00。那是輸入價格的 13 倍、輸出價格的 20 倍。

• 超過 200K 上下文時,每 1M 個 token 的價格 — V4.1 Flash 維持不變,為 $0.15 / $0.60,對比 Gemini 3.1 Pro 的輸入 $4.00 / 輸出 $18.00。輸入倍數擴大至 27×,而這恰好是長上下文工作所在之處。

• 快取輸入 — V4.1 Flash 離峰時段每 1M 為 $0.003,對比 Gemini 3.1 Pro 每 1M 為 $0.40。兩個數量級的差距,就落在決定重新讀取上下文是否負擔得起的這個項目上。

• 上下文視窗 — 1M tokens 對 1M tokens。等級。

• 最大輸出 — V4.1 Flash 384K tokens,對比 Gemini 3.1 Pro 的 65K tokens。上限高出六倍。

• 輸入模態 — V4.1 Flash 接受文字與圖片,而 Gemini 3.1 Pro 接受文字、圖片、音訊、影片以及檔案上傳。

• 權重 — V4.1 Flash MIT,可下載對比 Gemini 3.1 Pro 封閉,僅限 API。

• 發布狀態 — V4.1 Flash 自 2026 年 9 月 10 日起正式推出,而 Gemini 3.1 Pro 自 2026 年 2 月 19 日起仍處於預覽階段。

• 觀察到的首個權杖延遲——根據 OrcaRouter 自家的 7 天遙測資料,V4.1 Flash 在 p50 為 2.63 秒、p95 為 9.05 秒,而 Gemini 3.1 Pro 在 p50 為 10.00 秒、p95 為 10.00 秒。這個昂貴模型的中位等待時間正落在遙測上限,而它的尾端延遲也始終無法脫離該上限。

不帶價格來看這份清單,其輪廓在每一場開放權重與前沿模型的比較中都似曾相識:可下載模型在輸出上限勝出,在上下文方面打成平手,並在實測延遲上領先。封閉模型在模態方面勝出,而且在這些方面是徹底勝出。這裡沒有任何一點能單獨解釋 13 倍的輸入倍數。

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

200K 斷崖才是定價的關鍵

Gemini 3.1 Pro 的宣傳費率並非單一費率。輸入 token 數最多 200,000 的提示,每百萬個 token 的計費為輸入 $2.00、輸出 $12.00;超過此門檻的提示則按 $4.00 與 $18.00 計費。DeepSeek V4.1 Flash 則沒有級距——無論請求是 2,000 個 token 還是 900,000 個 token,都按 $0.15 與 $0.60 計費,唯一但書是 DeepSeek 在尖峰時段會將費率加倍,且週末完全以離峰費率運作。

那道方案分界正好落在對長上下文工作最不利的位置,因為長上下文工作定義上就是會跨越這道界線的工作。做個實際比較就能讓它具體起來。假設有一條管線每月發出 20,000 次呼叫,每次平均使用 250,000 個輸入 token 和 4,000 個輸出 token——這是一項針對大型檔案的文件分析工作。

• DeepSeek V4.1 Flash 離峰時段費率:20,000 × 250,000 等於 5,000M 輸入 token,以每百萬 $0.15 計算,即 $750.00。輸出為 20,000 × 4,000,也就是 80M token,以每百萬 $0.60 計算,即 $48.00。總計 $798.00。

• Gemini 3.1 Pro 在其超過 200K 的級距:相同的 5,000M 輸入 token,以每百萬 $4.00 計算,為 $20,000.00;而 80M 輸出 token,以每百萬 $18.00 計算,為 $1,440.00。總計 $21,440.00。

那是在相同流量下,每月支出相差 27×,而這並不是你從標題數字會猜到的倍數。標題上的倍數是 13×。你實際上為長上下文工作支付的倍數是 27×,因為方案層級的分界正好就落在你的提示所在的位置。

預覽標籤真正讓你付出的代價

預覽組建在整個業界就是預覽組建:它不附帶任何已公布的穩定性保證。廠商並未承諾會讓該端點維持在那樣的行為、那樣的價格或那樣的名稱。這並不是對 Gemini 3.1 Pro 的批評——這正是這個標籤的含義,也是為什麼 preview 後綴存在了七個月,而不是只是為期兩週的形式。

對原型來說,這沒什麼。但對正式生產路徑而言,這是一個具體且可量化的風險:你在賭你所調校的那個建置版本會維持不變。與這項比較另一邊的對比是結構性的,而非修辭上的。DeepSeek V4.1 Flash 已正式推出(GA),其權重採用 MIT 授權且可下載,這意味著即使託管的 API 明天更改條款,模型本身仍在你手上。封閉的預覽模型既不會給你 GA 承諾,也不會給你逃生出口。如果你的工作負載在兩者上都能執行,這個差異比一個基準測試分數更有價值。

在哪些情況下 Gemini 3.1 Pro 是更好的工具

模態差距不是捨入誤差,而且是這份清單上唯一一個無論價格多低,便宜模型都無法替代的維度。Gemini 3.1 Pro 將音訊和視訊視為一級輸入,另外還支援檔案上傳。DeepSeek V4.1 Flash 接受文字和圖像。如果你的管線需要接收通話錄音、螢幕擷取或影片評論,DeepSeek V4.1 Flash 就不是更便宜的選項——它根本不是選項。對於一個模型能做、另一個不能做的任務來說,13 倍這個倍數無關緊要。

還有第二個、較為低調的理由。Gemini 3.1 Pro 自二月起便以某種形式公開可用,而它是生產歷程較長的模型——更多人觸碰過它的極限,它在真實流量下的行為,也比一個推出僅十二天的版本有更完整的紀錄。對於輸出量大的互動式工作,由於工作在背景執行,十秒的中位數等待是可以接受的,在這種情況下,那份實績紀錄就是論據,而且是實實在在的論據。這不是延遲方面的論據:就上述的遙測數據而言,較便宜的模型在兩者之中更快,無論是中位數還是尾端延遲皆然。

而且還有一個問題:預覽標籤對那段歷史意味著什麼。以預覽版名稱提供七個月,比大多數模型能享有的時間都長,而且這也是七個月沒有 GA 承諾。DeepSeek V4.1 Flash 在撰寫本文時才問世十二天,其獨立紀錄很單薄:它近期唯一參與的第三方全面評測,即 2026 年 9 月 21 日發布的 Agents on Rails 代理式編碼排行榜,在最高強度下將其排在 17%,位居中段。十二天不足以讓一個模型的名聲具有任何意義,無論好壞——這才是買家在這裡可能偏好較舊模型的誠實理由,而這與速度毫無關係。

依上下文長度來路由,因為那才是真正的決策依據

這個比較所暗示的決策不是「二選一」。它是一條有兩個條款的規則:長上下文、高流量的工作交給 DeepSeek V4.1 Flash,而任何含有音訊或視訊的內容則交給 Gemini 3.1 Pro。麻煩之處在於,這條規則說起來容易,實作起來卻很惱人,因為這兩個條款通常分屬不同供應商,各自有不同的金鑰、不同的 SDK 和不同的速率限制。

兩個模型都能透過單一 OrcaRouter 金鑰存取,這讓此規則成為路由規則,而非應用程式中的分支程式碼——你可以直接依請求情境長度來決定,而這正是此處真正驅動成本差異的維度。OrcaRouter 以 0% 加價傳遞供應商牌價,因此上述的分級費率是 Google 自身的,而 DeepSeek 的尖峰時段排程也是 DeepSeek 自身的,供應商價格變動會在我們這邊當天生效。而且由於此配對的其中一方是預覽組建,值得在其背後加上自動容錯移轉:如果該組建在你使用期間被修訂,請求會落到另一個模型,而非錯誤頁面。

最後那一點是上述所有內容的實務版。長上下文工作上的 27 倍倍數,正是選擇路由而非二選一的理由;而兩個模型中有一個標著 preview,則是當建置版本更動時,請求得有地方可去的原因。

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

看什麼

• Gemini 3.1 Pro 是否會脫離預覽階段。正式發布將移除穩定性但書,且對這項比較格局的改變,會比任何價格變動都來得更大。

• 超過 20 萬的級距是否改變。在成本計算中,級距分界線發揮的作用比表面費率更大。

• DeepSeek V4.1 Flash 是否累積出獨立的實績紀錄。一個具備 MIT 授權權重、384K 輸出上限,以及每百萬輸入代幣 $0.15 的 1M 上下文之模型,是套罕見的組合;其能力是否真的到位,這個問題至今尚無公開基準測試能給出答案。

在那些事項中的第一項落實之前,準確的總結如下:DeepSeek V4.1 Flash 在輸入方面約比 Gemini 3.1 Pro 便宜十三倍,在長上下文輸入方面約便宜二十七倍,它是這兩者中唯一可下載的,也是這兩者中唯一背後有 GA 承諾的。Gemini 3.1 Pro 是擁有較長正式環境使用歷史的模型,也是這兩者中唯一能讀取音訊與視訊的。請據此進行路由。

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart