
DeepSeek V4.1 Flash 與 Gemini 3.1 Pro:其中一款仍處於預覽階段
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
最值得了解的一件事DeepSeek V4.1 Flash對上Gemini 3.1 Pro並不會印在任何一份規格表上。DeepSeek V4.1 Flash 是已正式推出(GA)的模型,於 2026 年 9 月 10 日發布,並附上以 MIT 授權、可自行下載的權重。Gemini 3.1 Pro 自 2026 年 2 月 19 日起便處於預覽階段,約七個月後仍以預覽版組建名稱提供服務。這種不對稱並不決定哪個模型更好,但它決定了當你以其中一個模型為基礎來開發時,你所做的是什麼樣的承諾,而這也是以下所有內容的框架。
兩者都能容納一百萬個 token 的上下文。兩者都接受圖片。真正讓它們有所區別的,是輸入 token 超過 200,000 之後的價格曲線、輸入模態、輸出上限,以及這兩者之中,一個是你可以實際擁有的檔案,另一個則是 API。
這兩者實際上究竟處於什麼立場
• 每 100 萬個 token 的價格,最高 200K 上下文 — DeepSeek V4.1 Flash 輸入 $0.15 / 輸出 $0.60,對比 Gemini 3.1 Pro 輸入 $2.00 / 輸出 $12.00。那是輸入價格的 13 倍、輸出價格的 20 倍。
• 超過 200K 上下文時,每 1M 個 token 的價格 — V4.1 Flash 維持不變,為 $0.15 / $0.60,對比 Gemini 3.1 Pro 的輸入 $4.00 / 輸出 $18.00。輸入倍數擴大至 27×,而這恰好是長上下文工作所在之處。
• 快取輸入 — V4.1 Flash 離峰時段每 1M 為 $0.003,對比 Gemini 3.1 Pro 每 1M 為 $0.40。兩個數量級的差距,就落在決定重新讀取上下文是否負擔得起的這個項目上。
• 上下文視窗 — 1M tokens 對 1M tokens。等級。
• 最大輸出 — V4.1 Flash 384K tokens,對比 Gemini 3.1 Pro 的 65K tokens。上限高出六倍。
• 輸入模態 — V4.1 Flash 接受文字與圖片,而 Gemini 3.1 Pro 接受文字、圖片、音訊、影片以及檔案上傳。
• 權重 — V4.1 Flash MIT,可下載對比 Gemini 3.1 Pro 封閉,僅限 API。
• 發布狀態 — V4.1 Flash 自 2026 年 9 月 10 日起正式推出,而 Gemini 3.1 Pro 自 2026 年 2 月 19 日起仍處於預覽階段。
• 觀察到的首個權杖延遲——根據 OrcaRouter 自家的 7 天遙測資料,V4.1 Flash 在 p50 為 2.63 秒、p95 為 9.05 秒,而 Gemini 3.1 Pro 在 p50 為 10.00 秒、p95 為 10.00 秒。這個昂貴模型的中位等待時間正落在遙測上限,而它的尾端延遲也始終無法脫離該上限。
不帶價格來看這份清單,其輪廓在每一場開放權重與前沿模型的比較中都似曾相識:可下載模型在輸出上限勝出,在上下文方面打成平手,並在實測延遲上領先。封閉模型在模態方面勝出,而且在這些方面是徹底勝出。這裡沒有任何一點能單獨解釋 13 倍的輸入倍數。

200K 斷崖才是定價的關鍵
Gemini 3.1 Pro 的宣傳費率並非單一費率。輸入 token 數最多 200,000 的提示,每百萬個 token 的計費為輸入 $2.00、輸出 $12.00;超過此門檻的提示則按 $4.00 與 $18.00 計費。DeepSeek V4.1 Flash 則沒有級距——無論請求是 2,000 個 token 還是 900,000 個 token,都按 $0.15 與 $0.60 計費,唯一但書是 DeepSeek 在尖峰時段會將費率加倍,且週末完全以離峰費率運作。
那道方案分界正好落在對長上下文工作最不利的位置,因為長上下文工作定義上就是會跨越這道界線的工作。做個實際比較就能讓它具體起來。假設有一條管線每月發出 20,000 次呼叫,每次平均使用 250,000 個輸入 token 和 4,000 個輸出 token——這是一項針對大型檔案的文件分析工作。
• DeepSeek V4.1 Flash 離峰時段費率:20,000 × 250,000 等於 5,000M 輸入 token,以每百萬 $0.15 計算,即 $750.00。輸出為 20,000 × 4,000,也就是 80M token,以每百萬 $0.60 計算,即 $48.00。總計 $798.00。
• Gemini 3.1 Pro 在其超過 200K 的級距:相同的 5,000M 輸入 token,以每百萬 $4.00 計算,為 $20,000.00;而 80M 輸出 token,以每百萬 $18.00 計算,為 $1,440.00。總計 $21,440.00。
那是在相同流量下,每月支出相差 27×,而這並不是你從標題數字會猜到的倍數。標題上的倍數是 13×。你實際上為長上下文工作支付的倍數是 27×,因為方案層級的分界正好就落在你的提示所在的位置。
預覽標籤真正讓你付出的代價
預覽組建在整個業界就是預覽組建:它不附帶任何已公布的穩定性保證。廠商並未承諾會讓該端點維持在那樣的行為、那樣的價格或那樣的名稱。這並不是對 Gemini 3.1 Pro 的批評——這正是這個標籤的含義,也是為什麼 preview 後綴存在了七個月,而不是只是為期兩週的形式。
對原型來說,這沒什麼。但對正式生產路徑而言,這是一個具體且可量化的風險:你在賭你所調校的那個建置版本會維持不變。與這項比較另一邊的對比是結構性的,而非修辭上的。DeepSeek V4.1 Flash 已正式推出(GA),其權重採用 MIT 授權且可下載,這意味著即使託管的 API 明天更改條款,模型本身仍在你手上。封閉的預覽模型既不會給你 GA 承諾,也不會給你逃生出口。如果你的工作負載在兩者上都能執行,這個差異比一個基準測試分數更有價值。
在哪些情況下 Gemini 3.1 Pro 是更好的工具
模態差距不是捨入誤差,而且是這份清單上唯一一個無論價格多低,便宜模型都無法替代的維度。Gemini 3.1 Pro 將音訊和視訊視為一級輸入,另外還支援檔案上傳。DeepSeek V4.1 Flash 接受文字和圖像。如果你的管線需要接收通話錄音、螢幕擷取或影片評論,DeepSeek V4.1 Flash 就不是更便宜的選項——它根本不是選項。對於一個模型能做、另一個不能做的任務來說,13 倍這個倍數無關緊要。
還有第二個、較為低調的理由。Gemini 3.1 Pro 自二月起便以某種形式公開可用,而它是生產歷程較長的模型——更多人觸碰過它的極限,它在真實流量下的行為,也比一個推出僅十二天的版本有更完整的紀錄。對於輸出量大的互動式工作,由於工作在背景執行,十秒的中位數等待是可以接受的,在這種情況下,那份實績紀錄就是論據,而且是實實在在的論據。這不是延遲方面的論據:就上述的遙測數據而言,較便宜的模型在兩者之中更快,無論是中位數還是尾端延遲皆然。
而且還有一個問題:預覽標籤對那段歷史意味著什麼。以預覽版名稱提供七個月,比大多數模型能享有的時間都長,而且這也是七個月沒有 GA 承諾。DeepSeek V4.1 Flash 在撰寫本文時才問世十二天,其獨立紀錄很單薄:它近期唯一參與的第三方全面評測,即 2026 年 9 月 21 日發布的 Agents on Rails 代理式編碼排行榜,在最高強度下將其排在 17%,位居中段。十二天不足以讓一個模型的名聲具有任何意義,無論好壞——這才是買家在這裡可能偏好較舊模型的誠實理由,而這與速度毫無關係。
依上下文長度來路由,因為那才是真正的決策依據
這個比較所暗示的決策不是「二選一」。它是一條有兩個條款的規則:長上下文、高流量的工作交給 DeepSeek V4.1 Flash,而任何含有音訊或視訊的內容則交給 Gemini 3.1 Pro。麻煩之處在於,這條規則說起來容易,實作起來卻很惱人,因為這兩個條款通常分屬不同供應商,各自有不同的金鑰、不同的 SDK 和不同的速率限制。
兩個模型都能透過單一 OrcaRouter 金鑰存取,這讓此規則成為路由規則,而非應用程式中的分支程式碼——你可以直接依請求情境長度來決定,而這正是此處真正驅動成本差異的維度。OrcaRouter 以 0% 加價傳遞供應商牌價,因此上述的分級費率是 Google 自身的,而 DeepSeek 的尖峰時段排程也是 DeepSeek 自身的,供應商價格變動會在我們這邊當天生效。而且由於此配對的其中一方是預覽組建,值得在其背後加上自動容錯移轉:如果該組建在你使用期間被修訂,請求會落到另一個模型,而非錯誤頁面。
最後那一點是上述所有內容的實務版。長上下文工作上的 27 倍倍數,正是選擇路由而非二選一的理由;而兩個模型中有一個標著 preview,則是當建置版本更動時,請求得有地方可去的原因。

看什麼
• Gemini 3.1 Pro 是否會脫離預覽階段。正式發布將移除穩定性但書,且對這項比較格局的改變,會比任何價格變動都來得更大。
• 超過 20 萬的級距是否改變。在成本計算中,級距分界線發揮的作用比表面費率更大。
• DeepSeek V4.1 Flash 是否累積出獨立的實績紀錄。一個具備 MIT 授權權重、384K 輸出上限,以及每百萬輸入代幣 $0.15 的 1M 上下文之模型,是套罕見的組合;其能力是否真的到位,這個問題至今尚無公開基準測試能給出答案。
在那些事項中的第一項落實之前,準確的總結如下:DeepSeek V4.1 Flash 在輸入方面約比 Gemini 3.1 Pro 便宜十三倍,在長上下文輸入方面約便宜二十七倍,它是這兩者中唯一可下載的,也是這兩者中唯一背後有 GA 承諾的。Gemini 3.1 Pro 是擁有較長正式環境使用歷史的模型,也是這兩者中唯一能讀取音訊與視訊的。請據此進行路由。

