
DeepSeek V4.1 Flash 對比 DeepSeek V4 Flash:相同的 Flash Rate Card,但模型經過重新訓練
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49程式
DeepSeek V4.1 Flash 從傳聞中的繼任者變成正式出貨的 Flash 模型,這一週既短暫又喧囂。9 月 8 日,該模型以模型 ID deepseek-v4.1-flash-expires-on-0910 的形式現身,作為為期兩天的 API 測試——這是 DeepSeek 自己稱之為「過渡版本」的建置。9 月 9 日,其開放平台表示正式版本 DeepSeek V4.1 Flash 將於 9 月 10 日左右發布,並在能力、成本、速度和端到端時間上「全面超越」DeepSeek V4 Pro。9 月 10 日,發布公告伴隨新的 Flash 系列計價方案,於北京時間 12:00 生效,這是 DeepSeek V4 Flash 自 8 月漲價以來未曾見過的降價。無論其他事實如何,文字處理主力 DeepSeek V4 Flash 已不再是執行 Flash 工作負載的最新方式,而本文要探討的,正是這對你目前正在運行的應用程式實際上會帶來什麼改變。
這種早期比較本來就不對等,在數據出來之前值得先說清楚。DeepSeek V4 Flash 有發布的規格表、DeepSeek-V4-Flash-0731 更新後一個月的生產流量、開放權重,以及 Artificial Analysis 的獨立評測。DeepSeek V4.1 Flash 只有官方公告、兩天的社群速度測試,沒有發布規格表、沒有技術報告,也還沒有第三方評分。以下供應商宣稱會標示為供應商宣稱,社群數據則標示為社群實測。
閃電階級剛重置 — 三項改動,為期一週
DeepSeek V4 Flash,這款擁有 284B 參數、13B 活躍參數的混合專家模型,自 7 月 31 日刷新以來,一直是大量生產文字流量的明智低成本、高吞吐量預設選擇。三天內三項公告動搖了它的根基:
• 9月8日 — DeepSeek 向所有 API 帳戶開放了 V4.1 Flash 的限時測試版,最多僅限 20 個並發請求,並預計於 9月10日 到期,其所使用的模型名稱本身也帶有到期日期。
• 9月9日——開放平台宣布 DeepSeek V4.1 Flash 將於9月10日左右正式發布,描述了一種具備原生多模態支援的新型模型結構,並聲稱其在效能、成本、速度和總完成時間方面優於 DeepSeek V4 Pro。
• 9月10日——正式发布带来新的Flash系列价格表,自北京时间12:00起生效,下调了DeepSeek V4 Flash自8月17日涨价以来收取的费率,那次涨价招致了开发者的强烈批评。
最後那一項值得單獨拿出來說,因為它是罕見的降價,而且是真正的降價。在新的價目表上,離峰時段的快取命中輸入從每百萬 tokens 人民幣 ¥0.05 降至 ¥0.02——降幅達 60%——而快取未命中輸入則從 ¥1.5 降至 ¥1,輸出從 ¥4.5 降至 ¥4。尖峰時段費率是離峰時段的兩倍。換算成整數美元,離峰時段大約是每百萬 tokens 快取命中輸入 $0.003、快取未命中輸入 $0.14、輸出 $0.56,尖峰時段則翻倍。八月漲價與這次降價之間相隔 24 天,並非排程上的偶然;這次價格調整是 V4.1 Flash 推出的一部分。
相同等級,不同型號
簡單的解讀是,V4.1 Flash 只是把 V4 Flash 的調速旋鈕調高了一檔。但事實並非如此。0731 版本的更新是在現有 DeepSeek V4 Flash 基礎上進行的訓練後更新——相同的架構,相同的 284B 總參數 / 13B 啟用參數的混合專家(MoE)佈局。DeepSeek 對 V4.1 Flash 的描述指向了更大的變革:一種新的模型結構,多家媒體將其解讀為一次全新的預訓練,而非微調。這個區別很重要,因為重新訓練的模型不會像刷新版本那樣繼承舊模型的行為——即使在能力未變的情況下,提示詞處理、工具呼叫和輸出風格都可能發生變化。
• 架構 — DeepSeek V4.1 Flash:新的模型結構,DeepSeek 將其描述為全新打造、具備原生多模態輸入的模型。DeepSeek V4 Flash:V4-Flash-0731 後訓練更新的 MoE 模型,總參數 284B / 啟用參數 13B。
• 輸入 — V4.1 Flash 在基礎模型中原生支援文字和圖像輸入;DeepSeek V4 Flash 僅支援文字,圖像則需要單獨的附加構建 DeepSeek-V4-Flash-Vision-Exp。
• 背景與輸出 — DeepSeek V4 Flash 支援 1M 上下文與 384K 最大輸出;DeepSeek 的發布資料指出 V4.1 Flash 保留了百萬級 token 的上下文視窗,但目前尚未發布正式的規格卡。
• 並發 — DeepSeek V4 Flash 列出 2,500 並發的上限;V4.1 Flash 測試版上限為 20,而 DeepSeek 對正式版「高並發」的主張,在撰寫本文時尚無已發布的數字佐證。
• 權重 — DeepSeek V4 Flash 在 MIT 授權下為開放權重;V4.1 Flash 則尚未宣布任何相關資訊。
• 獨立排名 — DeepSeek V4 Flash 已由 Artificial Analysis 評測;DeepSeek V4.1 Flash 尚無第三方評分。
文本與多模態的差異點,即使在文本比較中也值得多寫一句,因為它決定了 V4.1 Flash 是為誰而做的。如果你的 pipeline 原本是分別用 DeepSeek V4 Flash 處理文本、用 DeepSeek-V4-Flash-Vision-Exp 處理圖像,那麼 V4.1 Flash 是第一個在單一模型中涵蓋這兩種路徑的 DeepSeek 版本——只需維護一個 endpoint,不必在旁邊另外外掛 encoder。

它們真正的分歧點:吞吐量,以及完成一項任務所花的成本
在相同價格下,兩款型號在速度上有所區別,而速度正是數據最引人注目的地方。Artificial Analysis 測量 DeepSeek V4 Flash 0731 在 DeepSeek 自家 API 上約每秒 120–140 個輸出 token,具體取決於配置和測量時窗。V4.1 Flash 首日測試者回報持續生成速率約為每秒 280 到 500 個 token,視任務而定;在低並發運行中峰值超過每秒 500 個 token。較高的數字是由社群測量而得,並非廠商公布,而且每秒 token 數從來不是模型的內在屬性。儘管如此,所有首日報告的方向一致,DeepSeek 自身宣稱的更快生成速度與更低的整體完成時間也指向相同結論。
這種速度差距改變了成本結構,即使兩種模型採用相同的費率表,因為你是按 token 計費,而 token 送達得更快。一個在 V4 Flash 上需要一分鐘的長上下文檢索或程式碼生成任務,在 V4.1 Flash 上以相同的每個 token 價格,可以在極短時間內完成——多位首日測試者回報,在恰恰是這些任務類型上,端到端速度快了五到六倍。測試版初期「花錢更快」的抱怨正是同一枚硬幣的另一面:在每個 token 價格不變的情況下,一個產生 token 速度快兩到三倍的模型,每分鐘消耗餘額的速度也更快。每個任務的實際費用是否真的下降,取決於新模型是否用更少的 token 和更少的重試次數完成任務——而這正是目前還沒有人能證明的事。
在價目表上,這兩個模型並列顯示。以9月10日的價格表為例,離峰時段每百萬個token:快取命中輸入¥0.02、快取未命中輸入¥1、輸出¥4,尖峰時段則為兩倍——降價前適用於Flash層級的同一價格表原本是¥0.05、¥1.5和¥4.5。對於快取密集的工作負載而言,降價是最大的亮點:¥0.02對比¥0.05,在構成自動完成或agent迴圈輸入串流大部分的token上減少了60%。對於未命中快取的新資料攝入任務,節省幅度則接近三分之一。這些都不會讓V4.1 Flash的單位token價格比V4 Flash更便宜——兩者共用同一張價格表——但該架構更高的吞吐量才是差異化所在,而且無需額外成本。

收據是針對 V4 Flash;索賠是針對 V4.1 Flash
{{1}}目前關於這場對決最重要的一項基準測試事實是,新模型根本沒有基準測試數據。{{/1}}{{2}}DeepSeek V4.1 Flash 的頭條宣稱——即在能力、成本與速度上全面超越 DeepSeek V4 Pro——僅為廠商自行發布,未經第三方複現。{{/2}}{{3}}沒有公開參數數量、評測表格或技術報告,截至撰稿時 Artificial Analysis 也尚未對其進行測量。{{/3}}{{4}}面對一個上一代旗艦發布曾引發獨立審視的模型系列,「相信我們,它勝過 Pro」這種說法,讀者在第三方實際運行之前應審慎看待。{{/4}}
DeepSeek V4 Flash 相比之下則有實打實的紀錄可循。Artificial Analysis 將 0731 推理版本列為同級模型中的領先者之一,其評分遠高於同級開放權重模型的中位數,並且在 DeepSeek 自家 API 上測得的輸出吞吐量落在上述約每秒 120–140 tokens 的區間。這些數字將是 V4.1 Flash 自己的成績出爐時被拿來比較的基準,而這道門檻比「快速便宜的 Flash」這個標籤所暗示的要高得多。新版本所取代的模型並不弱;它是一款貨真價實、表現強勁的開放權重主力模型。正因如此,這次升級的決定才具有實質意義,而非流於形式。
路由正在承擔繁重的工作 — 無論是在 DeepSeek 內部,還是為你
這次發布中最未被充分報導的部分是,DeepSeek 正在其自身模型之間路由流量。其公告十分明確:一旦 V4.1 Flash 上線,且在 V4.1 Pro 推出之前,所有指向 deepseek-v4-pro 的 API 請求都將由 DeepSeek V4.1 Flash 提供服務,並以 Flash 等級的價格計費。V4 Pro 呼叫者無需更改任何程式碼,就能獲得新的架構,同時每個 token 的成本也僅剩一小部分。請注意哪些不會被路由:deepseek-v4-flash 的呼叫。舊的 Flash 模型會繼續服務那些仍然指向它的使用者,這正是這個比較存在的原因——如果你使用的是 V4 Pro,切換會自動為你發生;如果你使用的是 V4 Flash,則必須自己做決定。
一個供應商悄然決定讓較便宜的模型去承接原本瞄準其高階模型的呼叫,是對 V4.1 Flash 的強力背書——而這也正是路由層在供應商之間套用的同一邏輯。這正是 OrcaRouter 這類平台所填補的缺口:一個 API 對接 200 多種模型,供應商目錄價格以 0% 加價直接傳遞,所以 DeepSeek 在 9 月 10 日的 Flash 降價,當天就在我們這端生效。OrcaRouter 上的 DeepSeek V4 Flash仍能與您執行的所有其他模型一樣,使用同一個金鑰進行呼叫,這使得安全地採用首日模型的方式真正成本低廉:將一部分流量導向 DeepSeek 自家 API 上的 DeepSeek V4.1 Flash,在同一路由規則中將 DeepSeek V4 Flash 保留為自動後備,讓故障轉移處理邊緣情況,同時讓新架構證明自己的價值。
DeepSeek V4.1 Flash 對比 DeepSeek V4 Flash:你應該呼叫哪一個?
如果誠實的答案是這兩種模型任一都適合所有人,那就不會有這篇文章了。如今兩者分別對應不同的風險屬性,分野異常分明。

如果您今天要開始新的 Flash 工作負載,如果延遲和吞吐量是制約因素,如果您想要影像輸入而不需要維護第二個模型,或者如果您樂於讓 DeepSeek 自身的路由來降低 Pro 等級聲稱的風險,請改用 DeepSeek V4.1 Flash。該模型以 deepseek-v4.1-flash 名稱在 DeepSeek 的第一方 API 上提供,定價與它所取代的模型相同,採用相同的 Flash 方案,而且所有第一天的訊號都表明它明顯更快。
若您在已發布的 2,500 並發上限下承載生產流量、依賴其開放權重進行自架或合規,或您的提示詞、評測與工具呼叫邏輯是針對 {{2}}0731{{/2}} 行為調校、無法在第一天就吸收重新訓練模型的怪癖,請繼續使用 {{1}}DeepSeek V4 Flash{{/1}}。一次全新的預訓練是行為改變,而不只是速度改變;{{KEEP}}0731{{/KEEP}} 版本正是累積了整整一個月實績的版本。
對大多數團隊來說,站得住腳的預設是中間路線:將 DeepSeek V4.1 Flash 設為新工作負載的預設,保留 DeepSeek V4 Flash 作為承擔營收之工作負載的容錯移轉,並讓第一張獨立評分卡——加上已發布的規格卡與並發數——來解決任何兩天測試版都無法解決的爭論。Flash 層級剛迎來新引擎;舊引擎並非過時,而是基準。
好奇當 DeepSeek 將 Pro 級流量導向 V4.1 Flash 並以 Flash 價格計費時,流量會是什麼樣子? OrcaRouter 上的 DeepSeek V4 Pro — 兩者共用一個金鑰,按 DeepSeek 的定價計費。
本文中的比較4
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
