
DeepSeek V4.1 Flash:披著點版本號外衣的全新基礎模型
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123智能49程式
DeepSeek V4.1 Flash 於 2026 年 9 月 10 日發布:開放 MIT 權重、一百萬 token 的上下文長度、全新的因果編碼器-解碼器架構,以及一個 5520 億參數的混合專家模型主幹,DeepSeek 自家的模型卡將其歸類於公司所謂的「新架構家族」。此外,如果指出該命名的追蹤者判斷正確,這也是 DeepSeek 首次在完全全新的基礎模型上掛上 .1 版本號——這個標籤通常代表微調,而非重建。而那個版本號所暗示的旗艦型號 DeepSeek V4.1 Pro,目前仍然不存在。
這種不匹配不僅僅是命名上的吹毛求疵。任何按版本號比較 DeepSeek 世代的人,都會將「V4 Flash 到 V4.1 Flash」視為一個補丁步驟,並據此分配注意力。其底層架構說明了並非如此,而公司自己決定淘汰一個 1.6 萬億參數的旗艦型號,轉而採用 Flash 型號,更是有力地說明了這一點。

9月10日實際上發佈了什麼
這不是洩漏,也不是測試版。以模型 ID deepseek-v4.1-flash-expires-on-0910 於 9 月 8 日開始的兩天 API 測試,其結束方式正如其後綴所預示的那樣;真正的版本已於今天在 DeepSeek 的網頁應用程式、行動應用程式和第一方 API 上線,權重和技術報告則以 deepseek-ai/DeepSeek-V4.1-Flash 發布於 Hugging Face。
實際細節比儀式更重要:
• 模型名稱 — 呼叫 deepseek-flash。舊版名稱 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 仍被接受,但它們不再解析為原本的模型:兩者均已退役,指名使用它們的請求會由 DeepSeek V4.1 Flash 提供服務,並按 Flash 費率計費。
盒內含什麼 — 552B 骨幹參數、1M token 上下文視窗、384K 最大輸出長度、JSON 輸出、函式呼叫,以及預設開啟的思考模式,提供低、高、最高三種努力程度設定。
• 授權 — MIT,包含權重,儲存庫中附有推理資料夾及獨立的編碼模組。DeepSeek 明確邀請開源社群加入推理支援的開發,這是標準訊號,顯示主要執行環境的首日服務只需數天而非數週即可到位。
並非點版本的 .1
這篇文章的起點,來自 teortaxesTex 在 9 月 10 日的一則貼文。teortaxesTex 是一位化名、但備受密切關注的 DeepSeek 觀察者。該貼文宣稱:這是「DeepSeek 首次以 .1 版本號來標示一個全新的基礎模型」;V4.1「與 V4 之間的差異,比 LLaMA 3 與 LLaMA 1 之間的差異還大」;而且 DeepSeek「還不認為這值得稱為 V5」——但發文者卻無法說明原因。
將因果部分視為推測,將結構部分視為可驗證的。至於推測——為何 DeepSeek 選擇 .1 而非 V5——只是某位觀察者的解讀,僅此而已;公司外部無人解釋過這項決定,DeepSeek 自家材料也從未提及。可驗證的部分是架構,而它讀起來不像是一次小版本更新。DeepSeek 的變更日誌將 V4.1 Flash 描述為「我們新架構系列中規模最小的模型」,這句話用來形容版本號提升實在很奇怪:版本號提升是擴展一個系列,而不是開創一個系列。
這種模糊性有實際成本,而且是由買家而非 DeepSeek 承擔。版本號是開發者判斷「這是新世代還是重新調校,以及它值得我投入多少評估計畫」的最便宜訊號。DeepSeek 現在讓這個訊號在一個方向上變得不可靠——一個開創架構家族的模型,與一個改變其訓練後配方的模型,只差一個小數點。該公司得以保留其 V5 標記作為儲備。每個進行遷移評估的人都在為這種混亂付出代價。
「新架構」在權重中的含義是什麼?
這張模型卡異常具體,使得該世代主張無需任何基準測試就能輕鬆驗證。有四點格外突出。

• 不對稱激活——因果編碼器-解碼器的拆分是一個40層Transformer,組織為一個20層因果編碼器後接一個20層解碼器,其中解碼器的全局KV快取是從編碼器的最終隱藏狀態投影而來,而非從每個解碼器層本身的狀態推導。該設計的重點在於,模型在預填充期間每個token僅激活8B參數,而在解碼期間激活16B參數。輸入密集的代理工作負載——長文檔、長工具痕跡——使用模型的廉價一半;生成則使用昂貴的一半。
• KV 快取壓縮,以每個 token 計算 — DeepSeek-V4.1-Flash 以 FP4 主 KV 快取執行,每個 token 為 890 bytes,規格卡上標示約為 DeepSeek V4 Flash 的四分之一。中文報導更進一步,以第一代 V4 模型為基準,宣稱壓縮達 437 倍;這個較大的數字是供應商以不同基準算出的數據,應視為宣稱而非實際測量結果。
• SWA 有界重放 — 滑動視窗注意力通常迫使你將 KV 狀態持久化到 SSD 以重建上下文。此功能改為僅重放最近的 token 視窗來重建缺失的 SWA KV 狀態,將持久化 KV 佔用空間縮減至 DeepSeek V4 Flash 的約八分之一。
• Compressed Sparse Attention 2 — 每個注意力層以三種靜態模式之一運行(Full、Reindex 或 Reuse),跨層共享 KV 與索引器狀態,並以分層稀疏索引器將更深層的成本限制在與上下文長度無關的範圍內。
將這四點放在一起看,戰略意圖就很清楚了:這首先是一種稀疏性和快取效率優先的架構,其規模設定使得同一結構日後可以擴展升級。提到「新架構家族」並非空話——它意味著未來還有更多內容即將推出。
基準測試:由廠商自行報告,且尚未被推翻。
DeepSeek 在發佈時附帶發表了一套基準測試結果。根據公司自己的數據,V4.1 Flash 在 GPQA Diamond 得分 90.9,Codeforces 評分 3471,MathArena Apex 65.6,Terminal-Bench 2.1 為 90.6,DeepSWE v1.1 為 74.2,使用工具時在 HLE 上得分 63.9——最後一項附有註腳,將基準線 36.8 的數字限制在該基準測試的純文字子集。
將這些數字如實標示。它們是供應商自行報告的,發布時未附帶任何獨立評估,而這些正是 DeepSeek 用來證明其退役自家旗艦模型合理性的數字——也因此最值得檢視。截至 9 月 10 日發布時,Artificial Analysis 尚未公開對 DeepSeek V4.1 Flash 的評測數據,Hugging Face 的模型頁面本身也仍帶有「該模型尚未由任何推論供應商部署」的註記。此次發布的核心主張——即一款 Flash 級模型在效能、成本、速度與總處理時間上全面擊敗 1.6T 參數的旗艦模型——目前仍屬供應商說法,未經外部稽核。
另一面也有個誠實的提醒。同一家供應商的報告顯示,V4.1 Flash 在與 Kimi K3 的 16 次比較中贏了 13 次,對上 GLM-5.3 則是 13 次中贏 11 次,但在較新的 Terminal-Bench 3.0 和 4.0 任務以及 ProgramBench 上,仍落後 GPT-5.6 Sol 和 Claude Opus 5。這是一個連貫的樣貌——在此架構最佳化的編碼、終端機與代理自動化工作上最強,在前沿推理任務上較弱——而這正是真正的世代躍進會呈現的樣貌。
價格,以及值得記入行事曆的路由交換器
新定價已隨此次發布生效,且這與先前的 Flash 費率表相同,而非降價:在deepseek-flash上,快取命中輸入離峰時為每百萬 tokens $0.003,尖峰時為 $0.006;快取未命中輸入分別為 $0.15 與 $0.30;輸出分別為 $0.60 與 $1.20。尖峰價格正好是離峰的兩倍,適用於週一至週五的 01:00–04:00 與 06:00–10:00 UTC。
削減落在 Pro 流量上。DeepSeek V4 Pro 定價為 $0.022 與 $0.044 的快取命中輸入、$0.66 與 $1.32 的快取未命中輸入,以及 $1.98 與 $3.96 的輸出——因此,將 Pro 命名的請求路由到 V4.1 Flash,其輸出成本約降低 70%,而依 DeepSeek 的說法,同時提升了回答這些請求的能力。

此次重新路由是既定安排,而非假設。自 2026 年 9 月 14 日北京時間 12:00 起,指名deepseek-v4-pro的請求將改送至 V4.1 Flash,並以 Flash 定價計費,且持續如此,直到 DeepSeek V4.1 Pro 推出為止。若您的整合程式將 Pro 模型名稱寫死,一切不會中斷——您會以大約輸出價格三分之一的費率取得不同模型,無需變更程式碼,也無需額外通知,僅有變更日誌中的一筆條目。若您是依能力等級而非模型名稱進行路由,9 月 14 日便是重新測試的日子。
如果你今天致電DeepSeek,這代表什麼
OrcaRouter 目前尚未搭載 DeepSeek V4.1 Flash——截至目前,deepseek-v4.1-flash 的模型頁面仍回傳「找不到模型」,我們寧可直白說明,也不願暗示其他情況。由此衍生兩點。第一,DeepSeek 所宣布的重新路由屬於第一方 API 行為,因此 9 月 14 日的切換會在 DeepSeek 自家的端點上發生,無論您透過何種方式存取皆然。第二,若您今天就想要新的架構,您必須直接呼叫供應商。
我們所做的,是將其餘的 DeepSeek 系列全部統一路由到同一個金鑰:DeepSeek V4 Flash 和 DeepSeek V4 Pro,以及 200 多個其他模型。那裡的定價是 DeepSeek 的供應商列表價格,以 0% 加價直接轉傳——這正是這類發布最關鍵的部分:當供應商調降費率時,我們這邊當天就會生效,而不是等到重新定價週期結束後。而當 V4.1 Flash 真的進入目錄時,上述離峰時段的半價就是實際費率,不是我們協商出來的折扣。
{{1}}對於如此新的模型,路由的考量其實不在於價格。{{/1}}{{2}}而在於你願意將多少生產路徑押注在一個上市僅一週、沒有獨立基準測試、也沒有第三方服務的架構上。{{/2}}{{3}}將新模型放在可切換的方案之後——或使用非生產金鑰進行測試——正是評估與事故之間的區別。{{/3}}
什麼才能解決命名問題?
三件事,按照它們會告訴你的資訊量遞增排列。
對 DeepSeek V4.1 Flash 的獨立評測,將在第三方測試框架上驗證其架構宣稱。這是唯一能將廠商數據表轉化為事實的衡量標準,也是最可能出現的下一則消息。
DeepSeek V4.1 Pro 將考驗該家族的主張。路由通知將其列為 Pro-to-Flash 窗口的端點,這使它成為整個發佈所圍繞的模型——而它仍是 DeepSeek 確認最少的部分:沒有模型卡、沒有參數數量、沒有日期、沒有權重、沒有價格。
還有一點雖然不起眼但很實用:DeepSeek是否會再次這麼做。如果另一個新的基礎模型再次出現.1標籤,就會把異常變成慣例,而慣例是開發者可以規劃應對的。單一模型只是偶然。命名只有在形成規律之後,才會產生有用的誤導作用。
就目前而言,務實的解讀會依你的身分而清楚劃分。如果你使用的是 DeepSeek V4 Pro,請在行事曆上標記 9 月 14 日,並在此之前重新執行你的評估,因為那個名稱背後的模型無論你是否要求,都會改變。如果你使用的是 DeepSeek V4 Flash,你已經在以相同的價格,被遷移到 DeepSeek 為擴展而打造的架構上。而如果你一直在等待 V5,老實說,DeepSeek 似乎已經推出了這一代產品,卻拒絕為它命名——這種事你只能做一次,之後人們就不會再相信那個數字了。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
