
DeepSeek 的 3T 模型:必須等待叢集的規模擴充
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
9 月 14 日,DeepSeek 將淘汰DeepSeek V4 Pro——這款 1.6 兆參數、於 8 月 13 日正式全面開放的旗艦模型——並在回應每一通打給deepseek-v4-pro的呼叫時,以DeepSeek V4.1 Flash作為回應,這款 5520 億參數的模型於 9 月 10 日發布。在那次切換公告的四天前,一位匿名 DeepSeek 觀察者發表了某種指向相反方向的尖銳說法:該實驗室一直在研發一款 3 兆參數的模型,「大概是另一個 1T 參數的 Engram」,而它尚未推出是因為經濟因素,而非能力。
關於那個模型,沒有任何事獲得證實。沒有名稱、沒有儲存庫、沒有設定檔、沒有基準測試、沒有發布時程——只有一則 X 貼文,來源被指為「可靠權威」,而其中唯一最有趣的細節,還被作者本人明確標示為推測。把它當成一個訊號,而不是事實。不過它仍然值得一讀,因為這項說法的兩個部分彼此拉扯、方向相反,而其中只有一個有可能在與 DeepSeek 自身路線圖接觸後仍站得住腳。
這份外洩內容實際上說了什麼,以及它沒說什麼
這則貼文來自帳號 teortaxesTex,一位長期關注 DeepSeek 的觀察者,他自稱自 2023 年起就是該實驗室的粉絲。全文如下:「其實我有可靠消息指出,DeepSeek 當時正在開發一個 3T 模型(主幹,可能還有另一個 1T 參數的 Engram,但這只是我的推測)。他們只是不確定對它進行後訓練並提供服務是否划算。等他們的叢集規模擴大,我們就會看到一些……」
那兩句話裡有四件事具有分量,而其中一件根本不是事實。「可靠的消息來源」並未具名。參數數量只以單一數字出現,並未區分總數與啟用數。Engram 那段附帶提及,被提出推測的人自己標明為推測。而「當它們的叢集成長時」是個條件句,並未附上任何日期。
• 被聲稱的內容是什麼——一個處於某個開發階段的 3 兆參數 DeepSeek 模型存在。
• 作者明確表示純屬自己猜測的是什麼——其中大約 1T 是 Engram 記憶體。
• 未知的部分——它的名稱、架構、活躍參數數量、上下文視窗、訓練狀態,以及它究竟是否會以產品形式推出。
• 現在可驗證的是什麼——什麼都沒有。沒有任何 DeepSeek 儲存庫、模型卡、定價列或文件條目提及它。
甚至連算術本身都有歧義。「3T 模型(骨幹,可能還有另一個 1T 參數的 Engram)」有兩種解讀:一種是 3T 模型中約有 1T 是 Engram;另一種是 3T 骨幹再加上另一個 1T 的 Engram,總共約 4T。這個差距寬達一兆個參數,而且它對推論服務帳單的影響,比大多數實驗室花在一次訓練上的支出還大。
同樣值得記住的是,這個帳號的紀錄好壞參半,而非神諭級。他把 DeepSeek 9 月 9 日關於重新導向 V4 Pro 流量的通知,解讀為該實驗室已「解決 V4 系列架構問題」的證據——這是合理的推論,但仍只是推論。九月初,他也拋出一個說法:某第三方程式開發平台上的一個匿名隱形模型是小米的 MiMo-V3-Flash;此事無人證實。這是有用的早期訊號,但不是正式紀錄來源。
有趣的那一半是記憶體表,而不是參數數量。
Engram 是真實存在的,而這正是為何 3T 的說法比乍聽之下更合理的原因。DeepSeek 在 2026 年 1 月發表了這個條件式記憶架構,並附上開源程式碼,而它做了一件不尋常的事:它將靜態知識檢索與動態推理分開。模型不是花費 GPU 運算來回想事實,而是將其上下文雜湊成保存在 DRAM 中的嵌入表,並以常數時間檢索,查找路徑中沒有任何 GPU 工作,還有一個閘控機制,會在檢索到的記憶與周遭上下文衝突時將其抑制。
DeepSeek 針對自家測試配置所報告的數字,才是值得牢牢記住的:一張一千億參數的嵌入表以低於 3% 的吞吐量損失卸載到 DRAM,以及在 1M tokens 下,大海撈針準確率達 97%,而標準注意力為 84.2%。那些是該實驗室自家的數字,並非由我們重現。據報導,獨立早期評估在相同上下文長度下落於 93–96% 區間——高於基線,但低於其宣稱。
把這個想法放大十倍,外洩內容的樣貌就會改變。如果一個 3T 模型多出來的參數,大部分是存放在 DRAM 中的雜湊表記憶體,而不是競爭 HBM 的專家,那麼「3T」就不再是「無法提供服務」的代名詞。總參數量和服務成本就此分道揚鑣。這才是這次外洩中真正嶄新的想法,而這也是已發表研究實際支持的部分。
需要注意的是,據報導,Engram 論文並未處理推論時的額外負擔——延遲與吞吐量——而這正是 DRAM 常駐查找表如果真會在哪裡顯現,就一定會顯現的地方。你必須特地去取用的記憶體,並不是你能免費獲得的記憶體。

為何 DeepSeek 自家的 September 卻主張相反論點
反對 3T 產品即將推出的理由在於,DeepSeek 才剛在 1.6T 上做了這個實驗,並用更小的東西回答了自己的問題。目前 V4 的階梯如下:
• DeepSeek-V4-Flash-0731 — 總參數 284B,每個 token 啟用 13B。
• DeepSeek-V4-Pro-0813 — 總計 1.6T,活躍參數 49B,以 MIT 授權條款開放權重。
• DeepSeek V4.1 Flash — 採用因果編碼器-解碼器設計的 552B 主幹,在預填充階段每個符記啟用 8B 參數,解碼階段則啟用 16B。
北京時間9月14日中午,中階版本登場。DeepSeek 將 V4 Pro 下線,並將針對 deepseek-v4-pro的請求路由至 V4.1 Flash,按 Flash 費率計費,直到 V4.1 Pro 問世為止。官方定價頁面今天列出兩行,而就規模而言,兩者都不是這個已退役模型的接班機型:deepseek-flash在尖峰時段為每百萬輸入 token 0.30 美元、每百萬輸出 token 1.20 美元,deepseek-v4-pro則為 1.32 美元與 3.96 美元,離峰費率是這些數字的一半。兩者都列出 1M token 的上下文視窗,以及 384,000 token 的輸出上限。
發展方向並不隱晦。一個實驗室若讓自家最大的模型退役,轉而採用每個 token 只啟用十分之一參數的模型,就已經得出結論:前沿能力的經濟單位,並不是它能訓練出的最大檢查點。一個 3T 模型,若其建構者不確定它能否「以合乎經濟效益的方式進行後訓練與提供服務」,這並不是關於猶豫的傳聞;它描述的是一個如今已對替代方案握有實測數據的實驗室。
後訓練是那個問題中更棘手的一半。第三方 SLAI T-Rex 專案回報,在華為 CloudMatrix384 SuperPOD 上對 DeepSeek-V4-Pro 系列進行全參數後訓練,可達到 34.22% MFU,約為開放基準配方的 2.93 倍。那是個令人振奮的數字——一個第三方數字,而且是在 1.6T 模型上。把主幹規模加倍,大約就會讓帳單翻倍,而這還是在服務任何一個 token 之前。

當{{1}}他們的{{/1}}叢集成長時
這起洩密案中最關鍵的條款是最後一項,因為它是唯一具有公開書面紀錄的部分。據報導,DeepSeek 計劃在內蒙古烏蘭察布的新資料中心部署至少 160,000 顆 Huawei 的 Ascend 950DT 加速器,訂單價值約 25.6 億美元——這是歷來有人嘗試過的中國製 AI 晶片最大規模叢集之一。
該計畫附帶的但書,比新聞標題本身更重要。這些晶片是規劃用於推論,而非訓練:DeepSeek 過去曾嘗試用 Huawei 晶片進行訓練,如今仍使用 Nvidia 加速器訓練,而這正是 3T 模型實際上會需要的環節。交付可能需時超過一年。部分產能預計在 2027 年底至 2028 年初上線。此外,預計限制 Huawei 今年能打造多少 950DT 單位的因素,會是高頻寬記憶體供應,而非邏輯晶片。
「當其叢集擴張時」的樂觀解讀,最早會把 3T 模型放在 2027–2028 年的時間表上;而悲觀解讀——它始終只是研究成果,永遠不會成為產品——則與 DeepSeek 在 2026 年所發布的一切相符。該實驗室周遭的算力環境也是有爭議的政策問題,而非單純的供應問題:9 月 8 至 9 日,NSA、FBI 與 CISA 聯合指控包括 DeepSeek 在內的六家中國實驗室以「工業規模」蒸餾美國前沿模型,這項指控遭中國商務部駁斥。無論人們如何看待這項指控,凡是取決於叢集成長的發布,都取決於 DeepSeek 內部無人能掌控的決策。
什麼情況能讓這件事從走漏風聲變成正式發布?
這份檢查清單簡短又具體,而且還沒有一項觸發:
• 在 Hugging Face 上 deepseek-ai 組織底下的一個儲存庫,其名稱是版本化的檢查點名稱,而非系列代稱。
• DeepSeek 的「模型與定價」頁面上新增的一列。
• 一則帶有日期的條目,出現在 API 文件新聞摘要中,採用該實驗室慣用的 newsYYMMDD 格式。
• 是模型識別碼,而非家族名稱——DeepSeek 會為檢查點標上版本號,而至今單純的家族代稱僅代表預覽版。
較近的里程碑是 V4.1 Pro,DeepSeek 團隊成員在 9 月 9 日曾提到它是路由窗口的終點。它既沒有公布規格,也沒有參數數量、價格,甚至沒有日期。從某種意義上說,V4.1 Pro 是對這次洩漏的考驗:如果下一代旗艦大致落在 V4 Pro 的 1.6T 或以下,那麼 3T 的說法至少已經落後了一個世代。
如果你這週要挑選模型,這一切意味著什麼?
在 2026 年,3T 模型不是一個採購決策,而 DeepSeek 九月的實際教訓根本與規模無關。真正的教訓是:端點背後的模型可以改變,而端點的名稱卻保持一模一樣。任何人只要透過抽象層呼叫 deepseek-v4-pro,就能在 9 月 14 日取得一個不同、更小、更便宜的模型,完全不必改動程式碼。任何直接綁定單一供應商對該 ID 實作的人,就只能得到該供應商決定怎麼做的結果。
DeepSeek V4.1 Flash 與 DeepSeek V4 Pro 都在 OrcaRouter 上,透過同一組金鑰、以 0% 加價提供——直接沿用供應商牌價,這表示 DeepSeek 於 9 月 10 日的定價變更,當天就會在此以牌價生效,而不是以某個加價後的版本生效。模型頁面顯示,離峰區間的價格為每百萬輸入 token 0.15 美元、每百萬輸出 token 0.60 美元,這正是 DeepSeek 自家的離峰價格,沒有再往上加任何費用。跨供應商的自動容錯移轉,是那種不起眼、卻在像本週這樣的一週裡最重要的功能:當某家廠商在某個端點底下把模型抽換掉時,路由層正是讓這件事變成設定變更、而不是一次遷移的地方。
如果 3T 的 DeepSeek 模型真的推出,它將由擁有足以容納它的叢集的人來提供服務,價格則由算力決定。你會在同樣的路由層遇見它——不必再簽第二份合約,也不必重建任何東西。

懸而未決的問題,不是 DeepSeek 能否打造出 3 兆參數的模型。三篇已發表的架構論文、一套可運作的記憶體設計,以及一款其開發者聲稱表現超越自家 1.6T 前代模型的 552B 模型,全都顯示這間實驗室知道該怎麼做。問題在於是否有人願意付費讓它提供服務——而從過去兩週的證據來看,DeepSeek 自己也不確定。盯著叢集,而不是參數量。定價頁會比任何外洩消息都更快告訴你,DeepSeek 實際推出了什麼。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
