
DeepSeek 的 3T 模型:规模扩展需等待集群就绪
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
9月14日,DeepSeek 将停用 DeepSeek V4 Pro——这款于8月13日全面上线的1.6万亿参数旗舰模型——并对所有发往 deepseek-v4-pro的调用以DeepSeek V4.1 Flash来回应;后者是其在9月10日发布的5520亿参数模型。就在这一切换宣布的四天前,一位匿名 DeepSeek 观察者发帖提出了相反方向的尖锐说法:该实验室一直在研发一款3万亿参数模型,“可能是另一个 1T 参数的 Engram”,而其尚未发布的原因是经济考量,而非能力不足。
关于那个模型,没有任何一点得到确认。没有名称,没有代码仓库,没有配置文件,没有基准测试,没有发布窗口——只有一条 X 帖子,来源号称是“可靠权威”,而它唯一最有趣的细节,还被原作者明确标注为推测。把它当作一个信号,而不是一个事实。不过它仍然值得一读,因为这一说法的两半彼此拉扯、方向相反,而其中只有一半有可能在与 DeepSeek 自己的路线图接触后依然成立。
泄密事件实际说明了什么,又没有说明什么
这篇帖子来自账号 teortaxesTex,他是一位长期关注 DeepSeek 的观察者,自称自 2023 年起就是这家实验室的粉丝。全文如下:“其实我有可靠消息来源,DeepSeek 当时正在做一个 3T 模型(主干,可能又是 1T 参数的 Engram,不过这只是我的猜测)。他们只是不确定对它进行后训练并提供服务是否划算。等他们的集群规模扩大,我们就会看到一些……”
那两句话中有四件事有分量,其中一件根本不是事实。“可靠来源”未具名。参数数量以单一数字出现,没有区分总量和活跃量。关于Engram的题外话被推测者本人标注为推测。而“当它们的集群增长时”是一个没有附加日期的条件句。
• 正在被主张的是什么——即一个拥有 3 万亿参数的 DeepSeek 模型正处于某种开发阶段。
• 明确属于作者本人猜测的是——其中大约1T是Engram记忆。
• 未知的是什么——它的名称、架构、活跃参数数量、上下文窗口、训练状态,以及它是否作为产品发布。
• 目前可以核实的内容——没有。没有任何 DeepSeek 仓库、模型卡、定价条目或文档条目提及它。
连算术都是含糊的。"3T模型(backbone,大概另有1T参数的Engram)"支持两种解读:要么是3T模型中约1T为Engram,要么是3T骨干加1T Engram,合计约4T。这中间一万亿参数的差距,对推理服务账单的影响超过多数实验室跑一次训练的开销。
同样值得记住的是,这个账号的过往记录好坏参半,远非神谕级权威。他把 DeepSeek 9 月 9 日关于重新路由 V4 Pro 流量的通知,解读为该实验室已“解决 V4 系列架构问题”的证据——这是个合理推断,但终究仍是推断。9 月初,他还提出过一种猜测:某第三方编程平台上的匿名隐身模型是 Xiaomi 的 MiMo-V3-Flash,这一点无人证实。是有用的早期信号;但并非权威信源。
有趣的部分是内存表,而不是参数数量。
Engram 是真实存在的,而这正是 3T 这一说法比乍听起来更可信的原因。DeepSeek 于 2026 年 1 月发布了条件记忆架构,并附带了开源代码,而它做了一件不同寻常的事:将静态知识检索与动态推理分开。模型不再把 GPU 算力花在回忆事实上,而是将其上下文哈希到存放在 DRAM 中的嵌入表里,并以常数时间完成检索,查找路径中没有任何 GPU 工作;此外还有一个门控机制,当检索到的记忆与周围上下文冲突时,会将其抑制。
DeepSeek 为其自有测试配置所报告的数据才是应该记住的:一个 1000 亿参数的嵌入表被卸载到 DRAM,吞吐量损失低于 3%;在 100 万 token 下,“大海捞针”准确率为 97%,而标准注意力为 84.2%。这些是该实验室自己的数字,并非由我们复现。据报道,独立早期评估在同一上下文长度下落在 93–96% 区间——明显高于基线,但低于其宣称值。
把这个想法放大十倍,泄露的形态就会改变。如果一个3T模型的大部分额外参数是驻留在DRAM中的哈希表内存,而不是争夺HBM的专家,那么“3T”就不再是“无法服务”的代名词。总参数量与服务成本就此脱钩。这才是这次泄露中真正新颖的想法,也是已发表研究实际支持的部分。
需要提醒的是,Engram 论文据称并未涉及推理时的开销——延迟和吞吐量——而这恰恰是常驻 DRAM 的查找表如果要显现就最可能显现的地方。需要去获取的内存,并非免费获得的内存。

为什么 DeepSeek 自家的 September 却持相反观点
反对即将推出 3T 产品的论据是,DeepSeek 刚刚在 1.6T 上做了这个实验,并用更小的东西回答了自己的问题。V4 目前的阶梯如下:
• DeepSeek-V4-Flash-0731 — 总参数量284B,每个token激活13B。
• DeepSeek-V4-Pro-0813 — 总计1.6T参数,激活49B参数,采用MIT许可证开放权重。
• DeepSeek V4.1 Flash — 基于因果编码器-解码器设计的552B骨干网络,在预填充阶段每个token激活8B参数,在解码阶段激活16B参数。
北京时间9月14日中午,中间档位登场。DeepSeek 将 V4 Pro 下线,并将针对 deepseek-v4-pro 的请求路由到 V4.1 Flash,按 Flash 费率计费,直到 V4.1 Pro 问世。官方定价页面今天列出两行,而按规模来看,二者都不是已退役模型的继任者:deepseek-flash 在高峰期每百万输入 token 为 $0.30、每百万输出为 $1.20,deepseek-v4-pro 为 $1.32 和 $3.96,非高峰费率为上述数字的一半。两者都列出 1M token 上下文窗口和 384,000 token 输出上限。
趋势已十分明显。一家实验室弃用其最大的模型,转而采用每个token激活参数量仅为前者十分之一的模型,这已然表明它得出结论:前沿能力的经济单位并非它能训练出的最大检查点。一个3T模型,其构建者不确定能否"经济地完成后训练并投入服务"——这并非关于犹豫的传闻;它所描述的是一家如今已掌握替代方案实测数据的实验室。
后训练是那个问题更尖锐的一半。DeepSeek-V4-Pro 系列在华为 CloudMatrix384 SuperPOD 上的全参数后训练,已被第三方 SLAI T-Rex 项目报告为 34.22% MFU,约为开放基线方案的 2.93 倍。这是一个令人鼓舞的数字——一个第三方数字,跑在 1.6T 模型上。骨干加倍,成本也大致翻倍,而这一切发生在一个 token 都还没被提供之前。

当它们的集群增长时
泄露文件里真正承重的那一条是最后一条,因为它是唯一有公开书面记录可循的部分。据报道,DeepSeek 计划在内蒙古乌兰察布新建的数据中心部署至少 16 万块华为 Ascend 950DT 加速器,订单价值约 25.6 亿美元——这是迄今有人尝试过的最大的中国产 AI 芯片集群之一。
该计划附带的这些限制条件,比新闻标题本身更重要。这些芯片计划用于推理,而非训练:DeepSeek 此前曾尝试在华为芯片上训练,但目前仍在英伟达加速器上训练,而这正是 3T 模型实际需要的环节。交付可能需要一年多。预计部分产能将在 2027 年底至 2028 年初上线。而且,预计制约华为今年能生产多少颗 950DT 的,将是高带宽内存供应,而非逻辑芯片。
因此,对“当它们的集群增长时”的乐观解读意味着,3T模型最早要到2027—2028年才会出现;而悲观解读——即它仍是一个研究产物、永远不会成为产品——与DeepSeek在2026年交付的一切都相符。实验室周边的算力环境同样是一个有争议的政策问题,而非纯粹的供应问题:9月8日至9日,美国国家安全局、联邦调查局和网络安全与基础设施安全局联合指控包括DeepSeek在内的六家中国实验室以“工业规模”蒸馏美国前沿模型,中国商务部驳斥了这一指控。无论人们如何看待这一指控,一个依赖集群增长的发布都取决于DeepSeek内部无人能控制的决定。
什么能把这件事从泄露变成发布
这份清单简短而具体,但其中任何一项都尚未触发:
• Hugging Face 上 deepseek-ai 组织下的一个仓库,使用带版本号的检查点名称,而不是家族标识符。
• DeepSeek“模型与定价”页面上新增了一行。
• 实验室API文档新闻源上的一条带日期条目,采用实验室常用的newsYYMMDD格式。
• 一个模型标识符,而不是家族名称——DeepSeek 的各个版本对应的是检查点,而仅凭一个家族简称,迄今为止都只意味着预览版。
更近的里程碑是 DeepSeek 的 V4.1 Pro,一名团队成员曾在 9 月 9 日将其称为路由窗口的终点。它同样没有公开的规格,没有参数量,没有价格,也没有日期。从某种意义上说,V4.1 Pro 是对这次泄露的检验:如果下一代旗舰大致落在 V4 Pro 的 1.6T 或更低,那么 3T 的说法至少已经延后了一代。
如果你本周要选择一款模型,这一切意味着什么
在2026年,3T模型已不再是一项采购决策,而DeepSeek九月的实际教训也根本无关规模。真正的教训在于:端点背后的模型可以发生变化,而端点的名称却保持不变。任何通过抽象层调用 deepseek-v4-pro 的人,都会在9月14日拿到一个不同、更小、更便宜的模型,而无需改动自己的代码。而任何直接对接单一提供商对该ID实现的人,只能得到该提供商决定给出的东西。
DeepSeek V4.1 Flash 和 DeepSeek V4 Pro 都在 OrcaRouter 上,使用同一个密钥,0% 加价——按供应商标价原样透传,这意味着 DeepSeek 9 月 10 日的价格调整当天就在这里以标价生效,而不是以某种加价后的版本生效。模型页面显示,在非高峰时段,每百万输入 token 为 $0.15,每百万输出 token 为 $0.60,这就是 DeepSeek 自己的非高峰价格,没有任何附加费用。跨供应商的自动故障转移是那种不起眼、但在像本周这样的时期最重要的功能:当某个供应商在某个端点底下把模型换掉时,正是路由层让这件事变成一次配置更改,而不是一次迁移。
如果 3T DeepSeek 模型真有朝一日发布,它将由那些拥有足以承载它的集群的一方来提供服务,价格由算力决定。你会在同一个路由层遇到它——无需第二份合同,也无需重建任何东西。

悬而未决的问题不是 DeepSeek 能否构建一个 3 万亿参数的模型。三篇已发表的架构论文、一套可用的记忆设计,以及一款其制造商称性能超过自家 1.6T 前代的 552B 模型,都表明该实验室知道该怎么做。问题在于是否有人愿意付费来提供它的服务——而从过去两周的证据来看,DeepSeek 自己也不确定。关注集群,而不是参数数量。定价页面会比任何泄露都更快告诉你 DeepSeek 实际推出了什么。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
