
DeepSeek V4.1 Flash 基准测试:74.2 证明了什么,又没有证明什么
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 984 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 195 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
DeepSeek V4.1 Flash 在 DeepSWE v1.1 上得分 74.2,比 GPT-6 Astra 高十分之一分,比 Gemini 3.8 Flash 和 Claude Opus 5 高半分,这个数字一整周都被引用为一次改朝换代。值得精确说明它实际上是什么。模型本身并不新——DeepSeek V4.1 Flash 于 2026-09-10 全面可用,也就是六天前——所以这里谈不上是一次发布。真正落在这个窗口内的是测量层:首批独立指数条目、首个独立竞技场结果、三套技术栈上的首日服务支持,以及某家供应商决定让其自家旗舰退役、转而支持这一款。本页汇总了实际已被测量的内容,每个数字都注明了来源,并直白说明目前尚无任何人确立的内容。
DeepSWE 得分,以及与其相差不到半个百分点的四款模型
DeepSWE v1.1 是 Datacurve 推出的长周期软件工程基准测试——涵盖 91 个开源代码库、五种编程语言,共 113 个原创任务,围绕多文件修改与行为正确性构建。在 DeepSeek 自己的模型卡上,厂商报告的表格显示:DeepSeek V4.1 Flash 74.2、Claude Opus 5 74.0、GPT-5.6 Sol 73.0、Kimi K3 67.5、GLM-5.3 66.9、DeepSeek V4-Pro-0813 62.7、DeepSeek V4-Flash 54.4。
同一基准的独立排行榜并未复现这一排序,而这些差异比头条名次本身更重要。Datacurve 的 DeepSWE v1.1 Pass@1 排行榜将 Muse Spark 1.3(FAIR)以 75.40 排在首位,领先于 74.20 的 DeepSeek V4.1 Flash。其后的排名为:GPT-6 Astra 以 74.12(extra high)和 74.10(max),Gemini 3.8 Flash 以 73.83(high),Claude Opus 5 以 73.65(max)。
所以,74.2 是一个真实第三方排行榜上的真实条目,而且它排第二,而非第一。发布当天流传的那个说法——即这是 DeepSWE 上的最先进水平——在承载该分数的排行榜面前站不住脚。Muse Spark 1.3 领先 1.2 分。
现在来说说容易被略过的部分。在这个基准测试中,四个前沿模型彼此相差不到 0.55 分:74.20、74.12、73.83、73.65。这比测量噪声还要窄。DeepSWE 上已公布的运行间波动约为 1.4 到 3.2 分——是整个前四名分差的 3 到 6 倍。领先 GPT-6 Astra 0.2 分算不上什么发现;它不过是平局保留两位小数时的样子。
脚手架敏感性是不宜把该数字看得太死的第二个原因,而在这里,厂商自己的文档就提供了证据。DeepSeek 在同一批发布材料中报告了 DeepSWE 在八个脚手架上的表现。74.2 是在 mini-SWE 上取得的。同一个模型在 DSH Minimal 上得分 72.6,在 DSH Standard 上为 70.5,在 Claude Code 上为 69.8,在 DSH PTC 上为 67.6,在 Pi 上为 66.2,在 Codex 上为 65.6,在 OpenCode 上为 65.5。同一个模型、同一个基准上相差 8.7 分,完全是由包裹它的测试框架造成的。任何人若把在 mini-SWE 上产生的 DeepSeek 数字与竞争对手在不同智能体循环中产生的数字相比较,比较的都是脚手架,而不是模型。
独立指数实际将其置于何处
Artificial Analysis 在已声明的 effort 设置下运行一套固定测试套件,这使其 Intelligence Index 成为现有最干净的外部检验。在 DeepSeek V4.1 Flash 的模型页面上,在推理 max effort 下,该指数读数为 40——在该类别 113 个模型中排名第 6,而该类别的中位数为 18。闭源竞争对手则位居其上方:Claude Opus 5(max)51、GPT-5.6 Sol(max)47、GLM-5.3(max)45、Kimi K3(max)44、Gemini 3.8 Flash(high)41。DeepSeek 自己此前的旗舰 V4-Pro-0813 则以 36 位居其下方。
并排看这两个记分板,分歧是结构性的,而不是错误。在 DeepSeek 选定的基准上,搭配合适的脚手架,该模型与前沿水平持平。而在一个固定的外部测试套件上,对推理、编码、数学和智能体任务取平均后,它比 Claude Opus 5 落后 11 分,比 Gemini 3.8 Flash 落后 1 分。两者都可能是真的。厂商表格是一种论证;指数是平均值。
索引页上还有两个对路由决策至关重要、却很少登上头条的数据。DeepSeek V4.1 Flash 在最大努力下以每秒 214.4 个输出 token 运行——很快。它完成 Intelligence Index 时还生成了 2.5 亿个输出 token,而中位数为 1.4 亿,Artificial Analysis 指出这明显偏啰嗦。啰嗦不是质量问题;它是一笔账单。一个思考所用的 token 比同类多出 79% 的模型,会在每一次长时间推理调用中交还一部分价格优势。

ProgramBench:单模型得分与多智能体得分并非同一种测量
这是最容易被误读的数字,因此值得仔细区分。
• 单模型,标准配置——根据 DeepSeek 自己的模型卡,DeepSeek V4.1 Flash 在 ProgramBench (Almost@1) 上得分为 20.3。这低于 GPT-5.6 Sol 的 23.0,且远低于 Claude Opus 5 的 37.0,仅略高于 GLM-5.3 的 19.0 和 Kimi K3 的 17.5。厂商报告,且并未美化该模型。
• 多智能体团队配置——DeepSeek 的技术报告,DeepSeek-V4.1-Flash:突破 KV 缓存压缩的极限,描述了一种初步的 Agent Swarm RL 方案:由一个主智能体通过共享任务板协调队友。在一个高置信度的 172 项任务 ProgramBench 子集上——即参考解决方案通过率达到 95% 或更高的任务——多智能体配置从一小时截止时间下的 13.59% 攀升至八小时下的 30.04% 峰值,而单智能体基线则从 12.79% 提升至 20.39%。
30.04% 是“30%”这一说法的来源,而且它并不是单模型得分。它是一组智能体获得八小时时间、在筛选后的子集上测得的结果,出自厂商自己的初步评估。它引发的对比——“远高于单个 Sol,几乎是 Kimi K3 的两倍”——在与 Sol 的 23.0 和 K3 的 17.5 相比时在算术上说得通,同时它也是多智能体配置与单模型基线之间、在不同任务集上进行的对比。同一份报告还展示了在 FrontierSWE v2 上的效果:多智能体在二十小时时达到 32.90%,而单智能体为 28.20%。这一差距是真实存在的,随着截止时间延长它会缩小,而取得它所付出的 token 成本并不小——一份实测报告称 token 用量超过 10 倍,运行时间接近四小时。
参数数量尚未确定,因此请将每一次规模比较都视为暂定的。
DeepSeek 的发布说明描述了一个“552B 参数的 MoE”。这是厂商给出的数字,也是大多数报道所复述的内容。但它同样不是该产物的全貌。
DeepSeek 自己的模型卡记录了与 transformer 主干并存的第二个组件:“Engram 条件记忆(196B 参数,通过基于 token 的查找稀疏访问)。”把两者相加,就得到 748B。这就是发布后数小时内在 r/LocalLLaMA 上流传的社区解读背后的算术,而模型卡自己的 safetensors 索引在其张量类型中列出了 763B 参数。大约 510 GB FP8 这个数字来自同一系列的分析:你实际下载并保存在内存中的内容。
调和之处在于,这些数字统计的是不同的东西。552B 是计算主干——一个 token 流经的参数。196B 是在特定层被查询的查找表,它返回存储的信息,而不是在其之上进行计算。8B 和 16B 是 DeepSeek 引用的激活值,分别是在预填充(prefill)和解码(decode)期间活跃的每 token 切片。这四个数字描述的是同一个模型。
这一切都不能让这种比较变得可靠。所有“该模型以一小部分规模比肩前沿模型”之类的说法,都依托于厂商的宣传标题,而这种标题把该产物五分之一的成分排除在外。除非有人公布可复现的参数核算,否则基于规模的论证就应当在行文中直接带上这一限定。
ARC-AGI:该模型暂无结果
DeepSeek V4.1 Flash 没有 ARC-AGI-2 或 ARC-AGI-1 得分。ARC Prize 的已验证结果页面没有该检查点的条目,DeepSeek 自己的基准表中也没有 ARC 行。ARC Prize 唯一验证过的 DeepSeek 结果是较旧的 V4 Flash 0731 检查点——在最大推理努力下,ARC-AGI-2 半私有集上为 61.4%,ARC-AGI-1 上为 89.0%,每任务分别为 0.04 美元和 0.02 美元。那是前代模型在不同模型上的数字,把它们当作 V4.1 Flash 的结果引用是错误的。如果 ARC-AGI 对你的评估很重要,那么该模型目前尚未评分。
还有什么落在了窗口内?
对于一个正在决定是否要尝试这个模型的读者来说,有三件事发生了变化,而它们中没有任何一件是该模型自身的发布。
• 独立竞技场的测评结果。OpenDesign Arena 让十三款模型执行完全相同的设计任务——网页应用、仪表盘、移动端界面、落地页。DeepSeek V4.1 Flash 得分 81.2(满分 100),GPT-6 Astra 为 82.7;每份成品设计的成本为 0.023 美元对 1.61 美元,完成时间为 5.3 分钟对 11.1 分钟。交付率——即无需修改即可直接使用的输出占比——为 57.7%,Astra 为 60%。这是对该模型首批真正独立的测评之一,而且它专门衡量设计产出,而非通用推理或编程能力。
• 三套技术栈上的 Day-0 服务支持。vLLM 发布了 Day-0 镜像(2026-09-09),已在 NVIDIA 和 AMD 硬件上验证。SGLang 和 Miles 于 2026-09-10 发布了 Day-0 推理与 RL 支持,其中包括一条 Engram 主机卸载路径,在 4x GB300 上将 KV 缓存容量提升了 36%;以及一项有界重放优化,在 8x H200 上将 prefill 吞吐量提升了 1.56 倍。Cambricon 同日宣布在 vLLM 技术栈上完成 Day-0 适配。对于一个以激进 KV 缓存压缩为卖点的模型——HBM 占用仅为上一代的四分之一,SSD 占用仅为八分之一——从第一天起就能在标准技术栈上运行,是实验室成果与可部署成果之间的区别。
• 该厂商已让自家旗舰模型退役。 DeepSeek 正在逐步淘汰 V4-Pro。自 2026-09-14 04:00 UTC 起,任何指定“deepseek-v4-pro”的请求都将路由至 V4.1 Flash,并按 Flash 的价格计费,此状态将持续到 V4.1 Pro 发布为止。DeepSeek V4.1 Pro 尚未发布——它是一个未来的模型,而这一重定向只是权宜之计,用以避免已固定版本的集成出现故障。同样退役的还有:“deepseek-v4-flash”和“deepseek-v4-flash-vision-exp”,出于兼容性考虑,二者均暂时路由至 V4.1 Flash。如果你在生产环境中固定了某个模型 ID,那么这个重定向就是本页中你唯一不可忽视的运维事实。
价格对决策的影响
定价才是这个模型不再只是一个基准测试故事的关键所在。根据 DeepSeek 自己公布的费率,自 2026-09-10 04:00 UTC 起生效,其中高峰时段定义为工作日的 01:00–04:00 和 06:00–10:00 UTC,其他所有时段均为非高峰时段。
• 非高峰时段,每百万 token — 缓存命中 $0.003,缓存未命中 $0.15,输出 $0.60。
• 峰值,每百万词元 — 缓存命中 $0.006,缓存未命中 $0.30,输出 $1.20。
• 缓存输入,与前沿闭源模型相比——每百万 token 三十分之一美分,而后者约为五十美分。对于在同一代码库上反复循环的智能体而言,这一档承担了大部分 token。
• 基于我们自有目录实测——每百万输入 $0.15、输出 $0.60,首 token 中位耗时 784 毫秒,过去七天每秒 211 个 token。
Artificial Analysis 将同一模型列为输入 $0.30、输出 $1.20,缓存折扣 98%,混合价格为每百万 $0.18——那是峰值档位,而这两个数字不过是同一价格在一天中不同时段的表现。在比较各家供应商之前,这一点值得内化:采用双档时钟计价的模型,无法用单一标价来衡量。
这也是为什么在这里,按原价透传的定价方式比平时更为重要。OrcaRouter 将 DeepSeek V4.1 Flash 与其目录中的其他模型一同纳入路由,以0% 的加价——即供应商标价原封不动,因此 DeepSeek 的高峰与低谷时段价格会与 DeepSeek 公布的一样,原样抵达我们这一侧,而供应商调价当天即生效。对于一个每个工作日早晨费率翻倍、持续四小时的模型来说,把时段分层抹平的平台,恰恰藏起了你唯一需要的那个数字。


没有人确立过的事情
这段叙述中的缺口并非缺少基准测试。而是:在共享测试框架上,由与结果无利益关联的人运行,DeepSeek V4.1 Flash 与其具名竞争对手之间不存在可信的直接对比。本页上的每个数字都属于以下三种之一:厂商报告、由第三方在不同配置下产生,或是在一个并非为单独评估这一对决而设计的固定测试套件上的平均值。没有任何一次运行是在相同任务、相同脚手架、相同推理努力设置下对 DeepSeek V4.1 Flash 和 GPT-6 Astra 进行评估,并公布方差。
有三件具体的事会改变局面,而它们如今无一存在。
• 在受控脚手架条件下的 DeepSWE 对比。在 DeepSeek 自家各脚手架之间 8.7 个百分点的差距,大于排行榜前四名模型之间的任何差距。在前沿模型尚未在同一套测试框架上完成评测之前,那张表顶部的排序并不具有实际意义。
• 对 ProgramBench 智能体团队结果的独立复现。30.04% 这一数字来自厂商的技术报告,其基于经过筛选的 172 项任务子集,且处于初步配置阶段,其 token 成本尚未针对生产预算进行过刻画评估。
• ARC-AGI。该检查点目前完全没有分数。
实际影响是一个比标题所支持的更窄的结论。DeepSeek V4.1 Flash 在一个长时程编程基准上,其实测表现与前沿水平的差距落在噪声范围内;在独立设计任务上以约 1.4% 的成本真正具备竞争力;而在综合指数上大约落后十个百分点。这足以证明值得让它在你的实际工作负载上跑一跑,并让你的评估来回答这个问题。但不足以凭借 0.2 个百分点就去重写生产环境的路由表——而这两句话同时成立,正是全部发现所在。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
