主视觉标题卡上写着 DeepSeek V4.1 Flash in OpenCode,上方一行上划线文字为 Coding-agent playbook - September 2026,副标题介绍今天已验证的三项集成,以及那个决定它能否跑完的 effort 旋钮;另有四个标签,分别写着 OpenCode Go 每月 $10、非高峰 $0.15 / $0.60 每 100 万、effort 预设低 50、高 75、最大 100,以及 AA Intelligence Index 40;页脚注明这些 effort 预设来自社区反馈。
Guides & Insights

OpenCode 中的 DeepSeek V4.1 Flash:配置、成本,以及无人提及的努力程度旋钮

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

DeepSeek V4.1 Flash 自 9 月 10 日起就一直待在 OpenCode Go 中,而 OpenCode 为其附加的倍率有一个已公布的结束日期:9 月 20 日。距今只剩四天。有意思的地方不在于这个截止日期——而在于那个决定这个模型用起来写代码是否顺手的设置,在搜索结果首页的每一份配置指南里都找不到,并且在至少两个测试框架中被悄悄丢弃。这是一份把编程代理指向 DeepSeek V4.1 Flash 的实战指南:确切的模型 ID、今天验证过的三种集成方式、社区反馈的推理投入控制,以及过度思考的失败模式及其真正有效的缓解措施。

你实际上将你的智能体指向的目标

DeepSeek V4.1 Flash 于 2026-09-10 发布——DeepSeek 自家 API 文档中的发布说明标注的就是那一天,而且它是该厂商新架构家族中体量最小的模型。DeepSeek 称其采用 552B 参数的混合专家骨干,基于它所称的 Causal Encoder–Decoder 设计构建,在预填充阶段每个 token 激活约 8B 参数,在解码阶段激活 16B。它以文本和图像为输入并返回文本,提供最高一百万个 token 的上下文窗口,并会在单次响应中最多生成 384,000 个 token——上下文和输出上限均来自 OrcaRouter 自己关于该模型的模型页面,该页面分别列出 1,048,576 和 384,000。

厂商基准测试,来自 DeepSeek 发布页面上的图表,因此属于厂商自行报告、未经审计:Terminal-Bench 3.0 上为 30.0,DeepSWE v1.1 上为 74.2,CyberGym 上为 88.1,Automation-Bench 上为 54.8,GPQA Diamond 上为 90.9。独立评分较少,但确实存在——今日直接查阅 Artificial Analysis,其将 DeepSeek V4.1 Flash 在其 Intelligence Index 上评为 40 分,在其比较类别中 113 个模型里排名第 6。同一页面中有一句话,对编码智能体读者而言比排名更重要:Artificial Analysis 将该模型标注为 极为冗长,其完成 Intelligence Index 运行消耗了 250M 输出 token,而中位数为 140M。我们稍后会回到这一点。

两个命名事实可以节省真正的调试时间。DeepSeek 的规范 API 模型 id 现在是 code>deepseek-flash/code>。较旧的字符串 code>deepseek-v4-flash/code> 和 code>deepseek-v4-flash-vision-exp/code> 仍然会被接受,但它们背后的模型已经退役,请求由 V4.1 Flash 以 Flash 价格提供服务。另外,DeepSeek V4 Pro 并未消失:DeepSeek 的文档说明,V4 Pro API 服务在 2026-09-14 之后继续提供,计费不变。如果有人告诉你旗舰服务已关闭,那并不是供应商自己的文档所说的。

Single-column scoreboard titled DeepSeek V4.1 Flash in coding agents, with six rows reading Released 2026-09-10, Context window 1,048,576, Max output 384,000, Price per 1M $0.15 / $0.60 off-peak, Peak price per 1M $0.30 / $1.20, and AA Intelligence Index 40, #6 of 113, over a footer citing DeepSeek and OpenCode Go documentation for price and limits and Artificial Analysis for the index.

OpenCode:两种进入方式,以及实际要输入的 id

将 DeepSeek V4.1 Flash 接入 OpenCode 有两种方式,它们的经济账各不相同。

订阅方案是 OpenCode Go,每月 10 美元,OpenCode 称其为一组经过测试与基准评测的精选开源编程模型。设置只需四步,且无需手动编辑任何配置文件:登录 OpenCode Zen、订阅 Go、复制 API 密钥,然后运行 code>/connect/code>,在 TUI 中选择 OpenCode Go,并粘贴密钥。之后 code>/models/code> 会列出可用的模型。配置中的模型引用形式为 code>opencode-go/<model-id>/code>。

哪个模型 ID?两个都是。Go 网关自身的模型列表,今天从 code>https://opencode.ai/zen/go/v1/models/code> 获取,返回了 code>deepseek-flash/code> 和 code>deepseek-v4.1-flash/code> 这两个不同的条目,同时还包含旧版的 code>deepseek-v4-flash/code> 和 code>deepseek-v4-pro/code>。前两个中任意一个都能解析到你想要的模型;code>deepseek-flash/code> 是规范名称,对于任何你打算持续运行的东西来说都是更稳妥的选择。

直接路线完全跳过订阅:运行 code>/connect/code>,搜索 DeepSeek,然后粘贴一个 DeepSeek 平台密钥。此后由 DeepSeek 按标价向你计费,而不再从 Go 额度中支取。DeepSeek 公布的标价为非高峰时段每 100 万输入 token 0.15 美元、每 100 万输出 token 0.60 美元,缓存读取为每 100 万 0.003 美元——而高峰时段的价格正好翻倍。今日查阅的 OpenCode Go 文档和 OrcaRouter 的模型页面在这些数字上完全一致。

OpenCode Go 增加的是额度结构,而这里的数字值得仔细阅读,因为它们正是截止日期至关重要的原因。OpenCode 自己的文档列出了 DeepSeek V4.1 Flash,每月限额为 15 美元,目前在一项被 OpenCode 标注为“9 月 20 日结束”的促销活动中以 4 倍放大至 60 美元。预估请求次数分两列公布:按标准费率计算为每 5 小时 6,500 次 / 每周 16,250 次 / 每月 32,500 次,而在应用 4 倍乘数后则为 26,000 / 65,000 / 130,000。各模型的额度结构是一致的——5 小时限额是月度数字的 20%,每周限额是 50%,而月度限额就是全部。

那些是 OpenCode 公布的数字,是今天从其 Go 文档中读取的。促销活动该由他们来结束,而且它注明了日期。

Screenshot of the OpenCode Go documentation pricing table showing the DeepSeek V4.1 Flash off-peak row at $0.15 input, $0.60 output and $0.003 cached read per 1M tokens with a monthly limit of $15 raised to $60 under a 4x promotion ending Sep 20, the DeepSeek V4.1 Flash peak row at $0.30 input, $1.20 output and $0.006 cached read with the same $15 to $60 limit, and a footnote stating peak hours are 01:00-04:00 and 06:00-10:00 UTC Monday through Friday with all other hours including weekends off-peak.

Command Code:仍在运行,还有一份值得了解的缺陷报告

Command Code 自己的目录至今仍列出该模型,ID 为code>deepseek-v4-1-flash/code>,具有 1M token 上下文窗口和相同的转嫁定价:非高峰时段 $0.15 / $0.60,高峰时段 $0.30 / $1.20,缓存读取 $0.003。两个独立测试框架中价格一致并非巧合——两者都是在转售 DeepSeek 的标价,而不是自行定价。

机制很直接。用code>npm i -g command-code/code>安装,在项目目录中运行它,用code>/login/code>进行身份验证,如果想接入自己的提供商密钥,就用code>/connect/code>。code>/model <id>/code>会直接应用模型更改,而单独输入code>/model/code>会打开选择器,code>/effort/code>则为当前模型设置推理强度——这是这里最关键的一个标志。

在调试错误的层之前,有一份社区 bug 报告值得你先记在心里。一个针对第三方路由层的未关闭 issue 描述了一个推理重放缓存,它从未对以下 id 生效:code>command-code/deepseek-v4.1-flash/code>,因为路由层所匹配的模式期望的是 code>v4./code> 或 code>v4-/code> 片段,而该字符串是 code>v4.1/code>。报告的症状是上游 400 错误,抱怨在思考模式下产生的推理内容必须回传给 API。那是一份关于客户端匹配器的社区 bug 报告,不是厂商指导,也不是模型的问题——但它恰恰就是那种在凌晨两点看起来像模型故障的事情。

Claude Code、Codex,以及 OpenCode 自身已验证的客户端

OpenCode Go 并非只支持 OpenCode,其文档也明确说明了这一点:它专为 OpenCode 以及会产生类似请求模式的其他编程智能体而设计,并公布了一份经验证可用的客户端列表。该列表目前包含 Hermes、Claude Code、Codex、ZCode 和 Pi——而对 Claude Code 的说明是,它“能识别其原生会话标头,无需自定义标头包装层”。随之而来有两项要求:用你自己的用户代理来标识客户端,而不是使用通用的 SDK 名称;以及在每次对话时,在 code>x-opencode-session/code> 标头中发送一个稳定的会话标识符,这正是让他们的路由和提示缓存得以正常运作的关键。对 Hermes 而言,经过验证的构建版本很重要——标头修复是在 v0.21.0 之后才合并的,因此仅那个发行版并不包含该修复。

还有一条完全不附带订阅的路由,直接使用 DeepSeek 的 Anthropic 兼容端点。将 code>ANTHROPIC_BASE_URL/code> 设置为 code>https://api.deepseek.com/anthropic/code>,code>ANTHROPIC_AUTH_TOKEN/code> 设置为你的 DeepSeek 密钥,并将模型变量指向该模型。Claude 模型名称在传入时会被重新映射:任何以 code>claude-opus/code> 开头的都会转到 DeepSeek V4 Pro,并按 V4 Pro 的价格计费,而 code>claude-sonnet/code> 和 code>claude-haiku/code> 名称会转到 Flash 模型。模型字符串上的 code>[1m]/code> 后缀表示请求百万 token 上下文变体。DeepSeek 自己的此设置指南还会设置 code>CLAUDE_CODE_EFFORT_LEVEL=max/code> 并将自动压缩窗口固定为 786432 个 token。

最后一个变量正是社区修复方案所在之处。之所以存在一个变通代理,是因为近期的 Claude Code 构建会发送 code>thinking: {"type": "disabled"}/code>,用于子代理请求,而 code>CLAUDE_CODE_EFFORT_LEVEL=max/code> 会添加一个推理工作量参数,DeepSeek 的 Anthropic 格式端点会拒绝这一组合,并提示:在设置了推理工作量时,thinking 选项无法禁用。所报告的变通方案范围很窄——仅从子代理请求中剔除该工作量参数,主代理保持不变。请将其视为关于客户端与服务器契约不匹配的社区发现,并预期确切的版本边界还会变动。

努力程度调节盘:1–100,以及为什么“低”意味着 50

本节中的所有内容都是社区发现,而不是厂商指南。DeepSeek 并未发布我们可以核实的预设到数值映射,下面这些数字来自从业者的文章和第三方测试工具文档。它们在各个来源之间足够一致,因此很有用;又足够未经证实,因此你应该在自己的工作中测试它们。

DeepSeek V4.1 Flash 使用从 1 到 100 的连续推理努力标量进行训练。它不是 token 上限——它决定的是模型在训练过程所学到的曲线上所处的位置:较低的努力会施加更大压力以保持简洁,而较高的努力则使额外推理变得更便宜。三个公开预设映射到该尺度上:

• Low — 50,最短的路径,也是让该控件以廉价著称的预设。

• 高 —— 75,也是大多数社区来源所描述的智能体工作的理智上限。

• Max — 100,其中对推理长度的惩罚已完全移除。

这个旋钮所带来的收益是真实的,但急剧递减。一项社区基准测试扫掠报告称,将投入力度从 25 提高到 100,使 Terminal-Bench 2.1 的得分从 82.4 提升到 90.6,而整体输出 token 数大约增加了 2.5 倍。多项报告一致表明,投入力度在 60 到 80 之间时,能以不到一半的 token 预算获得大部分可用的准确率,而设为最大则会使智能体轨迹进一步增加 1.6–1.8 倍,换来的却只是微乎其微的收益。

默认值是各方无法达成一致的部分。一些测试框架文档和从业者报告称,未设置的 effort 会解析为 high;另一些人则将服务器默认值描述为完全未知。有明确记录而非存在争议的是,有两个测试框架集成被发现根本没有发送该参数——OpenCode Go 提供商配置文件和原生 DeepSeek 配置文件都跳过了发出 code>reasoning_effort/code>,针对 code>deepseek-flash/code> slug,因为它们的匹配守卫期望一个 code>deepseek-v…/code> 前缀,而规范 id 并没有该前缀。在这两种情况下,用户选择的设置都被提供商默认值静默替换了。如果你的客户端显示了 effort 控件,那并不能证明它真的在网络传输中。记录一次请求体然后看看。

来自同一批报告的又一件怪事:OpenCode Go 端点接受 code>low/code>、code>medium/code>、code>high/code> 和 code>max/code>,但拒绝整数形式的 effort——有报告称,值为 80 会返回 HTTP 400。模型中存在 1–100 的调节刻度,但它并非在所有地方都以原始数字形式暴露,因此“将 effort 设为 65”在你的客户端中可能无法表达。

过度思考的失效模式,以及真正能解决它的方法

这是一种失效模式,它决定你是否还会把这个模型留在你的循环中。社区报告描述了 DeepSeek V4.1 Flash 在任务完成后仍继续推理:反复争论一个它已经正确回答过的点,叙述自己纠正错误假设的过程,并生成信息密度低的长推理链。一位实践者报告称,在一次编码 CLI 会话中,推理输出持续了一个多小时。另一位则报告称,完全无法让它完成一次长时间基准测试运行。

关于第二份报告的溯源说明,因为这类说法很容易被洗白。它来自一个关于稳定运行该模型的社区帖子,而 Reddit 屏蔽了我们的抓取器,所以我们无法直接阅读该帖子——我们是在转述这份报告,而不是引用我们打开过的页面。我们能够独立核实的是问题的整体形态,而在这一点上,外部证据异常清晰:Artificial Analysis 在其自己的页面上指出,该模型非常啰嗦,完成一次运行消耗了 2.5 亿个输出 token,而其对比模型中的中位模型只需 1.4 亿就能完成。按第三方在固定任务集上的测量,这大约是 1.8 倍。论坛报告与这个独立指标描述的是同一种行为。

那些报告中得出的缓解措施,全部来自社区:

• 将 effort 固定在 high 或更低,并且不允许它逐步上调。在实际环境中见过的最明确的修复方案,是一个专门用来阻止 effort 升级的路由插件:轮次深度对升级评分毫无贡献,只有失败的工具结果或完全相同的重试才计入,升级设有上限,而 max 需要显式启用,且默认被降级。如果你的运行框架允许 agent 在运行时间变长时自行提高 effort,那就是应当关闭的机制。

• 不要将 max 作为默认设置。多位实践者反馈,max 在常规工作中会反复空转而非收敛,切回 high 即可解决。

• 限制 code>max_tokens/code> 在交互路径上的使用。384,000 个 token 的输出上限是一个限制,而非目标;而在该上限下,一个无法终止的循环代价高昂。

• 确认该参数确实被发送了。既然发现有两个测试框架会静默丢弃它,“我把它设成了 high”和“high 到达了 API”是两种不同的说法。

• 框架(harness)的影响比你预想的要大。运行相同权重的实践者报告说,在不同的外壳下模型行为差异极大——同一个模型,在一种框架里会自相矛盾、把信号淹没掉,换到另一种框架里却完全没有这些抱怨。这是社区对框架行为的观察,而非厂商对模型的说法,但它是这些报告中重复次数最多的一条建议。

按这些费率,一个编码循环实际要花多少钱

DeepSeek 的标价是非高峰时段每 100 万输入 token 0.15 美元、每 100 万输出 token 0.60 美元——输出价格是输入的四倍,这是了解一个既能生成推理又能生成代码的智能体时首先要记住的一点。

拿一个现实的智能体回合来说:输入 60,000 个 token 的上下文(系统提示词、工具 schema、仓库片段、对话历史),输出 3,000 个 token 的推理外加一个补丁。也就是 60,000 × $0.15/1M = $0.009 的输入,加上 3,000 × $0.60/1M = $0.0018 的输出,所以每回合大约 1.1 美分。一个工作日里 200 个这样的回合大约是 $2.16;按非高峰费率算,一个月的周一到周五大约 $47。正是这笔账,让每月 $15 的额度再加上 4× 促销显得很慷慨——也正是这笔账,让啰嗦成为最该盯紧的东西。

因为那个 Artificial Analysis 数字里隐藏的杠杆就在这里。模型在固定任务集上用了中位数输出 token 的 1.8 倍,意味着一个受输出制约的循环,其成本是仅凭 token 价格所推断出的 1.8 倍。而努力程度旋钮正是用来控制这一点的。社区报告显示,从 max 降到 high 大约能让输出 token 减半——这远比高峰/非高峰时段安排会对你造成的波动大得多。努力程度设置才是大杠杆;时段安排则是免费的那个。

在你安排任何事之前,值得了解的是:高峰时段是 UTC 周一至周五的 01:00–04:00 和 06:00–10:00,其他所有时间(包括周末)都是非高峰时段。一个按中欧时间 09:00–18:00 工作的欧洲团队完全不会碰到高峰。一个按相同当地时间工作的北京团队,则会撞上 09:00–12:00 和 14:00–18:00 的高峰时段——九个工作小时里有七个都按双倍价格计费。同样的模型,同样的代码,账单翻倍,完全由时区决定。

另一项免费节省来自缓存读取费率,每 100 万 token 为 $0.003,而全新输入为 $0.15——仅为五十分之一。编程智能体的提示词大部分是稳定前缀:系统指令、工具定义、仓库中不发生变化的部分。把稳定内容放在前面,让可变内容跟在后面,剩下的就交给服务商侧的缓存。折扣缓存输入是否适用、在什么条件下适用,由 DeepSeek 而非客户端决定,因此在据此制定预算之前,请查阅最新文档确认——我们自己的 code>deepseek/deepseek-v4.1-flash/code> 模型页面也说明了同样的事:缓存输入费率遵循服务商的条款。

如果你不想为了评估该模型而再增加一个订阅,同一个 id 可以通过在我们整个模型目录前方架设的一个 OpenAI 兼容端点获取,按提供商的价格,0% 加价——因此 DeepSeek 一侧的价格变动当天就会在这里生效,而不是等到下一次调价才更新。这一点对本文所描述的情形尤为关键:一个已有记录显示其倾向于一直说下去的模型,走在你尚未完成评估的路径上。回退链意味着出错的一轮会在响应开始之前落到另一个模型上,而不是让整个请求失败。

552B、748B 或 763B——尺寸问题确实尚无定论

不要把这个模型的参数数量当作定论来复述,因为目前流传着三个不同的数字,而它们没有一个是完全错误的。

DeepSeek 自己的模型卡描述了一个“552B 主干参数”模型,而这是厂商报告的数字——它也是我们自己模型页面上的规格面板中标注的数字。同一张模型卡还单独列出了一个 196B 参数的“Engram 条件记忆”模块,“通过基于 token 的查找进行稀疏访问”。把两者相加,就得到 748B,这正是发布后数小时内社区分析得出的算术结果。而同一模型仓库的文件元数据列出的模型规模为 763B 参数,这又是第三个数字。

表面上的争议是定义问题,而不是矛盾。查表得到的 Engram 参数消耗内存,但每个 token 几乎不消耗算术;而计算得到的主干参数则会在每个 token 上消耗时间——这正是厂商将它们分开报告的原因,也是为什么比较两个架构不同的模型的主要数字,能告诉你的信息少之又少。

真正没有严重争议的是活跃参数数量:预填充阶段每个 token 大约 8B,解码阶段大约 16B,这才是实际决定推理成本的数字。权重以 MIT 许可证开放,如果你想自行核实其中任何内容。请将 552B 视为厂商报告数据,将 748B 视为可信的社区总量,并将任何声称规模问题已有定论的说法视为为时过早。

Screenshot of DeepSeek's own API documentation release page for DeepSeek-V4.1-Flash, dated 2026-09-10, showing the headline claim of a 552B-parameter MoE on a new Causal Encoder-Decoder architecture with 8B active parameters for input and 16B for output, a bar chart comparing DeepSeek V4.1 Flash against Kimi K3, GLM-5.3, Opus 5 and GPT-5.6 Sol on Terminal-Bench 3.0, DeepSWE v1.1, CyberGym and Automation-Bench, and the start of a vendor benchmark table with GPQA Diamond at 90.9 and HLE at 36.8.

20号之前要做什么

如果你打算在编程智能体中试用 DeepSeek V4.1 Flash,最省时间的顺序是:先选好运行框架,再固定推理强度,最后再测量。

就这套运行框架而言,对今天验证结果最诚实的总结是:三条路径都能跑通,区别在于它们对你提出了什么要求。OpenCode Go 是每月 10 美元的订阅服务,附带一个将于 9 月 20 日到期的促销倍率,配置方式就是 code>/connect/code> 加 code>/models/code>,无需编辑任何文件。Command Code 在自己的目录中实时列出该模型,用 code>/model <id>/code> 进行切换,并把 effort 作为一等命令直接暴露出来。Claude Code 则可以通过 OpenCode Go 的已验证客户端路径接入——在这条路径下它不需要自定义请求头封装——或者直接对接 DeepSeek 的 Anthropic 格式端点,而在后者中,子代理的 effort 冲突是已知的粗糙之处。

关于 effort,要显式设置,而且设得偏低一些:设为 high,或者如果 high 恰好就是模型默认值,那就用模型默认值——总之别用 max。然后确认它确实从你的机器发出去了,因为已经发现有 两个 harness 会把它丢掉。

在衡量方面,要盯住输出 token,而不是挂钟时间。啰嗦程度才是成本所在,努力程度的旋钮才是控制手段,而高峰时段表不过是时区带来的意外,你可以零成本地避开它。

至于本周会有人拿来向你引述的那些规模说法——552B、748B、763B——有用的回应是:厂商报的是其主干,社区加上的是内存模块,而仓库元数据给出的又是另一回事。任何人把其中某一个当作定论摆出来,都是在挑数字,而不是在核数字。