DeepSeek-V4.1-Flash 是 DeepSeek 新架构系列中规模最小的模型,于 2026 年 9 月 10 日发布,具备原生多模态视觉理解能力——是 V4 Flash 和 V4 Flash Vision 实验的生产级继任者。新架构旨在实现更高的能力上限、更快的推理速度和更高的吞吐量,DeepSeek 报告称 V4.1 Flash 在性能、成本、速度和总任务耗时方面全面超越 V4 Pro。该模型接受文本和图像输入并输出文本,支持 100 万 token 的上下文窗口,最多可输出 384K token,并支持思考模式(默认开启,努力程度可选低/高/最大)和非思考模式,覆盖 Chat Completions、Responses 和 Anthropic 兼容 API,同时支持 JSON 输出、工具调用和聊天前缀补全;FIM 仅在非思考模式下可用。模型权重已在 Hugging Face 上开源(deepseek-ai/DeepSeek-V4.1-Flash)。 发布时的官方基准测试成绩:Terminal-Bench 2.1 上 90.6 分,DeepSWE v1.1 上 74.2 分,NL2Repo-Bench 上 65.4 分,GPQA Diamond 上 90.9 分,带工具的 HLE 上 63.9 分,以及强劲的原生视觉智能体成绩(BabyVision 89.6,带工具的 Chartography 78.9)。定价也随发布同步下调:非高峰时段输入 $0.15/M(缓存未命中)、输出 $0.60/M、缓存命中 $0.003/M;工作日晚高峰时段(UTC 时间 01:00-04:00 和 06:00-10:00)价格翻倍;包括周末在内的所有其他时段均为非高峰时段。
DeepSeek V4.1 Flash 是一款可通过 OrcaRouter 使用的 DeepSeek 模型,而 OrcaRouter 是兼容 OpenAI 的 API 网关。它接受文本和图像输入,上下文窗口为 1,048,576 tokens,单次响应最多可生成 384,000 tokens。OrcaRouter 按供应商费率对其计费:每 100 万输入 tokens 0.15 美元,每 100…
DeepSeek V4.1 Flash 接受文本和图像作为输入,并返回文本。在实践中,这涵盖了三大类模式。第一类是文档理解:将表格、扫描页面或图表的截图与书面指令一起输入。第二类是视觉定位,即在较长的对话或规格说明的上下文中,对界面、图表或错误状态的截图进行分析。第三类是混合模态推理,即将长篇文本语料与少量用于锚定问题的图像配对使用。 输出仅为文本,因此模型会描述、提取或解释它所看到的内容,而不会生成图像。图像 token 计入输入,并按每 100 万输入 token 0.15 美元计费,与 OrcaRouter 上的文本输入费率相同。对于仅靠文本即可满足需求的工作负载,纯文本模型可能更便宜,但 V4.1 Flash 避免了为轻量级视觉任务运行单独的视觉流水线。
非常适合的场景包括需要长回答的长上下文分析、跨大型代码仓库的代码理解、多模态文档审阅,以及需要携带大量状态的智能体循环。由于最大输出可达 384,000 个 token,模型可以返回完整报告、迁移说明或较长的代码,而不是简短摘要。 其他合理的用途包括转录文本转结构化笔记的流水线、合同比对,以及将完整历史记录保留在上下文中的支持类工作流。90.9 的 GPQA Diamond 得分表明其在研究生水平的科学问题上表现强劲,这说明它更适合技术与研究导向的问答,而不仅仅是散文写作。对于高频、小请求的流量,它的适用性就不那么明显,因为一次简短的分类调用并不需要百万 token 的窗口;同样,它也不适合需要图像生成的任务,因为其输出仅为文本。
许多模型将输出限制在几千个 token,这迫使长内容必须通过多轮拼接来完成。384,000 token 的上限让 DeepSeek V4.1 Flash 能够一次生成完整产物:完整的技术规范、长篇迁移计划、扩展的带注释 diff,或完整的转录稿重写。单次生成通常比用许多短调用拼装答案更能保持内部一致性,因为模型不会在轮次之间丢失线索。 代价是成本。在 OrcaRouter 上,输出按每 100 万输出 token 收费 $0.60,是输入费率的四倍,因此超长生成是请求中开销较大的部分。在连贯的长答案确有价值时使用该上限,将 max_tokens 设置为与任务匹配,并避免在两段话的答案就足够时让模型东拉西扯。
大上下文和高输出上限是你需要付费购买的能力。如果一项任务只需要一个简短提示和简短回答,例如意图分类、实体提取、路由或简单改写,额外的窗口不会带来任何好处,而 OrcaRouter 上其他地方的小模型通常每次调用成本更低。这同样适用于输入按设计已经分块的高吞吐量批处理任务。 当任务确实需要该窗口时,请选择 DeepSeek V4.1 Flash:整份文档、长代码上下文、多图像审核,或长单次回答。一个有用的规则是先估算提示大小和预期输出。如果两者都不大,请将总 token 成本与更小的选项进行比较。如果提示达到数十万 token,替代方案通常是检索流水线,但这会带来自身的工程成本和信息损失。
GPQA Diamond 是一组研究生水平的科学问题,旨在抵御简单检索,因此分数反映的是对高难度技术材料的推理,而非对常见事实的回忆。DeepSeek V4.1 Flash 在此基准测试中得分 90.9。在此取得高分表明,该模型能够胜任多步科学推理和精确的领域问题。 这并不意味着该模型在每项任务上都同样强大。GPQA Diamond 覆盖范围较窄:它几乎无法说明长上下文检索、语气、杂乱提示下的指令遵循能力,或大规模代码质量方面的表现。将 90.9 视为一个确认技术推理能力的数据点,并在你自己的workload上验证它。从你的真实输入中构建一个小型评估集,包括长文档和图文提示,并在该集合上比较输出,然后再在 OrcaRouter 上确定生产路由。
DeepSeek V4.1 Flash 上的延迟主要取决于你要求它生成多少内容。首字延迟时间受提示词大小和提供商负载影响,而总响应时间则随输出长度增长。在 384,000 token 的上限下,最大长度的生成本质上是一个长时间运行的请求。OrcaRouter 上没有该模型的已发布延迟数据,因此请用自己的提示词进行测量,而不是假设某个数值。 实用步骤:为交互路径限制 max_tokens,使响应保持有界;流式输出 token,让用户看到进度;并将超长生成留给后台任务。在高并发下,预计提供商的吞吐量限制会影响你的实际速率,并据此排队或重试。用相同的提示词与你当前的模型进行比较,并将首字延迟时间与总时长分开跟踪。
基准测试适合用来缩小选择范围,却不适合在生产环境中给模型排名。每个测试都在固定的提示格式下衡量某项特定且受限的技能。GPQA Diamond 奖励的是研究生级别的科学推理能力,而编程基准测试奖励的则是完全不同的行为。一个领域的出色得分不会自动迁移到另一个领域,而且模型之间的小幅差距往往落在多次运行的正常波动范围内。 有两种做法会有所帮助。第一,确认基准测试的任务与你的任务相似。GPQA Diamond 上的 90.9 分对于研究和技术问答很有意义,但对聊天语气或信息抽取而言就没那么重要。第二,用你自己的数据来测试:收集一个有代表性的样本,定义评分规则,然后进行测量。在 OrcaRouter 上,你可以通过一个兼容 OpenAI 的 API 把同一个请求路由到不同的模型 id,直接比较输出结果,这比单看排行榜名次更有参考价值。
有三项限制值得提前规划。首先,输出仅为文本:该模型可以接收图像输入,但不会生成图像。其次,长输出成本更高,输出价格为每 1M 个 token $0.60,是输入价格的四倍,因此冗长的生成内容是主要的成本风险。第三,大上下文窗口并不能保证每个细节都会被用到。对一百万个 token 的注意力处理能力,应在你自己的文档上进行验证,而不是想当然。 此外还有运维方面的限制。超大的提示词处理时间更长,并且会更快消耗速率预算。该模型由 DeepSeek 通过 OrcaRouter 提供服务,因此可用性取决于提供商的基础设施及其施加的任何限制。在密集图表、手写内容或低分辨率扫描件上的多模态准确率会有所波动;在将关键抽取工作交给它之前,请先在具有代表性的样本上进行验证。
DeepSeek V4.1 Flash 的计费为每 100 万输入 token 0.15 美元,每 100 万输出 token 0.60 美元。OrcaRouter 按提供商费率零加价透传这些价格,因此你看到的数字是提供商的价格,而非转售价格。输入包括你发送的所有内容:文本 token、图像 token,以及对话累积的历史记录。输出涵盖模型生成的所有内容,包括工具调用参数及其输出的任何推理文本。 计费基于 token,因此更便宜的请求只是使用了更少的 token。上下文窗口本身没有单独的费用说明:1,048,576 token 的窗口是限制,而不是费用。大型提示词自然花费更多,因为它包含更多输入 token。按路由跟踪用量,以便将支出归因到实际产生这些支出的功能上。
决定你花费的有两个乘数:输入多少 token,输出多少 token。输出是更贵的一侧,每 100 万 token 收费 $0.60,而每 100 万输入 token 为 $0.15,相差四倍。一个读取 200,000 token、写入 500 token 的请求,开销主要由输入主导;一个读取 2,000 token、写入 20,000 token 的请求,则由输出主导。了解你的产品属于哪种模式,就能知道该在哪里优化。 由此有三条杠杆。精简上下文:只纳入任务真正需要的文档和历史记录,即便可用的有 1,048,576 个 token。限制输出:把 max_tokens 设为真实需求,而不是直接顶到上限。还有批处理:更少、更大的调用可以避免反复重发同一段上下文,而这往往是长上下文应用中最不易察觉的浪费来源。
DeepSeek V4.1 Flash 由 OrcaRouter 按提供商费率计费,零加价,因此任何提供商侧折扣或缓存输入费率都会原样传递,而不会被吸收或加价。该模型是否提供折扣缓存输入,以及在什么条件下提供,由 DeepSeek 设定,因此在将节省纳入预算之前,请查阅提供商当前的文档进行确认。 你能直接控制的是提示词设计。保持稳定的前缀,例如系统指令、schema 和检索到的上下文,并将可变内容追加到末尾,以便提供商支持的任何前缀复用都能生效。在一个批次中跨调用复用相同上下文,而不是逐项重新发送。积极缩短历史记录,在较早轮次不再需要时对其进行摘要。这些习惯会减少输入 token,而长上下文工作负载通常正是在这里消耗。
将兼容 OpenAI 的客户端指向 https://api.orcarouter.ai/v1,并将模型设置为 deepseek/deepseek-v4.1-flash。由于 OrcaRouter 暴露 OpenAI 聊天补全接口,现有的 Python、JavaScript 及其他语言的 SDK 只需更改 base URL 和模型 id,并加上你的 OrcaRouter API 密钥即可使用。 一个最小请求会发送包含 system 和 user 轮次的 messages 数组,以及可选参数,例如 max_tokens、temperature 和 stream。图像输入遵循标准多模态内容格式,图像部分与文本部分位于同一条 user 消息中。响应以通常的格式返回,因此解析、流式传输和工具调用处理代码无需更改即可沿用。请查看 OrcaRouter 模型页面,了解各模型的参数说明,并在调整提示词大小和输出限制期间,记录前几次调用的原始响应。
四个参数决定了大多数 DeepSeek V4.1 Flash 请求的形态。max_tokens 设置输出上限,在最大 384,000 个 token 的情况下,它是主要的成本控制手段;将其设为任务所需的值,而不是最大值。temperature 决定输出的变化程度,因此在提取、结构化输出和代码任务中应保持较低,而在起草时可以提高。stream 让你在长文本生成时展示进度,当一次响应可能达到数万个 token 时,这一点很重要。系统指令应包含格式和安全要求。 对于图像,标准的多模态内容数组是应使用的机制。对于长提示,要考虑所包含的每份文档是否都必要,因为输入 token 按每 1M $0.15 计费。如果模型通过 OpenAI 兼容 schema 支持工具调用,请定义范围窄且文档完善的工具,而不是范围宽泛的工具。设置与预期最长生成时间相匹配的客户端超时。
迁移有意保持得很小。将基础 URL 改为 https://api.orcarouter.ai/v1,将模型字符串替换为 deepseek/deepseek-v4.1-flash,并提供 OrcaRouter API 密钥。请求和响应 schema 保持 OpenAI 兼容,因此消息数组、流式事件和工具调用载荷无需结构性重写。 工作在于行为,而不是底层管道。一个具有 1,048,576 token 窗口和 384,000 token 输出上限的模型,会促使你使用此前模型无法接受的提示词。借此机会提升上下文质量,而不是盲目增大提示词规模,因为输入 token 成本为每 1M $0.15。重新调整 max_tokens、temperature 和重试逻辑,然后重新运行你的评估集。还要检查分词器和提示词拆分假设:为小窗口构建的分块逻辑现在可能已不再必要,而保留它可能会使上下文碎片化。
图像以内容部分(content parts)的形式在用户消息中提供,与 OpenAI 多模态格式一致:消息内容变为一个数组,其中包含文本部分和图像部分,每个图像以 URL 或 base64 数据的形式给出。一次典型的调用会将较长的文本正文(例如规格说明、转录文本或先前对话)与一张或多张截图或扫描页面混合在一起,并提出一个同时依赖两者的提问。 上传前先调整尺寸。非常大的图像会增加输入 token,而输入按每 1M token 收费 $0.15,因此发送简单图表的全分辨率截图只会浪费预算,且无法提升准确率。裁剪到真正重要的区域,对于文本密集的材料使用清晰可辨的分辨率。如果一项任务需要许多图像,请将它们按逻辑分组放在一个请求中,而不是为每张图像单独发起一次调用,因为那样每次都会重新发送你的文本上下文。
前沿级模型常常在最难的推理和编码基准测试中领先,但它们的每 token 收费通常要高得多,并且可能将输出上限设得远低于 DeepSeek V4.1 Flash 所允许的水平。该模型在 GPQA Diamond 上获得 90.9 分,使其在研究生级别的科学推理方面处于可信区间,而每 1M 输入 token $0.15 和每 1M 输出 token $0.60 的定价,则让长上下文工作保持可负担。 选择通常归结为三个问题。推理任务有多难,准确率差距对它是否重要?输入有多长,1,048,576-token 窗口能在多大程度上降低流水线复杂性?在 384,000-token 上限下,输出有多长?对于文档密集型分析、长单次生成以及大批量多模态审核,V4.1 Flash 往往是实用之选。对于最困难的推理步骤,可以考虑将这些调用路由到 OrcaRouter 上成本更高的模型。
OrcaRouter 通过一个 OpenAI 兼容 API 提供许多模型,因此比较只需切换模型 id,而无需集成第二个供应商。在 DeepSeek 系列中,有意义的维度是价格、上下文窗口和输出上限。V4.1 Flash 将 1,048,576 token 的窗口与 384,000 token 的输出上限搭配,价格为每 1M 输入 token $0.15,每 1M 输出 token $0.60。 当提示词和回答都很短,且额外窗口没有价值时,更小或更便宜的模型才有意义。当你需要图像输出而不是图像输入时,支持视觉的替代方案就很重要。专用代码或推理模型可能在狭窄任务上胜出。由于 OrcaRouter 按提供商费率定价且零加价,在 token 上的比较是同类比较:用相同的提示词分别通过两个 id 运行,衡量成本和质量,然后按任务路由。
当任务形态与模型优势不匹配时,选择其他方案。简短、高频的分类、路由或提取任务从 1,048,576 token 的窗口中获得不了任何好处,而且在更小的模型上更便宜。需要生成图像的任务需要完全不同类别的模型。如果单个困难推理步骤主导质量,例如定理式数学或微妙的算法设计,那么仅在该步骤使用前沿模型可能值得更高的费率。 组合模型也是合理的。使用 DeepSeek V4.1 Flash 读取长输入、收集证据,并按每 1M 输入 token $0.15、每 1M 输出 token $0.60 的价格起草扩展输出,然后将具体决策升级到更昂贵的模型进行验证。OrcaRouter 的 OpenAI 兼容 API 使这种路由成为配置更改,而不是新的集成。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4.1-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokensreasoningreasoning_effortresponse_formatstopstreamstream_optionstemperaturethinkingtool_choicetoolstop_logprobstop_puser_id| 输入 / 1M tokens · 非高峰 | $0.150 |
|---|---|
| 输出 / 1M tokens · 非高峰 | $0.600 |
| 缓存读取 / 1M · 非高峰 | $0.0030 |
| 高峰时段 | 01:00–04:00, 06:00–10:00 ×2 (UTC) |
| 输入 / 1M tokens · ×2 | $0.300 |
| 输出 / 1M tokens · ×2 | $1.20 |
| 缓存读取 / 1M · ×2 | $0.0060 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_deepseek_v4_1_flash,
title = {DeepSeek V4.1 Flash API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash}
}DeepSeek. (2026). DeepSeek V4.1 Flash API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash