DeepSeek V4 Flash 0731 是 DeepSeek 高效 V4 Flash 混合专家模型重新后训练的官方发布版 —— 总参数 284B / 激活参数 13B,架构和规模与四月的 V4 Flash 版本完全相同,后训练从头开始重新进行。它支持 1M token 上下文窗口,最多输出 384K token,同时支持思考模式与非思考模式(默认开启思考模式),还支持 JSON 输出和工具调用,并原生支持 Responses API,针对 Codex 风格的编码智能体做了定向适配。 0731 修订版在智能体能力上实现了重大飞跃,在 DeepSeek 公布的智能体基准测试中甚至超过了 DeepSeek V4 Pro Preview —— Terminal Bench 2.1 得分 82.7,Cybergym 得分 76.7,Toolathlon Verified 得分 70.3,DeepSWE 得分 54.4,NL2Repo 得分 54.2。在 DeepSeek 第一方 API 上,deepseek-v4-flash 模型 ID 当前提供的就是这一修订版;带日期的标识符会为按日期引用该版本的调用者列出同一修订版。对于编码智能体、终端和工具使用工作负载,以及以 Flash 级别成本运行的高容量智能体流水线,它都是一个强有力的选择。
DeepSeek V4 Flash 0731 是来自提供商 deepseek 的一款纯文本语言模型,可通过 OrcaRouter 以模型 ID deepseek/deepseek-v4-flash-0731 使用。其核心规格包括 1,048,576 token 的上下文窗口、384,000 token 的最大输出长度,以及在 Terminal Bench 2.1 上 82.7 的得分。定价为每…
输入仅限于文本。上下文窗口为1,048,576个token,每次响应的最大输出为384,000个token。这是一个大型工作区:您可以在生成之前读取大约一百万个token的内容,并可在单次调用中请求最多384,000个token的输出。模型卡将这两项列为两个独立的上限;它没有说明同时使用接近上限值的请求的合并限制。实际操作中,为了保持在限制范围内,请在发送前计算您的token数,并将max_tokens设置为低于输出上限。仅限文本的限制还意味着您必须先将PDF、电子表格和其他文档转换为纯文本。可用事实中未指定分词(tokenization)方式,因此请测试代表性内容,以了解您的提示词会变得多大。如果您的请求超过1,048,576个输入token,API调用将失败;输出超过384,000个token时也同样会失败。
根据所列规格,该模型最适合那些结合长文本输入、长文本输出以及面向终端的智能体推理的任务。82.7 的 Terminal Bench 2.1 分数证明了其在命令行任务完成方面的实力,即模型读取 shell 输出并决定下一个命令。1,048,576 token 的上下文支持整个仓库的分析、多文件代码审查、长篇法律或技术文档以及广泛的聊天历史记录。384,000 token 的输出支持在单次生成中生成长篇结构化文档、合成数据集或逐步分析。每百万 token 的定价为输入 $0.15、输出 $0.29,使得大规模文本处理在财务上可预测。当您需要图像理解、音频转录或极低延迟时,该模型不太合适,这些均不在所提供的事实范围之内。如果您的任务符合纯文本、大上下文、大输出的特征,那么这是一个值得通过 OrcaRouter 进行评估的候选模型。
该模型无法接受非文本输入;其目录条目中不包含视觉、音频或视频模态。在可用事实中,它也没有已公布的延迟或流式传输保证。当你的工作负载不需要大上下文或高输出限制时,你应该选择更便宜的模型。例如,一次使用几千个令牌的简短聊天机器人对话仍会按相同的每令牌费率计费,但由上下文更小、每百万令牌价格更低的模型来服务可能更合适。可用事实中没有列出替代方案的价格,因此请在 OrcaRouter 目录中比较每百万令牌的费率。如果你的任务是简单分类或短文本摘要,更便宜的模型可能就足够了。如果你的任务需要完整的 1M 上下文或 384K 输出,或者受益于 Terminal Bench 2.1 在命令行工作方面的优势,那么该模型的价格才是评估的相关基准。
每个输入都必须是文本。PDF、图片、电子表格和音频文件在发送前需要转换为纯文本或转写为文本。这是一个必要的预处理步骤,同时它也简化了请求格式:你只需要包含字符串的标准 OpenAI 风格内容字段。1,048,576 token 的上下文意味着你可以在一次请求中传递很长的转换后文本;384,000 token 的输出意味着你可以收到很长的文本回复。Token 数量是主要的运营关注点,因为总费用取决于输入和输出 token。OrcaRouter 会在 OpenAI 兼容的响应中报告用量,让你可以监控这两个数字。如果你使用的语言或代码 token 化效率较低,你的有效上下文将会缩小,因为限制因素是 token 数量,而不是字符数。由于没有提供 tokenizer 的详细信息,请用你自己的内容快速测试一下,以了解典型的 token 长度。
Terminal Bench 2.1 评估模型在终端环境中工作的能力:理解命令输出、浏览目录、执行命令,以及通过 Shell 完成真实的系统管理或软件工程任务。DeepSeek V4 Flash 0731 的标题分数为 82.7,该分数越高表示性能越好。这是可用事实中提供的唯一基准测试结果。如果你计划构建发出 Shell 命令的代理循环,这个分数是一个有用的参考信号,因为该基准测试正是为了测试这类能力而设计的。它不能衡量通用知识、创意写作、数学或多语言能力。由于没有提供对比基線或其他基准测试数字,82.7 应在上下文中解读:它是对终端相关任务的强有力证据,而对其他领域既无正面也无负面的证据。基准测试分数取决于具体的任务分布,因此你自己的终端任务得分可能会有所不同;在生产环境中使用前,请使用自己的评估进行验证。
关于DeepSeek V4 Flash 0731的现有资料并未包含每秒令牌数、首令牌时间、p95延迟或吞吐量。Flash这一名称暗示其是一款更轻量的变体,但所提供的资料并未量化速度。资料中确实包含的是高达1,048,576个令牌的大型上下文窗口,以及384,000个令牌的大型输出上限。较长的输入和输出天然会消耗更多计算资源,因此即使对于快速模型,全上下文请求的延迟也可能高于短提示词。每百万令牌$0.15/$0.29的定价描述的是成本,而非速度。要做出明智的决策,请针对OrcaRouter的API运行您自己的负载测试,使用您计划采用的具有代表性的提示词大小,并将首令牌时间和总时长与目录中的其他模型进行比较。请勿根据基准评分推断延迟,因为该评分并不衡量响应时间。
主要限制从所列事实中可见。它仅支持文本,因此任何多模态输入都不在支持范围内。基准证据仅限于一个分数,即 Terminal Bench 2.1 上的 82.7,该基准涵盖基于终端的任务完成情况,而非通用推理或知识。没有发布延迟、可用性或错误率指标,因此负载下的性能未知。上下文和输出上限很大但有限:每次请求可输入 1,048,576 个 token,输出 384,000 个 token。超过这些限制的请求将无法成功。所提供的事实中没有记录提示缓存折扣,因此重复的前缀将按普通输入 token 计费。定价按 token 计费较低,但绝对成本随上下文大小线性增长。如果您的应用需要视觉、低延迟或非常高的吞吐量,该模型可能不适合;在投入之前请单独验证这些需求。
费用按token计算,输入和输出采用不同费率。输入token的价格为每1,000,000个token 0.15美元;输出token的价格为每1,000,000个token 0.29美元。OrcaRouter按提供商费率计费,零加成,也就是说在deepseek的费率之上不会增加任何平台百分比。单个请求的成本大约为:输入token数乘以0.15美元再除以1,000,000,加上输出token数乘以0.29美元再除以1,000,000。例如,完整的1,048,576个token的输入成本约为0.1573美元,而最大长度384,000个token的输出成本约为0.1114美元,前提是这两个上限分别用于不同的事务。现有信息并未提及缓存输入折扣定价,因此假设每个输入token都按标准费率计费。由于定价是线性的,只要知道平均提示词大小和输出长度,批次成本估算就很简单。
主要权衡在于上下文大小和价格之间。按照每100万输入令牌0.15美元计算,使用完整1,048,576令牌上下文的提示词,仅输入费用就约为0.157美元。如果你的任务只需要几千令牌的上下文,你就是在为未使用的容量付费,从某种意义上说,上下文更小且每令牌定价更低的模型可能会更便宜,具体取决于其费率。每100万输出令牌0.29美元的费率意味着长输出本身并不会特别昂贵,但生成千兆字节文本的工作负载会累积成本。在提供的事实中,没有列出批量折扣、预留或缓存折扣。OrcaRouter的零加价计费意味着你看到的价格就是提供商的价格;你的最终账单只是发送和接收的令牌数量的函数。对于大规模批量作业,估算总输入和输出令牌,乘以这两个费率,并与目录中的替代方案进行比较。
OrcaRouter 明确按照提供商费率对 DeepSeek V4 Flash 0731 计费,零加价。每 100 万输入标记 0.15 美元和每 100 万输出标记 0.29 美元是提供商的费率,而非加价后的版本。所提供的信息并未描述该模型的提示词缓存(prompt caching)。未列出缓存输入定价层级,也没有任何声明表明 OrcaRouter 会代表您自动缓存提示词。如果底层提供商提供缓存,相关条款不属于此目录条目所提供的内容,因此在假设有折扣之前,您应查阅 OrcaRouter 的最新文档。由于 API 响应遵循 OpenAI 的聊天补全(chat completions)格式,因此包含用量信息,可让您核实已计费的输入和输出标记。出于审计目的,请记录每个响应中的 usage 对象,并将其与您预期的标记数量进行比较。任何成本控制都必须来自您自己的提示词和参数选择。
向 OrcaRouter 的 OpenAI 兼容 API 发送标准聊天补全请求。基础 URL 为 https://api.orcarouter.ai/v1,模型 ID 为 deepseek/deepseek-v4-flash-0731。将 model 字段设置为该确切字符串,并在 Authorization 标头中以 bearer token 形式放入你的 OrcaRouter API 密钥。构建一个包含文本内容的 messages 数组;该模型不接受图像或音频内容。响应格式与 OpenAI 聊天补全一致,包含生成的消息和一个 usage 对象。由于模型 ID 包含提供商前缀,请原样保留。现有信息表明,不需要任何非标准标头或特殊传输设置。你可以使用 OpenAI SDK、curl 或任何支持 JSON 的 HTTP 客户端。先从一个小的请求开始,验证返回的 usage 与预期的输入和输出 token 数量一致,然后再扩大规模。
由于端点是兼容 OpenAI 的,因此可用的典型聊天补全参数包括:model、messages、temperature、top_p、max_tokens 或 max_completion_tokens、stop、stream,以及你所使用的 SDK 支持的其他类似选项。现有事实并未列出 OrcaRouter 针对此特定模型会处理哪些参数,因此除 model 和 messages 之外,任何参数都应自行测试。关键限制来自模型本身:输入 token 上限为 1,048,576,输出 token 上限为 384,000。请将 max_tokens 保持在输出上限之下,以避免请求失败。关于工具调用或函数调用,现有事实并未说明是否支持;在构建 agent 之前,请先用一个最小工具定义进行测试。关于输出格式控制,没有任何提及 JSON 模式或结构化输出保证;如果你需要可靠的结构,请自行验证生成的文本。流式传输在兼容 OpenAI 的端点上通常受支持,但现有事实并未确认此模型支持该功能,因此请查阅 OrcaRouter 的 API 参考文档。
迁移主要是配置上的调整:将基础 URL 改为 https://api.orcarouter.ai/v1,把 API 密钥换成你的 OrcaRouter 密钥,并将模型名称替换为 deepseek/deepseek-v4-flash-0731。只要代码遵循 OpenAI 约定,那么已有的构建消息、处理聊天补全响应以及读取用量数据的代码都将继续正常工作。有两个差异需要留意。第一,该模型仅支持文本,因此请从请求中移除任何 image_url 或 audio 字段。第二,上下文长度和输出上限都非常大;请调整你的 max_tokens 设置,以遵守 384,000 token 的输出上限,并为偶尔较长的响应做好准备。如果你的代码包含对 429 或 5xx 错误的重试逻辑,请保留它们;这些事实并不会改变错误处理的预期。先用一个小提示词做一次冒烟测试,确认计费显示为每百万 token $0.15/$0.29,然后逐步迁移流量。
OrcaRouter API 的基础 URL 是 https://api.orcarouter.ai/v1。对此端点的所有请求都应使用 HTTPS。认证使用 API 密钥,以标准的 Bearer 令牌形式放在 Authorization 请求头中发送。现有资料未列出其他认证方式。模型 ID 是 deepseek/deepseek-v4-flash-0731,其中包含提供商名称和 0731 快照后缀;请原样传递。在大多数兼容 OpenAI 的 SDK 中,你需要使用 base_url 和 api_key 配置客户端,然后在每次调用时设置模型名称。响应将在 usage 对象中包含与计费相关的 token 计数。现有资料未说明速率限制、重试行为或超时指导,因此请查阅 OrcaRouter 的文档以了解这些操作细节。请安全存储你的 API 密钥;该密钥决定了对 OrcaRouter 项目中每个模型账户的访问权限。如果你使用代理或网关,请将其指向 OrcaRouter 的基础 URL,并保留完整的模型 ID。
所提供的事实仅涵盖这一特定快照,因此无法根据现有信息与其他 DeepSeek 条目进行逐行数值比较。我们所了解的 DeepSeek V4 Flash 0731 包括:1,048,576 token 的上下文、384,000 token 的输出上限、仅文本输入、每 1M token $0.15/$0.29 的定价,以及 82.7 的 Terminal Bench 2.1 得分。OrcaRouter 目录中的其他 DeepSeek 模型在这些维度上可能存在差异。在决策时,请比较重要的规格:您的提示词实际使用多少 token、您的输出需要多少 token、您是否需要多模态输入,以及候选模型的每 1M token 价格。Flash 标签意味着相对于其他 DeepSeek 版本,这是一个更精简的变体,但事实中唯一的客观性能指标是 Terminal Bench 得分。在选择之前,请使用 OrcaRouter 的目录列表页面进行并排规格对比并查看当前定价。
在1,048,576个token的上下文长度下,该模型属于长上下文级别。上下文较小的模型可能只能支持几十万甚至更少的token,迫使你拆分文档、嵌入块或使用检索。该模型的优势在于,你可以将非常大的语料库放入单个提示词中,让模型在单次处理中关注全部内容。缺点是每次请求的成本:每个输入token都会计费,因此巨大的上下文会成倍增加输入开销。事实信息中未列出任何上下文窗口更大的模型,因此唯一稳妥的表述仅限于该模型自身的限制。在做出选择时,请估算你的实际提示词规模。如果你的任务通常使用不到10万token,那么完整上下文可能并无必要,更便宜、更小的模型或许更合适。如果你经常超出常见上下文限制,那么该模型100万token的窗口就是决定性特性。
当任务仅涉及文本并且你可以利用其规格时,选择 DeepSeek V4 Flash 0731。当需要一次性读取整个代码仓库、文档集或长篇幅转录文本时,1,048,576 token 的上下文窗口使其成为合适的选择。当需要生成超长回答而无需多次往返时,384,000 token 的输出上限使其成为合适的选择。82.7 的 Terminal Bench 2.1 分数使其成为终端自动化和智能体 CLI 工作流的合适选择。$0.15/$0.29 每百万 token 的价格使其成为以单 token 成本为主导的高吞吐批量文本处理的合适选择。当需要处理图像或音频、上下文需求很小且存在更便宜的模型、或无法接受未知的延迟特性时,请勿选择该模型。现有信息无法提供延迟保证,因此对性能敏感的团队应首先使用真实提示词进行基准测试。在任何情况下,扩大规模前都请在 OrcaRouter 上确认模型 ID 和计费方式。
兼容 OpenAI——沿用你现有的 SDK
https://api.orcarouter.ai/v1https://api.orcarouter.aiimport os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="deepseek/deepseek-v4-flash-0731",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltyinclude_reasoninglogit_biaslogprobsmax_tokensmin_ppresence_penaltyreasoningreasoning_effortrepetition_penaltyresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_ktop_logprobstop_p| 输入 / 1M tokens | $0.147 |
| 输出 / 1M tokens | $0.295 |
| 缓存读取 / 1M | $0.020 |
| 货币 | USD |
基于标价的估算
仅为估算——实际 Token 数取决于提供商的分词器。
本周开发者的讨论
@misc{orcarouter_deepseek_v4_flash_0731,
title = {DeepSeek V4 Flash 0731 API},
author = {DeepSeek},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731}
}DeepSeek. (2026). DeepSeek V4 Flash 0731 API. OrcaRouter. https://www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731