DeepSeek V4.1 Flash

deepseek/deepseek-v4.1-flash
精选
视觉工具JSON推理
来自 DeepSeek · 2026-09-10

DeepSeek-V4.1-Flash 是 DeepSeek 新架构系列中规模最小的模型,于 2026 年 9 月 10 日发布,具备原生多模态视觉理解能力——是 V4 Flash 和 V4 Flash Vision 实验的生产级继任者。新架构旨在实现更高的能力上限、更快的推理速度和更高的吞吐量,DeepSeek 报告称 V4.1 Flash 在性能、成本、速度和总任务耗时方面全面超越 V4 Pro。该模型接受文本和图像输入并输出文本,支持 100 万 token 的上下文窗口,最多可输出 384K token,并支持思考模式(默认开启,努力程度可选低/高/最大)和非思考模式,覆盖 Chat Completions、Responses 和 Anthropic 兼容 API,同时支持 JSON 输出、工具调用和聊天前缀补全;FIM 仅在非思考模式下可用。模型权重已在 Hugging Face 上开源(deepseek-ai/DeepSeek-V4.1-Flash)。 发布时的官方基准测试成绩:Terminal-Bench 2.1 上 90.6 分,DeepSWE v1.1 上 74.2 分,NL2Repo-Bench 上 65.4 分,GPQA Diamond 上 90.9 分,带工具的 HLE 上 63.9 分,以及强劲的原生视觉智能体成绩(BabyVision 89.6,带工具的 Chartography 78.9)。定价也随发布同步下调:非高峰时段输入 $0.15/M(缓存未命中)、输出 $0.60/M、缓存命中 $0.003/M;工作日晚高峰时段(UTC 时间 01:00-04:00 和 06:00-10:00)价格翻倍;包括周末在内的所有其他时段均为非高峰时段。

上下文1M tokens
最大输出384K
输入模态text + image
输出模态text
p50 首字节410 ms
输入$0.15/ 百万 tokens
输出$0.60/ 百万 tokens
p50 首字节410 ms7 天
p95 首字节1.56 s7 天
流量271.0Mtokens / 7 天

DeepSeek V4.1 Flash 是一款可通过 OrcaRouter 使用的 DeepSeek 模型,而 OrcaRouter 是兼容 OpenAI 的 API 网关。它接受文本和图像输入,上下文窗口为 1,048,576 tokens,单次响应最多可生成 384,000 tokens。OrcaRouter 按供应商费率对其计费:每 100 万输入 tokens 0.15 美元,每 100…

DeepSeek V4.1 Flash 是什么?

DeepSeek V4.1 Flash 是为谁打造的?

为什么 1,048,576 token 的上下文窗口很重要?

代码示例

用任意 SDK 调用

兼容 OpenAI——沿用你现有的 SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
  • Anthropic SDKhttps://api.orcarouter.ai
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="deepseek/deepseek-v4.1-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

支持的参数

  • include_reasoning
  • logprobs
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • stream_options
  • temperature
  • thinking
  • tool_choice
  • tools
  • top_logprobs
  • top_p
  • user_id

价格

价格
输入 / 1M tokens · 非高峰$0.150
输出 / 1M tokens · 非高峰$0.600
缓存读取 / 1M · 非高峰$0.0030
高峰时段01:00–04:00, 06:00–10:00 ×2 (UTC)
输入 / 1M tokens · ×2$0.300
输出 / 1M tokens · ×2$1.20
缓存读取 / 1M · ×2$0.0060
货币USD

费用计算器

每月 token 数10MM
输入占比70%%
预计每月 $2.85 · 启用提示缓存后 $2.34

基于标价的估算

Token 与费用估算器

输入 Token: 6每次请求费用: $0.000301

仅为估算——实际 Token 数取决于提供商的分词器。

性能

p50 首字节
410 ms
输出速度
215 tok/s
p95 首字节
1.56 s
错误率
0.07%

公共基准测试

Agents' Last Exam
31.8
Automation-Bench
54.8
BabyVision (with tools)
89.6
Chartography (with tools)
78.9
CyberGym
88.1
DeepSWE v1.1
74.2
ExploitGym
15.3
GPQA Diamond
90.9
HLE
36.8
HLE (with tools)
63.9
MathArena Apex
65.6
NL2Repo-Bench
65.4
ProgramBench
20.3
SEC-Bench Pro
62.8
Terminal-Bench 2.1
90.6
Terminal-Bench 3.0
30.0
Terminal-Bench 4.0
31.2
ZeroBench-main (with tools)
49.0
来源: api-docs.deepseek.com

社区热度

本周开发者的讨论

Hacker News13 次提及 · 近 7 天较上周增加 13

对比一览

DeepSeek V4.1 FlashDeepSeek V4 ProDeepSeek V4 FlashDeepSeek V4 Flash Vision (Exp)
输入 $/百万$0.15$0.73$0.24$0.24
输出 $/百万$0.60$2.18$0.73$0.73
上下文1.0M1.0M1.0M1.0M
质量8/108/107/107/10
并排对比并排对比并排对比并排对比

更多 DeepSeek 模型

常见问题

DeepSeek V4.1 Flash 在 OrcaRouter 上的价格是多少?
OrcaRouter 对 DeepSeek V4.1 Flash 的收费为每 100 万输入 token 0.15 美元、每 100 万输出 token 0.60 美元,按提供商费率原样传递,零加价。上下文窗口本身没有单独列出的费用:1,048,576 token 是上限,而非费用。输入 token 包括您发送的文本、图像和对话历史;输出 token 涵盖生成的所有内容,最多 384,000 token。
上下文窗口和最大输出分别是多少?
DeepSeek V4.1 Flash 的上下文窗口为 1,048,576 个 token,最大输出为 384,000 个 token。输入窗口允许你在一次调用中提交完整文档、转录文本或代码仓库快照,而输出上限则支持生成长篇单次输出产物,例如规格说明、迁移计划或扩展 diff。
DeepSeek V4.1 Flash 最擅长什么?
它专为长输入、长输出任务而打造:整份文档分析、大型代码仓库的代码理解、文本加图像的多模态审阅,以及需要大量生成答案而非简短回复的工作流。它在 GPQA Diamond 上 90.9 的得分也表明其具备扎实的研究生级别科学与技术推理能力。输入支持文本和图像;输出仅为文本。
它和更大的前沿模型相比如何?
前沿模型可能在最难的推理基准上领先,并且通常按 token 收费更高,而 DeepSeek V4.1 Flash 提供 1,048,576-token 上下文窗口和 384,000-token 输出上限,价格为每 1M 输入 token $0.15 和每 1M 输出 token $0.60。对于长上下文和高吞吐量工作,它通常是实用之选;对于最难的单个推理步骤,将这些调用路由到 OrcaRouter 上更昂贵的模型是一种合理的模式。
当我调用此模型时,数据是如何处理的?
OrcaRouter 将请求路由到 DeepSeek 的 API,并按提供商费率计费,零加价。保留、训练使用及相关条款由提供商的政策管辖,而非此处描述的单独安排,因此在发送敏感材料前,请确认提供商当前的条款。对不需要的标识符进行脱敏,并将提示词保持在任务所需的最低限度;更小的上下文也会降低输入成本,即每 100 万 tokens 0.15 美元。
我如何通过 OpenAI 兼容的 API 调用它?
将您的客户端基础 URL 设置为 https://api.orcarouter.ai/v1,并使用模型 ID deepseek/deepseek-v4.1-flash 及您的 OrcaRouter API 密钥。请求和响应遵循 OpenAI 聊天补全架构,因此现有的 SDK、流式处理程序和工具调用解析无需修改即可正常工作。迁移通常只需更改基础 URL 和模型字符串,并重新运行您的评估集。
DeepSeek V4.1 Flash 能接受图片吗?
是的。图像输入通过标准多模态内容数组得到支持,文本和图像部分位于同一条用户消息中。图像 token 计入输入,并在 OrcaRouter 上按每 1M 输入 token $0.15 计费。输出仍仅为文本,因此模型会描述图像或从图像中提取内容,而不是生成图像。
GPQA Diamond 上拿到 90.9 分,足以让我在任务中信任它吗?
这是一个有用的信号,而不是保证。GPQA Diamond 在固定提示格式下衡量研究生水平的科学推理,这与技术问答相关,但对长上下文召回、语气或对你数据的提取准确率则说明甚少。基于真实输入构建一个小型评估集,将其与 DeepSeek V4.1 Flash 以及 OrcaRouter 上的任何备选模型 ID 进行对比运行,并在将生产流量路由之前比较成本和质量。

嵌入此徽章

DeepSeek: DeepSeek V4.1 Flash$0.15/M in410ms p50通过 OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg" alt="DeepSeek: DeepSeek V4.1 Flash 在 OrcaRouter" /> </a>
Markdown [![DeepSeek: DeepSeek V4.1 Flash](https://www.orcarouter.ai/embed/deepseek/deepseek-v4.1-flash.svg)](https://www.orcarouter.ai/models/deepseek/deepseek-v4.1-flash)

以数据形式获取模型卡

GET /api/public/models/deepseek/deepseek-v4.1-flash打开