一张生成的标题卡上写着"Jev vs DeepSeek V4.1 Flash",副标题为"八分钱一千算不上一道护城河",将 Jev(类型化决策、校准置信度、每百万输入 $0.042、输出免费)与 DeepSeek V4.1 Flash(生成式、1M 上下文、峰值时每百万 $0.30 / $1.20)进行对照。
Guides & Insights

Jev vs DeepSeek V4.1 Flash:每千次八美分并非护城河

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

决定 Jev 问题的比较并不是与某个前沿模型进行的,而是与 DeepSeek V4.1 Flash 进行的。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日发布——比 TypeSafe AI 推出 Jev 早五天——因为 DeepSeek V4.1 Flash 是一个真正便宜的生成式模型,而且是现场最便宜、几乎能做 Jev 能做的一切的东西。2026 年 9 月发表的一项独立测试,将标准意图分类数据集 BANKING77 中的 77 个样本分别输入两者:Jev 的结果是每 1,000 次分类 7 美分,准确率 75%。DeepSeek V4.1 Flash 的结果是每 1,000 次 8 美分,准确率 79%。同一测试中,GPT-5.6 Luna 为 12 美分和 83%。一个拥有百万 token 上下文窗口、原生工具调用和图像输入的生成式模型,在每千次分类成本上仅比一个专用决策模型高出一美分——而在准确率上领先四个百分点。这就是这场对决核心处令人不安的事实,也重新界定了 Jev 真正在卖什么。

每个模型的功能

A screenshot of the TypeSafe AI documentation for Jev, showing the typed Choice, Score and Noul primitives, parallel evaluation against one shared read of the state, free output, and the roughly 32,000-token request budget.

Jev 是一个 System One 决策模型:它完全不返回任何文本。你发送一个状态,外加若干带类型的问题——Choice(从你提供的列表中选择)、Score(按有序评分量表打分)或 Noul(一个带有校准概率的是/否断言)——它便会返回带置信度的类型化答案。所有问题都会针对状态的同一次共享读取并行评估,这就是为什么增加问题几乎不会改变响应时间,也是为什么输出不产生任何成本:没有输出 token 需要计量。输入为每百万 token 0.042 美元,输出免费,请求预算约为 32,000 个 token。它于 2026 年 9 月 15 日发布,出自 TypeSafe AI,该公司由 Diogo Almeida 创立,并获得了由 DCVC 领投的 4000 万美元种子轮融资。

DeepSeek V4.1 Flash 是一款常规的生成式模型,并不假装自己不是。它于 2026 年 9 月 10 日发布,API id 为 deepseek-flash,采用 552B 参数的混合专家架构,非对称激活为 8B/16B,上下文窗口达 100 万 token,支持文本加图像输入。它逐 token 生成文本,而这恰恰是它每次调用成本更高、每次调用能力更强的原因。它以每秒 208.3 token 的速度运行,首 token 耗时 1.13 秒,定价为高峰时段每百万 token $0.30/$1.20,非高峰时段 $0.15/$0.60。在 Artificial Analysis 上,它的指数为 40——处于中端,而非前沿。

为什么按分类的数学计算会得出这样的结果

一分钱的差距并非偶然,也并不稳定。它源于每个模型各自的计费方式。

• Jev 每次决策的成本基本上是固定的——你只需为对输入执行一次遍历付费,价格为每百万个 token 0.042 美元,而你所问问题的数量几乎不会改变这一成本。一个只需要一个标签的分类和一个需要二十个标签的分类,成本几乎相同。

DeepSeek V4.1 Flash 每次决策的成本随输出规模增长。归类为简短标签很便宜;同一任务,如果你要求给出理由、置信度以及结构化 JSON 封装,输出 token 会是数倍,因此价格也是数倍。

• 高峰时段与低谷时段相比,DeepSeek 的输入价格翻倍,输出价格也翻倍。若在错误的时段批量运行分类任务,那一美分的差距就会变成完全不同的数字。

这就是为什么对差距的独立估算会如此大相径庭。在包含 77 个示例的 BANKING77 测试中,结果是 7¢ 对 8¢。另一项独立的综合基准 JevBench 显示,Jev 为每 1,000 次 0.041 美元,而 DeepSeek V4.1 Flash 为每 1,000 次 0.579 美元——相差十四倍。第三项针对 83 个销售联系人的测试发现,DeepSeek V4.1 Flash 每次运行为 0.183 美元,而 Jev 为 0.0055 美元,相差 33 倍。这些数字相差两个数量级的原因在于,每一项都假设了不同的提示词、不同的输出形态和不同的时段。任何人若把单次分类的数字当作模型本身的属性、而非评测框架的属性来引用,都是在兜售某种东西。

Jev 的结构能带给你、而生成模型无法提供的东西

区别不在于价格,而在于契约。Jev 的输出受模式锁定:由于所有可能的答案在模型运行前就已被穷举——你提供的是选项列表、评分标准或真/假断言——因此不存在任何空间去输出声明类型之外的值。格式错误的响应不是 Jev 能产生的东西。DeepSeek V4.1 Flash 可以通过模式约束为结构化输出,实践中也大多遵守,但这种保证是强先验,而非结构属性。如果你的流水线每月运行一千万次分类,“大多”和“始终”在一份事故报告里就是两条不同的条目。

第二个特性是校准。Jev 使用 TypeSafe 称为 RLCD 的方法训练——即用于校准决策的强化学习(Reinforcement Learning for Calibrated Decisions)——并且每个答案都带有概率分布,因此你的代码可以设置阈值:高于阈值自动接受,处于中间区间标记待查,低于阈值上报升级。如果你向 DeepSeek V4.1 Flash 索要,它会给出一个置信度数值,但那是生成的 token,而非经过校准的输出;生成的置信度是对自身的一种声称,而不是一种测量。这一区别正是值得为决策模型付费的全部理由,也是廉价生成式模型在结构上无法企及的一点。

第三点是延迟形态。Jev 文档记载的端到端延迟为 70–500ms,无论附加多少问题;而在 TypeSafe 自己的对比中,前沿 LLM 调用为 3–329 秒。DeepSeek V4.1 Flash 的 1.13 秒 TTFT 和 208 tokens/秒吞吐量对生成式模型来说非常出色,这也应是评判它的标准——但在生成输出加上首 token 延迟只有几百毫秒的情况下,它每次决策仍需数秒,而不是零点几秒。在 TypeSafe 的内部工作流仪表板上,Jev 在成本和延迟两列胜出,但在准确率列落败:发票处理上为 61.8% 对 79.1%,客户服务上为 76.0% 对 78.3%。该仪表板的参考答案是模型判断的平均值,而非真实标注,且仪表板本身也标记了可能存在评测框架偏差。

上下文差距是真实存在的,而且是单向的。

这里有一个维度并不接近,也不是表述角度的问题。DeepSeek V4.1 Flash 拥有 100 万 token 的上下文窗口;Jev 的请求预算大约是 32,000 个 token。如果你的分类依赖于阅读一整份合同、一段很长的支持对话,或一个大型代码文件,DeepSeek V4.1 Flash 能看到,而 Jev 不能——无论每次决策多么便宜,都无法弥补状态放不下的问题。Jev 在发布时也不接受图像或音频输入,而 DeepSeek V4.1 Flash 接受图像。

另一面是,Jev 的狭窄窗口被当成一种负债而非约束来定价,而 TypeSafe 自家文档里的两阶段模式就是变通办法:对于超出 255 个选项上限的 Choice 字段,先分批为候选项打分,再跨这些分数进行选择。当状态小、选项集大时,这行得通。当状态大时,就行不通。

各归其位

当决策确实是闭式的、状态能容纳在 32K tokens 内、调用量足够大以至于每次调用的秒数是真实成本、并且流水线需要一个可以用来分支的置信度值时,请使用 Jev。护栏检查、智能体循环中的每轮验证、高容量路由,以及并行评分大型文档集,是文档记录的适用场景。

当任务需要读取长内容、需要在给出标签的同时提供理由、需要查看图像,或者当分类是更长生成式工作流中的一个步骤,而将其拆分给第二个供应商只会为了节省一美分而增加一个环节(一个糟糕的提示词就可能让这笔节省化为乌有)时,请选用 DeepSeek V4.1 Flash。并且要注意,“生成模型也能做”是对该任务的正确描述,而不是 Jev 的失败——有趣的问题是,你是否需要置信度值,因为这是比较中生成模型无论出价多少都无法提供的唯一一项。

在一个密钥上运行决策层与生成层

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash, showing the model routed through the unified API with provider list price passed through at 0% markup, plus the routing-details and failover panels.

DeepSeek V4.1 Flash 是 OrcaRouter 所路由的模型之一,按提供商标价原价透传、0% 加价——因此 DeepSeek 一上线错峰降价,我们这边当天即可生效,你无需同时追踪两张价目表。Jev 本身我们并不提供:TypeSafe 的这款模型处于早期访问阶段,且使用自己的请求格式。这一对比所指向的架构是双模型架构——Jev 负责决策,DeepSeek V4.1 Flash 负责生成——而 OrcaRouter 以单个兼容 OpenAI 的端点覆盖生成这一半,并具备自动故障转移,因此一个尚未经过验证的决策组件永远不会成为单点故障。200+ 个模型,一个密钥,一张账单

裁决

如果你来这里,是期待 Jev 比生成式模型便宜得多,那么诚实的答案是:与 DeepSeek V4.1 Flash 相比,它通常并不便宜;而在这个特定的 77 个样本测试中,它便宜了一美分,准确率却低了四个百分点。Jev 卖的不是每次分类的价格。它卖的是一种结构性保证:输出不可能格式错误;一个经过校准的置信度值,你的代码可以据此分支;以及以毫秒而非秒计的延迟下限。这三样东西,在一条运行足够频繁、值得在意的流水线里,值得为之付费——但如果你的任务是读一份 400 页的文档并写出摘要,那它们就毫无价值,因为那是 DeepSeek V4.1 Flash 的活,从来就不是 Jev 的。

A generated two-column scoreboard comparing Jev and DeepSeek V4.1 Flash across the same six labelled dimensions, with a footer reading "Per-classification figures from a 77-example test; not a controlled comparison."