
Jev vs DeepSeek V4.1 Flash:每千次八美分并非护城河
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
决定 Jev 问题的比较并不是与某个前沿模型进行的,而是与 DeepSeek V4.1 Flash 进行的。DeepSeek V4.1 Flash 于 2026 年 9 月 10 日发布——比 TypeSafe AI 推出 Jev 早五天——因为 DeepSeek V4.1 Flash 是一个真正便宜的生成式模型,而且是现场最便宜、几乎能做 Jev 能做的一切的东西。2026 年 9 月发表的一项独立测试,将标准意图分类数据集 BANKING77 中的 77 个样本分别输入两者:Jev 的结果是每 1,000 次分类 7 美分,准确率 75%。DeepSeek V4.1 Flash 的结果是每 1,000 次 8 美分,准确率 79%。同一测试中,GPT-5.6 Luna 为 12 美分和 83%。一个拥有百万 token 上下文窗口、原生工具调用和图像输入的生成式模型,在每千次分类成本上仅比一个专用决策模型高出一美分——而在准确率上领先四个百分点。这就是这场对决核心处令人不安的事实,也重新界定了 Jev 真正在卖什么。
每个模型的功能

Jev 是一个 System One 决策模型:它完全不返回任何文本。你发送一个状态,外加若干带类型的问题——Choice(从你提供的列表中选择)、Score(按有序评分量表打分)或 Noul(一个带有校准概率的是/否断言)——它便会返回带置信度的类型化答案。所有问题都会针对状态的同一次共享读取并行评估,这就是为什么增加问题几乎不会改变响应时间,也是为什么输出不产生任何成本:没有输出 token 需要计量。输入为每百万 token 0.042 美元,输出免费,请求预算约为 32,000 个 token。它于 2026 年 9 月 15 日发布,出自 TypeSafe AI,该公司由 Diogo Almeida 创立,并获得了由 DCVC 领投的 4000 万美元种子轮融资。
DeepSeek V4.1 Flash 是一款常规的生成式模型,并不假装自己不是。它于 2026 年 9 月 10 日发布,API id 为 deepseek-flash,采用 552B 参数的混合专家架构,非对称激活为 8B/16B,上下文窗口达 100 万 token,支持文本加图像输入。它逐 token 生成文本,而这恰恰是它每次调用成本更高、每次调用能力更强的原因。它以每秒 208.3 token 的速度运行,首 token 耗时 1.13 秒,定价为高峰时段每百万 token $0.30/$1.20,非高峰时段 $0.15/$0.60。在 Artificial Analysis 上,它的指数为 40——处于中端,而非前沿。
为什么按分类的数学计算会得出这样的结果
一分钱的差距并非偶然,也并不稳定。它源于每个模型各自的计费方式。
• Jev 每次决策的成本基本上是固定的——你只需为对输入执行一次遍历付费,价格为每百万个 token 0.042 美元,而你所问问题的数量几乎不会改变这一成本。一个只需要一个标签的分类和一个需要二十个标签的分类,成本几乎相同。
DeepSeek V4.1 Flash 每次决策的成本随输出规模增长。归类为简短标签很便宜;同一任务,如果你要求给出理由、置信度以及结构化 JSON 封装,输出 token 会是数倍,因此价格也是数倍。
• 高峰时段与低谷时段相比,DeepSeek 的输入价格翻倍,输出价格也翻倍。若在错误的时段批量运行分类任务,那一美分的差距就会变成完全不同的数字。
这就是为什么对差距的独立估算会如此大相径庭。在包含 77 个示例的 BANKING77 测试中,结果是 7¢ 对 8¢。另一项独立的综合基准 JevBench 显示,Jev 为每 1,000 次 0.041 美元,而 DeepSeek V4.1 Flash 为每 1,000 次 0.579 美元——相差十四倍。第三项针对 83 个销售联系人的测试发现,DeepSeek V4.1 Flash 每次运行为 0.183 美元,而 Jev 为 0.0055 美元,相差 33 倍。这些数字相差两个数量级的原因在于,每一项都假设了不同的提示词、不同的输出形态和不同的时段。任何人若把单次分类的数字当作模型本身的属性、而非评测框架的属性来引用,都是在兜售某种东西。
Jev 的结构能带给你、而生成模型无法提供的东西
区别不在于价格,而在于契约。Jev 的输出受模式锁定:由于所有可能的答案在模型运行前就已被穷举——你提供的是选项列表、评分标准或真/假断言——因此不存在任何空间去输出声明类型之外的值。格式错误的响应不是 Jev 能产生的东西。DeepSeek V4.1 Flash 可以通过模式约束为结构化输出,实践中也大多遵守,但这种保证是强先验,而非结构属性。如果你的流水线每月运行一千万次分类,“大多”和“始终”在一份事故报告里就是两条不同的条目。
第二个特性是校准。Jev 使用 TypeSafe 称为 RLCD 的方法训练——即用于校准决策的强化学习(Reinforcement Learning for Calibrated Decisions)——并且每个答案都带有概率分布,因此你的代码可以设置阈值:高于阈值自动接受,处于中间区间标记待查,低于阈值上报升级。如果你向 DeepSeek V4.1 Flash 索要,它会给出一个置信度数值,但那是生成的 token,而非经过校准的输出;生成的置信度是对自身的一种声称,而不是一种测量。这一区别正是值得为决策模型付费的全部理由,也是廉价生成式模型在结构上无法企及的一点。
第三点是延迟形态。Jev 文档记载的端到端延迟为 70–500ms,无论附加多少问题;而在 TypeSafe 自己的对比中,前沿 LLM 调用为 3–329 秒。DeepSeek V4.1 Flash 的 1.13 秒 TTFT 和 208 tokens/秒吞吐量对生成式模型来说非常出色,这也应是评判它的标准——但在生成输出加上首 token 延迟只有几百毫秒的情况下,它每次决策仍需数秒,而不是零点几秒。在 TypeSafe 的内部工作流仪表板上,Jev 在成本和延迟两列胜出,但在准确率列落败:发票处理上为 61.8% 对 79.1%,客户服务上为 76.0% 对 78.3%。该仪表板的参考答案是模型判断的平均值,而非真实标注,且仪表板本身也标记了可能存在评测框架偏差。
上下文差距是真实存在的,而且是单向的。
这里有一个维度并不接近,也不是表述角度的问题。DeepSeek V4.1 Flash 拥有 100 万 token 的上下文窗口;Jev 的请求预算大约是 32,000 个 token。如果你的分类依赖于阅读一整份合同、一段很长的支持对话,或一个大型代码文件,DeepSeek V4.1 Flash 能看到,而 Jev 不能——无论每次决策多么便宜,都无法弥补状态放不下的问题。Jev 在发布时也不接受图像或音频输入,而 DeepSeek V4.1 Flash 接受图像。
另一面是,Jev 的狭窄窗口被当成一种负债而非约束来定价,而 TypeSafe 自家文档里的两阶段模式就是变通办法:对于超出 255 个选项上限的 Choice 字段,先分批为候选项打分,再跨这些分数进行选择。当状态小、选项集大时,这行得通。当状态大时,就行不通。
各归其位
当决策确实是闭式的、状态能容纳在 32K tokens 内、调用量足够大以至于每次调用的秒数是真实成本、并且流水线需要一个可以用来分支的置信度值时,请使用 Jev。护栏检查、智能体循环中的每轮验证、高容量路由,以及并行评分大型文档集,是文档记录的适用场景。
当任务需要读取长内容、需要在给出标签的同时提供理由、需要查看图像,或者当分类是更长生成式工作流中的一个步骤,而将其拆分给第二个供应商只会为了节省一美分而增加一个环节(一个糟糕的提示词就可能让这笔节省化为乌有)时,请选用 DeepSeek V4.1 Flash。并且要注意,“生成模型也能做”是对该任务的正确描述,而不是 Jev 的失败——有趣的问题是,你是否需要置信度值,因为这是比较中生成模型无论出价多少都无法提供的唯一一项。
在一个密钥上运行决策层与生成层

DeepSeek V4.1 Flash 是 OrcaRouter 所路由的模型之一,按提供商标价原价透传、0% 加价——因此 DeepSeek 一上线错峰降价,我们这边当天即可生效,你无需同时追踪两张价目表。Jev 本身我们并不提供:TypeSafe 的这款模型处于早期访问阶段,且使用自己的请求格式。这一对比所指向的架构是双模型架构——Jev 负责决策,DeepSeek V4.1 Flash 负责生成——而 OrcaRouter 以单个兼容 OpenAI 的端点覆盖生成这一半,并具备自动故障转移,因此一个尚未经过验证的决策组件永远不会成为单点故障。200+ 个模型,一个密钥,一张账单。
裁决
如果你来这里,是期待 Jev 比生成式模型便宜得多,那么诚实的答案是:与 DeepSeek V4.1 Flash 相比,它通常并不便宜;而在这个特定的 77 个样本测试中,它便宜了一美分,准确率却低了四个百分点。Jev 卖的不是每次分类的价格。它卖的是一种结构性保证:输出不可能格式错误;一个经过校准的置信度值,你的代码可以据此分支;以及以毫秒而非秒计的延迟下限。这三样东西,在一条运行足够频繁、值得在意的流水线里,值得为之付费——但如果你的任务是读一份 400 页的文档并写出摘要,那它们就毫无价值,因为那是 DeepSeek V4.1 Flash 的活,从来就不是 Jev 的。

