
Decision 3.0 已上线 Hugging Face:六个开放多模态决策模型,仅在 X 上公布
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens · 71 tok/s
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
Decision 3.0已经有了一个你现在就能下载的版本,而几乎没有人把它写下来。六个检查点——d3、d3-flash、d3-mini、d3-nano、d3-lite和d3-edge——于 2026 年 10 月 10 日出现在 Hugging Face 上的 vllm-sr 组织下,从 UTC 09:38 开始按最新优先排列,最后以 d3-edge 在 UTC 23:49 收尾。它们采用 Apache-2.0 许可,基于 Qwen3.5 和 Qwen3.8 主干构建,对选择题、是/否题和评分题会给出每个选项的概率,而不是生成一个 token;六个中有五个现在能读取图像和视频。每张模型卡都自称“vLLM Semantic Router 的决策模型 Decision 3.0 的 27B 多模态基础决策模型”,也就是 vLLM 项目的开放决策层。
缺失的是发布公告。vLLM 项目的 X 账号于 10 月 11 日祝贺 vLLM-SR 团队发布,并引用了维护者本人的介绍帖串——这就是全部的公开记录。该项目的博客索引仍停留在 10 月 10 日,最后一篇文章讲的是路由决策模型,而非这些模型。vllm-project/semantic-router的 GitHub releases 页面最高仍只到 9 月 27 日的 v0.4.0。权重已发布,发布说明却尚未发布。
这个区别对于你如何阅读以下所有内容很重要。本文中的每一个性能数字都来自 vLLM-SR 自己的模型卡,是用他们自己的测试框架在他们自己的硬件上测得的。这里没有任何内容经过外部第三方的复现,而他们发布结果的榜单也是由他们自己维护的。这是对一件真实存在的产物和一项尚未经过审计的声明所作的一次早期、诚实的解读。
Hugging Face 上究竟有什么?
这六个仓库结构简单、完整,且彼此一致。每个仓库都包含 safetensors 权重、一个对话模板、一个decision_config.json(用于锁定基础模型的修订版本)、自定义建模代码(modeling_d3.py、d3_engine.py、d3_server.py),一个位于独立readout.safetensors中的读出头,以及一个MODEL_MANIFEST.json,其中为每个文件记录了 SHA-256 校验值。第七个仓库即集合页面,列出了全部六个仓库。
这个系列,按尺寸排序如下:
• d3 — 26.09B 参数(包含 0.46B 视觉编码器),基于 Qwen/Qwen3.8-27B 构建。上传于 10 月 10 日 09:38 UTC。
• d3-flash — 8.39B,包含一个 0.46B 的视觉编码器,基于Qwen/Qwen3.5-9B。
• d3-mini — 总计 4.54B,其中包含一个 0.33B 的视觉编码器,基于 Qwen/Qwen3.5-4B 构建。
• d3-nano——2.21B,其中包括 0.33B 的视觉编码器,构建于Qwen/Qwen3.5-2B。
• d3-lite — 0.85B,其中包含 0.10B 视觉编码器,基于 Qwen/Qwen3.5-0.8B构建。
• d3-edge — 0.59B,其中包含 0.10B 的视觉编码器,同样基于Qwen/Qwen3.5-0.8B构建。最后上传,UTC 23:49。
这六个都遵循相同的请求契约:一个状态(文本或 JSON,可选带图像和视频),再加上一个具名问题字典,响应为带类型标注的概率分布。问题共有三种类型——Choice、Noul(是/否)、Score——模型在一次调用中即可回答全部问题,其方式是对同一输入为每个问题各运行一次前向传播,全程没有任何解码循环。

数字,以及它们属于谁
vLLM-SR 发布了一个它称之为 Jev Decision Index 0.3.1 的排行榜,并将 d3 置于榜首。主要排名行,均为厂商自行报告:
• d3 — 指数 64.7,公开测试套件 65.5,同技能测试 62.8,新领域任务 56.6。
Perplexity Decider v1.1 (27B) 62.8、62.3、61.1、55.6。
• Fastino GLiDE 无思考(28B) — 60.2、59.1、59.5、52.9。
• Jev — 60.1、58.0、58.0、55.0。
• Torchcast Decision 27B — 59.9、65.1、58.1、50.8。
• Decision 2.0 (27B),上一代 — 55.9、57.0、55.7、47.9。
d3 卡片上的一处脚注直言不讳地指出,d3 自己那一行是内部评估,而对比行则是 10 月 10 日读取的实时榜单数据。这是应当做出的正确披露,而且值得读上两遍:竞争对手的数字取自某个榜单,而受试对象的数字则是由构建该模型的团队产出的。卡片还声称,所有 140,178 个公开请求都得到了回答,没有一个未获支持——这是覆盖率声明,而非准确性声明,而且发布这样一项声明并不寻常。

规模较小的检查点报告出来的成绩步调一致。每张卡都给出一个公开评测集分数,以及与 Decision 2.0 中同等规模模型相比的差值:d3-flash 57.79,较前代 9B 提升 11.0;d3-mini 54.90,提升 10.7;d3-nano 42.22,提升 12.2;d3-lite 36.93,提升 16.4;d3-edge 28.82,提升 12.1。相对增益在规模区间的底端最大,如果多模态预训练配方对小模型的作用比对大模型更大,这正是你会预期看到的结果——也是你把小模型调优得最狠时会得到的结果。从外部无从分辨究竟是哪一种。
多模态部分才是真正的变化
Decision 2.0 的模型读取文本。Decision 3.0 的模型读取文本、图像和视频,这才是两代之间实质性的区别——而非索引变动。每张卡片都将图像输入列为 PNG、JPEG 或 WebP,以路径、URL、PIL 图像或 base64 数据 URL 的形式提供,每次请求可包含多张,每张最高 1.6 百万像素;视频则为 MP4、WebM、MOV 或 MKV,或以帧数组形式提供,以每秒 2 帧的速度读取,整个片段最多 32 帧,每帧最高 0.2 百万像素。请求中的每个问题都会看到附加给它的每张图像和每个视频。
视频的支持证据是在全部 19,140 道验证题上的 Perception Test 结果:d3 为 77.4,d3-flash 为 73.3,d3-mini 为 70.3,d3-nano 为 63.5,d3-lite 为 59.3,d3-edge 为 46.6,而三道选项题的有记录随机猜测下限为 33.3。vLLM-SR 将此标注为内部评估。d3 还带有一个视觉榜单,将其列为总体 71.6,领先于 Perplexity Decider v1.1 的 70.6 和 JEV-27B-VL 的 69.6,而对比行同样取自榜单数据,而非由作者运行。
这些吞吐量数据是单请求、单 GPU 的,并且也如实标明:d3 回答一个文本请求的中位时间为 55 毫秒,一个携带图像的请求为 273 毫秒,一个携带十秒视频的请求为 553 毫秒,且是在一块 AMD Instinct MI325X 上。d3-edge 做同样的事则分别为 6.7 毫秒、41.9 毫秒和 308.3 毫秒。这些是每次提问的中位数,针对的是一个被设计为在一个工作流内被多次调用的模型;对于这些模型所面向的架构而言,这才是真正重要的数字——二十个连续决策,每个额外多花 100 毫秒,总计就要两秒,正如 Microsoft 本月就自家决策模型提出的同样观点。
代码仓库没有说的事
在任何人围绕这一点制定计划之前,有三处缺口值得先点明。
首先是输入预算。decision_config.json中,对于最大的模型集合,把max_length设为 null,并且没有任何卡片为状态、问题加选项描述声明 token 上限。Decision 1.0 的卡片公布了明确的预算——编码器分支 1,024 个 token,解码器分支 16,384 个——这些数字是实实在在的规划约束。它们在此处的缺失很惹眼,而这是后续提交所能补充的最有用的东西。
第二项是准确率。决策模型最重要的数字并非准确率,而是 0.9 是否意味着十次中有九次。视觉和文本指标对此只字未提。这六张卡片中没有任何一张给出 Brier 分数、期望校准误差数值或温度参数。InternLM 于 9 月针对其自家决策模型公布了两项;而 vLLM-SR 则未公布,该系列的任何成员都没有。
第三点是独立性。Decision 2.0 的模型已经历了两周的外部使用;Decision 3.0 的模型则只有几个小时。10 月 11 日的下载量——d3 为 130,d3-lite 为 83,d3-nano 为 82——是一次上传留下的痕迹,而非被采用的证明。请把上文的每一项指标数值都当作一个附带代码仓库的假设来对待。
这在当今可调用的技术栈中的位置
关于决策模型,实际的问题是它能否直接接入一个已经存在的流水线;而在这里,生态系统的进展比模型本身更靠前。这些模型使用的 System One 请求格式并非 vLLM-SR 专有:它正是调用托管 Jev 模型时所用的同一套状态与具名问题契约,这也是为什么“Jev”既作为 d3 模型卡中的索引名称出现,又作为其排行榜上的一行出现。
OrcaRouter 承载着该家族的那一侧。typesafe/jev-1.13 已在我们的目录中,并通过 POST /v1/systemone 提供服务——同一契约,价格为 每百万输入 token $0.042,无补全费用,因为没有补全,最高约 64K 输入 token,输入文本,输出结构化 JSON,非流式。这正是决策层如今会调用的那类模型。有两件事我们并不声称:d3 以及 Decision 3.0 的其余部分不在我们的目录中,而且 Decision 3.0 的本地推理路径是 Hugging Face 仓库中的一个 Python 类,而不是我们即使想路由也无法路由的端点。在这里,路由器确实能为你带来的,是循环另一侧的东西——即依据决策采取行动的生成式模型,通过一个密钥在 200 多个模型之间路由,并在提供商出现波动时自动故障转移,因此,在工作流前面增加一个评分步骤,并不意味着还要增加第二个供应商关系。
什么会改变这张图?
四件事,大致按它们能提供多少信息量的顺序排列。一篇来自该项目的博客文章,说明输入预算和预期的部署形态——这能确认这是一次正式发布,而非一轮宣传造势。任何一个检查点上的 Brier 分数或 ECE 数值。由第三方在发布的权重上运行公开评测套件,而不是只读那份索引。以及一个运行时——semantic-router 仓库在 10 月 11 日提交了两个 commit,把 d3 和 d3-edge 接入其模型运行时,其中包含视频输入,这表明服务方案正在搭建,而它将成为让这些模型试用成本变得低廉的关键。
至少在那些东西中的第一个落地之前,最诚实的总结是这样的:Hugging Face 上有一个完整的、Apache-2.0 许可的、真正多模态的决策模型系列,规模从 0.6B 到 27B,发布时带有异常良好的溯源信息——文件哈希、固定的基础版本修订、声明的硬件目标——却异常缺少能让你判断是否该使用它的周边文档。下载它不花什么代价。相信那份索引则应该再等等。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
