为 Liquid AI 的开放权重决策模型设计的主视觉标题卡,标题为“两个从不写下一个字的模型”,副标题为“Liquid AI d1-3B 与 d1-omni-600M,开放权重,2026 年 10 月 7 日”,三个标签芯片分别标注是/否、选择一个标签并对量表打分,以及一张示意图:一个状态输入单次前向传播,返回一个概率、一个标签和一个分数。
Guides & Insights

Liquid AI d1-3B 与 d1-omni-600M:为从不写下一个字的模型开放权重

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Liquid AI d1-3B 和 Liquid AI d1-omni-600M 于 2026 年 10 月 7 日上线 Hugging Face,而这两个检查点有一个特性,会让你今年读过的每一张对比表都“形状不对”。它们俩都不生成文本。你把一个状态——一张支持工单、一份 JSON 载荷、一张照片,或者三者同时——以及一组具名问题交给 Liquid AI d1-3B,它就会返回直接从模型对你这些选项的分布上摘下来的答案。是/否以概率形式给出。在若干标签中做出选择,并附带置信度和完整的概率向量。在有序量表上给出位置。没有采样步骤,没有需要解析的 JSON,没有失控的生成,而厂商自己的用量计数器把这件事说得明明白白:output_tokens: 0。3B 模型是头条——它在厂商评分的 Decision Index 0.2.1 上拿到 48.57,领先于所有 10B 以下的模型,也领先于一个规模是它十二倍的决策模型。600M 这个同门型号才是值得关注的那个:它通过同一套主干权重读取图像和最长三十秒的语音,并且被标注为早期研究版本。

用一段话说明什么是决策模型

这个类别已经发展了一年,名称诸如 system-one 模型和“并非分类器的分类器”,而 d1 组合是迄今为止对它最清晰的表述。生成式模型被提问,然后写出答案;答案必须被解析,解析可能失败,而且它写出的每一个 token 都要耗费你的金钱和时间。决策模型被提问时,会报告它已经相信的内容。Liquid 的问题分为三种类型。noul 是一个是/否问题,以 0 到 1 之间的 P(yes) 来回答。choice 从命名集合中选取一个标签,并返回该标签、一个置信度,以及每个选项的概率。score 将状态放到一个二到十级的有序量表上,并返回预期级别及其分布和图例。一个状态可以同时承载多个问题,而该状态及其图像会为所有这些问题只读取一次。

最后那个特性正是整个商业价值的核心。一张工单上问三个问题,耗时只是问一个问题的1.3倍,而不是3倍,因为模型对输入只做一次前向计算,就能从中读出多个答案。没有什么需要写出来,也就没有什么会写得糟糕。

3B 和 600M 是从相反方向构建的

这正是本次发布在技术层面变得有趣的地方,也是发布报道大多跳过的部分。这两个模型并非同源。

Liquid d1-3B脱胎于 LFM2.5-VL-3B,也就是该厂商的纯解码器视觉语言模型。它拥有 3.12B 参数、一个 SigLIP2 NaFlex 形状优化 400M 视觉编码器、32,768 token 的上下文窗口、128,000 token 的词表,以及 128,000 种有文档记载的语言。为了构建它,Liquid 将 LFM2.5-2.6B 的权重与 LFM2.5-VL-3B 的文本主干取平均值,对来自若干随机种子和数据混合的检查点进行微调,然后再把结果合并起来。厂商自己对哪些因素真正重要的总结,朴实得令人耳目一新:在长输入上训练、打乱答案选项的顺序,以及追查训练数据中的捷径,这些对最终成绩的贡献都超过任何先进技术。

Liquid AI d1-omni-600M 衍生自 LFM2.5-Encoder-350M,一个双向编码器——完全是另一种网络物种。它总计有 5.87 亿个参数,分为一个 3.81 亿的共享主干与决策头、一个借用自 LFM2.5-VL-450M 的 9,400 万视觉编码器,以及一个由 17 层 FastConformer 构建的 1.12 亿音频编码器。每一种模态都通过同一套主干权重运行。其上下文为 16,384 个 token,同时覆盖文本、图像和音频位置;在附加图像时,状态和问题文本会被截断到 896 个 token,因为训练时采用的就是这个长度。音频有一条警告,卡片中毫不含糊地写道:这项能力是在英语使用者与助手之间的请求上训练的,而且音频片段会在三十秒处截断。

所以这个家族并不是同一模型的两个尺寸版本。它是一个解码器和一个编码器,经后训练以两种截然不同的机制完成同一项任务,其中一个负责看,一个负责听。

A two-column scoreboard for Liquid AI d1-3B and d1-omni-600M showing d1-3B at Decision Index 48.57 with 3.12B parameters, text and image input and 8 ms per question on an RTX 4090, against d1-omni-600M at 15.95 with 587M parameters, text, image and audio input and no reported latency, footed 'All figures vendor-reported by Liquid AI, Oct 7 2026; no independent reproduction.'

数字,以及它们属于谁

本节中的每一个数字都来自 Liquid 自己。d1 模型的决策指数(Decision Index)各行由供应商使用官方评分器打分——并未提交至排行榜——而每一个竞品的行则来自 v0.2.1 版本的公开排行榜。目前尚无任何独立实验室对此进行复现,而就在撰写本文时,这些模型才发布两天。

• Decision Index 0.2.1 — Liquid AI d1-3B 得分为 48.57,各子项得分为知识 23.8、语言 56.4、检索 52.8、工具 74.5 和艺术 36.3。Liquid AI d1-omni-600M 为 15.95,其中工具为 15.1。

• 48.57 所处的位置——在厂商发布的表格中,它在所有低于 10B 的条目里位列第一,并领先于 47.11 的 Decider 35B-A3B。它在整体上排名第二,落后于 50.02 的 Winnow-12B,而后者的规模是它的四倍。

• 文本基准测试,厂商报告数据——d1-3B 在七项公开基准测试中平均得分为 82.9,领先于 Decider 4B 的 81.1;d1-omni-600M 平均得分为 78.4,在参数量大约只有 Decider 2B 四分之一的情况下,击败了后者的 77.1。600M 在该表中取得了最佳的毒性评分(Civil Comments 95.8)以及最佳的复述评分(PAWS-X 79.5)。

• 视觉,厂商报告 — d1-3B 在十一项公开图像基准测试上的平均得分为 74.1,这些基准测试被解读为对每项基准选项作出决策,而其 LFM2.5-VL-3B 主干模型的得分为 73.9。移除图像后,同样的问题得分降至 45.1,厂商借此表明答案来自像素。

• 延迟,厂商实测——在 RTX 4090 上,回答一个问题耗时 8 毫秒,在 AMD MI325X 上耗时 9 毫秒;在 Jetson AGX Thor 上耗时 16 毫秒,在 Jetson AGX Orin 64 GB 上耗时 26 毫秒,在最小的 Jetson Orin Nano 上耗时 50 毫秒,在 Apple M5 Pro 上耗时 30 毫秒。在 4090 上,将 64 个状态打包进单次遍历,每秒可运行 475 次。

• 缺失的内容——d1-omni-600M 完全没有推理性能表。Liquid 表示它仍处于积极开发阶段,因此干脆没有报告它的延迟数据。整个发布材料中也完全找不到音频决策基准测试,因为用厂商的话说,专门的音频决策基准测试目前仍是一个悬而未决的问题。

新闻稿真正要提出的主张

在权重上调的两天前,Liquid 发布了该模型的托管版本,并在六个应用上让它与 GPT-6.1 Sol 和 Claude Opus 5.5 进行对比测试。其总结是:d1 在其中四个应用上追平或胜过 GPT-6.1 Sol,成本仅为后者的 1/19 到 1/200,并且在每项任务上回答都更快。在复述以上任何内容之前,值得先读一读其公布的方法论——每个应用在 2026 年 10 月 5 日对每个模型各运行一次,聊天模型以 JSON 格式在其默认推理设置下作答,而 d1 的成本是按每百万输入 token 0.04 美元计算的。

这些演示是更有说服力的那一半。从四条生产线——电路板、蜡烛、腰果、口香糖——分拣良品和次品,准确率在85%到97%之间,而模型从未针对该任务训练过,仅通过简短描述就理解了任务。一个SQL谓词,为150张支持工单中的每一张回答是或否。一个上下文压缩循环,读取编码代理会话中的每个工具输出,并保留、修剪或丢弃它,移除了52%的token,同时保留任务所需的每一个输出。在Tetris中,将屏幕添加到一款完全可用文字描述的游戏,将得分从清除70行提升到81行——这是无论纯文本分类器多好都无法获得的视觉结果。

那些是由供应商主导的演示,任务也由供应商挑选,方法学部分也说明了这一点。它们仍然是任何人所发表的、关于决策模型用途的最清晰图景。

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as open-weight models, d1-3B's Decision Index score of 48.57, and its latency figures of 8 ms on an RTX 4090, 16 ms on a Jetson AGX Thor and 26 ms on a Jetson AGX Orin.

运行位置,以及调用费用

开放权重是为本地执行而打造的,而且厂商已经提前完成了集成工作:首日就支持 llama.cpp、从 DGX 到 Jetson 的完整 NVIDIA 技术栈、NVFP4 量化,以及随基础检查点一同发布的 8 位权重/激活变体。GGUF 转换版本已经上线 Hugging Face。如果你不想自己托管任何东西,Liquid 会通过自家 API 提供托管的 d1——仅按输入 token 计费,输出 token 不计费,图像按输入计费,每 32×32 像素的图像块计 1.5 个 token,因此一张 1024×1024 的图像为 1,536 个 token。纯文本访问也可通过第三方平台获取。

诚实的路由说明:Liquid AI d1-3B 和 Liquid AI d1-omni-600M 都不在我们的目录中,本文也不是对其中任何一款的可用性声明。d1 这对模型给路由器带来的改变,在于其周围流水线的形态。一个以毫秒级作答、且输出 token 零成本的决策模型是过滤器,而不是替代品——良品与次品分拣和工单分类发生在生成调用之前,而生成调用,才是让一个覆盖 200+ 模型的单一端点,以 0% 加价透传的标价,以及 自动故障转移真正物有所值的地方。不同的层,同一条流水线。

什么才能解决这场争论?

有三件事悬而未决,而这三件都属于只有时间才能了结的那一类。

第一点是独立复现。Decision Index 的数值由供应商使用官方评分器生成,每一行竞争对手的数据都取自公开排行榜,这是一种站得住脚的方法,但与第三方运行你的模型并不是一回事。第二点是音频。一个能在单次前向传播中路由语音命令的 600M 检查点,是一项真正全新的能力,而目前并不存在任何基准来衡量它在这件事上做得有多好。第三点是范畴本身:当答案是从一个分布中读出来的,而不是写出来的,小模型通常的失效模式——循环、漂移、拒答、幻觉出某种格式——根本不会发生,而没有人发表过关于什么会取代它们的像样论述。校准误差是显而易见的候选,而每个答案上的置信度字段恰恰在邀请你自己去测量它。

十个演示在公共 Hugging Face Space 中循环运行 Liquid AI d1-3B,处理实时摄像头输入,这是形成你自己看法的最便宜方式。权重免费,问题也具体。这比今年大多数发布所提供的起点都要好。

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新