一张主视觉标题卡,标题为“Liquid AI d1-3B vs LFM2.5-2.6B-Base”,副标题为“决策模型及其自身祖先”,以从左到右的家族树形式绘制:一张标有“LFM2.5-2.6B-Base 原始权重”的卡片,一个标有“后训练”的箭头,以及一张标有“d1-3B 回答问题”的卡片,左侧卡片下方有一个“保留训练”标签块,右侧卡片下方有“是/否”、“标签”和“分数”三个标签块。
Guides & Insights

Liquid AI d1-3B 与 LFM2.5-2.6B-Base:决策模型及其自身的祖先

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

这不是两个竞争对手之间的对决。Liquid AI d1-3B 是 Liquid AI 于 2026 年 10 月 7 日发布的开放权重决策模型,它建立在一个底座之上——该底座由厂商将 LFM2.5-2.6B 的权重与 LFM2.5-VL-3B 的文本主干进行平均而构建。LFM2.5-2.6B-Base 就是那第一个亲本——Liquid 于 2026 年 8 月 1 日上传的原始预训练检查点,2.69B 参数,34 万亿训练 token,131,072 token 上下文,无指令微调,也无聊天模板。所以,对这场比较最诚实的框定是后裔对祖先:一个已被后训练以胜任某项非常具体工作的模型,站在它被塑造时所依据的那块未经雕琢的基底旁边。其中一个今晚就能回答问题。另一个则是当你要回答的问题尚无人提出时,你起步的地方。

每一个到底是什么

这两份模型卡读起来像是来自生产线不同阶段的文件,而它们之间的差异并非风格上的。

Liquid AI d1-3B 拥有 31.2 亿参数、一个 4 亿参数的 SigLIP2 NaFlex 视觉编码器、32,768 个 token 的上下文窗口、128,000 个 token 的词表以及十六种有文档记录的语言。它是一个决策模型:你向它提供一个状态和命名问题,它就会在一次前向传播中返回一个是/否概率、一个带有置信度的选定标签和完整选项分布,或一个有序分数——且不生成任何输出 token。它附带一个 system_one 调用,用于一个状态搭配多个问题;一个可在无填充的情况下打包许多请求的批处理变体;以及一个原始 probabilities 访问器,用于获取底层分布。它不是聊天模型,也不撰写文本,模型卡就是这么原话说的。

LFM2.5-2.6B-Base在 30 层中承载 2.69B 参数——22 个双门控短卷积块和 8 个分组查询注意力块——基于 34 万亿个 token 训练,并在中期训练期间扩展至 131,072 token 的上下文,采用相同的 128,000 token 词表和相同的十六种语言。它是一个仅文本的预训练检查点,没有指令微调,其模型卡上没有任何基准测试结果,而其中一条建议读起来像是警告:仅将其用于需要大量微调的任务。它能补全文本。它不会遵循指令。

两者均为采用Liquid自有开放许可证的无限制下载,且均以文本为主。二者均未收录于我们的目录中,此处亦不构成对二者可用性的任何主张。

A two-column scoreboard for Liquid AI d1-3B and LFM2.5-2.6B-Base. The d1-3B column reads: role post-trained decision model; 3.12B parameters; 32,768-token context; text and image input; Decision Index 48.57 (vendor); answers a question in 8 ms. The base column reads: role raw pre-trained base; 2.69B parameters; 131,072-token context; text-only input; Decision Index not scoreable; answers a question only after you fine-tune. The footer reads 'd1-3B figures vendor-reported; the base checkpoint publishes no benchmark table.'

传承才是有意思的部分。

Liquid 并没有为了发布 d1 而微调一个全新的模型。它将两个检查点——LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本塔——取平均,以获得更好的起点,然后用不同的随机种子和数据混合方式进行了多次微调,并将这些结果再合并回去。厂商对是什么改进了结果的说明明显不含任何奇特技术:在长输入上训练、打乱答案选项出现的顺序,以及从训练数据中移除捷径,比他们尝试过的任何高级方法都更有效。

消除捷径的这个细节值得停下来想一想,因为它点明了这一类别存在的目的就是要避免的失败模式。一个被训练来回答多项选择题的模型,会欣然学会认为选项 B 通常是对的,或者最长的选项会赢。在训练中打乱选项顺序,正是阻止这一点的关键。一个学到的是位置先验、而不是去读取状态的决策模型,比无用还糟糕——它会在大规模上自信地犯错——而这正是区分真正的决策模型和带提示词的分类器的具体所在。

还有一个值得直说的退步,因为厂商不会明说:基础检查点拥有 131,072 个 token 的上下文窗口,而 Liquid AI d1-3B 只有 32,768。后训练成决策模型,代价是损失了四分之三的可用上下文。如果你以为后代在每一个维度上都严格优于祖先,那并非如此,而长文档决策正是较旧检查点拥有更多空间的维度——理论上如此,尽管它没有决策头来利用这一点。

记分板,附带不对称性

将这两者在基准测试上进行比较是一种范畴错误,但这是一种具有信息量的范畴错误,所以这里在列明注意事项的情况下把它摆出来。d1-3B 的每一个数字都来自 Liquid 自己,是由厂商用官方评分器评出的,而不是提交到公开排行榜上的结果,并且没有任何第三方复现过。LFM2.5-2.6B-Base 的每一个数字都缺位,因为基础模型没有什么可测量的。

• Decision Index 0.2.1 —— Liquid AI d1-3B 48.57,在厂商表格中所有 10B 以下的模型里排名第一,并领先于一个规模是其十二倍的决策模型。LFM2.5-2.6B-Base —— 未评分,且在没有决策头的情况下无法评分。

• 文本基准 —— Liquid AI d1-3B 在涵盖理解、毒性、意图、医学问答和跨语言理解的七项公开基准上平均得分为 82.9。而 LFM2.5-2.6B-Base 则完全没有公布任何基准表。

• 视觉 — Liquid AI d1-3B 在十一项按决策方式解读的图像基准测试中平均得分为 74.1;移除图像后,同样的问题得分降至 45.1。LFM2.5-2.6B-Base 为纯文本模型,没有视觉塔。

• 参数——3.12B 对 2.69B。决策模型是两者中较大的那个,这与通常的后训练叙事相反。

• 上下文 — 32,768 个 token 对 131,072 个。祖先项赢下这一行,而这是它唯一赢下的一行。

• 延迟 — Liquid AI d1-3B 在 RTX 4090 上可在 8 毫秒内回答单个问题,在 Jetson Orin Nano 上为 50 毫秒,并在 4090 上以每秒 475 个的速度运行 64 个打包状态。LFM2.5-2.6B-Base 没有可引用的延迟数据,直到你将其微调成能回答问题的模型;而到那时,这个数字就是你微调后模型的延迟。

A capture of Liquid AI's documentation page for its decision models, showing the left-hand navigation including Decision Models and Liquid Nanos, the 'Open d1' banner announcing that visitors can now run d1-3B and d1-omni-600M locally, and the page's opening description of purpose-built models for structured decisions such as classification, routing and scoring in a single call with zero generation.

在实践中,你是在什么之间做选择

这里的决策规则异常清晰,因为这两个检查点并不在争夺同一条预算线。

Liquid AI d1-3B真正引人注目的是那个检查演示:在四条生产线上做良品与次品的分拣,准确率达到 85% 到 97%,而这还是模型从未训练过的任务——它仅凭一段简短描述就理解了。

LFM2.5-2.6B-Base适用于问题尚不存在的场景。对于你打算自己拥有的微调而言,它是更便宜的起点——一个领域决策头、一个定制分类器、一个还没有人做过检查点的任务。你继承了架构、分词器和长上下文,而付出的是算力、数据和评估。厂商围绕 d1 打造的四款应用中,有两款是从开源项目起步,而非从零开始,这恰好真实地展现了基础检查点加上纪律究竟能产出什么。

实际的陷阱在于把基础检查点当成可以直接替换使用的现成模型。它不是助手,不会遵循提示词,而若按聊天模型来评测,它的得分接近于零——这并不是关于它质量的事实,而是关于“基础”一词含义的事实。

自托管其中任意一个,以及其上一层

两者都以权重形式提供,而供应商为 d1 这一侧完成了部署工作:首日即支持 llama.cpp,覆盖从 DGX 到 Jetson 的完整 NVIDIA 技术栈,NVFP4 量化,一个 8 位权重与激活变体,以及在 Hugging Face 上的 GGUF 转换。基础检查点则通过更广泛的 LFM2.5 系列,自身提供 GGUF、ONNX 和 MLX 变体。如果你不想自行托管任何内容,Liquid 提供托管的 d1,来自其自有 API,仅按输入 token 计费,图像按每 32×32 像素区块 1.5 个 token 计费;纯文本访问也可通过第三方平台获取。

两条路径都不会改变的是技术栈的其余部分。你自行托管的模型,就是你必须维持运行、管理版本并做好故障转移的模型——而它喂给下游的决策,最终仍会落在你并不托管的那部分生成式调用旁边。这种混合正是路由器所压平的那一层:一个端点横跨 200 多个模型,以 0% 加价原样透传的供应商标价,因此厂商调价当天你这边就会生效,以及 自动故障转移,让某家上游的糟糕下午不会演变成你的服务中断。在此基础上自行托管一个 3B 决策模型,只会让路由问题更尖锐而非更缓和,因为此时一半流水线归你所有,另一半则是租来的。

哪一个,给谁

如果你这周需要回答的问题,属于决策模型所呈现的三种形态之一,而且是一个别人已经设想出来的问题,那么它的衍生版本已经完成、免费,并且能在没有 GPU 的设备上以 50 毫秒运行——直接采用 Liquid AI d1-3B 就完事了。

如果你正在打造的是那个能回答尚无人提出的问题的东西,并且你有足够的数据和算力去把它做出来并拥有它,那么 LFM2.5-2.6B-Base 就是一个诚实的起点;而且值得知道的是,本文中的衍生模型正是沿着你即将踏上的那条路线从它而来的。

如果你不确定自己处于这两种情况中的哪一种,答案几乎总是第一种。对决策头进行后训练是代价高昂的做法;运行别人的则是免费的。

A capture of our own models catalogue page, showing the filter rail for input modalities, context length, input price, status, series and supported parameters, a header reading '207 models, 16 providers, one API key, one bill', sort control set to Newest, a model listing beginning with openai/gpt-5-search-api-2025-10-14, and a 'How to call any model' panel with the OpenAI-compatible endpoint https://api.orcarouter.ai/v1/chat/completions.