
Liquid AI d1-3B 与 LFM2.5-2.6B-Base:决策模型及其自身的祖先
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 62 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 358 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
这不是两个竞争对手之间的对决。Liquid AI d1-3B 是 Liquid AI 于 2026 年 10 月 7 日发布的开放权重决策模型,它建立在一个底座之上——该底座由厂商将 LFM2.5-2.6B 的权重与 LFM2.5-VL-3B 的文本主干进行平均而构建。LFM2.5-2.6B-Base 就是那第一个亲本——Liquid 于 2026 年 8 月 1 日上传的原始预训练检查点,2.69B 参数,34 万亿训练 token,131,072 token 上下文,无指令微调,也无聊天模板。所以,对这场比较最诚实的框定是后裔对祖先:一个已被后训练以胜任某项非常具体工作的模型,站在它被塑造时所依据的那块未经雕琢的基底旁边。其中一个今晚就能回答问题。另一个则是当你要回答的问题尚无人提出时,你起步的地方。
每一个到底是什么
这两份模型卡读起来像是来自生产线不同阶段的文件,而它们之间的差异并非风格上的。
Liquid AI d1-3B 拥有 31.2 亿参数、一个 4 亿参数的 SigLIP2 NaFlex 视觉编码器、32,768 个 token 的上下文窗口、128,000 个 token 的词表以及十六种有文档记录的语言。它是一个决策模型:你向它提供一个状态和命名问题,它就会在一次前向传播中返回一个是/否概率、一个带有置信度的选定标签和完整选项分布,或一个有序分数——且不生成任何输出 token。它附带一个 system_one 调用,用于一个状态搭配多个问题;一个可在无填充的情况下打包许多请求的批处理变体;以及一个原始 probabilities 访问器,用于获取底层分布。它不是聊天模型,也不撰写文本,模型卡就是这么原话说的。
LFM2.5-2.6B-Base在 30 层中承载 2.69B 参数——22 个双门控短卷积块和 8 个分组查询注意力块——基于 34 万亿个 token 训练,并在中期训练期间扩展至 131,072 token 的上下文,采用相同的 128,000 token 词表和相同的十六种语言。它是一个仅文本的预训练检查点,没有指令微调,其模型卡上没有任何基准测试结果,而其中一条建议读起来像是警告:仅将其用于需要大量微调的任务。它能补全文本。它不会遵循指令。
两者均为采用Liquid自有开放许可证的无限制下载,且均以文本为主。二者均未收录于我们的目录中,此处亦不构成对二者可用性的任何主张。

传承才是有意思的部分。
Liquid 并没有为了发布 d1 而微调一个全新的模型。它将两个检查点——LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本塔——取平均,以获得更好的起点,然后用不同的随机种子和数据混合方式进行了多次微调,并将这些结果再合并回去。厂商对是什么改进了结果的说明明显不含任何奇特技术:在长输入上训练、打乱答案选项出现的顺序,以及从训练数据中移除捷径,比他们尝试过的任何高级方法都更有效。
消除捷径的这个细节值得停下来想一想,因为它点明了这一类别存在的目的就是要避免的失败模式。一个被训练来回答多项选择题的模型,会欣然学会认为选项 B 通常是对的,或者最长的选项会赢。在训练中打乱选项顺序,正是阻止这一点的关键。一个学到的是位置先验、而不是去读取状态的决策模型,比无用还糟糕——它会在大规模上自信地犯错——而这正是区分真正的决策模型和带提示词的分类器的具体所在。
还有一个值得直说的退步,因为厂商不会明说:基础检查点拥有 131,072 个 token 的上下文窗口,而 Liquid AI d1-3B 只有 32,768。后训练成决策模型,代价是损失了四分之三的可用上下文。如果你以为后代在每一个维度上都严格优于祖先,那并非如此,而长文档决策正是较旧检查点拥有更多空间的维度——理论上如此,尽管它没有决策头来利用这一点。
记分板,附带不对称性
将这两者在基准测试上进行比较是一种范畴错误,但这是一种具有信息量的范畴错误,所以这里在列明注意事项的情况下把它摆出来。d1-3B 的每一个数字都来自 Liquid 自己,是由厂商用官方评分器评出的,而不是提交到公开排行榜上的结果,并且没有任何第三方复现过。LFM2.5-2.6B-Base 的每一个数字都缺位,因为基础模型没有什么可测量的。
• Decision Index 0.2.1 —— Liquid AI d1-3B 48.57,在厂商表格中所有 10B 以下的模型里排名第一,并领先于一个规模是其十二倍的决策模型。LFM2.5-2.6B-Base —— 未评分,且在没有决策头的情况下无法评分。
• 文本基准 —— Liquid AI d1-3B 在涵盖理解、毒性、意图、医学问答和跨语言理解的七项公开基准上平均得分为 82.9。而 LFM2.5-2.6B-Base 则完全没有公布任何基准表。
• 视觉 — Liquid AI d1-3B 在十一项按决策方式解读的图像基准测试中平均得分为 74.1;移除图像后,同样的问题得分降至 45.1。LFM2.5-2.6B-Base 为纯文本模型,没有视觉塔。
• 参数——3.12B 对 2.69B。决策模型是两者中较大的那个,这与通常的后训练叙事相反。
• 上下文 — 32,768 个 token 对 131,072 个。祖先项赢下这一行,而这是它唯一赢下的一行。
• 延迟 — Liquid AI d1-3B 在 RTX 4090 上可在 8 毫秒内回答单个问题,在 Jetson Orin Nano 上为 50 毫秒,并在 4090 上以每秒 475 个的速度运行 64 个打包状态。LFM2.5-2.6B-Base 没有可引用的延迟数据,直到你将其微调成能回答问题的模型;而到那时,这个数字就是你微调后模型的延迟。

在实践中,你是在什么之间做选择
这里的决策规则异常清晰,因为这两个检查点并不在争夺同一条预算线。
Liquid AI d1-3B真正引人注目的是那个检查演示:在四条生产线上做良品与次品的分拣,准确率达到 85% 到 97%,而这还是模型从未训练过的任务——它仅凭一段简短描述就理解了。
LFM2.5-2.6B-Base适用于问题尚不存在的场景。对于你打算自己拥有的微调而言,它是更便宜的起点——一个领域决策头、一个定制分类器、一个还没有人做过检查点的任务。你继承了架构、分词器和长上下文,而付出的是算力、数据和评估。厂商围绕 d1 打造的四款应用中,有两款是从开源项目起步,而非从零开始,这恰好真实地展现了基础检查点加上纪律究竟能产出什么。
实际的陷阱在于把基础检查点当成可以直接替换使用的现成模型。它不是助手,不会遵循提示词,而若按聊天模型来评测,它的得分接近于零——这并不是关于它质量的事实,而是关于“基础”一词含义的事实。
自托管其中任意一个,以及其上一层
两者都以权重形式提供,而供应商为 d1 这一侧完成了部署工作:首日即支持 llama.cpp,覆盖从 DGX 到 Jetson 的完整 NVIDIA 技术栈,NVFP4 量化,一个 8 位权重与激活变体,以及在 Hugging Face 上的 GGUF 转换。基础检查点则通过更广泛的 LFM2.5 系列,自身提供 GGUF、ONNX 和 MLX 变体。如果你不想自行托管任何内容,Liquid 提供托管的 d1,来自其自有 API,仅按输入 token 计费,图像按每 32×32 像素区块 1.5 个 token 计费;纯文本访问也可通过第三方平台获取。
两条路径都不会改变的是技术栈的其余部分。你自行托管的模型,就是你必须维持运行、管理版本并做好故障转移的模型——而它喂给下游的决策,最终仍会落在你并不托管的那部分生成式调用旁边。这种混合正是路由器所压平的那一层:一个端点横跨 200 多个模型,以 0% 加价原样透传的供应商标价,因此厂商调价当天你这边就会生效,以及 自动故障转移,让某家上游的糟糕下午不会演变成你的服务中断。在此基础上自行托管一个 3B 决策模型,只会让路由问题更尖锐而非更缓和,因为此时一半流水线归你所有,另一半则是租来的。
哪一个,给谁
如果你这周需要回答的问题,属于决策模型所呈现的三种形态之一,而且是一个别人已经设想出来的问题,那么它的衍生版本已经完成、免费,并且能在没有 GPU 的设备上以 50 毫秒运行——直接采用 Liquid AI d1-3B 就完事了。
如果你正在打造的是那个能回答尚无人提出的问题的东西,并且你有足够的数据和算力去把它做出来并拥有它,那么 LFM2.5-2.6B-Base 就是一个诚实的起点;而且值得知道的是,本文中的衍生模型正是沿着你即将踏上的那条路线从它而来的。
如果你不确定自己处于这两种情况中的哪一种,答案几乎总是第一种。对决策头进行后训练是代价高昂的做法;运行别人的则是免费的。

