
Liquid AI d1-3B 与 Intern-Decision-4B:你实际需要哪个校准决策器?
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
两个开放权重模型如今通过什么都不写来回答问题,而除非你把它们的 I/O 模式并排放在一起,否则它们看起来就像是同一个想法出现了两次。Liquid AI 的 d1-3B 于 2026 年 10 月 5 日上传到 Hugging Face,两天后由 Liquid 发布,是一个 3.12B 多模态决策模型,其模型卡直白地写着它“不是聊天模型,也不写文本”。InternLM 的 Intern-Decision-4B 于 2026 年 9 月 26 日悄然上传到 InternLM 组织,背后没有博客文章、没有推文,也没有发布页面,是一个基于 Qwen3.5-4B 微调的 4B 决策模型,同样在一次前向传播中为每个问题返回一个答案分布。表面上契约相同。底层差异——一份会给你带来麻烦的许可证、一份可能意外写出文本的契约,以及无人比较过的机器——才决定了哪一个该放进你的技术栈。
这两者到底有多接近
首先要弄清楚的是,这个比较中有多少其实是平局。两个模型都接收一个状态和一组命名问题的模式,都在占位符位置从 logits 读取信号,而不是进行采样;两者都是多模态的,而且两者都报告说自己什么都没写。就调用的形态而言,它们几乎完全相同,而有趣的区别在于边缘细节之中。
• 规模 — Liquid AI d1-3B 总参数量 3.12B,基于 Liquid 的 LFM2.5-VL-3B 构建;Intern-Decision-4B 4B(按模型卡上印出的张量数量计算约为 4.54B),从 Qwen3.5-4B 微调而来
• 问题类型 — d1-3B 和 Intern-Decision-4B 使用相同的三种:noul 用于是/否,choice 用于从一组命名选项中选一个,score 用于有序量表上的一个分值
• 答案字段——d1-3B 返回答案以及置信度和概率;InternLM 模式返回分布以及一个置信度值,模型卡警告该值并非经过校准的概率
• 输入上限 —— d1-3B 支持 32,768 个 token 的上下文;Intern-Decision-4B 则有 8,192 个 token 的上限,对更长的请求会直接拒绝,而不是截断,图像也会计入其中
• 许可证 — d1-3B 采用 Liquid 的 LFM Open License v1.0,InternLM 侧采用 Apache 2.0
• 语言 — d1-3B 列出 16 种;Intern-Decision-4B 的卡片显示无
• 接口 — d1-3B 以模型形式发布,您加载并通过 trust_remote_code=True 调用;Intern-Decision-4B 以 Python 库形式发布,您通过 pip install 安装,其仅有一个已实现的后端,且请求自身的 model 字段明确无法切换检查点
• 厂商自己的得分——d1-3B 在 Decision Index 0.2.1 公开划分上为 48.57;Intern-Decision-4B 在其自身的七集表格上平均为 90.02,Brier 分数为 0.347,期望校准误差为 0.065
最后那两个数字并不可比,把它们当成记分牌会是这一页上最容易犯的一个错误。它们来自不同的评测框架、不同的问题集和不同的评分器。

校准就是产品的全部,而其中只有一个以书面形式为此背书。
一个决策模型只有在它紧挨着答案返回的那个数字确有含义时,其延迟才值得。这正是校准的意义所在:给出的置信度如果是0.9,就应当大约十次里对九次,而一个自信却出错的模型,比一个坦言自己不知道的模型更糟。
InternLM 是真正处理这一点的那个。它的模型卡记录了一个拟合温度为 1.99241824,该值是通过对 1,728 个指定校准案例进行负对数似然最小化得出的,其中 1,693 个留作验证,并打印到八位小数以便复现。它还公布了一项覆盖 96 个案例的前后试点,展示该机制确实在起作用,而不是空口断言:校准前 Brier 为 0.628、ECE 为 0.213,校准后为 0.550 和 0.089。Brier 和 ECE 是衡量所述概率是否诚实的两个标准指标,而这一变化的方向幅度很大。
Liquid 未发布任何同类内容。d1-3B 自己的模型卡中载有准确率类基准——SQuAD 2.0 85.3、Civil Comments 93.0、MASSIVE intent 87.3、PubMedQA 66.0、BoolQ 86.7、XNLI 85.0、PAWS-X 76.9,平均 77.1——以及其在 Decision Index 上的 48.57,而该模型宣称的卖点是经校准的类型化答案。但其中没有 ECE 行,没有 Brier 行,也没有公布拟合温度。
这种不对称并不意味着 Qwen3.5-4B 的衍生模型比基于 LFM2.5-VL-3B 构建的 3B 模型校准得更好;它意味着在这两张卡片之间,其中一张给了你复现该结论所需的算术依据,另一张只给了你结论。如果你的流水线对置信度设定了阈值——高于 0.8 就路由,低于 0.4 就升级——那么你今晚就能验证 InternLM 那一侧,而对 Liquid 那一侧你只能做抽查。
这一提醒对双方都适用。两组数字都是第一方数据。两个模型都没有经过独立第三方评分,而 InternLM 的校准主张所依据的,是 InternLM 自己在 96 个案例上的试点,对照的也是 InternLM 自己的拟合。
要求你提供号码的许可证
Intern-Dec-4B 采用 Apache 2.0 许可证,继承自 Qwen3.5-4B,并保留了上游声明——商业使用、再分发、微调,其中不存在任何疑问。
d1-3B 采用 Liquid 的 LFM 开放许可证 v1.0,而第 5 节正是那种在采购部门过目之前没人会去读的条款。商业使用仅在以下条件下被授予:你或你的法律实体低于该文件中所定义的阈值,即年收入一千万美元或以上;超过该阈值的使用则根本未获许可。非营利组织和研究用户被排除在外。
对于个人或小团队来说,两者都是免费的。对于任何设有财务部门的组织来说,这两个仓库就是不同的产品,而区别在于一个数字:你要么高于它,要么不高于它。
d1-3B 基准测试表的尾部才是它真正的主张
Liquid 卡片上的头条数字是 Decision Index 0.2.1 上的 48.57,在一张从 Winnow-12B 的 50.02 到 Decider 2B 的 28.97 的表格中,领先于其他低于 10B 的行。让这个数字值得引用的是位于其下方的区分指数。在 Decision Index 自身的子分数上,d1-3B 在 Tools 上得分 74.5,在 Arts 上得分 36.3,而在 Knowledge 上仅得到 23.8——对比 Decider 35B-A3B,一个规模是其 12 倍的 36B 混合专家模型,后者在 Tools 上得分 56.5,在 Arts 上得分 32.6,在 Knowledge 上得分 31.8。

换句话说,3B 并不是一个在各方面都稍差一点的小模型。它是一个在结构化工具式决策上异常强、在需要世界知识的问题上异常弱的小模型,而且在最像它被打造来执行的那项工作的两个类别上,它击败了 36B。如果你的决策是“在这五个命名动作中选哪一个”以及“这是否以检索到的段落为依据”,那么规模差距所起的作用会比你预期的更小。如果你的决策依赖于模型必须已经掌握的事实,那就等着 23.8 出现吧。
视觉方面存在该论点的第二个版本。d1-3B 在十一项公开图像基准上平均为 74.1,而其自身基础模型为 73.9,若将图像剔除,同样的问题得分 45.1——因此在图像问题上,答案确实来自图片。它与基础模型持平,而非优于它,而且各基准的表现也各有胜负:CV-Bench 82.1 对 87.6,POPE 88.5 对 90.1,BLINK 59.2 对 58.7。
同样值得注意的是 InternLM 卡片中的停顿:其较高的综合得分来自问题驱动型任务,例如 Typed Decision 80.55 和 ToolACE 96.45,而 Jevbench-Hard 则为 73.87。当模式变得困难时,分数就会下降。
速度:差距并不在你预期的地方
d1-3B 宣称,在 RTX 4090 上单个问题耗时 8 毫秒,在 MI325X 上为 9 毫秒;三个问题共享一个状态时为 21 毫秒;在 Jetson AGX Thor 上为 16 毫秒;在 4090 上的打包吞吐量为每秒 475 次决策,在 MI325X 上为 1,106 次。
Intern-Decision-4B 的卡片在同一块 RTX 4090 上测得端到端平均耗时为 44.16 ms,中位数为 44.03 ms,P95 为 44.60 ms。
那看起来像是 5 倍的胜利,但它并不是,因为两者衡量的是不同的东西。Liquid 的数字是预热后的模型调用,一次一个请求,内核选择和编译成本已在前期支付——卡片明确写着,在 4090 上,单个问题在不进行 CUDA graph 编译的情况下耗时 16 ms,而首次以新形状调用要为编译付出代价。InternLM 的 44 ms 是每次查询端到端通过一个 Python 库的耗时,而该库唯一实现的后端是本地 Hugging Face 推理,因此它承载着周边的一整套机制。两个数字都没有错。把两者放到同一个测试装置下、在同一台机器上、针对相同形状的请求,差距就会缩小到你会想要去测量而不是假设的程度。
毋庸置疑的是上限。8,192 个 token 在 InternLM 这边是硬性拒绝,而图像 token 也占用同一份预算,因此一份长文档加一张截图,返回的会是被拒绝的请求,而不是被截断的请求。d1-3B 为你提供 32,768 个 token 可用。如果你的状态是工单和简短交流,那么这一差距永远不会成为问题。如果它们有整页那么大,那么在任何基准测试给出判断之前,它就已经决定了这个问题。
以小组形式运行它们,而不是交换。
回答一个具体的“是/否”问题,与回答“这是六个具名事物中的哪一个,以及你有多确定”是两类不同的任务,而这两张卡片的形态差异足够大——一张有硬性输入上限和已发布的校准拟合,另一张有 32K 上下文和更好的评分尾部——以至于对同时评估两者的团队来说,有用的部署方式往往不是替代,而是一个评审小组:把同一个状态同时提交给两个模型,出现分歧时转交人工或更大的模型。
这两款模型都不在我们的目录里,这也不是在宣称可以供货;两者都是自托管产物。但面板恰恰是那种靠路由层干活、而不是靠文书流程的形态。OrcaRouter 用一个 API 密钥就能开放 200 多款模型,供应商标价按 0% 加价原样透传——因此当你路由在我们背后的某家供应商降价时,你的账单当天就会跟着变——而且跨供应商的自动故障转移能让一个双模型面板不至于变成两个单点故障。你今天路由的模型并不是这两款,而是你将要替换掉的那些托管通用模型,例如 Qwen3.5-27B,每百万输入 token 0.086 美元、每百万输出 token 0.688 美元——一旦把 GPU 算进去,这就是自托管的 3B 必须击败的数字。
本周做什么
如果你的决策是短状态,许可证必须能通过你公司的审查,而且你想要尽可能广的构建目标范围——llama.cpp、Ollama、LM Studio,以及一条打包批处理路径,一次前向就能跑完 64 个状态——那么 d1-3B 是两者中更产品化的那个,而它的工具与艺术判别能力是两张卡所展示的最强项。如果你的决策要跨越长状态,或者你需要一份没有营收条款的许可证,又或者你想要一个可复现的校准拟合,以及一个已经把周边成本计入其中的测试框架,那么 Intern-Decision-4B 才是那份你真正能核查清楚的文件所对应的选择。

令人不安的一点对两者而言是一样的:没有任何独立方运行过这两个模型中的任何一个,也不存在任何并非由编写该卡片的供应商委托开展的校准比较。对于一个其全部价值就在于答案旁边那个数字的含义的模型类别来说,这就是在对任何东西设定阈值之前值得弥合的差距。
