
Intern-Decision-0.8B vs LFM2.5 2.6B Base:自己动手构建的两种方式
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
把 Intern-Decision-0.8B 和 LFM2.5 2.6B Base 放在一起看,最诚实的第一印象是:按买家通常理解的意义来说,这两者都不是产品。Intern-Decision-0.8B 是 InternLM 于 2026 年 9 月 26 日上传到 Hugging Face 的检查点,完全没有发布任何公告——它是在 Qwen3.5-0.8B 上微调得到的 852,985,920 参数模型,能回答输入的提问,却不生成文本,以 Apache 2.0 许可发布,附带的 GitHub 链接却返回 404。LFM2.5 2.6B Base 是 Liquid AI 的 26.9 亿参数预训练文本检查点,于 2026 年 8 月 1 日发布,作为 LFM2.5 系列的基础,而它自己的模型卡写道,它“仅推荐用于需要大量微调的任务”。一个是完成品,且用途狭窄。另一个是未完成品,且通用。两者都假定由你来完成工作——而这两份工作并不是同一种工作。
这种区别就是整个比较的关键,也正是为什么一张直截了当的规格表会误导人。读者真正的问题是“这些里面我该下载哪一个”,而答案取决于你需要构建的东西是一个决策层还是一种语言能力。它们是不同的项目,有着不同的时间线。
每个模型为你提供什么
Intern-Decision-0.8B 以可运行系统的形式发布。该仓库提供 inference.py、一个 DecisionEngine 类、有文档说明的请求模式和响应模式,以及一个在安装四个固定版本的 Python 依赖项后即可运行的完整示例。你提供一个状态、一到十六个命名问题(每个问题最多 62 个选项),并可选提供最多八张图像,然后会得到每个字段的校准分布以及 argmax 标签。该引擎在预渲染骨架中的固定位置读取 logits,而不是生成任何内容,因此没有解码步骤、没有输出 token,也没有需要修复的 JSON。它运行所需文件约为 1.73 GB。
LFM2.5 2.6B Base 给你的恰恰相反:原始能力,却没有界面。它是一个纯文本因果语言模型,30 层由 22 个双门控短卷积块和 8 个分组查询注意力层组成,在约 34 万亿个 token 上跨 16 种语言预训练,拥有 128,000 token 的词汇表和 131,072 token 的上下文窗口。它自身没有指令微调,模型卡上也没有任务基准,因为基础检查点不会被评分——由它训练出来的模型才会。Liquid 自己的后训练流程才是把它变成智能体式 LFM2.5-2.6B 的关键,而这个流程正是要求你为自己的领域部分或全部复现的东西。
因此,关键不在于规模,而在于缺失的部分是一份决策契约,还是一次训练运行。
记分牌,附带注意事项
• 获得首个结果所需的时间 —— Intern-Decision-0.8B:一个下午,加载检查点并调用 predict()/。LFM2.5 2.6B Base:则取决于你的持续预训练或 SFT 运行需要多久,再加上准备数据的工作量。
• 参数 — Intern-Decision-0.8B:852,985,920,分布在 1.50 GB 的语言分片、176 MB 的视觉分片和一个 25 MB 的投影器中。LFM2.5 2.6B Base:2.69B,约 2.5 GB 权重。
• 输入模态——Intern-Decision-0.8B:文本加上最多八张图像,仓库中带有视觉权重。LFM2.5 2.6B Base:按设计仅支持文本——LFM2.5 系列中的多模态工作位于 VL 变体。
• 实际语境 — Intern-Decision-0.8B:8,192 tokens,被拒绝而非截断,尽管配置中的最大位置嵌入为 262,144。LFM2.5 2.6B Base:原生 131,072 tokens。
• 输出 — Intern-Decision-0.8B:每个字段一个经校准的概率分布和 argmax 标签,确定性。LFM2.5 2.6B Base:续写文本,采样生成。
• 基准测试 — Intern-Decision-0.8B:一份涵盖七项基准测试的完整厂商数据表,无人复现。LFM2.5 2.6B Base:出于设计考虑,未发布针对该基础模型本身的任何数据。
• 许可证 — Intern-Decision-0.8B:Apache 2.0,并保留 LICENSE-QWEN/ 用于上游权重。LFM2.5 2.6B Base:LFM 开放许可证 v1.0。

许可证行有自己单独的一节。
两张卡片都写着“open”,而这两个词的含义有实质区别。Intern-Decision-0.8B 采用 Apache 2.0——没有收入条件,没有使用领域限制,也没有需要另行协商的商业授权。代码仓库中的第二个许可证文件是沿用下来的 Qwen 许可证,因为该模型是 Qwen3.5-0.8B 的衍生模型,这是正确的处理方式,而不是一种限制。
LFM2.5 2.6B Base 以 LFM Open License v1.0 发布,在任何商业计划依赖该许可证之前,其第 5 节值得完整阅读。就商业用途授予的权利以你或你的法律实体不超过许可证中定义的阈值为条件,该阈值为年收入 1000 万美元或以上。超过这一界限,对作品或衍生作品的商业使用便不在本协议许可范围内。非营利与研究用途则被单独豁免。这是一条真实且可执行的边界,而且由于它同样约束衍生作品,它会传导到你从该基础模型微调出的任何成果中——而这正是该检查点的全部预期用途。
这里有一个直白的解读:如果你在进行商业开发,且你的实体年收入超过 1000 万美元,那么无论 LFM2.5 2.6B Base 与 Intern-Decision-0.8B 表现如何,它们都不是同一类资产。如果你低于该门槛、在做研究,或出于非商业目的进行微调,这一区分就不适用。无论如何,这都是一个应在训练运行之前而非之后回答的问题。
其中每个实际上都是正确的下载
当所需能力尚不存在于成品模型中时,LFM2.5 2.6B Base 就是正确选择。Liquid 的模型卡明确列出了预期用例:日语等特定语言的助手、医疗等特定领域的助手、在你无法发送到 API 的专有数据上进行训练,或尝试新颖的后训练方法。这份清单背后的逻辑是,34 万亿 token 的多语言预训练复现成本高昂,而继承几乎免费——你买到的是一个已经能在 16 种语言和 128K 上下文上胜任的起点,然后把自己的算力花在专属于你的部分上。
对于一个如此新的模型而言,这套方案所获得的生态支持之完整实属罕见。Liquid 通过 Unsloth 和 TRL 记录了继续预训练、SFT、DPO 与 GRPO 的流程,并为每一项都提供了 notebook,而该检查点还得到了 Transformers、vLLM、SGLang、llama.cpp、MLX 和 LM Studio 的支持。这可不是营销文案——它决定了你面对的是一个本周就能上手微调的基座模型,还是一个得花上两周时间才能塞进训练器里的模型。
Intern-Decision-0.8B 是正确的选择——当你所需要的能力已经存在,问题只在于它的形态时。如果你的任务是一个答案集封闭的有界决策——把这张工单分流、给这笔理赔打分、按评分标准对这条记录分类——那么生成式模型是获取标签的一种笨拙方式,而基座模型根本不是获取标签的方式。你想要的,是能返回分布、告诉你它的置信度、并且每次都稳定在同样 34 毫秒内完成的东西。InternLM 在单张 RTX 4090 上的实测延迟为平均 33.98 毫秒,p95 为 37.50 毫秒,而这块卡自身的数据显示,2B 的同门兄弟平均为 33.28 毫秒——这提醒我们,在这样的提示长度下,开销在于读取 schema,而不是运行权重。
你正在做的权衡,是用灵活性换一份契约。只要有数据和算力,基础模型最终能变成任何东西。而决策头已经就是那个东西了,它永远不会变成别的。如果你的 schema 每个月都改变形态,那是一项实实在在的成本。如果它不变,那它根本算不上成本。
关于内部决策表,没人能告诉你的事
Intern-Decision-0.8B 的每一项性能数据都由厂商报告,而这里的警示比通常更重,因为该版本发布仅一周,且完全没有文档记录。没有论文,没有汇集三个尺寸的合集,没有可用的 GitHub 仓库,也没有独立评估。在 Artificial Analysis 上搜索该模型,没有任何结果。
InternLM 选定了基准测试,选定了对比模型——这一组以决策模型为主,包括 TypeSafe 的 Jev、Convai 的 Laya 和 Kev——并在没有发布帖的情况下公布了表格。

有了这个标签,这个模型的形状仍然值得一读。Intern-Decision-0.8B 在 Jevbench 的三个 split 上分别取得 97.92 / 80.56 / 52.25,在 Typed Decision 上为 77.35,在 ToolACE 上为 94.52,平均 79.38。它的校准表现是最有意思的一项:Brier 为 0.530,期望校准误差为 0.066,尽管 Brier 更差,但 ECE 却优于 Jev 的 0.095。说白了,它准确度更低,但对自己有多准确更诚实,而对于基于阈值的工作流来说,这种排序比平均值更重要。最该让部署止步的那一列,是 WildJailBreak 上的 64.48,而 Jev 为 96.29。如此大的拒绝鲁棒性缺口是这次微调自身的属性,至于它究竟源于 Qwen3.5-0.8B 底座、决策调优目标还是参数量,卡上没有任何文档说明。
在这一维度上,与 LFM2.5 2.6B Base 的比较并不是“谁得分更高”,因为 base 没有得分。而是:一个模型的数字未经审计,另一个模型的数字则根本不存在——读者若要在两者之间做选择,就是在选择要面对哪一种未知。
大多数人最终实际搭建出来的流水线
有一种配置会同时用到两者,值得给它起个名字,因为大多数生产系统最终都会落到这里。决策层负责那些封闭式调用——分诊、路由、评分量规打分——在这些场景里,答案集是已知的,延迟会在上百万条记录上不断累积,而输出 token 纯属额外开销。语言层则负责一切需要成篇文字、综合归纳或长上下文的东西:升级摘要、附在标签上的解释、由人工修改的草稿。如果你有值得用来训练的领域数据,LFM2.5 2.6B Base 是后半部分的可行底座;而决策头则是前半部分的自然形态。
把两者组合起来才是繁琐的部分,而这部分值得不去手工构建。OrcaRouter 的路由 DSL 将路由表达为代码——带有 CEL 条件的 YAML,无需重新部署即可部署——因此,把一类请求发送到决策端点、另一类发送到语言模型的流水线是一条路由规则,而不是你自己维护的负载均衡器。该网关通过一个兼容 OpenAI 的密钥覆盖 200+ 个模型,并以零加价透传提供商目录价,而且不会在你选择的模型上加价。为准确说明边界:Intern-Decision-0.8B 和 LFM2.5 2.6B Base 都不是我们的——两者都是你下载并在本地运行的检查点,而在这两种情况下,这正是关键所在,因为选择 2 GB 模型的理由就在于它运行在你的数据已经所在的地方。网关的用途,就是你原本要向外调用的那半部分技术栈。
如果你要测试的是决策层,又不想为此投入一整轮训练,那么托管式决策模型就是更省钱的实验方式,而TypeSafe 的 Jev 1.13 正是 InternLM 用来做基准对比的那一个——如今可通过单个兼容 OpenAI 的端点调用,每百万输入 token 收费 0.042 美元,输出不另行计费。

那么,哪一个呢?
如果该能力尚不存在,而且你既有领域数据,又有进行一轮微调的意愿,就选择 LFM2.5 2.6B Base;在基于它进行商业构建之前,先查看 LFM Open License 中的 $10M 营收门槛。如果该能力已经存在,答案已经可以在你的提示词中枚举出来,而你需要的是快速、确定性、许可证干净地获得标签的方法,就选择 Intern-Decision-0.8B——同时接受它的文档缺失、基准测试未经审计,并且它在对抗性输入下的拒答行为尚未被调优它的实验室之外的任何人测试过。第二条是更短的路,也是更大的未知。第一条是更长的路,也是文档更充分的一条,而这两个事实都不等同于更好。
