为 Kolibri vs LFM2.5 2.6B Base 生成了主视觉卡片,标题为“Kolibri vs LFM2.5 2.6B Base”,副标题为“服务器级推理,对阵设备端检查点”,左侧是蜂鸟图标,右侧是小型芯片轮廓,分列于一条细分割线两侧。OrcaRouter 徽标位于图案下方的条带中。
Guides & Insights

Kolibri 与 LFM2.5 2.6B Base:78B 主权部署对决手机大小的检查点

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Kolibri放在 LFM2.5 2.6B Base旁边,最直观的解读就是大卫与歌利亚:781 亿参数对 26.9 亿参数,部署门槛是两张 GPU,而对面那款模型 Liquid AI 声称能在手机上跑。这种直观解读是错的,而且错的方向和你预期的并不一样。今天,这两者都不是你能直接拿来做某个任务的模型。Kolibri 由 Aleph Alpha 于 2026 年 10 月 3 日发布,是一个完整的、经过后训练的、支持工具调用的德英双语助手,并附带服务插件和推荐的采样配置。LFM2.5 2.6B Base 由 Liquid AI 于 2026 年 8 月初发布,是一个完全未经指令微调的预训练检查点,专门为微调而发布。一个是你可以部署的产品,另一个是原材料。比较两者的质量属于范畴错误,而真正有意思的问题是:你的项目究竟需要哪一种原材料。

这两者之间决定大多数实际采购的差距并不在于参数,而在于许可证。Kolibri 以 Apache 2.0 许可证发布。LFM2.5 2.6B Base 以 LFM Open License v1.0 发布,这是一项定制许可证(模型卡将其归类为 “license: other”),而这一差异会导致它被交给法务团队,而不是工程团队。

“开放权重”的两种不同含义

这两个模型都允许你下载权重并运行它们。它们的分歧在于之后允许你做什么。

• Kolibri——Apache 2.0,没有可接受使用附加条款,没有用户数量门槛,也没有单独的商用条款。Aleph Alpha 的模型卡只注明,该实验室是欧盟 GPAI 行为准则的签署方。

• LFM2.5 2.6B Base —— LFM 开放许可证 v1.0,这是 Liquid AI 自己的许可证,而非 OSI 标准许可证。它与管理后训练版 LFM2.5 2.6B 及该系列其余成员的许可证相同。

对研究团队来说,两者都可以。对于必须在采购文件中说明自身许可情况的企业来说,一个是已知量,另一个则是一份得有人去读的文件。这是实实在在的成本,在生成哪怕一个 token 之前就要付出,而且在任何基准测试表里都看不见。

同一类别中还有第二个区别,而这也正是 Liquid AI 自己的模型卡极力想要说明的一点。Base 不是助手。它没有经过指令微调,这意味着它不会遵循提示词,不会拒答,不会发出工具调用,也不会保持话题——不是因为它弱,而是因为它从未被训练这样做。模型卡明确表示,它仅推荐用于需要大量微调的任务:特定语言或特定领域的助手、在专有数据上训练,或试验新颖的后训练方法。基础检查点下游的一切——监督微调、教师专门化、同策略蒸馏、智能体强化学习——都是买家自己的问题。Kolibri 到来时所有这些都已完成,提供四种推理强度级别,并随权重一同附带 Hermes 风格的工具调用解析器。

这些尺寸实际上能换来什么

剥去那些包装,这两个模型是针对截然相反的约束条件进行优化的。

参数量——在 Kolibri 上总计 78,103,074,560,每个 token 激活 3,457,573,120;而 LFM2.5 Base 总计 26.9 亿,它采用由 22 个双门控短卷积块和 8 个分组查询注意力层构成的混合堆叠,而非由均匀块组成的 transformer。

• 上下文 — 在 LFM2.5 Base 上为 131,072 个 token,而 Kolibri 上的原生窗口为 262,144 个 token,并且经验证可在此基础上扩展至 1,048,576 个 token。

• 训练数据——LFM2.5 Base 为 34 万亿个 token,而 Kolibri 为 20 万亿个,后者取自经过滤和去重后超过 200 万亿的原始池,其中 13.6% 为代码。

• 语言——LFM2.5 Base 上支持十六种语言,包括阿拉伯语、中文、日语、韩语、泰语和越南语,而 Kolibri 上只有两种,德语和英语,这是明确的设计选择。

• 内存 — LFM2.5 Base 随附发布了 GGUF、ONNX 和 MLX 构建版本,并且专为边缘部署而打造;Kolibri 的 FP8 权重占用约 78 GB,最低需要两张 A100 80 GB 卡、两张 H100 SXM5、一张 H200、一张 B200 或一张 B300。

把这五行连起来读,画面就不再失衡。Liquid AI 的模型在规模小三个数量级的硬件上覆盖了十倍的语言。Aleph Alpha 的模型覆盖两种语言,上下文窗口长八倍,而其专业化深度只有在它自己的垂直评估中才会显现。二者都不是对方的更差版本;它们回答的是不同的问题,而这些问题分别是“这能否在没有服务器的情况下运行”以及“这能否对一份德国监管申报文件进行推理”。

Generated two-column scoreboard for Kolibri and LFM2.5 2.6B Base. Left column Kolibri: role 'post-trained assistant', parameters '78.1B MoE, 3.46B active', context '262,144 native, 1M validated', languages 'German and English', licence Apache 2.0, deployment 'two 80 GB accelerators'. Right column LFM2.5 2.6B Base: role 'pre-trained checkpoint', parameters 2.69B, context 131,072, languages 'sixteen', licence 'LFM Open License v1.0', deployment 'phone, GGUF and MLX'. The footer reads 'Kolibri figures vendor-reported; LFM2.5 2.6B Base has no published evaluation.'

其中只有一个有实测得分,而且它不是 Base

这就是这种配对所掩盖的部分。Artificial Analysis 确实有 LFM2.5-2.6B 的模型页面——但那是针对后训练模型的,而不是 Base。该页面报告 Intelligence Index 为 8,在其类别的 49 个模型中排名第 9,具有 128,000 token 的上下文、27 亿参数以及 LFM Open License v1.0。这是一个不高的分数,也是一个诚实的分数:该模型经过测量,定价实际上为零,并按其本来面目——一个小型推理模型——受到评估。

Base 检查点没有分数,也不可能有分数。智能指数是通过让模型执行推理和知识任务来计算的;一个未经指令微调的检查点在这些任务上没有有意义的行为。Liquid AI 没有为其发布评估表,而这种缺失是对该产物的说明,而不是发布中的疏漏。

Kolibri 的情况又有所不同,而且值得精确说明,因为它很容易被误读。Artificial Analysis 上也没有 Kolibri 的页面——我们查过了,该模型完全不在那个对比之中。存在的是 Aleph Alpha 自己的训练后表格,其中 Kolibri 在其测试框架上的英语平均分为 75.5,德语平均分为 70.8,而其前身 Kolibri Origin 分别为 54.1 和 46.4。这些是厂商在自建评估套件上运行得出的数字,无法换算为 Intelligence Index。因此,在这个标题涉及的兩個模型中,一个拥有针对其同系列版本的独立评分,另一个只有厂商表格,而正在比较的两个确切产物都没有任何独立测量。

Screenshot of the Artificial Analysis model page for LFM2.5-2.6B, showing an Intelligence Index of 8 against a median of 5, a #9/49 intelligence rank, 128k-token context window, the summary line that the model is amongst the leading models in intelligence and well priced compared with other open-weight models of similar size, $0.00 input and output pricing against $0.00 medians, and the 49 models in this class count.

改变推荐结果的同类项

单独评判 LFM2.5 2.6B Base 并不是评估 Liquid AI 此次发布的正确方式,因为 Base 的存在是为了服务经过后训练的 LFM2.5 2.6B,而且两者是一同推出的。如果你无意编写微调流水线,那么 Base 就不是适合你的模型——经过后训练的同系列版本才是,而且当你自行托管它时,它才是那个拥有公开评分、且公布价格基本上为每 token 近乎为零的模型。

这与 Kolibri 和 Kolibri Origin 之间的关系相同,而这一比较值得一做,因为 Aleph Alpha 公开了时间线。Origin 于 2026 年 6 月 11 日完成预训练,拥有 306 亿参数、32.7 亿活跃参数,且从未发布;Kolibri 于 2026 年 9 月 11 日完成,规模为 781 亿参数,并于 10 月 3 日发布。两个模型,相隔三个月,其中一个仅限内部。Liquid AI 的同类拆分则双向公开:基础版与后训练版并排提供,并随原生检查点一同发布面向 llama.cpp、ONNX Runtime 和 Apple MLX 的量化构建。如果你打算进行微调,那么这些周边工具链比一行基准测试分数更有价值,因为它决定了有多少工作必须由你自己完成。

按需求部署什么

这一个归结为一份简短的决定清单,而不是一个胜出者。

• 如果模型必须在没有服务器的情况下运行——在手机、笔记本电脑、工厂里的设备上——那么这两者中唯一还算得上候选的就是 LFM2.5 2.6B Base,而你实际会拿来起步的是经过后训练的 LFM2.5 2.6B。Kolibri 无论采用何种量化方式都无法在那里运行。

• 如果工作负载是在你自己的边界内进行德语或英语文档推理,并带有受监管数据约束以及需要拒答行为,那么 LFM2.5 Base 并不是合适形态的工件,而 Kolibri 正是针对这一点——前提是你能提供两块 80 GB 加速器,并接受一个可以用一句话说明的许可证立场。

• 如果你需要的不只是德语和英语,Liquid AI 的系列模型在 2.6B 规模下覆盖十六种语言,而在这个规模上,语言覆盖面的论点就反转了。

• 如果你本季度需要一个可部署的助手,又不想运行后训练流水线,那么 Kolibri 已完成后训练;LFM2.5 Base 则没有,而 LFM2.5 后训练模型是比 Kolibri 小得多的助手,而不是它的廉价版本。

对于那些工作负载真正处于中间地带的团队——每月数十亿 token、中等上下文、没有必须自持硬件的监管要求——这两者都不是首选。4B 以下的模型自托管成本低,但大规模路由时很麻烦,因为部署的运维成本可能超过 token 账单;78B 模型则是相反的问题。真正会被路由的层级是介于两者之间的那一层,而这一层如今就在 OrcaRouter 上:Qwen3.5 35B-A3B 每百万输入 $0.057、输出 $0.459,Qwen3.8-Flash 为 $0.15 和 $0.47,支持 1M token 上下文,或者混合专家模型 Gemma 4 26B-A4B IT 为 $0.06 和 $0.33。这些都是供应商标价原样透传,每个 token 不加收任何费用,只需一个兼容 OpenAI 的密钥并带故障转移,对于想在投入微调项目或机架之前先衡量真实 token 用量的团队来说,这就是最诚实的答案。

明确说明我们不提供哪些内容:目前,Kolibri 和 LFM2.5 2.6B Base 都无法在 OrcaRouter 上路由。我们已按每一种供应商和模型拼写方式在目录中检索这两者,但两者都不在其中。Kolibri 仅支持自托管,而 LFM2.5 Base 是一个微调产物,从未打算置于 API 之后。

Screenshot of the OrcaRouter model page for qwen/qwen3.5-35b-a3b, showing the 32K-token context badge, 65K maximum output, text, image and video input, the Vision, Tools, JSON and Reasoning capability tags, the attribution 'Public benchmarks by Qwen - 2026-02-25', the description as an open-weight mixture-of-experts multimodal model with 35B total and 3B active parameters, the pricing tiles $0.06 and $0.46, and a pricing table with two tiers: under 128K input tokens at $0.057 input and $0.459 output, and above that at $0.229 and $1.835, selected by each request's input token count.

单行选择

Kolibri 是一个已完成、已获授权、有文档记录的 780 亿参数德英推理器,运行它需要两块加速器。LFM2.5 2.6B Base 是一个未完成的 26.9 亿参数多语言起点,需要一条微调流水线,而且能装进你的口袋。两者之间的参数比是 29 比 1,而这是本文中最不具信息量的数字。