一张主标题卡片,以大号粗体字显示“Kolibri:来自德国的 78B 开放权重模型”,下方有一行较小的文字:“78B 总参数 / 3.46B 激活参数 / 1M token 上下文 / Apache 2.0”,还有三个小型扁平线性图标排成一行,置于白色背景上,带有柔和的蓝青渐变点缀,右下角有 OrcaRouter 标志。
Guides & Insights

Kolibri 首日:Aleph Alpha 开放了 780 亿德英权重,而外界的反应正跑在证据前面

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

在 Aleph Alpha 发布 Kolibri 二十四小时后,舆论反应已经固化成一句话,而这句话值得拆开细看。这家海德堡实验室于 2026 年 10 月 3 日将拥有 781 亿参数的混合专家模型以 Apache 2.0 许可发布在 Hugging Face 上,同日上午在自己的新闻编辑室和自家账号上宣布了此事,到第二天,AI 信息流中流传的摘要写道:总参数 781 亿,每 token 激活 34.6 亿参数,权重以 Apache 2.0 开放,为德语和英语打造。那句话的每一个分句都可以从仓库中核查。但很大程度上未被言明的是,这次发布中哪些部分是经过测量的事实,哪些是作者对自己模型作出的、海德堡之外无人运行验证过的说法。这一缺口才是发布首日的新闻,而且它比标题中的数字更重要。

先从时间线说起,因为相当多的反应都把这件事当成一次神秘的静默发布,而事实并非如此。Hugging Face 仓库 Aleph-Alpha/Kolibri-1创建于 2026 年 10 月 2 日 05:54:02 UTC,模型卡上标明的发布日期是 10 月 3 日,而厂商新闻室的文章也在当天早上 08:43:53 GMT 发出——正值德国统一日,这个日期显然是该实验室特意选定的。Aleph Alpha 自己的账号在几分钟内就发布了相关内容。没有媒体禁运期,也没有发布会,这大概就是"静默发布"这一说法的由来,但一篇厂商新闻室文章、一份技术报告加上一份官方公告,并不构成静默发布。它们是一次正常的发布,只是通用 AI 媒体当天根本没有报道而已。

该反应重复的次数

3.46B 激活参数之所以成为人人引用的数字,是因为它是发布信息中唯一一个会改变买家必须拥有何种硬件的数字。Kolibri 是一个 50 层 Transformer,其中每一层都是混合专家(mixture-of-experts),每层有 384 个专家,其中 1 个共享专家、6 个路由专家,总参数量为 78,103,074,560。每个 token 会激活其中 3,457,573,120 个参数——稀疏比约为 22.6 比 1。正是这一点,使得一个 780 亿参数的模型能够在一对 H100s 上提供服务,而不是一整个机架,并且这是此次发布中最具分量的单一主张。

它周围排列着其他主要数字,它们全都来自模型卡,而非独立运行:

• 上下文 — 在 16,384 个 token 上训练,在 65,536 个 token 上进行中期训练,原生为 262,144 个 token,并验证至 1,048,576 个 token。该卡片建议,对于延迟敏感的工作,保持在 262,144 或以下。请注意,你在摘要中看到的笼统的“1M 上下文”是经验证的上限,而不是原生窗口。

• 精度 — FP8 权重采用 128x128 分块,激活值动态量化,并使用 FP8 KV 缓存进行评估;嵌入层、LM head、归一化层和 MoE 路由器保持 bfloat16。

• 推理——四个强度级别——无、低、中、高——通过聊天模板进行设置,并具备 Hermes 风格的工具调用,以及与权重发布在同一代码仓库中的 vLLM 解析器。

• 语言——德语和英语,仅此而已。

• 训练——在过滤后的双语语料库上进行 20 万亿预训练 token,该语料库大致包含 62.5% 英语、23.9% 德语和 13.6% 代码,另有 3.44 万亿中期训练 token 以及 2010 亿用于长上下文扩展的 token。

• 计算与能耗——96台HGX节点上共768块NVIDIA B200,21天预训练,耗时511小时、392,000 GPU小时,报告的算力为6.4x10^23 FLOPs,估计耗电9.5x10^2 MWh(含数据中心开销,不含监督微调与强化学习)。

• 许可证 — Apache 2.0。无附加的可接受使用条款,无月活跃用户数门槛,无单独的商业条款。

没人核实过的两个说法

这是第一天里被该反应跳过的那部分,而正是这部分决定了 Kolibri 是重要,还是仅仅有趣。

第一项是服务经济性主张。Aleph Alpha 的表述并不是 Kolibri 是现有最强模型——在其实验室自己的对比表上它并非如此,而且该实验室也这么说。其表述是:在质量与每 GPU 每秒解码 token 数的帕累托前沿上,没有任何被比较的模型能在相同服务成本下提供更高品质,或在更低成本下提供相同品质。这是一个关于特定硬件上吞吐量的主张,而正是那种只有拿着秒表和两块 H100 的第三方才能裁定的主张。没有人做到过。截至 2026 年 10 月 4 日,Artificial Analysis 上没有 Kolibri 的条目,也没有对评测框架的第三方复现。

第二点是分词器方面的主张。Aleph Alpha 使用一种名为 UniBPE 的方法训练了一个德英双语分词器,词表规模为 128,000 个 token,并报告称其在德语网页文本上平均每个 token 为 4.90 字节,而 GPT-5 为 4.35,Gemini 为 4.13,Qwen 3.5-3.8 为 4.17,GLM 5.3 为 3.93,DeepSeek V4 为 3.72,Kimi K3 为 3.28。这些数字中的每一个都来自厂商自身,是在厂商自己的语料库上、针对厂商自己选择的竞品测得的。每个 token 承载更多文本确实会带来推理成本方面的影响,而不是一项质量声明;如果这一点成立,它会在任何文档处理工作负载中叠加放大——但这只是一家实验室的测量结果,并非基准测试结果。

德语才是重点所在,而它是本次发布中最有意思的工程。

大多数“多语言”模型卡描述的训练配比只是恰好包含了德语。这个则是反过来构建的,而且这张卡对机制描述得异常具体。

小型代理模型实验使 Aleph Alpha 将混合数据中约 20% 为德语数据设为目标,而对于一次 20 万亿 token 的训练运行,这意味着要找到 4 万亿个德语 token。经去重和过滤的公开德语数据集提供了 3900 亿个——差了一个数量级。该实验室通过三种方式填补了这一缺口:专门为德语重新调整 Common Crawl 过滤器,由此产生了 1.3 万亿个独特的原生 token;将现有德语文档改写成百科全书条目、问答对话和文本段落,这又产生了约 1 万亿 token,并成为最大的单一德语来源;以及翻译,这种方式曾用于前代模型,但在 Kolibri 中被有意放弃。德语最终成为一个 2.4 万亿 token 的独特语料池,其中 80% 由内部整理或生成,在上采样后占预训练 token 的 21.3%。

过滤器细节是那种只有在真正用德语训练过的实验室里才会浮现的东西。标准的语言数据管道会丢弃包含太多长单词的文档——但德语行政公文通常超过英语对平均词长的限制,因此默认设置会悄悄删除公共行政所使用的语域。一个用现成英语过滤器训练的模型根本谈不上有德语法律行政词汇,而且没有任何基准测试会告诉你这一点。

对比表实际展示的内容

Aleph Alpha 发布了一项涵盖十四个模型的后期训练比较,它比大多数发布表格更有用,因为它不会美化主角。在相同测试框架下、Kolibri 的推理强度设为高时,Qwen3.8 27B 在英语平均分上得分 80.2,而 Kolibri 为 75.5;在德语平均分上得分 79.9,而 Kolibri 为 70.8,并且它在 GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified 以及两个长上下文基准上都领先。Nemotron 3 Super 120B-A12B 的英语得分为 73.0,而 Kolibri 为 75.5。Gemma 4 26B-A4B IT 在这两项平均分上分别为 71.9 和 66.3。

因此,对这次发布诚实的总结并不是“最先进”。而是:Kolibri 处于一群每 token 激活 30 亿到 120 亿参数的模型的中游,它明显胜过那些小得多的模型,却在它自己表格的大多数行上输给来自 Alibaba 的一个稠密 270 亿参数模型,而它激活的参数大约只有后者的八分之一。经济性能否弥补这一差距才是帕累托主张,而这一帕累托主张尚未得到检验。

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

你今天实际上会怎么称呼它

厂商没有提供托管端点——此次发布是权重加一份技术报告,公开材料中没有面向 Kolibri 的 Aleph Alpha API SKU。OrcaRouter 上也没有它的路由:我们用厂商前缀和模型名的各种拼写检索了目录,Kolibri 都不在其中,所以今天要调用它,就意味着下载大约 78 GB 的 FP8 权重,并自行从 aleph-alpha-inference 包或已发布的容器镜像运行一个 vLLM 端点。

这是一个真实的采购决策,而不是一条脚注,而这正是路由层即便对于它并不承载的模型也能赢得一席之地的地方。对于任何正在权衡自托管 78B 主权部署的人来说,诚实的比较不在于基准测试的分数行——而是 78 GB 的显存,以及针对别人拥有的硬件上按 token 计费项目的采购对话。如果你这个月真正需要的,是一个无需购买两块 GPU 就能调用的小型混合专家模型,那么 Gemma 4 26B-A4B 这一档就是已经存在于某个路由端点上的最接近选项:每百万输入 token 0.06 美元、每百万输出 token 0.33 美元,上下文窗口为 262,144 个 token,而 OrcaRouter 将这一档路由在 一个兼容 OpenAI 的密钥 按供应商的标价上,且不额外加价。这是在硬件到手之前,判断这套工作负载是否值得拥有那套硬件的省钱办法。

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

值得关注的事项,以及哪些因素会改变结论

三件事,按它们对局面影响的大小排序。

在显卡推荐的双 H100 配置下进行独立吞吐量测量,将证实或推翻 Pareto 说法——这是发布稿中唯一真正新颖、而非复述规格表的说法。独立复现德语和英语任务套件的平均值,将告诉你与 Qwen3.8 27B 的差距是否如厂商自家表格所暗示的那样小,还是更小。而针对真实行政文本——而非翻译过来的通用基准——的德语评估,将检验该发布版本实际所面向的能力,这是目前任何排行榜都没有衡量的。

在其中任何一项成为现实之前,正确的定位就是该仓库自身所支持的那种。Kolibri 是欧洲实验室推出的真正开放权重发布,其规模是欧洲实验室此前从未交付过的,采用 Apache 2.0 条款,没有一家现有厂商能与之匹敌,数据管道与权重一同发布,而且有一个双模型迭代的故事,比那个头条数字更有趣。就目前而言,它还是一个其最常被引用的数字来自其作者自己的模型。在发布首日,这两句话都成立,而第二句正是外界反应所遗漏的那一句。

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.