
Kolibri 与 Gemma 4 12B:780亿参数对120亿,且只有其一有分数
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
Kolibri和Gemma 4 12B是同一谱系的两端,而开放权重模型发布通常不会让你在同等条件下对它们进行比较。Aleph Alpha 的 Kolibri 于 2026 年 10 月 3 日发布:781 亿总参数,每个 token 激活 34.6 亿参数,经过验证的 1,048,576 个 token 上下文窗口,仅支持德语和英语,Apache 2.0。Gemma 4 12B 于 2026 年 6 月 3 日发布:119.5 亿稠密参数,262,144 个 token 上下文窗口,文本、图像、音频和视频输入,Apache 2.0。其中一个有独立的、可公开复现的评分。另一个只有厂商基准测试表。这种不对称不是这次比较的脚注;它就是这次比较本身,因为买方关心的其他一切——每任务成本、每瓦质量、它能否在你的文档上奏效——都取决于这一点。
我们也应该同样直接地说明这场对比的性质,因为把 78B 模型与 12B 模型并列对打的标题会引出错误结论。它们并不是竞品。一个是 78 GB 的部署,面向在客户自有服务器机架上开展的德国公共部门和工业文档工作;另一个是 120 亿参数的统一多模态模型,可在笔记本电脑上运行,并带有一个独立的指数 14。接下来将说明两者各自实际上是做什么用的,公开数字在哪些方面能、哪些方面不能让你给它们排名,以及没有独立评分会付出什么代价。
这里有一个你可以信任的数字,还有一个你不能信任的数字。
Artificial Analysis 已在推理配置下对 Gemma 4 12B 进行了测量。以其模型页面上发布的结果为依据:
• 智能——Artificial Analysis Intelligence Index 为 14,在参与该对比的 142 个模型中排名第 21 位,位列顶级档位区间;而同类模型的中位数为 8。
• 速度 — 每秒输出 112.5 个 token,在速度视图中位列 142 个模型中的第 21 名,高于同类模型 91 个 token 的中位数。
• 价格 — 每百万输入 token 0.10 美元、每百万输出 0.30 美元,其页面指出,与同类规模和级别模型 0.03 美元和 0.15 美元的中位数相比,这有些昂贵。
• 规格 — 262,144 token 上下文,总参数 12B,Apache 2.0,支持文本、图像、语音和视频输入,文本输出。
Artificial Analysis 自己的总结性评判,对于一份排行榜页面而言异常直白,值得再说一遍:Gemma 4 12B 在智能水平上属于领先模型之列,但与其他规模相近的开放权重模型相比有些昂贵。这是来自与两家厂商均无利害关系的第三方所做的真实、独立、可复现的评估。
Kolibri 没有对等的东西。Artificial Analysis 没有它的模型页面,而且在撰写本文时,没有第三方复现过该评估套件。存在的是 Aleph Alpha 自己的对比表,其中 Kolibri 在其任务套件上的英语平均分为 75.5,德语平均分为 70.8。这些是在供应商选择的基准组合上、由供应商编写的评测框架上、以高推理强度得出的未加权百分比平均值。它们不是 Intelligence Index,这两个数字无法相互换算,也无法并排比较。任何把“Kolibri 75.5 对 Gemma 14”当作排名来呈现的人,都是在把一个尺度上的百分比与另一个尺度上的分数进行比较。诚实的立场是,Gemma 4 12B 的质量是经过测量的,而 Kolibri 的质量则是宣称的。
供应商表格能让你做的,是横向比较各行。Gemma 4 26B-A4B IT 作为谷歌与 12B 同属混合专家架构的自家兄弟模型,出现在 Aleph Alpha 的表格中:英语 71.9、德语 66.3,两项均低于 Kolibri。这是现有条件下最接近交叉验证的东西,但它同样带有那个警告:厂商的测试框架,厂商的数字。这是弱信号,不是证据。

稠密的 12B 对阵稀疏的 78B,并不像表面看上去那样不对等
一旦考虑到每个 token 实际计算的内容,架构差距就比参数差距更大。
• 每个 token 的计算量——Gemma 4 12B 在每个 token 上激活全部 119.5 亿个参数。Kolibri 激活其 78,103,074,560 个参数中的 3,457,573,120 个,约为模型的二十二分之一,每层在 384 个专家中有 1 个共享专家和 6 个路由专家。
• 显存——这里的取舍正好相反,而且非常残酷。bfloat16 格式的 Gemma 4 12B,权重约为 24 GB。Kolibri 的模型卡显示,FP8 权重约为 78 GB,最低需要两张 A100 80 GB 显卡、两张 H100 SXM5、一张 H200、一张 B200 或一张 B300。
• 注意力——Gemma 4 采用局部滑动窗口注意力与完全全局注意力的混合,且最后一层始终为全局。Kolibri 在 50 个全 MoE 层上采用 4:1 的滑动窗口与分组查询划分。
• 上下文 — Gemma 4 12B 为 262,144 个 token;Kolibri 原生为 262,144 个 token,经验证,在无需位置缩放的情况下可达 1,048,576。
因此,“78B 对 12B”的诚实表述是:Kolibri 在激活成本上胜出,在权重占用规模上落败,而这两种优势都不是没有代价的。一个每个 token 激活 34.6 亿参数的稀疏模型,仍然必须将所有 780 亿参数保存在内存中,这就是为什么部署下限是一对 80 GB 加速器,而不是一张消费级显卡。Gemma 4 12B 做出了相反的取舍:每个 token 都会触发模型中更大比例的部分,但它能装进普通人买得起的硬件上。
在 Kolibri 这一侧存在一个德语特有的变数,它改变的是算术结果,而非排名。根据 Aleph Alpha 自己的测量,其分词器在德语网页文本上平均每个 token 对应 4.90 字节,而 Gemini 为 4.13,Qwen3.5–3.8 系列为 4.17,GPT-5 为 4.35。每份德语文档的 token 数更少,直接降低了推理成本;而对于以百万计的德语行政文本这类工作负载,这一效应可能比几个指数点更有价值。而且,这完全来自厂商自报的数据。

每一个究竟能看到什么
这正是二者的较量不再接近的地方,而且这是规格层面的事实,而非质量上的主张。Gemma 4 12B 是一个统一的多模态模型:其说明卡描述了一种无编码器架构,可将原始图像块和音频波形直接投影到语言模型的嵌入空间中,输入文本、图像、语音和视频,输出文本。它专为在消费级设备上运行而构建,无需配置单独的编码器。
Kolibri 只读取文本,支持两种语言,除此之外什么都不做。Aleph Alpha 有意将其定位为以深度换广度:两种语言、经过高度精选,而不是宽泛的多语言混合。它没有视觉塔、没有音频通路、没有视频。如果你的工作负载包含扫描表单、通话录音或设备照片,那么 Gemma 4 12B 是一个候选,而 Kolibri 不是——无论基准测试那一行行数字怎么说。如果你的工作负载是一批绝不能离开本机构的德语和英语文档语料,那么反过来才更接近事实——但请注意,“绝不能离开本机构”这一要求,Gemma 4 12B 同样能满足,因为其权重采用 Apache 2.0 许可且可下载。
哪一个正在买取决于你在买什么
这两款模型的定价采用的是无法相互换算的货币。Gemma 4 12B 有市场价格:据 Artificial Analysis 跨提供商测得,每百万 token 分别为 0.10 美元和 0.30 美元;而在路由端点上,其 MoE 层级的价格更低。Kolibri 则完全没有价格,因为 Aleph Alpha 并不为它出售推理服务——此次发布的只是权重、一份技术报告和一张模型卡。
• Gemma 4 12B 在托管路由上——根据 Artificial Analysis 的数据,每百万输入 $0.10、每百万输出 $0.30。在我们自己的目录中,同属 MoE 的 Gemma 4 26B-A4B IT 标价为输入 $0.06、输出 $0.33,上下文窗口为 262,144 个 token;而更大的稠密模型 Gemma 4 31B IT 则为 $0.13 和 $0.38;这些都是按原样透传的供应商标价,也是我们唯一不添加任何费用的数字。
• 在自有硬件上运行 Kolibri——78 GB 权重、来自厂商 aleph-alpha-inference 软件包的 vLLM 插件,以及至少一台 H200 或 B200,或一对 H100 SXM5。成本是一笔资本购置、一个机架槽位,以及一名能运行 vLLM 部署的人员,并按你生成的 token 数量进行摊销。
那不是同一笔采购,比较的也不是“哪个更便宜”。关键在于,工作负载的形态是否足以证明拥有硬件是合理的。一个以高吞吐处理固定、敏感文档语料库的团队,在自托管方案上可能会遥遥领先。而一个构建产品功能、每天调用模型几百万个 token 的团队,几乎从来不会如此。
一条务实的中庸之道:Gemma 这一档目前就在 OrcaRouter 上,与其他所有服务共用同一个 OpenAI 兼容端点,并且具备 跨供应商的故障转移,供应商的标价原样透传,每个 token 不额外加价。这样一来,你就能以低成本在托管路由上测出自己真实的 token 用量,再决定是否值得为了它去做 78 GB 的主权部署。有一点值得直说清楚:我们不路由 Kolibri。我们把供应商名称和模型名称的每一种拼写都拿来检索了整个目录,它都不在里面。目前,自托管是调用它的唯一方式。

谁应该选哪个
这条决策规则足够简短,可以用三行来表述。
如果你需要处理德语和英语文本之外的任何内容,如果你需要在正式采用前得到一个经过实测的质量数值,如果模型必须运行在你已有的硬件上,或者如果你宁愿租用 token 也不愿自己拥有机架,那就选 Gemma 4 12B。它是这两者中唯一具备独立评分、已公布速度和市场价格的模型。
如果您的需求是一款 780 亿参数的推理模型——其权重、训练数据来源、能耗和许可均有完整记录,可部署在您自己的边界之内,配有专为德语行政文本构建的分词器,并具备受监管工作流可以依赖的弃权行为——那就选择 Kolibri。这是一个狭窄的目标,而 Aleph Alpha 正是有意瞄准了它。
不要因为你在发布文章里看到的一行基准测试成绩就选择其中任何一个。Gemma 4 12B 的 14 是别人做的一项测量,你可以核查。Kolibri 的 75.5 是其作者提出的说法,而目前唯一能证伪它的人,是拥有两块 H100 和一份文档语料库的客户。
