标题卡上写着“Kolibri vs Solar Mini 4”,副标题为“相同的 3B 活跃参数预算,两种截然不同的押注”,还有两行小字:“Kolibri — 78.1B 总量、Apache 2.0 权重、自托管”和“Solar Mini 4 — 35B 总量、闭源、托管 API”,背景为白色,带有柔和的蓝青色渐变点缀,右下角是 OrcaRouter 徽标。
Guides & Insights

Kolibri 与 Solar Mini 4:同样的 3B 活跃参数预算,两种截然不同的押注

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个模型相隔十七天发布,都被调校为每个 token 大约花费三十亿活跃参数,而在实际采用上,它们几乎不可能更不相同。Aleph Alpha 的 Kolibri 是 781 亿参数、Apache-2.0 权重,由你自行下载并部署:不存在托管端点,而且截至今天,任何地方都没有它的哪怕一个独立评分。Upstage 的 Solar Mini 4 是 350 亿参数,你根本无法下载——它只作为一个按量计费的端点存在,并且已经带有 24.05 的 Artificial Analysis Intelligence Index 分数。活跃参数数量告诉你的是运行每一个要花多少钱。关于这个数字,其他任何东西都不能告诉你,起步要花你多少钱。

总量相差如此之远——78.1B 对 35B,而活跃切片几乎相同——原因在于两者都是稀疏混合专家设计,而两家实验室在保留多少专家容量作为储备上做出了相反的选择。Kolibri 拥有 384 个专家,每个 token 路由到 1 个共享专家加其中 6 个。Solar Mini 4 披露了 35B/3B 的拆分,但对其专家数量只字未提。当两个模型以相同的活跃参数规模宣传时,决定你硬件账单的是参数总量,而不是活跃参数规模——而在这里,在同样声称的计算预算下,差距达到 2.2 倍。

每一个到底是什么

• 总参数量 — Kolibri 78.10B 对比 Solar Mini 4 35B

• 每 token 激活参数量 — Kolibri 3.46B 对比 Solar Mini 4 3B

• 权重 — Kolibri 采用 Apache 2.0,完整权重托管于 Hugging Face,而 Solar Mini 4 闭源;仅提供 API

• 上下文 —— Kolibri 1,048,576 个 token 已验证,对比 Solar Mini 4 的 512K(根据 Upstage 的文档);根据 Artificial Analysis 的模型卡为 1,048,576

• 最大输出 — Kolibri 不受供应商限制,而 Solar Mini 4 为 128,000 tokens

• 语言 — Kolibri 德语和英语对比 Solar Mini 4 英语、韩语和日语

• 知识截止日期——Kolibri 2026年6月18日 vs Solar Mini 2026年2月4日

• 交付 — Kolibri 自托管(vLLM)对比 Solar Mini 4 托管于 Upstage 的 Console、Playground 和本地部署环境

• 独立评估 — Kolibri 未公布,对比 Solar Mini 4 AA Intelligence Index 24.05

Kolibri:780亿参数,实验室外却无人为其评分

Aleph Alpha 于 2026 年 10 月 3 日发布了 Kolibri,特意选在德国统一日,作为新系列的首款模型、也是 Kolibri Origin 的继任者。其模型卡异常坦率地披露了训练投入:20 万亿 token 的预训练、3.44 万亿 token 的中期训练和 2010 亿 token 的长上下文训练,在 768 块 B200 GPU 上历时 21 天完成,算力约为 6.4×10²³ FLOPs,耗电约 950 MWh。厂商还主动公布了故障次数——38 次非计划中断,约每 10,000 GPU 小时一次——这类数字通常是各家实验室避而不谈的。

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

该架构是一套简洁的稀疏 MoE 方案。五十层,滑动窗口注意力(512 token 窗口)与全局注意力按 4:1 的比例配置,后者仅在每第五层触发。FP8 权重采用 128×128 块缩放,并配有 FP8 KV 缓存。作为对比,Kolibri Origin 使用了 128 个专家、按 8 路路由、专家隐藏维度为 768,并在每一层都使用全注意力,训练数据为截至 2024 年 9 月的英语数据。Kolibri 则改为 384 个专家、按 6 路路由,隐藏维度为 512,并将两种语言的数据截止日期均推进至 2026 年 6 月 18 日。

德语处理流程才是真正难以从别处获得的那一环。Aleph Alpha 训练了自己的 UniBPE 分词器,并报告德语文本达到每个 token 4.90 字节,相比之下 GPT-5 为 4.35,Qwen3.5 为 4.17,Gemini 为 4.13。这意味着该分词器声称其德语压缩效果优于任何前沿多语言模型,而它正是主权部署主张背后的具体机制:每份德语文档的 token 更少,意味着计费 token 更少,并且在相同硬件上拥有更长的有效窗口。

Kolibri 现有的每一项性能数据都来自 Aleph Alpha 自家的模型卡,也应当这样看待。厂商报告的表格显示,Kolibri 在英语评测中总体为 75.5,在德语中为 70.8;英语 GPQA Diamond 为 84.3,德语为 81.3;在 Humanity's Last Exam 上英语为 21.5,德语为 15.9;SWE-Bench Verified 为 66.4;LiveCodeBench v6 为 85.9;AA-LCR 为 68.3。这些都是未经审计的数字。Artificial Analysis 上没有 Kolibri 的页面——该追踪器的模型 URL 返回 404——因此那张表中的任何内容都没有得到独立复现,而你正在阅读的这篇文章也无法让它比实际更可靠。

这张卡真正做实的一点,是它的服务方案。硬件门槛是两块 A100 80GB,或两块 H100 SXM5,或单块 H200、B200 或 B300。一份已发布的 vLLM 配方使用 --kv-cache-dtype fp8 以及专用的推理和工具调用解析器来运行它,温度为 1.0、top-p 为 0.97、top-k 为 128,并带有一个 reasoning_effort 调节档位,涵盖 none、low、medium 和 high。单块 B300 在 100 万 token 的已验证上下文下服务一个 78B 模型,就是这项方案的具体形态:你买下这台机器,然后每一个 token 的边际成本都由你自己承担。

Solar Mini 4:你租用 3B 活跃切片,而不是买下它

Solar Mini 4 于 2026 年 9 月 22 日发布——快照 solar-mini4-260922,别名 solar-mini4——作为 Upstage 面向智能体的小型模型:总参数 35B,激活参数 3B,知识截止于 2026 年 2 月,支持英语、韩语和日语,具备聊天、推理、结构化输出和工具调用模式。它可通过 Upstage 的 Console 和 Playground 使用,也支持本地部署,但不提供权重下载,也没有可供查阅的许可证。Upstage 的文档还将其记录为“未收集数据”,如果你要将其用于真实流量场景,这正是合规方面至关重要的一条。

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

与 Kolibri 不同,Solar Mini 4 经过了独立测试框架的评测。Artificial Analysis 给出的 Intelligence Index 为 24.05,实测在 Terminal-Bench 4.0 上为 1.01%,在 SciCode 上为 47.6%,在 AA-LCR 上为 83.3%,在 Humanity's Last Exam 上为 25.8%。Upstage 的发布文章将 24.1 描述为激活参数为 3B 的模型中 Index 最高的,领先于 Qwen3.6 35B A3B 的 18 和 Nemotron 3.5 Lightning 的 13——这一说法就其本身而言是公允的,而值得注意的是,它也正像听起来那样狭窄,因为这是一种关于 3B 激活参数这一类别的主张,而非泛泛地关于小模型。

真正应该影响你如何为它做预算的衡量指标,并不是 Index。Artificial Analysis 的按任务成本明细显示,Solar Mini 4 完成每个 Intelligence-Index 任务约需 $0.36,其中约 $0.30——大约 82%——来自提示缓存写入。缓存读取为 $0.03,生成的输出仅为 $0.035。该模型每个任务大约输出 88,300 个 token,其中约 71,600 个是推理 token。换句话说:这是一款便宜的模型,其账单主要由重写长上下文主导,而不是由它回写的 token 决定。各项评估的成本从 Terminal-Bench 4.0 的 $1.63 到 AA-Briefcase 的 $0.95 不等。在首个数据块延迟为 1.58 秒的情况下,输出速度中位数为每秒 198 个 token。

每条路径的价格

Solar Mini 4 目前并非按标价计价。Upstage 自己的定价页面对它采用一套带日期的阶梯价:每百万输入 $0.03、缓存 $0.003、输出 $0.12——即 70% 的发布折扣——有效期至 2026 年 10 月 10 日 UTC,随后从 10 月 11 日起为 $0.05 / $0.005 / $0.20,最后从 10 月 23 日起为标价 $0.10 / $0.01 / $0.40。Upstage 的发布文章对折扣的描述比定价页面自己的时间表更宽松;上面的阶梯才是带日期的版本,也是值得据以做规划的版本。注意最大折扣落在哪里:缓存输入降至输入价格的十分之一,这恰好奖励了上文缓存写入成本概况所收费的那种长期稳定上下文工作负载。

Kolibri 的价格是一张采购订单。没有可按每百万 token 比较的费率,因为不存在托管式计量——你为 GPU 和电费付费,而供应商唯一公开的成本信号就是训练运行本身:生产该模型约需 950 MWh。如果你已经拥有推理算力,Kolibri 的每 token 边际成本就趋近于电费;如果你没有,入场门槛就是一台双 A100 机器或更好的配置。这与一个你可以按百万 token 调用、明天就停止调用的模型相比,是根本不同的承诺形态,而这正是这两种选项所呈现的真正决策。

它们重叠之处,以及比较失效之处

• 活跃计算量——几乎相同:每个 token 为 3.46B 对 3B

• 由此推导出的一切——无法比较,因为两者中只有一个拥有任何经过验证的证据

• 最佳实测得分 — Solar Mini 4 的经审计指数为 24.05;Kolibri 只有厂商提供的表格,完全没有经审计的得分

• 德语 — 两者中只有 Kolibri 针对它进行了训练,每个 token 4.90 字节;Solar Mini 4 未列出它

• 韩语和日语 — Solar Mini 4 两者都列出;Kolibri 两者都未列出

• 长上下文——Kolibri 可验证完整的 1,048,576 个 token;Solar Mini 4 自家文档写的是 512K,而其 Artificial Analysis 卡片则写着 1M,因此应把上限视为因厂商而异

• 首个 token 的时间——Solar Mini 4 只需几分钟,因为注册即可;Kolibri 则需要数天,因为得把机器上架

• 成本模型——按 token 计,随折扣阶梯下降,对照资本加电力

诚实的总结是:这不是一场能在排行榜上分出高下的对决。Kolibri 的厂商表格甚至包含了自己的对比集——GLM-4.7 Flash 30B-A3B 总体英语 64.7、Nemotron 3 Nano 30B-A3B 65.6、Qwen3.5 35B-A3B 74.7、Qwen3.6 35B-A3B 71.4、Gemma 4 26B-A4B IT 71.9,全部对照 Kolibri 自己的 75.5——而这些行中的每一个都是 Aleph Alpha 自己的数字,由同一实验室在自家测试框架上跑出。它是一张有用的 3B 激活参数邻近区间地图。它不是独立排名。

如果你今天想要的是一个在按键上的 3B 激活 MoE

本对比中的两个模型都不在 OrcaRouter 上,值得精确说明原因。Kolibri 目前还没有任何形式的托管推理——它只是权重和一套 vLLM 配方,因此路由器没有任何可指向的东西。Solar Mini 4 由 Upstage 以及 Upstage 自己的本地部署渠道提供服务;我们不对其进行路由,也不路由任何 Upstage 模型。如果你想要其中任何一个,直接从厂商那里获取。

我们所提供的路由属于周边档位——这个稀疏小型 MoE 区间正是这两个模型竞争的所在。Gemma 4 26B-A4B IT 已上架目录,价格为每百万 token 输入 $0.06、输出 $0.33,上下文窗口为 262,144 token。Qwen3.5 35B-A3B 为 $0.057 / $0.459,Qwen3.6 35B-A3B 为 $0.248 / $1.485,上下文窗口为 262,144 token,最大输出 65,536 token。这与上面两个模型所做的取舍如出一辙——以小型模型的价格买到 3B 到 4B 的激活切片——可通过一个 API 密钥使用,提供商的标价按 0% 加价透传,因此供应商的价格变动在宣布当天就会计入你的账单,而不是等到下次合同续约时。自动故障转移在这里比平时更重要:当你评估一个未经检验的稀疏模型时,同一密钥背后的第二条路由正是防止一个糟糕的下午演变成故障的关键。

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

该做什么,以及该注意什么

如果你的工作负载是德语或英语,如果数据不能离开你自己的机架,并且如果你拥有——或者愿意购买——能以 FP8 服务 78B 的 GPU,那就选择 Kolibri。在这种配置下,它是这两个模型中唯一一个甚至还算得上选项的模型,而经过验证的 1M token 上下文,搭配每 token 4.90 字节的德语分词器,是一个真实的优势——尽管是厂商测量的。如果你想本周就投入生产,如果韩语或日语在路线图上,如果你的工作负载是缓存折扣所奖励的那种长期稳定的上下文,那就选择 Solar Mini 4;要为缓存写入做预算,而不是输出 token。

两者面临的未解问题相同,而且这是证据问题,而非能力问题。Kolibri 的 75.5 和 84.3 是 Aleph Alpha 在自家测试框架上得出的自家数字;在独立追踪机构运行之前,任何引用这些数字的人都只是在引用该实验室的说法。Solar Mini 4 的 24.05 真实且可复现,但 Index 反映的是一款仍处于折扣阶梯中途的模型的快照,标价要到 10 月 23 日才会出现。留意 Kolibri 的首次独立评估,也留意一旦折扣阶梯结束 Solar Mini 4 的实际价格——因为在 $0.10 / $0.40 下,租用 3B 切片的经济性看起来与今天报价的 $0.03 / $0.12 不同。