为 Kolibri vs Qwen 3.8 生成的主视觉卡片,标题为“Kolibri vs Qwen 3.8”,副标题为“以主权的德国服务对阵开放的中国模型家族”,左侧是蜂鸟图标,右侧是云朵轮廓,分列于一条细分割线两侧。OrcaRouter 标志位于画面下方的条带中。
Guides & Insights

Kolibri 对决 Qwen 3.8:德国模型在自家榜单上落败,而这正是关键所在

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

从大多数关于Kolibri发布报道都略过的那句话说起。在 Aleph Alpha 于 2026 年 10 月 3 日随自家模型一同发布的基准测试表上,与之对比次数最多的模型,既不是欧洲的对手,也不是美国的。它就是Qwen3.8 27B,即该厂商那一代模型中的开放权重版本,于 2026 年 8 月 13 日发布——而按照 Aleph Alpha 自己给出的数据,它赢了。在同一套评测中,Qwen3.8 27B 的英文平均分为 80.2,德文平均分为 79.9;而 Kolibri 在这两项上分别是 75.5 和 70.8。它在 GPQA Diamond 上领先,89.2 对 84.3。它在 LiveCodeBench v6 上领先,93.8 对 85.9。它在 SWE-Bench Verified 上领先,72.6 对 66.4;在两个长上下文基准上也领先:LongBench Pro 上 76.9 对 64.5,AA-LCR 上 81.3 对 68.3。一个 270 亿参数的稠密中文模型,由一家德国实验室评测,却在该实验室自己那张表上的多数项目中击败了其 780 亿参数的旗舰模型。这算不上丑闻。这是此次发布中最有用的事实,因为它逼出了一个问题:Kolibri 究竟是做什么用的。

在继续比较之前需要先澄清一点,因为“Qwen 3.8”命名的是一个系列而非单个模型,而这里的区别很重要。Qwen3.8-Max是阿里巴巴的托管旗舰,自 2026 年 8 月 3 日起上线,提供 100 万 token 上下文窗口,每百万输入 token 2.00 美元,输出 6.00 美元。Qwen3.8-27B是开放权重层级,于 2026 年 8 月 13 日发布,上下文窗口为 262,144 token。Qwen3.8-Flash是走量层级,于 2026 年 8 月 26 日发布,具有 100 万 token 窗口和低得多的价格。而普通的 Qwen3.8——于 2026 年 7 月 19 日宣布,作为 2.4 万亿参数开放权重旗舰——尚未发布;它仅以目录跟踪页面和公告的形式存在。下面所有内容都是关于那个你可以下载并运行其权重的模型,也就是 27B。

Kolibri 真正胜出之处,从同一张表中读出

Kolibri 领先 Qwen3.8 27B 的那些行并非随机分散。它们会聚集起来,而这种聚集本身就是成果。

• 弃答——在 RGB Negative 上,Kolibri 得分为 85.6,而对照值为 70.6。当上下文不包含答案时,Kolibri 明确表示这一点的频率要高得多。

• 约束条件下的工具调用——在 τ²-bench telecom 上为 94.7,对比 82.5;在汽车供应商垂直套件上为 99.0,对比 97.3。

• 超长上下文——在无干扰项且超过 24k token 的 SealQA 上,100.0 对 94.4。

• 德语服务经济性——一个双语分词器在德语网页文本上平均每 token 4.90 字节,而根据 Aleph Alpha 自己的测量,Qwen3.5–3.8 系列为 4.17 字节。每份德语文档的 token 数更少,直接降低推理成本,这会体现在发票上,却不会出现在任何基准测试的行中。

这四项中有三项关乎行为而非能力。拒答、受约束的工具调用,以及有据可依的长上下文检索,正是你从一个需要读取本机构自有资料、并被期望在资料无法回答问题时如实承认的模型身上所需要的东西。Aleph Alpha 整个发布都围绕这一赌注展开,而表格显示这一赌注已然落地。

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Qwen3.8 27B 胜出的那几行关乎的是广度:两种语言的知识、研究生水平的科学问题、竞技编程、仓库级软件工程、长文档理解。如果你需要的是一个每 token 价格低廉、权重开放的强大通用模型,那 Qwen3.8 27B 就是更好的模型,而这张表正是用厂商自己的笔墨写明了这一点。

那种解读得到了佐证,而 Kolibri 的解读则没有。Artificial Analysis 独立测量了 Qwen3.8 27B 的 Xhigh 推理配置,并报告其 Intelligence Index 为 34,在该对比的 142 个模型中位列第 1,每秒输出 45.4 个 token,上下文长度为 256,000 个 token,采用 Apache 2.0 许可证。他们的说明以一种熟悉的方式并不中听——在索引评估期间生成了 2 亿个 token,而中位数为 8200 万,显得非常啰嗦,而且速度慢——但这个分数本身是对对手的第三方测量。Kolibri 根本没有 Artificial Analysis 页面。因此,这场对比中最强的模型已得到独立验证,而较弱的那个则只是厂商的一面之词,这与第一代欧洲旗舰通常被描述的方式正好相反。

两种方向相反的供应链主张

这两个发布都在争论模型源自何处,而这些争论互为镜像。

Aleph Alpha 的案例在于把溯源作为一项特性。Kolibri 由德国团队在德国和芬兰的基础设施上训练,依据欧盟和德国法律。模型卡披露了预训练数据配比——20 万亿 token,其中约 62.5% 为英语、23.9% 为德语、13.6% 为代码——中期训练和长上下文预算,确切算力为 768 块 NVIDIA B200,分布于 96 个 HGX 节点、运行 21 天,以及估计为 9.5×10² 兆瓦时的能源消耗(包含数据中心开销)。它详细说明了训练方法,精确到层:一个 50 层的混合专家 Transformer,以 4:1 的比例在滑动窗口注意力与分组查询注意力之间分配,在 384 个专家上使用 Muon 与精确分位数平衡(Exact Quantile Balancing),其中 1 个共享、6 个路由。一份 78 GB 的下载文件附带一万二千词的披露信息,以及就欧盟《通用人工智能行为准则》所声明的签署方立场。

阿里巴巴的情况则性质不同:不是“我们能解释每一项决策”,而是“权重在此,拿去便是”。以 Apache 许可证发布的开源权重,其规模和质量使 Qwen 成为全球事实上的默认选择;一个包含 248,077 个词元、覆盖一百多种语言的词表;以及一个围绕这些检查点调优已久、以至于几乎所有推理栈都能开箱即用地支持它们的服务生态。这里的主权论点关乎可用性:没有哪个供应商能撤回该模型,因为文件已经在你自己手里了。

这两种说法都是诚实的,而且回应的是不同的担忧。巴登-符腾堡州的一位公共部门采购者担心的是管辖权和可审计性,而 Kolibri 正是为了回应这种担忧。内罗毕或圣保罗的一个研究团队担心的是,模型被信用卡门槛挡住,而且要用一种他们无法支付的货币付款,而开放的 Qwen 权重回应的正是这种担忧。不诚实的是,假装其中任何一个是能力对比,因为能力表已经给出了答案。

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

许可差距确实存在,但比听起来要小。

Kolibri 采用 Apache 2.0 许可。Qwen3.8 27B 是以 Apache 许可发布的开放权重模型。两者都不附带可接受使用附加条款,没有月活跃用户数门槛,也没有单独的商业条款——这使它们归入一个小众类别,也意味着二者在投入商业使用前都无需经过法律审查。

真正区分二者的是许可证之后的一切。Kolibri 随附厂商提供的 vLLM 插件和解析器包、一个容器镜像、可通过聊天模板配置的四档推理力度级别、明确的弃答行为,以及一套推荐的采样配置。Qwen3.8 27B 则以权重形式交付,Transformers、vLLM 和 SGLang 本就懂得如何服务它,其工具调用格式也让更广泛的生态系统有数月时间来适配。

部署硬件也呈现同样的分化。Kolibri 的 FP8 权重占用约 78 GB,最低门槛是两张 A100 80 GB 卡、两张 H100 SXM5、一张 H200、一张 B200 或一张 B300。Qwen3.8 27B 的 bfloat16 权重约为 54 GB,全精度下只需单块 80 GB 加速器,量化版本所需则少得多。这个德国模型需要更多硬件,换来的基准测试成绩却更低。只有当你买的是基准测试成绩时,这才算一笔糟糕的交易。

价格标签能告诉你什么,不能告诉你什么

Kolibri 没有价格,因为 Aleph Alpha 并不为其出售推理服务。此次发布的是权重、一份技术报告和一张模型卡;没有托管 SKU。任何关于 Kolibri 的成本数字,都是你自己做的硬件摊销计算。

Qwen3.8 公开发布了三个定价层级,而对于在自托管与租用之间做比较的团队来说,中间那个层级才是关键。

• Qwen3.8-Max — 每百万输入 token $2.00,输出 $6.00,100 万 token 上下文,缓存读取 $0.25,2026 年 8 月 3 日发布。

• Qwen3.8-27B — 输入 $0.33,输出 $2.40,262,144 token 上下文,发布于 2026 年 8 月 13 日。这些是开放权重,因此如果你不想自行运行它们,这就是你需要支付的价格。

• Qwen3.8-Flash — 输入 $0.15、输出 $0.47,支持 1M token 上下文窗口,发布于 2026 年 8 月 26 日。

那些是提供商在OrcaRouter 上的标价,按 token 原样透传、不额外加价,当问题在于自托管部署能否收回成本时,这正是它有用的特性:你可以先按托管档位的价格衡量自己的真实 token 用量,再决定是否投入硬件。我们不额外加价,所以供应商降价当天就会在我们这边生效。Qwen3.8 的全部三个档位今天都已可路由,只需一个兼容 OpenAI 的密钥,并能在各提供商之间自动故障转移,而即将推出的 2.4 万亿参数 Qwen3.8 已有一个目录页面静候权重上线,而不是放一个假装已在提供服务的占位符。

Kolibri 不可路由。我们以每一种供应商和模型拼写方式探查了目录,它都不在其中——所以唯一能调用它的方式就是那 78 GB 的下载。如果你想知道德国模型会让你的工作负载付出多少成本,答案就是一台机架,以及一个能运行 vLLM 的人,而目前没有任何第三方能给你报出别的报价。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

谁该买哪款

这个决定并不取决于质量,因为那个问题已由供应商自己提供的表格裁定,结果对阿里巴巴有利。它取决于你要防范的是哪一种风险。

• 如果具有约束力的限制因素是司法管辖区、来源可追溯性文档或可审计性,请选择 Kolibri——如果你需要能够回答训练数据来自哪里、计算在哪里运行、依据哪一法律,并且如果你的工作负载是在你自己的边界内处理的德语和英语文档。你为此支付的是能力溢价,而这一溢价在上表中清晰可见。

• 如果关键制约因素是每美元的能力、语言覆盖面或生态系统支持,请选择 Qwen3.8 27B。在 Aleph Alpha 自己的评估中,它是更强的模型,它采用 Apache 许可,它可以在一个加速器上运行,而且如果你根本不想自己运行它,托管套餐的起价为每百万输入 token 0.33 美元。

• 如果工作负载既有受监管的核心,又有通用外围,就在同一架构中同时考虑两者。不能离开本地的文档发送到自托管的 Kolibri 端点;摘要、翻译和代码工作则交给经路由的 Qwen3.8 层级,每千个 token 三分之一美分。一个 API 密钥、一条路由规则、提供商标价原样透传,故障转移也为你处理妥当——这比从这两者中挑一个并假装另一个不存在,要实用得多。