已為 Kolibri 解說生成主視覺卡片,標題為「Kolibri:來自德國的 78B 開放權重模型」,副標為「78B 總計 / 3.46B 啟用 / 1M-token 上下文 / Apache 2.0」,並有三個扁平線性圖示:一隻蜂鳥、一疊層,以及一份文件上的掛鎖。OrcaRouter 標誌位於圖稿下方的橫條中。
Guides & Insights

Kolibri,詳解:Aleph Alpha 以 Apache 2.0 授權推出 78B 德英模型

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Aleph Alpha 發布了Kolibri,時間是 2026 年 10 月 3 日;這是一個 781 億參數的混合專家模型,每個詞元啟用 34.6 億個參數,具備經過驗證的 1,048,576 詞元上下文視窗,並以 Apache 2.0 授權在 Hugging Face 上提供完整權重。海德堡實驗室在德國統一日發布了它,同時發布技術報告、德英雙語模型卡,以及一份異常詳盡的訓練過程說明。Aleph Alpha 自家文件從頭到尾拿來比較的模型是 Kolibri Origin——那個 306 億參數、32.7 億活躍參數的前代模型,於 2026 年 6 月 11 日完成預訓練,且從未公開發布。兩個模型相隔三個月,而它們之間的差距是這次發布中最有意思的地方。

讓 Kolibri 值得仔細一讀的原因,並不是它是目前最強大的模型。在 Aleph Alpha 自家的比較表上,它並不是,而我們之後會談到這點。真正值得注意的是,一家歐洲實驗室竟然推出了這種規模的開放權重模型,同時一併公開訓練流程、資料溯源與能耗數據,並將授權條款設為 Apache 2.0,而非客製化的研究授權。對於採購規則第一條就是「資料會流向何處」的團隊而言,這樣的組合本身就是產品。

規格表,以及真正重要的兩個數字

以下所有內容皆來自 Aleph Alpha 隨權重一併發布的模型卡;目前尚未有任何一項經過獨立重現,而且截至撰寫本文時,Artificial Analysis 尚無 Kolibri 的資料列。

• 總參數量 — 78,103,074,560,每個 token 啟用 3,457,573,120 個,比例約為 22.6 比 1。

• 架構 — 一個50層的 Transformer,所有層皆為混合專家,每層有384個專家,其中1個共享、6個路由,以及整個堆疊中滑動視窗與分組查詢注意力的比例為4:1。

• 背景 — 在 16,384 個符元上訓練,在 65,536 個符元上進行中期訓練,並擴展至原生 262,144 個符元。由於位置編碼僅套用於滑動視窗層,Aleph Alpha 表示視窗可在不進行位置縮放的情況下延伸,且已驗證在最高 1,048,576 個符元下的品質與服務效率。該模型卡建議,延遲敏感的工作與複雜任務應維持在 262,144 或以下。

• 精確度 — 採用 128×128 區塊的 FP8 權重,搭配動態量化的激活值,並以 FP8 KV 快取進行評估;嵌入、LM head、正規化層與 MoE 路由器則維持 bfloat16。

• 推理 — 四種投入等級:無、低、中、高,透過聊天範本設定。

• 工具呼叫 — 可以,採用 Hermes 風格,並附有與權重一同放在同一儲存庫中的 vLLM 解析器。

• 語言 — 德語與英語,別無其他。這被表述為一項設計選擇,而非遺漏。

• 訓練 — 在經過篩選的雙語語料庫上使用 20 兆個預訓練 token,約 62.5% 為英文、23.9% 為德文、13.6% 為程式碼,另有 3.44 兆個中期訓練 token,以及 2,010 億個用於長上下文擴展的 token。

• 運算 — 768 顆 NVIDIA B200,部署於 96 個 HGX 節點,預訓練 21 天,共 511 小時與 392,000 GPU 小時,據報導達 6.4×10²³ FLOPs。中期訓練另增加五天與 90,000 GPU 小時;長上下文擴展則增加 13 小時與 10,000 GPU 小時。

• 能源 — 估計為 9.5×10² MWh,包含資料中心額外開銷,涵蓋預訓練、中期訓練與長上下文訓練,但不包括監督式微調與強化學習。

• 授權條款 — Apache 2.0。沒有可接受使用附加條款、沒有月活躍使用者門檻、沒有另訂的商業條款。

那幾行裡有兩行是買家應該讀兩遍的。活躍參數數量是你在推論時要付出的成本,而總計 780 億個參數中有 34.6 億個活躍參數,這是相當激進的稀疏比例——這正是這種規模的模型竟能在兩張 GPU 上提供服務的全部原因。而上下文長度數字標示為原生 262,144、經驗證 1,048,576,這比你在大多數關於這次發布的報導中會看到的單純「1M 上下文」說法更為謹慎。

Generated single-column scoreboard for Kolibri with six rows: total parameters 78.1B, active per token 3.46B, context 262,144 native and 1M validated, licence Apache 2.0, independent score 'none published', and deployment floor 2x H100 80GB. The footer reads 'All figures vendor-reported from the model card; no independent evaluation yet.'

兩款型號,相隔三個月

Kolibri 是 Aleph Alpha 所謂 Model Factory 所推出的第二個模型,而它公布的時程表,正是大多數報導在這次發布中最常略過的部分。

訓練流程的工作自 2026 年 1 月開始。Kolibri Origin 於 2026 年 6 月 11 日在目標規模下完成預訓練——總參數 306 億,活躍參數 32.7 億,65,536 詞元的上下文視窗,7.51 兆訓練詞元,50 層之中兩層為稠密層、48 層為 MoE,以及單一推理模式。它經過內部驗證,從未公開發布。Kolibri 於 2026 年 9 月 11 日完成預訓練。

• 參數 — 總計 30.6B、活躍 3.27B,對比之下為總計 78.1B、活躍 3.46B。

• 上下文 — 在 Origin 上,8,192 個 token 的預訓練上下文,對比 Kolibri 的 16,384,最終達到原生 262,144。

• 資料 — 在 Origin 上,預訓練使用 7.51 兆個 token,相較於 20 兆;這些 token 取自超過 200 兆的原始池,並經資料管線過濾、去重與精選整理。

• 架構 — 在 Origin 上,兩個密集層加上 48 個 MoE 層,對比 50 個 MoE 層,具有改變的注意力設計、三倍的專家數量、更高的稀疏性以及替換的路由演算法。

• 推理 — Origin 上有一種模式,對比 Kolibri 上的無、低、中和高。

• 發行 — Origin 無公開發行,Kolibri 為 2026年10月3日。

變動最大的數字是任務套件(task-suite)那組,因為兩個模型都是由同一套評估工具評分的。在德語的後訓練套件平均分上,Origin 得分為 46.4,Kolibri 為 70.8;在英語平均分上,則是 54.1 對 75.5。在德語的 AIME 2025 上,為 73.5 對 87.5。在廠商以垂直套組形式公布的內部客戶代理(customer-proxy)基準測試中,汽車供應商套件從 0.72 提升到 0.99,半導體從 0.35 提升到 0.80,德國公部門從 0.54 提升到 0.75,工業驅動技術從 0.31 提升到 0.60,航太從 0.14 提升到 0.59。

那些內部垂直領域數字是由廠商操作、在廠商打造且圍繞廠商客戶設計的評估套件上跑出來的,所以請把它們當成對意圖的描述,而不是分數。公布它們的重點在於,它們說明了該模型是為了什麼而最佳化:不是排行榜,而是一組受監管產業的文件。

Screenshot of Aleph Alpha's newsroom post 'Kolibri Has Landed: A Sovereign Open-Weight Model', showing the opening lines dating the release to the Day of German Reunification, describing Kolibri as an English-German mixture-of-experts transformer with 78B total and 3B active parameters, context lengths up to 1M tokens, full weights on Hugging Face under Apache 2.0, and the paragraph on Kolibri Origin as the 30B total, 3B active predecessor with a 65k context window.

德語在這裡是一項設計決策,而不是一個語言標籤。

大多數「多語言」模型卡的意思是,訓練資料組合中恰好包含了一些德語。這個模型則反其道而行,而且模型卡對其運作機制有具體說明。

Aleph Alpha 從小型代理模型實驗中發現,混合資料中約有 20% 的德語資料時結果最佳,而對於 20 兆詞元的訓練量而言,這意味著得找到 4 兆個德語詞元。去重並過濾後的公開德語資料集只提供了 3,900 億個——與目標相差一個數量級。該公司以三種方式補足缺口:針對德語重新調校 Common Crawl 篩選器,產生了 1.3 兆個獨特的有機詞元;將既有德語文件改寫成百科全書式條目、問答對話與文本段落,又增加了約 1 兆個,並成為單一最大的德語來源;以及翻譯,僅用於 Kolibri Origin,在 Kolibri 中已捨棄。德語最終成為 2.4 兆詞元的獨特池,其中 80% 是內部策劃或生成的,經上採樣後占預訓練詞元的 21.3%。

這個篩選細節值得引用,因為這種事情只會在真正用德語訓練過的實驗室裡才會浮現。標準的語言資料管線會丟棄含有太多長詞的文件——但德語行政公文向來超出英語對平均詞長的界限,因此預設設定便悄悄刪除了公共行政所書寫的那種語域。顯而易見的商業後果是,用現成英語篩選器訓練出來的模型,根本沒什麼德語法律行政詞彙可言,而沒有任何基準測試會告訴你這件事。

分詞器也獲得同樣的待遇。Aleph Alpha 使用一種稱為 UniBPE 的新方法,訓練了一個雙語德英分詞器,詞彙量為 128,000 個符元。該方法保留了位元組對編碼的由下而上合併,但以 unigram 目標來選擇合併。在德語網頁文本上,它報告每個符元平均 4.90 位元組,領先 GPT-5 的 4.35、Gemini 的 4.13、Qwen3.5–3.8 的 4.17、GLM 5.3 的 3.93、DeepSeek V4 的 3.72 以及 Kimi K3 的 3.28——所有這些都是廠商在其自身比較中報告的數字。每個符元容納更多文字意味著每項任務使用的符元更少,這是直接的推論成本效應,而非品質聲明,而且這種效率優勢會在文件處理工作負載中產生複合效果。

供應商表格未能解決的事項

Aleph Alpha 發布了一份涵蓋十四個模型的後訓練比較,這份比較比大多數發布表格更有用,因為它並不美化其主體。

在同一套測試框架上,當 Kolibri 的推理強度設為 high 時,Qwen3.8 27B 在英文平均上得分 80.2,而 Kolibri 為 75.5;在德文平均上得分 79.9,對比 70.8。它在 GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified 以及兩項長上下文基準測試上也居於領先。Nemotron 3 Super 120B-A12B 的英文得分為 73.0,對比 Kolibri 的 75.5——差距更近,並在 AIME 2025 上領先。Gemma 4 26B-A4B IT 在兩項平均上分別得分 71.9 和 66.3。

所以,這次發布誠實的總結並不是「最先進」。而是 Kolibri 位於一類每 token 啟用三十億到一百二十億參數的模型之間的中段,它明顯勝過那些小得多的模型,卻在自己表格的大多數列上輸給 Alibaba 一個稠密的 270 億參數模型,儘管它啟用的參數大約只有八分之一。Aleph Alpha 對此的框架是品質對上每 GPU 每秒解碼 token 數的帕雷托前沿——在所有比較模型中,沒有任何一個能在相同服務成本下提供更高品質,或以更低成本提供相同品質。這才是值得追問的主張,而這是服務經濟學的主張,不是能力主張。

這些數字均未經獨立驗證。Kolibri 沒有 Artificial Analysis 的收錄條目,評估框架也沒有第三方複製驗證,而垂直基準測試是供應商自行建構的。這項比較在結構上也在一個方向上對 Kolibri 特別寬容,在另一個方向上則不夠寬容:全部十四個模型都透過 Aleph Alpha 自家的測試框架執行,使用相同的提示與少樣本設定,這是正確的做法,但它仍然只是一家實驗室的測試框架。在本節中,除非有其他人實際跑過,否則每個數字都應視為供應商自行報告的結果。

Screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the licence badge apache-2.0 and the Model overview block: architecture Mixture-of-Experts, 78B total parameters given as 78,103,074,560, active parameters per token 3,457,573,120, languages German and English, context length 1,048,576 tokens with a recommendation to stay at or below 262,144 for serving efficiency and complex tasks, float8_e4m3 weights in 128x128 blocks with an FP8 KV cache and embeddings, LM head, norms and MoE router in bfloat16, reasoning mode yes, tool calling yes, and the June 18 2026 knowledge cutoff.

執行它所需的項目

Kolibri 不是那種可以在筆電上試跑的模型。FP8 權重的模型記憶體佔用量約為 78 GB,而顯示卡的最低需求是兩張 A100 80 GB、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300;建議配置是兩張 H100 SXM5、兩張 H200、一張 B200 或一張 B300。

要提供這項服務,意味著安裝 aleph-alpha-inference 套件,該套件提供 Kolibri vLLM 外掛並固定其所支援的 vLLM 版本,或是拉取容器映像檔 ghcr.io/aleph-alpha/aleph-alpha-inference。從那裡開始,就是標準的 vLLM 呼叫,搭配 FP8 KV 快取、Kolibri 推理剖析器與 Kolibri 工具呼叫剖析器。超過 262,144 個 token 的上下文需要明確的 maximum-model-length 旗標,以及位置嵌入覆寫。建議的取樣參數為 temperature 1.0、top-p 0.97 和 top-k 128。

這個 API 介面與 OpenAI 相容,這點比聽起來更重要:推理強度會以 reasoning_effort 值的形式,透過聊天範本傳遞,而工具呼叫則會以標準的 tools 欄位發出。已經熟悉 chat-completions 格式的團隊,可以直接把現有程式碼指向自家建築物內某台機器上的 Kolibri 端點,不需要中介包裝層。

Kolibri 目前尚未具備的功能

有四項缺席值得直言,因為上市報導往往會略過它們。

• 無獨立評估。Artificial Analysis 沒有 Kolibri 的模型頁面,且沒有任何第三方發表過該廠商基準測試表的複現。

• 供應商並未提供託管端點。此次發佈內容為權重加上技術報告;在隨模型發佈的資料中,並沒有針對 Kolibri 的 Aleph Alpha API SKU。

• 在 OrcaRouter 上沒有路由,在我們會點名的任何聚合器上也一樣沒有。我們用供應商前綴與模型名稱的每一種拼法探遍了目錄,Kolibri 就是不在那裡——所以如果你想呼叫它,你就是在自行下載 78 GB 並執行一個 vLLM 端點。我們寧願這樣說,也不願暗示我們有提供它。

• 不支援多模態輸入。文字進、文字出,兩種語言。這是該實驗室為了深度而犧牲廣度所做的取捨,而對文件處理的部署來說,這大概是正確的取捨,但這是一道真實的界線。

如果你今天真正需要的,是一個不必買兩張 GPU 就能呼叫的小型混合專家模型,那麼 Gemma 4 MoE 層級就是已經在路由端點上最接近的選擇:26B-A4B 變體的價格為每百萬輸入 token 0.06 美元、每百萬輸出 token 0.33 美元,並提供 262,144 token 的視窗。對於任何拿自架的 78B 主權部署來與之權衡的人而言,有用的比較不是基準測試的列數——而是 78 GB 的 VRAM,以及一場採購討論對上按 token 計費的單一項目。 OrcaRouter 以單一 OpenAI 相容金鑰路由該層級,並原樣轉嫁供應商的定價,不額外加價,這正是便宜得知該工作負載是否值得擁有硬體的方式。

Kolibri 本身是更有趣的產物。一個以 Apache 2.0 授權的 780 億參數德英模型,連同資料管線、分詞器方法、能耗數據,以及為期三個月的迭代歷程,與權重一同發布,這是一種不同於常見權重釋出的發布方式——揭露本身就是產品的一部分,而不是一篇關於產品的部落格文章。帕雷托主張是否禁得起檢驗,現在要由擁有兩張 H100 和一個碼錶的人來回答,而答案不會來自任何寫過模型卡的人。