
Kolibri,詳解:Aleph Alpha 以 Apache 2.0 授權推出 78B 德英模型
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
Aleph Alpha 發布了Kolibri,時間是 2026 年 10 月 3 日;這是一個 781 億參數的混合專家模型,每個詞元啟用 34.6 億個參數,具備經過驗證的 1,048,576 詞元上下文視窗,並以 Apache 2.0 授權在 Hugging Face 上提供完整權重。海德堡實驗室在德國統一日發布了它,同時發布技術報告、德英雙語模型卡,以及一份異常詳盡的訓練過程說明。Aleph Alpha 自家文件從頭到尾拿來比較的模型是 Kolibri Origin——那個 306 億參數、32.7 億活躍參數的前代模型,於 2026 年 6 月 11 日完成預訓練,且從未公開發布。兩個模型相隔三個月,而它們之間的差距是這次發布中最有意思的地方。
讓 Kolibri 值得仔細一讀的原因,並不是它是目前最強大的模型。在 Aleph Alpha 自家的比較表上,它並不是,而我們之後會談到這點。真正值得注意的是,一家歐洲實驗室竟然推出了這種規模的開放權重模型,同時一併公開訓練流程、資料溯源與能耗數據,並將授權條款設為 Apache 2.0,而非客製化的研究授權。對於採購規則第一條就是「資料會流向何處」的團隊而言,這樣的組合本身就是產品。
規格表,以及真正重要的兩個數字
以下所有內容皆來自 Aleph Alpha 隨權重一併發布的模型卡;目前尚未有任何一項經過獨立重現,而且截至撰寫本文時,Artificial Analysis 尚無 Kolibri 的資料列。
• 總參數量 — 78,103,074,560,每個 token 啟用 3,457,573,120 個,比例約為 22.6 比 1。
• 架構 — 一個50層的 Transformer,所有層皆為混合專家,每層有384個專家,其中1個共享、6個路由,以及整個堆疊中滑動視窗與分組查詢注意力的比例為4:1。
• 背景 — 在 16,384 個符元上訓練,在 65,536 個符元上進行中期訓練,並擴展至原生 262,144 個符元。由於位置編碼僅套用於滑動視窗層,Aleph Alpha 表示視窗可在不進行位置縮放的情況下延伸,且已驗證在最高 1,048,576 個符元下的品質與服務效率。該模型卡建議,延遲敏感的工作與複雜任務應維持在 262,144 或以下。
• 精確度 — 採用 128×128 區塊的 FP8 權重,搭配動態量化的激活值,並以 FP8 KV 快取進行評估;嵌入、LM head、正規化層與 MoE 路由器則維持 bfloat16。
• 推理 — 四種投入等級:無、低、中、高,透過聊天範本設定。
• 工具呼叫 — 可以,採用 Hermes 風格,並附有與權重一同放在同一儲存庫中的 vLLM 解析器。
• 語言 — 德語與英語,別無其他。這被表述為一項設計選擇,而非遺漏。
• 訓練 — 在經過篩選的雙語語料庫上使用 20 兆個預訓練 token,約 62.5% 為英文、23.9% 為德文、13.6% 為程式碼,另有 3.44 兆個中期訓練 token,以及 2,010 億個用於長上下文擴展的 token。
• 運算 — 768 顆 NVIDIA B200,部署於 96 個 HGX 節點,預訓練 21 天,共 511 小時與 392,000 GPU 小時,據報導達 6.4×10²³ FLOPs。中期訓練另增加五天與 90,000 GPU 小時;長上下文擴展則增加 13 小時與 10,000 GPU 小時。
• 能源 — 估計為 9.5×10² MWh,包含資料中心額外開銷,涵蓋預訓練、中期訓練與長上下文訓練,但不包括監督式微調與強化學習。
• 授權條款 — Apache 2.0。沒有可接受使用附加條款、沒有月活躍使用者門檻、沒有另訂的商業條款。
那幾行裡有兩行是買家應該讀兩遍的。活躍參數數量是你在推論時要付出的成本,而總計 780 億個參數中有 34.6 億個活躍參數,這是相當激進的稀疏比例——這正是這種規模的模型竟能在兩張 GPU 上提供服務的全部原因。而上下文長度數字標示為原生 262,144、經驗證 1,048,576,這比你在大多數關於這次發布的報導中會看到的單純「1M 上下文」說法更為謹慎。

兩款型號,相隔三個月
Kolibri 是 Aleph Alpha 所謂 Model Factory 所推出的第二個模型,而它公布的時程表,正是大多數報導在這次發布中最常略過的部分。
訓練流程的工作自 2026 年 1 月開始。Kolibri Origin 於 2026 年 6 月 11 日在目標規模下完成預訓練——總參數 306 億,活躍參數 32.7 億,65,536 詞元的上下文視窗,7.51 兆訓練詞元,50 層之中兩層為稠密層、48 層為 MoE,以及單一推理模式。它經過內部驗證,從未公開發布。Kolibri 於 2026 年 9 月 11 日完成預訓練。
• 參數 — 總計 30.6B、活躍 3.27B,對比之下為總計 78.1B、活躍 3.46B。
• 上下文 — 在 Origin 上,8,192 個 token 的預訓練上下文,對比 Kolibri 的 16,384,最終達到原生 262,144。
• 資料 — 在 Origin 上,預訓練使用 7.51 兆個 token,相較於 20 兆;這些 token 取自超過 200 兆的原始池,並經資料管線過濾、去重與精選整理。
• 架構 — 在 Origin 上,兩個密集層加上 48 個 MoE 層,對比 50 個 MoE 層,具有改變的注意力設計、三倍的專家數量、更高的稀疏性以及替換的路由演算法。
• 推理 — Origin 上有一種模式,對比 Kolibri 上的無、低、中和高。
• 發行 — Origin 無公開發行,Kolibri 為 2026年10月3日。
變動最大的數字是任務套件(task-suite)那組,因為兩個模型都是由同一套評估工具評分的。在德語的後訓練套件平均分上,Origin 得分為 46.4,Kolibri 為 70.8;在英語平均分上,則是 54.1 對 75.5。在德語的 AIME 2025 上,為 73.5 對 87.5。在廠商以垂直套組形式公布的內部客戶代理(customer-proxy)基準測試中,汽車供應商套件從 0.72 提升到 0.99,半導體從 0.35 提升到 0.80,德國公部門從 0.54 提升到 0.75,工業驅動技術從 0.31 提升到 0.60,航太從 0.14 提升到 0.59。
那些內部垂直領域數字是由廠商操作、在廠商打造且圍繞廠商客戶設計的評估套件上跑出來的,所以請把它們當成對意圖的描述,而不是分數。公布它們的重點在於,它們說明了該模型是為了什麼而最佳化:不是排行榜,而是一組受監管產業的文件。

德語在這裡是一項設計決策,而不是一個語言標籤。
大多數「多語言」模型卡的意思是,訓練資料組合中恰好包含了一些德語。這個模型則反其道而行,而且模型卡對其運作機制有具體說明。
Aleph Alpha 從小型代理模型實驗中發現,混合資料中約有 20% 的德語資料時結果最佳,而對於 20 兆詞元的訓練量而言,這意味著得找到 4 兆個德語詞元。去重並過濾後的公開德語資料集只提供了 3,900 億個——與目標相差一個數量級。該公司以三種方式補足缺口:針對德語重新調校 Common Crawl 篩選器,產生了 1.3 兆個獨特的有機詞元;將既有德語文件改寫成百科全書式條目、問答對話與文本段落,又增加了約 1 兆個,並成為單一最大的德語來源;以及翻譯,僅用於 Kolibri Origin,在 Kolibri 中已捨棄。德語最終成為 2.4 兆詞元的獨特池,其中 80% 是內部策劃或生成的,經上採樣後占預訓練詞元的 21.3%。
這個篩選細節值得引用,因為這種事情只會在真正用德語訓練過的實驗室裡才會浮現。標準的語言資料管線會丟棄含有太多長詞的文件——但德語行政公文向來超出英語對平均詞長的界限,因此預設設定便悄悄刪除了公共行政所書寫的那種語域。顯而易見的商業後果是,用現成英語篩選器訓練出來的模型,根本沒什麼德語法律行政詞彙可言,而沒有任何基準測試會告訴你這件事。
分詞器也獲得同樣的待遇。Aleph Alpha 使用一種稱為 UniBPE 的新方法,訓練了一個雙語德英分詞器,詞彙量為 128,000 個符元。該方法保留了位元組對編碼的由下而上合併,但以 unigram 目標來選擇合併。在德語網頁文本上,它報告每個符元平均 4.90 位元組,領先 GPT-5 的 4.35、Gemini 的 4.13、Qwen3.5–3.8 的 4.17、GLM 5.3 的 3.93、DeepSeek V4 的 3.72 以及 Kimi K3 的 3.28——所有這些都是廠商在其自身比較中報告的數字。每個符元容納更多文字意味著每項任務使用的符元更少,這是直接的推論成本效應,而非品質聲明,而且這種效率優勢會在文件處理工作負載中產生複合效果。
供應商表格未能解決的事項
Aleph Alpha 發布了一份涵蓋十四個模型的後訓練比較,這份比較比大多數發布表格更有用,因為它並不美化其主體。
在同一套測試框架上,當 Kolibri 的推理強度設為 high 時,Qwen3.8 27B 在英文平均上得分 80.2,而 Kolibri 為 75.5;在德文平均上得分 79.9,對比 70.8。它在 GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified 以及兩項長上下文基準測試上也居於領先。Nemotron 3 Super 120B-A12B 的英文得分為 73.0,對比 Kolibri 的 75.5——差距更近,並在 AIME 2025 上領先。Gemma 4 26B-A4B IT 在兩項平均上分別得分 71.9 和 66.3。
所以,這次發布誠實的總結並不是「最先進」。而是 Kolibri 位於一類每 token 啟用三十億到一百二十億參數的模型之間的中段,它明顯勝過那些小得多的模型,卻在自己表格的大多數列上輸給 Alibaba 一個稠密的 270 億參數模型,儘管它啟用的參數大約只有八分之一。Aleph Alpha 對此的框架是品質對上每 GPU 每秒解碼 token 數的帕雷托前沿——在所有比較模型中,沒有任何一個能在相同服務成本下提供更高品質,或以更低成本提供相同品質。這才是值得追問的主張,而這是服務經濟學的主張,不是能力主張。
這些數字均未經獨立驗證。Kolibri 沒有 Artificial Analysis 的收錄條目,評估框架也沒有第三方複製驗證,而垂直基準測試是供應商自行建構的。這項比較在結構上也在一個方向上對 Kolibri 特別寬容,在另一個方向上則不夠寬容:全部十四個模型都透過 Aleph Alpha 自家的測試框架執行,使用相同的提示與少樣本設定,這是正確的做法,但它仍然只是一家實驗室的測試框架。在本節中,除非有其他人實際跑過,否則每個數字都應視為供應商自行報告的結果。

執行它所需的項目
Kolibri 不是那種可以在筆電上試跑的模型。FP8 權重的模型記憶體佔用量約為 78 GB,而顯示卡的最低需求是兩張 A100 80 GB、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300;建議配置是兩張 H100 SXM5、兩張 H200、一張 B200 或一張 B300。
要提供這項服務,意味著安裝 aleph-alpha-inference 套件,該套件提供 Kolibri vLLM 外掛並固定其所支援的 vLLM 版本,或是拉取容器映像檔 ghcr.io/aleph-alpha/aleph-alpha-inference。從那裡開始,就是標準的 vLLM 呼叫,搭配 FP8 KV 快取、Kolibri 推理剖析器與 Kolibri 工具呼叫剖析器。超過 262,144 個 token 的上下文需要明確的 maximum-model-length 旗標,以及位置嵌入覆寫。建議的取樣參數為 temperature 1.0、top-p 0.97 和 top-k 128。
這個 API 介面與 OpenAI 相容,這點比聽起來更重要:推理強度會以 reasoning_effort 值的形式,透過聊天範本傳遞,而工具呼叫則會以標準的 tools 欄位發出。已經熟悉 chat-completions 格式的團隊,可以直接把現有程式碼指向自家建築物內某台機器上的 Kolibri 端點,不需要中介包裝層。
Kolibri 目前尚未具備的功能
有四項缺席值得直言,因為上市報導往往會略過它們。
• 無獨立評估。Artificial Analysis 沒有 Kolibri 的模型頁面,且沒有任何第三方發表過該廠商基準測試表的複現。
• 供應商並未提供託管端點。此次發佈內容為權重加上技術報告;在隨模型發佈的資料中,並沒有針對 Kolibri 的 Aleph Alpha API SKU。
• 在 OrcaRouter 上沒有路由,在我們會點名的任何聚合器上也一樣沒有。我們用供應商前綴與模型名稱的每一種拼法探遍了目錄,Kolibri 就是不在那裡——所以如果你想呼叫它,你就是在自行下載 78 GB 並執行一個 vLLM 端點。我們寧願這樣說,也不願暗示我們有提供它。
• 不支援多模態輸入。文字進、文字出,兩種語言。這是該實驗室為了深度而犧牲廣度所做的取捨,而對文件處理的部署來說,這大概是正確的取捨,但這是一道真實的界線。
如果你今天真正需要的,是一個不必買兩張 GPU 就能呼叫的小型混合專家模型,那麼 Gemma 4 MoE 層級就是已經在路由端點上最接近的選擇:26B-A4B 變體的價格為每百萬輸入 token 0.06 美元、每百萬輸出 token 0.33 美元,並提供 262,144 token 的視窗。對於任何拿自架的 78B 主權部署來與之權衡的人而言,有用的比較不是基準測試的列數——而是 78 GB 的 VRAM,以及一場採購討論對上按 token 計費的單一項目。 OrcaRouter 以單一 OpenAI 相容金鑰路由該層級,並原樣轉嫁供應商的定價,不額外加價,這正是便宜得知該工作負載是否值得擁有硬體的方式。
Kolibri 本身是更有趣的產物。一個以 Apache 2.0 授權的 780 億參數德英模型,連同資料管線、分詞器方法、能耗數據,以及為期三個月的迭代歷程,與權重一同發布,這是一種不同於常見權重釋出的發布方式——揭露本身就是產品的一部分,而不是一篇關於產品的部落格文章。帕雷托主張是否禁得起檢驗,現在要由擁有兩張 H100 和一個碼錶的人來回答,而答案不會來自任何寫過模型卡的人。
