一張主視覺標題卡,以大型粗體字寫著「Kolibri:來自德國的 78B 開放權重模型」,下方有一行較小的文字寫著「78B 總計 / 3.46B 啟用 / 1M token 上下文 / Apache 2.0」,並有三個小型扁平線性圖示排成一列,置於白色背景上,帶有柔和的藍色與青色漸層點綴,右下角有 OrcaRouter 標誌。
Guides & Insights

Kolibri 首日:Aleph Alpha 釋出了 78B 的德英雙語權重,而外界反應正跑在證據之前

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

在 Aleph Alpha 發布 Kolibri 的二十四小時後,外界反應已凝結成一句話,而這句話值得拆解。海德堡實驗室於 2026 年 10 月 3 日,以 Apache 2.0 授權將一個 781 億參數的專家混合模型放上 Hugging Face,同日上午在自家新聞室與自家帳號宣布,到了隔天,AI 資訊流中流傳的摘要寫道:總參數 78B、每個 token 啟用 3.46B、Apache 2.0 開放權重、專為德語和英語打造。那句話的每個子句都可從該儲存庫查證。大多未被言明的是,這次發布中哪些部分是實測事實,哪些是作者對自家模型提出、但海德堡以外無人跑過的主張。這個落差正是首日報導的核心,而且它比標題數字更重要。

先從時間線說起,因為出乎意料地有大量反應把這件事當成神祕的無聲發布,但它並不是。Hugging Face 儲存庫 Aleph-Alpha/Kolibri-1建立於 2026 年 10 月 2 日 05:54:02 UTC,模型卡上標示的發布日期是 10 月 3 日,而廠商的新聞室貼文於同日上午 08:43:53 GMT 發布——當天是德國統一日,這個日期顯然是該實驗室刻意挑選的。Aleph Alpha 自家的帳號幾分鐘內就發文談到此事。沒有媒體禁運,也沒有發布活動,這大概就是「低調發布」這種說法的由來;但廠商新聞室貼文、技術報告和官方公告都不是低調發布。它們是一次正常發布,只是當天一般 AI 媒體並未報導。

反應正在重複的數字

3.46B 活躍參數之所以是人人引用的數字,是因為它是這次發布中唯一會改變買家必須擁有什麼的數字。Kolibri 是一個 50 層的 Transformer,其中每一層都是混合專家(mixture-of-experts),每層有 384 個專家,1 個共享、6 個路由,總共有 78,103,074,560 個參數。每個 token 會啟動其中 3,457,573,120 個——稀疏比約為 22.6 比 1。這正是讓一個 780 億參數模型能在兩張 H100 上提供服務,而不必用到一整個機櫃的原因;也是這次發布中最具關鍵影響力的單一主張。

它周圍是其他重點數字,全都來自模型卡,而不是來自獨立執行:

• 上下文 — 以 16,384 個 token 訓練,以 65,536 進行中期訓練,原生為 262,144,並驗證至 1,048,576。模型卡建議對延遲敏感的工作維持在 262,144 或以下。請務必注意,你在摘要中會看到的固定「1M 上下文」是驗證上限,而非原生視窗。

• 精確度 — FP8 權重以 128×128 區塊呈現,搭配動態量化的激活值,並以 FP8 KV 快取進行評估;嵌入、LM head、正規化層與 MoE 路由器則維持 bfloat16。

• 推理——四個投入程度等級——無、低、中、高——透過聊天模板設定,並具備 Hermes 風格的工具呼叫,以及與權重一同發布於同一個儲存庫中的 vLLM 解析器。

• 語言 — 德語和英語,別無其他。

• 訓練 — 在經過篩選的雙語語料庫上使用 20 兆個預訓練詞元,該語料庫約有 62.5% 為英文、23.9% 為德文、13.6% 為程式碼,另加上 3.44 兆個中期訓練詞元,以及 2,010 億個用於長脈絡擴充的詞元。

• 運算與能源——橫跨 96 個 HGX 節點的 768 顆 NVIDIA B200,21 天預訓練,達 511 小時與 392,000 GPU 小時,據報導為 6.4x10^23 FLOPs,並估計為 9.5x10^2 MWh,包含資料中心額外開銷,不含監督式微調與強化學習。

• 授權條款 — Apache 2.0。沒有可接受使用附加條款、沒有月活躍使用者門檻、沒有另訂的商業條款。

沒有人查證過的兩項主張

這是第一天中反應所略過的部分,而這部分決定了 Kolibri 是重要,還是僅僅有趣。

第一項是服務經濟性的主張。Aleph Alpha 的論述框架並不是 Kolibri 是市面上最強的模型——在該實驗室自家的比較表上並非如此,而實驗室也這麼說。它的論述框架是:在品質對上每 GPU 每秒解碼 token 數的帕雷托前沿上,沒有任何受比較的模型能以相同的服務成本提供更高品質,或是以更低成本提供相同品質。這是一項關於特定硬體上吞吐量的主張,而且正是那種只有拿著碼錶和兩張 H100 的第三方才能定論的主張。沒有人這麼做過。截至 2026 年 10 月 4 日,Artificial Analysis 沒有 Kolibri 的條目,也沒有第三方複現該評估測試框架。

第二項是關於分詞器的主張。Aleph Alpha 用一種它稱為 UniBPE 的方法,訓練了一個詞彙量達 128,000 的德英雙語分詞器,並報告在德語網頁文本上平均每個 token 為 4.90 位元組,相較之下 GPT-5 為 4.35、Gemini 為 4.13、Qwen 3.5-3.8 為 4.17、GLM 5.3 為 3.93、DeepSeek V4 為 3.72,而 Kimi K3 為 3.28。這些數字每一個都出自該廠商自家,是在該廠商自己的語料庫上測得,且比較對象是該廠商自己挑選的競爭對手。每個 token 承載更多文字是實實在在的推論成本效應,而非品質上的宣稱;而若這一點成立,它會在任何文件處理工作負載中不斷累積——但這只是單一實驗室的測量,不是基準測試的結果。

德語才是重點,而它是這次發行版中最有趣的工程設計。

大多數「多語言」模型卡描述的都是恰好包含德語的訓練資料組合。這一個則是以相反的方式打造,而且這張模型卡對其運作機制的說明異常具體。

小型代理模型實驗讓 Aleph Alpha 訂下混合資料中約有 20% 德語資料的目標,而對一次 20 兆 token 的訓練而言,這意味著要找到 4 兆個德語 token。去重並過濾後的公開德語資料集提供了 3,900 億個——還差一個數量級。該實驗室透過三種方式彌補差距:針對德語專門重新調整 Common Crawl 篩選器,產生了 1.3 兆個不重複的自然語料 token;將現有德語文件改寫成百科全書條目、問答對話和文本段落,這又產生了約 1 兆個 token,並成為最大的單一德語來源;以及翻譯,這種方式曾用於前代模型,但在 Kolibri 中被刻意捨棄。德語最終成為一個 2.4 兆 token 的不重複語料池,其中 80% 由內部策劃或生成,在上採樣後,佔預訓練 token 的 21.3%。

過濾器細節這種東西,只有在真正用德語訓練過的實驗室裡才會浮現。標準的語言資料管線會丟棄含有太多長詞的文件——但德語行政文書的平均詞長經常超過英語的上限,因此預設設定會悄悄刪除公共行政所書寫的語域。一個用現成英語過濾器訓練出來的模型,幾乎沒有德語法律行政詞彙可言,而沒有任何基準測試會告訴你這件事。

比較表實際上顯示了什麼

Aleph Alpha 發表了一份後訓練比較,涵蓋十四個模型,而且它比大多數發布表格更有用,因為它不會美化研究對象。在與 Kolibri 相同、推理強度設為 high 的測試框架上,Qwen3.8 27B 的英文平均得分為 80.2,對比 Kolibri 的 75.5;德文平均得分為 79.9,對比 70.8,並且在 GPQA Diamond、LiveCodeBench v6、SWE-Bench Verified 以及兩項長上下文基準上都領先。Nemotron 3 Super 120B-A12B 的英文得分為 73.0,對比 Kolibri 的 75.5。Gemma 4 26B-A4B IT 在兩項平均上分別得分 71.9 和 66.3。

所以,這次發布誠實的總結並不是「最先進」。而是:Kolibri 落在一個每 token 啟用三十億到一百二十億參數的模型領域中間,它明顯勝過那些小得多的模型,卻在自己表格的大多數行上輸給阿里巴巴一個稠密的 270 億參數模型,而它啟用的參數量約為後者的八分之一。經濟效益是否能彌補這個差距,就是所謂的 Pareto 主張,而這個 Pareto 主張尚未經過驗證。

A single-column specification scoreboard titled 'Kolibri — the scoreboard', with six rows reading 'Total parameters: 78.1B', 'Active per token: 3.46B', 'Context: 262,144 native, 1M validated', 'Licence: Apache 2.0', 'Independent score: none published' and 'Deployment floor: 2x H100 80GB', and a footer line reading 'All figures vendor-reported from the model card; no independent evaluation yet.' OrcaRouter logo in the bottom-right corner.

你今天實際上會怎麼稱呼它?

供應商沒有提供託管端點——這次發布的內容是權重加上技術報告,在已發布的資料中並沒有針對 Kolibri 的 Aleph Alpha API SKU。OrcaRouter 上也沒有它的路由:我們用供應商前綴與模型名稱的各種拼法探查了目錄,Kolibri 並不在那裡,所以今天要呼叫它,就代表得下載大約 78 GB 的 FP8 權重,並自行從 aleph-alpha-inference 套件或已發布的容器映像來執行 vLLM 端點。

那是一項真正的採購決策,不是可有可無的附註,而這正是路由層即使對它並未承載的模型也能佔有一席之地的地方。對任何正在權衡自架 78B 主權部署的人來說,誠實的比較不是基準測試的數據列——而是 78 GB 的 VRAM,以及一場相對於他人擁有之硬體上按 token 計費項目的採購對話。如果你這個月真正需要的,是一個不必買兩張 GPU 就能呼叫的小型專家混合模型,那麼 Gemma 4 26B-A4B 這個級別就是已經存在於路由端點上的最接近選項,每百萬輸入 token 0.06 美元、每百萬輸出 token 0.33 美元,視窗為 262,144 個 token,而 OrcaRouter 以一組 OpenAI 相容金鑰 按供應商牌價路由該級別,不另加任何費用。這是在硬體到手之前,用便宜的方式弄清楚這項工作負載是否值得擁有那套硬體。

A screenshot of Aleph Alpha's newsroom post for Kolibri, showing the vendor headline about a sovereign open-weight model, the 78B parameter figure and the one-million-token context line, and the architecture comparison between Kolibri and Kolibri Origin.

觀察重點,以及什麼會改變判決

三件事,按它們能多大程度改變局面來排列。

在該卡建議的雙 H100 配置下進行的獨立吞吐量量測,將能證實或推翻 Pareto 宣稱,而這是發布內容中唯一真正新穎、而非重述規格表的說法。獨立重現德語與英語任務套件平均值,將能告訴你與 Qwen3.8 27B 之間的差距,是否真如供應商自家表格所示那般狹窄,或甚至更小。而針對真實行政文本——而非翻譯過的通用基準——進行德語評估,將能檢驗該發布內容真正為之打造的事物,而這是目前沒有任何排行榜在衡量的。

在這些事情有任何一項成真之前,正確的框架是該儲存庫本身所支持的那一套。Kolibri 是來自歐洲實驗室的真正開放權重發布,其規模是歐洲實驗室過去未曾推出過的,採用 Apache 2.0 條款,現有廠商無一能及,資料管線與權重一同發布,還有一段比頭條數字更有意思的雙模型迭代歷程。而且就目前而言,它也是一個最常被引用的數字來自其自身作者的模型。這兩句話在第一天都成立,而第二句正是外界反應所漏掉的。

A screenshot of the Hugging Face model card for Aleph-Alpha/Kolibri-1, showing the repository header, the Apache 2.0 licence tag, the stated release date of 3 October 2026, and the parameter, context and FP8 precision lines in the card body.