為 Kolibri 對決 Qwen 3.8 生成的主視覺卡片,標題為「Kolibri vs Qwen 3.8」,副標為「主權德語服務,對上開放的中國模型家族」,左側有蜂鳥圖示,右側有雲朵輪廓,兩者分居一道細分隔線兩側。OrcaRouter 標誌位於主視覺下方的條帶中。
Guides & Insights

Kolibri vs Qwen 3.8:德國模型在自己的主場落敗,而這正是重點

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

先從大多數關於Kolibri發布報導都略過的那句話說起。在 Aleph Alpha 於 2026 年 10 月 3 日隨自家模型發布的基準表中,最常被拿來與它對比的模型既不是歐洲對手,也不是美國對手。它是Qwen3.8 27B,該廠商那一世代的開放權重層級,於 2026 年 8 月 13 日發布——而根據 Aleph Alpha 自家的數字,它勝出。在同一套評估套件中,Qwen3.8 27B 的英語平均得分為 80.2,德語平均為 79.9;該套件給 Kolibri 的分數則是 75.5 與 70.8。它在 GPQA Diamond 上領先,89.2 對 84.3。它在 LiveCodeBench v6 上領先,93.8 對 85.9。它在 SWE-Bench Verified 上領先,72.6 對 66.4,並在兩項長上下文基準上都領先:LongBench Pro 上 76.9 對 64.5,AA-LCR 上 81.3 對 68.3。一個由德國實驗室評估、270 億參數的稠密中國模型,在該實驗室自家表格的大部分項目上,擊敗了該實驗室的 780 億參數旗艦。這不是醜聞。這是這次發布中最有用的事實,因為它迫使我們追問:Kolibri 究竟是要做什麼的。

在比較繼續深入之前,先釐清一件事,因為「Qwen 3.8」指的是一個模型家族,而非單一模型,而在這裡這些區別很重要。Qwen3.8-Max是阿里巴巴的託管旗艦模型,自 2026 年 8 月 3 日起上線,具備 100 萬個 token 的上下文視窗,每百萬輸入 token 收費 2.00 美元,輸出則為 6.00 美元。Qwen3.8-27B是開放權重層級,於 2026 年 8 月 13 日發布,上下文視窗為 262,144 個 token。Qwen3.8-Flash是大量用量層級,於 2026 年 8 月 26 日發布,同樣具備 100 萬 token 的上下文視窗,但價格低得多。而單純的 Qwen3.8——於 2026 年 7 月 19 日宣布,是擁有 2.4 兆參數的開放權重旗艦模型——尚未發布;它僅以目錄追蹤頁面和一篇發布公告的形式存在。以下所述全都關於那個你能下載並實際執行的權重版本,也就是 27B。

Kolibri 真正勝出之處,從同一張表即可讀出

Kolibri 領先 Qwen3.8 27B 的那些列並非隨機散落。它們會聚集成群,而這個群集本身就是產品。

• 棄答 — 在 RGB Negative 上,Kolibri 得分為 85.6,對手為 70.6。當上下文不包含答案時,Kolibri 更常表明這一點。

• 受約束的工具呼叫 —— 在 τ²-bench telecom 上,94.7 對比 82.5;在汽車供應商垂直套件上,99.0 對比 97.3。

• 極長上下文——在 SealQA 上,當超過 24k 個詞元且沒有干擾項時,100.0 對上 94.4。

• 德語推論服務成本效益 — 一款雙語分詞器在德語網頁文本上,{{1}}每個詞元平均為 4.90 位元組,相較於 Qwen3.5–3.8 系列依 Aleph Alpha 自家測量為 4.17{{/1}}。每份德語文件的詞元更少,可直接降低推論成本,這會反映在發票上,而不會出現在任何基準測試的列中。

那四項中有三項關乎行為,而非能力。當一個模型會閱讀你組織自身的資料,並被期待在資料無法回答問題時坦承以對,你需要的就是拒答、受約束的工具呼叫,以及有憑據的長脈絡檢索。Aleph Alpha 整場發布都圍繞著這個賭注打造,而表格顯示這個賭注成功落地。

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Qwen3.8 27B 勝出的那些列關乎廣度:兩種語言的知識、研究所程度的科學問題、競技程式設計、儲存庫層級的軟體工程、長文件理解。如果你需要的是每詞元價格低廉、具備開放權重的強大通用模型,那麼 Qwen3.8 27B 是更好的模型,而這張表在廠商自己的筆墨中也這麼顯示。

那種解讀獲得了佐證,而 Kolibri 的解讀則沒有。Artificial Analysis 已獨立測量 Qwen3.8 27B,在其 Xhigh 推理配置下,並報告 Intelligence Index 為 34,在該比較的 142 個模型中排名第 1,每秒輸出 45.4 個 token,具備 256,000 token 的上下文,以及 Apache 2.0 授權。他們的評註以一種熟悉的方式並不客氣——在索引評估期間產生了 2 億個 token,相較中位數 8,200 萬個,顯得極為冗長,而且速度緩慢——但這個分數本身是第三方對對手的測量。Kolibri 完全沒有 Artificial Analysis 頁面。所以在這項比較中,最強的模型已獲得獨立驗證,而較弱的那個則只是廠商的一面之詞,這與第一代歐洲旗艦通常被描述的方式正好相反。

兩種供應鏈主張,指向相反的方向

這兩個發行版都是關於模型來源的論證,而這些論證互為鏡像。

Aleph Alpha 的案例,是把來源可追溯性化為一項特色。Kolibri 由德國團隊訓練,使用位於德國與芬蘭的基礎設施,並遵循歐盟與德國法律。這份模型卡揭露了預訓練資料組成——20 兆個 token,約 62.5% 為英文、23.9% 為德文、13.6% 為程式碼——以及中期訓練與長上下文預算、精確運算規模:768 張 NVIDIA B200,橫跨 96 個 HGX 節點,為期 21 天,以及估計 9.5×10² MWh 的能源,包含資料中心額外負擔。它把訓練方法說明到層級細節:一個 50 層的專家混合(mixture-of-experts)Transformer,以 4:1 的比例分配給滑動視窗注意力與分組查詢注意力,並在 384 個專家上使用 Muon 與 Exact Quantile Balancing,其中 1 個共享、6 個路由。一份 78 GB 的下載檔案隨附 12,000 字的揭露資訊,並就歐盟《通用人工智慧行為準則》表明簽署立場。

阿里巴巴的案例在本質上不同:不是「我們能解釋每一項決策」,而是「權重在此,拿去用」。以 Apache 授權的開放權重,其規模與品質讓 Qwen 成為全球實質上的預設選擇;一份涵蓋遠超過一百種語言、包含 248,077 個詞元的詞彙表;以及一個圍繞這些檢查點調校已久、久到幾乎每個推論堆疊都能開箱即用支援它們的服務生態系。在那裡,主權論點在於可用性:沒有廠商能收回模型,因為你已經擁有那個檔案。

這兩種說法都誠實,而且各自回應的是不同的擔憂。巴登-符騰堡邦的公部門採購者擔心的是司法管轄權與可稽核性,而 Kolibri 正是針對這項擔憂而來。奈洛比或聖保羅的研究團隊擔心的,是某個模型被一道信用卡付費牆擋住,而且還得用他們付不起的貨幣付款,而開放權重的 Qwen 正是針對這一點。不誠實的,是假裝這兩者之中任何一個是在做能力比較,因為能力對照表早已給出答案。

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

授權落差確實存在,但比聽起來要小。

Kolibri 採用 Apache 2.0 授權。Qwen3.8 27B 是 Apache 授權的開放權重模型。兩者都沒有附帶可接受使用條款、沒有月活躍使用者門檻,也沒有另外的商業條款——這讓它們屬於少數的一群,也意味著兩者在商業使用前都不需要經過法律審查。

真正將兩者區隔開來的,是授權條款之後的一切。Kolibri 隨附廠商提供的 vLLM 外掛與解析器套件、一個容器映像、四種可透過聊天範本設定的推理強度層級、明確的棄答行為,以及建議的取樣設定。Qwen3.8 27B 則以權重形式推出,Transformers、vLLM 和 SGLang 早已知道如何服務這些權重,其工具呼叫格式也早已讓更廣泛的生態系有數月時間得以配合。

部署硬體也沿著同樣的脈絡出現差異。Kolibri 的 FP8 權重大約佔 78 GB,硬體門檻是兩張 A100 80 GB 卡、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300。Qwen3.8 27B 以 bfloat16 表示時,權重大約 54 GB,全精度下只需單張 80 GB 加速器,量化版本所需硬體更是少得多。這個德國模型耗用更多硬體,換回的基準測試成績卻更少。唯有當你買的是基準測試成績時,這才是筆不划算的交易。

價格標籤能告訴你什麼、不能告訴你什麼

Kolibri 沒有價格,因為 Aleph Alpha 並未為其販售推論服務。這次發布的是權重、技術報告與模型卡;沒有託管的 SKU。任何 Kolibri 的成本數字,都是你自己做的硬體攤銷計算。

Qwen3.8 公開定價分為三個層級,而對於正在比較自架與租用的團隊來說,中間那個層級才是關鍵。

• Qwen3.8-Max — 每百萬輸入 token 2.00 美元、輸出 6.00 美元,1M token 上下文,快取讀取 0.25 美元,於 2026 年 8 月 3 日發布。

• Qwen3.8-27B — 輸入 $0.33、輸出 $2.40,262,144 個 token 的上下文,2026 年 8 月 13 日發布。這些是開放權重,所以如果你不想自己跑,這就是你要付的價格。

• Qwen3.8-Flash — 輸入 $0.15、輸出 $0.47,具備 100 萬 token 視窗,於 2026 年 8 月 26 日發布。

那些是供應商在 OrcaRouter 上的定價表價格,按 token 原樣傳遞、不額外加價,當問題在於自架部署能否回本時,這正是有用的特性:你可以先在代管方案上衡量自己真實的 token 用量,再決定是否投入硬體。我們不額外加成,因此供應商一降價,我們這邊當天就同步生效。三個 Qwen3.8 方案今天都能透過 一把 OpenAI 相容金鑰,在各供應商之間自動容錯移轉進行路由,而即將推出、擁有 2.4 兆參數的 Qwen3.8 已經有一個目錄頁面在等著權重上架,而不是用假裝能提供服務的佔位內容來充數。

Kolibri 不可路由。我們試遍了每一種供應商與模型的拼寫來探查型錄,它都不在其中——所以唯一能呼叫它的方式,就是那個 78 GB 的下載檔。如果你想知道德國模型會讓你的工作負載付出多少成本,答案就是一個機架,以及一個能執行 vLLM 的人,而目前沒有第三方能向你報出其他方案。

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

誰該買哪一款

這項決定並不取決於品質,因為那個問題已由供應商自己的表格裁定,結果對阿里巴巴有利。它取決於你買保險是為了防範哪一種風險。

• 若具約束力的限制條件是司法管轄權、來源證明文件或可稽核性,請選擇 Kolibri——如果你必須能夠回答訓練資料來自何處、運算在何地執行、依循哪一套法律,而且工作負載是在你自己的邊界內處理的德文與英文文件。你為此支付了能力溢價,而這筆溢價在上表中顯而易見。

• 如果關鍵限制是每美元效能、語言廣度或生態系統支援,請選擇 Qwen3.8 27B。在 Aleph Alpha 自家的評估中,它是更強的模型;它採用 Apache 授權;可在單一加速器上執行;而託管方案每百萬輸入權杖 0.33 美元起,如果你根本不想自行執行它的話。

• 如果工作負載同時包含受監管的核心與一般周邊,就把它們放在同一套架構中考量。不能離開大樓的文件,交給自託管的 Kolibri 端點;摘要、翻譯與程式碼相關工作,則交給路由至 Qwen3.8 的層級,每千個 token 只要三分之一美分。一組 API 金鑰、一條路由規則、供應商牌價原樣傳遞,容錯移轉也替你處理好——這比從這兩者中挑一個,還假裝另一個不存在,要實用得多。