主視覺標題卡,以大型粗體字寫著「Kolibri vs Intern-Decision 4B」,下方有一行較小的文字寫著「相對於校準後機率分布所生成的文字」,以及兩個並排的小型扁平線性圖示——左邊是蜂鳥,右邊是小型鐘形曲線圖——以一條細垂直分隔線隔開,置於白色背景上,搭配柔和的藍色與青色漸層點綴,右下角有 OrcaRouter 標誌。
Guides & Insights

Kolibri vs Intern-Decision 4B:一個會撰寫文件,另一個則完全拒絕寫任何內容

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

最值得注意的一件事,就是關於Kolibri與Intern-Decision-4B:它們並非同一類物件,而若把這當成模型對模型的比較,就會犯下範疇錯誤。Kolibri 是 Aleph Alpha 的 781 億參數混合專家語言模型,於 2026 年 10 月 3 日發布,每個 token 啟用 34.6 億個參數,並能撰寫德文與英文文字。Intern-Decision-4B 是 InternLM 團隊的 45.4 億參數多模態結構化決策模型,於 2026 年 9 月 26 日上傳至 Hugging Face,其模型卡直言它「完全不呼叫 generate() 或取樣自由形式的文字」。前者產生散文。後者在你提供的選項上,於單次前向傳遞中產生機率分布,且沒有能力寫出一個句子。它們只會在一種狹窄情境下成為競爭者,而確切知道那是哪一種情境,恰好是這兩項發布中最有用的資訊。

兩次發布,兩個截然不同的簡短宣稱

Kolibri 的模型卡是一份大型稀疏語言模型的規格:50 層,每一層都是專家混合,每層 384 個專家,其中一個為共享、六個為路由,原生上下文為 262,144 個 token,經驗證可達 1,048,576,四種推理投入等級,Hermes 風格的工具呼叫並隨附 vLLM 解析器,以 128×128 區塊儲存的 FP8 權重,以及 Apache 2.0 條款。其訓練在 768 張 NVIDIA B200 上進行 21 天,處理了 20 兆個 token——392,000 GPU 小時,據報告為 6.4×10²³ FLOPs,估計為 9.5×10² MWh(包含資料中心額外開銷,但不含監督式微調與強化學習)。模型卡上的最低服務配置為兩張 A100 80 GB 卡、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300,而 FP8 佔用空間約為 78 GB。這是一套貨真價實的基礎設施,而它透過生成文字來回答問題。

Intern-Decision-4B 是另一種類型的物件,而這張卡片對它的描述坦率得令人耳目一新。它是 Qwen3.5-4B 的微調版本,其中視覺塔與投影器被凍結,只訓練語言主幹。你交給它一個狀態、一份具名問題的結構描述(schema),以及最多八張圖片(可選),它就會一次回傳每個問題所有候選答案的分布。其機制並不尋常,值得精確說明:選項會被映射到單一詞元的符號,涵蓋 A 到 Z、a 到 z 以及 0 到 9——共 62 個候選,因此每個問題最多可有 62 個選項——提示會以每個欄位各一個佔位符的方式渲染,而模型會讀取每個佔位符前一個位置的 logits。Softmax 只會對該欄位允許的符號 logits 執行,並以檢查點專屬的溫度校準結果,最後這些符號會映射回你原始輸入的選項值,成為帶型別的 JSON。沒有解碼迴圈、沒有取樣,也沒有散文式輸出。

• 輸出 — Kolibri:自由生成的德文或英文文字、工具呼叫、推理軌跡。Intern-Decision-4B:具型別的 JSON 答案,每個選項各附一個機率。

• 參數 — Kolibri:總計 78,103,074,560,作用中 3,457,573,120。Intern-Decision-4B:45.4 億,以 bfloat16 格式分佈於四個 safetensors 分片,並帶有凍結的視覺塔。

• 輸入 — Kolibri:僅文字。Intern-Decision-4B:文字加上最多八張圖片。

• 問題容量 — Intern-Decision-4B:每個欄位最多 62 個選項,可在單次前向傳遞中處理,題型包含 'choice'、'score' 與 'noul'(是/否)。Kolibri:原則上無上限,實務上一次一個 token。

• 語言 — Kolibri:在設計上即為德語與英語。Intern-Decision-4B:Qwen3.5-4B 帶有什麼就是什麼,且所有已發布的評估套件皆為英語。

• 延遲 — Intern-Decision-4B:根據其自身量測,在單張 RTX 4090 上,每次查詢平均為 44.16 毫秒、中位數為 44.03 毫秒,P95 為 44.60 毫秒。Kolibri:完全沒有公開任何每次查詢的數據。

• 授權條款 — 兩者皆為 Apache 2.0;Intern-Decision-4B 隨附發佈時,也一併保留了 Qwen 的授權條款檔案。

A two-column comparison scoreboard titled 'Kolibri vs Intern-Decision 4B'. Left column Kolibri: Output freely generated text, Parameters 78.1B MoE / 3.46B active, Input text only, Context 262,144 native / 1M validated, Latency none published, Licence Apache 2.0. Right column Intern-Decision 4B: Output typed JSON with a probability per option, Parameters 4.54B bfloat16 with a frozen vision tower, Input text plus up to eight images, Options up to 62 per field in one forward pass, Latency 44.16 ms mean on one RTX 4090, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; Intern-Decision 4B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

4B 評分器到底為什麼會存在

支持 Intern-Decision-4B 的理由,並不是它很小;而是要求大型生成式模型給出一個機率,並不等同於實際量測一個機率,而這個差異是可量測的。

這張卡自身的基準測試表,以異乎尋常大量的自我揭露來提出論證。在七個準確率測試套件中,Intern-Decision-4B 平均為 90.02,而它拿來比較的最強基準模型 Jev 則為 88.74。但準確率只是比較無趣的那一半。這張表也報告 Brier 分數與期望校準誤差,而在那裡,情況更為嚴苛。4B 的 Brier 為 0.347、ECE 為 0.065,Jev 則為 0.358 與 0.095。真正讓校準的故事變得具有資訊量的,是較小的同系列模型。Intern-Decision-2B 平均得分 84.68,遠高於 0.8B 的 79.38——然而其 ECE 0.100 比 0.8B 的 0.066 更差,也比 4B 的 0.065 更差,Brier 為 0.437,而 0.8B 為 0.530。這兩個小模型裡最準確的那個,對自身信心卻最不誠實。如果你曾假設校準會隨準確率提升,或隨參數數量提升,那張表在兩點上都是反例。

第二項、獨立的診斷測試涵蓋 96 個案例,這些案例是以精確參考分佈而非取樣的硬標籤所建構——隨機抽取、複合事件、條件歷史、機率謎題。4B 模型在該先導測試上的誤差,在所報告的指標上從 0.628 降至 0.550,而對照模型則落在 0.595。模型卡明確指出,此先導測試並未用於擬合或選擇所公布的溫度;4B 的溫度 1.992418 是在校準集上另行擬合得出的。InternLM 團隊也將基準測試本身發布到 GitHub 儲存庫——確定性生成器、參考資料與離線評分器——這意味著該校準主張屬於罕見的一類:第三方真的能夠重新執行,而不是只能盲目相信。

Kolibri 的發布內容中沒有任何東西能提供對等的事物。其比較表報告了在單一廠商測試框架上十四個模型的任務準確率,而準確率正是生成式模型可被衡量的指標。資料中沒有任何校準數值、沒有 Brier、沒有 ECE,也沒有辦法向它詢問「這條合約條款可執行的機率」,而不涉及取樣一個句子並閱讀它。

它們唯一真正交會的那道接縫

把兩者並排放進真實的流程中,差異就會變得顯而易見。一套德文文件工作流程需要這兩半,而這兩個工具都無法涵蓋對方的另一半。

Kolibri 是負責讀取與寫入的那一半。擁有德語合約或技術文件的團隊可獲得 262,144 詞元的原生視窗、FP8 KV 快取、一個雙語分詞器——Aleph Alpha 回報其在德語網頁文字上平均每詞元為 4.90 位元組——以及 Hermes 工具呼叫;也就是說,這是一個能夠摘要申報文件、草擬回覆並驅動工具迴圈的模型。它做不到的是,以你能夠稽核的方式告訴你它自身的信心程度,因為它輸出的每一個內容都是取樣而來的字串。

Intern-Decision-4B 是負責決策的那一半。給定一頁德文文本和一組固定選項,它能在單一消費級 GPU 上以 44 毫秒回傳一個經校準的分布,沒有生成步驟,因此完全沒有取樣變異。它做不到的是從頭產出德文文本,而且它已發表的評測套件都是英文——它的德文行為繼承自 Qwen3.5-4B 基礎模型,而非經過訓練而得,這對德文部署而言是一項實質限制,而且沒有人評估過這一點。

所以,對於受監管的德語工作流程,誠實的工程答案是:這些是同一條管線的兩個階段,而不是同一個位置的兩個候選方案。實際問題是各自要在哪裡執行。Kolibri 需要兩張 H100 或一張 B200,以及約 78 GB。Intern-Decision-4B 需要一張 RTX 4090,執行一次查詢只需不到 45 毫秒。硬體成本的不對稱程度大約達到兩個數量級,而這指向一種設計:小型評分器對每個案件持續執行,大型生成器則只在案件確實需要成篇文字時才被叫用。這比把每個案件都送進 78B 模型、換得一個之後還得自行解讀的答案,是更便宜、也更利於稽核的形態。

A screenshot of the Hugging Face model card for internlm/Intern-Decision-4B, showing the card header, the description of it as a multimodal structured decision model fine-tuned from Qwen3.5-4B that returns an answer distribution in one forward pass, and the numbered 'How inference works' steps mapping each question's options to single-token symbols.

兩者的主機現實,以及該層的用途

兩個模型都沒有以託管 API 形式提供,而我們是查證過,不是憑假設。Intern-Decision-4B 沒有廠商端點;這次發布的是權重、一個 GitHub 儲存庫,以及一個 Hugging Face Space。它的下載數和按讚數自週中以來已有變動,這說明人們正在採用它,但我們願意點名的任何地方,仍然沒有付費可呼叫的途徑。

Kolibri 同樣沒有 Aleph Alpha API SKU——此次發布的是權重、一份技術報告,以及位於 ghcr.io/aleph-alpha/aleph-alpha-inference 的容器映像。而且它並不在 OrcaRouter 上:我們以供應商前綴與模型名稱的各種拼法徹底探查了目錄,結果都顯示找不到;比起暗示相反的情況,我們更願意如實說明。

在這裡,路由層改變的不是對這兩個模型的存取權,而是決定是否要為其中任一個購買硬體的經濟考量。對生成性那一半來說,誠實的購買前測試,是讓工作負載跑在一個已經經過路由的小型混合專家層級上——Gemma 4 26B-A4B 變體,每百萬輸入 token 為 $0.06、每百萬輸出 token 為 $0.33,具備 262,144-token 視窗,並支援文字、圖像與影片輸入——使用一組 OpenAI 相容金鑰 按供應商定價,不加任何東西,然後看看在訂購 GPU 之前,德文文件工作負載是否真的需要 780 億個參數。決策那一半沒有這條捷徑,因為校準分佈行為正是這個模型的重點,而沒有任何經過路由的層級能做到這件事。但這本身就是那項發現:它告訴你 4B 評分器是你真正會自行託管的部分,而生成器則是值得用你下午就能租到的東西重新測試的部分。

什麼能讓它塵埃落定

兩項測量,而兩者都尚未存在。

第一個是 Intern-Decision-4B 在德語輸入上的表現。每個已發表的測試套件都是英文,而該模型是多語言基礎模型的微調版本,因此其德語校準狀況未知——而校準正是那項不會無償跨語言轉移的特性。若有人要發布關於這個模型的任何內容,96 個案例的分佈試點計畫的德語版本會是單一最具資訊量的產物。

第二個是 Kolibri 的每次決策成本。其服務經濟學主張是一條帕雷托前沿:品質對上每 GPU 每秒解碼 token 數,而 Kolibri 沒有 Artificial Analysis 頁面,也沒有第三方複製其測試框架。在有人實際運行之前,「780 億參數」是一項規格而非成本,而保留一個 44 毫秒評分器置於其前的理由,仍屬設計論證而非實測論證。

在那之前,看待這組搭配的正確方式並不是把它當成一場較勁。Intern-Decision-4B 是兩者中技術上更有趣的發布,因為校準感知的結構化輸出是幾乎沒有生成式模型提供的能力,而它的模型卡讓你得以查核這項說法。Kolibri 則是影響更深遠的發布,因為一家歐洲實驗室以 Apache 2.0 授權發布 780 億參數的模型,並同時公開資料管線,這是供應鏈層級的事件,而非單純的模型事件。兩者無法互相取代。同時需要兩者的團隊應該為兩者都做規劃,並據此估算硬體規模,而真正投入工程心力的地方,其實是圍繞它們的測試框架。

A screenshot of the InternLM 'Intern Large Models' organisation page on Hugging Face, showing the organisation header, its stated affiliation with Shanghai AI Laboratory, and a recent-activity feed listing models published within the last hour.