
Kolibri vs Intern-Decision 4B:一個會撰寫文件,另一個則完全拒絕寫任何內容
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 217 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
最值得注意的一件事,就是關於Kolibri與Intern-Decision-4B:它們並非同一類物件,而若把這當成模型對模型的比較,就會犯下範疇錯誤。Kolibri 是 Aleph Alpha 的 781 億參數混合專家語言模型,於 2026 年 10 月 3 日發布,每個 token 啟用 34.6 億個參數,並能撰寫德文與英文文字。Intern-Decision-4B 是 InternLM 團隊的 45.4 億參數多模態結構化決策模型,於 2026 年 9 月 26 日上傳至 Hugging Face,其模型卡直言它「完全不呼叫 generate() 或取樣自由形式的文字」。前者產生散文。後者在你提供的選項上,於單次前向傳遞中產生機率分布,且沒有能力寫出一個句子。它們只會在一種狹窄情境下成為競爭者,而確切知道那是哪一種情境,恰好是這兩項發布中最有用的資訊。
兩次發布,兩個截然不同的簡短宣稱
Kolibri 的模型卡是一份大型稀疏語言模型的規格:50 層,每一層都是專家混合,每層 384 個專家,其中一個為共享、六個為路由,原生上下文為 262,144 個 token,經驗證可達 1,048,576,四種推理投入等級,Hermes 風格的工具呼叫並隨附 vLLM 解析器,以 128×128 區塊儲存的 FP8 權重,以及 Apache 2.0 條款。其訓練在 768 張 NVIDIA B200 上進行 21 天,處理了 20 兆個 token——392,000 GPU 小時,據報告為 6.4×10²³ FLOPs,估計為 9.5×10² MWh(包含資料中心額外開銷,但不含監督式微調與強化學習)。模型卡上的最低服務配置為兩張 A100 80 GB 卡、兩張 H100 SXM5、一張 H200、一張 B200 或一張 B300,而 FP8 佔用空間約為 78 GB。這是一套貨真價實的基礎設施,而它透過生成文字來回答問題。
Intern-Decision-4B 是另一種類型的物件,而這張卡片對它的描述坦率得令人耳目一新。它是 Qwen3.5-4B 的微調版本,其中視覺塔與投影器被凍結,只訓練語言主幹。你交給它一個狀態、一份具名問題的結構描述(schema),以及最多八張圖片(可選),它就會一次回傳每個問題所有候選答案的分布。其機制並不尋常,值得精確說明:選項會被映射到單一詞元的符號,涵蓋 A 到 Z、a 到 z 以及 0 到 9——共 62 個候選,因此每個問題最多可有 62 個選項——提示會以每個欄位各一個佔位符的方式渲染,而模型會讀取每個佔位符前一個位置的 logits。Softmax 只會對該欄位允許的符號 logits 執行,並以檢查點專屬的溫度校準結果,最後這些符號會映射回你原始輸入的選項值,成為帶型別的 JSON。沒有解碼迴圈、沒有取樣,也沒有散文式輸出。
• 輸出 — Kolibri:自由生成的德文或英文文字、工具呼叫、推理軌跡。Intern-Decision-4B:具型別的 JSON 答案,每個選項各附一個機率。
• 參數 — Kolibri:總計 78,103,074,560,作用中 3,457,573,120。Intern-Decision-4B:45.4 億,以 bfloat16 格式分佈於四個 safetensors 分片,並帶有凍結的視覺塔。
• 輸入 — Kolibri:僅文字。Intern-Decision-4B:文字加上最多八張圖片。
• 問題容量 — Intern-Decision-4B:每個欄位最多 62 個選項,可在單次前向傳遞中處理,題型包含 'choice'、'score' 與 'noul'(是/否)。Kolibri:原則上無上限,實務上一次一個 token。
• 語言 — Kolibri:在設計上即為德語與英語。Intern-Decision-4B:Qwen3.5-4B 帶有什麼就是什麼,且所有已發布的評估套件皆為英語。
• 延遲 — Intern-Decision-4B:根據其自身量測,在單張 RTX 4090 上,每次查詢平均為 44.16 毫秒、中位數為 44.03 毫秒,P95 為 44.60 毫秒。Kolibri:完全沒有公開任何每次查詢的數據。
• 授權條款 — 兩者皆為 Apache 2.0;Intern-Decision-4B 隨附發佈時,也一併保留了 Qwen 的授權條款檔案。

4B 評分器到底為什麼會存在
支持 Intern-Decision-4B 的理由,並不是它很小;而是要求大型生成式模型給出一個機率,並不等同於實際量測一個機率,而這個差異是可量測的。
這張卡自身的基準測試表,以異乎尋常大量的自我揭露來提出論證。在七個準確率測試套件中,Intern-Decision-4B 平均為 90.02,而它拿來比較的最強基準模型 Jev 則為 88.74。但準確率只是比較無趣的那一半。這張表也報告 Brier 分數與期望校準誤差,而在那裡,情況更為嚴苛。4B 的 Brier 為 0.347、ECE 為 0.065,Jev 則為 0.358 與 0.095。真正讓校準的故事變得具有資訊量的,是較小的同系列模型。Intern-Decision-2B 平均得分 84.68,遠高於 0.8B 的 79.38——然而其 ECE 0.100 比 0.8B 的 0.066 更差,也比 4B 的 0.065 更差,Brier 為 0.437,而 0.8B 為 0.530。這兩個小模型裡最準確的那個,對自身信心卻最不誠實。如果你曾假設校準會隨準確率提升,或隨參數數量提升,那張表在兩點上都是反例。
第二項、獨立的診斷測試涵蓋 96 個案例,這些案例是以精確參考分佈而非取樣的硬標籤所建構——隨機抽取、複合事件、條件歷史、機率謎題。4B 模型在該先導測試上的誤差,在所報告的指標上從 0.628 降至 0.550,而對照模型則落在 0.595。模型卡明確指出,此先導測試並未用於擬合或選擇所公布的溫度;4B 的溫度 1.992418 是在校準集上另行擬合得出的。InternLM 團隊也將基準測試本身發布到 GitHub 儲存庫——確定性生成器、參考資料與離線評分器——這意味著該校準主張屬於罕見的一類:第三方真的能夠重新執行,而不是只能盲目相信。
Kolibri 的發布內容中沒有任何東西能提供對等的事物。其比較表報告了在單一廠商測試框架上十四個模型的任務準確率,而準確率正是生成式模型可被衡量的指標。資料中沒有任何校準數值、沒有 Brier、沒有 ECE,也沒有辦法向它詢問「這條合約條款可執行的機率」,而不涉及取樣一個句子並閱讀它。
它們唯一真正交會的那道接縫
把兩者並排放進真實的流程中,差異就會變得顯而易見。一套德文文件工作流程需要這兩半,而這兩個工具都無法涵蓋對方的另一半。
Kolibri 是負責讀取與寫入的那一半。擁有德語合約或技術文件的團隊可獲得 262,144 詞元的原生視窗、FP8 KV 快取、一個雙語分詞器——Aleph Alpha 回報其在德語網頁文字上平均每詞元為 4.90 位元組——以及 Hermes 工具呼叫;也就是說,這是一個能夠摘要申報文件、草擬回覆並驅動工具迴圈的模型。它做不到的是,以你能夠稽核的方式告訴你它自身的信心程度,因為它輸出的每一個內容都是取樣而來的字串。
Intern-Decision-4B 是負責決策的那一半。給定一頁德文文本和一組固定選項,它能在單一消費級 GPU 上以 44 毫秒回傳一個經校準的分布,沒有生成步驟,因此完全沒有取樣變異。它做不到的是從頭產出德文文本,而且它已發表的評測套件都是英文——它的德文行為繼承自 Qwen3.5-4B 基礎模型,而非經過訓練而得,這對德文部署而言是一項實質限制,而且沒有人評估過這一點。
所以,對於受監管的德語工作流程,誠實的工程答案是:這些是同一條管線的兩個階段,而不是同一個位置的兩個候選方案。實際問題是各自要在哪裡執行。Kolibri 需要兩張 H100 或一張 B200,以及約 78 GB。Intern-Decision-4B 需要一張 RTX 4090,執行一次查詢只需不到 45 毫秒。硬體成本的不對稱程度大約達到兩個數量級,而這指向一種設計:小型評分器對每個案件持續執行,大型生成器則只在案件確實需要成篇文字時才被叫用。這比把每個案件都送進 78B 模型、換得一個之後還得自行解讀的答案,是更便宜、也更利於稽核的形態。

兩者的主機現實,以及該層的用途
兩個模型都沒有以託管 API 形式提供,而我們是查證過,不是憑假設。Intern-Decision-4B 沒有廠商端點;這次發布的是權重、一個 GitHub 儲存庫,以及一個 Hugging Face Space。它的下載數和按讚數自週中以來已有變動,這說明人們正在採用它,但我們願意點名的任何地方,仍然沒有付費可呼叫的途徑。
Kolibri 同樣沒有 Aleph Alpha API SKU——此次發布的是權重、一份技術報告,以及位於 ghcr.io/aleph-alpha/aleph-alpha-inference 的容器映像。而且它並不在 OrcaRouter 上:我們以供應商前綴與模型名稱的各種拼法徹底探查了目錄,結果都顯示找不到;比起暗示相反的情況,我們更願意如實說明。
在這裡,路由層改變的不是對這兩個模型的存取權,而是決定是否要為其中任一個購買硬體的經濟考量。對生成性那一半來說,誠實的購買前測試,是讓工作負載跑在一個已經經過路由的小型混合專家層級上——Gemma 4 26B-A4B 變體,每百萬輸入 token 為 $0.06、每百萬輸出 token 為 $0.33,具備 262,144-token 視窗,並支援文字、圖像與影片輸入——使用一組 OpenAI 相容金鑰 按供應商定價,不加任何東西,然後看看在訂購 GPU 之前,德文文件工作負載是否真的需要 780 億個參數。決策那一半沒有這條捷徑,因為校準分佈行為正是這個模型的重點,而沒有任何經過路由的層級能做到這件事。但這本身就是那項發現:它告訴你 4B 評分器是你真正會自行託管的部分,而生成器則是值得用你下午就能租到的東西重新測試的部分。
什麼能讓它塵埃落定
兩項測量,而兩者都尚未存在。
第一個是 Intern-Decision-4B 在德語輸入上的表現。每個已發表的測試套件都是英文,而該模型是多語言基礎模型的微調版本,因此其德語校準狀況未知——而校準正是那項不會無償跨語言轉移的特性。若有人要發布關於這個模型的任何內容,96 個案例的分佈試點計畫的德語版本會是單一最具資訊量的產物。
第二個是 Kolibri 的每次決策成本。其服務經濟學主張是一條帕雷托前沿:品質對上每 GPU 每秒解碼 token 數,而 Kolibri 沒有 Artificial Analysis 頁面,也沒有第三方複製其測試框架。在有人實際運行之前,「780 億參數」是一項規格而非成本,而保留一個 44 毫秒評分器置於其前的理由,仍屬設計論證而非實測論證。
在那之前,看待這組搭配的正確方式並不是把它當成一場較勁。Intern-Decision-4B 是兩者中技術上更有趣的發布,因為校準感知的結構化輸出是幾乎沒有生成式模型提供的能力,而它的模型卡讓你得以查核這項說法。Kolibri 則是影響更深遠的發布,因為一家歐洲實驗室以 Apache 2.0 授權發布 780 億參數的模型,並同時公開資料管線,這是供應鏈層級的事件,而非單純的模型事件。兩者無法互相取代。同時需要兩者的團隊應該為兩者都做規劃,並據此估算硬體規模,而真正投入工程心力的地方,其實是圍繞它們的測試框架。

