標題卡寫著「Kolibri vs Solar Mini 4」,副標題為「同樣的 3B 活躍參數預算,兩種截然不同的押注」,以及兩行小字寫著「Kolibri — 總計 78.1B,Apache 2.0 權重,可自行託管」與「Solar Mini 4 — 總計 35B,閉源,託管式」,背景為白色,帶有柔和的藍色與青色漸層點綴,角落有 OrcaRouter 標誌。
Guides & Insights

Kolibri vs Solar Mini 4:同樣的 3B 活躍參數預算,兩種截然不同的押注

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩款相隔十七天推出的模型,都經過調校,讓每個 token 大約只動用三個活躍參數;但就實際採用而言,兩者的差異幾乎大到不能再大。Aleph Alpha 的 Kolibri 是 781 億參數、採 Apache-2.0 授權的權重,得由你自己下載、自行架設服務:它沒有代管端點,而且時至今日,任何地方都找不到一份關於它的獨立評測分數。Upstage 的 Solar Mini 4 則有 350 億參數,你卻完全無法下載——它只以按用量計費的端點形式存在,而且已經取得 24.05 的 Artificial Analysis Intelligence Index 分數。活躍參數數量告訴你的,是兩者各自的使用成本。這個數字的其餘任何面向,都不會告訴你起步要付出多少代價。

總量之所以會差到這麼遠——78.1B 對上 35B,而啟用的參數切片幾乎相同——是因為兩者都是稀疏混合專家架構,而這兩家實驗室對於該保留多少專家容量作為儲備,做出了完全相反的決定。Kolibri 帶有 384 個專家,每個 token 會路由到 1 個共享專家加上其中 6 個。Solar Mini 4 只揭露了 35B/3B 的拆分,對其專家數量則隻字未提。當兩個模型以相同的啟用參數數字來宣傳時,決定你硬體帳單的是參數總量,而不是啟用參數——而在這裡,在同樣宣稱的運算預算下,兩者相差 2.2 倍。

每一個實際上是什麼

• 總計 — Kolibri 78.10B 對比 Solar Mini 4 35B

• 每個 token 的活躍參數 — Kolibri 3.46B 對比 Solar Mini 4 3B

• 權重 — Kolibri Apache 2.0,完整權重在 Hugging Face 上;相較之下 Solar Mini 4 為封閉式;僅提供 API

• 上下文 — Kolibri 的 1,048,576 個 token 已通過驗證,對比 Solar Mini 4 根據 Upstage 文件為 512K、根據 Artificial Analysis 模型卡為 1,048,576

• 最大輸出 — 相較於 Solar Mini 4 的 128,000 個 token,Kolibri 不受廠商限制

• 語言 — Kolibri 德語與英語 對比 Solar Mini 4 英語、韓語與日語

• 知識截止日期 — Kolibri 2026年6月18日 對比 Solar Mini 2026年2月4日

• 交付方式 — Kolibri 自行託管(vLLM)對比 Solar Mini 4 託管於 Upstage 的 Console、Playground 與地端環境

• 獨立評估 — Kolibri 未公布,相較於 Solar Mini 4 的 AA Intelligence Index 24.05

Kolibri:780 億個參數,而實驗室外沒有人給它打過分

Aleph Alpha 於 2026 年 10 月 3 日發布 Kolibri,刻意選在德國統一日,作為新系列的首款模型,也是 Kolibri Origin 的後繼者。這份模型卡異常坦率地揭露了訓練內容:20 兆個 token 的預訓練、3.44 兆個 token 的中期訓練,以及 2,010 億個 token 的長上下文訓練,動用 768 張 B200 GPU 運行 21 天,約達 6.4×10²³ FLOPs,耗電約 950 MWh。廠商還主動公布了故障次數——38 次非計畫性中斷,大約每 10,000 GPU 小時一次——這是多數實驗室通常不會提及的數字。

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

這套架構是乾淨俐落的稀疏 MoE 設計。五十層,滑動視窗注意力(512 個 token 的視窗)與全域注意力的比例為 4:1,而全域注意力僅每五層觸發一次。採用 FP8 權重、128×128 區塊縮放,以及 FP8 KV 快取。相較之下,Kolibri Origin 使用 128 個專家、路由寬度為 8,專家隱藏維度為 768 寬,且每一層都採用完整注意力,訓練資料為截至 2024 年 9 月的英文資料。Kolibri 則改為 384 個專家、路由寬度為 6,隱藏維度為 512 寬,並將兩種語言的資料截止點都推進到 2026 年 6 月 18 日。

德語流程是真正難以在其他地方買到的部分。Aleph Alpha 訓練了自己的 UniBPE 分詞器,並回報德語文本為每詞元 4.90 位元組,相較於 GPT-5 的 4.35、Qwen3.5 的 4.17 與 Gemini 的 4.13。這是一個宣稱德語壓縮優於任何前沿多語言模型的分詞器,而這正是主權部署主張背後的具體機制:每份德語文件的詞元更少,意味著計費詞元更少,以及在相同硬體上更長的有效視窗。

Kolibri 所有現有的效能數據都來自 Aleph Alpha 自家的模型卡,也應該以這樣的角度來解讀。廠商自行報告的表格顯示,Kolibri 在英語評測的整體得分為 75.5,德語為 70.8;GPQA Diamond 英語為 84.3,德語為 81.3;Humanity's Last Exam 英語為 21.5,德語為 15.9;SWE-Bench Verified 為 66.4;LiveCodeBench v6 為 85.9;AA-LCR 為 68.3。這些都是未經審計的數字。Artificial Analysis 上沒有 Kolibri 的頁面——該追蹤網站的模型網址會回傳 404——因此那張表格裡的任何內容都未曾經過獨立重現,而你正在閱讀的這篇文章也無法讓它變得比實際情況更可靠。

這張卡真正做實的,是推論服務的故事。硬體門檻是兩張 A100 80GB,或兩張 H100 SXM5,或單張 H200、B200 或 B300。一份已公開的 vLLM 配方會以--kv-cache-dtype fp8以及專用的推理與工具呼叫解析器來運行它,temperature 為 1.0、top-p 為 0.97、top-k 為 128,並配有一個reasoning_effort旋鈕,涵蓋 none、low、medium 與 high。以單張 B300 在經過驗證的 100 萬 token 上下文下服務一個 78B 模型,正是這項方案的具體樣貌:你買下這台機器,接下來每個 token 的邊際成本就由你自己承擔。

Solar Mini 4:你租用 3B 活躍切片,而不是購買它

Solar Mini 4 於 2026 年 9 月 22 日推出——快照 solar-mini4-260922,別名 solar-mini4——作為 Upstage 面向代理的小型模型:總參數 35B,啟用參數 3B,知識截止於 2026 年 2 月,支援英文、韓文與日文,並具備聊天、推理、結構化輸出與工具呼叫模式。它可透過 Upstage 的 Console 與 Playground 使用,也可供地端部署,但沒有權重下載,也沒有授權條款可供檢視。Upstage 的文件也為其記錄「未收集資料」,若你要將它放在實際流量前,這正是關鍵的合規界線。

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

與 Kolibri 不同,Solar Mini 4 經過了獨立測試框架的檢驗。Artificial Analysis 將其智慧指數評為 24.05,在 Terminal-Bench 4.0 上測得 1.01%、SciCode 上 47.6%、AA-LCR 上 83.3%,以及 Humanity's Last Exam 上 25.8%。Upstage 的發布文章將 24.1 定位為擁有 30 億活躍參數的模型中指數最高者,領先 Qwen3.6 35B A3B 的 18 與 Nemotron 3.5 Lightning 的 13——這種定位就其本身而言是公允的,而值得注意的是,它正如聽起來那樣狹隘,因為這是一項關於 3B 活躍參數級別的宣稱,而非關於小型模型整體的宣稱。

真正該影響你如何為它編列預算的衡量指標,並不是 Index。Artificial Analysis 的每項任務成本細分顯示,Solar Mini 4 每個 Intelligence-Index 任務約為 $0.36,而其中約 $0.30——大約 82%——是提示快取寫入。快取讀取為 $0.03,生成的輸出僅為 $0.035。模型每項任務約產生 88,300 個輸出 token,其中約 71,600 個是推理 token。換句話說:這是一款便宜的模型,其帳單主要來自重新寫入長上下文,而不是它回寫的 token。各項評估成本從 Terminal-Bench 4.0 的 $1.63 到 AA-Briefcase 的 $0.95 不等。輸出速度中位數為每秒 198 個 token,首個區塊時間為 1.58 秒。

每條路徑的價格

Solar Mini 4 目前並非以定價計費。Upstage 自家的定價頁面為它列出一套標有日期的價格階梯:每百萬輸入 $0.03、快取 $0.003、輸出 $0.12——推出時 70% 折扣——適用到 2026 年 10 月 10 日 UTC,之後自 10 月 11 日起為 $0.05 / $0.005 / $0.20,最後自 10 月 23 日起為定價 $0.10 / $0.01 / $0.40。Upstage 的發布貼文對折扣的描述,比定價頁面自身的時程更寬鬆;上述階梯是附有日期的版本,也是值得據以規劃的版本。請注意最深的折扣落在何處:快取輸入降至輸入費率的十分之一,這正好回饋了上述快取寫入成本結構所收費的那種長時間穩定上下文工作負載。

Kolibri 的價格是一張採購訂單。沒有每百萬 token 的費率可供比較,因為它沒有託管式計量機制——你付的是 GPU 和電力,而供應商唯一公開的成本訊號就是訓練執行本身:生產這個模型約需 950 MWh。如果你已經擁有推論算力,Kolibri 的每 token 邊際成本就會趨近於電力成本;如果你沒有,入場門檻就是一台雙 A100 機器或更好的設備。這與一個你可以按百萬 token 呼叫、明天就停止呼叫的模型相比,是根本上不同的承諾形態,而這正是這兩個選項所呈現的真正決策。

它們重疊之處,以及比較失效之處

• 有效運算 — 幾乎相同:每個 token 3.46B 對 3B

• 隨之而來的一切——無從比較,因為兩者之中只有一方擁有任何已驗證的證據

• 最佳實測 — Solar Mini 4 的經審計指數為 24.05;Kolibri 有廠商,完全沒有經審計的分數

• 德語 — Kolibri 是兩者中唯一為其訓練的,每 token 4.90 位元組;Solar Mini 4 並未列出它

• 韓語與日語——Solar Mini 4 兩者皆列出;Kolibri 兩者皆未列出

• 長上下文 — Kolibri 驗證完整的 1,048,576 個 token;Solar Mini 4 自家文件寫的是 512K,而它的 Artificial Analysis 卡片則寫 1M,因此請將上限視為依供應商而定

• 首次取得 token 的時間 — Solar Mini 4 只要幾分鐘,因為你只要註冊;Kolibri 則要幾天,因為你得把機器上架

• 成本模型 — 按代幣計,隨折扣階梯下降,相對於資本加上電力

說得直白一點,這不是一場能靠排行榜定勝負的對決。Kolibri 的廠商數據表甚至納入了自家的一組對照——GLM-4.7 Flash 30B-A3B 英文整體得分 64.7、Nemotron 3 Nano 30B-A3B 為 65.6、Qwen3.5 35B-A3B 為 74.7、Qwen3.6 35B-A3B 為 71.4、Gemma 4 26B-A4B IT 為 71.9,全都對照 Kolibri 自家的 75.5——而這些列出的每一筆數字,都是 Aleph Alpha 自家跑出來的,由同一個實驗室用自家測試框架執行。這是一張描繪 3B 活躍參數這個範圍的有用地圖,但這不是一份獨立排名。

如果你想要的是今天在一個 key 上的 3B 活躍參數 MoE

這項比較中的兩個模型都不在 OrcaRouter 上,而箇中原因值得說清楚。Kolibri 目前完全沒有提供任何形式的託管推論——它只是一組權重和一份 vLLM 配方,因此路由器沒有可指向的目標。Solar Mini 4 由 Upstage 以及 Upstage 自家的地端通路提供;我們不路由它,也不路由任何 Upstage 模型。如果你想要其中任何一個,請直接向廠商取得。

我們所路由的,是環繞這兩者的整個級別——一個稀疏的小型 MoE 級距,而這兩個模型都在其中競爭。Gemma 4 26B-A4B IT 在價目表上的價格是每百萬詞元 $0.06 輸入、$0.33 輸出,並提供 262,144 詞元的脈絡窗。Qwen3.5 35B-A3B 為 $0.057 / $0.459,Qwen3.6 35B-A3B 則為 $0.248 / $1.485,脈絡窗為 262,144 詞元,最大輸出為 65,536 詞元。這些正是上述兩個模型在做的那筆相同交易——以小型模型的價格買到 3B 到 4B 的作用中切片——可透過一組 API 金鑰取得,並以 0% 加價直接轉嫁供應商的定價,因此廠商調價會在公告當天就反映到你的帳單上,而不是等到下一次合約續約。自動容錯移轉在這裡比平常更為重要:當你在評估一個未經實證的稀疏模型時,同一組金鑰後方的第二條路由,正是能防止一個糟糕的午後演變成服務中斷的關鍵。

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

該做什麼,以及該注意什麼

如果德語或英語是你的工作負載,如果資料不能離開你自己的機架,而且如果你已經有——或願意購買——能以 FP8 服務 78B 的 GPUs,就選擇 Kolibri。在那種配置下,它是這兩個模型中唯一甚至可考慮的選項,而搭配 4.90-byte-per-token 德語分詞器的 1M-token 已驗證上下文,是一項真實——儘管是由廠商測量——的優勢。如果你希望本週就進入生產環境,如果韓語或日語在你的發展藍圖上,而且如果你的工作負載是快取折扣能帶來回報的長時間穩定上下文,就選擇 Solar Mini 4;請把預算花在快取寫入,而不是輸出 token。

對兩者而言,未解的問題都一樣,而且這是證據問題,不是能力問題。Kolibri 的 75.5 和 84.3 是 Aleph Alpha 在自家測試框架上得出的自家數字,在獨立追蹤單位跑過之前,任何人引用它們,都只是在引用該實驗室。Solar Mini 4 的 24.05 是真的,也已重現,但 Index 只是一個仍處於折扣階梯中段的模型快照,牌價要到 10 月 23 日才會公佈。留意 Kolibri 的第一份獨立評估,也留意當折扣階梯結束後,Solar Mini 4 的實際價格——因為在 $0.10 / $0.40 時,租用 3B 切片的成本效益,看起來會不同於今天報給你的 $0.03 / $0.12。