一張生成的主視覺標題卡,寫著「Solar Mini 4 對上 Granite 4.2 3B」,副標題是「一個你呼叫的模型,以及一個你下載的檢查點」,還有兩個徽章寫著「每個模型每個 token 約有 30 億個參數處於啟用狀態」和「一個按 token 計費,另一個按瓦特計費」。
Guides & Insights

Solar Mini 4 與 Granite 4.2 3B:一個你呼叫的模型,以及一個你下載的檢查點

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

把 Solar Mini 4 和 Granite 4.2 3B 放在一起看,有趣的數字並不是基準測試差距。而是:IBM 於 2026 年 8 月 25 日發布、採 Apache-2.0 授權的推論模型 Granite 4.2 3B,今晚就能在你的筆電上免費執行;而 Upstage 於 2026 年 9 月 22 日發布的專有模型 Solar Mini 4,不只在你擁有的任何裝置上都跑不起來,回答一個問題還要按每百萬輸入 token 收 0.10 美元、每百萬輸出 token 收 0.40 美元計費。兩者每個 token 都約啟用三十億個參數的運算量。一個是檔案,另一個是計費表。

那個差異幾乎決定了這項比較的其他一切,包括哪些基準測試甚至值得並列放在一起。Granite 4.2 3B 早在 Solar Mini 4 之前就接受了獨立評估——Artificial Analysis 在 Intelligence Index v4.3.2 上給它 9 分,該評分來自與將 Solar Mini 4 評為 24 分相同的評估套件和相同組織。這意味著這裡的十五分差距異常地有充分根據:同一個實驗室、同一套方法論,以及兩個不需要任何人憑信心接受的模型。

規格,就在真正區分它們的維度上

• 架構 — Solar Mini 4 是稀疏的專家混合模型:總參數達 35B,每個 token 啟用 3B,根據 Upstage 的說法。Granite 4.2 3B 則是稠密模型,約有 3B 參數,而根據 safetensors 中繼資料,包含嵌入在內的總參數約為 4B。相同的啟用預算,兩種不同的運用方式。

• 權重 — Solar Mini 4 為專有且閉源。Granite 4.2 3B 以 Apache 2.0 授權發布,並附有詳盡的訓練配方文件,甚至涵蓋資料比例。

• 上下文 — Upstage 記載為 512K 個 token,輸出最高可達 128K;Artificial Analysis 則將同一個模型列為 1.0M,因此這個上限尚未有定論。Granite 4.2 3B 原生可執行 131,072 個 token,並透過第五個預訓練階段擴展至 512K。

• 價格 — Solar Mini 4 每百萬個 token 為 $0.10 / 快取 $0.01 / $0.40,目前至 2026 年 10 月 22 日前享 50% 折扣。Granite 4.2 3B 沒有供應商價目表,因為根本沒有東西可租;Artificial Analysis 所追蹤的託管端點定價約為 $0.03 / $0.12,而自行架設則只需負擔電費。

• 智慧指數 — Solar Mini 4 為 24,Granite 4.2 3B 為 9,兩者數據皆來自 Artificial Analysis v4.3.2。

• 速度 — Solar Mini 4 每秒可輸出 204 個 token,Granite 4.2 3B 則為 223 個,兩者皆由同一間實驗室測量,首個區塊時間分別為 1.5 秒與 0.5 秒。這款稠密模型在兩項指標上都較快。

那十五個百分點的差距究竟是由什麼組成的

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

個別評估所講述的故事,對 Granite 4.2 3B 而言比頭條成績更不光彩,對 Solar Mini 4 而言則更為複雜。在長上下文推理基準 AA-LCR v1.1 上,Solar Mini 4 得分 83%,Granite 4.2 3B 得分 24%。這單一評估占了指數差距的極大比例,而這並非規模上的偶然——這正是你用 512K 到 1M 個 token 的上下文,以及為了運用它所進行的訓練所換來的。Granite 4.2 3B 的原生視窗最高為 131K;延伸的 512K 階段確實存在,但該模型並未像 Solar Mini 4 那樣,針對跨越這段上下文進行推理而調校。

就一般知識而言,差距會縮小,接著在性質上反轉。Granite 4.2 3B 在 GPQA 上得分 55.9%,而 Solar Mini 4 完全沒有 GPQA 數據;在 Humanity's Last Exam 上,兩者分別是 6.6% 和 25.8%,這是更直接的比較,也是規模差異所預測的結果。根據 Artificial Analysis,Granite 4.2 3B 不會做的事是捏造:其 AA-Omniscience 非幻覺率為 73.7%,高於 Solar Mini 4 的 64.2%。這個較小的模型比較不會憑空編造它沒有的答案。

Agentic 編碼是這兩個模型都表現不佳的地方,也是讀懂數字很重要的地方。Solar Mini 4 在 Terminal-Bench 4.0 上得分 1%,在 AutomationBench-AA 上得分 22.3%。Granite 4.2 3B 在 Terminal-Bench 4.0 上得分 0%,在較舊的 Terminal-Bench 2.1 上得分 13.9%,在 τ³-Banking 上得分 5.6%。這兩個模型都不是適合自主終端工作的工具。Granite 4.2 系列中的 8B 和 30B 成員接受了 IBM 的代理式強化學習,並帶有 SWE-Bench 和 Terminal-Bench 的結果;3B 則明確跳過了那個訓練區塊,而 Upstage 的模型是為檢索、結構化與政策應用而定位,而非為了驅動 shell。

Granite 4.2 3B 仍是正確答案的情況

七又三分之一 GB 的 bfloat16 權重、採用實用量化後不到四 GB,再加上 Apache 2.0 授權,讓你能以自己的資料微調,並直接發布成果,無須徵詢任何人。一名只有一張消費級 GPU 的學生、一間無法把病患文本送往第三方的醫院、一項必須在飛機上或工廠地下室裡運作的產品、一個想擁有模型而非租用端點的團隊——這些情況每一個都會選擇 Granite 4.2 3B,而且不再回頭。其引擎可透過 vLLM、SGLang、Transformers 與 GGUF 執行,而 Ollama 也列出了 granite4.2:3b 組建。

其廠商自行報告的數字值得一如往常地謹慎看待。IBM 的規格卡宣稱在 AIME 2025 上達到 78.33、在 HMMT February 2025 上達到 66.67,並在 LiveCodeBench v6 上達到 69.71——這些數字全都未獲任何第三方重現,而對一個稠密 3B 模型來說,AIME 的數字遠高於歷史區間。Artificial Analysis 指數的 9 分顯示該模型確實實用,且遠不及前沿,而這正是更可信的訊號,正因為 IBM 並未發布它。

在什麼情況下 Solar Mini 4 才是正確答案

凡是工作內容為長篇文件、重複的結構化擷取,或是必須大量且一致套用的政策——且可接受九十秒延遲的情況。Solar Mini 4 的概況是專家的概況:長上下文推理 83%、科學程式編寫 48%、非幻覺 64%,以及有文獻記載傾向於棄權而非猜測。它也能將韓語作為與英語和日語並列的一流語言,這對於韓國市場的部署而言並非無足輕重的附註。

買方不該做的,是比較這兩個 token 的價格,然後斷定 Solar Mini 4 貴了三倍。Artificial Analysis 測得 Solar Mini 4 每完成一項 Intelligence Index 任務為 0.36 美元——而在同一套測試中,Granite 4.2 3B 為 0.006 美元。這是六十倍的差距,成因與讓 Solar Mini 4 相對於 GPT-6 Luna(max)被墊高的因素相同:每項任務 88,300 個輸出 token,而 Granite 為 18,600 個;以及一種成本結構,其中提示快取寫入占 Solar Mini 4 的 0.36 美元中的 0.30 美元,而 Granite 的 0.006 美元中則占 0.0006 美元。在一個冗長的模型上,便宜的輸出價格並不代表任務便宜。

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

這兩款模型都不在 OrcaRouter 上——Granite 和 Upstage 我們都不轉送——所以如果你想要 Granite 4.2 3B,它得從 Hugging Face 取得;而如果你想要 Solar Mini 4,它則來自 Upstage 自家的 API 與第三方平台。但這項比較所暗示的雙模型模式,正是路由器天生要處理的情境,而這也是為什麼 OrcaRouter 讓超過 200 款模型透過單一金鑰存取,且相較於供應商定價零加成:把長文件與韓語相關工作交給真正值得其成本的那款模型,把確定性的擷取步驟留在你自己託管的模型上,並讓路由與容錯移轉在每次呼叫時於兩者之間移動請求,而不是依照合約來決定。

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

關於上述數字的最後一點說明。每一個來自 Artificial Analysis 的 Solar Mini 4 數據都是獨立測量;每一個來自 IBM 模型卡的 Granite 4.2 3B 數據則是廠商宣稱,沒有第三方重現過。Artificial Analysis 的指數分數 24 與 9 是這裡唯一兩個由同一實驗室在相同條件下產生的數字——而它們正是應該用來建立決策的兩個數字。