一张生成的英雄标题卡,标题为“Solar Mini 4 vs Granite 4.2 3B”,副标题为“一个你调用的模型,一个你下载的检查点”,还有两个徽章,分别写着“每个模型每个 token 约有 30 亿活跃参数”和“一个按 token 计费,另一个按瓦特计费”。
Guides & Insights

Solar Mini 4 与 Granite 4.2 3B:一个可供调用的模型,一个可下载的检查点

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Solar Mini 4 和 Granite 4.2 3B 放在一起比较,有趣的数字并不是基准测试差距。而是:Granite 4.2 3B——IBM 于 2026 年 8 月 25 日发布的 Apache-2.0 推理模型——今晚就能免费在笔记本电脑上运行;而 Solar Mini 4——Upstage 于 2026 年 9 月 22 日发布的专有模型——在你拥有的任何设备上都跑不起来,并且回答问题要按每百万输入 token 收费 0.10 美元、每百万输出 token 收费 0.40 美元。两者每处理一个 token 都会激活大约三十亿参数的算力。一个是文件。另一个是计价器。

这一差异决定了这次比较中几乎所有其他方面,包括哪些基准测试甚至值得放在一起对比。Granite 4.2 3B 早在 Solar Mini 4 之前很久就有了独立评估——Artificial Analysis 在 Intelligence Index v4.3.2 上给它打 9 分,而给 Solar Mini 4 打 24 分的,是同一套评估体系和同一家机构。这意味着这里的十五分差距有着不同寻常的可靠依据:同一家实验室、同一套方法论,以及两个无需任何人盲目相信的模型。

规格方面,真正区分它们的那些维度

• 架构 — Solar Mini 4 采用稀疏混合专家架构:据 Upstage 称,总参数量为 35B,每个 token 激活 3B。Granite 4.2 3B 则是稠密模型,参数量约为 3B;根据 safetensors 元数据,包含嵌入层在内总计约 4B。相同的激活预算,两种不同的花费方式。

• 权重 — Solar Mini 4 为专有闭源模型。Granite 4.2 3B 以 Apache 2.0 许可发布,并附有详细的训练配方,细至数据配比。

• 上下文 — Upstage 的文档标明为 512K 个 token,输出最高可达 128K;而 Artificial Analysis 对同一模型列出的是 1.0M,因此这一上限尚无定论。Granite 4.2 3B 原生支持 131,072 个 token,并通过第五个预训练阶段扩展至 512K。

• 价格 — Solar Mini 4 为每百万 token $0.10 / 缓存 $0.01 / $0.40,目前截至 2026 年 10 月 22 日享受 50% 折扣。Granite 4.2 3B 没有厂商价目表,因为根本无从租用;Artificial Analysis 追踪的托管端点定价约为 $0.03 / $0.12,而自行托管只需支付电费。

• 智能指数——Solar Mini 4 为 24,Granite 4.2 3B 为 9,两者数据均来自 Artificial Analysis v4.3.2。

• 速度 — Solar Mini 4 的每秒输出 token 数为 204,Granite 4.2 3B 为 223,两者均由同一实验室测量,首块延迟分别为 1.5 秒和 0.5 秒。在这两项指标上,稠密模型都更快。

十五个百分点的差距实际上是由什么构成的

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

各项单独评估所反映的情况,对 Granite 4.2 3B 而言不如总体标题那么亮眼,对 Solar Mini 4 而言则更为复杂。在长上下文推理基准 AA-LCR v1.1 上,Solar Mini 4 得分为 83%,Granite 4.2 3B 得分为 24%。仅这一项评估就占据了指数差异中的极大份额,而且这并非规模带来的偶然结果——这是用 512K 到 1M token 的上下文以及为使用它而进行的训练换来的。Granite 4.2 3B 的原生窗口最高为 131K;扩展的 512K 阶段确实存在,但该模型并未像 Solar Mini 4 那样经过调优,以便在整个窗口范围内进行推理。

在常识方面,差距缩小,随后性质发生反转。Granite 4.2 3B 在 GPQA 上得分 55.9%,而 Solar Mini 4 完全没有 GPQA 数据;在 Humanity's Last Exam 上,两者分别为 6.6% 和 25.8%,这是更直接的比较,也是规模差异所预示的结果。根据 Artificial Analysis,Granite 4.2 3B 不会做的一件事是编造:其 AA-Omniscience 非幻觉率为 73.7%,高于 Solar Mini 4 的 64.2%。较小的模型更不可能编造出它并不掌握的答案。

智能体式编码正是两款模型都栽跟头的地方,也正是读懂数字的关键所在。Solar Mini 4 在 Terminal-Bench 4.0 上得分 1%,在 AutomationBench-AA 上得分 22.3%。Granite 4.2 3B 在 Terminal-Bench 4.0 上得分 0%,在更早的 Terminal-Bench 2.1 上得分 13.9%,在 τ³-Banking 上得分 5.6%。两款模型都不是执行自主终端任务的合适工具。Granite 4.2 家族中的 8B 和 30B 成员接受了 IBM 的智能体强化学习训练,并带有 SWE-Bench 和 Terminal-Bench 的成绩;3B 版本则明确跳过了那一训练环节,而 Upstage 的模型其定位是检索、结构化和策略应用,而非驱动 shell。

在哪些情况下Granite 4.2 3B仍然是正确答案

七又三分之一 GB 的 bfloat16 权重,在实际量化下不到四 GB,而且 Apache 2.0 许可证允许你用自己的数据微调,并直接发布结果,无需征求任何人的许可。只有一块消费级 GPU 的学生、无法将患者文本发送给第三方的医院、需要在一架飞机上或工厂地下室里运行的产品、想要拥有一个模型而不是租用一个端点的团队——所有这些情况都会选择 Granite 4.2 3B,并且不再回头。该引擎可通过 vLLM、SGLang、Transformers 和 GGUF 运行,Ollama 也列出了 granite4.2:3b 构建版本。

其厂商报告的数字理应受到惯常的审慎对待。IBM 的说明卡声称在 AIME 2025 上达到 78.33,在 HMMT February 2025 上达到 66.67,在 LiveCodeBench v6 上达到 69.71——这些均未得到任何第三方复现,而且对于一个稠密的 3B 模型来说,AIME 的数值远高于历史区间。Artificial Analysis 指数为 9,表明该模型确实有用,但远未达到前沿水平;这一信号之所以更可信,恰恰是因为 IBM 并未公布它。

Solar Mini 4 是正确答案的地方

凡是工作涉及长文档、重复的结构化抽取,或需要在规模化场景中一致执行的策略——并且可以接受九十秒延迟——都适用。Solar Mini 4 的画像是一份专家型画像:长上下文推理 83%,科学编程 48%,非幻觉率 64%,并且有记录显示它倾向于弃答而非猜测。它还把韩语与英语、日语并列为一等语言,这对于面向韩国市场的部署来说绝不是可有可无的脚注。

买家不该做的是比较这两个 token 价格,然后得出 Solar Mini 4 贵三倍的结论。Artificial Analysis 的测量结果是,Solar Mini 4 每完成一项 Intelligence Index 任务花费 0.36 美元,而在同一套测试中,Granite 4.2 3B 为 0.006 美元。这是六十倍的差距,其成因与 Solar Mini 4 相对 GPT-6 Luna (max) 成本虚高的原因相同:每项任务 88,300 个输出 token,而 Granite 为 18,600 个;以及在成本结构中,提示缓存写入占 Solar Mini 4 那 0.36 美元中的 0.30 美元,而 Granite 的 0.006 美元中仅占 0.0006 美元。在一个啰嗦的模型上,便宜的输出价格并不等于便宜的任务。

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

这两个模型都不在 OrcaRouter 上——Granite 和 Upstage 我们都不路由——所以如果你想要 Granite 4.2 3B,得从 Hugging Face 获取;如果你想要 Solar Mini 4,则要经由 Upstage 自家的 API 和第三方平台。但这次对比所体现的双模型模式,正是路由器天生就为之设计的那种模式,也正是 OrcaRouter 以单一密钥提供 200 多个模型、且相对提供商标价仅 0% 加价的原因所在:把长文档和韩语相关工作交给真正对得起成本的模型,把确定性提取步骤留在你自己托管的东西上,并让路由与故障转移按每次调用、而不是按合同在两者之间移动请求。

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

关于上述数字的最后一点说明。来自 Artificial Analysis 的每一个 Solar Mini 4 数字都是独立测量结果;来自 IBM 模型卡的每一个 Granite 4.2 3B 数字都是厂商声明,尚无任何第三方复现。Artificial Analysis 指数得分 24 和 9 是这里仅有的两个由同一实验室在相同条件下得出的数字——而它们才是应当作为决策依据的两个数字。