一张生成的主视觉标题卡片,上面写着“Solar Mini 4 对比 MathForm 8B”,副标题是“一个负责回答问题,另一个让问题变得可验证”,还有两个徽章,分别写着“通才对阵自动形式化器”和“Lean 4 编译在环”。
Guides & Insights

Solar Mini 4 与 MathForm 8B:一个模型回答问题,另一个让答案可核查

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

把 Solar Mini 4 和 MathForm 8B 放在一起比较,你面对的是两个并不争夺同一个 token 的模型。Solar Mini 4 是 Upstage 的 350 亿参数稀疏专家混合模型,于 2026 年 9 月 22 日发布,每个 token 激活约 30 亿参数;它负责回答问题:读取一篇长文档,对其推理,返回一份书面结果。MathForm 8B 是 OpenBMB 的 80 亿参数自动形式化器,于 2026 年 8 月 14 日以 Apache 2.0 许可发布,它做了一件任何推理模型都根本不做的事——它接收自然语言的数学陈述,并将其改写为证明助手的编译器会进行类型检查的 Lean 4 定理。一个产出答案。另一个产出机器可检查的问题,而后者才是更稀罕的东西。

无论如何,这个比较都值得一做,因为两者最终都会进入同一种流水线,也因为在优势上二者恰好相反,这使得选择变得异常清晰明了。Upstage 的模型擅长处理长文档,但在高难度推理上表现较弱,而且每完成一项任务的成本都很高。OpenBMB 的模型适用范围狭窄,在其专长领域之外几乎毫无用处;它从未经过任何独立评估方的评分,而且只要你有 GPU,运行起来不花一分钱。

并排对比,聚焦差异之处

• 它是什么 —— Solar Mini 4 是一个通用推理模型,拥有 1M token 的上下文(按照 Upstage 自家文档为 512K),在 Artificial Analysis 智能指数上实测得分为 24.1。MathForm 8B 是一个单任务自动形式化工具,没有公开的指数得分、没有独立评估,也没有任何通用能力方面的宣称。

• 参数 — 总计 35B / 活跃 3B,稀疏,用于 Solar Mini 4;用于 MathForm 8B 的 8.19B 稠密模型,基于 Qwen3-8B,在 OpenBMB 的 FormalVerse 语料库(约 367,000 个已验证的 Lean 4 示例)上微调而来。

• 许可与交付 —— Solar Mini 4 为专有模型,通过 Upstage 的 API 及第三方平台访问。MathForm 8B 为 Apache-2.0 权重,附带聊天模板、四个 safetensors 分片,并可在 OpenAI 兼容端点之后使用 Transformers、vLLM 或 SGLang 的部署路径。

• 价格 — Solar Mini 4 为每百万 token 0.10 美元 / 缓存 0.01 美元 / 0.40 美元,目前截至 2026 年 10 月 22 日享五折优惠。MathForm 8B 没有价目表;它的成本就是你给它配的那块 GPU。

• 速度 — Solar Mini 4 在 Artificial Analysis 测试框架上每秒输出 204 个 token,每个索引任务输出 88,300 个 token,每个任务约需 430 秒的工作量。MathForm 8B 的输出是一个 Lean 4 定理头,最多几百个 token。

• 其数字的独立性 — Solar Mini 4 已由第三方运行过。MathForm 8B 则没有:其论文中的每一个数字都出自作者本人,而且该模型太新、太专精,尚未吸引到独立运行。

两个模型在何处交汇,又在何处不交汇

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

这些失效模式正是让这一组合变得有趣的原因,因为它们恰好完全相反。Solar Mini 4 已公布的最差结果是 Terminal-Bench 4.0 上的 1%,以及 AutomationBench-AA 上的 22.3%——它不擅长在会给予反馈的环境中验证自己的工作。MathForm 8B 的整个设计前提就是验证:OpenBMB 区分了 Syntax Check 与 Consistency Check,前者问的是 Lean 4 语句能否通过编译,后者问的是它所编译出的语句是否真的与非形式化问题含义相同。它旨在防止的典型失败,是一种语句虽能通过类型检查,却在不知不觉中弱化了断言。

这是一个真实的区别,值得精确对待。一个生成证明的推理模型有一个众所周知的自我验证问题:生成过程中没有任何东西能告诉你答案是否正确。而编译器可以。如果你的工作流是“把一个题库转换成机器可以检查的东西”,那么 MathForm 8B 正在做 Solar Mini 4 完全做不了的那一半工作,而剩下的部分并不是程度问题。

厂商标称的数据,已按此标注:OpenBMB 的论文报告,在六个基准上,Syntax Check 下平均 Pass@8 为 88.06%,Consistency Check 下为 72.37%,并声称这些成绩超过若干专门的 32B 自动形式化器。其中没有任何一项得到第三方复现。两次检查之间 16 个百分点的下降是更具信息量的数字——它衡量的是,编译出的陈述在多大频率上并不完全是你所询问的那个问题,而这也是 Consistency Check 作为单独一列存在的原因。

为什么团队会同时运行两者

因为自然流水线有一个廉价、高吞吐的阶段,以及一个昂贵、低吞吐的阶段。MathForm 8B 在你自己的硬件上运行,把非正式问题转换成 Lean 4 头部,并有编译器可在人类看到之前拒绝糟糕的输出。Solar Mini 4 处理围绕这一环节发生的事情:阅读支撑论文、提取假设、用韩语或英语总结结果,并为工作安排路由。这两者从不会竞争同一个请求,而较小的那个负责工作中具有客观通过/失败信号的那部分。

这两款模型都不是我们能为你路由的——Upstage 的模型不在 OrcaRouter 上,OpenBMB 的也不在——所以如果你想要 Solar Mini 4,它得来自 Upstage 自家的 API;而如果你想要 MathForm 8B,它得来自 Hugging Face 和你自己的 GPU。我们能做的是把这条流水线的其余部分都放在一个密钥之后:超过 200 个模型,相较提供商标价零加价、跨提供商的自动故障转移,以及一套路由 DSL,让你能把多个模型串联成单次调用。在这样一种工作流里——小型专用模型负责形式化步骤,大型通用模型负责围绕它的一切——能够通过改一个模型字符串来更换通用模型,而不是发布一套新的集成,这就是两周的改动和一个下午之间的差别。

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

要点总结

如果你的问题是“这些里我该用哪一个”,诚实的答案是:这取决于你需要的是一个答案,还是一种形式化,而没有任何基准测试能给出定论。如果你的问题是“MathForm 8B 值不值得下载”,答案是:对一项很窄的任务来说值得,对其他任何用途都不值得——它是形式化器,不是证明器,而它产出的结果中,证明义务仍然未决。如果你的问题是“Solar Mini 4 每个任务 0.36 美元值不值”,答案是:对大批量长文档来说值得,对任何需要它检查自身工作的用途来说都不值得。

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

关于信息来源,最后补充一点。上面每一个 Solar Mini 4 的数字,除上下文窗口外,都是 Artificial Analysis 的独立测量结果;而上下文窗口是 Upstage 自己给出的数字,与他们的结果不一致。MathForm 8B 的每一个数字都来自 arXiv 2608.14221 的厂商自报数据,且未经复现,其发布也未作任何预告——权重、FormalVerse 数据集和论文都在 2026 年 8 月 14 日同时出现,既没有厂商博客文章,迄今为止也没有任何独立基准测试运行。