
Solar Mini 4 与 MathForm 8B:一个模型回答问题,另一个让答案可核查
- openai新OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 每百万 tokens
- anthropic新Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 每百万 tokens · 159 tok/s
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 220 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
把 Solar Mini 4 和 MathForm 8B 放在一起比较,你面对的是两个并不争夺同一个 token 的模型。Solar Mini 4 是 Upstage 的 350 亿参数稀疏专家混合模型,于 2026 年 9 月 22 日发布,每个 token 激活约 30 亿参数;它负责回答问题:读取一篇长文档,对其推理,返回一份书面结果。MathForm 8B 是 OpenBMB 的 80 亿参数自动形式化器,于 2026 年 8 月 14 日以 Apache 2.0 许可发布,它做了一件任何推理模型都根本不做的事——它接收自然语言的数学陈述,并将其改写为证明助手的编译器会进行类型检查的 Lean 4 定理。一个产出答案。另一个产出机器可检查的问题,而后者才是更稀罕的东西。
无论如何,这个比较都值得一做,因为两者最终都会进入同一种流水线,也因为在优势上二者恰好相反,这使得选择变得异常清晰明了。Upstage 的模型擅长处理长文档,但在高难度推理上表现较弱,而且每完成一项任务的成本都很高。OpenBMB 的模型适用范围狭窄,在其专长领域之外几乎毫无用处;它从未经过任何独立评估方的评分,而且只要你有 GPU,运行起来不花一分钱。
并排对比,聚焦差异之处
• 它是什么 —— Solar Mini 4 是一个通用推理模型,拥有 1M token 的上下文(按照 Upstage 自家文档为 512K),在 Artificial Analysis 智能指数上实测得分为 24.1。MathForm 8B 是一个单任务自动形式化工具,没有公开的指数得分、没有独立评估,也没有任何通用能力方面的宣称。
• 参数 — 总计 35B / 活跃 3B,稀疏,用于 Solar Mini 4;用于 MathForm 8B 的 8.19B 稠密模型,基于 Qwen3-8B,在 OpenBMB 的 FormalVerse 语料库(约 367,000 个已验证的 Lean 4 示例)上微调而来。
• 许可与交付 —— Solar Mini 4 为专有模型,通过 Upstage 的 API 及第三方平台访问。MathForm 8B 为 Apache-2.0 权重,附带聊天模板、四个 safetensors 分片,并可在 OpenAI 兼容端点之后使用 Transformers、vLLM 或 SGLang 的部署路径。
• 价格 — Solar Mini 4 为每百万 token 0.10 美元 / 缓存 0.01 美元 / 0.40 美元,目前截至 2026 年 10 月 22 日享五折优惠。MathForm 8B 没有价目表;它的成本就是你给它配的那块 GPU。
• 速度 — Solar Mini 4 在 Artificial Analysis 测试框架上每秒输出 204 个 token,每个索引任务输出 88,300 个 token,每个任务约需 430 秒的工作量。MathForm 8B 的输出是一个 Lean 4 定理头,最多几百个 token。
• 其数字的独立性 — Solar Mini 4 已由第三方运行过。MathForm 8B 则没有:其论文中的每一个数字都出自作者本人,而且该模型太新、太专精,尚未吸引到独立运行。
两个模型在何处交汇,又在何处不交汇

这些失效模式正是让这一组合变得有趣的原因,因为它们恰好完全相反。Solar Mini 4 已公布的最差结果是 Terminal-Bench 4.0 上的 1%,以及 AutomationBench-AA 上的 22.3%——它不擅长在会给予反馈的环境中验证自己的工作。MathForm 8B 的整个设计前提就是验证:OpenBMB 区分了 Syntax Check 与 Consistency Check,前者问的是 Lean 4 语句能否通过编译,后者问的是它所编译出的语句是否真的与非形式化问题含义相同。它旨在防止的典型失败,是一种语句虽能通过类型检查,却在不知不觉中弱化了断言。
这是一个真实的区别,值得精确对待。一个生成证明的推理模型有一个众所周知的自我验证问题:生成过程中没有任何东西能告诉你答案是否正确。而编译器可以。如果你的工作流是“把一个题库转换成机器可以检查的东西”,那么 MathForm 8B 正在做 Solar Mini 4 完全做不了的那一半工作,而剩下的部分并不是程度问题。
厂商标称的数据,已按此标注:OpenBMB 的论文报告,在六个基准上,Syntax Check 下平均 Pass@8 为 88.06%,Consistency Check 下为 72.37%,并声称这些成绩超过若干专门的 32B 自动形式化器。其中没有任何一项得到第三方复现。两次检查之间 16 个百分点的下降是更具信息量的数字——它衡量的是,编译出的陈述在多大频率上并不完全是你所询问的那个问题,而这也是 Consistency Check 作为单独一列存在的原因。
为什么团队会同时运行两者
因为自然流水线有一个廉价、高吞吐的阶段,以及一个昂贵、低吞吐的阶段。MathForm 8B 在你自己的硬件上运行,把非正式问题转换成 Lean 4 头部,并有编译器可在人类看到之前拒绝糟糕的输出。Solar Mini 4 处理围绕这一环节发生的事情:阅读支撑论文、提取假设、用韩语或英语总结结果,并为工作安排路由。这两者从不会竞争同一个请求,而较小的那个负责工作中具有客观通过/失败信号的那部分。
这两款模型都不是我们能为你路由的——Upstage 的模型不在 OrcaRouter 上,OpenBMB 的也不在——所以如果你想要 Solar Mini 4,它得来自 Upstage 自家的 API;而如果你想要 MathForm 8B,它得来自 Hugging Face 和你自己的 GPU。我们能做的是把这条流水线的其余部分都放在一个密钥之后:超过 200 个模型,相较提供商标价零加价、跨提供商的自动故障转移,以及一套路由 DSL,让你能把多个模型串联成单次调用。在这样一种工作流里——小型专用模型负责形式化步骤,大型通用模型负责围绕它的一切——能够通过改一个模型字符串来更换通用模型,而不是发布一套新的集成,这就是两周的改动和一个下午之间的差别。

要点总结
如果你的问题是“这些里我该用哪一个”,诚实的答案是:这取决于你需要的是一个答案,还是一种形式化,而没有任何基准测试能给出定论。如果你的问题是“MathForm 8B 值不值得下载”,答案是:对一项很窄的任务来说值得,对其他任何用途都不值得——它是形式化器,不是证明器,而它产出的结果中,证明义务仍然未决。如果你的问题是“Solar Mini 4 每个任务 0.36 美元值不值”,答案是:对大批量长文档来说值得,对任何需要它检查自身工作的用途来说都不值得。

关于信息来源,最后补充一点。上面每一个 Solar Mini 4 的数字,除上下文窗口外,都是 Artificial Analysis 的独立测量结果;而上下文窗口是 Upstage 自己给出的数字,与他们的结果不一致。MathForm 8B 的每一个数字都来自 arXiv 2608.14221 的厂商自报数据,且未经复现,其发布也未作任何预告——权重、FormalVerse 数据集和论文都在 2026 年 8 月 14 日同时出现,既没有厂商博客文章,迄今为止也没有任何独立基准测试运行。
