
Solar Mini 4 對決 MathForm 8B:一個模型回答問題,另一個讓答案可被檢驗
- openai新OpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 每百萬 tokens
- anthropic新Anthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 每百萬 tokens · 159 tok/s
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 220 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
把 Solar Mini 4 和 MathForm 8B 放在一起,你比較的是兩個並非爭奪同一種 token 的模型。Solar Mini 4 是 Upstage 的 350 億參數稀疏混合專家模型,於 2026 年 9 月 22 日發布,每個 token 約有 30 億個參數處於活躍狀態,它負責回答問題:讀取長篇文件、對其進行推理、回傳書面結果。MathForm 8B 是 OpenBMB 的 80 億參數自動形式化器,於 2026 年 8 月 14 日以 Apache 2.0 授權發布,它做的是任何推理模型都完全不會做的事——它會接收自然語言數學陳述,並將其改寫成一個能讓證明助理的編譯器進行型別檢查的 Lean 4 定理。一個產出答案。另一個產出可讓機器檢查的問題,而後者是更稀有的商品。
無論如何,這個比較都值得做,因為兩者最終都會進入同一種管線,也因為雙方的優勢恰好相反,使得這個選擇格外乾淨俐落。Upstage 的模型擅長處理長文件,在艱澀推理上卻很弱,而且每完成一項任務的成本高昂。OpenBMB 的模型則狹窄到在自己的利基之外毫無用處,從未經任何獨立評估者評分,而且只要你有 GPU,執行起來不花一毛錢。
並排對照,針對不同之處
• 這是什麼 — Solar Mini 4 是一款通用推理模型,具備 1M token 的上下文(依 Upstage 自家文件為 512K),且在 Artificial Analysis Intelligence Index 上實測為 24.1。Form 8B 則是單一任務的自動形式化工具,沒有公開的指數分數、沒有獨立評估,也沒有任何通用能力的宣稱。
• 參數 — Solar Mini 4 為 35B 總參數/3B 啟用參數的稀疏模型;MathForm 8B 為 8.19B 稠密模型,以 Qwen3-8B 為基礎,在 OpenBMB 的 FormalVerse 語料庫上微調而成,該語料庫包含約 367,000 個經驗證的 Lean 4 範例。
• 授權與交付 — Solar Mini 4 為專有模型,可透過 Upstage 的 API 及第三方平台取得。MathForm 8B 是 Apache-2.0 授權的權重,附帶聊天範本、四個 safetensors 分片,以及位於 OpenAI 相容端點後方的 Transformers、vLLM 或 SGLang 部署路徑。
• 價格 — Solar Mini 4 每百萬 token 為 $0.10/快取 $0.01/$0.40,即日起至 2026 年 10 月 22 日止享五折優惠。MathForm 8B 沒有價目表;它的成本就是你替它準備的那張 GPU。
• 速度 —— Solar Mini 4 在 Artificial Analysis 的測試框架上每秒可輸出 204 個 token,每個索引任務輸出 88,300 個 token,而每個任務約需 430 秒的作業時間。MathForm 8B 的輸出則是一個 Lean 4 定理標頭,最多只有數百個 token。
• 其數據的獨立性——Solar Mini 4 已由第三方測試過。MathForm 8B 則沒有:其論文中的每一項數據都是作者自行得出的,而該模型太新、也太專門,尚未吸引到獨立測試。
兩個模型交會之處,以及它們不相交之處

失敗模式正是讓這個組合變得有趣的原因,因為它們是完全相反的。Solar Mini 4 已發表的最弱結果是 Terminal-Bench 4.0 的 1%,以及 AutomationBench-AA 的 22.3%——它在一個會給予回饋的環境中,不擅長驗證自己的工作。MathForm 8B 的整個設計前提就是驗證:OpenBMB 區分了語法檢查(Syntax Check)與一致性檢查(Consistency Check),前者詢問 Lean 4 陳述是否能夠編譯,後者則詢問它所編譯出的陳述是否真的與非正式問題意思相同。它存在所要防止的典型失敗,是一種能夠通過型別檢查、卻悄悄弱化了主張的陳述。
那是一個真實的區別,而且值得精確看待。一個產生證明的推理模型有一個眾所皆知的自我驗證問題:生成過程中沒有任何東西能告訴你答案是否正確。編譯器則可以。如果你的工作流程是「把題庫轉換成機器可以檢查的東西」,MathForm 8B 正在做的是 Solar Mini 4 完全做不到的那一半工作,而剩下的部分並不是程度問題。
廠商自己提供的數字,且已清楚標示為廠商數據:OpenBMB 的論文報告指出,在六項基準測試中,Syntax Check 下的平均 Pass@8 為 88.06%,Consistency Check 下則為 72.37%,並聲稱這些數字勝過數款專門的 32B 自動形式化工具。這些結果沒有任何一項經過第三方重現。兩項檢查之間那 16 個百分點的落差,才是更有參考價值的數字——它衡量的是編譯後的陳述有多少時候並不完全是你要問的那個問題,而這正是 Consistency Check 之所以獨立成一欄的原因。
為什麼團隊會同時執行兩者
因為自然流程有一個便宜、高產量的階段,以及一個昂貴、低產量的階段。MathForm 8B 在你自己的硬體上運行,將非正式問題轉換成 Lean 4 標頭,並有編譯器可在人類看到之前拒絕不良輸出。Solar Mini 4 則處理圍繞這件事發生的工作:閱讀輔助論文、擷取假設、以韓文或英文摘要結果,以及分派工作。這兩者永遠不會競爭同一個請求,而較小者負責的是工作中具有客觀通過/失敗訊號的那一部分。
這兩款模型都不是我們能替你路由的——Upstage 的模型不在 OrcaRouter 上,OpenBMB 的也不在——所以如果你想要 Solar Mini 4,它來自 Upstage 自家的 API;如果你想要 MathForm 8B,它則來自 Hugging Face 和你自己的 GPU。我們能做的是把那條流程的其餘部分收攏到一把金鑰後面:超過 200 款模型,以供應商定價零加成、跨供應商自動容錯移轉,以及一套路由 DSL,讓你將模型串接成單次呼叫。在一個由小型專家模型負責形式化步驟、大型通用模型處理其周遭一切的工作流程中,能夠透過編輯模型字串來更換通用模型——而不是發布新的整合——就是兩週的變更與一個下午之間的差別。

重點摘要
如果你的問題是「這些之中我該用哪一個」,誠實的答案是:這取決於你需要的是答案還是形式化,而沒有哪個基準測試能決定這件事。如果你的問題是「MathForm 8B 值不值得下載」,答案是:對某一項狹窄的工作來說值得,對其他任何用途則不值得——它是形式化工具,不是證明器,而它產出的內容中,證明義務仍懸而未決。如果你的問題是「Solar Mini 4 每項任務 0.36 美元值不值得」,答案是:對大量處理長文件來說值得,對任何需要它檢查自身工作的用途則不值得。

關於來源,最後說明。上述每一個 Solar Mini 4 的數字,除了上下文視窗之外,都是 Artificial Analysis 的獨立測量結果;而上下文視窗是 Upstage 自家提供的數字,且與他們的數字不一致。MathForm 8B 的每一項數字都是廠商依 arXiv 2608.14221 自行回報,且未經重現,其發布也未經公告——權重、FormalVerse 資料集與論文都在 2026 年 8 月 14 日同時出現,沒有廠商部落格文章,至今也沒有任何獨立基準測試。
