生成されたヒーロータイトルカード。タイトルは「Solar Mini 4 vs MathForm 8B」、サブタイトルは「一方は問いに答える。もう一方はそれを検証可能にする」、2つのバッジは「汎用モデル 対 自動形式化ツール」と「ループ内での Lean 4 コンパイル」。
Guides & Insights

Solar Mini 4 vs MathForm 8B:一方のモデルは問いに答え、もう一方はそれを検証可能にする

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Solar Mini 4 を MathForm 8B の隣に置けば、同じトークンを奪い合わない2つのモデルを比較することになる。Solar Mini 4 は Upstage の350億パラメータのスパースなMixture-of-Expertsで、2026年9月22日に公開され、トークンあたり約30億パラメータが活性化する。そして質問に答える。長い文書を読み、それについて推論し、文章による結果を返す。MathForm 8B は OpenBMB の80億パラメータの自動形式化器で、2026年8月14日に Apache 2.0 のもとで公開された。そして、推論モデルがまったくしないことをする — 自然言語の数学的命題を受け取り、証明支援系のコンパイラが型チェックする Lean 4 の定理へと書き換える。一方は答えを生み出す。もう一方は機械的に検証可能な問いを生み出す。そして後者のほうがより希少な存在だ。

それでもこの比較には価値がある。なぜなら、両者は最終的に同じ種類のパイプラインに行き着くからであり、また両者の強みが正反対で、そのために選択が異例なほど明確になるからだ。Upstageのモデルは長い文書に強く、難しい推論は苦手で、完了したタスクあたりのコストが高い。OpenBMBのモデルはニッチの外では役に立たないほど狭く、独立した評価者によるスコア付けはこれまで一度もされておらず、GPUさえあれば実行コストはかからない。

異なる事柄については、並べて

• 概要 — Solar Mini 4は100万トークンのコンテキスト(Upstage自身のドキュメントでは512K)を備えた汎用推論モデルで、Artificial Analysis Intelligence Indexでは24.1を計測しています。MathForm 8Bは単一タスクの自動形式化ツールであり、公開されたインデックススコアも、独立した評価も、汎用能力に関する主張もありません。

• パラメータ — Solar Mini 4向けは疎(スパース)で総計35B/アクティブ3B、MathForm 8Bは8.19Bの密(デンス)で、OpenBMBのFormalVerseコーパス(約367,000件の検証済みLean 4サンプル)を用いてQwen3-8Bからファインチューニングされています。

• ライセンスと提供方法 — Solar Mini 4 はプロプライエタリで、Upstage の API およびサードパーティのプラットフォームを通じて利用できます。MathForm 8B は Apache-2.0 の重みで、チャットテンプレート、4 つの safetensors シャード、そして OpenAI 互換エンドポイントを介した Transformers、vLLM、または SGLang でのデプロイ経路を備えています。

• 価格 — Solar Mini 4は100万トークンあたり$0.10/キャッシュ$0.01/$0.40、現在2026年10月22日まで50%オフ。MathForm 8Bには料金表がなく、そのコストは自分で用意するGPUそのものだ。

• 速度 — Artificial Analysisのハーネス上で、Solar Mini 4は毎秒204出力トークン、インデックスタスクあたり88,300出力トークン、1タスクあたり約430秒の処理時間を記録。MathForm 8Bの出力はLean 4の定理ヘッダー1つだけで、多くても数百トークン程度です。

• 数値の独立性 — Solar Mini 4は第三者によって実行されている。MathForm 8Bはそうではない。論文に載っているすべての数値は著者自身によるもので、このモデルは新しすぎ、かつ専門特化しすぎているため、独立した実行を招いていない。

二つのモデルが一致する所、そして一致しない所

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

この組み合わせを面白くしているのは失敗モードだ。なぜなら、それらは正反対だからである。Solar Mini 4 の公表されている中で最も弱い結果は Terminal-Bench 4.0 の 1% で、AutomationBench-AA は 22.3% だ。つまり、フィードバックが得られる環境で自分の作業を検証するのが苦手である。MathForm 8B の設計上の前提はすべて検証にある。OpenBMB は、Lean 4 の文がコンパイルできるかどうかを問う「Syntax Check」と、コンパイルされた文が本当に非形式的な問題と同じ意味を持つかを問う「Consistency Check」を区別している。これが防ごうとしている典型的な失敗は、型チェックは通るものの、主張をひそかに弱めてしまう文だ。

それは本物の区別であり、正確に扱う価値がある。推論モデルが証明を生成するときには、よく知られた自己検証の問題がある。生成のどこにも、その答えが正しいかどうかを教えてくれるものはない。コンパイラなら教えてくれる。あなたのワークフローが「問題バンクを、機械が検証できるものに変換する」ことなら、MathForm 8B は Solar Mini 4 にはまったくできない仕事の半分を担っており、残りは程度の問題ではない。

ベンダーが公表した数値(そのように明記されている)によると、OpenBMBの論文は6つのベンチマーク全体で、Syntaxでは平均Pass@8が88.06%、Consistency Checkでは72.37%だと報告し、それらが専門特化した複数の32B自動形式化器を上回ると主張している。そのいずれも第三者による再現はされていない。2つのチェック間の16ポイントの低下こそが示唆に富む数値だ。これは、コンパイルされた文が、尋ねた問題とは微妙に異なる頻度を測っており、Consistency Checkが別個の列として存在する理由でもある。

チームが両方を実行する理由

なぜなら、自然なパイプラインには、安価で大量処理の段階と、高コストで少量処理の段階があるからです。MathForm 8B は自分のハードウェア上で動作し、非形式的な問題を Lean 4 のヘッダーに変換します。また、人間が見る前に不適切な出力を拒否できるコンパイラが利用可能です。Solar Mini 4 はその周辺で起こることを処理します。つまり、裏付けとなる論文を読み、前提を抽出し、結果を韓国語または英語で要約し、作業を振り分けます。この2つが同じリクエストを巡って競合することはなく、客観的な合否シグナルを伴う仕事の部分を担うのは、より小さい方です。

どちらのモデルも、当社がお客様にルーティングできるものではありません — UpstageのモデルはOrcaRouter上にありませんし、OpenBMBのモデルも同様です — ですからSolar Mini 4が必要ならUpstage独自のAPIから、MathForm 8Bが必要ならHugging Faceとお客様自身のGPUから取得することになります。当社にできるのは、そのパイプラインの残りの部分を1つのキーの背後に置くことです:プロバイダの定価に対するマークアップ0%で200以上のモデル、プロバイダ間の自動フェイルオーバー、そしてモデルを単一の呼び出しに連結できるルーティングDSL。小規模な専門モデルが形式化のステップを担い、大規模な汎用モデルがその周辺のすべてを担うワークフローにおいて、新しい統合をリリースする代わりにモデル文字列を編集するだけで汎用モデルを変更できることは、2週間がかりの変更と午後ひとつの違いになります。

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

要点

もしあなたの問いが「これらのどれを使うべきか」なら、正直な答えは、必要なのが答えなのか形式化なのかによって決まり、どんなベンチマークでも決着はつかない。もしあなたの問いが「MathForm 8B はダウンロードする価値があるか」なら、答えは、狭い一つの用途にはイエス、それ以外にはノーだ — それは形式化器であって証明器ではなく、生成する出力では証明義務が未解決のまま残る。もしあなたの問いが「Solar Mini 4 は1タスクあたり$0.36の価値があるか」なら、答えは、大量の長文書にはイエス、自分自身の作業を検証する必要があるものにはノーだ。

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

出典について、最後に。上記の Solar Mini 4 の数値はすべて、コンテキストウィンドウを除き、Artificial Analysis による独立した測定値です。コンテキストウィンドウだけは Upstage 自身の数値で、Artificial Analysis の値とは食い違っています。MathForm 8B の数値はすべて、arXiv 2608.14221 によるベンダー報告であり、再現されていません。また、そのリリースは事前に告知されていませんでした — 重み、FormalVerse データセット、論文はいずれも 2026年8月14日に公開され、ベンダーのブログ投稿も、これまでのところ独立したベンチマーク実行もありません。