
TwIL-LM3-Pro対MathForm 8B:言明と含意は形式化の両輪である
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
TwIL-LM3-ProとMathForm-8Bは、同じ広範な問題——機械にもっともらしい散文ではなく、形式的で検証可能なテキストを生成させること——を目指しており、両者はその異なる半分ずつを解いている。MathForm-8BはOpenBMBの80億パラメータの自動形式化ツールで、2026年8月に公開された。平易な言葉で書かれた数学の問題を与えると、その問題のLean 4のステートメントを出力し、証明の義務はコンパイラが検証できるよう開いたままにする。TwIL-LM3-ProはwebAIの36.6億パラメータの形式論理モデルで、2026年9月のものであり、その対象となる出力は含意ラベル、一階述語論理への翻訳、意味解析、そしてLeanの証明に対する批評である。一方は検証されるべきものを生み出す。もう一方は、手元にあるものが自分の主張する内容を含意しているかどうかを教えてくれる。
両者がたった一つの領域——Leanによる形式化——でだけ重なっているため、比較ページは魅力的だが誤解を招く。より有用な問いは、それぞれが何に対して報酬を得るよう訓練されたかである。というのも、報酬シグナルこそ、二つの設計が最も鋭く分岐する点であり、より賢い選択が実際に宿る場所だからだ。
陳述 対 含意
MathForm-8B は、OpenBMB の論文が約 367,000 件の検証済み例と説明する Lean 4 コーパス FormalVerse で、教師ありファインチューニングとそれに続く強化学習を通じて訓練されている。それを取り巻くパイプラインは、生成前に Mathlib から関連する定義と既存の形式化を取得し、その後、コンパイラ診断と意味的一貫性チェックを用いて改善する。その出力は — インポート、型、定理ヘッダー — という形式的な文であり、外部コンパイラがそれを受け入れるか拒否する。モデルカードは、それが問題を解くものではなく、解くと主張するものでもないことを明言している。証明は他の誰かの仕事である。
TwIL-LM3-Proは論理の側から同じ領域に取り組む。そのパイプラインは6つの目的を目指していた:一階述語論理翻訳、含意ラベリング、意味解析、Lean形式化、Lean証明批評、規則帰納。MathFormが文を出力するように作られているのに対し、TwIL-LM3-Proは文について判断を下すように作られている——これは含意されるか、この解析は正しいか、この証明の試みは健全か。また形式化も行い、それこそが両モデルが単に隣接しているだけでなく真に比較可能である唯一の点だ。
コンパイラからの報酬 対 スコアラーからの報酬
これこそが重要な設計上の違いであり、両ベンダーともこれを文書化しています。
MathFormの学習報酬は、Leanのコンパイルと意味的一貫性フィードバックから得られていた。コンパイラは神託である。形式化を受け入れるか、受け入れないかのどちらかで、部分点はなく、議論の余地もない。それは機械学習のこの分野において最もクリーンな報酬信号であり、自動形式化ベンチマークが合格率として報告される理由でもある――その指標は、誰が何を信じていようと気にしないプログラムの下流にあるのだ。
TwIL-LM3-Proの最終段階は、プログラム検証器に対するエントロピー重み付きGRPO実行であり、モデル自身のカードには、緩い一致に対する部分点とtoken-F1が記載され、すべてが失敗したプロンプト群でも勾配を生み出せるようになっていた。その主要なマクロゲートは、4つの有界な分類レーンとルール帰納の等重み平均であり、そのゲートでは、多肢選択レーンと手続きレーンが `max(exact_match, loose_match)` として評価される — カードが明白に述べている規則である。なぜなら、異なる形式でフォーマットされた正解は、推論の失敗ではなくフォーマット上のアーティファクトだからである。
どちらの設計も劣っているわけではない。両者は異なる帰結に合わせて調整されている。コンパイラで採点される報酬は、難しい形式化問題を指し示してその出力を信頼できるモデルを生む。なぜなら出力が検証可能だからだ。部分点付きの採点器評価の報酬は、より曖昧な判断——含意、批評、規則帰納——で訓練できるモデルを生む。そこでは裁定するコンパイラが存在せず、代わりにそうした領域で訓練しないという選択肢しかないからだ。代償は、得られる数値がハーネスの良し悪しにしか依存しないことだ、とwebAIは言う。ゆるい一致の加点のあらゆる痕跡を取り除いたそのstrict-7の行は、読者が見出しの数値と並べてより厳しい数値を見られるようにするためにまさに存在している。
スコアは同じ物差しで測られていない
両モデルはLean関連の数値を公開しているが、それらを減算することはできない。MathFormの論文は、6つのLeanベンチマークにわたって、Syntax Checkでは平均Pass@8が88.06%、Consistency Checkでは72.37%であると報告し、より難しいFATE-HおよびFATE-XサブセットではConsistency Checkの合格率がそれぞれ63%と37%であり、いくつかの特化した32B自動形式化器を上回ると主張している。TwIL-LM3-Proのカードは、独自のTrack Aハーネス上で`lean_formalize`のtoken-F1が0.5092、`lean_critic`の精度が0.7950であると報告している。
コンパイラチェック下のPass@8と、参照文字列に対するtoken-F1は、異なるものを測定している。Pass@8はモデルに8回の試行を与え、そのうち1つがコンパイルされ、一貫性を保ったかどうかを問う。token-F1は、単一の生成が参照にどれだけ近く一致したかを採点する。モデルは一方では高得点を取り、他方では低得点になることがあり、どちらの文書にも、両者を並べて読むことを正当化するものは何もない。
ベンチマーク記録の正直な要約はこうだ。MathForm-8B の根拠はコンパイラを介在させた論文から得られており、TwIL-LM3-Pro の根拠はスコアラーを介在させたベンダー製ハーネスから得られている。そして、第三者が両方を同一のルーブリックに通したことはない。「88.06%」を「0.5092」の隣に、あたかもスコア行であるかのように並べているページは、定義を読んでいないページとして扱え。
仕様を並べて比較
• パラメータ — TwIL-LM3-Pro 3.66B dense 対 MathForm-8B 8B、サイズはおよそ2.2倍。
• ベースモデル — `ibm-granite/granite-4.2-3b` 対 `Qwen/Qwen3-8B`。
• トレーニングデータ — FormalVerse に対する6つの目的を網羅する合成形式論理コーパス、約367,000件の検証済み Lean 4 例。
• 報酬 — 部分点と緩いマッチング許容を備えたプログラムによる検証器 対 Lean のコンパイルと意味的一貫性のフィードバック。
• 主要な出力 — 含意ラベル、FOL 翻訳、意味解析、Lean ステートメント、およびコンパイラがチェックするための Lean 4 ステートメントに対する証明批評。
• コンテキストウィンドウ — TwIL-LM3-Proでは131,072トークン、8,192トークン以内で測定;MathForm-8Bは、自身の使用例で最大16,384トークンの生成バジェットで提供されます。
• ライセンス — webAI Non-Commercial License ver. 1.0 対 Apache 2.0
• 量子化フットプリント — TwIL-LM3-Pro は CPU または 4 GB の VRAM 向けに 2.09 GiB の Q4_K_M GGUF を提供します。MathForm-8B は自身のリポジトリで GGUF を公開していません。
ライセンスが再び生産の問題を決定する
MathForm-8はApache 2.0です。微調整、再配布、商用製品内での提供が可能です。TwIL-LM3-Proは非商用です。研究および個人利用は許可されていますが、収益を生み出す形での導入にはwebAIとの個別契約が必要です。webAIの商用ルートは、公開された料金表ではなく、エンタープライズ向けの取り決めです。
研究者グループや学生にとって、その違いは問題にならない——どちらも Hugging Face でゲートなしにダウンロードできるからだ。企業にとっては、それは決定的であり、どちらのベンダーも同じようには測定していない領域でどちらのモデルが高いスコアを出すかに関係なく、実運用の自動形式化のあらゆる作業において MathForm-8B を指し示している。
このパイプラインでルーターがどこに位置するか
TwIL-LM3-Pro も MathForm-8B も OrcaRouter のカタログにあるルートではなく、理由もそれぞれ異なる。一方は非商用ライセンスでホスト型エンドポイントがなく、もう一方はセルフホスティング用のオープンチェックポイントとして公開されている。形式化パイプラインにおけるルーティングの問いは、それらを囲む層にある。FormalVerse 風のコーパスを構築するとは、何千もの非形式的な問題を生成し、それらを整形式性でフィルタリングし、出力を採点する意味的一貫性チェックを書くことを意味する — すべてテキスト呼び出しであり、すべて大量データを生成するモデルを、二つ目の契約なしにそれを評価するモデルへ差し替えたくなる種類の作業である。そのプロバイダー表示価格に0%のマークアップを加えた、200以上のモデルの前段に置かれた1つのOpenAI互換エンドポイントでは、その差し替えは設定変更であり、生成モデルのベンダー価格引き下げは同じ日に反映される。自動フェイルオーバーがコーパス構築で要となるのは、まさに、生成パスの3分の2で失敗するジョブが実行全体を無駄にするからである。

分業
教科書の数学を大規模にコンパイル可能なLean文へと変換するのが仕事で、その成果を商用製品として出荷しなければならないなら、MathForm-8Bがそのツールであり、Apache 2.0ライセンスがその理由だ。テキストの一まとまりがある主張を含意するかどうかの判断、含意のラベリング、意味論の解析、あるいは証明の試みの批評が仕事なら、TwIL-LM3-ProはMathFormが決して対象としてこなかった領域をカバーしている——そしてその非商用ライセンスは、その能力をどこで使えるかに関する境界であり、能力そのものに対するマイナス評価ではない。
理にかなっているのは、選択というより二段階のパイプラインだ。一方のモデルが形式的な文を出力し、もう一方がそれを判定する。両者は、自分たちを生み出したパイプラインを公開している。これはこの規模では異例であり、そもそもこの比較が可能になった理由でもある。


