生成されたタイトルカードには「AREX-2 vs MathForm-8B — チェックされる2つの在り方」と書かれ、2つのパネルがある。左のパネルは見出しが MathForm-8B で、以下を列挙している:8B dense、2026年8月リリース、Lean 4 の定理文を書く、Lean コンパイラでチェックされる、Pass@8 88.06%(構文チェック済み)。右のパネルは見出しが AREX-2 で、以下を列挙している:リポジトリ作成日 2026年9月29日、ファイルなし、カードなし、ダウンロードも実行もするものがない、チェックすべき図が存在しない。フッターには「片方はコンパイラに採点される。もう片方にはまだ採点するものが何もない」とある。OrcaRouter のロゴが右下隅に合成されている。
Guides & Insights

AREX-2 対 MathForm-8B:証明チェッカーと探索ループは異なる種類の検証である

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

MathForm-8BとAREX-2は、このシリーズで最も厳密に検証可能な2つのモデルであり、検証の方法は正反対です。MathForm-8Bは、OpenBMBの80億パラメータの自動形式化器で、2026年8月にリリースされました。平易な英語で書かれた数学の問題を与えると、その問題の形式的に正しいLean 4の記述を生成し、それを証明支援系のコンパイラがチェックします。AREX-2は、BAAIが2026年9月29日17:56 UTCに作成したHugging Faceリポジトリで、.gitattributesを持ち、重み、モデルカード、ライセンスタグ、発表のいずれもありません — BAAIのAREXディープリサーチエージェントの第2世代と見られるもののために確保された名前で、その第1世代は、与えられた制約に対して自身の回答を再チェックすることで自己検証します。

つまり、ここで興味深い問いは、どちらのモデルが優れているかではない。モデルが検証可能であるとはどういうことか、だ。というのも、この2つのうち一方は、誰が何を信じていようと気にしないコンパイラによって検証され、もう一方は、そのファミリーの前例が成り立つなら、同じモデルが回しているループによって検証されるからだ。対決の一方がまだ出荷されていなくても、この区別は生き残る。そして、この2つがそもそも同じ会話に属するのは、まさにそのためなのだ。

存在する側、そしてそれが検証可能である理由

MathForm-8Bの役割は狭く定義されており、その狭さこそが要点なので、正確に述べておく価値がある。これは数学の問題を解くものではなく、解くと主張してもいない。約367,000件の検証済みLean 4例からなるコーパスFormalVerseでファインチューニングされ、その訓練報酬は人間の選好モデルではなくLeanコンパイラから得られた。非形式的な命題が与えられると、imports、型、定理ヘッダを出力し、証明義務そのものは未解決のままにしておく。これにより、コンパイラはその形式化が非形式的な問題の述べていた内容を述べていると確認できる。

OpenBMBがベンダーとして報告したもので、独立に再現されたものは一つもない同モデルの公表数値は、6つのベンチマーク全体で、構文チェック下の平均Pass@8が88.06%、より厳格な一貫性チェック下が72.37%であり、最も難しいFATE-HおよびFATE-Xのサブセットでは63%と37%に落ち込む。それをあるがままに読むべきだ。形式システムに対して測定されたモデルであり、誤答は品質に関する見解の相違ではなく、コンパイル失敗である。それは珍しい特性だ。このブログのほとんどのベンチマーク主張は、信頼を置かざるを得ない採点者に依拠している。これだけは、機械が実行する算術に依拠している。

まだ存在しない側、そしてその検証が異なる理由

AREX-2について確認できる唯一の事実は、組織、名称、タイムスタンプだけだ。何もアップロードされておらず、BAAIも何も発言していない。とはいえ、その名称の背後にあるファミリーは実在しており、2026年7月23日にAREX-Baseとして公開された——Qwen3.5-122B-A10Bをベースとする、総パラメータ数1220億・アクティブパラメータ数100億のMixture-of-Experts——そしてAREX-Turbo、dense型の4Bも同時に登場した。いずれもApache 2.0で、どちらもチャットモデルではなくエージェントだ。

AREXの設計は2つのループからなる研究フレームワークであり、外側のループは検証ステップである。内側のループは検索とブラウジングから証拠を集め、それを統合し、信頼度の数値を添えた候補回答を生成する。次に外側のループがその候補を元の制約と照合し、受け入れるか、洗練するか、軌跡を破棄して再開始するかを決定する。反復間で、モデルは検証済みの知見、未解決の候補、未解決の制約、次の計画からなるコンテキストブロックを維持する。これにより、長い一連の調査を筋道を失わずに追跡できる。BAAIは、BaseについてBrowseCompで82.5、GAIAで85.4、DeepSearch QAで89.9、Turboについて70.7 / 81.6 / 78.5を報告している — ベンダー自身の数値であり、再現されていない。

それは現実的で有用な自己チェックの一形態である。それはまた、コンパイラより根本的に弱い。AREXの外側ループがある答えがその制約を満たすと判断するとき、その判定は制約を読む言語モデルからもたらされる。LeanがMathForm-8Bの形式化を受け入れるとき、その判定は固定された計算体系を実装する型チェッカーからもたらされる。どちらも誤りから自由ではない——形式化は、誤った定理を捉えている有効なLeanでありうる——しかし、誰にも気づかれずに誤りうるのは片方だけであり、その違いは程度の問題ではない。

• 入手可能性 — MathForm-8B は OpenBMB から公開カード付きでダウンロードできます。AREX-2 はファイルが1つも入っていないリポジトリです。

• パラメータ — MathForm-8Bは8Bのdense。AREX-2は不明。ファミリーは122BのMixture-of-Expertsとdense 4Bにまたがる。

• 生成されるもの — MathForm-8B 向けの Lean 4 定理ステートメント。証明は設計上、未完成のまま残されます。AREX-2 については不明。最初の生成では、信頼度の数値を伴う調査に基づく回答が出力されました。

• 検証方法 — MathForm-8B 向けの Lean コンパイラ。AREX-Base のエビデンスに基づく、同一モデル内での検証ループ。

• ライセンス — MathForm-8BにはOpenBMB独自の条件が適用されます。AREX-2についてはまだ何も表明されていません。初代AREXはApache 2.0でした。

• 主要な数値 — MathForm-8B の構文チェック済み 88.06%、一貫性チェック済み 72.37% の Pass@8(ベンダー報告値)。AREX-2 については存在しません。

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset and arXiv 2608.14221, and the opening of the card describing MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement, with the note that the model is trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback.A generated card headed 'Two ways a model can be checked' with rows contrasting MathForm-8B (8B dense, shipped August 2026; emits a Lean 4 theorem statement with the proof obligation left open; checked by the Lean compiler, a type checker implementing a fixed calculus; published figures Pass@8 88.06% syntax-checked and 72.37% consistency-checked, vendor-reported, with FATE-H and FATE-X at 63% and 37%) against AREX-2 (repository created 29 Sep 2026 with no weights, card or licence tag; nothing to check yet), and a row noting the AREX-Base outer loop re-reads the agent's own answer against its constraints - a model reading a model - with BrowseComp 82.5, GAIA 85.4 and DeepSearch QA 89.9 for the 122B Base, unreproduced. A footer reads 'A compiler fails a wrong answer. A verification loop has to notice one.' The OrcaRouter logo is composited in the bottom-right corner.

スタックが同時に保持できる2つのジョブ

これらのモデルは機能が重なっておらず、誰かが「versus」を選択肢として読む前に、そう言っておく価値がある。MathForm-8B は証明支援系のフロントエンドだ。その出力は定理のステートメントであり、数学者または自動証明器が次にそれを扱う。その自然な位置づけは、数学、形式手法、仕様記述作業のための検証パイプラインの内部にあり、そこでの価値は、下流のツールがモデルを信頼することなくその出力を利用できる点にある。

AREX-2は、そのファミリーを継続するなら、コンパイラを持たない問いのためのバックエンドである。「これら3つの提出書類のうち、どれが他の2つと矛盾しているか」には、それと照合する形式体系が存在せず、利用できる唯一の防御策は、より多くの証拠を集め、自分の推論を再検討することであり、それがAREXのアウターループである。両方を必要とするチームは、それらを別々の場所で実行するだろう。問題の形式化できる部分には形式化を、できない部分には探索検証エージェントを。

その分け方は、今週どちらを実行に移せるかという問いへの正直な答えでもある。MathForm-8B はリリース済みで、ドキュメントも整い、今すぐ使える。AREX-2 はただの名前だ。

検証が主題のとき、ルーティングの話はどう見えるか

この二つは使われ方が大きく異なるため、インフラに関する問いもまた分裂する。

MathForm-8B にとって、ワークロードは短く決定論的な生成のバーストであり、その出力はそのままコンパイラへ送られる。重要なのは、モデルに到達できることと、失敗した呼び出しが再試行されることだ。なぜなら、リクエストを取りこぼす形式化パイプラインは、失敗した形式化パイプラインと見分けがつかず、そのうち片方だけがモデルに関する事実だからである。プロバイダ間の自動フェイルオーバーこそが、その二つを区別し続ける具体的な機能だ。OrcaRouter は現在 MathForm-8B も AREX-2 も扱っていないため、OpenBMB の重みは OpenBMB 自身の配布物から取得され、ホストされたエンドポイントは他社のものである。私たちが提供するのは手前のルーティングであり、プロバイダの定価をそのまま通し、トークンごとの追加料金はない。

AREX-Base のようなエージェントでは、その形はより難しく、ルーティングを採用する根拠はより強い。ディープリサーチのトラジェクトリでは、クエリごとに数十回のモデル呼び出しが行われ、その一つ一つが、証拠が蓄積するにつれて大きくなるコンテキストを読み直す。そして、障害モードは複合する。25ステップ中19ステップ目でタイムアウトするプロバイダーは、回答を劣化させるのではなく、自信に満ちた誤った回答を生成する。それが、ループを200以上のモデルに対応し、実行時に判断するフェイルオーバールールを備えた単一のAPIの背後に置くべき根拠である。そうすれば、1つの不良プロバイダーは、誤った引用ではなく再試行になる。

注意すべき唯一のこと、そして前提にしてはならない唯一のこと

AREX-2に関する未解決の疑問の大半は、3つの事実によって答えが出る。しかもその3つはすべて外部から確認できる。すなわち、そのリポジトリにファイルが現れるかどうか、カードが主張するパラメータ数はいくつか、そして前身2つがそうだったようにApache 2.0タグを帯びているかどうかだ。それらが確認できるまでは、AREX-2について擁護できる唯一の記述は、BAAIが2026年9月29日にこの名称を確保し、それ以降何も発表していないというものだ。

想定してはならないのは、第二世代が第一世代の形を受け継ぐということだ。「2」は製品名であり、アーキテクチャではない。それは122B Baseより大きいかもしれないし、同じフレームワークの小さな蒸留版かもしれない——そして、このファミリーがすでに品質ティアと提供コストティアの両方を同時に投入していることを踏まえると、どちらの読み方ももっともらしい。現時点でもっともらしくないのは、それについて仕様を公開することだ。