
AREX-2 vs MathForm-8B: 증명 검사기와 검색 루프는 서로 다른 종류의 검증이다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 507 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 194 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
MathForm-8B와 AREX-2는 이 시리즈에서 가장 엄격하게 검증 가능한 두 모델이며, 서로 반대되는 방식으로 검증된다. MathForm-8B는 OpenBMB가 2026년 8월에 공개한 80억 파라미터 자동 형식화기로, 평범한 영어로 작성된 수학 문제를 주면 그 문제에 대한 형식적으로 올바른 Lean 4 문장을 만들어내고, 이를 증명 보조기의 컴파일러가 검사한다. AREX-2는 BAAI가 2026년 9월 29일 17:56 UTC에 만든 Hugging Face 저장소로, .gitattributes 하나만 들어 있고 가중치도, 모델 카드도, 라이선스 태그도, 공지도 없다 — BAAI의 AREX 딥리서치 에이전트의 2세대일 가능성이 높은 모델을 위해 예약된 이름이며, 그 1세대는 주어진 제약 조건에 비추어 자신의 답변을 다시 검사하는 방식으로 스스로를 검증한다.
그러니까 여기서 흥미로운 질문은 어느 모델이 더 나은가가 아니다. 그것은 모델이 검증 가능하다는 것이 무엇을 뜻하는가이다. 왜냐하면 이 둘 중 하나는 누가 무엇을 믿든 상관하지 않는 컴파일러가 검사하고, 다른 하나는 그 계열의 선례가 이어진다면 같은 모델이 돌리고 있는 루프가 검사하기 때문이다. 그 구분은 대결의 한쪽이 아직 출시되지 않았는데도 유지되며, 바로 그것이 이 둘이 애초에 같은 대화에 속하는 이유다.
존재하는 측면, 그리고 그것이 검증 가능한 이유
MathForm-8B는 좁은 직무 설명을 가지고 있으며, 좁음이 핵심이라는 점 때문에 이를 정확히 말할 가치가 있습니다. 이 모델은 수학 문제를 풀지 않으며 그렇게 주장하지도 않습니다. 약 367,000개의 검증된 Lean 4 예제로 이루어진 말뭉치인 FormalVerse로 미세 조정되었고, 훈련 보상은 인간 선호 모델이 아니라 Lean 컴파일러에서 나왔습니다. 비형식적 진술이 주어지면, 컴파일러가 형식화가 비형식 문제의 내용을 제대로 담고 있는지 확인할 수 있도록, 이 모델은 임포트, 타입, 정리 헤더를 내놓고 — 증명 의무 자체는 열린 상태로 남겨 둡니다.
이 모델의 공개 수치는 모두 OpenBMB가 벤더로서 보고한 것이며 독립적으로 재현된 것은 하나도 없는데, 6개 벤치마크 전반에서 구문 검사 기준 평균 Pass@8 88.06%, 더 엄격한 일관성 검사 기준 72.37%이고, 가장 어려운 FATE-H 및 FATE-X 하위 집합에서는 63%와 37%로 떨어진다. 이 수치들을 있는 그대로 읽어라: 형식 시스템에 비추어 측정된 모델이며, 여기서 오답은 품질에 대한 이견이 아니라 컴파일 실패다. 이는 드문 특성이다. 이 블로그의 대부분 벤치마크 주장은 신뢰해야 하는 채점자에 의존하지만, 이 주장은 기계가 수행하는 산술에 의존한다.
아직 존재하지 않는 측면, 그리고 그 검증 방식이 다른 이유
AREX-2에 대해 확인 가능한 유일한 사실은 조직, 이름, 타임스탬프뿐이다. 아무것도 업로드되지 않았고 BAAI는 아무 말도 하지 않았다. 하지만 그 이름 뒤에 있는 패밀리는 실제로 존재하며, 2026년 7월 23일 AREX-Base로 출시되었다 — Qwen3.5-122B-A10B 기반의 1220억 개 파라미터 전문가 혼합 모델로, 100억 개의 활성 파라미터를 갖추고 있다 — 그리고 덴스 4B인 AREX-Turbo도 함께 출시되었다. 둘 다 Apache 2.0이며, 둘 다 채팅 모델이 아닌 에이전트이다.
AREX 설계는 두 개의 루프로 이루어진 연구 프레임워크이며, 외부 루프는 검증 단계입니다. 내부 루프는 검색과 브라우징에서 증거를 수집하고, 이를 통합하며, 신뢰도 수치를 함께 붙인 후보 답변을 생성합니다. 그런 다음 외부 루프는 그 후보를 원래 제약 조건과 대조해 확인하고, 수용할지, 개선할지, 아니면 그 궤적을 폐기하고 다시 시작할지 결정합니다. 반복 사이에 모델은 검증된 발견, 열린 후보, 미해결 제약 조건, 다음 계획으로 구성된 컨텍스트 블록을 유지하는데, 이것이 바로 긴 탐구 과정을 따라가면서 흐름을 놓치지 않게 해줍니다. BAAI는 Base의 경우 BrowseComp에서 82.5, GAIA에서 85.4, DeepSearch QA에서 89.9를, Turbo의 경우 70.7 / 81.6 / 78.5를 보고합니다 — 공급업체 자체 수치이며, 재현되지 않았습니다.
그것은 실질적이고 유용한 자기 점검 방식이다. 그것은 또한 범주적으로 컴파일러보다 약하다. AREX 외부 루프가 어떤 답이 자신의 제약 조건을 충족한다고 판단할 때, 그 판단은 제약 조건을 읽는 언어 모델에서 나온다. Lean이 MathForm-8B 형식화를 받아들일 때, 그 판단은 고정된 형식 체계를 구현하는 타입 검사기에서 나온다. 둘 중 어느 것도 오류에서 자유롭지 않다 — 형식화는 잘못된 정리를 담아낸 유효한 Lean일 수 있다 — 하지만 둘 중 오직 하나만이 아무도 알아차리지 못한 채 틀릴 수 있으며, 그 차이는 정도의 문제가 아니다.
• 이용 가능성 — MathForm-8B는 공개된 카드와 함께 OpenBMB에서 다운로드할 수 있습니다. AREX-2는 파일이 하나도 들어 있지 않은 저장소입니다.
• 매개변수 — MathForm-8B의 경우 8B dense. AREX-2의 경우 알 수 없음. 이 제품군은 122B mixture-of-experts와 dense 4B를 아우릅니다.
• 산출물 — MathForm-8B용 Lean 4 정리문으로, 증명은 설계상 열린 상태로 남겨 둡니다. AREX-2의 경우 알 수 없음; 첫 생성에서는 신뢰도 수치와 함께 조사된 답변을 산출했습니다.
• 어떻게 검증되는가 — MathForm-8B을 위한 Lean 컴파일러. 동일한 모델 내부의 검증 루프, AREX-Base의 증거에 기반한다.
• 라이선스 — MathForm-8B에 대해서는 OpenBMB 자체 약관이 적용되며, AREX-2에 대해서는 아직 공개된 내용이 없습니다. 첫 번째 AREX 세대는 Apache 2.0이었습니다.
• 주요 수치 — MathForm-8B의 경우 구문 검사 88.06%, 일관성 검사 72.37%의 Pass@8이며, 이는 벤더가 보고한 수치입니다. AREX-2에 대해서는 이러한 수치가 존재하지 않습니다.


스택이 한 번에 담을 수 있는 두 개의 작업
이 모델들은 기능이 겹치지 않으며, 누군가 "versus"를 선택지로 읽기 전에 그 점을 분명히 말해 둘 가치가 있습니다. MathForm-8B는 증명 보조기의 프런트엔드입니다. 그 출력은 수학자나 자동 증명기가 이어서 작업하는 정리 진술입니다. 이 모델의 자연스러운 위치는 수학, 형식 기법, 명세 작업을 위한 검증 파이프라인 안이며, 여기서 가치는 하위 도구가 모델을 신뢰하지 않고도 출력을 활용할 수 있다는 데 있습니다.
AREX-2가 그 계열을 이어간다면, 컴파일러가 없는 질문들을 위한 백엔드다. "이 세 가지 제출 서류 중 어느 것이 나머지 둘과 일관되지 않는가"에는 대조해 확인할 형식 체계가 없고, 사용할 수 있는 유일한 방어책은 더 많은 증거를 모으고 자신의 추론을 재검토하는 것인데, 그것이 바로 AREX 외부 루프가 하는 일이다. 둘 다 필요한 팀이라면 그것들을 서로 다른 곳에서 운용할 것이다: 형식화할 수 있는 문제 부분에는 형식화를, 그럴 수 없는 부분에는 검색 및 검증 에이전트를.
그 구분은 이 중 무엇에 이번 주에 실제로 행동할 수 있는지에 대한 정직한 답이기도 합니다. MathForm-8B는 이미 출시되었고 문서화되었으며 지금 바로 사용할 수 있습니다. AREX-2는 이름일 뿐입니다.
검증이 주제일 때 라우팅 스토리는 어떻게 보이는가
두 가지가 너무 다르게 사용되기 때문에, 인프라 문제도 마찬가지로 나뉩니다.
MathForm-8B의 경우, 워크로드는 출력이 곧바로 컴파일러로 들어가는 짧고 결정적인 생성 작업이 몰려드는 형태입니다. 중요한 것은 모델에 접근할 수 있는지, 그리고 실패한 호출이 재시도되는지입니다. 요청을 누락하는 정형화 파이프라인은 실패한 정형화 파이프라인과 똑같이 보이기 때문이며, 그 둘 중 하나만이 모델 자체에 관한 사실입니다. 제공자 간 자동 장애 조치가 바로 이 둘을 구분해 주는 특정 기능입니다. OrcaRouter는 현재 MathForm-8B도 AREX-2도 취급하지 않으므로, OpenBMB 가중치는 OpenBMB 자체 배포판에서 오고 호스팅된 엔드포인트는 모두 다른 누군가의 것입니다. 우리가 제공하는 것은 앞단의 라우팅이며, 제공자 정가를 그대로 전달하고 토큰당 아무것도 더하지 않습니다.
AREX-Base와 같은 에이전트의 경우 형태가 더 어렵고 라우팅에 대한 근거가 더 강력하다. 심층 연구 궤적은 쿼리당 수십 번의 모델 호출을 수행하며, 각 호출은 증거가 축적됨에 따라 커지는 컨텍스트를 다시 읽고, 실패 모드는 복합적으로 발생한다: 25단계 중 19단계에서 타임아웃되는 제공자는 답변을 저하시키지 않고, 확신에 찬 잘못된 답변을 생성한다. 그것이 루프를 뒤에 두는 것에 대한 논거이다.런타임에 결정하는 장애 조치 규칙이 있는 200개 이상의 모델을 위한 하나의 API, 따라서 단일 불량 제공자는 잘못된 인용이 아니라 재시도가 된다.
주목해야 할 한 가지, 그리고 가정해서는 안 될 한 가지
AREX-2에 관한 미해결 질문 대부분에 답이 될 세 가지 사실이 있으며, 그 세 가지는 모두 외부에서 확인할 수 있다: 해당 저장소에 파일이 나타나는지, 카드가 주장하는 파라미터 수가 얼마인지, 그리고 두 전임 모델이 그랬던 것처럼 Apache 2.0 태그를 달고 있는지다. 그때까지 AREX-2에 관해 방어할 수 있는 유일한 진술은 BAAI가 2026년 9월 29일 그 이름을 예약했고 아무것도 발표하지 않았다는 것이다.
가정해서는 안 되는 것은 2세대가 1세대의 형태를 물려받는다는 점이다. "2"는 아키텍처가 아니라 제품명이다. 그것은 122B Base보다 클 수도 있고, 같은 프레임워크를 작게 증류한 모델일 수도 있다. 그리고 이 패밀리가 이미 품질 등급과 서빙 비용 등급을 동시에 출시했다는 점을 감안하면, 두 해석 모두 그럴듯하다. 지금 이 순간 그럴듯하지 않은 것은 그것에 대한 사양을 공개하는 일이다.
