
TwIL-LM3-Pro vs MathForm 8B: 진술과 함의는 형식화의 서로 다른 두 반쪽이다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
TwIL-LM3-Pro와 MathForm-8B는 같은 광범위한 문제, 즉 기계가 그럴듯한 산문이 아니라 형식적이고 검증 가능한 텍스트를 생성하도록 만드는 문제를 겨냥하고 있으며, 그 문제의 서로 다른 절반을 각각 해결하고 있습니다. MathForm-8B는 2026년 8월에 공개된 OpenBMB의 80억 매개변수 자동 형식화 모델로, 자연어로 된 수학 문제가 주어지면 그 문제의 Lean 4 정리를 출력하고 증명 의무는 컴파일러가 검사하도록 남겨 둡니다. TwIL-LM3-Pro는 2026년 9월에 나온 webAI의 36.6억 매개변수 형식 논리 모델이며, 함의 레이블, 일차 논리 변환, 의미 분석, Lean 증명 비평을 목표 출력으로 삼습니다. 하나는 검사받아야 할 대상 자체를 만들어 내고, 다른 하나는 당신이 가진 것이 당신이 주장하는 바를 함의하는지 알려 줍니다.
두 가지가 정확히 한 영역, 즉 Lean 형식화에서만 겹치기 때문에 비교 페이지는 솔깃하지만 오해를 부른다. 더 유용한 질문은 각각이 무엇에 대해 보상을 받도록 훈련되었는가이다. 왜냐하면 보상 신호야말로 두 설계가 가장 극명하게 갈라지는 지점이며, 더 현명한 선택이 실제로 자리하는 곳이기 때문이다.
진술 대 함축
MathForm-8B는 OpenBMB 논문에서 약 367,000개의 검증된 예제로 설명하는 Lean 4 코퍼스인 FormalVerse로 학습되었으며, 지도 미세 조정 후 강화 학습을 거칩니다. 이를 둘러싼 파이프라인은 생성 전에 Mathlib에서 관련 정의와 기존 형식화를 검색한 다음, 컴파일러 진단과 의미 일관성 검사를 사용해 개선합니다. 그 출력은 형식 명제 — 임포트, 타입, 정리 헤더 — 이며, 외부 컴파일러가 이를 수용하거나 거부합니다. 모델 카드는 이 모델이 문제를 해결하지 않으며 그렇게 주장하지도 않는다고 명시합니다. 증명은 다른 누군가의 몫입니다.
TwIL-LM3-Pro는 논리적인 측면에서 동일한 도메인에 접근한다. 그 파이프라인은 여섯 가지 목표를 겨냥했다: 1차 논리 변환, 함의 레이블링, 의미 파싱, Lean 형식화, Lean 증명 비평, 규칙 귀납. MathForm이 진술을 산출하도록 만들어졌다면, TwIL-LM3-Pro는 진술에 대한 판단을 내리도록 만들어졌다 — 이것이 함의되는가, 이 파싱이 올바른가, 이 증명 시도가 건전한가. TwIL-LM3-Pro는 또한 형식화를 수행하는데, 바로 그 지점이 두 모델이 단지 인접한 것을 넘어 진정으로 비교 가능한 유일한 곳이다.
컴파일러로부터의 보상 대 스코어러로부터의 보상
이것이 중요한 설계상의 차이이며, 두 공급업체 모두 이를 문서화하고 있습니다.
MathForm의 학습 보상은 Lean 컴파일과 의미 일관성 피드백에서 나왔다. 컴파일러는 오라클이다. 형식화를 받아들이거나 받아들이지 않을 뿐이며, 부분 점수도 없고 논쟁할 여지도 없다. 이는 머신러닝의 이 분야에서 가장 깔끔한 보상 신호이며, 자동 형식화 벤치마크가 통과율로 보고되는 이유이기도 하다. 그 지표는 누구의 믿음도 신경 쓰지 않는 프로그램에서 나오는 결과다.
TwIL-LM3-Pro의 최종 단계는 프로그램 방식 검증기를 상대로 한 엔트로피 가중 GRPO 실행이었으며, 모델 자체의 카드에는 느슨한 일치와 token-F1에 대한 부분 점수를 설명하여 모든 것이 실패한 프롬프트 그룹도 여전히 그래디언트를 생성하도록 했다. 이 모델의 대표 매크로 게이트는 네 개의 범위 제한 분류 레인에 규칙 유도를 더한 것의 균등 가중 평균이며, 그 게이트에서 객관식 및 절차적 레인은 `max(exact_match, loose_match)`로 인정된다 — 카드가 분명히 명시하는 규칙인데, 이는 다르게 포맷된 정답이 추론 실패라기보다 포맷팅 아티팩트이기 때문이다.
어느 설계도 더 나쁘지 않다. 그것들은 서로 다른 결과를 위해 조율되어 있다. 컴파일러로 채점하는 보상은 어려운 형식화 문제를 가리켜 그 출력을 신뢰할 수 있는 모델을 만든다. 왜냐하면 그 출력은 검증 가능하기 때문이다. 부분 점수를 주는 채점자 기반 보상은 더 모호한 판단 — 함의, 비평, 규칙 귀납 — 으로 훈련될 수 있는 모델을 만든다. 이런 영역에는 판정할 컴파일러가 없고, 대안은 아예 그 영역들로 학습하지 않는 것이다. 대가는 그 결과 수치가 하네스만큼만 좋다는 점이며, webAI도 그렇게 말한다: 느슨한 매칭 점수의 흔적을 모두 제거한 strict-7 행은 바로 독자가 헤드라인 수치 옆에서 더 가혹한 수치를 볼 수 있도록 존재한다.
점수들은 같은 척도에 있지 않습니다.
두 모델 모두 Lean에 인접한 수치를 공개하지만, 이를 서로 빼서 비교할 수는 없다. MathForm의 논문은 여섯 개 Lean 벤치마크 전반에서 Syntax Check 기준 평균 Pass@8이 88.06%, Consistency Check 기준 72.37%라고 보고하며, 더 어려운 FATE-H 및 FATE-X 하위 집합에서는 일관성 검사 통과율이 각각 63%와 37%이고, 여러 특화된 32B autoformalizer보다 성능이 우수하다고 주장한다. TwIL-LM3-Pro의 카드에는 자체 Track A 하네스에서 `lean_formalize` token-F1이 0.5092, `lean_critic` 정확도가 0.7950이라고 보고되어 있다.
Pass@8은 컴파일러 검사 아래에서, 참조 문자열에 대한 token-F1은 서로 다른 것을 측정한다. Pass@8은 모델에 여덟 번의 시도를 주고 그중 하나가 컴파일되고 일관성을 유지했는지 묻는다. token-F1은 단일 생성이 참조와 얼마나 가깝게 일치했는지 점수화한다. 모델은 한쪽에서는 좋은 점수를 받고 다른 쪽에서는 나쁜 점수를 받을 수 있으며, 어느 문서도 이 둘을 나란히 놓고 읽는 것을 정당화하지 않는다.
벤치마크 기록에 대한 솔직한 요약은 이것이다. MathForm-8B의 근거는 컴파일러가 관여하는 논문에서 나오고, TwIL-LM3-Pro의 근거는 스코어러가 관여하는 벤더 하네스에서 나오며, 어느 제3자도 둘 다를 하나의 루브릭으로 평가한 적이 없다. "88.06%"를 "0.5092" 옆에 마치 하나의 점수 기록인 양 놓는 페이지는 모두 정의를 읽지 않은 페이지로 취급하라.
사양, 나란히 비교
• 파라미터 — TwIL-LM3-Pro 3.66B dense 대 MathForm-8B 8B, 대략 2.2배 크기.
• 베이스 모델 — `ibm-granite/granite-4.2-3b` vs `Qwen/Qwen3-8B`.
• 훈련 데이터 — FormalVerse와 비교해 여섯 가지 목표를 아우르는 합성 형식 논리 코퍼스, 약 367,000개의 검증된 Lean 4 예제.
• 보상 — 부분 점수와 느슨한 일치 허용을 갖춘 프로그래밍 방식 검증기 vs Lean 컴파일 및 의미 일관성 피드백.
• 주요 출력 — 함의 레이블, FOL 번역, 의미 분석, Lean 문장 및 증명 비평, 그리고 컴파일러가 검사할 Lean 4 문장.
• 컨텍스트 윈도우 — TwIL-LM3-Pro의 경우 131,072 토큰이며, 8,192 토큰 이내에서 측정되었습니다; MathForm-8B는 자체 사용 예시에서 최대 16,384 토큰의 생성 예산으로 제공됩니다.
• 라이선스 — webAI Non-Commercial License ver. 1.0 vs Apache 2.0.
• 양자화된 풋프린트 — TwIL-LM3-Pro는 CPU 또는 4GB VRAM용 2.09GiB Q4_K_M GGUF를 제공합니다; MathForm-8B는 자체 저장소에 GGUF를 게시하지 않습니다.
라이선스가 다시 생산 문제를 결정한다
MathForm-8B는 Apache 2.0입니다. 파인튜닝하고 재배포하며 상업용 제품 내에서 서비스할 수 있습니다. TwIL-LM3-Pro는 비상업적입니다: 연구 및 개인적 사용은 허용되며, 수익을 창출하는 배포에는 webAI와 별도 계약이 필요합니다. webAI의 상업적 경로는 공개된 요금표가 아니라 기업용 계약 방식입니다.
연구 그룹이나 학생에게 그 차이는 중요하지 않습니다 — 둘 다 Hugging Face에서 제한 없이 다운로드할 수 있으니까요. 기업에게는 이 차이가 결정적이며, 이는 두 공급업체가 같은 방식으로 측정하지 않은 영역에서 어느 모델이 더 나은 점수를 받든 관계없이 모든 프로덕션 자동 형식화 작업에 MathForm-8B를 가리킵니다.
이 파이프라인에서 라우터가 위치하는 곳
TwIL-LM3-Pro도 MathForm-8B도 OrcaRouter 카탈로그의 라우트가 아니며, 그 이유는 서로 다릅니다: 하나는 호스팅 엔드포인트가 없는 비상업적 라이선스이고, 다른 하나는 셀프 호스팅용 오픈 체크포인트로 공개되어 있습니다. 형식화 파이프라인에서의 라우팅 문제는 그들을 둘러싼 계층입니다. FormalVerse 스타일 코퍼스를 구축한다는 것은 수천 개의 비형식 문제를 생성하고, 그것들의 정형성을 필터링하며, 출력을 채점하는 의미 일관성 검사를 작성하는 것을 의미합니다 — 모두 텍스트 호출이고, 모두 두 번째 계약 없이 대량 데이터를 생성하는 모델을 그것을 판별하는 모델로 교체하고 싶은 종류의 작업입니다. 공급자 정가에 0% 마크업이 추가된, 200개 이상의 모델 앞에 있는 하나의 OpenAI 호환 엔드포인트에서, 그 교체는 구성 변경이며, 생성 모델에 대한 공급업체 가격 인하는 같은 날 적용됩니다. 자동 장애 조치는 코퍼스 구축에서 특히 핵심적인데, 그 이유는 생성 패스의 3분의 2 지점에서 죽는 작업이 전체 실행을 통째로 날려버리기 때문입니다.

분업
교과서 수학을 대규모로 컴파일 가능한 Lean 문장으로 바꾸는 일이 작업이고, 그 결과가 상용 제품에 포함되어 출시되어야 한다면, MathForm-8B가 바로 그 도구이며 Apache 2.0 라이선스가 그 이유다. 텍스트 본문이 어떤 주장을 함의하는지 판단하거나, 함의를 라벨링하거나, 의미를 파싱하거나, 증명 시도를 비판하는 일이라면, TwIL-LM3-Pro는 MathForm이 애초에 겨냥한 적 없는 영역을 다룬다 — 그리고 그 비상업적 라이선스는 해당 능력을 어디에 사용할 수 있는지에 대한 경계일 뿐, 그 능력 자체에 대한 결점은 아니다.
말이 되는 조합은 선택이라기보다 2단계 파이프라인이다: 한 모델이 형식 진술을 내놓고, 다른 모델이 그것을 판정한다. 둘 다 자신들을 만들어낸 파이프라인을 공개했는데, 이는 이 규모에서는 이례적이며 이 비교가 애초에 가능한 이유다.


