
Solar Mini 4 vs MathForm 8B: 한 모델은 질문에 답하고, 다른 모델은 답을 검증 가능하게 만든다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 100만 토큰당
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 100만 토큰당 · 159 tok/s
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 220 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Solar Mini 4를 MathForm 8B 옆에 놓고 보면, 같은 토큰을 두고 경쟁하지 않는 두 모델을 비교하는 셈이다. Solar Mini 4는 2026년 9월 22일 공개된 Upstage의 350억 매개변수 희소 전문가 혼합(MoE) 모델로, 토큰당 약 30억 개 매개변수가 활성화되며 질문에 답한다. 긴 문서를 읽고, 그 위에서 추론한 뒤, 서면 결과를 반환하는 식이다. MathForm 8B는 2026년 8월 14일 Apache 2.0으로 공개된 OpenBMB의 80억 매개변수 자동 정형화기로, 어떤 추론 모델도 전혀 하지 않는 일을 한다. 자연어 수학 명제를 받아 증명 보조기의 컴파일러가 타입 검사할 수 있는 Lean 4 정리로 다시 쓴다. 하나는 답을 만들어낸다. 다른 하나는 기계가 검증할 수 있는 질문을 만들어내며, 후자가 더 희귀한 자원이다.
어차피 둘 다 같은 종류의 파이프라인에 결국 들어가게 되고, 두 모델이 서로 상반된 강점을 지녀서 선택이 유난히 깔끔해지기 때문에 이 비교는 해볼 가치가 있다. Upstage의 모델은 긴 문서에 강하고 어려운 추론에는 약하며, 완료된 작업당 비용이 비싸다. OpenBMB의 모델은 틈새 분야 밖에서는 쓸모없을 정도로 좁고, 독립 평가자에게 점수를 받은 적이 전혀 없으며, GPU만 있으면 실행하는 데 비용이 전혀 들지 않는다.
나란히, 서로 다른 점들에 대해서
• 개요 — Solar Mini 4는 1M 토큰 컨텍스트(Upstage 자체 문서 기준 512K)와 Artificial Analysis Intelligence Index에서 측정된 24.1점을 갖춘 범용 추론 모델입니다. MathForm 8B는 공개된 지수 점수도, 독립적 평가도, 범용 역량에 대한 주장도 없는 단일 작업용 자동 형식화 모델입니다.
• 매개변수 — 총 35B / 활성 3B, 희소, Solar Mini 4용; MathForm 8B용 8.19B 밀집, OpenBMB의 약 367,000개의 검증된 Lean 4 예제로 구성된 FormalVerse 코퍼스에서 Qwen3-8B를 기반으로 미세 조정되었습니다.
• 라이선스 및 제공 방식 — Solar Mini 4는 독점 모델로, Upstage의 API와 서드파티 플랫폼을 통해 이용할 수 있습니다. MathForm 8B는 Apache-2.0 가중치이며, 채팅 템플릿, 4개의 safetensors 샤드, 그리고 OpenAI 호환 엔드포인트 뒤에 있는 Transformers, vLLM 또는 SGLang 배포 경로를 갖추고 있습니다.
• 가격 — Solar Mini 4는 백만 토큰당 $0.10 / 캐시 사용 시 $0.01 / $0.40이며, 2026년 10월 22일까지 현재 50% 할인 중입니다. MathForm 8B에는 요금표가 없습니다. 그 비용은 바로 그 아래에 두는 GPU입니다.
• 속도 — Artificial Analysis의 평가 환경에서 Solar Mini 4는 초당 204개의 출력 토큰을 생성하며, 인덱스 작업당 88,300개의 출력 토큰과 작업당 약 430초의 작업 시간이 소요됩니다. MathForm 8B의 출력은 Lean 4 정리 헤더 하나로, 많아야 수백 개의 토큰에 불과합니다.
• 수치의 독립성 — Solar Mini 4는 제3자가 실행한 적이 있다. MathForm 8B는 그렇지 않다. 논문에 실린 모든 수치는 저자 자신의 것이며, 이 모델은 너무 최신이고 너무 특수화되어 있어 독립적인 실행을 이끌어내지 못했다.
두 모델이 만나는 곳, 그리고 만나지 않는 곳

실패 양상이 바로 이 조합을 흥미롭게 만드는데, 두 가지가 정확히 정반대이기 때문이다. Solar Mini 4의 공개된 결과 중 가장 약한 것은 Terminal-Bench 4.0의 1%이고, AutomationBench-AA는 22.3%다. 즉 피드백을 주는 환경에서 자기 작업을 검증하는 데 서투르다. MathForm 8B의 설계 전제 전체는 검증이다. OpenBMB는 Lean 4 명제가 컴파일되는지를 묻는 Syntax Check와, 컴파일된 명제가 비형식 문제와 실제로 같은 의미인지를 묻는 Consistency Check를 구분한다. 이것이 방지하고자 존재하는 전형적 실패는, 타입 검사를 통과하면서도 주장을 조용히 약화시키는 명제다.
그것은 실질적인 구분이며, 정확히 짚고 넘어갈 가치가 있습니다. 증명을 생성하는 추론 모델에는 잘 알려진 자기 검증 문제가 있습니다: 생성 과정의 그 무엇도 답이 옳은지 알려주지 않습니다. 컴파일러는 그렇습니다. 여러분의 워크플로가 "문제 은행을 기계가 검사할 수 있는 것으로 변환하는 것"이라면, MathForm 8B는 Solar Mini 4가 전혀 할 수 없는 작업의 절반을 하고 있는 셈이며, 남은 부분은 정도의 문제가 아닙니다.
벤더 측이 밝힌 수치로서: OpenBMB의 논문은 여섯 개 벤치마크에서 Syntax Check 기준 평균 Pass@8이 88.06%, Consistency Check 기준 72.37%라고 보고하며, 이것이 여러 특화된 32B autoformalizer를 능가한다고 주장한다. 이 중 어느 것도 제3자에 의해 재현된 바 없다. 두 검사 사이의 16포인트 하락이 더 많은 정보를 주는 수치다 — 이는 컴파일된 명제가 당신이 물어본 문제와 꼭 맞지 않는 경우가 얼마나 잦은지를 측정하며, Consistency Check가 별도의 열로 존재하는 이유가 바로 여기에 있다.
팀이 둘 다 실행하는 이유
자연 파이프라인에는 저렴하고 대량 처리하는 단계와 비싸고 소량 처리하는 단계가 있기 때문입니다. MathForm 8B는 자체 하드웨어에서 실행되며 비형식 문제를 Lean 4 헤더로 변환하고, 사람이 보기 전에 잘못된 출력을 거부할 수 있는 컴파일러를 갖추고 있습니다. Solar Mini 4는 그 주변의 일을 처리합니다: 지원 논문을 읽고, 가정을 추출하고, 결과를 한국어 또는 영어로 요약하고, 작업을 라우팅합니다. 둘은 결코 같은 요청을 두고 경쟁하지 않으며, 더 작은 쪽이 객관적인 통과/실패 신호가 있는 작업 부분을 담당합니다.
어느 모델도 저희가 여러분께 라우팅해 드릴 수 있는 것이 아닙니다 — Upstage의 모델은 OrcaRouter에 없고 OpenBMB의 모델도 마찬가지입니다 — 따라서 Solar Mini 4를 원하신다면 Upstage 자체 API에서 가져와야 하고, MathForm 8B를 원하신다면 Hugging Face와 여러분의 GPU에서 가져와야 합니다. 저희가 할 수 있는 일은 그 파이프라인의 나머지 부분을 하나의 키 뒤에 두는 것입니다: 프로바이더 정가 대비 0% 마크업으로 200개 이상의 모델, 프로바이더 전반에 걸친 자동 페일오버, 그리고 모델을 단일 호출로 연결할 수 있게 해주는 라우팅 DSL. 작은 전문 모델이 형식화 단계를 담당하고 대형 범용 모델이 그 주변의 모든 것을 처리하는 워크플로에서, 새 통합을 배포하는 대신 모델 문자열을 수정하는 것만으로 범용 모델을 바꿀 수 있다는 것은 2주짜리 변경과 반나절의 차이입니다.

기억할 점
"이 중 무엇을 써야 하나?"가 당신의 질문이라면, 솔직한 답은 당신이 답이 필요한지 형식화가 필요한지에 달려 있으며, 어떤 벤치마크도 그것을 결판내지 못한다는 것입니다. "MathForm 8B는 다운로드할 가치가 있나?"가 질문이라면, 답은 하나의 좁은 작업에는 '그렇다', 그 밖의 무엇에도 '아니다'입니다 — 그것은 증명기가 아니라 형식화기이며, 그것이 내놓는 출력에서 증명 의무는 열린 채로 남습니다. "Solar Mini 4가 작업당 $0.36의 가치가 있나?"가 질문이라면, 답은 대량의 긴 문서에는 '그렇다', 스스로 작업을 검증해야 하는 무엇에도 '아니다'입니다.

마무리로 출처를 밝히겠습니다. 위의 모든 Solar Mini 4 수치는 Artificial Analysis가 독립적으로 측정한 값이며, 컨텍스트 윈도우만 예외입니다. 이는 Upstage 자체 수치이고 그들의 수치와 일치하지 않습니다. 모든 MathForm 8B 수치는 arXiv 2608.14221에 실린 공급업체 보고 수치이며 재현되지 않았고, 그 출시는 예고 없이 이루어졌습니다 — 가중치, FormalVerse 데이터셋, 논문이 모두 2026년 8월 14일에 등장했으며, 지금까지 공급업체 블로그 게시물도, 독립적인 벤치마크 실행도 없었습니다.
