
MiniMax M3 vs Muse Spark 1.2: 벤치마크 석권에 맞선 4배 가격 격차
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3우리 카탈로그에서 백만 입력 토큰당 $0.30입니다. Muse Spark 1.2$1.25입니다. 이는 입력에서 4.2배, 출력에서 3.5배의 격차이며, 이것이 이 조합에 관한 가장 유용한 단일 사실입니다. 같은 카탈로그 페이지에서 Muse Spark 1.2가 두 모델이 공유하는 모든 벤치마크 항목에서 MiniMax M3를 앞서기 때문입니다. 하나는 공급업체가 보장하는 512K의 사용 가능한 컨텍스트와 512K 출력 상한을 갖춘 저렴한 오픈웨이트 옵션입니다. 다른 하나는 이제 자사 제품군보다 한 세대 뒤처졌음에도 거의 모든 곳에서 여전히 더 높은 점수를 내는 Meta 추론 체크포인트입니다. 이 페이지의 나머지 부분은 그 두 사실 중 어느 것이 실제로 워크로드를 결정하는지에 관한 것입니다 — 그리고 답은 모든 워크로드에 대해 같지 않습니다.
이 모델들 각각이 실제로 무엇인지
둘 다 올해 출시됐고 어느 쪽도 새로운 게 아니다. 이 점이 중요하다. 둘 중 하나가 출시되는 것처럼 쓴 비교 페이지는 한 달 안에 스스로 낡아 버리기 때문이다.

MiniMax M3는 MiniMax가 자체 출시한 모델로, 2026-06-01 공급업체 블로그에서 "MiniMax M3: 프런티어 코딩, 1M 컨텍스트, 네이티브 멀티모달리티 — 하나의 모델에 모두 담다"라는 제목으로 발표되었습니다. 게시물은 단도직입적으로 시작합니다. "MiniMax M3가 오늘 공식 출시되었습니다." MiniMax가 내세운 세 가지 주장은 코딩 및 에이전트 작업에서 프런티어 수준의 성능에 도달한다는 것, 회사가 제안한 새로운 어텐션 아키텍처인 MSA(MiniMax Sparse Attention)를 사용한다는 것, 그리고 네이티브 멀티모달이라는 것입니다. 즉 이미지와 비디오 입력을 받아들이고, MiniMax의 표현에 따르면 "데스크톱 컴퓨터를 운용할 수 있습니다." MiniMax는 이 세 가지 역량이 폐쇄형 프런티어 모델에게는 기본 요건이며, M3가 "세 가지를 모두 결합한 최초이자 유일한 오픈 웨이트 모델"이라고 덧붙입니다. 저희 카탈로그에는 이 모델이 2026-05-31부터 사용 가능한 것으로 등록되어 있으며, 이는 블로그 날짜보다 하루 이릅니다.
Muse Spark 1.2는 Meta의 것입니다. 우리 카탈로그는 이를 2026-08-05로 기재합니다. 이것은 새로운 티어가 아닙니다 — Muse Spark 1.1에 비해 약간 더 높은 성능을 가진 업데이트된 체크포인트이며, 동일한 가격으로 같은 Standard tier에서 제공되므로, 별도의 제품이라기보다는 바로 대체할 수 있는 업그레이드입니다. 이 모델의 차별화되는 특징은 입력 표면입니다: 텍스트, 이미지, 비디오, 오디오 및 PDF. 출력은 텍스트입니다.
여기에는 나중에 묻히기보다 이 자리에 들어가야 할 맥락이 하나 있습니다. Meta는 2026-09-02에 Muse Spark 제품군을 1.3 체크포인트로 넘겼고, 그로 인해 1.2는 같은 라인의 이전 세대가 되었습니다. 이는 3주 전에 일어난 일이라 뉴스가 아니며, 이 페이지도 이를 뉴스로 취급하지 않습니다 — 하지만 오늘 이 둘 중 하나를 선택하려는 사람이라면, 자신이 현재 MiniMax 모델과 대체된 Meta 모델을 비교하고 있다는 점을 알아야 합니다.
백만 토큰당 가격, 그리고 워크로드의 실제 비용

공개된 요금은 자체 카탈로그의 각 모델 페이지에서 가져온 것이며, 카탈로그는 제공업체의 정가를 마크업 없이 그대로 전달합니다:
• 입력 — MiniMax M3 100만 토큰당 $0.30 대 Muse Spark 1.2 100만 토큰당 $1.25
• 출력 — MiniMax M3 1M당 $1.20 vs Muse Spark 1.2 1M당 $4.25
• 캐시 읽기 — MiniMax M3 1M당 $0.060 vs Muse Spark 1.2 1M당 $0.150
• 비율 — Muse Spark 1.2는 입력에서 4.2배, 출력에서 3.5배, 캐시 읽기에서 2.5배입니다
그 추상적인 비율들은 각 페이지의 비용 계산기에서 구체화됩니다. 둘 다 월 1,000만 토큰, 입력 비중 70%로 설정하면 — 요약 또는 추출 작업에 합리적인 형태이며 추정기가 기본 제공하는 값입니다 — MiniMax M3는 월 $5.70로 나옵니다. Muse Spark 1.2는 월 $11.30로 나옵니다. 프롬프트 캐싱을 켜면 동일한 워크로드는 대략 $4.86 대 대략 $9.63이 됩니다. 계산기는 둘 다 정가 기준 추정치라고 표시하는데, 이는 적절한 단서입니다: 실제 토큰 수는 제공업체의 토크나이저에 따라 달라집니다.
저렴한 워크로드라면 그 차이는 커피 한 잔 값이다. 핵심은 절대값이 아니라 곡선의 모양이다: 월 1억 개의 출력 비중이 높은 토큰을 처리하는 워크로드는 Muse Spark 쪽만으로도 세 자릿수에서 네 자릿수로 넘어간다. 비용이 이 조합을 검토하게 만든 제약이라면, 바로 그 숫자를 자신의 트래픽에 대입해 모델링해야 한다.
우리는 공급자 정가를 마크업 없이 그대로 전달하기 때문에, 공급업체의 가격 인하는 발표된 당일에 우리 쪽에도 그대로 반영됩니다. 그리고 이 두 모델은 모두 이곳으로 라우팅됩니다 — 하나의 키가 둘 다를 처리하므로, 두 모델을 서로 견주어 가격을 책정하는 데 별도의 계약이나 코드 변경이 필요하지 않습니다.
컨텍스트 윈도우, 그리고 실제로 그 안에 들어가는 것
이 섹션은 두 제품이 스펙표에서는 가장 비슷해 보이지만 실제 사용에서는 가장 달라 보이는 부분입니다.
• 컨텍스트 윈도우 — MiniMax M3 1,048,576 토큰 vs Muse Spark 1.2 1,048,576 토큰
• 최대 출력 — MiniMax M3 512,000 토큰 vs Muse Spark 1.2 131,072 토큰
• 입력 표면 — MiniMax M3의 텍스트, 이미지, 동영상 vs Muse Spark 1.2의 텍스트, 이미지, 동영상, 오디오, PDF
• 출력 표면 — 둘 다 텍스트만 출력
• 구조화된 매개변수 — MiniMax M3는 tools와 tool_choice를 제공하고, Muse Spark 1.2는 reasoning_effort와 structured_outputs를 제공합니다.
두 윈도는 모두 동일한 100만 토큰이므로, "누가 더 많은 컨텍스트를 가지는가"라는 질문에는 승자가 없습니다. 최대 출력 행에서 둘이 갈라집니다: MiniMax M3 응답은 512,000토큰까지 실행될 수 있으며, 이는 Muse Spark 1.2의 상한인 131,072의 약 네 배입니다. 작업이 장문 생성 — 전체 파일 재작성, 긴 보고서, 트랜스크립트 규모의 출력 — 이라면, 그 차이는 점진적이 아니라 구조적입니다. 작업이 긴 입력에 대한 짧은 답변이라면, 이는 무관합니다.
입력 표면 항목은 반대 방향으로 작용한다. Muse Spark 1.2는 오디오와 PDF를 직접 받아들이지만, MiniMax M3의 문서화된 입력 범위는 이미지와 비디오에서 멈춘다. 통화 녹음이나 스캔한 문서를 입력으로 받는 파이프라인은 이 둘 각각에 대해 수행해야 할 전처리 양이 다르다.
MiniMax 측에서는 이 컨텍스트 주장에 아키텍처 관련 설명이 따라붙는데, 이는 벤더 자체의 것으로 분명히 표시할 가치가 있습니다. MiniMax는 M3의 장문맥 동작을 MSA(MiniMax Sparse Attention) 덕분이라고 보는데, 우리 카탈로그는 MSA가 최소 512K 보장이라는 문구와 함께 최대 1M 토큰의 컨텍스트를 지원한다고 기술합니다. 최소 보장이라는 표현은 MiniMax의 것이며, 우리가 제시할 수 있는 독립적인 측정치는 없으므로 512K 하한은 테스트된 수치가 아니라 벤더 주장으로 취급하십시오.
자체 게이트웨이에서의 지연 시간과 처리량
이 수치들은 우리가 가장 직접적으로 언급할 수 있는 수치입니다. 우리 자체 수치이기 때문입니다. 이는 2026-09-23까지의 7일간을 포괄하며, 벤더 벤치마크가 아니라 우리 게이트웨이의 트래픽을 설명합니다.
• p50 첫 토큰까지의 시간 — MiniMax M3 4.28초 vs Muse Spark 1.2 4.82초
• p95 첫 토큰까지 걸리는 시간 — MiniMax M3 10.00초 vs Muse Spark 1.2 10.00초
• 출력 속도 — MiniMax M3 289 tok/s vs Muse Spark 1.2 507 tok/s
• 오류율 — MiniMax M3 0.12% vs Muse Spark 1.2 0.15%
• 트래픽, 지난 7일 — MiniMax M3 153.8M 토큰 vs Muse Spark 1.2 79.6M 토큰
이것을 솔직하게 읽어보면 그림은 갈린다. 첫 토큰까지 걸리는 시간에서는 두 모델이 비슷하다 — 중앙값 기준 4.28초 대 4.82초이고, p95는 10.00초로 소수점 둘째 자리까지 동일한데, 이는 실제 동률이라기보다 둘 다 같은 한계치 근처에 머물러서 생긴 반올림 결과다. 출력 속도에서는 전혀 비슷하지 않다: Muse Spark 1.2는 MiniMax M3의 약 1.75배 속도로 스트리밍하는데, 이는 총비용이 더 높더라도 긴 생성이 지켜보는 사용자에게 느껴지는 방식을 바꾼다. 오류율은 서로 반올림 오차 범위 안에 있고 둘 다 낮다.
트래픽 행은 점수판이 아니라 신호로 읽을 가치가 있습니다. 같은 7일 동안 우리 게이트웨이에서 MiniMax M3는 Muse Spark 1.2가 처리한 토큰의 약 두 배를 처리했습니다. 그것이 시장이 선택하고 있는 것이지 벤치마크가 말하는 것이 아니며, 이 조합에서는 그 둘이 서로 어긋납니다.
두 모델을 하나의 엔드포인트 뒤에 라우팅하는 것은 여러분의 워크로드가 어느 쪽을 선호하는지 알아내는 저렴한 방법이기도 합니다. 페일오버 덕분에 어느 모델에서든 공급자 측 성능 저하가 발생해도 오류가 나는 대신 정상 작동하는 경로로 넘어가기 때문입니다.
도구 호출 및 장기 지평의 에이전트 작업
이것은 측정 결과에서 두 가지가 가장 크게 차이 나는 부분이며, 주의 사항이 가장 중요하게 작용하는 지점입니다.
• Terminal-Bench v2.1 — MiniMax M3 52.4 vs Muse Spark 1.2 80.1
• tau_banking (도구 사용) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8
• MCP Atlas — MiniMax M3 74.2(벤더 보고) vs Muse Spark 1.2 미측정
• BrowseComp — MiniMax M3 83.5(벤더 보고 기준) vs Muse Spark 1.2 측정되지 않음
• OSWorld-Verified — MiniMax M3 70.0(벤더 보고) 대 Muse Spark 1.2는 측정되지 않음
처음 두 행은 우리 자체 카탈로그 페이지의 벤치마크 패널에서 나온 것이며, 두 모델 모두 채워 넣은 유일한 에이전트형 행입니다. 둘은 접전이 아닙니다: Muse Spark 1.2는 tau_banking에서 MiniMax M3를 두 배 이상 앞서고 Terminal-Bench v2.1에서는 거의 28점 차로 앞섭니다. 워크로드가 도구 표면을 갖춘 장기 지평 에이전트라면, 이는 이 페이지에서 가장 큰 단일 격차입니다.
다음 세 행은 MiniMax가 출시 게시물에서 공개한 자체 수치입니다. 이 수치들은 처음 두 행과 비교할 수 없습니다 — 서로 다른 하네스를 사용했고 독립 감사도 없습니다 — 하지만 해당 작업들에서 MiniMax M3에 관해 공개된 유일한 수치이므로, 이것을 빼면 해당 모델을 과소평가하게 됩니다. 이 수치들은 벤더가 보고한 것으로만 받아들이고, 그 이상으로는 받아들이지 마십시오.
하나의 불일치는 별도의 문단을 할애할 만하다. 왜냐하면 그것은 비교 페이지가 대개 얼버무려 넘어가는 종류의 사안이기 때문이다. MiniMax의 출시 게시물은 M3에 대해 Terminal-Bench 2.1을 66.0으로 표기하는데, 이는 숫자 표가 함께 제공되지 않는 차트 이미지 안에 들어 있다. 우리 카탈로그 페이지의 독립적인 Terminal-Bench v2.1 행은 같은 모델에 대해 52.4를 보여준다. 과제 이름이 충분히 비슷해서 독자들은 두 수치를 나란히 보게 될 것이고, 두 수치는 13점 넘게 차이 난다. 우리는 둘 중 하나가 틀렸다고 단정하지 않겠다. 유력한 설명은 서로 다른 하네스나 서로 다른 실행 구성이라는 것이며, 솔직한 진술은 벤더 자체 수치와 감사를 거친 수치가 불일치하고, 벤더 쪽이 더 높다는 것이다.
매개변수 목록은 더 작지만 더 실용적인 이야기를 들려준다. MiniMax M3는 tools와 tool_choice를 노출하므로 요청에서 도구 선택을 조정할 수 있다. Muse Spark 1.2는 reasoning_effort를 노출하므로 대신 추론의 깊이를 조정할 수 있다. 어느 쪽도 상대방의 다이얼은 노출하지 않는다. 애플리케이션의 제어 문제가 "올바른 함수를 호출하게 만들기"라면 한쪽을 가리키고, "어려운 경우에 더 오래 생각하게 만들기"라면 다른 쪽을 가리킨다.
코딩
코딩은 MiniMax M3가 내세우는 대표적인 강점이며, 측정된 격차가 가장 곤란하게 드러나는 지점이기도 하다.
• AA Coding Index — MiniMax M3 38.7 vs Muse Spark 1.2 72.2
• SciCode — MiniMax M3 43.1 대 Muse Spark 1.2 57.4
• SWE-Bench Pro — MiniMax M3 59.0(공급업체 보고) vs Muse Spark 1.2 미측정
• KernelBench Hard — MiniMax M3 28.8 (벤더 보고) vs Muse Spark 1.2 측정되지 않음
MiniMax가 M3에 대해 잡은 포지셔닝은 코딩 우선이다 — 출시 헤드라인에서는 "Frontier Coding"을 백만 토큰 컨텍스트와 멀티모달리티보다 앞세운다. 자체 보고한 SWE-Bench Pro 수치 59.0은 벤더의 하네스에서 강한 숫자다. 하지만 두 모델 모두 값을 채운 독립적인 Coding Index와 SciCode 행에서는 Muse Spark 1.2가 큰 차이로 앞서며, Coding Index의 33포인트 격차는 tau_banking 다음으로 이 페이지에서 두 번째로 크다.
현재 입수 가능한 증거로 MiniMax M3를 더 나은 코딩 모델로 제시하는 정직한 방법은 없다. 말할 수 있는 것은, 공급업체 자체의 코딩 수치는 높고 독립적인 수치는 그렇지 않다는 점이며, 이는 위의 Terminal-Bench 격차와 같은 패턴이다. 코딩에 따라 결정을 내리는 사람이라면 누구든, 출시 게시물의 차트보다 감사된 행에 더 큰 비중을 두어야 하며, 둘 중 어느 쪽이 아니라 자신의 저장소에서 테스트해야 한다.
그들이 진정으로 가까운 곳
세 개의 행은 승자를 내놓지 않으며, 그렇다고 말하는 것이 억지로 하나를 만들어내는 것보다 더 유용하다.
• GPQA Diamond — MiniMax M3 89.9 vs Muse Spark 1.2 90.4, 실용적인 관점에서는 무승부나 마찬가지인 0.5점 차이
• p95 첫 토큰까지 걸리는 시간 — 지난 7일 동안 우리 게이트웨이에서 둘 다 10.00초
• 컨텍스트 창과 출력 모달리티 — 1,048,576 입력 토큰 및 텍스트 전용 출력에서 동일
대학원 수준 과학 추론에서 이 둘은 사실상 구별할 수 없으며, 이는 MiniMax M3의 훨씬 저렴한 모델이 더 비싼 모델에 맞서 대등한 성능을 보이는 유일한 추론 항목이다. 종합 지표를 읽을 때 기억해 둘 만하다: 이 모델들 사이의 격차는 역량 전반에 걸쳐 균일하지 않고, 에이전트 및 코딩 작업에 집중되어 있으며, 지식 비중이 높은 객관식에서는 거의 0이다.

MiniMax M3를 선택하세요, 만약, Muse Spark 1.2를 선택하세요, 만약
도입 문단의 두 가지 사실은 무엇을 만들고 있느냐에 따라 다르게 판가름나므로, 여기서는 얼버무리지 않고 그 구분을 제시한다.
• 토큰당 비용이 결정적 제약이라면, 131,072개 토큰을 넘는 장문 출력이 필요하다면, 오픈 가중치가 필요하다면, 별도 파이프라인 없이 비디오 입력을 원한다면, 또는 입력 가격의 약 4분의 1 수준으로 추론 비중이 높은 지식 작업을 원한다면 MiniMax M3를 선택하세요 — GPQA Diamond에서는 막상막하이며, 바로 그 항목에서 저렴한 모델이 제값을 합니다.
• 도구를 사용하는 장기 작업 에이전트가 워크로드라면, 감사된 코딩 점수가 가장 높아야 한다면, 명시적인 reasoning_effort 조절 다이얼을 원한다면, 오디오나 PDF를 직접 수집해야 한다면, 또는 빠른 스트리밍 출력이 필요하다면 Muse Spark 1.2를 선택하세요 — 507 tok/s 대 289 tok/s는 벤치마크상의 차이가 아니라 눈에 보이는 차이입니다.
• 아직 어느 쪽을 선택해야 할지 모르겠다면, 결정적인 근거는 이 페이지에 없습니다. 두 모델을 자체 트래픽 샘플에 적용해 측정해 보세요. 각 모델 페이지의 가격 계산기를 이용하면 1분 만에 비용 측면을 알 수 있고, 위에 제시된 7일 지연 시간 수치는 성능 측면을 미리 가늠해 볼 수 있는 가장 가까운 지표입니다.
둘 다 사용 중인 것은 공급자 정가 대비 마크업이 없는 하나의 API이며, 따라서 이번 체험은 마이그레이션이 아니라 모델 ID 변경이고, 자동 장애 조치는 어느 한 제공자에 문제가 생긴 날에도 서비스 중단이 아니라 더 느린 응답으로 이어진다는 의미입니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
