MiniMax M3 해설용 히어로 카드로, 428B 총 파라미터에 23B 활성화라고 적힌 카드, 1M 토큰 컨텍스트라고 적힌 넓은 컨텍스트 리본, 네이티브 멀티모달과 오픈 웨이트라고 적힌 배지, 그리고 하단에 MiniMax M3 - 2026년 6월 1일 발표 - MiniMax라고 적힌 푸터를 보여줍니다.
Guides & Insights

MiniMax M3란 무엇인가? MiniMax의 100만 컨텍스트 멀티모달 플래그십

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

MiniMax M3는 M 시리즈 텍스트 모델, Hailuo 비디오 모델, Music 시리즈를 만든 중국 연구소의 네이티브 멀티모달 오픈 웨이트 언어 모델이다. 연구소는 2026년 6월 1일 이를 발표했으며, MiniMax M2.7을 제치고 회사 자체 모델 목록에서 최상위 자리를 차지했다. 100만 토큰 컨텍스트 윈도우, 네이티브 텍스트-이미지-비디오 입력, 그리고 연구소가 MSA라고 부르는 희소 어텐션 아키텍처를 갖췄다.

이 블로그 아카이브에는 MiniMax M3를 언급한 글이 열네 편 있습니다. 지금까지 그중 어느 것도 MiniMax M3 자체를 다룬 적은 없었습니다. 이 모델은 거듭되는 비교에서 상대로 등장합니다 — 더 새로운 Gemini, Qwen, Grok 또는 GPT가 견줘지는 오픈 가중치 기준점으로 — 그리고 독자가 MiniMax M3가 실제로 무엇인지 알아보려고 들어갈 수 있는 페이지는 여기에 없었습니다. 이 글이 바로 그 페이지입니다.

사양 시트

MiniMax M3는 MiniMax가 가중치와 함께 공개하는 모델 카드에 따르면 총 약 4,280억 개의 파라미터와 토큰당 약 230억 개의 활성화 파라미터를 가진 전문가 혼합(mixture-of-experts) 모델입니다. 이 모델은 텍스트 전용 모델에 비전을 덧붙인 방식이 아니라 처음부터 네이티브로 멀티모달이며, 카드에서는 첫 단계부터 인터리브된 모달리티로 학습했다고 설명하고, 텍스트, 이미지, 비디오 입력을 받아 텍스트를 반환합니다.

• 컨텍스트 창: 1,048,576 토큰, 자체 카탈로그 항목에는 사용 가능한 컨텍스트의 보장 최소 512,000 토큰이 명시됨
• 최대 출력: 카탈로그 페이지 기준 512,000 토큰, MiniMax는 자체 자료에서 최대 출력 수치를 공개하지 않으므로 512K는 벤더가 아닌 우리 수치로 간주
• 모달리티: 텍스트, 이미지, 비디오 입력; 텍스트 출력
• 파라미터: 총 ~428B, 토큰당 활성 ~23B
• 추론 제어: enabled, adaptive, disabled 모드를 갖춘 thinking 파라미터
• 권장 샘플링: temperature 1.0, top_p 0.95
• 아키텍처: MiniMax Sparse Attention(MSA), arXiv 논문 2606.13392의 주제
• 엔드포인트 형태: OpenAI 호환 chat completions

핵심적인 아키텍처 주장은 긴 컨텍스트에서의 어텐션 비용에 관한 것이다. MiniMax에 따르면 MSA는 100만 토큰 창에서 M2보다 프리필링이 9배 이상 빠르고 디코딩이 15배 이상 빠르며, 토큰당 연산량을 이전 세대의 약 20분의 1로 줄인다. 이는 공급업체 측 수치이며, 우리는 이것이 독립적으로 재현되는 것을 보지 못했다.

MiniMax M3가 MiniMax 자체 라인업에서 차지하는 위치

그것은 언어 라인의 최상단이지만, 그 라인에 무엇이 포함되는지는 정확히 짚고 넘어갈 가치가 있습니다. MiniMax는 대부분의 연구소보다 여전히 목록에 올라 있는 모델의 더 긴 꼬리를 유지하기 때문입니다. 벤더 자체의 모델 문서는 이들을 둘로 나눕니다.

• 현재 모델: MiniMax M3, MiniMax M2.7, MiniMax M2.7-highspeed
• 레거시 모델, 아직 목록에 있음: MiniMax M2.5, MiniMax M2.5-highspeed, MiniMax M2.1, MiniMax M2.1-highspeed, MiniMax M2
• 그중 가장 오래된 MiniMax M2는 200,000토큰 컨텍스트와 사고 연쇄(chain-of-thought)를 포함한 128,000토큰 최대 출력을 지원합니다
• MiniMax는 M2.7이나 M2.1의 컨텍스트 또는 출력 제한을 같은 문서에 공개하지 않습니다

세대 간 격차는 실재하지만, 두 모델이 모두 등장하는 단 하나의 지수에서는 그리 크지 않다. Artificial Analysis는 Intelligence Index 개정판 v4.3.2에서 MiniMax M3에 29점을, 같은 개정판에서 MiniMax M2.7에 23점을 부여한다 — 29는 해당 개정판 표에서 114개 모델 중 M3를 16위에 올리고, 23은 M2.7을 36위에 올린다. M2.7은 2026년 3월에 출시되었다. 이 도약은 세대가 아니라 한 단계에 불과하며, 두 수치를 같은 개정판 기준으로 읽는 것이 중요하다: 이 지수는 2026년 9월 7일에 재조정되었고, 그 날짜 이전의 점수는 이후 점수와 비교할 수 없다.

비용

MiniMax는 종량제 요금표에서 요청 규모에 따라 M3의 가격을 책정하며, 공개된 요금에는 더 높은 정가 대비 영구적인 50% 할인이 적용됩니다.

• 입력 512K 토큰까지: 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $1.20, 캐시 읽기 100만 건당 $0.06 — 정가 $0.60 / $2.40 / $0.12 대비
• 입력 512K 토큰 초과: 입력 100만 개당 $0.60, 출력 100만 개당 $2.40, 캐시 읽기 100만 건당 $0.12 — 정가 $1.20 / $4.80 / $0.24 대비
• 우선순위 서비스 티어: 표준 요금의 1.5배이므로 소규모 요청 티어에서 $0.45 / $1.80 / $0.09이며, service_tier를 "priority"로 설정하여 선택됩니다
• 미공개: MiniMax는 M3에 대한 캐시 쓰기 가격을 공개하지 않고 캐시 읽기 가격만 공개합니다

OrcaRouter는 MiniMax M3를 동일한 수치 — 입력 $0.30, 출력 $1.20 — 로 제공하며, 공급자 요율에 별도의 마크업을 붙이지 않습니다. 이 모델은 우리 카탈로그의 주요 모델이며, 트래픽도 만만치 않습니다. 작성 시점 기준 지난 7일 동안 1억 5,370만 토큰이 라우팅되었고, 첫 토큰까지 걸리는 시간은 p50 4.26초, p95 10.00초였습니다.

Screenshot of MiniMax's own M3 announcement page, showing the article title MiniMax M3, a dateline reading 2026-06-01 and the vendor's three headline claims: native multimodality, context scaling via sparse attention, and frontier coding and cowork capability.

MiniMax M3가 측정 가능할 정도로 잘하는 것

MiniMax가 스스로 보고한 수치부터 시작해 보자. 이 수치들은 모두 벤더가 보고한 것이며, 그중 어느 것도 제3자가 재현하는 것을 우리는 본 적이 없다.

• SWE-Bench Pro: 59.0%
• Terminal-Bench 2.1: 66.0%
• SWE-fficiency: 34.8%
• MCP Atlas: 74.2%
• BrowseComp: 83.5, 에이전트 검색에서 벤더가 앞세운 수치
• Video-MME: 512프레임에서 84.6, 외부 API가 프레임을 640으로 제한하는 가운데
• KernelBench Hard: 28.8%
• OSWorld-Verified: 최대 100스텝에서 68.70%, 200스텝에서는 70.06%로 상승

독립적인 그림도 같은 방향을 가리킨다. Artificial Analysis는 MiniMax M3를 리비전 v4.3.2에서 지능 지수 29로 평가하며, 114개 모델 중 16위이고, 모델당 해당 지수를 실행하는 비용은 $0.51로 그 비용 척도에서 114개 중 21위다. 출력 속도는 초당 106.4토큰으로 중앙값 67.1을 상회하며, 첫 토큰까지의 시간은 1.25초로 중앙값 2.33초보다 빠르다. 이 두 가지 모두 해당 등급의 일반적인 수준보다 우수하고, 가격은 그보다 훨씬 낮다.

동일한 지수 계열을 제3자가 재게시한 자료가 하위 점수를 채워 줍니다: SWE-bench Verified 80.5%, tau-squared-bench 88.9%, AA-GPQA Diamond 92.9%, AA-LCR 83.0%, AA-IFBench 82.9%, OmniDocBench 1.5 91.6%, USAMO 2026 85.7%. 문서 이해와 지시 수행은 진정한 강점으로 보이며, 장문맥 추론 점수는 아키텍처상의 설명과 일치합니다.

Scoreboard graphic comparing independently measured MiniMax M3 figures, showing an Intelligence Index of 29 at rank 16 of 114, output speed of 106.4 tokens per second, a time to first token of 1.25 seconds, and a blended price of 0.22 US dollars per million tokens.

그것이 측정 가능할 정도로 잘 못하는 점

솔직한 약점들은 두 곳에 집중되어 있으며, 둘 다 공개된 수치에서 드러난다.

• 에이전트 격차가 가장 큰 문제입니다: 동일한 제3자 재게시에서 MiniMax M3는 AA 코딩 지수에서 58.6점을 받지만 AA 에이전트 지수에서는 30.8점에 그칩니다. 이 모델은 장기 다단계 작업을 자율적으로 수행하는 것보다 코드를 훨씬 더 잘 작성합니다.
• 지식과 환각: AA-Omniscience 지수 1.4, 정확도 16.7%, 환각률 18.4%. 이는 모르는 것에 대해서도 자신 있게 답하는 모델입니다.
• OSWorld 2.0: 4.6%
• CritPt: 3.7%, 우리가 확인한 M3의 공개 점수 중 어디서든 가장 낮은 수치
• ResearchClawBench: 19.8%
• 장황함: Intelligence Index를 완료하는 데 1억 2천만 개의 출력 토큰, 114개 중 11위 — 이는 말이 많은 모델이며, 추론 비중이 높은 프롬프트에서는 그 비용이 청구서에 나타납니다
• 종합 하한선: 한 제3자 애그리게이터는 100점 만점에 55.28점, 505개 중 60위로 평가하지만, 481개 벤치마크 중 50개만 부분적으로 다룬 것이므로 그 종합 점수는 평결이라기보다 하한선입니다

몇 가지 항목은 그냥 측정되지 않았으며, 우리는 그 공백을 메우기보다 그렇다고 말하는 편을 택한다. MiniMax 외부의 그 누구도 위의 벤더 벤치마크 표를 재현하지 않았다. Artificial Analysis는 M3에 대해 Coding Index나 Agentic Index 수치를 자체적으로 공개하지 않는다 — 58.6과 30.8의 조합은 동일한 지수 계열을 다시 게시한 제3자로부터 나온 것이다. Artificial Analysis는 AA-Omniscience를 자사 지수의 구성 요소로 언급하지만, M3에 대한 숫자로 된 Omniscience 점수는 공개하지 않는다. MiniMax는 최대 출력 수치를 공개하지 않으므로, 우리 자체 모델 페이지에 있는 512K는 우리 수치다. 그리고 벤더 요금표에는 캐시 쓰기 가격이 아예 없다.

누가 MiniMax M3를 선택해야 하며, 누가 다른 것을 선택해야 할까요?

긴 컨텍스트와 멀티모달을 동시에 요구하는 작업이라면 MiniMax M3를 선택하세요. 비디오 입력을 지원하는 100만 토큰, 직접 다운로드해 실행할 수 있는 오픈 웨이트, 그리고 100만 토큰당 $0.30의 입력 가격은 오픈 웨이트 분야에서 다른 무엇도 깔끔하게 따라올 수 없는 조합입니다. 장문 문서 분석, 비디오 이해, 리포지토리 규모의 코드 읽기, 문서 추출 파이프라인이 바로 측정된 강점이 발휘되는 영역입니다 — OmniDocBench 91.6%와 AA-LCR 83.0%가 이를 뒷받침하는 수치입니다.

세 가지 경우에는 다른 것을 고르세요. 컨텍스트 윈도나 비전 입력이 필요 없다면, MiniMax M2.7은 동일한 $0.30/$1.20의 비용이 들고, 현재 인덱스 개정판에서 M3의 29점에 비해 23점을 기록하며, 운영해야 할 대상도 더 작습니다 — M3의 이점은 공짜가 아니라, 같은 정가에 책정되어 있을 뿐입니다. 워크로드가 코딩이 아니라 자율 에이전트라면, 에이전트 격차가 다른 곳을 찾아야 하는 이유이며, MiniMax 자체 비교표도 같은 지점을 가리킵니다: PostTrainBench에서 벤더는 M3에 대해 0.37, Opus 4.7에 대해 0.42, GPT-5.5에 대해 0.39를 보고하는데, 이는 M3가 둘 모두에게 뒤지는 유일하게 공개된 벤치마크입니다. 그리고 아무런 조건 없는 라이선스가 필요하다면, 결정하기 전에 다음 문단을 읽으세요.

라이선스는 많은 보도가 건너뛰는 바로 그 함정입니다. MiniMax M3는 Apache나 MIT가 아니라 MiniMax Community License에 따라 배포됩니다. 비상업적 사용은 무료입니다. 상업적 사용은 허용되지만, "Built with MiniMax M3"를 눈에 띄게 표시해야 합니다. 연 매출 2천만 달러 미만이면 일회성 통지를 제출하면 되고, 그 이상이면 MiniMax로부터 사전 서면 승인을 받아야 하며, "M3 licensing - authorization request"라는 제목으로 이메일을 보내 요청해야 합니다. 이 라이선스에는 금지되는 사용 목록 부록도 포함되어 있습니다. 제품을 출시하는 경우, 이는 형식적인 절차가 아니라 법률 검토 사항입니다.

실용적인 요약

MiniMax M3는 현재 MiniMax 언어 라인의 플래그십입니다: 약 428B 파라미터의 전문가 혼합(mixture-of-experts) 모델로, 토큰당 약 23B가 활성화되며, 100만 토큰 컨텍스트, 네이티브 비디오 및 이미지 입력, 그리고 전체 컨텍스트에서 토큰당 연산량을 20배 줄여준다고 벤더가 평가하는 희소 어텐션을 갖추고 있습니다. 2026년 6월 1일에 발표되었으므로, 이는 새로운 모델이 아니라 이미 자리 잡은 모델입니다 — 2026년 9월의 흥미로운 질문은 이것이 좋은지가 아니라, 여러분의 워크로드 중 어느 절반에 적합한지입니다.

냉정하게 평가한 답은 이렇다. 이 모델은 코드와 문서에는 강하고, 지식에는 평범하며, 자율 에이전트 작업에는 약하다. 하는 일에 비해 저렴하고, 긴 컨텍스트 주장이 독립적인 검토를 견뎌내는 드문 오픈 웨이트 모델이다. 라이선스는 대부분의 팀이 스스로와 협상해야 할 부분이다.

MiniMax M3는 OrcaRouter에서 공급자 요율로 마크업 없이 실행되며, 여기 다른 모든 것과 동일한 OpenAI 호환 엔드포인트를 통해 이용할 수 있습니다: API 키 하나로 200개 이상의 모델에 접근, 엔드포인트가 중단되면 자동 페일오버가 작동하고, 고정하거나 혼합하고 싶을 때 사용할 수 있는 라우팅 DSL도 제공됩니다. 결정하기 전에 카탈로그의 나머지 모델과 비교하고 싶다면, 모델 페이지에서 실시간 요금표, 첫 토큰까지 걸리는 시간 백분위수 및 트래픽을 확인할 수 있습니다.

Screenshot of the OrcaRouter model page for MiniMax M3, showing a featured badge, the model ID minimax/minimax-m3, a context length of 1,048,576 tokens, input and output prices of 0.30 and 1.20 US dollars per million tokens with 50 percent off badges, the MiniMax provider card showing 153.7 million tokens routed in seven days with a p50 time to first token of 4.26 seconds and a p95 of 10.00 seconds, and the model parameters listed as approximately 428 billion total with 23 billion active.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트