
MiniMax M3.1: 유출된 프리뷰 문서가 말하는 것 — 그리고 아무도 확인하지 않은 것
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 434 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 183 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Hugging Face에는 MiniMax-M3.1-preview-private라는 250 GB 체크포인트가 있는데, 소수의 추론 파트너 외에는 누구도 열 수 없습니다. 9월 22일자 문서가 하나 있는데, 내용은 벤더의 아키텍처 노트와 똑같이 읽히며, 벤더 자체 사이트가 아니라 공개 파트너 엔지니어링 저장소에서 유통되고 있습니다. 그리고 9월 26일에는 많은 이들이 팔로우하는 모델 워처가 MiniMax M3.1이 "다음 주에 나올 차기 모델"이라며 이미 그 프리뷰를 테스트 중이라고 게시했습니다. 이 세 가지를 종합하면 MiniMax M3.1의 공개 기록 전부가 됩니다. 이름, 아키텍처 차이점, 가중치 수, 등장 주간이 모두 회자되고 있지만, 벤더는 이 중 어느 것도 공개적으로 언급한 적이 없습니다. 이 모델이 계승한 전작 MiniMax M3는 사정이 다릅니다. 그 모델은 실제로 출시되었고, 바로 그 때문에 사람들이 이 모델에 관심을 갖습니다.
이것은 아직 공개되지 않은 모델이 외부에서 보이는 모습이며, 세 가닥의 근거가 똑같이 강하지는 않기 때문에 증거의 형태를 정확히 짚고 넘어갈 가치가 있다. 체크포인트의 존재는 뒷받침된다: 여러 독립적인 단서가 동일한 비공개 저장소 이름과 동일한 파일 수를 가리킨다. 아키텍처 문서는 그런 식으로 뒷받침되지 않는다 — 그것은 제3자의 전사본이며, 진본일 수도, 낡은 것일 수도, 부분적으로 지어낸 것일 수도 있다. "다음 주"라는 주장은 일정이 아니라 한 사람의 기대다. 이 글의 모든 내용은 실제로 지니는 강도에 맞게 표시되어 있으며, 여기 있는 어떤 것도 출시 발표로 읽혀서는 안 된다.
MiniMax M3.1이 존재하기도 전에 기사로 다룰 가치가 있는 이유는 바로 전작에 있다. 대부분의 평가에 따르면 MiniMax M3는 MiniMax가 내놓은 가장 강력한 오픈 웨이트 모델이었다. 100만 토큰 규모의 텍스트-이미지-비디오 모델로, Artificial Analysis Intelligence Index에서 29.2에 도달했으며, 여전히 진정으로 긴 컨텍스트를 온전히 유지할 수 있는 몇 안 되는 오픈 모델 중 하나다. M3.1이 9월 마지막 주에 등장한다면, 개발자에게 중요한 수치는 유출의 신빙성이 아니라 레이어에서 무엇이 바뀌었는지, 그리고 서빙 비용이 얼마인지다. 그리고 이 두 가지 모두에서 유출된 문서는 이례적으로 구체적이다.
무엇이 확인된 사실이고, 무엇이 단지 유포 중인 것인가
2026년 9월 27일 기준, 솔직한 분배:
• 확인됨: MiniMax M3.1의 공개 버전은 존재하지 않습니다. Hugging Face의 MiniMaxAI 조직은 MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview, MiniMaxAI/MiniMax-M3.1-preview-private 모두에 대해 401을 반환합니다 — 이는 플랫폼의 "찾을 수 없거나 사용자에게 표시되지 않음" 응답입니다. 가장 최신 공개 업로드는 여전히 MiniMax-Music3(2026년 8월 7일)와 MiniMax-H3(2026년 7월 28일)입니다.
• 확인됨: MiniMax M3.1은 저희가 확인할 수 있는 어디에서도 라우팅되지 않습니다. OrcaRouter 모델 카탈로그와 저희가 모니터링하는 공개 목록 어디에도 없습니다. 현재 실제로 호출할 수 있는 MiniMax 모델은 MiniMax M3이며, minimax/minimax-m3에서 확인할 수 있습니다.
• 확인됨: MiniMax는 아무것도 공개하지 않았다. 모델 카드도, 블로그 게시물도, 가격 페이지도, 가중치도, API 모델 ID도 없다. 출시에 대한 언론 보도가 없는 것은 출시가 없었기 때문이다.
• 유통 중: 아키텍처 문서. 이 문서는 공개 저장소 — 호스팅 모델 엔드포인트를 위한 파트너 온보딩 제품군인 longsco/innoferra-eval, 2026년 9월 23일 생성 — 에 PREVIEW-20260922.md라는 파일명으로 그대로 재현되어 있으며, 헤더에는 9월 25일에 공유된 공급업체 문서라고 설명하고 "모델명, 제공업체 출시일 및 공개 출시는 실제 출시에 따라 달라질 수 있음"이라는 단서가 붙어 있습니다. 이는 문서 자체의 유보 표현이지 우리의 것이 아니며, 그것이 맞습니다: 제3자가 공급업체 메모를 복사한 것은 MiniMax의 성명이 아닙니다.
• 회자 중: 250GB 체크포인트와 그 두 번째 배포분. 해당 리포지토리의 온보딩 스펙에는 MiniMaxAI/MiniMax-M3.1-preview-private의 비공개 멀티모달 체크포인트가 기록되어 있습니다 — 파일 62개, safetensors 파일 48개, 약 250GB, 아키텍처 문자열 MiniMaxM3SparseForConditionalGeneration — 그리고 이어서 더 큰 두 번째 배포분인 MiniMax-M3.1-preview2-dspark-private은 파일 101개, 약 236GB이며, 2.3GB fp8 추측 드래프트가 추가되었습니다. 둘 다 비공개입니다. 우리도 둘 중 어느 것도 열 수 없고, 당신도 마찬가지입니다.
• 유포 중인 정보: 일정. 9월 26일 게시물은 누군가 공개적으로 제시한 유일한 날짜이며, “다음 주”는 예상일 뿐이다. 9월 28일이 있는 주를 날짜가 아니라 지켜볼 기간으로 취급하라.
엔지니어링 세부 정보를 담고 있는 단 하나의 문서
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
MiniMax M3.1의 설계에 관해 구체적으로 알려진 모든 것은 그 마크다운 파일 하나와, 같은 저장소에 있는 두 동반 문서로 거슬러 올라간다: 체크포인트가 어떻게 서비스되어야 하는지를 설명하는 SGLang 데모 문서, 그리고 파트너 엔드포인트가 충족해야 하는 spec.yaml이다. 저장소 전체를 읽어 보면, 그것은 추론 제공자가 하는 일을 정확히 하는 추론 제공자처럼 보인다 — MiniMax로부터 초기 드롭을 받고, 무엇이 바뀌었는지 적고, 그에 대한 검증 스위트를 구축하는 것이다. 이 저장소는 프레스 키트가 아니며, 누군가를 설득하기 위해 쓰인 것도 아니다.
그것은 그것에 유리한 점이며, 동시에 그것이 입증하는 바의 한계이기도 하다. 그 안에는 MiniMax가 서명한 것이 아무것도 없다. 세 문서는 실제 문서들이 서로 일치하는 방식으로 일치하며 — 동일한 양자화 상수, 동일한 환경 변수 이름, 동일한 실행 플래그 — 실제 배포본들이 서로 어긋나는 방식으로 어긋난다: 9월 22일 프리뷰는 새로운 추측성 디코딩 방법에 신뢰도 헤드가 없다고 말하지만, 두 번째 체크포인트 배포본은 enable_confidence_head가 true로 설정된 드래프트 구성을 제공했다. 날조라면 보통 수정 궤적을 포함하지 않을 것이다. 그러나 "이례적으로 일관됨"은 "확인됨"이 아니며, 독자가 빠지기 쉬운 실패 방식은 아래의 상수들을 MiniMax가 공개한 설계로 받아들이는 것이다. 그것들은 기껏해야 다른 누군가가 읽어낸 MiniMax의 비공개 설계일 뿐이다.
해당 문서에 따른 다섯 가지 엔지니어링 변경 사항
다음은 문서에 설명된 대로 MiniMax M3와 MiniMax M3.1 사이의 차이입니다. 모든 줄은 공급업체에서 도출된 것이며 감사를 거치지 않았습니다 — 어떤 독립적인 당사자도 MiniMax M3.1의 어떤 종류의 출력도 측정하지 않았습니다.
• 어텐션 범위. 처음 세 개 층의 전체 어텐션이 희소 어텐션으로 대체되어, 모든 층이 희소해집니다. MiniMax M3에서는 처음 세 개 층이 희소 스택의 전체 어텐션 기준점 역할을 했습니다.
• 어텐션 정밀도 — "Q8KV4". 인덱서의 쿼리를 포함한 쿼리는 투영에서 BF16으로 나오며 FP8 E4M3로 캐스팅된다. 키와 값은 — 역시 인덱서의 것도 포함해 — E2M1, 4비트로, 16개 블록 단위로 양자화되며, 블록별 E4M3 스케일은 amax/6이고 [1/512, 448]로 클램프된다. 문서는 래더가 비대칭 임계값을 사용하는 round-half-to-even이라고, 바깥 텐서 스케일은 정확히 1이라고, 0 크기는 양의 0으로 인코딩되어야 한다고 강조한다. M3는 같은 계열의 8비트 KV 경로를 사용했으므로, 이는 KV 바이트를 다시 절반으로 줄인다.
• 전문가 정밀도. MoE 라우팅 전문가들은 MXFP8에서 W4A4 NVFP4로 이동하며, 공유 전문가는 의도적으로 제외됩니다. 두 전문가 프로젝션에는 서로 다른 활성화 스킴이 적용됩니다: FC1은 2688을 해당 행의 절대 최댓값으로 나눈 동적 행별 스케일을 사용하며, 이 행 스케일은 GEMM 이후에, 그러나 활성화 함수 이전에 적용됩니다; FC2는 고정된 외부 스케일 16을 사용합니다. 파트너 README에 명시된 실질적 결과는 직설적입니다: "이러한 설정 없이 일반 NVFP4 경로로 체크포인트를 실행하는 제공자는 아무런 경고 없이 다른 수치 결과를 생성합니다."
• 추측 디코딩. EAGLE 스타일의 다중 토큰 예측 헤드는 사라졌고, MiniMax가 DSpark라고 부르는 방식으로 대체되었습니다. 이는 순수한 마르코프 헤드이며, 9월 22일 문서에서는 신뢰도 헤드가 없습니다. 이는 서빙되는 엔드포인트의 체감에 가장 큰 영향을 미치는 변경입니다. 설계에서 유일한 스트림별 속도 레버이기 때문입니다. MiniMax가 체크포인트와 함께 제공한 데모 엔진에는 DSpark가 포함되어 있지 않으며, 제공업체는 그 격차를 측정했습니다. 추측이 없는 동일한 80,000토큰 프레임에서 스트림별 처리량은 동시성 1에서 초당 63.9토큰이고 동시성 4에서는 60 아래로 떨어지므로, 문서 자체의 결론은 DSpark가 없으면 이 스택이 부하 상황에서 지연 시간 목표를 유지할 수 없다는 것입니다.
• 새로운 요청 필드. MiniMax M3.1은 max, xhigh, high, medium 또는 low를 받는 최상위 reasoning_effort 필드를 추가하며, 이 필드는 채팅 템플릿에 의해 effort 태그로 시스템 프롬프트에 주입된다. M3에는 adaptive와 disabled가 있는 thinking 스위치만 있었다. 문서는 이 필드가 검증도 없고 필수 기본값도 없이 전달된다고, 이상하리만치 구체적으로 지적한다 — 제공자는 이를 목록에 없는 값을 수락하거나 거부할 수 있는 허가로 해석했으며, 이는 규격을 준수하는 두 엔드포인트가 동일한 요청에 대해 서로 다르게 동작할 수 있음을 의미한다.

체크포인트에서 두 가지 세부 사항은 별도로 짚어 볼 만한데, 이는 출시 게시물이 흔히 생략하는 종류의 내용이기 때문입니다. 첫째, 이 체크포인트에는 이미지 전처리기 구성과 비디오 전처리기 구성이 모두 포함되어 있습니다 — MiniMax M3.1은 설계상 멀티모달 모델이며, 나중에 비전을 끼워 넣은 텍스트 모델이 아닙니다. 또한 공급자 자체 가이드라인은 새 스택에서 이미지 입력을 거부하지 말라고 합니다. 둘째, 두 번째 체크포인트 배포에서는 MTP와 NEXTN 키를 완전히 제거했고 이를 대체하는 것은 아무것도 추가하지 않았습니다. 그래서 DSpark 드래프트가 별도의 2.3 GB 아티팩트로 제공되어야 했습니다. 메인 가중치에는 활성화할 드래프트 헤드가 없습니다.
M3.1 벤치마크 수치가 없는 이유, 그리고 그것이 실수가 아닌 이유
모든 유출 분석 글은 결국 벤치마크 표를 만들어내거나, 그런 표가 없다고 인정하는 대목에 도달한다. MiniMax M3.1에는 그런 표가 없다. 파트너 사양서는 누군가 그 실수를 저지르는 것을 막기 위해 존재하는 필드에서 이를 명시적으로 밝히고 있다:
• "3.1 기준선은 아직 발표되지 않았습니다. M3 수치를 합격 기준으로 재사용하지 마십시오."
그 지침은 전체 코퍼스에서 가장 유용한 문장입니다. 왜냐하면 이 글의 게으른 버전은 MiniMax M3의 Artificial Analysis 점수를 MiniMax M3.1 제목 아래에 적기 때문입니다. 그래서는 안 됩니다. 같은 저장소는 MiniMax 자체의 M3.1 엔드포인트를 대상으로 AIME-25 및 GPQA-Diamond 프로브를 실행하고, 점수가 확정되지 않은 팀원 대 벤더 비교로 기록합니다: GPQA-Diamond에서는 팀 실행이 0.904, 벤더가 0.813이며, 600문항 MMLU-Pro 하위 집합에서는 0.898 대 0.821입니다. 이는 동일한 평가를 두 번 실행한 결과가 서로 불일치하는 것이지 모델 결과가 아니며, 반복이 집계된 미리보기로 표시됩니다. 오늘 단일 MiniMax M3.1 벤치마크 수치를 인용하는 사람은 아직 존재하지 않는 것을 인용하는 것입니다.
MiniMax M3가 무엇인지, 그래야 속편의 규모를 가늠할 수 있으니까
MiniMax M3는 2026년 5월 말에 출시되어 6월 2일 Hugging Face에 공개되었다. 총 4,280억 개 파라미터에 230억 개가 활성화되고, 60개 레이어, top-4 라우팅을 사용하는 128개 라우티드 전문가, 64개 어텐션 헤드에 대응하는 4개 KV 헤드, 1,048,576 토큰의 컨텍스트 윈도우와 최대 출력 512,000을 갖췄다. 독립적인 측면에서 Artificial Analysis는 Intelligence Index에서 29.2점을 부여해 샘플링된 145개 모델 중 60위로 올렸으며, 코딩 지수에서는 58.6점, 자체 라우팅 텔레메트리에서는 첫 토큰까지 p50 3,348밀리초를 기록했다. MiniMax가 자체적으로 내세운 대표 수치는 BrowseComp에서 83.5인데, 이는 벤더 측 수치이며 그 자체로 감사되지 않았다.
가격은 유출 주기에서 가장 오래 살아남는 부분입니다. MiniMax M3는 입력 토큰 백만 개당 $0.30, 출력 토큰 백만 개당 $1.20이며, 캐시 읽기는 $0.06입니다. 그리고 OrcaRouter에서 minimax/minimax-m3로, 공급자 정가에 0% 마크업으로 라이브되어 있으니, MiniMax가 M3.1을 같은 방식으로 책정한다면 새 요금은 청구 주기가 한 번 지난 뒤가 아니라 그것이 존재하는 그날 바로 저희 쪽에 라이브됩니다.
이 모든 것을 다시 말하는 요점은 향수가 아니다. 이번 주에 사람들이 Hugging Face 조직 페이지를 새로고침하는 이유는 바로, MiniMax M3가 충분히 뛰어나서 그 후속 모델이 관전용 경기가 아니라 실무에서 다뤄야 할 문제가 되었기 때문이다 — 그리고 1M 컨텍스트를 갖춘 4,280억 파라미터 모델이 $0.30/$1.20에 제공된다는 사실은 M3.1이 넘어야 할 기준, 즉 단순한 성능 기준이 아니라 가격 대비 성능 기준을 세운다는 것이다.
익명 리스팅 관점, 그리고 그것이 이미 답변되었을 수 있는 이유
9월 초의 한 실마리는 여기서 매듭지을 만하다. 제3자 코딩 플랫폼에 1,000,000토큰 컨텍스트, $0 가격, 필수 추론 레벨을 내건 익명 스텔스 리스팅이 등장했고, 우리는 이를 Space Bunny Alpha라는 이름으로 다루면서 이런 종류의 모든 익명 리스팅은 결국 어느 벤더의 모델로 귀속된다는 기저율을 짚었다 — Pony Alpha는 Zhipu 모델이 되었고, Hunter Alpha는 Xiaomi의 것이 되었으며, Ox Alpha는 다른 이름의 MiniMax 릴리스가 되었다. 그 리스팅의 토크나이저와 이상 징후 지문은 MiniMax 프리뷰 체크포인트를 가리켰다. MiniMax M3.1이 이번 주에 실제로 등장한다면, 가장 유력한 해석은 그 익명 리스팅이 그 모델의 실전 테스트였다는 것이며, 이 수수께끼는 추가 포렌식 작업이 아니라 발표로 풀린다. 그것은 증거가 아니라 추론이며, 이 글의 마지막 추론이다.

이번 주에 주목할 것과 해야 할 일
유출에서 출시로 바꿔 놓을 신호들은 구체적이고 확인 가능하며, 대부분의 논평이 좇는 신호가 아니다. MiniMaxAI 조직 산하의 공개 Hugging Face 리포지토리—비공개가 아니라—에 모델 카드가 있는 것이 가장 강력한 단일 지표다. 조직의 업로드 이력은 공개되어 있고 모든 릴리스의 날짜를 하루 단위까지 밝혀 준다. MiniMax 모델 페이지나 API 모델 ID가 두 번째다. 공개된 가격이 세 번째이며, 예산에 중요한 항목이다. Artificial Analysis에 릴리스 이후 날짜로 올라온 벤치마크 표가 네 번째이며, 유일하게 독립적인 지표다.
그때까지, 무언가를 구축하는 사람에게 실질적인 입장은 다른 어떤 출시 전 주간과도 다르지 않습니다: 오늘 라우팅할 수 있는 모델은 MiniMax M3이고, 하나의 API 키로 이 모델에 접근할 수 있으며, 동시에 200개 이상의 다른 모델에도 접근할 수 있습니다. 자동 페일오버는 엔드포인트가 흔들려도 장애로 이어지지 않는다는 뜻이며, 라우팅 DSL을 통한 고정 또는 혼합 라우트나 모델 퓨전을 통해 함께 응답하는 모델 패널이 아직 프로덕션에 투입하지 않은 모델의 위험을 줄이는 방법입니다. M3.1이 출시되면, 그것은 마이그레이션이 아니라 하나의 모델 ID 교체입니다 — 이는 유출된 정보에 맞춰 맞춤형 통합을 구축하지 않는 것에 대한 전체 논거입니다.
이 글에서 하지 않을 한 가지는 언제인지 아는 척하는 것이다. 체크포인트는 실재하고, 문서는 구체적이며, 가장 최근의 공개 주장은 누군가 "다음 주"라고 말한 것뿐이다. 이 세 가지 중에서 스스로 확인할 수 있는 것은 처음 두 가지뿐이다.
