제목이 'MiniMax M3.1 Flash Preview vs MiniMax M3'이고 부제가 '이 라인업의 최신 모델이 가장 안전하게 호출할 수 있는 모델은 아니다'인 생성된 히어로 카드. 왼쪽 카드에는 'MiniMax M3.1 Flash Preview: 월 $22-$132 토큰 플랜, 공개된 토큰당 요금 없음, 가중치 비공개, thinking 항상 켜짐'이라고 적혀 있고, 오른쪽 카드에는 'MiniMax M3: 백만 토큰당 $0.30 / $1.20, 가중치 공개, thinking 끄기 가능'이라고 적혀 있다. 하단에는 '둘 다 100만 토큰 컨텍스트 창을 갖추고 있다. MiniMax M3.1 Flash Preview 수치는 platform.minimax.io 기준.'이라고 적혀 있다.
Guides & Insights

MiniMax M3.1 Flash Preview vs MiniMax M3: 더 새로운 모델이 더 위험할 때

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

이제 공급업체 자체 문서에서는 MiniMax-M3.1-Flash-Preview를 MiniMax-M3 위에 기재하고 있는데, 이 순서 자체가 상당한 설득 효과를 내고 있다. 이 모델은 라인업에서 가장 최신 텍스트 모델이고, 동일한 100만 토큰 컨텍스트 창을 갖추었으며, 구형 모델에는 없는 사고 깊이 제어 기능을 추가한다. 그 표가 보여주지 않는 것은, 구형 모델이 둘 중 유일하게 다운로드하고, 토큰당 가격을 책정하고, 무엇이든 상대로 벤치마크하고, 구독 없이 호출할 수 있는 모델이라는 점이다 — 그리고 신형 모델은 MiniMax-M3가 제공하던 스위치를 없애버렸다는 점이다.

이것은 한 모델이 대체되는 이야기가 아니다. 이것은 한 벤더가 자신의 제품 라인을 종량제 주력 모델과 구독 제한형 프리뷰로 분할하는 이야기이며, 이 둘은 어느 방향으로도 서로 바꿔 쓸 수 없다. 다음은 각각이 실제로 무엇인지다.

두 사양서, 나란히

둘 모두에 대해 공급업체 자체 페이지에 명시된 내용부터 시작하십시오. 차이의 형태는 벤치마크 표가 아니라 여기에서 드러나기 때문입니다.

• 발표 — 2026년 6월 1일 MiniMax-M3를 아키텍처 노트, 벤치마크 시트, 요금표와 함께 공개했으며; 2026년 9월 27일 MiniMax-M3.1-Flash-Preview를 문서 항목과 MiniMax 에이전트 계정의 게시물과 함께 공개했습니다 • 컨텍스트 창 — 둘 모두 1,000,000 토큰이며, MiniMax 자체 모델 표 기준입니다 • 최대 출력 — 당사 카탈로그 항목에서 MiniMax-M3의 경우 512,000 토큰이며, 이는 MiniMax가 자체적으로 공개하지 않는 수치입니다; MiniMax-M3.1-Flash-Preview의 경우 어디에도 공개되지 않았습니다 • 입력 모달리티 — 둘 모두 텍스트, 이미지, 비디오 입력, 텍스트 출력 • 사고 제어 — MiniMax-M3가 건너뛰도록 지시할 수 있는 사고 매개변수이며, reasoning_details을 통해 reasoning_split; MiniMax-M3.1-Flash-Preview에서는 사고가 필수이며 reasoning_split을 비활성화할 수 없습니다 • 사고 깊이 — MiniMax-M3에서는 사용할 수 없습니다; effort 사다리가 있으며: low, medium, high, xhigh, max의 기본값은 max, MiniMax-M3.1-Flash-Preview 기준 • 공개된 출력 속도 — MiniMax-M3의 경우 초당 약 100+ 토큰이며, MiniMax 자체 모델 표 기준입니다; MiniMax-M3.1-Flash-Preview에 대해서는 공개된 내용이 없습니다 • 가중치 — MiniMax-M3는 공개 저장소가 있는 오픈 웨이트입니다; MiniMax-M3.1-Flash-Preview는 없습니다 • 가격 — 공급자 요율 기준 MiniMax-M3의 경우 백만 입력 토큰당 $0.30, 백만 출력 토큰당 $1.20; MiniMax-M3.1-Flash-Preview에는 토큰당 요율이 없습니다 • 액세스 — MiniMax-M3는 종량제 및 Token Plan에서 사용 가능하며, 타사 플랫폼을 통해 라우팅할 수 있습니다; MiniMax-M3.1-Flash-Preview는 Token Plan 및 MiniMax Code에서만 사용 가능합니다

거기 있는 두 행은 나머지와는 다른 범주에 속한다. 공개된 출력 속도는 구형 모델에 대해서만 업체가 제시한 수치이므로, 신형 모델은 수치도 붙지 않은 채 빠른 모델로 팔리고 있다. 그리고 생각 제어는 마케팅과 반대 방향으로 움직였다: 신형 모델은 얼마나 생각할지를 더 세밀하게 제어할 수 있게 해 주면서도, 생각을 아예 멈추게 할 수 있는 능력은 없애 버렸다.

MiniMax가 없앤 스위치

이것은 가장 문제가 될 가능성이 큰 세부 사항이며, 숨겨진 것이 아니라 문서화되어 있습니다. MiniMax-M3의 경우, thinking: {"type": "disabled"}를 OpenAI 호환 엔드포인트에서 보내면 사고를 건너뛰고 직접 답변을 반환합니다. Anthropic 호환 엔드포인트에서는 사고가 기본적으로 꺼져 있으며 다음으로 활성화할 수 있습니다: adaptive. MiniMax-M3.1-Flash-Preview에서는 동일한 요청이 HTTP 400과 함께 메시지를 반환합니다: adaptive 사고가 필요합니다. 비추론 응답을 얻을 수 있는 지원되는 방법은 없습니다.

실질적으로 이는 MiniMax-M3를 저렴하고 빠른 분류기나 라우터로 사용하던 워크로드, 즉 짧은 프롬프트를 넣고 짧은 구조화된 답변을 받아내며 사고 연쇄가 없는 작업이 최신 모델로 곧바로 갈아탈 수 있는 업그레이드 경로가 없다는 뜻입니다. effort를 low로 낮출 수는 있으며, MiniMax의 안내에서도 사고를 비활성화하기보다 effort를 낮추는 것이 사고 지연 시간과 토큰을 줄이는 의도된 방법이라고 명확히 밝히고 있습니다. 하지만 토큰과 지연 시간이 0이 되는 것은 아니며, 호출 한 번에 필드 네 개를 기록하는 대량 추출 작업에서 "항상 먼저 사고함"은 "요청할 때 사고함"과는 다른 비용 구조입니다.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs MiniMax M3 — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Thinking off: not allowed (HTTP 400)', 'Thinking depth: effort low to max', 'Published speed: none', 'Open weights: no', 'Per-token price: not published'. The right column, MiniMax M3, reads 'AA Intelligence: 29.2', 'Thinking off: supported', 'Thinking depth: not available', 'Published speed: 100+ tokens per second (vendor)', 'Open weights: yes', 'Per-token price: $0.30 / $1.20'. A footer reads 'MiniMax M3 figures per Artificial Analysis and MiniMax; MiniMax M3.1 Flash Preview has no independent scores of any kind.'

각각에서 실제로 측정되는 것은 무엇인가

이 비교의 한쪽에는 숫자가 있고 다른 한쪽에는 빈 열이 있는데, 어느 숫자가 누구의 것인지 정확히 하는 것이 좋습니다.

MiniMax-M3의 독립적인 기록은 사실입니다: Artificial Analysis는 이를 Intelligence Index에서 29.2로 평가합니다 — 145개 중 60위 — Coding Index 58.6, Math index 59.18, 같은 index family 기준 GPQA Diamond 92.9%, long-context recall 83%, IFBench 82.9%를 기록했습니다. 이는 누구나 다운로드해 다시 실행할 수 있는 모델에 대한 제3자 평가입니다. M3에 대한 MiniMax 자체 출시 수치 — BrowseComp 83.5%, SWE-Bench Pro 59.0%, Terminal-Bench 2.1 66.0%, MCP Atlas 74.2%, OSWorld-Verified 70% — 는 벤더 측 수치이며, 우리는 그것이 재현되는 것을 본 적이 없습니다.

MiniMax-M3.1-Flash-Preview에는 둘 다 없습니다. MiniMax는 벤치마크 표를 공개하지 않았고, 이 모델은 Artificial Analysis의 인덱스에 항목이 없습니다. 따라서 독립적인 점수도, 코딩 지수도, 장문맥 회상 수치도, 환각 측정치도 없습니다. 세간에 유통되는 이 모델에 대한 모든 표현 — "빠름", "신뢰할 수 있음", "일상 개발을 위해 만들어짐" — 은 출시 게시물에서 벤더가 직접 쓴 형용사입니다. 이 부재는 양쪽으로 작용하기 때문에 분명히 말할 가치가 있습니다: 더 나쁘다는 것이 입증된 바도 없고, 더 낫다는 것이 입증된 바도 없습니다.

그 비대칭성이 바로 이 결정의 전부입니다. MiniMax-M3는 오늘 오후에 다운로드하거나 호출하여 평가할 수 있고, 그 평가를 공개 스코어보드와 비교할 수도 있습니다. MiniMax-M3.1-Flash-Preview의 경우에는 그저 사용해 보고 개인적인 의견을 형성할 수 있을 뿐입니다.

새로운 모델이 진정으로 우위를 점하는 지점

위 내용을 새로운 모델을 무시해야 한다는 논거로 읽기는 쉽겠지만, 그것 역시 올바른 결론은 아니다. 그 모델에 실재하며 그 모델에만 특유한 세 가지가 있다.

effort ladder는 단순한 토글이 아니라 진짜 기능입니다. 다섯 단계 — low부터 max까지 — 를 통해 하나의 모델이 사소한 이름 변경과 저장소 전체 리팩터링을 서로 다른 연산 비용으로 처리할 수 있으며, 이는 MiniMax-M3.1-Flash-Preview에서만 효과적인 것으로 문서화되어 있습니다. MiniMax-M3에서는 선택지가 이분법적입니다. 작업별 지연 시간을 예측할 수 없다는 것이 문제라면, 조정 가능한 깊이가 바로 원하던 제어 수단입니다.

그것은 해당 벤더의 현재 최상위 모델이며, 이는 6월 이후 M 시리즈 계보가 습득한 모든 것을 그대로 이어받는다는 뜻이다. 그리고 MiniMax는 이것이 에이전트형 추론, 도구 사용, 코딩 및 장문맥 작업을 위한 최신 모델이라고 분명히 밝힌다. M3가 도입한 인터리브 사고(interleaved-thinking) 도구 사용 메커니즘도 그대로 이어지며, 여기에는 전체 응답을 — 사고 블록까지 모두 — 메시지 기록에 다시 추가해야 한다는 요구 사항도 포함된다.

그리고 그것은 구독 안에서 Flash 가격대로 동영상을 입력받습니다. MiniMax-M3도 토큰당 가격으로 그렇게 합니다. 이미 Token Plan 좌석을 지불하고 있고 동영상 입력을 사용하는 데 유일한 장벽이 호출당 한계 비용이었다면, M3.1-Flash-Preview가 그 장벽을 없애줍니다.

구형 모델이 여전히 정답인 경우

세 가지 사례, 모두 품질보다는 예측 가능성에 관한 것이다.

비용을 모델링해야 할 때. MiniMax-M3에는 요금표가 있습니다: 백만 입력 토큰당 $0.30, 백만 출력 토큰당 $1.20, 그리고 우리 카탈로그에 있는 캐시 읽기 요금은 백만 토큰당 $0.06입니다. 실행하기 전에 워크로드의 월별 청구서를 센트 단위까지 추정할 수 있습니다. MiniMax-M3.1-Flash-Preview는 MiniMax의 페이지 어디에도 토큰당 요금이 없으므로, 그 비용은 구독료를 사용량으로 나눈 값입니다 — 고정 예산에는 적합하지만, 단위 경제성에는 쓸모가 없습니다.

모델이 정말 모델이어야 할 때. MiniMax-M3는 오픈 웨이트입니다: 직접 다운로드하고, 자체 하드웨어에서 실행하며, 6개월 뒤에도 여러분의 호출에 응답하는 결과물이 오늘 응답하는 것과 동일하다는 것을 알 수 있습니다. MiniMax-M3.1-Flash-Preview에는 체크포인트가 없으며, 프리뷰 등급 접근은 서빙 스택, 할당량 구성, 가용성이 모두 벤더 통제 하에 있고 명시적으로 변경될 수 있음을 의미합니다.

추론 없는 답변이 필요할 때. 위와 마찬가지로 — 이것은 비교에서 유일한 능력 퇴행이며, 사람들을 놀라게 하는 바로 그 지점입니다. 왜냐하면 이전 모델이 할 수 있었던 일을 할 수 없는 더 새로운 모델은 누구도 대비하는 사례가 아니기 때문입니다.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, followed by the language model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', above MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

한 곳에서 둘 다 호출하기

여기서 어색한 점은 두 모델의 구매 방식이 서로 다르다는 것입니다 — 하나는 종량제, 하나는 구독제 — 그래서 자연스러운 본능은 한쪽 편을 고르는 것이죠. 더 유용한 선택은 작업 형태에 따라 둘 사이를 라우팅하는 것이며, 이는 종량제 쪽이 다른 모든 것과 같은 곳에서 접근 가능할 때만 작동합니다.

OrcaRouter의 MiniMax-M3는 MiniMax의 정가에 0% 마크업만 더한 가격을 적용하므로, 요금표에 적힌 $0.30과 $1.20이 곧 호출 비용이며 플랫폼 마진은 전혀 붙지 않습니다. 이 모델은 MiniMax M2.7과 동일한 OpenAI 호환 엔드포인트에 올라가 있으며 — 200,000토큰 윈도우에 동일한 $0.30/$1.20 가격표, 역시 오픈 가중치 — 200개 이상의 다른 모델과도 마찬가지로, 하나의 API 키 뒤에, 그리고 제공자 간 자동 장애 조치가 엔드포인트 하나가 흔들릴 때 작동합니다. 벤더가 제시하는 수치와는 성격이 다른 저희 자체 텔레메트리와 비교해 보면: 지난 7일 동안 M3는 초당 약 238개의 출력 토큰 속도로 응답했고, 첫 토큰까지의 p50은 약 4.1초였으며, 오류율은 0.15%에 가까웠습니다. 이는 OrcaRouter 플레이그라운드에서 측정한 값입니다. MiniMax-M3를 파이프라인의 든든한 절반으로 두고 MiniMax-M3.1-Flash-Preview를 실험적인 절반으로 다루고 싶다면, 든든한 절반은 두 번째 벤더 관계가 아니라 설정 한 줄이면 됩니다. MiniMax-M3.1-Flash-Preview 자체는 저희 카탈로그에 없으며, 그 경로는 벤더 자체의 Token Plan과 코딩 제품입니다.

이 기사를 바꿔 놓을 요인은 구체적이고 지켜보기 쉽다. MiniMax-M3.1-Flash-Preview의 공개된 요금표가 나오면, 경제성 측면에서 M3를 선호할 주된 이유가 무너질 것이다. 독립적인 점수 한 세트가 있으면 빈 열을 비교 가능한 무언가로 대체할 수 있을 것이다. 다운로드 가능한 체크포인트가 있으면 재현성 반론을 없앨 수 있을 것이다. 그중 최소한 하나가 나오기 전까지는, MiniMax-M3가 이 조합에서 책임을 물을 수 있는 모델로 남는다 — 그리고 더 새로운 쪽은 MiniMax가 토큰이 아니라 월 단위로 과금하기로 결정한, 더 빠르고 더 잘 제어되지만 측정되지 않은 프리뷰로 남는다.

A headless Chromium screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the model title 'MiniMax: MiniMax M3', a context length of 1,048,576 tokens, a maximum output of 512,000 tokens, and a pricing panel reading 0.300 US dollars per million input tokens, 1.20 per million output tokens and 0.060 per million cache-read tokens, captured 28 September 2026.