
MiniMax M3.1 Flash Preview, 토큰 플랜에서 출시: 구독으로 실제 누릴 수 있는 것
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 468 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 192 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
MiniMax-M3.1-Flash-Preview는 2026년 9월 27일 출시되었는데, 그 출시 방식 자체가 화제다. 이것은 종량제 모델이 아니다. 공급업체는 최신 텍스트 모델을 이미 MiniMax-M3, MiniMax M2.7 및 M2.7-highspeed 변형을 포괄하는 동일한 Token Plan Subscription Key로 접근하도록 해 두었다. 따라서 시트를 보유하고 있다면 새로 발급받을 키도, 두 번째로 서명할 계약도 없다. 오늘 기준으로 또한 없는 것은 토큰당 가격, 모델 카드, 공개된 벤치마크, 또는 모델의 thinking을 끄는 방법이다.
마찰 없는 접근성과 전혀 공개되지 않은 경제성이 결합된 이 조합은, 누군가 여기에 프로덕션 파이프라인을 연결하기 전에 한번 파헤쳐 볼 가치가 있을 만큼 이례적입니다. 이 글의 나머지에서는 벤더 자체 문서가 실제로 말하는 것, 눈에 띄게 말하지 않는 것, 그리고 이 모델이 당신의 업무 방식에 맞는지 1분 안에 알려줄 단 한 줄의 코드를 다룹니다.
9월 27일에 실제로 무엇이 도착했는가?
MiniMax의 개발자 문서에는 이제 모든 텍스트 모델 페이지마다 반복되는 상시 안내 문구가 있습니다: MiniMax-M3.1-Flash-Preview는 현재로서는 Token Plan과 MiniMax Code를 통해서만 사용할 수 있습니다. 이 모델은 벤더 자체의 모델 표에서 MiniMax-M3보다 위에 가장 먼저 등장하며, 1M 컨텍스트 윈도우와 조정 가능한 사고 깊이를 갖춘 최전선 멀티모달 코딩 모델로 설명됩니다.
• 컨텍스트 윈도우 — 1,000,000 토큰, MiniMax-M3가 갖는 것과 동일한 상한
• 입력 모달리티 — 텍스트, 이미지 및 비디오, 텍스트 반환
• 사고 깊이 — effort 설정은 low, medium, high, xhigh 및 max를 받아들이며, 생략 시 기본값은 max입니다
• 프로토콜 지원 — 동일한 모델 ID가 MiniMax의 Anthropic 호환 엔드포인트, OpenAI 호환 엔드포인트 및 OpenAI Responses 엔드포인트에서 작동합니다
• 사용 가능성 — Token Plan 및 MiniMax Code에서만; 종량제에서는 제공되지 않음
• 가격 — 토큰당 요금이 어디에도 공개되지 않음
• 가중치 — 없음; MiniMaxAI 조직의 가장 최근 공개 저장소 두 개는 여전히 MiniMax-Music3 및 MiniMax-H3입니다
• 독립 벤치마크 — 없음; 이 모델은 Artificial Analysis의 모델 인덱스에 항목이 없습니다
회사는 같은 날 자사의 MiniMaxAgent 계정에서 이를 발표하며, 최전선 작업보다는 일상적인 개발을 위한 것으로 자리매김했다: 빠르고 안정적이며, 간단한 버그 수정부터 전체 기능 개발까지. 이는 Flash 등급에 주어진 임무이지, 플래그십에 주어진 임무가 아니다. PANews와 KuCoin의 제3자 통신 보도도 같은 표현으로 이를 설명하며, 개발자들이 회사가 확인하기 전에 MiniMax Code 선택기에서 해당 모델을 발견했다고 언급했다.

어떤 키를 사용하는지가 평소보다 더 중요합니다
이 부분이 사람들을 당황하게 만드는 지점입니다. MiniMax는 두 가지 별도의 자격 증명 유형을 운영하며, M3.1-Flash-Preview는 그중 하나에만 응답합니다. Token Plan Subscription Key는 Billing > Token Plan에서 발급되며 구독 사용량과 구매한 Credits를 포괄합니다. pay-as-you-go API Key는 토큰당 과금 모델을 포괄합니다. 벤더 문서는 두 키가 상호 교환 가능하지 않으며, Subscription Key가 어떤 유료 리소스도 연결되기 전에 존재할 수 있다고 — 이 경우 뒤에 아무것도 없는 유효한 키입니다 — 명확히 밝히고 있습니다.
따라서 실질적인 기준은 "MiniMax API 키가 있는가"가 아니라 "Token Plan 시트가 있는가"입니다. 기존 시트는 이미 적용됩니다. 문서에 따르면 Subscription Key는 시트 또는 Credits 접근 권한이 할당될 때 사용할 수 있게 되며, 구독 할당량이 소진되면 Credits 초과분이 자동으로 차감됩니다.
가격 페이지를 먼저 읽는 사람이라면 누구나 혼란을 겪게 될 테니, 알아 둘 만한 문서상의 불일치가 하나 더 있습니다. Token Plan 가격 페이지의 적용 범위 각주에는 여전히 대상 라인업이 M3, M2.7, 이미지 및 음성으로 나와 있고 H3는 제외되어 있습니다. 즉 M3.1-Flash-Preview를 명시하도록 업데이트되지 않았습니다. 모델 페이지들은 그와 반대로 말합니다. M3.1-Flash-Preview는 Token Plan에서만 사용할 수 있고 그 외에는 불가능하다고요. 두 페이지 모두 오늘 기준으로 실제 운영 중인 벤더 페이지입니다. 오직 당신 손에 있는 키만이 이를 판가름합니다.
이게 어떤 종류의 모델인지 알려주는 400
모든 MiniMax M 시리즈 모델은 답변하기 전에 생각하지만, M3.1-Flash-Preview는 멈추기를 거부하는 첫 번째 모델입니다. 다음을 보내면 thinking: {"type": "disabled"} 또는 reasoning_effort: "none" API는 다음과 같은 메시지와 함께 HTTP 400을 반환합니다:
모델 "MiniMax-M3.1-Flash-Preview"은(는) 적응형 사고를 필요로 합니다. thinking.type="disabled"(reasoning.effort=none 포함)는 허용되지 않습니다 (2013)
벤더 자체의 권장 사항은 effort를 낮추는 것이지 사고를 비활성화하려는 시도가 아닙니다. 그리고 이 사다리는 지연 시간 레버입니다: 일상적인 편집에는 low, 저장소 전체 변경에는 xhigh가 사용되며, 이는 동일한 모델이 서로 다른 트레이드오프를 하는 것입니다. 이 모델에만 해당하는 두 가지 세부 사항이 더 있습니다. reasoning_effort 매개변수는 MiniMax-M3.1-Flash-Preview에서만 유효한 것으로 문서화되어 있습니다 — 일반적인 M 시리즈 제어가 아닙니다. 그리고 reasoning_split 출력 스위치는 사고를 reasoning_content 필드로 분리하는 기능인데, 이 모델에서는 현재 false로 설정할 수 없습니다.
thinking 텍스트가 어디에 위치하는지는 프로토콜에 따라 다릅니다: Anthropic 호환 엔드포인트는 이를 thinking 콘텐츠 블록으로 반환하고, OpenAI 호환 엔드포인트는 이를 reasoning_content로 반환하며, Responses 엔드포인트는 이를 추론 출력 항목으로 반환합니다. MiniMax-M3 출력에서 <think> 태그를 파싱하고 있었다면, 최신 모델에서는 그 작업이 더 이상 필요하지 않습니다 — 그리고 인터리브된 도구 사용 대화의 경우, thinking 블록을 포함한 전체 응답을 메시지 기록에 다시 추가해야 하며, 그렇지 않으면 추론 체인이 끊어집니다.
현재 진행 중인 프로모션
MiniMax Code는 UTC+8 기준 9월 28일부터 10월 7일까지 출석 체크 프로모션을 진행하며, 매일 로그인 시 지급되는 무료 크레딧을 두 배로 늘리고 신규 및 기존 사용자 모두에게 개방합니다. 지급된 크레딧은 지원되는 모델 전반에 적용되며, M3.1-Flash-Preview와 H3 비디오 모델이 예로 언급되었습니다. 별도로, 회사는 Token Plan 할당량이 출시 시 모든 사용자에 대해 초기화되었으며 이벤트 기간 중 추가 초기화가 계획되어 있다고 밝혔고, 자격 여부는 앱 내에서 확인할 수 있습니다.
그 두 가지는 출시 보도를 통해 전달된 공급업체 발언으로 취급하세요. 이는 날짜가 붙은 프로모션 조건이며 제품 동작이 아니고, 같은 보도에서는 해당 발표가 체크인당 크레딧 수나 미체크인 날짜에 대한 정확한 규칙을 명시하지 않았다고 지적합니다. 정상 상태의 경제성은 말하기 더 쉽습니다: Token Plan은 Plus의 경우 월 $22, Max의 경우 $55, Ultra의 경우 $132에 책정되며, 5시간 롤링 및 주간 할당량 윈도우를 두고, 공급업체가 각각 대략 동시 에이전트 3~4개, 4~5개, 6~7개로 산정했습니다. Purchased Credits는 1달러당 1,000크레딧이며 각 모델의 종량제 정가로 차감됩니다.
이 모델에게 아직 없는 네 가지
다음 내용 중 어느 것도 모델에 대한 비판이 아닙니다. 각각은 팀이 미리 대비해 계획해야 하는 허점이며, 네 가지 모두 오늘날 검증할 수 있습니다.
• 가격 없음. MiniMax의 어떤 페이지에도 M3.1-Flash-Preview의 토큰당 요금이 없으므로, M3의 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $1.20와 비교할 수도 없고, 토큰당 비용 기준으로 다른 무엇과도 비교할 수 없다.
• 벤치마크 없음. MiniMax는 이번 릴리스와 함께 어떤 평가 표도 공개하지 않았다. 다른 누구도 마찬가지다. 이 모델은 Artificial Analysis 지수에 없으므로, 해당 칼럼은 단지 아직 이른 것이 아니라 실제로 비어 있다.
• 가중치 없음. MiniMax-M3는 오픈 가중치로 출시되었지만, M3.1-Flash-Preview에는 저장소도 없고 다운로드 가능한 체크포인트도 없다.
• 독립적 측정 없음. 제3자로부터의 출력 속도, 지연 시간 또는 오류율 수치가 없으며, 이 모델이 우리 카탈로그에 없기 때문에 우리 자체 라우팅 텔레메트리에서도 나온 수치가 없다.
2026년 6월의 M3 출시가 첫날부터 아키텍처 노트, 벤치마크 시트, 요금표를 함께 내놓은 것과 대비하면, 이번은 의도적으로 조용한 출시다. 그럴듯한 해석은 — 그리고 이는 해석일 뿐, 공식적으로 밝힌 계획은 아니다 — MiniMax가 모델의 가격을 정하고 공개 여부를 결정하기 전에 자사 제품 안에서 실제 사용을 원한다는 것이다.

유출된 프리뷰 노트가 맞힌 것
출시 나흘 전, 공개 파트너 저장소에 전사된 미리보기 문서가 유포되었는데, 희소 어텐션, Q8KV4 어텐션 양자화, NVFP4 라우티드 전문가, DSpark 추측 디코딩 헤드, 그리고 max부터 low까지 값을 취하는 새로운 reasoning_effort 필드를 갖춘 MiniMax M3.1을 설명하고 있었습니다. 당시 우리는 이를 미검증으로 다뤘습니다. 실제로 그랬으니까요: 가중치도, 모델 카드도, 가격 페이지도, API 모델 ID도 존재하지 않았습니다.
그 다섯 가지 주장 중 하나는 이제 벤더 자체 문서로 확인되었으며, 그것은 바로 reasoning_effort 필드입니다 — 최대에서 최소로 이어지는 사다리를 포함하며, 이는 출시된 값들과 정확히 일치합니다. 나머지 네 가지는 여전히 확인되지 않았습니다. MiniMax가 공개한 M3.1-Flash-Preview 설명에는 100만 컨텍스트 창과 조정 가능한 사고 깊이를 갖춘 프런티어 멀티모달 코딩 모델이라는 점만 적혀 있을 뿐, 어텐션 방식이나 양자화, 디코딩 헤드는 설명하지 않습니다. 희소 어텐션과 NVFP4 주장을 확정된 사양인 양 반복하는 사람은 제3자의 필사본을 반복하는 것이며, 이는 바로 이번 릴리스가 확인하지 않은 부분입니다.
그것에 파이프라인을 걸지 않고 시도해 보고 싶다면
토큰 플랜 전용 프리뷰의 어색한 점은, 새 모델을 평가하는 자연스러운 방법—기존 스택에서 호출해 측정하는 것—이 바로 깔끔하게 할 수 없는 유일한 일이라는 점입니다. 모델링에 비교할 토큰당 요금도 없고, 공개된 지연 시간 프로필도 없으며, 프리뷰가 불안정해질 경우 벤더 자체 제품 내에서의 페일오버 방안도 없습니다.
그것이 라우팅 계층이 만들어진 상황입니다. 오늘 호출할 수 있는 모든 것은 하나의 OpenAI 호환 엔드포인트와 하나의 API 키 뒤에 있습니다. 그리고 이와 인접한 모델들은 이미 있습니다: 공급사 요금으로 MiniMax-M3는 백만 입력 토큰당 $0.30, 백만 출력 토큰당 $1.20이고, MiniMax M2.7은 동일한 가격표에 200,000토큰 창과 오픈 가중치를 갖추고 있으며, DeepSeek와 Qwen Flash 계층도 같은 가격대에 있습니다. 우리 쪽 가격은 공급사 정가를 0% 마크업으로 그대로 전달한 것이므로, 공급사가 요금을 인하하면 재협상 주기가 아니라 같은 날 여기에 반영됩니다. 자동 장애 조치는 미리보기 등급 의존성을 프로덕션 경로 아래가 아니라 옆에 둘 수 있음을 의미하며, MiniMax가 MiniMax-M3.1-Flash-Preview의 요금표와 엔드포인트를 실제로 공개하면 문제는 마이그레이션 프로젝트가 아니라 라우팅 테이블 항목이 됩니다. MiniMax-M3.1-Flash-Preview 자체는 우리 카탈로그에 없으며, 오늘 그것에 접근하는 방법은 공급사 자체의 Token Plan과 코딩 제품입니다.
출시일에 이 글을 읽는 팀을 위한 솔직한 요약: 이 모델은 이미 서비스 중이고, 이미 Token Plan 시트를 결제하고 있다면 한계 비용 측면에서는 무료이며, 그 자체 기준으로는 가격도 측정도 전혀 되어 있지 않습니다. MiniMax Code에서 한번 돌려 보고, 의존하는 파이프라인은 요금표와 입증된 실적을 갖춘 모델 위에 유지하고, 이것을 호기심에서 의사결정으로 바꿔 놓을 두 가지 — 공개된 가격과 첫 독립 평가 점수 — 를 지켜보십시오.

