
Mistral Large 4 vs MiniMax M3: 다섯 달의 진보가 치르는 대가
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 151 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 116 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 249 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
MiniMax M3는 이 등급에서 가장 저렴한 모델이며 2026년 5월 31일부터 계속 그렇습니다. 입력 토큰 100만 개당 $0.30, 출력 100만 개당 $1.20, 캐시 100만 개당 $0.06으로, 입력에서는 Mistral Large 4를 약 절반, 출력에서는 약 두 배 차이로 밑돌며 — 그리고 더 새로운 모델과 달리, 오늘 프리뷰 라벨 없이 구매할 수 있습니다. 2026년 10월 6일부터 공개 프리뷰 중인 1.05조 매개변수 오픈 웨이트 모델인 Mistral Large 4는 $0.68과 $2.09의 비용이 들며 이달 말까지 가중치를 공개하겠다고 약속합니다. 다섯 달 간격을 두고 나온 두 오픈 웨이트 플래그십 모델이 있으며, 그 다섯 달은 정확히 한 곳에서 드러납니다: M3의 독립 Intelligence Index 점수 29.2 대 아직 존재하지 않는 Mistral Large 4의 점수.
이것이 이 비교의 솔직한 모습이며, 가격표가 시사하는 것보다 더 흥미롭다. M3는 특정 아키텍처적 승부수 — 100만 토큰이 넘는 컨텍스트를 지속하는 MiniMax Sparse Attention, 그리고 비디오를 일급 입력으로 삼는 것 — 를 중심으로 만들어졌고, Mistral Large 4가 겨루지 않는 두 범주에서 서류상으로 이긴다: 원시 출력 길이와 네이티브 비디오다. 그 외 모든 면에서는 더 새로운 모델이 구매자가 더 선호할 쪽이며, 그 차이가 구매를 거의 좌우하지 않을 만큼 여전히 낮은 가격이다.
두 가지 아키텍처, 두 가지 베팅
MiniMax M3는 MiniMax의 플래그십 오픈웨이트 파운데이션 모델이자, 최전선 수준의 코딩 및 에이전트 성능과 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달리티를 하나의 릴리스에 결합한 최초의 모델입니다. 텍스트, 이미지, 영상을 입력받아 텍스트를 반환하며, 최대 1,048,576 토큰의 컨텍스트를 보장된 최소 512K와 함께 유지하도록 설계된 아키텍처인 MiniMax Sparse Attention을 기반으로 구축되었습니다. 사전학습 파이프라인은 멀티모달 데이터를 나중에 덧붙이는 방식이 아니라 첫 단계부터 포함하여 100조 토큰을 넘어설 때까지 확장할 수 있도록 재구축되었습니다. 최대 출력은 512,000 토큰입니다.
Mistral Large 4는 다른 베팅을 합니다. 이는 세분화된 전문가 혼합(mixture-of-experts) 모델로, 총 1조 500억 개 중 490억 개의 활성 파라미터를 지녔고, 16억 개 파라미터의 비전 인코더를 갖추었으며, 160개 이상의 언어에 걸친 데이터로 Mistral 자체의 유럽 데이터센터 안에서 NVIDIA Grace Blackwell GPU 3,800개로 처음부터 학습되었습니다. 약 100만 토큰의 컨텍스트에 걸쳐 텍스트와 이미지를 처리하며 — 비디오는 지원하지 않습니다 — Mistral은 이를 소버린 배포: 유럽 인프라, 오픈 웨이트, 자체 정책 아래 실행할 수 있는 능력을 중심으로 포지셔닝하고, 사이버보안을 대표 사용 사례로 삼습니다.
• 컨텍스트 윈도우 — MiniMax M3 1,048,576 토큰 vs Mistral Large 4 약 1,000,000
• 최대 출력 — MiniMax M3 512,000 토큰 vs Mistral Large 4는 아직 문서화되지 않음
• 입력 모달리티 — MiniMax M3 텍스트, 이미지 및 비디오 vs Mistral Large 4 텍스트 및 이미지
• 입력 가격 — MiniMax M3 1M당 $0.30 vs Mistral Large 4 1M당 $0.68
• 출력 가격 — MiniMax M3 100만 개당 $1.20 vs Mistral Large 4 100만 개당 $2.09
• 캐시된 입력 — MiniMax M3 1M당 $0.06 대 Mistral Large 4 1M당 $0.07
• 파라미터 — Mistral Large 4 총 1.05T / 활성 49B vs MiniMax M3 미공개
• 출시됨 — MiniMax M3 2026년 5월 31일 vs Mistral Large 4 2026년 10월 6일, 프리뷰
• 가중치 — 둘 다 오픈 라이선스, Mistral Large 4의 가중치는 2026년 10월 말까지 공개 약속

점수판은 팽팽하지도 않고, 공정하지도 않다
Artificial Analysis Intelligence Index v4.3.2에서 MiniMax M3는 29.2점을 기록하며 147개 모델 중 62위에 올랐습니다. 이는 중간권 성적이며, 해당 모델에 대한 비판은 아닙니다. 이 Index는 M3 출시 이후 개정되었고, MiniMax가 훈련하던 당시에는 존재하지 않았던 평가들을 포함하고 있기 때문입니다. 코딩 하위 점수는 더 나은 이야기를 들려줍니다. AA Coding index에서 58.6점으로 138개 중 46위, Terminal-Bench 2.1에서 65.2%를 기록했습니다. GPQA Diamond에서 92.9%, 장문맥 회상에서 83%, SciCode에서 47.1%를 유지하고 있습니다.
Mistral Large 4는 같은 리더보드에서 Index 점수가 없습니다. 페이지는 "Mistral Large 4 Preview"라는 제목으로 공개되어 있지만 그 숫자는 빠져 있습니다. Mistral이 실제로 공개하는 것은 ML4가 통합 Coding Agent Index에서 49.8%로 DeepSeek V4 Pro 0813과 Qwen3.8 Max를 앞선다는 점과, AutomationBench — Gmail, Sheets, Slack, Salesforce 전반의 657개 비즈니스 워크플로 — 에서 59.9%를 기록해 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro보다 앞선다는 점입니다. MiniMax는 두 비교 어디에도 이름을 올리지 않았는데, 이는 Mistral이 어떤 모델을 진짜 경쟁자로 여기는지에 대한 신호 그 자체입니다.
그러니 공정하게 해석하자면 이렇다: M3는 성능이 괜찮고, 저렴하며, 문서화가 잘 된 모델로, 종합 점수는 중위권이고 코딩 프로필은 괜찮은 편이며, 출시된 지 5개월 되었다. ML4는 더 높은 상한을 주장하는 프리뷰 모델로, 공개된 종합 점수도 없고, Artificial Analysis가 비공개로 평가했으며 해당 하네스가 출시되면 Coding Agent Index에 공개할 일련의 에이전트 관련 수치들이 있다. 오늘 당장 숫자가 필요하다면 M3가 그 숫자를 준다. 몇 주만 기다릴 수 있다면 ML4도 그 숫자를 줄 것이고, Mistral은 그것이 더 높을 것이라는 데 걸고 있다.
M3가 ML4로부터 전혀 경쟁을 받지 않는 경우
그 목록의 두 행은 상충 관계가 아니라, 부재입니다.
동영상 입력이 첫 번째다. M3는 텍스트 및 이미지와 함께 동영상을 네이티브로 지원한다. Mistral Large 4는 텍스트와 이미지만 입력받으며 그 외에는 아무것도 입력받지 않는다 — Mistral 자체의 딥다이브는 기가픽셀 위성 이미지와 엔지니어링 도면에 대한 그라운딩에 관한 것이며, 이는 여전히 이미지 작업이다. 여러분의 파이프라인이 화면 녹화, 감시 영상 또는 동영상 문서를 입력으로 받는다면, ML4는 가격이 어떻든 모델이 될 수 없다. 그것은 Mistral이 가격 재조정으로 메울 격차가 아니다.
출력 길이는 두 번째입니다. M3는 단일 응답에서 최대 512,000개의 토큰을 생성합니다. Mistral은 ML4에 대한 출력 상한을 공개하지 않았습니다. 한 번에 긴 구조화된 산출물 — 전체 보고서, 대규모 마이그레이션 스크립트, 완전한 명세 — 을 생성하는 것은 512K 상한이 Intelligence Index 1점보다 더 가치 있는 워크로드이며, Mistral이 ML4의 한도를 문서화할 때까지 M3는 그 워크로드를 염두에 두고 계획할 수 있는 둘 중 유일한 모델입니다.
M3의 벤더 보고 에이전트 수치는 같은 프로필을 뒷받침한다. MiniMax는 자율 웹 리서치 부문 BrowseComp에서 83.5, 컴퓨터 사용 부문 OSWorld-verified에서 70, 도구 사용 부문 MCP Atlas에서 74.2, GDPval 루브릭에서 76.7, SWE Bench Pro에서 59로 평가한다. 이는 MiniMax 자체 평가에서 나온 것으로 독립적으로 재현된 적이 없으며, 29.2라는 Index 점수와는 어울리지 않게 놓인다 — 바로 이것이 벤더 대 독립 평가의 구분이 중요한 이유다. 한 모델이 벤더가 선택한 벤치마크에서는 선두를 달리면서도 중립적인 10개 평가 평균에서는 중간권에 머물 수 있으며, 두 가지 모두 사실일 수 있다.
2x는 그만한 가치가 있나요?
여기서 가격 차이는 절대 금액으로 보면 정말 작으며, 이는 폐쇄형 플래그십과의 불일치와 비교할 때 셈법을 바꿔 놓습니다. 한 달에 1억 토큰을 입력/출력 4:1 비율로 사용한다고 가정해 보겠습니다: 입력 토큰 8,000만 개, 출력 토큰 2,000만 개입니다. M3는 $24에 $24를 더해 총 $48을 청구합니다. Mistral Large 4는 $54.40에 $41.80을 더해 총 $96.20을 청구합니다. 프리미엄은 월 약 $48입니다 — 규모가 커지면 적지 않은 돈이지만, 실패를 단 한 번만 피해도 충당되는 종류의 격차입니다.
캐싱은 그 격차를 더 좁혀 주지만 M3에 유리한 정도는 아주 미미합니다. 캐시된 토큰 100만 개당 $0.06 대 $0.07은 이 가격대에서는 반올림 오차에 불과합니다. 둘 다 충분히 저렴하므로 결정은 청구서가 아니라 역량과 적합성을 기준으로 내려야 합니다. 이는 이 비교가 언뜻 보이는 방식과는 정반대입니다.
프리미엄이 사주는 것은 스팬이다. ML4는 다섯 달 뒤 더 새로운 데이터로, 총 1조 개 매개변수에 활성 490억 개인 mixture-of-experts 구조로 학습되었으며, Mistral은 발표된 기준 하루 330억 토큰으로 아직 포화되지 않은 실행을 통해 이 모델에 강화학습을 돌리고 있다. M3는 완성되었고, ML4는 공개된 주기로 개선되고 있다. 공급업체가 오늘 구매하는 모델이 앞으로 돈을 낼 가장 약한 버전이라고 말하고, 기존 모델 대비 프리미엄이 100만 토큰당 1달러 미만이라면, 더 새로운 모델이 보통 더 나은 기본값이다. 예외는 위의 두 워크로드이며, 여기서는 더 오래된 모델만이 적합하다.
갭을 우회하는 라우팅

이것은 둘 다 실행하는 것이 헤지가 아니라 실제 해답인 페어링입니다. 두 모델이 서로 겹치지 않는 영역에서 강하기 때문입니다. 동영상 입력, 긴 아티팩트 출력, 또는 컴퓨터 사용 루프: M3. 문서 및 이미지 분석, 에이전트 워크플로, 또는 자체 정책에 따라 유럽 인프라에서 실행해야 하는 모든 것: ML4. 둘 중 하나를 불필요하게 만드는 라우팅 규칙은 없습니다.
둘 다 OrcaRouter의 OpenAI 호환 엔드포인트 하나 뒤에 있으며 마크업은 0%이고, 제공업체 정가가 그대로 전달되므로 5개월에 걸친 가격 차이가 왜곡 없이 유지됩니다 — MiniMax가 M3의 요율을 인하하거나 Mistral이 프리뷰 요율을 종료하면, 당신의 라우트를 평가하는 기준 숫자도 같은 날 바뀝니다. 이렇게 서로 겹치지 않는 강점들을 하나의 호출 표면으로 바꿔 주는 것이 바로 라우팅 DSL입니다. 요청의 모달리티를 검사하는 규칙이 비디오가 포함된 페이로드는 M3로, 나머지는 모두 ML4로 보내며, 프리뷰 모델의 가용성 문제가 사용자에게 전파되지 않고 자동 장애 조치로 흡수된다는 확신을 줍니다. 단일 출력이 단일 가격보다 더 중요할 때는 모델 퓨전으로 둘 다 실행하고 패널이 고르게 할 수 있는데, 이는 M3의 문서화된 동작을 하한선으로 유지하면서 Mistral이 주장하는 상한을 사는 합리적인 방법입니다.

평결
MiniMax M3는 두 가지 워크로드에 대해서는 정답이고, 세 번째에 대해서는 정당화할 수 있는 답이다. 비디오 입력, 수십만 토큰 규모의 단일 패스 생성, 컴퓨터 사용 에이전트는 이 모델의 영역이다. 가격은 이 등급의 어떤 플래그십보다도 낮으며, 공개된 중위권 점수는 여러분이 정확히 무엇을 얻는지 알 수 있게 해준다. 자체적인 틈새시장에서 아직 대체되지 않은 모델에게 5개월은 오래된 시간이 아니다.
Mistral Large 4는 다른 모든 용도에서 더 나은 기본값입니다. 한 달에 1억 토큰을 쓰면 약 $48 더 들고, 매개변수 수와 유럽 훈련 계보는 더 높은 상한을 가리키며, 사이버보안 관련 주장은 검증 가능할 만큼 구체적이고, 약속된 오픈 가중치와 온프레미스 배포는 M3의 API 전용 엔터프라이즈 스토리가 충족하지 못하는 요구사항을 해결합니다. 그 베팅의 대가는, Independent Intelligence Index 점수가 아직 공개되지 않았고 그 동작이 몇 주 안에 상당히 바뀔 것이라고 Mistral이 말하는 모델에 확정적으로 투자한다는 점입니다.
이 문제를 판가름할 두 날짜가 있습니다: ML4의 가중치가 공개되거나 오픈 웨이트 약속이 흐지부지해 보이기 시작할 2026년 10월 말, 그리고 Mistral이 비공개로 평가한 49.8%가 동일한 리비전에서 M3의 공개된 58.6 코딩 점수와 맞붙는 Coding Agent Index의 발표입니다. 그때까지 M3는 검증할 수 있는 모델이고 ML4는 베팅하는 모델입니다 — 그리고 1억 토큰에 월 $48의 추가 비용이라면, 그것은 큰 베팅이 아닙니다.
