생성된 히어로 카드: 제목은 MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash, 부제는 '동일한 1M 토큰 윈도, 매우 다른 두 가지 세일즈 피치'. 왼쪽 카드에는 'MiniMax M3.1 Flash Preview: 1M 컨텍스트, 가격 미공개, Token Plan 전용, thinking 비활성화 불가'라고 적혀 있고, 오른쪽 카드에는 'DeepSeek V4 Flash: 1M 컨텍스트, 오프피크 $0.15/$0.60, 텍스트 전용, V4.1 Flash로 대체됨'이라고 적혀 있다. 하단에는 'MiniMax 수치는 platform.minimax.io 기준, DeepSeek 수치는 DeepSeek의 공개 요금표 기준'이라고 적혀 있다.
Engineering & Research

MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash: 저렴한 1M 컨텍스트 티켓 두 장, 거대한 별표 하나

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

만약 백만 토큰 컨텍스트 윈도우를 토큰당 낮은 가격에 찾고 있다면, MiniMax-M3.1-Flash-Preview와 DeepSeek V4 Flash가 계속 언급되는 두 이름입니다 — 그리고 이들은 실제로 같은 종류의 제품이 아닙니다. DeepSeek V4 Flash는 식별자는 여전히 응답하는 은퇴한 모델로, 센트 단위까지 읽을 수 있는 공급업체 요금표 안에 자리 잡고 있습니다. MiniMax-M3.1-Flash-Preview는 공개된 요금이 전혀 없는 라이브 프리뷰입니다. 따라서 아래 비교는 부분적으로는 스펙 비교이고, 부분적으로는 이 두 공급업체가 동일한 가격대를 얼마나 다르게 판매하려고 하는지를 보여주는 것입니다.

그것의 양쪽 모두를 정확히 밝힐 가치가 있습니다. 왜냐하면 그것을 좌우하는 숫자들이 한 공급업체의 가격 페이지, 공급업체 문서 트리, 그리고 우리 자체 카탈로그에 흩어져 있고, DeepSeek V4 Flash에 관해 가장 자주 반복되는 주장 중 하나인 '가격'은 DeepSeek이 이후 교체해 버린 것이기 때문입니다.

두 스펙 시트가 실제로 일치하는 항목

주요 사양은 결정적 요인이 되지 않을 만큼 충분히 비슷하다. 아무도 광고하지 않는 한 가지 예외만 빼고.

• 컨텍스트 윈도우 — MiniMax-M3.1-Flash-Preview의 경우 1,000,000 토큰, DeepSeek V4 Flash의 경우 1,048,576 토큰: 명목상 동일하지만 48,576 토큰 차이
• 최대 출력 — MiniMax-M3.1-Flash-Preview는 공개되지 않음; DeepSeek V4 Flash는 384,000 토큰으로, 이 가격대에서는 이례적이며 많은 구매 결정을 좌우할 수 있는 수치
• 입력 모달리티 — MiniMax-M3.1-Flash-Preview는 텍스트, 이미지, 비디오; DeepSeek V4 Flash는 텍스트만
• 사고 제어 — 노력 단계: 낮음부터 최대까지, MiniMax-M3.1-Flash-Preview는 사고가 영구적으로 켜져 있음; DeepSeek V4 Flash에서는 사고 또는 비사고가 가능하며, 비사고가 실질적 옵션
• 프로토콜 지원 — MiniMax-M3.1-Flash-Preview는 Anthropic 호환, OpenAI 호환 및 OpenAI Responses 엔드포인트; DeepSeek V4 Flash는 동일한 세 가지에 더해 채팅 접두사 완성
• 가중치 — MiniMax-M3.1-Flash-Preview는 없음; DeepSeek의 V4 Flash 가중치는 공개되었지만, 모델 자체는 대체됨
• 가격 — MiniMax-M3.1-Flash-Preview는 미공개; DeepSeek V4 Flash는 공개되었고 낮음

그 목록을 두 번 읽어보세요. 왜냐하면 출력 상한이 바로 조용한 쪽이기 때문입니다. 백만 토큰의 컨텍스트에 384,000 토큰의 출력은 정말로 긴 단일 패스 생성 창입니다. 백만 토큰의 컨텍스트에 공개되지 않은 출력 상한은 읽기에 대한 약속이지, 쓰기에 대한 약속이 아닙니다. 당신의 작업 부하가 "리포지토리를 읽고 마이그레이션 계획을 내놓는 것"이라면, 두 번째 숫자가 그 작업이 한 번의 호출에 들어맞는지를 결정하는 숫자입니다.

각각이 측정되는 기준

이것은 이 비교에서 가장 불편한 부분이며, 짧습니다.

DeepSeek V4 Flash에는 벤치마크 기록이 있으며, 이는 독립적입니다. Artificial Analysis는 Intelligence Index에서 34.3점을 부여합니다 — 해당 지수에서 145개 모델 중 42위 — Coding Index에서는 69.1점, GPQA Diamond에서는 90.8%를 기록합니다. 우리 자체 카탈로그 항목이 맨 앞에 내세우는 τ²-Bench의 95.0은 DeepSeek의 출시 자료가 실은 것과 동일한 수치이므로, 감사된 수치라기보다는 독립적인 결과들 사이에 놓인 벤더 수치입니다. 장문맥 회상률은 79.7%이고, v2.1 하네스에서 terminal-bench 수치는 78.7%입니다. 이들은 알려진 모델에 대한 실제적이고 비교 가능한 측정치입니다.

MiniMax-M3.1-Flash-Preview에는 없습니다. MiniMax는 이번 출시와 함께 평가표를 공개하지 않았고, 제3자도 그것을 가지고 있지 않습니다 — 이 모델은 Artificial Analysis의 지수에 전혀 나타나지 않습니다. 이는 우리 조사의 공백이 아닙니다. 그것은 공개 기록의 현재 상태이며, 이는 더 새로운 모델에 관한 모든 품질 주장이 현시점에서는 벤더의 수식어일 뿐임을 의미합니다. 오늘 여러분에게 MiniMax-M3.1-Flash-Preview 벤치마크 표를 건네는 사람은 더 오래된 MiniMax-M3를 인용하고 있거나, 그것을 지어내고 있는 것입니다.

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs DeepSeek V4 Flash — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Coding score: none published', 'Context window: 1M', 'Max output: not published', 'Weights: none', 'Price: not published'. The right column, DeepSeek V4 Flash, reads 'AA Intelligence: 34.3', 'Coding score: 69.1', 'Context window: 1,048,576', 'Max output: 384,000', 'Weights: published', 'Price: $0.15 / $0.60 off-peak'. A footer reads 'MiniMax figures per platform.minimax.io documentation, 27 September 2026; DeepSeek figures per DeepSeek's published rate card and Artificial Analysis. The MiniMax column is empty because nothing has been published, not because a result is pending.'

DeepSeek V4 Flash는 당신이 기억하는 가격에 판매되지 않습니다.

여기에 함정이 있습니다. DeepSeek V4 Flash에 대해 널리 인용된 수치인 입력 토큰 100만 개당 $0.14, 출력 100만 개당 $0.28은 2026년 9월 10일 이전에 이 모델이 제시했던 요금표였습니다. 그날 DeepSeek은 DeepSeek-V4.1-Flash를 출시하고 V4 Flash와 V4-Flash-Vision-Exp 실험을 모두 종료했으며 가격을 인하했습니다. 이 deepseek-v4-flash 식별자는 여전히 작동하지만, DeepSeek 문서에 따르면 일시적으로 V4.1 Flash로 라우팅되며 Flash 가격으로 청구됩니다. 다시 말해, 이전 모델 이름을 계속 입력할 수는 있지만, 호출되는 것은 이전 모델이 아닙니다.

그러니까 실제로 비교해야 할 카드는 현재 카드이고, 1M 토큰당 기준입니다 — 그리고 오프피크는 그중 더 저렴한 절반입니다:

• 캐시 미스 입력 — 비피크 시 $0.15, 피크 시 $0.30
• 캐시 히트 입력 — 비피크 시 $0.003, 피크 시 $0.006
• 출력 — 비피크 시 $0.60, 피크 시 $1.20
• 피크 시간대 — 월요일부터 금요일까지 01:00–04:00 및 06:00–10:00 UTC, 중국 공휴일 제외, 그 외 모든 시간(주말 전체 포함)은 비피크

이와 대조적으로, MiniMax-M3.1-Flash-Preview에는 어떤 형태의 토큰당 요금도 없습니다. 비용은 Token Plan 시트 비용, 즉 Plus, Max, Ultra의 경우 월 $22, $55 또는 $132이며, 각 모델의 종량제 정가로 공유 할당량 풀을 통해 소진됩니다. 공급업체는 해당 풀의 구성을 변경할 권리를 보유합니다. 예측 가능한 사용량이 있는 고정 월 예산이라면 이는 탁월한 가치가 될 수 있습니다. 호출당 비용을 배분해야 하는 프로젝트라면, 이는 구독으로 포장된 불투명성입니다.

DeepSeek 쪽에서 이 점이 평소보다 더 중요한 이유는 피크 배율 때문입니다. 유럽이나 아시아에서 근무일을 보내는 팀은 트래픽의 상당 부분이 피크 시간대에 들어가고, 그 대가로 두 배를 지불합니다. 그러면 공시된 $0.15 입력 요금이 대부분의 제품이 바쁜 바로 그 시간에는 $0.30이 됩니다. 트래픽이 정말로 UTC 기준 야간에 도는 게 아니라면, 예산은 피크 열을 기준으로 잡으세요.

MiniMax M3.1 Flash Preview가 잘못된 선택인 경우

세 가지 경우가 있는데, 처음 두 가지는 제거되지 않고 문서화되어 있기 때문에 놓치기 쉽습니다.

출력 상한은 알 수 없습니다. 작업이 긴 생성 — 전체 명세서, 대화록 재작성, 주석이 달린 보고서 — 으로 끝난다면, 당신은 보이지 않는 출력 예산을 고르는 셈입니다. DeepSeek V4 Flash는 384,000을 공개합니다. 이런 비대칭성은 많은 양을 작성하는 모든 작업에서 더 오래된 모델에 유리하게 작용합니다.

사고 기능은 끌 수 없습니다. 전송: thinking: {"type": "disabled"}를 MiniMax-M3.1-Flash-Preview로 보내면 HTTP 400을 받습니다: 이 모델은 적응형 사고를 요구합니다. DeepSeek V4 Flash에서는 non-thinking 모드가 존재하며 지원되는 스위치입니다. 높은 처리량의 분류, 라우팅 또는 짧은 구조화 추출의 경우, 항상 먼저 추론하는 모델은 요청하지도 않은 지연 시간과 토큰을 지불하고 있는 것입니다 — 그리고 당신이 가진 유일한 조절 수단은 effort를 low로 낮추는 것이지, 추론을 제거하는 것이 아닙니다.

pay-as-you-go에서는 호출할 수 없습니다. 공급업체 문서는 MiniMax-M3.1-Flash-Preview가 현재 Token Plan과 MiniMax Code를 통해서만 제공된다는 점을 분명히 밝히고 있으며, Subscription Key는 pay-as-you-go API 키와 서로 바꿔 사용할 수 없습니다. 이미 시트를 보유하고 있다면 한 줄만 변경하면 됩니다. 보유하고 있지 않다면, 이 모델을 평가하려면 구독을 구매해야 합니다.

DeepSeek 수치가 잘못된 판단인 경우

그 반대의 경우는 DeepSeek V4 Flash가 텍스트 전용이며 이미 대체되었다는 점이다. 이 모델은 이미지를 받아들인 적이 없었고 — 그 작업에는 별도의 실험적 빌드가 필요했으며, 이제 그 빌드도 함께 폐기되었다 — 이제 모델 식별자는 이름이 시사하는 것과 다른 가중치를 제공한다. deepseek-v4-flash에 고정된 파이프라인은 재현성을 위해 DeepSeek가 일시적이라고 설명하는 리디렉션에 의존하고 있다.

MiniMax-M3.1-Flash-Preview는 텍스트, 이미지, 영상을 네이티브로 처리하며, 해당 벤더의 현재 최상위 텍스트 모델입니다. Flash 가격대에서 영상 입력을 지원하는 것은 이 등급에서는 흔치 않은 일입니다.

두 가지 주의 사항은 모두 프로덕션 트래픽을 운영하는 사람에게 같은 방향을 가리킵니다: 청구서의 식별자와 응답한 모델이 영원히 같은 것이라고 보장되지는 않으며, 그것이 뒤늦게 발견되는 대신 처리되는 곳이 바로 라우팅 계층입니다.

A generated infographic titled 'The two Flash brackets, side by side' listing six paired rows: 'Sales motion — subscription seat vs per-token rate card', 'Effective input rate — Token Plan quota vs $0.15 off-peak / $0.30 peak', 'Peak surcharge — not applicable vs doubles 01:00-04:00 and 06:00-10:00 UTC', 'Cost attribution — pooled quota vs metered per call', 'Failure mode — no published output ceiling vs identifier now serves a successor', and 'Best fit — fixed-budget teams vs metered pipelines'. A footer reads 'Both models carry a 1M-token context window; neither figure is a quality claim.'

이걸 한나절 만에 결정하는 방법

작업의 시작이 아니라 끝에서부터 시작하세요.

작업이 장문 생성, 즉 수만 개의 토큰을 작성하여 끝나는 모든 작업이라면, DeepSeek V4 Flash는 그 둘 중 그것을 약속할 만큼 충분히 큰 상한을 공개한 유일한 모델이며, 요금표는 피크 배수를 감당할 수 있을 만큼 작다. 비용은 비피크가 아니라 피크 기준으로 모델링하고, 퇴역한 식별자는 안정적인 계약이라기보다 아직 수행하지 않은 마이그레이션으로 취급하라.

고정된 월 예산 아래에서 멀티모달 입력—화면 녹화, 스캔 문서, 영상 검토—을 읽고 추론하는 작업이라면, MiniMax-M3.1-Flash-Preview가 더 유능한 형태이고, Token Plan 시트 안에서는 이 컨텍스트 길이로 영상 입력을 얻는 가장 저렴한 방법이다. 측정되지 않은 모델을 사고 있다는 점을 받아들이고 피해 범위를 제한하라: 중요한 워크로드는 공개된 요금표가 있는 모델에 두고, 탐색적인 절반은 프리뷰가 처리하게 하라.

두 설명이 모두 귀하의 파이프라인에 해당한다면, 그것은 모델 선택 문제가 아니라 라우팅 문제이며, 바로 우리가 존재하는 이유입니다. OrcaRouter의 DeepSeek V4 Flash는 제공업체 요율에 0% 마크업으로 자리합니다 — 카탈로그 항목에는 백만 입력 토큰당 $0.22, 백만 출력 토큰당 $0.66이 표시되는데, 이는 현재 Flash 카드의 피크 열로 그대로 전달된 가격입니다 — 같은 키로 같은 가격대에 MiniMax-M3와 MiniMax M2.7도 함께 있습니다. 하나의 엔드포인트로 200개 이상의 모델에 도달할 수 있으며 뒤에는 자동 장애 조치가 있어, 워크로드가 두 번째 통합 없이 가격대 사이를 이동할 수 있습니다. MiniMax-M3.1-Flash-Preview는 우리 카탈로그에 없습니다. 그 모델에 도달하려면 벤더의 Token Plan과 해당 코딩 제품이 필요합니다.

한 줄 요약: DeepSeek V4 Flash는 공개된 출력 상한, 알아보기 쉬운 요금표, 그리고 조용히 그 이름으로 불리는 후속 모델을 갖춘 이미 검증된 선택지다. MiniMax-M3.1-Flash-Preview는 더 새롭고 멀티모달이며 아직 측정되지 않은 쪽으로, 사용해 보려면 구독 비용을 지불해야 한다. 이 중 어느 것도 다른 쪽을 골라야 할 이유는 아니다 — 그것들은 DeepSeek가 9월에 폐기한 요금표를 인용하는 토큰당 가격 비교로는 얻지 못했을 사실들일 뿐이다.

A headless Chromium screenshot of the OrcaRouter model page for deepseek/deepseek-v4-flash, showing the model title 'DeepSeek: DeepSeek V4 Flash', a pricing row reading 0.22 US dollars per million input tokens and 0.66 per million output tokens, a context window of 1,048,576 tokens, and a maximum output of 384,000 tokens, captured 28 September 2026.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트