
Dots 대 MiniMax M3: 워커를 빌릴 것인가, 리더를 다운로드할 것인가
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 349 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 210 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
이 중 가장 저렴한 모델은 당신이 보유할 수 있는 모델이기도 하며, 그 조합이 전부입니다. 2026년 5월 31일 공개된 MiniMax M3는 MiniMax의 플래그십 오픈 웨이트 파운데이션 모델로 설명됩니다. 텍스트, 이미지, 비디오를 입력받아 텍스트를 출력하고, 1,048,576토큰 컨텍스트 창을 가지며, 단일 응답에서 최대 512,000토큰을 출력할 수 있습니다. 정가는 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $1.20이며, 캐시된 읽기는 $0.30입니다. 이는 업계 최전선 모델들이 같은 토큰에 부과하는 요금의 약 13분의 1입니다. Dots는 2026년 9월 29일 DevDay에서 발표된 회사의 상시 작동 에이전트입니다. 자체 클라우드 컴퓨터와 브라우저를 갖추고, 4,000개 이상의 연결된 앱에서 작동하며, GPT-6 Astra를 실행하고, Pro와 Business에 포함되어 제공되지만 허용량 수치는 어디에도 공개되지 않았습니다. 하나는 직접 보유할 수 있는 컴포넌트입니다. 다른 하나는 구독만 할 수 있는 서비스입니다.
가격은 흥미로운 숫자가 아니다
입력 토큰 100만 개당 30센트가 헤드라인이지만, 흥미로운 수치는 당신이 무엇을 요청할 수 있는지를 좌우하는 두 가지다. 첫째는 최대 출력 512,000토큰이다. 이는 GPT-5.6 Sol이 한 응답에서 내보내는 양의 여섯 배이며, 이 비교 세트에 포함된 어떤 모델보다도 큰 출력 상한이다. 둘째는 긴 컨텍스트 회상에서의 83점으로, 이는 컨텍스트 윈도우가 사양서에 적힌 숫자가 아니라 실제로 사용할 수 있는 작업 표면임을 보여줄 만큼 높다.
이것들을 종합하면 특정 부류의 작업이 저렴해집니다: 긴 원문에서 긴 결과물을 생성하는 일입니다. 다른 독자층을 위한 400페이지 분량의 기술 매뉴얼. 전체 리포지토리에서 생성한 마이그레이션 가이드. 그 자체로 보고서 길이에 달하는 연구 요약. 백만 토큰당 $0.30과 $1이라면, 프런티어 모델에서는 네 자릿수 비용 항목이 될 작업이 여기서는 반올림 오차에 불과합니다 — 그리고 출력 상한이 수만 토큰이 아니라 수십만 토큰으로 측정된다는 사실 덕분에, 스무 번이 아니라 단 한 번의 요청으로 처리됩니다.
측정과 관련해 짚고 넘어갈 만한 주의점이 있습니다. 우리 카탈로그의 지연 시간 패널은 1,835만 토큰의 트래픽을 보여 주는 동일한 7일 기간 동안 M3의 첫 토큰까지 걸리는 중앙값 시간을 10.00초로 보고하는데, 이 수치는 패널이 표시하는 범위의 맨 위에 정확히 걸쳐 있습니다. 이는 모델의 특성이라기보다 해당 기간의 부산물로 읽어야 합니다. 사람들이 실제로 이를 사용하고 있다는 점을 알려 주는 것은 트래픽 수치입니다.

비디오는 아무도 예상하지 못하는 입력이다
비전은 이제 기본 요건이 되었으므로, 여전히 차별화를 만들어 내는 모달리티는 비디오입니다. M3는 텍스트 및 이미지와 함께 비디오를 기본적으로 받아들이며, 이는 단순히 기능 목록에 하나를 추가하는 것이 아니라 파이프라인의 형태를 바꿉니다. 화면 녹화의 지원 아카이브, 대시캠 클립 모음, 한 학기 분량의 강의 캡처 — 이것들은 이전에는 전처리 문제였습니다. 한 도구로 프레임을 샘플링하고 다른 도구로 설명해야 했죠. 비디오를 직접 읽는 모델은 두 단계를 한 번의 호출로 합칩니다.
그것은 또한 비용 계산을 덜 예측 가능하게 만든다. 비디오는 텍스트와 달리 검토하는 데 비용이 많이 들고, 청구서에서 가장 큰 숫자는 대개 아무도 예산에 넣지 않았던 입력이기 때문이다. 저렴한 토큰당 요금은 그것을 안전하게 실험할 수 있게 해준다. 입력 토큰 백만 개당 $0.30이라면, 이따금 발생하는 5시간 분량 인제스트는 계획 회의에서 논쟁하기보다 프로토타입을 만들어볼 만큼 충분히 저렴하다.
공개 가중치가 실제로 바꾸는 것
MiniMax는 M3를 오픈 웨이트 모델이라고 설명한다. 이는 가중치가 서빙만 되는 것이 아니라 공개된다는 뜻이며, 이는 구독과는 다른 종류의 보증이다. 만약 MiniMax가 내일 서빙을 중단하거나, 가격을 바꾸거나, 해당 식별자를 지원 중단하더라도 그 모델은 사라지지 않는다 — 이미 구매해 둔 하드웨어에서, 거기에 맞는 양자화로 계속 돌아갈 것이다. 그렇다고 해서 일반적인 경우에 셀프 호스팅이 더 저렴해지는 것은 아니다. 대규모 희소 전문가 혼합(mixture-of-experts) 모델을 직접 서빙하는 것은 그 자체로 제대로 된 엔지니어링 프로젝트다. 그것은 의존성을 생존 가능하게 만들어 줄 뿐이며, 이는 다른 주장이고, 무엇 위에 구축할지 결정할 때 중요한 바로 그 주장이다.
dot은 정반대의 보장을 제공합니다. OpenAI는 컴퓨터와 브라우저, 커넥터, 그리고 할당량을 보유하고 있으며, 그중 무엇 하나라도 바뀌면 당신이 취할 수 있는 구제책은 사용을 중단하는 것뿐입니다. 그것은 공정한 계약입니다 — 대부분의 팀은 임대하는 방식으로 시작해야 합니다 — 하지만 같은 계약은 아니며, 그 차이는 정말 중요한 날에야 드러납니다.

결정을 바꾸는 여섯 가지 차이
• 보증 — 약관을 바꿀 수 있는 서비스와, 당신이 계속 보유할 수 있는 가중치를 맞세운 것 (MiniMax M3는 오픈 웨이트라고 설명되지만, 점 하나는 어떤 의미로도 다운로드할 수 없다)
• 작업 단위당 비용 — 점(.)에 대해서는 미공개, 백만 토큰당 $0.30 및 $1.20에 대비하며, 캐시된 읽기는 $0.06으로 이 비교 세트에서 가장 낮은 요율
• 단일 요청 상한 — 점 하나까지도 문서화되지 않음, 입력 1,048,576 토큰과 출력 512,000 토큰 대비
• 입력 모달리티 — 닷(dot)에는 메시지와 연결된 앱 데이터, 모델에는 텍스트, 이미지, 동영상
• 모달리티 제외 — 다른 소프트웨어 내부의 변경, 텍스트에 대한 것이며 텍스트만 해당
• 독립적 위상 — dot에 대한 벤치마크는 존재하지 않습니다; M3는 Artificial Analysis Intelligence Index 29.2를 기록해 측정된 145개 모델 중 60위에 올랐으며, 이는 중위권이므로 저렴한 요금이 프런티어급 추론을 제공한다고 가정하기 전에 알아둘 가치가 있습니다. 그렇지 않습니다.
각 항목이 인보이스에서 한 줄을 차지할 자격을 얻는 방식
M3의 공개된 프로필을 솔직하게 읽자면, 그것은 프런티어 모델이 아니라 볼륨 모델이라는 점이다: GPQA Diamond에서 92.9는 경쟁력 있고, SWE Bench Pro에서 59는 괜찮은 편이며, 중간권 Intelligence Index가 결정적 단서다. 그것이 이기는 지점은 작업 단위당 비용, 출력 상한, 비디오, 배포 용이성이며, 바로 이 순서다. 이는 파이프라인의 비싼 계층 아래에 두기 좋은 모델이다 — 요약, 추출, 전사, 장문 생성, 다수 시도 팬아웃 단계 — 그리고 그 위에 두기에는 나쁜 모델이다.
OrcaRouter는 이를 minimax/minimax-m3로 MiniMax 제공사 정가에 0% 마크업으로 제공합니다. 단일 키 뒤에 200개 이상의 모델이 있는 동일한 카탈로그에서 말이죠. 업스트림 제공사 전반의 자동 장애 조치와 라우팅 DSL을 통해 개별 요청을 처리해야 할 모델로 보낼 수 있습니다. 이러한 구조 덕분에 2계층 분리가 이론이 아니라 실용적인 것이 됩니다. 볼륨을 위해 저렴한 모델에 도달하는 동일한 키가 정확해야 하는 호출을 위해서는 프런티어 모델에 도달하며, dot 안에는 아무것도 도착하지 않습니다. dot은 카탈로그에 아예 없기 때문입니다 — 엔드포인트도, 식별자도, 대체 지능도 없습니다.
월요일에 무엇을 할까
오디오나 비디오 코퍼스가 있는데 그것을 살펴볼 저렴한 방법이 없다면, 거기서 시작하세요: M3는 이 세트에서 이 가격에 비디오를 네이티브로 읽는 유일한 모델이며, 그 실험에는 거의 비용이 들지 않습니다. 아무도 나서서 하지 않아서 계속 빠지고 있는 작업 부류가 있다면, dot은 바로 그런 작업을 위해 만들어진 제품이며, 종량제 모델은 그것인 척하지 않을 것입니다.
둘은 하나가 반드시 이겨야 한다고 가정할 때만 충돌한다. 구독은 쫓아가고, 다운로드된 리더는 읽는다. 두 번째는 소유하고, 첫 번째는 임대하며, 둘 사이의 경계를 어느 한쪽을 다른 쪽을 다시 작성하지 않고도 교체할 수 있을 만큼 명시적으로 유지하라.

