
Claude Sonnet 5.5 vs MiniMax M3: 15배 더 저렴한 모델이 실제로 대등해지는 지점
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 931 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 192 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- xAISpaceXAI: Grok 4.62026-08-1244지능77코딩
독립 보드에는 MiniMax M3와 Claude Sonnet 5.5가 같은 모델인 행이 하나 있는데, 그것은 누구나 짐작할 만한 행이 아니다. 긴 컨텍스트 회상에서 MiniMax M3는 83.0%를 기록하고 Claude Sonnet 5.5는 82.7%를 기록한다. MiniMax M3는 입력 토큰 100만 개당 $0.30, 출력 100만 개당 $1.20의 비용이 든다. Claude Sonnet 5.5는 $2.00와 $10.00의 비용이 든다. 전체 Intelligence Index에서 M3의 측정 비용은 작업당 $0.51로, Claude Sonnet 5.5의 $7.60과 대비된다 — 15배 더 저렴하며, 모델이 아주 긴 문서에서 여전히 무언가를 찾을 수 있는지를 측정하는 단 하나의 평가에서도 전혀 뒤처지지 않는다.
그런 다음 에이전틱 평가를 열어 보면 그림이 너무나도 극적으로 뒤집혀서 더 이상 비교가 성립하지 않는다. 모델에게 셸을 구동해 실제로 소프트웨어 작업을 끝내라고 요구하는 Terminal-Bench 4.0에서 MiniMax M3는 2.0%를, Claude Sonnet 5.5는 63.6%를 기록한다. 프로덕션 작업과 가장 유사한 단 하나의 벤치마크에서 나타난 30배 격차는 가격 문제가 아니며, 이를 상쇄할 토큰당 절감은 없다. 이 맞대결이 던지는 유용한 질문은 "어느 쪽이 더 나은가"가 아니라, 이 두 가지 실패 모드 중 어느 것을 당신의 워크로드가 감당할 수 있는가이다: MiniMax M3는 검색에서는 프런티어 모델과 맞먹지만 실행에서는 무너지는 오픈 웨이트, 백만 토큰, 네이티브 비디오 모델이고, Claude Sonnet 5.5는 정반대를 하기 위해 2026년 9월 28일에 출시된 클로즈드 모델이다.
각각이 무엇인지, 평이하게 서술
MiniMax M3는 중국 연구소의 플래그십 오픈 웨이트 파운데이션 모델로, 2026년 6월 1일 발표되었으며 MiniMax 자체 커뮤니티 라이선스로 다운로드할 수 있다. 이는 총 파라미터가 약 4,280억 개이고 토큰당 약 230억 개가 활성화되는 전문가 혼합(MoE) 모델이며, 강한 의미에서 네이티브 멀티모달이다. 즉 텍스트, 이미지, 비디오가 입력되고 텍스트가 출력되며, 멀티모달 파이프라인은 나중에 덧붙인 것이 아니라 최초 사전 학습 단계부터 재구축되었다. 윈도는 1,048,576 토큰이고 — 자체 카탈로그 항목에서 보장되는 사용 가능 최소치는 512,000 토큰 — 최대 출력은 512,000 토큰인데, 이는 벤더가 아니라 우리 수치이다. MiniMax가 이를 공개하지 않기 때문이다. 아키텍처는 arXiv 2606.13392의 주제인 MiniMax Sparse Attention이며, 이에 대한 벤더의 주장은 백만 토큰 윈도에서 이전 세대보다 9배 이상 빠른 프리필링과 15배 이상 빠른 디코딩이다. 이는 벤더 수치이며, 우리는 이것이 독립적으로 재현되는 것을 보지 못했다.

Claude Sonnet 5.5는 Anthropic의 두 번째 5.5세대 모델로, 이 글을 쓰는 시점에 출시된 지 하루밖에 지나지 않았으며, 클로즈드 모델이다. Anthropic은 이를 라인업에서 속도와 지능을 가장 잘 결합한 모델이라고 설명한다. 사양은 1,000,000토큰 컨텍스트, 동기식 출력 128,000토큰(Message Batches API에서는 300,000토큰), 텍스트·이미지·파일 입력, 선택 가능한 노력 수준을 갖춘 적응형 사고, 2026년 6월 지식 컷오프, 출시 시점부터 제공되는 제로 데이터 보존이다. 가격은 Claude Sonnet 5에서 변하지 않았다: 입력 $2.00, 출력 $10.00, 캐시 읽기 $0.20, 캐시 쓰기 $2.50. Anthropic은 Claude Sonnet 5보다 30% 더 빠르게 실행되고 작업당 최대 30% 더 적은 비용이 든다고 말한다. 이는 공급업체가 제시한 수치이며 재현되지 않았고, 요율은 동일하므로 요율이 아니라 토큰 수에 관한 주장으로 읽어야 한다.
벤치마크의 형태가 모든 것을 말해준다
두 모델 모두 동일한 인덱스인 리비전 v4.3.2에서 측정되며, 평가별 결과 덕분에 이 조합은 한쪽으로 치우치지 않고 흥미롭습니다.
• 장문 컨텍스트 회상 — MiniMax M3 83.0% 대 Claude Sonnet 5.5 82.7%, 사실상 동점인 상황에서 반올림 오차에 불과한 차이
• SciCode — MiniMax M3 47.1% vs Claude Sonnet 5.5 61.0%, 실재하지만 감당할 수 있는 격차
• 인류의 마지막 시험 — MiniMax M3 39.0% vs Claude Sonnet 5.5 55.0%
• Terminal-Bench 4.0 — MiniMax M3 2.0% vs Claude Sonnet 5.5 63.6%, 비교가 더 이상 유용하지 않게 되는 지점
• 지능 지수 — MiniMax M3 29 vs Claude Sonnet 5.5 56
• Index 작업당 비용 — MiniMax M3 $0.51 vs Claude Sonnet 5.5 $7.60
• Index 전반에서 생성된 출력 토큰 — MiniMax M3 120M vs Claude Sonnet 5.5 410M
• 출력 속도 — MiniMax M3 115.3 토큰/초 vs Claude Sonnet 5.5 138.7 토큰/초
그 행들을 순서대로 읽어 보면 일관된 모델이 드러난다. MiniMax M3는 정적 추론과 검색에는 유능하지만 지속적인 실행에는 약하다. Terminal-Bench 결과는 미미한 부족이 아니다. 2.0%라는 점수는 이 모델이 사실상 과제를 완수하지 못한다는 뜻이며, 같은 패턴은 0.71 대비 0.21이라는 자동화 벤치마크 점수와 32.3 대비 1.35라는 omniscience 점수에서도 나타난다. MiniMax M3가 실제로 제 몫을 하는 곳은 바로 그 아키텍처가 강점을 내세우는 지점이다: 진정으로 긴 입력을 읽고 답하는 것. 그것은 MSA가 MiniMax가 MSA를 팔며 내세운 바로 그 일을 하고 있다는 뜻이다.

비용 항목은 덜 분명한 두 번째 요점을 추가한다. MiniMax M3는 토큰당 더 저렴할 뿐만 아니라 — 입력에서 1/6.7, 출력에서 1/8.3 — 답에 도달하는 데 더 적은 토큰을 소비한다. 같은 보드에서 대략 1억 2천만 개 대 4억 1천만 개다. 두 효과가 곱해져 과제당 15배 격차가 된다. 그 격차 중 일부는 진정한 효율성이고, 일부는 단순히 MiniMax M3가 실패하고 있는 과제에서 더 빨리 포기하기 때문이다. 잘못된 답을 내놓는 저렴한 모델은 절약이 아니다. 그리고 이것은 이 기사에서 가장 저렴하다.
가격표가 보여줄 수 없는 차원
MiniMax M3에는 Claude Sonnet 5.5가 갖지 못하고 가질 수도 없는 속성이 하나 있습니다. 바로 가중치를 가져갈 수 있다는 점입니다. 이는 정확히 한 부류의 구매자에게 중요하며, 그 구매자에게는 위의 모든 것보다 더 큰 비중을 차지합니다. 요청이 관할 구역을 벗어날 수 없거나, 네트워크 경계를 넘을 수 없거나, API에 전혀 접근할 수 없는 곳에서 실행되어야 한다면, 다운로드 가능한 가중치가 없는 모델은 어떤 가격에도 선택지가 아니며, 4280억 개 매개변수의 오픈 웨이트 모델은 선택지가 됩니다. 같은 속성은 다른 방향에서는 부담이 됩니다. 23B 활성으로 428B 매개변수를 자체 호스팅하는 것은 API 키가 아니라 자본 결정이며, MiniMax 자체의 희소 어텐션 주장이 존재하는 이유는 100만 토큰에서의 대안이 감당할 수 없는 인프라이기 때문입니다.
다른 모든 사람에게 솔직한 구도는 이것이 가격표가 붙은 자체 구축 대 구매(build-versus-buy)의 경계선이라는 점이다. Claude Sonnet 5.5는 에이전트적인 모든 작업에 더 나은 모델이다. MiniMax M3는 어마어마하게 큰 무언가를 읽고 그에 관한 질문에 답하는 데 더 나은 모델이며, 동영상 처리에서는 훨씬 더 나은 모델인데, Claude Sonnet 5.5는 동영상을 전혀 받아들이지 않는다 — 입력 표면은 텍스트, 이미지, 파일이다.
• 가중치 — MiniMax M3는 MiniMax 커뮤니티 라이선스로 공개, Claude Sonnet 5.5는 비공개
• 입력 모달리티 — MiniMax M3 텍스트, 이미지 및 동영상 vs Claude Sonnet 5.5 텍스트, 이미지 및 파일
• 최대 출력 — 당사 카탈로그 기준 MiniMax M3 512,000 토큰 vs Claude Sonnet 5.5 동기식 128,000, Batches 사용 시 300,000
• 캐시 가격 — MiniMax M3 백만 회 읽기당 $0.06 vs Claude Sonnet 5.5 읽기 $0.20 및 쓰기 $2.50
• 노력 제어 — MiniMax M3 사고 활성화, 적응형 또는 비활성화 vs Claude Sonnet 5.5 적응형 사고에서는 이제 비활성화하려면between_tools 형식
• 데이터 보존 — MiniMax M3는 자체 호스팅할 경우 귀하의 자체 배포 환경에서 관리되는 반면, Claude Sonnet 5.5는 출시 시점에 Anthropic에서 데이터 무보존(zero data retention)을 제공
두 개의 계약을 실행하지 않고 둘 다 실행하기
하나의 파이프라인에서 오픈 웨이트 중국 모델과 클로즈드 Anthropic 모델을 함께 쓰면, 운영 비용은 대개 토큰에서 나오는 게 아니다. 두 번째 계약, 두 번째 키, 두 번째 레이트 리밋, 그리고 장애가 발생할 수 있는 두 번째 지점에서 나온다. OrcaRouter는 이를 200개 이상의 모델을 아우르는 하나의 OpenAI 호환 엔드포인트로 접어버린다. 제공사 정가가 양쪽 어디에도 마크업 없이 그대로 전달되고, 업스트림 제공사 간 자동 페일오버가 이뤄지며, 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL까지 제공한다. MiniMax M3는 여기서 다음과 같이 라우팅할 수 있다 minimax/minimax-m3 — MiniMax의 $0.30 및 $1.20, 캐시 읽기 $0.06 요금으로. 또한 트래픽 기준으로 카탈로그에서 가장 바쁜 모델 중 하나인데, 이는 그 자체로 유용한 신호다. 라우팅 레이어는 모델이 점수가 아니라 실제로 얼마나 많은 부하를 감당하고 있는지 알려줄 수 있다.
Claude Sonnet 5.5는 아직 저희 카탈로그에 없으며, 이 글은 그런 척하지 않습니다. 오늘 그것에 접근하는 경로는 Anthropic 자체 API입니다. Claude Sonnet 5는 여기에서 동일한 $2.00 및 $10.00으로 라우팅할 수 있으며, 6월 30일부터 그렇게 해 왔고, 후속 모델이 나온 지 하루밖에 되지 않은 지금 자연스러운 스테이징 대상이자 페일오버 파트너입니다.
그 조합 — 하나의 자격 증명 뒤에 있는 롱컨텍스트 전환과 에이전트 경로 — 이 바로 라우터가 존재하는 이유다. MiniMax M3는 이 카탈로그를 통해 주당 6,320만 토큰의 트래픽을 처리하는 반면, Claude Sonnet 5는 790만 토큰을 처리한다. 그래서 저렴한 모델은 여기서 이론적인 대체재가 아니라, 이미 그 물량을 감당하고 있는 모델이다. 두 모델을 하나의 키에서 라우팅한다는 것은, 분할이 트래픽을 옮겨 다닐 수 있는 구성 결정이라는 뜻이지, 더 저렴한 쪽을 테스트하기 전에 체결해야 하는 두 번째 계약이 아니다.

넥타이를 어떻게 할까
워크로드가 문서 규모의 질의응답 — 매우 긴 입력, 짧은 사실형 답변, 감내할 만한 지연 시간 — 이라면, 롱컨텍스트 동률은 실재하며 MiniMax M3의 15배 비용 우위도 그와 함께 실재합니다. 이는 간단히 교체할 수 있는 선택이며 이번 주에 테스트해 볼 가치가 있습니다.
워크로드가 에이전트형이라면, Terminal-Bench 항목이 가격이 논의에 들어오기도 전에 결론을 내린다. Index 작업당 $7.60의 Claude Sonnet 5.5와 $0.51의 MiniMax M3를 비교하면, 프로덕션 트래픽과 가장 유사한 평가에서 60점 더 높은 점수를 받는 모델에 15배의 프리미엄을 지불하는 셈이며, 그 작업에 실패하는 15배 더 저렴한 옵션이 바로 비싼 쪽이다. 자체 데이터로 실행해야 할 측정은 요청당 토큰이 아니라 완료된 작업당 토큰이다. 왜냐하면 그것이 이 글에서 MiniMax M3의 가격 우위가 기본적으로는 살아남지 못하는 유일한 수치이기 때문이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
