
GPT-6.1 Sol vs MiniMax M3: 더 저렴한 요금표가 청구서에서는 진다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
MiniMax M3이 요구하는 것의 일부만을 요구한다GPT-6.1 Sol — 입력 토큰 100만 개당 $0.30 대 $2.00, 출력 토큰 100만 개당 $1.20 대 $10.00 — 그리고 실제로 돌아가는 요금계로 따져 보면 더 저렴하다: Artificial Analysis의 v4.3.2 평가에서 작업당 $0.508 대 $0.724다. 이는 진정한 승리이며, 동시에 논거의 전부이기도 하다. 왜냐하면 M3에게 더 낮은 청구서를 안겨주는 바로 그 측정이 GPT-6.1 Sol에게는 22.6포인트의 지수 우위를 안겨주고, 모델이 에이전트 작업을 설명하는 것이 아니라 끝낼 수 있는지를 측정하는 벤치마크 세트는 그 격차를 벽으로 바꿔 놓기 때문이다. 벤더는 2026년 9월 29일에 GPT-6.1 Sol을 출시했다. 이 회사는 2026년 5월 31일에 4,280억 매개변수의 오픈 가중치 모델인 M3를 공개했다.
둘 다 실제로 운영 중이고, 둘 다 가격이 책정되어 있으며, 둘 다 API 호출 한 번이면 닿는다. 이어지는 내용은 둘 사이의 선택을 결정하는 계산, 그리고 그 계산이 전부는 아닌 두 지점이다.
각 모델이 실제로 무엇인지
GPT-6.1 Sol은 OpenAI의 현재 추론 및 소프트웨어 엔지니어링용 플래그십입니다 — 폐쇄형 모델로, 자기가 대체하는 GPT-6 Sol이 출시된 지 꼭 일주일 만에 출시되었으며, 전작과 동일한 $2.00 / $10.00 정가로 판매됩니다. 캐시 입력 요금은 $0.10로, GPT-6 Sol이 캐시 적중에 부과했던 금액의 절반이며, OpenAI가 채팅이 아니라 에이전트형 코딩을 이야기할 때 가리키는 모델입니다.
MiniMax M3는 총 4,280억 개의 파라미터와 토큰당 230억 개의 활성 파라미터를 갖춘 전문가 혼합(mixture-of-experts) 모델로, MiniMax 커뮤니티 라이선스로 공개되었습니다 — 비상업적 성격이 가미된 맞춤형 라이선스가 적용된 오픈 웨이트 릴리스이며, OSI 승인 라이선스는 아닙니다. 이 모델은 폭넓은 추론 제공업체들을 통해 서비스됩니다: Artificial Analysis는 M3에 대해 15개의 호스트를, GPT-6.1 Sol에 대해서는 8개의 호스트를 기록했습니다. 이러한 폭넓음은 오픈 웨이트의 실질적인 장점이며, M3의 가격 경쟁이 폐쇄형 모델보다 더 빠르게 진행된 이유이기도 합니다.
요금표, 그리고 그것을 무효화하는 미터

두 개의 공개된 요금표를 나란히 놓고 보면 차이는 명백하다.
• 입력 — GPT-6.1 Sol 1M당 $2.00 vs MiniMax M3 1M당 $0.30; M3가 85% 더 저렴
• 출력 — 1M당 $10.00 vs 1M당 $1.20; M3가 88% 더 저렴
• 캐시된 입력 — 1M당 $0.10 vs 1M당 $0.06
• AA 작업당 비용 — $0.724 vs $0.508; M3는 30% 더 저렴, 85%가 아님
• 작업당 출력 토큰 — 38,128 vs 48,192; M3가 26% 더 많이 작성
• 작업당 시간 — 640초 vs 486초
• 컨텍스트 창 — 1,050,000 vs 1,048,576 토큰; 사실상 동일
• 최대 출력 — 128,000 토큰 vs 512,000; M3는 매우 긴 답변을 하나 작성할 것
• 허용되는 입력 — 텍스트, 이미지 및 파일 vs 텍스트, 이미지 및 비디오
• 인덱스 순위 — GPT-6.1 Sol은 147개 모델 중 10위, MiniMax M3는 62위
맨 위의 두 저렴한 라인은 조달 시트가 보는 라인이다. 세 번째 라인은 청구서를 지불하게 하는 라인이며, 85–88%의 요율표상 우위가 30%의 실제 우위가 된다고 말한다. M3가 작업당 더 많은 토큰을 생성하고, 작업은 고정된 작업량이 아니기 때문이다. 요율표는 토큰에 가격을 매기고, 작업은 태스크 단위로 가격이 매겨진다. 처음 두 라인에서 멈추는 모든 비교는 잘못된 숫자를, 잘못된 단위로 비교하는 것이다.
30퍼센트가 더 이상 중요하지 않게 되는 지점
작업 비용은 충분히 비슷해서, 대량 텍스트를 넘어서는 용도에서는 지수 격차가 승부를 가릅니다. Artificial Analysis는 GPT-6.1 Sol을 51.83, MiniMax M3를 29.22로 평가합니다 — 22.6점 차이이며, 이 격차는 전체 스위트에 고르게 분포되어 있지 않습니다. 모델에게 터미널을 조작하고, 리포지토리를 편집하고, 자체 작업을 검증하도록 요구하는 평가에서는 두 모델이 같은 범주에 있지 않습니다:
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5600 대 MiniMax M3 0.0202
Terminal-Bench Science — 0.5810 대 0.0048
• AA-Omniscience — 41.53 대 1.35
• MMLU-Pro — 0.8595 대 0.7856
• AutomationBench — 0.6487 대 0.2125
• τ²-bench — 이번 실행에서는 GPT-6.1 Sol에 대해 공개되지 않음 대 M3의 0.8889
• GPQA Diamond — 이번 실행에서는 GPT-6.1 Sol에 대해 공개되지 않음 대 M3의 0.9293
• CritPT — 0.3171 대 0.0371
그 점을 주의 깊게 읽어 보세요. 이것은 깔끔한 완승이 아니며, 예외가 바로 흥미로운 부분입니다. MiniMax M3는 도구 사용 및 고객 서비스 대화 평가인 τ²-bench에서 0.8889점을, GPQA Diamond에서 0.9293점을 기록합니다. 이는 이번 특정 실행에서 공개된 모든 OpenAI 수치를 앞서는 대학원 수준의 과학 점수입니다. M3는 유능한 추론기이며 대화형 도구 사용자로서도 우수합니다. Terminal-Bench 4.0에서는 0.0202점을 기록합니다. 그것은 "더 나쁘다"가 아닙니다. 그것은 다단계 리포지토리 작업을 전혀 일관되게 이어가지 못하는 모델이며, 토큰 할인을 아무리 해도 모델이 실패하는 작업이 모델이 완료하는 작업보다 저렴해지지 않습니다.
작업당 수치가 숨기는 2차적 비용이 있다. M3는 작업당 출력 토큰 48,192개와 응답 시간 23.0초를 기록했는데, 이는 GPT-6.1 Sol의 332.0초와 대비된다 — 소형 모델은 거의 즉시 답변을 시작한 뒤 길게 추론한다. 워크로드가 지연 시간에 민감하지만 얕다면, 이는 M3에 유리한 점이다. 에이전트형이라면, 토큰 수는 지불해야 할 비용이고 최종 점수는 얻게 되는 성과다.
GPT-6.1 Sol에 대한 우리 자체 모델 카드에는 실제로 라우팅할 때 기준으로 삼게 되는 형태의 동일한 수치가 담겨 있습니다: $2.00 / $10.00 요금, 1,050,000토큰 컨텍스트 윈도, 첫 토큰까지의 p50 4.54초, 그리고 같은 페이지에 자리한 Artificial Analysis 인덱스 및 벤치마크 블록.

여기서 오픈 웨이트의 가치는 무엇인가
M3를 다운로드할 수 있다는 점은 M3에 대한 가장 강력한 논거이며, 그것이 무엇을 얻어 주는지 정확히 따져볼 가치가 있다. 그것은 자체 경계 안에서 모델을 실행할 수 있게 해주는 라이선스 조건을 얻어 주며—데이터가 외부로 나갈 수 없을 때 유용하다—또한 15개 독립 호스트에서 비롯되는 가격 경쟁을 얻어 준다. 하지만 값싼 배포를 얻어 주는 것은 아니다. 4,280억 개 파라미터 중 230억 개가 활성인 모델에는 여전히 상당한 추론 하드웨어가 필요하며, MiniMax Community License는 조건이 붙은 맞춤형 라이선스이지 제한 없는 라이선스가 아니다. 대부분의 팀에게 ‘오픈 웨이트’란 호스팅 추론에서 더 나은 가격을 뜻하지, 랙에 놓인 장비 한 대를 뜻하는 것이 아니다.
MiniMax M3의 OrcaRouter 카드에는 실제 제공되는 수치가 담겨 있습니다: $0.30 / $1.20 요금, 1,048,576토큰 컨텍스트 윈도우, 512,000토큰 최대 출력, 텍스트/이미지/비디오 입력, 그리고 이를 라우팅하는 제공자 전반에 걸친 7일간 5,640만 토큰 볼륨입니다.

둘 다 하나의 키 뒤에
이 비교가 마이그레이션이 아니라 구성 변경인 실질적인 이유는 두 모델 모두 단일 OrcaRouter 엔드포인트에서 접근할 수 있기 때문입니다. 즉 200개 이상의 모델을 위한 하나의 API이며, 제공업체의 정가가 0% 마크업으로 그대로 전달됩니다. 따라서 MiniMax 요금 변경은 재판매업체가 재협상할 때가 아니라 벤더가 공표하는 당일 청구서에 반영됩니다. 이는 경쟁 모델보다 M3에 더 중요합니다. 오픈 웨이트 모델로 라우팅하는 이유 자체가 그 가격과 호스트 목록이 계속 움직이기 때문이며, 그대로 전달하는 미터만이 움직이는 목표를 추적할 수 있는 유일한 방식이기 때문입니다.
자동 페일오버는 나머지 절반이다. M3는 안정성이 제각각인 여러 제공자가 서비스하며, 라우팅 계층은 한 호스트의 성능이 저하될 때 호출자가 어느 호스트에 요청이 도착했는지 알지 못한 채 요청을 다른 호스트로 옮길 수 있다. 그것이 Terminal-Bench 점수가 "중요 경로에 적합하지 않다"고 말하는 모델을 받아들이는 솔직한 방식이다. 재시도 비용이 저렴한 곳에 두는 것이다.
오늘 꼭 하나를 골라야 한다면, 어느 거죠?
작업이 대량 텍스트 — 추출, 요약, 분류, 대화, 출력이 산문이고 실패 모드가 빌드가 깨지는 것이 아니라 잘못된 문장인 모든 작업 — 라면, MiniMax M3가 올바른 기본값이며 그 30퍼센트는 실질적인 돈이다. GPQA와 τ²-bench 수치를 근거로 삼아라: 이는 유능하면서도 마침 저렴한 모델이다.
작업이 에이전트 기반이라면 — 저장소, 터미널, 도구 체인, 검증 단계가 있는 그 무엇이든 — Terminal-Bench 4.0에서의 0.0202는 실격 사유이고, 작업당 $0.724로 0.5606을 기록한 GPT-6.1 Sol이 토큰당 85% 더 비싸더라도 더 나은 거래다. 요금표는 애초에 당신이 사려던 것이 아니었다.
유용한 답은 한 번 선택하고 끝낼 필요가 없다는 것입니다. 얕은 티어는 M3로 라우팅하고, 에이전트 티어는 GPT-6.1 Sol로 라우팅하되, 둘 모두를 하나의 자격 증명 뒤에 두십시오 — 작업이 추출로 시작해 복구 작업으로 바뀌면 라우팅 DSL이 둘을 단일 호출로 합성합니다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
