
LongCat-2.5-Preview vs MiniMax M3: 저렴한 자리는 이미 차지되었다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
대부분의 LongCat-2.5-Preview 보도가 깔고 있는 전제는 Meituan이 이 분야의 가격을 깎아 내렸다는 것이다. MiniMax M3와 맞붙으면 그 전제는 접촉하는 순간 사라진다. MiniMax M3는 저희 카탈로그에서 백만 입력 토큰당 $0.30, 백만 출력 토큰당 $1.20에 올라와 있다. LongCat-2.5-Preview의 공개 요금표는 백만 캐시되지 않은 입력 토큰당 $0.30, 백만 출력 토큰당 $1.20이다. 이는 비슷한 숫자가 아니라 똑같은 숫자다. 두 요금이 갈리는 곳은 캐시된 입력 한 군데뿐인데, Meituan은 백만당 $0.006을 부르는 반면 기존 모델은 $0.06이다. 청구서에서 가장 저렴한 항목에서 10배 격차가 나는 셈이다. 그러니 흥미로운 질문은 LongCat-2.5-Preview가 저렴한지 여부가 아니다. 새 모델이 기존 모델과 정확히 같은 가격에 등장할 때, 당신이 무엇을 사고 무엇을 포기하는가이다.
간단히 답하자면: 훨씬 더 높은 출력 상한, 훨씬 더 빈약한 근거 기반, 그리고 캐시 할인입니다.
동일한 대표 가격, 매우 다른 공개 상한선
MiniMax M3는 2026년 5월 31일부터 공식적으로 공개되었습니다. 저희 카탈로그는 이를 1,048,576토큰 컨텍스트 윈도우와 최대 512,000토큰 출력으로 제공합니다 — 이는 대부분의 모델이 허용하는 것보다 많으며, LongCat-2.5-Preview의 131,072보다 네 배 많습니다. 텍스트, 이미지, 비디오를 입력으로 받아 텍스트를 반환하며, 도구 호출, JSON 모드, 추론 기능을 제공합니다.

2026년 9월 25일 Meituan의 LongCat API 플랫폼에 등록된 LongCat-2.5-Preview는 컨텍스트에서는 1,000,000 토큰으로 일치하지만 출력에서는 131,072로 크게 미달합니다. 그 입력 프로필이 핵심 쟁점입니다: 변경 로그는 이미지 이해를 주요 추가 사항으로 내세우지만, Meituan 자체의 "Retrieve Model" 문서에 있는 예시 응답은 여전히 다음을 보여줍니다: input_modalities는 ["text"]이며, text->text 모달리티 문자열을 사용합니다. MiniMax M3는 비디오도 허용하는데, LongCat-2.5-Preview는 이를 전혀 주장하지 않습니다. 파이프라인이 화면 녹화나 프레임 시퀀스를 입력으로 받는다면, 이 비교는 여기서 끝입니다.
캐시 비대칭성은 반대 방향으로 작용하며, 이는 Meituan에 유리한 점으로 짚을 가치가 있습니다. 왜냐하면 이것이 새 모델이 진정으로 차별화되는 유일한 차원이기 때문입니다. 캐시된 입력 100만 개당 $0.006 대 $0.06은 매 턴마다 동일한 긴 프리픽스를 다시 보내는 에이전트 워크로드 — 대부분이 여기에 해당합니다 — 에 실질적인 이점입니다. 또한 이 항목은 예고 없이 바뀔 가능성이 가장 큰 항목이기도 한데, Meituan이 전체 카드를 기간 한정 할인으로 표시하고 있기 때문입니다.
양방향 모두에서 정직하게 측정한 증거 격차
MiniMax M3의 벤치마크상 위치는 강하지 않으며, 그 사실을 말하는 것도 이 비교를 제대로 수행하는 일의 일부입니다. Artificial Analysis는 이 모델의 코딩 지수를 58.6으로 기록했는데, 이는 추적 중인 모델 가운데 46위이며, 지능 지수는 29.2로 60위입니다. GPQA Diamond 92.9%, Humanity's Last Exam 39%, SciCode 47.1%, Long-Context Recall 83, τ²-Bench 뱅킹 15.3, Terminal-Bench v2.1 65.2입니다. MiniMax가 자체 공개한 수치는 다른 영역을 다룹니다: BrowseComp 83.5, GDPval 루브릭 76.7, MCP Atlas 74.2, BankerToolBench 76.1입니다. 이는 벤더가 보고한 수치이며 독립적인 수치와는 다른 열에 속하지만, 그것들은 존재합니다. 그리고 여기서 핵심은 바로 '존재한다'입니다.

LongCat-2.5-Preview는 아예 열이 없습니다. 공개된 벤치마크 표도, 모델 카드도, 기술 보고서도, HuggingFace나 Meituan의 GitHub 조직에 있는 저장소도 없으며, 카탈로그 메타데이터는 오픈 웨이트를 false로 기록하고 있습니다. 약 1.6조 총 파라미터 / 480억 활성 파라미터라는 수치는 문서가 아니라 Meituan 사이트 메타데이터와 중국 업계 보도에서 나온 것입니다. 따라서 정확한 표현은 이렇습니다: M3의 점수는 평범하고 독립적인 출처에서 나온 반면, LongCat-2.5-Preview의 점수는 없습니다. 코딩 지수에서 40점대를 받는 모델은 계획을 세울 수 있는 알려진 변수입니다. 점수가 없는 모델은 다른 종류의 위험이며, 가격이 동일하다는 점은 보통 그것을 선택하는 것을 정당화해 주는 보상을 없애 버립니다.
같은 가격이 당신이 해야 할 일을 바꾸는 경우
새 모델이 시장 가격을 밑돌 때, 합리적인 선택은 그것을 평가해 보는 것이다 — 이점은 실질적인 할인이다. 새 모델이 5월부터 판매되어 온 기존 모델과 정확히 같은 가격으로 등장한다면, 이점은 가격이 아니다. 그것은 성능이며, 성능은 LongCat-2.5-Preview가 공개하지 않은 유일한 항목이다. 이는 평가의 틀을 완전히 바꾼다. 당신은 그것이 더 저렴한지 시험하는 것이 아니라, 기준 삼을 근거도 없이 맨바닥에서 출발해 당신의 작업에서 그것이 더 나은지 시험하는 것이다.
그 테스트를 겉보기보다 더 저렴하게 만들어 주는 2차적인 세부 사항이 하나 있습니다. LongCat-2.5-Preview는 OpenCode를 통해 기간이 명시되지 않은 한시적 창구 동안 무료·무제한으로 제공되며, OpenCode가 명시적으로 문서화한 제로 보존 정책이 적용됩니다 — 모델 학습 "Not used", 데이터 보존 "0 days"인 반면, 비교 대상 목록은 30일입니다. 따라서 자체 평가를 생성하는 비용은 거의 0에 가깝고, 보존 정책 덕분에 비공개 코드를 대상으로도 실행할 수 있습니다. 먼저 정리해야 할 하네스 세부 사항 하나는, 모델이 추론 흔적을 인터리브된 reasoning_content 필드로 반환한다는 점입니다. 이를 예상하지 않고 채팅 완료를 파싱하는 클라이언트는 사고 과정을 조용히 버려서 모델이 실제보다 더 나빠 보이게 만듭니다.

동일 가격 비교에 국한된 라우팅 논거
저희는 MiniMax M3를 제공합니다: MiniMax의 정가로, 마진 없이. LongCat-2.5-Preview는 저희가 제공하는 경로 중 하나가 아닙니다 — 저희는 이를 제공하지 않으며, 이 내용에 그렇다고 주장하는 의미가 담겨 있어서는 안 됩니다.
동일 가격 맞대결은 라우팅이 편의 기능이 아니라 제값을 하는 바로 그런 경우입니다. 두 모델의 비용이 같다면, 둘 사이의 선택은 요청별·작업별로 달라집니다: 512,000토큰 출력 상한과 비디오 입력에는 M3, 품질에 대해 충분히 확인한 뒤라면 긴 에이전트 루프에서 캐시된 프리픽스 할인을 받으려면 LongCat-2.5-Preview를 선택하는 식입니다. 모델 퓨전은 이를 문자 그대로 실현하는 메커니즘입니다 — 검색 패스와 합성 단계가 단일 요청에서 서로 다른 모델일 수 있으므로, 증거를 확보하기 전에 승자를 정하도록 강제되지 않습니다. 그리고 우리는 제공업체의 정가를 마크업 없이 그대로 전달하기 때문에, 벤더의 요율 변경이 다음 계약 갱신 때가 아니라 같은 날 청구서에 반영됩니다. 이는 두 카드 중 하나가 명시적으로 프로모션인 경우에 평소보다 더 중요합니다. 그다음 자동 페일오버는 한 제공업체가 성능이 저하되는 경우를 커버하며, 이는 검사할 서빙 이력이 없는 모델에 가장 중요합니다.
자주 묻는 질문
• LongCat-2.5-Preview가 MiniMax M3보다 더 저렴한가요? 아니요. 공개된 요금표에서 입력 및 출력 요율은 백만 토큰당 $0.30와 $1.20로 동일합니다. 유일한 가격 이점은 캐시된 입력으로, $0.06 대비 $0.006이며, Meituan은 전체 요금표를 한시적 할인이라고 표시하면서 이후에 무엇이 이어질지는 밝히지 않습니다.
• 사용 가능한 출력은 어느 쪽이 더 큰가? MiniMax M3가 큰 차이로 앞섭니다: 512,000 토큰 대 131,072. 장문 생성, 대형 문서에 대한 구조화된 추출, 또는 한 챕터 이상을 작성하는 모든 작업에서 그 상한이 결정적인 사양입니다.
• 내가 검증할 수 있는 건 어느 쪽인가? MiniMax M3인데, 그 검증은 그것에 호의적이지 않다 — Artificial Analysis에서 Coding 58.6으로 46위, Intelligence Index 29.2로 60위다. LongCat-2.5-Preview는 누구로부터도 공개된 평가가 없다. 이번 주에 LongCat-2.5-Preview 벤치마크가 나타난다면, 이름이 명시된 평가자에게 그 출처를 추적할 수 있을 때까지는 검증 불가능한 것으로 취급하세요.
• 프로덕션에 어느 것을 넣어야 할까요? 직접 테스트하지 않고는 어느 쪽도 안 됩니다. 둘 중에서 M3는 변동성이 더 낮은 선택입니다. 약점이 문서화되어 있고 입력 모달리티가 확인되었기 때문입니다; LongCat-2.5-Preview는 변동성이 더 높은 쪽으로, 더 큰 컨텍스트 주장, 훨씬 더 작은 출력 상한, 캐시 할인, 그리고 공개 증거가 전혀 없습니다. 창이 열려 있는 동안 무료로 실행해 보고, 둘 다 하나의 키 뒤에 두고, 직접 수치로 판단하게 하세요.
