
LongCat-2.5-Preview vs Qwen3.8-Max: 가격은 7분의 1, 스코어보드에는 전무
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 610 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 189 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Meituan은 LongCat-2.5-Preview를 2026년 9월 25일 자사 API 플랫폼에 변경 로그 항목과 요금표를 함께 올렸고, 그 어떤 벤치마크도 없었습니다 — 그런 다음 동일한 호출에 Qwen3.8-Max가 부과하는 금액의 약 7분의 1로 가격을 책정했습니다. 이는 작은 격차가 아니며, 안전한 격차도 아닙니다. 해당 공급업체의 플래그십인 Qwen3.8-Max는 2026년 8월 3일부터 정식 제공되어 왔고, 독립적인 Artificial Analysis 순위를 보유하며, 이름으로 고정할 수 있는 날짜가 명시된 스냅샷을 게시하고, 입력에 대해서는 6.7배, 출력에 대해서는 5배를 청구합니다. 이 비교가 답해야 할 질문은 어느 모델이 더 나은가가 아닙니다 — Meituan 외부의 누구도 아직 그 질문에 답할 수 있는 위치에 있지 않습니다. 그것은 그 차액으로 무엇을 사는지, 그리고 그 차액이 살 만한 가치가 있는지입니다.
각 측이 실제로 공개한 내용
출처부터 시작하죠. 어떤 벤치마크보다도 이 둘을 더 뚜렷하게 구분해 주는 건 바로 그것이니까요.
LongCat-2.5-Preview는 Meituan 자체 변경 로그에 날짜가 명시된 항목 — 벤더의 표현: "버전: 2026-09-25 — LongCat-2.5-Preview 이제 사용 가능" —, 플랫폼의 현재 종량제 모델로 이를 나열한 가격 페이지, 그리고 두 가지 와이어 형식을 모두 다루는 빠른 시작 가이드와 함께 등장했습니다. Meituan의 X 계정은 이를 "1.6T 매개변수. 약 48B 활성. 1M 토큰 컨텍스트 윈도우. 네이티브 멀티모달."이라고 설명합니다. 그 외에는 읽을 것이 없습니다. meituan-longcat Hugging Face 조직에는 이 모델을 다루는 저장소가 없습니다 — 조직의 가장 최근 저장소는 7월 31일의 LongCat-Flash-Lite-Sparse입니다 — 그리고 이를 제공하는 OpenCode 모델 카탈로그는 이를 클로즈드 웨이트로 기록합니다. 벤더가 공개한 모델 카드도, 기술 보고서도, 라이선스도, 매개변수 표도 없으며, 어디에도 독립적인 평가가 없습니다: 9월 27일 기준으로 Artificial Analysis에는 LongCat-2.5-Preview 페이지가 없습니다.
Qwen3.8-Max는 거의 모든 면에서 정반대의 사례다. 2026년 8월 3일 공개된 요금표와 함께 정식 출시되었고, 알리바바는 9월 2일 이름이 붙은 리프레시인 Qwen3.8-Max-0902를 내놓았다. Artificial Analysis가 이를 측정한다: Intelligence Index 45.4로 145개 모델 중 15위, Coding Index 76.2로 138개 중 9위다. GPQA Diamond 92.8%, Humanity's Last Exam 43.1%, SciCode 52.1%, Long-Context Recall 80.3%, Terminal-Bench 2.1 88.8%, τ-bench banking 47.8%를 기록한다. 즉, 모든 수치에 영수증이 딸린, 측정된 모델이다.
그러니까 증거 열에 대한 솔직한 요약은 능력과는 아무 상관 없는 방식으로 한쪽으로 치우쳐 있습니다. 이 모델들 중 하나는 결정을 내리기 전에 평가할 수 있습니다. 다른 하나는 시도해 보는 수밖에 없습니다.
요금표, 한 줄씩
둘 다 동일한 출력 상한을 가진 백만 토큰 모델이라, 스펙 시트는 스펙 시트가 가장 쓸모없는 바로 그 지점에서 정확히 수렴한다:
• 캐시되지 않은 입력 — LongCat-2.5-Preview는 100만 개당 $0.30, Qwen3.8-Max는 100만 개당 $2.00으로 6.7배 차이입니다.
• 캐시된 입력 — 100만 개당 $0.006 vs $0.25, 41.7배 격차.
• 출력 — 1M당 $1.20 vs 1M당 $6.00, 5배 차이.
• 컨텍스트 윈도우 — 1,048,576 토큰 대 1,000,000 토큰. 기능적으로는 무승부.
• 최대 출력 — 양쪽 모두 131,072 토큰. 동일.
• 독립 점수 — 공개된 수치 없음 vs AA Intelligence 45.4 및 AA Coding 76.2.
거기 있는 모든 LongCat 수치는 Meituan 자체 가격 책정 페이지에서 나온 것이며, 그 페이지는 해당 열 전체를 "할인 가격(한시적)"이라고 표기하고 있습니다. Qwen3.8-Max의 수치는 Alibaba의 정가로, 우리 자체 모델 카드에서 읽은 것이며, 캐시 읽기는 백만 개당 $0.25, 캐시 쓰기는 $2.50입니다. Artificial Analysis의 스냅샷 날짜는 2026년 9월 2일입니다.
캐시 입력 항목이 바로 눈여겨봐야 할 부분이다. 캐시 읽기에서의 42배 차이는 이 비교에서 가장 큰 단일 수치이며, 그것은 에이전트 워크로드가 실제로 상주하는 차원에 떨어진다. 매 턴마다 100,000토큰짜리 시스템 프롬프트와 도구 스키마를 다시 보내는 에이전트 루프는 토큰 대부분에 대해 대표 입력 요율이 아니라 캐시 요율을 지불하고 있는 것이다.
양쪽 방식으로 가격이 책정된 150,000토큰 호출
에이전트 형태의 그럴듯한 요청을 가정해 보자: 입력 150,000토큰, 그중 50,000토큰은 캐시에서 제공, 응답은 4,000토큰. 메이투안의 할인 요율로는 그 호출 비용이 $0.0501이다. Qwen3.8-Max의 정가 요율로는 동일한 호출 비용이 $0.3365 — 6.7배 더 비싸며, 하루 1,000회 호출 기준으로 $50 대 $337이다. 입력 구성을 완전 캐시로 밀어붙이면, 즉 반복 프롬프트의 정상 상태라면 비율은 12.3배로 벌어진다: 호출당 $0.006 대 $0.074.
그 계산 어디에도 LongCat-2.5-Preview가 좋다는 점에 좌우되는 것은 없다. 바로 그것이 문제다. 당신이 제안받는 배율은 실제이며, 공급업체 자체 페이지에서 그것에 붙은 단어는 'limited-time'이고, 종료일도, 명시된 후속 가격도 없다. 만료가 공표되지 않은 6.7배 할인은 계획에 넣을 수 없는 예산 항목이다. 그것은 지켜봐야 하는 예산 항목이다.
또한 분명히 짚고 넘어갈 만한 라우팅 비대칭성이 있습니다. Qwen3.8-Max는 저희가 제공하는 경로 — qwen/qwen3.8-max 그리고 고정된 qwen/qwen3.8-max-0902 — Alibaba의 정가로, 마크업 없이 제공됩니다. 따라서 벤더 가격 변동은 몇 주 뒤가 아니라 같은 날 저희 쪽에 반영됩니다. LongCat-2.5-Preview는 저희 경로 중 하나가 아니며, 그렇지 않은 척할 생각도 없습니다. 이 비교의 저렴한 쪽에서는 Meituan 자체 API와, 그것에 접근하기 위해 거치는 플랫폼이 무엇이든 그것을 상대하게 됩니다.
메이투안 자체 API가 반박하는 단 하나의 주장
이것은 워크로드가 순수 텍스트가 아닌 사람이라면 누구에게나 그 대결의 승자를 결정지어 줄 연구 결과입니다.
Meituan의 변경 이력은 이미지 이해를 2.5 세대의 대표적인 추가 기능으로 꼽는다: "멀티모달 이해: 새로운 이미지 이해 기능으로, 이미지 내용을 분석할 수 있으며, 교차 모달 질의응답, 콘텐츠 요약, 복잡한 시각적 추론을 지원한다." X 게시물은 "네이티브 멀티모달"이라고 말한다. 이는 모두 벤더의 주장이며, 그 자체만으로는 의사 결정에 반영해도 합리적일 것이다.
그런 다음 같은 문서 사이트가 해당 모델 자체의 메타데이터를 검색하기 위한 예시 응답을 게시하는데, 반환되는 모델은 텍스트 전용입니다. id "LongCat-2.5-Preview"에 대해 페이로드는 다음을 보여줍니다: context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], 그리고 모달리티 문자열은 text->text. 이미지 항목은 없습니다. 오래된 스냅샷이 아니라 — 해당 엔드포인트를 문서화하는 페이지의 실제 예제에 있습니다.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
그것은 해당 모델이 볼 수 없다는 것을 증명하지 않는다. 그것은 공급업체가 자사 설명과 자체 API 스키마를 아직 정합시키지 않았음을 입증하며, 누군가 이를 정리하기 전까지는 구매자가 그 체인지로그 문장을 근거로 비전 워크로드를 청구할 수 없다는 뜻이다. 이를 반대편과 나란히 놓아보자: 우리 카탈로그에는 Qwen3.8-Max가 텍스트, 이미지, 비디오 입력을 받는 것으로 등록되어 있고, 선언된 기능 중 하나로 비전이 포함되어 있으며, 해당 모델 뒤에는 독립적인 벤치마크 표가 있다. 작업이 문서 이해, 스크린샷 트리아지, 또는 비디오 프레임 분석이라면, 비싼 열은 검증된 입력 모달리티가 있는 쪽이고 저렴한 열은 해결되지 않은 입력 모달리티가 있는 쪽이다. 그 단 하나의 행이 6.7× 전체를 지워버릴 수 있다.
Preview를 고정할 수 없는 대상
Alibaba는 날짜가 지정된 스냅샷을 제공합니다. qwen/qwen3.8-max-0902는 기본 모델과 동일한 $2/$6 가격에 이름이 붙은 고정 빌드이므로, 이를 지정한 라우팅 규칙은 다음 달에도 동일한 가중치를 계속 반환합니다. 동작 변경은 원하는 일정에 맞춰 도입할 수 있는 새 ID로 제공됩니다.
LongCat-2.5-Preview에는 그런 핸들이 없습니다. 모델 ID가 프리뷰 ID이고, 스냅샷 접미사도 없으며, 플랫폼에 버전 기록도 없고, 가중치가 바뀌었다고 알려 줄 변경 로그 항목도 없습니다 — 다만 할인이 "기간 한정"이라는 것뿐입니다. 그것은 일반적인 의미의 프리뷰입니다. 그 이름 아래에 있는 것은 바뀔 수 있으며, 릴리스 노트가 아니라 여러분의 출력에서 그 사실을 알게 될 것입니다.
빠져 있는 증거를 확보하는 가장 저렴한 방법은 Meituan이 이 반대편에 열어둔 창구다: OpenCode는 LongCat-2.5-Preview를 한시적으로 무료로 올려두었고, 제공업체는 제로 보존 정책을 따르며 사용자 데이터로 학습하지 않는다. 그리고 9월 26일, 그 창구가 2주간 열린다고 밝혔다. 무료 입력, 무료 출력, 무료 캐시 읽기. 이것은 아무도 공개하지 않은 벤치마크 테이블을 만드는 정당한 방법이다 — 자체 평가 코퍼스를 이 모델에 돌려보면, 벤더가 문장 하나를 내놓은 자리에서 당신은 숫자를 갖게 된다. 그것이 아닌 것은 계획을 세울 수 있는 가격이라는 점이다: 2주는 끝나고, 그 반대편의 숫자는 Meituan이 정할 몫이다.
누가 무엇을 골라야 할까
워크로드가 애초에 그 모델을 구매하는 이유일 때는 Qwen3.8-Max를 선택하세요. 입력이 이미지나 동영상이라면, 답변이 빌드마다 재현 가능해야 한다면, 독립적인 지수가 조달 요건이라면, 또는 그 작업이 Terminal-Bench와 Coding Index가 대리하는 종류의 에이전트형 코딩이라면, 6.7×는 자신의 작업을 검증할 수 있는 대가입니다. 한 가지 핵심 지표에서는 폴백 체인뒤에 있기 때문에, 점수가 매겨진 모델이 점수가 매겨지지 않은 모델의 안 좋은 날을 흡수할 수 있어 두 개의 통합을 운영할 필요가 없습니다.

워크로드가 대용량이고, 짧은 컨텍스트, 텍스트 전용, 내부용일 때 — 분류, 추출, 요약, 대량 재작성 — 그리고 잘못했을 때의 비용이 고객이 아니라 재시도인 경우에는 LongCat-2.5-Preview를 선택하세요. 그런 형태에서는 캐시된 입력 라인이 할인이 아니라 작업의 경제성 전체를 좌우하며, 42×는 측정할 가치가 있는 숫자입니다. 무료 윈도를 활용해 아직 존재하지 않는 벤치마크를 산출하세요. 중요 경로(critical path)를 여기로 마이그레이션하지는 마세요.
이 판정을 바꿀 수 있는 것은 중요도 순으로: LongCat-2.5-Preview에 대한 독립적 평가, 할인의 공개된 종료일과 후속 가격, 날짜가 표시된 스냅샷이 있는 버전 이력, 그리고 모달리티 목록이 텍스트 전용인지 아닌지에 대한 결론입니다. 이 중 하나라도 충족되면 저렴한 열은 단순한 할인 이상이 됩니다. 적어도 하나가 실현되기 전까지, 이 비교는 두 모델 간의 맞대결이 아니라 — 검증할 수 있는 가격과 검증할 수 없는 성능 사이의 맞대결입니다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
