생성된 히어로 타이틀 카드에는 'LongCat-2.5-Preview vs GLM-5.2'가 표시되어 있고, 오버라인은 '동일한 1M 윈도우, 그중 하나만 측정됨'이며, 두 개의 패널이 있습니다: 'LongCat-2.5-Preview: 1M 컨텍스트, 1M당 $0.30 / $1.20, 벤치마크 미공개' 및 'GLM-5.2: 1M 컨텍스트, AA Long-Context Recall 78.33'. OrcaRouter 로고는 오른쪽 하단에 있습니다.
Guides & Insights

LongCat-2.5-Preview vs GLM-5.2: 두 개의 1M 토큰 윈도우, 그중 하나는 실측

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

LongCat-2.5-Preview와 GLM-5.2는 동일한 대표 숫자를 내세운다: 100만 토큰의 컨텍스트 윈도우. 이번 주에 작성되는 대부분의 비교에서 그 단 하나의 우연이 모든 일을 하고 있으며, 그것만으로 두 모델을 비교하기에는 충분하지 않다. GLM-5.2는 2026년 6월 16일부터 공개 벤치마크 프로필, 공개된 요금표, 독립 평가자의 장문맥 회상 점수를 기록으로 남겨 왔다. LongCat-2.5-Preview는 2026년 9월 25일 Meituan의 LongCat API Platform에 할인된 요금표, 중국 업계 보도에서 보고된 파라미터 수와 함께 등장했으며, 어떤 종류의 공개 벤치마크도 없다. 한쪽 윈도우는 측정된다. 다른 쪽은 주장된다. 아래의 모든 내용은 이 두 범주를 분리해 둔다, 왜냐하면 스펙 시트와 테스트 결과는 같은 종류의 사실이 아니기 때문이다.

이것이 그 맞대결의 솔직한 버전이며, 미화된 버전보다 더 유용하다.

각 측이 실제로 공개한 내용

Meituan의 변경 로그에는 날짜가 표시된 항목 — "버전: 2026-09-25, LongCat-2.5-Preview 출시" — 이 실려 있으며, 세 가지 주장된 기능을 나열합니다: 이미지 이해, 코딩, 그리고 "Claude Code 및 기타 주류 개발 환경"과의 호환성으로, Hermes, OpenClaw, OpenCode, Kilo Code를 언급합니다. 공급업체의 가격 페이지에는 종량제 요금으로 캐시되지 않은 입력 토큰 100만 개당 $0.30, 캐시된 입력 토큰 100만 개당 $0.006, 출력 토큰 100만 개당 $1.20이 명시되어 있으며, 페이지 자체에 한시적 할인이라고 표시되어 있습니다. 컨텍스트 창은 100만 토큰이고 최대 출력은 131,072입니다. 전문가 혼합(mixture-of-experts) 백본에서 총 파라미터가 약 1.6조 개이고 토큰당 활성 파라미터가 약 480억 개라는 정보는 Meituan 자체 사이트 메타데이터와 이 목록에 대한 중국 업계 보도에서 나온 것이지 API 문서에서 나온 것이 아닙니다. 이와 함께 제공된 기술 보고서, 모델 카드, 벤치마크 표는 전혀 없습니다. HuggingFace에는 LongCat-2.5-Preview 저장소가 없고, Meituan의 GitHub 조직에도 그 이름의 저장소가 없습니다. OpenCode와 함께 제공되는 모델 카탈로그 메타데이터는 오픈 가중치를 false로 기록합니다.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

Z.ai의 GLM-5.2는 반대 위치에 있습니다. 6월 출시 제품이며, 당사가 정가로 제공하는 요금표는 다음과 같습니다: 당사 카탈로그 기준 입력 토큰 백만 개당 $1.40, 캐시된 입력 토큰 백만 개당 $0.26, 출력 토큰 백만 개당 $4.40이고, 1,000,000토큰 컨텍스트 창과 최대 출력 128,000토큰을 갖추고 있습니다. 공개된 점수는 서로 다른 두 곳에서 나오며, 그 구분은 중요합니다: AIME 2026, HMMT February 2026, GPQA-Diamond 및 FrontierSWE 스위트에 대한 Z.ai 자체 수치는 공급업체 보고입니다; 당사 카탈로그에 실린 Coding Index 및 Intelligence Index 수치는 자체 평가를 수행하는 Artificial Analysis에서 가져온 것입니다.

그들이 진정으로 동등한 유일한 차원

두 모델 모두 정확히 1,000,000 토큰의 컨텍스트를 내세운다. 하지만 그 안에 들어 있는 내용을 모델이 여전히 활용할 수 있는지 시험하는 공개 점수를 가진 쪽은 둘 중 하나뿐이다. Artificial Analysis는 GLM-5.2의 장문맥 회상(Long-Context Recall) 수치를 78.33으로 기록한다. LongCat-2.5-Preview에는 이에 상응하는 숫자가 없다. 누구에게서도. 그 비대칭성이 이 맞대결 전체를 한 줄로 요약한다. 100만 토큰 창은 아키텍처의 용량에 관한 진술이지, 900,000번째 토큰에서 모델이 올바르게 검색해내는지에 관한 진술이 아니다. 용량은 표기하기는 싸고 검증하기는 비싸다. 그래서 모든 벤더가 그것을 표기하고, 거의 어떤 업체도 회상 테스트를 공개하지 않는다.

그러니까 긴 컨텍스트 작업 때문에 이 둘 중에서 고르는 거라면, 당신은 공개된 리콜 점수가 있는 선택지와 없는 선택지 사이에서 고르는 셈이다 — 그리고 없는 쪽은 측정되지 않은 벤치마크 프로필을 가진 쪽이기도 하다. 그건 그것에 반대하는 논거가 아니다. 그것은 일치하는 정수 하나를 근거로 둘을 서로 바꿔 쓸 수 있는 것으로 취급하는 데 반대하는 논거다.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

실제 작업에서 가격 격차가 어떻게 보이는지

요금표는 서로 가깝지 않고, 그 방향성도 사람들이 서구 프런티어 랩에 맞서는 중국 오픈 웨이트 도전자에게 기대하는 방향이 아니다. LongCat-2.5-Preview는 캐시되지 않은 입력에서 GLM-5.2보다 약 4.7배 저렴하고 출력에서 약 3.7배 저렴하다 — 이 비율은 측정값이 아니라 두 공개 요금표로 계산한 산술값이다. 20,000토큰을 다시 출력하는 500,000토큰 문서 처리 작업에서는 약 17센트 대 약 79센트가 된다. 두 모델 모두 같은 문서를 읽어야 한다. 문서 끝에서도 여전히 주의를 기울일지에 대한 공개된 점수를 가진 것은 둘 중 하나뿐이다.

함께 언급해야 할 두 번째 유의점이 있다: Meituan은 자사 요금표를 기간 한정 할인이라고 표시한다. $0.30이라는 수치는 프로모션 가격이고, 이 업체는 그 뒤에 무엇이 이어지는지 말하지 않는다. 프로모션 가격을 토대로 세운 비용 모델에는 읽어낼 수 없는 만료일이 있다. 그것은 그 모델을 피할 이유가 아니라, 공급자 간 마이그레이션을 저렴하게 유지해야 할 이유다.

OrcaRouter에서 우리가 제공하는 라우트는 하나의 키 뒤에서 공급자 정가로, 마크업 없이 제공됩니다. 따라서 벤더의 가격이 바뀌면 다음 갱신 시점이 아니라 같은 날 청구서에 반영되며, 자동 페일오버가 성능이 저하된 요청을 애플리케이션이 알지 못하는 사이에 정상 공급자로 옮겨 줍니다. GLM-5.2는 우리가 제공하는 라우트 중 하나입니다. LongCat-2.5-Preview는 아닙니다 — 우리는 이를 제공하지 않으며, 이 글의 어떤 내용도 그렇다고 주장하는 것으로 읽혀서는 안 됩니다. Z.ai 역시 6월 이후 나아갔습니다: GLM-5.3은 2026년 8월 18일부로 우리 카탈로그에 라이브 상태이므로, "신모델 대 현행 모델"로 짜인 비교는 이미 GLM-5.2를 최전선이 아니라 기존 모델로 자리매김하고 있는 셈입니다.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

무엇이 이것을 해결할 수 있고, 무엇은 그렇지 않은가

• Meituan 또는 독립 평가자가 제공한 LongCat-2.5-Preview의 Long-Context Recall 점수. 그 점수가 존재하기 전까지 LongCat-2.5-Preview의 1M 윈도는 아무런 테스트도 붙지 않은 주장일 뿐이며, GLM-5.2의 78.33이 이 비교에서 같은 질문을 다루는 유일한 숫자다.

• 기간 한정 표시가 없는 공급업체 요금표. 할인된 가격은 프로모션 기간 동안 해당 모델의 비용이 얼마인지 알려줄 뿐, 실제 비용을 알려주지는 않는다.

• 어떤 종류든 벤치마크 표. 리더보드 순위가 아니라, 그저 공개된 평가 실행 결과 — 그래야 비교가 스펙 시트와 결과 페이지를 맞세우는 일이 아니게 된다.

• 이미지 입력 확인. 변경 로그는 이미지 이해를 대표적인 추가 사항으로 내세우지만, Meituan 자체의 "Retrieve Model" 문서에 나오는 예시 응답은 여전히 input_modalities를 ["text"]로, text->text 모달리티 문자열로 보여줍니다. 그 샘플은 단순히 오래된 것일 수 있습니다. 그럼에도 이는 벤더가 공개한 계약이므로, 이미지 입력은 사용 가능한 것이 아니라 주장된 것으로 취급하십시오. 이와 대조적으로 GLM-5.2는 우리 카탈로그에서 텍스트 입력 및 텍스트 출력이며 이미지 모달리티가 전혀 없습니다. 따라서 이 측면에서는 두 모델 중 어느 것도 검증된 답을 주지 않으며, 둘 중 하나는 주장만 제시합니다.

• 직접 측정한 수치. 공개된 수치와 여러분에게 필요한 수치 사이의 격차는 두 모델을 여러분의 작업에서 실행해 보면 메워지며, LongCat-2.5-Preview의 무료 개방 기간이 지금 그것을 저렴하게 만들어 줍니다. 인터리브된 reasoning_content 필드로 도착하는 추론 트레이스는 가장 먼저 확인해야 할 하네스 세부 사항입니다. 이를 조용히 버리는 툴링은 오류를 내지 않으면서도 모델의 유용성 대부분을 잃게 되기 때문입니다.

이로 인해 비교가 어디에 놓이게 되는가

오늘 결정을 내려야 하고 그것이 긴 컨텍스트를 포함한다면, GLM-5.2는 실제로 평가할 수 있는 모델이다. 여기에는 공개된 재현율, Artificial Analysis의 독립적인 코딩 점수 68.8, Intelligence Index 33.7, 그리고 예산을 세울 수 있는 가격이 있다. 이 수치들은 최전선급이라기보다는 유능한 모델을 설명한다 — Z.ai 자체의 후속 모델인 GLM-5.3이 더 높은 점수를 낸다 — 그래도 그것들은 무언가를 설명한다. LongCat-2.5-Preview는 더 저렴하고 컨텍스트가 더 크며 전혀 측정되지 않은 제안인데, 그 가장 매력적인 특성인 가격은 명시적으로 일시적이다. 그것에 대한 올바른 태도는 회의주의가 아니다. 프로모션 요금이 사라지기 전에, 자체 채점 하네스를 붙여 2주간 평가를 실행하는 것이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트