
Nex-N2.5 Pro vs GLM-5.2: Terminal-Bench에서 동일한 82.7, 매우 다른 출처
- openaiNEWOpenAI: GPT-6 Astra2026-09-0455지능77코딩
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0247지능76코딩
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0247지능72코딩
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0157지능82코딩
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2646지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1849지능75코딩
- obsidianQwen3.8 27B2026-08-1541지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1251지능77코딩
- metaMeta: Muse Spark 1.22026-08-0547지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0347지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2140지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128지능49코딩
오픈 가중치(open-weights) 에이전틱 모델 두 개, 그리고 하나의 수상한 우연: Nex-N2.5 Pro와 GLM-5.2가 Terminal-Bench 2.1에서 모두 82.7을 기록했다. Nex-AGI는 자체 모델 카드에 Nex-N2.5 Pro에 대해 82.7을 명시했는데, 이는 대중에게 공개된 적 없는 동맹 자체의 NexCUA 하네스로 측정한 값이다. Z.ai가 동일한 스위트에서 보고한 GLM-5.2의 최고 수치도 82.7이다. 그러나 독립 하네스가 해당 모델을 다시 실행했을 때 결과는 77.9로, 공급업체가 발표한 수치보다 약 5포인트 낮았다. 아무도 검증할 수 없는 수치와 검증되자마자 이미 줄어든 수치 사이의 완벽한 동률은 결코 동률이 아니다. 이는 '오픈 가중치'와 '결국에는 존재하게 될 가중치'의 차이가 단 하나의 벤치마크 결과도 읽히기 전에 이 대결을 판가름하는 이유를 보여주는 가장 명확한 증거다.
{{1}}두 모델은 같은 상업적 영역에 자리하지만, 성격은 이보다 더 다를 수 없다.{{/1}} {{2}}2026년 9월 8일에 발표된 Nex-N2.5 Pro는 멀티모달 컴퓨터 사용 모델로, 총 3,970억 개의 파라미터 중 약 170억 개만 활성화되며, Qwen3.5 계열을 기반으로 구축되었다. 화면을 읽고 시각적 피드백 루프를 통해 브라우저나 데스크톱 세션을 구동하도록 설계되었다.{{/2}} {{3}}GLM-5.2는 Z.ai(Zhipu AI)의 MIT 라이선스가 적용된 플래그십 모델로, 장기 추론과 코딩에 특화되어 있다. 총 약 7,430억 개의 파라미터 중 약 400억 개가 활성화되며 텍스트 전용이고, 2026년 6월 16일부터 GA 상태이며, 수개월간 오픈 가중치 계층의 독립 평가 점수를 주도해 온 모델이다.{{/3}} {{4}}하나는 픽셀을 통해 세상을 바라보고 그에 따라 행동한다. 다른 하나는 텍스트로 사고하고 코드를 내놓는다.{{/4}} {{5}}두 모델 모두 라이선스상 비즈니스를 구축할 수 있다고 명시되어 있다. 차이점은 그중 하나의 경우 해당 라이선스가 현재로서는 약속에 불과하다는 점이다.{{/5}}
같은 숫자, 서로 다른 두 출처
동점부터 시작하자. 동점이야말로 이번 대결의 전체 구도를 설명해 주기 때문이다. Nex-AGI의 카드에는 Nex-N2.5 Pro가 Terminal-Bench 2.1에서 82.7을 기록한 것으로 나와 있으며, OSWorld-2 56.4, SWE-Bench Pro 61.2, BrowseComp 89.7도 함께 실려 있다. 이 모든 수치는 NexCUA 하네스를 통해 산출됐고, 모델 출시 초기 며칠간은 그 어느 것도 독립적으로 재현되지 못했다. 가중치를 내려받을 수 없다는 단순한 이유 때문이다. Z.ai가 GLM-5.2의 Terminal-Bench 2.1 점수로 제시한 82.7은 벤더가 자체 보고한 최고 수치이지만, 그 수치가 나온 모델은 누구나 Hugging Face에서 내려받아 오늘 오후에 다시 실행할 수 있다. 독립 하네스 측정값 77.9는 이미 존재하며, Z.ai의 주장보다 약 5포인트 낮다. 벤더 수치가 독립 테스트에서 줄어드는 것은 스캔들이 아니다. 자체 측정에 붙는 정상적인 세금일 뿐이다. 그런데 경쟁 벤더의 수치가 테스트조차 불가능할 때, 그 세금이 없다는 사실 자체가 문제다. 그 수치가 말끔하다는 신호가 아니라.

주변 행들도 같은 방식으로 읽어야 합니다. GLM-5.2는 오픈 계층이 산출한 독립 지수 수치 중 가장 높은 값을 보유하고 있습니다 — Artificial Analysis의 현재 Intelligence Index 기준 50대 초반 — 그렇기에 가장 화려한 신규 출시는 아니었음에도 수개월 동안 오픈 모델의 기준이 되어 왔습니다. Nex-N2.5 Pro에는 독립 지수 항목이 전혀 없습니다. 양쪽 공급업체가 수치를 주장하는 행에서는 검증 가능한 쪽이 기존 모델의 것이고, Nex-AGI만 공개한 행에서는 그 수치가 재현되지 않았습니다. 이것은 어느 모델이 더 똑똑한지에 대한 판정이 아닙니다. 어느 모델을 검증할 수 있는지에 대한 판정입니다.
사양서들은 생각보다 더 일치한다
벤치마크를 빼고 보면 두 모델은 기본기에서 거의 차이가 없다:
• 출시됨 — Nex-N2.5 Pro: 2026년 9월 8일(호스팅 엔드포인트는 라이브, 가중치는 아직 미공개). GLM-5.2: 2026년 6월 16일 GA, 가중치 공개됨.
• 라이선스 — Nex-N2.5 Pro: Apache-2.0, 가중치 곧 제공 예정. GLM-5.2: MIT, 지금 다운로드 가능.
• 규모 — Nex-N2.5 Pro: 총 397B / 활성 ~17B. GLM-5.2: 총 ~743B / 활성 ~40B.
• 모달리티 — Nex-N2.5 Pro: 텍스트 및 이미지 입력, 텍스트 출력, 컴퓨터 사용 비전 루프. GLM-5.2: 텍스트 전용 추론 모델.
• 컨텍스트 / 출력 — Nex-N2.5 Pro: 262,144 토큰 컨텍스트. GLM-5.2: 1M 토큰 컨텍스트, 128K 출력 상한.
• 추론 제어 — Nex-N2.5 Pro: 없음 / 중간(적응형, 기본값) / 높음. GLM-5.2: 동일한 모델 문자열에서 reasoning-effort 제어 가능.
• 1M 토큰당 가격 — Nex-N2.5 Pro: 무료 호스팅 티어, 공시 가격 없음. GLM-5.2: 입력 $1.40 / 출력 $4.40, 캐시 입력 $0.26.
두 모델의 작업이 다른 만큼 사양 한계도 다릅니다: {{1}}GLM-5.2{{/1}}은 긴 엔지니어링 세션을 위해 백만 개의 텍스트 컨텍스트 토큰과 128K 출력 상한을 제공하는 반면, {{2}}Nex-N2.5 Pro{{/2}}는 컨텍스트 크기를 희생하고 대신 비전 채널과 화면 규모 작업에 맞춘 더 작은 {{3}}262K{{/3}} 창을 제공합니다. 어느 쪽 사양도 틀린 것이 아닙니다. 서로 다른 작업에 맞게 설계된 것입니다.
Open weights, 두 가지 다른 의미

바로 이 지점에서 비교는 더 이상 숫자에 관한 것이 아닙니다. GLM-5.2는 사업을 구축할 수 있는 제품을 출시하는 방식 그대로 공개되어 있습니다: {{1}}MIT 라이선스, Hugging Face에 공개된 가중치, 상업적 이용 제한 없음, 데이터 공유 조항 없음, 어깨 너머로 지켜보는 벤더 없음.{{/1}} 직접 다운로드하고, 파인튜닝하고, 자체 컴플라이언스 경계 안에서 서빙하거나, 원하는 호스트에 가져갈 수 있습니다. 그리고 가중치가 공개되어 있기에 그 가격에는 어떤 단일 벤더도 올릴 수 없는 하한선이 있습니다. Nex-N2.5 Pro는 동등하게 허용적인 Apache-2.0 라이선스로 제공되겠다고 약속되었지만, Hugging Face 카드의 배너에는 가중치가 곧 공개될 예정이라고만 쓰여 있고 날짜는 명시되지 않았습니다. 데이터 거버넌스 규정을 적용받는 팀이든, 대규모에서 토큰당 과금을 완전히 피하려는 팀이든, 그 차이가 결정의 전부입니다: {{2}}GLM-5.2는 오늘 당장 소유할 수 있는 모델이고, Nex-N2.5 Pro는 약속만 받은 모델입니다.{{/2}} 가중치가 마침내 공개될 때 자체 호스팅 계산에서도 신제품이 유리합니다 — {{3}}H100 8개 노드에서 17B 활성 파라미터는 GLM-5.2의 약 40B 활성 규모보다 훨씬 접근하기 쉬운 설치 면적이기 때문입니다{{/3}} — 하지만 그 문장에서 '가중치가 공개될 때'라는 말이 큰 비중을 차지합니다.
가족들은 서로 반대 방향으로 이동하고 있다.
두 모델 모두 빠르게 진화하는 패밀리에 속해 있으며, 그 궤적은 서로 다른 방향으로 향하고 있습니다. GLM-5.2의 계보는 투명하고 반복적으로 진화합니다. Z.ai는 동일한 5.2 베이스의 포스트트레이닝 리프레시인 GLM-5.3을 8월에, 9월 초에는 GLM-5.3 Flash를 출시했습니다. 따라서 오늘 여러분이 그 위에 구축하는 5.2 가중치는 패밀리가 계속해서 개선해 나가는 기반이며, 여러분의 아키텍처 지식과 파인튜닝도 그대로 이어집니다. Nex-AGI의 패밀리는 완전히 새로운 세대에 거는 베팅입니다. 35B 규모의 Nex-N2.5 Mini, 397B 규모의 Nex-N2.5 Pro, 그리고 자체 베이스가 DeepSeek-V4-Pro-Base인 텍스트 전용 1.6T Nex-N2.5 Max가 있지만, 패밀리의 주장을 누구나 검증할 수 있게 해줄 Pro 가중치는 여전히 비공개 상태입니다. 구축 기반으로 삼을 플랫폼을 선택하는 팀은 리프레시 로드맵이 공개된 계보와 아직 2막이 도래하지 않은 첫 번째 릴리스 사이에서 선택하는 셈입니다.
어느 쪽이 당신의 빌드에 어울리나요?
요구사항이 "모델은 우리 것이어야 한다"는 것이라면 — 데이터 거버넌스, 감사, 단일 벤더가 통제하는 것을 원하지 않는 제품을 위해서라면 — 이 대결에서 GLM-5.2는 더 나은 선택이 아니라 유일한 선택입니다. 다운로드할 수 있는 유일한 모델이기 때문입니다. 또한 독립적인 점수를 가진 유일한 모델이기도 하며, 가격은 Z.ai의 공시가 기준으로 입력 100만 토큰당 $1.40, 출력 100만 토큰당 $4.40입니다. 요구사항이 폐쇄형 리더들을 결국 능가할 수 있는 멀티모달 컴퓨터 사용 에이전트라면, Nex-N2.5 Pro가 더 흥미로운 장기적 논점입니다 — 무엇을 구축하려는지 분명히 아는 연합이 만든 17B 활성 비전 에이전트 — 하지만 논점은 의존성이 아니며, 무료 호스팅 엔드포인트는 기반이 아닙니다.

이 모든 것에 대해 실용적으로 대응하는 방법은 이미 존재하는 것 위에 구축하고, 그것이 실제로 도착했을 때 그 가능성을 측정하는 것입니다. GLM-5.2는 OrcaRouter에서 Z.ai의 공시 가격($1.40 / $4.40) 그대로, 마크업 없이 제공되며, 오픈 웨이트 모델이므로 측정 범위에 자체 서빙 스택을 포함하려면 직접 호스팅할 수도 있습니다. 이것이 오늘날 실제 에이전틱 워크로드를 실행할 기준점이며, 라우팅 DSL은 Nex-N2.5 Pro가 공시 가격으로 프로바이더에 등장할 그 날을 대신해 지금을 지탱합니다. 실제로 그런 일이 발생하면 비교 대상을 전환하는 것은 마이그레이션이 아니라 하나의 라우팅 규칙일 뿐입니다. 샤드가 공개되고 독립적인 하네스가 그 82.7을 확인하거나 정정하기 전까지, Nex-N2.5 Pro와 GLM-5.2의 대결은 검증할 수 있는 모델과 검증할 수 없는 숫자 사이의 대결입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
