
NV-Reason-CT vs GLM-5.2: 이 중 하나는 더 이상 사용되지 않으며, 당신이 생각하는 그쪽이 아니다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 97 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
이 비교에서 더 오래된 모델이 바로 퇴역하는 쪽이다. GLM-5.2는 2026년 6월 16일에 출시되었고, NV-Reason-CT는 저장소 활동이 2026년 9월 2일부터 25일 사이로 기록되어 있다. 보통이라면 9월의 것이 불확실한 대상이고 6월의 것이 확정된 선택이라고 여길 것이다. 텍스트 파이프라인에서 중요한 축에서는 그 반대다. GLM-5.2는 2026년 8월 18일에 출시된 GLM-5.3으로 대체되었고, 이제 수치가 공개되는 독립 리더보드에서 사용 중단 표시가 붙어 있다. NV-Reason-CT는 다른 무엇이 미해결이든, 그것이 하는 유일한 일의 최신 릴리스다.
따라서 이 글에서 첫 번째로 유용한 문장은 독자가 가장 접하기 어려운 문장이다. 오늘 텍스트 빌드를 시작하면서 습관적으로 GLM-5.2를 선택하려 한다면, 잠시 멈추고 GLM-5.3을 먼저 살펴보라. 입력 토큰 100만 개당 $1.26, 출력 토큰 100만 개당 $3.96으로, GLM-5.2의 $1.40, $4.40과 대비된다. 더 새롭고 더 저렴하다. 그리고 독립 지능 지수는 33.7 대비 44.8로, 이는 같은 척도에서 옆걸음이 아니라 한 단계 위로 올라선 것이다. 이는 CT와 관련된 그 어떤 것과도 별개의 결정이며, 별도로 내려질 만하다.
두 모델, 그리고 두 가지 다른 종류의 오래된 것
오래된 모델과 대체된 모델 사이에는 실질적인 차이가 있으며, 이 짝은 그 차이를 구체적으로 보여준다.
• 기능 — NV-Reason-CT는 흉부 또는 복부 CT 볼륨을 판독하여 해부학적 부위별로 구조화된 소견을 출력합니다. GLM-5.2는 추론, 코드, 장문 문서 작업을 위한 텍스트 전용 언어 모델입니다
• 공개됨 — NV-Reason-CT의 아티팩트는 2026년 9월 2일부터 25일까지이며, GLM-5.2는 2026년 6월 16일, GLM-5.3은 2026년 8월 18일에 뒤이어 공개되었습니다
• 세대 현황 — NV-Reason-CT는 버전 0.1로, 최초 릴리스이며 아직 공식 발표되지 않았습니다. GLM-5.2는 출시된 제품 라인의 이전 세대입니다
• 독립적 위상 — NV-Reason-CT에 대한 독립적 측정치는 존재하지 않으며, GLM-5.2는 Artificial Analysis Intelligence Index에서 33.7로 측정되었고 지원 중단(deprecation) 표시가 있는 반면, GLM-5.3은 44.8임
• 라이선스 및 액세스 — 다운로드하는 OpenMDW-1.1 가중치; 백만 토큰당 $1.40 및 $4.40에, 캐시된 읽기 $0.26로 제공되는 오픈 웨이트 모델과 대비
• 컨텍스트 — 채팅 창 없이 볼륨당 시각 토큰 13,824개, 이에 비해 입력 1,000,000개·출력 128,000개
• 명시된 사용 목적 — 연구 및 교육 전용, 의료기기가 아님; 범용 배포 반대
"deprecated"라는 단어는 여기서 정확한 역할을 하고 있으며, 지나치게 확대해석하지 않는 것이 좋습니다. 리더보드의 deprecation 표시는 평가자가 해당 모델을 더 이상 최신으로 취급하지 않는다는 뜻이며, 보통 후속 모델이 그 자리를 차지했기 때문입니다. 그것은 가중치가 회수되었다거나, API가 꺼졌다거나, 모델이 작동을 멈췄다는 뜻이 아닙니다. GLM-5.2에 맞춰 조정된 파이프라인을 가진 팀들이 곤경에 빠진 것도 아닙니다. 그것이 실제로 의미하는 것은 해당 수치가 GLM-5.3이 존재하기 전의 스냅샷이라는 점, 그리고 그것을 다른 모델들의 현재 수치와 섞는 것은 6월의 측정값을 9월의 상황과 비교하는 것이라는 점입니다.
각 측이 가진 숫자와 그 숫자들이 지닌 가치
GLM-5.2의 기록은 이례적으로 풍부하게 채워져 있으며, 이는 교훈적인 방식으로 서로 상충하는 두 출처에서 비롯된다.
Z.ai의 자체 보고에 따르면, 이 모델은 τ²-Bench에서 99.12, SWE-bench Pro에서 62.1, 도구를 사용한 Humanity's Last Exam에서 54.7, 최고 보고 기준 Terminal-Bench 2.1에서 82.7을 기록했습니다. 독립적인 측면에서, Artificial Analysis는 동일 모델을 Terminal-Bench 2.1에서 77.9, 자체 Intelligence Index에서 33.7, GPQA Diamond에서 89.5, Humanity's Last Exam에서 41.1로 측정합니다. 다른 벤더 수치도 있습니다 — AIME 2026에서 99.2, HMMT February 2026에서 92.5, IMOAnswerBench에서 91, FrontierSWE에서 74.4, ProgramBench에서 63.7, MCP-Atlas에서 76.8 — 그리고 이들은 모두 Z.ai의 것입니다.
그 목록에 관해 두 가지는 짚고 넘어갈 만하다. 첫째, Terminal-Bench 2.1에서 공급업체가 최고로 보고한 82.7과 독립 측정치 77.9 사이의 4.8점 차이는 모순이 아니다. 공급업체가 보고한 최고 수치는 일반적으로 여러 하네스 중 최고값이며, 같은 벤치마크에 대한 Z.ai 자체의 Terminus-2 수치는 81이다. 즉 독립 측정치는 공급업체 자체 범위 안에 들어온다. 둘째, Humanity's Last Exam의 격차는 더 크다. 독립 측정치는 41.1인데, 공급업체 수치는 도구 없이 40.5, 도구를 사용하면 54.7이다. 이는 대표 수치인 54.7이 도구 지원 수치이고 41.1이 도구 없이 측정한 순수 수치라는 뜻이다. 54.7을 다른 모델의 도구 없는 점수 옆에 인용하는 것은 실제 오류가 될 것이다.
NV-Reason-CT의 기록에는 그러한 두 출처 구조가 없으며, 바로 그 점에서 더 약하다. CT-RATE 결과 — 18개 레이블 전반에 걸쳐 0.614 F1 및 0.871 AUROC로, 고정된 균일 임계값과 직접적인 예/아니오 프롬프트를 사용하며 분류 헤드나 작업별 적응이 없음 — 는 NVIDIA 자체의 것이다. 그 논문에서 비교 대상이 되는 모델들(VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303)은 모두 영상 모델이다. 독립적으로 재현된 것은 아무것도 없으며, 이 모델은 몇 주째 다운로드 가능한 상태다. 또한 보고서에서 도출한 매크로-F1 0.592와, 보조 검토가 평균 보고 해석 시간을 50% 줄이는 것과 연관된다는 전문 방사선의를 대상으로 한 예비 연구 결과를 보고하는데, 저자들 스스로 이를 심각한 소규모 표본이라고 지적한다.
그래서 출처 비교는 더 새로운 모델에 유리하지 않으며, 이 점은 곱씹어 볼 가치가 있다. GLM-5.2는 더 오래되고 대체된 모델이지만, 회사 외부의 누군가가 하네스를 실행했기 때문에 그 수치가 NV-Reason-CT의 수치보다 더 신뢰할 만하다. 최신이라는 것은 검증되었다는 것과 같지 않다.

왜 이 지원 중단이 들리는 것보다 더 중요한가
이 비교가 방지하도록 설계된 특정한 실패가 있는데, 그것은 CT와 전혀 관련이 없습니다.
임상 텍스트 파이프라인을 구축하는 팀이 민감한 데이터를 다루기 때문에 자체 하드웨어에서 실행할 오픈 웨이트 모델을 찾습니다. 그들은 GLM-5.2를 발견하는데, 이는 7,430억 개 파라미터에 약 400억 개가 활성화되는 MIT 라이선스 모델로 조건에 부합하며 벤치마크 기록도 잘 문서화되어 있습니다. 그들은 이를 기준으로 튜닝합니다. 6개월 후, 현재 세대가 GLM-5.3이고, 1M 컨텍스트에 128K 출력 상한을 가지며, $1.26와 $3.96으로 더 저렴하다는 사실을 알게 됩니다. 그리고 그들이 내리고 있다고 생각했던 결정, 즉 어떤 오픈 웨이트 모델을 표준으로 삼을지에 대한 결정은 사실 어느 세대를 선택할지에 대한 결정이었으며, 그들은 그것을 우연히 내린 것이었습니다.
그것은 늦게 발견하기에는 값비싼 사고이며, 한 번의 조회로 피할 수 있습니다. 구체적인 안내:
• 표준화하려는 모델이 현재 세대인지 확인하세요 — 리더보드의 지원 중단 표시가 가장 빠른 신호이고, 벤더 자체의 모델 목록이 가장 권위 있는 기준입니다
• 6월 스냅샷을 9월 수치와 혼용하지 마세요 — GLM-5.2의 지수 33.7은 GLM-5.3이 존재하기 전에 측정된 것이며, 이를 현재 모델의 지수 옆에 놓는 것은 변화하는 분야에서 서로 다른 두 시점을 비교하는 셈입니다
• 명칭에 주의하세요 — "GLM-5.3 Prime" 표기는 동일한 가중치를 약 두 배의 정가로 제공하는 서빙 티어일 뿐, 별도의 모델이 아닙니다. 프리미엄을 지불하기 전에 어떤 SKU든 그 뒤에 있는 가중치를 확인하세요
• 더 낮은 표면 요금을 답이 아니라 질문으로 받아들이세요 — GLM-5.3이 이전 버전보다 저렴하다는 점은 이례적이므로, 당연하게 여기기보다 자신의 워크로드에 비추어 확인해 볼 가치가 있습니다
그렇다고 해서 GLM-5.2가 나쁜 선택이 되는 것은 아니다. 팀이 이미 튜닝을 맞춰 둔 MIT 라이선스 743B 모델을 $1.40 및 $4.40에 계속 운영하는 것은 지극히 합리적인 일이며, 검증된 실적을 갖춘 중간 세대 모델은 때로 규제를 받는 워크플로가 정확히 원하는 것이다. 핵심은 그것이 7월에 유효했던 목록에서 물려받은 기본값이 아니라, 의도적으로 내린 선택이어야 한다는 점이다.
텍스트 모델과 CT 모델을 비교할 때의 함정
이 조합이 애초에 그럴듯해 보이는 이유는 둘 다 2026년에 공개된 오픈 웨이트 모델이고, 카탈로그를 훑어보는 독자는 비교 가능한 두 항목을 보기 때문이다. 하지만 둘은 비교 대상이 아니며, 그 불일치에는 특정한 형태가 있다.
GLM-5.2는 1,000,000개의 토큰을 담을 수 있다. NV-Reason-CT의 단일 CT 볼륨은 13,824개의 시각 토큰을 소비한다. 그 계산대로라면 GLM-5.2는 일흔 건의 CT 검사를 담고도 여유가 남는데, 이는 충분히 긴 컨텍스트를 갖춘 텍스트 모델이 이미징 모델을 불필요하게 만든다는 결론을 불러온다. 그 결론은 성립하지 않으며, 그 이유는 예산이 아니라 인터페이스에 있다.
그 13,824개 토큰은 요약이 아니다. 그것들은 384밀리미터 정육면체가 2mm 등방성으로 리샘플링되고, 24 x 24 x 24 그리드에서 8 x 8 x 8 패치로 잘려, 공간 다운샘플링도 병합 계층도 없이 언어 백본에 전달된 것이다. 그렇기 때문에 활성 경로는 전체 4.69B 중 4.35B 파라미터이고, 연산은 해상도를 압축해 없애기보다 유지하는 데 쓰인다. GLM-5.2는 텍스트 전용이다. 비전 경로가 전혀 없으므로 스캔을 어떻게 처리할지라는 질문은 생기지 않는다. 답은 그것이 어떤 형태로도 스캔을 받을 수 없다는 것이다. 두 모델 카드는 토큰 예산의 600배 차이를 기술하는데, 이는 이 비교와 아무 관련이 없다. 왜냐하면 그중 하나는 입력을 받을 방법이 전혀 없기 때문이다.
반대 방향의 실수도 얼마든지 가능하다. NV-Reason-CT는 흉부와 복부를 지원하고, 프롬프트가 아니라 NIfTI 파일을 입력으로 받으며, 도구 사용 기능이 없다. 또한 모델 카드는 이를 연구 및 교육용으로 제한하고, 의료기기가 아니며 출력이 부정확할 수 있다고 명시한다. 이 모델은 보고서 코퍼스를 정규화하거나, 평가 하네스를 작성하거나, 가이드라인 문서를 바탕으로 추론할 수 없다. 4.7B 이미징 모델이 743B 텍스트 모델을 대체할 수 없는 것과 마찬가지로, 그 반대도 마찬가지다.

텍스트 절반을 하나의 키에 넣기
파이프라인 작업을 어떤 텍스트 모델로 돌릴지가 문제라면, 오늘의 답은 아마도 GLM-5.2가 아니라 GLM-5.3입니다 — 그리고 두 모델 모두 하나의 키로 저희 카탈로그에 있습니다. z-ai/glm-5.2는 Z.ai의 제공사 목록 요율로 마크업 없이 제공되며, GLM-5.3도 함께 제공됩니다200개 이상의 모델을 아우르는 단일 API 안에서 . 두 모델을 모두 사용 가능하게 유지하는 것은 세대 교체기에는 평소보다 더 중요합니다: 확정하기 전에 자체 코퍼스에서 후속 모델을 측정해 볼 수 있고, 그동안 기존 모델을 폴백으로 유지할 수 있으며, 두 번째 계약이나 코드 변경 없이 전환할 수 있습니다.
패스스루 요율은 벤더가 가격을 재조정하는 모든 모델에서 중요한 것과 같은 이유로 한 문장 정도 언급할 가치가 있습니다. 중간에 마크업 계층이 없으면 벤더 요율 변경이 같은 날 우리 쪽에 반영됩니다. 자동 페일오버는 배치 중간에 제공업체가 성능이 저하되는 상황을 커버합니다장시간 추출 작업에서는 이것이 실제로 하룻밤을 날려버리는 장애이며, 라우팅 DSL을 사용하면 모든 요청을 하나의 엔드포인트로 보내는 대신 각 요청을 처리해야 할 모델로 보낼 수 있습니다.
NV-Reason-CT는 우리 플랫폼에 없으며, 어떤 NVIDIA 모델도 없습니다. 이 점은 추론에 맡기기보다 분명히 밝힐 가치가 있습니다. 이 아키텍처의 CT 쪽은 자체 하드웨어에 다운로드된 가중치로, 이를 허용하는 라이선스와 임상 사용을 금지하는 모델 카드 아래에 있습니다. 우리는 이를 호스팅하지 않으며, 그렇지 않다고 암시하는 문장을 쓰지 않을 것입니다.
이러한 결정을 내리는 순서
임상 빌드에 알맞은 순서는 그 비교가 암시하는 순서가 아니다.
텍스트 생성 질문부터 시작하되, 어느 세대가 현재인지 확인하는 것부터 시작하세요 — 가격과 측정된 성능 면에서 GLM-5.2가 아니라 GLM-5.3입니다. 단, 현상 유지할 이유가 없다면 말이죠. 그런 다음 CT 모델의 연구별 지연 시간을 자체 하드웨어에서 측정하세요. 그 수치는 공개되지 않았고 나머지 예산을 좌우하기 때문입니다. 그런 다음 두 절반이 독립적으로 교체 가능하도록 파이프라인을 설계하세요. 한쪽은 프리뷰에 준하는 수명 주기에 있고 다른 쪽은 버전 0.1이기 때문입니다.
하지 말아야 할 단 한 가지는 이 둘을 선택지로 취급하는 것이다. 대체된 743B 텍스트 모델과 현재의 4.69B CT 모델은 공통으로 하는 작업이 없다. 이 비교는 오직 그것이 드러내는 것 때문에 가치가 있다: 더 새로운 아티팩트 뒤에는 더 약한 근거가 있다는 점, 더 오래된 쪽은 조용히 세대에서 벗어나 있다는 점, 그리고 두 사실 모두 그것들을 마치 대안인 것처럼 나란히 나열한 카탈로그 행을 읽는 누구에게도 보이지 않는다는 점.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
