
NV-Reason-CT vs Claude Opus 5: 진지하게 고려할 가치가 있는 범주 오류
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 506 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 183 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
넣는 것은, NV-Reason-CT와 Claude Opus 5를 같은 문장에, 범주 오류다, 그리고 그 오류는 교훈적이기 때문에 그래도 할 가치가 있다. NV-Reason-CT는 NVIDIA의 46.9억 매개변수 네이티브 3D 비전-언어 모델로, 헨리필드 단위의 흉부 또는 복부 CT 볼륨을 입력받아 구조화된 소견별 보고서를 생성한다. 의료 기기가 아니며 자체 모델 카드에도 그렇게 명시되어 있다. Claude Opus 5는 2026년 7월 24일 출시된 벤더의 범용 프론티어 텍스트 및 비전 모델로, 100만 토큰 컨텍스트 창, 128,000 토큰 출력 상한, 그리고 백만 입력 토큰당 5달러, 백만 출력 토큰당 25달러의 공개 요금을 갖추고 있다. 이 중 하나는 CT를 읽는다. 다른 하나는 나머지 모든 것을 읽는다.
그 비교가 계속 이루어지는 이유는 — 그리고 앞으로도 누군가 새로운 의료 VLM을 볼 때마다 익숙한 잣대를 집어 들 테니 계속 그럴 것이다 — 둘 다 이미지에 관한 산문을 만들어 내기 때문이다. 그 표면적 유사성은 사람들이 이 둘을 어떻게 생각하는지에 실제로 해를 끼치고 있으므로, 이를 자세히 풀어볼 가치가 있다.
그들이 실제로 공유하는 축, 그리고 그들이 공유하지 않는 축
그것들은 정확히 한 곳에서 겹치는데, 그 부분은 보기보다 좁다.
• 입력 모달리티 — NV-Reason-CT는 전용 3차원 프로세서를 통해 헌스필드 단위(HU)의 단일 채널 NIfTI 볼륨을 입력받습니다. Claude Opus 5는 텍스트, 이미지, 파일을 입력받는데, 이는 이미지를 위한 2세대 인터페이스로서 부피 CT 검사를 기본적으로 입력받을 수 없습니다.
• 돌아오는 것 — NV-Reason-CT가 해부학적 부위별로 정리해 내놓는 소견 목록과, Claude Opus 5가 내놓는 일반 산문·구조화된 JSON·도구 호출의 대조
• 작업 단위 — 하나의 CT 볼륨을 2mm 등방성으로 리샘플링하고, 해부학적 구조에 맞게 크롭한 뒤, 8 x 8 x 8 패치로 자른 것; 토큰 예산에 무엇을 넣든 그것과 견주어
• 맥락 — NV-Reason-CT에는 채팅 창이 전혀 없으며, 단일 볼륨은 다운샘플링 없이 13,824개의 시각 토큰이 됩니다. Claude Opus 5는 1,000,000개의 토큰을 입력으로 받아 최대 128,000개를 출력합니다
• 라이선스 — OpenMDW-1.1, 자체 하드웨어에서 실행하는 다운로드 가능한 모델; 호스팅된 API와는 대조적
• 명시된 용도 — 연구 및 교육 전용이며, 명시적으로 의료기기가 아님, NV-Reason-CT 대상; Claude Opus 5의 범용 지원에는 반대
• 가격 — 정가가 없습니다. 살 것은 없고 실행할 가중치만 있기 때문입니다. 백만 토큰당 $5, $25와 대비되며, 캐시된 읽기는 $0.50입니다
"modality in" 행은 범주 오류가 태어나는 곳이다. 둘 다 이미지를 받아들이므로 둘 다 이미지 모델처럼 보이고, 독자는 당연히 이미지에서 어느 쪽이 더 나은지 묻는다. 하지만 CT 검사는 이미지가 아니다. CT 검사는 밀리미터 단위의 물리적 스케일, 보정된 밀도 단위, 그리고 3차원에서만 의미를 갖는 해부학적 구조를 지닌 체적 배열이다. Claude Opus 5의 비전은 진정으로 유능하며 방사선 사진이나 병리 슬라이드에 대해 합리적으로 논할 것이다. 그것은 2mm 해상도에서 384밀리미터 큐브의 Hounsfield 값을 통합하고 결절의 분엽상에 대해 보고하는 것과는 다른 작업이다.
각 측면의 숫자가 실제로 측정하는 것
두 모델의 벤치마크 기록은 결코 맞닿는 법이 없는데, 그 사실을 알아차리지 못한 채 두 기록을 나란히 놓고 읽는 것 — 바로 그렇게 해서 잘못된 조달 결정이 내려진다.
NV-Reason-CT는 CT-RATE 공개 흉부 CT 벤치마크에서 18개 레이블에 걸쳐, 고정된 균일 임계값과 직접적인 예/아니오 프롬프트를 사용하고 분류 헤드와 작업별 적응은 사용하지 않은 채 결과를 보고한다. 이 모델은 0.614 F1과 0.871 AUROC를 기록하여, VoxelFM(0.581, 0.870), Pillar-0(0.544, 0.861), ClinFusion-8B(0.442 F1), CT-CLIP(0.398, 0.733), Merlin(0.358, 0.662), 그리고 최대 85개의 축상 슬라이스가 주어졌을 때의 MedGemma 1.5(0.303 F1)보다 앞선다. 보고서에서 도출된 macro-F1도 0.592이다. 이 수치들은 모두 NVIDIA 자체 논문에서 나온 것이다. 그중 어느 것도 다른 사람에 의해 재현되지 않았으며, 이 모델은 몇 주째 다운로드할 수 있다.
Claude Opus 5의 기록은 범용적인 것이며 대체로 독립적이다. Artificial Analysis는 이를 Intelligence Index에서 50.8, Coding Index에서 78, GPQA Diamond에서 93.2, Humanity's Last Exam에서 54.9로 측정했으며, 장문맥 회상 점수는 79.33이다. 이는 일반 추론, 코드 및 지식 작업에 관한 제3자 수치다. 그 세트에는 임상 영상 벤치마크가 없으며, Claude Opus 5의 공개된 기록 어디에도 CT-RATE 행은 없다.
그러므로 솔직한 진술은 어느 한쪽이 앞서 있다는 것이 아니다. 그것은 두 모델이 동일한 과제에서 누구에 의해서도 측정된 적이 없다는 것이다. "NV-Reason-CT가 의료 영상에서 Claude Opus 5보다 낫다"라는 형태의 어떤 문장도 적힌 그대로는 반증 불가능하다. 왜냐하면 아무도 그 실험을 수행한 적이 없기 때문이다. NVIDIA 자체의 비교 표에도 일반적인 프런티어 모델은 포함되어 있지 않다.

사람들이 인터페이스 문제를 잘못 이해하는 지점
진정으로 흥미로운 단 하나의 기술적 교차점은 아무도 논쟁하지 않는 부분이다: CT 모델과 텍스트 모델 사이의 인터페이스가 어떤 모습이어야 하는가.
합리적인 직감은 Claude Opus 5에게 CT 이미지 세트나 다운샘플링된 볼륨을 입력하고 추론하도록 요청하는 것이다. 1,000,000 토큰의 컨텍스트에서는 그것이 넉넉하게 들리고, 겨우 13,824개의 시각 토큰에 불과한 연구에 비추면 충분한 여유가 있는 것처럼 들린다. 여유가 문제는 아니다. Claude Opus 5의 비전 파이프라인은 이미지를 픽셀 스케일을 가진 2차원 그림으로 취급한다. 그런 방식으로 제시된 흉부 CT는 병변을 측정 가능하게 만드는 슬라이스 간 간격과 "ground-glass"를 설명이 아닌 임계값으로 만드는 밀도 보정을 잃는다. 축상 슬라이스의 몽타주를 건네주고 일관성 있어 들리는 문단을 얻을 수는 있다. 얻을 수 없는 것은 측정값이다.
그것이 바로 NV-Reason-CT의 설계가 연산을 쏟아붓는 지점이다. 384밀리미터 볼륨에서 나온 24 x 24 x 24 그리드는 공간적 다운샘플링도, 병합 계층도 없이 전체 해상도로 언어 모델에 전달된다. 그래서 활성 경로가 훨씬 더 작은 무언가가 아니라 4.35B 파라미터인 것이다. 이 아키텍처는 공간적 세부 정보를 유지하는 것이 토큰 비용을 감수할 가치가 있다는 하나의 베팅이다. 그것은 언어 능력이 아니라 표현에 관한 베팅이며, Claude Opus 5는 그 베팅의 참가자가 아니다.
생산적인 패턴은 지루한 쪽이다: 볼륨 판독에는 CT 모델을 사용하고, 그 주변의 모든 작업에는 텍스트 모델을 사용하라. 보고서 생성과 정규화, 코호트 요약, 평가 하네스, 대규모로 DICOM 아카이브를 NIfTI로 변환하기, 사람이 어떤 검사를 먼저 봐야 할지 분류하기. 이는 장문 문서 및 코드 작업이며, 바로 여기서 1M 컨텍스트 모델이 제값을 하는 지점이다.
비용, 서로 환산되지 않는 두 단위로
Claude Opus 5는 종량제로 과금됩니다. 입력 토큰 100만 개당 5달러, 출력 100만 개당 25달러, 캐시 읽기는 50센트, 캐시 쓰기는 10달러입니다. 보고서 코퍼스를 정규화하거나 평가 코드를 작성하고 다시 작성하는 파이프라인이라면, 세울 수 있는 예측이 나옵니다: 입력 토큰, 출력 토큰, 캐시 읽기, 그리고 캐싱을 제대로 하면 훨씬 저렴해지는 청구서입니다.
NV-Reason-CT는 가격이 없습니다. 46억 9천만 개의 파라미터를 다운로드하고 전기, GPU 시간, 엔지니어링 시간으로 비용을 지불합니다. 전체 13,824토큰 연구에 대해 공개된 처리량 수치도 없고, 제공되는 양자화 버전도 없으므로, 이를 실행하는 연구당 비용은 직접 측정해야 하는 숫자입니다. 이는 연구용 가중치에서는 정상이며, 또한 두 가지 사이의 가장 큰 실질적 차이이기도 합니다. 하나는 요금표가 있고, 다른 하나는 이미 지불한 뒤에야 볼 수 있는 청구서가 있습니다.
실제로 중요한 비교는 토큰당이 아니라 검사당입니다. CT 판독은 하나의 작업 단위입니다. 같은 케이스에 대한 보고서 정규화 작업은 수천 개의 토큰으로 측정되는 텍스트 작업입니다. 첫 번째에 달러 금액을 매기려면 하드웨어를 알아야 하고, 두 번째에 금액을 매기는 것은 산수입니다.
비교의 중간에 있는 함정
이름 붙일 가치가 있는 특정한 실수가 있는데, 바로 이 맞대결이 불러들이는 실수다. 그것은 NV-Reason-CT를 범용 모델을 특화 파인튜닝한 것으로 취급하고, 따라서 범용 모델이 대부분의 경우 충분히 비슷하고 훨씬 더 유연할 것이라고 가정하는 것이다.
이것은 파인튜닝이 아니다. 이것은 Primus라고 불리는 3D 비전 트랜스포머로, COLIPRI에서 초기화되고, 3D 다축 로터리 위치 임베딩을 갖춘 Qwen3.5-4B 언어 백본에 결합되어, CT-RATE, CancerVerse 및 내부 NIH 컬렉션 전반의 70,111개 CT 볼륨에서 추출한 약 550,000개의 구조화된 질문-답변 예시로 훈련된 뒤, 이상 집합 F1에 2.0, 영역별 보고서 구조 점수에 0.5, 소프트 길이 페널티에 1.0의 가중치를 부여하는 보상에 대해 GRPO로 튜닝되었다. 3차원 인코더가 이 모델의 핵심이다. 2차원 또는 슬라이스 기반 프런트 엔드는 다른 도구이며, 논문 자체의 비교는 그 차이가 어떤 가치를 지니는지 보여준다: 최대 85개의 축상 슬라이스를 입력받았을 때 MedGemma 1.5는 F1 0.303인 반면, 네이티브 볼류메트릭 모델은 0.614이다.
반대 방향의 실수도 똑같이 흔하고 못지않게 비용이 큽니다. NV-Reason-CT가 특화되어 있다는 이유로 모든 임상 작업에 그것을 사용해야 한다고 가정하는 것입니다. 이 모델은 흉부와 복부만 지원하고 그 외에는 아무것도 지원하지 않으며, 호출 입력은 채팅 메시지가 아니라 NIfTI 파일이고, 라이선스 조건은 연구 및 교육용으로만 사용하라고 명시하고 있습니다. 이 모델은 병리 슬라이드를 읽지도, 가이드라인에 관한 질문에 답하지도, DICOM 변환을 일괄 처리하는 코드를 작성하지도 못합니다. 텍스트 작업을 하려고 CT 모델을 찾는 것은 체적 측정을 하려고 텍스트 모델을 찾는 것과 같은 범주의 오류이며, 단지 방향만 반대일 뿐입니다.

두 반쪽이 하나의 시스템에 어떻게 들어맞는가
어느 모델도 다른 모델을 대체하지 않으며, 합리적인 아키텍처는 둘 다 포함합니다 — 그러면 이를 어떻게 호출할 것인가라는 실무적인 질문이 제기됩니다.
Claude Opus 5는 OrcaRouter를 통해 anthropic/claude-opus-5로 Anthropic 제공업체 목록 요금에 마크업 없이 제공되며, 200개 이상의 모델을 아우르는 단일 API 안에서 이용할 수 있습니다. 이는 단일 호출보다 주변 파이프라인에서 더 중요합니다. 임상 빌드의 텍스트 절반이 여러 후보 중 하나의 모델일 때, 이들 모두를 하나의 키 뒤에 두면 두 번째 계약이나 코드 변경 없이 자체 코퍼스에서 비교할 수 있고, 라우팅 DSL을 사용하면 개별 요청을 그것을 처리해야 할 모델로 보낼 수 있으며 제공업체가 성능이 저하될 때 자동 페일오버가 이를 감당해 줍니다.
NV-Reason-CT는 우리 플랫폼에 없고, NVIDIA 모델도 없습니다. 그것은 직접 다운로드해 자체 하드웨어에서 실행하는 가중치이며, 이는 라이선스가 허용하는 바로 그 일이고, 입력이 환자 유래 볼류메트릭 데이터라는 점을 고려하면 아마 어차피 원하시는 방식일 것입니다. 우리가 호스팅하지 않는 모델을 라우팅한다고 암시하지는 않겠습니다. 이 빌드에서 텍스트 쪽이 우리가 유용한 부분이고, 볼류메트릭 쪽은 4.69B 모델과 GPU를 가지고 직접 감당하셔야 하는 부분입니다.

면밀한 검토를 견뎌낸 평결
CT 볼륨을 구조화된 판독 소견으로 읽어내야 한다면, 그것을 위한 모델이 있습니다. NVIDIA의 연구 그룹에서 나온 모델이며, API 호출이 아니라 다운로드 방식입니다. 보고서 코퍼스를 정규화하거나, 평가 하네스를 작성하거나, DICOM 변환 작업을 스크립팅하거나, 코호트를 요약해야 한다면, 그것을 위한 모델도 있습니다. 그리고 여기에는 요금표가 있습니다.
고수해야 할 선은 이렇다. 실험이 아직 수행되지 않았으므로 어느 쪽도 다른 쪽보다 어떤 면에서든 더 낫다고 입증되지 않았다. 입증된 것은 네이티브 3차원 인터페이스가 공개 흉부 CT 벤치마크에서 슬라이스 기반 인터페이스를 저자들이 약 3 F1 포인트로 제시한 차이만큼 앞선다는 것, 그리고 범용 프런티어 모델이 추론, 코드, 장문맥 작업에서 분야 최상위로 독립적으로 측정된다는 것이다. 이 둘은 서로 다른 두 작업에 관한 두 가지 진술이다. 이것을 순위로 읽는 것이 범주 오류이며, 그 오류는 누군가 아직 아무도 발표하지 않은 직접 비교를 발표하기 바로 전까지 유효하게 남는다.
