'NV-Reason-CT vs Grok 4.6'이라는 제목과 '스캔을 읽는 쪽과 보고서를 읽는 쪽'이라는 부제가 붙은 생성된 히어로 카드입니다. 하단을 따라 세 개의 칩이 나란히 있습니다: 'CT 볼륨 하나 vs 500,000 토큰', '0.871 vs 0.870은 동점', 'Grok 4.6: M당 $2.00 / $6.00'. OrcaRouter 로고는 오른쪽 하단에 합성됩니다.
Guides & Insights

NV-Reason-CT vs Grok 4.6: 누가 스캔을 읽고, 누가 보고서를 읽는가

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

CT 파이프라인에 AI를 투입하는 방법은 두 가지가 있으며, 그중 하나만 이미지에 관한 것이다. NV-Reason-CT가 첫 번째다. NIfTI 볼륨을 직접 읽는 4.69B 파라미터의 3D 비전-언어 모델로, NVIDIA의 출시 게시물 없이 2026년 9월 8일 Hugging Face에 공개되었다. Grok 4.6은 두 번째다. 2026년 8월 12일에 출시된 500,000 토큰 텍스트-이미지 모델로, 입력 토큰 100만 개당 $2.00의 비용이 들며, 누군가 이미 소견을 기록해 둔 뒤에 이루어지는 작업 부분에서 매우 뛰어나다. 이 둘을 놓고 비교하면, 흔히 나오는 질문 — 어느 쪽이 더 나은가 — 은 사실 잘못된 질문이다. 이들은 파이프라인의 같은 자리를 두고 경쟁하는 것이 아니다. 같은 예산 항목을 두고 경쟁하는 것이다.

각 진영에서 실제로 출시된 것

NV-Reason-CT는 제품이 아니라 리포지토리, 논문, 데모 Space로 등장했다. NVIDIA-Medtech 아래의 GitHub 리포지토리는 2026년 9월 2일에 생성되었고, Hugging Face 가중치는 9월 8일에 뒤따랐으며, arXiv 프리프린트, NV-Reason-CT: CT 분석을 위한 3D 시각 언어 모델은 9월 23일에 NVIDIA, NIH, 취리히 대학교 소속 저자 16명과 함께 공개되었다. NVIDIA의 뉴스룸에는 이에 관한 내용이 전혀 없다. 모델 카드에는 버전 0.1이라고 설명되어 있으며 사용을 연구 및 교육으로 제한한다.

Grok 4.6은 정반대 종류의 릴리스다. 이는 일급 상용 엔드포인트로, 공급업체의 개발자 문서에 "최신"으로 등재되어 있으며, 공개된 요금표를 기준으로 가격이 책정되고, 기존 통합에서 베이스 URL만 변경하면 도입할 수 있는 OpenAI 호환 모델로 제공된다. 동일한 컨텍스트 윈도, 동일한 입력 표면, 동일한 기본 가격으로 Grok 4.5를 계승했다.

그 비대칭성이 이 비교의 전부다. 하나는 다운로드가 가능하기는 한 연구 산출물이다. 다른 하나는 인프라다. 둘을 서로 견주어 읽으면 의료 영상에서 ‘연구 산출물’과 ‘인프라’ 사이의 경계가 현재 어디에 그어져 있는지 알 수 있다 — 그리고 그것은 당신이 짐작할 만한 곳에 있지 않다.

투입과 산출에 있어서의 분업

• 볼륨 입력 — NV-Reason-CT는 .nii/.nii.gz NIfTI 볼륨을 Hounsfield 단위로 읽으며, 흉부 또는 복부만 지원 vs Grok 4.6은 텍스트, 이미지, 파일을 읽고 볼륨 경로가 없음 • 공간 처리 — NV-Reason-CT는 384×384×384mm 볼륨을 3D MRoPE와 함께 13,824개 토큰의 24×24×24 그리드로 변환하며, 다운샘플링 없음 vs Grok 4.6은 이미지를 2D 그림으로 취급 • 컨텍스트 — NV-Reason-CT에서는 하나의 볼륨이 하나의 고정 접두사이며, 일반적인 의미의 컨텍스트 창은 없음 vs Grok 4.6은 500,000개 토큰 • 출력 — NV-Reason-CT는 구조화된 보고서, 답변 또는 추론 트레이스를 출력하며 사고(thinking)를 비활성화할 수 있음 vs Grok 4.6은 구조화된 출력과 도구 호출을 지원하는 텍스트 • 라이선스 — NV-Reason-CT는 OpenMDW-1.1, 10.6GB BF16 가중치 vs Grok 4.6은 독점, API 전용 • 가격 — NV-Reason-CT는 GPU 자본 지출(CapEx), 토큰당 요금 없음 vs Grok 4.6은 백만 토큰당 $2.00 / $6.00, 200K 입력 초과 시 두 배

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

이 조합은 자연스러운 인계로 읽힌다. NV-Reason-CT는 볼륨에서 소견을 생성하고, Grok 4.6은 그러한 소견 천 개를 하나의 컨텍스트 창에 넣어 코호트 전반의 패턴을 찾도록 건네줄 모델이다. 아무도 그 파이프라인을 공개하지 않았다. 그것은 명백한 아키텍처이며, 검증되지 않았다는 점을 분명히 말할 가치가 있다.

Grok 4.6의 수치, 그리고 그것이 누구의 것인지

Grok 4.6에 관한 두 가지 수치가 함께 돌고 있는데, 이 둘은 같은 종류의 것이 아니다. GPQA Diamond 점수 94.9는 벤더가 보고한 것이 아니라 Artificial Analysis가 측정한 것이다. 이는 제3자가 이를 실행했다는 바로 그 이유 때문에 두 범주 중 더 신뢰할 만한 쪽이다. 인덱스 개정 v4.3.2 기준 Artificial Analysis Intelligence Index 점수 44는 Grok 4.6을 해당 클래스에서 211개 중 28위에 놓는다. Artificial Analysis는 또한 이 모델을 독점 모델로 기록한다. 가중치는 공개적으로 이용 가능하지 않다.

같은 보드에서 AA는 Terminal-Bench 2.1을 88.4, SciCode를 56.5, Humanity's Last Exam을 42.9, 𝜏²-banking을 50.7, 장문맥 회상을 80.3으로 측정한다. 이것들은 범용 추론 측정 도구다. 그중 어느 것도 3D CT 볼륨에 대해 실행될 수 없으며, 그것은 Grok 4.6에 대한 흠이 아니다 — 벤치마크 스위트가 무엇을 측정하는지에 대한 진술이다.

CT 측에는 정확히 하나의 표가 있으며, 그것은 저자들의 것이다.

NV-Reason-CT의 전체 공개 근거 기반은 CT-RATE의 18개 레이블에 대한 하나의 분류 표이며, 고정된 균일 임계값에서 분류 헤드 없이 직접적인 예/아니오 프롬프트를 사용합니다. 이는 Macro-F1 0.614와 Macro-AUROC 0.871을 보고하며, VoxelFM의 0.581/0.870, Pillar-0의 0.544/0.861, ClinFusion-8B의 0.442, CT-CLIP의 0.398/0.733, Merlin의 0.358/0.662, MedGemma 1.5의 0.303과 대비됩니다.

이것들은 모델 카드에서 나온 공급업체 보고이며, 아직 독립적인 제3자가 이를 재현하지 않았기 때문에 나는 그것들을 그렇게 표기하고 있다. 표 안에서 주목할 만한 점이 두 가지 있다. VoxelFM 대비 F1 마진은 0.033으로, 이는 고정 임계값에서 18개 레이블에 대한 실질적인 격차다. 같은 모델 대비 AUROC 마진은 0.001로, 이는 동점이다. 두 수치는 같은 표의 같은 행에 나타나며, 그중 하나만 주장을 담고 있다.

표가 알려주는 또 다른 점은 논문 자체의 프레이밍에 관한 것이다. 비교 모델들은 3D 대조 사전학습 시스템, 융합형 2D/3D 생성 MLLM, 슬라이스 기반 프런티어 모델이다. 저자들은 볼륨을 입력으로 받는 시스템을 벤치마크 대상으로 삼았는데, 여기서 유일하게 의미 있는 주장은 생성형 3D 모델이 헤드 없이 분류에서 판별형 3D 모델을 이길 수 있다는 것이기 때문이다. 이것은 NV-Reason-CT가 어떤 측면에서든 일반 프런티어 모델과 어떻게 비교되는지에 대해서는 아무것도 말해주지 않는다. 그 비교는 이 축에서는 존재하지 않기 때문이다.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

돈이 어디로 가는지, 그리고 왜 티어 경계가 중요한지

Grok 4.6의 요금표에는 많은 아키텍처를 조용히 결정짓는 세부 사항이 하나 있습니다: 200K 입력 토큰을 초과하는 프롬프트는 기본 요율의 두 배로 청구됩니다 — 입력 $4.00, 출력 $12.00이며, 캐시 읽기 요율은 $0.50에서 $1.00로 오릅니다. 발견 사항을 하나의 긴 컨텍스트에 누적하는 코호트 검토 작업은 바로 그 선을 넘는 워크로드입니다. 그 아래에서는 백만 토큰당 $0.50의 캐시 읽기 요율이 입력 가격의 4분의 1이며, 이는 수천 건의 보고서에 걸쳐 큰 고정 프리픽스를 반복하는 일을 단지 가능하게 하는 데 그치지 않고 감당할 수 있게 만드는 요인입니다.

OrcaRouter를 통해 Grok 4.6은 해당 제공업체의 정가로 마크업 없이 제공됩니다, 따라서 위의 티어 계산이 실제로 지불하는 금액이며, 향후 이에 대한 조정은 다음 갱신 때가 아니라 같은 날 청구서에 반영됩니다. 이런 작업을 하나의 엔드포인트로 하드코딩하기보다 라우팅하는 이유는, 임상 파이프라인의 코호트 검토 부분이 바로 결정을 내리기 전에 세 가지 다른 모델을 시도해 보고 싶은 지점이기 때문입니다 — 그리고 하나의 OpenAI 호환 키로제공업체 간 자동 장애 조치가 이루어지면, 그 실험은 모델 이름을 바꾸는 것만으로 가능합니다.

파이프라인의 CT 절반에는 그러한 옵션이 없습니다. NV-Reason-CT는 OrcaRouter에 호스팅되지 않습니다 — 이는 trust_remote_code=True로 Ampere, Hopper 또는 Lovelace 실리콘에서 직접 실행하는 사용자 정의 모델 코드가 포함된 10.6GB 체크포인트입니다. 우리는 그렇지 않은 인상을 주지 않겠습니다. 이 파이프라인을 구축한다면 한쪽 절반을 위해서는 GPU를, 다른 쪽 절반을 위해서는 토큰을 구매하는 것이며, 두 절반 모두 최소한 하나의 콘솔에서 관리할 수 있다는 사실이 내세울 가치가 있는 유일한 통합 주장입니다.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

두 번째 독자가 실제로 지닌 가치

NV-Reason-CT 논문에는 "AI 보조 검토에 대한 긍정적인 신뢰도 평가"와 평균적으로 보고된 판독 및 보고 시간의 50% 감소를 보고하는, 전문 영상의학과 의사를 대상으로 한 예비 연구가 포함되어 있다. 이는 강력한 수치이며, 논문 자체가 밝히는 단서가 따른다: 예비적이라는 점, 그리고 저자들 자신의 연구 설계라는 점이다. 발표된 독립적 재현은 없으며, 통제된 판독 연구에서의 50% 시간 단축은 재현되면 줄어드는 바로 그런 종류의 결과다. 추적할 가치는 있다. 확립된 것으로 인용할 가치는 없다.

그에 비추어 보면, Grok 4.6이 영상의학 워크플로에 기여하는 바는 진단이 전혀 아니다. 그것은 보고서를 읽는 계층, 즉 트리아지 대기열, 추적 서한, 코딩, 사전 승인 패킷이다. 그 작업은 텍스트이고, 양이 많고, 단위당 저렴하며, 잘못했을 때의 실패 모드는 임상적이라기보다 행정적이다. 또한 500K 컨텍스트 창과 $0.50 캐시 읽기가 진정으로 제 몫을 하는 지점이기도 하다.

그래서 이 비교가 내놓는 구분은 직설적이다: NV-Reason-CT에는 실제 3D 경로가 있고, 유통도, 가격도, 독립적 검증도 없다. Grok 4.6에는 유통, 가격, 독립적 벤치마크 커버리지가 있고, 체적 경로는 전혀 없다. 스캔을 판독해야 한다면, 이 중 하나만이 그것을 할 수 있다. 스캔에 관한 서류 작업을 처리해야 한다면, 제품인 것은 다른 하나뿐이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트