'NV-Reason-CT vs GPT-5.6 Sol'이라는 제목과 '단어 하나를 입력하기도 전에 13,824개의 시각 토큰'이라는 부제가 붙은 생성된 히어로 카드입니다. 하단을 따라 세 개의 칩이 이어집니다: '4.69B CT 전문가 vs 미공개', '3D NIfTI 입력, 소견 출력', 'Sol: 입력 1,050,000 / 출력 128,000'. OrcaRouter 로고는 오른쪽 아래에 합성되어 있습니다.
Guides & Insights

NV-Reason-CT vs GPT-5.6 Sol: 단어 하나를 입력하기도 전에 13,824개의 시각 토큰

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

당신이 NV-Reason-CT로 보내는 흉부 CT 하나하나는 프롬프트가 시작되기도 전에 13,824개의 시각 토큰을 소비한다. 그것은 별난 특성이나 튜닝 선택이 아니다 — 설계의 전부다. 이 모델의 네이티브 3D 비전 인코더는 384×384×384mm 볼륨을 받아 24×24×24 그리드로 바꾸며, 모델 카드는 13,824개 토큰 모두와 그 3차원 좌표가 "공간 다운샘플링 없이" 언어 모델에 도달한다고 분명히 밝힌다. 그것을 당신이 이미 비용을 치르고 있을 가능성이 큰 것과 비교해 보라. GPT-5.6 Sol은 텍스트, 이미지, 파일을 받아들이며, 여기에 보내는 이미지는 2D 그림이다 — 하나의 슬라이스, DICOM 뷰어 스크린샷, PDF에서 붙여 넣은 영상의학 도해일 뿐이다. 이 모델들 중 하나에는 볼류메트릭 경로가 있다. 다른 하나에는 컨텍스트 윈도우가 있다. 이 둘 사이의 대부분의 비교는 바로 그 차이에서 무너지며, 그 무너짐이 흥미로운 부분이다.

아무도 발표하지 않은 릴리스

NVIDIA는 뉴스룸에 NV-Reason-CT에 대해 한마디도 게시하지 않았습니다. 출시 게시물도, 기조연설 슬라이드도, 보도자료도 없습니다. 존재하는 것은 2026년 9월 8일에 생성된 Hugging Face 저장소, 9월 2일에 생성된 NVIDIA-Medtech 조직 산하의 GitHub 저장소, Gradio 데모 Space, 그리고 arXiv 프리프린트 — NV-Reason-CT: CT 분석을 위한 3D 시각 언어 모델 — 2026년 9월 23일 NVIDIA의 16인 저자 팀이 NIH와 취리히 대학교의 공동 저자들과 함께 제출한 것입니다.

그것은 실재하는 패턴이며, 미스터리로 취급하기보다 정확히 이름 붙일 가치가 있다. NVIDIA의 의료 영상 그룹은 조용히 가중치를 공개하고, 논문과 저장소가 발표를 맡게 한다. 전작인 NV-Reason-CXR-3B도 2025년 10월에 같은 방식으로 나왔다. 여기서 차이는 규모다: 이 그룹이 2D X선에서 네이티브 3D 볼륨으로 레시피를 확장한 것은 이번이 처음이며, 논문은 나온 지 이틀밖에 되지 않았다.

저장소를 통해 알 수 있는 것: 아키텍처, 라이선스, 학습 데이터, 벤치마크 표. 아직 확인되지 않은 것: NVIDIA가 이것을 지원되는 제품 라인으로 삼을 의도인지, 더 많은 체크포인트가 나올지, 그리고 저자 외 다른 사람이 평가할 때 이것이 얼마나 잘 견디는지. 저장소는 버전 0.1이며, 스스로를 연구 및 교육용으로만 설명한다.

각 모델이 실제로 받아들이는 것

바로 여기서 정면 대결은 금세 솔직해진다. 두 모델은 입력 표면을 공유하지 않는다.

NV-Reason-CT는 NIfTI 볼륨을 읽습니다 — .nii 또는 .nii.gz — 복셀 강도는 Hounsfield 단위입니다. 폐 Hounsfield 단위와 3D 형태학 휴리스틱을 사용하여 자동으로 흉부 또는 복부로 크롭하고, 2-mm 등방성 해상도로 리샘플링하며, 해부학 값으로 "chest" 또는 "abdomen"만 허용합니다. 텍스트를 출력합니다: 구조화된 보고서, 답변, 또는 단계별 추론 과정이며, 짧은 답변을 위해 추론을 끌 수 있는 스위치가 있습니다.

GPT-5.6 Sol은 텍스트, 이미지, 파일을 읽으며, 1,050,000토큰 컨텍스트 창과 단일 응답에서 최대 128,000개의 출력 토큰을 지원합니다. 이 모델에는 볼류메트릭 인코더가 없습니다. CT를 넣으면 먼저 300여 장의 슬라이스를 2D 이미지 인코더가 받아들일 수 있는 형태로 평탄화할 방법을 결정해야 합니다 — 몽타주, 몇 장의 핵심 슬라이스, 렌더링된 최대 강도 투영 중에서요. 그 각각의 선택은 3D 경로가 보존하도록 만들어진 공간적 관계를 버립니다.

그러니까 솔직한 정리는 "어느 모델이 더 똑똑한가"가 아니다. 그것은 Sol의 이미지 경로와 NV-Reason-CT의 3D 경로가 서로 다른 질문에 답하고 있다는 점이다. Sol은 방사선과 의사가 스캔에 대해 설명한 내용을 추론할 수 있다. NV-Reason-CT는 그 스캔 자체를 추론할 수 있다.

벤치마크가 하나 존재하며, 그중 오직 하나에만 숫자가 붙어 있다

NV-Reason-CT는 CT-RATE의 18개 라벨 분류 작업에서 분류 헤드도, 작업별 적응도 없이 직접적인 Yes/No 프롬프트를 사용해 Macro-F1 0.614와 Macro-AUROC 0.871을 보고한다. 이는 모델 카드에 있는 저자들 자신의 수치이며, 유용한 부분은 비교 행이다: VoxelFM은 0.581 Macro-F1, Pillar-0은 0.544, ClinFusion-8B는 0.442, CT-CLIP은 0.398, Merlin은 0.358, MedGemma 1.5는 0.303이다. 동일한 고정 균일 임계값에서 생성형 3D 모델은 3D 대조 사전학습 기준선들과 슬라이스 기반 최첨단 모델을 능가한다.

그 표의 한 숫자는 반복하기보다 회의적으로 볼 만하다: 바로 AUROC 격차다. NV-Reason-CT는 VoxelFM의 0.870에 맞서 0.871을 보고한다. 벤더가 수행한 평가에서 1천분의 1점은 승리가 아니다 — 그 평가가 지닌 어떤 노이즈 범위 안의 동점일 뿐이다. 0.033이라는 Macro-F1 격차가 입증된 주장이다.

GPT-5.6 Sol에는 CT-RATE 수치가 없습니다. CT-RATE는 이 모델을 실행할 수 있는 벤치마크가 아니기 때문입니다. 이 모델은 Artificial Analysis Intelligence Index 47, AA가 측정한 GPQA Diamond 점수 94.1, Humanity's Last Exam 점수 49.5를 기록했습니다. 이들은 모두 일반 추론을 측정하는 도구입니다. 0.614 Macro-F1을 AA Index의 47 옆에 놓는 것은 서로 다른 두 자로 산수를 하는 것과 같습니다. 저는 그렇게 하지 않을 것이며, 그렇게 하는 사람은 누구든 불신하셔야 합니다.

추론 추적, 두 가지 서로 다른 제품

두 모델 모두 추론을 내놓는다. 그것이 유일하게 진정으로 겹치는 철학적 지점이며, 그 차이는 시사하는 바가 있다.

GPT-5.6 Sol은 구성 가능한 추론 노력을 제공하므로, 요청마다 지연 시간과 비용을 깊이와 맞바꿀 수 있으며, 다음을 통해 추론 결과를 다시 받아볼 수 있습니다include_reasoning. 이는 전송하는 모든 내용에 적용되는 범용 기능입니다.

NV-Reason-CT의 추론은 의도적으로 좁은 범위에 한정되어 있습니다. 학습 코퍼스는 70,111개의 고유 CT 볼륨에서 추출한 약 550,000개의 구조화된 QA 예시로 구성되며, 그중 일부는 녹음 및 전사된 전문가 해석에서 수집한 영상의학과 의사가 작성한 추론입니다. SFT 이후의 GRPO 단계는 흉부 및 복부 이상 소견 세트에 대해 검증 가능한 보상을 사용합니다. 즉, 보상 신호는 서술된 소견이 실제로 볼륨에 존재하는지에 근거하며, 산문이 잘 읽히는지에는 근거하지 않습니다. 모델 카드는 출력을 "검토 가능한 관찰, 감별 진단 및 불확실성"이라고 설명하며, 생성된 추론이 "모델의 내부 연산을 나타낸다고 보장되지 않는다"는 명시적 주의를 담고 있습니다. 그 주의는 실제로 중요한 역할을 합니다. 그것은 데이터와 대조해 확인할 수 있는 추적과 그저 감상할 수밖에 없는 추적의 차이입니다.

크기와 라이선스, 한 번에

• 파라미터 — NV-Reason-CT 총 4.69B / CT 경로에서 활성 4.35B, Qwen3.5-4B 백본에 Primus 3D ViT 추가 vs GPT-5.6 Sol 비공개 • 체크포인트 크기 — NV-Reason-CT 약 10.6 GB BF16 safetensors, Ampere/Hopper/Lovelace에서 실행 vs GPT-5.6 Sol API 전용 • 입력 — Hounsfield 단위의 3D NIfTI CT 볼륨 vs 텍스트, 이미지, 파일 • 컨텍스트 — NV-Reason-CT 해당 없음, 볼륨 하나가 고정 13,824토큰 접두사 vs Sol 입력 1,050,000토큰, 출력 128,000토큰 • 라이선스 — OpenMDW-1.1, 가중치 다운로드 가능 vs 독점, API 접근만 가능 • 제공 — 벤더 저장소 및 자체 가중치 vs OrcaRouter에서 백만 토큰당 $4.00 / $20.00로 라우팅, Sol의 요금은 입력 272K 토큰 초과 시 $8.00 / $30.00로 두 배

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

이별이 실제로 당신에게 치르게 하는 대가

비용 비교는 워크로드가 서로 다르다는 점을 받아들여야만 비로소 의미가 있습니다. 그래서 정말로 말이 되는 버전은 다음과 같습니다.

Sol은 토큰당 과금되며 가격 절벽이 있습니다: 프롬프트 272K 토큰까지 입력 100만 토큰당 $4.00, 출력 100만 토큰당 $20.00이고, 그 이후에는 $8.00와 $30.00입니다. OrcaRouter에서는 OpenAI 자체 정가에 마크업 없이 제공되는데, 이는 들리는 것보다 더 중요합니다 — 여러분이 보는 요금이 OpenAI가 공개하는 요금이므로, 모든 가격 변동이 다음 계약 갱신 때가 아니라 당일 청구서에 반영됩니다. 캐시 읽기 요금은 100만 토큰당 $0.40으로, 입력의 10분의 1이며, 이는 큰 고정 프리픽스를 가진 긴 에이전틱 루프를 산술적으로 감당 가능하게 만드는 요소입니다.

NV-Reason-CT에는 토큰당 가격이 전혀 없습니다. 10.6 GB를 다운로드하고 GPU 비용을 지불하는 것입니다. 이는 CAPEX 대 OPEX 문제이며, 답은 하나뿐입니다. 볼륨이 충분히 높으면 4.35B 활성 파라미터 모델을 자체 호스팅하는 것이 비용상 유리합니다. 그 볼륨 아래에서는 그렇지 않으며, 교차점은 전적으로 GPU 활용률에 달려 있습니다. 아직 NVIDIA 외부에서는 이 체크포인트의 처리량 수치를 공개한 사람이 없으므로, 누군가 여러분에게 교차점을 제시한다면 그것은 추측입니다.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

여기서 라우터가 도움을 주는 부분은 워크플로에서 스캔이 아닌 부분입니다. 프로덕션 임상 연구 파이프라인은 하나의 모델로만 이루어지는 경우가 드뭅니다. 추출, 추론 단계, 요약 단계, 때로는 세컨드 오피니언으로 구성됩니다. OrcaRouter가 노출하는 것은 하나의 OpenAI 호환 엔드포인트 뒤에 있는 200개 이상의 모델를 갖춘 제공자 전반에 걸친 자동 페일오버입니다. 따라서 해당 파이프라인의 범용 절반은 별도의 계약 없이 교체하거나 재라우팅할 수 있습니다. NV-Reason-CT는 우리가 라우팅하는 모델 중 하나가 아닙니다. 직접 실행하는 체크포인트입니다. 파이프라인의 두 절반은 여전히 하나의 키 뒤에 있을 수 있습니다.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

열린 질문

NV-Reason-CT는 논문으로는 이틀, 리포지토리로는 열일곱 날 된 것이며, 그것이 속한 분야는 다음 데이터 포인트가 유의미한 정보가 될 만큼 작다. 세 가지를 지켜보라. 독립적인 CT-RATE 재현, 같은 계열의 두 번째 체크포인트, 그리고 NVIDIA의 의료 부문이 이것을 논문이 아니라 하나의 라인으로 다루고 있다는 조짐이다. 그때까지 방어 가능한 입장은 좁고 분명하다 — 저자들 자신의 표를 기준으로 판단할 때, 이것은 현재 다운로드 가능한 가장 강력한 네이티브 3D CT 추론 체크포인트이며, CT를 읽는 일 외에는 그 무엇에서도 범용 프런티어 모델을 대체하지 못한다.