'NV-Reason-CT vs DeepSeek V4 Pro'라는 제목과 '스캔을 읽는 비용, 그리고 배치를 언제 실행할지'라는 부제가 달린 생성된 히어로 카드. 두 장의 마주보는 카드는 한 쌍의 파란 화살표로 분리되어 있습니다: 왼쪽 카드에는 'NV-Reason-CT'라는 라벨과 신체 스캔 아이콘, 그리고 'CT 볼륨 1개 - 13,824개의 비주얼 토큰 - 공개된 처리량 없음'이 있습니다; 오른쪽 카드에는 'DeepSeek V4 Pro'라는 라벨과 칩 아이콘, 그리고 '총 1.6T / 활성 49B MoE - 1M 컨텍스트 - 백만당 $0.66 / $1.98, 두 개의 UTC 구간에서 두 배'가 있습니다. OrcaRouter 로고는 우측 하단 모서리에 합성되어 있습니다.
Guides & Insights

NV-Reason-CT DeepSeek V4 Pro: 스캔의 비용, 그리고 배치를 실행할 시점

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

어떤 벤치마크보다 더 많은 임상 파이프라인 예산을 좌우하는 운영상의 사실이 있습니다: DeepSeek V4 Pro는 백만 입력 토큰당 $0.66, 백만 출력 토큰당 $1.98의 비용이 들며, 이 요금은 매일 두 시간대인 UTC 01:00~04:00과 06:00~10:00에 두 배가 됩니다. 그 시간대 밖에서 실행되는 배치 작업은 그 시간대 안에서 실행될 때 드는 비용의 절반이 듭니다. 한편 NV-Reason-CT는 NVIDIA의 46억 9천만 파라미터 3D CT 추론기로, 요금표가 전혀 없습니다 — 다운로드해서 실행하는 가중치 세트이며, 단일 13,824토큰 검사에 대해 공개된 처리량 수치도 없습니다. 이 모델들 중 하나는 스케줄하면 됩니다. 다른 하나는 예산을 세우기 전에 측정해야 합니다.

그 비대칭성은 이 비교로 들어가는 유용한 길이다. 왜냐하면 두 모델은 파이프라인의 양 극단을 차지하고, 재무적으로도 정반대 방식으로 실패하기 때문이다. NV-Reason-CT는 고정비형 도구다. 하드웨어를 일단 사고 나면 추가 연구의 한계비용은 거의 무료지만, 하드웨어 결정은 규모가 크고 연구당 지연 시간은 문서화되어 있지 않다. DeepSeek V4 Pro는 변동비형 엔진이다. 살 것은 없고 모든 것이 사용량에 따라 과금되며, 그 계량기에는 달력에서 읽어낼 수 있는 요금 일정이 있다.

각각 무엇인지, 각각 한 줄씩

• 직무 — NV-Reason-CT는 흉부 또는 복부 CT 볼륨을 읽고 구조화된 소견을 출력합니다; DeepSeek V4 Pro는 텍스트를 읽고 씁니다

• 아키텍처 — COLIPRI에서 초기화된 Primus라는 3D 비전 트랜스포머로, Qwen3.5-4B 언어 백본과 3D 다축 회전 위치 임베딩을 갖추고 있으며, 4.69B 파라미터 중 4.35B가 활성 상태입니다. 토큰당 490억 개가 활성화되는 1.6조 파라미터 전문가 혼합 모델과 비교됩니다

• 입력 — 헌스필드 단위(HU)의 단일 채널 NIfTI 볼륨(.nii, .nii.gz), LPS 방향, 2mm 등방성으로 리샘플링되고 해부학적 구조에 맞게 크롭됨; 텍스트와 대조

• 컨텍스트 — 단일 볼륨은 24 x 24 x 24 그리드에서 13,824개의 시각적 토큰이 되며, 공간적 다운샘플링과 병합 레이어가 없습니다. 1,048,576개 입력 토큰과 384,000개 출력 토큰과 대비됩니다.

• 지원되는 해부 부위 — 흉부와 복부뿐, 그 외에는 없음; 텍스트가 설명할 수 있는 모든 것과는 대조적

• 가격 — 정가 없음, 셀프 호스팅, 스터디당 공개된 처리량 없음; 백만 토큰당 $0.66 / $1.98에 대비, 위에 명시된 두 UTC 구간에서 두 배로 증가하며, 캐시 읽기는 $0.022

•측정된 지연 시간 — 게시되지 않음; 초당 96.01 출력 토큰에서 3,483밀리초 중앙값 시간 대비, 오류율 0.75%

거기에 있는 두 행은 각각 한 줄보다 더 가치가 있습니다. 컨텍스트 행이 명백한 쪽입니다 — 100만 토큰 대 13,824 — 하지만 단위가 서로 비교 가능한 것이 아니며, 이를 어느 방향으로든 능력 격차로 해석하는 것은 실수입니다. 13,824토큰은 하나의 CT 검사를 충실히 표현하는 데 드는 양입니다. 100만 토큰은 담을 수 있는 주변 텍스트의 양입니다. 첫 번째 숫자는 해상도에 관한 것이고, 두 번째는 메모리에 관한 것입니다.

지연 시간 행은 건너뛰게 되는 항목이다. DeepSeek V4 Pro의 첫 토큰까지 3.48초 중앙값과 초당 96토큰은 측정되어 공표된 수치이며, 이를 통해 텍스트 작업 규모를 서류상으로 산정할 수 있다. NV-Reason-CT에 이에 상응하는 수치가 전혀 없다는 점은 해당 모델에 대한 비판이 아니다. 그것이 바로 누군가 실제로 실행해 보기 전에는 CT 파이프라인의 비용을 산출할 수 없는 이유다. 13,824개의 시각 토큰을 처리하는 4.69B 모델은 작은 연산이 아니며, 자신의 하드웨어에서 시간을 재보기 전까지는 추측에 불과하다.

자신을 속이지 않으면서 두 벤치마크 기록 읽기

DeepSeek V4 Pro의 기록은 독립적 측정과 공급업체 보고가 섞여 있는데, 이 혼합은 교훈적입니다. 그 안에는 우려스러워 보이지만 실제로는 그렇지 않은 숫자가 하나 들어 있기 때문입니다.

• Artificial Analysis Intelligence Index — 36으로, 측정된 모델 중 72.4백분위에 해당

• GPQA Diamond — 92.8로, 해당 분야 최상위권에 해당합니다

• Humanity's Last Exam — 41, 그리고 MMLU-Pro에서 41, 수학 지수에서 62.51

• τ²-Bench — 96.20, IFBench는 76.46, tau_banking은 39.59

• 장문맥 회상 — 80.33

• SciCode 및 Terminal-Bench — Terminal-Bench의 두 번째 버전에서 51 및 78.65

36의 종합 지수가 92.8의 GPQA Diamond 옆에 나란히 있는 모습은 모순처럼 보이지만, 지수가 무엇인지 알면 그렇지 않다. 지수는 많은 평가를 종합한 집계이며, 그중 몇 개에서는 뛰어나고 다른 것들에서는 그저 적당한 모델은 합계에서는 중간권에 위치하면서도 개별 리더보드에서는 1위를 차지할 수 있다. 36만 인용하여 DeepSeek V4 Pro가 중간 계층이라고 주장하는 사람은 평균을 마치 최대값인 것처럼 인용하는 것이다. 92.8만 인용하여 그것이 분야를 선도한다고 주장하는 사람은 최대값을 마치 평균인 것처럼 인용하는 것이다. 두 숫자 모두 Artificial Analysis에서 나온 것이며, 둘 다 사실이다.

NV-Reason-CT의 기록에는 그런 혼합이 없으며, 그것이 바로 이 기록의 있는 그대로의 문제다. CT-RATE 수치 — 고정된 균일 임계값과 분류 헤드 없이, 작업별 적응 없이 직접적인 예/아니오 프롬프트를 사용해 18개 레이블 전반에서 0.614 F1과 0.871 AUROC — 는 NVIDIA 자체 논문에서 나온 것이며 그 외 어디에서도 나온 것이 아니다. 그 논문의 비교 집합(VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303)은 전적으로 다른 이미징 모델들로만 구성되어 있다. 그 안에는 일반 텍스트 모델이 단 하나도 등장하지 않으며, 어떤 제3자도 그 수치들 중 어느 것도 재현하지 못했다.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

스케줄링 문제, 끝까지 검토함

DeepSeek V4 Pro의 시간대별 요금제는 두 모델 중 운영 측면에서 가장 실행에 옮길 수 있는 요소이므로, 구체적으로 짚어볼 가치가 있습니다.

CT 프로그램에서 현실적인 텍스트 측면의 워크로드는 화려하지 않다. 그것은 역사적 보고서 코퍼스에서 구조화된 필드를 추출해 학습에 사용할 레이블을 확보하는 일, DICOM 디렉터리 트리를 대규모로 NIfTI로 변환하는 일, 평가 하네스를 작성하고 다시 작성하는 일, 네 개 데이터셋에 걸쳐 단위와 용어를 정규화하는 일, 그리고 코호트를 요약하는 일이다. 중간 규모 프로그램 기준으로 1억 개의 입력 토큰과 1천만 개의 출력 토큰이라고 하자. 이는 "텍스트 작업이 많다"는 말을 대신하는 의도적으로 둥근 수치다.

• 두 배로 늘어난 구간에서 — 백만 건당 $1.32와 $3.96, 따라서 해당 볼륨 기준 $132에 $39.60을 더한 금액

• 해당 구간을 벗어나면 — 백만 건당 $0.66 및 $1.98, 즉 $66에 $19.80 추가

• 그 차이 — 본질적으로 일괄 처리 가능한 작업을 옮기는 데 드는 약 86달러, 즉 오프피크 요금 청구액의 49%

• 캐시된 읽기 — 백만 건당 $0.022로, 입력 요율의 1/60이므로, 코퍼스 전반에서 재사용하는 모든 프롬프트 접두사는 거의 무료입니다

그것은 단순한 반올림 오차가 아니며, 작업이 비동기적이기 때문에 가능한 일이다. 보고서 추출이 14:00에 이루어질 필요는 없다. DICOM 변환 작업은 몇 시인지 전혀 신경 쓰지 않는다. 가격 구조는 스케줄링을 향한 직접적인 초대장이며, 이를 무시하는 파이프라인은 원할 때 실행하는 특권에 대해 49%의 프리미엄을 지불하는 셈이다. 캐시 읽기가 중요한 이유도 같다. 공유 시스템 프롬프트나 고정된 추출 스키마가 수천 개의 보고서에 걸쳐 재사용될 때, 그 비용은 입력 요율의 60분의 1에 해당한다.

NV-Reason-CT에는 이에 상응하는 레버가 없습니다. 미터기가 없기 때문입니다. 스캔을 판독하는 비용은 GPU의 시간당 비용을 시간당 처리할 수 있는 스캔 수로 나눈 값이며, 두 번째 숫자는 아무도 공개하지 않은 값입니다. 단일 검사가 2초 걸린다면 단일 L40S로 대규모 프로그램을 무리 없이 처리할 수 있습니다. 20초가 걸린다면 하드웨어 계산은 완전히 달라집니다. NVIDIA는 H100과 L40S에서 테스트했는데, 이는 카드의 등급을 알려줄 뿐 처리 속도를 알려주지는 않습니다.

그것들이 대체될 수 있다고 가정하는 데 있는 함정

이 맞대결이 불러들이는 실수는 여느 범주 오류보다 더 미묘하다. 슬라이드 위에서는 그것의 한 형태가 그럴듯해 보이기 때문이다.

DeepSeek V4 Pro는 1,048,576개 토큰을 수용하고 최대 384,000개를 출력한다. CT 볼륨은, 그것을 제대로 읽는 모델이 계산하기로는, 고작 13,824개 토큰이다. 따라서 100만 토큰 창을 가진 텍스트 모델은 그 토큰 수 기준으로 70여 건의 CT 검사를 담을 공간이 있다. 산술은 맞지만, CT 데이터를 텍스트 모델에 입력하고 이미징 인프라를 절약할 수 있다는 결론은 틀렸다. 바로 13,824라는 수치가 애초에 존재하는 이유 때문이다.

그 숫자는 스캔의 압축된 요약이 아니다. 그것은 스캔 그 자체다. 384밀리미터 큐브 전체에 걸쳐 2mm 등방성 해상도로, 8 x 8 x 8 패치로 잘려, 공간 다운샘플링도 병합 레이어도 없이 언어 모델에 넘겨진다. 토큰 수가 높은 것은 바로 아무것도 버려지지 않았기 때문이다: 결절을 측정 가능하게 만드는 슬라이스 간 간격, 텍스처를 형용사가 아니라 임계값으로 만들어 주는 밀도 값. 텍스트 모델은 문서를 부피로 받아들일 수 없는 것과 마찬가지로 그 토큰들을 부피로 받아들일 수 없다. 그것은 예산은 있다. 인터페이스는 없다.

논문 자체의 내부 비교는 그 차이를 하나의 숫자로 보여준다. MedGemma 1.5에 최대 85개의 축상 슬라이스를 입력했을 때 — 2차원 또는 슬라이스 적층형 프런트엔드가 합리적으로 할 수 있는 최선 — F1 점수는 0.303인 반면, 네이티브 볼류메트릭 모델은 0.614를 기록한다. 그 격차가 바로 3차원 인코더의 가치이며, 어떤 크기의 컨텍스트 윈도로도 이를 메울 수 없다.

역방향 대체는 더 단순한 이유들로 실패한다. NV-Reason-CT는 흉부와 복부를 지원하고, 프롬프트가 아니라 NIfTI 파일을 입력으로 받으며, 도구 사용 기능이 없고, 모델 카드에서 연구 및 교육용으로만 제한하며 의료 기기가 아니고 출력이 부정확할 수 있다고 명시한다. 보고서에서 필드를 추출할 수 없고, 당신의 코퍼스를 구축하는 스크립트를 작성할 수도 없다.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

우리가 맞는 곳, 그리고 우리가 의도적으로 맞지 않는 곳

DeepSeek V4 Pro는 OrcaRouter를 통해 다음과 같이 제공됩니다: deepseek/deepseek-v4-pro, 공급자의 정가로 마크업 없이, 200개 이상의 모델을 아우르는 단일 API 안에서. 패스스루는 시간대별 가격이 있는 모델에서는 평소보다 더 중요합니다: 공급업체가 요금이나 시간대를 바꾸면, 중간에 예전 숫자를 붙들고 있는 마크업 계층이 없기 때문에 저희 쪽 요금도 같은 날 바뀝니다. 자동 장애 조치는 공급업체가 배치 중간에 성능이 저하되는 경우를 처리하는데, 장시간 무인 추출 작업에서는 실제로 하룻밤을 날려버리는 장애 유형이며, 라우팅 DSL을 사용하면 모든 요청을 하나의 엔드포인트로 보내는 대신, 개별 요청을 처리해야 할 모델로 보낼 수 있습니다.

NV-Reason-CT는 우리 플랫폼에 없습니다. NVIDIA 모델도 없습니다. 이 아키텍처의 CT 쪽은 직접 다운로드한 가중치를 사용하는 자체 하드웨어이며, 우리는 독자가 달리 생각하게 만드는 문장을 쓰지 않을 것입니다. 입력이 환자 유래 볼륨 데이터이고 라이선스가 호스팅 서비스가 전혀 수반되지 않은 OpenMDW-1.1이라는 점을 고려하면, 어쨌든 그 모델이 속할 곳은 로컬 실행입니다.

페어링이 실제로 알려주는 것

두 모델은 경쟁 관계가 아니며, 두 모델을 비교하는 요점은 서로 다른 방식으로 실패한다는 데 있다. NV-Reason-CT는 오픈된 것 중 어디에도 없는 역량, 즉 검사 영상의 전체 해상도에서 네이티브 3차원 CT 추론을 제공하는 대신, 예산에 잡히지 않은 검사당 비용, 공개되지 않은 처리량, 그리고 임상 배포를 금지하는 라이선스를 받아들이라고 요구한다. DeepSeek V4 Pro는 공개된 지연 시간, 공개된 오류율, 독립적인 측정치, 그리고 시계를 확인하는 것만으로 절반으로 줄일 수 있는 가격을 갖춘 종량제 엔진을 제공하지만, 스캔은 전혀 볼 수 없다.

만약 그것을 사는 대신 직접 만든다면, 실전에서 살아남는 형태는 시시한 쪽이다. CT 읽기는 로컬에서 실행하고, 예산은 견적으로가 아니라 측정으로 책정하며, 그 주변의 모든 텍스트 작업은 오프피크 시간대와 만나도록 배치하라. 아무도 따라 해서는 안 되는 일정은 02:00 UTC에 1억 토큰의 추출을 돌리는 일정인데, 그건 배치가 마침 준비되었던 때이기 때문이다.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.