
NV-Reason-CT vs Qwen3.8 Max: 파인튜닝과 그 모태가 된 패밀리
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 45 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
첫 줄에서 NV-Reason-CT 모델 카드는 대부분 사람들이 그냥 지나치는 무언가를 알려준다. 기본 모델은 Qwen/Qwen3.5-4B이며, 저장소 메타데이터에 파인튜닝 관계로 기재되어 있다. 그래서 NVIDIA가 Primus 3D 비전 트랜스포머를 붙일 언어 모델이 필요했을 때, Qwen을 택했다. 그 체크포인트를 Qwen3.8 Max와 — Alibaba 자체의 1,000,000토큰 플래그십으로, 2026년 8월 3일에 출시된 — 비교해 보면, 파인튜닝 하나와 집안의 대표작을 보고 있는 셈이다. 하나는 흉부 및 복부 CT 볼륨을 판독하는 4.69B 전문 모델이며, 2026년 9월 8일 별도 발표 없이 Hugging Face에 공개되었다. 다른 하나는 텍스트, 이미지, 비디오 입력을 지원하는 범용 플래그십으로, 공개된 요금표와 지난주 우리 네트워크에서 측정된 3,720만 토큰의 트래픽을 갖고 있다. 흥미로운 질문은 어느 쪽이 이기느냐가 아니다. 4B 파인튜닝이 그 제품군의 플래그십이 할 수 없는 무엇을 할 수 있는지, 그리고 그 답이 왜 예상보다 더 구체적인지다.
파인튜닝이 구체적으로 무엇을 얻어냈는가
NVIDIA가 이 격차를 스스로 규정한 방식은 유난히 정밀하며, 이는 리포지토리에서 가장 유용한 문장이다: 대부분의 비전-언어 시스템은 "2D 이미지에서 작동하거나 언어 디코딩 전에 볼류메트릭 특징을 압축한다." 이는 모델 전체 부류에 대한 설명이며, 시장의 모든 범용 멀티모달 플래그십을 포함한다.
수정은 규모의 문제라기보다 아키텍처적인 문제다. 384×384×384mm 입력 볼륨은 13,824개의 시각 토큰으로 이루어진 24×24×24 그리드가 된다. 그 토큰들과 그 3차원 좌표는 공간 다운샘플링 없이 언어 모델로 들어가며, 3D MRoPE는 디코더 내부의 공간적 관계를 보존한다. 입력 볼륨은 폐 Hounsfield units을 사용해 흉부 또는 복부로 해부학 인식 방식으로 크롭된 다음, 2mm 등방성 해상도로 리샘플링된다.
Qwen3.8 Max가 수용하는 것과 그것을 대조해 보세요. 텍스트, 이미지, 비디오 — 그리고 비디오는 이 시리즈에서 볼륨 입력에 가장 가까운 것으로, 이는 그것을 수사적 비교 대상이 아니라 정직한 비교 대상으로 만든다. 비디오는 시간 순으로 정렬된 2D 프레임의 스택이다. CT 볼륨은 z축을 따라 물리적 위치 순으로 정렬된 2D 슬라이스의 스택으로, 헐스필드 단위로 표현되고 알려진 밀리미터 간격을 가진다. 둘 다 3차원 배열이다. 그중 오직 하나만이 영상의학과 의사의 소견을 위치시킬 수 있는 물리적 좌표계를 갖고 있으며, 오직 하나만이 이미지 센서 외부에서 의미를 갖는 단위로 측정된다. 비디오로 훈련된 모델은 시간적 연속성을 학습한다. CT 볼륨으로 훈련된 모델은 한 슬라이스의 종괴가 8밀리미터 아래의 다음 슬라이스에서도 동일한 종괴임을 학습한다.
학습 코퍼스가 바로 진정한 차이다
여기서부터 두 모델은 전혀 비교할 수 없게 되는데, 바로 이 부분을 스펙 시트는 감춘다.
NV-Reason-CT는 70,111개의 고유 CT 볼륨에서 추출한 약 550,000개의 구조화된 QA 예시를 사용하여 지도 미세 조정에 이어 그룹 상대 정책 최적화(Group Relative Policy Optimization)를 통해 엔드투엔드로 훈련되었습니다. 출처는 CT-RATE — 쌍을 이룬 방사선 보고서가 있는 Istanbul Medipol University Mega Hospital의 47,149건 —, 내부 NIH 세트의 15,991건, 그리고 네 가지 조영제 단계와 13가지 악성 종양 유형에 걸친 CancerVerse의 22,720건입니다. 코퍼스에는 표준화된 보고서, 이상 소견 중심 QA, 다중 턴 대화, 그리고 기록된 전문가 해석에서 전사한 방사선과 전문의 작성 추론이 포함됩니다. GRPO 단계는 흉부 및 복부 이상 소견 세트에 대해 검증 가능한 보상을 사용합니다. 즉, 보상 신호는 진술된 소견이 해당 볼륨에 존재하는지 여부를 확인하는 것이지, 문장이 임상적으로 들리는지 여부를 확인하는 것이 아닙니다.
Qwen3.8 Max의 훈련 코퍼스는 그렇게 자세히 공개된 적이 없으며, 설령 공개되었더라도 도움이 되지 않았을 것입니다. 목표로 하는 능력이 범용적이기 때문입니다. 대신 관련 증거는 Artificial Analysis 수치입니다: Intelligence Index 45.4로 우리 API 스냅샷에서 145개 모델 중 15위를 차지하며, AA Coding 76.2로 9위, Terminal-Bench 2.1에서 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1, 장문맥 회상 80.3입니다. 이는 벤더의 주장이 아닌 제3자 측정치이므로, 이 페이지 양쪽에서 가장 신뢰할 수 있는 수치입니다.
추론 출력, 두 개의 서로 다른 계약
두 모델 모두 추론 트레이스를 출력하며, 둘 다 이를 끌 수 있다. 비슷한 점은 인터페이스에서 끝난다.
Qwen3.8 Max는 enable_thinking과 reasoning_effort를 노출하며, 전체 샘플링 표면 — temperature, top_p, seed, penalties, 구조화된 출력, 도구 호출 —을 함께 제공합니다. 이는 가지고 있는 무엇이든 향하게 할 수 있는 범용 추론 기능입니다. 그 사고는 당신이 건네는 문제만큼 훌륭하며, 주어진 텍스트 외에는 어떤 것에 대해서도 주장을 검증할 방법이 없습니다.
NV-Reason-CT의 추론은 독자와 맺는 계약이 더 좁으며, 모델 카드는 그 한계를 명시적으로 밝힌다: 생성된 추론은 "검토 가능한 모델 출력이며, 모델의 내부 계산을 나타낸다고 보장되지 않는다." 이 단서는 실질적인 역할을 하며, 이는 팀이 그럴듯하게 들리는 추적 기록을 임상의가 어떻게 다룰지 고민했을 때에만 나오는 종류의 문장이다. 카드는 출력을 검토 가능한 관찰, 감별 진단, 불확실성으로 설명한다. 다시 말해, 읽기만 할 수 있는 추적 기록이 아니라 볼륨과 대조해 확인할 수 있는 추적 기록인 것이다.
처리량, 우리가 그것을 측정할 수 있는 유일한 지점에서
Qwen3.8 Max는 지난 7일 동안 OrcaRouter 자체 플레이그라운드에서 3,720만 개의 토큰을 처리했습니다. 첫 토큰까지 걸리는 중앙값 시간은 1.96초였으며, 이는 이 시리즈의 모델들 중 단연 가장 빠른 수치로, 초당 53.3개의 출력 토큰을 기록했습니다. 해당 기간의 오류율은 3.5%였습니다.
그 두 수치는 서로 반대 방향을 가리키며, 둘 다 중요합니다. 지연 시간은 훌륭해서 모델을 반복 개선하기에 쾌적합니다. 오류율은 같은 기간 Kimi K3의 0.21%보다 대략 열일곱 배 높으며, 바로 이 수치가 모델을 동기식 사용자 대면 호출 뒤에 둘지, 재시도가 있는 배치 작업에 둘지를 결정합니다. 이는 벤치마크가 아니라 우리 네트워크에서 측정된 동작이며, 요금표가 결코 알려주지 않는 종류의 정보입니다.
NV-Reason-CT는 어디에도 이에 상응하는 측정치가 없습니다. 이는 사용자 지정 모델 코드가 있는 10.6GB BF16 체크포인트이며, 다음으로 로드됩니다: trust_remote_code=True로 Ampere, Hopper 또는 Lovelace 하드웨어에서, NVIDIA가 H100 및 L40S에서 테스트했습니다. 공개된 p50도, 오류율도, 처리량 수치도 없습니다. 이 자체 호스팅이 토큰당 지불하는 것보다 유리해지는 교차 볼륨을 알려주는 사람은 추측하는 것입니다.
가격과 형태, 나란히
• 가격 — NV-Reason-CT는 GPU 자본지출로 토큰당 요금이 없는 반면, Qwen3.8 Max는 백만 토큰당 $2.00 / $6.00, 캐시 읽기 $0.25, 캐시 쓰기 $2.50
• 입력 — Hounsfield 단위의 NV-Reason-CT 3D NIfTI CT 볼륨, 흉부 또는 복부만 vs Qwen3.8 Max 텍스트, 이미지 및 비디오
• 컨텍스트 — NV-Reason-CT 단일 볼륨, 고정 13,824토큰 프리픽스 vs Qwen3.8 Max 1,000,000토큰
• 매개변수 — NV-Reason-CT 총 4.69B / CT 경로에서 활성 4.35B vs Qwen3.8 Max 비공개
• 라이선스 — NV-Reason-CT OpenMDW-1.1, 가중치 공개 vs Qwen3.8 Max 독점, API로만 접근 가능
• 독립 평가 점수 — NV-Reason-CT 없음 vs Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

Qwen3.8 Max의 캐시 경제성은 특정한 형태에 보상을 준다: $2.00의 신규 입력에 맞선 $0.25의 캐시된 읽기는 8배 할인이며, $2.50의 캐시 쓰기는 길게 재사용 가능한 프리픽스가 빠르게 비용을 회수하게 해준다. 그것이 바로 시스템 프롬프트와 프로토콜 문서가 수천 건의 요청에 걸쳐 재사용되는 워크로드다. NV-Reason-CT는 반대의 비용 프로필을 가진다 — GPU를 한 번 구매하면 스캔당 한계 비용이 거의 0이고, GPU 한 대를 무기한 보유해야 하는 강제 하한이 있다.

함께 가족을 꾸려가기
여기서 자연스러운 아키텍처는 — 아무도 이를 발표한 적이 없다는 점은 말해둘 가치가 있습니다 — 대량 처리를 위한 파인튜닝 모델과 그 주변의 모든 것을 위한 플래그십 모델입니다. NV-Reason-CT는 구조화된 소견을 생성하고, Qwen3.8 Max는 의뢰 텍스트, 모델 매칭, 코딩, 후속 편지 — 백만 토큰 윈도와 8배 캐시 할인이 실제로 진가를 발휘하는 대량 텍스트 작업 — 을 처리합니다.
그 파이프라인이 당신의 것이라면, 그 절반은 당신이 호스팅하는 체크포인트이고 나머지 절반은 당신이 구매하는 토큰이며, 후자의 절반이야말로 단일 벤더 엔드포인트가 할 수 없는 일을 라우터가 해내는 지점입니다. Qwen3.8 Max는 OrcaRouter를 통해 Alibaba의 정가로 마크업 없이 제공되므로, 위의 $2.00 / $6.00이 바로 당신이 지불하는 금액이며 향후 가격 변동은 갱신 시점이 아니라 같은 날 청구서에 반영됩니다. 제공자 간 자동 장애 조치가 평소보다 더 중요해집니다 모델 자체의 측정 오류율이 3.5%일 때에는 — 정상 상태의 다른 엔드포인트로 재시도하는 것이 일시적 문제와 배치 실패를 가르는 차이이기 때문입니다. 그리고 파이프라인의 일반적인 절반은 200개 이상의 모델을 포괄하는 OpenAI 호환 엔드포인트 뒤에 있는 하나의 모델 이름이므로, 일주일짜리 실험을 위해 다른 모델로 바꾸는 비용은 통합 작업이 아니라 문자열 하나 바꾸는 것에 불과합니다.
NV-Reason-CT는 분명히 말하자면 OrcaRouter에 없고 앞으로도 없을 것입니다 — 그것은 직접 실행하는 커스텀 코드 3D 추론입니다. 통합 이야기의 솔직한 버전은 자체 호스팅 전문 모델과 라우팅된 범용 모델이 하나의 키 아래에 있을 수 있다는 것이며, 그게 주장의 전부입니다.

실제로 유효한 평결
이 조합은 "어느 쪽이 더 나은가"로 분류되지만, 그렇게 되어서는 안 된다. Qwen3.8 Max는 제3자들이 일반 추론에 대해 측정하며 대부분의 경쟁자를 앞선다. NV-Reason-CT는 하나의 CT 벤치마크에 대한 자체 수치 표 하나를 갖고 있을 뿐이고, 4.69B 파라미터 수는 어떤 일반적 비교에서도 눈에 띄지 않을 것이다. 어떤 일반 벤치마크에서든 플래그십이 이기며, 그 이유는 일반 벤치마크가 바로 그것을 위해 만들어진 것이기 때문이다.
NV-Reason-CT가 만들어진 바로 그 하나의 작업, 즉 흉부 또는 복부 CT 볼륨을 읽고 그 안에 무엇이 있는지 말하며, 누군가 확인할 수 있는 추적을 함께 내놓는 작업에서, Qwen3.8 Max는 더 약한 경쟁자가 아니다. 이 모델에는 볼륨 인코더가 없어서, 누군가가 먼저 스캔을 그림으로 평탄화하는 방법을 정하지 않고서는 입력에 대해 전혀 실행될 수 없다. 그 결정이 바로 공간 정보가 사라지는 지점이다. 그것이 네이티브 3D 경로와 13,824토큰 고정 프리픽스를 갖춘 4B 파인튜닝의 핵심이며, 이 모델에서 흥미로운 점이 그 크기가 아니라 백본의 작음인 이유다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
