
NV-Reason-CT vs Kimi K3: 210 다운로드 및 5억 8800만 토큰
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 45 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 182 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
이 모델 중 하나는 Hugging Face에서 210회 다운로드되었습니다. 다른 하나는 지난 7일 동안 우리 자체 플레이그라운드에서 5억 8,800만 개의 토큰을 처리했습니다. 둘 다 오픈 웨이트이고, 둘 다 지금 바로 다운로드할 수 있으며, 이 두 숫자 사이의 격차가 이 비교에서 가장 유용한 정보입니다. NV-Reason-CT는 흉부 및 복부 CT를 위한 NVIDIA의 4.69B 파라미터 3D 비전-언어 모델로, 2026년 9월 8일 별도 발표 없이 Hugging Face에 공개되었습니다. Kimi K3는 MoonshotAI의 1,048,576 토큰 플래그십으로, 2026년 7월 15일에 출시되어 현재 우리 네트워크에서 가장 바쁜 모델 중 하나입니다. 둘 다 조달 양식에서 중요한 의미의 "오픈"입니다. 하지만 결코 같은 방식의 오픈은 아닙니다.
"you can download it"의 두 가지 의미
각 다운로드가 실제로 디스크에 무엇을 남기는지부터 시작하세요. 대부분의 오픈 웨이트 비교가 바로 이 지점에서 느슨해지기 때문입니다.
NV-Reason-CT는 model.safetensors를 BF16에서 약 10.6GB로 제공하며, model.py와 상당한 분량의 processor.py — 해부학 인식 크로핑, 2mm 리샘플링, 3D 패치화를 구현하는 26KB의 사용자 정의 처리 코드 — 를 함께 제공합니다. 이것을 trust_remote_code=True로 로드합니다. 이는 프로세스 내에서 NVIDIA의 저장소 코드를 실행한다는 뜻입니다. 추론에는 CUDA PyTorch가 필요하며, 카드 목록에는 Ampere, Hopper, Lovelace가 있고 H100과 L40S에서 테스트되었습니다. 입력은 한 번에 하나의 NIfTI 볼륨입니다. 게시된 배칭 관련 설명도, 처리량 수치도 없고, 저장소에는 inference.py 예제 외의 서빙 구성도 없습니다.
Kimi K3는 1,048,576토큰 컨텍스트 창, 텍스트 및 이미지 입력, 네이티브 도구 호출, 구조화된 출력, 구성 가능한 추론 강도를 갖춘 범용 추론 모델을 제공합니다. 한 번의 요청으로 100개의 임상 가이드라인을 읽거나 한 부서의 10년치 보고서를 읽을 때 선택하게 될 모델입니다. Artificial Analysis 장문맥 회상 점수는 88.7로, 이 시리즈 모델 중 가장 높으며 Grok 4.6의 80.3보다 무려 8.4점 높습니다.
쉽게 말해, NV-Reason-CT는 좁은 입력 표면과 직접 신뢰하고 유지·관리해야 하는 커스텀 코드를 가진 전문가용 체크포인트입니다. Kimi K3는 인프라처럼 동작하는 넓은 입력 표면을 가진 범용 모델입니다. 둘 다 다운로드할 수 있습니다. 그중 하나만 별도 수정 없이 바로 끼워 쓸 수 있습니다.
CT 증거, 전체 내용, 그리고 그것은 짧다
NV-Reason-CT의 품질에 관해 공개적으로 알려진 모든 것은 자체 모델 카드에 있는 단 하나의 표에 달려 있습니다: 고정된 균일 임계값에서의 CT-RATE 18개 클래스 분류 작업, 직접적인 Yes/No 프롬프팅, 분류 헤드 없음, 작업별 적응 없음. Macro-F1 0.614, Macro-AUROC 0.871.
비교 행은 VoxelFM이 0.581/0.870, Pillar-0이 0.544/0.861, ClinFusion-8B가 0.442, CT-CLIP이 0.398/0.733, Merlin이 0.358/0.662, MedGemma 1.5가 0.303입니다. 그 각각은 NVIDIA 카드에 실린 벤더 보고 수치이며, 아직 어느 것도 독립적으로 재현되지 않았습니다 — 논문이 나온 지 이틀밖에 되지 않았습니다.
이 표가 입증하는 바는 제한적이며, 정확히 짚고 넘어갈 가치가 있다: 작업 특화 헤드가 없는 생성형 3D 모델이 18개 레이블 CT 분류에서 3D 대조 사전학습 베이스라인과 슬라이스 기반 최전선 모델을 능가한다는 것이다. 반면, 이 표가 입증하는 것은 일반 추론에 관한 그 무엇도, 흉부 및 복부 CT 이외의 모달리티에 관한 그 무엇도, AUROC 우위에 관한 그 무엇도 아니다 — 0.871 대 0.870은 소수점을 뒤집어쓴 동점일 뿐이다.
Kimi K3의 수치, 그리고 오픈 웨이트 보드의 주의사항
Artificial Analysis는 Kimi K3를 Intelligence Index 43.6으로 측정했으며, 이는 우리 모델 API의 순위 스냅샷에서 해당 리더보드의 145개 모델 중 19위에 해당합니다. GPQA Diamond 점수는 93.5, Humanity's Last Exam은 46.9, SciCode는 59.5, Terminal-Bench 2.1은 85.0, AA Coding은 9위로 76.2, 𝜏²-banking은 46.0입니다.
한 가지 순위 주장은 주의가 필요합니다. 틀리기 쉬울 뿐만 아니라 이전에도 틀린 적이 있기 때문입니다. Kimi K3의 AA Intelligence Index 44는 오픈 웨이트 리더보드에서 오픈 웨이트 모델 중 3위이며, 46점의 MiMo-V2.6-Pro와 45점의 GLM-5.3 뒤에 있습니다. 그것은 해당 리더보드의 선두가 아니며, Grok 4.6과 같은 리더보드에서 경쟁하지도 않습니다 — Artificial Analysis는 Grok 4.6을 독점 모델로 기록하므로, 그 44는 오픈 웨이트 순위가 아니라 일반 순위에 속합니다. 두 지수는 동일해 보이지만 동일하지 않습니다.
운영자가 실제로 보는 것
5억 8,800만이라는 숫자는 여기서 나오며, 이 기사에서 누군가의 마케팅이 아니라 우리 자체의 것인 유일한 증거이므로 이를 분명히 밝힐 가치가 있습니다.
지난 7일 동안 Kimi K3는 OrcaRouter의 플레이그라운드를 통해 5억 8,780만 개의 토큰을 처리했습니다. 첫 토큰까지 걸리는 중앙값 시간은 7.8초였고, 초당 42.9개의 출력 토큰을 생성했으며, 해당 기간의 오류율은 0.21%였습니다 — 약 480건의 요청 중 1건의 실패입니다. 이렇게 측정된 오류율은 모델 카드에서는 얻을 수 없는 정보이며, 모델을 배치 작업에 투입해도 안전한지를 결정하는 숫자입니다.
NV-Reason-CT에는 이에 상응하는 것이 없습니다. 왜냐하면 그것은 어디에도 호스팅된 엔드포인트가 아니기 때문입니다 — 그것은 직접 실행하는 체크포인트입니다. p50도 없고, 오류율도 없고, 가동 시간도 없으며, 페일오버할 대상도 없습니다. 그것은 비판이 아닙니다. 그것은 셀프 호스팅에 관한 구조적 사실이며, 연구 그룹이 어느 화요일이든 NV-Reason-CT를 도입할 수 있지만 프로덕션 팀은 일반적으로 그럴 수 없는 이유입니다.
이 둘의 양쪽 절반을 모두 운영하고 있다면 — 호스팅된 범용 계층으로서의 Kimi K3와 자체 GPU 박스에서 돌리는 NV-Reason-CT — 라우팅 쪽이 바로 호스팅된 절반이 복원력을 얻는 지점이다. Kimi K3는 Moonshot 자체 정가인 입력 백만 개당 $3.00에 제공되며 출력 백만 개당 $15.00에 마크업 없이 제공되고, 캐시 읽기 요금은 백만 개당 $0.30으로 입력의 10분의 1이며, 가격이 그대로 전달되므로 공급업체의 인하가 같은 날 청구서에 반영된다. 제공자 간 자동 페일오버는 업스트림 엔드포인트 하나가 흔들릴 때 배치 작업을 살려 두는 것이다 — 그리고 0.21%의 오류율에서는 흔들림이 워낙 드물어서, 그렇지 않게 되기 전까지는 잊고 지내기 쉽다.
비용 형태들은 서로 닮지 않습니다.
• 가격 — NV-Reason-CT GPU 자본 지출(capex) + 자체 서빙 스택 vs Kimi K3 백만당 $3.00 / $15.00, 캐시 읽기 $0.30
• 최소 실행 가능 지출 — NV-Reason-CT: Ampere 이상 GPU 1개 무기한 보유 vs Kimi K3: 요청 1건
• 컨텍스트 — NV-Reason-CT 단일 볼륨, 13,824개 토큰 고정 vs Kimi K3 1,048,576개 토큰
• 1000번째 요청의 한계 비용 — GPU 비용을 한 번 지불하면 NV-Reason-CT는 사실상 0인 반면, Kimi K3는 토큰 수에 선형
• 가장 먼저 무너지는 지점 — 검증되지 않은 NV-Reason-CT 처리량과 배치 처리 방안 부재 vs 요청당 1M 토큰에서 Kimi K3의 롱컨텍스트 비용
• 모달리티 — NV-Reason-CT 3D NIfTI, 흉부 또는 복부 vs Kimi K3 텍스트 및 이미지, 무엇이든

경제성은 볼륨에 따라 역전됩니다. Kimi K3는 시작하는 데 비용이 전혀 들지 않고 선형적으로 확장됩니다. NV-Reason-CT는 시작하는 데 GPU 한 대가 들고, 그다음에는 거의 평탄하게 확장됩니다. 그래서 210회 다운로드는 실패 신호가 아닙니다. 그것은 이미 하드웨어를 보유한 기관을 대상으로 하는 체크포인트에 맞는 올바른 숫자이며, 그 기관들은 토큰 처리량 통계에는 전혀 나타나지 않을 것입니다.

당신은 실제로 어느 것을 선택하고 있나요?
CT 볼륨을 판독하고 추론 추적이 포함된 구조화된 소견을 생성하는 작업이라면, Kimi K3는 할 수 없고 NV-Reason-CT는 할 수 있다. "더 못한다"가 아니라, 할 수 없다. 그 안에는 볼륨 인코더가 어디에도 없고, 스캔을 먼저 이미지로 평탄화하면 3D 경로가 보존하려고 존재하는 공간적 관계가 사라지기 때문이다.
작업이 400페이지 분량의 의뢰 노트를 읽고, 이를 프로토콜 문서와 대조하며, 구조화된 출력을 내보내는 일이라면 NV-Reason-CT는 논외이고, Kimi K3가 사용 가능한 더 나은 답변 중 하나이며, 우리 네트워크에서 측정된 오류율은 4분의 1퍼센트 미만입니다.

진정한 결정은 둘 중 하나를 고르는 것이 아니다. 그것은 당신의 문제가 볼륨 문제인지 텍스트 문제인지의 여부이며, 2억 1,000만 대 5억 8,800만의 격차는 그 구분이 외부에서 보이는 모습일 뿐이다. 한 모델은 가중치가 실린 논문이다. 다른 하나는 인프라의 한 조각이다. 둘 다 가질 가치가 있으며, 어느 쪽도 다른 쪽을 대체하지 못한다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
