
NV-Reason-CT vs Gemini 3.1 Pro: 가장 넓은 입력 표면, 그리고 여전히 CT 판독기는 아니다
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 506 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 183 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
94퍼센트. 그것은 우리 자체 카탈로그가 현재 Gemini 3.1 Pro를 제공하는 한 경로에 대해 기록하는 오류율입니다 — 93.93%, 첫 토큰까지의 중앙값 시간은 10초 상한으로 읽히고 처리량은 초당 978토큰입니다. 그것을 모델에 관한 진술로 읽으면 정확히 잘못된 결론을 내리게 됩니다. 부하가 걸린 프리뷰 티어에 관한 진술로 읽으면 그것은 페이지에서 가장 유용한 정보가 됩니다. 왜냐하면 프로덕션 트래픽용으로 프로비저닝되지 않은 경로에 의존할 때 임상 파이프라인이 실제로 겪는 일이 바로 그것이기 때문입니다.
이 비교의 반대편에 있는 모델에는 그런 문제도, 그런 측정치도 없습니다. NV-Reason-CT는 NVIDIA의 46억 9천만 개 매개변수 네이티브 3D CT 추론기로, OpenMDW-1.1에 따라 다운로드할 수 있으며, 공개된 처리량 수치는 전혀 없고 어디에도 호스팅되어 있지 않습니다. 따라서 이 대결의 한쪽은 이 분야에서 가장 폭넓은 입력 표면을 제공하지만 그에 맞춰 설계해야 하는 가용성 프로필을 가지고 있고, 다른 쪽은 직접 측정해야 하는 지연 시간을 지닌 하나의 좁은 기능만 제공합니다. 어느 쪽도 첫날부터 신뢰할 수 있는 모니터링 대시보드는 없으며, 그 이유는 정반대입니다.
두 모델, '멀티모달'의 두 가지 정의
그 단어는 두 제품 설명 모두에서 많은 역할을 담당하고 있지만, 그중 공유되는 것은 거의 없다.
• 입력 허용 범위 — Gemini 3.1 Pro는 텍스트, 이미지, 오디오, 동영상, 파일을 입력받고, NV-Reason-CT는 하운스필드 단위(HU)의 단일 채널 NIfTI 볼륨만 입력받으며 그 외에는 아무것도 받지 않습니다
• "3D"의 의미 — NV-Reason-CT는 384밀리미터 정육면체에 걸쳐 2mm 등방성으로 리샘플링하고, 이를 24 x 24 x 24 그리드용 8 x 8 x 8 패치로 잘라냅니다. Gemini 3.1 Pro의 비디오 입력은 타임라인이 있는 2차원 프레임들의 시퀀스입니다
• 컨텍스트 — Gemini 3.1 Pro의 경우 입력 1,048,576 토큰, 출력 65,536 토큰입니다. NV-Reason-CT의 경우 한 볼륨은 13,824개의 시각 토큰이며, 다운샘플링도 병합 레이어도 없고, 그 주변에 채팅 창도 없습니다
• 출시 — 2026년 2월 19일, Gemini 3.1 Pro 대상, 프리뷰 슬러그 기준; NV-Reason-CT를 위한 미공개 연구 배포이며, 리포지토리 활동은 2026년 9월 2일부터 25일까지로 기록됨
• 가격 — 200,000토큰까지는 100만 토큰당 $2와 $12, 이후에는 $4와 $18이며, 캐시 읽기는 $0.20, 캐시 쓰기는 $0.375; 자체 호스팅 가중치에는 요금표가 없음
• 기능 — Gemini 3.1 Pro의 비전, 오디오, 도구 사용, JSON 출력 및 추론; NV-Reason-CT의 해부학적 부위별 구조화된 소견, 도구 사용 없음
• 라이선스 및 상태 — 호스팅된 프리뷰 API; 모델 카드에서 연구 및 교육용이라고만 밝히고 의료기기가 아니라고 분명히 명시한 OpenMDW-1.1 가중치를 대상으로 함
동영상 입력과 체적 CT 입력은 멀리서 보면 인접해 보이지만 가까이서 보면 그야말로 극과 극이다. 동영상은 시간에 따른 프레임이다. CT 검사는 세 개의 공간 축, 밀리미터 단위의 물리적 스케일, 보정된 밀도 단위를 가진 단일 정적 볼륨이며, 여기서 측정되는 것은 크기가 중요한 구조의 밀도다. Gemini 3.1 Pro는 수술 녹화 영상을 보고 무슨 일이 있었는지 설명할 것이다. 하지만 결절을 측정하지는 않는다. 그것은 Google이 해결하지 못한 한계가 아니라, 아무도 범용 모델로 해결하지 못한 다른 문제다.
두 벤치마크 기록이 다루는 것과 빠뜨린 것
Gemini 3.1 Pro는 독립적인 기록을 보유하고 있으며, 측정하는 축에서는 좋은 기록입니다.
• GPQA Diamond — 94.1, 이 일련의 글 전체에서 가장 높은 수치
• Humanity's Last Exam — 47점, 장문맥 회상 점수 82점으로 이 비교에서 다시 한번 가장 높은 수치
• IFBench 및 SciCode — 77.14 및 58.7
• τ²-Bench — 95.61, tau_banking 21.44, Terminal-Bench Hard 53.79
• Artificial Analysis Intelligence 및 Coding — 29.7 및 68.8
• 측정된 지연 시간 — 첫 토큰까지의 중앙값이 10초이며, 이는 실제 중앙값이라기보다 상한으로 보이고, 초당 978토큰 및 93.93%의 오류율을 기록했다
그 모양새를 보세요. 비교표 맨 위에는 지식 및 장문맥 프로필이 있고, 중간 아래에는 인텔리전스 지수가 있으며, 사용할 수 없는 가용성 측정치가 있습니다. 세 가지 모두 같은 경로에서 같은 모델을 설명합니다. 높은 GPQA Diamond는 그 모델이 아주 많은 것을 알고 있다는 뜻입니다. 29.7이라는 종합 점수는 모든 면에서 앞서지는 않는다는 뜻입니다. 93.93%의 오류율은 이 특정 경로에서 여러분의 요청 대부분이 완료되지 않는다는 뜻이며, 이는 거의 확실히 가중치의 속성이라기보다 프리뷰 엔드포인트의 용량 및 프로비저닝 문제입니다. 우리는 외부에서 어느 쪽인지 증명할 수 없습니다. 다만 말할 수 있는 것은 그 세 숫자 중 어느 것도 오타가 아니며, 첫 번째 숫자만 읽는 아키텍처는 힘든 한 주를 보내게 될 것이라는 점입니다.
NV-Reason-CT의 기록은 범위가 더 좁고 다른 주의 사항이 따른다. CT-RATE에서의 0.614 F1과 0.871 AUROC는 18개 레이블 전반에 걸쳐 고정된 균일 임계값과 직접적인 예/아니오 프롬프트를 사용하고 분류 헤드나 작업별 적응이 없이 얻은 수치로, NVIDIA 자체 논문에 실린 NVIDIA 자체 수치다. 그 뒤에 놓인 비교 집합 — VoxelFM 0.581, Pillar-0 0.544, ClinFusion-8B 0.442, CT-CLIP 0.398, Merlin 0.358, MedGemma 1.5 0.303 — 에는 이미징 모델만 포함되어 있다. 범용 멀티모달 모델은 하나도 등장하지 않는데, 이는 "Gemini 3.1 Pro가 CT-RATE에서 어떻게 할까"라는 질문이 제기되지도 않았고, 답변은 더더욱 없었다는 뜻이다.

미리보기 등급 문제, 제대로 진술하자면
이것은 CT와는 아무 관련이 없고, 임상적인 무엇이든 운영하는 것과 모든 관련이 있는 비교의 한 부분입니다.
93.93%의 오류율은 미미한 성능 저하가 아닙니다. 이는 대다수의 호출이 실패하는 경로입니다. 자연스러운 반응은 모델을 사용할 수 없다고 선언하는 것이지만, 그 반응은 두 가지 이유에서 잘못입니다. 첫째, 프리뷰 엔드포인트에서 측정된 오류율은 모델의 능력이 아니라 용량, 할당량, 리전 라우팅을 반영합니다. 구글의 프리뷰 티어는 프로덕션이 아니라 평가용으로 프로비저닝되는 것으로 유명하며, 프리뷰를 이름에 둔 슬러그는 예고 없이 스로틀링될 수 있는 슬러그입니다. 둘째, 그 측정값은 한 순간의 한 경로에 대한 스냅샷입니다. 그것은 바뀔 것입니다. 바뀌지 않을 것은 교훈입니다. 프리뷰 경로에 대한 의존은 다른 누군가가 내리는 용량 결정에 대한 의존입니다.
그 완화책들은 매력적이지 않으며, 바로 그렇기 때문에 라우팅이 단순한 편의 기능이 아니라 하나의 학문 분야로 존재하는 것이다.
• 프로덕션 경로에 프리뷰 슬러그를 절대 하드코딩하지 마세요 — 그 기능을 인터페이스 뒤에 두어, 배포 없이도 그 뒤의 모델을 교체할 수 있게 하세요
• 다른 제공자나 다른 모델로 재시도하고 폴백하기 — 배치 추출 작업에서 94%의 실패율은 실패가 다른 곳으로 라우팅되면 감당할 수 있지만, 그렇지 않으면 치명적입니다
• 오류율을 그대로 물려받지 말고 직접 측정하세요 — 93.93%라는 수치는 저희 카탈로그에서 특정 경로 하나에 대한 수치이며, 여러분의 수치는 지역과 물량, 워크로드 형태에 따라 달라집니다
• 임상 일정에 영향을 주는 모든 작업에는 두 번째 모델을 대기 상태로 유지하세요 — 여러분이 방지하려는 실패 유형은 잘못된 답변이 아니라, 아무 답변도 나오지 않는 것입니다
라우트가 전혀 없는 CT 측에서는 반대 방향으로도 같은 원칙이 적용됩니다. 셀프 호스팅 모델에는 제공자 오류율이 없습니다. 대신 하드웨어 오류율, 유지보수 부담, 그리고 구매한 GPU 수에 따라 정해지는 용량 상한이 있습니다. 장애 모드는 대기열이고, 완화 방법은 페일오버가 아니라 스케줄링입니다. 문제는 다르지만 규칙은 같습니다. 실제로 어떤 숫자에 의존하고 있는지 알아야 합니다.
긴 컨텍스트가 진정으로 도움이 되는 경우와 그렇지 않은 경우
Gemini 3.1 Pro의 1,048,576토큰 창과 82점의 장문맥 회상 점수는 실질적인 장점이며, 우연히 쓰기보다는 의도적으로 활용할 가치가 있습니다.
CT 프로그램에서 그것이 진가를 발휘하는 곳은 스캔이 아니다. 그 주변의 모든 것이다. 긴 수술 기록지와 그에 딸린 보고서들을 한 번의 추출 작업으로 처리하면서, 문서 전체를 컨텍스트에 담아 필드들이 서로 일관되게 맞춰지도록 하는 일. 수백 명의 환자 서사를 한 번에 담아 그 사이의 패턴을 찾아야 하는 코호트 요약. 스키마와 100개의 예시 레코드, 오류 로그가 모두 같은 호출에서 보여야 하는 변환 작업. 이런 작업에서는 긴 윈도우가 단순한 편의가 아니라 답을 바꾼다.
그것이 도움이 되지 않는 곳은 스캔 자체이며, 그 이유는 정확히 짚고 넘어갈 가치가 있다. 왜냐하면 그것이 바로 이 맞대결이 불러들이는 실수이기 때문이다. NV-Reason-CT가 표현하는 방식으로 표현된 흉부 CT는 13,824개의 토큰을 소비한다. Gemini 3.1 Pro는 그러한 검사 70건을 컨텍스트 창 안에 넣고도 공간이 남을 수 있다. 제약은 공간이 아니다. 문제는 Gemini 3.1 Pro의 비전 경로가 이미지를 픽셀 스케일을 지닌 그림으로 취급한다는 점이다. 그래서 그런 식으로 제시된 검사는 첫 토큰이 출력되기도 전에 슬라이스 간 간격과 밀도 보정을 잃어버린다. 볼륨에 백만 토큰을 써도 여전히 볼륨을 가질 수는 없다. 논문 자체의 비교는 그 비용을 구체적으로 보여준다. MedGemma 1.5는 최대 85개의 축상 슬라이스를 입력받았을 때 F1 0.303인 반면, 네이티브 볼륨 모델은 0.614로, 이는 대략 두 배의 격차다.
우리가 어디에 맞는지, 그리고 우리가 결코 말하지 않을 한 가지
Gemini 3.1 Pro는 OrcaRouter를 통해 google/gemini-3.1-pro-preview로 제공되며, 제공업체의 정가에 마크업 없이 200개 이상의 모델을 아우르는 단일 API 안에서 이용할 수 있습니다. 현재 프리뷰 등급에 있는 모델치고는, 이 조합은 들리는 것보다 훨씬 유용합니다. 마크업이 없다는 것은 벤더 요율 변경이 오래된 숫자를 붙들고 있는 중간 계층에 흡수되는 대신 같은 날 우리 쪽에 그대로 반영된다는 뜻입니다. 자동 장애 조치 덕분에 실패하기 시작한 경로가 배치 전체를 끌어내리지 않습니다 — 한 경로에서 측정된 오류율이 90%대였다는 점을 감안하면 이는 가상의 이야기가 아닙니다. 그리고 개별 요청을 처리해야 할 모델로 보내는 라우팅 DSL을 쓰면 두 개의 통합을 유지할 필요 없이 긴 컨텍스트 작업은 한 모델에, 저렴하고 대량인 작업은 다른 모델에 맡길 수 있습니다.
NV-Reason-CT는 우리 플랫폼에 없습니다. NVIDIA 모델도 없습니다. 그것은 직접 다운로드해 실행하는 가중치이며, 정직하게 말하자면 이 아키텍처의 두 반쪽은 완전히 다른 곳에 있습니다. 하나는 요금표와 프리뷰 위험이 있는 API 뒤에 있고, 다른 하나는 OpenMDW-1.1 라이선스와 직접 산출해야 하는 처리량 수치를 안고 자체 하드웨어에서 돌아갑니다.


프로덕션과 맞닥뜨려도 살아남는 결정
문제가 긴 컨텍스트에서의 텍스트, 오디오, 비디오 또는 문서 이해라면, Gemini 3.1 Pro는 지식과 회상에서 업계 최고로 독립적으로 측정되었으며, 그것과 프로덕션 파이프라인 사이를 가로막는 유일한 것은 라우트 신뢰성입니다 — 이는 모델 문제가 아니라 해결 가능한 엔지니어링 문제입니다. 페일오버 뒤에 두고, preview 슬러그를 하드코딩하지 말며, 우리 것을 포함해 누구의 오류율도 신뢰하지 말고 직접 오류율을 측정하세요.
당신의 문제가 흉부 또는 복부 CT 볼륨이라면, 이 비교에서 그것을 해결할 수 있는 오픈 모델은 정확히 하나뿐이며, 그것은 백만 토큰 창을 가진 모델이 아니고, 당신의 계획을 좌우해야 할 숫자는 그 모델의 F1 점수가 아니다. 그것은 아무도 공개하지 않은 검사당 지연시간이다. 누군가에게 처리량 수치를 약속하기 전에 그것을 측정하라.
이 비교는 해 둘 가치가 있습니다. 끊임없이 뒤섞이는 두 가지, 즉 입력의 폭과 표현의 깊이를 분리해 주기 때문입니다. Gemini 3.1 Pro는 지금까지 출시된 것 중 가장 넓은 입력 표면과 이 세트에서 가장 뛰어난 장문맥 회상을 갖췄지만, 그럼에도 CT 검사를 CT 검사로서 읽어내지는 못합니다. NV-Reason-CT는 하나는 읽어낼 수 있지만 그 외에는 아무것도 못 합니다. 파이프라인에는 둘 다 필요하고, 둘을 서로 다른 인프라에 올려야 하며, 양쪽의 두 수치 중 어느 것이 새벽 3시에 당신을 호출할 수치인지 알아야 합니다.
