Сгенерированная hero-карточка под названием «NV-Reason-CT vs Claude Opus 5» с подзаголовком «Категориальная ошибка, к которой стоит отнестись серьёзно». Две обращённые друг к другу карточки разделены парой синих стрелок: на левой карточке указано «NV-Reason-CT» с иконкой сканирования тела и «4,69 млрд параметров — 13 824 токена на один КТ-том — не медицинское изделие»; на правой карточке указано «Claude Opus 5» с иконкой чипа и «1M контекста — 128K вывода — $5 / $25 за миллион токенов». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

NV-Reason-CT против Claude Opus 5: категориальная ошибка, которую стоит принимать всерьёз

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Помещение NV-Reason-CT и Claude Opus 5 в одно предложение — это категориальная ошибка, и всё же это стоит сделать, потому что ошибка поучительна. NV-Reason-CT — это нативная 3D-визуально-языковая модель от NVIDIA с 4,69 млрд параметров, которая принимает объём КТ грудной клетки или брюшной полости в единицах Хаунсфилда и создаёт структурированное описание по каждой находке. Это не медицинское изделие, и в его собственной карточке модели так и сказано. Claude Opus 5 — это универсальная фронтирная текстовая и визуальная модель производителя, выпущенная 24 июля 2026 года, с контекстным окном в один миллион токенов, потолком вывода в 128 000 токенов и опубликованной ценой в пять долларов за миллион входных токенов и двадцать пять долларов за миллион выходных. Одна из них читает КТ. Другая читает всё остальное.

Причина, по которой это сравнение продолжают проводить — и будут проводить всякий раз, когда кто-то видит новую медицинскую VLM и тянется к привычной мерке, — состоит в том, что обе системы создают текст об изображении. Это поверхностное сходство реально вредит тому, как люди рассуждают об этих двух вещах, поэтому стоит разобрать его подробно.

Настоящая ось, которая у них общая, и та, которая — нет.

Они пересекаются ровно в одном месте, и оно уже, чем выглядит.

• Модальность ввода — NV-Reason-CT принимает одноканальные NIfTI-тома в единицах Хаунсфилда через специализированный трёхмерный процессор; Claude Opus 5 принимает текст, изображения и файлы — это интерфейс второго поколения для работы с изображениями, и он не способен нативно обрабатывать объёмное КТ-исследование

• Что возвращается — список находок, организованный по анатомическим областям от NV-Reason-CT, в сравнении с обычным текстом, структурированным JSON или вызовами инструментов от Claude Opus 5

• Единицы работы — один КТ-объём, пересэмплированный до изотропных 2 мм, обрезанный по анатомии, нарезанный на патчи 8 x 8 x 8; против того, что вы поместите в бюджет токенов

• Контекст — у NV-Reason-CT вообще нет окна чата; один том превращается в 13 824 визуальных токена без понижающей дискретизации. Claude Opus 5 принимает 1 000 000 токенов, а выдаёт до 128 000

• Лицензия — OpenMDW-1.1, загружаемая модель, которую вы запускаете на собственном оборудовании; в отличие от API, размещённого на хостинге

• Заявленное использование — только для исследований и образования, явно не медицинское изделие, для NV-Reason-CT; против универсальной помощи для Claude Opus 5

• Цена — нет цены по прайс-листу, потому что покупать нечего, есть только веса для запуска; в сравнении с $5 и $25 за миллион токенов, а при кэшированных чтениях — $0,50

Строка «modality in» — именно здесь рождается категориальная ошибка. Оба принимают изображение, поэтому оба выглядят как модели для работы с изображениями, и читатель резонно спрашивает, какая из них лучше работает с изображениями. Но КТ-исследование — не изображение. Это объёмный массив с физическим масштабом в миллиметрах, калиброванной единицей плотности и анатомией, которая имеет смысл только в трёх измерениях. Зрительные возможности Claude Opus 5 действительно впечатляют, и он разумно обсудит рентгенограмму или гистологический препарат. Это совсем другая задача, нежели интегрировать куб значений Хаунсфилда со стороной 384 миллиметра при разрешении 2 мм и описывать дольчатость узла.

Что на самом деле означают числа с каждой стороны

У этих двух моделей есть результаты бенчмарков, которые никогда не пересекаются, и именно так, читая их бок о бок и не замечая этого, принимаются плохие решения о закупках.

NV-Reason-CT сообщает свои результаты на публичном бенчмарке CT-RATE для КТ грудной клетки по восемнадцати меткам, используя фиксированный единый порог и прямой промпт с ответом «да/нет», без классификационной головы и без адаптации под конкретную задачу. Он показывает 0,614 F1 и 0,871 AUROC, опережая VoxelFM с 0,581 и 0,870, Pillar-0 с 0,544 и 0,861, ClinFusion-8B с 0,442 F1, CT-CLIP с 0,398 и 0,733, Merlin с 0,358 и 0,662 и MedGemma 1.5 с 0,303 F1 при подаче до 85 аксиальных срезов. Также есть выведенный из отчётов macro-F1, равный 0,592. Каждая из этих цифр взята из собственной статьи NVIDIA. Ни одна из них не была воспроизведена кем-либо ещё, а модель уже несколько недель доступна для скачивания.

Результаты Claude Opus 5 носят универсальный характер и в значительной степени независимы. Artificial Analysis оценивает их в 50,8 по своему Intelligence Index, 78 — по Coding Index, 93,2 — по GPQA Diamond и 54,9 — по Humanity's Last Exam, с показателем запоминания длинного контекста 79,33. Это сторонние показатели по задачам общего рассуждения, программирования и знаний. В этом наборе нет бенчмарка по клинической визуализации, и нигде в опубликованных результатах Claude Opus 5 нет строки CT-RATE.

Так что честное утверждение состоит не в том, что одна модель впереди. Оно в том, что никто и никогда не измерял обе модели на одной и той же задаче. Любое предложение вида «NV-Reason-CT лучше, чем Claude Opus 5, в медицинской визуализации» в том виде, как оно написано, неопровержимо, потому что никто не проводил этот эксперимент. В собственной сравнительной таблице NVIDIA нет ни одной универсальной фронтирной модели.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

Где люди ошибаются в вопросе об интерфейсе

Единственное по-настоящему интересное техническое пересечение — то, о котором никто не спорит: как должен выглядеть интерфейс между CT-моделью и текстовой моделью.

Разумный инстинкт — скормить Claude Opus 5 набор КТ-изображений или прореженный объём и попросить его рассуждать. При 1 000 000 токенов контекста это звучит щедро, а на фоне исследования, которое занимает всего 13 824 визуальных токена, это звучит как более чем достаточно места. Проблема не в месте. Конвейер зрения Claude Opus 5 рассматривает изображение как двумерную картинку с пиксельным масштабом. КТ грудной клетки, представленная таким образом, теряет межсрезовый интервал, который делает поражение измеримым, и калибровку плотности, которая делает «матовое стекло» порогом, а не описанием. Вы можете передать ему монтаж аксиальных срезов и получить связно звучащий абзац. Чего вы не можете получить — так это измерения.

Именно на это дизайн NV-Reason-CT и расходует свои вычислительные ресурсы. Сетка 24 x 24 x 24 из объёма размером 384 миллиметра передаётся языковой модели в полном разрешении, без пространственного даунсэмплинга и без слоя объединения, поэтому активный путь насчитывает 4,35 млрд параметров, а не нечто гораздо меньшее. Эта архитектура — ставка на то, что сохранение пространственных деталей оправдывает затраты на токены. Это ставка на представление, а не на языковые способности, и Claude Opus 5 в ней не участвует.

Продуктивный шаблон — скучный: используйте CT-модель для объёмного чтения, а текстовую модель — для всего, что вокруг этого. Генерация и нормализация отчётов, сводки по когортам, среды оценки, масштабное преобразование архивов DICOM в NIfTI, триаж исследований, которые человек должен просмотреть первыми. Это работа с длинными документами и кодом, и именно здесь модель с контекстом 1M отрабатывает свою цену.

Стоимость, в двух единицах, которые не конвертируются

Claude Opus 5 тарифицируется. Пять долларов за миллион входных токенов и двадцать пять за миллион выходных, чтение из кэша — пятьдесят центов, запись в кэш — десять долларов. Для конвейера, который нормализует корпус отчётов или пишет и переписывает код оценки, это даёт прогноз, который можно построить: токены на входе, токены на выходе, чтения из кэша — и значительно более дешёвый счёт, если правильно настроить кэширование.

У NV-Reason-CT нет цены. Вы скачиваете 4,69 млрд параметров и платите электричеством, часами работы GPU и инженерным временем. Для полного исследования на 13 824 токена не опубликовано никаких показателей пропускной способности, и квантованный вариант не предлагается, поэтому стоимость одного исследования вам пришлось бы измерять самостоятельно. Это нормально для исследовательских весов, и это же — самое большое практическое различие между ними: у одного есть тарифная сетка, у другого — счёт, которого вы не увидите, пока уже не заплатите.

Сравнение, которое действительно имеет значение, — это на одно исследование, а не на токен. Чтение КТ — это одна единица работы. Проход нормализации отчёта по тому же случаю — это текстовая задача, измеряемая тысячами токенов. Чтобы выразить первое в долларах, нужно знать ваше оборудование; выразить второе — это просто арифметика.

Ловушка в середине сравнения

Есть одна конкретная ошибка, которую стоит назвать, потому что именно её провоцирует это сопоставление. Она заключается в том, что NV-Reason-CT рассматривают как специализированный файнтюн универсальной модели и поэтому предполагают, что универсальная модель окажется достаточно близкой в большинстве случаев и гораздо более гибкой.

Это не файн-тюнинг. Это 3D-трансформер компьютерного зрения под названием Primus, инициализированный из COLIPRI, подключённый к языковому бэкбону Qwen3.5-4B с 3D-многоосевым вращательным позиционным кодированием, обученный на примерно 550 000 структурированных примерах вопрос-ответ, извлечённых из 70 111 КТ-томов, охватывающих CT-RATE, CancerVerse и внутреннюю коллекцию NIH, а затем дообученный с помощью GRPO на основе вознаграждения, которое присваивает вес 2.0 для F1 набора аномалий, 0.5 для регион-специфичной оценки структуры отчёта и 1.0 для мягкого штрафа за длину. Трёхмерный энкодер — это главная особенность модели. Двумерный или основанный на срезах фронтенд — это другой инструмент, и собственное сравнение в статье показывает, чего стоит эта разница: MedGemma 1.5 с F1 0.303 при подаче до 85 аксиальных срезов против 0.614 для нативной объёмной модели.

Обратная ошибка столь же распространена и столь же дорого обходится: предполагать, что раз NV-Reason-CT специализирована, её следует использовать для всего клинического. Она поддерживает грудную клетку и живот и ничего больше, её вызов — это файл NIfTI, а не сообщение в чате, а условия лицензии говорят: только исследования и образование. Она не прочитает патологический слайд, не ответит на вопрос о клиническом руководстве и не напишет код, который пакетно выполняет вашу конвертацию DICOM. Потянуться к КТ-модели для текстовой работы — та же категориальная ошибка, что и потянуться к текстовой модели для волюметрии, только в другую сторону.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

Как обе половины укладываются в одну систему

Ни одна из моделей не заменяет другую, и разумная архитектура содержит обе — что поднимает практический вопрос о том, как их вызывать.

Claude Opus 5 предоставляется через OrcaRouter как anthropic/claude-opus-5 по ставке из прайс-листа провайдера Anthropic без наценки, в рамках единого API, охватывающего более 200 моделей. Для отдельного вызова это значит меньше, чем для всей окружающей цепочки: когда текстовая половина клинической разработки — это одна модель среди нескольких кандидатов, наличие их всех за одним ключом означает, что вы можете сравнивать их на собственном корпусе без второго договора или изменений в коде, а DSL маршрутизации позволяет отправлять отдельные запросы той модели, которая должна их обрабатывать, тогда как автоматическое переключение при сбое подстрахует вас, когда провайдер деградирует.

NV-Reason-CT отсутствует на нашей платформе, как и любая модель NVIDIA. Это веса, которые вы скачиваете и запускаете на собственном оборудовании, — именно это разрешает лицензия, и, учитывая, что входные данные представляют собой объёмные данные пациентов, вероятно, это в любом случае то, что вам нужно. Мы не собираемся создавать впечатление, что маршрутизируем модель, которую не размещаем у себя. Текстовая часть сборки — там, где мы полезны; объёмная часть — там, где вы остаётесь один на один с моделью на 4,69 млрд параметров и GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

Вердикт, выдерживающий тщательную проверку

Если вам нужно, чтобы том КТ был прочитан и преобразован в структурированные заключения, для этого есть модель: она вышла из исследовательской группы NVIDIA, и её можно скачать, а не вызывать через API. Если вам нужно нормализовать корпус отчётов, написать средство оценки, подготовить скрипт для конвертации DICOM или обобщить данные когорты, для этого тоже есть модель, и у неё есть тарифная сетка.

Позиция, которой нужно придерживаться, такова: не было продемонстрировано, что один из них в чём бы то ни было лучше другого, потому что эксперимент не проводился. Продемонстрировано же было то, что нативный трёхмерный интерфейс превосходит основанный на срезах на публичном бенчмарке по КТ грудной клетки с отрывом, который авторы оценивают примерно в три пункта F1, и что передовая модель общего назначения независимо признана лучшей в своей области по рассуждениям, коду и работе с длинным контекстом. Это два утверждения о двух разных задачах. Интерпретировать их как рейтинг — это категориальная ошибка, и она сохраняется ровно до тех пор, пока кто-нибудь не опубликует прямое сравнение, которого пока никто не опубликовал.