
NV-Reason-CT против Claude Opus 5: категориальная ошибка, которую стоит принимать всерьёз
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 506 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 183 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Помещение NV-Reason-CT и Claude Opus 5 в одно предложение — это категориальная ошибка, и всё же это стоит сделать, потому что ошибка поучительна. NV-Reason-CT — это нативная 3D-визуально-языковая модель от NVIDIA с 4,69 млрд параметров, которая принимает объём КТ грудной клетки или брюшной полости в единицах Хаунсфилда и создаёт структурированное описание по каждой находке. Это не медицинское изделие, и в его собственной карточке модели так и сказано. Claude Opus 5 — это универсальная фронтирная текстовая и визуальная модель производителя, выпущенная 24 июля 2026 года, с контекстным окном в один миллион токенов, потолком вывода в 128 000 токенов и опубликованной ценой в пять долларов за миллион входных токенов и двадцать пять долларов за миллион выходных. Одна из них читает КТ. Другая читает всё остальное.
Причина, по которой это сравнение продолжают проводить — и будут проводить всякий раз, когда кто-то видит новую медицинскую VLM и тянется к привычной мерке, — состоит в том, что обе системы создают текст об изображении. Это поверхностное сходство реально вредит тому, как люди рассуждают об этих двух вещах, поэтому стоит разобрать его подробно.
Настоящая ось, которая у них общая, и та, которая — нет.
Они пересекаются ровно в одном месте, и оно уже, чем выглядит.
• Модальность ввода — NV-Reason-CT принимает одноканальные NIfTI-тома в единицах Хаунсфилда через специализированный трёхмерный процессор; Claude Opus 5 принимает текст, изображения и файлы — это интерфейс второго поколения для работы с изображениями, и он не способен нативно обрабатывать объёмное КТ-исследование
• Что возвращается — список находок, организованный по анатомическим областям от NV-Reason-CT, в сравнении с обычным текстом, структурированным JSON или вызовами инструментов от Claude Opus 5
• Единицы работы — один КТ-объём, пересэмплированный до изотропных 2 мм, обрезанный по анатомии, нарезанный на патчи 8 x 8 x 8; против того, что вы поместите в бюджет токенов
• Контекст — у NV-Reason-CT вообще нет окна чата; один том превращается в 13 824 визуальных токена без понижающей дискретизации. Claude Opus 5 принимает 1 000 000 токенов, а выдаёт до 128 000
• Лицензия — OpenMDW-1.1, загружаемая модель, которую вы запускаете на собственном оборудовании; в отличие от API, размещённого на хостинге
• Заявленное использование — только для исследований и образования, явно не медицинское изделие, для NV-Reason-CT; против универсальной помощи для Claude Opus 5
• Цена — нет цены по прайс-листу, потому что покупать нечего, есть только веса для запуска; в сравнении с $5 и $25 за миллион токенов, а при кэшированных чтениях — $0,50
Строка «modality in» — именно здесь рождается категориальная ошибка. Оба принимают изображение, поэтому оба выглядят как модели для работы с изображениями, и читатель резонно спрашивает, какая из них лучше работает с изображениями. Но КТ-исследование — не изображение. Это объёмный массив с физическим масштабом в миллиметрах, калиброванной единицей плотности и анатомией, которая имеет смысл только в трёх измерениях. Зрительные возможности Claude Opus 5 действительно впечатляют, и он разумно обсудит рентгенограмму или гистологический препарат. Это совсем другая задача, нежели интегрировать куб значений Хаунсфилда со стороной 384 миллиметра при разрешении 2 мм и описывать дольчатость узла.
Что на самом деле означают числа с каждой стороны
У этих двух моделей есть результаты бенчмарков, которые никогда не пересекаются, и именно так, читая их бок о бок и не замечая этого, принимаются плохие решения о закупках.
NV-Reason-CT сообщает свои результаты на публичном бенчмарке CT-RATE для КТ грудной клетки по восемнадцати меткам, используя фиксированный единый порог и прямой промпт с ответом «да/нет», без классификационной головы и без адаптации под конкретную задачу. Он показывает 0,614 F1 и 0,871 AUROC, опережая VoxelFM с 0,581 и 0,870, Pillar-0 с 0,544 и 0,861, ClinFusion-8B с 0,442 F1, CT-CLIP с 0,398 и 0,733, Merlin с 0,358 и 0,662 и MedGemma 1.5 с 0,303 F1 при подаче до 85 аксиальных срезов. Также есть выведенный из отчётов macro-F1, равный 0,592. Каждая из этих цифр взята из собственной статьи NVIDIA. Ни одна из них не была воспроизведена кем-либо ещё, а модель уже несколько недель доступна для скачивания.
Результаты Claude Opus 5 носят универсальный характер и в значительной степени независимы. Artificial Analysis оценивает их в 50,8 по своему Intelligence Index, 78 — по Coding Index, 93,2 — по GPQA Diamond и 54,9 — по Humanity's Last Exam, с показателем запоминания длинного контекста 79,33. Это сторонние показатели по задачам общего рассуждения, программирования и знаний. В этом наборе нет бенчмарка по клинической визуализации, и нигде в опубликованных результатах Claude Opus 5 нет строки CT-RATE.
Так что честное утверждение состоит не в том, что одна модель впереди. Оно в том, что никто и никогда не измерял обе модели на одной и той же задаче. Любое предложение вида «NV-Reason-CT лучше, чем Claude Opus 5, в медицинской визуализации» в том виде, как оно написано, неопровержимо, потому что никто не проводил этот эксперимент. В собственной сравнительной таблице NVIDIA нет ни одной универсальной фронтирной модели.

Где люди ошибаются в вопросе об интерфейсе
Единственное по-настоящему интересное техническое пересечение — то, о котором никто не спорит: как должен выглядеть интерфейс между CT-моделью и текстовой моделью.
Разумный инстинкт — скормить Claude Opus 5 набор КТ-изображений или прореженный объём и попросить его рассуждать. При 1 000 000 токенов контекста это звучит щедро, а на фоне исследования, которое занимает всего 13 824 визуальных токена, это звучит как более чем достаточно места. Проблема не в месте. Конвейер зрения Claude Opus 5 рассматривает изображение как двумерную картинку с пиксельным масштабом. КТ грудной клетки, представленная таким образом, теряет межсрезовый интервал, который делает поражение измеримым, и калибровку плотности, которая делает «матовое стекло» порогом, а не описанием. Вы можете передать ему монтаж аксиальных срезов и получить связно звучащий абзац. Чего вы не можете получить — так это измерения.
Именно на это дизайн NV-Reason-CT и расходует свои вычислительные ресурсы. Сетка 24 x 24 x 24 из объёма размером 384 миллиметра передаётся языковой модели в полном разрешении, без пространственного даунсэмплинга и без слоя объединения, поэтому активный путь насчитывает 4,35 млрд параметров, а не нечто гораздо меньшее. Эта архитектура — ставка на то, что сохранение пространственных деталей оправдывает затраты на токены. Это ставка на представление, а не на языковые способности, и Claude Opus 5 в ней не участвует.
Продуктивный шаблон — скучный: используйте CT-модель для объёмного чтения, а текстовую модель — для всего, что вокруг этого. Генерация и нормализация отчётов, сводки по когортам, среды оценки, масштабное преобразование архивов DICOM в NIfTI, триаж исследований, которые человек должен просмотреть первыми. Это работа с длинными документами и кодом, и именно здесь модель с контекстом 1M отрабатывает свою цену.
Стоимость, в двух единицах, которые не конвертируются
Claude Opus 5 тарифицируется. Пять долларов за миллион входных токенов и двадцать пять за миллион выходных, чтение из кэша — пятьдесят центов, запись в кэш — десять долларов. Для конвейера, который нормализует корпус отчётов или пишет и переписывает код оценки, это даёт прогноз, который можно построить: токены на входе, токены на выходе, чтения из кэша — и значительно более дешёвый счёт, если правильно настроить кэширование.
У NV-Reason-CT нет цены. Вы скачиваете 4,69 млрд параметров и платите электричеством, часами работы GPU и инженерным временем. Для полного исследования на 13 824 токена не опубликовано никаких показателей пропускной способности, и квантованный вариант не предлагается, поэтому стоимость одного исследования вам пришлось бы измерять самостоятельно. Это нормально для исследовательских весов, и это же — самое большое практическое различие между ними: у одного есть тарифная сетка, у другого — счёт, которого вы не увидите, пока уже не заплатите.
Сравнение, которое действительно имеет значение, — это на одно исследование, а не на токен. Чтение КТ — это одна единица работы. Проход нормализации отчёта по тому же случаю — это текстовая задача, измеряемая тысячами токенов. Чтобы выразить первое в долларах, нужно знать ваше оборудование; выразить второе — это просто арифметика.
Ловушка в середине сравнения
Есть одна конкретная ошибка, которую стоит назвать, потому что именно её провоцирует это сопоставление. Она заключается в том, что NV-Reason-CT рассматривают как специализированный файнтюн универсальной модели и поэтому предполагают, что универсальная модель окажется достаточно близкой в большинстве случаев и гораздо более гибкой.
Это не файн-тюнинг. Это 3D-трансформер компьютерного зрения под названием Primus, инициализированный из COLIPRI, подключённый к языковому бэкбону Qwen3.5-4B с 3D-многоосевым вращательным позиционным кодированием, обученный на примерно 550 000 структурированных примерах вопрос-ответ, извлечённых из 70 111 КТ-томов, охватывающих CT-RATE, CancerVerse и внутреннюю коллекцию NIH, а затем дообученный с помощью GRPO на основе вознаграждения, которое присваивает вес 2.0 для F1 набора аномалий, 0.5 для регион-специфичной оценки структуры отчёта и 1.0 для мягкого штрафа за длину. Трёхмерный энкодер — это главная особенность модели. Двумерный или основанный на срезах фронтенд — это другой инструмент, и собственное сравнение в статье показывает, чего стоит эта разница: MedGemma 1.5 с F1 0.303 при подаче до 85 аксиальных срезов против 0.614 для нативной объёмной модели.
Обратная ошибка столь же распространена и столь же дорого обходится: предполагать, что раз NV-Reason-CT специализирована, её следует использовать для всего клинического. Она поддерживает грудную клетку и живот и ничего больше, её вызов — это файл NIfTI, а не сообщение в чате, а условия лицензии говорят: только исследования и образование. Она не прочитает патологический слайд, не ответит на вопрос о клиническом руководстве и не напишет код, который пакетно выполняет вашу конвертацию DICOM. Потянуться к КТ-модели для текстовой работы — та же категориальная ошибка, что и потянуться к текстовой модели для волюметрии, только в другую сторону.

Как обе половины укладываются в одну систему
Ни одна из моделей не заменяет другую, и разумная архитектура содержит обе — что поднимает практический вопрос о том, как их вызывать.
Claude Opus 5 предоставляется через OrcaRouter как anthropic/claude-opus-5 по ставке из прайс-листа провайдера Anthropic без наценки, в рамках единого API, охватывающего более 200 моделей. Для отдельного вызова это значит меньше, чем для всей окружающей цепочки: когда текстовая половина клинической разработки — это одна модель среди нескольких кандидатов, наличие их всех за одним ключом означает, что вы можете сравнивать их на собственном корпусе без второго договора или изменений в коде, а DSL маршрутизации позволяет отправлять отдельные запросы той модели, которая должна их обрабатывать, тогда как автоматическое переключение при сбое подстрахует вас, когда провайдер деградирует.
NV-Reason-CT отсутствует на нашей платформе, как и любая модель NVIDIA. Это веса, которые вы скачиваете и запускаете на собственном оборудовании, — именно это разрешает лицензия, и, учитывая, что входные данные представляют собой объёмные данные пациентов, вероятно, это в любом случае то, что вам нужно. Мы не собираемся создавать впечатление, что маршрутизируем модель, которую не размещаем у себя. Текстовая часть сборки — там, где мы полезны; объёмная часть — там, где вы остаётесь один на один с моделью на 4,69 млрд параметров и GPU.

Вердикт, выдерживающий тщательную проверку
Если вам нужно, чтобы том КТ был прочитан и преобразован в структурированные заключения, для этого есть модель: она вышла из исследовательской группы NVIDIA, и её можно скачать, а не вызывать через API. Если вам нужно нормализовать корпус отчётов, написать средство оценки, подготовить скрипт для конвертации DICOM или обобщить данные когорты, для этого тоже есть модель, и у неё есть тарифная сетка.
Позиция, которой нужно придерживаться, такова: не было продемонстрировано, что один из них в чём бы то ни было лучше другого, потому что эксперимент не проводился. Продемонстрировано же было то, что нативный трёхмерный интерфейс превосходит основанный на срезах на публичном бенчмарке по КТ грудной клетки с отрывом, который авторы оценивают примерно в три пункта F1, и что передовая модель общего назначения независимо признана лучшей в своей области по рассуждениям, коду и работе с длинным контекстом. Это два утверждения о двух разных задачах. Интерпретировать их как рейтинг — это категориальная ошибка, и она сохраняется ровно до тех пор, пока кто-нибудь не опубликует прямое сравнение, которого пока никто не опубликовал.
