
NV-Reason-CT vs GPT-5.6 Sol: 13 824 визуальных токена, прежде чем вы введёте слово
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 45 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Каждая КТ грудной клетки, которую вы отправляете в NV-Reason-CT стоит 13 824 визуальных токенов ещё до начала промпта. Это не причуда и не выбор настройки — это весь замысел. Встроенный 3D-визуальный энкодер модели принимает объём 384×384×384 мм и превращает его в сетку 24×24×24, и в карточке модели явно указано, что все 13 824 токена и их трёхмерные координаты доходят до языковой модели «без пространственного даунсэмплинга». Сравните это с тем, за что вы, вероятно, уже платите. GPT-5.6 Sol принимает текст, изображения и файлы, и отправленное ему изображение — это 2D-картинка: срез, скриншот DICOM-просмотрщика, радиологический рисунок, вставленный из PDF. У одной из этих моделей есть объёмный путь. У другой — контекстное окно. Большинство сравнений между ними рушится на этом различии, и это крушение — самое интересное.
Релиз, который никто не анонсировал
NVIDIA не опубликовала ни слова об NV-Reason-CT в своём новостном разделе. Нет ни поста о запуске, ни слайда с ключевым докладом, ни пресс-релиза. Что есть: репозиторий Hugging Face, созданный 8 сентября 2026 года, репозиторий GitHub в организации NVIDIA-Medtech, созданный 2 сентября, демо-пространство Gradio и препринт arXiv — NV-Reason-CT: 3D визуально-языковая модель для анализа КТ — поданный 23 сентября 2026 года командой из шестнадцати авторов из NVIDIA с соавторами из NIH и Цюрихского университета.
Это реальная закономерность, и её стоит назвать точно, а не относиться к ней как к загадке. Группа NVIDIA по медицинской визуализации тихо выпускает веса и позволяет статье и репозиторию сделать объявление. Предшественник, NV-Reason-CXR-3B, вышел в октябре 2025 года таким же образом. Разница здесь в масштабе: это первый случай, когда эта группа расширила методику с 2D-рентгеновских снимков до нативных 3D-объёмов, и статье два дня.
Что можно узнать из репозитория: архитектура, лицензия, обучающие данные, таблица бенчмарков. Что пока не подтверждено: намерена ли NVIDIA сделать это поддерживаемой линейкой продуктов, появятся ли новые чекпоинты и как это выдержит оценку кого-либо, кроме авторов. Репозиторий имеет версию 0.1 и описывает себя как предназначенный только для исследований и обучения.
Что на самом деле принимает каждая модель
Именно здесь сравнение один на один быстро становится честным. У этих двух моделей нет общей входной поверхности.
NV-Reason-CT читает тома NIfTI — .nii или .nii.gz — с интенсивностями вокселей в единицах Хаунсфилда. Он автоматически обрезает изображение до грудной клетки или брюшной полости, используя единицы Хаунсфилда для лёгких и эвристику 3D-морфологии, выполняет ресемплинг до изотропного разрешения 2 мм и принимает в качестве значений анатомии только «chest» или «abdomen». На выходе — текст: структурированный отчёт, ответ или пошаговая трассировка рассуждений, с переключателем для отключения рассуждений при коротких ответах.
GPT-5.6 Sol читает текст, изображения и файлы, имея контекстное окно размером 1 050 000 токенов и до 128 000 выходных токенов в одном ответе. У него нет объёмного энкодера. Подайте ему КТ — и сначала придётся решить, как свести три с лишним сотни срезов во что-то, что примет 2D-энкодер изображений: монтаж, несколько ключевых срезов, отрендеренную проекцию максимальной интенсивности. Каждый из этих вариантов уничтожает пространственные связи, которые 3D-путь был призван сохранять.
Так что честная формулировка — не «какая модель умнее». Она в том, что путь обработки изображений у Sol и 3D-путь у NV-Reason-CT отвечают на разные вопросы. Sol способен рассуждать об описании снимка, сделанном радиологом. NV-Reason-CT способен рассуждать о самом снимке.
Существует один бенчмарк, и только у одного из них есть число.
NV-Reason-CT сообщает о Macro-F1 0,614 и Macro-AUROC 0,871 в задаче 18-классовой классификации CT-RATE, используя прямой запрос «Да/Нет» без классификационной головы и без адаптации под конкретную задачу. Это собственные числа авторов из карточки модели, и наиболее полезная часть — строка сравнения: VoxelFM — 0,581 Macro-F1, Pillar-0 — 0,544, ClinFusion-8B — 0,442, CT-CLIP — 0,398, Merlin — 0,358, MedGemma 1.5 — 0,303. При одном и том же фиксированном едином пороге генеративная 3D-модель превосходит базовые модели 3D-контрастивного предобучения и передовую модель на основе срезов.
Одно число в этой таблице заслуживает скептицизма, а не повторения: разрыв по AUROC. NV-Reason-CT сообщает 0.871 против 0.870 у VoxelFM. Одна тысячная пункта в оценке, проведённой вендором, — это не победа, а ничья в пределах любого шума, который несёт оценка. Разрыв Macro-F1 в 0.033 — это обоснованное утверждение.
У GPT-5.6 Sol нет показателя CT-RATE, потому что CT-RATE — это не бенчмарк, на котором его можно запустить. Его Artificial Analysis Intelligence Index составляет 47, измеренный AA показатель GPQA Diamond — 94,1, а результат Humanity's Last Exam — 49,5 — все это инструменты для оценки общего рассуждения. Поставить 0,614 Macro-F1 рядом с 47 в AA Index — это было бы арифметикой на двух разных линейках. Я не собираюсь этого делать, и вам следует с недоверием относиться к любому, кто это сделает.
Трассировки рассуждений, два разных продукта
Обе модели выдают рассуждения. Это единственное подлинное философское пересечение, и различие показательно.
GPT-5.6 Sol предоставляет настраиваемый объём усилий, затрачиваемых на рассуждения, поэтому вы обмениваете задержку и стоимость на глубину при каждом запросе, а также можете запросить рассуждения обратно через include_reasoning. Это универсальная возможность, применяемая ко всему, что вы ей отправляете.
Рассуждения NV-Reason-CT намеренно узки. Обучающий корпус — это примерно 550 000 структурированных примеров в формате вопросов и ответов, взятых из 70 111 уникальных КТ-томов, и часть его составляют рассуждения, написанные радиологами и собранные из записанных и транскрибированных экспертных интерпретаций. Этап GRPO, следующий за SFT, использует проверяемые вознаграждения по наборам отклонений грудной клетки и брюшной полости — то есть сигнал вознаграждения основан на том, действительно ли указанная находка присутствует в томе, а не на том, хорошо ли читается текст. Карточка модели описывает вывод как «проверяемые наблюдения, дифференциальные диагнозы и неопределённость» и содержит явное предупреждение о том, что сгенерированные рассуждения «не гарантированно отражают внутренние вычисления модели». Это предупреждение выполняет реальную работу. Оно — разница между следом, который можно сверить с данными, и следом, которым можно только любоваться.
Размер и лицензия — за один проход
• Параметры — NV-Reason-CT 4,69 млрд всего / 4,35 млрд активных в контуре CT, на базе Qwen3.5-4B плюс Primus 3D ViT против GPT-5.6 Sol — не раскрыто • Размер контрольной точки — NV-Reason-CT ~10,6 ГБ BF16 safetensors, работает на Ampere/Hopper/Lovelace против GPT-5.6 Sol только через API • Вход — 3D-тома NIfTI КТ в единицах Хаунсфилда против текста, изображения, файла • Контекст — NV-Reason-CT неприменимо, один том — это один фиксированный префикс на 13 824 токена против Sol 1 050 000 токенов на входе, 128 000 на выходе • Лицензия — OpenMDW-1.1, веса доступны для скачивания против проприетарной, доступ только через API • Доступность — репозиторий вендора и собственные веса против маршрутизируется через OrcaRouter по $4,00 / $20,00 за миллион, при этом тариф Sol при входных токенах свыше 272 тыс. удваивается до $8,00 / $30,00

Во что вам на самом деле обходится раскол
Сравнение затрат имеет смысл только в том случае, если признать, что рабочие нагрузки различаются, поэтому вот версия, которая действительно имеет смысл.
Sol тарифицируется за токен, и у его цены есть скачок: 4,00 $ за миллион входных токенов и 20,00 $ за миллион выходных токенов до 272K токенов промпта, затем — 8,00 $ и 30,00 $. На OrcaRouter он предоставляется по собственной прейскурантной цене OpenAI с нулевой наценкой, и это важнее, чем может показаться — тариф, который вы видите, — это тариф, который публикует OpenAI, поэтому любое изменение цены отражается в вашем счёте в тот же день, а не при следующем продлении контракта. Тариф на чтение из кэша составляет 0,40 $ за миллион, то есть десятую часть входной цены, и именно это делает длинные агентные циклы с большим фиксированным префиксом арифметически выживаемыми.
У NV-Reason-CT вообще нет цены за токен. Вы скачиваете 10,6 ГБ и платите за GPU. Это вопрос капитальных затрат против операционных, и ответ на него только один: при достаточно большом объёме самостоятельный хостинг модели с 4,35 млрд активных параметров выигрывает по стоимости. Ниже этого объёма — нет, и точка перехода полностью зависит от загрузки вашего GPU. Никто за пределами NVIDIA пока не опубликовал показатель пропускной способности для этого чекпойнта, так что любой, кто называет вам точку перехода, просто гадает.

Что здесь помогает роутер — это часть рабочего процесса, которая не является сканированием. Производственный конвейер клинических исследований редко состоит из одной модели — это извлечение данных, этап рассуждения, этап суммирования, иногда второе мнение. OrcaRouter предоставляетболее 200 моделей за одним эндпоинтом, совместимым с OpenAI с автоматическим переключением между провайдерами при сбое, поэтому универсальную половину этого конвейера можно заменить или перенаправить без второго контракта. NV-Reason-CT — не одна из моделей, которые мы маршрутизируем; это контрольная точка, которую вы запускаете сами. Обе половины конвейера всё ещё могут работать через один ключ.

Открытый вопрос
NV-Reason-CT существует два дня как статья и семнадцать дней как репозиторий, а область, к которой он относится, настолько мала, что следующая точка данных будет информативной. Следите за тремя вещами: независимое воспроизведение CT-RATE, второй чекпоинт в этом семействе и любой признак того, что медицинское подразделение NVIDIA рассматривает это как направление, а не как статью. До тех пор защитимая позиция узка и ясна: это самый сильный из доступных для скачивания на данный момент чекпоинтов для нативного 3D-рассуждения по КТ, если судить по собственной таблице авторов, и он не является заменой универсальной передовой модели ни в чём, кроме чтения КТ.
