Сгенерированная hero-карточка под названием «NV-Reason-CT vs GPT-5.6 Sol» с подзаголовком «13 824 визуальных токена, прежде чем вы введёте слово». Вдоль нижнего края расположены три чипа: «4,69B КТ-специалист против нераскрытого», «3D NIfTI на входе, находки на выходе» и «Sol: 1 050 000 на входе / 128 000 на выходе». Логотип OrcaRouter вкомпонован в правый нижний угол.
Guides & Insights

NV-Reason-CT vs GPT-5.6 Sol: 13 824 визуальных токена, прежде чем вы введёте слово

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Каждая КТ грудной клетки, которую вы отправляете в NV-Reason-CT стоит 13 824 визуальных токенов ещё до начала промпта. Это не причуда и не выбор настройки — это весь замысел. Встроенный 3D-визуальный энкодер модели принимает объём 384×384×384 мм и превращает его в сетку 24×24×24, и в карточке модели явно указано, что все 13 824 токена и их трёхмерные координаты доходят до языковой модели «без пространственного даунсэмплинга». Сравните это с тем, за что вы, вероятно, уже платите. GPT-5.6 Sol принимает текст, изображения и файлы, и отправленное ему изображение — это 2D-картинка: срез, скриншот DICOM-просмотрщика, радиологический рисунок, вставленный из PDF. У одной из этих моделей есть объёмный путь. У другой — контекстное окно. Большинство сравнений между ними рушится на этом различии, и это крушение — самое интересное.

Релиз, который никто не анонсировал

NVIDIA не опубликовала ни слова об NV-Reason-CT в своём новостном разделе. Нет ни поста о запуске, ни слайда с ключевым докладом, ни пресс-релиза. Что есть: репозиторий Hugging Face, созданный 8 сентября 2026 года, репозиторий GitHub в организации NVIDIA-Medtech, созданный 2 сентября, демо-пространство Gradio и препринт arXiv — NV-Reason-CT: 3D визуально-языковая модель для анализа КТ — поданный 23 сентября 2026 года командой из шестнадцати авторов из NVIDIA с соавторами из NIH и Цюрихского университета.

Это реальная закономерность, и её стоит назвать точно, а не относиться к ней как к загадке. Группа NVIDIA по медицинской визуализации тихо выпускает веса и позволяет статье и репозиторию сделать объявление. Предшественник, NV-Reason-CXR-3B, вышел в октябре 2025 года таким же образом. Разница здесь в масштабе: это первый случай, когда эта группа расширила методику с 2D-рентгеновских снимков до нативных 3D-объёмов, и статье два дня.

Что можно узнать из репозитория: архитектура, лицензия, обучающие данные, таблица бенчмарков. Что пока не подтверждено: намерена ли NVIDIA сделать это поддерживаемой линейкой продуктов, появятся ли новые чекпоинты и как это выдержит оценку кого-либо, кроме авторов. Репозиторий имеет версию 0.1 и описывает себя как предназначенный только для исследований и обучения.

Что на самом деле принимает каждая модель

Именно здесь сравнение один на один быстро становится честным. У этих двух моделей нет общей входной поверхности.

NV-Reason-CT читает тома NIfTI — .nii или .nii.gz — с интенсивностями вокселей в единицах Хаунсфилда. Он автоматически обрезает изображение до грудной клетки или брюшной полости, используя единицы Хаунсфилда для лёгких и эвристику 3D-морфологии, выполняет ресемплинг до изотропного разрешения 2 мм и принимает в качестве значений анатомии только «chest» или «abdomen». На выходе — текст: структурированный отчёт, ответ или пошаговая трассировка рассуждений, с переключателем для отключения рассуждений при коротких ответах.

GPT-5.6 Sol читает текст, изображения и файлы, имея контекстное окно размером 1 050 000 токенов и до 128 000 выходных токенов в одном ответе. У него нет объёмного энкодера. Подайте ему КТ — и сначала придётся решить, как свести три с лишним сотни срезов во что-то, что примет 2D-энкодер изображений: монтаж, несколько ключевых срезов, отрендеренную проекцию максимальной интенсивности. Каждый из этих вариантов уничтожает пространственные связи, которые 3D-путь был призван сохранять.

Так что честная формулировка — не «какая модель умнее». Она в том, что путь обработки изображений у Sol и 3D-путь у NV-Reason-CT отвечают на разные вопросы. Sol способен рассуждать об описании снимка, сделанном радиологом. NV-Reason-CT способен рассуждать о самом снимке.

Существует один бенчмарк, и только у одного из них есть число.

NV-Reason-CT сообщает о Macro-F1 0,614 и Macro-AUROC 0,871 в задаче 18-классовой классификации CT-RATE, используя прямой запрос «Да/Нет» без классификационной головы и без адаптации под конкретную задачу. Это собственные числа авторов из карточки модели, и наиболее полезная часть — строка сравнения: VoxelFM — 0,581 Macro-F1, Pillar-0 — 0,544, ClinFusion-8B — 0,442, CT-CLIP — 0,398, Merlin — 0,358, MedGemma 1.5 — 0,303. При одном и том же фиксированном едином пороге генеративная 3D-модель превосходит базовые модели 3D-контрастивного предобучения и передовую модель на основе срезов.

Одно число в этой таблице заслуживает скептицизма, а не повторения: разрыв по AUROC. NV-Reason-CT сообщает 0.871 против 0.870 у VoxelFM. Одна тысячная пункта в оценке, проведённой вендором, — это не победа, а ничья в пределах любого шума, который несёт оценка. Разрыв Macro-F1 в 0.033 — это обоснованное утверждение.

У GPT-5.6 Sol нет показателя CT-RATE, потому что CT-RATE — это не бенчмарк, на котором его можно запустить. Его Artificial Analysis Intelligence Index составляет 47, измеренный AA показатель GPQA Diamond — 94,1, а результат Humanity's Last Exam — 49,5 — все это инструменты для оценки общего рассуждения. Поставить 0,614 Macro-F1 рядом с 47 в AA Index — это было бы арифметикой на двух разных линейках. Я не собираюсь этого делать, и вам следует с недоверием относиться к любому, кто это сделает.

Трассировки рассуждений, два разных продукта

Обе модели выдают рассуждения. Это единственное подлинное философское пересечение, и различие показательно.

GPT-5.6 Sol предоставляет настраиваемый объём усилий, затрачиваемых на рассуждения, поэтому вы обмениваете задержку и стоимость на глубину при каждом запросе, а также можете запросить рассуждения обратно через include_reasoning. Это универсальная возможность, применяемая ко всему, что вы ей отправляете.

Рассуждения NV-Reason-CT намеренно узки. Обучающий корпус — это примерно 550 000 структурированных примеров в формате вопросов и ответов, взятых из 70 111 уникальных КТ-томов, и часть его составляют рассуждения, написанные радиологами и собранные из записанных и транскрибированных экспертных интерпретаций. Этап GRPO, следующий за SFT, использует проверяемые вознаграждения по наборам отклонений грудной клетки и брюшной полости — то есть сигнал вознаграждения основан на том, действительно ли указанная находка присутствует в томе, а не на том, хорошо ли читается текст. Карточка модели описывает вывод как «проверяемые наблюдения, дифференциальные диагнозы и неопределённость» и содержит явное предупреждение о том, что сгенерированные рассуждения «не гарантированно отражают внутренние вычисления модели». Это предупреждение выполняет реальную работу. Оно — разница между следом, который можно сверить с данными, и следом, которым можно только любоваться.

Размер и лицензия — за один проход

• Параметры — NV-Reason-CT 4,69 млрд всего / 4,35 млрд активных в контуре CT, на базе Qwen3.5-4B плюс Primus 3D ViT против GPT-5.6 Sol — не раскрыто • Размер контрольной точки — NV-Reason-CT ~10,6 ГБ BF16 safetensors, работает на Ampere/Hopper/Lovelace против GPT-5.6 Sol только через API • Вход — 3D-тома NIfTI КТ в единицах Хаунсфилда против текста, изображения, файла • Контекст — NV-Reason-CT неприменимо, один том — это один фиксированный префикс на 13 824 токена против Sol 1 050 000 токенов на входе, 128 000 на выходе • Лицензия — OpenMDW-1.1, веса доступны для скачивания против проприетарной, доступ только через API • Доступность — репозиторий вендора и собственные веса против маршрутизируется через OrcaRouter по $4,00 / $20,00 за миллион, при этом тариф Sol при входных токенах свыше 272 тыс. удваивается до $8,00 / $30,00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

Во что вам на самом деле обходится раскол

Сравнение затрат имеет смысл только в том случае, если признать, что рабочие нагрузки различаются, поэтому вот версия, которая действительно имеет смысл.

Sol тарифицируется за токен, и у его цены есть скачок: 4,00 $ за миллион входных токенов и 20,00 $ за миллион выходных токенов до 272K токенов промпта, затем — 8,00 $ и 30,00 $. На OrcaRouter он предоставляется по собственной прейскурантной цене OpenAI с нулевой наценкой, и это важнее, чем может показаться — тариф, который вы видите, — это тариф, который публикует OpenAI, поэтому любое изменение цены отражается в вашем счёте в тот же день, а не при следующем продлении контракта. Тариф на чтение из кэша составляет 0,40 $ за миллион, то есть десятую часть входной цены, и именно это делает длинные агентные циклы с большим фиксированным префиксом арифметически выживаемыми.

У NV-Reason-CT вообще нет цены за токен. Вы скачиваете 10,6 ГБ и платите за GPU. Это вопрос капитальных затрат против операционных, и ответ на него только один: при достаточно большом объёме самостоятельный хостинг модели с 4,35 млрд активных параметров выигрывает по стоимости. Ниже этого объёма — нет, и точка перехода полностью зависит от загрузки вашего GPU. Никто за пределами NVIDIA пока не опубликовал показатель пропускной способности для этого чекпойнта, так что любой, кто называет вам точку перехода, просто гадает.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Что здесь помогает роутер — это часть рабочего процесса, которая не является сканированием. Производственный конвейер клинических исследований редко состоит из одной модели — это извлечение данных, этап рассуждения, этап суммирования, иногда второе мнение. OrcaRouter предоставляетболее 200 моделей за одним эндпоинтом, совместимым с OpenAI с автоматическим переключением между провайдерами при сбое, поэтому универсальную половину этого конвейера можно заменить или перенаправить без второго контракта. NV-Reason-CT — не одна из моделей, которые мы маршрутизируем; это контрольная точка, которую вы запускаете сами. Обе половины конвейера всё ещё могут работать через один ключ.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

Открытый вопрос

NV-Reason-CT существует два дня как статья и семнадцать дней как репозиторий, а область, к которой он относится, настолько мала, что следующая точка данных будет информативной. Следите за тремя вещами: независимое воспроизведение CT-RATE, второй чекпоинт в этом семействе и любой признак того, что медицинское подразделение NVIDIA рассматривает это как направление, а не как статью. До тех пор защитимая позиция узка и ясна: это самый сильный из доступных для скачивания на данный момент чекпоинтов для нативного 3D-рассуждения по КТ, если судить по собственной таблице авторов, и он не является заменой универсальной передовой модели ни в чём, кроме чтения КТ.