Сгенерированная hero-карточка с заголовком «NV-Reason-CT против Grok 4.6» и подзаголовком «Кто читает снимок, а кто — отчёт». Внизу идут три чипа: «Один КТ-объём против 500 000 токенов», «0.871 против 0.870 — ничья» и «Grok 4.6: $2.00 / $6.00 за M». Логотип OrcaRouter наложен в правом нижнем углу.
Guides & Insights

NV-Reason-CT против Grok 4.6: кто читает снимок, а кто — отчёт

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Есть два способа поместить ИИ в конвейер КТ, и только один из них связан с изображением. NV-Reason-CT — первый: 3D-визуально-языковая модель с 4,69 млрд параметров, которая напрямую читает тома NIfTI и была опубликована на Hugging Face 8 сентября 2026 года без поста о запуске от NVIDIA. Grok 4.6 — второй: модель на 500 000 токенов, работающая с текстом и изображениями, выпущенная 12 августа 2026 года, стоит $2,00 за миллион входных токенов и очень хорошо справляется с той частью работы, которая происходит после того, как кто-то уже записал находку. Поставьте их рядом для сравнения, и обычный вопрос — какая из них лучше — окажется неправильно поставленным. Они не конкурируют за одно и то же место в конвейере. Они конкурируют за одну и ту же статью бюджета.

Что на самом деле вышло с каждой стороны

NV-Reason-CT появился как репозиторий, статья и демо Space, а не как продукт. Репозиторий GitHub в организации NVIDIA-Medtech был создан 2 сентября 2026 года; веса Hugging Face появились 8 сентября; препринт arXiv, NV-Reason-CT: 3D-визуально-языковая модель для анализа КТ, вышел 23 сентября с шестнадцатью авторами из NVIDIA, NIH и Цюрихского университета. В новостной ленте NVIDIA об этом ничего нет. В карточке модели указана версия 0.1, а использование ограничено исследованиями и образованием.

Grok 4.6 — это релиз противоположного типа. Это полноценный коммерческий эндпоинт, указанный как «Последняя» в документации для разработчиков от производителя, с ценой по опубликованному прайс-листу и доступный как OpenAI-совместимая модель, которую существующие интеграции подключают, изменив базовый URL. Он пришёл на смену Grok 4.5 с тем же контекстным окном, той же входной поверхностью и тем же базовым ценообразованием.

Эта асимметрия — и есть вся суть этого сравнения. Один — исследовательский артефакт, который, так уж вышло, можно скачать. Другой — инфраструктура. Сопоставление их друг с другом показывает, где сейчас в медицинской визуализации проходит граница между «исследовательским артефактом» и «инфраструктурой», — и она не там, где вы бы предположили.

Разделение труда, в затратах и выпуске

• Объёмный ввод — NV-Reason-CT читает тома NIfTI .nii/.nii.gz в единицах Хаунсфилда, только грудная клетка или брюшная полость, в отличие от Grok 4.6, который читает текст, изображения и файлы, без объёмного пути • Пространственная обработка — NV-Reason-CT преобразует объём 384×384×384 мм в сетку 24×24×24 из 13 824 токенов с 3D MRoPE, без понижающей дискретизации, в отличие от Grok 4.6, который обрабатывает изображение как 2D-картинку • Контекст — NV-Reason-CT: один объём — это один фиксированный префикс, контекстного окна в обычном смысле нет, в отличие от Grok 4.6 — 500 000 токенов • Вывод — NV-Reason-CT: структурированный отчёт, ответ или трассировка рассуждений с отключаемым режимом размышления, в отличие от Grok 4.6 — текст со структурированными выводами и вызовами инструментов • Лицензия — NV-Reason-CT: OpenMDW-1.1, веса BF16 объёмом 10,6 ГБ, в отличие от Grok 4.6 — проприетарная, только API • Цена — NV-Reason-CT: капитальные затраты на GPU, без ставки за токен, в отличие от Grok 4.6 — $2,00 / $6,00 за миллион, удваивается свыше 200 тыс. входных токенов

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

Эта пара воспринимается как естественная передача задач. NV-Reason-CT формирует находку по объёму; Grok 4.6 — это модель, которой вы бы передали тысячу таких находок в одном контекстном окне, чтобы искать закономерности по когорте. Никто не публиковал этот конвейер. Это очевидная архитектура, и стоит прямо сказать, что она не проверена.

Цифры Grok 4.6 — и чьи они

Две цифры по Grok 4.6 ходят вместе, но это не одно и то же. Показатель GPQA Diamond, равный 94,9, измерен Artificial Analysis, а не заявлен производителем, — и именно потому, что его получила третья сторона, он относится к более надёжной из этих двух категорий. Оценка 44 по Artificial Analysis Intelligence Index, в ревизии индекса v4.3.2, ставит Grok 4.6 на 28-е место из 211 в его классе. Кроме того, Artificial Analysis отмечает модель как проприетарную: веса не находятся в открытом доступе.

На том же табло AA измеряет Terminal-Bench 2.1 на 88.4, SciCode на 56.5, Humanity's Last Exam на 42.9, 𝜏²-banking на 50.7 и long-context recall на 80.3. Это инструменты для оценки общего рассуждения. Ни один из них нельзя запустить на трёхмерном объёме КТ, и это не камень в огород Grok 4.6 — это констатация того, что именно измеряет набор бенчмарков.

У стороны CT есть ровно одна таблица, и она принадлежит авторам.

Вся публичная доказательная база NV-Reason-CT состоит из одной таблицы классификации по 18 меткам CT-RATE, при фиксированном едином пороге, с использованием прямого запроса Yes/No без классификационной головы. Сообщается Macro-F1 0.614 и Macro-AUROC 0.871, против VoxelFM с 0.581/0.870, Pillar-0 с 0.544/0.861, ClinFusion-8B с 0.442, CT-CLIP с 0.398/0.733, Merlin с 0.358/0.662 и MedGemma 1.5 с 0.303.

Это данные, предоставленные вендором, из карточки модели, и я помечаю их именно так, поскольку их ещё не воспроизвела ни одна независимая сторона. В таблице заслуживают внимания две вещи. Отрыв по F1 от VoxelFM составляет 0,033 — это реальный разрыв на 18 метках при фиксированном пороге. Отрыв по AUROC от той же модели составляет 0,001, то есть это ничья. Оба числа находятся в одной и той же строке одной и той же таблицы, и только одно из них несёт утверждение.

Ещё одна вещь, которую показывает таблица, касается того, как сама статья выстраивает рамки. Модели для сравнения — это системы 3D-контрастивного предобучения, объединённая генеративная MLLM для 2D/3D и передовая модель на основе срезов. Авторы решили сравниваться с системами, которые принимают на вход объёмные данные, потому что единственное значимое утверждение здесь — это то, что генеративная 3D-модель может превзойти дискриминативные 3D-модели в классификации без классификационной головы. Это ничего не говорит о том, как NV-Reason-CT соотносится с универсальной передовой моделью хоть в чём-либо, потому что такого сравнения на этой оси не существует.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Куда уходят деньги и почему важна граница уровня

В тарифной сетке Grok 4.6 есть деталь, которая незаметно определяет многое в архитектуре: запросы длиной более 200 тыс. входных токенов тарифицируются по двойной базовой ставке — $4,00 за вход, $12,00 за выход, а ставка за чтение кэша растёт с $0,50 до $1,00. Задача по когортному обзору, накапливающая выводы в одном длинном контексте, — это ровно та рабочая нагрузка, которая пересекает этот порог. Ниже него ставка за чтение кэша в $0,50 за миллион составляет четверть цены за вход, и именно это делает прогон большого фиксированного префикса по тысячам отчётов доступным, а не просто возможным.

Через OrcaRouter Grok 4.6 предоставляется по каталожной цене этого провайдера без какой-либо наценки, так что тарифная арифметика, приведённая выше, — это именно та арифметика, которую вы действительно оплачиваете, и любое её будущее изменение отразится в вашем счёте в тот же день, а не при следующем продлении. Причина маршрутизировать задачу подобным образом, а не жёстко прописывать одну конечную точку, состоит в том, что часть клинического конвейера, отвечающая за проверку когорт, — это как раз то место, где вам захочется опробовать три разные модели, прежде чем на чём-то остановиться, — а при использовании одного ключа, совместимого с OpenAI, с автоматическим переключением при сбое между провайдерами такой эксперимент обходится лишь сменой названия модели.

У CT-части пайплайна такой возможности нет. NV-Reason-CT не размещается на OrcaRouter — это чекпоинт объёмом 10,6 ГБ с кастомным кодом модели, который вы запускаете сами, на железе Ampere, Hopper или Lovelace, с trust_remote_code=True. Мы не собираемся подразумевать обратное. Если вы строите этот пайплайн, вы покупаете GPU для одной половины и токены для другой, и то, что обе половины можно хотя бы администрировать из одной консоли, — это единственное заявление об интеграции, которое стоит делать.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

Чего на самом деле стоит второй читатель

В статье NV-Reason-CT описано предварительное исследование с участием экспертов-радиологов, в котором сообщается о «благоприятных оценках уверенности для просмотра с поддержкой ИИ» и о снижении среднего заявленного времени интерпретации и подготовки заключения на 50%. Это сильные цифры, и с ними связана оговорка, которую приводит сама статья: предварительный характер и собственный дизайн исследования авторов. Опубликованного независимого воспроизведения нет, а снижение времени на 50% в контролируемом исследовании чтения — как раз тот тип результата, который уменьшается при воспроизведении. За этим стоит следить. Но не стоит ссылаться на это как на установленный факт.

Если рассматривать это в таком контексте, вклад Grok 4.6 в рабочий процесс радиологии — вовсе не диагностика. Это слой, который читает отчёты — очередь на триаж, письмо для последующего наблюдения, кодирование, пакет документов для предварительного согласования. Эта работа текстовая, высокообъёмная, дешёвая в расчёте на единицу, а сбой при её выполнении приводит к административным, а не клиническим последствиям. Именно здесь контекстное окно на 500K и чтение кэша за $0,50 по-настоящему оправдывают себя.

Итак, разделение, к которому приходит это сравнение, однозначно: у NV-Reason-CT есть настоящий 3D-путь, но нет дистрибуции, нет цены и нет независимой проверки. У Grok 4.6 есть дистрибуция, цена, независимое покрытие бенчмарков и вообще нет объёмного пути. Если вам нужно прочтение сканирования, только один из них может это сделать. Если вам нужно уладить бумажные вопросы вокруг сканирования, только другой является продуктом.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно