
NV-Reason-CT против Qwen3.8 Max: дообучение и семейство, из которого оно вышло
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 45 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Первая строка NV-Reason-CT, карточки модели, сообщает нечто, что большинство людей пропускает. Базовая модель — Qwen/Qwen3.5-4B, указанная в метаданных репозитория как связь дообучения. Поэтому когда NVIDIA понадобилась языковая модель, к которой можно прикрутить 3D-визуальный трансформер Primus, она взяла Qwen. Сравните этот чекпойнт с Qwen3.8 Max — собственным флагманом Alibaba на 1 000 000 токенов, выпущенным 3 августа 2026 года, — и вы увидите дообученную модель и семейный бизнес. Один — специалист на 4,69B, который читает КТ грудной и брюшной полостей и был опубликован на Hugging Face 8 сентября 2026 года без анонса. Другой — универсальный флагман, принимающий текст, изображения и видео, с опубликованной тарифной сеткой и 37,2 миллионами токенов измеренного трафика в нашей сети за последнюю неделю. Интересный вопрос не в том, кто побеждает. А в том, что 4B-дообучение может делать то, чего не может флагман его семейства, и почему ответ более конкретен, чем вы ожидаете.
Что конкретно дал файнтюн
Собственная формулировка NVIDIA этого разрыва необычно точна, и это самое полезное предложение в репозитории: большинство визуально-языковых систем «либо работают с 2D-изображениями, либо сжимают объёмные признаки перед языковым декодированием». Это описание целого класса моделей, и оно включает все универсальные мультимодальные флагманы на рынке.
Исправление носит архитектурный характер, а не является вопросом масштаба. Входной объем размером 384×384×384 мм превращается в сетку 24×24×24 из 13 824 визуальных токенов. Эти токены и их трехмерные координаты поступают в языковую модель без пространственного понижения разрешения, а 3D MRoPE сохраняет пространственные связи внутри декодера. Входные объемы обрезаются с учетом анатомии до области грудной клетки или живота по единицам Хаунсфилда для легких, затем передискретизируются до изотропного разрешения 2 мм.
Сопоставьте это с тем, что принимает Qwen3.8 Max. Текст, изображение и видео — и видео в этом ряду ближе всего к объёмному вводу, что делает его честной точкой сравнения, а не риторической. Видео — это стек 2D-кадров, упорядоченных по времени. КТ-объём — это стек 2D-срезов, упорядоченных по физическому положению вдоль оси z, в единицах Хаунсфилда, с известным шагом в миллиметрах. Оба представляют собой трёхмерные массивы. Только у одного из них есть физическая система координат, относительно которой можно локализовать находку рентгенолога, и только один из них измеряется в единице, которая имеет значение за пределами датчика изображения. Модель, обученная на видео, усваивает временную непрерывность. Модель, обученная на КТ-объёмах, усваивает, что образование на одном срезе — это то же образование на следующем срезе, на восемь миллиметров ниже.
Обучающий корпус — вот в чём настоящая разница.
Вот здесь две модели перестают быть сравнимыми вообще, и это именно то, о чём не расскажет спецификация.
NV-Reason-CT обучали сквозным образом с помощью обучения с учителем, за которым следовала Group Relative Policy Optimization, на примерно 550 000 структурированных примерах вопросов и ответов, взятых из 70 111 уникальных КТ-томов. Источники: CT-RATE — 47 149 случаев из мегагоспиталя Стамбульского университета Медипол с парными радиологическими заключениями, внутренний набор NIH из 15 991 случая и 22 720 случаев CancerVerse по четырём фазам контрастирования и тринадцати типам злокачественных опухолей. Корпус включает стандартизированные заключения, вопросы и ответы, ориентированные на патологии, многоходовые диалоги и рассуждения, составленные радиологами и расшифрованные из записанных экспертных интерпретаций. На этапе GRPO используются проверяемые награды по наборам патологий грудной клетки и брюшной полости, что означает, что сигнал награды проверяет, присутствует ли указанная находка в томе, а не то, звучит ли текст клинически.
Обучающий корпус Qwen3.8 Max не опубликован с такой степенью детализации, и это не помогло бы, даже если бы он был опубликован, поскольку целевая способность носит общий характер. Вместо этого свидетельством служат его показатели Artificial Analysis: индекс интеллекта 45,4, что ставит его на 15-е место из 145 моделей в нашем снимке API; AA Coding 76,2 на 9-м месте; Terminal-Bench 2.1 — 88,8; GPQA Diamond — 92,8; Humanity's Last Exam — 43,1; SciCode — 52,1 и воспроизведение в длинном контексте — 80,3. Это сторонние измерения, а не заявления вендора, что делает их самыми надёжными цифрами по обе стороны этой страницы.
Вывод рассуждений, два разных контракта
Обе модели выдают цепочки рассуждений, и обе позволяют их отключить. На этом сходство заканчивается — дальше всё решает интерфейс.
Qwen3.8 Max предоставляет enable_thinking и reasoning_effort, а также полный набор параметров сэмплирования — temperature, top_p, seed, штрафы, структурированные выходы, вызов инструментов. Это универсальная способность к рассуждению, которую вы направляете на то, что у вас есть. Качество его размышлений ровно настолько высоко, насколько хороша задача, которую вы ему даёте, и у него нет способа проверить утверждение по чему-либо, кроме текста, который ему был дан.
Рассуждение NV-Reason-CT имеет более узкий контракт с читателем, и в карточке модели это ограничение указано явно: сгенерированное рассуждение — это «доступный для проверки вывод модели, и не гарантируется, что он отражает внутренние вычисления модели». Эта оговорка играет реальную роль, и это та фраза, которая появляется только тогда, когда команда задумалась о том, что клиницист будет делать с правдоподобно звучащей трассировкой. В карточке вывод описывается как доступные для проверки наблюдения, дифференциальные диагнозы и неопределённость. Иными словами, это трассировка, которую можно сверить с объёмом, а не та, которую можно только прочитать.
Пропускная способность — из того единственного места, где мы можем её измерить
За последние семь дней Qwen3.8 Max пропустил 37,2 млн токенов через собственную тестовую площадку OrcaRouter. Медианное время до первого токена составило 1,96 секунды — уверенно самый быстрый показатель среди моделей этой серии — со скоростью 53,3 выходных токена в секунду. Доля ошибок за этот период составила 3,5%.
Эти два показателя тянут в противоположные стороны, и оба важны. Задержка превосходна, и с моделью приятно работать в итеративном режиме. Доля ошибок примерно в семнадцать раз выше, чем 0,21% у Kimi K3 за тот же период, и именно это число определяет, ставить ли её за синхронный вызов, обращённый к пользователю, или за пакетное задание с повторными попытками. Это измеренное поведение в нашей сети, а не бенчмарк, и это как раз то, о чём тарифная карта никогда не расскажет.
Для NV-Reason-CT нигде нет сопоставимых измерений. Это BF16-чекпоинт размером 10,6 ГБ с кастомным кодом модели, загружаемый с trust_remote_code=True на оборудовании Ampere, Hopper или Lovelace, протестированный NVIDIA на H100 и L40S. Не опубликовано ни p50, ни частоты ошибок, ни показателя пропускной способности. Любой, кто говорит вам, что пороговый объём, при котором самостоятельный хостинг этой модели выгоднее оплаты за токен, — гадает.
Цена и форма, бок о бок
• Цена — капитальные затраты на GPU для NV-Reason-CT, без тарифа за токен; в отличие от Qwen3.8 Max, где $2,00 / $6,00 за миллион токенов, $0,25 за чтение из кэша, $2,50 за запись в кэш
• Вход — 3D NIfTI-томы КТ в единицах Хаунсфилда, только грудная клетка или брюшная полость, в сравнении с Qwen3.8 Max: текст, изображение и видео
• Контекст — NV-Reason-CT: один том, фиксированный префикс из 13 824 токенов против Qwen3.8 Max — 1 000 000 токенов
• Параметры — NV-Reason-CT: всего 4,69 млрд / 4,35 млрд активных в CT-пути, тогда как у Qwen3.8 Max — не раскрыто
• Лицензия — NV-Reason-CT OpenMDW-1.1; веса опубликованы, тогда как Qwen3.8 Max — проприетарная модель с доступом только через API
• Независимые оценки — NV-Reason-CT: нет, против Qwen3.8 Max — AA Intelligence Index 45.4, GPQA Diamond 92.8

Экономика кэша Qwen3.8 Max вознаграждает определённую конфигурацию: чтение из кэша за $0.25 против $2.00 за свежий ввод — это восьмикратная скидка, а запись в кэш за $2.50 означает, что длинный переиспользуемый префикс быстро окупается. Это нагрузка в виде системного промпта плюс документа с протоколом, переиспользуемых в тысячах запросов. У NV-Reason-CT противоположный профиль затрат — почти нулевые предельные издержки на одно сканирование после покупки GPU и жёсткий минимум в виде одного GPU, удерживаемого бессрочно.

Вместе управляем семьёй
Естественная архитектура здесь — и стоит сказать, что никто её не публиковал, — это дообученная модель для объёмных задач и флагманская модель для всего вокруг. NV-Reason-CT формирует структурированное заключение; Qwen3.8 Max обрабатывает текст направлений, сопоставление с протоколами, кодирование, письма для последующего наблюдения — работу с большими объёмами текста, где окно в миллион токенов и восьмикратная скидка на кэш действительно оправдывают себя.
Если это ваш пайплайн, то половина — это чекпоинт, который вы хостите у себя, а половина — это то, что вы покупаете за деньги, и вторая половина — это то, где роутер делает то, чего не может эндпоинт вендора.Qwen3.8 Max обслуживается через OrivaRouter по прайс-листовой цене Alibaba без наценки, указанные выше $2.00 / $6.00 — это то, что вы платите, и любое изменение цены сразу попадает в ваш счёт, а не откладывается до продления.Автоматическое переключение между провайдерами при сбое важнее, чем обычно, когда собственный измеренный уровень ошибок модели составляет 3.5% — повтор, направленный на другой работоспособный эндпоинт, — это разница между временным сбоем и неудачным запросом. А поскольку универсальная половина пайплайна — это одно название модели за OpenAI-совместимым эндпоинтом, охватывающим 200+ моделей, замена на что-то другое для эксперимента стоит одной строки, а не интеграции.
NV-Reason-CT, чтобы было ясно, не находится на OrcaRouter и не будет — это 3D-инференс на кастомном коде, который вы запускаете сами. Честная версия истории интеграции такова: специализированная модель, размещённая самостоятельно, и универсальная модель, доступная через маршрутизацию, могут работать под одним ключом, и это всё, что утверждается.

Вердикт, который действительно имеет силу
Это сопоставление относят к категории «что лучше», хотя не должны. Qwen3.8 Max оценивается третьими сторонами по общим способностям к рассуждению и обходит большинство конкурентов; у NV-Reason-CT есть одна таблица собственных показателей по одному CT-бенчмарку и количество параметров — 4,69 млрд, что было бы ничем не примечательно в любом общем сравнении. На любом общем бенчмарке побеждает флагман, и причина в том, что общий бенчмарк — это то, для чего он был создан.
В той единственной задаче, для которой был создан NV-Reason-CT — чтение объёма КТ грудной клетки или брюшной полости и определение того, что в нём есть, с трассировкой, которую можно проверить, — Qwen3.8 Max не является более слабым конкурентом. У него нет объёмного энкодера, поэтому его вообще нельзя подать на вход, пока кто-то сначала не решит, как преобразовать сканирование в набор плоских снимков. Именно на этом решении теряется пространственная информация. В этом весь смысл дообучения модели на 4B с нативным 3D-путём и фиксированным префиксом на 13 824 токена, и именно поэтому интересное в этой модели — малость её бэкбона, а не её размер.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
