
NV-Reason-CT против Gemini 3.1 Pro: самая широкая входная поверхность, и всё ещё не CT Reader
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 506 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 183 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Девяносто четыре процента. Это частота ошибок, которую наш собственный каталог в настоящее время фиксирует для одного маршрута, обслуживающего Gemini 3.1 Pro — 93,93%, а также медианное время до первого токена, которое выглядит как десятисекундный потолок, и показатель пропускной способности в 978 токенов в секунду. Если воспринимать это как утверждение о модели, вы придёте ровно к неверному выводу. Если воспринимать это как утверждение о preview-уровне под нагрузкой, это становится самым полезным на странице, потому что именно с этим на практике сталкивается клинический пайплайн, когда зависит от маршрута, который не был обеспечен ресурсами для продакшен-трафика.
У модели по другую сторону этого сравнения нет ни такой проблемы, ни таких измерений. NV-Reason-CT — это нативный 3D-ризонер для КТ от NVIDIA с 4,69 млрд параметров, доступный для загрузки по лицензии OpenMDW-1.1, вообще без опубликованных показателей пропускной способности и без какого-либо размещения у хостинг-провайдеров. Так что одна сторона этого противостояния даёт вам самую широкую входную поверхность в отрасли, а профиль доступности приходится учитывать при проектировании; другая даёт одну узкую возможность, а задержку приходится измерять самостоятельно. Ни у одной из сторон нет панели мониторинга, которой можно доверять с первого дня, и по противоположным причинам.
Две модели — два определения «мультимодальности»
Это слово несёт огромную нагрузку в обоих описаниях продукта, и почти ничего из этого не совпадает.
• Принимаемые входные данные — Gemini 3.1 Pro принимает текст, изображения, аудио, видео и файлы; NV-Reason-CT принимает одноканальный том NIfTI в единицах Хаунсфилда, и ничего больше
• Что означает «3D» — NV-Reason-CT пересэмплирует до изотропных 2 мм в пределах 384-миллиметрового куба и нарезает его на патчи 8 x 8 x 8 для сетки 24 x 24 x 24; видеовход Gemini 3.1 Pro — это последовательность двумерных кадров с временной шкалой
• Контекст — 1,048,576 токенов на входе и 65,536 на выходе для Gemini 3.1 Pro; один том — 13,824 визуальных токена для NV-Reason-CT, без даунсэмплинга и без слоя слияния, и вокруг него нет окна чата
• Релиз — 19 февраля 2026 года для Gemini 3.1 Pro, на preview-слаге; неанонсированный исследовательский релиз для NV-Reason-CT, с активностью в репозитории, датированной 2–25 сентября 2026 года
• Цена — $2 и $12 за миллион токенов до 200 000 токенов, затем $4 и $18, при этом чтение из кэша — $0.20, а запись в кэш — $0.375; против самостоятельно размещённых весов без тарифной сетки
• Возможности — компьютерное зрение, аудио, использование инструментов, вывод в формате JSON и рассуждения для Gemini 3.1 Pro; структурированные результаты по анатомическим областям для NV-Reason-CT, без использования инструментов
• Лицензия и статус — API предварительного просмотра, размещённый на хостинге; на основе весов OpenMDW-1.1, карточка модели которых прямо указывает, что они предназначены только для исследований и образования, и недвусмысленно заявляет, что это не медицинское изделие
Видеовход и вход объёмной КТ издалека выглядят рядом стоящими, а вблизи оказываются максимально далёкими друг от друга. Видео — это кадры во времени. КТ-исследование — это единый статический объём с тремя пространственными осями, физическим масштабом в миллиметрах и калиброванной единицей плотности, где измеряется плотность структуры, размер которой имеет значение. Gemini 3.1 Pro посмотрит хирургическую запись и опишет, что произошло. Он не будет измерять узел. Это не ограничение, которое Google не смогла устранить; это другая задача, которую никто не решил с помощью модели общего назначения.
Что охватывают две записи бенчмарка и что они оставляют за рамками
У Gemini 3.1 Pro есть независимый послужной список, и он хорош по тем осям, которые он измеряет.
• GPQA Diamond — 94,1, самый высокий показатель во всей этой серии статей
• Humanity's Last Exam — 47, с показателем воспроизведения в длинном контексте 82, и это снова самый высокий результат в данном сравнении
• IFBench и SciCode — 77,14 и 58,7
• τ²-Bench — 95.61, при этом tau_banking — 21.44, а Terminal-Bench Hard — 53.79
• Artificial Analysis: интеллект и программирование — 29,7 и 68,8
• Измеренная задержка — медиана в десять секунд до первого токена, что, судя по всему, представляет собой верхний предел, а не истинную медиану, при 978 токенах в секунду и доле ошибок 93,93%
Обратите внимание на форму этого: профиль знаний и длинного контекста наверху сравнения, индекс интеллекта в нижней середине и измерение доступности, которое непригодно к использованию. Все три описывают одну и ту же модель на одном и том же маршруте. Высокий GPQA Diamond означает, что она знает очень много. Композитный показатель 29.7 означает, что она не лидирует по всем параметрам. Частота ошибок 93.93% означает, что на этом конкретном пути большинство ваших запросов не завершится — и это почти наверняка факт о мощности и выделении ресурсов для preview-эндпоинта, а не свойство весов. Мы не можем доказать, что именно, извне. Что мы можем сказать: ни одно из этих трёх чисел не является опечаткой, и у любой архитектуры, которая читает только первое, будет плохая неделя.
Рекорд NV-Reason-CT имеет более узкий охват и сопровождается другой оговоркой. Его 0,614 F1 и 0,871 AUROC на CT-RATE — по восемнадцати меткам, при фиксированном едином пороге, прямом запросе в формате «да/нет» и без классификационной головы или адаптации к конкретной задаче — это собственные показатели NVIDIA из собственной статьи NVIDIA. Набор для сравнения за ними — VoxelFM с 0,581, Pillar-0 с 0,544, ClinFusion-8B с 0,442, CT-CLIP с 0,398, Merlin с 0,358, MedGemma 1.5 с 0,303 — содержит только модели визуализации. Ни одна общая мультимодальная модель не фигурирует, а значит, вопрос «как бы Gemini 3.1 Pro показал себя на CT-RATE» даже не ставился, не говоря уже о том, чтобы на него ответили.

Проблема уровня предварительного просмотра, сформулированная корректно
Это та часть сравнения, которая не имеет никакого отношения к КТ и целиком касается организации любой клинической работы.
Уровень ошибок 93,93% — это не незаметная деградация. Это маршрут, на котором подавляющее большинство вызовов завершается неудачно. Естественная реакция — объявить модель непригодной для использования, и эта реакция ошибочна по двум причинам. Во-первых, частота ошибок, измеренная на preview-эндпоинте, отражает ёмкость, квоты и региональную маршрутизацию, а не способности модели. Уровни preview у Google, как известно, выделяются для оценки, а не для продакшена, а слаг с именем preview — это слаг, который могут ограничить без предупреждения. Во-вторых, это измерение — снимок одного маршрута в один момент времени. Оно изменится. Не изменится урок: зависимость от preview-маршрута — это зависимость от решения о ёмкости, которое принимает кто-то другой.
Меры по смягчению прозаичны, и именно они — вся причина, по которой маршрутизация существует как дисциплина, а не как удобство.
• Никогда не зашивайте slug предварительного просмотра в продакшен-путь — вынесите эту возможность за интерфейс, чтобы стоящую за ним модель можно было заменить без деплоя
• Повторяйте попытку и переключайтесь на другого провайдера или другую модель — для задачи пакетного извлечения уровень сбоев в 94% переживаем, если сбои перенаправляются в другое место, и фатален, если нет
• Измеряйте собственную частоту ошибок, а не наследуйте чужую — показатель 93,93% — это цифра из нашего каталога для одного маршрута, а ваш будет зависеть от вашего региона, объёма и характера рабочей нагрузки
• Держите вторую модель наготове для всего, что связано с клиническими сроками — режим отказа, от которого вы защищаетесь, — это не плохой ответ, а отсутствие ответа
Та же дисциплина применяется в обратном направлении на стороне CT, где маршрута нет вообще. У самостоятельно развёрнутой модели нет частоты ошибок провайдера; у неё есть частота аппаратных ошибок, бремя обслуживания и потолок ёмкости, устанавливаемый тем, сколько GPU вы купили. Режим отказа — это очередь, а средство смягчения — планирование, а не переключение при отказе. Другая проблема, то же правило: знайте, от какого числа вы на самом деле зависите.
Где длинный контекст действительно помогает, а где — нет
Окно Gemini 3.1 Pro размером 1 048 576 токенов и показатель召回 в длинном контексте в 82 балла — это реальные преимущества, которые стоит использовать осознанно, а не случайно.
В программе КТ они окупаются не в самом сканировании. А во всём, что его окружает. Один проход извлечения по длинной операционной записи и связанным с ней отчётам, при котором весь документ удерживается в контексте, чтобы поля были согласованы между собой. Сводка по когорте, которая должна удерживать сотни историй пациентов одновременно, чтобы выявить сквозную закономерность. Задача конвертации, в которой схема, сотня примеров записей и журнал ошибок должны быть видны в одном и том же вызове. Это задачи, в которых длинное окно меняет сам ответ, а не только удобство.
Место, где это не помогает, — само сканирование, и причину стоит назвать точно, потому что это та ошибка, к которой подталкивает данное сопоставление. КТ грудной клетки, представленная так, как её представляет NV-Reason-CT, обходится в 13 824 токена. Gemini 3.1 Pro мог бы вместить семьдесят таких исследований в своё окно ещё с запасом. Ограничение не в объёме места. Дело в том, что путь обработки изображений Gemini 3.1 Pro воспринимает изображение как картинку с пиксельным масштабом, поэтому исследование, представленное таким образом, уже потеряло расстояние между срезами и калибровку плотности ещё до генерации первого токена. Можно потратить миллион токенов на объём и всё равно не получить объём. Собственное сравнение из статьи делает цену этого наглядной: MedGemma 1.5 — 0,303 F1 при подаче до 85 аксиальных срезов против 0,614 у нативной волюметрической модели, а это разрыв примерно в два раза.
Где нам место, и то единственное, чего мы не скажем
Gemini 3.1 Pro предоставляется через OrcaRouter как google/gemini-3.1-pro-previewпо каталожной цене провайдера с нулевой наценкой, в рамках единого API, охватывающего более 200 моделей. Для модели, которая сейчас находится на уровне preview, такое сочетание полезнее, чем кажется. Нулевая наценка означает, что изменение тарифа вендором доходит до нас в тот же день, а не поглощается промежуточным слоем, удерживающим старую цифру. Автоматическое переключение при сбое означает, что маршрут, начавший давать сбои, не обрушивает вместе с собой весь батч — что, учитывая зафиксированный уровень ошибок в девяносто с лишним процентов на одном из путей, отнюдь не гипотетическая ситуация. А DSL маршрутизации для отправки отдельных запросов той модели, которая должна с ними справляться, позволяет поручить работу с длинным контекстом одной модели, а дешёвую массовую работу — другой, не поддерживая две интеграции.
NV-Reason-CT нет на нашей платформе. Как и ни одной модели NVIDIA. Это веса, которые вы скачиваете и запускаете самостоятельно, и честная формулировка такова: две половины этой архитектуры находятся в совершенно разных местах: одна — за API с тарифной сеткой и риском предварительной версии, другая — на вашем собственном оборудовании с лицензией OpenMDW-1.1 и показателем пропускной способности, который вам придётся получить самостоятельно.


Решение, которое выживает при столкновении с продакшеном
Если ваша задача — понимание текста, аудио, видео или документов на длинном контексте, то Gemini 3.1 Pro независимо оценён как лидер в своей области по знаниям и полноте воспроизведения, и единственное, что стоит между ним и производственным конвейером, — это надёжность маршрутизации; а это решаемая инженерная проблема, а не проблема модели. Поставьте его за слой отказоустойчивого переключения, не зашивайте preview slug в код и измеряйте собственную частоту ошибок, а не доверяйте чужой, включая нашу.
Если ваша задача — КТ-объём грудной клетки или брюшной полости, то в этом сравнении есть ровно одна открытая модель, способная с ней справиться; это не та, у которой окно в миллион токенов, и число, которое должно определять ваше планирование, — не её F1-оценка. Это задержка на одно исследование, которую никто не публиковал. Измерьте её, прежде чем обещать кому-либо показатель пропускной способности.
Это сравнение стоит провести, потому что оно разграничивает две вещи, которые постоянно смешивают: широту входных данных и глубину представления. У Gemini 3.1 Pro самая широкая входная поверхность из всего, что кто-либо выпускал, и лучшее в этом наборе восстановление длинного контекста, и при этом он всё равно не может прочитать КТ-исследование как КТ-исследование. NV-Reason-CT умеет читать его — и больше ничего. Конвейеру нужно и то и другое, нужно, чтобы они работали на разной инфраструктуре, и нужно знать, какое из двух чисел с каждой стороны — то, которое поднимет тебя в три часа ночи.
