
NV-Reason-CT против DeepSeek V4 Pro: стоимость чтения скана и когда запускать пакетную обработку
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 506 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 183 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Вот операционный факт, от которого зависит больше бюджетов клинических пайплайнов, чем от любого бенчмарка: DeepSeek V4 Pro стоит $0,66 за миллион входных токенов и $1,98 за миллион выходных токенов, причём эти тарифы удваиваются в течение двух окон каждый день — с 01:00 до 04:00 и с 06:00 до 10:00 UTC. Пакетная работа, выполняемая вне этих окон, обходится вдвое дешевле, чем внутри них. Тем временем NV-Reason-CT, система рассуждений для 3D-КТ от NVIDIA с 4,69 млрд параметров, вообще не имеет прайс-листа — это набор весов, который вы скачиваете и запускаете, и нет опубликованного показателя пропускной способности для одного исследования на 13 824 токена. Одну из этих моделей вы планируете. Другую нужно измерить, прежде чем закладывать её в бюджет.
Эта асимметрия — удобный вход в это сравнение, потому что две модели занимают противоположные концы пайплайна и с финансовой точки зрения терпят неудачу противоположными способами. NV-Reason-CT — инструмент с фиксированными затратами: предельное исследование почти бесплатно после покупки оборудования, но решение о покупке оборудования крупное, а латентность на одно исследование не документирована. DeepSeek V4 Pro — движок с переменными затратами: ничего покупать не нужно, всё измеряется, и у счётчика есть расписание, которое можно прочитать по календарю.
Что представляет собой каждый из них, по одной строке на каждый
• Задача — NV-Reason-CT читает КТ-объём грудной клетки или брюшной полости и выдаёт структурированные результаты; DeepSeek V4 Pro читает и пишет текст
• Архитектура — 3D-трансформер компьютерного зрения под названием Primus, инициализированный из COLIPRI, с языковым бэкбоном Qwen3.5-4B и 3D-многоосевым ротационным позиционным кодированием, при 4,69 млрд параметров, из которых 4,35 млрд активны; в сравнении со смесью экспертов на 1,6 трлн параметров с 49 млрд активных на токен
• Входные данные — одноканальные NIfTI-тома (.nii, .nii.gz) в единицах Хаунсфилда, с ориентацией LPS, ресемплированные до изотропного вокселя 2 мм и обрезанные по анатомии; в сопоставлении с текстом
• Контекст — один объём превращается в 13 824 визуальных токена в сетке 24 x 24 x 24, без пространственного даунсэмплинга и без слоя слияния; по сравнению с 1 048 576 входными и 384 000 выходными токенами
• Поддерживаемые анатомии — грудная клетка и брюшная полость, и ничего больше; против всего, что может описать текст
• Цена — нет цены по прайс-листу, развёртывание на собственных серверах, нет опубликованной пропускной способности в расчёте на одно исследование; по сравнению с $0,66 / $1,98 за миллион токенов, с удвоением в двух указанных выше окнах UTC, при чтении из кэша по $0,022
• Измеренная задержка — не публикуется; по сравнению с медианным временем до первого токена 3 483 миллисекунды при 96,01 выходного токена в секунду, с частотой ошибок 0,75%
Две строки там заслуживают большего, чем по одной строке. Строка контекста — очевидная из них (миллион токенов против 13 824), но эти единицы несопоставимы, и было бы ошибкой читать это как разрыв в возможностях в любую сторону. 13 824 токена — это то, сколько нужно, чтобы достоверно представить одно КТ-исследование. Миллион токенов — это то, сколько окружающего текста вы можете удержать. Первое число — утверждение о разрешении; второе — утверждение о памяти.
Строку о задержке обычно и пропускают. Медианные 3,48 секунды до первого токена и 96 токенов в секунду у DeepSeek V4 Pro — это измеренные и опубликованные цифры, и они позволяют ещё на бумаге оценить объём текстовой задачи. Отсутствие у NV-Reason-CT какой-либо эквивалентной цифры — не критика модели; это причина, по которой стоимость CT-пайплайна нельзя рассчитать, пока кто-нибудь его не запустит. Модель на 4,69 млрд параметров при 13 824 визуальных токенах — это немалое вычисление, и пока вы не замерите её на собственном оборудовании, вы будете гадать.
Чтение двух записей бенчмарка без самообмана
Рекорд DeepSeek V4 Pro — это смесь независимых измерений и отчётности производителя, и эта смесь поучительна, потому что содержит одно число, которое выглядит тревожно, но таковым не является.
• Artificial Analysis Intelligence Index — 36, что соответствует 72,4-му процентилю измеренных моделей
• GPQA Diamond — 92,8, что близко к вершине в этой области
• Humanity's Last Exam — 41, и 41 по MMLU-Pro, 62,51 по индексу математики
• τ²-Bench — 96,20, при этом IFBench — 76,46, а tau_banking — 39,59
• Воспроизведение в длинном контексте — 80.33
• SciCode и Terminal-Bench — 51 и 78.65 во второй версии Terminal-Bench
Составной индекс 36 рядом с результатом 92,8 по GPQA Diamond выглядит как противоречие, пока не поймёшь, что такое индекс. Это совокупный показатель по множеству оценок, и модель, которая превосходна в нескольких из них и лишь удовлетворительна в остальных, окажется в середине списка по сумме, при этом возглавив отдельные рейтинги. Тот, кто приводит только 36, чтобы утверждать, что DeepSeek V4 Pro относится к среднему уровню, приводит среднее так, будто это максимум. Тот, кто приводит только 92,8, чтобы утверждать, что она лидирует в этой области, приводит максимум так, будто это среднее. Оба числа — от Artificial Analysis, и оба верны.
В истории NV-Reason-CT нет такой смеси, и в этом заключается честная проблема с ним. Его показатели по CT-RATE — 0,614 F1 и 0,871 AUROC по восемнадцати меткам, при использовании фиксированного единообразного порога и прямого запроса с ответом «да/нет», без классификационной головы и без адаптации под конкретную задачу — взяты из собственной статьи NVIDIA и больше ниоткуда. Набор для сравнения в той статье (VoxelFM — 0,581, Pillar-0 — 0,544, ClinFusion-8B — 0,442, CT-CLIP — 0,398, Merlin — 0,358, MedGemma 1.5 — 0,303) состоит исключительно из других моделей обработки изображений. В нём нет ни одной универсальной текстовой модели, и ни одна третья сторона не воспроизвела ни одну из этих цифр.

Вопрос планирования, разобранный до конца
Повременная тарификация DeepSeek V4 Pro — это самое практически значимое с точки зрения эксплуатации из всего, что касается обеих моделей, поэтому она заслуживает конкретного пошагового разбора.
Реалистичная текстовая нагрузка для программы по КТ не выглядит эффектно. Это извлечение структурированных полей из корпуса исторических отчётов, чтобы получить метки для обучения, преобразование деревьев каталогов DICOM в NIfTI в больших масштабах, написание и переписывание системы оценки, нормализация единиц измерения и терминологии по четырём наборам данных и составление сводок по когортам. Назовём это сотней миллионов входных токенов и десятью миллионами выходных токенов для программы среднего размера — намеренно округлённая цифра, заменяющая «много текстовой работы».
• В пределах удвоенного окна — $1,32 и $3,96 за миллион, то есть $132 плюс $39,60 на таких объёмах
• Вне этих диапазонов — $0,66 и $1,98 за миллион, то есть $66 плюс $19,80
• Разница — примерно $86, или 49% от счёта за непиковое потребление, за перенос задачи, которую по своей природе можно обрабатывать пакетно
• Чтение из кэша — $0,022 за миллион, что составляет одну шестидесятую от ставки за ввод, поэтому любой префикс промпта, который вы повторно используете по всему корпусу, почти бесплатен
Это не погрешность округления, и это доступно, потому что работа асинхронна. Извлечение отчётов не обязательно должно выполняться в 14:00. Для задачи извлечения DICOM время суток не имеет никакого значения. Ценообразование — прямое приглашение к планированию, а конвейер, который его игнорирует, означает 49% надбавки за то, что он работал, когда захотел. Чтения из кэша важны в таком случае: системный промпт или фиксированная схема извлечения, переиспользуемая в тысячах отчётов, составляет одну шестидесятую от ставки за входные данные.
NV-Reason-CT не имеет эквивалентного рычага, потому что у него нет счётчика. Стоимость чтения скана равна стоимости часа работы вашего GPU, делённой на количество сканов в час, которые вы можете через него пропустить, и второе число — это то, которое никто не публиковал. Если одно исследование занимает две секунды, один L40S с запасом справляется с крупной программой. Если двадцать — арифметика оборудования полностью меняется. NVIDIA тестировала на H100 и L40S, что говорит о классе карты, а не о скорости.
Ловушка в предположении, что их можно заменить
Ошибка, к которой располагает это сопоставление, тоньше обычной категориальной ошибки, потому что есть её версия, которая выглядит разумно на слайде.
DeepSeek V4 Pro вмещает 1 048 576 токенов и выдаёт до 384 000. Объём КТ, по оценке модели, которая читает его должным образом, — всего 13 824 токена. Так что текстовая модель с окном в миллион токенов может вместить при таком количестве токенов порядка семидесяти с лишним КТ-исследований. Арифметика верна, а вывод — что можно подать данные КТ текстовой модели и избавить себя от инфраструктуры визуализации — неверен по той самой причине, по которой эта цифра 13 824 вообще существует.
Это число — не сжатая сводка сканирования. Это само сканирование, с изотропным разрешением 2 мм в кубе размером 384 миллиметра, разрезанное на 8 x 8 x 8 фрагментов и переданное языковой модели без пространственного даунсэмплинга и без слоя слияния. Количество токенов велико именно потому, что ничего не выбросили: межсрезовое расстояние, которое делает узел измеримым, значения плотности, которые делают текстуру порогом, а не прилагательным. Текстовая модель не может воспринимать эти токены как объёмы — как не может и документ. У неё есть бюджет. У неё нет интерфейса.
Внутреннее сравнение в самой статье позволяет выразить эту разницу числом. MedGemma 1.5, которой подают до 85 аксиальных срезов — максимум, который может разумно обеспечить двумерный или основанный на наборе срезов входной модуль, — набирает 0.303 F1 против 0.614 у нативной объёмной модели. Этот разрыв и есть ценность трёхмерного энкодера, и никакое расширение контекстного окна его не закрывает.
Обратная подстановка не работает по более простым причинам. NV-Reason-CT поддерживает грудную клетку и брюшную полость, принимает файл NIfTI, а не промпт, не поддерживает использование инструментов, а её карточка модели ограничивает её исследованиями и образованием и утверждает, что она не является медицинским изделием и что результаты могут быть неверными. Она не может извлекать поля из отчёта и не может написать скрипт, который строит ваш корпус.

Где мы вписываемся — и где мы сознательно не вписываемся
DeepSeek V4 Pro предоставляется через OrcaRouter как deepseek/deepseek-v4-pro, по прайсовой ставке провайдера без наценки, в рамках единого API, охватывающего более 200 моделей. Сквозная передача тарифов важна здесь больше обычного для модели с ценой, зависящей от времени суток: когда поставщик меняет ставку или временное окно, ставка на нашей стороне меняется в тот же день, потому что между нами нет слоя наценки, удерживающего старую цифру. Автоматическое переключение при сбое покрывает случай, когда провайдер деградирует посреди пакета, что для долгой задачи извлечения без присмотра — именно тот сценарий отказа, который реально стоит вам целой ночи, а DSL маршрутизации позволяет отправлять отдельные запросы той модели, которая должна их обрабатывать, вместо того чтобы прогонять всё через одну конечную точку.
NV-Reason-CT нет на нашей платформе. Моделей NVIDIA там тоже нет. Часть этой архитектуры, отвечающая за КТ, — это ваше собственное оборудование с вашими собственными загруженными весами, и мы не собираемся писать предложение, которое позволило бы читателю подумать иначе. Учитывая, что входные данные — это объёмные данные, полученные от пациентов, а лицензия — OpenMDW-1.1 без какого-либо привязанного хостингового сервиса, локальное выполнение — это то место, где такая модель должна работать, в любом случае.
Что на самом деле говорит вам это сочетание
Эти две модели не конкурируют, и смысл их сравнения в том, что они дают сбои по-разному. NV-Reason-CT даёт вам возможность, которой больше ни у кого нет в открытом доступе, — нативное трёхмерное рассуждение по КТ при полном разрешении исследования — и требует принять неучтённую в бюджете стоимость за одно исследование, непубликованную пропускную способность и лицензию, запрещающую клиническое применение. DeepSeek V4 Pro даёт вам движок с тарификацией по потреблению, опубликованной задержкой, опубликованной частотой ошибок, независимыми измерениями и ценой, которую можно снизить вдвое, просто взглянув на часы, но при этом он вообще не видит снимков.
Если вы создаёте эту штуку сами, а не покупаете, то форма, которая выживает при контакте, — скучная. Запускайте CT-чтение локально, планируйте бюджет на основе измерений, а не котировок, и приурочьте всё текстовое вокруг него к окну низкой нагрузки. Единственное расписание, которое никому не стоит копировать, — это то, которое выполняет извлечение ста миллионов токенов в 02:00 UTC, потому что именно тогда батч случайно оказался готов.

