
NV-Reason-CT против Kimi K3: 210 загрузок и 588 миллионов токенов
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 45 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Одну из этих моделей скачали с Hugging Face 210 раз. Другая за последние семь дней пропустила через нашу собственную песочницу 588 миллионов токенов. Обе — с открытыми весами, обе доступны для скачивания прямо сейчас, и разрыв между этими двумя числами — самое полезное в этом сравнении. NV-Reason-CT — это 3D-мультимодальная модель NVIDIA на 4,69 млрд параметров для КТ грудной клетки и брюшной полости, опубликованная на Hugging Face 8 сентября 2026 года без каких-либо анонсов. Kimi K3 — это флагманская модель MoonshotAI с контекстом 1 048 576 токенов, выпущенная 15 июля 2026 года и сейчас одна из самых загруженных моделей в нашей сети. Обе они «открытые» в том смысле, который важен для закупочной формы. Но открыты они совсем не одинаково.
Два значения фразы «вы можете скачать это».
Начните с того, что на самом деле попадает на ваш диск при каждой загрузке, потому что именно здесь большинство сравнений моделей с открытыми весами теряет строгость.
NV-Reason-CT даёт вам model.safetensors примерно на 10,6 ГБ в BF16, плюс model.py и объёмный processor.py — 26 КБ пользовательского кода обработки, который реализует кроппинг с учётом анатомии, 2-мм ресемплинг и 3D-патчификацию. Вы загружаете его с trust_remote_code=True, а значит, вы исполняете код репозитория NVIDIA внутри своего процесса. Для инференса нужен PyTorch с CUDA, и в карточке перечислены Ampere, Hopper и Lovelace, протестировано на H100 и L40S. Вход — один том NIfTI за раз. Не опубликовано никакой истории о батчинге, нет данных о пропускной способности, и в репозитории нет конфигурации сервинга, кроме inference.py в качестве примера.
Kimi K3 — это универсальная модель рассуждений с контекстным окном на 1 048 576 токенов, вводом текста и изображений, нативным вызовом инструментов, структурированными выходными данными и настраиваемой интенсивностью рассуждений. Это модель, к которой вы обратились бы, чтобы прочитать сотню клинических рекомендаций в одном запросе или отчеты отдела за десятилетие. Ее оценка воспроизведения в длинном контексте от Artificial Analysis составляет 88,7 — самая высокая среди моделей этой серии и на целых 8,4 балла выше 80,3 у Grok 4.6.
Говоря прямо: NV-Reason-CT — это специализированный чекпойнт с узкой входной поверхностью и кастомным кодом, которому вам нужно доверять и который нужно поддерживать. Kimi K3 — это универсальная модель с широкой входной поверхностью, которая ведёт себя как инфраструктура. Обе доступны для скачивания. Только одну из них можно подключить и использовать как есть.
Доказательства КТ, в полном объёме, и они коротки
Всё, что публично известно о качестве NV-Reason-CT, основывается на единственной таблице в его собственной карточке модели: задача классификации CT-RATE по 18 меткам при фиксированном едином пороге, прямое Yes/No-промптирование, без классификационной головы, без адаптации под конкретную задачу. Macro-F1 0.614, Macro-AUROC 0.871.
Строки сравнения — это VoxelFM с 0,581/0,870, Pillar-0 с 0,544/0,861, ClinFusion-8B с 0,442, CT-CLIP с 0,398/0,733, Merlin с 0,358/0,662 и MedGemma 1.5 с 0,303. Каждое из этих значений — заявленное производителем число из карточки NVIDIA, и ни одно из них пока не было независимо воспроизведено — статье всего два дня.
То, что устанавливает таблица, узко и заслуживает точной формулировки: генеративная 3D-модель без специализированной под задачу головы превосходит базовые модели 3D контрастивного предобучения и передовую модель, работающую со срезами, в задаче классификации КТ по 18 меткам. Чего она не устанавливает — так это ничего об общих рассуждениях, ничего о модальностях, кроме КТ грудной клетки и брюшной полости, и ничего о преимуществе по AUROC — 0,871 против 0,870 — это ничья, прикрытая десятичной запятой.
Цифры Kimi K3 и оговорка по таблице открытых весов
Artificial Analysis оценивает Kimi K3 по индексу интеллекта в 43,6, что ставит его на 19-е место из 145 моделей в этом рейтинге согласно снимку ранжирования в нашем API моделей. Его результат по GPQA Diamond — 93,5, по Humanity's Last Exam — 46,9, по SciCode — 59,5, по Terminal-Bench 2.1 — 85,0, по AA Coding — 76,2 на 9-м месте, а по 𝜏²-banking — 46,0.
Одно утверждение о ранжировании требует осторожности, потому что в нём легко ошибиться, и такие ошибки уже случались. AA Intelligence Index у Kimi K3, равный 44, занимает третье место среди моделей с открытыми весами в таблице открытых весов, уступая MiMo-V2.6-Pro с 46 и GLM-5.3 с 45. Он не является лидером в этой таблице и не соревнуется в той же таблице, что Grok 4.6 — Artificial Analysis относит Grok 4.6 к проприетарным моделям, поэтому его 44 относится к общему рейтингу, а не к рейтингу открытых весов. Эти два индекса выглядят одинаковыми, но это не так.
Что оператор на самом деле видит
Вот откуда берётся число 588 миллионов, и это стоит разъяснить подробно, потому что это единственное доказательство в этой статье, которое принадлежит нам, а не чьему-либо маркетингу.
За последние семь дней через тестовую среду OrcaRouter прошло 587,8 млн токенов Kimi K3. Медианное время до первого токена составило 7,8 секунды, модель выдавала 42,9 выходных токенов в секунду, а её частота ошибок за этот период была равна 0,21% — одна ошибка примерно на 480 запросов. Именно эту измеренную частоту ошибок нельзя получить из карточки модели, и именно это число решает, можно ли безопасно использовать модель для пакетной обработки.
Для NV-Reason-CT эквивалента нет, потому что это нигде не размещённый эндпоинт — это контрольная точка, которую вы запускаете сами. У неё нет p50, нет частоты ошибок, нет времени безотказной работы, и нет никого, на кого можно переключиться при сбое. Это не упрёк; это структурный факт о self-hosting, и именно поэтому исследовательская группа может внедрить NV-Reason-CT во вторник, а продакшн-команда, как правило, не может.
Если вы запускаете обе половины этой схемы — Kimi K3 в качестве хостируемого слоя общего назначения и NV-Reason-CT на собственной GPU-машине, — то именно маршрутизация обеспечивает устойчивость хостируемой половины. Kimi K3 обслуживается по собственной прейскурантной цене Moonshot — $3.00 за миллион входных токенов и $15.00 за миллион выходных без какой-либо наценки, тариф за чтение из кэша составляет $0.30 за миллион, то есть десятую часть входного, а поскольку цена передаётся без изменений, снижение цены поставщиком отразится в вашем счёте в тот же день. Автоматическое переключение при сбое между провайдерами — это то, что не даёт пакетному заданию умереть, когда один из вышестоящих эндпоинтов начинает сбоить; а при частоте ошибок 0.21% сбои настолько редки, что о них легко забыть — до тех пор, пока они не напомнят о себе.
Формы затрат не похожи друг на друга
• Цена — капитальные затраты на GPU NV-Reason-CT плюс ваш собственный стек для обслуживания против Kimi K3: $3,00 / $15,00 за миллион, $0,30 за чтение из кэша
• Минимальные жизнеспособные затраты — NV-Reason-CT: один GPU поколения Ampere или новее, удерживаемый бессрочно, против Kimi K3: один запрос
• Контекст — NV-Reason-CT: один объём, фиксированные 13 824 токена, против Kimi K3 — 1 048 576 токенов
• Предельная стоимость тысячного запроса — у NV-Reason-CT она фактически нулевая после оплаты GPU, в отличие от Kimi K3, у которой она линейно зависит от токенов
• Где это сломается в первую очередь — неподтверждённая пропускная способность NV-Reason-CT и отсутствие ясной стратегии батчинга против стоимости длинного контекста Kimi K3 при 1 млн токенов на запрос
• Модальности — NV-Reason-CT 3D NIfTI, грудная клетка или брюшная полость против текста и изображений Kimi K3, что угодно

Экономика меняется на противоположную в зависимости от объёма. Kimi K3 ничего не стоит на старте и масштабируется линейно. NV-Reason-CT требует GPU для запуска, а затем масштабируется почти горизонтально — поэтому 210 загрузок не является сигналом провала. Это правильное число для чекпоинта, чья аудитория — организации, которые уже владеют оборудованием и которые вообще никогда не появятся в статистике пропускной способности по токенам.

Какой из них вы на самом деле выбираете?
Если задача — прочитать КТ-объём и сформировать структурированное заключение с цепочкой рассуждений, Kimi K3 не способен на это, а NV-Reason-CT способен. Не «справляется хуже» — не способен, потому что в нём нигде нет объёмного энкодера, а предварительное преобразование скана в изображения отбрасывает пространственные связи, которые и призван сохранять 3D-путь.
Если задача — прочитать 400 страниц направлений, сопоставить их с документом протокола и выдать структурированный вывод, то NV-Reason-CT не рассматривается, а Kimi K3 — один из лучших доступных вариантов с измеренной частотой ошибок менее четверти процента в нашей сети.

Настоящее решение — не между этими двумя. Оно в том, является ли ваша проблема проблемой объёма или проблемой текста, а разрыв между 210 и 588 миллионами — это просто то, как это различие выглядит со стороны. Одна модель — это статья с весами. Другая — часть инфраструктуры. Обе стоят того, чтобы их иметь; ни одна не заменяет другую.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
