Сгенерированная hero-карточка с заголовком «NV-Reason-CT vs Kimi K3» и подзаголовком «210 загрузок и 588 миллионов токенов». Внизу расположены три чипа: «210 загрузок с HF против 587,8 млн токенов / 7 дней», «0,21 % измеренной ошибки в нашей сети» и «Один том против 1 048 576 токенов». Логотип OrcaRouter скомпонован в правом нижнем углу.
Guides & Insights

NV-Reason-CT против Kimi K3: 210 загрузок и 588 миллионов токенов

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Одну из этих моделей скачали с Hugging Face 210 раз. Другая за последние семь дней пропустила через нашу собственную песочницу 588 миллионов токенов. Обе — с открытыми весами, обе доступны для скачивания прямо сейчас, и разрыв между этими двумя числами — самое полезное в этом сравнении. NV-Reason-CT — это 3D-мультимодальная модель NVIDIA на 4,69 млрд параметров для КТ грудной клетки и брюшной полости, опубликованная на Hugging Face 8 сентября 2026 года без каких-либо анонсов. Kimi K3 — это флагманская модель MoonshotAI с контекстом 1 048 576 токенов, выпущенная 15 июля 2026 года и сейчас одна из самых загруженных моделей в нашей сети. Обе они «открытые» в том смысле, который важен для закупочной формы. Но открыты они совсем не одинаково.

Два значения фразы «вы можете скачать это».

Начните с того, что на самом деле попадает на ваш диск при каждой загрузке, потому что именно здесь большинство сравнений моделей с открытыми весами теряет строгость.

NV-Reason-CT даёт вам model.safetensors примерно на 10,6 ГБ в BF16, плюс model.py и объёмный processor.py — 26 КБ пользовательского кода обработки, который реализует кроппинг с учётом анатомии, 2-мм ресемплинг и 3D-патчификацию. Вы загружаете его с trust_remote_code=True, а значит, вы исполняете код репозитория NVIDIA внутри своего процесса. Для инференса нужен PyTorch с CUDA, и в карточке перечислены Ampere, Hopper и Lovelace, протестировано на H100 и L40S. Вход — один том NIfTI за раз. Не опубликовано никакой истории о батчинге, нет данных о пропускной способности, и в репозитории нет конфигурации сервинга, кроме inference.py в качестве примера.

Kimi K3 — это универсальная модель рассуждений с контекстным окном на 1 048 576 токенов, вводом текста и изображений, нативным вызовом инструментов, структурированными выходными данными и настраиваемой интенсивностью рассуждений. Это модель, к которой вы обратились бы, чтобы прочитать сотню клинических рекомендаций в одном запросе или отчеты отдела за десятилетие. Ее оценка воспроизведения в длинном контексте от Artificial Analysis составляет 88,7 — самая высокая среди моделей этой серии и на целых 8,4 балла выше 80,3 у Grok 4.6.

Говоря прямо: NV-Reason-CT — это специализированный чекпойнт с узкой входной поверхностью и кастомным кодом, которому вам нужно доверять и который нужно поддерживать. Kimi K3 — это универсальная модель с широкой входной поверхностью, которая ведёт себя как инфраструктура. Обе доступны для скачивания. Только одну из них можно подключить и использовать как есть.

Доказательства КТ, в полном объёме, и они коротки

Всё, что публично известно о качестве NV-Reason-CT, основывается на единственной таблице в его собственной карточке модели: задача классификации CT-RATE по 18 меткам при фиксированном едином пороге, прямое Yes/No-промптирование, без классификационной головы, без адаптации под конкретную задачу. Macro-F1 0.614, Macro-AUROC 0.871.

Строки сравнения — это VoxelFM с 0,581/0,870, Pillar-0 с 0,544/0,861, ClinFusion-8B с 0,442, CT-CLIP с 0,398/0,733, Merlin с 0,358/0,662 и MedGemma 1.5 с 0,303. Каждое из этих значений — заявленное производителем число из карточки NVIDIA, и ни одно из них пока не было независимо воспроизведено — статье всего два дня.

То, что устанавливает таблица, узко и заслуживает точной формулировки: генеративная 3D-модель без специализированной под задачу головы превосходит базовые модели 3D контрастивного предобучения и передовую модель, работающую со срезами, в задаче классификации КТ по 18 меткам. Чего она не устанавливает — так это ничего об общих рассуждениях, ничего о модальностях, кроме КТ грудной клетки и брюшной полости, и ничего о преимуществе по AUROC — 0,871 против 0,870 — это ничья, прикрытая десятичной запятой.

Цифры Kimi K3 и оговорка по таблице открытых весов

Artificial Analysis оценивает Kimi K3 по индексу интеллекта в 43,6, что ставит его на 19-е место из 145 моделей в этом рейтинге согласно снимку ранжирования в нашем API моделей. Его результат по GPQA Diamond — 93,5, по Humanity's Last Exam — 46,9, по SciCode — 59,5, по Terminal-Bench 2.1 — 85,0, по AA Coding — 76,2 на 9-м месте, а по 𝜏²-banking — 46,0.

Одно утверждение о ранжировании требует осторожности, потому что в нём легко ошибиться, и такие ошибки уже случались. AA Intelligence Index у Kimi K3, равный 44, занимает третье место среди моделей с открытыми весами в таблице открытых весов, уступая MiMo-V2.6-Pro с 46 и GLM-5.3 с 45. Он не является лидером в этой таблице и не соревнуется в той же таблице, что Grok 4.6 — Artificial Analysis относит Grok 4.6 к проприетарным моделям, поэтому его 44 относится к общему рейтингу, а не к рейтингу открытых весов. Эти два индекса выглядят одинаковыми, но это не так.

Что оператор на самом деле видит

Вот откуда берётся число 588 миллионов, и это стоит разъяснить подробно, потому что это единственное доказательство в этой статье, которое принадлежит нам, а не чьему-либо маркетингу.

За последние семь дней через тестовую среду OrcaRouter прошло 587,8 млн токенов Kimi K3. Медианное время до первого токена составило 7,8 секунды, модель выдавала 42,9 выходных токенов в секунду, а её частота ошибок за этот период была равна 0,21% — одна ошибка примерно на 480 запросов. Именно эту измеренную частоту ошибок нельзя получить из карточки модели, и именно это число решает, можно ли безопасно использовать модель для пакетной обработки.

Для NV-Reason-CT эквивалента нет, потому что это нигде не размещённый эндпоинт — это контрольная точка, которую вы запускаете сами. У неё нет p50, нет частоты ошибок, нет времени безотказной работы, и нет никого, на кого можно переключиться при сбое. Это не упрёк; это структурный факт о self-hosting, и именно поэтому исследовательская группа может внедрить NV-Reason-CT во вторник, а продакшн-команда, как правило, не может.

Если вы запускаете обе половины этой схемы — Kimi K3 в качестве хостируемого слоя общего назначения и NV-Reason-CT на собственной GPU-машине, — то именно маршрутизация обеспечивает устойчивость хостируемой половины. Kimi K3 обслуживается по собственной прейскурантной цене Moonshot — $3.00 за миллион входных токенов и $15.00 за миллион выходных без какой-либо наценки, тариф за чтение из кэша составляет $0.30 за миллион, то есть десятую часть входного, а поскольку цена передаётся без изменений, снижение цены поставщиком отразится в вашем счёте в тот же день. Автоматическое переключение при сбое между провайдерами — это то, что не даёт пакетному заданию умереть, когда один из вышестоящих эндпоинтов начинает сбоить; а при частоте ошибок 0.21% сбои настолько редки, что о них легко забыть — до тех пор, пока они не напомнят о себе.

Формы затрат не похожи друг на друга

• Цена — капитальные затраты на GPU NV-Reason-CT плюс ваш собственный стек для обслуживания против Kimi K3: $3,00 / $15,00 за миллион, $0,30 за чтение из кэша

• Минимальные жизнеспособные затраты — NV-Reason-CT: один GPU поколения Ampere или новее, удерживаемый бессрочно, против Kimi K3: один запрос

• Контекст — NV-Reason-CT: один объём, фиксированные 13 824 токена, против Kimi K3 — 1 048 576 токенов

• Предельная стоимость тысячного запроса — у NV-Reason-CT она фактически нулевая после оплаты GPU, в отличие от Kimi K3, у которой она линейно зависит от токенов

• Где это сломается в первую очередь — неподтверждённая пропускная способность NV-Reason-CT и отсутствие ясной стратегии батчинга против стоимости длинного контекста Kimi K3 при 1 млн токенов на запрос

• Модальности — NV-Reason-CT 3D NIfTI, грудная клетка или брюшная полость против текста и изображений Kimi K3, что угодно

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

Экономика меняется на противоположную в зависимости от объёма. Kimi K3 ничего не стоит на старте и масштабируется линейно. NV-Reason-CT требует GPU для запуска, а затем масштабируется почти горизонтально — поэтому 210 загрузок не является сигналом провала. Это правильное число для чекпоинта, чья аудитория — организации, которые уже владеют оборудованием и которые вообще никогда не появятся в статистике пропускной способности по токенам.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

Какой из них вы на самом деле выбираете?

Если задача — прочитать КТ-объём и сформировать структурированное заключение с цепочкой рассуждений, Kimi K3 не способен на это, а NV-Reason-CT способен. Не «справляется хуже» — не способен, потому что в нём нигде нет объёмного энкодера, а предварительное преобразование скана в изображения отбрасывает пространственные связи, которые и призван сохранять 3D-путь.

Если задача — прочитать 400 страниц направлений, сопоставить их с документом протокола и выдать структурированный вывод, то NV-Reason-CT не рассматривается, а Kimi K3 — один из лучших доступных вариантов с измеренной частотой ошибок менее четверти процента в нашей сети.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

Настоящее решение — не между этими двумя. Оно в том, является ли ваша проблема проблемой объёма или проблемой текста, а разрыв между 210 и 588 миллионами — это просто то, как это различие выглядит со стороны. Одна модель — это статья с весами. Другая — часть инфраструктуры. Обе стоят того, чтобы их иметь; ни одна не заменяет другую.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно