
NV-Reason-CT vs GLM-5.2: Один из них устарел, и это не тот, о котором вы думаете
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 97 tok/s
- openaiНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- anthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- grokНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 182 tok/s
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
Более старая модель в этом сравнении — та, которую снимают с эксплуатации. GLM-5.2 была выпущена 16 июня 2026 года; NV-Reason-CT имеет активность в репозитории, датированную периодом со 2 по 25 сентября 2026 года. Можно было бы ожидать, что сентябрьская — это неопределённая величина, а июньская — устоявшийся выбор. Всё наоборот по той оси, которая важна для текстового конвейера: GLM-5.2 была вытеснена моделью GLM-5.3, вышедшей 18 августа 2026 года, и теперь несёт отметку об устаревании в независимом рейтинге, где публикуются её показатели. NV-Reason-CT, что бы там ни оставалось нерешённым, — это текущий релиз единственного, что она делает.
Итак, первое полезное предложение в этой статье — то, которое читатель, скорее всего, еще не знает: если вы сегодня начинаете сборку текста и по привычке тянетесь к GLM-5.2, остановитесь и сначала посмотрите на GLM-5.3. Он стоит $1.26 за миллион входных токенов и $3.96 за миллион выходных токенов против $1.40 и $4.40 у GLM-5.2 — он и новее, и дешевле — а его независимый индекс интеллекта составляет 44.8 против 33.7, что является шагом вверх по той же шкале, а не шагом в сторону. Это отдельное решение, не связанное ни с чем, что относится к CT, и его стоит принимать отдельно.
Две модели и два разных вида устаревания
Между старой моделью и моделью, которая была заменена, есть реальное различие, и это сопоставление делает его конкретным.
• Что делает — NV-Reason-CT считывает КТ-объём грудной или брюшной полости и выдаёт структурированные заключения по анатомическим областям; GLM-5.2 — это чисто текстовая языковая модель для рассуждений, работы с кодом и длинными документами
• Выпущено — артефакты NV-Reason-CT датируются периодом со 2 по 25 сентября 2026 года; GLM-5.2 — 16 июня 2026 года, а GLM-5.3 — 18 августа 2026 года
• Статус поколения — NV-Reason-CT — это версия 0.1, первоначальный выпуск, публично не анонсированный; GLM-5.2 — предыдущее поколение линейки выпускаемых продуктов
• Независимая оценка — независимых измерений NV-Reason-CT не существует; GLM-5.2 оценивается в 33,7 в Индексе интеллекта Artificial Analysis, с пометкой об устаревании, против 44,8 у GLM-5.3
• Лицензия и доступ — веса OpenMDW-1.1, которые вы скачиваете; в сравнении с моделью с открытыми весами, обслуживаемой по цене $1.40 и $4.40 за миллион токенов, с кэшированными чтениями по $0.26
• Контекст — 13 824 визуальных токенов на том без окна чата; в сравнении с 1 000 000 входных и 128 000 выходных токенов
• Заявленное использование — только для исследований и обучения, не является медицинским изделием; против развёртывания общего назначения
Слово «deprecated» здесь выполняет вполне конкретную функцию, и не стоит придавать ему лишний смысл. Пометка об устаревании в таблице лидеров означает, что оценщик перестал считать эту модель актуальной — обычно потому, что её место заняла следующая версия. Это не значит, что веса были отозваны, API отключён или модель перестала работать. Команды, чьи пайплайны настроены под GLM-5.2, не в беде. А значит это то, что её показатели — это снимок состояния до появления GLM-5.3, и смешивать их с текущими цифрами по другим моделям — всё равно что сравнивать июньское измерение с сентябрьской ситуацией.
Числа, которые есть у каждой стороны, и сколько они стоят
Послужной список GLM-5.2 необычно богат, и складывается он из двух источников, которые расходятся между собой поучительным образом.
Согласно собственной отчётности Z.ai, модель набирает 99,12 на τ²-Bench, 62,1 на SWE-bench Pro, 54,7 на Humanity's Last Exam с инструментами и лучший заявленный результат 82,7 на Terminal-Bench 2.1. Что касается независимых оценок, Artificial Analysis измеряет у той же модели 77,9 на Terminal-Bench 2.1, 33,7 в своём Intelligence Index, 89,5 на GPQA Diamond и 41,1 на Humanity's Last Exam. Есть и другие цифры от вендора — 99,2 на AIME 2026, 92,5 на HMMT February 2026, 91 на IMOAnswerBench, 74,4 на FrontierSWE, 63,7 на ProgramBench, 76,8 на MCP-Atlas, — и все они принадлежат Z.ai.
Два момента в этом списке заслуживают того, чтобы их назвать. Во-первых, разрыв в 4,8 пункта на Terminal-Bench 2.1 между лучшим заявленным вендором показателем 82,7 и независимым 77,9 — это не противоречие. Лучшие заявленные вендором цифры обычно представляют собой лучший результат из нескольких харнессов, а собственная цифра Z.ai по Terminus-2 для того же бенчмарка — 81, то есть независимое измерение укладывается в собственный диапазон вендора. Во-вторых, расхождение по Humanity's Last Exam больше: 41,1 при независимом измерении против заявленных вендором 40,5 без инструментов и 54,7 с ними, а значит, фигурирующие в заголовках 54,7 — это показатель с использованием инструментов, а 41,1 — «голый». Приводить 54,7 рядом с «голым» результатом другой модели было бы настоящей ошибкой.
У NV-Reason-CT в послужном списке нет такой структуры с двумя источниками, и именно в этом он слабее. Его результаты на CT-RATE — 0,614 по F1 и 0,871 по AUROC по восемнадцати меткам, при фиксированном едином пороге, прямом запросе с ответом «да/нет» и без головы классификации или адаптации под конкретную задачу — получены самой NVIDIA. Модели, с которыми его сравнивают в той статье (VoxelFM 0,581, Pillar-0 0,544, ClinFusion-8B 0,442, CT-CLIP 0,398, Merlin 0,358, MedGemma 1.5 0,303), — все являются моделями для анализа изображений. Ничего не было воспроизведено независимо, а модель доступна для скачивания уже несколько недель. Он также сообщает о вычисленном по отчётам macro-F1, равном 0,592, и о предварительном исследовании с участием экспертов-радиологов, связывающем ассистированный просмотр со снижением среднего заявленного времени интерпретации на 50%, которое сами авторы отмечают как исследование с критически малой выборкой.
Итак, сравнение происхождения данных говорит не в пользу более новой модели, и именно на этом стоит задержаться. GLM-5.2 — модель более старая, устаревшая, но её цифры заслуживают большего доверия, чем у NV-Reason-CT, потому что испытательный стенд прогонял кто-то со стороны, вне компании. Быть актуальным — не то же самое, что быть проверенным.

Почему устаревание значит больше, чем кажется
Есть конкретный сбой, который это сравнение призвано предотвратить, и он вовсе не связан с CT.
Команда, создающая конвейер обработки клинических текстов, ищет модель с открытыми весами для запуска на собственном оборудовании, потому что данные чувствительны. Они находят GLM-5.2 — с лицензией MIT, 743 миллиардами параметров, из которых примерно 40 миллиардов активны, — которая им подходит и имеет хорошо задокументированную историю бенчмарков. Они настраивают её под свои задачи. Шесть месяцев спустя они обнаруживают, что текущее поколение — GLM-5.3, что у неё контекст 1M при ограничении вывода 128K, что она дешевле — $1.26 и $3.96, — и что решение, которое, как они думали, они принимают — какую модель с открытыми весами выбрать в качестве стандарта, — на самом деле было решением о том, какое поколение, и они приняли его случайно.
Это дорогостоящая ошибка, которую можно обнаружить слишком поздно, и её можно избежать с помощью одной проверки. Конкретные рекомендации:
• Проверьте, относится ли модель, которую вы собираетесь сделать стандартом, к текущему поколению — маркер устаревания в таблице лидеров — самый быстрый сигнал, а собственный список моделей вендора — авторитетный источник
• Не смешивайте июньский срез с сентябрьскими показателями — индекс GLM-5.2, равный 33.7, был измерен ещё до появления GLM-5.3, и сопоставление его с индексом текущей модели сравнивает два разных момента в быстро меняющейся области
• Будьте внимательны с названием — позиция «GLM-5.3 Prime» — это тариф обслуживания, использующий те же веса примерно по двойной каталожной цене, а не отдельная модель. Прежде чем платить с наценкой, проверьте, какие веса стоят за любым SKU
• Относитесь к более низкой заявленной ставке как к вопросу, а не как к ответу — то, что GLM-5.3 дешевле своего предшественника, необычно, и это стоит проверить на собственной рабочей нагрузке, а не принимать на веру
Ничто из этого не делает GLM-5.2 плохим выбором. Модель на 743B с лицензией MIT по цене $1,40 и $4,40, под которую команда уже настроила свои решения, — это вполне разумно продолжать использовать, а модель середины поколения с устоявшейся репутацией иногда именно то, что нужно регламентированному рабочему процессу. Смысл в том, что это должно быть выбором, сделанным осознанно, а не значением по умолчанию, унаследованным из списка, актуального в июле.
Ловушка в сравнении текстовой модели с КТ-моделью
Причина, по которой это сопоставление вообще выглядит правдоподобным, заключается в том, что обе модели являются моделями с открытыми весами, выпущенными в 2026 году, и читатель, просматривающий каталог, видит две сопоставимые позиции. Они несопоставимы, и это несоответствие имеет конкретную форму.
GLM-5.2 вмещает 1 000 000 токенов. Один КТ-объём в NV-Reason-CT стоит 13 824 визуальных токена. По этой арифметике GLM-5.2 могла бы вместить семьдесят КТ-исследований и ещё имела бы запас, что подталкивает к выводу, будто текстовая модель с достаточно длинным контекстом делает модель визуализации избыточной. Этот вывод не следует, и причина в интерфейсе, а не в бюджете.
Эти 13 824 токена — не сводка. Это 384-миллиметровый куб, пересэмплированный до изотропного разрешения 2 мм, нарезанный на патчи 8 x 8 x 8 на сетке 24 x 24 x 24 и переданный языковому бэкбону без пространственного даунсэмплинга и без слоя слияния — именно поэтому активный путь содержит 4,35 млрд параметров из 4,69 млрд общих, и поэтому вычисления тратятся на сохранение разрешения, а не на его сжатие и отбрасывание. GLM-5.2 — текстовая модель. У неё вообще нет визуального пути, так что вопрос о том, как она обрабатывала бы скан, не возникает; ответ состоит в том, что ей нельзя передать его ни в какой форме. В двух карточках моделей описывается шестисоткратная разница в бюджете токенов, не имеющая никакого отношения к сравнению, потому что одна из них никак не может получить входные данные.
Обратная ошибка точно так же возможна. NV-Reason-CT поддерживает грудную клетку и брюшную полость, принимает файл NIfTI, а не промпт, не поддерживает использование инструментов, а его карточка модели ограничивает его исследованиями и образованием и указывает, что он не является медицинским изделием и что выходные данные могут быть неверными. Он не может нормализовать корпус отчётов, написать среду оценки или рассуждать по документу с рекомендациями. Модель обработки изображений с 4,7 млрд параметров не является заменой текстовой модели с 743 млрд параметров, как и наоборот.

Помещение половины текста на одну клавишу
Если вопрос в том, какую текстовую модель использовать для работы конвейера, сегодня ответ, вероятно, GLM-5.3, а не GLM-5.2 — и обе представлены в нашем каталоге под одним ключом. z-ai/glm-5.2 предоставляется по тарифу из прайс-листа провайдера Z.ai без наценки, а GLM-5.3 — вместе с ней, в рамках единого API, охватывающего более 200 моделей. Сохранять доступность обеих важнее, чем обычно, при смене поколения: вы можете протестировать преемника на собственном корпусе, прежде чем принять решение, сохранить текущую модель как запасной вариант на это время и переключиться без второго договора или изменения кода.
Сквозная ставка заслуживает отдельного предложения по той же причине, по которой она важна для любой модели, чей поставщик пересматривает цены. Когда между нами нет слоя наценки, изменение ставки поставщика отражается на нас в тот же день. Автоматическое переключение при сбое покрывает случай, когда провайдер деградирует в середине пакетной обработки, и для долгой задачи извлечения именно такой сбой действительно стоит целой ночи, а DSL маршрутизации позволяет отправлять отдельные запросы той модели, которая должна их обрабатывать, вместо того чтобы направлять всё в одну конечную точку.
NV-Reason-CT не представлен на нашей платформе, как и ни одна модель NVIDIA. Об этом стоит сказать прямо, а не оставлять на домысливание: CT-часть этой архитектуры — это скачанные веса на вашем собственном оборудовании, под лицензией, которая это разрешает, и с карточкой модели, которая запрещает клиническое использование. Мы его не размещаем и не станем писать фразу, которая позволяла бы предположить обратное.
Порядок, в котором следует принимать эти решения
Правильная последовательность для клинической сборки — не та, которую подразумевает сравнение.
Начните с вопроса генерации текста и начните с проверки того, какое поколение является текущим — GLM-5.3, а не GLM-5.2, по цене и по измеренным возможностям, если у вас нет причин оставаться на месте. Затем измерьте задержку CT-модели на одно исследование на собственном оборудовании, потому что эта цифра не опубликована и определяет остальную часть бюджета. Затем спроектируйте конвейер так, чтобы две его половины можно было заменять независимо, поскольку одна находится на жизненном цикле, близком к preview, а другая — на версии 0.1.
Единственное, чего не следует делать, — это воспринимать эти две вещи как выбор. Устаревшая текстовая модель 743B и актуальная CT-модель 4.69B не имеют ни одной общей задачи. Сравнивать их стоит только ради того, что это обнажает: что за более новым артефактом стоят более слабые доказательства, что более старый незаметно выпал из текущего поколения, и что оба эти факта невидимы для любого, кто читает строку каталога, где они перечислены бок о бок так, будто это альтернативы.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
