Заголовочная карточка для «Tencent HY4 Preview vs tencent-hy3». Заголовок гласит: «Вшестеро дороже — и что на самом деле даёт этот скачок». Левая панель «Tencent HY4 Preview» (НОВЫЙ ФЛАГМАН, 28 августа 2026) с чипами «770B / 49B MoE», «1M context», «DeepSWE 64.3». Правая панель «tencent-hy3» (ПРОВЕРЕННАЯ РАБОЧАЯ ЛОШАДКА) с чипами «295B / 21B MoE», «256K context», «DeepSWE 28.0». Внизу указано: «Цена ¥6/¥18 против ¥1/¥4 за MTok. Бенчмарки предоставлены вендором».
Guides & Insights

Tencent HY4 Preview против tencent-hy3: цена в шесть раз выше, и что на самом деле даёт этот скачок

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent HY4 Preview — первая модель в семействе Hunyuan, которая намеренно заставляет своего предшественника выглядеть дёшево: Tencent устанавливает цену на входные токены в шесть раз выше, чем у tencent-hy3, а на выходные — в четыре с половиной раза, и в анонсе утверждается, что премия оправдана. Релиз состоялся 28 августа 2026 года, модель открыта в исходниках. В DeepSWE она набирает по программной инженерии результат, более чем вдвое превышающий 28.0 у Hy3, — 85.4 в Terminal-Bench 2.1 за управление терминалом, а контекстное окно выросло с 256K до более миллиона токенов. tencent-hy3, официально вышедший 6 июля, — зрелая рабочая лошадка семейства: 295B параметров всего, 21B активных, четверть контекста и ценник, близкий к статистической погрешности. Это не тот случай, когда спецификации оставляют интригу. Вопрос в том, оправдывает ли разрыв свою цену для реальных сценариев, и ответ зависит от типа нагрузки.

Табло: где эти двое на самом деле расходятся

Каждый бенчмарк в материалах Tencent — это данные самого вендора: они получены на собственных оценочных стендах Tencent при запуске каждой модели, не воспроизведены независимой лабораторией, а для флагманской модели она публично доступна менее суток. Относитесь к этим показателям как к потолку, которого, по мнению Tencent, ей удалось достичь, и придавайте больше значения общей тенденции, чем любой отдельной цифре. Тенденция очевидна, и она сосредоточена на инженерных задачах с использованием агентов, а не на общих знаниях:

• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Это самый большой единичный скачок в этой паре: увеличение более чем вдвое на бенчмарке программной инженерии масштаба репозитория. Именно это число отделяет чат-модель от модели, которой доверяют целую кодовую базу.

• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, что, по словам Tencent, сравнимо с Claude Opus 5 и превосходит DeepSeek V4 Pro. tencent-hy3: 71.7, как сообщалось при его запуске в июле. Доведение реального терминала до конца при выполнении многошаговых задач — это именно тот тип длительных задач, в котором Hy3 был наиболее слаб.

• Toolathlon-Verified — Tencent HY4 Preview: 74,1, что, по словам Tencent, превосходит Qwen 3.8 Max и GPT-5.6 Sol. Сопоставимых показателей Hy3 опубликовано не было.

Внутренний слепой тест — 163 эксперта оценили 203 инженерные задачи на 2,99/4,00 для Tencent HY4 Preview, что немного опережает 2,92 у GLM-5.3 и 2,94 у Kimi K3. Это оценка рецензентов Tencent на задачах Tencent; относитесь к этому как к ориентировочному результату.

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

Сквозная линия: улучшения касаются управления терминалом, вызова инструментов и задач масштаба репозитория — позиционирование продуктивности, которое Tencent продвигает с Hy3, теперь подкреплено вычислительными мощностями.

Ценовая премия: строка за строкой

Здесь сравнение перестаёт быть вопросом хвастовства. Прейскурантные цены Tencent за миллион токенов:

• Вход — Tencent HY4 Preview: 6 юаней (~US$0.85). tencent-hy3: 1 юань (~US$0.14). В шесть раз.

• Output — Tencent HY4 Preview: 18 юаней (~2,50 долл. США). tencent-hy3: 4 юаня (~0,56 долл. США). В четыре с половиной раза.

• Попадание в кэш — Tencent HY4 Preview: 0,3 юаня. tencent-hy3: 0,25 юаня. Они почти одинаковы, и это важнее, чем кажется, потому что агентные циклы постоянно повторно отправляют один и тот же системный промпт и префикс диалога.

Прогоните реалистичный сценарий агентного написания кода через смешанные показатели — скажем, 20 миллионов входных и 4 миллиона выходных токенов в месяц, что соответствует бюджету одного активного разработчика-агента. Tencent HY4 Preview: 120 юаней плюс 72 юаня, около 192 юаней (~27 долл. США). tencent-hy3: 20 юаней плюс 16 юаней, около 36 юаней (~5 долл. США). Флагманская модель стоит в пять и более раз дороже при том же соотношении токенов — и она запросит больше выходных токенов на задачу, потому что размышляет дольше.

Это не причина избегать Tencent HY4 Preview; скачок DeepSWE — это именно та возможность, ради которой существует премиум. Это причина рассчитать стоимость рабочей нагрузки, прежде чем направлять её на него. И именно здесь слой маршрутизации оправдывает своё существование: tencent-hy3 уже доступен на OrcaRouter по цене провайдера из прайс-листа — наценка 0%, так что цифра, которую вы видите, — это собственная цена обслуживающего провайдера, а не перепроданная версия с наценкой — с автоматическим переключением между провайдерами, и изменение цены вендора вступает в силу на нашей стороне в тот же день.

В четыре раза больше контекста, вдвое больше активных вычислений

• Архитектура — Tencent HY4 Preview: 770B суммарно, 49B активных MoE. tencent-hy3: 295B суммарно, 21B активных. Флагман тратит примерно в 2,3 раза больше вычислений на каждый токен.

• Контекстное окно — Tencent HY4 Preview: более 1M токенов. tencent-hy3: 256K. Полный репозиторий или пакет финансовых документов помещается в окно флагманской модели как один запрос; на Hy3 та же задача требует разбиения на части, поиска или агентного цикла.

• Управление рассуждением — tencent-hy3 включает в себя настройку reasoning_effort для каждого запроса (no_think, low, high) плюс слой спекулятивного декодирования, который обеспечивает высокую скорость. Tencent HY4 Preview, по собственному признанию Tencent, склонен к длительным размышлениям перед первым выводом и чрезмерной самопроверке на сложных задачах — сжигая токены на перепроверку уже выполненной работы.

Последняя строка — это скрытая разница для случаев, чувствительных к задержке. Hy3 можно попросить отвечать напрямую; Tencent HY4 Preview, по крайней мере в этой ранней форме, часто не может не думать. Для чата с низкой задержкой или конвейера извлечения с высокой пропускной способностью дополнительные возможности флагмана тратятся впустую, а его дополнительные размышления — это налог. Для автономной пакетной инженерной задачи налог — это именно то, что даёт лучший ответ.

Налог на предпросмотр: что у Hy3 всё ещё есть

«Preview» есть в названии Tencent HY4 Preview, и оно ведёт себя соответствующе. Ни зрения, ни мультимодального ввода — модель только текстовая, так что всё, что связано с изображениями или видео, остаётся на той модели, которую вы уже используете для этих задач. Двухнедельный бесплатный пробный период в WorkBuddy и CodeBuddy — это дегустация, а не полноценный план. Tencent прямо заявляет, что это ранняя итерация Hy4, и улучшения на этапах предварительного и последующего обучения ещё впереди — в том темпе, который приносил крупные версии примерно каждые два месяца с февраля. Независимых бенчмарков для флагмана пока нет нигде.

tencent-hy3 — полная противоположность всему этому. Это официальный стабильный релиз, который находится в продакшене с июля. Его бесплатный тариф действует до 30 сентября. Его уровни рассуждения дают вам регулятор, а не темперамент, а слой спекулятивного декодирования и 21B активных параметров делают его дешёвой, быстрой и предсказуемой половиной этого семейства — модель, которую вы направляете на путь по умолчанию и забываете о ней.

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

Кто должен выбирать

Выбирайте Tencent HY4 Preview, когда главное — результат: сложная задача по разработке ПО, контекст масштаба репозитория, агентный рабочий процесс, где лучший ответ оправдывает пятикратный счёт за токены и вы можете позволить себе задержку модели, которая думает, прежде чем говорить. Выбирайте tencent-hy3, когда главное — ограничения: высокая пропускная способность, низкая задержка, ограниченный бюджет или любая задача, где вы хотите, чтобы модель отвечала, а не размышляла.

Практический паттерн для такой пары — эскалация: дешёвая управляемая модель работает на маршруте по умолчанию, а флагманская подключается только тогда, когда задача этого требует. Именно для этого нужен DSL маршрутизации OrcaRouter — собрать несколько моделей в один вызов, чтобы политика была конфигурацией, а не кодом, — а автоматическое переключение при отказе означает, что путь Hy3 продолжает обслуживаться, даже если один из провайдеров деградирует. OrcaRouter пока не маршрутизирует Tencent HY4 Preview: Tencent не открыл модель для стороннего инференса, поэтому сейчас она работает на собственном эндпоинте Tencent Cloud TokenHub вендора и на self-hosted развёртываниях открытых весов. tencent-hy3, тем временем, уже сегодня есть в каталоге по прейскурантной цене провайдера — и в тот день, когда флагман откроется, она точно так же встроится в тот же слой маршрутизации, превратив замену одной модели на другую в изменение одной строки, а не в переписывание кода.

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

Вердикт скучен в лучшем смысле: {{1}}флагман оправдывает наценку ровно для той работы, ради которой он оценён, а рабочая лошадка по-прежнему остаётся правильным выбором для всего, что просто нужно сделать.{{/1}} Разрыв в цене в шесть раз реален, {{2}}разрыв DeepSWE с 28 до 64 тоже реален,{{/2}} и одно не отменяет другое — {{3}}просто нужно понимать, какой именно вариант вы покупаете.{{/3}}

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube