
Tencent HY4 Preview против tencent-hy3: цена в шесть раз выше, и что на самом деле даёт этот скачок
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0259Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0258Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0166Интеллект82Кодинг
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
Tencent HY4 Preview — первая модель в семействе Hunyuan, которая намеренно заставляет своего предшественника выглядеть дёшево: Tencent устанавливает цену на входные токены в шесть раз выше, чем у tencent-hy3, а на выходные — в четыре с половиной раза, и в анонсе утверждается, что премия оправдана. Релиз состоялся 28 августа 2026 года, модель открыта в исходниках. В DeepSWE она набирает по программной инженерии результат, более чем вдвое превышающий 28.0 у Hy3, — 85.4 в Terminal-Bench 2.1 за управление терминалом, а контекстное окно выросло с 256K до более миллиона токенов. tencent-hy3, официально вышедший 6 июля, — зрелая рабочая лошадка семейства: 295B параметров всего, 21B активных, четверть контекста и ценник, близкий к статистической погрешности. Это не тот случай, когда спецификации оставляют интригу. Вопрос в том, оправдывает ли разрыв свою цену для реальных сценариев, и ответ зависит от типа нагрузки.
Табло: где эти двое на самом деле расходятся
Каждый бенчмарк в материалах Tencent — это данные самого вендора: они получены на собственных оценочных стендах Tencent при запуске каждой модели, не воспроизведены независимой лабораторией, а для флагманской модели она публично доступна менее суток. Относитесь к этим показателям как к потолку, которого, по мнению Tencent, ей удалось достичь, и придавайте больше значения общей тенденции, чем любой отдельной цифре. Тенденция очевидна, и она сосредоточена на инженерных задачах с использованием агентов, а не на общих знаниях:
• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Это самый большой единичный скачок в этой паре: увеличение более чем вдвое на бенчмарке программной инженерии масштаба репозитория. Именно это число отделяет чат-модель от модели, которой доверяют целую кодовую базу.
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4, что, по словам Tencent, сравнимо с Claude Opus 5 и превосходит DeepSeek V4 Pro. tencent-hy3: 71.7, как сообщалось при его запуске в июле. Доведение реального терминала до конца при выполнении многошаговых задач — это именно тот тип длительных задач, в котором Hy3 был наиболее слаб.
• Toolathlon-Verified — Tencent HY4 Preview: 74,1, что, по словам Tencent, превосходит Qwen 3.8 Max и GPT-5.6 Sol. Сопоставимых показателей Hy3 опубликовано не было.
Внутренний слепой тест — 163 эксперта оценили 203 инженерные задачи на 2,99/4,00 для Tencent HY4 Preview, что немного опережает 2,92 у GLM-5.3 и 2,94 у Kimi K3. Это оценка рецензентов Tencent на задачах Tencent; относитесь к этому как к ориентировочному результату.

Сквозная линия: улучшения касаются управления терминалом, вызова инструментов и задач масштаба репозитория — позиционирование продуктивности, которое Tencent продвигает с Hy3, теперь подкреплено вычислительными мощностями.
Ценовая премия: строка за строкой
Здесь сравнение перестаёт быть вопросом хвастовства. Прейскурантные цены Tencent за миллион токенов:
• Вход — Tencent HY4 Preview: 6 юаней (~US$0.85). tencent-hy3: 1 юань (~US$0.14). В шесть раз.
• Output — Tencent HY4 Preview: 18 юаней (~2,50 долл. США). tencent-hy3: 4 юаня (~0,56 долл. США). В четыре с половиной раза.
• Попадание в кэш — Tencent HY4 Preview: 0,3 юаня. tencent-hy3: 0,25 юаня. Они почти одинаковы, и это важнее, чем кажется, потому что агентные циклы постоянно повторно отправляют один и тот же системный промпт и префикс диалога.
Прогоните реалистичный сценарий агентного написания кода через смешанные показатели — скажем, 20 миллионов входных и 4 миллиона выходных токенов в месяц, что соответствует бюджету одного активного разработчика-агента. Tencent HY4 Preview: 120 юаней плюс 72 юаня, около 192 юаней (~27 долл. США). tencent-hy3: 20 юаней плюс 16 юаней, около 36 юаней (~5 долл. США). Флагманская модель стоит в пять и более раз дороже при том же соотношении токенов — и она запросит больше выходных токенов на задачу, потому что размышляет дольше.
Это не причина избегать Tencent HY4 Preview; скачок DeepSWE — это именно та возможность, ради которой существует премиум. Это причина рассчитать стоимость рабочей нагрузки, прежде чем направлять её на него. И именно здесь слой маршрутизации оправдывает своё существование: tencent-hy3 уже доступен на OrcaRouter по цене провайдера из прайс-листа — наценка 0%, так что цифра, которую вы видите, — это собственная цена обслуживающего провайдера, а не перепроданная версия с наценкой — с автоматическим переключением между провайдерами, и изменение цены вендора вступает в силу на нашей стороне в тот же день.
В четыре раза больше контекста, вдвое больше активных вычислений
• Архитектура — Tencent HY4 Preview: 770B суммарно, 49B активных MoE. tencent-hy3: 295B суммарно, 21B активных. Флагман тратит примерно в 2,3 раза больше вычислений на каждый токен.
• Контекстное окно — Tencent HY4 Preview: более 1M токенов. tencent-hy3: 256K. Полный репозиторий или пакет финансовых документов помещается в окно флагманской модели как один запрос; на Hy3 та же задача требует разбиения на части, поиска или агентного цикла.
• Управление рассуждением — tencent-hy3 включает в себя настройку reasoning_effort для каждого запроса (no_think, low, high) плюс слой спекулятивного декодирования, который обеспечивает высокую скорость. Tencent HY4 Preview, по собственному признанию Tencent, склонен к длительным размышлениям перед первым выводом и чрезмерной самопроверке на сложных задачах — сжигая токены на перепроверку уже выполненной работы.
Последняя строка — это скрытая разница для случаев, чувствительных к задержке. Hy3 можно попросить отвечать напрямую; Tencent HY4 Preview, по крайней мере в этой ранней форме, часто не может не думать. Для чата с низкой задержкой или конвейера извлечения с высокой пропускной способностью дополнительные возможности флагмана тратятся впустую, а его дополнительные размышления — это налог. Для автономной пакетной инженерной задачи налог — это именно то, что даёт лучший ответ.
Налог на предпросмотр: что у Hy3 всё ещё есть
«Preview» есть в названии Tencent HY4 Preview, и оно ведёт себя соответствующе. Ни зрения, ни мультимодального ввода — модель только текстовая, так что всё, что связано с изображениями или видео, остаётся на той модели, которую вы уже используете для этих задач. Двухнедельный бесплатный пробный период в WorkBuddy и CodeBuddy — это дегустация, а не полноценный план. Tencent прямо заявляет, что это ранняя итерация Hy4, и улучшения на этапах предварительного и последующего обучения ещё впереди — в том темпе, который приносил крупные версии примерно каждые два месяца с февраля. Независимых бенчмарков для флагмана пока нет нигде.
tencent-hy3 — полная противоположность всему этому. Это официальный стабильный релиз, который находится в продакшене с июля. Его бесплатный тариф действует до 30 сентября. Его уровни рассуждения дают вам регулятор, а не темперамент, а слой спекулятивного декодирования и 21B активных параметров делают его дешёвой, быстрой и предсказуемой половиной этого семейства — модель, которую вы направляете на путь по умолчанию и забываете о ней.

Кто должен выбирать
Выбирайте Tencent HY4 Preview, когда главное — результат: сложная задача по разработке ПО, контекст масштаба репозитория, агентный рабочий процесс, где лучший ответ оправдывает пятикратный счёт за токены и вы можете позволить себе задержку модели, которая думает, прежде чем говорить. Выбирайте tencent-hy3, когда главное — ограничения: высокая пропускная способность, низкая задержка, ограниченный бюджет или любая задача, где вы хотите, чтобы модель отвечала, а не размышляла.
Практический паттерн для такой пары — эскалация: дешёвая управляемая модель работает на маршруте по умолчанию, а флагманская подключается только тогда, когда задача этого требует. Именно для этого нужен DSL маршрутизации OrcaRouter — собрать несколько моделей в один вызов, чтобы политика была конфигурацией, а не кодом, — а автоматическое переключение при отказе означает, что путь Hy3 продолжает обслуживаться, даже если один из провайдеров деградирует. OrcaRouter пока не маршрутизирует Tencent HY4 Preview: Tencent не открыл модель для стороннего инференса, поэтому сейчас она работает на собственном эндпоинте Tencent Cloud TokenHub вендора и на self-hosted развёртываниях открытых весов. tencent-hy3, тем временем, уже сегодня есть в каталоге по прейскурантной цене провайдера — и в тот день, когда флагман откроется, она точно так же встроится в тот же слой маршрутизации, превратив замену одной модели на другую в изменение одной строки, а не в переписывание кода.

Вердикт скучен в лучшем смысле: {{1}}флагман оправдывает наценку ровно для той работы, ради которой он оценён, а рабочая лошадка по-прежнему остаётся правильным выбором для всего, что просто нужно сделать.{{/1}} Разрыв в цене в шесть раз реален, {{2}}разрыв DeepSWE с 28 до 64 тоже реален,{{/2}} и одно не отменяет другое — {{3}}просто нужно понимать, какой именно вариант вы покупаете.{{/3}}
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
