Hero-карточка заголовка для Tencent Hy4 Preview. По центру — заголовок: «Tencent Hy4 Preview — открытые веса, поддержка vLLM с первого дня». Строка подзаголовка: «770B MoE · 49B активных · контекст 1M». Четыре плашки с характеристиками: «Открытые веса (Apache 2.0)», «vLLM + SGLang с первого дня», «Инференс на 8 GPU (FP8)», «¥6 / ¥18 за MTok». В футере: «Выпущено 28 августа 2026 · Работает в vLLM». В правом нижнем углу — логотип OrcaRouter.
Guides & Insights

Предварительная версия Tencent Hy4 работает в vLLM с первого дня: MoE-модель с открытыми весами на 770B параметров, которую реально можно обслуживать

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Когда Tencent Hy4 Preview вышел 28 августа 2026 года, он сделал то, что большинство флагманов топ-класса пропускают в первый день: он выпушен в рабочем состоянии. Вместе с открытыми весами Tencent и команда vLLM опубликовали готовый Docker-образ, официальный рецепт развёртывания и включили поддержку фреймворка прямо в vLLM, так что самая большая модель с открытыми весами, созданная в линейке Hunyuan — 770 миллиардов параметров всего, 49 миллиардов активных на токен, — оказалась за эндпоинтом, совместимым с OpenAI, на ваших собственных GPU уже через несколько часов после анонса. Именно эта история с запуском в день релиза и есть тема поста, потому что «работает в vLLM» — не сноска для модели такого размера. Это разница между пресс-релизом и вещью, которую можно запустить в продакшен.

Остальная часть запуска — обычный пакет в формате предварительной версии, и оговорки здесь важны не меньше цифр. Tencent называет Tencent Hy4 Preview ранней итерацией, отмечает чрезмерно длинные рассуждения и избыточную самопроверку как известное поведение, а также публикует таблицу бенчмарков, полностью основанную на собственных данных — ни одна независимая лаборатория её ещё не оценивала, а самой модели на момент написания этого текста всего два дня. Ничто из этого не меняет практическую суть: веса распространяются под лицензией Apache 2.0, контекстное окно составляет 1 миллион токенов, а поддержка vLLM с первого дня означает, что путь самостоятельного развёртывания реален, а не просто декларативен.

Что на самом деле представляет собой Tencent Hy4 Preview

Tencent позиционирует Tencent Hy4 Preview как преемника Hy3 (суммарно 295B, контекст 256K), примерно удваивая активную мощность и увеличивая контекстное окно в четыре раза. Архитектуру стоит читать построчно, потому что каждая строка меняет то, что модели с открытыми весами позволено делать на вашем оборудовании.

Архитектура — Mixture-of-Experts с 770 млрд суммарных параметров и 49 млрд активных на токен в 78 слоях. Первый слой плотный; остальные 77 маршрутизируют каждый токен через 256 маршрутизируемых экспертов плюс один общий эксперт, активируя топ-8. Именно это соотношение разреженности примерно 16:1 удерживает стоимость инференса в пределах, которые серьёзная команда действительно может себе позволить.

• Окно контекста — 1 048 576 нативных токенов, одно из самых широких среди всех моделей с открытым весом. Полный репозиторий, многофайловый рефакторинг, пакет длинных документов — задачи, решаемые одним запросом.

• Внимание — Gated Deep​Seek Sparse Attention (Gated DSA) с IndexCache, дизайн разреженного внимания, который вычисляет свежий разреженный индекс только на 21 из 78 слоёв и повторно использует его на остальных 57. Именно поэтому его обслуживание — это не просто «больший vLLM» — нужен бэкенд, который понимает разреженное внимание.

• {{1}}Встроенное спекулятивное декодирование{{/1}} — {{2}}слой MTP (multi-token prediction) объёмом около 10B всего / 0.7B активных параметров находится внутри модели, поэтому vLLM и SGLang могут генерировать токены без необходимости размещать отдельную модель-черновик.{{/2}}

• Веса — Apache 2.0, в чекпойнтах как BF16, так и FP8, опубликованы на Hugging Face, ModelScope, GitCode и CNB.

Что на самом деле означает «day-zero vLLM»

Объединённая поддержка фреймворка в день запуска — это конкретное событие, стоящее за сигналом: изменение vLLM, добавляющее Tencent Hy4 Preview (PR #54160), попало в то же окно, что и релиз, а официальный рецепт ориентирован на vLLM 0.29.0 или новее. На практике это означает, что процесс обслуживания — это одна команда, а не неделя отладки ядра.

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

Флаги имеют значение, и каждый из них сопоставляется с чем-то в модели, а не является просто шаблонным текстом:

• --attention-backend FLASHMLA_SPARSE — требуется, не опционально. Разреженное внимание Gated DSA в Tencent Hy4 Preview не работает корректно на стандартных плотных бэкендах, и именно этот флаг задается в официальном рецепте.

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — включает встроенный слой MTP модели для спекулятивного декодирования с опережением на три черновых токена. Отдельную черновую модель разворачивать не нужно.

• --tool-call-parser hy_v4 и --reasoning-parser hy_v4 — пользовательские парсеры, которые сообщают серверу, как Tencent Hy4 Preview формирует вызовы инструментов и свою цепочку рассуждений, а --enable-auto-tool-choice позволяет модели самой решать, когда вызывать инструменты.

Tencent рекомендует температуру 0.9 и top_p 1.0 для сэмплирования. Рассуждение по умолчанию использует цепочку мыслей с «высоким» уровнем усилий, направленную на математику, программирование и сложные задачи; если вам нужен прямой ответ без длительного обдумывания, передайте в запросе параметр усилия рассуждения no_think, а не меняйте веса.

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

Поддержка с первого дня — не только в vLLM, что само по себе примечательно для такого свежего релиза. SGLang в тот же день выпустил готовый мультиархитектурный образ (lmsysorg/sglang:hy4-preview) со спекулятивным декодированием в стиле NEXTN, а экосистема Ascend получила поддержку с нулевого дня через vLLM-Ascend, используя W8A8-квантизованные веса на 16 NPU Atlas 800I A3. Открытые релизы с весами обычно требуют недель, чтобы инференс-экосистема их догнала; здесь же понадобились часы.

Результаты, которые стоит процитировать

Каждый бенчмарк, опубликованный Tencent для Tencent Hy4 Preview, является отчётом самого вендора — он выполнялся на собственной тестовой среде Tencent, не был воспроизведён ни одной независимой лабораторией, а модель публично доступна всего два дня. Воспринимайте их как потолок, который, по мнению Tencent, она достигла, а не как установленный факт. Независимая верификация не появится, пока третья сторона не проведёт её; ни один публичный лидерборд пока не отражает эту модель.

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Главный показатель — Terminal Bench 2.1, тест того, насколько хорошо модель управляет реальным терминалом при написании кода. Tencent сообщает о результате 85.4 для Tencent Hy4 Preview, который, как утверждается, сравнялся с Claude Opus 5 и превзошёл DeepSeek V4 Pro, а также опередил своего предшественника Hy3 на 14,6 балла. Это единственное число определяет весь релиз — это утверждение, которое ставит модель с открытыми весами в один ряд с самыми дорогими закрытыми фронтирными моделями на сложном тесте агентного программирования, — и это утверждение больше всего нуждается в независимом подтверждении.

Остальная часть внутренней таблицы — все собственные показатели Tencent: DeepSWE, бенчмарк для программной инженерии, прыгает с 28.0 на Hy3 до 64.3. SWE-bench Pro показывает 65.7, SWE-bench Multilingual — 82.9. В Toolathlon-Verified, тесте на вызов инструментов, Tencent сообщает о 74.1, что, по его словам, превосходит Qwen 3.8 Max и GPT-5.6 Sol и приближается к Kimi K3 и Claude Opus 5. В APEX-Agents pass@1 он получает 37.1, немного отставая от 37.2 у Kimi K3. И в отдельной внутренней слепой оценке 163 привлечённых Tencent эксперта оценили 203 инженерные задачи на 2.99 из 4.00, слегка опередив 2.92 у GLM-5.3 и 2.94 у Kimi K3.

Стоит отметить две закономерности. Все сильные показатели относятся к агентной инженерной работе — управлению терминалом, вызову инструментов, задачам масштаба репозитория, — и ни один не относится к общим знаниям или рассуждениям, что соответствует позиционированию в сфере продуктивности, а не является совпадением. Tencent описывает DeepSWE и другие модели как сокращающие, а не устраняющие разрывы; единственное чистое, пригодное для маркетинга заявление о паритете — это ничья на Terminal Bench 2.1, и именно это заявление больше всего стоит проверить на собственной нагрузке.

Сколько на самом деле стоит эксплуатация

{{1}}Арифметика самостоятельного хостинга — первое, о чём стоит говорить честно.{{/1}} {{2}}Это не модель для одной GPU и не настольная модель.{{/2}} {{3}}Чекпойнт FP8 — это почти терабайт весов, а официальный рецепт предполагает тензорный параллелизм 8 — восемь GPU с высокой пропускной способностью и быстрыми интерконнектами (референсное железо Tencent для FP8 — 8×B300, а для полного BF16 нужно 16×B200).{{/3}} {{4}}Если у вас нет такого масштаба, дёшево вы его не захостите, а бэкенд с разреженным вниманием означает, что обходного пути для памяти KV-кэша при контексте в 1M токенов нет.{{/4}}

Одно дополнение недели запуска меняет часть этой математики для команд, которым нужны открытые веса без флагманского масштаба. Команда Hy из Tencent выпустила сжатую сборку GGUF для Tencent Hy4 Preview, сжав релиз в BF16 объёмом ~1,5 ТБ до примерно 200 ГиБ с помощью послойной схемы смешанного квантования, названной MIX-STQ1_0: основные тензоры экспертов снижаются примерно до 1,3 бита, а слои, критически важные для остаточного потока, сохраняют более высокую точность. По собственным оценкам Tencent, изменение точности невелико — SWE-bench Multilingual: 82,9 против 81,3; MCP Atlas: 83,7 против 83,2; IFBench: 73,5 против 72,5 — компромисс, который вендор называет почти без потерь. Это цифры Tencent на их собственной конфигурации, пока никем не воспроизведённые. Модель на 200 ГиБ по-прежнему не помещается в один GPU, но это значительно меньшая ставка, чем чекпойнт FP8 почти на терабайт, и она делает путь открытых весов доступным для узла с меньшим числом GPU, чем предполагает конфигурация с восемью B300.

Интереснее всего цена на API-пути. На TokenHub от Tencent Cloud Tencent Hy4 Preview предлагается по 6 юаней (~0,83 долл. США) за миллион входных токенов, 18 юаней (~2,50 долл. США) за миллион выходных токенов и 0,3 юаня (~0,04 долл. США) за миллион токенов при попадании в кэш. Цена выходных данных — примерно 2,50 долл. за миллион — намного ниже, чем 25 долл. за миллион у ведущей закрытой frontier-модели, а дешёвые попадания в кэш делают длинные агентные циклы — когда один и тот же системный промпт и префиксы диалога постоянно пересылаются заново — необычайно доступными.

Tencent также предоставляет двухнедельный бесплатный доступ к Tencent Hy4 Preview в WorkBuddy и CodeBuddy, пока модель новая, так что самый дешевый способ попробовать её на этой неделе — бесплатно — и именно в WorkBuddy позиционирование продуктивности обретает конкретные черты. В любом разговоре в WorkBuddy селектор модели переключается между Hy3 и Hy4 preview, поэтому разделение между офисной продуктивностью и аналитической работой, с одной стороны, и программированием, с другой, — это выбор для каждой задачи, а не решение о развертывании. Такое разделение соответствует тому, куда Tencent нацеливал модель, и практические тесты в WorkBuddy показывают, что она с первого раза создает сложные артефакты — играбельный прототип игры в стиле low-poly по одному запросу, полный ежеквартальный бизнес-обзор, собранный из десяти вложений без единого ручного вмешательства, а также, в демо для тестировщиков, распространившемся на этой неделе, симуляцию черной дыры. Это наблюдения сообщества за собственным приложением Tencent, а не бенчмарки вендора — но это первые практические сигналы того, как модель справляется с реальными многошаговыми задачами, и их можно бесплатно воспроизвести, прежде чем вы потратите что-либо.

Решение о стоимости — это как раз то, где маршрутизирующий слой меняет расчёт, и мы будем честны в отношении своей роли в этом: OrcaRouter пока не маршрутизирует Tencent Hy4 Preview, потому что Tencent не открыл эту модель для сторонних инференс-платформ — она работает на собственном эндпоинте TokenHub в Tencent Cloud и на self-hosted развёртываниях открытых весов, и мы не заявляем, что обслуживаем то, чего не обслуживаем. {{2}}Что даёт маршрутизирующий слой — так это каркас принятия решений вокруг этого. {{3}}Если вы выбираете между узлом с 8 GPU и API, то с того дня, как Tencent это откроет, применяется та же дисциплина сквозного пропуска цен, на которой работает весь остальной каталог: OrcaRouter передаёт цены провайдера без наценки, поэтому снижение цены вендором в тот же день отражается и у нас, а не перепродаётся с наценкой. {{4}}А для модели, которой всего два дня и единственное свидетельство которой — бенчмарки её вендора, автоматический фейловер — безопасный способ её протестировать: поставьте проверенную модель на критический путь, а Tencent Hy4 Preview — рядом, подключая её на задачах, где выигрывает её ценовой профиль, и откатываясь назад в тот момент, когда это не так, — всё через один API и один ключ.

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

Пределы, которые не помещаются в спецификации

Tencent перечисляет известные ограничения прямо, и они должны учитываться при любом решении о развертывании. Tencent Hy4 Preview — текстовая модель, и точка: ни зрения, ни мультимодального ввода, так что всё, что связано с изображениями или видео, лучше отдать другой модели. Tencent также отмечает медленный старт на сложных задачах (долгое обдумывание перед первым выводом) и склонность к чрезмерной самопроверке, сжигающей токены на перепроверку уже сделанной работы. Такое сочетание совершенно не подходит для чатов, чувствительных к задержке, и вполне терпимо для офлайн-пакетной инженерной работы, что указывает на то, где Tencent ожидает его запускать.

Два утверждения в материалах запуска заслуживают отдельного внимания, поскольку они касаются того, как была построена модель, а не того, какие результаты она показала. Tencent утверждает, что Tencent Hy4 Preview участвовала в собственной разработке: она помогала оптимизировать методы обучения, стратегию работы с данными, оценочные фреймворки и низкоуровневые операторы, которые её создали, — это ранний цикл рекурсивного самосовершенствования, — а также самостоятельно оптимизировала свою систему инференса, добившись сквозного прироста пропускной способности на 31,8% по сравнению с базовым уровнем. С научной стороны Tencent сообщает, что она продвинула известную нижнюю границу задачи Бляшке–Лебега в выпуклой геометрии с 0,380799 до 0,41104, а также ускорила моделирование фосфолипидного бислоя из 32 512 атомов в 2,0 раза — до 54,9 миллисекунды на шаг. Как и всё остальное в день запуска, это утверждения самой Tencent.

И самое главное отсутствие — это верификация. Для Tencent Hy4 Preview пока нет ни одной независимой оценки — ни в публичных лидербордах, ни от сторонних лабораторий тестирования, ни в записи Artificial Analysis. Модель слишком новая для этого. Внутренний слепой тест с экспертами — полезный сигнал о том, как собственные рецензенты Tencent видят её в сравнении с GLM-5.3 и Kimi K3, но это рецензенты Tencent на задачах Tencent. Всё, что выходит за рамки спецификации, — это утверждение, ожидающее проверки.

Кто должен проводить Tencent Hy4 Preview на этой неделе?

Честный ответ на этой неделе делится на три группы, и одной из них не нужно никакого оборудования. Если вы просто хотите почувствовать, что умеет Tencent Hy4 Preview, бесплатный доступ в WorkBuddy — самый быстрый путь: без GPU, без API-ключа, откройте диалог, переключите селектор модели на Hy4 preview и дайте ей задачу Work или Coding. Если у вас есть GPU и вы запускаете инженерные рабочие нагрузки пакетно — долгосрочные агентные задачи, анализ в масштабе репозитория, офлайн-оценку — модель стоит серьёзно протестировать прямо сейчас: веса открыты, окно контекста рассчитано на масштаб репозитория, запуск через vLLM — одна команда, а выпущенная на неделе запуска GGUF-сборка снижает планку требований к оборудованию для пробного запуска. Если вы запускаете продакшен-чат, критичный к задержкам, или что-то мультимодальное, или что-то, где вы не можете позволить себе модель, единственное подтверждение которой — собственные бенчмарки вендора, подождите — Tencent выпускает итерации примерно каждые два месяца, начиная с февраля, и уже заявил, что следующая партия моделей Hy4 в пути, так что превью — это явно ранняя итерация.

Для всех остальных полезная стратегия — это паттерн маршрутизации: проверьте её рядом с моделью, которой вы уже доверяете, по цене, от которой можно отказаться, и масштабируйте только там, где её цифры подтверждаются на вашей собственной рабочей нагрузке. Именно для этого и существует маршрутизатор — в день, когда Tencent откроет эту модель для стороннего инференса, она попадёт в каталог с единым API, более чем 200 моделями и трансляцией списка цен, как и любая другая, а инструменты для отказоустойчивости и композиции уже будут на месте. А пока веса лежат на Hugging Face, API — в Tencent Cloud, а бесплатная пробная версия — в WorkBuddy — и утверждение, что модель с открытыми весами достигла высшего уровня в агентном программировании, наконец получило конкретную цифру. Цифра принадлежит Tencent. Тест — ваш.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube