
Tencent HY4 Preview против Kimi K3: Слепой тест, который Tencent решил опубликовать
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Tencent HY4 Preview против Kimi K3 — это единственное противостояние в рамках запуска этой модели, которое сама Tencent решила устроить. В её внутреннем слепом тесте — 163 инженера, 203 инженерные задачи, оценка по четырёхбалльной шкале — HY4 Preview набрал 2,99/4,00 против 2,94 у Kimi K3, и в заголовке Tencent это назвали победой. Мелкий шрифт этой победы стоит прочитать медленно: HY4 Preview обошёл Kimi K3 в 51,2% задач, сыграл вничью в 7,9% и проиграл в 40,9%. Чистый перевес в 10 процентных пунктов — это реально, но это узкое преимущество над моделью с третью общего количества параметров и менее чем половиной активных параметров — и весь тест проводила сама Tencent.
Kimi K3 — флагман Moonshot с открытыми весами на 2,8 триллиона параметров, крупнейшая открытая модель из когда-либо выпущенных и эталон, с которым каждая китайская лаборатория сверяется с 16 июля. Tencent выбрала её в качестве соперника, потому что она является стандартом среди моделей с открытыми весами, — что делает задачу этой статьи необычно конкретной: прочитать единственное очное сравнение, которое претендент предложил по собственной воле, и решить, чего оно стоит.
Бенчмарк, который Tencent решил опубликовать.
Слепой тест оценивали инженеры самой Tencent на собственных инженерных задачах Tencent — это первое, что стоит сбрасывать со счетов. Набор задач, составленный самой компанией, — это именно та среда, в которой новая модель показывает свой лучший возможный результат. Даже если это признать, сама структура результата показательна: 51,2% побед против 40,9% поражений — это скромное преимущество, а доля ничьих в 7,9% означает, что модели очень близки по большинству задач. На сложных задачах — тех, где фронтовая модель действительно отрывается от остальных, — разрыв остаётся там, где он всегда и бывает. И заголовок Tencent «незначительно опережает Kimi K3» сформулирован честно, чего не скажешь о публикациях каждой лаборатории.
Масштаб — не судьба
Сравнение параметров делает результат либо впечатляющим, либо подозрительным — в зависимости от ваших априорных ожиданий. Kimi K3 — это 2,8 триллиона параметров всего, из которых 104 миллиарда активных: 896 экспертов, 16 активных на токен — и она обучалась рассуждать постоянно, с открытой цепочкой рассуждений. HY4 Preview — 770 миллиардов всего и 49 миллиардов активных, треть общего масштаба и менее половины активных вычислений. То, что меньшая модель одерживает узкую победу над большей в слепом тесте, — это направление, в котором движется вся область моделей с открытым весом: Qwen3.8-Max (2,4 трлн) и GLM-5.2 (753 млрд) месяцами обмениваются ударами на агентных бенчмарках, — так что результат правдоподобен, а не из ряда вон выходящий. И, что крайне важно, он не проверен никем за пределами Tencent.
Табло

• Масштаб — HY4 Preview 770B всего / 49B активных против Kimi K3 2.8T всего / 104B активных
• Контекст — HY4 Preview >1M токенов vs Kimi K3 1M токенов
• Цена за 1M — HY4 Preview ¥6 вход / ¥18 выход (≈$0.85 / $2.50) против Kimi K3 $3.00 вход / $15.00 выход, попадания в кэш $0.30
• Модальность — HY4 Preview только текст против Kimi K3 нативный ввод изображений и видео
• Рассуждения — HY4 Preview без опубликованного режима против Kimi K3 с постоянно включенными рассуждениями и потоковой цепочкой рассуждений
• Независимая оценка — HY4 Preview: нет данных против Kimi K3 AA: Intelligence Index 57, топ-3 в мире на момент релиза.
В строках, где обе стороны указывают число, модели сближаются. Tencent сообщает для HY4 Preview результат 37,1 в APEX-Agents — практически вровень с 37,2 у Kimi K3; почти ничья, которую предсказал бы табло слепого тестирования. У Toolathlon-Verified 74,1 и DeepSWE 64,3 у HY4 Preview нет аналога у Kimi K3 в моём распоряжении, а у Kimi K3 показатели FrontierSWE 81,2, ProgramBench 77,8 и BrowseComp 91,2 не имеют эквивалента у HY4 Preview. Табло честно показывает, что две карточки почти не пересекаются, — а это само по себе предупреждение о том, что строки любого из вендоров не стоит воспринимать как полное описание модели.
Видение — это самое большое реальное различие.
Для разработчика, который выбирает между этими двумя сегодня, структурный разрыв — это не интеллект, а модальность ввода. Kimi K3 изначально мультимодальна: она принимает изображения и видео через свой энкодер MoonViT-V2 и входит в число лучших открытых моделей в задачах компьютерного зрения, занимая второе место в мировом рейтинге vision arena. Tencent HY4 Preview в этой предварительной версии работает только с текстом, и Tencent заявил, что поддержка изображений появится лишь в полном релизе. Любая задача, требующая скриншотов, понимания интерфейса или визуального анализа, по умолчанию остаётся за Kimi K3, независимо от того, что говорят слепые тесты об инженерном тексте. Если ваша работа — это чистый код, документы и вывод терминала, разрыв не имеет значения; как только задача предполагает визуальное восприятие, он определяет исход сравнения.
Вопрос стоимости
В пересчёте на токен HY4 Preview значительно дешевле: примерно $0,85/$2,50 против $3,00/$15,00 у Kimi K3, при попаданиях в кэш — ¥0,3 (примерно четыре цента) против $0,30. Но у двух моделей противоположное поведение в отношении токенов, что сокращает разрыв. Kimi K3 рассуждает постоянно и транслирует свою цепочку рассуждений, что раздувает выходные токены в каждом запросе; рецензенты отмечают, что модель медленнее — около 62 токенов в секунду — и требовательна к токенам в агентных циклах. HY4 Preview, согласно собственному релизному примечанию Tencent, «склонен к чрезмерно длинным размышлениям и избыточной самопроверке» на сложных задачах. Обе модели сжигают лишние выходные токены; HY4 Preview просто берёт за них меньше. Справедливое сравнение — это стоимость выполнения задачи, и пока никто за пределами Tencent не измерил её для HY4 Preview.
Вердикт
Tencent HY4 Preview — это более дешёвый, компактный и непроверенный претендент, заявляющий о небольшом преимуществе в слепом тестировании перед стандартом с открытыми весами; Kimi K3 — более крупный, проверенный и способный работать с изображениями действующий игрок, который стоит в четыре-пять раз дороже за токен и имеет независимый индекс интеллекта 57. Карточка бенчмарков ни одной из моделей не является полностью независимой — ключевые показатели Kimi K3 тоже предоставлены Moonshot, хотя её индекс 57 — нет. Если ваша нагрузка мультимодальна, Kimi K3 — единственный выбор в этом противостоянии. Если она текстовая и инженерная, HY4 Preview — выгодная ставка с реальным, пусть и проводимым вендором, сравнением один на один, а дешёвый путь — направить Kimi K3 на production-ключ: она доступна на OrcaRouter по прейскурантной цене Moonshot $3.00/$15.00, передаваемой без наценки, пока вы запускаете HY4 Preview через собственный API Tencent на теневых нагрузках. Когда HY4 Preview появится на роутере, тот же ключ и те же правила отказоустойчивости будут обслуживать обе модели, а ставка Tencent ¥6/¥18 будет передаваться без изменений.


Что посмотреть
• Независимый повторный прогон заданий слепого тестирования. Показатель побед в 51,2% — самое проверяемое утверждение в этом запуске, и сторонний испытательный стенд разрешил бы этот вопрос за неделю.
• Поставляется ли HY4 Preview с функцией зрения до выхода полной версии Hy4. Именно это превратило бы данное сравнение из чисто текстового сопоставления ценности в настоящую битву флагманов.
• Стоимость за выполненную задачу на стандартных агентных средах. Обе модели потребляют много токенов; та, что дешевле за готовую задачу, побеждает в споре о продакшене.
• Ответ Kimi K3 на ценовое давление. Если Moonshot снизит тариф вывода $15, рамка «дешёвый претендент против дорогого стандарта» перевернётся.
