Титульная карточка для сравнения «Tencent HY4 Preview против Kimi K3». Центральная карточка в стиле табло гласит: «Внутренний слепой тест, 4-балльная шкала»; слева — «Tencent HY4 Preview 2.99», справа — «Kimi K3 2.94». Левая карточка «Tencent HY4 Preview» содержит: «770B / 49B активных параметров, открытые веса», «¥6 / ¥18 за 1M», «Предварительная версия, только текст». Правая карточка «Kimi K3» содержит: «2.8T / 104B активных параметров, открытые веса», «$3.00 / $15.00 за 1M», «Нативное зрение, AA Index 57». В нижнем колонтитуле указано: «Слепой тест проведён Tencent с участием 163 инженеров по 203 задачам; результаты предоставлены вендором». Логотип OrcaRouter вкомпонован в правый нижний угол.
Guides & Insights

Tencent HY4 Preview против Kimi K3: Слепой тест, который Tencent решил опубликовать

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent HY4 Preview против Kimi K3 — это единственное противостояние в рамках запуска этой модели, которое сама Tencent решила устроить. В её внутреннем слепом тесте — 163 инженера, 203 инженерные задачи, оценка по четырёхбалльной шкале — HY4 Preview набрал 2,99/4,00 против 2,94 у Kimi K3, и в заголовке Tencent это назвали победой. Мелкий шрифт этой победы стоит прочитать медленно: HY4 Preview обошёл Kimi K3 в 51,2% задач, сыграл вничью в 7,9% и проиграл в 40,9%. Чистый перевес в 10 процентных пунктов — это реально, но это узкое преимущество над моделью с третью общего количества параметров и менее чем половиной активных параметров — и весь тест проводила сама Tencent.

Kimi K3 — флагман Moonshot с открытыми весами на 2,8 триллиона параметров, крупнейшая открытая модель из когда-либо выпущенных и эталон, с которым каждая китайская лаборатория сверяется с 16 июля. Tencent выбрала её в качестве соперника, потому что она является стандартом среди моделей с открытыми весами, — что делает задачу этой статьи необычно конкретной: прочитать единственное очное сравнение, которое претендент предложил по собственной воле, и решить, чего оно стоит.

Бенчмарк, который Tencent решил опубликовать.

Слепой тест оценивали инженеры самой Tencent на собственных инженерных задачах Tencent — это первое, что стоит сбрасывать со счетов. Набор задач, составленный самой компанией, — это именно та среда, в которой новая модель показывает свой лучший возможный результат. Даже если это признать, сама структура результата показательна: 51,2% побед против 40,9% поражений — это скромное преимущество, а доля ничьих в 7,9% означает, что модели очень близки по большинству задач. На сложных задачах — тех, где фронтовая модель действительно отрывается от остальных, — разрыв остаётся там, где он всегда и бывает. И заголовок Tencent «незначительно опережает Kimi K3» сформулирован честно, чего не скажешь о публикациях каждой лаборатории.

Масштаб — не судьба

Сравнение параметров делает результат либо впечатляющим, либо подозрительным — в зависимости от ваших априорных ожиданий. Kimi K3 — это 2,8 триллиона параметров всего, из которых 104 миллиарда активных: 896 экспертов, 16 активных на токен — и она обучалась рассуждать постоянно, с открытой цепочкой рассуждений. HY4 Preview — 770 миллиардов всего и 49 миллиардов активных, треть общего масштаба и менее половины активных вычислений. То, что меньшая модель одерживает узкую победу над большей в слепом тесте, — это направление, в котором движется вся область моделей с открытым весом: Qwen3.8-Max (2,4 трлн) и GLM-5.2 (753 млрд) месяцами обмениваются ударами на агентных бенчмарках, — так что результат правдоподобен, а не из ряда вон выходящий. И, что крайне важно, он не проверен никем за пределами Tencent.

Табло

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Масштаб — HY4 Preview 770B всего / 49B активных против Kimi K3 2.8T всего / 104B активных

• Контекст — HY4 Preview >1M токенов vs Kimi K3 1M токенов

• Цена за 1M — HY4 Preview ¥6 вход / ¥18 выход (≈$0.85 / $2.50) против Kimi K3 $3.00 вход / $15.00 выход, попадания в кэш $0.30

• Модальность — HY4 Preview только текст против Kimi K3 нативный ввод изображений и видео

• Рассуждения — HY4 Preview без опубликованного режима против Kimi K3 с постоянно включенными рассуждениями и потоковой цепочкой рассуждений

• Независимая оценка — HY4 Preview: нет данных против Kimi K3 AA: Intelligence Index 57, топ-3 в мире на момент релиза.

В строках, где обе стороны указывают число, модели сближаются. Tencent сообщает для HY4 Preview результат 37,1 в APEX-Agents — практически вровень с 37,2 у Kimi K3; почти ничья, которую предсказал бы табло слепого тестирования. У Toolathlon-Verified 74,1 и DeepSWE 64,3 у HY4 Preview нет аналога у Kimi K3 в моём распоряжении, а у Kimi K3 показатели FrontierSWE 81,2, ProgramBench 77,8 и BrowseComp 91,2 не имеют эквивалента у HY4 Preview. Табло честно показывает, что две карточки почти не пересекаются, — а это само по себе предупреждение о том, что строки любого из вендоров не стоит воспринимать как полное описание модели.

Видение — это самое большое реальное различие.

Для разработчика, который выбирает между этими двумя сегодня, структурный разрыв — это не интеллект, а модальность ввода. Kimi K3 изначально мультимодальна: она принимает изображения и видео через свой энкодер MoonViT-V2 и входит в число лучших открытых моделей в задачах компьютерного зрения, занимая второе место в мировом рейтинге vision arena. Tencent HY4 Preview в этой предварительной версии работает только с текстом, и Tencent заявил, что поддержка изображений появится лишь в полном релизе. Любая задача, требующая скриншотов, понимания интерфейса или визуального анализа, по умолчанию остаётся за Kimi K3, независимо от того, что говорят слепые тесты об инженерном тексте. Если ваша работа — это чистый код, документы и вывод терминала, разрыв не имеет значения; как только задача предполагает визуальное восприятие, он определяет исход сравнения.

Вопрос стоимости

В пересчёте на токен HY4 Preview значительно дешевле: примерно $0,85/$2,50 против $3,00/$15,00 у Kimi K3, при попаданиях в кэш — ¥0,3 (примерно четыре цента) против $0,30. Но у двух моделей противоположное поведение в отношении токенов, что сокращает разрыв. Kimi K3 рассуждает постоянно и транслирует свою цепочку рассуждений, что раздувает выходные токены в каждом запросе; рецензенты отмечают, что модель медленнее — около 62 токенов в секунду — и требовательна к токенам в агентных циклах. HY4 Preview, согласно собственному релизному примечанию Tencent, «склонен к чрезмерно длинным размышлениям и избыточной самопроверке» на сложных задачах. Обе модели сжигают лишние выходные токены; HY4 Preview просто берёт за них меньше. Справедливое сравнение — это стоимость выполнения задачи, и пока никто за пределами Tencent не измерил её для HY4 Preview.

Вердикт

Tencent HY4 Preview — это более дешёвый, компактный и непроверенный претендент, заявляющий о небольшом преимуществе в слепом тестировании перед стандартом с открытыми весами; Kimi K3 — более крупный, проверенный и способный работать с изображениями действующий игрок, который стоит в четыре-пять раз дороже за токен и имеет независимый индекс интеллекта 57. Карточка бенчмарков ни одной из моделей не является полностью независимой — ключевые показатели Kimi K3 тоже предоставлены Moonshot, хотя её индекс 57 — нет. Если ваша нагрузка мультимодальна, Kimi K3 — единственный выбор в этом противостоянии. Если она текстовая и инженерная, HY4 Preview — выгодная ставка с реальным, пусть и проводимым вендором, сравнением один на один, а дешёвый путь — направить Kimi K3 на production-ключ: она доступна на OrcaRouter по прейскурантной цене Moonshot $3.00/$15.00, передаваемой без наценки, пока вы запускаете HY4 Preview через собственный API Tencent на теневых нагрузках. Когда HY4 Preview появится на роутере, тот же ключ и те же правила отказоустойчивости будут обслуживать обе модели, а ставка Tencent ¥6/¥18 будет передаваться без изменений.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

Что посмотреть

• Независимый повторный прогон заданий слепого тестирования. Показатель побед в 51,2% — самое проверяемое утверждение в этом запуске, и сторонний испытательный стенд разрешил бы этот вопрос за неделю.

• Поставляется ли HY4 Preview с функцией зрения до выхода полной версии Hy4. Именно это превратило бы данное сравнение из чисто текстового сопоставления ценности в настоящую битву флагманов.

• Стоимость за выполненную задачу на стандартных агентных средах. Обе модели потребляют много токенов; та, что дешевле за готовую задачу, побеждает в споре о продакшене.

• Ответ Kimi K3 на ценовое давление. Если Moonshot снизит тариф вывода $15, рамка «дешёвый претендент против дорогого стандарта» перевернётся.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube