
Tencent HY4 Preview против Qwen3.8-Max: августовская битва моделей с открытыми весами
- AlibabaНОВИНКАQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.3 Flash2026-08-2658Интеллект72Кодинг
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
Tencent HY4 Preview против Qwen3.8-Max — это столкновение, к которому шёл этот месяц. Qwen3.8-Max от Alibaba вышел в общий доступ 3 августа и стал первой Max-классовой Qwen с открытыми весами 12 августа; Tencent HY4 Preview появился этим утром, 25 днями позже, с презентационной карточкой, которая напрямую называет Qwen3.8-Max — Tencent заявляет для HY4 Preview результат 74.1 на Toolathlon-Verified, опережая Qwen3.8-Max на этом бенчмарке. Обе модели — китайские флагманы с открытыми весами, обе имеют агрессивное ценообразование, и только у одной из них есть независимые оценки.
Эти две модели разделяет не только масштаб — у Qwen3.8-Max 2,4 триллиона параметров против 770 миллиардов у HY4 Preview — но на агентных бенчмарках, которые имеют значение для покупателя, они целятся в одну мишень: длительные автономные задачи, где модель читает, вызывает инструменты и итерирует без участия человека в цикле. Это ровно та территория, где августовское поколение моделей с открытыми весами пытается доказать, что способно заменить закрытые фронтирные модели, и первым ходом Tencent стал выпад в сторону крупнейшего открытого релиза месяца.
Табло

• Масштаб — HY4 Preview 770B всего / 49B активных против Qwen3.8-Max 2.4T всего / ~95B активных
• Контекст — HY4 Preview >1M токенов против Qwen3.8-Max 1M токенов в API (262K нативно в открытых весах, расширяемый до ~1.01M)
• Цена за 1M — HY4 Preview ¥6 за вход / ¥18 за выход (≈$0.85 / $2.50) против Qwen3.8-Max $2.00 за вход / $6.00 за выход, чтение кэша $0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (по данным производителя) против Qwen3.8-Max 86.6
• Модальность — в версиях с открытым весом обе модели работают только с текстом; API Qwen3.8-Max добавляет ввод изображений и видео, а превью-версия HY4 Preview — нет.
• Независимая оценка — HY4 Preview: нет оценки против Qwen3.8-Max: AA, индекс интеллекта 58, агентный индекс 58
Эти две карточки рассказывают одну и ту же историю с противоположных сторон. На Terminal-Bench 2.1 результаты Qwen3.8-Max и HY4 Preview — 86,6 и 85,4 соответственно — разделяет полтора балла: один балл в пользу Qwen, причём показатель HY4 не проходил независимую проверку. По цене за токен HY4 Preview дешевле как на входе, так и на выходе. Что касается верификации, у Qwen3.8-Max есть независимые показатели: Intelligence Index — 58 и Agentic Index — 58; у HY4 Preview нет ничего, кроме собственных пресс-релизов. Этот разрыв — классическая картина: претендент выходит на рынок с более низкими ценами и неподтверждёнными заявлениями против проверенного действующего лидера.
Чтение заявления Toolathlon
Toolathlon-Verified измеряет надёжность агентного использования инструментов — насколько последовательно модель проводит инструмент через полную задачу с ошибками, восстановлением и многошаговыми вызовами. Результат Tencent — 74.1 — нацелен прямо на самую сильную часть профиля Qwen3.8-Max, потому что её Agentic Index, равный 58, и 86.1 на OSWorld-Verified — это цифры, которые сделали агентную заявку Alibaba убедительной. Qwen3.8-Max также показывает 82.8 на IFBench (следование инструкциям) и 93.0 на PaperBench (агентная работа исследовательского уровня), по обоим показателям превосходя такие модели, как GPT-5.6 Sol, в собственных таблицах вендора. Поэтому Tencent выбрал единственный бенчмарк, где заявляет о прямой победе над крупнейшей открытой моделью месяца, — и это заявление сейчас настолько же проверяемо, как и любая другая строка отдельного вендора: никак.
Проверено по сравнению с указанным поставщиком
Это та ось, на которой сравнение наименее честно, и об этой асимметрии стоит сказать прямо. Индекс интеллекта Qwen3.8-Max — 58 — получен от Artificial Analysis, его агентный индекс — 58 — тоже от Artificial Analysis, и те же независимые стенды, которые дали ему эти оценки, также измерили его слабости: 40% галлюцинаций на AA-Omniscience против 23% у предыдущего поколения, и целых 64 агентных шага на задачу — модель работает усердно, и вы платите за каждый шаг. У Tencent HY4 Preview нет ничего из этого инструментария. Его сильные стороны — это заявления, а его режимы сбоев — Tencent сам отмечает длительное обдумывание и чрезмерную самопроверку — это признания, а не измерения.
Для команды, выбирающей между этими двумя, пробел в верификации не является абстрактным. Поведение Qwen3.8-Max — 64 итерации на задачу — это реальный, измеренный фактор затрат: при цене $2/$6 он всё ещё остаётся самым дорогим агентом за выполненную задачу в некоторых сторонних сравнениях, и команды сообщают, что количество итераций съедает его ценовое преимущество. Эквивалентное поведение HY4 Preview неизвестно — он может оказаться дешевле в расчёте на задачу, чем следует из его и без того низкой цены за токен, а может, его привычка к самопроверке поглотит эту разницу. Никто пока не может сказать, какой именно вариант вас ждёт, потому что никто за пределами Tencent его не запускал.
Цена и практические аспекты open-weights
В пересчёте на токен HY4 Preview дешевле по обеим статьям: ¥6/¥18 против $2.00/$6.00 у Qwen3.8-Max, а попадания в кэш — ¥0.3 против $0.25. Это делает HY4 Preview самым дешёвым открытым флагманом как по входу, так и по выходу, и точка. Но у «открытых весов» есть два разных набора условий мелким шрифтом. Релиз открытых весов Qwen3.8-Max — Qwen3.8-2.4T-A95B — только текст, с принудительно включённым thinking, родным контекстом 262K вместо 1M в API и собственной лицензией с условиями по уровням масштаба: требование указывать название модели при более 100 млн месячных пользователей и отдельная лицензия для крупного бизнеса Model-as-a-Service. Веса Tencent HY4 Preview доступны на HuggingFace, ModelScope и GitHub с сегодняшнего утра, но точные условия лицензии и то, соответствуют ли веса обслуживаемому API, не заявлены с такой же ясностью. Обе модели можно скачать; ни одна из них не ставится по принципу «загрузил и работает».
Суть
Qwen3.8-Max — более безопасный выбор во всех аспектах, где проверка даёт безопасность: независимая оценка по интеллекту и агентной работе, известные режимы отказов, устоявшаяся лицензия и три недели обратной связи из продакшена. В пересчёте на токен это также более дорогой вариант, а её измеренная склонность к многоходовым диалогам — известный ценовой риск. Tencent HY4 Preview — выгодная ставка: дешевле и по входным, и по выходным токенам, сопоставимая заявка по Terminal-Bench и прямая заявка на Toolathlon-Verified против Qwen — но всё это без проверки с первого дня. Если вы выводите модель с открытыми весами в продакшен на этой неделе, Qwen3.8-Max — обоснованный выбор: она уже доступна на OrcaRouter по прейскурантной цене Alibaba — $2.00/$6.00, без наценки. HY4 Preview — проект для оценки: прогоните её через API самого Tencent на своих задачах в стиле Toolathlon, оставьте продакшен на проверенной модели, и когда появятся независимые оценки — или когда HY4 Preview дойдёт до роутера и её тариф ¥6/¥18 будет передаваться без наценки с того же дня — замена будет правилом маршрутизации, а не переписыванием.


Что посмотреть
• Первый независимый запуск HY4 Preview на агентном стенде. Оценка Toolathlon-Verified 74.1 — это цифра, которую Tencent хочет получить; сторонний Agentic Index стал бы подтверждением.
• Измеренное количество ходов (turn count) HY4 Preview. 64 хода на задачу у Qwen3.8-Max — это предостерегающий пример; является ли HY4 Preview более дешёвым в расчёте на выполненную задачу — и есть весь экономический аргумент.
• Лицензионные условия для весов. Они определят, означает ли «открытый» «пригодный для вашего масштаба» для HY4 Preview, так же, как условия лицензии Qwen3.8-Max определили это для модели Alibaba.
• Снизит ли кто-либо из вендоров цену снова. В месяц, когда два флагмана с открытыми весами вышли с агрессивным ценообразованием, сквозное снижение цены на роутере делает любое дальнейшее снижение заметным в тот же день.
Сравнение в этой статье2
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
