Главная титульная карточка для сравнения 'Tencent HY4 Preview vs GPT-5.6 Sol'. Центральный акцент гласит: 'Toolathlon-Verified 74.1 — заявка на открытые веса против фронтира', с примечанием: 'Tencent сообщает, что её модель опережает GPT-5.6 Sol в агентном вызове инструментов'. Левая карточка 'Tencent HY4 Preview' перечисляет: 'Открытые веса, 770B / 49B активных', '¥6 / ¥18 за 1M', 'Нет независимых оценок'. Правая карточка 'GPT-5.6 Sol' перечисляет: 'Закрытый API, флагман OpenAI', '$4 / $20 базовая за 1M', 'Terminal-Bench 2.1: 88.8'. В нижнем колонтитуле указано: 'Показатели HY4 Preview предоставлены вендором; показатели Sol широко воспроизведены.' Логотип OrcaRouter размещён в правом нижнем углу.
Guides & Insights

Tencent HY4 Preview против GPT-5.6 Sol: заявление о вызове инструментов, которое противопоставляет открытые веса передовым моделям.

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent HY4 Preview — первая за несколько месяцев модель с открытыми весами, чья карточка запуска прямо заявляет о победе над GPT-5.6 Sol. Речь идёт о показателе Toolathlon-Verified — бенчмарке для агентного вызова инструментов, где Tencent сообщает о результате HY4 Preview в 74.1, что выше, чем у Qwen3.8-Max, и, по собственному сравнению Tencent, выше, чем у GPT-5.6 Sol. По всем остальным параметрам эти две модели не являются действительно сопоставимыми: GPT-5.6 Sol — закрытая флагманская фронтирная модель OpenAI с независимыми замерами, а Tencent HY4 Preview — превью с открытыми весами на 770 миллиардов параметров, выпущенное сегодня утром с отчётом от производителя и без сторонней проверки.

Итак, интересный вопрос не в том, «какая модель умнее», — а в том, способен ли конкурент с открытым весом при цене ввода примерно в шесть раз ниже, чем у Sol, убедительно претендовать на долю на переднем крае, и что команде делать с утверждением, которое сейчас невозможно проверить.

Утверждение, которое превращает это в настоящее противостояние

Toolathlon-Verified измеряет, насколько надежно модель управляет инструментом в рамках полной агентной задачи — читая результаты, принимая решение о следующем вызове, восстанавливаясь после ошибок, — а не то, насколько хорошо она пишет отдельную функцию. Это важно, потому что наибольшая доля реальных расходов на API на передовых моделях приходится на агентные циклы, а не на одноразовые завершения. Показатель Tencent 74.1 в этом бенчмарке — то самое конкретное утверждение, которое поместило HY4 Preview в разговор GPT-5.6 Sol, и над ним стоит задуматься: это число такого рода, которое, если оно подтвердится при независимом воспроизведении, делает разговор о стоимости открытых весов и закрытых передовых моделей реальным. Если же оно не подтвердится, это становится очередной вендорской таблицей результатов, которая испаряется под сторонним тестовым окружением.

Два способа купить интеллект

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Параметры — HY4 Preview (770B всего / 49B активных, открытые веса) против GPT-5.6 Sol (количество параметров не раскрыто, закрытый API)

• Контекст — HY4 Preview >1M токенов против GPT-5.6 Sol 1.05M токенов, 128K максимальный вывод

• Цена за 1M — HY4 Preview ¥6 вход / ¥18 выход (≈$0.85 / $2.50) против GPT-5.6 Sol $4.00 / $20.00 на базовом тарифе, возрастая до $8.00 / $30.00 для запросов с большим контекстом, чтение кэша $0.40

• Модальности ввода — HY4 Preview в этой предварительной версии поддерживает только текст, а GPT-5.6 Sol — ввод текста и изображений.

• Режимы рассуждений — HY4 Preview: опубликованного эквивалента нет; GPT-5.6 Sol: Ultra-режим (до 16 параллельных субагентов) и Max reasoning effort

• Независимая проверка — HY4 Preview пока отсутствует, тогда как GPT-5.6 Sol присутствует во всех крупных лидербордах, с рейтингом в контексте 1,05M, входящим в верхний ярус составных тестов на длинный контекст.

Ценовая колонка — вот где разворачивается всё соперничество. На базовом уровне GPT-5.6 Sol стоит $4,00 за миллион входных токенов и $20,00 за миллион выходных токенов. Tencent HY4 Preview стоит около $0,85 и $2,50 по текущему курсу. Для нагрузки, которая генерирует много выходных токенов — а именно так работает агентное кодирование, — модель с открытыми весами стоит примерно в восемь раз дешевле закрытой, и этот разрыв сохраняется даже с учётом оговорки, что цифры Sol подкреплены гораздо более серьёзной проверкой.

Где {{1}}GPT-5.6 Sol{{/1}} по-прежнему удерживает преимущество

Верификация — это первое преимущество. GPT-5.6 Sol доступен для всех с 9 июля, и с тех пор его показатели независимо измерялись: 88.8 на Terminal-Bench 2.1 при базовом режиме рассуждений, 91.9 в режиме Ultra, 53.6 на Agents' Last Exam (рекорд на момент выпуска), 94.6 на GPQA Diamond и 64.6 на SWE-bench Pro. Ope​nAI также сообщает о 54%-ном улучшении эффективности использования токенов при решении задач агентного программирования по сравнению со своей предыдущей флагманской моделью. Это цифры, которые можно найти воспроизведёнными за пределами собственной документации Ope​nAI, — именно этого свойства сегодня не хватает Tencent HY4 Preview.

Возможности — это второе преимущество, и оно носит структурный, а не маргинальный характер. GPT-5.6 Sol принимает изображения на вход; HY4 Preview в этой предварительной версии работает только с текстом, а Tencent признаёт, что поддержку зрения придётся ждать до полного релиза. GPT-5.6 Sol поставляется с режимом Ultra — мультиагентной конфигурацией, которая координирует параллельных субагентов при затратах токенов в три-четыре раза выше, что полезно именно для долгосрочных инженерных задач, где эти две модели действительно могли бы конкурировать. Кроме того, пути использования компьютера и программного вызова инструментов у Sol документированы, проверены в производственных масштабах и протестированы под нагрузкой. Заявление Tencent о Toolathlon-Verified, если оно подтвердится, сокращает разрыв в использовании инструментов; но оно не закрывает мультимодальные и мультиагентные разрывы, которые HY4 Preview даже не пытается устранить.

Где HY4 Preview действительно интересен

Отбросим в сторону театр бенчмарков — и останутся три реальные вещи. Первое — цена: при ¥6/¥18 (примерно $0,85/$2,50) Tencent демпингует на выходных токенах в четыре-восемь раз по сравнению с западными передовыми моделями, а на входных — по сравнению со своими китайскими аналогами с открытыми весами. Второе — открытые веса: MoE с 49B активных параметров можно развернуть на одном узле так, как никогда не получится с нераскрытой архитектурой Sol, и веса уже доступны на HuggingFace, ModelScope и GitHub. Третье — контекст и инженерная траектория: DeepSWE 64.3 и контекстное окно размером более 1M направлены на те же долгосрочные агентные нагрузки, на которые нацелен режим Ultra от Sol, но за малую долю стоимости.

Честная оговорка: ничто из этого не прошло проверку независимым бенчмарком. История самооптимизации, которую рассказывает Tencent — прирост сквозной пропускной способности на 31,8% за счёт того, что модель сама итерировала свой инференс-стек, — измерена внутренне. Победа в слепом тесте над GLM 5.3 и Kimi K3 также получена внутренними силами. Всё интересное в HY4 Preview на сегодняшний день — это лишь заявления.

Решение

Если вы сегодня строите production-систему, GPT-5.6 Sol — обоснованный выбор, и он доступен через OrcaRouter по собственной tier-цене Ope​nAI — $4.00/$20.00 на базовом тарифе, $8.00/$30.00 выше него, без какой-либо наценки, так что любое изменение цены вендором отражается у нас в тот же день. Если ваш workflow агентный и с интенсивным использованием инструментов, tier-структура означает, что вам следует проверять фактические размеры входных данных относительно порога в $272K токенов, а не рассчитывать на фиксированную ставку.

Если вы готовы провести теневую оценку, HY4 Preview достаточно дёшев, чтобы оправдать полноценную: направьте сегодня свой трафик вызовов инструментов через Sol, прогоните те же промпты через HY4 Preview с помощью собственного API Tencent и сравните результаты на своих задачах в стиле Toolathlon. И если независимые оценки совпадут с заявленными Tencent, путь перехода короток: модель с открытым весом встаёт в маршрутизатор, ваше правило аварийного переключения меняет конечные точки, а тариф вендора ¥6/¥18 передаётся без изменений. Такова честная структура этого противостояния: проверенная передовая модель, на которой можно строить уже сегодня, против непроверенного открытого соперника, который достаточно дёшев для тестирования и призван перевести разговор о цене на весь класс моделей с открытым весом.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Что посмотреть

• Первое независимое воспроизведение Toolathlon-Verified. Если сторонний харнесс подтвердит результат HY4 Preview в районе 70 баллов, аргумент о том, что «открытые веса не способны на агентное использование инструментов», рушится.

• Добавит ли Tencent поддержку зрения до полного выпуска Hy4. Текстовый режим ограничивает HY4 Preview строгим подмножеством задач, которые обрабатывает GPT-5.6 Sol.

• Фактические счета за токены из-за склонности HY4 Preview к длительным размышлениям. При ¥18 за миллион выходных токенов многословная самопроверка съедает ценовое преимущество быстрее, чем на модели за $20.

• Увидит ли многоуровневая ценовая политика Sol ещё одно снижение до полного запуска Hy4. Сквозное прохождение через роутер означает, что падение видно в тот же день.

Сравнение в этой статье2

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube