Титульная карточка с надписью «GPT-6 Astra против Tencent HY4 Preview», с подзаголовком «Числа одной модели проверил кто-то другой. Числа другой — нет, и 64 000 выходных токенов — это предел, на котором дешёвая сторона останавливается», поверх сгенерированной иллюстрации: запечатанный сертифицированный куб рядом с раскрытым кубом с видимыми слоями
Guides & Insights

GPT-6 Astra против Tencent HY4 Preview: у одной модели есть журнал аудита, а у другой — таблица бенчмарков

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent HY4 Preview и GPT-6 Astra — это два самых дешёвых пути к почти передовому агентному программированию из доступных сегодня, если верить собственным цифрам поставщиков, и это две наименее сопоставимые модели в этом классе, если верить кому-либо ещё. Tencent HY4 Preview была выпущена и открыта 28 августа 2026 года под лицензией Apache 2.0, по цене $0.834 за миллион входных токенов и $2.501 за миллион выходных токенов, с архитектурой смеси экспертов на 770 миллиардов параметров, контекстным окном, превышающим миллион токенов, и потолком вывода в 64,000 токенов. GPT-6 Astra находится в общем доступе с 3 сентября 2026 года по цене $10.00 и $50.00, с окном в 1,050,000 токенов и максимальным объёмом вывода 128,000. Сильные стороны Astra подкреплены восемью опубликованными независимыми оценками; сильные стороны HY4 Preview подкреплены только собственными прогонами Tencent по работе в терминале, вызову инструментов и слепым оценкам, и больше ничем. Эта асимметрия не означает, что более дешёвая модель слабее. Она означает, что одно из этих двух сравнений можно проверить, а другое приходится принимать на веру, и практические решения в этих двух случаях различаются.

Что на самом деле даёт вам релиз Apache 2.0

Лицензия — это та часть этого противостояния, которую не способна выразить таблица цен. Tencent HY4 Preview — это не хостируемый тизер под брендом открытых весов: веса можно скачать с Hugging Face, GitHub, ModelScope и GitCode, а значит, модель переживёт любое решение Tencent относительно собственного ценообразования, собственного эндпоинта или собственного дальнейшего интереса к её обслуживанию.

• Архитектура — 770 млрд параметров всего, 49 млрд активных на токен, 78 слоёв, 256 маршрутизируемых экспертов плюс один общий эксперт и нативный слой multi-token-prediction для спекулятивного декодированияbr /> • Характеристики обслуживания — 54,6 выходных токенов в секунду и медианное время до первого токена 6,26 секунды, измеренные по маршрутам OrcaRouter за скользящее семидневное окноbr /> • Контекст и потолок — окно в 1 048 576 токенов при максимальном выводе в 64 000 токеновbr /> • Входная поверхность — только текст; без изображений, без файлов, без аудиоbr /> • Управление рассуждением — три уровня: high, low и none, причём high по умолчанию, плюс документированная рекомендация по сэмплированию: temperature 0.9 и top_p 1.0br /> • Надёжность — 2,8% ошибок за то же семидневное окно против 10,3% на маршруте Astra

Эта последняя пара чисел — самое действенное, что есть на этой странице, и это тот самый показатель, который ни один поставщик не публикует о своей собственной модели. Независимые оценки Astra по бенчмаркам выше, и за последнюю неделю её маршрут отказывал примерно в одном запросе из десяти, тогда как модель, у которой независимых оценок нет вообще, отказывала в одном из тридцати пяти. Ни один из этих показателей ничего не говорит о самих моделях — частота ошибок измеряет маршрут, ограничения скорости и апстрим, а не веса, — но это те числа, с которыми реально сталкивается продакшн-система.

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

Где показатели Tencent можно сверить с чужими

Это, судя по опубликованным данным, действительно необычная возможность: у Astra и HY4 Preview обеих есть показатель Terminal-Bench 2.1, и только один из них предоставлен вендором.

• Terminal-Bench 2.1, управление реальным терминалом — GPT-6 Astra 88,4, независимая оценка; Tencent HY4 Preview 85,4, по данным производителяbr /> • Вызов инструментов — Astra 41,4 в τ²-Banking, независимая оценка; HY4 Preview 74,1 в Toolathlon-Verified, по данным производителя, на другом тестеbr /> • Разработка ПО — HY4 Preview 64,3 в DeepSWE, рост с 28,0 у предшественника Hy3, по данным производителяbr /> • Агентные задачи — HY4 Preview 37,1 pass@1 в APEX-Agents, по данным производителяbr /> • Человеческие предпочтения — средний балл 2,99 из 4,00 по 203 инженерным задачам, оценённым 163 экспертами; исследование проводил производитель; против GLM-5.3 с 2,92 и Kimi K3 с 2,94br /> • Независимый индекс — GPT-6 Astra 54,7 в Intelligence Index и 96,1 в GPQA Diamond, от третьей стороны; эквивалентного индекса для HY4 Preview не существует

На строке Terminal-Bench стоит задержаться. Разрыв в 3 балла между независимым результатом 88,4 и заявленными производителем 85,4 вполне укладывается в диапазон, который может дать другой испытательный стенд, другой каркас или другая температура сэмплирования, а значит, честная интерпретация не «Astra лучше на три балла», а «самая дешёвая модель с открытыми весами в этом сегменте заявляет о паритете, и это заявление как минимум правдоподобно». Собственная формулировка Tencent в этом вопросе осторожна: в ней DeepSWE описывается как «постепенно сокращающий разрыв», а не как закрывающий его, и её единственное однозначное заявление о паритете — равенство на Terminal-Bench с лучшей закрытой моделью другого производителя — это ровно то заявление, которое больше всего нуждается во втором измерении.

Есть ещё одно изменение, о котором стоит знать, потому что оно меняет экономику, а не оценки. 7 сентября 2026 года Tencent добавила в действующую предварительную сборку оптимизацию, которая, по её утверждению, сокращает число шагов рассуждения и потребление токенов на задачу при сложной работе. Поскольку модель тарифицируется по токенам, меньшее число токенов на завершённую задачу снижает стоимость задачи, даже если цена за токен не изменилась. Размер этой экономии — это собственное измерение Tencent, и никто за пределами Tencent его не воспроизвёл, — но механизм реален, и именно поэтому предварительная версия, выпущенная в августе, в октябре может быть существенно дешевле в эксплуатации, чем предполагалось в её анонсе.

Потолок в 64 000 токенов — это спецификация, которая определяет развёртывания.

На середине спецификации находится ограничение, которое первым дает о себе знать, и это не качество. Максимальный объем вывода HY4 Preview — 64 000 токенов против 128 000 у Astra, причем у модели, заявленное назначение которой — агенты для программирования и длинные цепочки использования инструментов. Сгенерированный файл, патч для нескольких файлов, длинный структурированный отчет — именно эти выходные данные упираются в потолок, а при запуске агента сбой выражается не в чуть худшем ответе, а в усеченном, который окружающему пайплайну приходится обнаруживать и обрабатывать.

Обе модели принимают на вход примерно миллион токенов, так что в сценарии чтения документов действительно ничья. Разница целиком на стороне генерации, и она двукратная, а не ошибка округления. Добавьте сюда разницу во входных данных — Astra принимает изображения и файлы, HY4 Preview работает только с текстом — и вырисовывается картина четкого разделения труда, а не рейтинга: модель с открытыми весами для агентных циклов «текст на входе — текст на выходе», где результат — вызов инструмента или diff, и закрытая модель для всего, что требует взглянуть на что-то или написать что-то длинное.

Что даёт 20-кратная скорость вывода, строка за строкой

• Цена ввода — Tencent HY4 Preview $0.834 за 1 млн против GPT-6 Astra $10.00, примерно в 12 разbr /> • Цена вывода — HY4 Preview $2.501 за 1 млн против Astra $50.00, примерно в 20 разbr /> • Кэшированный ввод — HY4 Preview $0.042 за 1 млн против Astra $1.00, примерно в 24 разаbr /> • Ступень для длинных запросов — Astra переоценивает весь запрос свыше 272 000 входных токенов до $20.00 и $75.00; в карточке HY4 Preview аналогичной ступени нетbr /> • Эффективная ставка ввода при промпте на 400 000 токенов — у HY4 Preview без изменений: $0.834 против $20.00 у Astra, примерно в 24 разаbr /> • Стоимость миллиона токенов обычного цикла агента при соотношении ввода к выводу 4:1 — у HY4 Preview примерно $1.17 против примерно $18.00 у Astrabr /> • Стоимость месяца на 100 миллионов токенов при том же соотношении — у HY4 Preview примерно $117 против примерно $1 800 у Astra

Строка кэшированного ввода — это та, что масштабируется хуже всего для дорогой стороны, потому что агентные циклы повторно отправляют один и тот же системный промпт и префикс диалога на каждом шаге. При $0,042 против $1,00 самые дешёвые токены длинного цикла в 24 раза дешевле на модели Tencent, и это именно та нагрузка, где небольшая разница в цене за токен накапливается быстрее всего. Стоимость за задачу — метрика, которая позволила бы чисто закрыть этот вопрос, — Tencent вообще не публикует, так что единственный способ получить число, которое имеет значение, — прогнать обе модели через ваш собственный набор задач и прочитать объект usage.

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

Что здесь добавляет маршрутизатор, имея на руках показатели ошибок

Обе модели есть в каталоге OrcaRouter — tencent/hy4-preview и openai/gpt-6-astra — за одним OpenAI-совместимым эндпоинтом, каждая по собственной прайсовой ставке провайдера, переданной с наценкой 0%. Эта последняя деталь важнее именно для этой пары, чем для большинства других, ведь прайсовая ставка модели Tencent публикуется в юанях: долларовые цифры выше — это сконвертированная ставка, которую вы действительно видите, а не наценка реселлера, и если Tencent изменит цену, это отразится здесь в тот же день, а не при следующем продлении контракта.

DSL маршрутизации — это то место, где две модели перестают быть альтернативами. Естественное правило для этой пары — эскалация по выходу: отправляйте цикл в дешёвую модель, и когда ответ возвращается усечённым из-за потолка в 64 000 токенов или не проходит вашу проверку схемы, повторите этот шаг на openai/gpt-6-astra, у которой вдвое больше места для вывода. Автоматическое переключение при сбое — вторая половина аргумента, и это не теоретическое соображение, когда один из двух маршрутов за прошедшую неделю выдавал ошибку на одном запросе из десяти — долгий запуск агента, привязанный к одной модели, умирает вместе со своим накопленным контекстом, и ни одна из этих моделей не настолько дешева, чтобы случайно перезапустить всё с самого начала.

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

Что бы изменило это сравнение?

Три вещи — в порядке того, насколько сильно они могли бы изменить ситуацию. Независимая оценка HY4 Preview: модель публично доступна уже шесть недель, у неё нет стороннего индекса, нет воспроизведённого результата Terminal-Bench и нет данных о стоимости за задачу, а единственная слепая оценка, проведённая самим вендором, — это все существующие данные о предпочтениях людей. Опубликованная стоимость за выполненную задачу для обеих моделей, которая заменила бы все соотношения в этой статье одним числом. И решение Tencent по стороннему инференсу, потому что веса под Apache 2.0 может обслуживать кто угодно, и как только конкурирующие хосты развернут HY4 Preview, цена на дешёвой стороне этого сравнения станет рынком, а не прайс-листом.

До тех пор пригодная к использованию сводка уже, чем пост о запуске любого из двух вендоров, и честнее, чем табло: GPT-6 Astra — это модель, заявления о возможностях которой проверены, с вдвое более высоким потолком вывода и маршрутом, который сбоит в одном запросе из десяти. Tencent HY4 Preview — это модель, заявления о возможностях которой не проверены, с опубликованной архитектурой, открытой лицензией, ценой в три раза ниже и гораздо более низкой долей ошибок за тот же период. Если ваша работа — это текст на входе и текст на выходе и укладывается в 64 000 сгенерированных токенов, более дешёвая модель — не компромисс, а правильный ответ, и единственное, чем вы жертвуете, — это аудиторский след.

Естественное правило для этой пары — эскалация на выходе: отправляйте цикл дешёвой модели, и когда ответ возвращается усечённым относительно потолка в 64 000 токенов или не проходит проверку вашей схемы, повторяйте этот шаг с openai/gpt-6-astra, у которой вдвое больше места для вывода.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно