Сгенерированная hero-карточка под названием Claude Sonnet 5.5 vs Tencent HY4 Preview, с подзаголовком: обе лаборатории продают счёт за токены, с тремя карточками статистики: цена вывода за 1 млн — $10.00 против $2.50, веса закрытые против Apache 2.0, и измеренная скорость вывода — 138.7 против 22.3 токенов в секунду, с нижним колонтитулом: цена и скорость Tencent HY4 Preview по каталогу OrcaRouter, в списке поставщиков — 6 / 18 юаней за миллион; Claude Sonnet 5.5 — от Anthropic.
Guides & Insights

Claude Sonnet 5.5 против Tencent HY4 Preview: обе лаборатории продают счёт за токены

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Два запуска с разницей в шесть недель, обещающие одно и то же разными словами. Утверждение вендора состоит в том, что Claude Sonnet 5.5, выпущенный 28 сентября 2026 года, стоит «до 30% меньше на задачу», чем Claude Sonnet 5, при неизменных ставках за токен. Второе утверждение — что оптимизация от 7 сентября в hosted-сборке Tencent HY4 Preview, впервые выпущенной и открытой 28 августа 2026 года, сокращает число шагов рассуждения и потребление токенов на задачу при том же качестве выполнения задачи. Ни один из вендоров не повышал и не понижал цену, чтобы сделать это утверждение. Оба говорят вам, что теперь продукт — это токены, и интересная часть этого противостояния в том, что только одно из двух утверждений можно проверить по опубликованному показателю на задачу — потому что только у одной из этих двух моделей есть независимое измерение для такой проверки.

Эта асимметрия — не упрёк Tencent. У HY4 Preview нет страницы модели на Artificial Analysis, нет независимой оценки Intelligence Index и нет показателя стоимости за задачу от какой-либо третьей стороны. Что у него есть — это таблица бенчмарков от вендора: Terminal-Bench 2.1 — 85,4, DeepSWE — 64,3, внутренняя слепая оценка на 203 инженерных задачах, где он набрал в среднем 2,99 против 2,92 у GLM-5.3 и 2,94 у Kimi K3, — а также публичный дебют с голосованием сообщества в таблице лидеров WebDev Arena, где Tencent сообщает, что он занял примерно пятое место в общем зачёте и третье среди открытовесовых моделей. Все это — реальные сигналы. Ни один из них не является стоимостью за задачу, а значит, точное число, за которое конкурируют оба вендора, для HY4 Preview недоступно.

Что на самом деле выпустила каждая сторона

Tencent HY4 Preview — это смесь экспертов на 770 миллиардов параметров, с 49 миллиардами активных на токен, 78 слоями, 256 маршрутизируемыми экспертами плюс один общий эксперт, нативным слоем MTP для спекулятивного декодирования и контекстным окном, превышающим миллион токенов. По дизайну он работает только с текстом — Tencent создавала его для кодинг-агентов, сложного использования инструментов и продуктивной работы, а не для изображений — и по умолчанию применяет интенсивные рассуждения с тремя настраиваемыми уровнями (high, low, none) и рекомендованной производителем настройкой сэмплирования temperature 0.9 и top_p 1.0. Веса распространяются под Apache 2.0 и доступны для скачивания на Hugging Face, GitHub, ModelScope и GitCode. Изначально Tencent отметила в превью две шероховатости — трату большего времени на размышления, чем необходимо, и чрезмерную проверку собственной работы, — и обновление от 7 сентября нацелено именно на них.

Claude Sonnet 5.5 — вторая модель поколения 5.5 от A​nthropic и та, которую она позиционирует как лучшее сочетание скорости и интеллекта в линейке. Один миллион токенов контекста, 128 000 выходных токенов синхронно и 300 000 в Message Batches API, ввод текста, изображений и файлов, адаптивное мышление с выбираемым уровнем усилий, отсечка знаний — июнь 2026 года, нулевое хранение данных доступно с момента запуска, а вывод из эксплуатации — не ранее 28 сентября 2027 года. Тарифная сетка не изменилась по сравнению с Claude Sonnet 5: $2,00 за миллион входных токенов, $10,00 за миллион выходных, $0,20 за чтение из кэша и $2,50 за запись в кэш. Закрытые веса, API A​nthropic, а также Bedrock, Goo​gle Cloud и Microsoft Foundry.

Поставьте эти две друг против друга — и позиции окажутся почти симметричными:

• Цена — Claude Sonnet 5.5 $2.00 за вход / $10.00 за выход за миллион против Tencent HY4 Preview $0.83 за вход / $2.50 за выход в нашем каталоге, из прайс-листа вендора ¥6 / ¥18

• Чтение из кэша — Claude Sonnet 5.5 $0.20 за миллион против Tencent HY4 Preview $0.042 за миллион по нашему каталогу

• Веса — Claude Sonnet 5.5 закрытые, в отличие от Tencent HY4 Preview Apache 2.0, доступного для скачивания

• Контекст — Claude Sonnet 5.5: 1 000 000 токенов против Tencent HY4 Preview: 1 048 576 токенов — практически идентичны

• Максимальный объём вывода — Claude Sonnet 5.5: 128 000 синхронно, 300 000 в Batches, против Tencent HY4 Preview: 64 000 в нашем каталоге

• Модальность ввода — Claude Sonnet 5.5: текст, изображения и файлы, против Tencent HY4 Preview: только текст

• Независимые оценки — Claude Sonnet 5.5: Intelligence Index 56, $7,60 за задачу, редакция v4.3.2, в сравнении с Tencent HY4 Preview — данные не опубликованы

• Измеренная скорость вывода — Claude Sonnet 5.5 138,7 токенов/с, Tencent Hunyuan 22,2 токенов/с на нашем собственном трафике

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

Утверждение, которое делают обе лаборатории, и почему одну из них можно проверить

«на 30 % меньше на задачу» от Anthropic и «меньше шагов рассуждения, ниже потребление токенов» от Tencent — это один и тот же инженерный проект, описанный с двух сторон: заставить модель тратить меньше токенов, приходя к тому же ответу. Anthropic прямо указывает, что тарифы не изменились, а значит, любая экономия на задачу должна происходить за счёт количества токенов — и независимый рейтинг позволяет увидеть форму проблемы, а не масштаб исправления. Claude Sonnet 4.5 генерирует 440 миллионов токенов в рамках оценки Intelligence Index против 117 миллионов у MiniMax M3 и 39 миллионов у Grok 4.5. Это многословная модель, и это измерено в рейтинге, который публикует это число. Что бы ни представляло собой 30-процентное улучшение по сравнению с Claude Sonnet 4, оно применяется к очень большой базе.

Для HY4 Preview эквивалентного показателя публично не существует. Собственная заметка Tencent об оптимизации — единственное описание этого, и в ней результат приводится без числа: меньше ходов, меньше входных и выходных токенов, то же качество, подтверждённое метриками бенчмарков и человеческой оценкой в два прохода. Это заявление вендора в строгом смысле — заявлено, правдоподобно, не воспроизведено — и здесь оно обозначено именно так. Принять preview-модель, полагаясь на заявление вендора об экономике токенов, когда экономику токенов невозможно измерить извне, — это ровно та ставка, которую preview-релиз предлагает вам сделать.

Ещё одна деталь, о которой стоит знать, прежде чем кто-либо запланирует развёртывание на собственных серверах с опорой на эту оптимизацию. Изменение T​encent от 7 сентября применяется к сборке, которую T​encent предоставляет на своих собственных хостинговых эндпоинтах. Снимок открытых весов не был обновлён — дата последнего изменения в репозитории Hugging Face по-прежнему 28 августа — поэтому копия весов, размещённая на собственных серверах, воспроизводит исходное поведение с более длинными рассуждениями, о котором предупреждали заметки к предварительной версии. Оптимизированная версия и версия для скачивания — это не один и тот же артефакт.

Там, где открытые веса действительно окупаются, — это всё то же место, что и всегда: развёртывание, которое не может обращаться к API. Модель с 770 млрд параметров и 49 млрд активных — это решение уровня дата-центра, а не рабочей станции, так что это не та история класса ноутбуков, которую рассказывает модель на 30 млрд, — но для покупателя, которому нужна модель внутри собственного периметра, Apache 2.0 в таком масштабе — это вариант, который Claude Sonnet 5.5 не предлагает ни за какую цену.

Пробуем превью, не завязывая на него продакшн-путь

Модели предварительного просмотра — это тот случай, когда маршрутизация перестаёт быть оптимизацией затрат и становится управлением рисками. Причина помещать сборку предварительного просмотра за маршрутизатор, а не вызывать её напрямую, заключается в том, что предварительный просмотр по определению может измениться у вас под ногами, и две вещи, которые вам нужны от слоя перед ним, — это процентное разделение и нечто, что перехватывало бы сбои.

Такова схема, которую предлагает OrcaRouter: одна совместимая с OpenAI конечная точка, охватывающая более 200 моделей, цена из прайс-листа провайдера передаётся без наценки, автоматическое переключение при сбое между вышестоящими провайдерами, а также DSL маршрутизации для составления вызовов из нескольких моделей. Tencent HY4 Preview уже сегодня можно маршрутизировать здесь как tencent/hy4-preview по цене $0,83 за ввод и $2,50 за вывод за миллион токенов при $0,042 за чтение из кэша в пределах окна в 1 048 576 токенов — та же сборка, по тарифу провайдера, доступная по ключу, который вы уже используете для всего остального в каталоге. Claude Sonnet 5 здесь тоже можно маршрутизировать, по цене A​nthropic — $2,00 и $10,00, и так с 30 июня; он становится очевидным партнёром для отказоустойчивости, пока модель, которой всего день, накапливает доказательства в продакшене.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 сам по себе не в нашем каталоге. Он вышел вчера, маршрут к нему — собственный API A​nthropic, и эта страница не собирается утверждать обратное — смысл рекомендаций по маршрутизации в том, что безопасный способ запустить в производство совершенно новый уровень — дать ему долю трафика, за которой стоит что-то проверенное, и это работает только тогда, когда оба конца схемы находятся там, откуда можно добраться из одного места. HY4 Preview несёт здесь 372 тысячи токенов трафика в неделю — так выглядит двухдневный превью, пока никто ещё не взял на него обязательств; Claude Sonnet 5 несёт 7,9 миллиона в неделю с 30 июня, и это разница между кандидатом и надёжной основой.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

Куда на самом деле уходят деньги

Только по тарифам HY4 Preview в четыре раза дешевле Claude Sonnet 5.5 на выводе и почти в пять раз дешевле на чтении из кэша, и при этом не уступает по размеру окна. А вот по замерам Claude Sonnet 5.5 генерирует вывод в шесть раз быстрее на нашем собственном трафике — 138,7 токена в секунду против 22,3, — и это как раз тот разрыв, который превращает четырёхкратное преимущество в тарифах в куда более скромное преимущество по реальному времени, а иногда и в проигрыш, если принять в расчёт ожидание в очереди.

Между этими двумя фактами решение опирается на четыре вопроса, на которые может ответить только читатель. Требует ли работа изображения или файла в промпте? HY4 Preview работает только с текстом — и на этом обсуждение заканчивается. Нужно ли ей выполнить многошаговую задачу по разработке ПО, где показатель HY4 Preview в Terminal-Bench 2.1, равный 85.4, — это собственная цифра Tencent, и она невоспроизведена? Тогда статус preview — это риск, который вы принимаете, а оптимизацию от 7 сентября стоит перепроверить, а не доверять ей. Должна ли рабочая нагрузка выполняться внутри вашего собственного периметра? Тогда решающим фактом являются веса Apache 2.0. И важнее ли совокупный уровень возможностей, чем тариф? Тогда независимо измеренный показатель Claude Sonnet 5.5, равный 56, — это число, которое нужно взвесить, при $7.60 за задачу Index, с оговоркой, что на стороне Tencent не существует эквивалентного показателя для сравнения.

Что на самом деле демонстрируют оба запуска — это то, что фронтир ушёл от прайс-листов. Две лаборатории с разницей в шесть недель выпустили модели и выдвинули на первый план потребление токенов на задачу, а не цену за миллион, и практическое следствие для покупателя таково: полезной цифры больше нет ни на странице цен одного вендора, ни на странице цен другого. Это количество токенов, которое производит ваша собственная рабочая нагрузка, измеренное на обеих моделях, и это единственная цифра в этой статье, которую ни один из вендоров не может вам дать.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно