
Claude Sonnet 5.5 против Tencent HY4 Preview: обе лаборатории продают счёт за токены
- typesafeНОВИНКАTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 931 tok/s
- OpenAIНОВИНКАOpenAI: GPT-6 Luna2026-09-2237Интеллект
- OpenAIНОВИНКАOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicНОВИНКАAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIНОВИНКАGrok 4.72026-09-2146Интеллект
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов · 192 tok/s
- OrcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- xAISpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
Два запуска с разницей в шесть недель, обещающие одно и то же разными словами. Утверждение вендора состоит в том, что Claude Sonnet 5.5, выпущенный 28 сентября 2026 года, стоит «до 30% меньше на задачу», чем Claude Sonnet 5, при неизменных ставках за токен. Второе утверждение — что оптимизация от 7 сентября в hosted-сборке Tencent HY4 Preview, впервые выпущенной и открытой 28 августа 2026 года, сокращает число шагов рассуждения и потребление токенов на задачу при том же качестве выполнения задачи. Ни один из вендоров не повышал и не понижал цену, чтобы сделать это утверждение. Оба говорят вам, что теперь продукт — это токены, и интересная часть этого противостояния в том, что только одно из двух утверждений можно проверить по опубликованному показателю на задачу — потому что только у одной из этих двух моделей есть независимое измерение для такой проверки.
Эта асимметрия — не упрёк Tencent. У HY4 Preview нет страницы модели на Artificial Analysis, нет независимой оценки Intelligence Index и нет показателя стоимости за задачу от какой-либо третьей стороны. Что у него есть — это таблица бенчмарков от вендора: Terminal-Bench 2.1 — 85,4, DeepSWE — 64,3, внутренняя слепая оценка на 203 инженерных задачах, где он набрал в среднем 2,99 против 2,92 у GLM-5.3 и 2,94 у Kimi K3, — а также публичный дебют с голосованием сообщества в таблице лидеров WebDev Arena, где Tencent сообщает, что он занял примерно пятое место в общем зачёте и третье среди открытовесовых моделей. Все это — реальные сигналы. Ни один из них не является стоимостью за задачу, а значит, точное число, за которое конкурируют оба вендора, для HY4 Preview недоступно.
Что на самом деле выпустила каждая сторона
Tencent HY4 Preview — это смесь экспертов на 770 миллиардов параметров, с 49 миллиардами активных на токен, 78 слоями, 256 маршрутизируемыми экспертами плюс один общий эксперт, нативным слоем MTP для спекулятивного декодирования и контекстным окном, превышающим миллион токенов. По дизайну он работает только с текстом — Tencent создавала его для кодинг-агентов, сложного использования инструментов и продуктивной работы, а не для изображений — и по умолчанию применяет интенсивные рассуждения с тремя настраиваемыми уровнями (high, low, none) и рекомендованной производителем настройкой сэмплирования temperature 0.9 и top_p 1.0. Веса распространяются под Apache 2.0 и доступны для скачивания на Hugging Face, GitHub, ModelScope и GitCode. Изначально Tencent отметила в превью две шероховатости — трату большего времени на размышления, чем необходимо, и чрезмерную проверку собственной работы, — и обновление от 7 сентября нацелено именно на них.
Claude Sonnet 5.5 — вторая модель поколения 5.5 от Anthropic и та, которую она позиционирует как лучшее сочетание скорости и интеллекта в линейке. Один миллион токенов контекста, 128 000 выходных токенов синхронно и 300 000 в Message Batches API, ввод текста, изображений и файлов, адаптивное мышление с выбираемым уровнем усилий, отсечка знаний — июнь 2026 года, нулевое хранение данных доступно с момента запуска, а вывод из эксплуатации — не ранее 28 сентября 2027 года. Тарифная сетка не изменилась по сравнению с Claude Sonnet 5: $2,00 за миллион входных токенов, $10,00 за миллион выходных, $0,20 за чтение из кэша и $2,50 за запись в кэш. Закрытые веса, API Anthropic, а также Bedrock, Google Cloud и Microsoft Foundry.
Поставьте эти две друг против друга — и позиции окажутся почти симметричными:
• Цена — Claude Sonnet 5.5 $2.00 за вход / $10.00 за выход за миллион против Tencent HY4 Preview $0.83 за вход / $2.50 за выход в нашем каталоге, из прайс-листа вендора ¥6 / ¥18
• Чтение из кэша — Claude Sonnet 5.5 $0.20 за миллион против Tencent HY4 Preview $0.042 за миллион по нашему каталогу
• Веса — Claude Sonnet 5.5 закрытые, в отличие от Tencent HY4 Preview Apache 2.0, доступного для скачивания
• Контекст — Claude Sonnet 5.5: 1 000 000 токенов против Tencent HY4 Preview: 1 048 576 токенов — практически идентичны
• Максимальный объём вывода — Claude Sonnet 5.5: 128 000 синхронно, 300 000 в Batches, против Tencent HY4 Preview: 64 000 в нашем каталоге
• Модальность ввода — Claude Sonnet 5.5: текст, изображения и файлы, против Tencent HY4 Preview: только текст
• Независимые оценки — Claude Sonnet 5.5: Intelligence Index 56, $7,60 за задачу, редакция v4.3.2, в сравнении с Tencent HY4 Preview — данные не опубликованы
• Измеренная скорость вывода — Claude Sonnet 5.5 138,7 токенов/с, Tencent Hunyuan 22,2 токенов/с на нашем собственном трафике

Утверждение, которое делают обе лаборатории, и почему одну из них можно проверить
«на 30 % меньше на задачу» от Anthropic и «меньше шагов рассуждения, ниже потребление токенов» от Tencent — это один и тот же инженерный проект, описанный с двух сторон: заставить модель тратить меньше токенов, приходя к тому же ответу. Anthropic прямо указывает, что тарифы не изменились, а значит, любая экономия на задачу должна происходить за счёт количества токенов — и независимый рейтинг позволяет увидеть форму проблемы, а не масштаб исправления. Claude Sonnet 4.5 генерирует 440 миллионов токенов в рамках оценки Intelligence Index против 117 миллионов у MiniMax M3 и 39 миллионов у Grok 4.5. Это многословная модель, и это измерено в рейтинге, который публикует это число. Что бы ни представляло собой 30-процентное улучшение по сравнению с Claude Sonnet 4, оно применяется к очень большой базе.
Для HY4 Preview эквивалентного показателя публично не существует. Собственная заметка Tencent об оптимизации — единственное описание этого, и в ней результат приводится без числа: меньше ходов, меньше входных и выходных токенов, то же качество, подтверждённое метриками бенчмарков и человеческой оценкой в два прохода. Это заявление вендора в строгом смысле — заявлено, правдоподобно, не воспроизведено — и здесь оно обозначено именно так. Принять preview-модель, полагаясь на заявление вендора об экономике токенов, когда экономику токенов невозможно измерить извне, — это ровно та ставка, которую preview-релиз предлагает вам сделать.
Ещё одна деталь, о которой стоит знать, прежде чем кто-либо запланирует развёртывание на собственных серверах с опорой на эту оптимизацию. Изменение Tencent от 7 сентября применяется к сборке, которую Tencent предоставляет на своих собственных хостинговых эндпоинтах. Снимок открытых весов не был обновлён — дата последнего изменения в репозитории Hugging Face по-прежнему 28 августа — поэтому копия весов, размещённая на собственных серверах, воспроизводит исходное поведение с более длинными рассуждениями, о котором предупреждали заметки к предварительной версии. Оптимизированная версия и версия для скачивания — это не один и тот же артефакт.
Там, где открытые веса действительно окупаются, — это всё то же место, что и всегда: развёртывание, которое не может обращаться к API. Модель с 770 млрд параметров и 49 млрд активных — это решение уровня дата-центра, а не рабочей станции, так что это не та история класса ноутбуков, которую рассказывает модель на 30 млрд, — но для покупателя, которому нужна модель внутри собственного периметра, Apache 2.0 в таком масштабе — это вариант, который Claude Sonnet 5.5 не предлагает ни за какую цену.
Пробуем превью, не завязывая на него продакшн-путь
Модели предварительного просмотра — это тот случай, когда маршрутизация перестаёт быть оптимизацией затрат и становится управлением рисками. Причина помещать сборку предварительного просмотра за маршрутизатор, а не вызывать её напрямую, заключается в том, что предварительный просмотр по определению может измениться у вас под ногами, и две вещи, которые вам нужны от слоя перед ним, — это процентное разделение и нечто, что перехватывало бы сбои.
Такова схема, которую предлагает OrcaRouter: одна совместимая с OpenAI конечная точка, охватывающая более 200 моделей, цена из прайс-листа провайдера передаётся без наценки, автоматическое переключение при сбое между вышестоящими провайдерами, а также DSL маршрутизации для составления вызовов из нескольких моделей. Tencent HY4 Preview уже сегодня можно маршрутизировать здесь как tencent/hy4-preview по цене $0,83 за ввод и $2,50 за вывод за миллион токенов при $0,042 за чтение из кэша в пределах окна в 1 048 576 токенов — та же сборка, по тарифу провайдера, доступная по ключу, который вы уже используете для всего остального в каталоге. Claude Sonnet 5 здесь тоже можно маршрутизировать, по цене Anthropic — $2,00 и $10,00, и так с 30 июня; он становится очевидным партнёром для отказоустойчивости, пока модель, которой всего день, накапливает доказательства в продакшене.

Claude Sonnet 5.5 сам по себе не в нашем каталоге. Он вышел вчера, маршрут к нему — собственный API Anthropic, и эта страница не собирается утверждать обратное — смысл рекомендаций по маршрутизации в том, что безопасный способ запустить в производство совершенно новый уровень — дать ему долю трафика, за которой стоит что-то проверенное, и это работает только тогда, когда оба конца схемы находятся там, откуда можно добраться из одного места. HY4 Preview несёт здесь 372 тысячи токенов трафика в неделю — так выглядит двухдневный превью, пока никто ещё не взял на него обязательств; Claude Sonnet 5 несёт 7,9 миллиона в неделю с 30 июня, и это разница между кандидатом и надёжной основой.

Куда на самом деле уходят деньги
Только по тарифам HY4 Preview в четыре раза дешевле Claude Sonnet 5.5 на выводе и почти в пять раз дешевле на чтении из кэша, и при этом не уступает по размеру окна. А вот по замерам Claude Sonnet 5.5 генерирует вывод в шесть раз быстрее на нашем собственном трафике — 138,7 токена в секунду против 22,3, — и это как раз тот разрыв, который превращает четырёхкратное преимущество в тарифах в куда более скромное преимущество по реальному времени, а иногда и в проигрыш, если принять в расчёт ожидание в очереди.
Между этими двумя фактами решение опирается на четыре вопроса, на которые может ответить только читатель. Требует ли работа изображения или файла в промпте? HY4 Preview работает только с текстом — и на этом обсуждение заканчивается. Нужно ли ей выполнить многошаговую задачу по разработке ПО, где показатель HY4 Preview в Terminal-Bench 2.1, равный 85.4, — это собственная цифра Tencent, и она невоспроизведена? Тогда статус preview — это риск, который вы принимаете, а оптимизацию от 7 сентября стоит перепроверить, а не доверять ей. Должна ли рабочая нагрузка выполняться внутри вашего собственного периметра? Тогда решающим фактом являются веса Apache 2.0. И важнее ли совокупный уровень возможностей, чем тариф? Тогда независимо измеренный показатель Claude Sonnet 5.5, равный 56, — это число, которое нужно взвесить, при $7.60 за задачу Index, с оговоркой, что на стороне Tencent не существует эквивалентного показателя для сравнения.
Что на самом деле демонстрируют оба запуска — это то, что фронтир ушёл от прайс-листов. Две лаборатории с разницей в шесть недель выпустили модели и выдвинули на первый план потребление токенов на задачу, а не цену за миллион, и практическое следствие для покупателя таково: полезной цифры больше нет ни на странице цен одного вендора, ни на странице цен другого. Это количество токенов, которое производит ваша собственная рабочая нагрузка, измеренное на обеих моделях, и это единственная цифра в этой статье, которую ни один из вендоров не может вам дать.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
