Титульная карточка для 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B' с подзаголовком «Плотный оптимум или флагман MoE по той же цене», показывающая две иконки стеков моделей со знаком равенства между ними и два одинаковых ценника с надписью $0.074 / $0.295, с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Tencent Hy-MT2-7B против Tencent Hy-MT2-30B-A3B: плотная золотая середина или флагман MoE по той же цене

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Вот в чём сюрприз этого противостояния: Tencent Hy-MT2-7B, плотная модель на 7B, и Tencent Hy-MT2-30B-A3B, флагман на основе смеси экспертов с 30 миллиардами параметров суммарно и примерно 3 миллиардами активных, на этой неделе обе стали доступны для вызовов через размещённые API — 7B примерно 19 августа 2026 года, 30B-A3B днём позже, обе обслуживаются Tencent Cloud — по абсолютно одинаковой цене: $0,074 за миллион входных токенов и $0,295 за миллион выходных. Семейство было опубликовано с открытым исходным кодом вместе 21 мая 2026 года, так что ни одна из моделей не нова; именно одинаковая цена API делает это сравнение по-настоящему странным. Обычно более крупная модель стоит дороже, и вы взвешиваете надбавку против выгоды. Здесь же флагман не стоит ни цента дополнительно за токен, и решение сводится к одному вопросу: что, если вообще что-то, 7B теряет из-за того, что она плотная и маленькая?

Сюрприз: та же цена

Ценовой паритет 30B-A3B — это выгодная сделка MoE, которая работает как надо. Его архитектура хранит 30B сохранённых знаний, но активирует лишь около 3B на токен, поэтому Tencent Cloud может обслуживать его по той же ставке за токен, что и 7B: те же $0.074 / $0.295, тот же контекст в 8,192 токена, та же поддержка структурированного вывода и то же ограничение — отсутствие вызова функций. В API «профессиональная» модель не дороже. Загвоздка переходит в другое место: в объём памяти, сложность обслуживания и задержку, где более плотная и простая конструкция 7B имеет структурные преимущества, которые цена за токен выразить не может.

Характеристики бок о бок

Архитектура — плотная ~7B против MoE 30B всего / ~3B активных.

Цена API — $0.074 / $0.295 против $0.074 / $0.295 за 1 млн токенов (идентично).

Контекст — оба по 8,192 токена.

Позиционирование — сбалансированная золотая середина по сравнению с профессиональным флагманом.

FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9% от Gemini 3.1 Pro (Think); 30B-A3B: лучший показатель семейства по общему переводу (данные производителя).

Сравнение Deep​Seek / K​imi — обе превосходят DeepSeek-V4-Pro и Kimi K2.6 в режиме быстрого мышления, по данным вендора.

Занимаемый объём — один A100 / RTX 4090 против весов уровня 30B (квантизованная сборка класса 18GB на диске и ещё больше в VRAM).

Параметры инференса по умолчанию — temp 0.7, top_p 0.6, top_k 20 против temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Где 30B-A3B действительно выигрывает

Tencent позиционирует 30B-A3B как профессиональную модель в своём семействе, и опубликованные ею данные подтверждают такую характеристику для определённого типа текстов. На материале с высокой терминологической плотностью — юридические формулировки, медицинские тексты, техническая документация — её линия GEMBA на DomainMTBench оказывается самой сильной в семействе: по сообщениям, она достигает около 99% от базового уровня Gemini 2.5 Pro, а её общий балл за перевод превосходит показатель 7B на собственной кривой FLORES семейства. Эти дремлющие 27B дополнительных знаний — именно тот ресурс, который проявляется, когда предложение содержит плотную терминологию, а не обычную прозу: договорная фраза «indemnification shall survive termination» не слишком нагружает модель 7B, но полный документ о слияниях и поглощениях с глоссарием — нагружает. 30B-A3B также является самым надёжным вариантом для пар с китайского на языки меньшинств (тибетский, уйгурский, монгольский), где Tencent сообщает о своих лучших результатах.

Где 7B всё равно побеждает

Преимущества 7B — эксплуатационные, и они реальны. Во-первых, собственный хостинг: 7B помещается на один A100 или RTX 4090 и охватывает наибольшее число фреймворков — Transformers, vLLM, SGLang и llama.cpp через GGUF — все они протестированы. 30B-A3B, даже в квантованном виде, требует видеопамяти масштаба дата-центра, и меньше людей прогоняли его через производственные стеки инференса. Во-вторых, задержка и простота обслуживания: плотную 7B проще держать «горячей», и её рекомендуемый сэмплинг ближе к стандартному декодированию. В-третьих, в API одинаковая цена означает, что 7B стоит ровно столько же за токен, сколько и флагман, — так что единственная причина выбрать меньшую модель в том, что на чистых текстах общего назначения разрыв в качестве слишком мал, чтобы его заметить. 7B уже достигает примерно 97,9% от показателя Gemini 3.1 Pro (Think) на FLORES-200; дополнительные баллы флагмана расположены на вершине кривой, где каждый из них всё труднее увидеть на практике.

Разрыв, измеренный честно

Всё в двух последних разделах — это собственная оценка Tencent, и если читать её честно, то на обычном переводе две модели достаточно близки, так что всё решает ваш корпус. На обычном чистом тексте результат 7B на уровне ~97,9% от Gemini означает, что отрыв флагмана измеряется небольшими долями XCOMET: на лидерборде он заметен, но в тикете поддержки его вряд ли почувствуешь. На плотных специализированных текстах и парах с миноритарными языками заявленное лидерство флагмана в GEMBA и FLORES — это ровно та область, где профессиональный переводчик (человек или модель) отрабатывает своё и где повторный перевод обходится дороже всего. На момент написания независимых бенчмарков нет ни для одной из моделей; единственное, в чём сходятся обе карточки вендора, — что каждый размер превосходит DeepSeek-V4-Pro и Kimi K2.6 в быстром режиме мышления семейства.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Маршрутизация семьи

{{1}}Ни одна из моделей на момент написания не числится в каталоге OrcaRouter, поэтому обе обслуживаются через собственное облако Tencent и несколько сторонних платформ.{{/1}} {{2}}Однако практический урок маршрутизации остаётся в силе.{{/2}} {{3}}Поскольку цены на API идентичны, это классический случай для маршрутизации по нагрузке, а не для выбора одной модели: отправляйте высокообъёмный сегмент общего перевода на 7B, а плотный, узкоспециализированный сегмент — на 30B-A3B, с автоматическим переключением при сбое, чтобы всплеск задержки на MoE-эндпоинте никогда не останавливал конвейер.{{/3}} {{4}}Именно такой паттерн DSL-маршрутизации OrcaRouter собирает для более чем 200 моделей, которые мы действительно поддерживаем, — диспетчеризация с учётом стоимости, цена провайдера передаётся без наценки (0%) — и он подходит этому семейству лучше, чем большинству других, потому что вендор установил цены на два уровня так, чтобы разделение было экономически нейтральным.{{/4}}

Вердикт

При одинаковых ценах API ответ по умолчанию — 7B: та же стоимость за токен, проще в самостоятельном размещении и почти не уступает на обычных текстах. Выбирайте 30B-A3B, когда корпус профессионально плотный — юридический, медицинский, технический или перевод на редкие языки — где заявленное преимущество флагмана в предметной области оправдывает больший размер и задержку. Если же ваша нагрузка смешанная, не выбирайте: направьте общую часть на 7B, а сложную — на флагман. Это не компромисс между ними; это единственный способ получить оба по цене, которую установил Tencent.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube