
Tencent Hy-MT2-7B против Tencent Hy-MT2-30B-A3B: плотная золотая середина или флагман MoE по той же цене
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Вот в чём сюрприз этого противостояния: Tencent Hy-MT2-7B, плотная модель на 7B, и Tencent Hy-MT2-30B-A3B, флагман на основе смеси экспертов с 30 миллиардами параметров суммарно и примерно 3 миллиардами активных, на этой неделе обе стали доступны для вызовов через размещённые API — 7B примерно 19 августа 2026 года, 30B-A3B днём позже, обе обслуживаются Tencent Cloud — по абсолютно одинаковой цене: $0,074 за миллион входных токенов и $0,295 за миллион выходных. Семейство было опубликовано с открытым исходным кодом вместе 21 мая 2026 года, так что ни одна из моделей не нова; именно одинаковая цена API делает это сравнение по-настоящему странным. Обычно более крупная модель стоит дороже, и вы взвешиваете надбавку против выгоды. Здесь же флагман не стоит ни цента дополнительно за токен, и решение сводится к одному вопросу: что, если вообще что-то, 7B теряет из-за того, что она плотная и маленькая?
Сюрприз: та же цена
Ценовой паритет 30B-A3B — это выгодная сделка MoE, которая работает как надо. Его архитектура хранит 30B сохранённых знаний, но активирует лишь около 3B на токен, поэтому Tencent Cloud может обслуживать его по той же ставке за токен, что и 7B: те же $0.074 / $0.295, тот же контекст в 8,192 токена, та же поддержка структурированного вывода и то же ограничение — отсутствие вызова функций. В API «профессиональная» модель не дороже. Загвоздка переходит в другое место: в объём памяти, сложность обслуживания и задержку, где более плотная и простая конструкция 7B имеет структурные преимущества, которые цена за токен выразить не может.
Характеристики бок о бок
• Архитектура — плотная ~7B против MoE 30B всего / ~3B активных.
• Цена API — $0.074 / $0.295 против $0.074 / $0.295 за 1 млн токенов (идентично).
• Контекст — оба по 8,192 токена.
• Позиционирование — сбалансированная золотая середина по сравнению с профессиональным флагманом.
• FLORES-200 — 7B: 86,89 XCOMET-XXL, ≈97,9% от Gemini 3.1 Pro (Think); 30B-A3B: лучший показатель семейства по общему переводу (данные производителя).
• Сравнение DeepSeek / Kimi — обе превосходят DeepSeek-V4-Pro и Kimi K2.6 в режиме быстрого мышления, по данным вендора.
• Занимаемый объём — один A100 / RTX 4090 против весов уровня 30B (квантизованная сборка класса 18GB на диске и ещё больше в VRAM).
• Параметры инференса по умолчанию — temp 0.7, top_p 0.6, top_k 20 против temp 0.7, top_p 1.0, top_k -1.

Где 30B-A3B действительно выигрывает
Tencent позиционирует 30B-A3B как профессиональную модель в своём семействе, и опубликованные ею данные подтверждают такую характеристику для определённого типа текстов. На материале с высокой терминологической плотностью — юридические формулировки, медицинские тексты, техническая документация — её линия GEMBA на DomainMTBench оказывается самой сильной в семействе: по сообщениям, она достигает около 99% от базового уровня Gemini 2.5 Pro, а её общий балл за перевод превосходит показатель 7B на собственной кривой FLORES семейства. Эти дремлющие 27B дополнительных знаний — именно тот ресурс, который проявляется, когда предложение содержит плотную терминологию, а не обычную прозу: договорная фраза «indemnification shall survive termination» не слишком нагружает модель 7B, но полный документ о слияниях и поглощениях с глоссарием — нагружает. 30B-A3B также является самым надёжным вариантом для пар с китайского на языки меньшинств (тибетский, уйгурский, монгольский), где Tencent сообщает о своих лучших результатах.
Где 7B всё равно побеждает
Преимущества 7B — эксплуатационные, и они реальны. Во-первых, собственный хостинг: 7B помещается на один A100 или RTX 4090 и охватывает наибольшее число фреймворков — Transformers, vLLM, SGLang и llama.cpp через GGUF — все они протестированы. 30B-A3B, даже в квантованном виде, требует видеопамяти масштаба дата-центра, и меньше людей прогоняли его через производственные стеки инференса. Во-вторых, задержка и простота обслуживания: плотную 7B проще держать «горячей», и её рекомендуемый сэмплинг ближе к стандартному декодированию. В-третьих, в API одинаковая цена означает, что 7B стоит ровно столько же за токен, сколько и флагман, — так что единственная причина выбрать меньшую модель в том, что на чистых текстах общего назначения разрыв в качестве слишком мал, чтобы его заметить. 7B уже достигает примерно 97,9% от показателя Gemini 3.1 Pro (Think) на FLORES-200; дополнительные баллы флагмана расположены на вершине кривой, где каждый из них всё труднее увидеть на практике.
Разрыв, измеренный честно
Всё в двух последних разделах — это собственная оценка Tencent, и если читать её честно, то на обычном переводе две модели достаточно близки, так что всё решает ваш корпус. На обычном чистом тексте результат 7B на уровне ~97,9% от Gemini означает, что отрыв флагмана измеряется небольшими долями XCOMET: на лидерборде он заметен, но в тикете поддержки его вряд ли почувствуешь. На плотных специализированных текстах и парах с миноритарными языками заявленное лидерство флагмана в GEMBA и FLORES — это ровно та область, где профессиональный переводчик (человек или модель) отрабатывает своё и где повторный перевод обходится дороже всего. На момент написания независимых бенчмарков нет ни для одной из моделей; единственное, в чём сходятся обе карточки вендора, — что каждый размер превосходит DeepSeek-V4-Pro и Kimi K2.6 в быстром режиме мышления семейства.

Маршрутизация семьи
{{1}}Ни одна из моделей на момент написания не числится в каталоге OrcaRouter, поэтому обе обслуживаются через собственное облако Tencent и несколько сторонних платформ.{{/1}} {{2}}Однако практический урок маршрутизации остаётся в силе.{{/2}} {{3}}Поскольку цены на API идентичны, это классический случай для маршрутизации по нагрузке, а не для выбора одной модели: отправляйте высокообъёмный сегмент общего перевода на 7B, а плотный, узкоспециализированный сегмент — на 30B-A3B, с автоматическим переключением при сбое, чтобы всплеск задержки на MoE-эндпоинте никогда не останавливал конвейер.{{/3}} {{4}}Именно такой паттерн DSL-маршрутизации OrcaRouter собирает для более чем 200 моделей, которые мы действительно поддерживаем, — диспетчеризация с учётом стоимости, цена провайдера передаётся без наценки (0%) — и он подходит этому семейству лучше, чем большинству других, потому что вендор установил цены на два уровня так, чтобы разделение было экономически нейтральным.{{/4}}
Вердикт
При одинаковых ценах API ответ по умолчанию — 7B: та же стоимость за токен, проще в самостоятельном размещении и почти не уступает на обычных текстах. Выбирайте 30B-A3B, когда корпус профессионально плотный — юридический, медицинский, технический или перевод на редкие языки — где заявленное преимущество флагмана в предметной области оправдывает больший размер и задержку. Если же ваша нагрузка смешанная, не выбирайте: направьте общую часть на 7B, а сложную — на флагман. Это не компромисс между ними; это единственный способ получить оба по цене, которую установил Tencent.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
