{{1}}Титульная карточка{{/1}} для '{{2}}Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B{{/2}}' с подзаголовком '{{3}}Выбор серверного качества или переводчик на 440 МБ на каждом телефоне{{/3}}', на которой изображены {{4}}значок сервера и значок смартфона{{/4}} с {{5}}весами{{/5}} между ними, {{6}}чип на 440 МБ{{/6}} и {{7}}два ярлыка с названиями моделей{{/7}}, а в правом нижнем углу — логотип OrcaRouter.
Guides & Insights

Tencent Hy-MT2-7B против Tencent Hy-MT2-1.8B: выбор в пользу серверного качества или переводчик размером 440 МБ на каждом телефоне

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Tencent Hy-MT2-7B и Tencent Hy-MT2-1.8B — это две крайние точки одного семейства, опубликованные в открытом доступе вместе 21 мая 2026 года, и обе на этой неделе стали доступны через размещённые API: 7B — примерно 19 августа, а 1.8B — днём позже; обе обслуживаются Tencent Cloud. Они не конкуренты в обычном смысле, потому что их назначение почти не пересекается. 7B — это выбор для качества: плотная модель, работающая на одном GPU или через API по цене $0,074 за миллион входных и $0,295 за миллион выходных токенов. 1.8B — это выбор для устройств: модель, квантованная до 440 мегабайт, работает на телефоне полностью офлайн, при этом на API-тарифе она стоит $0,044 / $0,177 за миллион. Если вы выбираете между ними, ответ в основном определяется тем, где должен происходить перевод, и лишь во вторую очередь — бенчмарками, которые гораздо ближе, чем следует из четырёхкратной разницы в параметрах.

Краткий ответ

Выбирайте модель 7B, когда перевод выполняется в дата-центре и вы хотите получить максимальное качество в пересчете на доллар серверных затрат — через API или на одном GPU класса A100. Выбирайте 1.8B, когда перевод должен выполняться на устройстве, офлайн или при минимально возможной стоимости за токен. Если обе модели живут в одном облаке и бюджет не является решающим фактором, 7B выигрывает по качеству. Если контент конфиденциален, подлежит регулированию или должен работать без сети, 1.8B — единственная из двух, которая на это способна.

Характеристики бок о бок

Параметры — 7B dense против 1.8B dense.

Квантованный размер — FP8 и GGUF до нескольких ГБ против 440 МБ с помощью 1.25-битного квантования AngelSlim.

FLORES-200 (XX⇔XX) — 86,89 против 79,77 у XCOMET-XXL, что составляет примерно 97,9% и 89,9% от показателей Gemini 3.1 Pro (Think), по данным вендора.

WMT25 — 7B: 63.86/71.21/82.24; 1.8B превосходит коммерческие API Microsoft и Doubao по всем трём метрикам.

DomainMTBench (GEMBA) — 92.79 против 91.08, по данным вендора.

Цена API — $0.074 / $0.295 против $0.044 / $0.177 за 1 млн токенов (ввод/вывод).

Контекст — оба по 8,192 токена.

Развертывание — одна A100 / RTX 4090 или облачный API против встроенных чипов Apple, Qualcomm и MediaTek, офлайн.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

Разрыв в качестве реален, но он уже, чем разрыв в размерах.

Всё нижеследующее — собственная оценка Tencent, не прошедшая независимого воспроизведения. На FLORES-200 7B опережает 1.8B на восемь пунктов XCOMET (86,89 против 79,77) — именно на этом разрыве строится позиционирование версий «balanced» и «on-device». Но на DomainMTBench — бенчмарке доменного перевода, охватывающем финансы, политику и образование, — 1.8B отстаёт от 7B всего на 1,7 пункта GEMBA (91,08 против 92,79). А то, как 1.8B смотрится на фоне остального мира, — деталь, которая продолжает удивлять: Tencent сообщает, что она превосходит коммерческие API перевода Microsoft и Doubao по всем трём метрикам WMT25 и обходит Tower-Plus-72B — модель, которая в сорок раз больше неё. Так что на обычных доменных текстах маленькая модель гораздо ближе к своему старшему собрату, чем можно было бы предположить по четырёхкратной разнице в параметрах. Реальное преимущество 7B проявляется на «хвосте» общего перевода и на сложных инструкциях, где её отрыв по FLORES и более высокие баллы IFMTBench за комплексные задачи создают заметную дистанцию между двумя моделями.

Форк развертывания

Модель 7B требует инфраструктуры — либо облачного API, либо одного GPU класса A100 — с обычными операционными издержками. Модель 1.8B при 440 МБ с 1,25-битным квантованием от AngelSlim работает на тех же чипах, что и типичное мобильное приложение, в 1,5 раза быстрее предыдущего поколения Hy-MT1.5 и вообще не требует сети. Это превращает приватность из функции в стандартное поведение: для контрактов, медицинских записей или любых регулируемых данных информация никогда не покидает устройство — свойство, которое невозможно купить никакой ценой за токен на серверной стороне. Компромисс заметен на задачах общего перевода в стиле FLORES, где проявляются дополнительные возможности 7B, — а также на любой достаточно сложной инструкции, где суммарные 83,14 балла IFMTBench модели 1.8B упираются в более высокий потолок 7B.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

Математика затрат

На уровне API обе модели дёшевы; 1.8B дешевле. При $0.044 / $0.177 против $0.074 / $0.295 за миллион, маленькая модель примерно на 40% ниже 7B по обеим сторонам счёта — при стабильном миллионе выходных токенов в день это примерно $70 в день против $118. На устройстве 1.8B стоит ноль за токен, и именно эта цифра доминирует над любым серверным сравнением при больших объёмах. Контраргумент 7B — не цена, а запас прочности: если ваш корпус тяготеет к техническим, юридическим текстам или инструкциям, запас качества 7B — это именно то, что проявляется в виде меньшего числа повторных переводов — а повторные переводы и есть реальная удельная стоимость в профессиональном машинном переводе.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

Фрезеровка двух размеров

Ни одна из моделей на момент написания не числится в каталоге OrcaRouter, поэтому честная формулировка такова: обе обслуживаются через собственное облако Tencent и несколько сторонних платформ. Тем не менее, их сопоставление наглядно иллюстрирует урок о маршрутизации, вокруг которого построен этот блог: когда две модели пересекаются по возможностям, но различаются по цене и задержке, рациональное развёртывание — это не «выбрать одну», а «маршрутизировать по нагрузке»: высокообъёмный сегмент с низкой сложностью — на дешёвую компактную модель, сложный сегмент — на качественную модель, с автоматическим переключением при сбое, чтобы отказ любой из них никогда не останавливал конвейер. Именно такой паттерн и собирает DSL маршрутизации OrcaRouter среди 200+ моделей, которые мы действительно поддерживаем, а цены из прайс-листов провайдеров пропускаются с нулевой наценкой. Если семейство переводческих моделей Tencent пополнит каталог, это будет естественный следующий арендатор.

Вердикт

Если перевод выполняется в вашем центре обработки данных, возьмите Tencent Hy-MT2-7B — через API, если не хотите заниматься эксплуатацией, или на одном GPU, если хотите полный контроль, — и дальше можно не читать. Если перевод должен выполняться на устройстве, офлайн или при требовании конфиденциальности, возьмите Tencent Hy-MT2-1.8B — и компактный размер в 440 МБ выигрывает по определению. Единственный по-настоящему сложный случай — это облачная нагрузка среднего объёма, где качество модели 7B и цена модели 1.8B одинаково обоснованны. В этом случае не принимайте решение по вендорским бенчмаркам: заявленный разрыв по GEMBA составляет менее двух пунктов, поэтому прогоните обе модели на собственных текстах из вашей предметной области и пусть ваши данные выберут.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube