
Tencent Hy-MT2-7B против Tencent Hy-MT2-1.8B: выбор в пользу серверного качества или переводчик размером 440 МБ на каждом телефоне
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
Tencent Hy-MT2-7B и Tencent Hy-MT2-1.8B — это две крайние точки одного семейства, опубликованные в открытом доступе вместе 21 мая 2026 года, и обе на этой неделе стали доступны через размещённые API: 7B — примерно 19 августа, а 1.8B — днём позже; обе обслуживаются Tencent Cloud. Они не конкуренты в обычном смысле, потому что их назначение почти не пересекается. 7B — это выбор для качества: плотная модель, работающая на одном GPU или через API по цене $0,074 за миллион входных и $0,295 за миллион выходных токенов. 1.8B — это выбор для устройств: модель, квантованная до 440 мегабайт, работает на телефоне полностью офлайн, при этом на API-тарифе она стоит $0,044 / $0,177 за миллион. Если вы выбираете между ними, ответ в основном определяется тем, где должен происходить перевод, и лишь во вторую очередь — бенчмарками, которые гораздо ближе, чем следует из четырёхкратной разницы в параметрах.
Краткий ответ
Выбирайте модель 7B, когда перевод выполняется в дата-центре и вы хотите получить максимальное качество в пересчете на доллар серверных затрат — через API или на одном GPU класса A100. Выбирайте 1.8B, когда перевод должен выполняться на устройстве, офлайн или при минимально возможной стоимости за токен. Если обе модели живут в одном облаке и бюджет не является решающим фактором, 7B выигрывает по качеству. Если контент конфиденциален, подлежит регулированию или должен работать без сети, 1.8B — единственная из двух, которая на это способна.
Характеристики бок о бок
• Параметры — 7B dense против 1.8B dense.
• Квантованный размер — FP8 и GGUF до нескольких ГБ против 440 МБ с помощью 1.25-битного квантования AngelSlim.
• FLORES-200 (XX⇔XX) — 86,89 против 79,77 у XCOMET-XXL, что составляет примерно 97,9% и 89,9% от показателей Gemini 3.1 Pro (Think), по данным вендора.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B превосходит коммерческие API Microsoft и Doubao по всем трём метрикам.
• DomainMTBench (GEMBA) — 92.79 против 91.08, по данным вендора.
• Цена API — $0.074 / $0.295 против $0.044 / $0.177 за 1 млн токенов (ввод/вывод).
• Контекст — оба по 8,192 токена.
• Развертывание — одна A100 / RTX 4090 или облачный API против встроенных чипов Apple, Qualcomm и MediaTek, офлайн.

Разрыв в качестве реален, но он уже, чем разрыв в размерах.
Всё нижеследующее — собственная оценка Tencent, не прошедшая независимого воспроизведения. На FLORES-200 7B опережает 1.8B на восемь пунктов XCOMET (86,89 против 79,77) — именно на этом разрыве строится позиционирование версий «balanced» и «on-device». Но на DomainMTBench — бенчмарке доменного перевода, охватывающем финансы, политику и образование, — 1.8B отстаёт от 7B всего на 1,7 пункта GEMBA (91,08 против 92,79). А то, как 1.8B смотрится на фоне остального мира, — деталь, которая продолжает удивлять: Tencent сообщает, что она превосходит коммерческие API перевода Microsoft и Doubao по всем трём метрикам WMT25 и обходит Tower-Plus-72B — модель, которая в сорок раз больше неё. Так что на обычных доменных текстах маленькая модель гораздо ближе к своему старшему собрату, чем можно было бы предположить по четырёхкратной разнице в параметрах. Реальное преимущество 7B проявляется на «хвосте» общего перевода и на сложных инструкциях, где её отрыв по FLORES и более высокие баллы IFMTBench за комплексные задачи создают заметную дистанцию между двумя моделями.
Форк развертывания
Модель 7B требует инфраструктуры — либо облачного API, либо одного GPU класса A100 — с обычными операционными издержками. Модель 1.8B при 440 МБ с 1,25-битным квантованием от AngelSlim работает на тех же чипах, что и типичное мобильное приложение, в 1,5 раза быстрее предыдущего поколения Hy-MT1.5 и вообще не требует сети. Это превращает приватность из функции в стандартное поведение: для контрактов, медицинских записей или любых регулируемых данных информация никогда не покидает устройство — свойство, которое невозможно купить никакой ценой за токен на серверной стороне. Компромисс заметен на задачах общего перевода в стиле FLORES, где проявляются дополнительные возможности 7B, — а также на любой достаточно сложной инструкции, где суммарные 83,14 балла IFMTBench модели 1.8B упираются в более высокий потолок 7B.

Математика затрат
На уровне API обе модели дёшевы; 1.8B дешевле. При $0.044 / $0.177 против $0.074 / $0.295 за миллион, маленькая модель примерно на 40% ниже 7B по обеим сторонам счёта — при стабильном миллионе выходных токенов в день это примерно $70 в день против $118. На устройстве 1.8B стоит ноль за токен, и именно эта цифра доминирует над любым серверным сравнением при больших объёмах. Контраргумент 7B — не цена, а запас прочности: если ваш корпус тяготеет к техническим, юридическим текстам или инструкциям, запас качества 7B — это именно то, что проявляется в виде меньшего числа повторных переводов — а повторные переводы и есть реальная удельная стоимость в профессиональном машинном переводе.

Фрезеровка двух размеров
Ни одна из моделей на момент написания не числится в каталоге OrcaRouter, поэтому честная формулировка такова: обе обслуживаются через собственное облако Tencent и несколько сторонних платформ. Тем не менее, их сопоставление наглядно иллюстрирует урок о маршрутизации, вокруг которого построен этот блог: когда две модели пересекаются по возможностям, но различаются по цене и задержке, рациональное развёртывание — это не «выбрать одну», а «маршрутизировать по нагрузке»: высокообъёмный сегмент с низкой сложностью — на дешёвую компактную модель, сложный сегмент — на качественную модель, с автоматическим переключением при сбое, чтобы отказ любой из них никогда не останавливал конвейер. Именно такой паттерн и собирает DSL маршрутизации OrcaRouter среди 200+ моделей, которые мы действительно поддерживаем, а цены из прайс-листов провайдеров пропускаются с нулевой наценкой. Если семейство переводческих моделей Tencent пополнит каталог, это будет естественный следующий арендатор.
Вердикт
Если перевод выполняется в вашем центре обработки данных, возьмите Tencent Hy-MT2-7B — через API, если не хотите заниматься эксплуатацией, или на одном GPU, если хотите полный контроль, — и дальше можно не читать. Если перевод должен выполняться на устройстве, офлайн или при требовании конфиденциальности, возьмите Tencent Hy-MT2-1.8B — и компактный размер в 440 МБ выигрывает по определению. Единственный по-настоящему сложный случай — это облачная нагрузка среднего объёма, где качество модели 7B и цена модели 1.8B одинаково обоснованны. В этом случае не принимайте решение по вендорским бенчмаркам: заявленный разрыв по GEMBA составляет менее двух пунктов, поэтому прогоните обе модели на собственных текстах из вашей предметной области и пусть ваши данные выберут.
