Главная карточка с заголовком «North Small Translate 1.0 vs Hy-MT2-1.8B» и подзаголовком «218 ГБ модели против 440 МБ», над двумя карточками: North Small Translate 1.0 (218B MoE, минимум 2x B200) и Hy-MT2-1.8B (1.8B dense, 440 МБ, работает на смартфоне) с иконкой контура телефона.
Guides & Insights

North Small Translate 1.0 против Hy-MT2-1.8B: 218 ГБ модели против 440 МБ

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Одна из них помещается на смартфоне. Hy-MT2-1.8B, модель перевода на устройстве от Tencent Hunyuan, открытая под лицензией Apache 2.0 21 мая 2026 года, сжимается до 440 мегабайт при 1,25-битной квантизации AngelSlim и работает на смартфонных чипах Apple, Qualcomm и MediaTek. North Small Translate 1.0, модель смеси экспертов на 218 миллиардов параметров, которую Cohere описала в своих примечаниях к выпуску 9 сентября 2026 года, поставляется с набором весов FP8 порядка 218 гигабайт и требует как минимум два B200. Это примерно в пятьсот раз больше объёма хранилища для одной из них, и интересный вопрос не в том, какая из них лучше, — а в том, для чего на самом деле нужна каждая из них и какая лицензия позволяет её выпускать.

Разница в размере — это не разница в качестве.

Соблазнительно воспринимать 218B в сравнении с 1.8B как прямое ранжирование возможностей. Это не так по двум причинам. Первая: North Small Translate 1.0 — это разреженная модель смеси экспертов, в которой на каждый токен активируется лишь 25 миллиардов параметров, поэтому объём вычислений на токен находится в совершенно иной категории, чем количество параметров. Вторая: две модели оптимизировались под разные цели: 1.8B от Tencent создавалась достаточно маленькой, чтобы работать офлайн на мобильном телефоне, а модель Cohere создавалась, чтобы удерживать весь документ в контексте и переводить его как единое целое.

Эта разница заметна при взгляде на контекстные окна. Конфигурация Hy-MT2-1.8B заявляет до 262 144 позиций, но собственное руководство Tencent по инференсу ограничивает генерацию 8 192 токенами — практическое рабочее окно составляет 8K. North Small Translate 1.0 документирует 16K на входе и 16K на выходе, что вдвое превышает входное окно и, что важнее, даёт целых 16K выходных данных. Если ваша единица работы — руководство по обслуживанию, то этот бюджет вывода и есть та самая ключевая возможность. Если ваша единица работы — сообщение в чате, это не имеет значения.

Всего параметров — North Small Translate 1.0: 218B MoE, 25B активных против Hy-MT2-1.8B: 1.8B плотная

Контекст — 16K на входе и 16K на выходе против 8K рабочего окна (в конфигурации заявлено до 262 144 позиций; рекомендации Tencent — 8 192)

Языки — 50 (английский + 49) против 33 языков плюс 5 языков меньшинств и диалектов

Лицензия — CC BY-NC 4.0, коммерческое использование через Model Vault в сравнении с Apache 2.0, без ограничений

Квантованный объём — FP8 ~218GB, NVFP4 W4A16 ~109GB против 440MB при 1.25-bit; FP8 и GGUF также опубликованы

Минимальное оборудование — 2×B200 или 4×H100 при FP8 против смартфона

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

Что Tencent на самом деле выпустила в 1.8B

Модель 1.8B — самый маленький представитель семейства из трёх моделей — 1.8B, 7B и флагманской 30B-A3B MoE — все они выпущены вместе с сопутствующим бенчмарком IFMTBench, который измеряет следование инструкциям при переводе, а не само качество перевода. Tencent выпустила квантованные версии FP8, GGUF, 2-bit и 1.25-bit вместе с базовыми весами, и именно версия 1.25-bit даёт показатель 440 МБ и заявленное ускорение инференса в 1,5 раза по сравнению с предыдущим поколением Hy-MT1.5. Сервинг поддерживается через transformers 5.6.0 и более поздние версии, vLLM, SGLang и llama.cpp, при этом путь GGUF зависит от ядра STQ, добавленного в llama.cpp. Рекомендуемые параметры сэмплирования: temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05; системного промпта по умолчанию нет — это противоположность подхода Cohere.

Кроме того, в отличие от North Small Translate 1.0, это модель с заметным распространением. Репозиторий на Hugging Face был скачан более 23 000 раз и имеет около 1 200 лайков. Основной репозиторий Cohere на момент написания показывал 26 скачиваний и ноль лайков.

Лицензия — это более резкое отличие

Именно эта часть должна влиять на большее число развёртываний, чем таблица бенчмарков. Hy-MT2-1.8B распространяется под Apache 2.0 без гейтинга — коммерческое использование, дообучение, производные работы и распространение разрешены. North Small Translate 1.0 — это CC BY-NC 4.0: веса бесплатны для некоммерческого использования, а для коммерческого развёртывания требуется приобретённая лицензия через Model Vault от Cohere, цена на которую не публикуется.

Если говорить прямо: если вы создаёте продукт, модель Tencent — это та, которую можно выпустить уже сегодня без переговоров, а модель Cohere — та, которую можно только оценивать. Эта асимметрия не делает модель Cohere хуже, но она меняет порядок действий — модель Cohere вы оцениваете, а модель Tencent можете развернуть.

Доказательства качества асимметричны, и данные обеих сторон предоставляются вендорами.

Ни у одной из моделей нет независимой оценки, поэтому считайте каждое число здесь заявлением её создателя. Разница в том, сколько именно их создатели выложили на стол. Tencent опубликовала полную сравнительную таблицу и технический отчёт: в переводе с английского на X по FLORES-200 Hy-MT2-1.8B набирает 90,00 против 94,42 у Gemini 3.1 Pro и 94,16 у GPT-5.5 — немного отставая от передовых моделей, но в пределах нескольких пунктов, причём это модель, которая помещается на телефоне. По общей оценке следования инструкциям в IFMTBench модель 1.8B набирает 69,36%, значительно уступая своей же родственной модели 30B-A3B с 85,7% и Gemini 3.1 Pro с 89,08%, и это честно отражает компромисс: крошечная модель следует инструкциям по форматированию и терминологии гораздо менее надёжно, чем переводит.

Cohere опубликовала одну цифру — оценку WMT26 в 83,60, которая возрастает до 84,36 при использовании агентного многопроходного рабочего процесса — без указания названия метрики и без страницы результатов WMT26, с которой её можно было бы сверить. Это не то сравнение, которое мы можем провести. Единичное безымянное число нельзя сопоставить с таблицей именованных бенчмарков, и делать вид, что это возможно, было бы самым вводящим в заблуждение действием, которое могла бы совершить эта статья.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Противовесом Tencent служит то, что цифры компании взяты из источника, который читатель может проверить. Репозиторий Hy-MT2 публикует обзор семейства, три размера моделей и данные о том, какие среды выполнения поддерживает каждый из них, вместе с таблицей бенчмарков — именно это делает показатели FLORES-200 и IFMTBench вообще проверяемыми и именно поэтому единственное безымянное число Cohere так заметно выделяется на контрасте.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Сколько стоит позвонить каждому из них

У 1.8B-модели Tencent есть хостируемый коммерческий API, запущенный в августе 2026 года, по цене примерно $0,044 за миллион входных токенов и $0,177 за миллион выходных токенов — дёшево в абсолютном выражении, к тому же с тарификацией за токен. Модель Cohere доступна на бесплатном тарифе Chat V2, бесплатна для пробных и рабочих ключей до достижения лимитов частоты запросов, так что стоимость оценки равна нулю, но стоимость эксплуатации — это контракт, который вам придётся согласовывать. Самостоятельный хостинг полностью переворачивает арифметику: 440 МБ на смартфоне против двух B200 — разница измеряется в порядках величины, а не в процентах.

Причина, по которой об этом разрыве стоит говорить в статье о платформе маршрутизации, состоит в том, что дешёвый и дорогой уровни — не конкуренты: это две позиции в каскаде, а каскады — именно то, для чего нужен маршрутизатор. OrcaRouter передаёт цену из прайс-листа провайдера с наценкой 0%, поэтому снижение цены поставщиком на размещённую конечную точку перевода становится доступным на нашей стороне в тот же день без дилерской маржи, которую нужно пересогласовывать, а цепочки отказоустойчивого переключения позволяют меньшей модели поглощать основную часть трафика, тогда как более тяжёлая модель берёт на себя запросы, с которыми меньшая не справляется. Сначала попробуйте дешёвую, переключайтесь на более мощную в сложных случаях и позвольте политике храниться в слое маршрутизации, а не в коде вашего приложения.

Какой из них вам стоит выбрать

Если ваш перевод выполняется на устройстве, офлайн, в условиях бюджета хранения на мегабайт или внутри коммерческого продукта, не готового вести переговоры о лицензии, то Hy-MT2-1.8B — это ответ, а North Small Translate 1.0 не участвует в гонке. Если ваша единица работы — длинный документ на одном из пятидесяти языков, поддерживаемых Cohere, если вам нужно 16K вывода за один проход и если коммерческая лицензия — это то, что ваша организация готова купить, то модель Cohere — более способная машина по каждому раскрытому измерению — с той оговоркой, что ее качество основывается на единственной невоспроизведенной цифре.

И для большинства команд честный ответ — оба, именно в таком порядке: модель 440MB выполняет рутинную работу с ничтожно малыми затратами, модель 218B обрабатывает документы, которые имеют значение, а решение о том, какой запрос куда направлять, — это правило маршрутизации, а не переписывание. Разрыв между этими двумя моделями — не разрыв, который нужно закрыть. Это спектр, который нужно использовать.