
North Small Translate 1.0 против Hy-MT2-1.8B: 218 ГБ модели против 440 МБ
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Одна из них помещается на смартфоне. Hy-MT2-1.8B, модель перевода на устройстве от Tencent Hunyuan, открытая под лицензией Apache 2.0 21 мая 2026 года, сжимается до 440 мегабайт при 1,25-битной квантизации AngelSlim и работает на смартфонных чипах Apple, Qualcomm и MediaTek. North Small Translate 1.0, модель смеси экспертов на 218 миллиардов параметров, которую Cohere описала в своих примечаниях к выпуску 9 сентября 2026 года, поставляется с набором весов FP8 порядка 218 гигабайт и требует как минимум два B200. Это примерно в пятьсот раз больше объёма хранилища для одной из них, и интересный вопрос не в том, какая из них лучше, — а в том, для чего на самом деле нужна каждая из них и какая лицензия позволяет её выпускать.
Разница в размере — это не разница в качестве.
Соблазнительно воспринимать 218B в сравнении с 1.8B как прямое ранжирование возможностей. Это не так по двум причинам. Первая: North Small Translate 1.0 — это разреженная модель смеси экспертов, в которой на каждый токен активируется лишь 25 миллиардов параметров, поэтому объём вычислений на токен находится в совершенно иной категории, чем количество параметров. Вторая: две модели оптимизировались под разные цели: 1.8B от Tencent создавалась достаточно маленькой, чтобы работать офлайн на мобильном телефоне, а модель Cohere создавалась, чтобы удерживать весь документ в контексте и переводить его как единое целое.
Эта разница заметна при взгляде на контекстные окна. Конфигурация Hy-MT2-1.8B заявляет до 262 144 позиций, но собственное руководство Tencent по инференсу ограничивает генерацию 8 192 токенами — практическое рабочее окно составляет 8K. North Small Translate 1.0 документирует 16K на входе и 16K на выходе, что вдвое превышает входное окно и, что важнее, даёт целых 16K выходных данных. Если ваша единица работы — руководство по обслуживанию, то этот бюджет вывода и есть та самая ключевая возможность. Если ваша единица работы — сообщение в чате, это не имеет значения.
• Всего параметров — North Small Translate 1.0: 218B MoE, 25B активных против Hy-MT2-1.8B: 1.8B плотная
• Контекст — 16K на входе и 16K на выходе против 8K рабочего окна (в конфигурации заявлено до 262 144 позиций; рекомендации Tencent — 8 192)
• Языки — 50 (английский + 49) против 33 языков плюс 5 языков меньшинств и диалектов
• Лицензия — CC BY-NC 4.0, коммерческое использование через Model Vault в сравнении с Apache 2.0, без ограничений
• Квантованный объём — FP8 ~218GB, NVFP4 W4A16 ~109GB против 440MB при 1.25-bit; FP8 и GGUF также опубликованы
• Минимальное оборудование — 2×B200 или 4×H100 при FP8 против смартфона

Что Tencent на самом деле выпустила в 1.8B
Модель 1.8B — самый маленький представитель семейства из трёх моделей — 1.8B, 7B и флагманской 30B-A3B MoE — все они выпущены вместе с сопутствующим бенчмарком IFMTBench, который измеряет следование инструкциям при переводе, а не само качество перевода. Tencent выпустила квантованные версии FP8, GGUF, 2-bit и 1.25-bit вместе с базовыми весами, и именно версия 1.25-bit даёт показатель 440 МБ и заявленное ускорение инференса в 1,5 раза по сравнению с предыдущим поколением Hy-MT1.5. Сервинг поддерживается через transformers 5.6.0 и более поздние версии, vLLM, SGLang и llama.cpp, при этом путь GGUF зависит от ядра STQ, добавленного в llama.cpp. Рекомендуемые параметры сэмплирования: temperature 0.7, top_p 0.6, top_k 20, repetition penalty 1.05; системного промпта по умолчанию нет — это противоположность подхода Cohere.
Кроме того, в отличие от North Small Translate 1.0, это модель с заметным распространением. Репозиторий на Hugging Face был скачан более 23 000 раз и имеет около 1 200 лайков. Основной репозиторий Cohere на момент написания показывал 26 скачиваний и ноль лайков.
Лицензия — это более резкое отличие
Именно эта часть должна влиять на большее число развёртываний, чем таблица бенчмарков. Hy-MT2-1.8B распространяется под Apache 2.0 без гейтинга — коммерческое использование, дообучение, производные работы и распространение разрешены. North Small Translate 1.0 — это CC BY-NC 4.0: веса бесплатны для некоммерческого использования, а для коммерческого развёртывания требуется приобретённая лицензия через Model Vault от Cohere, цена на которую не публикуется.
Если говорить прямо: если вы создаёте продукт, модель Tencent — это та, которую можно выпустить уже сегодня без переговоров, а модель Cohere — та, которую можно только оценивать. Эта асимметрия не делает модель Cohere хуже, но она меняет порядок действий — модель Cohere вы оцениваете, а модель Tencent можете развернуть.
Доказательства качества асимметричны, и данные обеих сторон предоставляются вендорами.
Ни у одной из моделей нет независимой оценки, поэтому считайте каждое число здесь заявлением её создателя. Разница в том, сколько именно их создатели выложили на стол. Tencent опубликовала полную сравнительную таблицу и технический отчёт: в переводе с английского на X по FLORES-200 Hy-MT2-1.8B набирает 90,00 против 94,42 у Gemini 3.1 Pro и 94,16 у GPT-5.5 — немного отставая от передовых моделей, но в пределах нескольких пунктов, причём это модель, которая помещается на телефоне. По общей оценке следования инструкциям в IFMTBench модель 1.8B набирает 69,36%, значительно уступая своей же родственной модели 30B-A3B с 85,7% и Gemini 3.1 Pro с 89,08%, и это честно отражает компромисс: крошечная модель следует инструкциям по форматированию и терминологии гораздо менее надёжно, чем переводит.
Cohere опубликовала одну цифру — оценку WMT26 в 83,60, которая возрастает до 84,36 при использовании агентного многопроходного рабочего процесса — без указания названия метрики и без страницы результатов WMT26, с которой её можно было бы сверить. Это не то сравнение, которое мы можем провести. Единичное безымянное число нельзя сопоставить с таблицей именованных бенчмарков, и делать вид, что это возможно, было бы самым вводящим в заблуждение действием, которое могла бы совершить эта статья.

Противовесом Tencent служит то, что цифры компании взяты из источника, который читатель может проверить. Репозиторий Hy-MT2 публикует обзор семейства, три размера моделей и данные о том, какие среды выполнения поддерживает каждый из них, вместе с таблицей бенчмарков — именно это делает показатели FLORES-200 и IFMTBench вообще проверяемыми и именно поэтому единственное безымянное число Cohere так заметно выделяется на контрасте.

Сколько стоит позвонить каждому из них
У 1.8B-модели Tencent есть хостируемый коммерческий API, запущенный в августе 2026 года, по цене примерно $0,044 за миллион входных токенов и $0,177 за миллион выходных токенов — дёшево в абсолютном выражении, к тому же с тарификацией за токен. Модель Cohere доступна на бесплатном тарифе Chat V2, бесплатна для пробных и рабочих ключей до достижения лимитов частоты запросов, так что стоимость оценки равна нулю, но стоимость эксплуатации — это контракт, который вам придётся согласовывать. Самостоятельный хостинг полностью переворачивает арифметику: 440 МБ на смартфоне против двух B200 — разница измеряется в порядках величины, а не в процентах.
Причина, по которой об этом разрыве стоит говорить в статье о платформе маршрутизации, состоит в том, что дешёвый и дорогой уровни — не конкуренты: это две позиции в каскаде, а каскады — именно то, для чего нужен маршрутизатор. OrcaRouter передаёт цену из прайс-листа провайдера с наценкой 0%, поэтому снижение цены поставщиком на размещённую конечную точку перевода становится доступным на нашей стороне в тот же день без дилерской маржи, которую нужно пересогласовывать, а цепочки отказоустойчивого переключения позволяют меньшей модели поглощать основную часть трафика, тогда как более тяжёлая модель берёт на себя запросы, с которыми меньшая не справляется. Сначала попробуйте дешёвую, переключайтесь на более мощную в сложных случаях и позвольте политике храниться в слое маршрутизации, а не в коде вашего приложения.
Какой из них вам стоит выбрать
Если ваш перевод выполняется на устройстве, офлайн, в условиях бюджета хранения на мегабайт или внутри коммерческого продукта, не готового вести переговоры о лицензии, то Hy-MT2-1.8B — это ответ, а North Small Translate 1.0 не участвует в гонке. Если ваша единица работы — длинный документ на одном из пятидесяти языков, поддерживаемых Cohere, если вам нужно 16K вывода за один проход и если коммерческая лицензия — это то, что ваша организация готова купить, то модель Cohere — более способная машина по каждому раскрытому измерению — с той оговоркой, что ее качество основывается на единственной невоспроизведенной цифре.
И для большинства команд честный ответ — оба, именно в таком порядке: модель 440MB выполняет рутинную работу с ничтожно малыми затратами, модель 218B обрабатывает документы, которые имеют значение, а решение о том, какой запрос куда направлять, — это правило маршрутизации, а не переписывание. Разрыв между этими двумя моделями — не разрыв, который нужно закрыть. Это спектр, который нужно использовать.
