Главная карточка с заголовком «North Small Translate 1.0 vs Hy-MT2-7B» и подзаголовком «Один GPU против двух B200», над двумя карточками: North Small Translate 1.0 (218B MoE / 25B активных, CC BY-NC 4.0) и Hy-MT2-7B (8B dense, около 16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 против Hy-MT2-7B: одна GPU против двух B200

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Самое близкое противостояние в открытом переводе прямо сейчас может оказаться и самым неочевидным. Hy-MT2-7B — средний ребёнок в семействе переводчиков Tencent Hunyuan, открытый под Apache 2.0 21 мая 2026 года, и он работает на одной RTX 4090 или A100, используя около 16 ГБ видеопамяти. North Small Translate 1.0 — это разреженный смесь-экспертный переводчик Cohere на 218 миллиардов параметров, описанный в примечаниях к выпуску компании от 9 сентября 2026 года, с минимальным развёртыванием на двух B200 в FP8 или на одном B200 в его форме NVFP4 W4A16. Оба — специалисты по переводу. Оба — актуальны. Один из них можно запустить с рабочей станции, и уже один этот факт переворачивает всё сравнение — потому что бенчмарка, в котором их больше всего хотели бы оценить на равных условиях, не существует.

Начните с конверта, а не с оценок.

Стоимость развёртывания — это критерий, который определяет большинство реальных интеграций, и здесь две модели даже близко не стоят. Hy-MT2-7B — это плотная модель HunYuanDenseV1 примерно на восемь миллиардов параметров с опубликованными сборками FP8 и GGUF, а также 8-битными версиями MLX от сообщества для Apple silicon. В примечаниях Tencent по развёртыванию в качестве поддерживаемых сред выполнения перечислены transformers 5.6.0 или новее, vLLM, SGLang и llama.cpp, а рекомендации по инференсу ограничивают генерацию 8 192 токенами, хотя конфигурация заявляет до 262 144 позиций. С этим справляется одна современная потребительская GPU или GPU для рабочих станций.

North Small Translate 1.0 — это объект совершенно иного класса. Его общие параметры — 218 млрд, из которых 25 млрд активных, распределены между 128 экспертами, при этом на каждый токен активны восемь, плюс общие эксперты, а Cohere публикует минимальные требования к оборудованию для каждого из трёх своих чекпоинтов: четыре B200 или восемь H100 для BF16, два B200 или четыре H100 для FP8, один B200 или два H100 для сборки NVFP4 W4A16. Обслуживание работает через vLLM с cohere_melody>=0.9.0, и Cohere рекомендует жадное декодирование, чтобы соответствовать продакшену. В выходных данных присутствуют <|START_TEXT|> и <|END_TEXT|> — маркеры, которые не зарегистрированы как специальные токены.

Shape — North Small Translate 1.0: 218B всего / 25B активных, разреженная MoE, 128 экспертов против Hy-MT2-7B: плотная, примерно 8B

Контекст — 16K на входе и 16K на выходе против 8K рабочего окна; в конфигурации заявлено до 262 144 позиций

Минимальное оборудование — 1×B200 при W4A16, 2×B200 или 4×H100 при FP8 против одной GPU класса RTX 4090 в ~16 ГБ

Опубликованные форматы — BF16, FP8, NVFP4 W4A16 против базовой, FP8, GGUF, а также MLX 8-бит от сообщества

Языки — 50 (английский + 49) против 33 языков плюс 5 языков меньшинств и диалектов

Лицензия — CC BY-NC 4.0, коммерческое использование через Model Vault в сравнении с Apache 2.0, без ограничений

Заявленное качество — WMT26 83.60, метрика не указана, заявленные вендором данные в сравнении с таблицами названных вендоров на FLORES-200, WMT25 GEMBA, XCOMET-XXL и IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Проблема эталонного теста

Вот честная суть этого сравнения: мы не можем ранжировать эти две модели друг относительно друга, и любой, кто утверждает обратное, выдумывает число. Tencent опубликовала четыре поименованные оценки. На переводе FLORES-200 с английского на X модель 7B показывает 93,52, уступая 94,42 у Gemini 3.1 Pro и 94,16 у GPT-5.5, но достаточно близко, чтобы иметь значение. На метрике GEMBA, смежной с WMT25, она набирает 82,24 против 84,34 у 30B-A3B и 83,41 у GPT-5.5. По XCOMET-XXL она лидирует среди всего в сравнительной таблице Tencent с результатом 63,86 — впереди Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro и Kimi K2.6. По показателю следования инструкциям IFMTBench она достигает 83,14%. Все это собственные цифры Tencent, ни одна не была независимо воспроизведена, и они всё равно намного превосходят то, что предложила Cohere.

Cohere опубликовала единственный показатель: оценку WMT26 в 83,60, которая возрастает до 84,36 в рамках агентного многопроходного рабочего процесса. Ни одна метрика не названа ни в карточке модели, ни в примечании к выпуску, и ни одна страница результатов WMT26 не опубликована для этой модели. Эта асимметрия не доказывает, что модель Cohere слабее или сильнее. Она означает, что сравнение, которое читатель хочет больше всего — один и тот же тест, одна и та же метрика, обе модели — невозможно провести на основе публичных данных, а разброс в четыре пункта внутри двух собственных показателей Cohere (от 83,60 до 84,36) уже больше, чем большинство разрывов в таблице Tencent.

Языки и длинный документ

North Small Translate 1.0 охватывает пятьдесят языков и региональных вариантов, при этом современный стандартный арабский, немецкий, французский, японский, корейский, русский и украинский отнесены к первому уровню, а на входе и на выходе он принимает и выдает по 16 000 токенов. Hy-MT2-7B охватывает тридцать три языка плюс пять языков меньшинств и диалектов, включая тибетский, уйгурский и кантонский. Ни один из этих списков не является надмножеством другого — Tencent охватывает кантонский и уйгурский, Cohere — более широкий набор европейских локалей, — поэтому многоязычное развертывание может обнаружить, что нуждается в обоих уже только по соображениям покрытия.

Окно вывода — это менее заметное отличие. Шестнадцать тысяч токенов вывода означают полноценный документ процедуры за один проход, с согласованными терминологией и регистром по всему документу, потому что модель видела всё это целиком. А окно в 8K — нет, и обходной путь с переводом по предложениям вновь вносит именно те проблемы согласованности между сегментами, для измерения которых и были созданы такие бенчмарки следования инструкциям при переводе, как IFMTBench.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Лицензия, опять же, решает больше, чем таблица.

North Small Translate 1.0 распространяется под лицензией CC BY-NC 4.0. Веса бесплатны для некоммерческой работы, а коммерческое развёртывание осуществляется через Model Vault от Cohere по приобретаемой лицензии, цена на которую не публикуется. Hy-MT2-7B имеет лицензию Apache 2.0 и доступен без ограничений — коммерческое использование, дообучение и производные разрешены без каких-либо переговоров. Для коммерческого продукта порядок действий очевиден сам по себе: Hy-MT2-7B можно развернуть уже сегодня, а модель Cohere можно оценить уже сегодня, и ни одна строка из бенчмарков не меняет этот порядок.

Компенсирующее преимущество Cohere — это бесплатный уровень. North Small Translate 1.0 работает на бесплатном уровне Chat V2, бесплатном как для тестовых, так и для продакшен-ключей, пока не будут достигнуты лимиты запросов, так что оценка не стоит ничего, кроме времени. У Hy-MT2-7B есть коммерческий API с хостингом — Tencent оценила хостинговый тариф этого семейства примерно в $0,044 за миллион входных токенов и $0,177 за миллион выходных токенов — а самостоятельный хостинг на собственном GPU — это по-настоящему бесплатный путь.

Что на самом деле подразумевает «multi-pass»

Решение Cohere опубликовать и 83.60, и 84.36 — самая информативная деталь в её заметке о выпуске, потому что оно говорит о том, что компания считает: рабочий процесс превосходит одиночный вызов. Это та же ставка, которую Tencent сделала с другим механизмом: её флагманская 30B-A3B выигрывает на GEMBA и XCOMET, тогда как Gemini 3.1 Pro выигрывает на FLORES-200, а это значит, что лучшая система — не одна модель, а панель. Объединение моделей OrcaRouter запускает несколько моделей как панель и согласовывает их ответы в рамках одного вызова — это версия идеи многопроходности на уровне платформы, к которой стремятся оба вендора, — и это сочетается со стороной маршрутизации, где один ключ покрывает каталог из более чем 200 моделей по прейскурантной цене провайдера с наценкой 0%, поэтому изменение цены вендора доходит до нас в тот же день, а не при следующем продлении контракта.

Такая постановка также решает проблему доказательств, с которой начиналась эта статья. Когда два поставщика публикуют непересекающиеся бенчмарки и ни у одного из них нет независимой оценки, выбирать нужно не по таблице. А прогнать оба на собственных документах и позволить расхождению проявиться на реальном тексте — именно для этого и нужны панель и цепочка аварийного переключения.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Какой именно, и когда

Если вам нужна модель перевода, работающая на оборудовании, которым вы уже владеете, в коммерческом продукте, без разговоров о лицензировании, Hy-MT2-7B побеждает уже за счёт одной лишь совокупности условий — а её опубликованные производителем результаты, хоть и не воспроизведённые, по крайней мере названы, сопоставимы и близки к переднему краю. Если вы переводите длинные документы на пятьдесят языков Cohere, вам нужно 16K согласованного вывода за один проход и у вас есть либо бюджет на две B200, либо готовность провести оценку на бесплатном тарифе Cohere, прежде чем принимать решение, North Small Translate 1.0 — более мощная машина по всем раскрытым осям.

Ни одна из моделей не избавляет от необходимости тестировать. Cohere предоставила вам одно безымянное число и бесплатный способ его проверить. Tencent предоставила вам таблицу и загрузку размером с GPU. 83.60 — это обещание, а не результат, и единственное место, где это обещание подтверждается, — ваш собственный корпус.