
North Small Translate 1.0 против Hy-MT2-7B: одна GPU против двух B200
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Самое близкое противостояние в открытом переводе прямо сейчас может оказаться и самым неочевидным. Hy-MT2-7B — средний ребёнок в семействе переводчиков Tencent Hunyuan, открытый под Apache 2.0 21 мая 2026 года, и он работает на одной RTX 4090 или A100, используя около 16 ГБ видеопамяти. North Small Translate 1.0 — это разреженный смесь-экспертный переводчик Cohere на 218 миллиардов параметров, описанный в примечаниях к выпуску компании от 9 сентября 2026 года, с минимальным развёртыванием на двух B200 в FP8 или на одном B200 в его форме NVFP4 W4A16. Оба — специалисты по переводу. Оба — актуальны. Один из них можно запустить с рабочей станции, и уже один этот факт переворачивает всё сравнение — потому что бенчмарка, в котором их больше всего хотели бы оценить на равных условиях, не существует.
Начните с конверта, а не с оценок.
Стоимость развёртывания — это критерий, который определяет большинство реальных интеграций, и здесь две модели даже близко не стоят. Hy-MT2-7B — это плотная модель HunYuanDenseV1 примерно на восемь миллиардов параметров с опубликованными сборками FP8 и GGUF, а также 8-битными версиями MLX от сообщества для Apple silicon. В примечаниях Tencent по развёртыванию в качестве поддерживаемых сред выполнения перечислены transformers 5.6.0 или новее, vLLM, SGLang и llama.cpp, а рекомендации по инференсу ограничивают генерацию 8 192 токенами, хотя конфигурация заявляет до 262 144 позиций. С этим справляется одна современная потребительская GPU или GPU для рабочих станций.
North Small Translate 1.0 — это объект совершенно иного класса. Его общие параметры — 218 млрд, из которых 25 млрд активных, распределены между 128 экспертами, при этом на каждый токен активны восемь, плюс общие эксперты, а Cohere публикует минимальные требования к оборудованию для каждого из трёх своих чекпоинтов: четыре B200 или восемь H100 для BF16, два B200 или четыре H100 для FP8, один B200 или два H100 для сборки NVFP4 W4A16. Обслуживание работает через vLLM с cohere_melody>=0.9.0, и Cohere рекомендует жадное декодирование, чтобы соответствовать продакшену. В выходных данных присутствуют <|START_TEXT|> и <|END_TEXT|> — маркеры, которые не зарегистрированы как специальные токены.
• Shape — North Small Translate 1.0: 218B всего / 25B активных, разреженная MoE, 128 экспертов против Hy-MT2-7B: плотная, примерно 8B
• Контекст — 16K на входе и 16K на выходе против 8K рабочего окна; в конфигурации заявлено до 262 144 позиций
• Минимальное оборудование — 1×B200 при W4A16, 2×B200 или 4×H100 при FP8 против одной GPU класса RTX 4090 в ~16 ГБ
• Опубликованные форматы — BF16, FP8, NVFP4 W4A16 против базовой, FP8, GGUF, а также MLX 8-бит от сообщества
• Языки — 50 (английский + 49) против 33 языков плюс 5 языков меньшинств и диалектов
• Лицензия — CC BY-NC 4.0, коммерческое использование через Model Vault в сравнении с Apache 2.0, без ограничений
• Заявленное качество — WMT26 83.60, метрика не указана, заявленные вендором данные в сравнении с таблицами названных вендоров на FLORES-200, WMT25 GEMBA, XCOMET-XXL и IFMTBench

Проблема эталонного теста
Вот честная суть этого сравнения: мы не можем ранжировать эти две модели друг относительно друга, и любой, кто утверждает обратное, выдумывает число. Tencent опубликовала четыре поименованные оценки. На переводе FLORES-200 с английского на X модель 7B показывает 93,52, уступая 94,42 у Gemini 3.1 Pro и 94,16 у GPT-5.5, но достаточно близко, чтобы иметь значение. На метрике GEMBA, смежной с WMT25, она набирает 82,24 против 84,34 у 30B-A3B и 83,41 у GPT-5.5. По XCOMET-XXL она лидирует среди всего в сравнительной таблице Tencent с результатом 63,86 — впереди Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro и Kimi K2.6. По показателю следования инструкциям IFMTBench она достигает 83,14%. Все это собственные цифры Tencent, ни одна не была независимо воспроизведена, и они всё равно намного превосходят то, что предложила Cohere.
Cohere опубликовала единственный показатель: оценку WMT26 в 83,60, которая возрастает до 84,36 в рамках агентного многопроходного рабочего процесса. Ни одна метрика не названа ни в карточке модели, ни в примечании к выпуску, и ни одна страница результатов WMT26 не опубликована для этой модели. Эта асимметрия не доказывает, что модель Cohere слабее или сильнее. Она означает, что сравнение, которое читатель хочет больше всего — один и тот же тест, одна и та же метрика, обе модели — невозможно провести на основе публичных данных, а разброс в четыре пункта внутри двух собственных показателей Cohere (от 83,60 до 84,36) уже больше, чем большинство разрывов в таблице Tencent.
Языки и длинный документ
North Small Translate 1.0 охватывает пятьдесят языков и региональных вариантов, при этом современный стандартный арабский, немецкий, французский, японский, корейский, русский и украинский отнесены к первому уровню, а на входе и на выходе он принимает и выдает по 16 000 токенов. Hy-MT2-7B охватывает тридцать три языка плюс пять языков меньшинств и диалектов, включая тибетский, уйгурский и кантонский. Ни один из этих списков не является надмножеством другого — Tencent охватывает кантонский и уйгурский, Cohere — более широкий набор европейских локалей, — поэтому многоязычное развертывание может обнаружить, что нуждается в обоих уже только по соображениям покрытия.
Окно вывода — это менее заметное отличие. Шестнадцать тысяч токенов вывода означают полноценный документ процедуры за один проход, с согласованными терминологией и регистром по всему документу, потому что модель видела всё это целиком. А окно в 8K — нет, и обходной путь с переводом по предложениям вновь вносит именно те проблемы согласованности между сегментами, для измерения которых и были созданы такие бенчмарки следования инструкциям при переводе, как IFMTBench.

Лицензия, опять же, решает больше, чем таблица.
North Small Translate 1.0 распространяется под лицензией CC BY-NC 4.0. Веса бесплатны для некоммерческой работы, а коммерческое развёртывание осуществляется через Model Vault от Cohere по приобретаемой лицензии, цена на которую не публикуется. Hy-MT2-7B имеет лицензию Apache 2.0 и доступен без ограничений — коммерческое использование, дообучение и производные разрешены без каких-либо переговоров. Для коммерческого продукта порядок действий очевиден сам по себе: Hy-MT2-7B можно развернуть уже сегодня, а модель Cohere можно оценить уже сегодня, и ни одна строка из бенчмарков не меняет этот порядок.
Компенсирующее преимущество Cohere — это бесплатный уровень. North Small Translate 1.0 работает на бесплатном уровне Chat V2, бесплатном как для тестовых, так и для продакшен-ключей, пока не будут достигнуты лимиты запросов, так что оценка не стоит ничего, кроме времени. У Hy-MT2-7B есть коммерческий API с хостингом — Tencent оценила хостинговый тариф этого семейства примерно в $0,044 за миллион входных токенов и $0,177 за миллион выходных токенов — а самостоятельный хостинг на собственном GPU — это по-настоящему бесплатный путь.
Что на самом деле подразумевает «multi-pass»
Решение Cohere опубликовать и 83.60, и 84.36 — самая информативная деталь в её заметке о выпуске, потому что оно говорит о том, что компания считает: рабочий процесс превосходит одиночный вызов. Это та же ставка, которую Tencent сделала с другим механизмом: её флагманская 30B-A3B выигрывает на GEMBA и XCOMET, тогда как Gemini 3.1 Pro выигрывает на FLORES-200, а это значит, что лучшая система — не одна модель, а панель. Объединение моделей OrcaRouter запускает несколько моделей как панель и согласовывает их ответы в рамках одного вызова — это версия идеи многопроходности на уровне платформы, к которой стремятся оба вендора, — и это сочетается со стороной маршрутизации, где один ключ покрывает каталог из более чем 200 моделей по прейскурантной цене провайдера с наценкой 0%, поэтому изменение цены вендора доходит до нас в тот же день, а не при следующем продлении контракта.
Такая постановка также решает проблему доказательств, с которой начиналась эта статья. Когда два поставщика публикуют непересекающиеся бенчмарки и ни у одного из них нет независимой оценки, выбирать нужно не по таблице. А прогнать оба на собственных документах и позволить расхождению проявиться на реальном тексте — именно для этого и нужны панель и цепочка аварийного переключения.

Какой именно, и когда
Если вам нужна модель перевода, работающая на оборудовании, которым вы уже владеете, в коммерческом продукте, без разговоров о лицензировании, Hy-MT2-7B побеждает уже за счёт одной лишь совокупности условий — а её опубликованные производителем результаты, хоть и не воспроизведённые, по крайней мере названы, сопоставимы и близки к переднему краю. Если вы переводите длинные документы на пятьдесят языков Cohere, вам нужно 16K согласованного вывода за один проход и у вас есть либо бюджет на две B200, либо готовность провести оценку на бесплатном тарифе Cohere, прежде чем принимать решение, North Small Translate 1.0 — более мощная машина по всем раскрытым осям.
Ни одна из моделей не избавляет от необходимости тестировать. Cohere предоставила вам одно безымянное число и бесплатный способ его проверить. Tencent предоставила вам таблицу и загрузку размером с GPU. 83.60 — это обещание, а не результат, и единственное место, где это обещание подтверждается, — ваш собственный корпус.
