Hero-карточка для противостояния с заголовком «North Small Translate 1.0 vs NLLB-200» и подзаголовком «50 языков против 200», над двумя карточками: North Small Translate 1.0 (218B MoE / 25B активных, 2026, контекст 16K) и NLLB-200 (флагманская 54.5B MoE, 2022, 200 языков).
Guides & Insights

North Small Translate 1.0 против NLLB-200: 50 языков против 200

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Более новая модель охватывает четверть языков. North Small Translate 1.0, которую Cohere описала в примечаниях к выпуску 9 сентября 2026 года, переводит между английским и ещё 49 языками. NLLB-200, семейство No Language Left Behind, выпущенное Meta в июле 2022 года, охватывает 200. Если бы количество языков было всем сравнением, это была бы короткая статья, но это не так: эти две модели — разные машины, созданные для разных задач, и четырёхлетний разрыв между ними проявляется в вещах, никак не связанных с тем, сколько языков указано в списке. Далее — для чего на самом деле хороша каждая из них, сколько стоит их эксплуатация и куда вас ведёт лицензирование.

Показатель покрытия, если честно

Двести против пятидесяти — это реальность, и это самая часто цитируемая причина держать NLLB-200 в стеке. Meta обучила её на более чем 18 миллиардах пар предложений с явным акцентом на языки с недостатком ресурсов, и она переводит напрямую между любой парой, а не через английский как промежуточное звено — архитектурное решение, которое имеет огромное значение, скажем, для перевода с бенгальского на тамильский, где система с английским в качестве промежуточного языка теряет качество дважды.

Что скрывает эта цифра, так это то, что пересечение двух списков — это и есть коммерчески полезная часть. Пятьдесят языков North Small Translate 1.0 включают немецкий, французский, испанский, португальский, итальянский, нидерландский, польский, чешский, японский, корейский, упрощённый и традиционный китайский, арабский, иврит, хинди, бенгальский, тамильский, телугу, тайский, турецкий, вьетнамский, индонезийский, малайский, русский и украинский — языки, на которые приходится подавляющая часть корпоративного объёма локализации. NLLB-200 также поддерживает все эти языки, плюс ещё примерно 150, которые North Small Translate 1.0 вообще не затрагивает. Так что вопрос не в том, какой список длиннее. А в том, включает ли ваш трафик языки, которые поддерживает только один из этих двух.

Две разные машины

Архитектурный разрыв — это то, что определяет, что вы можете построить. Крупнейший выпущенный чекпойнт NLLB-200 — это модель смеси экспертов с разреженным гейтингом примерно на 54,5 миллиарда параметров, а её плотные собратья идут на 3,3 млрд, 1,3 млрд и вплоть до дистиллированной версии на 600 млн. Все они — модели «последовательность-в-последовательность» архитектуры энкодер-декодер из линии M2M-100: вы подаёте токенизатору исходный сегмент, и он возвращает переведённый сегмент. Здесь нет шаблона чата, нет системного запроса, нет многоходовой структуры, а выпущенные чекпойнты построены вокруг перевода на уровне сегментов: в собственной карточке модели Meta указано, что модель обучалась на входных последовательностях длиной не более 512 токенов, и предупреждается, что более длинные последовательности ухудшают качество. Совокупный лимит токенизатора для исходного и целевого текста составляет 1 024 токена. В карточке NLLB-200 также говорится, что это исследовательская модель, не выпущенная для промышленного развёртывания, и отмечается, что она не предназначена для перевода документов, — именно это отличие резче всего отделяет её от того, что создала Cohere.

North Small Translate 1.0 имеет противоположную архитектуру. Это разреженный MoE только с декодером с 218 миллиардами общих параметров и 25 миллиардами активных параметров на токен, 128 экспертами, из которых восемь активны, плюс общие эксперты, и вниманием, которое чередует слои со скользящим окном (окно 4 096, RoPE) с глобальными слоями внимания, не несущими позиционных эмбеддингов. Он работает за шаблоном чата с системной инструкцией по умолчанию, и его окно составляет 16K токенов ввода и 16K токенов вывода. Этот бюджет вывода — показатель: это модель, созданная для того, чтобы ей передали документ и попросили вернуть документ, а не модель, созданная для того, чтобы ей передали предложение.

Всего параметров — North Small Translate 1.0: 218B MoE (25B активных) против NLLB-200: флагманская MoE 54,5B, плотные 600M–3,3B

Архитектура — каузальная MoE только с декодером и шаблоном чата против seq2seq с энкодером-декодером без шаблона чата

Контекст — 16K на входе и 16K на выходе в отличие от уровня сегмента; суммарный бюджет токенизатора — 1 024 токена

Языки — 50 (английский + 49) против 200

Прямые пары — ориентированная на английский иерархия уровней против «любой с любым» без английского посредника

Лицензия — CC BY-NC 4.0 vs CC BY-NC 4.0

Минимальные требования — 1×B200 при W4A16, 2×B200 при FP8 против ~37 ГБ видеопамяти при 4-битном режиме для 54B, 600M работает где угодно

Анонс — 9 сентября 2026 г. (веса на Hugging Face доступны по запросу с 14 августа) против июля 2022 г.

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

Что NLLB-200 всё ещё удерживает

Три вещи, и они вовсе не сентиментальны. Первая — длинный хвост: если вам нужны оромо, тигринья или любой из примерно 150 языков за пределами списка North Small Translate 1.0, решение уже принято. Вторая — ресурсоёмкость на нижнем конце: дистиллированный чекпойнт 600M набрал 1,4 миллиона загрузок и работает на аппаратном обеспечении, которое даже не смогло бы загрузить веса Cohere, что делает его единственным из этих двух, подходящим для развёртывания в изолированной сети или на периферии без трюков с квантизацией. Третья — зрелость: за NLLB-200 стоят четыре года инструментария, форков квантизации и историй из продакшена, плюс рецензируемая статья в Nature от июня 2024 года, описывающая, как он был создан. Cohere опубликовала заметку о выпуске.

Обратный компромисс столь же конкретен. В карточке модели NLLB-200 она описывается как исследовательская модель, не выпущенная для промышленного развёртывания, а её флагманский чекпоинт на 54B — настоящий тяжеловес: примерно 350 ГБ дискового пространства и порядка 108–120 ГБ видеопамяти для обслуживания без сжатия. Meta не продаёт размещённый у себя эндпоинт NLLB. Запуск модели в масштабе — ваша забота, и забота вполне реальная.

Лицензионная ловушка с обеих сторон

Именно это удивляет людей: обе модели распространяются по одной и той же лицензии, и это не та, которую предполагает большинство команд. И NLLB-200, и North Small Translate 1.0 выпущены под Creative Commons Attribution-NonCommercial 4.0. Ни одну из них в опубликованном виде нельзя использовать в коммерческом продукте. Ограничение NLLB-200 на некоммерческое использование вызвало настолько много споров, что существует специальный общественный проект Open-NLLB, цель которого — попытаться создать коммерчески пригодную производную версию, что напрямую упирается в лицензию, из которой он происходит. Путь Cohere чище: купить коммерческую лицензию и развернуть через Model Vault, при этом веса FP8 бесплатны на Hugging Face только для некоммерческой работы.

Есть одна асимметрия, которую стоит отметить. Cohere предоставляет North Small Translate 1.0 на бесплатном уровне своего Chat V2 API — бесплатно для пробных и рабочих ключей, пока не достигнуты лимиты запросов, — так что вы можете провести настоящую оценку без затрат и подписывать что-либо только если вы выпускаете продукт. NLLB-200 даёт вам веса и ничего больше.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Развертывание любого из них

North Small Translate 1.0 поставляется в трёх контрольных точках — BF16, FP8 и NVFP4 W4A16 — с опубликованными минимальными требованиями к оборудованию для каждой: четыре B200 или восемь H100 для BF16, два B200 или четыре H100 для FP8 и один B200 или два H100 для W4A16. Обслуживание осуществляется через vLLM с cohere_melody>=0.9.0, и Cohere рекомендует жадное декодирование, соответствующее её производственной конфигурации. Вывод оборачивается в маркеры <|START_TEXT|> и <|END_TEXT|>, которые не зарегистрированы как специальные токены, поэтому наивное skip_special_tokens=True оставит их в вашем выводе.

NLLB-200 развёртывается через стандартные пути transformers или fairseq с гораздо большей терпимостью к маломощному оборудованию, поскольку именно дистиллированные чекпойнты 600M и 1.3B большинство людей фактически запускает. А вот 54B MoE — тот, который требует планирования.

Вопрос маршрутизации, который на самом деле представляет это противостояние

Ни North Small Translate 1.0, ни NLLB-200 нет в каталоге OrcaRouter сегодня, так что это не статья о том, чтобы выбрать один с нашей полки. Всё же стоит назвать форму проблемы, потому что «одна модель для языков первого уровня, другая для длинного хвоста» — это политика маршрутизации, а политика маршрутизации — это то, что должно жить в конфигурации, а не в коде приложения. DSL маршрутизации OrcaRouter выражает именно это в виде YAML плюс правила CEL, так что правило для языковой пары может отправлять европейские пары в одну модель и переключаться на другую, когда пара не поддерживается, а цепочки отказоустойчивости означают, что вышестоящий сервис, который начинает возвращать ошибки, не становится вашим простоем. Это один ключ и одна интеграция по каталогу из более чем 200 моделей по прейскурантной цене провайдера с 0% наценки, а не второй контракт с поставщиком для каждой модели перевода, которую вы решите попробовать.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

К какому из них вам стоит обратиться

Если ваша контент-стратегия затрагивает языки за пределами пятидесяти, поддерживаемых Cohere, оставьте NLLB-200 и считайте вопрос решённым — никакая архитектурная современность не компенсирует отсутствие нужного языка. Если вы занимаетесь корпоративной локализацией на языки, которые перечислила Cohere, работаете в рамках документа, а не отдельного предложения, и готовы купить коммерческую лицензию, North Small Translate 1.0 — более способная модель по каждому из измерений, раскрываемых в документации, с важной оговоркой: её единственное свидетельство качества — одна невоспроизведённая цифра от поставщика. Если вы прототипируете и у вас нет бюджета, бесплатный тариф Cohere делает такую оценку почти бесплатной, и это лучшая стартовая позиция, чем у NLLB-200, где цена того, чтобы выяснить, — аренда GPU.

Полезный способ одновременно удержать оба факта: NLLB-200 — это модель, которая охватывает языки, до которых не добирается больше никто, и она была создана в 2022 году для исследовательского перевода на уровне предложений. North Small Translate 1.0 — это модель, которая лучше справляется с меньшим числом языков, и она была создана в 2026 году для документов. Выбор между ними — это на самом деле не суждение о качестве. Это вопрос о том, какие языки вы действительно выпускаете.