Thẻ hero cho màn đối đầu có tiêu đề "North Small Translate 1.0 vs NLLB-200" với phụ đề "50 ngôn ngữ đối đầu 200", phía trên hai thẻ: North Small Translate 1.0 (218B MoE / 25B hoạt động, 2026, ngữ cảnh 16K) và NLLB-200 (54.5B MoE chủ lực, 2022, 200 ngôn ngữ).
Guides & Insights

North Small Translate 1.0 vs NLLB-200: 50 ngôn ngữ so với 200

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Mẫu mới hơn chỉ bao phủ một phần tư số ngôn ngữ. North Small Translate 1.0, mà Cohere đã ghi lại trong ghi chú phát hành ngày 9 tháng 9 năm 2026, dịch giữa tiếng Anh và 49 ngôn ngữ khác. NLLB-200, dòng No Language Left Behind mà Meta phát hành vào tháng 7 năm 2022, bao phủ 200 ngôn ngữ. Nếu số lượng ngôn ngữ là toàn bộ tiêu chí so sánh thì đây sẽ là một bài viết ngắn, nhưng không phải vậy: hai mô hình này là những cỗ máy khác nhau được chế tạo cho những công việc khác nhau, và khoảng cách bốn năm giữa chúng thể hiện theo những cách chẳng liên quan gì đến việc có bao nhiêu ngôn ngữ xuất hiện trong một danh sách. Phần tiếp theo là những gì mỗi mô hình thực sự làm tốt, chi phí để vận hành chúng, và việc cấp phép sẽ dẫn bạn đến đâu.

Con số độ phủ, thành thật mà nói

Hai trăm so với năm mươi là có thật, và đó là lý do được trích dẫn nhiều nhất để giữ NLLB-200 trong một stack. Meta đã huấn luyện nó trên hơn 18 tỷ cặp câu với sự nhấn mạnh rõ ràng vào các ngôn ngữ ít tài nguyên, và nó dịch trực tiếp giữa bất kỳ cặp nào thay vì trung chuyển qua tiếng Anh — một lựa chọn thiết kế vô cùng quan trọng đối với, chẳng hạn, tiếng Bengal sang tiếng Tamil, nơi một hệ thống trung chuyển qua tiếng Anh mất chất lượng hai lần.

Điều mà con số này che giấu là phần chồng lấn giữa hai danh sách mới chính là phần hữu ích về mặt thương mại. Năm mươi ngôn ngữ của North Small Translate 1.0 bao gồm tiếng Đức, tiếng Pháp, tiếng Tây Ban Nha, tiếng Bồ Đào Nha, tiếng Ý, tiếng Hà Lan, tiếng Ba Lan, tiếng Séc, tiếng Nhật, tiếng Hàn, tiếng Trung giản thể và phồn thể, tiếng Ả Rập, tiếng Do Thái, tiếng Hindi, tiếng Bengal, tiếng Tamil, tiếng Telugu, tiếng Thái, tiếng Thổ Nhĩ Kỳ, tiếng Việt, tiếng Indonesia, tiếng Mã Lai, tiếng Nga và tiếng Ukraina — những ngôn ngữ chiếm phần áp đảo trong khối lượng bản địa hóa doanh nghiệp. NLLB-200 cũng bao gồm tất cả những ngôn ngữ đó, cộng thêm khoảng 150 ngôn ngữ nữa mà North Small Translate 1.0 hoàn toàn không đụng tới. Vậy nên câu hỏi không phải là danh sách nào dài hơn. Mà là liệu lưu lượng truy cập của bạn có bao gồm những ngôn ngữ mà chỉ một trong hai hỗ trợ hay không.

Hai cỗ máy khác nhau

Khoảng cách kiến trúc là phần quyết định bạn có thể xây dựng được gì. Checkpoint lớn nhất được phát hành của NLLB-200 là một mô hình mixture-of-experts với cơ chế gating thưa, có khoảng 54,5 tỷ tham số, còn các mô hình anh em dense của nó chạy ở mức 3.3B, 1.3B, và thấp xuống đến bản chưng cất 600M. Tất cả chúng đều là mô hình encoder-decoder sequence-to-sequence thuộc dòng M2M-100: bạn đưa cho tokenizer một đoạn nguồn, nó trả về một đoạn đã dịch. Không có chat template, không có system prompt, không có cấu trúc đa lượt, và các checkpoint được phát hành được xây dựng xoay quanh dịch ở cấp đoạn: model card của chính Meta nêu rằng mô hình được huấn luyện với độ dài đầu vào không vượt quá 512 token, và cảnh báo rằng các chuỗi dài hơn sẽ làm giảm chất lượng. Ngân sách kết hợp của tokenizer cho nguồn và đích là 1,024 token. Card của NLLB-200 cũng mô tả nó như một mô hình nghiên cứu không được phát hành để triển khai production, và lưu ý rằng nó không nhằm dùng cho dịch tài liệu — sự khác biệt khiến nó tách biệt rõ nét nhất so với những gì Cohere đã xây dựng.

North Small Translate 1.0 có hình dạng ngược lại. Nó là một MoE thưa chỉ có decoder với 218 tỷ tham số tổng cộng và 25 tỷ tham số hoạt động mỗi token, 128 chuyên gia với tám chuyên gia hoạt động cùng các chuyên gia chia sẻ, và cơ chế attention xen kẽ các lớp cửa sổ trượt (cửa sổ 4.096, RoPE) với các lớp attention toàn cục không mang embedding vị trí. Nó chạy đằng sau một mẫu chat với chỉ dẫn hệ thống mặc định, và cửa sổ của nó là 16K token đầu vào và 16K token đầu ra. Ngân sách đầu ra đó chính là dấu hiệu: đây là một mô hình được xây dựng để nhận một tài liệu và trả lại một tài liệu, chứ không phải một mô hình được xây dựng để nhận một câu.

Tổng số tham số — North Small Translate 1.0: 218B MoE (25B hoạt động) so với NLLB-200: 54.5B MoE chủ lực, 600M–3.3B dense

Kiến trúc — MoE nhân quả chỉ có bộ giải mã với mẫu trò chuyện so với seq2seq bộ mã hóa-bộ giải mã không có mẫu trò chuyện

Ngữ cảnh — 16K vào và 16K ra so với cấp phân đoạn, ngân sách tokenizer 1.024 token kết hợp

Ngôn ngữ — 50 (tiếng Anh + 49) so với 200

Cặp trực tiếp — Phân tầng lấy tiếng Anh làm trung tâm so với any-to-any không dùng tiếng Anh làm trục trung gian

Giấy phép — CC BY-NC 4.0 so với CC BY-NC 4.0

Dung lượng tối thiểu — 1×B200 ở W4A16, 2×B200 ở FP8 so với ~37GB VRAM ở 4-bit cho bản 54B, bản 600M chạy được ở mọi nơi

Công bố — ngày 9 tháng 9 năm 2026 (trọng số được giới hạn truy cập trên Hugging Face kể từ ngày 14 tháng 8) so với tháng 7 năm 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

NLLB-200 vẫn sở hữu những gì

Ba điều, và chúng không mang tính cảm tính. Điều thứ nhất là phần đuôi dài: nếu bạn cần tiếng Oromo, tiếng Tigrinya, hoặc bất kỳ ngôn ngữ nào trong khoảng 150 ngôn ngữ nằm ngoài danh sách của North Small Translate 1.0, thì quyết định đã được đưa ra rồi. Điều thứ hai là dấu chân ở phân khúc nhỏ — checkpoint 600M đã chưng cất có 1,4 triệu lượt tải và chạy trên phần cứng mà thậm chí sẽ không tải nổi trọng số Cohere, khiến nó là mô hình duy nhất trong hai mô hình phù hợp với triển khai air-gapped hoặc edge mà không cần các thủ thuật lượng tử hóa. Điều thứ ba là độ trưởng thành: NLLB-200 có bốn năm công cụ, các bản fork lượng tử hóa, và những câu chuyện thực chiến từ sản xuất đằng sau nó, cộng thêm một bài báo Nature được bình duyệt từ tháng 6 năm 2024 mô tả cách nó được xây dựng. Cohere đã công bố một ghi chú phát hành.

Chiều ngược lại của sự đánh đổi cũng cụ thể không kém. Thẻ mô hình của NLLB-200 mô tả nó là một mô hình nghiên cứu không được phát hành để triển khai trong môi trường sản xuất, và checkpoint 54B chủ lực của nó là một gã nặng ký — khoảng 350GB dung lượng lưu trữ, và vào cỡ 108–120GB VRAM để phục vụ ở dạng không nén. Meta không bán endpoint NLLB được host. Chạy nó ở quy mô lớn là vấn đề của bạn, và đó là một vấn đề thực sự.

Cái bẫy cấp phép ở cả hai phía

Đây là phần khiến mọi người bất ngờ, vì hai mô hình mang cùng một giấy phép và đó không phải là giấy phép mà hầu hết các nhóm vẫn tưởng. Cả NLLB-200 lẫn North Small Translate 1.0 đều được phát hành theo Creative Commons Attribution-NonCommercial 4.0. Không mô hình nào có thể dùng trong sản phẩm thương mại như khi được phát hành. Hạn chế phi thương mại của NLLB-200 đã gây tranh cãi đến mức tồn tại một dự án cộng đồng tên Open-NLLB, được lập ra đặc biệt để cố tạo ra một bản phái sinh dùng được cho mục đích thương mại, nhưng lại đụng ngay vào giấy phép mà nó được phái sinh từ đó. Con đường của Cohere sạch sẽ hơn: mua giấy phép thương mại và triển khai qua Model Vault, với trọng số FP8 miễn phí trên Hugging Face chỉ cho công việc phi thương mại.

Có một điểm bất đối xứng đáng lưu ý. Cohere chạy North Small Translate 1.0 trên gói miễn phí của API Chat V2, miễn phí cho cả khóa dùng thử và khóa production cho đến khi đạt giới hạn tốc độ — nên bạn có thể chạy đánh giá thực tế với chi phí bằng không và chỉ ký kết điều gì đó nếu bạn triển khai. NLLB-200 chỉ cho bạn trọng số và không gì khác.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Triển khai một trong hai

North Small Translate 1.0 được phát hành với ba checkpoint — BF16, FP8 và NVFP4 W4A16 — cùng cấu hình phần cứng tối thiểu được công bố cho từng loại: bốn B200 hoặc tám H100 cho BF16, hai B200 hoặc bốn H100 cho FP8, và một B200 hoặc hai H100 cho W4A16. Việc phục vụ được thực hiện qua vLLM với cohere_melody>=0.9.0, và Cohere khuyến nghị giải mã tham lam (greedy decoding), khớp với cấu hình production của mô hình. Đầu ra được bọc trong các marker <|START_TEXT|> và <|END_TEXT|> — đây là những marker không được đăng ký như special token, nên nếu đặt skip_special_tokens=True một cách đơn giản thì chúng sẽ vẫn còn trong đầu ra của bạn.

NLLB-200 triển khai thông qua các đường dẫn transformers hoặc fairseq tiêu chuẩn với khả năng chịu đựng rộng hơn nhiều đối với phần cứng nhỏ, vì các checkpoint đã chưng cất 600M và 1.3B là những cái mà hầu hết mọi người thực sự chạy. 54B MoE là cái đòi hỏi phải lên kế hoạch.

Câu hỏi định tuyến mà cặp đấu này thực sự đại diện

Cả North Small Translate 1.0 lẫn NLLB-200 đều không nằm trong danh mục của OrcaRouter hôm nay, nên đây không phải là bài viết về việc chọn một cái nào đó khỏi kệ hàng của chúng tôi. Dù sao thì cũng đáng gọi tên hình dạng của vấn đề, bởi vì “một mô hình cho các ngôn ngữ hạng nhất, một mô hình khác cho phần đuôi dài” là một chính sách định tuyến — và chính sách định tuyến là thứ nên nằm trong cấu hình thay vì trong mã ứng dụng. DSL định tuyến của OrcaRouter diễn đạt chính xác điều đó dưới dạng YAML cùng các quy tắc CEL, vì vậy một quy tắc theo cặp ngôn ngữ có thể gửi các cặp ngôn ngữ châu Âu đến một mô hình và chuyển sang mô hình khác khi một cặp không được hỗ trợ, và chuỗi dự phòng nghĩa là một upstream bắt đầu trả lỗi sẽ không trở thành sự cố dịch vụ của bạn. Đó là một khóa và một tích hợp trên khắp danh mục hơn 200 mô hình ở giá niêm yết của nhà cung cấp với mức markup 0%, thay vì thêm một hợp đồng nhà cung cấp thứ hai cho mỗi mô hình dịch thuật mà bạn quyết định thử.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

Bạn nên chọn cái nào

Nếu chiến lược nội dung của bạn đụng đến những ngôn ngữ nằm ngoài năm mươi ngôn ngữ của Cohere, hãy giữ NLLB-200 và coi như đã chốt — kiến trúc có hiện đại đến đâu cũng không bù đắp được cho một ngôn ngữ bị thiếu. Nếu bạn đang làm bản địa hóa cấp doanh nghiệp sang các ngôn ngữ mà Cohere đã liệt kê, làm việc trong phạm vi cả tài liệu thay vì từng câu, và sẵn sàng mua giấy phép thương mại, thì North Small Translate 1.0 là mô hình có năng lực hơn trên mọi khía cạnh mà tài liệu công bố, kèm lưu ý quan trọng rằng bằng chứng chất lượng duy nhất của nó chỉ là một con số từ nhà cung cấp chưa được tái lập. Nếu bạn đang tạo nguyên mẫu và không có ngân sách, gói miễn phí của Cohere khiến việc đánh giá đó gần như miễn phí, một vị thế khởi đầu tốt hơn so với NLLB-200, nơi cái giá để biết kết quả là phải thuê GPU.

Cách hữu ích để nắm giữ đồng thời cả hai sự thật: NLLB-200 là mô hình vươn tới những ngôn ngữ mà không ai khác làm được, và nó được xây dựng vào năm 2022 cho dịch nghiên cứu ở cấp độ câu. North Small Translate 1.0 là mô hình xử lý ít ngôn ngữ hơn nhưng tốt hơn, và nó được xây dựng vào năm 2026 cho tài liệu. Việc lựa chọn giữa chúng thực sự không phải là một đánh giá về chất lượng. Đó là câu hỏi về việc bạn thực sự đưa những ngôn ngữ nào vào sản phẩm.