
North Small Translate 1.0 vs Hy-MT2: Hai trình dịch MoE, một khoảng trống bằng chứng
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Cả hai dòng mô hình này đều được xây dựng dựa trên cùng một canh bạc — rằng một mạng mixture-of-experts thưa được hậu huấn luyện cho dịch thuật sẽ đánh bại một mô hình đa dụng được yêu cầu dịch — và chúng đã đi đến đó từ hai hướng đối lập. Hy-MT2, dòng ba mô hình dịch thuật của Tencent Hunyuan với mô hình chủ lực là Hy-MT2-30B-A3B MoE, đã được mã nguồn mở vào ngày 21 tháng 5 năm 2026 theo Apache 2.0 cùng một báo cáo kỹ thuật, một benchmark mã nguồn mở và một bảng so sánh đầy đủ. North Small Translate 1.0, mô hình dịch MoE 218 tỷ tham số, 25 tỷ tham số hoạt động của Cohere, đã được ghi lại trong một ghi chú phát hành đề ngày 9 tháng 9 năm 2026, và bằng chứng chất lượng của nó chỉ là một con số duy nhất mà không gắn với bất kỳ chỉ số nào. Các kiến trúc na ná nhau. Còn phần tài liệu thì không, và sự khác biệt đó là điều hữu ích nhất cần hiểu trước khi chọn một trong hai.
Một họ, ba kích cỡ đối đầu với một mô hình lớn
Hy-MT2 không phải là một mô hình duy nhất mà là cả một dải: mô hình dense 1,8B cho xử lý trên thiết bị, mô hình dense 7B cho một GPU đơn, và MoE 30B-A3B là mô hình chủ lực với ba tỷ tham số hoạt động trên mỗi token. Cả ba đều theo Apache 2.0, không bị hạn chế truy cập, và được phát hành cùng với các bản lượng tử hóa FP8, GGUF, 2-bit và 1.25-bit, cùng bộ đánh giá tuân thủ chỉ dẫn IFMTBench và một bài báo đồng hành. Tencent báo cáo rằng dòng mô hình này dịch được giữa 33 ngôn ngữ cùng với năm ngôn ngữ thiểu số và phương ngữ.
North Small Translate 1.0 là một điểm duy nhất trong không gian kích thước, và là một điểm lớn: 218B tham số tổng, 25B hoạt động, 128 chuyên gia với tám chuyên gia được kích hoạt trên mỗi token cùng các chuyên gia dùng chung, và attention luân phiên theo tỷ lệ 3:1 giữa các lớp cửa sổ trượt (cửa sổ 4.096, RoPE) và các lớp toàn cục không mang embedding vị trí. Cửa sổ của nó là 16K đầu vào và 16K đầu ra trên tiếng Anh cùng 49 ngôn ngữ khác, với tiếng Ả Rập chuẩn hiện đại, tiếng Đức, tiếng Pháp, tiếng Nhật, tiếng Hàn, tiếng Nga và tiếng Ukraina được xếp vào nhóm tier-one. Đáng chú ý, hình dạng này không mới — Command A+ của Cohere từ tháng 5 năm 2026 đã dùng cùng cấu hình 218B/25B — khiến đây là một bản post-train chuyên biệt cho dịch thuật của một lõi hiện có thay vì một kiến trúc mới.
• Tham số — North Small Translate 1.0: tổng 218B / 25B hoạt động so với Hy-MT2-30B-A3B: tổng 30B / 3B hoạt động, cùng với các mô hình dense anh em 1.8B và 7B
• Ngữ cảnh — 16K vào và 16K ra so với cửa sổ làm việc 8K, cấu hình quảng cáo lên tới 262.144 vị trí
• Ngôn ngữ — 50 (tiếng Anh + 49) so với 33 cộng thêm 5 ngôn ngữ và phương ngữ thiểu số
• Giấy phép — CC BY-NC 4.0, thương mại qua Model Vault so với Apache 2.0, không cần phê duyệt truy cập
• Bằng chứng đã công bố — một số liệu WMT26 không nêu tên, do nhà cung cấp báo cáo so với một báo cáo kỹ thuật, một benchmark mở, và các kết quả có nêu tên trên FLORES-200, WMT25 GEMBA và XCOMET-XXL
• Phục vụ — vLLM với cohere_melody>=0.9.0, giải mã tham lam được khuyến nghị so với transformers, vLLM, SGLang và llama.cpp
• Công bố — ngày 9 tháng 9 năm 2026 (trọng số được giới hạn truy cập trên Hugging Face kể từ ngày 14 tháng 8) so với ngày 21 tháng 5 năm 2026

Khoảng trống bằng chứng mới là câu chuyện thật sự
Bản phát hành của Tencent đi kèm bằng chứng xác thực. Có một bài báo trên arXiv, một benchmark do công ty tự viết và mở mã nguồn dành riêng để đo khả năng tuân thủ chỉ dẫn dịch, cùng một bảng kết quả nêu tên các đối thủ cạnh tranh. FLORES-200 English-to-X đặt 30B-A3B ở mức 93,85, so với Gemini 3.1 Pro ở mức 94,42 và GPT-5.5 ở mức 94,16. Chỉ số GEMBA thời WMT25 đặt nó ở mức 84,34 — điểm cao nhất trong so sánh của chính Tencent, xếp trên GPT-5.5 ở mức 83,41 và 83,29 trong hai chế độ của nó, Gemini 3.1 Pro ở mức 82,23, DeepSeek-V4-Pro ở mức 81,99 và Kimi K2.6 ở mức 81,68. XCOMET-XXL đặt nó ở mức 62,89, sau mô hình anh em 7B của chính mình. Trên IFMTBench, nó đạt 85,7% về khả năng tuân thủ chỉ dẫn tổng thể, với điểm phụ 91,94% chỉ cách Gemini 3.1 Pro trong khoảng một phần trăm điểm, và một điểm phụ riêng là 85,55%, nơi nó dẫn đầu hoàn toàn trước mô hình Gemini 3.1 Pro.
Mỗi một trong số đó đều là phép đo của chính Tencent và chưa có cái nào được tái lập một cách độc lập. Nhưng chúng có tên, chúng có thể so sánh được, và chúng có thể bị phản bác — người đọc biết chính xác cần chạy thử nghiệm nào để tranh luận.
Ghi chú phát hành của Cohere chỉ đưa ra một con số: WMT26 83,60, tăng lên 84,36 theo cái mà họ gọi là quy trình dịch đa lượt dạng tác tử. Không có chỉ số nào được nêu tên ở bất kỳ đâu trên thẻ mô hình hay trong tài liệu. Không có trang kết quả WMT26 nào được công bố cho mô hình này. Tập dữ liệu huấn luyện, số lượng token và đường ống dữ liệu đều không được tiết lộ, trong khi báo cáo kỹ thuật năm 2025 của Command A Translate đã mô tả chi tiết một kỹ thuật lọc theo độ khó. Không điều nào trong số đó là bằng chứng cho thấy một mô hình kém hơn. Đó là bằng chứng về việc có ít bằng chứng hơn, một chuyện khác hẳn và cũng quan trọng không kém khi bạn đang cân nhắc đưa thứ gì vào vận hành thực tế.
Thước đo chung mà không bên nào thực sự công bố.
Có một điểm tiếp xúc thực sự giữa hai bên, và nó đáng để dành một đoạn văn bởi đây là nơi duy nhất một so sánh công bằng có thể diễn ra. Tencent là đối tác của WMT26, tài trợ một nhiệm vụ dịch phụ đề video với các giải thưởng do Hunyuan tài trợ. Con số duy nhất được Cohere công bố là một con số của WMT26. Vì vậy, cả hai tổ chức đều nằm trong cùng một chu kỳ đánh giá năm 2026, và chỉ số duy nhất nơi một cuộc đối đầu trực tiếp có thể ngã ngũ lại chính là chỉ số mà chỉ một trong hai đã công bố bất cứ điều gì — và công bố nó mà không nêu tên chỉ số.
Đó là khoảng cách đáng để theo dõi. Nếu Cohere gán một tên chỉ số cho 83.60, hoặc nếu các trang kết quả WMT26 bao gồm một hệ thống North Small Translate, thì việc so sánh mới trở nên thực chất. Cho đến lúc đó, đem các con số FLORES-200 và GEMBA của Tencent đặt cạnh con số WMT26 không nhãn của Cohere sẽ là một sự ngụy tạo được khoác áo phân tích.

Giấy phép và triển khai
Hy-MT2 dùng Apache 2.0 không có gating: sử dụng cho mục đích thương mại, tinh chỉnh, sản phẩm phái sinh và tái phân phối, tất cả đều không cần trao đổi qua lại. North Small Translate 1.0 là CC BY-NC 4.0, miễn phí cho sử dụng phi thương mại, còn triển khai thương mại phải thông qua Model Vault của Cohere với mức giá không được công bố. Với bất kỳ thứ gì được giao đến khách hàng, sự khác biệt đó quyết định lựa chọn trước cả khi các benchmark được xem xét.
Câu chuyện về phần cứng diễn ra theo cùng một khuôn mẫu nhưng theo chiều ngược lại. Hy-MT2 trải dài từ một bản dựng lượng tử hóa 440MB chạy trên điện thoại di động cho tới 30B-A3B, với ba tỷ tham số hoạt động giúp khối lượng tính toán mỗi token ở mức khiêm tốn so với phân khúc chất lượng của nó; các runtime bao gồm transformers, vLLM, SGLang và llama.cpp. North Small Translate 1.0 công bố yêu cầu phần cứng tối thiểu cho từng checkpoint — bốn B200 hoặc tám H100 cho BF16, hai B200 hoặc bốn H100 cho FP8, một B200 hoặc hai H100 cho NVFP4 W4A16 — và khuyến nghị giải mã tham lam để khớp với môi trường production. Lợi thế bù đắp của Cohere là mô hình chạy trên gói miễn phí của API Chat V2, miễn phí cho cả khóa dùng thử lẫn khóa production cho đến khi chạm giới hạn tốc độ, nên việc đánh giá nó không tốn kém gì.
Bạn có nên chuyển không, và chuyển sang cái gì?
Câu hỏi về việc chuyển đổi thực sự bất đối xứng ở đây. Chuyển từ Hy-MT2 sang North Small Translate 1.0 không phải là một nâng cấp hiệu năng mà bạn có thể biện minh ở thời điểm hiện tại — đó là đặt cược vào một mô hình mà tuyên bố công khai duy nhất chỉ là một con số, đánh đổi lấy một họ mô hình có báo cáo được công bố và giấy phép có thể triển khai. Điều đáng làm là đánh giá: mô hình Cohere được gọi miễn phí, bao phủ năm mươi ngôn ngữ, bao gồm cả một nhóm ngôn ngữ châu Âu rộng hơn, và cung cấp cho bạn 16K đầu ra mỗi lượt, điều mà cửa sổ làm việc 8K của Hy-MT2 không làm được.
Đánh giá đó chính là trường hợp mà một lớp định tuyến chứng minh được giá trị của mình, bởi vì câu trả lời trung thực cho hầu hết các stack đa ngôn ngữ là cả hai mô hình đều được giữ lại. OrcaRouter đặt một danh mục hơn 200 mô hình phía sau một khóa duy nhất, vì vậy việc thử một mô hình dịch thứ hai chỉ là một thay đổi cấu hình, chứ không phải một hợp đồng nhà cung cấp thứ hai hay một thay đổi mã nguồn — bạn chỉ cần trỏ cùng một client tương thích OpenAI vào một model id khác và so sánh trên chính văn bản của mình. Giá niêm yết của nhà cung cấp được chuyển tiếp ở mức gia tăng 0%, nên khi giá dịch vụ lưu trữ thay đổi thì phía chúng tôi cập nhật ngay trong cùng ngày mà không cộng thêm bất kỳ khoản chênh lệch nào lên trên, và các chuỗi chuyển đổi dự phòng giữ cho môi trường production chạy trên mô hình vốn đã hoạt động tốt trong khi mô hình mới đang được đánh giá. Cả North Small Translate 1.0 lẫn Hy-MT2 đều chưa có trong danh mục của chúng tôi hiện nay, nên đây không phải là lời khuyên mua một trong hai từ chúng tôi — mà là lập luận cho việc đừng cố định quyết định trước khi bạn chạy thử nghiệm.

Bản án
Hy-MT2 của Tencent là lựa chọn an toàn hơn và xét trên bằng chứng thì không hề sát nút: Apache 2.0, ba kích cỡ, một bài báo, một benchmark mở, bốn bộ đánh giá có tên và một quan hệ đối tác WMT26. North Small Translate 1.0 của Cohere mới là cái thú vị hơn — 218 tỷ tham số MoE chuyên cho dịch thuật đằng sau cửa sổ đầu ra 16K và năm mươi ngôn ngữ, một gói đánh giá miễn phí, và con số 83.60 mà chưa ai ngoài Cohere từng kiểm chứng.
Nếu bạn cần một quyết định trong quý này, hãy chọn dòng có bằng chứng. Nếu bạn có một corpus và một tuần, hãy đưa một phần của nó qua gói miễn phí và tìm hiểu xem con số 83.60 không tên của Cohere có ý nghĩa gì trên tài liệu của bạn không — bởi vì đó là câu hỏi mà không bảng biểu nào của nhà cung cấp sẽ trả lời thay bạn, và con số duy nhất mà Cohere chọn công bố lại chính xác là con số mà nó từ chối đặt tên.
