Thẻ Hero mang tiêu đề "North Small Translate 1.0 vs Hy-MT2-7B" với phụ đề "Một GPU đối đầu hai B200", nằm trên hai thẻ: North Small Translate 1.0 (218B MoE / 25B hoạt động, CC BY-NC 4.0) và Hy-MT2-7B (8B dense, khoảng 16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: Một GPU đấu với hai B200

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cuộc đối đầu sít sao nhất trong lĩnh vực dịch thuật mở hiện nay có thể cũng chính là cuộc đối đầu ít ai ngờ tới nhất. Hy-MT2-7B là đứa con giữa trong gia đình dịch thuật của Tencent Hunyuan, được mở mã nguồn theo giấy phép Apache 2.0 vào ngày 21 tháng 5 năm 2026, và nó chạy trên một chiếc RTX 4090 hoặc A100 duy nhất với khoảng 16GB VRAM. North Small Translate 1.0 là mô hình dịch mixture-of-experts thưa 218 tỷ tham số của Cohere, được ghi lại trong ghi chú phát hành của công ty vào ngày 9 tháng 9 năm 2026, với yêu cầu triển khai tối thiểu là hai chiếc B200 ở FP8 hoặc một chiếc B200 ở dạng NVFP4 W4A16. Cả hai đều là chuyên gia dịch thuật. Cả hai đều là bản hiện hành. Một trong hai có thể được phục vụ ngay từ một máy trạm, và chỉ riêng sự thật đó thôi đã định hình lại toàn bộ phép so sánh — bởi vì cái thước đo mà cả hai mong muốn nhất để được đánh giá trên cùng một mặt bằng lại không hề tồn tại.

Hãy bắt đầu với phong bì, không phải điểm số.

Chi phí triển khai là khía cạnh quyết định hầu hết các tích hợp thực tế, và ở đây hai mô hình không hề gần nhau. Hy-MT2-7B là một mô hình HunYuanDenseV1 dày đặc với khoảng tám tỷ tham số, có các bản dựng FP8 và GGUF đã được công bố, cùng với các phiên bản MLX 8-bit từ cộng đồng cho Apple silicon. Ghi chú triển khai của Tencent liệt kê transformers 5.6.0 trở lên, vLLM, SGLang và llama.cpp là các runtime được hỗ trợ, và hướng dẫn suy luận giới hạn việc tạo ở 8.192 token mặc dù cấu hình quảng cáo lên đến 262.144 vị trí. Một GPU tiêu dùng hoặc máy trạm hiện đại là đủ để chạy nó.

North Small Translate 1.0 thuộc một lớp đối tượng hoàn toàn khác. Tổng cộng 218B tham số với 25B tham số hoạt động được chia trên 128 expert, với tám expert hoạt động trên mỗi token cùng các expert chia sẻ, và Cohere công bố phần cứng tối thiểu cho từng checkpoint trong ba checkpoint của mình: bốn B200 hoặc tám H100 cho BF16, hai B200 hoặc bốn H100 cho FP8, một B200 hoặc hai H100 cho bản dựng NVFP4 W4A16. Việc phục vụ chạy qua vLLM với cohere_melody>=0.9.0, và Cohere khuyến nghị giải mã tham lam để khớp với production. Đầu ra mang <|START_TEXT|><|END_TEXT|> vốn là các marker không được đăng ký làm token đặc biệt.

Hình dạng — North Small Translate 1.0: tổng 218B / 25B hoạt động sparse MoE, 128 chuyên gia so với Hy-MT2-7B: dense, khoảng 8B

Ngữ cảnh — 16K vào và 16K ra so với cửa sổ làm việc 8K, cấu hình quảng cáo lên tới 262.144 vị trí

Phần cứng tối thiểu — 1×B200 ở W4A16, 2×B200 hoặc 4×H100 ở FP8 so với một GPU hạng RTX 4090 trong ~16GB

Các định dạng đã phát hành — BF16, FP8, NVFP4 W4A16 so với bản gốc, FP8, GGUF, cùng MLX 8-bit do cộng đồng phát triển

Ngôn ngữ — 50 (tiếng Anh + 49) so với 33 ngôn ngữ cùng 5 ngôn ngữ thiểu số và phương ngữ

Giấy phép — CC BY-NC 4.0, thương mại qua Model Vault so với Apache 2.0, không cần phê duyệt truy cập

Chất lượng được báo cáo — WMT26 83.60, chỉ số không được nêu tên, do nhà cung cấp tự báo cáo so với các bảng của nhà cung cấp được nêu tên trên FLORES-200, WMT25 GEMBA, XCOMET-XXL và IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Vấn đề benchmark

Đây là phần cốt lõi trung thực của màn so tài này: chúng ta không thể xếp hạng hai mô hình này so với nhau, và bất kỳ ai nói ngược lại đều đang bịa ra một con số. Tencent đã công bố bốn bài đánh giá có tên cụ thể. Trên FLORES-200 dịch Anh sang X, mô hình 7B đạt 93.52, đứng sau 94.42 của Gemini 3.1 Pro và 94.16 của GPT-5.5 nhưng đủ gần để tạo khác biệt. Trên chỉ số GEMBA liên quan WMT25, nó đạt 82.24 so với 84.34 của 30B-A3B và 83.41 của GPT-5.5. Trên XCOMET-XXL, nó dẫn đầu mọi thứ trong bảng so sánh của Tencent với 63.86 — vượt trên Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-ProKimi K2.6. Trên điểm tuân thủ chỉ dẫn của IFMTBench, nó đạt 83.14%. Tất cả đều là số liệu của chính Tencent, chưa có số nào được tái lập độc lập, và chúng vẫn còn nhiều hơn hẳn những gì Cohere đã đưa ra.

Cohere đã công bố một con số duy nhất: điểm WMT26 là 83,60, tăng lên 84,36 trong một quy trình làm việc đa lượt mang tính tác tử. Không có chỉ số nào được nêu tên trên thẻ mô hình hay trong ghi chú phát hành, và chưa có trang kết quả WMT26 nào được công bố đối chiếu với mô hình này. Sự bất đối xứng đó không phải bằng chứng cho thấy mô hình của Cohere yếu hơn hay mạnh hơn. Điều đó có nghĩa là phép so sánh mà người đọc mong muốn nhất — cùng bài kiểm tra, cùng chỉ số, cả hai mô hình — không thể được thực hiện từ bằng chứng công khai, và khoảng chênh lệch bốn điểm trong chính hai con số của Cohere (83,60 đến 84,36) đã lớn hơn phần lớn các khoảng cách trong bảng của Tencent.

Ngôn ngữ và tài liệu dài

North Small Translate 1.0 bao gồm năm mươi ngôn ngữ và biến thể địa phương, với tiếng Ả Rập chuẩn hiện đại, tiếng Đức, tiếng Pháp, tiếng Nhật, tiếng Hàn, tiếng Nga và tiếng Ukraina được chỉ định là hạng nhất, và nó chấp nhận và phát ra 16.000 token ở cả hai bên. Hy-MT2-7B bao gồm ba mươi ba ngôn ngữ cộng với năm ngôn ngữ thiểu số và phương ngữ bao gồm tiếng Tây Tạng, tiếng Uyghur và tiếng Quảng Đông. Không có danh sách nào là siêu tập của danh sách kia — Tencent tiếp cận tiếng Quảng Đông và tiếng Uyghur, Cohere tiếp cận một tập hợp rộng hơn các địa phương châu Âu — vì vậy một triển khai đa ngôn ngữ có thể thấy rằng nó cần cả hai chỉ vì lý do độ phủ.

Cửa sổ đầu ra là sự khác biệt kín đáo hơn. Mười sáu nghìn token đầu ra nghĩa là một tài liệu quy trình trọn vẹn trong một lượt, với thuật ngữ và văn phong nhất quán xuyên suốt toàn bộ vì mô hình đã thấy tất cả. Cửa sổ 8K thì không, và cách xử lý tạm bằng từng câu một lại đưa trở lại đúng những vấn đề nhất quán xuyên phân đoạn mà các benchmark tuân thủ chỉ dẫn dịch thuật như IFMTBench được xây dựng để đo lường.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Một lần nữa, giấy phép lại quyết định nhiều hơn cả bảng.

North Small Translate 1.0 là CC BY-NC 4.0. Các trọng số miễn phí cho công việc phi thương mại, và triển khai thương mại phải thông qua Model Vault của Cohere theo một giấy phép đã mua với mức giá không được công bố. Hy-MT2-7B là Apache 2.0 và không bị hạn chế truy cập — sử dụng thương mại, tinh chỉnh và các sản phẩm phái sinh đều được phép mà không cần trao đổi. Đối với một sản phẩm thương mại, thứ tự thực hiện tự nó đã rõ ràng: Hy-MT2-7B có thể triển khai ngay hôm nay và mô hình của Cohere có thể đánh giá ngay hôm nay, và không có dòng benchmark nào thay đổi được thứ tự đó.

Lợi thế bù đắp của Cohere là gói miễn phí. North Small Translate 1.0 chạy trên gói miễn phí của Chat V2, miễn phí cho cả khóa dùng thử và khóa sản xuất cho đến khi đạt giới hạn tốc độ, vì vậy việc đánh giá không tốn gì ngoài thời gian. Hy-MT2-7B có API thương mại được lưu trữ — Tencent định giá gói lưu trữ của dòng này ở khoảng $0,044 cho mỗi triệu token đầu vào và $0,177 cho mỗi triệu token đầu ra — và tự lưu trữ trên GPU của riêng bạn là con đường thực sự miễn phí.

"multi-pass" thực sự ngụ ý điều gì

Quyết định công bố cả hai mức 83,60 và 84,36 của Cohere là chi tiết đáng chú ý nhất trong ghi chú phát hành của hãng, bởi nó cho thấy công ty tin rằng một quy trình làm việc sẽ thắng một lệnh gọi đơn lẻ. Đó cũng chính là canh bạc mà Tencent đã đặt cược bằng một cơ chế khác: mô hình chủ lực 30B-A3B của hãng thắng trên GEMBA và XCOMET trong khi Gemini 3.1 Pro thắng trên FLORES-200, nghĩa là hệ thống tốt nhất không phải một mô hình đơn lẻ mà là cả một hội đồng. Tính năng hợp nhất mô hình của OrcaRouter chạy nhiều mô hình như một hội đồng và dung hòa câu trả lời của chúng trong một lệnh gọi duy nhất — đây chính là phiên bản cấp nền tảng của ý tưởng nhiều lượt mà cả hai nhà cung cấp đang theo đuổi — và nó kết hợp được với phía định tuyến, nơi một khóa duy nhất bao phủ danh mục hơn 200 mô hình với giá niêm yết của nhà cung cấp và mức chênh 0%, nhờ đó khi nhà cung cấp thay đổi giá thì thay đổi đó đến phía chúng ta ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo.

Cách đặt vấn đề đó cũng giải quyết vấn đề bằng chứng mà bài viết này mở đầu. Khi hai nhà cung cấp công bố những bộ đánh giá chuẩn không trùng lặp và không bên nào có đánh giá độc lập, cách để chọn không phải là tin vào một bảng. Mà là chạy cả hai trên tài liệu của chính bạn và để sự bất đồng lộ ra trên văn bản thực — đó chính xác là mục đích của một panel và một chuỗi failover.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Cái nào, và khi nào

Nếu bạn cần một mô hình dịch chạy trên phần cứng bạn đã sở hữu, trong một sản phẩm thương mại, mà không phải bàn chuyện cấp phép, thì Hy-MT2-7B thắng chỉ nhờ vào ưu thế về phạm vi đáp ứng của nó — và các kết quả do nhà cung cấp công bố, dù chưa được tái lập, ít nhất vẫn có tên, có thể so sánh và gần với biên giới tiên tiến. Nếu bạn đang dịch các tài liệu dài sang năm mươi ngôn ngữ của Cohere, cần 16K đầu ra nhất quán mỗi lượt, và có hoặc là ngân sách hai B200 hoặc là sự sẵn sàng chạy đánh giá trên gói miễn phí của Cohere trước khi quyết định, thì North Small Translate 1.0 là cỗ máy có năng lực cao hơn trên mọi trục được công bố.

Điều mà cả hai mô hình đều không làm được là loại bỏ nhu cầu kiểm thử. Cohere đã cho bạn một con số không tên và một cách miễn phí để kiểm tra nó. Tencent đã cho bạn một bảng và một bản tải cỡ GPU. Con số 83,60 là một lời hứa, không phải kết quả — và nơi duy nhất lời hứa đó được định đoạt là trên chính kho ngữ liệu của bạn.