標題為「North Small Translate 1.0 vs Hy-MT2-7B」的主視覺卡片,副標題是「一張 GPU 對抗兩張 B200」,置於兩張卡片上方:North Small Translate 1.0(218B MoE/25B 作用參數,CC BY-NC 4.0)與 Hy-MT2-7B(8B 稠密模型,約 16GB VRAM,Apache 2.0)。
Guides & Insights

North Small Translate 1.0 對上 Hy-MT2-7B:一顆 GPU 對抗兩張 B200

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

目前開源翻譯領域中最接近的一場對決,可能也是最不顯眼的一場。Hy-MT2-7B是騰訊混元翻譯家族中的老二,於 2026 年 5 月 21 日在 Apache 2.0 授權下開源,可在單張 RTX 4090 或 A100 上運行,約佔 16GB 顯存。North Small Translate 1.0則是 Cohere 的 2180 億參數稀疏混合專家翻譯模型,記錄於該公司 2026 年 9 月 9 日的發行說明中,最低部署需求為兩張 B200(FP8),或是一張 B200 的 NVFP4 W4A16 形式。兩者都是翻譯專門模型,兩者都是當前最新。其中一個可以直接從工作站提供服務,而單單這一項事實就重新界定了整個比較——因為那個最能讓兩者在同等條件下受評判的基準並不存在。

先從信封開始,而不是分數。

部署成本是決定大多數實際整合的關鍵面向,而在這一點上,這兩個模型差距懸殊。Hy-MT2-7B 是一個稠密的 HunYuanDenseV1 模型,擁有約八十億個參數,已發布 FP8 與 GGUF 版本,另有社群為 Apple 晶片提供的 MLX 8 位元版本。騰訊的部署說明列出 transformers 5.6.0 或更新版本、vLLM、SGLang 與 llama.cpp 為支援的執行環境,而推論指引將生成上限設在 8,192 個 token,儘管配置宣稱可支援多達 262,144 個位置。單一張現代消費級或工作站 GPU 就能應付。

North Small Translate 1.0 是不同類別的物件。其總參數量為 218B、活躍參數為 25B,分散於 128 個專家之中,每個 token 有八個活躍專家,另加上共享專家;而 Cohere 為其三種檢查點分別公布了最低硬體需求:BF16 需要四張 B200 或八張 H100,FP8 需要兩張 B200 或四張 H100,NVFP4 W4A16 版本則需要一張 B200 或兩張 H100。推論服務透過 vLLM 執行,需搭配 cohere_melody>=0.9.0,且 Cohere 建議採用貪婪解碼以符合生產環境。輸出帶有 <|START_TEXT|><|END_TEXT|> 標記,這些標記並未註冊為特殊 token。

架構 — North Small Translate 1.0:總計 218B/啟用 25B 的稀疏 MoE,128 個專家;相較於 Hy-MT2-7B:稠密,約 8B

上下文 — 輸入 16K、輸出 16K,對比 8K 工作視窗;設定檔標示最高可支援 262,144 個位置

最低硬體需求 — W4A16 下需 1×B200,FP8 下需 2×B200 或 4×H100,對比單張約 16GB 的 RTX 4090 等級 GPU

已發佈格式 — BF16、FP8、NVFP4 W4A16 對比基礎版、FP8、GGUF,以及社群版 MLX 8 位元

語言 — 50(英語 + 49)對比 33 種語言加上 5 種少數民族語言與方言

授權 — CC BY-NC 4.0,商業用途須透過 Model Vault,相較 Apache 2.0 則無需申請開放使用

報告品質 — WMT26 83.60,指標未具名,為廠商自行回報,有別於具名廠商表格,涵蓋 FLORES-200、WMT25 GEMBA、XCOMET-XXL 與 IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

基準問題

這場對決最誠實的核心是:我們無法將這兩個模型互相比較排名,任何告訴你不然的人都是在憑空編造數字。Tencent 發表了四項具名評測。在 FLORES-200 英文至 X 翻譯上,7B 得到 93.52,落後 Gemini 3.1 Pro 的 94.42 與 GPT-5.5 的 94.16,但已接近到不容忽視。在與 WMT25 相關的 GEMBA 指標上,它得分 82.24,相較於 30B-A3B 的 84.34 與 GPT-5.5 的 83.41。在 XCOMET-XXL 上,它以 63.86 在 Tencent 的比較表中領先所有模型——領先 Gemini 3.1 Pro、GPT-5.5、DeepSeek-V4-ProKimi K2.6。在 IFMTBench 的指令遵循分數上,它達到 83.14%。這些全都是 Tencent 自家的數字,沒有任何一項經過獨立重現,而它們仍遠多於 Cohere 所提供的內容。

Cohere 公布了一個單一數字:WMT26 分數為 83.60,在代理式多輪工作流程下上升至 84.36。模型卡或發佈說明中沒有指明任何指標,且尚未有針對此模型的 WMT26 結果頁面發佈。這種不對稱並非證明 Cohere 的模型較弱或較強。這意味著讀者最想要的比較——相同測試、相同指標、兩個模型——無法從公開證據中進行,而 Cohere 自己兩個數字內的四分差距(83.60 到 84.36)已經大於騰訊表格中大多數的差距。

語言與長篇文件

North Small Translate 1.0 涵蓋五十種語言與地區變體,並將現代標準阿拉伯語、德語、法語、日語、韓語、俄語和烏克蘭語指定為第一級,且雙向皆可接收與輸出 16,000 個 token。Hy-MT2-7B 涵蓋三十三種語言,外加包括藏語、維吾爾語和粵語在內的五種少數民族語言與方言。這兩份清單皆非彼此的超集——Tencent 涵蓋粵語和維吾爾語,Cohere 則涵蓋更廣泛的歐洲地區變體——因此單就涵蓋範圍而言,多語言部署可能會發現兩者都需要。

輸出視窗是較不明顯的差異。一萬六千個 token 的輸出,意味著一次就能產出完整的程序文件,而且整份文件的術語與語域保持一致,因為模型看見了全貌。8K 視窗做不到這一點,而逐句處理的變通做法,正好會重新引入跨片段一致性的問題——這正是像 IFMTBench 這類翻譯指令遵循基準原本要衡量的問題。

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

授權,又一次,比表格更能決定。

North Small Translate 1.0 採用 CC BY-NC 4.0 授權。其權重可免費用於非商業用途,而商業部署則須透過 Cohere 的 Model Vault,以購買授權的方式進行,且未公開價格。Hy-MT2-7B 採用 Apache 2.0 且無使用門檻——商業使用、微調與衍生作品全都無須事先洽談即可獲准。對商業產品而言,這個先後順序不言自明:Hy-MT2-7B 今天就能部署,而 Cohere 的模型今天就能評估,沒有任何基準測試的數據列能改變這個順序。

Cohere 的抵銷優勢在於免費方案。North Small Translate 1.0 在 Chat V2 的免費方案上運作,試用與正式金鑰皆可免費使用,直到觸及速率限制,因此評估除了時間之外不花任何成本。Hy-MT2-7B 則有託管的商用 API——騰訊將該系列託管方案定價為每百萬輸入 token 約 $0.044、每百萬輸出 token 約 $0.177——而在自己的 GPU 上自行託管才是真正免費的途徑。

「multi-pass」實際上暗示了什麼

Cohere 決定同時公布 83.60 與 84.36,是其發布說明中最具資訊價值的細節,因為這表示該公司相信工作流程勝過單次呼叫。那也是騰訊以不同機制所下的同一注:其旗艦 30B-A3B 在 GEMBA 與 XCOMET 上勝出,而 Gemini 3.1 Pro 則在 FLORES-200 上勝出,這意味著最好的系統不是單一模型,而是一組模型。OrcaRouter 的模型融合會將數個模型組成一個小組來運行,並在單次呼叫中調和它們的答案,這是兩家廠商都在追求的多重處理構想的平台層級版本——而且它可與路由端相互搭配,其中 一組金鑰即可涵蓋超過 200 個模型的目錄,並以供應商牌價、0% 加價提供,因此供應商價格變動當天就會反映在我們這一端,而不是等到下一次合約續約。

那樣的框架也解決了本文開頭提出的證據問題。當兩家廠商各自發布互不重疊的基準測試,而雙方都沒有獨立評估時,選擇的方式並不是相信一張表格,而是把兩者都跑在你自己的文件上,讓歧異在真實文本上浮現——這正是面板與容錯移轉鏈的用途所在。

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

哪一個,以及何時?

如果你需要一個能在你已擁有的硬體上運行、用於商業產品,又無須談授權的翻譯模型,Hy-MT2-7B 光憑其適用範圍就勝出——而它由廠商公布的結果,儘管尚未被重現,至少是有名可循、可相互比較,且接近前沿。如果你要把長篇文件翻譯成 Cohere 的五十種語言,每輪需要 16K 的一致輸出,而且你要麼有兩張 B200 的預算,要麼願意先在 Cohere 免費方案上跑評估再決定,那麼 North Small Translate 1.0 在每一個已揭露的軸線上都是能力更強的機器。

這兩個模型都沒做到的是免除測試的必要。Cohere 給了您一個未具名的數字,以及一個免費的查核方式。騰訊給了您一張表格和一個 GPU 等級大小的下載檔。83.60 是一個承諾,不是結果——而這個承諾唯一能得到驗證的地方,就是在您自己的語料庫上。