主視覺卡片標題為「North Small Translate 1.0 vs Hy-MT2」,副標題為「兩個 MoE 翻譯模型,一個證據缺口」,下方置有兩張卡片:North Small Translate 1.0(218B MoE/25B 活躍參數,一個未具名的 WMT26 數據)與 Hy-MT2-30B-A3B(30B MoE/3B 活躍參數,論文、基準測試、Apache 2.0)。
Guides & Insights

North Small Translate 1.0 對比 Hy-MT2:兩款 MoE 翻譯器,一個證據缺口

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這兩個系列都建立在同一個押注之上——也就是一個為翻譯進行後訓練的稀疏混合專家網路,勝過被要求翻譯的通用模型——而它們是從相反的方向抵達這個結論的。Hy-MT2,騰訊混元的三模型翻譯系列,由Hy-MT2-30B-A3B MoE 領銜,於 2026 年 5 月 21 日以 Apache 2.0 開源,並附上技術報告、開源基準測試與完整比較表。North Small Translate 1.0是 Cohere 的 2,180 億參數、250 億活躍參數 MoE 翻譯模型,記錄於 2026 年 9 月 9 日的一份發布說明中,而其品質佐證不過是一個數字,且未附帶任何指標。架構彼此呼應。文件則不然,而在選擇兩者之前,這個差異是最值得理解的一件事。

一個家族,三種尺寸,對抗一個大型模型

Hy-MT2 並非單一模型,而是一系列模型:用於裝置端運算的 1.8B 稠密模型、適用於單一 GPU 的 7B 稠密模型,以及作為旗艦的 30B-A3B MoE,每個 token 啟用三十億個參數。三者皆採用 Apache 2.0 授權、無需申請即可取用,並同步發布 FP8、GGUF、2-bit 與 1.25-bit 量化版本,以及 IFMTBench 指令遵循基準測試與配套論文。騰訊表示,該系列可在 33 種語言以及五種少數民族語言與方言之間進行翻譯。

North Small Translate 1.0 是規模空間中的一個單點,而且是個大點:218B 總參數、25B 活躍參數、128 個專家,每個 token 啟用八個專家,外加共享專家,而注意力以 3:1 的比例在滑動視窗層(視窗 4,096,RoPE)與不帶位置嵌入的全局層之間交替。其視窗在英語及其他 49 種語言上皆為輸入 16K、輸出 16K,其中現代標準阿拉伯語、德語、法語、日語、韓語、俄語與烏克蘭語被指定為第一級。值得注意的是,這個架構形態並不新奇——Cohere 於 2026 年 5 月推出的 Command A+ 就採用了相同的 218B/25B 配置——這使得它更像是對既有核心進行翻譯特化的後訓練,而非全新架構。

參數 — North Small Translate 1.0:總計 218B / 啟用 25B,對比 Hy-MT2-30B-A3B:總計 30B / 啟用 3B,另有 1.8B 與 7B 稠密版本

上下文 — 輸入 16K、輸出 16K,對比 8K 工作視窗;設定檔標示最高可支援 262,144 個位置

語言 — 50(英語 + 49)對比 33 加 5 種少數語言與方言

授權 — CC BY-NC 4.0,商業用途須透過 Model Vault,相較 Apache 2.0 則無需申請開放使用

已發表的證據 — 一個未具名的 WMT26 數據、廠商自行報告與技術報告的對比、一個公開基準,以及在 FLORES-200、WMT25 GEMBA 和 XCOMET-XXL 上的具名結果

服務 — vLLM 搭配 cohere_melody>=0.9.0,建議使用貪婪解碼,相較於 transformers、vLLM、SGLang 和 llama.cpp

已公告 — 2026年9月9日(權重自8月14日起在Hugging Face上受限)對比2026年5月21日

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

證據缺口才是真正的重點

騰訊這次發布附上了實據。arXiv 上有一篇論文,該公司還撰寫並開源了一套基準,專門用來衡量翻譯指令遵循能力,另有一張列出競爭對手的結果表。FLORES-200 英文轉 X 將 30B-A3B 置於 93.85,對比 Gemini 3.1 Pro 的 94.42 與 GPT-5.5 的 94.16。WMT25 時代的 GEMBA 指標將其置於 84.34——在騰訊自家的比較中得分最高,領先 GPT-5.5 兩種模式下的 83.41 與 83.29、Gemini 3.1 Pro 的 82.23、DeepSeek-V4-Pro 的 81.99,以及 Kimi K2.6 的 81.68。XCOMET-XXL 將其置於 62.89,落後於自家的 7B 同系列模型。在 IFMTBench 上,它達到整體指令遵循率 85.7%,其中一個子分數為 91.94%,與 Gemini 3.1 Pro 相差不到百分之一分,而另一個子分數 85.55% 則讓它直接領先 Gemini 3.1 Pro 模型。

上述每一項都是 Tencent 自家的量測,且沒有一項經過獨立重現。但它們都有名稱、可互相比較,而且可被否證——讀者清楚知道該跑哪一項測試來提出論辯。

Cohere 的發行說明提供了一個數字:WMT26 83.60,在其所稱的代理式多遍翻譯工作流程下升至 84.36。模型卡或文件中任何地方都沒有指明指標名稱。尚未針對此模型發布任何 WMT26 結果頁面。訓練語料庫、權杖數與資料管道均未揭露,而 Command A Translate 的 2025 年技術報告曾詳細描述一種難度篩選技術。這些都不是模型較差的證據。這顯示的是證據較少,這是另一回事,而在你決定要將什麼投入生產環境時,也同樣重要。

雙方實際上都沒有公布的共同衡量標準

兩者之間有一個真正的接觸點,值得用一段來說明,因為這是唯一可能進行公平比較的地方。Tencent 是 WMT26 的合作夥伴,贊助了一項影片字幕翻譯任務,並提供由 Hunyuan 資助的獎項。Cohere 唯一公布的數字是一個 WMT26 數據。因此,兩個組織都處於同一個 2026 年評估週期內,而唯一能讓雙方正面交鋒、分出高下的指標,正是只有其中一方公布了任何內容的那個——而且公布時並未指明該指標。

這就是值得關注的落差。如果 Cohere 為 83.60 標上指標名稱,或者 WMT26 的結果頁面納入一套 North Small Translate 系統,這項比較才算真正成立。在那之前,把 Tencent 的 FLORES-200 和 GEMBA 數字拿來跟 Cohere 未標示的 WMT26 數字對比,只會是包裝成分析的捏造。

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

授權與部署

Hy-MT2 採用 Apache 2.0,沒有任何使用門檻:商業用途、微調、衍生作品與再散布,全都無需事先洽談。North Small Translate 1.0 採用 CC BY-NC 4.0,可免費用於非商業用途,商業部署則須經由 Cohere 的 Model Vault 進行,且價格並未公開。對於任何要交付給客戶的產品,這項差異在還沒讀到基準測試結果之前,就已經讓決定拍板定案。

硬體方面的情況則以相反方向遵循同樣的模式。Hy-MT2 涵蓋從能在手機上執行的 440MB 量化版本,一路到 30B-A3B,其三十億個活躍參數讓每 token 的運算量在其品質層級中維持在適度水準;執行環境涵蓋 transformers、vLLM、SGLang 與 llama.cpp。North Small Translate 1.0 公布了各個檢查點的最低硬體需求——BF16 需要四張 B200 或八張 H100,FP8 需要兩張 B200 或四張 H100,NVFP4 W4A16 需要一張 B200 或兩張 H100——並建議採用貪婪解碼以對齊正式環境。Cohere 的抵銷優勢在於,該模型可在其 Chat V2 API 的免費方案上執行,試用金鑰與正式金鑰均免費,直到觸及速率限制為止,因此評估它完全不需任何成本。

你該不該換,又該換成什麼?

這裡的切換問題確實是不對稱的。從 Hy-MT2 轉向 North Small Translate 1.0 並不是你目前能合理論證的效能升級——這是在押注一個唯一公開說法只是一個數字的模型,用以換取一個擁有已發布報告與可部署授權的系列。真正值得做的是評估:Cohere 模型可免費呼叫,涵蓋五十種語言,包括更廣泛的歐洲語言組合,並且每次處理可提供 16K 輸出,而 Hy-MT2 的 8K 工作視窗則辦不到。

這種評估正是路由層發揮價值的情境,因為對大多數多語言技術堆疊而言,誠實的答案是兩個模型都會留下來。OrcaRouter 把超過 200 個模型的目錄收在同一組金鑰之後,因此試用第二個翻譯模型只是改個設定,而不是多簽一份供應商合約或改動程式碼——你只要把同一個 OpenAI 相容的用戶端指向不同的 model id,就能用你自己的文本做比較。供應商定價以0% 加成,所以供應商調價時,我們這邊當天就會同步生效,不會再疊加任何價差,而容錯移轉鏈能讓正式環境繼續使用已經運作正常的模型,同時為新模型評分。North Small Translate 1.0 和 Hy-MT2 目前都不在我們的目錄中,因此這並不是建議你向我們購買其中任何一個——而是要說明,在你實際跑過測試之前,不該先把決定寫死。

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

裁決

騰訊的 Hy-MT2 是更安全的選擇,而且從證據來看雙方差距並不小:Apache 2.0、三種尺寸、一篇論文、一個公開基準、四套具名評估套件,以及 WMT26 合作關係。Cohere 的 North Small Translate 1.0 則更有意思——2,180 億個翻譯專用 MoE 參數,背後有 16K 輸出視窗和五十種語言、免費的評估方案,以及一個 Cohere 以外沒有人查核過的 83.60。

如果你這一季就得做出決定,就選那個拿得出憑據的系列。如果你手上有一份語料庫和一週的時間,就把其中一部分送進免費方案跑一遍,看看 Cohere 未具名的 83.60 對你的文件是否具有任何意義——因為這個問題沒有哪家廠商的表格能替你回答,而 Cohere 選擇公布的那個數字,正是它不肯指名的那一個。