主视觉卡片标题为“North Small Translate 1.0 对比 Hy-MT2”,副标题为“两个 MoE 翻译模型,一处证据缺口”,下方是两张卡片:North Small Translate 1.0(218B MoE / 25B 激活参数,一个未具名的 WMT26 数据)与 Hy-MT2-30B-A3B(30B MoE / 3B 激活参数,论文、基准测试、Apache 2.0)。
Guides & Insights

North Small Translate 1.0 vs Hy-MT2:两款 MoE 翻译器,一个证据缺口

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这两个系列都建立在同一个赌注之上——即为翻译做过后期训练的稀疏专家混合(MoE)网络,胜过一个被要求执行翻译的通用模型——而它们是从相反的方向走到这一步的。Hy-MT2是腾讯混元的三模型翻译家族,以Hy-MT2-30B-A3B MoE 为主打,于 2026 年 5 月 21 日以 Apache 2.0 协议开源,并附有技术报告、开源基准和完整的对比表。North Small Translate 1.0是 Cohere 的 2180 亿参数、250 亿激活参数的 MoE 翻译模型,其记录仅见于一份日期为 2026 年 9 月 9 日的发布说明,而它的质量证据只是一个孤零零的数字,没有附带任何指标。架构上二者如出一辙。文档上却并非如此,而在选择任何一方之前,最值得弄明白的就是这一差异。

一个家族,三种规模,对标一个大模型

Hy-MT2 并非单一模型,而是一个系列:用于端侧工作的 1.8B 稠密模型、面向单 GPU 的 7B 稠密模型,以及作为旗舰的 30B-A3B MoE,每个 token 激活三十亿参数。三者均采用 Apache 2.0、无需门控,并一同发布了 FP8、GGUF、2 比特和 1.25 比特量化版本,以及 IFMTBench 指令遵循基准和一篇配套论文。腾讯报告称,该系列可在 33 种语言以及五种少数民族语言和方言之间进行翻译。

North Small Translate 1.0 是规模空间中的一个单点,而且是个大点:总计 218B 参数,25B 激活,128 个专家,每个 token 激活八个,外加共享专家;注意力以 3:1 的比例在滑动窗口层(窗口 4,096,RoPE)与不携带位置嵌入的全局层之间交替。其窗口为输入 16K、输出 16K,覆盖英语以及其他 49 种语言,其中现代标准阿拉伯语、德语、法语、日语、韩语、俄语和乌克兰语被指定为第一梯队。值得注意的是,这一形态并不新鲜——Cohere 于 2026 年 5 月推出的 Command A+ 使用了相同的 218B/25B 配置——这使其成为对现有核心进行翻译专门化的后训练,而非一种新架构。

参数 — North Small Translate 1.0:总参数量218B / 激活25B,对比Hy-MT2-30B-A3B:总参数量30B / 激活3B,另有1.8B和7B稠密版本

上下文 — 输入 16K、输出 16K,而工作窗口为 8K,配置宣称最多可达 262,144 个位置

语言 — 50(英语 + 49)对 33 加 5 种少数民族语言和方言

许可 — CC BY-NC 4.0,商用需通过 Model Vault,对比 Apache 2.0,无门禁

已发表的证据——一个未具名的 WMT26 数字、厂商自行报告的与一份技术报告的对比、一个公开基准,以及 FLORES-200、WMT25 GEMBA 和 XCOMET-XXL 上的具名结果

服务 — vLLM 搭配 cohere_melody>=0.9.0,与 transformers、vLLM、SGLang 和 llama.cpp 相比,推荐使用贪心解码

发布 — 2026 年 9 月 9 日(权重自 8 月 14 日起在 Hugging Face 上受限开放)对比 2026 年 5 月 21 日

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

证据缺口才是真正的故事

腾讯这次发布是带着实锤的。有一篇发在 arXiv 上的论文,一个该公司专门为衡量翻译指令遵循能力而编写并开源的基准,还有一张点名其竞争对手的结果表。FLORES-200 英译 X 上,30B-A3B 得 93.85,而 Gemini 3.1 Pro 为 94.42,GPT-5.5 为 94.16。WMT25 时期的 GEMBA 指标给出 84.34——这是腾讯自己那份对比中的最高分,领先于 GPT-5.5 的 83.41 及其两种模式下的 83.29、Gemini 3.1 Pro 的 82.23、DeepSeek-V4-Pro 的 81.99 以及 Kimi K2.6 的 81.68。XCOMET-XXL 给出 62.89,落后于自家 7B 版本。在 IFMTBench 上,其整体指令遵循率达到 85.7%,其中一个子项得分 91.94%,与 Gemini 3.1 Pro 仅相差不到 0.01 个百分点;另一个子项得分 85.55%,在这一项上直接领先 Gemini 3.1 Pro 模型。

其中每一项都是 Tencent 自己的测量结果,且没有任何一项被独立复现。但它们都有名称、可以相互比较,而且可证伪——读者清楚地知道该运行哪项测试来提出质疑。

Cohere 的发布说明提供了一个数字:WMT26 83.60,在其所称的智能体式多轮翻译工作流下升至 84.36。模型卡或文档中均未指明这是哪项指标。也没有针对该模型发布任何 WMT26 结果页面。训练语料、token 数和数据流水线均未披露,而 Command A Translate 的 2025 年技术报告曾详细描述过一种难度过滤技术。这些都不能说明模型更差。它表明的是证据更少,而这是另一回事,在你决定将什么投入生产时同样重要。

双方实际上都未公布的共同标准

两者之间有一个实实在在的交汇点,值得用一段话来谈,因为这是唯一可能进行公平比较的地方。腾讯是 WMT26 的合作伙伴,赞助了一项视频字幕翻译任务,并提供由混元资助的奖项。Cohere 唯一公布的数字是一个 WMT26 的数值。因此,两家机构都处在同一个 2026 年评估周期内,而唯一能一决高下的指标,恰恰是其中只有一方公布过任何东西的那个——而且公布时还没有说明该指标是什么。

这就是值得关注的差距。如果 Cohere 给 83.60 附上了指标名称,或者 WMT26 结果页面包含了 North Small Translate 系统,这种比较才算真正成立。在此之前,把腾讯的 FLORES-200 和 GEMBA 数据与 Cohere 未标注的 WMT26 数字拿来对比,只会是披着分析外衣的捏造。

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

许可证和部署

Hy-MT2 采用 Apache 2.0 许可,且无任何限制:商业使用、微调、衍生和再分发,全都无需洽谈。North Small Translate 1.0 采用 CC BY-NC 4.0 许可,可免费用于非商业用途,而商业部署则需经由 Cohere 的 Model Vault 进行,价格尚未公布。对于任何要交付给客户的产品,这一差异在阅读基准测试之前就已决定了选择。

硬件方面的情况则以相反的顺序遵循同样的模式。Hy-MT2 的覆盖范围从可在手机上运行的 440MB 量化版本一直到 30B-A3B,其三十亿活跃参数使其在同等质量层级中单 token 计算量保持适中;运行时涵盖 transformers、vLLM、SGLang 和 llama.cpp。North Small Translate 1.0 公布了每个检查点的最低硬件要求——BF16 需要四块 B200 或八块 H100,FP8 需要两块 B200 或四块 H100,NVFP4 W4A16 需要一块 B200 或两块 H100——并建议采用贪心解码以匹配生产环境。Cohere 的抵消性优势在于,该模型可运行在其 Chat V2 API 的免费层级上,试用密钥和生产密钥均免费,直至达到速率限制,因此对其进行评估不产生任何成本。

你是否应该转换,以及转换到什么

要不要切换的问题在这里确实是不对称的。从 Hy-MT2 迁移到 North Small Translate 1.0,并不是你目前能证明合理的性能升级——这等于押注一个模型,而它唯一的公开说法只是一个数字,与之相对的却是一个拥有已发布报告和可部署许可证的模型家族。真正值得做的是评估:Cohere 模型可免费调用,覆盖五十种语言,包括更广泛的欧洲语言集,并且每次可输出 16K,而 Hy-MT2 的 8K 工作窗口做不到这一点。

这种评估正是路由层体现自身价值的地方,因为对大多数多语言技术栈来说,最诚实的答案就是两个模型都留下。OrcaRouter 把 200 多个模型的目录放在一个密钥背后,因此试用第二个翻译模型只是一次配置变更,而不是再签一份供应商合同或改动代码——你只需把同一个兼容 OpenAI 的客户端指向另一个模型 ID,然后用自己的文本做对比。供应商标价按0% 加价原样透传,因此托管方的价格一有变动,我们这边当天就会生效,不额外叠加任何差价;同时,故障转移链路会让生产环境继续运行已经可用的模型,而新模型则在接受评测。North Small Translate 1.0 和 Hy-MT2 目前都不在我们的目录中,所以这并不是建议你从我们这里购买其中任何一个——这是在说,在跑完测试之前,不要把决定写死。

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

裁决

腾讯的 Hy-MT2 是更稳妥的选择,而且从证据来看,这毫无悬念:Apache 2.0 许可、三种规模、一篇论文、一个开放基准、四个具名评估套件,以及与 WMT26 的合作。Cohere 的 North Small Translate 1.0 则更有意思——2180 亿参数的翻译专用 MoE,支持 16K 输出窗口和五十种语言,提供免费评估档位,以及一个 Cohere 之外无人核验过的 83.60。

如果你需要在本季度就拍板,那就选拿得出实据的那个系列。如果你有一个语料库和一周时间,就把其中一部分放进免费额度里跑一跑,看看 Cohere 那个未具名的 83.60 在你的文档上究竟意味着什么——因为这个问题,任何厂商的表格都无法替你回答,而 Cohere 选择公开的那个数字,恰恰正是它拒绝点名的那个。