主视觉卡片,标题为“North Small Translate 1.0 vs Hy-MT2-7B”,副标题为“单块 GPU 对决两块 B200”,位于两张卡片上方:North Small Translate 1.0(218B MoE / 25B 激活,CC BY-NC 4.0)和 Hy-MT2-7B(8B 稠密,约 16GB 显存,Apache 2.0)。
Guides & Insights

North Small Translate 1.0 对决 Hy-MT2-7B:单块 GPU 对抗两块 B200

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

当前开放翻译领域中最势均力敌的一场对决,或许也是最不显眼的一场。Hy-MT2-7B是腾讯混元翻译模型家族中的中间成员,于 2026 年 5 月 21 日以 Apache 2.0 协议开源,可在单块 RTX 4090 或 A100 上运行,显存占用约 16GB。North Small Translate 1.0是 Cohere 的 2180 亿参数稀疏混合专家(MoE)翻译模型,记录在该公司 2026 年 9 月 9 日的发布说明中,最低部署为两块 FP8 精度下的 B200,或一块采用 NVFP4 W4A16 形式的 B200。两者都是翻译专用模型。两者都是当前世代的产品。其中一个可以在工作站上提供推理服务,而仅凭这一事实就重构了整场对比——因为它们最希望被放在同等条件下评判的那个基准测试并不存在。

从信封开始,而不是分数

部署成本是决定大多数实际集成方案的关键维度,而在这方面,这两个模型差距悬殊。Hy-MT2-7B 是一个稠密的 HunYuanDenseV1 模型,参数规模约 80 亿,已发布 FP8 和 GGUF 构建版本,以及面向 Apple silicon 的社区 MLX 8 位版本。腾讯的部署说明将 transformers 5.6.0 或更高版本、vLLM、SGLang 和 llama.cpp 列为支持的运行时,而推理指南将生成上限限制在 8,192 个 token,尽管配置标明最多可支持 262,144 个位置。一块现代消费级或工作站 GPU 即可覆盖。

North Small Translate 1.0 是一种截然不同类别的对象。其 218B 总参数中有 25B 处于激活状态,分布在 128 个专家上,每个 token 激活八个专家,外加若干共享专家;Cohere 为其三个检查点分别公布了最低硬件要求:BF16 需要四块 B200 或八块 H100,FP8 需要两块 B200 或四块 H100,NVFP4 W4A16 构建需要一块 B200 或两块 H100。服务通过 vLLM 运行,需 cohere_melody>=0.9.0,并且 Cohere 建议采用贪心解码以匹配生产环境。输出中带有 <|START_TEXT|><|END_TEXT|> 标记,而这些标记并未注册为特殊 token。

形态 — North Small Translate 1.0:总计 218B / 25B 激活的稀疏 MoE,128 个专家,对比 Hy-MT2-7B:稠密,约 8B

上下文 — 输入 16K、输出 16K,而工作窗口为 8K,配置宣称最多可达 262,144 个位置

最低硬件要求 — W4A16 下需 1×B200,FP8 下需 2×B200 或 4×H100,而单块 RTX 4090 级 GPU 仅约 16GB

已发布格式 — BF16、FP8、NVFP4 W4A16 对比基础版本、FP8、GGUF,以及社区版 MLX 8-bit

语言 — 50(英语 + 49)对比 33 种语言加上 5 种少数民族语言和方言

许可 — CC BY-NC 4.0,商用需通过 Model Vault,对比 Apache 2.0,无门禁

报告质量 — WMT26 83.60,指标未指明,在 FLORES-200、WMT25 GEMBA、XCOMET-XXL 和 IFMTBench 上,供应商自报数据与具名供应商表格对比

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

基准问题

这就是这场对比的诚实核心:我们无法将这两个模型相互排名,任何告诉你并非如此的人都在编造数字。腾讯公布了四项具名评测。在 FLORES-200 英语到 X 翻译上,7B 得分为 93.52,落后于 Gemini 3.1 Pro 的 94.42 和 GPT-5.5 的 94.16,但接近到足以产生影响。在与 WMT25 相关的 GEMBA 指标上,它得 82.24,而 30B-A3B 为 84.34、GPT-5.5 为 83.41。在 XCOMET-XXL 上,它以 63.86 领跑腾讯对比表中的所有对象——领先于 Gemini 3.1 Pro、GPT-5.5、DeepSeek-V4-ProKimi K2.6。在 IFMTBench 的指令遵循得分上,它达到 83.14%。所有这些都是腾讯自己的数字,没有一个经过独立复现,而它们仍然远多于 Cohere 所提供的。

Cohere 只公布了一个数字:WMT26 得分 83.60,在智能体多轮工作流下升至 84.36。模型卡和发布说明中都没有指明具体指标,也没有针对该模型发布任何 WMT26 结果页面。这种不对称并不能证明 Cohere 的模型更弱或更强。它意味着读者最想要的那种对比——同一测试、同一指标、两个模型——无法依据公开证据完成,而 Cohere 自己给出的两个数字之间那四点差距(83.60 到 84.36),已经大于腾讯表格中的大多数差距。

语言和长文档

North Small Translate 1.0 覆盖五十种语言和区域变体,其中现代标准阿拉伯语、德语、法语、日语、韩语、俄语和乌克兰语被指定为一级,并且其在输入和输出两端均可接受和生成 16,000 个词元。Hy-MT2-7B 覆盖三十三种语言,外加五种少数民族语言和方言,包括藏语、维吾尔语和粤语。这两个列表互不为超集——Tencent 覆盖粤语和维吾尔语,Cohere 覆盖更广泛的欧洲区域设置——因此,仅从覆盖范围来看,多语言部署可能会发现两者都需要。

输出窗口则是那个不那么显眼的差异。16,000 个 token 的输出,意味着一次就能生成一份完整的流程文档,而且因为模型看到了全部内容,整篇文档的术语和语域保持一致。8K 窗口则做不到这一点,而逐句处理的变通做法恰恰重新引入了跨片段一致性问题——IFMTBench 这类翻译指令遵循基准正是为了衡量这些问题而构建的。

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

又是许可证,它比表格更能决定一切

North Small Translate 1.0 采用 CC BY-NC 4.0 许可。其权重可免费用于非商业用途,商业部署则需通过 Cohere 的 Model Vault,凭购买的许可证进行,且未公布价格。Hy-MT2-7B 采用 Apache 2.0 许可,且无需申请即可获取——商业使用、微调与衍生作品一律允许,无需任何协商。对于商业产品而言,操作顺序不言自明:Hy-MT2-7B 今天就能部署,Cohere 的模型今天就能评估,任何基准测试的排名都改变不了这一先后顺序。

Cohere 的抵消性优势在于其免费额度。North Small Translate 1.0 运行在 Chat V2 的免费额度之上,无论是试用密钥还是生产密钥都可免费使用,直到触及速率限制为止,因此一次评估除了时间之外不产生任何成本。Hy-MT2-7B 则拥有托管式商业 API——腾讯将该系列的托管层定价为每百万输入 token 约 0.044 美元、每百万输出 token 约 0.177 美元——而在你自己的 GPU 上自行托管才是真正免费的途径。

“multi-pass”实际上意味着什么

Cohere 决定同时发布 83.60 和 84.36,是其发布说明中最具信息量的细节,因为这表明该公司相信工作流胜过单次调用。这与 Tencent 以不同机制押下的注相同:其旗舰 30B-A3B 在 GEMBA 和 XCOMET 上胜出,而 Gemini 3.1 Pro 在 FLORES-200 上胜出,这意味着最佳系统不是一个模型,而是一组模型。OrcaRouter 的模型融合将多个模型作为一组运行,并在单次调用内协调它们的答案,这正是两家厂商都在追求的多遍思路的平台级版本——而且它与路由侧可组合,其中一个密钥以提供商标价、0% 加价覆盖超过 200 个模型的目录,因此供应商价格变动当天就会落到我们这边,而不是等到下一次合同续签。

这一框架同样解决了本文开头提出的证据问题。当两家厂商发布互不重叠的基准测试结果,而双方又都没有独立评估时,选择的方式不是相信一张表格,而是把两者都放到你自己的文档上运行,让分歧在真实文本上暴露出来——这正是面板和故障转移链的用途所在。

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

哪一个,什么时候

如果你需要一个能在自己已有的硬件上运行、用于商业产品中、且无需进行授权洽谈的翻译模型,Hy-MT2-7B 仅凭其规格范围就能胜出——而它由厂商发布的结果,尽管尚未被复现,至少是具名的、可比较的,并且接近前沿。如果你要把长文档翻译成 Cohere 的五十种语言,需要每轮处理产生 16K 的一致输出,并且要么有两块 B200 的预算,要么愿意在决定之前先在 Cohere 的免费层级上运行评估,那么 North Small Translate 1.0 在每一个已披露的维度上都是能力更强的机器。

这两个模型都没有做到的一件事,就是消除测试的必要。Cohere 给了你一个未具名的数字,以及一种免费核验它的方式。Tencent 给了你一张表格和一个 GPU 级别的下载。83.60 是一个承诺,而不是结果——而兑现这个承诺的唯一地方,就是你自己的语料库。