
North Small Translate 1.0 对决 Hy-MT2-7B:单块 GPU 对抗两块 B200
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
当前开放翻译领域中最势均力敌的一场对决,或许也是最不显眼的一场。Hy-MT2-7B是腾讯混元翻译模型家族中的中间成员,于 2026 年 5 月 21 日以 Apache 2.0 协议开源,可在单块 RTX 4090 或 A100 上运行,显存占用约 16GB。North Small Translate 1.0是 Cohere 的 2180 亿参数稀疏混合专家(MoE)翻译模型,记录在该公司 2026 年 9 月 9 日的发布说明中,最低部署为两块 FP8 精度下的 B200,或一块采用 NVFP4 W4A16 形式的 B200。两者都是翻译专用模型。两者都是当前世代的产品。其中一个可以在工作站上提供推理服务,而仅凭这一事实就重构了整场对比——因为它们最希望被放在同等条件下评判的那个基准测试并不存在。
从信封开始,而不是分数
部署成本是决定大多数实际集成方案的关键维度,而在这方面,这两个模型差距悬殊。Hy-MT2-7B 是一个稠密的 HunYuanDenseV1 模型,参数规模约 80 亿,已发布 FP8 和 GGUF 构建版本,以及面向 Apple silicon 的社区 MLX 8 位版本。腾讯的部署说明将 transformers 5.6.0 或更高版本、vLLM、SGLang 和 llama.cpp 列为支持的运行时,而推理指南将生成上限限制在 8,192 个 token,尽管配置标明最多可支持 262,144 个位置。一块现代消费级或工作站 GPU 即可覆盖。
North Small Translate 1.0 是一种截然不同类别的对象。其 218B 总参数中有 25B 处于激活状态,分布在 128 个专家上,每个 token 激活八个专家,外加若干共享专家;Cohere 为其三个检查点分别公布了最低硬件要求:BF16 需要四块 B200 或八块 H100,FP8 需要两块 B200 或四块 H100,NVFP4 W4A16 构建需要一块 B200 或两块 H100。服务通过 vLLM 运行,需 cohere_melody>=0.9.0,并且 Cohere 建议采用贪心解码以匹配生产环境。输出中带有 <|START_TEXT|> 和 <|END_TEXT|> 标记,而这些标记并未注册为特殊 token。
• 形态 — North Small Translate 1.0:总计 218B / 25B 激活的稀疏 MoE,128 个专家,对比 Hy-MT2-7B:稠密,约 8B
• 上下文 — 输入 16K、输出 16K,而工作窗口为 8K,配置宣称最多可达 262,144 个位置
• 最低硬件要求 — W4A16 下需 1×B200,FP8 下需 2×B200 或 4×H100,而单块 RTX 4090 级 GPU 仅约 16GB
• 已发布格式 — BF16、FP8、NVFP4 W4A16 对比基础版本、FP8、GGUF,以及社区版 MLX 8-bit
• 语言 — 50(英语 + 49)对比 33 种语言加上 5 种少数民族语言和方言
• 许可 — CC BY-NC 4.0,商用需通过 Model Vault,对比 Apache 2.0,无门禁
• 报告质量 — WMT26 83.60,指标未指明,在 FLORES-200、WMT25 GEMBA、XCOMET-XXL 和 IFMTBench 上,供应商自报数据与具名供应商表格对比

基准问题
这就是这场对比的诚实核心:我们无法将这两个模型相互排名,任何告诉你并非如此的人都在编造数字。腾讯公布了四项具名评测。在 FLORES-200 英语到 X 翻译上,7B 得分为 93.52,落后于 Gemini 3.1 Pro 的 94.42 和 GPT-5.5 的 94.16,但接近到足以产生影响。在与 WMT25 相关的 GEMBA 指标上,它得 82.24,而 30B-A3B 为 84.34、GPT-5.5 为 83.41。在 XCOMET-XXL 上,它以 63.86 领跑腾讯对比表中的所有对象——领先于 Gemini 3.1 Pro、GPT-5.5、DeepSeek-V4-Pro 和 Kimi K2.6。在 IFMTBench 的指令遵循得分上,它达到 83.14%。所有这些都是腾讯自己的数字,没有一个经过独立复现,而它们仍然远多于 Cohere 所提供的。
Cohere 只公布了一个数字:WMT26 得分 83.60,在智能体多轮工作流下升至 84.36。模型卡和发布说明中都没有指明具体指标,也没有针对该模型发布任何 WMT26 结果页面。这种不对称并不能证明 Cohere 的模型更弱或更强。它意味着读者最想要的那种对比——同一测试、同一指标、两个模型——无法依据公开证据完成,而 Cohere 自己给出的两个数字之间那四点差距(83.60 到 84.36),已经大于腾讯表格中的大多数差距。
语言和长文档
North Small Translate 1.0 覆盖五十种语言和区域变体,其中现代标准阿拉伯语、德语、法语、日语、韩语、俄语和乌克兰语被指定为一级,并且其在输入和输出两端均可接受和生成 16,000 个词元。Hy-MT2-7B 覆盖三十三种语言,外加五种少数民族语言和方言,包括藏语、维吾尔语和粤语。这两个列表互不为超集——Tencent 覆盖粤语和维吾尔语,Cohere 覆盖更广泛的欧洲区域设置——因此,仅从覆盖范围来看,多语言部署可能会发现两者都需要。
输出窗口则是那个不那么显眼的差异。16,000 个 token 的输出,意味着一次就能生成一份完整的流程文档,而且因为模型看到了全部内容,整篇文档的术语和语域保持一致。8K 窗口则做不到这一点,而逐句处理的变通做法恰恰重新引入了跨片段一致性问题——IFMTBench 这类翻译指令遵循基准正是为了衡量这些问题而构建的。

又是许可证,它比表格更能决定一切
North Small Translate 1.0 采用 CC BY-NC 4.0 许可。其权重可免费用于非商业用途,商业部署则需通过 Cohere 的 Model Vault,凭购买的许可证进行,且未公布价格。Hy-MT2-7B 采用 Apache 2.0 许可,且无需申请即可获取——商业使用、微调与衍生作品一律允许,无需任何协商。对于商业产品而言,操作顺序不言自明:Hy-MT2-7B 今天就能部署,Cohere 的模型今天就能评估,任何基准测试的排名都改变不了这一先后顺序。
Cohere 的抵消性优势在于其免费额度。North Small Translate 1.0 运行在 Chat V2 的免费额度之上,无论是试用密钥还是生产密钥都可免费使用,直到触及速率限制为止,因此一次评估除了时间之外不产生任何成本。Hy-MT2-7B 则拥有托管式商业 API——腾讯将该系列的托管层定价为每百万输入 token 约 0.044 美元、每百万输出 token 约 0.177 美元——而在你自己的 GPU 上自行托管才是真正免费的途径。
“multi-pass”实际上意味着什么
Cohere 决定同时发布 83.60 和 84.36,是其发布说明中最具信息量的细节,因为这表明该公司相信工作流胜过单次调用。这与 Tencent 以不同机制押下的注相同:其旗舰 30B-A3B 在 GEMBA 和 XCOMET 上胜出,而 Gemini 3.1 Pro 在 FLORES-200 上胜出,这意味着最佳系统不是一个模型,而是一组模型。OrcaRouter 的模型融合将多个模型作为一组运行,并在单次调用内协调它们的答案,这正是两家厂商都在追求的多遍思路的平台级版本——而且它与路由侧可组合,其中一个密钥以提供商标价、0% 加价覆盖超过 200 个模型的目录,因此供应商价格变动当天就会落到我们这边,而不是等到下一次合同续签。
这一框架同样解决了本文开头提出的证据问题。当两家厂商发布互不重叠的基准测试结果,而双方又都没有独立评估时,选择的方式不是相信一张表格,而是把两者都放到你自己的文档上运行,让分歧在真实文本上暴露出来——这正是面板和故障转移链的用途所在。

哪一个,什么时候
如果你需要一个能在自己已有的硬件上运行、用于商业产品中、且无需进行授权洽谈的翻译模型,Hy-MT2-7B 仅凭其规格范围就能胜出——而它由厂商发布的结果,尽管尚未被复现,至少是具名的、可比较的,并且接近前沿。如果你要把长文档翻译成 Cohere 的五十种语言,需要每轮处理产生 16K 的一致输出,并且要么有两块 B200 的预算,要么愿意在决定之前先在 Cohere 的免费层级上运行评估,那么 North Small Translate 1.0 在每一个已披露的维度上都是能力更强的机器。
这两个模型都没有做到的一件事,就是消除测试的必要。Cohere 给了你一个未具名的数字,以及一种免费核验它的方式。Tencent 给了你一张表格和一个 GPU 级别的下载。83.60 是一个承诺,而不是结果——而兑现这个承诺的唯一地方,就是你自己的语料库。
