
North Small Translate 1.0 vs Hy-MT2:两款 MoE 翻译器,一个证据缺口
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
这两个系列都建立在同一个赌注之上——即为翻译做过后期训练的稀疏专家混合(MoE)网络,胜过一个被要求执行翻译的通用模型——而它们是从相反的方向走到这一步的。Hy-MT2是腾讯混元的三模型翻译家族,以Hy-MT2-30B-A3B MoE 为主打,于 2026 年 5 月 21 日以 Apache 2.0 协议开源,并附有技术报告、开源基准和完整的对比表。North Small Translate 1.0是 Cohere 的 2180 亿参数、250 亿激活参数的 MoE 翻译模型,其记录仅见于一份日期为 2026 年 9 月 9 日的发布说明,而它的质量证据只是一个孤零零的数字,没有附带任何指标。架构上二者如出一辙。文档上却并非如此,而在选择任何一方之前,最值得弄明白的就是这一差异。
一个家族,三种规模,对标一个大模型
Hy-MT2 并非单一模型,而是一个系列:用于端侧工作的 1.8B 稠密模型、面向单 GPU 的 7B 稠密模型,以及作为旗舰的 30B-A3B MoE,每个 token 激活三十亿参数。三者均采用 Apache 2.0、无需门控,并一同发布了 FP8、GGUF、2 比特和 1.25 比特量化版本,以及 IFMTBench 指令遵循基准和一篇配套论文。腾讯报告称,该系列可在 33 种语言以及五种少数民族语言和方言之间进行翻译。
North Small Translate 1.0 是规模空间中的一个单点,而且是个大点:总计 218B 参数,25B 激活,128 个专家,每个 token 激活八个,外加共享专家;注意力以 3:1 的比例在滑动窗口层(窗口 4,096,RoPE)与不携带位置嵌入的全局层之间交替。其窗口为输入 16K、输出 16K,覆盖英语以及其他 49 种语言,其中现代标准阿拉伯语、德语、法语、日语、韩语、俄语和乌克兰语被指定为第一梯队。值得注意的是,这一形态并不新鲜——Cohere 于 2026 年 5 月推出的 Command A+ 使用了相同的 218B/25B 配置——这使其成为对现有核心进行翻译专门化的后训练,而非一种新架构。
• 参数 — North Small Translate 1.0:总参数量218B / 激活25B,对比Hy-MT2-30B-A3B:总参数量30B / 激活3B,另有1.8B和7B稠密版本
• 上下文 — 输入 16K、输出 16K,而工作窗口为 8K,配置宣称最多可达 262,144 个位置
• 语言 — 50(英语 + 49)对 33 加 5 种少数民族语言和方言
• 许可 — CC BY-NC 4.0,商用需通过 Model Vault,对比 Apache 2.0,无门禁
• 已发表的证据——一个未具名的 WMT26 数字、厂商自行报告的与一份技术报告的对比、一个公开基准,以及 FLORES-200、WMT25 GEMBA 和 XCOMET-XXL 上的具名结果
• 服务 — vLLM 搭配 cohere_melody>=0.9.0,与 transformers、vLLM、SGLang 和 llama.cpp 相比,推荐使用贪心解码
• 发布 — 2026 年 9 月 9 日(权重自 8 月 14 日起在 Hugging Face 上受限开放)对比 2026 年 5 月 21 日

证据缺口才是真正的故事
腾讯这次发布是带着实锤的。有一篇发在 arXiv 上的论文,一个该公司专门为衡量翻译指令遵循能力而编写并开源的基准,还有一张点名其竞争对手的结果表。FLORES-200 英译 X 上,30B-A3B 得 93.85,而 Gemini 3.1 Pro 为 94.42,GPT-5.5 为 94.16。WMT25 时期的 GEMBA 指标给出 84.34——这是腾讯自己那份对比中的最高分,领先于 GPT-5.5 的 83.41 及其两种模式下的 83.29、Gemini 3.1 Pro 的 82.23、DeepSeek-V4-Pro 的 81.99 以及 Kimi K2.6 的 81.68。XCOMET-XXL 给出 62.89,落后于自家 7B 版本。在 IFMTBench 上,其整体指令遵循率达到 85.7%,其中一个子项得分 91.94%,与 Gemini 3.1 Pro 仅相差不到 0.01 个百分点;另一个子项得分 85.55%,在这一项上直接领先 Gemini 3.1 Pro 模型。
其中每一项都是 Tencent 自己的测量结果,且没有任何一项被独立复现。但它们都有名称、可以相互比较,而且可证伪——读者清楚地知道该运行哪项测试来提出质疑。
Cohere 的发布说明提供了一个数字:WMT26 83.60,在其所称的智能体式多轮翻译工作流下升至 84.36。模型卡或文档中均未指明这是哪项指标。也没有针对该模型发布任何 WMT26 结果页面。训练语料、token 数和数据流水线均未披露,而 Command A Translate 的 2025 年技术报告曾详细描述过一种难度过滤技术。这些都不能说明模型更差。它表明的是证据更少,而这是另一回事,在你决定将什么投入生产时同样重要。
双方实际上都未公布的共同标准
两者之间有一个实实在在的交汇点,值得用一段话来谈,因为这是唯一可能进行公平比较的地方。腾讯是 WMT26 的合作伙伴,赞助了一项视频字幕翻译任务,并提供由混元资助的奖项。Cohere 唯一公布的数字是一个 WMT26 的数值。因此,两家机构都处在同一个 2026 年评估周期内,而唯一能一决高下的指标,恰恰是其中只有一方公布过任何东西的那个——而且公布时还没有说明该指标是什么。
这就是值得关注的差距。如果 Cohere 给 83.60 附上了指标名称,或者 WMT26 结果页面包含了 North Small Translate 系统,这种比较才算真正成立。在此之前,把腾讯的 FLORES-200 和 GEMBA 数据与 Cohere 未标注的 WMT26 数字拿来对比,只会是披着分析外衣的捏造。

许可证和部署
Hy-MT2 采用 Apache 2.0 许可,且无任何限制:商业使用、微调、衍生和再分发,全都无需洽谈。North Small Translate 1.0 采用 CC BY-NC 4.0 许可,可免费用于非商业用途,而商业部署则需经由 Cohere 的 Model Vault 进行,价格尚未公布。对于任何要交付给客户的产品,这一差异在阅读基准测试之前就已决定了选择。
硬件方面的情况则以相反的顺序遵循同样的模式。Hy-MT2 的覆盖范围从可在手机上运行的 440MB 量化版本一直到 30B-A3B,其三十亿活跃参数使其在同等质量层级中单 token 计算量保持适中;运行时涵盖 transformers、vLLM、SGLang 和 llama.cpp。North Small Translate 1.0 公布了每个检查点的最低硬件要求——BF16 需要四块 B200 或八块 H100,FP8 需要两块 B200 或四块 H100,NVFP4 W4A16 需要一块 B200 或两块 H100——并建议采用贪心解码以匹配生产环境。Cohere 的抵消性优势在于,该模型可运行在其 Chat V2 API 的免费层级上,试用密钥和生产密钥均免费,直至达到速率限制,因此对其进行评估不产生任何成本。
你是否应该转换,以及转换到什么
要不要切换的问题在这里确实是不对称的。从 Hy-MT2 迁移到 North Small Translate 1.0,并不是你目前能证明合理的性能升级——这等于押注一个模型,而它唯一的公开说法只是一个数字,与之相对的却是一个拥有已发布报告和可部署许可证的模型家族。真正值得做的是评估:Cohere 模型可免费调用,覆盖五十种语言,包括更广泛的欧洲语言集,并且每次可输出 16K,而 Hy-MT2 的 8K 工作窗口做不到这一点。
这种评估正是路由层体现自身价值的地方,因为对大多数多语言技术栈来说,最诚实的答案就是两个模型都留下。OrcaRouter 把 200 多个模型的目录放在一个密钥背后,因此试用第二个翻译模型只是一次配置变更,而不是再签一份供应商合同或改动代码——你只需把同一个兼容 OpenAI 的客户端指向另一个模型 ID,然后用自己的文本做对比。供应商标价按0% 加价原样透传,因此托管方的价格一有变动,我们这边当天就会生效,不额外叠加任何差价;同时,故障转移链路会让生产环境继续运行已经可用的模型,而新模型则在接受评测。North Small Translate 1.0 和 Hy-MT2 目前都不在我们的目录中,所以这并不是建议你从我们这里购买其中任何一个——这是在说,在跑完测试之前,不要把决定写死。

裁决
腾讯的 Hy-MT2 是更稳妥的选择,而且从证据来看,这毫无悬念:Apache 2.0 许可、三种规模、一篇论文、一个开放基准、四个具名评估套件,以及与 WMT26 的合作。Cohere 的 North Small Translate 1.0 则更有意思——2180 亿参数的翻译专用 MoE,支持 16K 输出窗口和五十种语言,提供免费评估档位,以及一个 Cohere 之外无人核验过的 83.60。
如果你需要在本季度就拍板,那就选拿得出实据的那个系列。如果你有一个语料库和一周时间,就把其中一部分放进免费额度里跑一跑,看看 Cohere 那个未具名的 83.60 在你的文档上究竟意味着什么——因为这个问题,任何厂商的表格都无法替你回答,而 Cohere 选择公开的那个数字,恰恰正是它拒绝点名的那个。
