North Small Translate 1.0 主视觉卡片以模型名称为标题,并带有“Cohere 的 218B 翻译模型,仅在发布说明中记录”这一行文字;其下方是一张列出 218B 总参数 / 25B 激活 MoE、50 种语言以及 16K 输入 / 16K 输出的卡片,旁边是一个标记为“无发布帖”的文档图案。
Guides & Insights

North Small Translate 1.0:Cohere 迄今最安静的大模型

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

North Small Translate 1.0是 Cohere 和 Cohere Labs 推出的一个 2180 亿参数的专家混合翻译模型,它的到来方式与极少数前沿规模发布不同:只有一份发布说明,别无其他。Cohere 的更新日志将公告日期定为 2026 年 9 月 9 日,但三个检查点早在 8 月 14 日就已放在 Hugging Face 的门控之后——三周半的权重,没有博客文章,没有媒体报道,也没有发布帖。本文撰写时,主仓库显示零个点赞、过去一个月 26 次下载,以及一个无人回复的社区讨论。一个厂商报告的 WMT26 得分为 83.60 的 218B 模型却几乎无人注意到,这值得解释,因此以下是文档和仓库实际证实的内容,并与它们未能证实的内容区分开来。

Cohere 署名的那些数字

从规格说起,因为它们明确无歧义,而且是本次发布中完全可知的部分。North Small Translate 1.0 是一个仅解码器的稀疏专家混合模型——与 Cohere 在 2026 年 5 月用于 Command A+ 的形态相同——拥有 128 个专家,每个 token 激活八个,另有在每个 token 上都会运行的共享专家。路由器对专家 logits 取 sigmoid 激活,并在 top-k 选择范围内进行归一化。注意力以 3:1 的比例在滑动窗口层(窗口 4,096,RoPE)和不带任何位置嵌入的全局注意力层之间交替。

参数 — 总计 218B,每个 token 激活 25B

上下文 — 16K 输入和 16K 输出

语言 — 英语加另外 49 种,共 50 种

第一梯队语言 — 现代标准阿拉伯语、德语、法语、日语、韩语、俄语、乌克兰语

检查点 — BF16、FP8 和 NVFP4 W4A16

最低硬件要求 — BF16:4×B200 或 8×H100;FP8:2×B200 或 4×H100;W4A16:1×B200 或 2×H100

许可证 — CC BY-NC 4.0,商业用途须经 Cohere 的 Model Vault 授权

报告质量 — WMT26 83.60,采用智能体多轮翻译工作流后提升至 84.36

其中两行值得展开说说,而不只是列个要点。上下文窗口为 16K 输出,这对翻译模型来说很不寻常,也决定了是翻译一个段落,还是一次性翻译整份流程文档。那个智能体指标——84.36 对 83.60——是 Cohere 在描述一种工作流,而不是一个模型:多轮处理,想必由智能体决定哪些内容需要重新翻译。这与 Cohere 在 2025 年 8 月随 Command A Translate 推出的“Deep Translation”是同一个理念,如今又以更大规模在此重现。

Single-model scoreboard for North Small Translate 1.0 with six rows reading Total parameters 218B MoE, Active parameters 25B, Context 16K in / 16K out, Languages 50, License CC BY-NC 4.0, and WMT26 score 83.60 (unaudited), with a footer noting the figures come from Cohere's model card and release note and that the WMT26 metric is unnamed and not independently reproduced.

代码仓库所展示、而发布说明未展示的内容

发布说明是营销文档;代码仓库才是工程文档,而其中的一些细节比那些头条规格更重要。服务通过 vLLM 支持,需搭配 cohere_melody>=0.9.0,并且 Cohere 明确建议使用贪心解码,"与生产部署保持一致"——一个告诉你关闭采样的翻译模型,是追求确定性的翻译模型,而非面向创意写作。输出被包裹在 <|START_TEXT|><|END_TEXT|> 标记中,解析时依赖 Cohere 的 melody 库。这些标记并未注册为特殊 token,因此设置 skip_special_tokens=True 不会将它们剥离——这是个小小的陷阱,在天真的集成方式中会产生可见的标签残留。

还有一个聊天模板,带有默认的系统指令,以“North Small Translate”这一名称来呈现该模型,并声明它由 Cohere 构建。每段对话的系统消息会追加到该默认指令之后,而不是替换它——如果你需要将其替换掉,还有一个单独的platform_instruction_override槽位。正是这类底层管线的细节告诉你:这是一个经过后训练的聊天模型披着翻译任务的外衣,而不是经典的编码器-解码器架构。

它在Cohere产品线中的定位

这一谱系是解读本次发布最有用的背景,而且它已有文档记录。Command A Translate 于 2025 年 8 月 28 日发布,是 Cohere 的首个机器翻译模型——111B 参数,16K 窗口分为 8K 输入和 8K 输出,支持 23 种语言,并以 CC-BY-NC 研究许可发布。North Small Translate 1.0 将语言数量翻了一倍多,达到 50 种,把活跃参数数量增至三倍,达到 25B,总窗口保持 16K,但使其全部可用于输出,并将单个偏稠密模型换成稀疏 MoE,其占用规模与 Cohere 在 North 系列其他地方已经使用的一致。

诚实的解读是,这是 Cohere 当前 MoE 核心的一个专门化衍生物,针对翻译进行了后训练,而非一种全新架构。模型卡用一句话说明了这一点——它是“专为翻译质量进行后训练”的——并且未披露任何关于训练语料、token 数量或数据管线的内容。Command A Translate 的技术报告详细描述了一种难度过滤数据技术;而针对该模型,尚未发布任何同等内容。

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

什么是真正未得到确认的?

这正是静默发布必须谨慎处理的地方,因为无声无息是一把双刃剑。以下这些事情,目前 Cohere 外部无人知晓:

WMT26 83.60 衡量的是什么。模型卡和发布说明中均未指明具体指标,也没有针对该模型发布任何 WMT26 结果页面。没有指标名称的"83.60"只是一个数字,而非结果。

该评分是否可复现。没有独立团队运行过此模型。本文中的每个数字都来自 Cohere 自己。

智能体式多轮工作流究竟是什么。84.36 这个数字只用了一句话来描述。它是附在模型卡上的一项系统级声明,而该系统并未被具体说明。

商业许可证的费用是多少。Cohere 将企业客户引导至销售部门和 Model Vault。文档页面上未公布价格。

是否会发布博客文章。 Cohere 有博客。Command A Translate 拿到了完整的一篇。而这款模型只拿到了一条发布说明。

这些都不是指责。这是你可评估的模型与你可购买的产品之间的区别,而目前 North Small Translate 1.0 完全属于前者——外加一样你可以免费使用的东西。

免费版是你今天真正可以测试的部分。

与纯粹只发布权重不同,这一次还提供了可直接使用的线上入口:North Small Translate 1.0 通过 Chat V2 API 在 Cohere 的免费层中提供,Cohere 的发布说明称,无论是试用 生产密钥,在达到速率限制之前都可免费使用。这是一个异常宽松的评估窗口——你不需要付费合同,就能让它承载真实流量。与此同时,权重是 Hugging Face 上采用 CC BY-NC 4.0 许可的 FP8 权重集,因此如果没有 Model Vault 协议,用于商业目的的自托管是行不通的。

那么,这个决定在实践中是什么样子:通过 API 免费评估,只有当你决定正式上线时才付费。这是一次低风险的试用,而路由层正是为这种事而生的。如果你已经在通过 OrcaRouter 调用翻译——一个密钥,畅行 200 多个模型,供应商标价按0% 加价原样透传——那么真正值得评估的问题就不是“我要不要迁移”,而是“它在我自己的文档上能否胜过我现在已经在调用的东西”,而这个问题你可以通过把同一段文本分别跑一遍两边来回答。供应商一旦降价,在我们这边当天就会生效,因为上面没有叠加任何经销商差价。而面对一个只有单次、且无法复现的基准测试、又没有第三方评测的模型,故障转移正是让你能够试用它、却不必把生产链路押上去的机制:你的流量继续流向那个已经跑得通的模型,而新模型则在真实输入上接受评分。

Screenshot of Cohere's Release Notes page showing the date badge September 9, 2026 above the heading "Announcing Cohere's North Small Translate", followed by the key features list (218 billion total parameters with 25 billion active, free-tier Chat V2 API, FP8 open weights under CC BY-NC 4.0, suggested hardware two H100s or one B200) and the technical details listing model name north-small-translate-1-0, context length 16K and FP8 open-weights format.

怎样才能把这份发布说明变成一次正式发布?

有三件事会让 North Small Translate 1.0 从一条文档条目变成一个真正的竞争者,而这三件事都可以从外部观察到。第一,为 WMT26 那个数字给出一个具名指标——83.60 附上指标就可以比较,而没有指标则无法比较。第二,第一次独立复现,无论它来自 WMT26 评估活动本身,还是来自第三方在 FP8 权重上运行 FLORES 风格的测试。第三,一篇实际的发布帖,这将表明 Cohere 打算出售它,而不仅仅是把它发表出来。

在那之前,正确的姿态是证据所支持的那一种:一个确实有趣的 218B MoE 翻译专用模型,提供免费评估途径,支持五十种语言,并拥有文档长度的输出窗口,而其质量宣称完全依赖于其开发方的说法。Cohere 在十三个月内推出了四款具备翻译能力的模型,其中只有一款有博文介绍。这两个事实中哪一个更具信息量,才是值得静下心来思考的问题。