
North Small Translate 1.0:Cohere 迄今最安静的大模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百万 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
North Small Translate 1.0是 Cohere 和 Cohere Labs 推出的一个 2180 亿参数的专家混合翻译模型,它的到来方式与极少数前沿规模发布不同:只有一份发布说明,别无其他。Cohere 的更新日志将公告日期定为 2026 年 9 月 9 日,但三个检查点早在 8 月 14 日就已放在 Hugging Face 的门控之后——三周半的权重,没有博客文章,没有媒体报道,也没有发布帖。本文撰写时,主仓库显示零个点赞、过去一个月 26 次下载,以及一个无人回复的社区讨论。一个厂商报告的 WMT26 得分为 83.60 的 218B 模型却几乎无人注意到,这值得解释,因此以下是文档和仓库实际证实的内容,并与它们未能证实的内容区分开来。
Cohere 署名的那些数字
从规格说起,因为它们明确无歧义,而且是本次发布中完全可知的部分。North Small Translate 1.0 是一个仅解码器的稀疏专家混合模型——与 Cohere 在 2026 年 5 月用于 Command A+ 的形态相同——拥有 128 个专家,每个 token 激活八个,另有在每个 token 上都会运行的共享专家。路由器对专家 logits 取 sigmoid 激活,并在 top-k 选择范围内进行归一化。注意力以 3:1 的比例在滑动窗口层(窗口 4,096,RoPE)和不带任何位置嵌入的全局注意力层之间交替。
• 参数 — 总计 218B,每个 token 激活 25B
• 上下文 — 16K 输入和 16K 输出
• 语言 — 英语加另外 49 种,共 50 种
• 第一梯队语言 — 现代标准阿拉伯语、德语、法语、日语、韩语、俄语、乌克兰语
• 检查点 — BF16、FP8 和 NVFP4 W4A16
• 最低硬件要求 — BF16:4×B200 或 8×H100;FP8:2×B200 或 4×H100;W4A16:1×B200 或 2×H100
• 许可证 — CC BY-NC 4.0,商业用途须经 Cohere 的 Model Vault 授权
• 报告质量 — WMT26 83.60,采用智能体多轮翻译工作流后提升至 84.36
其中两行值得展开说说,而不只是列个要点。上下文窗口为 16K 输出,这对翻译模型来说很不寻常,也决定了是翻译一个段落,还是一次性翻译整份流程文档。那个智能体指标——84.36 对 83.60——是 Cohere 在描述一种工作流,而不是一个模型:多轮处理,想必由智能体决定哪些内容需要重新翻译。这与 Cohere 在 2025 年 8 月随 Command A Translate 推出的“Deep Translation”是同一个理念,如今又以更大规模在此重现。

代码仓库所展示、而发布说明未展示的内容
发布说明是营销文档;代码仓库才是工程文档,而其中的一些细节比那些头条规格更重要。服务通过 vLLM 支持,需搭配 cohere_melody>=0.9.0,并且 Cohere 明确建议使用贪心解码,"与生产部署保持一致"——一个告诉你关闭采样的翻译模型,是追求确定性的翻译模型,而非面向创意写作。输出被包裹在 <|START_TEXT|> 和 <|END_TEXT|> 标记中,解析时依赖 Cohere 的 melody 库。这些标记并未注册为特殊 token,因此设置 skip_special_tokens=True 不会将它们剥离——这是个小小的陷阱,在天真的集成方式中会产生可见的标签残留。
还有一个聊天模板,带有默认的系统指令,以“North Small Translate”这一名称来呈现该模型,并声明它由 Cohere 构建。每段对话的系统消息会追加到该默认指令之后,而不是替换它——如果你需要将其替换掉,还有一个单独的platform_instruction_override槽位。正是这类底层管线的细节告诉你:这是一个经过后训练的聊天模型披着翻译任务的外衣,而不是经典的编码器-解码器架构。
它在Cohere产品线中的定位
这一谱系是解读本次发布最有用的背景,而且它已有文档记录。Command A Translate 于 2025 年 8 月 28 日发布,是 Cohere 的首个机器翻译模型——111B 参数,16K 窗口分为 8K 输入和 8K 输出,支持 23 种语言,并以 CC-BY-NC 研究许可发布。North Small Translate 1.0 将语言数量翻了一倍多,达到 50 种,把活跃参数数量增至三倍,达到 25B,总窗口保持 16K,但使其全部可用于输出,并将单个偏稠密模型换成稀疏 MoE,其占用规模与 Cohere 在 North 系列其他地方已经使用的一致。
诚实的解读是,这是 Cohere 当前 MoE 核心的一个专门化衍生物,针对翻译进行了后训练,而非一种全新架构。模型卡用一句话说明了这一点——它是“专为翻译质量进行后训练”的——并且未披露任何关于训练语料、token 数量或数据管线的内容。Command A Translate 的技术报告详细描述了一种难度过滤数据技术;而针对该模型,尚未发布任何同等内容。

什么是真正未得到确认的?
这正是静默发布必须谨慎处理的地方,因为无声无息是一把双刃剑。以下这些事情,目前 Cohere 外部无人知晓:
• WMT26 83.60 衡量的是什么。模型卡和发布说明中均未指明具体指标,也没有针对该模型发布任何 WMT26 结果页面。没有指标名称的"83.60"只是一个数字,而非结果。
• 该评分是否可复现。没有独立团队运行过此模型。本文中的每个数字都来自 Cohere 自己。
• 智能体式多轮工作流究竟是什么。84.36 这个数字只用了一句话来描述。它是附在模型卡上的一项系统级声明,而该系统并未被具体说明。
• 商业许可证的费用是多少。Cohere 将企业客户引导至销售部门和 Model Vault。文档页面上未公布价格。
• 是否会发布博客文章。 Cohere 有博客。Command A Translate 拿到了完整的一篇。而这款模型只拿到了一条发布说明。
这些都不是指责。这是你可评估的模型与你可购买的产品之间的区别,而目前 North Small Translate 1.0 完全属于前者——外加一样你可以免费使用的东西。
免费版是你今天真正可以测试的部分。
与纯粹只发布权重不同,这一次还提供了可直接使用的线上入口:North Small Translate 1.0 通过 Chat V2 API 在 Cohere 的免费层中提供,Cohere 的发布说明称,无论是试用 和生产密钥,在达到速率限制之前都可免费使用。这是一个异常宽松的评估窗口——你不需要付费合同,就能让它承载真实流量。与此同时,权重是 Hugging Face 上采用 CC BY-NC 4.0 许可的 FP8 权重集,因此如果没有 Model Vault 协议,用于商业目的的自托管是行不通的。
那么,这个决定在实践中是什么样子:通过 API 免费评估,只有当你决定正式上线时才付费。这是一次低风险的试用,而路由层正是为这种事而生的。如果你已经在通过 OrcaRouter 调用翻译——一个密钥,畅行 200 多个模型,供应商标价按0% 加价原样透传——那么真正值得评估的问题就不是“我要不要迁移”,而是“它在我自己的文档上能否胜过我现在已经在调用的东西”,而这个问题你可以通过把同一段文本分别跑一遍两边来回答。供应商一旦降价,在我们这边当天就会生效,因为上面没有叠加任何经销商差价。而面对一个只有单次、且无法复现的基准测试、又没有第三方评测的模型,故障转移正是让你能够试用它、却不必把生产链路押上去的机制:你的流量继续流向那个已经跑得通的模型,而新模型则在真实输入上接受评分。

怎样才能把这份发布说明变成一次正式发布?
有三件事会让 North Small Translate 1.0 从一条文档条目变成一个真正的竞争者,而这三件事都可以从外部观察到。第一,为 WMT26 那个数字给出一个具名指标——83.60 附上指标就可以比较,而没有指标则无法比较。第二,第一次独立复现,无论它来自 WMT26 评估活动本身,还是来自第三方在 FP8 权重上运行 FLORES 风格的测试。第三,一篇实际的发布帖,这将表明 Cohere 打算出售它,而不仅仅是把它发表出来。
在那之前,正确的姿态是证据所支持的那一种:一个确实有趣的 218B MoE 翻译专用模型,提供免费评估途径,支持五十种语言,并拥有文档长度的输出窗口,而其质量宣称完全依赖于其开发方的说法。Cohere 在十三个月内推出了四款具备翻译能力的模型,其中只有一款有博文介绍。这两个事实中哪一个更具信息量,才是值得静下心来思考的问题。
