
North Small Translate 1.0:Cohere 迄今最安靜的大型模型
North Small Translate 1.0是來自 Cohere 與 Cohere Labs 的 2180 億參數混合專家翻譯模型,而它的登場方式,是極少數前沿規模發布會有的樣子:只有一則發布說明,別無其他。Cohere 的變更紀錄將公告日期定為 2026 年 9 月 9 日,但這三個檢查點自 8 月 14 日起就已放在 Hugging Face 的閘門之後——長達三週半的權重,沒有部落格文章、沒有媒體報導,也沒有發布討論串。撰寫本文時,主要儲存庫顯示零個讚、過去一個月 26 次下載,以及一則未獲回覆的社群討論。一個廠商回報 WMT26 分數達 83.60、卻幾乎無人注意的 218B 模型,值得好好解釋,因此以下說明文件與儲存庫實際確立了什麼,並將之與它們並未確立的事分開來看。
Cohere 具名背書的那些數字
先從規格談起,因為它們明確無疑,而且是這次發布中完全可知的部分。North Small Translate 1.0 是僅解碼器的稀疏混合專家模型——與 Cohere 在 2026 年 5 月用於 Command A+ 的架構相同——擁有 128 個專家,每個 token 啟用八個,再加上每個 token 都會執行的共享專家。路由器對專家 logits 取 sigmoid 激活,並在 top-k 選取範圍內進行正規化。注意力以 3:1 的比例交替使用滑動視窗層(視窗 4,096,RoPE)與完全不帶位置嵌入的全域注意力層。
• 參數 — 總計 218B,每個 token 啟用 25B
• 上下文 — 16K 輸入與 16K 輸出
• 語言 — 英文加上其他 49 種,總共 50 種
• 第一級語言——現代標準阿拉伯語、德語、法語、日語、韓語、俄語、烏克蘭語
• 檢查點 — BF16、FP8 與 NVFP4 W4A16
• 最低硬體需求 — BF16:4×B200 或 8×H100;FP8:2×B200 或 4×H100;W4A16:1×B200 或 2×H100
• 授權 — CC BY-NC 4.0,商業用途導向 Cohere 的 Model Vault
• 報告品質 — WMT26 83.60,在代理式多輪翻譯工作流程下提升至 84.36
其中兩行值得的不只是一則要點。上下文窗口為 16K 輸出符元,這對翻譯模型而言並不尋常,也正是「翻譯一段文字」與「一次翻完整份程序文件」之間的差別。而那個代理式(agentic)的分數——84.36 對上 83.60——是 Cohere 在描述一套工作流程,而非一個模型:多輪處理,想必是由代理決定哪些部分要重新翻譯。這與 Cohere 在 2025 年 8 月搭配 Command A Translate 以「Deep Translation」名義推銷的概念如出一轍,如今在此以更大規模重現。

儲存庫顯示、但發行說明未顯示的內容
發布說明是行銷文件;程式碼倉庫才是工程文件,而其中有些細節比標題規格更重要。推論服務可透過 vLLM 支援,搭配 cohere_melody>=0.9.0,而 Cohere 明確建議使用貪婪解碼,「與生產部署一致」——一個叫你關掉取樣的翻譯模型,是著眼於確定性的翻譯模型,而不是為了創意寫作。輸出會以 <|START_TEXT|> 與 <|END_TEXT|> 標記包住,解析時預期使用 Cohere 的 melody 函式庫。這些標記並未註冊為特殊符號,所以設定 skip_special_tokens=True 並不會把它們移除——這是個小陷阱,在粗糙的整合中會產生看得見的標籤殘留。
另有一個聊天模板,其中包含預設系統指令,會以「North Small Translate」這個名稱呈現該模型,並說明它是由 Cohere 建構。每個對話的系統訊息會附加到該預設值,而非取代它——如果你需要將它置換掉,另有一個獨立的 platform_instruction_override 插槽。這類底層機制說明這是個披著翻譯任務外衣的後訓練聊天模型,而不是經典的編碼器—解碼器。
它在 Cohere 產品線中的定位
這條脈絡是理解本次發布最實用的背景,而且已有文件記載。Command A Translate 於 2025 年 8 月 28 日發布,是 Cohere 首個機器翻譯模型——111B 參數、16K 視窗拆分為 8K 輸入與 8K 輸出、23 種語言,並以 CC-BY-NC 研究授權發布。North Small Translate 1.0 將語言數量增加逾一倍至 50 種,把作用中參數數量增至三倍達 25B,總視窗維持在 16K,但讓整個視窗都能用於輸出,並以稀疏 MoE 取代單一偏稠密模型,其佔用規模與 Cohere 已在 North 系列其他產品使用的相同。
老實說,最合理的解讀是:這是 Cohere 現行 MoE 核心的專門衍生模型,為了翻譯而經過後訓練,而非全新架構。模型卡只用一行就表明了這一點——它「特別針對翻譯品質進行後訓練」——卻未揭露任何關於訓練語料、token 數量或資料管線的資訊。Command A Translate 的技術報告詳細描述了一種難度過濾資料技術;但針對這個模型,並沒有發表任何同等內容。

什麼是真正未經確認的?
這是必須謹慎處理靜默發布的地方,因為沒有聲量是把雙面刃。以下是目前 Cohere 外部無人知曉的事情:
• WMT26 的 83.60 衡量的是什麼。模型卡與發布說明中都沒有指明任何指標名稱,也沒有針對此模型公布任何 WMT26 的結果頁面。少了指標名稱的「83.60」只是個數字,不是結果。
• 分數是否可重現。沒有獨立團隊運行過這個模型。本文中的所有數據均出自 Cohere 本身。
• 代理式多輪流程實際上究竟是什麼。84.36 這個數字只用了一個子句來描述。它是附掛在模型卡上的系統層級主張,而該系統並未具體指明。
• 商業授權的費用是多少。 Cohere 會將企業客戶導向業務部門與 Model Vault。文件頁面上並未公布任何價格。
• 是否會有部落格文章。 Cohere 有部落格。Command A Translate 拿到了完整的部落格文章。這個模型只拿到了一則發行說明。
以上都不是指控。這正是你能評估的模型與你能購買的產品之間的差異,而現在 North Small Translate 1.0 完全屬於前者——外加一項你可以免費使用的東西。
免費方案是您今天就能實際測試的部分
不同於單純的權重釋出,這次還有一個實際可用的介面:North Small Translate 1.0 已透過 Chat V2 API 在 Cohere 的免費方案中提供,而 Cohere 的發布說明指出,無論是試用 與 正式環境金鑰,在達到速率限制之前皆可免費使用。這是一個異常寬鬆的評估窗口——你不需要付費合約,就能讓真實流量經過它。另一方面,權重是 Hugging Face 上以 CC BY-NC 4.0 授權的 FP8 集合,因此若無 Model Vault 協議,商業用途的自行託管便不可行。
那麼,這個決策的實際樣貌是:透過 API 免費評估,只有在決定要正式上線時才付費。這是一種低風險的試用,而這正是路由層存在的目的。如果你已經透過 OrcaRouter 呼叫翻譯服務——一組金鑰即可橫跨超過 200 個模型的目錄,供應商定價以0% 加成原樣傳遞——那麼可評估的問題不是「我該不該搬遷」,而是「這能不能勝過我目前用在自己的文件上的服務」,而你可以把同一段文字分別送進兩者來得到答案。供應商降價在我們這邊是當天生效的變動,因為上頭沒有疊加經銷商的價差。而對於只有一個未經重現的基準測試、又沒有第三方評估的模型,容錯移轉正是讓你不必把正式環境路徑賭在它身上就能一試的機制:你的流量會持續流向已經運作良好的模型,同時新的模型則在真實輸入上接受評分。

什麼會讓這從一則發布說明變成一次發布?
有三件事會讓 North Small Translate 1.0 從一筆文件紀錄變成真正的競爭者,而這三件事都能從外部觀察到。第一,為 WMT26 數字提供一個具名指標——附上指標的 83.60 可以比較,沒有指標的則無法。第二,首次獨立重現,無論是來自 WMT26 評測活動本身,還是來自第三方在 FP8 權重上進行 FLORES 式測試。第三,一篇實際的發布貼文,這將顯示 Cohere 打算銷售這項產品,而不只是把它發表出來。
在那之前,正確的立場是證據所支持的那個:一個真正有趣的 218B MoE 翻譯專門模型,有免費的評估途徑、五十種語言,以及文件長度的輸出視窗,而其品質宣稱完全取決於製造商的一面之詞。Cohere 在十三個月內推出了四款具備翻譯能力的模型,其中只有一款有部落格文章。這兩個事實中,哪一個更具資訊價值,才是值得好好思量的問題。
