
North Small Translate 1.0 對比 Hy-MT2:兩款 MoE 翻譯器,一個證據缺口
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
這兩個系列都建立在同一個押注之上——也就是一個為翻譯進行後訓練的稀疏混合專家網路,勝過被要求翻譯的通用模型——而它們是從相反的方向抵達這個結論的。Hy-MT2,騰訊混元的三模型翻譯系列,由Hy-MT2-30B-A3B MoE 領銜,於 2026 年 5 月 21 日以 Apache 2.0 開源,並附上技術報告、開源基準測試與完整比較表。North Small Translate 1.0是 Cohere 的 2,180 億參數、250 億活躍參數 MoE 翻譯模型,記錄於 2026 年 9 月 9 日的一份發布說明中,而其品質佐證不過是一個數字,且未附帶任何指標。架構彼此呼應。文件則不然,而在選擇兩者之前,這個差異是最值得理解的一件事。
一個家族,三種尺寸,對抗一個大型模型
Hy-MT2 並非單一模型,而是一系列模型:用於裝置端運算的 1.8B 稠密模型、適用於單一 GPU 的 7B 稠密模型,以及作為旗艦的 30B-A3B MoE,每個 token 啟用三十億個參數。三者皆採用 Apache 2.0 授權、無需申請即可取用,並同步發布 FP8、GGUF、2-bit 與 1.25-bit 量化版本,以及 IFMTBench 指令遵循基準測試與配套論文。騰訊表示,該系列可在 33 種語言以及五種少數民族語言與方言之間進行翻譯。
North Small Translate 1.0 是規模空間中的一個單點,而且是個大點:218B 總參數、25B 活躍參數、128 個專家,每個 token 啟用八個專家,外加共享專家,而注意力以 3:1 的比例在滑動視窗層(視窗 4,096,RoPE)與不帶位置嵌入的全局層之間交替。其視窗在英語及其他 49 種語言上皆為輸入 16K、輸出 16K,其中現代標準阿拉伯語、德語、法語、日語、韓語、俄語與烏克蘭語被指定為第一級。值得注意的是,這個架構形態並不新奇——Cohere 於 2026 年 5 月推出的 Command A+ 就採用了相同的 218B/25B 配置——這使得它更像是對既有核心進行翻譯特化的後訓練,而非全新架構。
• 參數 — North Small Translate 1.0:總計 218B / 啟用 25B,對比 Hy-MT2-30B-A3B:總計 30B / 啟用 3B,另有 1.8B 與 7B 稠密版本
• 上下文 — 輸入 16K、輸出 16K,對比 8K 工作視窗;設定檔標示最高可支援 262,144 個位置
• 語言 — 50(英語 + 49)對比 33 加 5 種少數語言與方言
• 授權 — CC BY-NC 4.0,商業用途須透過 Model Vault,相較 Apache 2.0 則無需申請開放使用
• 已發表的證據 — 一個未具名的 WMT26 數據、廠商自行報告與技術報告的對比、一個公開基準,以及在 FLORES-200、WMT25 GEMBA 和 XCOMET-XXL 上的具名結果
• 服務 — vLLM 搭配 cohere_melody>=0.9.0,建議使用貪婪解碼,相較於 transformers、vLLM、SGLang 和 llama.cpp
• 已公告 — 2026年9月9日(權重自8月14日起在Hugging Face上受限)對比2026年5月21日

證據缺口才是真正的重點
騰訊這次發布附上了實據。arXiv 上有一篇論文,該公司還撰寫並開源了一套基準,專門用來衡量翻譯指令遵循能力,另有一張列出競爭對手的結果表。FLORES-200 英文轉 X 將 30B-A3B 置於 93.85,對比 Gemini 3.1 Pro 的 94.42 與 GPT-5.5 的 94.16。WMT25 時代的 GEMBA 指標將其置於 84.34——在騰訊自家的比較中得分最高,領先 GPT-5.5 兩種模式下的 83.41 與 83.29、Gemini 3.1 Pro 的 82.23、DeepSeek-V4-Pro 的 81.99,以及 Kimi K2.6 的 81.68。XCOMET-XXL 將其置於 62.89,落後於自家的 7B 同系列模型。在 IFMTBench 上,它達到整體指令遵循率 85.7%,其中一個子分數為 91.94%,與 Gemini 3.1 Pro 相差不到百分之一分,而另一個子分數 85.55% 則讓它直接領先 Gemini 3.1 Pro 模型。
上述每一項都是 Tencent 自家的量測,且沒有一項經過獨立重現。但它們都有名稱、可互相比較,而且可被否證——讀者清楚知道該跑哪一項測試來提出論辯。
Cohere 的發行說明提供了一個數字:WMT26 83.60,在其所稱的代理式多遍翻譯工作流程下升至 84.36。模型卡或文件中任何地方都沒有指明指標名稱。尚未針對此模型發布任何 WMT26 結果頁面。訓練語料庫、權杖數與資料管道均未揭露,而 Command A Translate 的 2025 年技術報告曾詳細描述一種難度篩選技術。這些都不是模型較差的證據。這顯示的是證據較少,這是另一回事,而在你決定要將什麼投入生產環境時,也同樣重要。
雙方實際上都沒有公布的共同衡量標準
兩者之間有一個真正的接觸點,值得用一段來說明,因為這是唯一可能進行公平比較的地方。Tencent 是 WMT26 的合作夥伴,贊助了一項影片字幕翻譯任務,並提供由 Hunyuan 資助的獎項。Cohere 唯一公布的數字是一個 WMT26 數據。因此,兩個組織都處於同一個 2026 年評估週期內,而唯一能讓雙方正面交鋒、分出高下的指標,正是只有其中一方公布了任何內容的那個——而且公布時並未指明該指標。
這就是值得關注的落差。如果 Cohere 為 83.60 標上指標名稱,或者 WMT26 的結果頁面納入一套 North Small Translate 系統,這項比較才算真正成立。在那之前,把 Tencent 的 FLORES-200 和 GEMBA 數字拿來跟 Cohere 未標示的 WMT26 數字對比,只會是包裝成分析的捏造。

授權與部署
Hy-MT2 採用 Apache 2.0,沒有任何使用門檻:商業用途、微調、衍生作品與再散布,全都無需事先洽談。North Small Translate 1.0 採用 CC BY-NC 4.0,可免費用於非商業用途,商業部署則須經由 Cohere 的 Model Vault 進行,且價格並未公開。對於任何要交付給客戶的產品,這項差異在還沒讀到基準測試結果之前,就已經讓決定拍板定案。
硬體方面的情況則以相反方向遵循同樣的模式。Hy-MT2 涵蓋從能在手機上執行的 440MB 量化版本,一路到 30B-A3B,其三十億個活躍參數讓每 token 的運算量在其品質層級中維持在適度水準;執行環境涵蓋 transformers、vLLM、SGLang 與 llama.cpp。North Small Translate 1.0 公布了各個檢查點的最低硬體需求——BF16 需要四張 B200 或八張 H100,FP8 需要兩張 B200 或四張 H100,NVFP4 W4A16 需要一張 B200 或兩張 H100——並建議採用貪婪解碼以對齊正式環境。Cohere 的抵銷優勢在於,該模型可在其 Chat V2 API 的免費方案上執行,試用金鑰與正式金鑰均免費,直到觸及速率限制為止,因此評估它完全不需任何成本。
你該不該換,又該換成什麼?
這裡的切換問題確實是不對稱的。從 Hy-MT2 轉向 North Small Translate 1.0 並不是你目前能合理論證的效能升級——這是在押注一個唯一公開說法只是一個數字的模型,用以換取一個擁有已發布報告與可部署授權的系列。真正值得做的是評估:Cohere 模型可免費呼叫,涵蓋五十種語言,包括更廣泛的歐洲語言組合,並且每次處理可提供 16K 輸出,而 Hy-MT2 的 8K 工作視窗則辦不到。
這種評估正是路由層發揮價值的情境,因為對大多數多語言技術堆疊而言,誠實的答案是兩個模型都會留下來。OrcaRouter 把超過 200 個模型的目錄收在同一組金鑰之後,因此試用第二個翻譯模型只是改個設定,而不是多簽一份供應商合約或改動程式碼——你只要把同一個 OpenAI 相容的用戶端指向不同的 model id,就能用你自己的文本做比較。供應商定價以0% 加成,所以供應商調價時,我們這邊當天就會同步生效,不會再疊加任何價差,而容錯移轉鏈能讓正式環境繼續使用已經運作正常的模型,同時為新模型評分。North Small Translate 1.0 和 Hy-MT2 目前都不在我們的目錄中,因此這並不是建議你向我們購買其中任何一個——而是要說明,在你實際跑過測試之前,不該先把決定寫死。

裁決
騰訊的 Hy-MT2 是更安全的選擇,而且從證據來看雙方差距並不小:Apache 2.0、三種尺寸、一篇論文、一個公開基準、四套具名評估套件,以及 WMT26 合作關係。Cohere 的 North Small Translate 1.0 則更有意思——2,180 億個翻譯專用 MoE 參數,背後有 16K 輸出視窗和五十種語言、免費的評估方案,以及一個 Cohere 以外沒有人查核過的 83.60。
如果你這一季就得做出決定,就選那個拿得出憑據的系列。如果你手上有一份語料庫和一週的時間,就把其中一部分送進免費方案跑一遍,看看 Cohere 未具名的 83.60 對你的文件是否具有任何意義——因為這個問題沒有哪家廠商的表格能替你回答,而 Cohere 選擇公布的那個數字,正是它不肯指名的那一個。
