
North Small Translate 1.0 對上 Hy-MT2-7B:一顆 GPU 對抗兩張 B200
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 每百萬 tokens
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
目前開源翻譯領域中最接近的一場對決,可能也是最不顯眼的一場。Hy-MT2-7B是騰訊混元翻譯家族中的老二,於 2026 年 5 月 21 日在 Apache 2.0 授權下開源,可在單張 RTX 4090 或 A100 上運行,約佔 16GB 顯存。North Small Translate 1.0則是 Cohere 的 2180 億參數稀疏混合專家翻譯模型,記錄於該公司 2026 年 9 月 9 日的發行說明中,最低部署需求為兩張 B200(FP8),或是一張 B200 的 NVFP4 W4A16 形式。兩者都是翻譯專門模型,兩者都是當前最新。其中一個可以直接從工作站提供服務,而單單這一項事實就重新界定了整個比較——因為那個最能讓兩者在同等條件下受評判的基準並不存在。
先從信封開始,而不是分數。
部署成本是決定大多數實際整合的關鍵面向,而在這一點上,這兩個模型差距懸殊。Hy-MT2-7B 是一個稠密的 HunYuanDenseV1 模型,擁有約八十億個參數,已發布 FP8 與 GGUF 版本,另有社群為 Apple 晶片提供的 MLX 8 位元版本。騰訊的部署說明列出 transformers 5.6.0 或更新版本、vLLM、SGLang 與 llama.cpp 為支援的執行環境,而推論指引將生成上限設在 8,192 個 token,儘管配置宣稱可支援多達 262,144 個位置。單一張現代消費級或工作站 GPU 就能應付。
North Small Translate 1.0 是不同類別的物件。其總參數量為 218B、活躍參數為 25B,分散於 128 個專家之中,每個 token 有八個活躍專家,另加上共享專家;而 Cohere 為其三種檢查點分別公布了最低硬體需求:BF16 需要四張 B200 或八張 H100,FP8 需要兩張 B200 或四張 H100,NVFP4 W4A16 版本則需要一張 B200 或兩張 H100。推論服務透過 vLLM 執行,需搭配 cohere_melody>=0.9.0,且 Cohere 建議採用貪婪解碼以符合生產環境。輸出帶有 <|START_TEXT|> 與 <|END_TEXT|> 標記,這些標記並未註冊為特殊 token。
• 架構 — North Small Translate 1.0:總計 218B/啟用 25B 的稀疏 MoE,128 個專家;相較於 Hy-MT2-7B:稠密,約 8B
• 上下文 — 輸入 16K、輸出 16K,對比 8K 工作視窗;設定檔標示最高可支援 262,144 個位置
• 最低硬體需求 — W4A16 下需 1×B200,FP8 下需 2×B200 或 4×H100,對比單張約 16GB 的 RTX 4090 等級 GPU
• 已發佈格式 — BF16、FP8、NVFP4 W4A16 對比基礎版、FP8、GGUF,以及社群版 MLX 8 位元
• 語言 — 50(英語 + 49)對比 33 種語言加上 5 種少數民族語言與方言
• 授權 — CC BY-NC 4.0,商業用途須透過 Model Vault,相較 Apache 2.0 則無需申請開放使用
• 報告品質 — WMT26 83.60,指標未具名,為廠商自行回報,有別於具名廠商表格,涵蓋 FLORES-200、WMT25 GEMBA、XCOMET-XXL 與 IFMTBench

基準問題
這場對決最誠實的核心是:我們無法將這兩個模型互相比較排名,任何告訴你不然的人都是在憑空編造數字。Tencent 發表了四項具名評測。在 FLORES-200 英文至 X 翻譯上,7B 得到 93.52,落後 Gemini 3.1 Pro 的 94.42 與 GPT-5.5 的 94.16,但已接近到不容忽視。在與 WMT25 相關的 GEMBA 指標上,它得分 82.24,相較於 30B-A3B 的 84.34 與 GPT-5.5 的 83.41。在 XCOMET-XXL 上,它以 63.86 在 Tencent 的比較表中領先所有模型——領先 Gemini 3.1 Pro、GPT-5.5、DeepSeek-V4-Pro 與 Kimi K2.6。在 IFMTBench 的指令遵循分數上,它達到 83.14%。這些全都是 Tencent 自家的數字,沒有任何一項經過獨立重現,而它們仍遠多於 Cohere 所提供的內容。
Cohere 公布了一個單一數字:WMT26 分數為 83.60,在代理式多輪工作流程下上升至 84.36。模型卡或發佈說明中沒有指明任何指標,且尚未有針對此模型的 WMT26 結果頁面發佈。這種不對稱並非證明 Cohere 的模型較弱或較強。這意味著讀者最想要的比較——相同測試、相同指標、兩個模型——無法從公開證據中進行,而 Cohere 自己兩個數字內的四分差距(83.60 到 84.36)已經大於騰訊表格中大多數的差距。
語言與長篇文件
North Small Translate 1.0 涵蓋五十種語言與地區變體,並將現代標準阿拉伯語、德語、法語、日語、韓語、俄語和烏克蘭語指定為第一級,且雙向皆可接收與輸出 16,000 個 token。Hy-MT2-7B 涵蓋三十三種語言,外加包括藏語、維吾爾語和粵語在內的五種少數民族語言與方言。這兩份清單皆非彼此的超集——Tencent 涵蓋粵語和維吾爾語,Cohere 則涵蓋更廣泛的歐洲地區變體——因此單就涵蓋範圍而言,多語言部署可能會發現兩者都需要。
輸出視窗是較不明顯的差異。一萬六千個 token 的輸出,意味著一次就能產出完整的程序文件,而且整份文件的術語與語域保持一致,因為模型看見了全貌。8K 視窗做不到這一點,而逐句處理的變通做法,正好會重新引入跨片段一致性的問題——這正是像 IFMTBench 這類翻譯指令遵循基準原本要衡量的問題。

授權,又一次,比表格更能決定。
North Small Translate 1.0 採用 CC BY-NC 4.0 授權。其權重可免費用於非商業用途,而商業部署則須透過 Cohere 的 Model Vault,以購買授權的方式進行,且未公開價格。Hy-MT2-7B 採用 Apache 2.0 且無使用門檻——商業使用、微調與衍生作品全都無須事先洽談即可獲准。對商業產品而言,這個先後順序不言自明:Hy-MT2-7B 今天就能部署,而 Cohere 的模型今天就能評估,沒有任何基準測試的數據列能改變這個順序。
Cohere 的抵銷優勢在於免費方案。North Small Translate 1.0 在 Chat V2 的免費方案上運作,試用與正式金鑰皆可免費使用,直到觸及速率限制,因此評估除了時間之外不花任何成本。Hy-MT2-7B 則有託管的商用 API——騰訊將該系列託管方案定價為每百萬輸入 token 約 $0.044、每百萬輸出 token 約 $0.177——而在自己的 GPU 上自行託管才是真正免費的途徑。
「multi-pass」實際上暗示了什麼
Cohere 決定同時公布 83.60 與 84.36,是其發布說明中最具資訊價值的細節,因為這表示該公司相信工作流程勝過單次呼叫。那也是騰訊以不同機制所下的同一注:其旗艦 30B-A3B 在 GEMBA 與 XCOMET 上勝出,而 Gemini 3.1 Pro 則在 FLORES-200 上勝出,這意味著最好的系統不是單一模型,而是一組模型。OrcaRouter 的模型融合會將數個模型組成一個小組來運行,並在單次呼叫中調和它們的答案,這是兩家廠商都在追求的多重處理構想的平台層級版本——而且它可與路由端相互搭配,其中 一組金鑰即可涵蓋超過 200 個模型的目錄,並以供應商牌價、0% 加價提供,因此供應商價格變動當天就會反映在我們這一端,而不是等到下一次合約續約。
那樣的框架也解決了本文開頭提出的證據問題。當兩家廠商各自發布互不重疊的基準測試,而雙方都沒有獨立評估時,選擇的方式並不是相信一張表格,而是把兩者都跑在你自己的文件上,讓歧異在真實文本上浮現——這正是面板與容錯移轉鏈的用途所在。

哪一個,以及何時?
如果你需要一個能在你已擁有的硬體上運行、用於商業產品,又無須談授權的翻譯模型,Hy-MT2-7B 光憑其適用範圍就勝出——而它由廠商公布的結果,儘管尚未被重現,至少是有名可循、可相互比較,且接近前沿。如果你要把長篇文件翻譯成 Cohere 的五十種語言,每輪需要 16K 的一致輸出,而且你要麼有兩張 B200 的預算,要麼願意先在 Cohere 免費方案上跑評估再決定,那麼 North Small Translate 1.0 在每一個已揭露的軸線上都是能力更強的機器。
這兩個模型都沒做到的是免除測試的必要。Cohere 給了您一個未具名的數字,以及一個免費的查核方式。騰訊給了您一張表格和一個 GPU 等級大小的下載檔。83.60 是一個承諾,不是結果——而這個承諾唯一能得到驗證的地方,就是在您自己的語料庫上。
