一張以「騰訊 HY-MT2 1.8B 推出託管 API」為主旨的主視覺標題卡,副標題為「騰訊 440MB 翻譯器上雲」,畫面中有一支帶有語言圖示的智慧型手機、一朵雲遞送一顆小巧的 440MB 晶片、一個標有 33 個圓點的地球、一個日期徽章寫著「2026 年 5 月 21 日開源 · 2026 年 8 月 20 日推出託管 API」,以及右下角的 OrcaRouter 標誌。
Guides & Insights

Tencent HY-MT2 1.8B 現提供託管 API:騰訊 440MB 翻譯模型上雲

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Tencent HY-MT2 1.8B,作為 Hy-MT2 翻譯系列中體積最精巧的成員,由騰訊混元於2026年5月21日開源,如今除了自架部署之外,也可透過商業化託管 API 呼叫——該模型的 API 上架資訊已於2026年8月20日正式發布,定價約為每百萬輸入 token 0.044美元、每百萬輸出 token 0.177美元。這個上架日期的重要性遠超一般情況,因為 1.8B 從不只是另一個開放權重的模型:它是騰訊為了證明一個 440MB 的量化翻譯模型能完全在手機上運作而打造的模型,而在開源發布後的三個月內,它也已整合進騰訊自家的 HyTranslate 迷你程式以及隨後推出的 iOS 與 Android 應用程式中。本文要探討的是託管 API 的推出帶來哪些改變、這個模型的本質是什麼,以及哪些數據值得你信賴。

8月20日實際發生了什麼變化

到目前為止,使用騰訊 HY-MT2 1.8B 只有兩種方式:自行將 Apache-2.0 權重載入 transformers、vLLM、SGLang 或 llama.cpp,或是使用騰訊的消費級翻譯產品。託管式 API 則提供了第三條路徑——你透過 HTTP 傳送文字,由騰訊雲提供 1.8B 端點服務。該模型維持 8,192 token 的上下文長度與 4,096 token 的最大輸出,僅處理純文字,定價約為每百萬輸入 token 0.044 美元、每百萬輸出 token 0.177 美元。對於翻譯量波動劇烈的團隊而言,這移除了嘗試該模型時「必須自行營運 GPU」的最低門檻。

A screenshot of the Tencent Cloud techpedia page for Hy-MT2: High-Performance Multilingual Translation Model (captured Aug 20, 2026), showing the English page header with the Tencent Cloud nav, the title 'Hy-MT2: High-Performance Multilingual Translation Model for Real Use', and the table of contents starting with the model name.

故事的另一半在於應用程式。HyTranslate 小程式於五月與開源發布一同推出,具備語音輸入、風格預設與離線模式。iOS 與 Android 應用程式——會下載裝置端模型以進行免網路翻譯——其後也已發布。1.8B 模型正是這套離線方案的關鍵主力:藉由 AngelSlim 的 1.25 位元極致量化,模型縮減至約 440MB 儲存空間,可在 Apple、Qualcomm 與 MediaTek 手機晶片上本機執行,騰訊並回報在 Apple A15 上的推論速度比前一代 4 位元版本快 1.5 倍。

1.8B是什麼?

HY-MT2-1.8B 是一個基於 hunyuan_v1_dense 架構的密集、僅解碼器(decoder-only)因果語言模型——儘管名稱是 1.8B,實際上約有 20 億個參數——配有聊天模板,且沒有預設系統提示詞。它能翻譯 33 種語言,加上五個少數民族語言和方言對,包括中文、英文、日文、韓文、法文、西班牙文、俄文、阿拉伯文、泰文、越南文、印尼文、印地文、孟加拉文、坦米爾文,以及藏語、維吾爾語、哈薩克語、蒙古語和粵語方言對。與傳統的編碼器-解碼器翻譯模型不同,它經過指令微調:你可以用目標語言和可選指令提示它,它能保留 JSON 和 HTML 結構、遵循詞彙表、符合語域,並利用上下文來消除歧義。這種能力類別是姊妹模型 7B 和 30B-A3B 所共有的,也是騰訊發布 IFMTBench 基準測試與之配套評分的對象。

基準測試的現況

品質宣稱值得仔細閱讀,因為截至目前為止,這些宣稱幾乎全部來自騰訊本身,尚未有獨立實驗室重現驗證。騰訊的數據顯示,HY-MT2-1.8B 達到 Gemini 3.1 Pro 平均 FLORES-200 分數的 89.9%(7B 為 97.9%、30B-A3B 為 98.6%);在其實測的 GEMBA 風格測試集上達到 Gemini 的 96.7%;在涵蓋八個專業領域的 DomainMTBench 上達到 96.2%。部分媒體報導將 FLORES-200 的數字下修至 88.1%,而廠商 README 記載的是 89.9%。騰訊也宣稱,1.8B 的整體表現勝過來自 Microsoft、Doubao 等廠商的主流商用翻譯 API。目前尚未有獨立重現的結果,因此上述數據都應視為廠商自行回報的方向性證據,而非經審計的事實。不受廠商主觀因素影響的部分包括:33+5 的語言組合已固定、Apache-2.0 授權為真,以及一個 440MB、可在手機上執行的量化 checkpoint 可由外界獨立觀察得到。

A single-column spec scoreboard for Tencent HY-MT2 1.8B reading: Params: ~2B dense decoder-only; Languages: 33 + 5 dialect pairs; Released: May 21, 2026 · Apache-2.0; FLORES-200: 89.9% of Gemini 3.1 Pro; On-device: 440MB at 1.25-bit; API: ~$0.044 / $0.177 per 1M tokens; footer 'Benchmark figures vendor-reported; no independent scores yet.'

你會如何使用它,以及需要多少費用

自行架設 — Apache-2.0 權重可從 Hugging Face 或 ModelScope 取得;可使用 transformers(>=5.6.0)、vLLM、SGLang 或 llama.cpp GGUF 建置來執行。成本就是你的 GPU 帳單;1.25-bit 建置可在 CPU 等級的裝置上執行。

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured Aug 20, 2026) showing the model header, the Tencent attribution, the Translation / Transformers / Safetensors tags, a 36-languages tag, the hunyuan_v1_dense architecture label, the arxiv 2605.22064 link, the apache-2.0 license, and the 2B-params model size.

• 託管 API — Tencent Cloud 截至本文撰寫時以約每百萬輸入 token 美金 $0.044、每百萬輸出 token 美金 $0.177 提供 1.8B 模型;該供應商自己的 API 與數個第三方平台均有提供此模型。

• 消費端 — HyTranslate 小程序及 iOS/Android 應用程式,包括透過下載的裝置端模型進行的離線翻譯。

1.8B 建議的取樣設定:溫度 0.7、top-p 0.6、top-k 20、重複懲罰 1.05、最大 token 數 4096。

如果你正在建置翻譯管線而非推出消費端應用程式,這類模型有趣的地方在於其價格是一個變動目標——騰訊在六月就已經調降了 Hy-MT2-Pro 的 API 費率。這正是 0% 加價路由器存在的理由:因為轉嫁價格就是供應商列表價,供應商降價會在同一天的帳單上反映出來,而不是等到你的閘道重新定價之後。截至撰寫本文時,該模型並不在 OrcaRouter 的服務清單上,因此你要嘛自架權重,要嘛直接呼叫騰訊雲的 API;故障轉移和單一金鑰的論點適用於你在其周围建構的更廣泛翻譯技術棧,在其中混合使用小型裝置端模型處理廉價的大量流量,加上較大型模型處理困難的語言配對,正是路由(routing)被設計來表達的那種組合方式。

重點

騰訊HY-MT2 1.8B在五月的時候,作為一款手機級別的Apache-2.0翻譯器,就已頗受關注;8月20日的託管API清單,更使它成為那些想在無需自行搭建基礎設施的情況下進行評估的團隊的候選方案。其品質數據為廠商自行報告,語言組合也刻意走主流路線而非追求極致,真正的特色在於其裝置端佔用空間。如果你的語言對落在其33種語言之內,現在要驗證這些宣稱是否適用於你的內容,成本比以往任何時候都更低。