
騰訊 Hy-MT2-7B 現已提供託管 API:每個百萬輸出 tokens 0.295 美元的翻譯器帶來什麼改變
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
{{1}}騰訊Hy-MT2-7B,這款騰訊混元於2026年5月21日發布的開源翻譯模型,本週起可透過託管API呼叫{{/1}}:{{2}}約在2026年8月19日,這款稠密7B模型在騰訊雲的託管端點上線,輸入每百萬token收費0.074美元,輸出每百萬token收費0.295美元,配備8,192 token的上下文視窗{{/2}}。它並非單獨到來——{{3}}騰訊Hy-MT2-1.8B與騰訊Hy-MT2-30B-A3B也在一天內於同一後端上線{{/3}}。{{4}}模型權重已在Hugging Face和ModelScope上發布三個月{{/4}};{{5}}真正的新進展在於,團隊如今無需租用GPU、不必從原始碼建置llama.cpp、也不用部署1.25位元裝置端工具鏈,即可呼叫該模型{{/5}}。{{6}}對翻譯工作負載而言,這正是實驗與產品決策之間的差別{{/6}}。
剛發布了什麼
商業端點是騰訊雲自有的,透過廠商API及多個第三方平台對外提供。三種規模各自在8K上下文中運行,完成長度為4,096個token;三者皆可透過其response_format欄位中的JSON schema接受結構化輸出,且均未實作函式呼叫。實際規格,每個維度一行:
• Tencent Hy-MT2-7B — 每 1M tokens 輸入 $0.074 / 輸出 $0.295,8,192 上下文,密集 ~7B,支援結構化輸出,不支援工具呼叫。
• Tencent Hy-MT2-1.8B — 每 1M tokens 輸入 $0.044 / 輸出 $0.177,8,192 上下文,密集式 1.8B,不支援工具呼叫。
• Tencent Hy-MT2-30B-A3B — 每 1M tokens 輸入 $0.074 / 輸出 $0.295,上下文長度 8,192,MoE 30B 總參數 / 3B 活躍參數,支援結構化輸出,不支援工具呼叫。
頭條價格亮點在於7B模型的輸出費率:每千個輸出token不到0.3美分,而騰訊聲稱該模型能與大上一個數量級的模型一較高下。翻譯是少數幾種LLM工作負載中,輸出token幾乎佔據全部費用的類型,因此輸出價格是決定一條管線能否在大規模運行下具備可行性的關鍵數字。

端點背後的模型
Hy-MT2 是騰訊的「快速思考」系列:它不會對每個句子都鋪陳漫長的思考鏈,而是以專業譯者的方式應對——原文有歧義時審慎斟酌,沒有歧義時迅速反應。7B 是該系列中定位均衡的中間型號,這款稠密模型以 Apache-2.0 授權釋出,涵蓋 33 種語言,外加五組中國少數民族語言與方言對(包括藏語、哈薩克語、蒙古語、維吾爾語和粵語)。它與一般用於翻譯的通用 LLM 不同之處在於遵循指令的能力:無論是讓詞彙表術語在整份文件中保持一致、套用指定風格、保留分隔符號與 JSON 鍵值不動,或是接受以日常語言提出的個人化指令,都能確實執行。騰訊在發布模型權重的同時,也推出了 IFMTBench——一個專門考評這項能力的開放基準;而面向消費者的產品——騰訊 Hy Translate 小程式,以及正在開發中的 iOS 與 Android 應用程式——正是建立在這個系列之上。

帶有星號的數字
以下均為騰訊自己的評測,發布於模型卡及隨附報告中;截至撰寫本文時,這些結果尚未被獨立重現。在 FLORES-200 的 XX⇔XX 通用翻譯賽道上,7B 模型取得 86.89 XCOMET-XXL 分數,騰訊表示這約為 Gemini 3.1 Pro (Think) 的 97.9%。據稱在其「快速思考」模式下,表現勝過多個開源通用模型,包括 DeepSeek-V4-Pro、Kimi K2.6、Qwen3.5-397B-A17B 與 Gemma4-26B-A4B。在 WMT25 上,其各項分數相較上一代全面提升——63.86/71.21/82.24,對比 Hy-MT1.5-7B 的 61.59/68.85/75.91,其中在 GEMBA 上進步幅度最大;而在 DomainMTBench(金融、政治、教育)上,則取得 94.92 XCOMET / 92.79 GEMBA。在指令遵循方面,它與一年前的翻譯語言模型拉開最明顯的差距:IFMTBench 上簡易 89.73 / 複雜 72.67 / 總分 83.14。
託管式 API 為翻譯管線帶來了什麼改變
自行託管 7B 模型以這類事情而言確實很簡單——它可以在一張 A100 或 RTX 4090 上運行,而且已有量化的 FP8 與 GGUF 建置。但「易於自行託管」並不等於「零維運」。GGUF 路線目前依賴帶有騰訊 STQ 核心的 llama.cpp,FP8 路線則需要正確的技術棧,而且總得有人盯著。託管端點把所有這些都移出考量:不需要 GPU、不需要編譯核心、不需要容量規劃,而且每個 token 的價格固定,無論使用率高低。對於每天處理數百萬句翻譯的團隊來說,這種可預測性比頭條基準數字更重要——也正是本週比五月發布更重要的原因。

還沒有人提出的路由問題
由於這個模型在 API 端才上線三天,實際的採用方式與任何全新供應商相同:將它放在帶有自動故障轉移的路由規則後面,這樣未經測試的端點永遠不會拖垮生產路徑,並讓流量來決定它是否值得一個永久位置。這正是 OrcaRouter 的路由 DSL 在我們所支援的 200 多個模型中組合而成的模式——這裡值得精確說明:截至本文撰寫時,Tencent Hy-MT2-7B 並不在 OrcaRouter 的目錄中,所以這不是一個「透過我們呼叫」的故事。真正相關的是定價模式。OrcaRouter 以 0% 加價轉傳各家供應商的牌價,因此當廠商降價時,當天就會在平台上生效。對於高流量的翻譯工作負載,任何端點該問的問題不是「今天入口網站的價格是多少」,而是「供應商實際收取的每 token 牌價是多少,以及中間是否有任何仲介。」以每 M 輸出 token 0.295 美元的價格,Tencent Hy-MT2-7B 剛好讓這個問題變得有趣起來。
接下來要看什麼
本週有三件事值得關注。首先,1.8B 與 30B-A3B 這兩個姊妹模型現在已同樣可供呼叫,因此「選擇哪個規模」變成一個真正的 API 問題,而非自架模型的決定(該系列有自己的比較頁面,但簡而言之:1.8B 適用於裝置端與最便宜方案,30B-A3B 適用於專業級領域,7B 則介於兩者之間)。其次,騰訊的 WMT26 合作案提供獎項給在「通用機器翻譯」與「影片字幕翻譯」任務中使用 Hy-MT 模型的團隊——這顯示騰訊有意讓這個系列成為競爭性機器翻譯中開放翻譯的預設選擇。第三,具備裝置端推論能力的 iOS 與 Android 應用程式,若如期發布,將使 1.8B 成為全球安裝量最高的開放翻譯模型。本週發生變化的是託管 API;這個系列的發展軌跡早在五月就已確定。
