
腾讯HY-MT2 1.8B获得托管API:腾讯440MB翻译器上云
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 426 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 183 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
腾讯HY-MT2 1.8B,Hy-MT2翻译家族中紧凑的成员,由腾讯混元于2026年5月21日开源,现在可以通过托管的商业API调用,而不仅限于自托管——该模型的API上架于2026年8月20日,价格约为每百万输入token 0.044美元、每百万输出token 0.177美元。这个上架日期比通常情况下更重要,因为1.8B从来不只是又一个开放检查点:它是腾讯为证明一个440MB量化翻译模型可以完全在手机上运行而打造的模型,而且在开源发布后的三个月里,它也已经内置在腾讯自家的HyTranslate小程序以及随后推出的iOS和Android应用中。本文讨论的是托管API发布带来了哪些变化、这个模型到底是什么,以及哪些数字值得你相信。
8月20日到底发生了什么变化
到目前为止,使用腾讯 HY-MT2 1.8B 意味着两种方式之一:自己将 Apache-2.0 权重加载到 transformers、vLLM、SGLang 或 llama.cpp 中,或者使用腾讯的消费级翻译产品。托管 API 是第三条路径——你通过 HTTP 发送文本,腾讯云提供 1.8B 端点服务。该模型保留 8,192 token 的上下文长度和 4,096 token 的最大输出,仅处理文本,定价约为每百万输入 token 0.044 美元,每百万输出 token 0.177 美元。对于翻译量波动大的团队来说,这消除了尝试该模型时“必须运维 GPU”的门槛。

故事的另一半在于应用。HyTranslate 小程序与五月的开源发布同步上线,具备语音输入、风格预设和离线模式。iOS 和 Android 应用也已相继推出,它们会下载设备端模型以支持无网络翻译。1.8B 模型是离线方案的主力:通过 AngelSlim 的 1.25 位极致量化,其体积缩减至约 440MB 存储空间,可在 Apple、Qualcomm 和 MediaTek 手机芯片上本地运行。据腾讯报告,在 Apple A15 上,其推理速度比上一代 4 位量化版本快 1.5 倍。
这个1.8B是什么
HY-MT2-1.8B 是一个基于 hunyuan_v1_dense 架构的稠密、仅解码器的因果语言模型——尽管名为 1.8B,实际约有 20 亿参数——带有聊天模板,且无默认系统提示。它支持在 33 种语言以及五个少数民族语言和方言对之间进行翻译,包括中文、英语、日语、韩语、法语、西班牙语、俄语、阿拉伯语、泰语、越南语、印尼语、印地语、孟加拉语、泰米尔语,以及藏语、维吾尔语、哈萨克语、蒙古语和粤语方言对。与经典的编码器-解码器翻译模型不同,它经过了指令微调:你可以用目标语言和可选指令来提示它,它能够保留 JSON 和 HTML 结构、遵循术语表、匹配语域,并利用上下文来消除歧义。这一能力类别是兄弟模型 7B 和 30B-A3B 所共有的,腾讯发布 IFMTBench 基准测试也是为了对此进行评分。
基准测试的现状
这些质量声明值得仔细阅读,因为截至本文撰写时,几乎所有声明都是腾讯自己提出的,尚未有独立实验室复现。腾讯报告称,HY-MT2-1.8B 在 FLORES-200 平均得分上达到 {{1}}Gemini 3.1 Pro{{/1}} 的 89.9%(7B 达到 97.9%,30B-A3B 达到 98.6%),在其真实场景 GEMBA 风格测试集上达到 {{2}}Gemini{{/2}} 的 96.7%,在覆盖八个专业领域的 DomainMTBench 上达到 96.2%。一些媒体报道将 FLORES-200 的得分四舍五入后记为 88.1%;而厂商 README 中列为 89.9%。腾讯还声称,1.8B 版本在整体上超越了微软、豆包等厂商的主流商业翻译 API。目前尚不存在独立的复现结果,因此应将上述数据视为厂商报告的方向性证据,而非经审计的事实。不依赖于厂商的部分包括:33+5 语言对是固定的,Apache-2.0 许可证是真实的,以及一个可在手机上运行的 440MB 量化检查点是可以独立验证的。

如何使用它,以及它的费用
• 自托管 — 来自 Hugging Face 或 ModelScope 的 Apache-2.0 权重;可通过 transformers(>=5.6.0)、vLLM、SGLang 或 llama.cpp GGUF 构建运行。成本就是你的 GPU 账单;1.25 位版本可在 CPU 级设备上运行。

• 托管 API — 截至撰写本文时,Tencent Cloud 以每百万输入 token 约 $0.044、每百万输出 token 约 $0.177 的价格提供 1.8B 模型;该厂商自己的 API 和多个第三方平台均提供该模型。
• 消费者 — HyTranslate 小程序及 iOS/Android 应用,包括通过下载的端侧模型进行离线翻译。
1.8B 模型的推荐采样参数:temperature 0.7,top-p 0.6,top-k 20,重复惩罚 1.05,最大 token 数为 4096。
如果你是在构建翻译流水线,而不是发布面向消费者的应用,那么这类模型的有趣之处在于,它的价格是动态变化的——腾讯在六月已经下调了 Hy-MT2-Pro 的 API 费率。这正是 0% 加价路由器存在的场景:因为透传价格采用供应商列表价,供应商降价会体现在当天的账单上,而不是等你的网关重新定价之后。截至撰写本文时,该模型尚不在 OrcaRouter 的名单中,因此你需要自行托管权重,或直接调用腾讯云的 API;故障转移和单一密钥方案适用于你围绕它构建的更广泛翻译栈,在这种架构中,将小型设备端模型用于廉价批量流量,而将较大模型用于困难语种组合,正是路由所擅长表达的那种组合方式。
底线
腾讯 HY-MT2 1.8B 在五月份就已经作为手机大小的 Apache-2.0 翻译器引起了关注;8月20日的托管 API 上架使其成为那些希望在不搭建基础设施的情况下评估该模型的团队的一个候选方案。质量数据为供应商自行报告,语言集刻意走主流路线而非追求最大覆盖,设备端占用才是其真正独特之处。如果你的语言对在其覆盖的 33 种语言之内,那么现在验证这些说法是否适用于你的内容,成本比以往任何时候都更低。
