
腾讯 Hy-MT2-7B 现已提供托管 API:0.295 美元/百万输出的翻译器将带来怎样的改变
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
Tencent Hy-MT2-7B 是 Tencent Hunyuan 于 2026 年 5 月 21 日发布的开源翻译模型,本周已可通过托管 API 调用:大约在 2026 年 8 月 19 日,这款稠密 7B 模型在 Tencent Cloud 的托管端点上正式上线,定价为每百万输入 token $0.074、每百万输出 token $0.295,上下文窗口为 8,192 个 token。它并非独自上线——Tencent Hy-MT2-1.8B 和 Tencent Hy-MT2-30B-A3B 也在一天之内登上了同一个后端。模型权重已经在 Hugging Face 和 ModelScope 上发布三个月了;新的变化在于,团队现在无需租用 GPU、从源码构建 llama.cpp,也无需交付 1.25-bit 端侧工具链,就能直接调用该模型。对于翻译工作负载来说,这正是实验与产品决策之间的区别。
刚刚发布的内容
该商用端点为腾讯云自有,经由厂商 API 及多个第三方平台暴露。三种尺寸均在 8K 上下文中运行,补全长度为 4,096 个 token;三者均支持通过 response_format 字段中的 JSON schema 进行结构化输出,且均未实现函数调用。实际规格按每个维度一行列出:
• Tencent Hy-MT2-7B — 每100万token输入$0.074 / 输出$0.295,上下文8,192,密集~7B,支持结构化输出,不支持工具调用。
• Tencent Hy-MT2-1.8B — 每100万token输入$0.044 / 输出$0.177,8,192上下文,稠密1.8B,不支持工具调用。
• Tencent Hy-MT2-30B-A3B — 每百万 token 输入 $0.074 / 输出 $0.295,8,192 上下文长度,MoE 总计 30B / 激活 3B,支持结构化输出,不支持工具调用。
標誌性的價格點在於7B模型的輸出速率:每千個輸出token不到0.3美分,而騰訊聲稱這款模型足以媲美規模大一個數量級的模型。翻譯是少數幾個LLM工作負載中,輸出token幾乎佔據全部費用的場景,因此輸出價格才是決定一條管道在大規模下是否可行的關鍵數字。

端点背后的模型
Hy-MT2 是腾讯的“快速思考”系列:它不会在每句话上都花费冗长的思维链,而是被设计成以专业译者的方式做出反应——在原文含糊之处仔细斟酌,在清晰之处快速处理。7B 是该系列中定位均衡的中端型号,一个采用 Apache-2.0 许可的稠密模型,覆盖 33 种语言以及五组中国少数民族语言和方言对(其中包括藏语、哈萨克语、蒙古语、维吾尔语和粤语)。它与做翻译的通用大语言模型的不同之处在于指令遵循能力:它能在一整份文档中保持术语表术语的一致性、应用指定风格、保持分隔符和 JSON 键不变,并能接受用自然语言表述的个人化指令。腾讯在发布权重的同时还推出了 IFMTBench——一个专门评估这一能力的开放基准。面向消费者的产品——腾讯 Hy Translate 小程序(iOS 和 Android 应用也即将推出)——正是构建在这一系列之上。

带星号的数字
以下内容全部来自腾讯自己的评估,发布在模型卡及随附报告中;截至撰写本文时,这些结果尚未被独立复现。在 FLORES-200 的 XX⇔XX 通用翻译赛道中,7B 模型获得 86.89 XCOMET-XXL,腾讯认为这大约相当于 Gemini 3.1 Pro (Think) 的 97.9%。在其“快速思考”模式下,据称能超越包括 DeepSeek-V4-Pro、Kimi K2.6、Qwen3.5-397B-A17B 和 Gemma4-26B-A4B 在内的开源通用模型。在 WMT25 上,其得分较上一代全面提升——63.86/71.21/82.24,对比 Hy-MT1.5-7B 的 61.59/68.85/75.91,其中 GEMBA 提升最大——在 DomainMTBench(金融、政治、教育)上则取得 94.92 XCOMET / 92.79 GEMBA。其指令遵循能力是它与一年前的翻译语言模型最明显的分野:IFMTBench 上简单指令 89.73 / 复杂指令 72.67 / 总计 83.14。
托管 API 如何改变翻译流水线
就这类事情而言,自托管 7B 确实很容易——它可以在单个 A100 或 RTX 4090 上运行,而且也存在量化的 FP8 和 GGUF 构建。但“易于自托管”并不等于“零运维”。GGUF 路径目前依赖带有腾讯 STQ 内核的 llama.cpp,FP8 路径需要正确的技术栈,并且还得有人盯着。托管端点则把这一切都消除了:无需 GPU、无需构建内核、无需容量规划,而且每 token 的价格固定不变,无论利用率如何。对于一个每天处理数百万条翻译句子的团队来说,这种可预测性比头条基准更重要——也正是为什么这一周比五月发布更重要。

还没有人提出的路由问题
由于该模型在API端仅上线三天,现实的采用方式与采用任何全新提供商的方式相同:将其置于带有自动故障转移的路由规则后面,这样未经验证的端点绝不会拖垮生产路径,并让流量来决定它是否赢得一个永久席位。这正是OrcaRouter的路由DSL在我们所支持的200多个模型之间构建的模式——这里有必要说明清楚:截至本文撰写时,Tencent Hy-MT2-7B并不在OrcaRouter的目录中,因此这并不是一个“通过我们来调用”的故事。真正贴合主题的是定价模式。OrcaRouter按各提供商的标价原样传递,加价率为0%,因此当供应商降价时,降价当天就会在平台上生效。对于高流量的翻译工作负载,向任何端点该问的问题不是“今天门户价格是多少”,而是“提供商实际按token收取的标价是多少,以及在我和它之间是否存在中间环节。”以每百万输出token $0.295的价格,Tencent Hy-MT2-7B刚刚让这个问题变得有趣。
接下来看什么
本周有三件事值得关注。第一,1.8B和30B-A3B这对姊妹模型现在同样可通过API调用,因此“该选哪个尺寸”成为一个真正的API问题,而非自托管决策(该系列有自己的对比页面,简而言之:1.8B面向端侧设备与最廉价档位,30B-A3B面向专业级领域,7B介于两者之间)。第二,腾讯的WMT26合作向在通用机器翻译和视频字幕翻译任务中使用Hy-MT模型的团队提供奖励——这表明腾讯有意让该系列成为竞争性机器翻译领域的开源翻译默认选择。第三,支持端侧推理的iOS和Android应用如果按公告发布,将使1.8B成为全球安装量最大的开源翻译模型。托管API是本周发生变化的部分;该系列的发展轨迹早在五月就已确定。
