
腾讯 Hy-MT2-7B 对比 Hy-MT2-30B-A3B:同价位下的稠密甜点还是 MoE 旗舰?
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grok新SpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77代码
这场对决的核心惊喜在于:腾讯 Hy-MT2-7B(一个稠密的 7B 模型)和腾讯 Hy-MT2-30B-A3B(混合专家旗舰模型,总参数 300 亿,活跃参数约 30 亿)本周均通过托管 API 开放调用——7B 大约在 2026 年 8 月 19 日,30B-A3B 晚一天,两者都由腾讯云提供服务——而且价格完全相同:每百万输入 token 0.074 美元,每百万输出 token 0.295 美元。该系列模型于 2026 年 5 月 21 日一起开源,因此两个模型都不算新;真正让这次对比显得蹊跷的是完全相同的 API 价格。通常,更大的模型会更贵,你需要权衡溢价与收益。而在这里,旗舰模型每 token 没有任何额外费用,决策就归结为一个问题:7B 作为稠密小模型,究竟会损失什么(如果有的话)?
同价惊喜
30B-A3B的价格平价体现了MoE模式的价值:其架构存储了30B的知识,但每个token仅激活约3B参数,因此腾讯云可以按与7B相同的每token费率提供服务——相同的$0.074/$0.295定价,相同的8,192 token上下文,相同的结构化输出支持,同样不支持函数调用。在API上,"专业"模型并不更贵。代价转移到了别处——内存占用、服务复杂性和延迟。在这些方面,7B更密集、更简单的设计具有结构性优势,这是按token计价无法体现的。
规格,并排对比
• 架构 — 稠密约7B vs MoE总计30B/约3B激活。
• API 价格 — 每 1M tokens 的价格:$0.074 / $0.295 对比 $0.074 / $0.295(相同)。
• 上下文——两者均为 8,192 个标记。
• 定位——均衡甜点 vs 专业级旗舰。
• FLORES-200——7B:86.89 XCOMET-XXL,约为 Gemini 3.1 Pro (Think) 的 97.9%;30B-A3B:该系列最佳通用翻译得分(数据由厂商报告)。
• DeepSeek / Kimi 对比 — 两者在快速思考模式下均击败 DeepSeek-V4-Pro 和 Kimi K2.6,据厂商报告。
• 资源占用——单块 A100 / RTX 4090 对比 30B 级权重(磁盘上为 18GB 级量化版本,显存占用更高)。
• 推理默认设置——temp 0.7、top_p 0.6、top_k 20 对比 temp 0.7、top_p 1.0、top_k -1。

30B-A3B 真正胜出的地方
Tencent将30B-A3B定位为该系列中的专业级成员,其发布的证据也印证了这一标签适用于特定类型的文本。在领域密集型材料上——法律条款、医学文本、技术文档——它在DomainMTBench上的GEMBA成绩为系列中最强,据报约为Gemini 2.5 Pro基线的99%,通用翻译得分在系列自身的FLORES曲线上也超过7B。那沉睡的额外27B知识,正是当句子承载密集术语而非普通文本时才会展现的能力:合同中“赔偿条款在终止后继续有效”这样的表述对7B模型来说并不费力,但一份带术语表的完整并购文件则会。对于中文到少数民族语言(藏语、维吾尔语、蒙古语)的翻译对,30B-A3B也是最稳妥的选择,Tencent在这些方向上报告了最佳成绩。
7B 依然能胜出的地方
7B 的优势在于实际部署层面,而且这些优势是真实存在的。首先,自托管:7B 可以运行在单张 A100 或 RTX 4090 上,并且拥有最广泛的框架支持——Transformers、vLLM、SGLang 以及通过 GGUF 使用的 llama.cpp 都经过了充分验证。而 30B-A3B 即使经过量化,也需要数据中心级别的显存,并且很少有人将其投入生产级服务栈中进行验证。其次,延迟和服务简洁性:稠密架构的 7B 更容易保持热状态,其推荐的采样参数也更接近标准解码流程。第三,在 API 方面,相同的定价意味着 7B 每个 token 的成本与旗舰模型完全相同——因此选择更小模型的唯一理由是,对于干净的通用文本,质量差距过于细微而难以察觉。在 FLORES-200 基准上,7B 已经达到 Gemini 3.1 Pro (Think) 约 97.9% 的水平;旗舰模型多出的分数位于一条曲线的顶端,而曲线上的每一分在实际使用中都更难被感知。
差距,如实衡量
最后两节中的所有内容都是腾讯自己的评估,坦诚地说,这意味着在普通翻译任务上,两个模型已经足够接近,最终起决定作用的是你的语料库。在一般干净文本上,7B版本约为Gemini 97.9%的得分表明,旗舰版的优势仅以微小的XCOMET分数差来衡量——这种差距在排行榜上真实存在,但在客服工单中却难以感知。在密集领域文本和小语种语言对上,旗舰版所报告的GEMBA和FLORES领先优势,恰恰是专业翻译(无论是人类译员还是模型)真正体现价值的地方,也是重译成本最高的地方。截至撰写本文时,这两个模型均无独立的基准测试结果;两家厂商的模型卡唯一一致的观点是:在该系列的快速思考模式下,每个尺寸都优于DeepSeek-V4-Pro和Kimi K2.6。

引导家庭
截至目前,这两个模型都不在OrcaRouter的目录中,因此两者均通过Tencent自有云和若干第三方平台提供服务。路由层面的经验教训依然具有实际意义。由于API价格完全相同,这是一个工作负载路由的教科书式案例,而非单一选择:将高容量的通用翻译负载交给7B,将信息密集、领域性强的负载交给30B-A3B,并配置自动故障转移,使MoE端点的延迟尖峰永远不会阻塞流水线。这正是OrcaRouter的路由DSL在我们实际收录的200多个模型中所编排的模式——成本加权调度、提供商标价以0%加价直通——而且它对这个系列的适配度高于大多数其他场景,因为供应商对这两个档次的定价使得拆分在经济上保持中性。
裁决
在相同API价格下,默认答案是7B:每token成本相同,自托管更简单,且在通用文本上几乎不分伯仲。当语料库专业密集度较高时——法律、医疗、技术或小语种翻译——选择30B-A3B,此时旗舰版所报告的领域优势值得更大的部署规模和更高的延迟。如果你的工作负载是两者的混合,不要二选一:将通用部分路由到7B,将困难部分路由到旗舰版。这不是两者之间的妥协;这是在腾讯设定的价格下同时获得两者的唯一方式。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
