
Tencent Hy-MT2-7B 對決 Tencent Hy-MT2-30B-A3B:同價位下的密集模型甜蜜點,還是 MoE 旗艦?
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百萬 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75程式
- obsidian新Qwen3.8 27B2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- metaMeta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
這場對決的核心驚喜在於:騰訊Hy-MT2-7B,一款密集的7B模型,以及騰訊Hy-MT2-30B-A3B,這款混合專家旗艦模型,總參數量達300億,活躍參數約30億,兩者都在本週透過託管API開放呼叫——7B版約在2026年8月19日上線,30B-A3B版晚一天,兩者均由騰訊雲提供服務——而且價格完全相同:每百萬輸入tokens 0.074美元,每百萬輸出tokens 0.295美元。這個系列於2026年5月21日一同開源,因此兩款模型都不算新;真正讓這次比較顯得奇特的是相同的API價格。通常較大的模型收費較高,你得衡量溢價與效益。在這裡,旗艦版每tokens沒有額外成本,決策於是濃縮成單一問題:這款7B模型因為採用密集且規模較小,究竟放棄了什麼(如果有的話)?
同價驚喜
{{1}}30B-A3B 的價格持平,正是 MoE 性價比優勢發揮作用的表現。{{/1}} {{2}}其架構儲存了 300 億參數的知識,但每個 token 只啟動約 30 億參數,{{/2}} {{3}}因此騰訊雲能以與 7B 相同的每 token 費率來提供服務{{/3}} — {{4}}相同的 $0.074 / $0.295 價格、相同的 8,192 token 上下文、相同的結構化輸出支援,以及同樣不支援函式呼叫的限制。{{/4}} {{5}}在 API 端,「professional」模型並不會更貴。{{/5}} {{6}}代價則轉移到別處:記憶體佔用、服務複雜度與延遲,{{/6}} {{7}}在這些方面,7B 更密集、更簡單的設計擁有結構性優勢,這是每 token 價格無法體現的。{{/7}}
規格,並排比較
• 架構 — 密集式 ~7B 對比 MoE 總計 30B / 活躍 ~3B。
• API 價格 — $0.074 / $0.295 對比 $0.074 / $0.295 每 1M tokens(相同)。
• 上下文 — 兩者均為 8,192 個 token。
• 定位 — 均衡的甜蜜點 vs 專業級旗艦。
• FLORES-200 — 7B:86.89 XCOMET-XXL,約為 Gemini 3.1 Pro (Think) 的 97.9%;30B-A3B:該系列最佳的一般翻譯分數(數據由廠商提供)。
• DeepSeek / Kimi 比較 — 兩者在快速思考模式下均勝過 DeepSeek-V4-Pro 與 Kimi K2.6,據廠商報告。
• 資源佔用 — 單張 A100 / RTX 4090,而非 30B 規模的權重(磁碟上約 18GB 級別的量化建置,VRAM 中佔用更多)。
• 推論預設值 — temp 0.7、top_p 0.6、top_k 20 對比 temp 0.7、top_p 1.0、top_k -1。

30B-A3B 實際勝出的地方
騰訊將 30B-A3B 定位為該系列的專業級成員,而其公布的數據也支持這個定位——但僅針對特定類型的文本。在專業領域密集的素材上——法律條款、醫學文本、技術文件——它在 DomainMTBench 上的 GEMBA 成績是系列中最強的,據報導約為 Gemini 2.5 Pro 基準的 99%,而其在自家 FLORES 曲線上的通用翻譯分數也優於 7B 版本。那休眠的 27B 額外知識容量,正是句子承載密集術語而非一般散文時會展現出來的能力:合約中的「indemnification shall survive termination」(賠償義務於終止後仍持續有效)對 7B 模型而言不算什麼負擔,但一份附有術語表的完整併購文件就完全是另一回事了。此外,30B-A3B 也是中文到少數民族語言(藏語、維吾爾語、蒙古語)配對中最穩妥的選擇,騰訊在這些語言對上公布了最佳成績。
無論如何,7B 勝出的地方
7B 的優勢在於營運層面,而且這些優勢是真實的。首先,自行託管:7B 可裝載於單張 A100 或 RTX 4090 上,框架涵蓋範圍最廣——Transformers、vLLM、SGLang,以及透過 GGUF 使用的 llama.cpp 都已實際運行過。30B-A3B 即使經過量化,仍需要資料中心等級的 VRAM,而且較少人曾將其投入生產環境的服務堆疊中測試。其次,延遲與服務簡易性:稠密的 7B 更容易保持熱機狀態,其建議的取樣方式也更接近標準解碼。第三,在 API 上,相同的價格意味著 7B 每個 token 的成本與旗艦版完全相同——所以選擇較小模型的唯一理由,就是對於乾淨的一般文字而言,品質差距太細微,難以察覺。7B 在 FLORES-200 上已經大約達到 Gemini 3.1 Pro (Think) 的 97.9%;旗艦版的額外分數位於一條曲線的頂端,而在這條曲線上,每一分的提升在實際中都更難看出差異。
誠實衡量的差距
最後兩節的所有內容都是騰訊自家的評估,誠實的解讀方式是:這兩款模型在一般翻譯上表現已足夠接近,最終由你的語料庫來決定勝負。在一般乾淨文本上,7B 模型約達 Gemini 的 97.9%,意味著旗艦版的領先幅度僅以微小的 XCOMET 分數差距來衡量——在排行榜上確有其事,但在客服案件裡卻難以察覺。在密集的專業領域文本與少數語言組合上,旗艦版公布的 GEMBA 與 FLORES 領先優勢,正是專業譯者(無論人類或模型)展現價值的所在,也是重譯成本最昂貴之處。截至撰寫本文時,兩款模型皆無獨立的第三方基準評測;兩家廠商規格表唯一共同的說法是:每個尺寸在自家快速思考模式下皆勝過 DeepSeek-V4-Pro 與 Kimi K2.6。

引導家庭
截至撰寫本文時,這兩個模型皆未列入 OrcaRouter 的目錄,因此兩者均透過騰訊自家雲端及數個第三方平台提供服務。路由的啟示仍然具有實際意義。由於 API 價格相同,這是工作負載路由而非單純擇一的教科書級案例:將高流量的通用翻譯部分送往 7B,將密集且高度專業領域的部分送往 30B-A3B,並配備自動故障轉移,使 MoE 端點的延遲飆升永遠不會讓管線停滯。這就是 OrcaRouter 的路由 DSL 在我們所收錄的 200 多個模型之間組合出的模式——成本加權派發、供應商目錄價格以 0% 加價直接轉嫁——而它對這一系列模型的契合度更勝於其他大多數模型,因為供應商已為兩個等級定價,使分流在經濟上保持中立。
裁決
在 API 價格相同的情況下,預設答案就是 7B:每個 token 的成本相同、自行託管更簡單,而且在一般文本上幾乎不分軒輊。當語料屬於專業密集的內容——法律、醫療、技術或少數民族語言翻譯——才選用 30B-A3B;在這些情境下,旗艦版所宣稱的領域優勢,值得你付出更大的資源佔用與延遲代價。如果你的工作負載兩者混合,請不要二選一:把一般部分分流至 7B,把困難部分分流至旗艦版。這不是兩者之間的折衷;而是在騰訊所定的價格下,同時擁有兩者的唯一方法。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
