
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B:同じ価格でのDenseのスイートスポットか、MoEのフラッグシップか
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
この対決の核心にある驚きはこれだ。Dense(高密度)7BモデルであるTencent Hy-MT2-7Bと、総パラメータ数300億・アクティブパラメータ数約30億を備えたMixture-of-ExpertsのフラッグシップであるTencent Hy-MT2-30B-A3Bが、今週どちらもホスト型API経由で呼び出し可能になった——7Bは2026年8月19日頃、30B-A3Bはその1日後で、いずれもTencent Cloudが提供——しかも価格はまったく同じ、入力トークン100万件あたり0.074ドル、出力トークン100万件あたり0.295ドルである。このモデルファミリーは2026年5月21日にまとめてオープンソース化されているため、どちらのモデルも新しいわけではない。API価格が同一であることこそが、この比較を本当に奇妙なものにしているのだ。通常、モデルが大きいほどコストがかかり、そのプレミアムと利得を天秤にかけるものだ。しかし今回は、フラッグシップがトークンあたりの追加コストを一切負わない。したがって、判断は単一の問いに集約される——7Bは、Denseで小型であるがゆえに、何かを(もしあるとすれば)犠牲にしているのか、という問いだ。
同じ価格の驚き
30B-A3Bの価格同等性は、MoEの割安さが機能している証拠だ。そのアーキテクチャは30Bの蓄積知識を保持するが、トークンごとに約3Bしか活性化しないため、Tencent Cloudは7Bと同じトークンあたりの料金でこれを提供できる — {{1}}同じ$0.074 / $0.295、同じ8,192トークンのコンテキスト、同じ構造化出力サポート、同じ関数呼び出し非対応という制約{{/1}}。API上では、{{2}}"professional"{{/2}}モデルはより高額ではない。落とし穴は別の場所に移る。すなわち、{{3}}メモリフットプリント、サービングの複雑さ、レイテンシ{{/3}}だ。そこでは、7Bのより高密度でシンプルな設計が、トークンあたりの価格では表現できない{{4}}構造的優位性{{/4}}を持つ。
Specs, side by side
• アーキテクチャ — dense 約7B vs MoE(総計30B / アクティブ約3B)。
• API価格 — $0.074 / $0.295 対 $0.074 / $0.295(1Mトークンあたり)(同一)。
• コンテキスト — 両方とも8,192トークン。
• ポジショニング — プロフェッショナルグレードのフラッグシップに対する、バランスの取れたスイートスポット。
• FLORES-200 — 7B: 86.89 XCOMET-XXL、Gemini 3.1 Pro (Think) の約97.9%。30B-A3B: ファミリー内で最高の一般翻訳スコア(数値はベンダー報告による)。
• DeepSeek / Kimi 比較 — どちらも高速思考モードでDeepSeek-V4-ProとKimi K2.6を上回る(ベンダー報告による)。
• フットプリント — A100 / RTX 4090 単体 vs 30B規模の重み(ディスク上では18GBクラスの量子化ビルド、VRAMではそれ以上を消費)。
• 推論のデフォルト — temp 0.7, top_p 0.6, top_k 20 対 temp 0.7, top_p 1.0, top_k -1。

30B-A3Bが実際に勝つところ
Tencentは30B-A3Bを同ファミリーのプロフェッショナルグレードの製品として位置づけており、公開されているエビデンスは、特定の種類のテキストについてはその評価を裏付けている。法的条項、医療テキスト、技術文書といった専門性の高い素材では、DomainMTBench上のGEMBAラインがファミリー内で最も強く、Gemini 2.5 Proベースラインの約99%に達すると報告されている。また、汎用翻訳スコアは同ファミリーのFLORESカーブ上で7Bモデルを上回る。この休眠状態にある27B分の追加知識は、まさに一文が通常の散文ではなく高密度の専門用語を伴う場合に発揮される種類の能力である。契約書の「indemnification shall survive termination(補償義務は契約終了後も存続する)」という文言は7Bモデルにとって大きな負担にはならないが、用語集を伴う完全なM&A文書となれば話は別だ。30B-A3Bはまた、Tencentが最高の数値を報告している中国語から少数民族言語(チベット語、ウイグル語、モンゴル語)への翻訳ペアにおいても、最も安全な選択肢である。
それでも7Bが勝つ場面
7Bの利点は実運用上のものであり、本物です。第一に、セルフホスティング:7Bは単一のA100またはRTX 4090に収まり、フレームワーク対応範囲が最も広く — {{1}}Transformers、vLLM、SGLang、GGUF経由のllama.cppがすべて使用されています{{/1}}。30B-A3Bは、量子化してもデータセンター規模のVRAMを必要とし、本番サービングスタックで運用した人ははるかに少ないのが現状です。第二に、レイテンシとサービングの簡便さ:denseな7Bはホットに保ちやすく、推奨サンプリングも標準的なデコードに近いものです。第三に、APIでは価格が同じなので、7Bはフラッグシップとトークンあたりのコストがまったく同じです。つまり、小さいモデルを選ぶ唯一の理由は、クリーンな一般的なテキストでは品質の差が薄すぎて気づかないからです。7BはFLORES-200でGemini 3.1 Pro (Think)の約97.9%にすでに達しています。フラッグシップの追加ポイントは、実践では1つ1つがさらに見えにくくなる曲線の上に積み重なっています。
正直に測定されたギャップ
最後の2つのセクションはすべてTencent自身の評価であり、正直に解釈すれば、通常の翻訳において2つのモデルは十分に互角で、使用するコーパスが結果を左右するということです。一般的なクリーンテキストでは、7BモデルのスコアはGeminiの約97.9%であり、フラッグシップモデルの優位性はわずかなXCOMETの差でしか測れません。これはリーダーボードでは明確な差ですが、サポートチケットでは体感しにくい差です。情報密度の高い専門テキストや少数言語のペアでは、フラッグシップモデルが報告するGEMBAとFLORESでのリードこそが、プロの翻訳者(人間であれモデルであれ)が価値を発揮する領域であり、再翻訳のコストが最も高くなる領域でもあります。本稿執筆時点では、どちらのモデルについても独立したベンチマークは存在しません。両ベンダーのカードが一致している唯一の点は、各サイズが同ファミリーの高速思考モードでDeepSeek-V4-ProとKimi K2.6を上回るということです。

家族のルーティング
本稿執筆時点では、どちらのモデルもOrcaRouterのカタログには載っていないため、両モデルともTencent独自のクラウドと複数のサードパーティ製プラットフォームを通じて提供されている。それでもルーティングの教訓は依然として実用的だ。APIの価格が同一であるため、これは単一モデルの選択ではなくワークロードルーティングの典型的なケースである。すなわち、高ボリュームの汎用翻訳スライスは7Bへ、高密度でドメイン特化型のスライスは30B-A3Bへ送り、MoEエンドポイントのレイテンシー急増がパイプラインを停止させないよう自動フェイルオーバーを備える。これこそが、OrcaRouterが実際に取り扱う200以上のモデルにわたってOrcaRouterのルーティングDSLが構成するパターンである——コスト重視のディスパッチ、プロバイダーの定価を0%マークアップでそのまま適用——そして、ベンダーが2つのティアを、分割が経済的に中立になるよう価格設定しているため、このファミリーには他のほとんどのケースよりもよく適合する。
評決
API価格が同一であれば、デフォルトの答えは7Bです。トークンあたりのコストは同じで、セルフホストが容易であり、一般的なテキストでの性能はほぼ互角です。コーパスが専門的に密度の高い場合、すなわち法律、医療、技術、または少数言語の翻訳といった場合は、30B-A3Bを採用してください。そこでは、フラッグシップの報告されているドメイン上の優位性が、より大きなフットプリントとレイテンシに見合う価値があります。そして、ワークロードが両方の混在であるならば、選択をしないでください。一般的な部分は7Bに、難しい部分はフラッグシップに振り分けてください。それは両者の間の妥協ではありません。Tencentが設定した価格で両方を手に入れる唯一の方法です。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
