
Tencent HY4 プレビュー vs tencent-hy3:価格は6倍、その飛躍が実際に買えるもの
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0259知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0258知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0166知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
Tencent HY4 Previewは、Hunyuanファミリーの中で、意図的に前世代モデルを安く見せる最初のモデルです。Tencentは入力価格をtencent-hy3の6倍、出力価格を4.5倍に設定し、発表資料ではそのプレミアムは正当化されると主張しています。2026年8月28日にリリースされオープンソース化されたTencent HY4 Previewは、DeepSWEでのソフトウェアエンジニアリングスコアがHy3の28.0の2倍以上、Terminal-Bench 2.1でのターミナル駆動スコア85.4を記録し、コンテキストウィンドウも256Kから100万トークン以上に拡大しました。7月6日に正式版となったtencent-hy3は、このファミリーの成熟した実用モデルです。総パラメータは295B、アクティブは21B、コンテキストは4分の1、価格はほぼ誤差同然です。これはスペックシート上で接戦とは言えない争いです。問題は、実際に実行するワークロードにとってその差が価格に見合うかどうかであり、その答えはワークロードによって分かれます。
スコアボード: 両者が実際に分岐する点
テンセントの資料にあるベンチマークはすべてベンダー報告によるものだ。各モデルの発表時にテンセント自身の評価環境で実行され、独立した研究所による再現はされておらず、フラッグシップモデルに関しては公開から1日も経っていない。スコアはテンセントが達成したと考える上限と捉え、単一の数字よりもパターンに重みを置くべきだ。そのパターンは紛れもなく、一般的な知識よりもエージェント的エンジニアリング業務に集中している。
DeepSWE — Tencent HY4 Preview: 64.3。tencent-hy3: 28.0。これはこの組み合わせにおける最大の単一飛躍であり、リポジトリ規模のソフトウェアエンジニアリングベンチマークでの2倍以上の伸びであり、チャットモデルとコードベース全体を渡されるモデルとを分ける数字です。
• Terminal-Bench 2.1 — Tencent HY4 Preview: 85.4。Tencentによると、これはClaude Opus 5に匹敵し、DeepSeek V4 Proを上回るという。tencent-hy3は7月の発表時点で71.7と報告されていた。実際のターミナルを操作して複数ステップのタスクを完了に導くことは、まさにHy3が最も苦手とする長期的な作業だ。
• Toolathlon検証済み — Tencent HY4 プレビュー: 74.1。テンセントによると、これはQwen 3.8 MaxとGPT-5.6 Solを上回るという。同等のHy3スコアは公表されていない。
• 内部ブラインドテスト — 163人の専門家が203件のエンジニアリングタスクを評価し、Tencent HY4 Previewは4.00点満点中2.99点で、GLM-5.3の2.92点とKimi K3の2.94点をわずかに上回りました。これはTencentのレビュアーによるTencentのタスクに対する評価であり、参考程度に捉えてください。

一貫した流れ:改善が見られるのは端末操作、ツール呼び出し、リポジトリ規模のタスクであり——TencentがHy3以来推し続けてきた生産性重視のポジショニングが、今やそれを裏付ける計算リソースを得た形だ。
価格プレミアム、行ごとに
ここから先の比較は、もはや単なる自慢合戦ではありません。テンセントのリスト価格(100万トークンあたり)は以下の通りです:
• 入力 — Tencent HY4 Preview: 6元(約US$0.85)。 tencent-hy3: 1元(約US$0.14)。 6倍。
• 出力 — Tencent HY4 Preview: 18元(約US$2.50)。tencent-hy3: 4元(約US$0.56)。4.5倍。
• キャッシュヒット — Tencent HY4 Preview: 0.3元。tencent-hy3: 0.25元。ほぼ同等だが、これは見た目以上に重要だ。エージェンティックなループは同じシステムプロンプトと会話プレフィックスを絶えず再送信するからだ。
現実的なエージェント型コーディングのワークロードを、このブレンドされた数値で実行してみましょう。たとえば、忙しい単一開発者エージェントの予算として、月間2000万入力トークンと400万出力トークンとします。Tencent HY4 Preview: 120元+72元で約192元(約US$27)。tencent-hy3: 20元+16元で約36元(約US$5)。旗艦モデルは同じトークン構成で実行すると、5倍以上のコストがかかります。さらに、タスクごとにより多くの出力トークンを要求します。なぜなら、より長く考えるからです。
それはTencent HY4 Previewを避ける理由にはなりません。DeepSWEのジャンプは、まさにプレミアムを払う価値がある種類の能力です。それは、ルーティングする前にワークロードの価格を見積もるべき理由です。そして、こここそがルーティング層が存在価値を発揮する場面です。tencent-hy3はすでにOrcaRouter上でプロバイダーの定価(マークアップ0%)で提供されており、表示される価格は提供プロバイダー自身の価格であって、転売されて値上げされたものではありません。また、プロバイダー間の自動フェイルオーバーに対応しており、ベンダーの価格変更は当社側でも同じ日に反映されます。
コンテキスト4倍、アクティブコンピュート2倍
• アーキテクチャ — Tencent HY4 Preview: 合計770B、アクティブ49BのMoE。tencent-hy3: 合計295B、アクティブ21B。フラッグシップは各トークンに約2.3倍の計算量を投入します。
• コンテキストウィンドウ — Tencent HY4 Preview: 100万トークン以上。tencent-hy3: 256K。完全なリポジトリや財務ドキュメントのバッチは、フラッグシップモデルのウィンドウに単一リクエストとして収まります。Hy3では、同じタスクにはチャンキング、検索、またはエージェントループが必要です。
• 推論制御 — tencent-hy3 は、リクエストごとの reasoning_effort 設定(no_think、low、high)に加え、高速性を維持する投機的デコード層を搭載しています。Tencent HY4 Preview は、Tencent 自身が認めるところでは、最初の出力までの思考に時間がかかる傾向があり、複雑なタスクでは自己検証を過剰に行います — すでに実行した作業を再確認するためにトークンを消費します。
その最後の行は、レイテンシ重視の用途における隠れた違いです。Hy3は直接答えるよう指示できますが、Tencent HY4 Previewは、少なくともこの初期の形では、考えずにはいられないことがよくあります。低遅延チャットや高スループットの抽出パイプラインでは、フラッグシップの追加機能は無駄になり、余分な思考は税のようなものです。オフラインのバッチ処理エンジニアリング業務では、その税こそがより良い回答を得る代償なのです。
プレビューの代償:Hy3にまだ残っているもの
「Preview」はTencent HY4 Previewの名前に含まれており、その名の通りの動作をする。視覚入力やマルチモーダル入力はなく、このモデルはテキスト専用だ。そのため、画像や動画に関連するものはすべて、これまでその用途に使っているモデルに任せることになる。WorkBuddyとCodeBuddyの2週間無料トライアルは、あくまでお試しであり、プランではない。Tencentは、これがHy4の初期バージョンであることを明確にしている。事前学習と事後学習の改善は今後も続き、2月以降およそ2か月ごとにメジャーバージョンがリリースされるペースだ。フラッグシップモデルに関する独立したベンチマークは、今のところどこにも存在しない。
tencent-hy3はそのすべての正反対です。7月から本番稼働している公式の安定版リリースです。無料利用枠は9月30日までです。その推論レベルは、気質ではなくダイヤルを提供し、投機的デコード層と21Bのアクティブパラメータにより、このファミリーの中で安く、速く、予測可能な半分となります——デフォルトのパスを指して忘れておけるモデルです。

誰がどれを選ぶべきか
タスクが目的の場合はTencent HY4 Previewを選択——難しいソフトウェアエンジニアリングタスク、リポジトリ規模のコンテキスト、より良い回答が5倍のトークン費用を正当化し、話す前に考えるモデルのレイテンシを許容できるエージェントワークフロー。タスクが制約の場合はtencent-hy3を選択——高スループット、低レイテンシ、厳しい予算、または熟考ではなく回答を求めるあらゆるタスク。
{{1}}このような組み合わせにおける実用的なパターンはエスカレーションです。つまり、安価で制御しやすいモデルをデフォルトパスにルーティングし、タスクが要求する場合にのみフラッグシップモデルにエスカレーションします。{{/1}}{{2}}これこそがOrcaRouterのルーティングDSLの目的です。複数のモデルを1回の呼び出しにまとめ、ポリシーをコードではなく設定として扱えるようにするためのものです。自動フェイルオーバーにより、あるプロバイダーが劣化してもHy3のパスは稼働し続けます。{{/2}}{{3}}OrcaRouterはまだTencent HY4 Previewをルーティングしていません。Tencentがこのモデルを第三者による推論に開放していないためです。そのため現時点では、同モデルはベンダー自身のTencent Cloud TokenHubエンドポイントと、オープンウェイトのセルフホストデプロイ上で動作します。{{/3}}{{4}}一方、tencent-hy3は、本日現在プロバイダーの定価でカタログに掲載されています。そして、フラッグシップが開放されたその日には、同じ方法で同じルーティングレイヤーに組み込まれ、モデル間の切り替えは、書き直しではなく1行の変更になります。{{/4}}

この結論は良い意味で退屈だ:{{1}}フラッグシップは、まさに価格に見合った仕事をするからこそ、プレミアムを払う価値がある{{/1}}し、{{3}}ただ終わらせれば済むすべての仕事{{/3}}には、{{2}}ワークホースが依然として正解だ{{/2}}。{{4}}6倍の価格差は現実であり、28対64のDeepSWEギャップも現実だ{{/4}}。そして{{5}}どちらも他方を打ち消すものではない{{/5}}——{{6}}自分が買っているのがどちらなのかを知っていればいいだけだ{{/6}}。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
