Tencent Hy4 Previewのヒーロータイトルカード。中央に配置されたタイトルには「Tencent Hy4 Preview — オープンウェイト、初日からvLLM対応」と表示されています。サブタイトル行には「770B MoE · 49Bアクティブ · 1Mコンテキスト」と表示されています。4つのスペックチップには「オープンウェイト (Apache 2.0)」「vLLM + SGLang 初日対応」「8x GPUサーバー (FP8)」「MTokあたり¥6 / ¥18」と表示されています。フッター行には「2026年8月28日リリース · vLLMで動作」と表示されています。OrcaRouterのロゴは右下隅に合成されています。
Guides & Insights

Tencent Hy4 Previewは初日からvLLMで動作:実際にデプロイ可能な770BオープンウェイトMoE

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月28日にTencent Hy4 Previewがローンチされたとき、それはほとんどのフロンティア級フラッグシップが初日には省略することをやってのけました。すなわち、実行可能な状態で出荷されたのです。オープンウェイトに加えて、TencentとvLLMチームは、ビルド済みのDockerイメージ、公式のサービングレシピ、そしてvLLM自体へのフレームワークサポートの統合を公開しました。その結果、Hunyuanシリーズがこれまでに生み出した最大のオープンウェイトモデル——合計7700億パラメータ、トークンあたりアクティブな490億パラメータ——は、発表から数時間以内に、あなた自身のGPU上でOpenAI互換エンドポイントの背後にありました。この投稿が伝えるニュースは、その初日のランタイムの話です。というのも、この規模のモデルにとって「vLLMで動作する」ことは単なる脚注ではないからです。それは、プレスリリースと、実際に本番稼働できるものとの違いなのです。

ローンチの残りはいつものプレビュー型のパッケージであり、注意点は数字と同じくらい重要だ。TencentはTencent Hy4 Previewを初期イテレーションと呼び、過度に長い推論と過剰な自己検証を既知の挙動として挙げつつ、完全に自己申告によるベンチマーク表を公開している。独立したラボによる評価はまだなく、本稿執筆時点でモデルは登場から2日しか経っていない。それでも実際的な見出しは変わらない。ウェイトはApache 2.0、コンテキストウィンドウは100万トークン、そして初日からのvLLMサポートにより、セルフホスティングの道は夢物語ではなく現実なのである。

Tencent Hy4 Previewの正体

TencentはTencent Hy4 PreviewをHy3(合計295B、256Kコンテキスト)の後継として位置づけており、アクティブ容量を約2倍に、コンテキストウィンドウを4倍に拡大している。このアーキテクチャは1行ずつ読む価値がある。なぜなら、各行がオープンウェイトモデルがあなたのハードウェア上で何を許されるかを変えるからだ。

• アーキテクチャ — 合計770Bパラメータ、トークンあたり49BがアクティブなMixture-of-Expertsで、78層から構成。最初の層は高密度(dense)で、残りの77層は各トークンを256のルーティング対象エキスパートと1つの共有エキスパートに振り分け、上位8つを活性化する。この約16:1のスパース性比率が、本格的なチームが実際に実行可能な範囲に推論コストを抑える鍵となっている。

• コンテキストウィンドウ — ネイティブで1,048,576トークン、オープンウェイトモデルの中でも最も広い部類の一つ。完全なリポジトリ、複数ファイルのリファクタリング、長文ドキュメントのバッチ処理:どれも単一リクエストで処理できる問題です。

• Attention — IndexCacheを備えたGated DeepSeek Sparse Attention(Gated DSA)は、78層のうちわずか21層でのみ新しいスパースインデックスを計算し、残り57層ではそれを再利用する、スパースアテンション設計です。そのため、このモデルの推論サービスは単に「より大きなvLLM」ではなく、スパースアテンションを理解したバックエンドが必要になります。

組み込みの投機的デコード — 総パラメータ約10B / アクティブパラメータ約0.7BのMTP(マルチトークン予測)レイヤーがモデル内に組み込まれているため、vLLMとSGLangは別のドラフトモデルをホストすることなくトークンをドラフトできます。

• ウェイト — Apache 2.0、BF16 と FP8 の両方のチェックポイントで提供され、Hugging Face、ModelScope、GitCode、CNB に公開されています。

「"day-zero vLLM"が実際に意味するもの」

リリース当日にフレームワークサポートがマージされたことが、このシグナルの背後にある具体的な出来事です。Tencent Hy4 Previewを追加するvLLMの変更(PR #54160)はリリースと同時期にマージされ、公式レシピはvLLM 0.29.0以降を対象としています。実際には、サービングパスは1つのコマンドで完結し、1週間のカーネルデバッグは不要です。

docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview

フラグは重要で、それぞれが単なる定型文ではなく、モデル内の何かに対応しています:

• --attention-backend FLASHMLA_SPARSE — 必須であり、任意ではありません。Tencent Hy4 PreviewのGated DSAスパースアテンションは、デフォルトのデンスバックエンドでは正しく動作しません。公式レシピが設定するのはこのフラグです。

• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — モデル内蔵のMTPレイヤーを有効にして投機的デコーディングを行い、3トークン先までドラフトします。別途ドラフトモデルをデプロイする必要はありません。

• --tool-call-parser hy_v4 および --reasoning-parser hy_v4 — これらはカスタムパーサーで、Tencent Hy4 Preview がツール呼び出しとチェーン・オブ・ソートをどのように出力するかをサーバーに伝えます。--enable-auto-tool-choice を使用すると、モデルがツールを呼び出すタイミングを決定できます。

Tencentはサンプリングにtemperature 0.9とtop_p 1.0を推奨しています。推論はデフォルトで、数学、コーディング、複雑なタスクを対象とした「高」労力のチェーン・オブ・ソートになります。長い思考を伴わない直接的な応答が必要な場合は、重みを入れ替えるのではなく、リクエストでno_think推論努力を渡してください。

A screenshot of the official vLLM recipe page for tencent/Hy4-preview (recipes.vllm.ai/tencent/Hy4-preview, captured August 30, 2026). It shows the model spec chips '770B | 49B | 1,048,576 ctx | vLLM 0.29.0+', a note describing the built-in 10B MTP layer for speculative decoding and the hy_v4 tool/reasoning parsers, and the prebuilt docker run command with --tensor-parallel-size 8, --attention-backend FLASHMLA_SPARSE, and the hy_v4 parsers.

デイゼロサポートがvLLM専用ではないという点も、これほど新しいリリースにしては注目に値する。SGLangは同日、NEXTNスタイルの投機的デコードを備えたマルチアーキテクチャ対応のプリビルドイメージ(lmsysorg/sglang:hy4-preview)をリリースし、Ascendエコシステムは、vLLM-Ascendを通じてW8A8量子化ウェイトを使用し、16基のAtlas 800I A3 NPUにわたってデイゼロサポートを実現した。オープンウェイトのリリースでは、サービングエコシステムが追いつくまでに数週間かかることがよくあるが、今回は数時間だった。

引用する価値のあるスコア

テンセントがTencent Hy4 Preview向けに公開したすべてのベンチマークはベンダー報告によるものであり、テンセント独自の評価環境で実行され、独立した研究所による再現はされていません。しかも、このモデルは公開からまだ2日しか経っていません。これらはテンセントが到達したと考える上限値として読むべきであり、確立された事実としてではありません。第三者が実行するまで、独立した検証は存在しません。公開リーダーボードには、まだこのモデルを反映したものは何もありません。

A single-model scoreboard titled 'Tencent Hy4 Preview — the scoreboard'. Rows read: 'Total params: 770B MoE', 'Active params: 49B', 'Context: 1M tokens', 'Weights: open (Apache 2.0)', 'Price: ¥6 / ¥18 per MTok (¥0.3 cache hit)', 'Independent benchmarks: none yet'. A footer reads 'Benchmark claims vendor-reported, unreproduced as of Aug 30, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

最大の注目数字はTerminal Bench 2.1だ。これは、モデルがコーディング中に実際のターミナルをどれだけうまく操作できるかを測定するテストである。TencentはTencent Hy4 Previewが85.4を記録したと報告しており、これはClaude Opus 5に並びDeepSeek V4 Proを上回り、自社の前世代モデルHy3を14.6ポイント上回るという。その一つの数字が今回のリリースのすべてを物語っている。すなわち、オープンウェイトモデルが、難しいエージェンティックコーディングテストにおいて、最も高価なクローズドフロンティアモデルと同等であるという主張であり、そして独立した検証が最も必要な主張でもある。

内部テーブルの残りは、すべてテンセント独自の数値だ。ソフトウェアエンジニアリングベンチマークのDeepSWEは、Hy3の28.0から64.3へ急上昇する。SWE-bench Proは65.7、SWE-bench Multilingualは82.9。ツール呼び出しテストのToolathlon-Verifiedでは、テンセントは74.1を報告しており、Qwen 3.8 MaxとGPT-5.6 Solを上回り、Kimi K3とClaude Opus 5に迫るとしている。APEX-Agents pass@1では37.1で、Kimi K3の37.2に僅かに及ばない。また、別の内部ブラインド評価では、テンセントが採用した163人の専門家が203件のエンジニアリングタスクを4.00点満点中2.99点と評価し、GLM-5.3の2.92点とKimi K3の2.94点を僅かに上回った。

注目に値するパターンが2つある。優れたスコアはすべてエージェンティックエンジニアリング業務(ターミナル操作、ツール呼び出し、リポジトリ規模のタスク)に関するものであり、一般的な知識や推論に関するものは皆無だ。これは偶然ではなく、生産性重視のポジショニングに合致している。また、TencentはDeepSWEやその他のモデルを、ギャップを埋めるのではなく縮めるものだと説明している。明確で市場に訴求できる同等性の主張はTerminal Bench 2.1でのタイのみであり、それは自社のワークロードで検証する価値が最も高い主張である。

実際にかかるランニングコスト

正直に言うと、最初に考えるべきはセルフホスティングのコスト計算です。これはシングルGPUモデルでもデスクトップモデルでもありません。FP8チェックポイントは約1テラバイトの重みに達し、公式の構成はテンソル並列度8を前提としています——つまり、高速インターコネクトを備えた高帯域幅GPUが8基必要です(TencentのFP8向けリファレンスハードウェアは8×B300、フルBF16なら16×B200が必要)。その規模のハードウェアがなければ、セルフホスティングを安価に行うことはできません。さらに、スパースアテンションバックエンドでは、100万トークンのコンテキストにおけるKVキャッシュのメモリを回避する近道はありません。

あるローンチウィークのアドオンは、フラッグシップの規模を必要とせずにオープンウェイトを求めるチームにとって、その計算の一部を変える。TencentのHyチームは、Tencent Hy4 Previewの圧縮GGUFビルドをリリースし、約1.5 TBのBF16版を、MIX-STQ1_0と呼ぶレイヤーごとの混合量子化スキームで約200 GiBにまで圧縮した。バルクのエキスパートテンソルは約1.3ビットに削減される一方、残差ストリームに重要なレイヤーはより高い精度を維持する。Tencent自身の評価では、精度の変化は小さい。SWE-bench Multilingualは82.9から81.3、MCP Atlasは83.7から83.2、IFBenchは73.5から72.5。これはベンダーが「ほぼロスレス」と呼ぶトレードオフだ。これらはTencentのセットアップにおけるTencentの数値であり、これまでのところ再現されていない。200 GiBモデルは依然としてシングルGPUモデルではないが、ほぼテラバイト級のFP8チェックポイントよりもはるかに小さい賭けであり、8基のB300構成を前提とするよりも小さなマルチGPUノードでもオープンウェイトへの道を実現可能にする。

APIパスこそ、価格が興味深いところだ。Tencent CloudのTokenHubでは、Tencent Hy4 Previewは、入力トークン100万件あたり6元(約US$0.83)、出力トークン100万件あたり18元(約US$2.50)、キャッシュヒット時はトークン100万件あたり0.3元(約US$0.04)で提供されている。100万件あたり約2.50ドルという出力価格は、トップクラスのクローズドなフロンティアモデルの出力価格である100万件あたり25ドルをはるかに下回っており、さらにキャッシュヒット時の低料金により、同じシステムプロンプトや会話プレフィックスが繰り返し送信される長いエージェントループを、異例なほど手頃な価格で実現できる。

Tencentはまた、モデルが新しい間、WorkBuddyとCodeBuddy内でTencent Hy4 Previewへの2週間の無料アクセスを実施しています。そのため、今週試す最も安い方法は無料です。そして、生産性のポジショニングが具体化するのはWorkBuddyです。WorkBuddyのどの会話でも、モデルセレクターはHy3とHy4プレビューの間で切り替えられるため、オフィス生産性・分析作業とコーディングの間の分割は、デプロイメントの決定ではなく、タスクごとの選択となります。この分割はTencentがモデルを向けた先と一致しており、WorkBuddyでのハンズオンテストでは、モデルが複雑な成果物をワンショットで生成しています。具体的には、単一のプロンプトから生成されたプレイ可能なローポリゲームのプロトタイプ、10個の添付ファイルから手動介入ゼロで組み立てられた完全な四半期ビジネスレビュー、そして今週出回ったテスターデモでのブラックホールシミュレーションなどです。これらはベンダーのベンチマークではなく、Tencent自社アプリに関するコミュニティの観察ですが、実際のマルチステップタスクでモデルが何を行うかを示す最初の実地シグナルであり、費用を支払う前に無料で再現できます。

コストの判断こそ、ルーティングレイヤーが計算を変えるまさにその点であり、私たちもその点における自らの役割について正直に述べます。OrcaRouterはまだTencent Hy4 Previewをルーティングしていません。Tencentがこのモデルを第三者の推論プラットフォームに開放していないからです。これはTencent Cloud自身のTokenHubエンドポイントと、オープンウェイトのセルフホストデプロイメント上で動作します。私たちは提供していないものを提供すると主張することはありません。ルーティングレイヤーがもたらすのは、その周りの意思決定フレームワークです。8-GPUノードとAPIのどちらかを選ぶ場合、Tencentがこれを開放したその日に、カタログの他のすべてが基づいているのと同じパススルーの原則が適用されます。OrcaRouterはプロバイダーのリスト価格をゼロマークアップで透過的に渡すため、ベンダーの値下げは転売されて値上げされるのではなく、同日中に当社側でも有効になります。登場から2日しか経っておらず、唯一の根拠がベンダーのベンチマークしかないモデルにとっては、自動フェイルオーバーが安全なテスト方法です。実績のあるモデルをクリティカルパスに置き、その隣にTencent Hy4 Previewを配置します。コストプロファイルが有利なタスクでは切り替え、そうでないことが判明した瞬間にフェイルバックします。すべては1つのAPIと1つのキーで完結します。

A screenshot of the Artificial Analysis model leaderboard (artificialanalysis.ai, captured August 28, 2026) showing frontier models ranked by the Artificial Analysis Intelligence Index. Tencent Hy4 Preview does not yet appear — it is too new to have an independent score, which illustrates the verification gap discussed in this article.

仕様書に収まりきらない限界

Tencentは既知の制限事項を率直に列挙しており、それらがあらゆる導入決定を左右すべきです。Tencent Hy4 Previewはテキストモデルであり、それだけです。ビジョンやマルチモーダル入力はないため、画像や動画に関連するものはすべて別のモデルに任せるべきです。Tencentはまた、複雑なタスクでのスロースタート動作(最初の出力までの長い思考)と、自己検証しすぎる傾向、つまり既に完了した作業を再確認してトークンを消費することを指摘しています。その組み合わせは、遅延に敏感なチャットにはまったく不向きであり、オフラインバッチエンジニアリング作業には十分許容できます。これは、Tencentがどこで実行することを想定しているかを示しています。

発表資料に記載された2つの主張は、モデルが何をスコアしたかではなく、どのように構築されたかに関するものなので、特に注目に値する。Tencentは、Tencent Hy4 Previewが自身の開発に参加したと述べている。つまり、同モデルを生み出したトレーニング手法、データ戦略、評価フレームワーク、低レベル演算子の最適化を支援した、初期の再帰的自己改善ループである。さらに、ベースライン比31.8%のエンドツーエンドのスループット向上を達成するため、推論システムを自律的に最適化したという。科学的な面では、Tencentは凸幾何学におけるBlaschke–Lebesgue問題の既知の下限を0.380799から0.41104に引き上げ、32,512原子のリン脂質二重層シミュレーションで2.0倍の高速化を実現し、1ステップあたり54.9ミリ秒に短縮したと報告している。初日の他のすべての発表と同様に、これらはTencent自身による説明である。

そして最も重要な欠落は検証だ。Tencent Hy4 Previewの独立したスコアは、まだどこにも存在しない——公開リーダーボードにも、第三者評価ラボにも、Artificial Analysisのエントリーにもない。このモデルはあまりに新しすぎる。社内の専門家によるブラインドテストは、Tencent自身のレビュアーがGLM-5.3やKimi K3と比べてどう見るかについて有用なシグナルではあるが、それはTencentのレビュアーがTencentのタスクで評価したものだ。スペックシートに書かれていること以上のものはすべて、検証を待つ主張に過ぎない。

今週は誰がTencent Hy4 Previewを実行すべきですか?

正直な答えは、今週は3つのグループに分かれます。そのうち1つはハードウェアを一切必要としません。単にTencent Hy4 Previewが何をするのか体感したいだけなら、無料のWorkBuddyアクセスが最短ルートです。GPUもAPIキーも不要で、会話を開き、モデルセレクターをHy4 previewに切り替え、WorkタスクかCodingタスクを渡すだけです。GPUを保有し、エンジニアリングワークロードをバッチで実行しているなら——長期的なエージェントタスク、リポジトリ規模の分析、オフライン評価など——このモデルは今すぐ本格的に試す価値があります。重みはオープンで、コンテキストウィンドウはリポジトリ規模、vLLMパスは単一コマンド、そしてローンチ週のGGUFビルドが試験実行のハードウェアハードルを下げてくれます。レイテンシーに敏感な本番チャット、何らかのマルチモーダル用途、あるいはベンダー自身のベンチマークだけが根拠のモデルを許容できない状況であれば、待つのが賢明です。Tencentは2月以降、およそ2か月ごとにアップデートを重ねており、次期Hy4モデル群が来るとすでに発表しているため、このプレビューは明確に初期イテレーションという位置づけです。

他の人にとって、有用な姿勢はルーティングパターンです。すでに信頼しているモデルの隣でそれを証明し、手放せるコストで試し、自分のワークロードで数字が成立する場所にだけスケールする。それがルーターの存在理由です。Tencentがこのモデルをサードパーティの推論に開放した日、それは他のどのモデルとも同じように、一つのAPI、200以上のモデル、リスト価格パススルーのカタログに加わり、フェイルオーバーと構成ツールはすでに整っているでしょう。それまでは、ウェイトはHugging Faceに、APIはTencent Cloudに、無料トライアルはWorkBuddyにあります。そして、オープンウェイトのモデルがエージェント的コーディングの最上位層に到達したという主張に、ようやく具体的な数字が付いたのです。その数字はTencentのものです。テストはあなたのものです。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube