
Tencent HY4 Preview がオープンソース化:770B MoE、1Mコンテキスト、そしてフロンティアを下回る価格
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0259知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0258知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0166知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
2026年8月28日にリリースされオープンソース化されたTencent HY4 Previewは、中国の研究所から数ヶ月ぶりに登場した、真に競争力のあるオープンウェイトのフラッグシップモデルであり、その最も驚くべき数字は価格だ。Tencentは入力トークン100万件あたり6元(約0.85米ドル)、出力トークン100万件あたり18元(約2.50米ドル)と価格を設定している。これはトップクラスのクローズドフロンティアモデルが出力に対して請求する価格のおよそ10分の1に相当する。一方で、トークンごとに490億がアクティブとなる7,700億パラメータのミクスチャー・オブ・エキスパーツモデルを公開し、コンテキストウィンドウは100万トークンを超える。これはHunyuanファミリーのHy3(総パラメータ2,950億、コンテキスト256K)の後継であり、コンテキストを4倍に拡大しつつ、アクティブ容量を2倍以上に増やしている。ウェイトは本日からHugging Face、GitHub、ModelScope、GitCodeでダウンロード可能で、同じモデルはすでにTencent自社製品(WorkBuddy、国内版・国際版のCodeBuddy、Yuanbaoアシスタント、imaワークスペースアプリ)で稼働している。ソフトウェアエンジニアリング分野でオープンウェイトモデルがフロンティアに及ばないのを見てきた人々にとって、今回のリリースはついにその差が議論可能になったことを意味する。そして、注意点も数字と同じくらい重要だ。
位置づけは意図的だ。TencentはTencent HY4 Previewを、ソフトウェアエンジニアリング、オフィス・データ分析、ゲーム開発、科学研究という4つの領域向けの生産性モデルとして位置づけている。エンジニアリングへの重点が、汎用モデル群との差別化ポイントだ——リリースノートはチャット品質ではなく、長期タスクの理解、計画、デバッグを前面に打ち出している。その焦点はベンチマーク表だけでなく統合リストにも表れている。CodeBuddyはIDEでこのモデルを利用でき、WorkBuddyはオフィスワークフローで利用できる(Tencentは72件の財務文書を一度に処理するデモを披露している)。ゲーム開発者向けには、Unreal Engine 5とUnityへのMCPフックが提供され、一文の指示からプレイ可能なデモを生成できる。
実際に出荷されたもの
スペックシートは1行ずつ読む価値がある。各行が、オープンウェイトモデルに許されることを変えるからだ。
• アーキテクチャ — 総パラメータ数770B、トークンあたり有効パラメータ数49BのMixture-of-Experts。スパース比は約16:1で、推論コストを小規模チームでも実際に負担できる範囲に抑えています。
• コンテキストウィンドウ — 100万トークン以上、Hy3の256Kの4倍。長期的なエンジニアリングタスク — ウィンドウ内の完全なリポジトリ、複数ファイルのリファクタリング、大量のドキュメントバッチ — が単一リクエストの問題になります。
• ウェイト — MITスタイルのオープンリリースとして、Hugging Face、GitHub、ModelScope、GitCodeで公開。これはダウンロード可能で自己ホスト可能なモデルであり、ホスト型のティーザーではありません。
• API — Tencent CloudのTokenHubで利用可能。ベンダー自身がホストするエンドポイントで、価格は入力トークン100万件あたり6元、出力トークン100万件あたり18元、キャッシュヒット時は100万件あたり0.3元。
• 製品統合 — WorkBuddy、CodeBuddy(国内版・国際版)、Yuanbao、ima。つまり、Tencentが自社アプリで提供しているのと同じウェイトを取得して実行できるということです。
テンセントはまた、ローンチノートにはめったに載らない推論エンジニアリングの数値を報告している。オペレーター融合と通信最適化による、エンドツーエンドのスループット31.8%の向上だ。これをスペックシートの脚注以上のものにしているのは、テンセントによれば、Tencent HY4 Previewがボトルネックを自ら発見したという点にある。つまり、モデル自身が自分の推論スタックを分析し、その最適化はコンテキスト長や同時実行レベルを問わず安定していると報告されているのだ。これは、実験室が研究アーティファクトとしてリリースするモデルと、企業が本番トラフィックの到来を想定するモデルとを隔てる、まさにそうした詳細である。公開からまだ数日しか経っていないプレビューにあっては、これはまた、テンセントの外部ではまだ誰も検証していない、まさにそういう種類の主張でもある。
引用する価値のあるスコア
Tencent が Tencent HY4 Preview について公開したすべてのベンチマークはベンダー報告によるものであり、Tencent 自身の評価環境で実行され、独立した研究所による再現はなく、モデルが公開されてからまだ数日しか経っていません。これらは Tencent が到達したと考える上限として読むべきであり、確立された事実として読むべきではありません。

見出しとなる数字はTerminal Bench 2.1、つまりモデルがコーディング中に実際のターミナルをどれだけうまく操作できるかを測るテストだ。Tencentは、Tencent HY4 Previewが85.4を記録したと報告しており、これはClaude Opus 5に並び、DeepSeek V4 Proを上回り、さらに自社の前世代モデルHy3を14.6ポイント上回るという。このひとつの数字は大きな役割を担っている——オープンウェイトモデルが、難易度の高いエージェント型コーディングテストにおいて、最も高価なクローズドフロンティアモデルと同等であるという主張を支えるものだ——そして、この主張こそが最も独立した確認を必要としている。
内部テーブルの残りを見ると、ソフトウェアエンジニアリングのベンチマークであるDeepSWEは、Hy3で28.0から64.3へと跳ね上がり、Tencentはこれを「ファーストティアモデルとの差を徐々に縮めている」と表現している。ツール呼び出しテストであるToolathlon-Verifiedでは74.1を記録し、TencentによるとこれはQwen 3.8 MaxとGPT-5.6 Solを上回り、Kimi K3とClaude Opus 5に迫るスコアだという。APEX-Agentsのpass@1では37.1で、Kimi K3の37.2にわずかに及ばない。また、別の内部ブラインドテストでは、163人の専門家が203件のエンジニアリングタスクを4.00点満点中2.99点と評価し、GLM-5.3の2.92とKimi K3の2.94をわずかに上回った。
2つのパターンが浮かび上がる。第一に、強い数値はすべてエージェント型エンジニアリング作業(ターミナル操作、ツール呼び出し、リポジトリ規模のタスク)に関するものであり、一般的な知識や推論に関するものは皆無である。これは偶然ではなく、生産性重視のポジショニングと整合する。第二に、TencentはDeepSWEやその他のモデルについて、ギャップを「埋める」のではなく「縮める」と慎重に表現している。明確で市場に訴求できる唯一の同等性主張はTerminal Bench 2.1での同点であり、それが自社のワークロードで検証する価値が最も高い主張である。
その料金で実際に得られるもの
価格設定が変わるのは、リリースが面白い領域から破壊的領域に入る瞬間だ。Tencentの定価では、100万入力トークンのコストは、一部のプラットフォームにおける中級API呼び出し1回分とほぼ同等になる。100万出力トークンあたり18元(約2.50米ドル)という数値は、トップのクローズド系フロンティアモデルが出力100万トークンあたり25米ドルという価格を大きく下回っており、さらに0.3元のキャッシュヒット率により、同じシステムプロンプトや会話のプレフィックスが絶えず再送信される長大なエージェントループを、異例なほど安価に実行できる。
ここはまた、ルーティング層が計算を変える唯一の場所でもあります。OrcaRouterはまだTencent HY4 Previewをルーティングしていません。Tencentはこのモデルをサードパーティの推論プラットフォームに開放していないため、Tencent Cloud独自のTokenHubエンドポイントと、オープンウェイトのセルフホストデプロイ上で動作します。当社は提供していないものを提供しているとは主張しません。しかし、値下げを意味あるものにする規律は、カタログの他のすべてが基づいているものと同じです。OrcaRouterはプロバイダーのリスト価格をゼロマークアップで素通しするため、Tencentのようなベンダーがトークンを6元に設定した場合、お客様が当社側で支払う金額も6元であり、転売されて値上げされたものではありません。そして、ベンダーが価格を変更した日には、その変更は同じ日に当社側でも反映されます。200以上のモデルに対応する単一のAPI、あるプロバイダーが一時的に障害を起こしたときのプロバイダー間の自動フェイルオーバー、モデルを組み合わせるためのルーティングDSL。これこそが、Tencent HY4 Previewがルーティング可能になった瞬間に、すでにカタログにある他のオープンモデルやクローズドモデルと並んで、そのモデルを担うメカニズムです。

スペックシートに収まらない部分
発表資料における2つの主張は、モデルの構築方法に関するものであり、そのスコアに関するものではないため、個別に注目する価値がある。
1つ目は自己改善ループです。Tencentは、Tencent HY4 Previewが自身の研究開発に参加したと述べています。つまり、このモデルは、自分自身を生み出したトレーニング手法、データ戦略、評価システム、基盤オペレーターの最適化に使用されたということです。31.8%のスループット向上は、そのループの最も具体的な公的成果です。Tencentはこれを、モデルが自身のサービングスタックで特定したボトルネックによるものとしています。これは初期の再帰的自己強化サイクルです。つまり、モデルが次のバージョン自身の設計を支援するということです。フロンティアラボがこのような断片を報告することは珍しくありませんが、中国のオープンウェイトモデルがこのループを出荷済み機能として公に説明することは、こうしたリリースの自己語りにおける段階的な変化です。
2つ目は数学面の成果だ。Tencentによると、このモデルは、凸幾何学における長年の未解決問題であるブラシュケ–ルベーグ問題(等幅体の最小体積を求める問題)の既知の体積下界を0.380799から0.41104へと改善し、マイスナー四面体予想が示す値に約2%以内まで近づけた。またTencentは、科学研究レーンでの取り組みとして、32,512原子のリン脂質二重層シミュレーションを2.0倍高速化し、1ステップあたり54.9ミリ秒まで短縮したとも報告している。こうした成果は、通常であればモデル単独の論文が書かれる類のものだ。ここではそれらは発表時の箇条書き項目であり、他の発表資料と同様、Tencent自身の説明にすぎない。
正直なところ、何が欠けているのか
{{1}}テンセントは既知の制限事項を率直に列挙しており、このモデルで何を構築するかを決めるすべての人にとって重要な意味を持つ。{{/1}} {{2}}視覚やマルチモーダル入力はない——Tencent HY4 Previewはテキストモデルであり、それ以外の何物でもない。したがって、画像や動画に関連するものはすべて別のモデルで扱うべきだ。{{/2}} {{3}}テンセントはまた、このモデルが複雑なタスクでスロースタート挙動を示すこと——最初の出力までの思考時間が長いこと——と、過剰な自己検証傾向、つまりすでに完了した作業を再確認するためにトークンを消費することを指摘している。{{/3}} {{4}}この組み合わせは、レイテンシーに敏感なチャットにはまさに不向きであり、オフラインのバッチエンジニアリング作業にはまさに許容範囲である。これは、テンセントがこのモデルをどこで実行することを想定しているかを示している。{{/4}}
そして最も重要な欠落は検証です。Tencent HY4 Preview の独立したスコアは、まだどこにも存在しません。公開リーダーボードにも、第三者の評価ラボにも、Artificial Analysis のエントリーにもありません。このモデルはあまりに新しく、そうした評価がまだ追いついていないのです。内部の専門家によるブラインドテストは、Tencent 自社のレビュアーが GLM-5.3 や Kimi K3 と比較してどう見ているかについての有用なシグナルですが、それは Tencent のレビュアーによる Tencent のタスクでの評価です。仕様書に書かれていること以外はすべて、検証待ちの主張に過ぎません。

今日は誰がウェイトを引くべきですか
正直に言えば、今回のリリースは明確に二つの対象者に分かれます。自社インフラ上でエンジニアリング系ワークロードを実行しており、クローズドAPIのコスト面が障壁となっているなら、Tencent HY4 Previewは今すぐ週末を費やして真剣に試す価値があります。ウェイトはオープン、コンテキストウィンドウはリポジトリ規模、そしてリストプライスのおかげで、長いエージェントループを、出力100万トークンあたり25ドルのモデルでは決して実現できない形で手頃に実行できます。一方、レイテンシに敏感な本番チャット、マルチモーダルな何か、またはベンダー自身のベンチマークだけが根拠のモデルを許容できない何かを実行しているなら、待つのが賢明です。Tencentが2月から続けている2ヶ月単位のイテレーションサイクルは、完全版Hy4のリリースが遠くないことを示唆しており、プレビューは明らかに、既知の問題点を抱えた初期イテレーションとして位置づけられているからです。
実用的な中間の道はルーティングパターンです。実績のあるモデルをクリティカルパスで実行し、新しいモデルをその隣で並行実行します。コストプロファイルが有利なタスクではTencent HY4 Previewに切り替え、そうでない場合は自動的にフォールバックします。それこそがルーターが存在するためのパターンです。Claude Opus 5、DeepSeek V4 Pro、Gemini 3.1 Proを各プロバイダーの一覧価格で提供しているのと同じOrcaRouterが、Tencentが公開したその日にこのモデルも提供するでしょう。それまでは、ウェイトはGitHubに、APIはTencent Cloudにあります。そして、オープンウェイトモデルがエージェンティックコーディングの最上位層に到達したという主張に、ようやく具体的な数字が付けられました。その数字はTencentのものです。テストはあなたのものです。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
