比較「Tencent HY4 Preview vs GPT-5.6 Sol」のヒーロータイトルカード。中央のハイライトには「Toolathlon-Verified 74.1 - フロンティアに対するオープンウェイトの主張」とあり、注釈には「Tencentは、エージェンティックなツール呼び出しにおいて自社モデルがGPT-5.6 Solより優れていると報告している」と記されている。左のカード「Tencent HY4 Preview」には「オープンウェイト、770B / 49Bアクティブ」「1Mあたり¥6 / ¥18」「独立したスコアはなし」とリスト表示。右のカード「GPT-5.6 Sol」には「クローズドAPI、OpenAIの旗艦」「1Mあたり基本$4 / $20」「Terminal-Bench 2.1: 88.8」とリスト表示。フッターには「HY4 Previewの数値はベンダー報告によるもので、Solの数値は広く再現されている」と記されている。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol:オープンウェイトをフロンティアと対決させるツール呼び出しの主張

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Tencent HY4 Preview は、ローンチカードで GPT-5.6 Sol に対する勝利を明示的に主張する、ここ数か月で初のオープンウェイトモデルです。問題の数字は、エージェンティックなツール呼び出しのベンチマークである Toolathlon-Verified で、Tencent は HY4 Preview を 74.1 と報告しており、Qwen3.8-Max を上回り、Tencent 自身の比較では GPT-5.6 Sol も上回っています。他のすべての側面において、両モデルは実際には同等ではありません。GPT-5.6 Sol は、Ope​nAI のクローズドでフラッグシップの、独立に測定されたフロンティアモデルであり、Tencent HY4 Preview は、今朝リリースされた 7700 億パラメータのオープンウェイトのプレビューで、ベンダー報告のスコアカードのみで、第三者による検証はありません。

つまり、興味深い問いは「どのモデルがより賢いか」ではなく、Solの入力価格のおよそ6分の1というオープンウェイトの挑戦者が、フロンティアの一部を信用できる形で主張できるかどうか、そして、現在検証不可能な主張に対してチームがどう対処すべきか、ということだ。

これを真の対決にする主張

Toolathlon-Verifiedは、単一の関数をどれだけうまく書けるかではなく、エージェント的タスク全体を通じてモデルがツールをどれだけ確実に操作できるか——結果を読み取り、次の呼び出しを決定し、エラーから回復する——を測定するものです。これが重要なのは、フロンティアモデルへの実際のAPI支出の最大のシェアが、ワンショットの完了ではなくエージェントループに向けられているからです。そのベンチマークにおけるテンセントの74.1は、HY4 PreviewをGPT-5.6 Solの会話に登場させた具体的な主張であり、少し立ち止まって考える価値があります。独立した再現によって裏付けられれば、オープンウェイトとクローズドフロンティアのコストに関する議論を現実のものにする種類の数字です。裏付けがなければ、サードパーティのハーネスの下で消え去る、また別のベンダーのスコアカードになるでしょう。

知能を購入する2つの方法

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• パラメータ — HY4 Preview: 総数770B / アクティブ49B、オープンウェイト vs GPT-5.6 Sol: パラメータ数非公開、クローズドAPI

• コンテキスト — HY4 Preview 100万トークン超 vs GPT-5.6 Sol 105万トークン、最大出力128K

• 1Mあたりの価格 — HY4 Preview: 入力¥6 / 出力¥18(約$0.85 / $2.50)vs GPT-5.6 Sol: ベーシックティアでは$4.00 / $20.00、大コンテキストリクエストでは$8.00 / $30.00に上昇、キャッシュ読み取りは$0.40

• 入力モダリティ — HY4 Previewはこのプレビューではテキストのみ対応、GPT-5.6 Solはテキストと画像入力に対応

• 推論モード — HY4 Previewには公開された同等機能がない vs GPT-5.6 SolのUltraモード(最大16の並列サブエージェント)およびMax reasoning effort

• 独立検証 — HY4 Preview はまだなし、GPT-5.6 Sol は主要なリーダーボードすべてに存在し、1.05Mコンテキストのランキングでは長文脈複合テストの最上位層に入っている。

価格の欄こそ、この対決の全容が決まるところだ。基本ティアでは、GPT-5.6 Solは入力トークン100万件につき4.00ドル、出力トークン100万件につき20.00ドル。Tencent HY4 Previewは現在の為替レートで約0.85ドルと2.50ドルだ。大量の出力トークンを動かすワークロード——エージェンティックコーディングがまさにそうだが——では、オープンウェイトモデルの価格はクローズドモデルのおよそ8分の1に設定されている。そして、Solの数値にははるかに多くの検証が背後にあるという留保を考慮しても、その差は依然として残る。

GPT-5.6 Sol が依然として優位性を保つ領域

検証こそが第一の強みです。GPT-5.6 Solは7月9日から一般提供されており、それ以降の独立測定結果は、ベース推論でTerminal-Bench 2.1 88.8、Ultraモードで91.9、Agents' Last Examで53.6(リリース時点での記録)、GPQA Diamondで94.6、SWE-bench Pro 64.6となっています。Ope​nAIはまた、エージェント型プログラミングタスクにおいて、自社の前世代フラッグシップと比較してトークン効率が54%向上したと報告しています。これらの数値はOpe​nAI自身のドキュメント以外でも再現確認できるものです。これは、Tencent HY4 Previewが現在欠いているまさにその性質です。

能力が2つ目の強みであり、それは限界的なものではなく構造的なものである。GPT-5.6 Solは画像入力を受け付ける一方、HY4 Previewは今回のプレビューではテキストのみであり、Tencentは視覚対応はフルリリースまで待つ必要があると認めている。GPT-5.6 SolはUltraモードを搭載する。これは、並列サブエージェントを統括するマルチエージェント構成で、トークンコストは3〜4倍かかるが、両モデルが実際に競合するような長期的なエンジニアリングタスクにこそ有用である。さらに、Solのコンピューター操作およびプログラムによるツール呼び出しのパスは、文書化され、本番規模で実践され、負荷テストも実施されている。TencentのToolathlon-Verifiedという主張が再現可能であれば、ツール使用のギャップは縮まる。ただし、マルチモーダルやマルチエージェントのギャップは埋まらず、HY4 Previewはそもそもそれらを試みていない。

HY4 Previewが本当に興味深い点

ベンチマークの舞台は脇に置いて、現実に残るものは三つある。{{1}}第一に価格だ。¥6/¥18(およそ$0.85/$2.50)という価格設定で、Tencent(テンセント)は出力トークンにおいて西側のすべてのフロンティアモデルを4分の1から8分の1の価格で下回り、入力においては中国の同類のオープンウェイトモデルをも下回っている。{{/1}} {{2}}第二にオープンウェイトだ。49BアクティブのMoEは単一ノードにデプロイ可能であり、Solの非公開アーキテクチャでは決してそうならない。ウェイトはすでにHuggingFace、ModelScope、GitHubに公開されている。{{/2}} {{3}}第三にコンテキストとエンジニアリングの軌道だ。DeepSWE 64.3と100万トークン超のコンテキストウィンドウは、SolのUltraモードが狙うのと同じ長期的なエージェントワークロードを対象としており、コストはほんの一部で実現している。{{/3}}

正直な注意点として、これらのどれも独立したベンチマークとの接触を経ていない。テンセントが語る自己最適化のストーリー、つまりモデルが自身の推論スタックを反復改良してエンドツーエンドのスループットを31.8%向上させたという話は、社内測定によるものだ。GLM 5.3Kimi K3に対するブラインドテストでの勝利も、社内で実施されたものだ。HY4 Previewに関する興味深い点はすべて、今日の時点では主張にすぎない。

決定

今日プロダクションシステムを構築するなら、GPT-5.6 Solは妥当な選択肢であり、OrcaRouterを通じてOpenAI自身のティア制リスト価格で利用できます — 基本ティアでは$4.00/$20.00、それより上のティアでは$8.00/$30.00で、マークアップなしでそのまま適用されるため、ベンダーの価格変更は当日中に当社側にも反映されます。ワークフローがエージェント中心でツールを多用する場合、ティア制の構造上、一律料金を想定するのではなく、実際の入力サイズを$272Kトークンのしきい値と照合して確認すべきです。

シャドウ評価を実施しても構わないなら、HY4 Previewは実際の評価を行う価値があるほど安価です。今日からツール呼び出しワークロードをSol経由でルーティングし、同じプロンプトをTencentの自社API経由でHY4 Previewに対して実行し、自作のToolathlon風タスクで比較してください。そして、独立したスコアがTencentの主張どおりになれば、移行経路は短いものです。オープンウェイトモデルをルーターに組み込めば、フェイルオーバールールがエンドポイントを切り替え、ベンダーの¥6/¥18という料金はそのまま透過されます。これがこの対決の正直な構造です。今日から構築できる検証済みのフロンティアモデルと、テストするには十分安価で、価格の議論をオープンウェイトクラス全体の話題にしようと位置づけられた、未検証のオープンチャレンジャーとの対決です。

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

何を見るべきか

• Toolathlon-Verified の初の独立再現。サードパーティのハーネスが HY4 Preview を 70 点台と確認すれば、「オープンウェイトではエージェンティックなツール使用はできない」という主張は崩壊する。

• Tencentが完全なHy4リリースの前にビジョンを出荷するかどうか。テキストのみでは、HY4 PreviewはGPT-5.6 Solが処理するワークロードの厳密なサブセットに制限される。

HY4 Previewの長考傾向による実際のトークン請求額。出力100万トークンあたり18円では、冗長な自己検証によって$20モデルよりも速く価格優位性が食いつぶされる。

• Solの段階的価格設定がHy4のフルローンチ前にさらに引き下げられるかどうか。ルーターでのパススルーにより、値下げは当日に反映される。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube