
Tencent HY4 Preview vs GPT-5.6 Sol:オープンウェイトをフロンティアと対決させるツール呼び出しの主張
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
Tencent HY4 Preview は、ローンチカードで GPT-5.6 Sol に対する勝利を明示的に主張する、ここ数か月で初のオープンウェイトモデルです。問題の数字は、エージェンティックなツール呼び出しのベンチマークである Toolathlon-Verified で、Tencent は HY4 Preview を 74.1 と報告しており、Qwen3.8-Max を上回り、Tencent 自身の比較では GPT-5.6 Sol も上回っています。他のすべての側面において、両モデルは実際には同等ではありません。GPT-5.6 Sol は、OpenAI のクローズドでフラッグシップの、独立に測定されたフロンティアモデルであり、Tencent HY4 Preview は、今朝リリースされた 7700 億パラメータのオープンウェイトのプレビューで、ベンダー報告のスコアカードのみで、第三者による検証はありません。
つまり、興味深い問いは「どのモデルがより賢いか」ではなく、Solの入力価格のおよそ6分の1というオープンウェイトの挑戦者が、フロンティアの一部を信用できる形で主張できるかどうか、そして、現在検証不可能な主張に対してチームがどう対処すべきか、ということだ。
これを真の対決にする主張
Toolathlon-Verifiedは、単一の関数をどれだけうまく書けるかではなく、エージェント的タスク全体を通じてモデルがツールをどれだけ確実に操作できるか——結果を読み取り、次の呼び出しを決定し、エラーから回復する——を測定するものです。これが重要なのは、フロンティアモデルへの実際のAPI支出の最大のシェアが、ワンショットの完了ではなくエージェントループに向けられているからです。そのベンチマークにおけるテンセントの74.1は、HY4 PreviewをGPT-5.6 Solの会話に登場させた具体的な主張であり、少し立ち止まって考える価値があります。独立した再現によって裏付けられれば、オープンウェイトとクローズドフロンティアのコストに関する議論を現実のものにする種類の数字です。裏付けがなければ、サードパーティのハーネスの下で消え去る、また別のベンダーのスコアカードになるでしょう。
知能を購入する2つの方法

• パラメータ — HY4 Preview: 総数770B / アクティブ49B、オープンウェイト vs GPT-5.6 Sol: パラメータ数非公開、クローズドAPI
• コンテキスト — HY4 Preview 100万トークン超 vs GPT-5.6 Sol 105万トークン、最大出力128K
• 1Mあたりの価格 — HY4 Preview: 入力¥6 / 出力¥18(約$0.85 / $2.50)vs GPT-5.6 Sol: ベーシックティアでは$4.00 / $20.00、大コンテキストリクエストでは$8.00 / $30.00に上昇、キャッシュ読み取りは$0.40
• 入力モダリティ — HY4 Previewはこのプレビューではテキストのみ対応、GPT-5.6 Solはテキストと画像入力に対応
• 推論モード — HY4 Previewには公開された同等機能がない vs GPT-5.6 SolのUltraモード(最大16の並列サブエージェント)およびMax reasoning effort
• 独立検証 — HY4 Preview はまだなし、GPT-5.6 Sol は主要なリーダーボードすべてに存在し、1.05Mコンテキストのランキングでは長文脈複合テストの最上位層に入っている。
価格の欄こそ、この対決の全容が決まるところだ。基本ティアでは、GPT-5.6 Solは入力トークン100万件につき4.00ドル、出力トークン100万件につき20.00ドル。Tencent HY4 Previewは現在の為替レートで約0.85ドルと2.50ドルだ。大量の出力トークンを動かすワークロード——エージェンティックコーディングがまさにそうだが——では、オープンウェイトモデルの価格はクローズドモデルのおよそ8分の1に設定されている。そして、Solの数値にははるかに多くの検証が背後にあるという留保を考慮しても、その差は依然として残る。
GPT-5.6 Sol が依然として優位性を保つ領域
検証こそが第一の強みです。GPT-5.6 Solは7月9日から一般提供されており、それ以降の独立測定結果は、ベース推論でTerminal-Bench 2.1 88.8、Ultraモードで91.9、Agents' Last Examで53.6(リリース時点での記録)、GPQA Diamondで94.6、SWE-bench Pro 64.6となっています。OpenAIはまた、エージェント型プログラミングタスクにおいて、自社の前世代フラッグシップと比較してトークン効率が54%向上したと報告しています。これらの数値はOpenAI自身のドキュメント以外でも再現確認できるものです。これは、Tencent HY4 Previewが現在欠いているまさにその性質です。
能力が2つ目の強みであり、それは限界的なものではなく構造的なものである。GPT-5.6 Solは画像入力を受け付ける一方、HY4 Previewは今回のプレビューではテキストのみであり、Tencentは視覚対応はフルリリースまで待つ必要があると認めている。GPT-5.6 SolはUltraモードを搭載する。これは、並列サブエージェントを統括するマルチエージェント構成で、トークンコストは3〜4倍かかるが、両モデルが実際に競合するような長期的なエンジニアリングタスクにこそ有用である。さらに、Solのコンピューター操作およびプログラムによるツール呼び出しのパスは、文書化され、本番規模で実践され、負荷テストも実施されている。TencentのToolathlon-Verifiedという主張が再現可能であれば、ツール使用のギャップは縮まる。ただし、マルチモーダルやマルチエージェントのギャップは埋まらず、HY4 Previewはそもそもそれらを試みていない。
HY4 Previewが本当に興味深い点
ベンチマークの舞台は脇に置いて、現実に残るものは三つある。{{1}}第一に価格だ。¥6/¥18(およそ$0.85/$2.50)という価格設定で、Tencent(テンセント)は出力トークンにおいて西側のすべてのフロンティアモデルを4分の1から8分の1の価格で下回り、入力においては中国の同類のオープンウェイトモデルをも下回っている。{{/1}} {{2}}第二にオープンウェイトだ。49BアクティブのMoEは単一ノードにデプロイ可能であり、Solの非公開アーキテクチャでは決してそうならない。ウェイトはすでにHuggingFace、ModelScope、GitHubに公開されている。{{/2}} {{3}}第三にコンテキストとエンジニアリングの軌道だ。DeepSWE 64.3と100万トークン超のコンテキストウィンドウは、SolのUltraモードが狙うのと同じ長期的なエージェントワークロードを対象としており、コストはほんの一部で実現している。{{/3}}
正直な注意点として、これらのどれも独立したベンチマークとの接触を経ていない。テンセントが語る自己最適化のストーリー、つまりモデルが自身の推論スタックを反復改良してエンドツーエンドのスループットを31.8%向上させたという話は、社内測定によるものだ。GLM 5.3とKimi K3に対するブラインドテストでの勝利も、社内で実施されたものだ。HY4 Previewに関する興味深い点はすべて、今日の時点では主張にすぎない。
決定
今日プロダクションシステムを構築するなら、GPT-5.6 Solは妥当な選択肢であり、OrcaRouterを通じてOpenAI自身のティア制リスト価格で利用できます — 基本ティアでは$4.00/$20.00、それより上のティアでは$8.00/$30.00で、マークアップなしでそのまま適用されるため、ベンダーの価格変更は当日中に当社側にも反映されます。ワークフローがエージェント中心でツールを多用する場合、ティア制の構造上、一律料金を想定するのではなく、実際の入力サイズを$272Kトークンのしきい値と照合して確認すべきです。
シャドウ評価を実施しても構わないなら、HY4 Previewは実際の評価を行う価値があるほど安価です。今日からツール呼び出しワークロードをSol経由でルーティングし、同じプロンプトをTencentの自社API経由でHY4 Previewに対して実行し、自作のToolathlon風タスクで比較してください。そして、独立したスコアがTencentの主張どおりになれば、移行経路は短いものです。オープンウェイトモデルをルーターに組み込めば、フェイルオーバールールがエンドポイントを切り替え、ベンダーの¥6/¥18という料金はそのまま透過されます。これがこの対決の正直な構造です。今日から構築できる検証済みのフロンティアモデルと、テストするには十分安価で、価格の議論をオープンウェイトクラス全体の話題にしようと位置づけられた、未検証のオープンチャレンジャーとの対決です。


何を見るべきか
• Toolathlon-Verified の初の独立再現。サードパーティのハーネスが HY4 Preview を 70 点台と確認すれば、「オープンウェイトではエージェンティックなツール使用はできない」という主張は崩壊する。
• Tencentが完全なHy4リリースの前にビジョンを出荷するかどうか。テキストのみでは、HY4 PreviewはGPT-5.6 Solが処理するワークロードの厳密なサブセットに制限される。
HY4 Previewの長考傾向による実際のトークン請求額。出力100万トークンあたり18円では、冗長な自己検証によって$20モデルよりも速く価格優位性が食いつぶされる。
• Solの段階的価格設定がHy4のフルローンチ前にさらに引き下げられるかどうか。ルーターでのパススルーにより、値下げは当日に反映される。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
