
Tencent HY4 プレビュー vs Qwen3.8-Max:8月のオープンウェイト対決
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianNEWQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
Tencent HY4 PreviewとQwen3.8-Maxの対決は、{{1}}今月が向かっていた衝突{{/1}}だ。AlibabaのQwen3.8-Maxは{{2}}8月3日に一般提供を開始し{{/2}}、{{3}}8月12日にオープンウェイトを持つ初のMaxクラスQwenとなった{{/3}}。Tencent HY4 Previewは{{4}}その25日後の今朝登場し{{/4}}、{{5}}Qwen3.8-Maxを直接名指しするローンチカードを添えている{{/5}}——TencentはToolathlon-VerifiedでHY4 Previewが74.1を記録し、{{6}}そのベンチマークでQwen3.8-Maxを上回っている{{/6}}と報告している。両者ともオープンウェイトの中国製フラッグシップであり、どちらも{{7}}販売促進向けの価格設定{{/7}}だが、{{8}}独立したスコアを持つのは片方だけだ{{/8}}。
2つのモデルの差は、規模だけにとどまらない —— Qwen3.8-Maxは2.4兆パラメータであるのに対し、HY4 Previewは7700億パラメータだ —— しかし、買い手にとって重要なエージェント型ベンチマークでは、両者は同じ標的を狙っている。すなわち、人間の介在なしにモデルが読み取り、ツールを呼び出し、反復処理を行う長期的なタスクだ。これはまさに、8月のオープンウェイト世代がクローズドなフロンティアモデルを置き換えられることを証明しようとしている領域であり、テンセントの最初の一手は、今月最大のオープンリリースに照準を合わせることだった。
スコアボード

• スケール — HY4 Preview 合計770B / アクティブ49B vs Qwen3.8-Max 合計2.4T / アクティブ約95B
• コンテキスト — HY4 Preview は API 上で 1M トークン超、Qwen3.8-Max は 1M トークン(オープンウェイトではネイティブ 262K、約 1.01M まで拡張可能)
• 1Mあたりの価格 — HY4 Preview:入力¥6 / 出力¥18(約$0.85 / $2.50) vs Qwen3.8-Max:入力$2.00 / 出力$6.00、キャッシュ読み出しは$0.25
• Terminal-Bench 2.1 — HY4 Preview 85.4 (ベンダー報告値) vs Qwen3.8-Max 86.6
• モダリティ — オープンウェイト版は両方ともテキストのみ。Qwen3.8-Max APIは画像・動画入力に対応するが、HY4 Previewプレビューは対応しない。
• 独立スコア — HY4 Preview:なし vs Qwen3.8-Max AA 知能指数 58、エージェント指数 58
この2枚のカードは、同じ物語を反対側から語っている。Terminal-Bench 2.1では、Qwen3.8-Maxの86.6とHY4 Previewの85.4は1.5ポイント差であり、そのうち1ポイントはQwenに有利、そしてHY4の数字は監査を受けていない。価格面では、HY4 Previewはトークンあたりの入力・出力の両方で安い。検証面では、Qwen3.8-Maxは独立したインテリジェンス指数58とエージェンティック指数58を持つ。HY4 Previewには自社の発表以外に何もない。この開きは、検証済みの既存製品に対して、より安い価格と未証明の主張で挑戦者が現れるという典型的なパターンだ。
Toolathlonの主張を読む
Toolathlon-Verified は、エージェンティックなツール使用の信頼性を測定します。つまり、モデルがエラー、回復、複数ステップの呼び出しを含む完全なタスクを通じて、ツールをどれだけ一貫して操作できるかということです。Tencentの74.1は、Qwen3.8-Maxのプロファイルの中で最も強い部分を直接狙ったものです。なぜなら、QwenのAgentic Index 58とOSWorld-Verified 86.1が、Alibabaのエージェンティックな売り込みを信頼できるものにした数字だからです。Qwen3.8-Maxはまた、IFBench(指示追従)で82.8、PaperBench(研究グレードのエージェンティックな作業)で93.0を記録しており、どちらもベンダー自身の表ではGPT-5.6 Solなどのモデルを上回っています。そこでTencentは、今月最大のオープンモデルに対して直接の勝利を主張できる唯一のベンチマークを選びました。そしてその主張は、現在のところ他のどの単一ベンダーの項目と同じくらい検証可能です。つまり、まったく検証できません。
検証済み vs ベンダー報告
ここが、このマッチアップが最も不公平な軸であり、この非対称性は明確に述べておく価値がある。Qwen3.8-MaxのIntelligence Index 58はArtificial Analysisによるものであり、Agentic Index 58もArtificial Analysisによるものだ。そして、それらのスコアを与えたのと同じ独立した評価ハーネスが、その弱点も測定している。AA-Omniscienceでの幻覚率は40%で、前世代の23%から上昇しており、さらにタスクあたりのエージェントターン数は実に64回——このモデルは懸命に働くが、そのターンごとにコストがかかる。Tencent HY4 Previewには、そうした計測が一切ない。その強みは主張にすぎず、その失敗モード——Tencent自身が長時間の思考と過剰な自己検証を挙げている——も、測定ではなく自己申告にすぎない。
2つのうちどちらかを選ぶチームにとって、検証ギャップは抽象的なものではない。Qwen3.8-Maxのタスクあたり64ターンという挙動は、実際に測定されたコスト要因である。$2/$6という価格でも、完了タスクあたりのエージェントとしては一部のサードパーティ比較で依然として最も高額であり、ターン数がその価格優位性を損なっているとチームは報告している。HY4 Previewの同等の挙動は不明である — すでに低いトークンあたり価格が示すよりもタスクあたりのコストが安い可能性もあれば、自己検証の癖がその差を食い潰す可能性もある。どちらなのかを教えられる人はまだいない。テンセント以外でそれを実行した人がいないからだ。
価格とオープンウェイトの実用性
トークン単位では、HY4 Preview は入力・出力の両側面で安価です。Qwen3.8-Max の $2.00/$6.00 に対して ¥6/¥18、キャッシュヒットは $0.25 に対して ¥0.3 です。つまり HY4 Preview は、入力・出力のいずれで見ても、間違いなく最も安価なオープンウェイトのフラッグシップモデルです。ただし、「オープンウェイト」には2つの異なる但し書きがあります。Qwen3.8-Max のオープンウェイトリリース(Qwen3.8-2.4T-A95B)は、テキストのみ対応で thinking モードが強制オン、ネイティブコンテキストは API の 1M ではなく 262K です。さらに、カスタムライセンスには規模別の条件が含まれます。すなわち、月間ユーザー数が1億を超える場合はモデル名の表示が要件となり、大規模な Model-as-a-Service(MaaS)事業には別のライセンスが必要です。テンセントの HY4 Preview のウェイトは、今朝の時点で HuggingFace、ModelScope、GitHub に公開されていますが、正確なライセンス条件や、公開ウェイトが API で提供中のモデルと一致するかどうかについては、そこまで明確には発表されていません。どちらのモデルもダウンロード可能ですが、どちらも単純に差し替えられるほど簡単ではありません。
結論
Qwen3.8-Maxは、検証が安全性を買うと言えるすべての面で、より安全な選択肢です。インテリジェンスとエージェント的タスクの両方で独立に評価され、既知の障害モード、確定済みライセンス、そして3週間分の本番運用フィードバックがあります。ただし、トークンあたりのコストは高く、計測されたターン数の多い挙動は既知のコストリスクです。Tencent HY4 Previewはコスト重視の賭けです。入力・出力ともにより安く、Terminal-Benchでは同等の主張、そしてQwenに対する直接のToolathlon-Verifiedの主張もありますが、そのすべてが初日時点では未検証です。今週オープンウェイトモデルを本番投入するなら、Qwen3.8-Maxは妥当な選択であり、OrcaRouter上でAlibabaのリスト価格である$2.00/$6.00をマークアップなしでそのまま通して利用可能です。HY4 Previewは評価プロジェクトです。Tencent自身のAPIを通じて、自社のToolathlonスタイルのタスクで実行し、本番パスは検証済みモデルに維持してください。そして、独立したスコアが揃ったとき、あるいはHY4 Previewがルーターに載って¥6/¥18レートが当日パススルーになるとき、切り替えはルーティングルールの変更であって、書き直しではありません。


何を見るべきか
エージェンティック・ハーネス上でのHY4 Previewの最初の独立実行。Toolathlon-Verified 74.1はTencentが勝ち取りたい数字であり、第三者によるAgentic Indexがその裏付けとなるだろう。
• HY4 Previewの測定されたターン数。Qwen3.8-Maxのタスクあたり64ターンは戒めの物語です。HY4 Previewが完了タスクあたりでより安価かどうかが、経済的議論の全てです。
• ウェイトのライセンス条項。それらは、HY4 Previewにおいて「オープン」が「あなたの規模で使用可能」を意味するかどうかを決定します。Qwen3.8-Maxライセンス条件がAlibabaのモデルに対してそうだったように。
• どちらかのベンダーが再び値下げをするかどうか。オープンウェイトのフラッグシップ2機種が積極的な価格設定で出荷されたこの月、ルーターでの透過処理により、さらなる値下げがあれば同じ日に即座に反映される。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
