
Claude Sonnet 5.5 vs Tencent HY4 Preview:両ラボが売り込むのはトークン課金
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 931 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 192 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
2つのリリースが6週間違いで、異なる言葉で同じ約束をしている。ベンダーの主張は、Claude Sonnet 5.5が、2026年9月28日に出荷され、トークンあたりの料金が変わらないまま、Claude Sonnet 5よりも「タスクあたり最大30%安い」という。2つ目の主張は、9月7日の最適化が、Tencent HY4 Previewのホストされたビルドに対して行われたもので、2026年8月28日に最初にリリースされオープンソース化されたが、同じタスク品質で推論ターンとタスクあたりのトークン消費量を削減する。どちらのベンダーも、その主張をするために価格を上げたり下げたりしていない。どちらも、今やトークンが製品であると言っている。そして、この対決の興味深い点は、2つの主張のうち1つだけが、公開されたタスクあたりの数値と照合できるということだ。なぜなら、これら2つのモデルのうち1つだけが、それを照合するための独立した測定を持っているからである。
その非対称性は Tencent をけなすものではない。HY4 Preview には Artificial Analysis のモデルページも、独立した Intelligence Index スコアも、第三者によるタスクあたりコストの数値もない。あるのはベンダーのベンチマーク表 — Terminal-Bench 2.1 で 85.4、DeepSWE で 64.3、203 件のエンジニアリングタスクにわたる社内ブラインド評価で、GLM-5.3 の 2.92、Kimi K3 の 2.94 に対して平均 2.99 — と、WebDev Arena リーダーボードでの一般投票による初登場だ。Tencent の報告では、総合で約 5 位、オープンウェイトモデルの中では 3 位に入ったという。それらはすべて実際のシグナルだ。しかし、そのどれもがタスクあたりのコストではない。つまり、両ベンダーが競っている正確な数値は、HY4 Preview については入手できない。
各陣営が実際に出荷したもの
Tencent HY4 Previewは、7700億パラメータのMixture of Experts(MoE)で、トークンあたり490億がアクティブ、78層、256のルーティングされたエキスパートと1つの共有エキスパートを備え、投機的デコーディング用のネイティブMTP層を持ち、コンテキストウィンドウは100万トークンを超えます。設計上テキスト専用であり、Tencentは画像向けではなく、コーディングエージェント、複雑なツール使用、生産性作業向けに構築しました。デフォルトで重い推論を行い、設定可能な3つのレベル(high、low、none)があり、ベンダー推奨のサンプリング設定はtemperature 0.9とtop_p 1.0です。重みはApache 2.0で、Hugging Face、GitHub、ModelScope、GitCodeからダウンロードできます。Tencentは当初、プレビュー版における2つの荒削りな点として、必要以上に長く思考することと、自身の作業を過剰に検証することを指摘しており、9月7日のアップデートはまさにそれらに対処しています。
Claude Sonnet 5.5はAnthropicの2番目の5.5世代モデルであり、ラインナップの中で速度と知性の最良の組み合わせとして位置づけられているモデルです。100万トークンのコンテキスト、同期で128,000出力トークン、Message Batches APIでは300,000、テキスト・画像・ファイル入力、選択可能なエフォートでの適応的思考、2026年6月の知識カットオフ、ローンチ時から利用可能なゼロデータリテンション、そして2027年9月28日の廃止下限。料金表はClaude Sonnet 5から変わっていません。入力100万トークンあたり$2.00、出力100万トークンあたり$10.00、キャッシュ読み取り$0.20、キャッシュ書き込み$2.50。クローズドウェイト、Anthropic APIに加えてBedrock、Google Cloud、Microsoft Foundry。
二つを向かい合わせに並べると、その位置はほぼ対称になる:
• 価格 — Claude Sonnet 5.5 は100万トークンあたり入力$2.00 / 出力$10.00、これに対しTencent HY4 Preview は当社カタログで入力$0.83 / 出力$2.50(ベンダーリストでは¥6 / ¥18)
• キャッシュ読み取り — Claude Sonnet 5.5 は100万あたり $0.20、当社カタログでは Tencent HY4 Preview が100万あたり $0.042
• 重み — Claude Sonnet 5.5 はクローズド、それに対して Tencent HY4 Preview は Apache 2.0 でダウンロード可能
• コンテキスト — Claude Sonnet 5.5 の1,000,000トークン 対 Tencent HY4 Preview の1,048,576トークンで、実質的に同一
• 最大出力 — Claude Sonnet 5.5 は同期で 128,000、Batches では 300,000。一方、Tencent HY4 Preview は当社のカタログで 64,000
• 入力モダリティ — Claude Sonnet 5.5 はテキスト、画像、ファイル、Tencent HY4 Preview はテキストのみ
• 独立スコア — Claude Sonnet 5.5 インテリジェンス指数 56(タスクあたり $7.60)、リビジョン v4.3.2 対 Tencent HY4 Preview は未公開
• 計測された出力速度 — 当社独自のトラフィックにおいて、Claude Sonnet 5.5 は138.7トークン/秒、Tencent HY4 Preview は22.3トークン/秒

両研究所が主張していること、そしてなぜ一方は検証可能なのか
Anthropic の「タスクあたり 30% 削減」と Tencent の「推論ターン数が少なく、トークン消費量も少ない」は、同じエンジニアリングプロジェクトを二つの方向から説明したものだ。つまり、同じ回答に到達するまでにモデルが消費するトークン数を減らすということだ。Anthropic は料金レートが変わっていないと明確にしている。これは、タスクあたりの節約分はすべてトークン数から生じなければならないことを意味する——そして独立系のリーダーボードのおかげで、修正の規模ではなく問題の形が見えてくる。Claude Sonnet 5.5 は Intelligence Index 評価全体で 4 億 1,000 万出力トークンを生成するのに対し、MiniMax M3 は 1 億 1,700 万、Grok 4.5 は 7,700 万である。それは、その数値を公表しているリーダーボード上で測定された、冗長なモデルだ。Claude Sonnet 5 に対する 30% の改善がどれほどのものであっても、それは非常に大きなベースに適用されている。
HY4 Preview については、相当する数値が公には存在しない。テンセント自身の最適化ノートが唯一の説明であり、そこでは数値を挙げずに結果が述べられている。すなわち、ターン数が少なく、入力トークンと出力トークンが少なく、品質は同じで、ベンチマーク指標と二重パスでの人間評価によって検証済みだという。これは厳密な意味ではベンダーの主張である——述べられており、もっともらしく、再現されていない——そしてここではそのようにラベル付けされている。トークン経済性こそ外部からは測定できないものであるのに、ベンダーのトークン経済性の主張を根拠にプレビューモデルを採用することは、まさにプレビューリリースがあなたに求めている賭けである。
さらに、誰かがその最適化を前提にセルフホスト型デプロイを計画する前に、知っておく価値のある厄介な点がもう一つある。Tencentの9月7日の変更は、Tencentが自社のホスト型エンドポイントで提供しているビルドに適用される。オープンウェイトのスナップショットは更新されておらず、Hugging Faceリポジトリの最終更新日は依然として8月28日である。そのため、重みのセルフホストコピーでは、プレビューの注記が指摘していた元の、より長く推論する挙動が実行される。最適化されたバージョンとダウンロード可能なバージョンは、同じ成果物ではない。
オープンウェイトが本当に報われるのは、いつもと同じ場所だ。APIを呼び出せないデプロイメントである。770Bパラメータで49Bアクティブのモデルは、ワークステーションではなくデータセンターの決断であり、これは30Bモデルが語るようなラップトップ級の話ではない——しかし、自社の境界内にモデルを必要とする買い手にとって、その規模のApache 2.0は、Claude Sonnet 5.5がどんな価格でも提供しない選択肢だ。
本番パスを賭けずにプレビューを試す
プレビューモデルは、ルーティングがコスト最適化ではなくリスク管理になるケースです。プレビュービルドを直接呼び出すのではなくルーターの背後に置く理由は、プレビューとは自分の足元で変わりうる可能性によって定義されるものだからであり、その前段のレイヤーに求めるものは、パーセンテージ分割と、失敗を捕まえる何かです。
それがOrcaRouterの提供する形です。200以上のモデルをカバーする単一のOpenAI互換エンドポイント、プロバイダーの定価をマークアップなしでそのまま適用、アップストリームプロバイダー間の自動フェイルオーバー、そして複数のモデルから呼び出しを組み立てるためのルーティングDSL。 Tencent HY4 Previewは本日ここで以下としてルーティング可能です tencent/hy4-preview 100万トークンあたり入力$0.83、出力$2.50、キャッシュ読み取り$0.042、1,048,576トークンのコンテキストウィンドウ全体にわたり — 同じビルドを、プロバイダーの料金で、カタログ内の他のすべてにお使いのキーから利用できます。 Claude Sonnet 5もここでルーティング可能で、Anthropicの$2.00と$10.00、そして6月30日からずっとそうなっています。出たばかりのモデルが本番での証拠を積み上げる間、明白なフェイルオーバーパートナーとなります。

Claude Sonnet 5.5自体は当社のカタログには含まれていません。登場したのは昨日で、そこへの経路はAnthropic自身のAPIであり、このページがそれ以外のことを示唆することはありません — ルーティングに関する助言の要点は、まったく新しいティアを本番環境で運用する安全な方法とは、その背後に実績のあるものを置いたうえでトラフィックの一部を割り当てることであり、そしてそれが機能するのは、その取り合わせの両端が一箇所から到達できる場所にある場合に限られる、という点にあります。HY4 Previewはここで週37万2千トークンのトラフィックを捌いていますが、これは誰も本採用を決めていない2日前のプレビューが示す姿です。Claude Sonnet 5は6月30日以降、週790万を捌いており、これが候補と土台の違いです。

お金は実際どこへ行くのか
料金だけを見れば、HY4 Preview は出力で Claude Sonnet 5.5 より4倍安く、キャッシュ読み取りではほぼ5倍安く、コンテキストウィンドウも同等です。実測面では、Claude Sonnet 5.5 は当社のトラフィック上で出力を6倍速く生成します — 毎秒138.7トークン対22.3トークン — これは、キューイングを考慮に入れると、4倍の料金優位をはるかに小さな実時間上の優位に変え、時には損失にさえ変えてしまうような差です。
その2つの事実の間で、判断は読者だけが答えられる4つの問いにかかっている。その作業はプロンプトに画像やファイルを必要とするか? HY4 Previewはテキスト専用であり、それで議論は終わる。多段階のソフトウェアタスクを完了する必要があるのか? そこではHY4 PreviewのTerminal-Bench 2.1スコア85.4はTencent自身の数値であり、再現されていない。その場合、プレビュー版という状態があなたが受け入れるリスクであり、9月7日の最適化は信頼するよりも再テストする価値がある。そのワークロードは自社の境界内で実行する必要があるか? その場合、Apache 2.0のウェイトが決め手となる事実だ。また、総合的な能力レベルが料金よりも重要か? その場合、Claude Sonnet 5.5の独立に測定された56が比較検討すべき数値であり、Indexタスクあたり$7.60で、それと比較できる同等の数値がTencent側に存在しないという注意点がある。
両方の発表が本当に示しているのは、最前線が料金表から先へ進んだということだ。2つのラボが6週間の間隔を置いてモデルを投入し、100万トークンあたりの価格ではなく、タスクごとのトークン消費量を前面に打ち出した。そして購入者にとっての実用的な帰結は、有用な数字がどちらのベンダーの価格ページにももう載っていないということだ。それは、両方のモデルで測定された、あなた自身のワークロードが生み出すトークン数であり、この記事の中でどちらのベンダーもあなたに示せない唯一の数値だ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
