生成されたヒーローカード。タイトルは Claude Sonnet 5.5 vs Tencent HY4 Preview、サブタイトルは「両ラボともトークン課金を売りにしている」、3枚の統計カードは、100万あたりの出力価格 $10.00 対 $2.50、重みは closed 対 Apache 2.0、実測出力速度は毎秒 138.7 対 22.3 トークン。フッターには、Tencent HY4 Preview の価格と速度は OrcaRouter のカタログによるもので、ベンダー一覧では100万あたり 6 / 18 元、Claude Sonnet 5.5 は Anthropic によるものと記されている。
Guides & Insights

Claude Sonnet 5.5 vs Tencent HY4 Preview:両ラボが売り込むのはトークン課金

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2つのリリースが6週間違いで、異なる言葉で同じ約束をしている。ベンダーの主張は、Claude Sonnet 5.5が、2026年9月28日に出荷され、トークンあたりの料金が変わらないまま、Claude Sonnet 5よりも「タスクあたり最大30%安い」という。2つ目の主張は、9月7日の最適化が、Tencent HY4 Previewのホストされたビルドに対して行われたもので、2026年8月28日に最初にリリースされオープンソース化されたが、同じタスク品質で推論ターンとタスクあたりのトークン消費量を削減する。どちらのベンダーも、その主張をするために価格を上げたり下げたりしていない。どちらも、今やトークンが製品であると言っている。そして、この対決の興味深い点は、2つの主張のうち1つだけが、公開されたタスクあたりの数値と照合できるということだ。なぜなら、これら2つのモデルのうち1つだけが、それを照合するための独立した測定を持っているからである。

その非対称性は Tencent をけなすものではない。HY4 Preview には Artificial Analysis のモデルページも、独立した Intelligence Index スコアも、第三者によるタスクあたりコストの数値もない。あるのはベンダーのベンチマーク表 — Terminal-Bench 2.1 で 85.4、DeepSWE で 64.3、203 件のエンジニアリングタスクにわたる社内ブラインド評価で、GLM-5.3 の 2.92、Kimi K3 の 2.94 に対して平均 2.99 — と、WebDev Arena リーダーボードでの一般投票による初登場だ。Tencent の報告では、総合で約 5 位、オープンウェイトモデルの中では 3 位に入ったという。それらはすべて実際のシグナルだ。しかし、そのどれもがタスクあたりのコストではない。つまり、両ベンダーが競っている正確な数値は、HY4 Preview については入手できない。

各陣営が実際に出荷したもの

Tencent HY4 Previewは、7700億パラメータのMixture of Experts(MoE)で、トークンあたり490億がアクティブ、78層、256のルーティングされたエキスパートと1つの共有エキスパートを備え、投機的デコーディング用のネイティブMTP層を持ち、コンテキストウィンドウは100万トークンを超えます。設計上テキスト専用であり、Tencentは画像向けではなく、コーディングエージェント、複雑なツール使用、生産性作業向けに構築しました。デフォルトで重い推論を行い、設定可能な3つのレベル(high、low、none)があり、ベンダー推奨のサンプリング設定はtemperature 0.9とtop_p 1.0です。重みはApache 2.0で、Hugging Face、GitHub、ModelScope、GitCodeからダウンロードできます。Tencentは当初、プレビュー版における2つの荒削りな点として、必要以上に長く思考することと、自身の作業を過剰に検証することを指摘しており、9月7日のアップデートはまさにそれらに対処しています。

Claude Sonnet 5.5はA​nthropicの2番目の5.5世代モデルであり、ラインナップの中で速度と知性の最良の組み合わせとして位置づけられているモデルです。100万トークンのコンテキスト、同期で128,000出力トークン、Message Batches APIでは300,000、テキスト・画像・ファイル入力、選択可能なエフォートでの適応的思考、2026年6月の知識カットオフ、ローンチ時から利用可能なゼロデータリテンション、そして2027年9月28日の廃止下限。料金表はClaude Sonnet 5から変わっていません。入力100万トークンあたり$2.00、出力100万トークンあたり$10.00、キャッシュ読み取り$0.20、キャッシュ書き込み$2.50。クローズドウェイト、Anthro​pic APIに加えてBedrock、Goo​gle Cloud、Microsoft Foundry。

二つを向かい合わせに並べると、その位置はほぼ対称になる:

• 価格 — Claude Sonnet 5.5 は100万トークンあたり入力$2.00 / 出力$10.00、これに対しTencent HY4 Preview は当社カタログで入力$0.83 / 出力$2.50(ベンダーリストでは¥6 / ¥18)

• キャッシュ読み取り — Claude Sonnet 5.5 は100万あたり $0.20、当社カタログでは Tencent HY4 Preview が100万あたり $0.042

• 重み — Claude Sonnet 5.5 はクローズド、それに対して Tencent HY4 Preview は Apache 2.0 でダウンロード可能

• コンテキスト — Claude Sonnet 5.5 の1,000,000トークン 対 Tencent HY4 Preview の1,048,576トークンで、実質的に同一

• 最大出力 — Claude Sonnet 5.5 は同期で 128,000、Batches では 300,000。一方、Tencent HY4 Preview は当社のカタログで 64,000

• 入力モダリティ — Claude Sonnet 5.5 はテキスト、画像、ファイル、Tencent HY4 Preview はテキストのみ

• 独立スコア — Claude Sonnet 5.5 インテリジェンス指数 56(タスクあたり $7.60)、リビジョン v4.3.2 対 Tencent HY4 Preview は未公開

• 計測された出力速度 — 当社独自のトラフィックにおいて、Claude Sonnet 5.5 は138.7トークン/秒、Tencent HY4 Preview は22.3トークン/秒

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

両研究所が主張していること、そしてなぜ一方は検証可能なのか

Anthropic の「タスクあたり 30% 削減」と Tencent の「推論ターン数が少なく、トークン消費量も少ない」は、同じエンジニアリングプロジェクトを二つの方向から説明したものだ。つまり、同じ回答に到達するまでにモデルが消費するトークン数を減らすということだ。Anthropic は料金レートが変わっていないと明確にしている。これは、タスクあたりの節約分はすべてトークン数から生じなければならないことを意味する——そして独立系のリーダーボードのおかげで、修正の規模ではなく問題の形が見えてくる。Claude Sonnet 5.5 は Intelligence Index 評価全体で 4 億 1,000 万出力トークンを生成するのに対し、MiniMax M3 は 1 億 1,700 万、Grok 4.5 は 7,700 万である。それは、その数値を公表しているリーダーボード上で測定された、冗長なモデルだ。Claude Sonnet 5 に対する 30% の改善がどれほどのものであっても、それは非常に大きなベースに適用されている。

HY4 Preview については、相当する数値が公には存在しない。テンセント自身の最適化ノートが唯一の説明であり、そこでは数値を挙げずに結果が述べられている。すなわち、ターン数が少なく、入力トークンと出力トークンが少なく、品質は同じで、ベンチマーク指標と二重パスでの人間評価によって検証済みだという。これは厳密な意味ではベンダーの主張である——述べられており、もっともらしく、再現されていない——そしてここではそのようにラベル付けされている。トークン経済性こそ外部からは測定できないものであるのに、ベンダーのトークン経済性の主張を根拠にプレビューモデルを採用することは、まさにプレビューリリースがあなたに求めている賭けである。

さらに、誰かがその最適化を前提にセルフホスト型デプロイを計画する前に、知っておく価値のある厄介な点がもう一つある。Tencentの9月7日の変更は、Tencentが自社のホスト型エンドポイントで提供しているビルドに適用される。オープンウェイトのスナップショットは更新されておらず、Hugging Faceリポジトリの最終更新日は依然として8月28日である。そのため、重みのセルフホストコピーでは、プレビューの注記が指摘していた元の、より長く推論する挙動が実行される。最適化されたバージョンとダウンロード可能なバージョンは、同じ成果物ではない。

オープンウェイトが本当に報われるのは、いつもと同じ場所だ。APIを呼び出せないデプロイメントである。770Bパラメータで49Bアクティブのモデルは、ワークステーションではなくデータセンターの決断であり、これは30Bモデルが語るようなラップトップ級の話ではない——しかし、自社の境界内にモデルを必要とする買い手にとって、その規模のApache 2.0は、Claude Sonnet 5.5がどんな価格でも提供しない選択肢だ。

本番パスを賭けずにプレビューを試す

プレビューモデルは、ルーティングがコスト最適化ではなくリスク管理になるケースです。プレビュービルドを直接呼び出すのではなくルーターの背後に置く理由は、プレビューとは自分の足元で変わりうる可能性によって定義されるものだからであり、その前段のレイヤーに求めるものは、パーセンテージ分割と、失敗を捕まえる何かです。

それがOrcaRouterの提供する形です。200以上のモデルをカバーする単一のOpenAI互換エンドポイント、プロバイダーの定価をマークアップなしでそのまま適用、アップストリームプロバイダー間の自動フェイルオーバー、そして複数のモデルから呼び出しを組み立てるためのルーティングDSL。 Tencent HY4 Previewは本日ここで以下としてルーティング可能です tencent/hy4-preview 100万トークンあたり入力$0.83、出力$2.50、キャッシュ読み取り$0.042、1,048,576トークンのコンテキストウィンドウ全体にわたり — 同じビルドを、プロバイダーの料金で、カタログ内の他のすべてにお使いのキーから利用できます。 Claude Sonnet 5もここでルーティング可能で、A​nthropicの$2.00と$10.00、そして6月30日からずっとそうなっています。出たばかりのモデルが本番での証拠を積み上げる間、明白なフェイルオーバーパートナーとなります。

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5自体は当社のカタログには含まれていません。登場したのは昨日で、そこへの経路はAnthropic自身のAPIであり、このページがそれ以外のことを示唆することはありません — ルーティングに関する助言の要点は、まったく新しいティアを本番環境で運用する安全な方法とは、その背後に実績のあるものを置いたうえでトラフィックの一部を割り当てることであり、そしてそれが機能するのは、その取り合わせの両端が一箇所から到達できる場所にある場合に限られる、という点にあります。HY4 Previewはここで週37万2千トークンのトラフィックを捌いていますが、これは誰も本採用を決めていない2日前のプレビューが示す姿です。Claude Sonnet 5は6月30日以降、週790万を捌いており、これが候補と土台の違いです。

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

お金は実際どこへ行くのか

料金だけを見れば、HY4 Preview は出力で Claude Sonnet 5.5 より4倍安く、キャッシュ読み取りではほぼ5倍安く、コンテキストウィンドウも同等です。実測面では、Claude Sonnet 5.5 は当社のトラフィック上で出力を6倍速く生成します — 毎秒138.7トークン対22.3トークン — これは、キューイングを考慮に入れると、4倍の料金優位をはるかに小さな実時間上の優位に変え、時には損失にさえ変えてしまうような差です。

その2つの事実の間で、判断は読者だけが答えられる4つの問いにかかっている。その作業はプロンプトに画像やファイルを必要とするか? HY4 Previewはテキスト専用であり、それで議論は終わる。多段階のソフトウェアタスクを完了する必要があるのか? そこではHY4 PreviewのTerminal-Bench 2.1スコア85.4はTencent自身の数値であり、再現されていない。その場合、プレビュー版という状態があなたが受け入れるリスクであり、9月7日の最適化は信頼するよりも再テストする価値がある。そのワークロードは自社の境界内で実行する必要があるか? その場合、Apache 2.0のウェイトが決め手となる事実だ。また、総合的な能力レベルが料金よりも重要か? その場合、Claude Sonnet 5.5の独立に測定された56が比較検討すべき数値であり、Indexタスクあたり$7.60で、それと比較できる同等の数値がTencent側に存在しないという注意点がある。

両方の発表が本当に示しているのは、最前線が料金表から先へ進んだということだ。2つのラボが6週間の間隔を置いてモデルを投入し、100万トークンあたりの価格ではなく、タスクごとのトークン消費量を前面に打ち出した。そして購入者にとっての実用的な帰結は、有用な数字がどちらのベンダーの価格ページにももう載っていないということだ。それは、両方のモデルで測定された、あなた自身のワークロードが生み出すトークン数であり、この記事の中でどちらのベンダーもあなたに示せない唯一の数値だ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新