タイトルカードの文言は「GPT-6 Astra vs Tencent HY4 Preview」、デッキは「一方のモデルの数値は他者によって検証済み。もう一方は未検証——そして64,000出力トークンが、安価な側の止まる地点だ」。背景には、封印された認定済みの立方体と、層が見える開かれた立方体を並べた生成イラスト。
Guides & Insights

GPT-6 Astra対Tencent HY4 Preview:一方のモデルには監査証跡があり、もう一方にはベンチマーク表がある

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Tencent HY4 Preview と GPT-6 Astraは、ベンダー自身の公表数値を見る限り、今日利用できるほぼ最先端のエージェント型コーディングへの最も安価な2つの経路であり、他社の数値を見る限り、その層で最も比較しにくい2つのモデルでもある。Tencent HY4 Preview は2026年8月28日に Apache 2.0 の下でリリースされ、オープンソース化された。入力100万トークンあたり0.834ドル、出力100万トークンあたり2.501ドルで、7,700億パラメータの mixture-of-experts アーキテクチャ、100万トークンを超えるコンテキストウィンドウ、64,000トークンの出力上限を備える。GPT-6 Astra は2026年9月3日から一般提供されており、価格は入力10.00ドル、出力50.00ドル、コンテキストウィンドウは1,050,000トークン、最大出力は128,000トークン。Astra の強みは、公表された8件の第三者評価に裏付けられている。HY4 Preview の強みは、Tencent 自身によるターミナル、ツール呼び出し、ブラインド評価の実行に裏付けられており、それ以外には何もない。その非対称性は、安価なモデルの方が弱いという意味ではない。これは、この2つの比較のうち一方は検証できるが、もう一方は信じるしかないということであり、実務上の判断もそれに応じて異なる。

Apache 2.0リリースが実際にあなたにもたらすもの

ライセンスは、この対決において価格表では表現できない部分だ。Tencent HY4 Preview は、オープンウェイトのブランディングをまとったホスト型のティーザーではない。重みは Hugging Face、GitHub、ModelScope、GitCode からダウンロードできる。つまりこのモデルは、Tencent が自社の価格設定、自社のエンドポイント、あるいは提供を続けるかどうかについて下すどんな決定にも耐えうるということだ。

• アーキテクチャ — 総パラメータ数770B、トークンあたり49Bがアクティブ、78層、ルーティングされるエキスパート256個に加えて共有エキスパート1個、さらに投機的デコーディング向けのネイティブなマルチトークン予測層br /> • サービング特性 — 直近7日間のローリングウィンドウでOrcaRouterのルートを測定したところ、出力毎秒54.6トークン、初回トークンまでの中央値6.26秒br /> • コンテキストと上限 — 1,048,576トークンのウィンドウに対し、最大出力は64,000トークンbr /> • 入力サーフェス — テキストのみ。画像、ファイル、音声はなしbr /> • 推論制御 — high、low、none の3レベルで、デフォルトは high。加えて、temperature 0.9、top_p 1.0 というサンプリング推奨値が文書化されているbr /> • 信頼性 — 同じ7日間のウィンドウでエラー率2.8%、Astraルートの10.3%に対して

最後のあの2つの数値は、このページで最も実行に移しやすいものであり、どのベンダーも自社モデルについて公表しない類の数字だ。Astra は独立系ベンチマークのスコアがより高く、そのルートは過去1週間にわたっておよそ10リクエストに1件の割合で失敗している。一方、独立系スコアがまったくないモデルは35件に1件の割合で失敗している。どちらの数値もモデルそのものについて述べたものではない——エラー率が測るのはルート、レート制限、上流であって、重みではない——が、これらは本番システムが実際に経験する数値なのだ。

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

テンセントの数字を他社の数字と照合できる場面

公開されている証拠が示す限り、これは真に珍しい機会だ。Astra と HY4 Preview はどちらも Terminal-Bench 2.1 の数値を有しており、そのうちベンダー報告なのは一方だけである。

• Terminal-Bench 2.1、実際のターミナルを操作 — GPT-6 Astra 88.4、独立評価、Tencent HY4 Preview 85.4、ベンダー報告br /> • ツール呼び出し — Astra は τ²-Banking で 41.4、独立評価、HY4 Preview は Toolathlon-Verified で 74.1、ベンダー報告、別のテストでの結果br /> • ソフトウェアエンジニアリング — HY4 Preview は DeepSWE で 64.3、前身の Hy3 の 28.0 から上昇、ベンダー報告br /> • エージェントタスク — HY4 Preview は APEX-Agents で pass@1 37.1、ベンダー報告br /> • 人間の選好 — 163 名の専門家が採点した 203 件のエンジニアリングタスク全体で 4.00 点満点中平均 2.99、ベンダー実施、GLM-5.3 は 2.92、Kimi K3 は 2.94br /> • 独立系インデックス — GPT-6 Astra は Intelligence Index 54.7、GPQA Diamond 96.1、第三者による評価、HY4 Preview には同等のインデックスは存在しない

Terminal-Benchの行こそ、じっくり検討する価値がある。独立評価の88.4とベンダー報告の85.4の間の3ポイント差は、異なるハーネス、異なるスキャフォールド、あるいは異なるサンプリング温度が生じうる範囲に十分収まっている。つまり、正直な読み方は「Astraが3ポイント優れている」ではなく、「このティアで最も安価なオープンウェイトモデルが同等性を主張しており、その主張は少なくとももっともらしい」ということだ。Tencent自身の説明もこの点では慎重で、DeepSWEについて「差を徐々に縮めている」と述べるにとどめ、差を解消したとは言っていない。そして、その唯一の明確な同等性の主張——別ベンダーのトップ級クローズドモデルとのTerminal-Benchでの同点——こそ、まさに再測定を最も必要としている主張である。

また、知っておく価値のある変更があります。それはスコアではなく経済性を動かすものだからです。2026年9月7日、Tencentはライブプレビュービルドに最適化を投入しました。同社によると、これは複雑な作業における推論ターンとタスクあたりのトークン消費を削減します。モデルはトークン単位で課金されるため、完了したタスクあたりのトークン数が減れば、トークン単価が変わらなくてもタスクのコストは下がります。その削減幅はTencent自身の測定値であり、Tencent外部で再現した人はいません——しかし、仕組み自体は実在しており、8月にリリースされたプレビューが、ローンチ時の記事が示唆していたよりも10月には実質的に安く運用できる理由はそこにあります。

64,000トークンの上限は、デプロイを左右する仕様です

仕様書の中ほどに、最初に効いてくる制約がある。それは品質ではない。HY4 Previewの最大出力は64,000トークンで、Astraの128,000トークンに対するものだが、これはコーディングエージェントと長いツール使用チェーンを目的として掲げるモデルにおける話だ。生成されたファイル、複数ファイルにまたがるパッチ、長い構造化レポート——これらは上限に突き当たる出力であり、エージェント実行では、失敗はわずかに劣る回答ではない。周囲のパイプラインが検知して対処しなければならない、切り詰められた回答なのだ。

両モデルとも入力はおよそ100万トークンなので、文書読解のケースは本当に引き分けだ。違いは完全に生成側にあり、それは丸め誤差ではなく2倍の差だ。さらに入力面の違い——Astraは画像とファイルを受け付け、HY4 Previewはテキストのみ——を加えると、見えてくるのはランキングではなく明確な役割分担だ。成果物がツール呼び出しや差分であるテキスト入力・テキスト出力のエージェントループにはオープンウェイトモデル、何かを見たり長い文章を書いたりする必要があるものにはクローズドモデルだ。

出力レート20倍がもたらすもの、行ごとに

• 入力価格 — Tencent HY4 Preview は100万トークンあたり $0.834、GPT-6 Astra は $10.00 で、約12倍br /> • 出力価格 — HY4 Preview は100万トークンあたり $2.501、Astra は $50.00 で、約20倍br /> • キャッシュ入力 — HY4 Preview は100万トークンあたり $0.042、Astra は $1.00 で、約24倍br /> • 長文リクエストの段階 — Astra は入力トークンが 272,000 を超えるとリクエスト全体を $20.00 と $75.00 に再価格設定する。HY4 Preview の料金表にはこれに相当する段階はないbr /> • 400,000トークンのプロンプトにおける実効入力レート — HY4 Preview は $0.834 のまま、Astra は $20.00 で、約24倍br /> • 通常のエージェントループ、入力:出力 = 4:1 における100万トークンあたりのコスト — HY4 Preview はおよそ $1.17、Astra はおよそ $18.00br /> • 同じ比率で1か月に1億トークンを使用した場合のコスト — HY4 Preview はおよそ $117、Astra はおよそ $1,800

キャッシュ入力の行は、高コスト側にとって最もスケールが悪い項目です。なぜなら、エージェントループは毎ターン同じシステムプロンプトと会話プレフィックスを再送信するからです。$0.042 対 $1.00 では、長いループの最も安いトークンは Tencent モデルの方が 24 倍安く、これはまさにトークンあたりのわずかな差が最も速く積み重なるワークロードです。これをきれいに決着させてくれるはずの指標であるタスクあたりのコストは、Tencent がまったく公開していません。したがって、本当に重要な数値を得る唯一の方法は、両方のモデルを自分のタスクセットで実行し、usage オブジェクトを読むことです。

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

エラー率が手元にある状態で、ここでルーターが付け加えるもの

両モデルはOrcaRouterのカタログに掲載されています — tencent/hy4-previewとopenai/gpt-6-astraで、単一のOpenAI互換エンドポイントの背後にあり、いずれもプロバイダー自身の定価に0%のマークアップを上乗せせずそのまま適用されます。この最後の点は、このペアでは他の多くの場合よりも重要です。なぜなら、Tencentのモデルの定価は人民元で公表されているからです。上記のドル金額は、実際に表示される換算後のレートであり、再販業者の上乗せ分ではありません。また、Tencentが価格を変更すれば、その変更は次回の契約更新時ではなく、当日中にここに反映されます。

ルーティングDSLこそ、この2つのモデルがもはや代替案ではなくなる場所です。このペアにとって自然なルールは出力時のエスカレーションです。ループは安価なモデルに送り、応答が64,000トークンの上限に達して切り詰められて返ってきた場合、あるいはスキーマチェックに失敗した場合には、そのステップを、出力容量が2倍あるopenai/gpt-6-astraに対してリトライします。自動フェイルオーバーはこの議論のもう半分であり、過去1週間にわたって2つのルートのうち片方が10リクエストに1回エラーを出していたとなれば、それはもはや理論上の話ではありません。単一のモデルに固定された長いエージェント実行は、蓄積されたコンテキストごと死んでしまい、これらのモデルはいずれも、事故で最初から再実行できるほど安くはありません。

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

この比較を変えるものは何でしょうか?

この状況を大きく動かす順に、3つのことだ。HY4 Preview の独立した評価——このモデルは公開から6週間が経ち、第三者のインデックスも、再現された Terminal-Bench の数値も、タスクあたりのコスト数値もなく、存在する人間の選好データはベンダーが実施した唯一のブラインド評価だけである。両モデルの完了タスクあたりのコストの公表——これがあれば、本記事のあらゆる比率が1つの数値に置き換わる。そして、サードパーティ推論に関する Tencent の決定——Apache 2.0 の重みは誰でも提供できるのだから、競合するホストが HY4 Preview を立ち上げた瞬間、この比較の安価な側の価格はリストではなく市場になる。

それまでは、使える要約はどちらのベンダーの発表記事よりも範囲が狭く、スコアボードよりも正直だ。GPT-6 Astra は、能力に関する主張が検証済みのモデルで、出力上限は2倍、そして10回に1回のリクエストが失敗しているルートを持つ。Tencent HY4 Preview は、能力に関する主張が未検証のモデルで、アーキテクチャが公開され、オープンライセンスで、価格は3分の1、同じ期間におけるエラー率ははるかに低い。あなたの作業がテキスト入力・テキスト出力で、生成トークン64,000以内に収まるなら、安い方のモデルは妥協ではない — それが正解であり、犠牲にするのは監査証跡だけだ。

このペアに自然なルールは出力時のエスカレーションです。ループを安価なモデルに送り、レスポンスが64,000トークンの上限に達して切り詰められて返ってきた場合、またはスキーマチェックに失敗した場合、そのステップをopenai/gpt-6-astraに対して再試行します。こちらは出力の余地が2倍あります。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新