「中国Flashティア、監査済み」という見出しのヒーロータイトルカード。それには「2026年10月」のクレームチェックタグ、Claude Haiku 5.5 $0.10 in / $0.50 out(100万トークンあたり)、GLM 5.3 Flash $0.15 / $0.50、DeepSeek V4.1 Flash $0.30 / $1.20 と表示された3つの価格チップ、「Terminal Bench 4.0 0.32828 - 同点」と書かれた行、そして 43.40 - 41.81 - 39.46 と書かれた Index v4.3.2 の行がある。
Guides & Insights

Claude Haiku 5.5は中国のフラッシュ・ティアを狙っていた。その主張の半分だけが精査に耐える。

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

今週、中国語で書いた読者が鋭い主張を展開した:Claude Haiku 5.5は中国の中間層市場を獲るために作られているように見える。なぜなら、DeepSeek V4.1 FlashとGLM 5.3 Flashを価格で下回り、Terminal Bench 4.0とArtificial Intelligence IndexではGLM 5.3 Flashを上回るからだ。これはほとんどのローンチ解説より鋭い見方だ。それは一枚のコートを着た二つの主張であり、同じだけの真実を帯びているわけではない。

Anthropicは2026年10月7日にClaude Haiku 5.5をリリースした——日付入りの発表、システムカード、公開された料金表を伴う完全な一般公開だ。そのおかげで、この主張には、二次的な市場解説がめったに得られないもの、つまり検証できる数字が備わっている。

以下の監査では、一方の半分が読者が述べたよりも強力であり、もう一方の半分は、それが引用する特定のベンチマークに関して誤っていることが分かった。どちらの所見も知る価値がある。なぜなら、それらは相反する方向を指し示しているからだ。

正確に述べられた主張

細部まで分解すると、その議論は三つの部分から成り立っている。

• 価格 — Claude Haiku 5.5 は DeepSeek V4.1 Flash より安く、GLM 5.3 Flash よりも安いです。

• 独立スコア — Artificial Analysis Intelligence Indexでは、GLM 5.3 Flashを約1ポイント上回っています。

• コーディングベンチマーク — Terminal Bench 4.0 では GLM 5.3 Flash を1ポイント上回るスコアも記録しています。

それらのうち2つは公表されている表と照合可能で、調整を加えれば成り立つ。3つ目は同じ表と照合可能だが、説明されているのとは異なる結果になる。

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

価格の半分:真実であり、一方の方向では過小評価され、もう一方では過大評価されている

Anthropicが公表しているClaude Haiku 5.5の料金は、10万トークンのプロンプトまでは入力100万トークンあたり$0.10、出力100万トークンあたり$0.50で、そのしきい値を超えると入力が$0.50、出力が$2.50に上がります。キャッシュされた入力の読み取りは$0.01、書き込みは$0.125です。コンテキストウィンドウは100万トークンで、最大出力は128,000です。

Z.aiのGLM 5.3 Flashは$0.15および$0.50で、キャッシュ入力は$0.026です。DeepSeek V4.1 Flashは$0.30および$1.20で、キャッシュ入力は$0.006です。

ヘッドライン料金については、読者が正しい。入力料金 $0.10 は GLM 5.3 Flash を 3 分の 1 下回り、DeepSeek V4.1 Flash を 3 分の 2 下回る。出力料金 $0.50 は GLM 5.3 Flash と完全に一致しつつ、DeepSeek の半分をはるかに下回る。これは意図的に見える着地点だ。より安い競合の出力に並び、入力でそれを上回り、比率にモノを言わせる。

この主張にとって有利なのは、完成したタスクあたりの実測コストだ。Artificial AnalysisのIntelligence Index v4.3.2では、ジョブ全体のコストはClaude Haiku 5.5で$0.21、GLM 5.3 Flashで$0.25、DeepSeek V4.1 Flashで$0.27になる。料金表では、Claude Haiku 5.5は入力でGLM 5.3 Flashより1.5倍安いとされているが、実測では完成したジョブは約6分の1ほど安い。それでも3つの中で依然として最も安い — ただし、表示価格が示唆するほどの差ではない。

その理由は、ほとんどの価格比較が取りこぼしている点だ。Claude Haiku 5.5は冗長だ。Artificial AnalysisはIndexを実行する際に、同モデルについて162,164出力トークンを記録したが、GLM 5.3 Flashは68,673、DeepSeek V4.1 Flashは88,574だった。Anthropic自身のドキュメントは第2の効果を付け加えている。このモデルはClaude 4.7以降と共有される新しいトークナイザーを使用するため、同じテキストが、それが置き換えるモデルよりも約30%多くのトークンとして数えられる。より安い料金がより多くのトークンに適用されることは、より安い料金がより多くのトークンに適用されるということだ。

ルーティングされた請求書でしか表面化しない厄介な点が一つあります。当社独自のカタログでは、DeepSeek V4.1 Flash を入力 $0.15、出力 $0.60 と記載しており、1日2回の時間帯 01:00–04:00 と 06:00–10:00 UTC には2倍の乗数が適用されます。1日のうち18時間はこれが基本料金で、6時間は出力料金が $1.20 になります。これらの時間帯を避けてスケジュールできるバッチトラフィックは、ベンダーの目玉となる定価リストが示すよりも実質的に有利な DeepSeek 価格を得られますが、インタラクティブトラフィックはそうではありません。この比較を実際にモデル化するなら、料金表と同じくらいカレンダーも重要です。

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

スコアの半分:「約1点」は1.6

Artificial Analysis Intelligence Index v4.3.2において、Claude Haiku 5.5はMax構成で43.40と測定されています。GLM 5.3 Flashは41.81と測定されています。DeepSeek V4.1 Flashは39.46です。

つまり、この主張のうち指数に関する部分は方向性としては正しく、切り捨てられる。差は1ポイントではなく1.59ポイントだ。これは60台に達する指数における確かなリードであり、この対戦のあらゆる要約で引用される数字である。

それが~でないのは、その土台にあるベンチマークについての主張である。両ベンダーはそれぞれ独自の評価セットを公開しており、それらは同じセットではない——Anthropic は Claude Haiku 5.5 について GDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0、FrontierCode を報告しており、Z.ai は GLM 5.3 Flash について独自のスイートを報告している。独立系ボードは、利用可能な唯一の同一条件で比較可能な行であり、まさにそれが、インデックスの差にこれほど強く頼る理由であり、次のセクションが重要である理由でもある。

コーディングの半分:今回は完全な引き分けで、勝ちではありません

Terminal Bench 4.0は、共通の独立した測定において、Claude Haiku 5.5で0.32828、GLM 5.3 Flashで0.32828を示す。小数点以下5桁まで同一。

それはこの対戦で最も引用されやすい数字だが、その数字についての主張は誤っている。混乱の原因はおそらく隣の行にある。Flashではない兄弟モデルであるフル版のGLM-5.3は、同じベンチマークで0.4192を記録している。もし「GLM」と「Terminal Bench」が同じ文中で、Claude Haiku 5.5を1ポイント上回る数字の隣に並んでいるのを見たなら、それはFlashではなく兄弟モデルのほうだ。

Artificial Analysisが両方のモデルについて公表している他の3行は、同点よりも興味深く、どちらか一方を示すものではない:

• SciCode — Claude Haiku 5.5 は 0.5498、GLM 5.3 Flash は 0.5162。Anthropic が 3.4 ポイントの優位。

• Humanity's Last Exam — 0.4439 対 0.3985。Anthropic が 4.5 ポイント差で優位。

• AutomationBench、部分スコア — 0.3541 対 0.6037。GLM 5.3 Flash に25ポイントの優位があり、セット内で断トツに最大の差。

その最後の行こそ、調達チームが最も気にするものだ。なぜなら、エージェント型自動化こそ、ミッドティアのモデルが実際に導入されている領域だからである。モデルが多段階のタスクを最後まで遂行できるかという指標では、より低コストで動かせるオープンウェイトのモデルが、逆方向の1.6ポイントという指標差をはるかに凌ぐ大差で勝利している。

速度も価格と同じように二極化する。いや、それ以上に。Artificial Analysisの測定では、IndexタスクあたりClaude Haiku 5.5が424.6秒、GLM 5.3 Flashが1035.4秒だった。Anthropicのモデルは半分以下の実時間でそこに到達し、エージェントループにおいてこれはトークン処理速度よりも大きな運用上の数字である。

その主張が完全に省いているもの

この比較は価格とスコアの話として組み立てられており、2つのモデルが最も似ていない側面を静かに飛ばしている。GLM 5.3 Flashはオープンウェイトで、MITライセンスの下で公開されており、総パラメータ数は3200億、アクティブは180億。DeepSeek V4.1 Flashも同様にオープンウェイトで、総計5520億、アクティブ160億。Claude Haiku 5.5はプロプライエタリでAPI専用、公開されたパラメータ数もリポジトリもない。

多くの購入者にとって、それは脚注ではない。要件定義書の最初の行だ。自社のテナンシーで推論を実行し、ファインチューニングし、あるいはモデルバージョンを何年も固定しておく必要があるチームは、インデックス指標でこれら3つを選んでいるわけではない。価格の列を読む前に、3つのうち2つは失格になる。読者のフレーミングは市場ポジショニングに関する観察であり、妥当な指摘だ。ただ、その構造上の違いが、そのフレーミングが擁護しているモデルに不利に働くというだけのことだ。

自分で比較を実行する

GLM 5.3 FlashとDeepSeek V4.1 FlashはどちらもOrcaRouterのカタログにプロバイダーの定価、マークアップ0%で掲載されています。つまり、この比較の中国側は、表計算ソフトでモデル化するものではなく、今日そのまま呼び出せるものです。料金はブレンドされるのではなくそのまま渡されるため、ベンダーの価格改定は、彼らの側に反映されたその日に私たちの側にも反映されます。そして上記のカレンダーベースのDeepSeekウィンドウは、ルーティングの対象となる同じ料金ブロック内で確認できます。1つのキー、1つのSDK、自動フェイルオーバーがその下にあり、コスト上限をアプリケーションコードではなくルートで表現したい場合にはルーティングDSLも利用できます。

Claude Haiku 5.5は当社のカタログにはありません。Anthropic自身のAPIを通じて利用できます。それを暗にほのめかすままにするより、率直に述べるほうがよいのです。

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

読者が正しく捉えたこと、そしてそれをどう活かすか

その直感はもっともだ。安価で高性能な中国製ミッドティアモデルの波を高く見せたければ、おおよそこういう手を打つのだろう。より安いライバルの出力レートに並び、入力レートを半減させ、指数で1.6ポイント上回り、タスク完了あたりの価格という数字に議論を担わせる。Claude Haiku 5.5 はそれをやってのける。しかも、狙いを定めたモデルよりタスクあたり2倍以上の速さでそれを成し遂げる。

読者が取り違えた点は、より狭く、より興味深い。Terminal Bench 4.0は勝利ではなく、まったくの引き分けだ。価格面の優位性は、トークン単位ではなく作業全体に対して課金すると、料金表が示唆する1.5×ではなく約6分の1になる。そして、2つのモデルが最も大きく差をつけている唯一のベンチマークはエージェント型のもので、そこではGLM 5.3 Flashが25ポイントリードしている。

つまり、この主張を正直に言い換えるとこうなる。Claude Haiku 5.5 は中国のフラッシュティアを狙っており、その比較では総合指標、完了タスクあたりのコスト、レイテンシで勝っているが、エージェント型自動化やオープン性では勝っていない。そして、その議論を決定的に感じさせた特定のコーディングベンチマーク上の優位は存在しない。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新