
Claude Haiku 5.5 vs GLM 5.3 Flash:両ベンダーが引用するベンチマークで完全に互角
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.
それはまた、それで決めるには間違った数字でもある。2つのモデルは他のあらゆる点で鋭く分かれており、その分離のパターンは、どちらのベンダーの看板の主張をどう読むべきかを変えるほど異例だ。一方は総合指数とタスクあたりのコストの数値で勝っている。もう一方は、実際の展開と思われるほとんどすべてで勝っている。
それらは能力によって分けられているのではない。形によって分けられているのだ。
「これらは同じクラスのモデルだ」と示す、その1つの数字から始めてください。
• SciCode — Claude Haiku 5.5 は 0.5498、GLM 5.3 Flash は 0.5162。Anthropic に2ポイント。だが、2ポイントなどノイズにすぎないベンチマークで。
• Terminal Bench 4.0 — 0.32828 対 0.32828。まさに引き分け。
• コンテキストウィンドウ — 両方とも100万トークン。
• 出力価格、第1ティア — いずれも100万トークンあたり$0.50。
4行、4つがほぼ一致。ここで止めれば、これらのモデルは互換性があり、価格で選ぶべきだと結論づけるでしょう。その結論は誤りで、次の行のセットがその理由です。
それらが分かれるところでも、方向性は一貫している
They do separate them—the rows are not scattered. それらを実際に分けている行は、散らばってなどいない。2つのグループに固まっており、各モデルがそれぞれ一方のグループを丸ごと独占している。
そのエージェント系グループは GLM 5.3 Flash に属する。AutomationBench の部分スコアは、GLM 5.3 Flash が 0.6037 であるのに対し Claude Haiku 5.5 は 0.3541 — 25 ポイントの差であり、共通の測定項目においてこの 2 モデル間に見られる単一の差異としては最大である。Tau-Bench Banking は GLM 5.3 Flash が 0.4722、Claude Haiku 5.5 はその行に公表された数値がない。GPQA は GLM 5.3 Flash が 0.9121、ここでも比較対象となる Anthropic の数値はない。モデルが多段階のタスクを維持し、構造化された領域内でツールを確実に使いこなせるかという指標において、Z.ai のモデルは、逆方向に生じている複合指標の差をはるかに凌ぐマージンで先行している。
複合・コスト部門はClaude Haiku 5.5に属する。Artificial Analysis Intelligence Index v4.3.2は43.40対41.81——1.59ポイントで、この対決のあらゆる要約が引用する数字だ。完了したIndexタスクあたりのコストは$0.21対$0.25。Indexタスクあたりの実時間は424.6秒対1,035.4秒:Anthropicのモデルは半分以下の時間で完了する。
それがこの選択の構図だ。Claude Haiku 5.5 はより高速で、完了した仕事あたりのコストが安く、総合値でも上だ。GLM 5.3 Flash は、安価なモデルが買われる特定の種類の作業において、より信頼性が高い。

信じるべきはどれですか?
どちらも単独では——そして、その不一致自体が情報なのだ。
Intelligence Indexは、推論、科学、コーディング、エージェントの各カテゴリにまたがる重み付けされたブレンドです。これは「このモデルはおおよそどれほど有能か」を単一の数値で答えるように設計されており、その役割を果たしています。できないのは、1.59ポイントのリードが、あなたのワークロードが存在するカテゴリから来ているのか、それとも決して触れないカテゴリから来ているのかを教えることです。ここでは、そのリードは主にSciCodeやHumanity's Last Examのような行から来ています — 0.5498対0.5162、そして0.4439対0.3985 — 一方、AutomationBenchには逆の符号で25ポイントの不足があります。
ターミナルループ上でコーディングアシスタントを構築するチームは、SciCodeの優位性に気づくだろう。銀行業務のワークフローをエンドツーエンドで完了しなければならないエージェントを構築するチームは、AutomationBenchのギャップに気づく。しかも、それは毎日のように気づくのだ。この2つのチームは同じ指標を見ており、正反対の結論に達するべきである。
実用的な判断は、総合スコアをランキングとしてではなくフィルターとして読むことだ。2つのモデルがインデックスでおよそ2ポイント以内なら、総合スコアは両者が同じ帯域にあることを示しているだけで、どちらを選ぶべきかについては何も示していない。その時点で読む価値がある行は、自分のワークロードに合致する行だけだ — そしてベンダーが必要な行を公開していないなら、その不在自体がデータポイントであり、仮定で埋めるべき空白ではない。
比較表に誰も入れないトークナイザーの行
Anthropic自身のドキュメントには、Claude Haiku 5.5に関わるあらゆる価格比較を一変させる一文が含まれているが、それは見落としやすい。このモデルはClaude 4.7以降と共通の新しいトークナイザーを採用しており、同じテキストを、それが置き換えるモデルよりも約30%多いトークンとして数える。
それを料金表と突き合わせると、計算結果は表示価格が示唆するほど魅力的ではなくなる。Claude Haiku 5.5の入力料金は100万トークンあたり$0.10で、GLM 5.3 Flashの$0.15に対して1.5倍の優位性がある。同じプロンプトで30%多くトークンを消費すると、同一テキストにおける実効的な優位性はかなり縮まるが、消えてなくなるわけではない。出力料金は最初のティアでは$0.50で同一なので、そこではトークナイザーの影響が何にも相殺されずにそのまま及ぶ。
測定結果は、この主張の正直な版だ。Artificial Analysis自身の集計では、Claude Haiku 5.5はIndexタスクあたり162,164出力トークンを生成し、GLM 5.3 Flashの68,673に対して2.4倍だった——それでも完了タスクあたり$0.21で、$0.25に対して優位だった。料率の優位は冗長性を生き延びており、その残りは料金表が示すより小さい。
この2つのうち、料金が定額として明記されているのは一方だけです。Claude Haiku 5.5の価格は、プロンプトが100,000トークンを超えると入力$0.50、出力$2.50に段階的に上がりますが、GLM 5.3 Flashには同等のしきい値が公表されていません。ほとんどのチャットやコード支援のトラフィックでは、この段階は決して適用されません。長文ドキュメントや大規模コンテキストのエージェント作業では常に適用され、その時点で比較は、第一段階の数値が示唆するものをはるかに超えて逆転します。

どの数字よりも先に、それを決めるセリフ
ここまでの話はすべて、これら2つのモデルを自由に選べることを前提としている。かなりの割合のチームにはそれができず、その理由は、ベンチマークの議論ではとかく埋もれがちなスペックシートのたった一行にある。
GLM 5.3 Flashはオープンウェイトで、MITライセンスの下で公開されており、総パラメータ数3200億、アクティブ180億です。ダウンロード、セルフホスト、ファインチューニング、量子化、バージョン固定が可能で、自分で管理するテナンシー内で実行できます。Claude Haiku 5.5はプロプライエタリかつAPI専用で、公開されたパラメータ数も、ライセンスも、リポジトリもありません。
要件定義書に、モデルは自社ハードウェア上で動作しなければならない、あるいは特定のチェックポイントが今後3年間呼び出し可能であり続けなければならないと書かれているなら、価格の列を読むまでもなく、この比較は終わっている。それは単なる形式的な話ではない。チームがそもそもオープンウェイトの中位モデルに行き着く最も一般的な理由であり、25ポイントのAutomationBenchの優位だけがZ.aiの方向へチームを引き寄せている唯一の要因ではない理由でもある。
逆方向にも同じことが当てはまり、そこでも同じ誠実さが求められる。AnthropicはClaude Haiku 5.5について、2027年10月より前には廃止しないという廃止コミットメントを公表しており、システムカードと文書化された評価セットを備えたファーストパーティAPIでこのモデルを提供している。オープンウェイトのリリースが自動的により長持ちするわけではない——重みとともに運用負担も引き継ぐことになり、ライセンスファイルはサポート契約ではない。そのどちらを望むかは、モデルではなくあなたのチームに関する問いだ。
両方を同じキーに割り当てて、実証的に決着をつけたいなら
GLM 5.3 Flash は OrcaRouter のカタログに Z.ai の定価で、0% のマークアップで掲載されており、ブレンドではなくパススルーされています。したがって、上記の料金は請求書上の料金であり、Z.ai が行う変更は同日に当社側へ反映されます。Claude Haiku 5.5 は当社のカタログには掲載されていません — Anthropic 独自の API を通じて利用可能です — そして、それを暗に示すよりも明言する方がよいのです。
カタログが容易にしてくれるのは、この対決が実際に求めているテストの形です。複合インデックスとエージェント的行の不一致はあなたのワークロードに関する仮説であり、それを解決する唯一の方法は、同じトレース上で両方のモデルを走らせることです。GLM 5.3 Flash をルートに、Anthropic 側のレッグを同じゲートウェイの反対側に置けば、それは2つの統合ではなく設定変更になります — 200以上のモデルに対応する1つのAPI、1つのキー、 自動フェイルオーバーがその下にあり、タスククラスごとにトラフィックを分割してコストを1枚の請求書から読み取りたいときにはルーティングDSLが使えます。

数字が裏付ける形で述べられた評決
あなたの作業がテキスト入力・テキスト出力で、プロンプトが最初の料金ティア内に収まり、実際のボリュームに対してトークン単位で課金しているなら、ここでは Claude Haiku 5.5 のほうが優れたモデルです。総合スコアは高く、完了したタスクあたりのコストは安く、タスクあたりの速度は2倍以上です。ターミナルベンチマークの見出しスコアは互角であり、何かを決める根拠にすべきではありません。
あなたの取り組みが、監督なしで多段階のワークフローを完了しなければならないエージェントであるなら、まさにそれを測定する唯一の共通ベンチマークにおいて、GLM 5.3 Flash は25ポイント先行しており、また、重みを保持できるため、2つのうち変更がより安価な方です。
0.32828 での同点は、このペアを表すのにふさわしいイメージだ。ただし、モデルが同等だからではない。それは、ほかにほとんど共通点がない2つのモデルが、たまたま同じ数字に行き着く唯一の行であり、その数字を比較の要約として扱うことこそ、表の中で最も情報量の少ない数値に基づいて調達判断が下されるやり方なのだ。
