
Claude Haiku 5.5 対 Gemini 3.7 Flash:この2つのうち、片方はすでに廃止されている
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
今日書かれるいかなるClaude Haiku 5.5対Gemini 3.7 Flashの比較の下にも、気まずい事実が横たわっている。Gemini 3.7 Flashは非推奨です。ベンダーは2026年8月13日にこれをリリースし、9月2日にGemini 3.8 Flashへ置き換え、Artificial Analysisは現在、3.7のページに非推奨フラグを付けて掲載している。対照的に、Claude Haiku 5.5は2026年10月7日に登場し、2027年10月より早くに廃止されることはないという確約を伴っている。
それは比較を無意味にするものではない。それは問いを変える。これはもはや「この二つのどちらを呼び出すべきか」ではない——ほとんどのチームにとって、その答えはどちらでもない。なぜなら3.7系はそれ自身のファミリー内で取って代わられているからだ。それが役立つのは、より微妙で、おそらくより有用なことだ。つまり、GoogleのFlashティアが3週間でどれだけ速く動いたか、そしてFlashティアモデルのスペックシートのどの部分が実際にそれが使われるかどうかを決めるのか、を明確に読み取れることだ。
まだ測定できるもの
両モデルは同じ独立した評価ボード上で実行されており、そこは両者をそもそも並べて比較できる唯一の場所だ。Artificial Analysis Intelligence Index v4.3.2 では、Claude Haiku 5.5 が Max 構成で 43.40 を記録するのに対し、Gemini 3.7 Flash は High 構成で 39.06 で、4.33 ポイントの差だ。
両社はそれぞれ独自の評価セットも公開しており、それらは直接比較できるような形では重複していない。共通の独立した行は、Artificial Analysis が両方で実行した4行である:
• Terminal Bench 4.0 — Claude Haiku 5.5 の 0.3283 に対し、Gemini 3.7 Flash は 0.1364。19ポイントの絶対差であり、このセット内で最も大きな非対称性だ。
• SciCode — 0.5498 対 0.5718。Gemini 3.7 Flash が 2.2 ポイント差で上回っています。
• Humanity's Last Exam — 0.4439 対 0.4787。Gemini 3.7 Flash が3.5ポイント差。
• AutomationBench、部分スコア — 0.3541 対 0.6203。Gemini 3.7 Flash が27ポイント差。
そのセットは注意深く読んでほしい。興味深い結果が含まれているからだ。Gemini 3.7 Flash は共通ベンチマーク4つのうち3つで勝利しながら、総合指数ではなお4.3ポイント負けている。指数は重み付きの合成であり、その重み付けは、ターミナルとコードの行——そこでは差が逆方向にはるかに大きな幅で開いている——を、他の項目の集計よりも優先している。これは採点上のアーティファクトというより、その指数が何のためのものかという表明である。つまり、モデルが仕事を最後までやり遂げられるかを予測しようとしており、その問いにおいて3.7系は弱かったのだが、それは、それなりの科学ベンチマークのスコアでは隠しきれないものだった。

3.7系が実際のところ何がダメだったのか
2つの行のほうがインデックスよりも雄弁に物語る。
Terminal Bench 4.0における0.1364は低い数字であり、同じモデルの前世代Terminal Benchでの0.8577と隣り合っている。それはモデルが悪化したのではなく、ベンチマークが測定対象を変えたのであり、Gemini 3.7 Flashはその移行に適応できなかったのだ。Claude Haiku 5.5は、同じ改訂版ベンチマークで0.3283を記録している――絶対値としては華々しくないが、エージェント型コーディング性能を最も直接的に予測する行において、3.7 Flashの数値のほぼ2.5倍だ。
2行目はTau-Bench Bankingで、ここではGemini 3.7 Flashが0.3278を記録しています。構造化された領域におけるツール利用の信頼性は、安価なモデルがまさに導入される目的そのものであり、0.33未満というスコアは、パイロットを静かに潰しかねない類の数字です。Claude Haiku 5.5は同じ表に公表されたTau-Benchの数値がないため、そこでは比較はできません——推測するのではなく、そう正直に述べるべきです。
Gemini 3.7 Flashが持ちこたえたのは、いつも持ちこたえてきたところだった。GPQA 0.9455とMMMU-Pro 0.8549はどちらも紛れもない強みであり、そのマルチモーダル入力が疑われたことは一度もなかった。失敗があったのは、エージェントループが機能するかどうかを決めるスペックシートの部分であり、リーダーボードの行を勝ち取る部分ではなかった。
その後の3週間で何が変わったのか
Gemini 3.8 Flashは2026年9月2日に登場しました。2027年のパイプラインを計画している人にとっては、Google自身のFlashティア内の動きのほうが、より有用な比較材料になります。
同じ指標で、Gemini 3.8 Flashは40.93を記録し、3.7系の39.06に対して3週間で1.87ポイントの向上となっている。Terminal Bench 4.0は0.1364から0.1970へ、Tau-Bench Bankingは0.3278から0.4495へと動いた。これらはまさに3.7モデルが最も苦手としていた項目であり、後継モデルが汎用的な能力向上ではなく、まさにこの弱点を狙って作られたことを示唆している。
価格はまったく動かなかった。Gemini 3.7 Flash は100万トークンあたり入力$0.75、出力$3.75で掲載され、Gemini 3.8 Flash も同じ$0.75と$3.75で登場した——同一の料金表が、エージェントにとって重要な項目でインデックスが2ポイント優れたモデルに付けられている。

この比較で本当に差がつくのは、料金表だ。
Claude Haiku 5.5と比べれば、Googleの価格がすべてを物語っており、しかもその差は僅差ではない。
• 入力 — Claude Haiku 5.5は100万トークンあたり$0.10(100,000トークンまで)、それを超えると$0.50。Gemini 3.7 Flashは一律$0.75、つまり第1ティア内ではAnthropic料金の7.5倍。
• 出力 — Claude Haiku 5.5 は第1ティア内で $0.50、それを超える場合は $2.50、Gemini 3.7 Flash は $3.75。
• キャッシュ済み入力 — Claude Haiku 5.5 は $0.01 と $0.125、Gemini 3.7 Flash は読み取り $0.075、書き込み $0.75。
• コンテキスト — 両方とも100万トークン。最大出力 — Claude Haiku 5.5 は128,000トークン、Gemini 3.7 Flash は65,536トークン。
• 入力モダリティ — Claude Haiku 5.5 はテキストと画像、Gemini 3.7 Flash はテキスト、画像、音声、動画。Google の仕様が厳密に長くなる唯一の項目は依然としてこれであり、3.8 への世代交代を経ても変わらず生き残っている。
• 完了した Index タスクあたりの独立コスト — Claude Haiku 5.5 が $0.21 であるのに対し、Gemini 3.7 Flash は $0.93。4.4 倍の差は、7.5 対 1 の入力比が示唆するよりも大きい。なぜなら、ここでは Anthropic のモデルの方が冗長だからだ。Index タスクあたりの出力トークン数は 162,164 で、Gemini 3.7 Flash の 58,387 に対してである。Anthropic はまた、Claude 4.7 以降と共有のトークナイザーを文書化しており、これは同じテキストに対して約 30% 多くのトークンを数えるもので、同じ方向に働く。
• 速度 — Indexタスク1件あたり、Gemini 3.7 Flash は212.3秒、Claude Haiku 5.5 は424.6秒。Googleのモデルは両者の中で2倍高速であり、このセクションで唯一、安価なモデルが同時により優れているわけではない項目である。
今日選ぶなら、これが意味すること
実用的な解釈としては、この二つのどちらも正解ではなく、それぞれ異なる理由があるということだ。
Gemini 3.7 Flashは非推奨であり、後継モデルと同じ料金に設定され、安価な本番モデルが必要とするまさにその行でその後継より劣っている。それを勧めることは、取って代わられたモデルに紐づく料金表を勧めることに等しい — 後継は同じ料金でより多くのことができる。2026年10月にこの2つのどちらかを選ぶ人が3.7系に行き着くべきではなく、その料金表が変わっていないという事実が決め手となる。
Claude Haiku 5.5は現行モデルで、テキスト入力・テキスト出力の作業では、あらゆる指標でより安価であり、総合スコアでも上回り、エージェント的成功を予測する2つの行では大幅に優れています。一方で、より遅く、音声や動画は受け付けません。それが重要かどうかは、モデルではなく、あなたのパイプライン次第です。
第三の選択肢は、3.8と3.7の間のインデックス・ポイントの差が可視化しているものだが、Googleのフラッシュ層の動きが十分に速いため、3週間前の比較はすでに過去のものになっている、というものだ。フラッシュ層の直接対決は、四半期ではなく週単位で測られる賞味期限を持つものとして扱え。
どちらの側に着地しても稼働する
Gemini 3.8 Flash — 非推奨となった 3.7 ではなく、その後継 — は、OrcaRouter のカタログに Google の定価、マークアップ 0% で掲載されています。つまり、Google が公表する料金がそのまま請求額になり、Google 側での変更は同日中に当社側にも反映されます。Claude Sonnet 5.5 と Claude Opus 5.5 もカタログに掲載されているため、2 社間のルーティングテストはプロジェクトではなく設定作業で済みます: 200 以上のモデルに対応する 1 つの API、1 つのキー、自動フェイルオーバーを基盤に備え、エスカレーションをコードではなくルートに持たせたい場合にはルーティング DSL も利用できます。
Gemini 3.7 Flash自体は当社のカタログには掲載されておらず、Claude Haiku 5.5も同様です。両者は各ベンダー自身のAPIを通じて、またGoogleの場合は複数のサードパーティプラットフォームを通じても引き続き利用できます。これは読者に自分で気づかせるのではなく、はっきりと明記しておく価値があります。

引く数
問題は4.33ポイントの指数差ではない。Gemini 3.7 Flashが共通の4つのベンチマークのうち3つで勝ちながら、総合スコアでは4ポイント負けたことだ。なぜなら、指数が最も重く重み付けしているベンチマークこそ、それで0.1364を記録したものだったからだ。フラッシュ級モデルの科学スコアは問題なく見えても、安価なモデルが買われる目的の点では失敗することがある。
その系論とは、後継モデルがまさにそれらの行を3週間以内に、価格を変えることなく修正したということだ。この証拠から言えるのは、この層における競争圧力は価格ではないということだ。それはモデルが多段階のタスクを完了できるかどうかであり、そしてそれは今や料金表が動くよりも速く動いている。
