
Claude Haiku 5.5 対 Gemini 3.6 Flash:回答あたりのコストは7.5倍、モデル性能は9ポイント低い
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Claude Haiku 5.5 と Gemini 3.6 Flashは、それぞれのラインナップの中で同じティア、つまり小型で高速、安価なものに位置している。だが、類似点はそこまでだ。Artificial Analysis Intelligence Index v4.3.2 では、Claude Haiku 5.5 はその Max 構成で 43.40 を記録し、Gemini 3.6 Flash はその High 構成で 33.98 だった。同じ実行では、Index タスクを 1 件完了するコストは Claude Haiku 5.5 で $0.21、Gemini 3.6 Flash で $1.60 である。
その2つはセットで読んでほしい。どちらか片方だけでは誤解を招くからだ。安い方のモデルは「わずかに安い」のではない。完了したタスク1件あたりで7.5倍安いのだ。そして、それが打ち負かしているモデルも「わずかに弱い」のではない。インデックススコアで9.42ポイント低く、182モデルが並ぶリーダーボード上では、それは第3四分位と中央との距離に相当する。
どちらの事実も同じ独立実行から得られたもので、ここではベンダーのカードがどちらも教えてくれないため、この点は重要です。Anthropic は 2026年10月7日に Claude Haiku 5.5 をリリースし、Google は 2026年7月21日に Gemini 3.6 Flash をリリースしました。両者の間の3か月こそが興味深い部分です。
2枚のカード、横に並んで
100万トークンあたりの米ドル表示。AnthropicとGoogleの料金は各社の料金ドキュメントに基づきます。共通の行はArtificial Analysis Intelligence Index v4.3.2です。キャッシュ日:2026-10-08。

• 入力 — Claude Haiku 5.5 は 100,000 トークンまで $0.10、それを超えると $0.50、Gemini 3.6 Flash は本日時点で $0.75 の一律料金、2027 年 1 月 1 日に $1.50 に値上げ。
• 出力 — Claude Haiku 5.5 は 100,000 トークンまで $0.50、それを超えると $2.50。Gemini 3.6 Flash は本日 $3.75 の定額で、同じ日に $7.50 へ値上がり。
• キャッシュ入力 — Claude Haiku 5.5 $0.01 および $0.05、Gemini 3.6 Flash $0.075、さらに 100万トークンあたり毎時 $0.50 のストレージ料金。
• コンテキストと出力上限 — どちらも100万トークン。Claude Haiku 5.5 はレスポンスを128,000トークンに制限し、Gemini 3.6 Flash は65,536トークン。
• モダリティ — Claude Haiku 5.5 はテキストと画像を扱う。Gemini 3.6 Flash はテキスト、画像、動画、音声、ファイルを扱う。これは Google 側が明確に優位に立つ唯一の項目であり、メディア理解のパイプラインでは、それが全体の判断を左右しかねない。
• 独立スコア — Claude Haiku 5.5(Max)の43.40に対し、Gemini 3.6 Flash(High)は33.98。
• 完了したタスクあたりのコスト — 同じ評価実行で、$0.21 対 $1.60。

なぜトークン単位ではなくタスク単位の数値を使うべきなのか
レートカード倍率はすでに入力で7.5、出力で7.5のように見えるので、タスクあたりの数値はここでは驚くには当たらない。しかし、一方の指標では2つのモデルが同じ結果になり、もう一方ではこれほどかけ離れる理由を示す価値はある。というのも、同じ計算がこのバッチの他の対戦では逆方向に働くからだ。
Gemini 3.6 Flash は二つのうちでより冗長性が低い方だ。Intelligence Index タスクあたり 41,606 出力トークンを生成する — 推論 20,061、回答 21,545 — 一方、Claude Haiku 5.5 は 162,164 で、内訳は推論 129,047、回答 33,118 である。Anthropic のモデルは同じ仕事をするのにほぼ4倍のトークンを費やし、しかも出力レートは Google の7分の1なので、トークン差とレート差は相殺されるどころか掛け合わされる。
その組み合わせ——安価な従量単価×大量利用——こそが、Claude Haiku 5.5 の経済性を正直に言い表したものであり、Anthropic 自身のローンチ記事もそのもう一方の側面を認めている。すなわち、このモデルは「最大100,000トークンのプロンプトを伴うタスクに使う場合に特にコスト効率が良く、そうしたタスクは当社の以前の Haiku モデルへのリクエストの約90%を占めている」という。100,000トークンを超えると、入力メーターは$0.50、出力メーターは$2.50になり、その時点で Gemini 3.6 Flash に対する倍率はおよそ1.5倍に縮まる。
この比較が停滞するなか、Google 自身のティアは何をしたのか
ここが、その記事が2つのモデルの比較ではなくなり、実際にどのGeminiと比較しているのかについての警告になるポイントです。
GoogleはFlashの価格を3世代にわたって据え置いてきた。Gemini 3.6 Flash、Gemini 3.7 Flash、Gemini 3.8 Flashはいずれも、Google自身の価格ドキュメント上で入力$0.75、出力$3.75と記載されており、キャッシュ料率も同じ$0.075、2027年1月1日の$1.50と$7.50への引き上げも同じだ。3.6系に関するGoogleの説明カードには「当社の前世代Flashモデル」と記されており、これはベンダー自身の言葉である。
動いたのは価格ではなく、スコアだった。独立系ボードでは、Gemini 3.6 Flashが33.98、Gemini 3.7 Flashが39.06、Gemini 3.8 Flashが40.93で、いずれも公開されている最高強度の構成における数値だ。GoogleのFlash階層内で、6週間のうちに9インデックスポイントが上がったが、料金はまったく変わっていない。
評価の途中にある人にとって、その帰結は具体的だ。3週間前に Gemini 3.7 Flash を相手にこの対決をベンチマークしていたなら、あなたの結果はすでに古い。そして Gemini 3.8 Flash を相手にベンチマークすれば、Claude Haiku 5.5 との差は 2.47 ポイントに縮まる。Gemini 3.6 Flash は、この比較のなかで Anthropic を最もよく見せるバージョンであり、同時に Google が最も販売から遠いバージョンでもある。
Artificial Analysisは3.6の項目を非推奨としてフラグを立てている。Googleの価格ドキュメントは依然としてその料金を掲載しており、モデル一覧も依然として3.6セクションへ誘導している。したがって、正直な解釈は「消えた」ではなく「10週間のうちに同じファミリー内で2回置き換えられた」ということだ——そしてそれは、このティアがどれほど速く動くかについての事実であり、比較を省く理由ではない。
これは実際に誰のために決まるのか
Gemini 3.6 Flash を推すべき確かな根拠はある。そしてそれはスコアではない。
プロンプトに音声や動画が必要なら、Claude Haiku 5.5 にはまったく対応できません — テキストと画像を読み取るだけで、それ以外は何もできません。Gemini 3.6 Flash はテキスト、画像、動画、音声、ファイルを読み取り、当社自身のカタログには、過去1週間で実測毎秒582出力トークン、初回トークンまでの時間の中央値が4.1秒と記録されています。これは Flash の基準からしても高速なモデルです。メディア理解パイプラインでは、モダリティの一覧こそが判断のすべてであり、インデックスの差は脚注にすぎません。
あなたの作業がテキストと画像なら、この算数は議論の余地がないほど差が開いている。入力が中心の7:2:1のブレンド——大半の本番トラフィックが取る形——で、Claude Haiku 5.5は100万トークンあたり0.077ドル、それに対してGemini 3.6 Flashは0.63ドルだ。1日あたりブレンドで100万トークンなら、77セント対6.30ドル、そして2つ目の数字は2027年1月1日にさらに悪化するが、1つ目はびくともしない。
100,000トークンの崖が、それを覆す唯一の条件だ。検索または長文書パイプラインが常時150,000トークンのプロンプトを組み立てるなら、リクエスト全体に対してAnthropicの$0.50/$2.50ティアを支払うことになり、その時点で両モデルの価格差は1.5倍以内に収まる一方、Gemini 3.6 Flashはモダリティと、Googleが128k平均でのマルチニードル検索について公表している91.8%という数値で依然として勝っている。それはベンダー報告であり未再現であって、まさにそのフレーミングに属する。

両方を呼ぶ、または片方を呼ぶ
Gemini 3.6 Flash は本日、OrcaRouter のカタログに登場しましたgoogle/gemini-3.6-flash として、Google の定価そのまま、マークアップ 0% で提供されます — $0.75 と $3.75、キャッシュ読み取りは $0.075 で、プロバイダーが課金する通りにそのまま適用されます。これはこの特定のモデルにとって重要な点です。なぜなら Google の 1 月 1 日の値上げは料金改定であり、パススルー型のカタログは次の契約更新時ではなく、実施されたその日に反映するからです。1 つの API キーと 1 回の SDK 呼び出しで、このモデルでもカタログ上の他の 200 以上ものモデルのいずれでも利用できるため、Google 側と Anthropic 側の A/B は、2 つ目の統合ではなく、モデル文字列の変更とその下で自動的に行われるフェイルオーバーで済みます。
Claude Haiku 5.5はカタログにありません。Anthropicのモデルは、Anthropic自身のAPI経由、およびAWS、Google Cloud、Microsoft Azure経由で利用可能です。これが正直なところ、すべてです。そのラインナップから当社が取り扱っているのはClaude Sonnet 5.5とClaude Opus 5.5であり、だからこそ、低コストの分類呼び出しから中位層のエージェント呼び出しへのエスカレーション経路は、プロジェクトではなくルーティングの判断になるのです。
そのため、結論は率直に述べられるほど単純だ。短いプロンプト長でのテキストと画像の作業では、Claude Haiku 5.5 が応答上限を除くすべての軸で勝利する。音声や動画を含むものについては、Gemini 3.6 Flash がこの2つのうち唯一、そもそも応答できるものだ。そして、その能力に対してGoogleの料金を払うつもりなら、どのGeminiに対して払っているのかを尋ねるべきだ。なぜなら、このティアでは同じ金額で、より新しい兄弟モデルから9ポイント多いインデックスポイントを得られるからだ。
200以上のモデルに対応する1つのAPI、1つのキー、自動フェイルオーバーがその下で機能するため、GoogleレッグとAnthropicレッグのA/Bテストは、2つ目の統合を追加するのではなくモデル文字列を変更するだけで済みます。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
