「インデックス2ポイントのために6倍のコスト」の生成されたヒーローカード。バッジは「タスクあたりのコスト」、キッカーは「2つのフラッシュ級モデル、1つのボード」、サブタイトルは「Intelligence Index v4.3.2で、Claude Haiku 5.5が43.40、Gemini 3.8 Flashが40.93」。4つのチップは「43.40 vs 40.93」「$0.21 vs $1.24」「$0.10 vs $0.75」「2027年1月1日に値上げ」と表示。下の2枚のカードには「Anthropicの優位性」(「共通ボードでより上位、そして完了タスクあたりのコストは6分の1」)と「Googleの優位性」(「音声と動画入力、そしてウィンドウ全体を通じた定額」)というラベルが付いている。フッターには「Artificial Analysisによる独立した測定値、定価は2026年10月8日時点」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.8 Flash:インデックスで2ポイント差、タスクあたり6倍のコスト

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Haiku 5.5とGemini 3.8 Flashは、計測された能力において、この価格帯の他のどの組み合わせよりも互いに近接している——Artificial Analysis Intelligence Index v4.3.2 で 43.40 対 40.93 であり、両モデルとも 225 モデルからなるボードのトップ 50 に入っている。両者を分けるのは、そのインデックスの 1 ポイントにかかるコストだ。同じ独立した計測において、Intelligence Index のタスクを 1 件完了するコストは Claude Haiku 5.5 で $0.21、Gemini 3.8 Flash で $1.24 である。

それは、スコアの2.5ポイント差に対して6倍の開きであり、この比較を決めるべき数字だ。それ以外のすべて——表示料金、モダリティの一覧、Googleの価格設定に付随する期限——は、周辺部についての議論にすぎない。

重要な数値で見た両モデル

100万トークンあたりの米ドル建て。AnthropicとGoogleの各社価格ドキュメントより。独立した測定値はArtificial Analysisによるものです。キャッシュ日:2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.8 Flash - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.8 Flash reads input $0.75 now and $1.50 after January 1 2027, output $3.75 and $7.50, cached input $0.075 plus storage, maximum output 65,536 tokens, input modality text images speech and video, Intelligence Index v4.3.2 40.93, cost per task $1.24. A footer reads 'Vendors' published list rates; Google's lower rate runs through December 31, 2026; independent scores from Artificial Analysis.'

• 入力 — Claude Haiku 5.5 は10万トークンまで0.10ドル、それを超えると0.50ドル。Gemini 3.8 Flash は一律0.50ドル、2027年1月1日に1.50ドルに値上げ。

• 出力 — Claude Haiku 5.5 は 100,000 トークンまで $0.50、それ以上は $2.50;Gemini 3.8 Flash は $3.75 定額、同日に $7.50 に上昇。

• キャッシュ入力 — Claude Haiku 5.5 $0.01および$0.05、Gemini 3.8 Flash $0.075、さらに100万トークンあたり1時間$0.50のストレージ料金。

• コンテキスト — 両方とも1Mトークン。最大出力 — Claude Haiku 5.5は128,000トークン、Gemini 3.8 Flashは65,536トークン。

• 入力モダリティ — Claude Haiku 5.5 はテキストと画像、Gemini 3.8 Flash はテキスト、画像、音声、動画。Google のリストが厳密に長くなるのは、この一行だけだ。

• 独立系スコア — Intelligence Index v4.3.2 において、Claude Haiku 5.5(Max)が43.40、Gemini 3.8 Flash(High)が40.93。

• タスクあたりの独立コスト — 同じボードで$0.21 対 $1.24。

• 速度 — 毎秒241.9出力トークン(125.2に対して)、いずれもArtificial Analysisによる測定。

6倍という数字はどこから来ているのか

タスクあたりコストの差は、表示価格の差よりも大きい。そしてそこが興味深い点だ。なぜなら、それは料金表だけでは説明できないことを意味するからだ。

表示価格の計算はきわめて単純だ。入力では$0.10対$0.75で7.5倍安く、出力では$0.50対$3.75で同じ比率になる。両モデルが同じ作業で同じトークン数を生成するなら、その比率はそのまま請求額に反映される。

それはそのまま当てはまらず、どちらの効果もGoogleに有利に働く。Claude Haiku 5.5は、そのベンダー自身が認めるほど冗長だ。Artificial Analysisは、Indexを実行中に4億4,000万出力トークンを記録した(中央値は1億)とし、このモデルを非常に冗長だと評している。Gemini 3.8 Flashは中央値8,100万に対して1億7,000万を生成した。これも冗長と指摘されているが、トークン数は3分の1だ。Anthropic自身のドキュメントは2つ目の効果を加えている。Claude Haiku 5.5はClaude 4.7以降と共有される新しいトークナイザーを使用するため、同じテキストが、それが置き換えるモデルより約30%多くトークンとしてカウントされる。

まとめると、価格に関する主張の正直な版はこうだ。入力レートで10対1、出力レートで7.5対1の優位があり、それが回答あたりにより多くのトークンを書くモデルによって一部食われ、仕事全体に課金する測定では6対1の優位に落ち着く。それでも圧勝であり、料金表が示唆するよりも小さい圧勝だ。

Googleの価格には日付が付いている

Googleの料金ページで最も役立つのは、ほとんどの比較表が省いてしまう一文だ。

Gemini 3.8 Flash は、「2026年12月31日まで」は入力 $0.75、出力 $3.75 と記載され、「2027年1月1日から」は入力 $1.50、出力 $7.50 と記載されています。キャッシュ入力は同じ日付に $0.075 から $0.15 へ変わります。これは、この執筆時点からおよそ11週間後に迫った有効期限がそのすぐ隣に明記された導入料金です。

Anthropicのカードには、そのように読み取れる記述は一切ない。Claude Haiku 5.5の料金は料金として明示されており、カレンダーではなくプロンプト長に紐づく2段階構造をとり、退役については2027年10月7日より早くは行わないというコミットメントが示されている。来年にまたがるパイプラインをモデリングしているなら、Googleの1月のステップは倍増であり、モデルに組み込むべきだ。Anthropicの側には、計画すべき同等のイベントは存在しない。

それはどちらにも当てはまる。公平に読めば、「一方のベンダーは誠実で、もう一方はそうではない」ということにはならない。プロモーション価格は、それが続く限り実際の価格であり、Googleには新製品の投入をそのように価格設定する権利がある。1月の数字のうち安く見える側に期限があるというのは、単に比較についての事実にすぎない。

A screenshot of Anthropic's model documentation showing the Claude Haiku 5.5 specifications row and the published pricing table beneath it, with the per-million-token input, output and cache rates and the prompt-length threshold at which the second tier begins.

インデックスの2ポイントにはどのような価値がありますか?

指数が60台まで達するスケールにおける2.47ポイントの差は、丸め誤差ではなく、深い断絶でもない。両モデルは同じ実用帯域に位置しており、実践的な問いは、その差が実際に自分が実行するタスクで surface するかどうかだ。

ベンダー自身の数値では、両者は同じハーネスで測定されていないため、直接並べて比較することはできない——AnthropicはClaude Haiku 5.5向けにGDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0、FrontierCodeの結果を公開しており、GoogleはGemini 3.8 Flash向けに独自の結果一式を公開しているが、どちらのベンダーも相手のスイートを実行していない。利用可能な唯一の同一条件比較は独立系のボードであり、そこでの答えは、Anthropicが測定可能ながら小さい差で先行しているというものだ。

一部のチームにとってより重要になる能力差は、モダリティの違いにある。Gemini 3.8 Flashは音声入力と動画入力を受け付けるが、Claude Haiku 5.5はテキストと画像を受け付ける。通話録音や画面キャプチャをネイティブに取り込むパイプラインは、この2モデルを価格で選んでいるわけではまったくない。一方は、その前段に文字起こしまたはフレーム抽出のステップを置かなければその仕事をこなせず、そのステップには独自のコストと独自の障害モードがある。

ペアの割安な側を運用する

Gemini 3.8 Flash は OrcaRouter のカタログに Google の定価で、マークアップ 0% で掲載されています。これはここでは通常以上に重要です。プロバイダーの料金はブレンドされるのではなくそのまま反映されるため、1月のステップが請求額に実際に何をもたらすかを知りたい場合、Google の料金が動けば数字も動きます。Claude Sonnet 5.5 と Claude Opus 5.5 もカタログに掲載されており、そのため三者間ルーティングテスト — Google の Flash レッグ、Anthropic の中間ティア、そして後に Anthropic の小規模ティア — は、プロジェクトではなく設定になります。1つのキー、1つの SDK、その下での自動フェイルオーバー、そして エスカレーションをアプリケーションコードではなくルートで表現したい場合のルーティング DSL。

Claude Haiku 5.5 自体はまだカタログに載っていません。曖昧なままにしておくより、そう言い切るほうがよいでしょう。この比較の Anthropic 側は現在 Anthropic でしか利用できませんが、Google 側は上記の価格で本日当社から呼び出すことができます。

A screenshot of the OrcaRouter catalogue page for Gemini 3.8 Flash, showing the model identifier in provider-slash-model form, the provider Google, the model description and a stat strip carrying the per-million-token input and output rates alongside the context window and maximum output.

どちらを、そして誰のために

あなたの作業がテキスト入力とテキスト出力だけで完結し、プロンプトが100,000トークン未満に収まり、実際の大量利用に対してトークン単位で支払っているなら、Claude Haiku 5.5 は、本記事で取り上げるあらゆる指標においてより安価なモデルであり、唯一共通の評価ボードにおいてより高スコアのモデルでもある——ただし、その優位性はタスクあたりコストで6倍であり、表示価格が示唆する10倍ではないという留保付きだ。

オーディオやビデオの入力が必要な場合、65K超の応答が必要な場合、あるいはプロンプトが日常的に長くなる場合、計算は変わってきます。Gemini 3.8 Flash は Ant​hropic の小規模ティアでは扱えない入力を受け付け、100,000トークンを超えると Ant​hropic 自身の第2ティアは Google の定額料金をはるかに上回る価格設定になります。

唯一押さえておくべきは日程だ。Googleの料金は年末まで有効で、その後は2倍になる。Ant​hropicの料金は、長さに応じた段階付きの定額として示されている。どちらに判断が落ち着くにしても、パイプラインを組む前にカレンダーをスプレッドシートに組み込め。