「トークンあたりは安く、回答あたりは高く」の生成ヒーローカードで、バッジは「回答あたりのコスト」、キッカーは「安価な2つのティア、1つの共通ボード」、サブタイトルは「Intelligence Index v4.3.2で、Claude Haiku 5.5が43.40、Gemini 3.5 Flash-Liteが22.2」。4つのチップは「43.40 vs 22.2」「$0.21 vs $0.12」「$0.10 vs $0.30」「$0.50 vs $2.50」。下の2つのカードには「ANTHROPICの強み」(「共通ボードで21ポイント高く、両方のメーターで安い」)と「GOOGLEの強み」(「完成したタスクあたりでは安く、動画と音声にも対応」)というラベルが付く。フッターは「スコアとタスクあたりのコストはArtificial Analysisによる独立系のもので、定価は2026年10月8日時点。」。OrcaRouterのロゴが右下に合成されている。
Guides & Insights

Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite:トークンあたりでは安いが、回答あたりでは高い

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Claude Haiku 5.5は、100万入力トークンあたり0.10ドル、100万出力トークンあたり0.50ドルかかります。Gemini 3.5 Flash-Liteは、同じ2つの指標で0.30ドルと2.50ドルかかります。Anthropicモデルは、入力価格が3分の1、出力価格が5分の1で、Artificial Analysis Intelligence Index v4.3.2では43.40対22.2を記録しています。10点が世代を画する飛躍となる分野では、20点を超える差です。料金表ではこれは接戦ではありませんし、能力面でも接戦ではありません。

請求書の上ではほぼ互角の比較となり、しかも結論は逆になります。両モデルを同じ独立系のベンチマークに載せ、トークンではなく完了したタスクごとに課金して比べると、Gemini 3.5 Flash-Lite のほうが回答あたりのコストが安くなります。Artificial Analysis によると、Claude Haiku 5.5 は Intelligence Index のタスクあたり $0.21、Gemini 3.5 Flash-Lite は $0.1235 で、トークンを出力するごとに5倍多く支払うモデルが 1.7 対 1 で優位に立っています。

その逆転こそが、この比較のすべてだ。Claude Haiku 5.5 は、Anthropic がこれまでに投入した中で最も安価なティアを置き換え、共有ボード上ではその周辺のあらゆるものを打ち負かしている。Gemini 3.5 Flash-Lite は 2026年7月21日にリリースされ、夏以降この価格帯でコスパの良い選択肢であり続けている。購入者が実際に抱く疑問は、どちらが優れているかではない。その答えはすでに決まっているからだ。そうではなく、低コストで返ってこなければならないリクエストの前に、どちらを置くかである。

以下はすべて、100万トークンあたりの米ドル表示です。リスト価格はベンダー自身が公表した料金です。Artificial Analysis に帰属する独立スコア、タスクあたりコスト、速度測定値は、同評価機関によるものです。Gemini 3.5 Flash-Lite のレイテンシ数値は、当社のメータリングに基づくものです。モデル記録に数値が記載されている場合、当社はベンダー側ではなく評価者側の情報源を支持しています。

ステッカーと請求書の内容が一致しません

タスクあたりのコスト差は料金表では説明がつかず、その差が生じる理由は、どちらかのモデルが本番環境に近づく前に知っておく価値がある。

Claude Haiku 5.5は冗長で、評価者もその点を明言しています。Artificial AnalysisがIntelligence Indexを実行した際、このモデルから4億4,000万の出力トークンが記録されました。これは全体の中央値である1億トークンに対してのもので、非常に冗長だと指摘されました。思考は出力として課金され、思考はデフォルトで有効であり、エフォートダイヤルはmediumから始まります。また、入力単価が安くても、請求の大部分が出力であるワークロードには役立ちません。

Gemini 3.5 Flash-Lite も簡潔ではないが、ジョブあたりのコストは測定可能なほど低い。同じボードは、完了したインデックスタスクあたり 17,507 の出力トークンを記録している——そのうち 10,405 が推論で、7,102 が回答だ。これを Ant​hropic モデルのトークン量と突き合わせると、計算がはっきりする。出力レートにおける 5 対 1 の優位は、より大きな応答を生成するモデルによって部分的に相殺され、タスクレベルで残るのは、大きな優位ではなく小さな劣位である。

同じ方向に働く、より静かな第二の効果がある。Ant​hropicのドキュメントによると、Claude Haiku 5.5はClaude 4.7以降と共有のトークナイザーを使用しているため、同じテキストは、これが置き換えるモデルで数えられた場合より約30%多くのトークンとしてカウントされる。レートはGoo​gleのティアに対して3分の1に下がった。トークン数は下がらず、同じテキストでは増えた。

重要な数値で見た両モデル

キャッシュ済みの料金と定価は、Ant​hropicおよびGoo​gle自身のドキュメントに基づくもの。独立系の数値はArtificial Analysisに帰属。ライブのレイテンシは当社自身の7日間のトラフィックウィンドウから取得。キャッシュ日: 2026-10-08。

A generated scoreboard titled 'Claude Haiku 5.5 vs Gemini 3.5 Flash-Lite - on the numbers that matter'. Claude Haiku 5.5 reads input $0.10 under 100K and $0.50 above, output $0.50 and $2.50, cached input $0.01 and $0.05, maximum output 128,000 tokens, input modality text and images, Intelligence Index v4.3.2 43.40, cost per task $0.21. Gemini 3.5 Flash-Lite reads input $0.30, output $2.50, cached input $0.03, maximum output 65,536 tokens, input modality text images video audio and files, Intelligence Index v4.3.2 22.2, cost per task $0.12. A footer reads 'Vendors' published list rates; independent scores and cost per task from Artificial Analysis.'

• 入力 — Claude Haiku 5.5:100,000トークンまで$0.10、それを超えると$0.50。Gemini 3.5 Flash-Lite:1,048,576トークンのウィンドウ全体で$0.30の定額。

• 出力 — Claude Haiku 5.5 は100,000トークンまで$0.50、それを超えると$2.50。Gemini 3.5 Flash-Lite は$2.50の定額。

• キャッシュ入力 — Claude Haiku 5.5 は 100,000 トークンまで $0.01、それを超えると $0.05。Gemini 3.5 Flash-Lite は $0.03。キャッシュ書き込みは Claude Haiku 5.5 の場合、100万トークンあたり $0.125 および $0.625。

• コンテキストと出力 — それぞれ100万トークン。最大出力は Claude Haiku 5.5 が128,000トークン、Gemini 3.5 Flash-Lite が65,536トークンなので、Anthropic の上限はおよそ2倍です。

• 入力モダリティ — Claude Haiku 5.5 ではテキストと画像、Gemini 3.5 Flash-Lite ではテキスト、画像、動画、音声、ファイル。どちらもテキストを返します。

• 独立スコア — Claude Haiku 5.5 (Max) は 43.40 で、Intelligence Index v4.3.2 において 182 モデル中 2 位。一方、Gemini 3.5 Flash-Lite は 22.2 で、147 モデル中 96 位、同ボードの 34 パーセンタイル。

• タスクあたりの独立コスト — 同じボードで $0.21 対 $0.1235。

• スループット — Artificial AnalysisがClaude Haiku 5.5について測定した241.9出力トークン/秒に対し、Gemini 3.5 Flash-Liteは私たち自身のプレイグラウンドで過去7日間に測定された280.0。これは2つのハーネスであり、1つではない。したがって、競争としてではなく、桁の目安として読んでほしい。

二十一の点、そしてそれらが何でできているか

60台に達する指標での21ポイント差はマージンではない。それは、エージェント的ループを回せるモデルと、明確に指定された単一の呼び出しを渡すべきモデルとの違いだ。

2社は互いのハーネスを測定していないため、自社のスイート同士を並べて比較することはできない。AnthropicはClaude Haiku 5.5についてGDPval-AA v2.1、OSWorld 2.1、Terminal-Bench 4.0、FrontierCodeの結果を公開しており、GoogleはFlash-Liteティア向けに独自の結果一式を公開しているが、どちらも相手のものは実行していない。唯一可能な同一条件での比較は独立系のボードであり、そこではAnthropicのモデルが大差で先行している。

評価者によるGemini 3.5 Flash-Liteのサブスコアは、そのティアの輪郭を記録に残した。GPQA Diamondで83.8%、SWE-Bench Proで54.2%、Terminal-bench 2.1で54%、SciCodeで41.3%、MLE-Benchで39.2%、そしてHumanity's Last Examで18.8%を記録している。これらは有能で安価な汎用ティアの数値だ — 知識問題には強いが、最も難易度の高い推論と研究の評価では明らかに後れを取っている。総合スコア43.40のClaude Haiku 5.5は、まったく別の帯域に位置しており、実用的な読み方は、長期的な視野にわたる多段階の計画を必要とする作業は、Goo​gleのティアにはまったく向かない仕事だということだ。

ウィンドウが100万トークン、回答が65,536トークン

2つのコンテキストウィンドウは同じサイズですが、同じ製品ではありません。

Gemini 3.5 Flash-Lite における長文コンテキストは、距離が離れるにつれて劣化する。その度合いは、信頼する前にコストとして見積もっておく価値がある。8つのニードルを使う検索評価である GDM-MRCR v2 では、ニードルが128,000トークン以内に収まっている場合は平均72.2%、100万トークンのポイントワイズ版では21.3%となる。Long-Context Recall の数値は76%、CharXiv Reasoning はツールなしで74.5%、ツールありで76.5%だ。100万トークンのウィンドウは確かな能力だが、その遠端から確実に検索できることはそれより小さな能力であり、上記の2つの数字はその隔たりを示している。Claude モデルのウィンドウは、同じベンチマーク上で同じ方法では測定されていないため、同等の数値は存在せず、本稿がそれをでっち上げることはない。

出力上限は、よりすぐに役立つ違いです。Claude Haiku 5.5 は1回の応答で128,000トークンを出力しますが、Gemini 3.5 Flash-Lite は65,536で止まります。得たい成果物が長いファイル、完全な移行、生成されたテストスイート、文字起こし規模の書き換えである場合、これら2つのモデルの一方は1回の呼び出しでそれを生成でき、もう一方はできません — そして、2回の呼び出しに分割されたジョブは1回の呼び出しの2倍を超えるコストがかかります。なぜなら、共有プレフィックスが2回送信されるからです。

A screenshot of the Artificial Analysis model page for Gemini 3.5 Flash-Lite, showing the model name over the provider Google, the release month July 2026, a one-million-token context window, the input modality list covering text, image, video, audio and PDF, an Intelligence Index v4.3.2 score of 22, the per-million-token input and output rates with the cached-input discount, and the measured output speed, total response time and cost per task.

音声と映像は価格の問題ではない。

Gemini 3.5 Flash-Liteは、動画、音声、ファイルをテキストと同じレートで受け付けます。Claude Haiku 5.5は、テキストと画像を受け付けます。

録音された通話、画面キャプチャ、監視映像を取り込むパイプラインにとって、重要な能力差は21の指標ポイントではない。重要なのは、これらのモデルの一方は入力を直接受け取るのに対し、もう一方はその前段に文字起こしまたはフレーム抽出のステージを必要とする点だ。つまり、2つ目のモデル、2つ目の請求、そしてソースと答えの間に横たわる新たな障害モードである。その立場にあるチームは、安価な2つのティアを選んでいるのではない。1つのモデルと1つのパイプラインを選んでいるのだ。

文書については逆のことが成り立つ。両モデルともネイティブに読み取り、Claude Haiku 5.5 は総合スコアで43.40を出している。したがって、音声を含まないページ画像抽出や図の理解といったワークロードは、モダリティの議論ではなく、数値の上ではAnthropic側に属する。

ここから2つのうちの1つを実行する

Gemini 3.5 Flash-Lite は、OrcaRouter のカタログに Goo​gle の定価のまま、0% のマークアップで掲載されています。つまり、プロバイダーの料金はブレンドされるのではなくそのまま反映され、Goo​gle のレートカードの変更は、それが反映されたその日に御社の請求書にも反映されます。Goo​gle の階層も、同じくカタログに掲載されている Claude Sonnet 5.5 や Claude Opus 5.5 と並んで、1 つのキーと 1 つの SDK で扱えます。したがって、Goo​gle Flash-Lite のレッグと Ant​hropic のレッグの間で A/B を取ることは、もはや統合プロジェクトではなく、すでに設定のひとつです。その下には自動フェイルオーバーがあり、どちらのレッグも単一障害点にはならず、ルーティング DSL がルート内でエスカレーションを表現しますロジックがそこに属するのであれば、

そのレッグのレイテンシプロファイルは、ベンダーの測定ではなく当社自身の測定に基づいています。過去7日間のライブトラフィックを通じて、Gemini 3.5 Flash-Lite は毎秒280出力トークンで p50 2,426ミリ秒、p95 8,600ミリ秒を維持し、エラー率は0.313%でした。これは約束ではなくローリングウィンドウとして読んでください。トラフィックやプロバイダーの状況に応じて変動し、特定のパイプラインで信頼すべき数値は、1週間後に自分で計測したものです。

A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing the Anthropic model name and an October 2026 release, Intelligence Index v4.3.2 of 43 ranking second of 182, speed ninth of 182 at 241.9 output tokens per second, a $0.21 cost per task, input $0.10 and output $0.50 per million tokens, and a one-million-token context window.

Claude Haiku 5.5 はカタログにありません。2026年10月7日に提供開始されました — これが書かれる前日のことです — そして現時点で当社からはルーティングできません。そのため、この比較のAnthropic側は現在Anthropicでしか利用できません。それを明言するほうが、暗にほのめかしておくよりよいのです。モデルが提供開始されることと、当社を通じて呼び出せるようになることの間にはギャップがあるのが普通であり、それがいつ解消されるかを約束するものではありません。移行を計画している読者は、自分が望むカレンダーではなく、自分に見えるカレンダーを基準に計画すべきです。

どちらを、そして誰のために

テキスト入力・テキスト出力の作業で、プロンプトが100,000トークン未満に収まり、タスクに多段階の計画立案や長期ホライズンのエージェントが必要なら、Claude Haiku 5.5 のほうが21ポイント上回るより強力なモデルであり、トークンあたりでは3〜5分の1と安価なモデルです。予算は料金表ではなくタスクあたりのコストで組み、独立系ボードが測定する種類のジョブではおよそ$0.21を見込み、何かを予測する前にプロンプトを数え直してください。トークナイザーの変更だけでカウントが約30パーセント動くのですから。

作業が短く、大量で、答えの形をしている——タグ、カテゴリ、抽出、ガードレールの判断——なら、算術は Gemini 3.5 Flash-Lite に有利に働き、しかもそれは地味な理由による。ごくわずかしか出力しない呼び出しの請求額は入力が支配的で、2つの入力料金は $0.30 対 $0.10、そして Google モデルのはるかに短いタスクフットプリントのおかげで、表示価格では負けていても、より安い料金が最終的な仕事を制する。動画、音声、ファイル入力を加えると、選択はもはや価格の話ですらなくなる。

この組み合わせが実際に明らかにするのは、「新しいHaikuは安い」ということよりも、もっと限定的なことだ。それは、安価な階層の見出し料金は、その階層にかかるコストを知るための手がかりとしては乏しいということであり、料金ページでは3倍高く見えるモデルのほうが、請求額を小さくできるということだ。どちらに転ぶにせよ、測るべきは送信するトークンではなく出力するトークンだ。なぜなら、これら2つのモデルではどちらも、請求書が実際に書かれているのはそちらのメーターだからだ。