
Claude Haiku 5.5 対 GPT-6 Luna:同じ定価、請求額は3倍
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
Claude Haiku 5.5とGPT-6 Lunaは、表面上は同一価格だ。入力100万トークンあたり0.10ドル、出力100万トークンあたり0.50ドル——セント単位まで同じその2つの数字を、めったに意見が一致しない2社が提示している。Anthropicのローンチ投稿は、Lunaのスコアを自社のスコアの隣の列にまで載せているが、これは、脅威にならないと見なしているモデルについてベンダーがするようなことではない。
2つのカードは、ステッカーが隠しているすべての点で大きく異なる。Lunaはその料金を272,000トークンまで据え置き、それを超えると引き上げる。Claude Haiku 5.5は100,000で切り替わる。Claude Haiku 5.5はArtificial Analysis Intelligence Index v4.3.2で43.40を記録し、Lunaは38.12。完了したIndexタスク1件あたりのコストはClaude Haiku 5.5が0.21ドル、Lunaが0.07ドル。同じ価格で、請求額は3倍、知能は5ポイント上。これがこの取引のすべてであり、この価格帯のほとんどの直接対決より、ずっと明快だ。
2枚のカード、横並び
100万トークンあたりの米ドル価格。AnthropicとOpenAIの公開料金を当社のカタログに反映したものに基づき、独立した測定値はArtificial Analysisに帰属します。2026-10-08にキャッシュ。

• 入力 — Claude Haiku 5.5 は $0.10(100,000トークンまで)、それを超えると $0.50。GPT-6 Luna は $0.10(272,000トークンまで)、それを超えると $0.20。
• 出力 — Claude Haiku 5.5 は100,000トークンまで0.50ドル、それを超えると2.50ドル。GPT-6 Luna は272,000トークンまで0.50ドル、それを超えると0.75ドル。
• キャッシュ入力と書き込み — 最初のしきい値まではどちらも $0.01 と $0.125、Claude Haiku 5.5 は 100,000 トークンを超えると $0.05 と $0.625 に、GPT-6 Luna は 272,000 を超えると $0.02 と $0.25 に。
• コンテキストと出力 — どちらも1Mトークン、両方とも最大出力128,000。この2つは本当に同じ形だ。
• 思考 — 両方で適応型、どちらも effort パラメータ付き。Claude Haiku 5.5 のデフォルトの effort は medium。公開されているスコアのすべてがその設定でのものというわけではありません。
• 独立系スコア — Claude Haiku 5.5 (Max) 43.40、182モデル中2位。GPT-6 Luna (Max) 38.12、182モデル中8位。
• タスクあたりの個別コスト — $0.21 対 $0.07
速度 — 同じ評価ツールによる測定で、1秒あたり241.9出力トークン対129.4。
しきい値とは、違いがあるところです
両ベンダーは2段階の料金表を構築した。それを設定した位置は大きく異なっており、その配置は一番上の数字よりもはるかに重要だ。
Anthropicの段階は100,000トークンに設定されている。それを下回る場合は$0.10と$0.50を支払い、上回る場合は5倍と5倍——$0.50と$2.50を支払う。Anthropicによると、しきい値を下回るプロンプトは以前のHaikuモデルへのリクエストの約90%を占めていた。これはベンダー自身のトラフィック構成であり、一般に短いコールのワークロードを妥当に表す説明でもある。
OpenAIの段階は272,000トークンにある。その下では、$0.10と$0.50——Anthropicと同一。その上では、$0.20と$0.75で、2倍と50%の増加。これははるかに緩やかな段階で、しかも始まるのはほぼ3倍先だ。
200,000トークンのプロンプトを考えてみてください。これは長文ドキュメントのパイプラインとしてはあり得る規模で、100万トークンのウィンドウならまったく妥当です。Claude Haiku 5.5では、そのリクエストは第2ティアで課金されます。入力 $0.50、出力 $2.50です。GPT-6 Lunaでは、入力 $0.50、出力 $0.50です。同じリクエストに対して、同じ表示価格の2つのモデル間で、入力料率が5倍、出力料率も5倍になります。これは細かい違いではありません。長いプロンプトのワークロードにとっては、それこそが比較のすべてです。
同じ料率なのに請求額が3倍になる理由
タスクあたりのコストこそが、大量処理パイプラインの可否を決めるべき数値であり、ここで両モデルは、料金表では説明のつかない形で袂を分かつ。
Artificial AnalysisはGPT-6 Luna(Max)をIntelligence Indexタスクあたり0.07ドル、Claude Haiku 5.5(Max)を0.21ドルと評価している——同一の表示料金で3倍、スコア差は5.28ポイントだ。原因は同じページにあり、決して微妙な話ではない。Claude Haiku 5.5はIndexを実行する際に4億4,000万の出力トークンを生成したのに対し、中央値は1億で、評価者はそれを非常に冗長と評している。GPT-6 Lunaは同じ1億の中央値に対して1億4,000万を生成し、やや冗長と評されている。出力が課金を支配する指標である以上、3倍の出力トークンは3倍の請求額になる。
Anthropic自身の数値も同じ方向を指している。ベンダーのコスト対精度チャートでは Haiku 5.5 がエフォート範囲全体にわたってプロットされており、ローンチ時のプルクオートでは、複雑なエージェント型コーディング作業には Sonnet 5.5 と Opus 5.5 が依然としてより良い選択肢であり、代わりに Haiku 5.5 はコンパクション、要約、サブエージェント向けに位置づけられている。ジョブが小さいほど、その冗長性の問題を抱え込む度合いは小さくなる——そしてそれはまさに、このモデルが作られたワークロードであり、3倍のコスト差を、ボードのものではなく自分のログと照らし合わせて確認する価値があるまさにそのワークロードなのだ。
台帳にもう1件、評価者のものではなくAnthropicのドキュメントによるもの:Claude Haiku 5.5は、Claude 4.7以降と共有されている新しいトークナイザーを使用しているため、同じテキストは以前のHaikuより約30%多いトークンとしてカウントされます。料金はLunaと同じですが、トークナイザーは同じではありません。

Anthropic自身の表がLunaについて述べていること
Anthropicのローンチページでは、ベンチマーク表の1列としてGPT-6 Lunaを実行しており、それを誠実に報じる方法は出典表示を添えることだ。つまり、これはAnthropicによる評価であり、Anthropicのハーネス上で、競合他社のモデルに対して実行されたものである。これらはベンダー報告であり、独立に再現されたものではない。そして、ベンダーが自社のスイートを競合のスコアに対して実行したものは、そのまま受け入れるのではなく、吟味すべき比較である。
• ナレッジワーク — GDPval-AA v2.1では、Claude Haiku 5.5が1620、GPT-6 Lunaが1437。AA-Briefcase v1.1では、1578に対して1336。
• コンピュータ操作 — OSWorld 2.1 オフラインサブセットで 72.4% 対 48.9%。
• エージェント型コーディング — Terminal-Bench 4.0 は 16.4% に対して 39.2%、FrontierCode 1.1(Main)は 42.4% に対して 46.4%。
• 視覚的推論 — Chartography はツールなしで 46.4%、対して 29.1%。
ベンダー自身のハーネスでは、Claude Haiku 5.5 がすべての行で首位に立つ。独立系のボードでは、より小さい差で首位に立つ — 43.40 対 38.12 — これはベンダーの表と第三者による表の間でよく見られる関係であり、ここに両方を掲載している理由でもある。両者は方向性では一致し、大きさでは一致しない。
その法案が決め手となる一票だ
実際に重要な4つの事実を突き合わせてみれば、ほとんどのワークロードにおいてその選択はもはや僅差ではなくなる。
GPT-6 Luna は、独立した測定において、完了したタスクあたりのコストが3分の1で、最初の価格帯はコンテキストウィンドウを18倍先までカバーし、しきい値超過率は両方の指標で低く、長コンテキストのペナルティが5倍ではなく2倍の増加で済むのは、両者のうちこれだけである。Claude Haiku 5.5 は、測定された知能で確かだが控えめな差をつけて先行し、出力ではほぼ2倍高速で、そして——差が最も大きく開くベンダー自身のハーネス上では——公開されているすべてのベンチマーク行で先行している。
呼び出しが短い場合、スループットが制約になっている場合、あるいは品質差が自分の評価で見えてくる場合は、3倍払おう。呼び出しが長い場合、機械生成で人間が読まない場合、または1日に100万回も発火する分類ティアを動かしている場合、同じ$0.10と$0.50で、もう一方では請求額が3分の1になり、犠牲にする能力は、両モデルがそろって上位付近に付けているボードでの5ポイントだ。
どちらも 1 か所から呼び出す
ここまで僅差の比較で助かるのは、当社の見解も含め、誰の言葉も鵜呑みにする必要がないはずだという点です。GPT-6 Luna は本日、OrcaRouter のカタログにプロバイダー料率のままマークアップ 0% で掲載されています — 上に記載したのと同じ料率体系で、混ぜ合わせではなくそのまま適用されます — Claude Sonnet 5.5 と Claude Opus 5.5 も同様なので、安価なレッグから中間ティアへのエスカレーションのテストは、プロジェクトではなく設定次第で済みます。キーは 1 つ、SDK も 1 つ、その下で自動フェイルオーバー、そしてエスカレーションがアプリケーションではなくルートに属するならルーティング DSL。
Claude Haiku 5.5はまだカタログに載っていない。それをはっきり述べることは、そうでないかのように示唆するよりも役に立つ。この比較のLuna側は今朝から私たちから呼び出せるが、Anthropic側は、そうでなくなるまではAnthropicに問い合わせるしかない。

何が答えを変えるだろうか
2つのことがあり、どちらも推測するより注視する価値がある。
第一は、冗長さが動くかどうかです。Claude Haiku 5.5 のタスクあたりコストは、最大effortで回答あたりに費やすトークン数の関数であり、effortパラメータがそのためのレバーです。effortをより低く固定するチーム——モデル自体のデフォルトは最大ではなくmediumです——は、タスクあたりコストがLunaに近い数値になり、スコアもLunaに近くなります。そのトレードオフは利用可能です。それがどれほどの価値があるかは、モデルについてではなく、あなたの評価についての問いです。
2つ目は、両モデルがより多くの計測済み実行を重ねるにつれて、独立したタスクあたりコストの数値が維持されるかどうかです。ボードへの1回の掲載はスナップショットにすぎず、1つのスナップショットに現れた3倍の差は、それを前提にパイプラインを再構築する前に、ご自身の請求書と突き合わせて確認する価値があります。共有エンドポイントは、まさにそのためのものです。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
