GPT-5.6 Luna と Claude Haiku 4.5 を比較するタイトルカード。Luna はインテリジェンス指数 38、100万トークンのコンテキストウィンドウ、価格は100万トークンあたり入力 $0.20、出力 $1.20 を示し、Haiku 4.5 はインテリジェンス指数 18、20万トークンのコンテキスト、価格は入力 $1.00、出力 $5.00 と対比している。
Guides & Insights

GPT-5.6 Luna 対 Claude Haiku 4.5:安価なティア、大きく異なる2つの請求書

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GPT-5.6 LunaClaude Haiku 4.5 は、2つの異なるフロンティアファミリーの低価格帯であり、両者の差は、どの数値を見るかによってまったく変わります。定価で見ればこれは圧勝です:入力100万トークンあたり$0.20 対 $1.00。Artificial Analysis の「完了した Intelligence Index タスクあたりのコスト」では、$0.18 対 $0.21 — 約14%の差です。同じ2つのモデル、2つの正直な答え、そしてそれらが食い違う理由こそ、どちらかを選ぶ前に理解しておくべき、何よりも役立つ一点です。

要するに、Luna はスペック上はより強力なモデルで、スループットもより速いが、長考するため、その分の料金が請求される。Haiku 4.5 はより古く、守備範囲も狭いが、リクエストあたりのコストがかなり予測しやすい。どちらをより重視するかは、モデルではなく、あなたのワークロードの性質によって決まる。

概要

ベンダーOpenAIAnthropic

リリース — 2026年7月9日 対 2025年10月15日

コンテキストウィンドウ — 100万トークン vs 20万トークン

最大出力 — 128Kトークン vs 64Kトークン

入力 — テキスト、画像、ファイル vs テキスト、画像、PDF

100万トークンあたりの価格 — 入力$0.20 / 出力$1.20 対 入力$1.00 / 出力$5.00

Artificial Analysis Intelligence Index — 38、177件中4位 対 18、200件中138位(いずれも推論構成)

Intelligence Index タスクあたりのコスト — $0.18 対 $0.21

出力速度 — 109.4 トークン/秒 対 84.7 トークン/秒

推論制御 — なしから最大までのエフォート調整 対 エフォートパラメータなしで手動で有効化される拡張思考

信頼できる知識のカットオフ — 2026年2月 対 2025年2月(トレーニングデータは2025年7月まで)

引退の確約 — 公表なし vs 2026年10月15日より早くない

GPT-5.6 Lunaが実際に勝つのはどこか

Screenshot of an Artificial Analysis head-to-head between GPT-5.6 Luna (max) and Claude 4.5 Haiku (Reasoning). The Intelligence Index row reads 38 against 18, AA-Briefcase 1339 against 614, GDPval-AA v2 1489 against 854, AutomationBench-AA 50% against 3%, Terminal-Bench v4.0 12% against 0%, SciCode 54% against 42%, Humanity's Last Exam 39% against 10%, GDPpdf 24% against 4%, CritPt 21% against 0%, AA-Omniscience -10 against -4, and AA-LCR v1.1 84% against 74%. The Cost section shows a blended price per 1M tokens of $0.174 against $0.77.

能力は、大差で上回る。 Intelligence Index の38対18は、接戦ではない。Lunaは、Artificial Analysisが推論、知識、数学、コーディングの評価から構築する総合指標でHaikuを上回り、しかもトークンあたりのコストが安いモデルである。この2つのファミリーを9月以前のインデックス——Lunaが51と52を示していた——で最後に比較した人は、2026年9月に尺度全体が再採点され、その再採点後もLunaの優位が生き残ったことに留意すべきである。

コンテキストは、5倍です。 1Mトークンのウィンドウと200Kの対比は、それだけで一つの作業カテゴリを決めます。リポジトリ全体のパス、長い文書セット、Haikuでは要約が必要になるような長尺のエージェントトランスクリプトなどです。アプリケーションが保持しなければならないコンテキストの量によって定義されるなら、比較はここで終わりです。

出力の余裕が、2倍に。 最大出力トークン128K対64Kは、長文生成や、一行の回答ではなく構造化されたプランを返すエージェントループにとって重要です。

スループット。毎秒109.4出力トークン対84.7という差は、ストリーミングインターフェースにとって実際に意味のある違いですが、応答性と同じものではありません — 以下のレイテンシのセクションを参照してください。

価格は、表示価格のとおりだ。入力で5倍、出力でおよそ4倍安いというのは、誤差の範囲ではない。そして短い出力の作業においては、それが判断のすべてを決める。

Claude Haiku 4.5が依然としてその存在価値を発揮する場面

予測可能なコスト。 Haiku 4.5の推論は、手動でオンにする拡張思考です。オフのままにすれば、直接回答し、課金も予測可能です。GPT-5.6 Lunaのエフォートダイヤルは最大まで上げられ、一段上げるごとに出力レートでより多くの出力トークンが発生します。事前に明言できるコスト上限を求めるチームにとって、Haikuのほうが試算しやすく、たとえ表示価格が高くてもそう感じられるでしょう。

非推論構成は、実行コストが本当に安い。Artificial AnalysisはClaude 4.5 Haikuの非推論構成をIntelligence Index 15と評価しており、タスクあたりのコストは公表されていない。そしてこれは、基準が単に「これを正しく解析する」ことである業務——意図分類、フィールド抽出、ルーティング判断、モデレーションのトリアージ——に無理なく適している。そうしたタスクでは、15と38の指数差はほとんど無関係だ。どちらのモデルも考えることを求められていないからである。

キャッシュとバッチ割引は成熟しています。 Haiku 4.5には90%のプロンプトキャッシュ読み取り割引と、Batch APIの50%割引があります。Lunaも同等のキャッシュ経済性を備えているため、これは優位性というよりも引き分けに近い——しかし、あなたのパイプラインがすでにAnthropicのツールでバッチ処理を行っているなら、Haikuから乗り換える移行コストは実際にかかるコストであり、どのベンチマークにも現れません。

運用実績。Haiku 4.5 は2025年10月から本番環境で稼働しており、2026年10月15日より前には提供終了しないという公表済みの確約を伴っています。Luna はまだ2か月です。モデルが製品そのものではなく細部であるようなワークロードでは、11か月の本番稼働実績には、ベンチマークでは表せない価値があります。

それを測る唯一の軸において、より真実に即しているのはこちらのモデルだ。 Artificial Analysisの直接比較では、ほぼすべての能力項目でLunaが先行している——AA-Briefcaseは1,339対614、GDPval-AA v2は1,489対854、AutomationBench-AAは50%対3%、Humanity's Last Examは39%対10%、GDPpdfは24%対4%。例外はAA-Omniscienceで、これは知識問題における自信満々の誤答にペナルティを与える。そこでのLunaのスコアは-10、Haikuは-4だ。負のスコアは、幻覚に対するペナルティが正確さへの加点を上回っていることを意味し、Lunaのペナルティのほうが大きい。合成指数が高いことは、より信頼できる回答と同じではない。そして、その二つを切り分けるために作られた唯一の評価において、旧モデルのほうが優れている。

実際のワークロードでのコスト計算

月に1億の入力トークンを消費し、2,000万の出力トークンを生成するパイプラインを例に取りましょう。

GPT-5.6 Luna — 100 × $0.20 = $20、さらに 20 × $1.20 = $24。月額合計 $44。

Claude Haiku 4.5 — 100 × $1.00 = $100、さらに 20 × $5.00 = $100。月額合計 $200。

その比率では、Lunaは約4.5倍安く、これがほとんどの比較が公表している計算です。ここで前提を一つ変えてみましょう。Lunaの推論エフォートを上げると、出力トークンが増え、出力は高価な側です——$1.20では、入力の6倍のコストがかかります。同じ作業量に対して、Artificial Analysisの評価セットでそうしているように、Lunaが150Mの出力トークンを出すところまで押し上げると、$44は余裕で$180を超えます。4.5倍は互角へと崩れ落ちます。

教訓はLunaが高いということではない。Lunaの価格上の優位性は、どれだけ話すかで決まる——それはあなたが制御できるパラメータだ。抽出と分類では推論を下げれば、割引は本物になる。すべてで最大のままにしておけば、もはや定価の面影がない価格で、より高性能なモデルを買ったことになる。

レイテンシ、そして信頼してはいけない数字

これら2つのモデルについて公表されている初回トークンまでの時間(time-to-first-token)の数値は、ほとんど役に立たない。その理由を理解しておく価値がある。Artificial Analysisでは、両モデルの推論構成は、初回トークン遅延が数十秒、場合によっては数百秒にも及ぶことを示している。これは、モデルが推論を終えるまでハーネスがトークンを出力しないためだ。この数値は評価設定を測っているのであり、モデルの応答性を測っているのではない。

ルーティングテレメトリのほうがより良い情報源だ。本番環境でモデルを測定しているからだ。OrcaRouter自身の数値では、GPT-5.6 Lunaは最初のトークンまでの中央値が1.83秒、95パーセンタイルが10.00秒であるのに対し、Claude Haiku 4.5は中央値3.81秒、95パーセンタイル9.47秒だ。正しく読めば、これは両者がリーダーボードが示唆するよりも近いことを意味する。Lunaは典型的なリクエストで勝っており、裾は互いに約0.5秒以内に収まっている。平均ではなく最悪ケースが気になるなら、両者の間にはほとんど差がない。

どちらを選ぶべきですか

GPT-5.6 Lunaを選びましょう。長いコンテキストを保持する場合、タスクが真の推論から恩恵を受ける場合、出力が長いまたは構造化されている場合、あるいは価格帯の下限で入手できる最強のモデルを求める場合に適しています。また、スタックの残りがすでにOpen​AIファミリーの挙動で動作しているなら、より自然な選択でもあります。

Claude Haiku 4.5 を選びましょう短い出力を大量に生成する作業なら、リクエストを実行する前に提示できるコスト上限が必要なら、パイプラインがすでに Anthhropic のバッチ処理とキャッシュを前提に構築されているなら、または、登場から2か月しか経っていないモデルよりも、本番運用の実績と公開されたライフサイクルを備えたモデルを重視するなら。

どちらも選ばないでください小規模な推論モデルやファインチューニング済みの分類器で事足りるタスクには。これら2つのティアが吸収しているトラフィックの大部分は、より狭い範囲のモデルでより安く実行できる分類と抽出であり、最も安価なモデルとは、常に、必要としなかったモデルのことです。

両方を1つのキーで実行する

Screenshot of the OrcaRouter model page for Claude Haiku 4.5, showing the model identifier anthropic/claude-haiku-4.5, a release date of 2025-10-15, a 200K-token context window, 64K maximum output, input pricing of $1.00 per million tokens, output pricing of $5.00, a median time to first token of 3.81 seconds and a 95th percentile of 9.47 seconds.

両方が単一のエンドポイントから到達できるようになれば、この対決はもはや排他的ではなくなる。OrcaRouterでは、Claude Haiku 4.5とGPT-5.6 Lunaは同じOpenAI互換のベースURLの背後に並んでいる——200以上のモデルに対応する1つのAPI、1つのキー、1つの請求明細、2つ目の契約は不要、モデル識別子以外のコード変更も不要。まだ確信が持てないティアの判断にとって、それは移行を設定値の変更に変えてくれる。

ここでは2つの機能が実際に役立つ。プロバイダー間の自動フェイルオーバーにより、低コスト層が単一ベンダーに依存せずに本番トラフィックを担える。これは、モデルが十分に安く、重要な1回の呼び出しではなく1時間に数千回の呼び出しを送る場合に有用だ。そしてルーティングDSLを使えば、複数のモデルから1つの呼び出しを構成できる。単純な大多数のリクエストはLunaにルーティングし、残りはGPT-5.6 Terraにエスカレーションし、リトライではなく別ベンダーの回答が欲しいときのフォールバックとしてHaiku 4.5をプールに残しておく。

どちらかを本番経路に投入する前に、GPT-5.6 Luna と Claude Haiku 4.5 のリアルタイムのトークン単価を確認してください。どちらの料金もマークアップ0%でパススルーされるため、ベンダーが動いたその日に動き、サードパーティの価格トラッカーは数日から数週間遅れます。

実際に答える価値のある質問

GPT-5.6 Lunaは本当にClaude Haiku 4.5より5倍安いのか? 入力トークンについては、はい — $0.20 対 $1.00。同じ評価対象タスクを完了するコストについては、いいえ:$0.18 対 $0.21。これら2つの記述の差は、Lunaの冗長さにある。同じ作業を完了するのに、Haikuのおよそ2倍の出力トークンを生成し、しかも出力トークンのコストは入力トークンの6倍だ。短い回答では、表示価格はおおむね正直だ。推論を多用する作業では、そうではない。

両方で同じようにコストを調整できますか?いいえ、そしてこれは両者の間で最もあまり報告されていない違いです。Lunaはnoneからmaxまでの設定を備えた推論努力ダイヤルを公開しているため、リクエストごとにコストと品質が明示的にトレードオフされます。Haiku 4.5の拡張思考は、トークン予算を伴って有効になっているか、そうでないかのどちらかです — effortパラメータはありません。リクエストごとのコスト管理が重要なら、この2つのうちそのレバーを与えてくれるのは片方だけです。

1日に数百万回の呼び出しを行う高負荷な分類器の場合はどうでしょうか?どちらのモデルも、これに推論は必要ありません。Haiku 4.5 を拡張思考オフで実行するか、Luna を effort を none に設定して実行し、複合インデックスではなくレイテンシと出力長で比較してください。その段階では、重要なのは最初のトークンがどれだけ速く到着するかと、回答が何トークンを要するかであり、知能ベンチマークは両者を区別しなくなります。

A two-column comparison scoreboard for GPT-5.6 Luna and Claude Haiku 4.5. Luna's column reads Intelligence Index 38, context window 1M tokens, price $0.20/$1.20, cost per index task $0.18, output speed 109.4 tokens per second, reasoning control an effort dial from none to max. Haiku 4.5's column reads Intelligence Index 18, context window 200K tokens, price $1.00/$5.00, cost per index task $0.21, output speed 84.7 tokens per second, reasoning control extended thinking on or off.

1年後もまだここに残っているのはどちらでしょうか。Claude Haiku 4.5には、2026年10月15日より前に廃止しないという公表済みのコミットメントがあります。OpenAIはGPT-5.6 Lunaについて同等の日付を公表しておらず、GPT-5.6系列にはすでにGPT-6 Astraという新しい世代がその上位にあります。どちらもLunaを避ける理由にはなりませんが、ロードマップが11か月の計画期間を前提としているなら、モデル識別子をハードコードするのではなく設定に保持しておく理由にはなります。

同じキーで使える GPT-5.6 Luna のトークン単位のリアルタイム料金。マークアップ0%でそのまま反映され、別途の請求関係は発生しません。

トークン単位のリアルタイム料金:Claude Haiku 4.5(同一エンドポイント上)。これにより、2つのティアを別契約なしで比較できます。