
GPT-6 Luna 対 GPT-5.6 Luna:同じ名前、半額、そしてより劣る成果物
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
2つのモデル、共通する単語が1つ、そして実質的に同一の独立したスコア。GPT-6 LunaはArtificial Analysis Intelligence Indexで37.26に到達し、GPT-5.6 Lunaは37.32に到達した。0.07ポイントの差は測定値ではなくノイズであり、これがこのペアリングに関する最も重要な唯一の事実である。両モデルを分かつのは能力ではない — 完了したインデックスタスク1件あたり$0.0681対$0.1783という価格と、値下げが言及していない一連のナレッジワークのリグレッションである。
数字を読むうえで日付が重要だ。GPT-5.6 Lunaは2026年7月9日にリリースされ、入力トークン100万あたり0.20ドル、出力トークン100万あたり1.20ドルだった。GPT-6 Lunaは2026年9月22日にリリースされ、0.10ドルと0.50ドル——入力料金はちょうど半額、出力料金は58%引きで、OpenAIはこれをプロモーションではなく恒久的なものだと説明している。それは本物の値下げであり、同時に話の小さい半分でもある。大きい半分は、新しいモデルが同じモデルの値付け替えではなく、別のモデルだという点だ。

移行が実際にもたらすもの、数字で見る
移行を決める軸で両者を並べてみると、その姿は均一ではない。改善する行もあれば、後退する行もあり、そして一つは大幅に改善する。
• 価格 — GPT-6 Luna は100万トークンあたり入力$0.10 / 出力$0.50、GPT-5.6 Luna は$0.20 / $1.20。入力は半額、出力は58%オフ。
• キャッシュ済み入力 — 100万あたり$0.01($0.02に対して)。半減したベースに同じ90%の割引なので、繰り返されるプレフィックスのコストは7月の半分になる。
• 完了したタスクあたりのコスト — 同じスイートで $0.0681 対 $0.1783。62% の削減で、これはトークン価格の引き下げよりも大きい。タスクの構成が同一ではないため。
• タスクあたりの出力トークン — 50,537 対 41,235。新しいモデルは完了したジョブあたり 23% 饒舌で、その出力の 78% は応答に現れない推論です。
• コンテキストウィンドウ — 1,050,000トークン対1,000,000。実用上の上限は同じで、どちらも出力は128,000トークンに制限されます。
• 棄権 — AA-Omniscience におけるハルシネーション率は、92.6% に対して 76.7%。これはこのセットにおける単一最大の改善であり、知識の向上によるものではありません。精度は 42.7% から 43.8% へと移行しており、実質的に横ばいです。新しいモデルは作り話をするのではなく辞退します。これは能力の変化ではなく、行動の変化です。
• ナレッジワークの成果物 — AA-Briefcase v1.1 は 1,345.38 Elo から 1,299.23 に低下し、GDPval-AA v2.1 は 1,443.14 から 1,367.09 に低下します。いずれも下落しており、それぞれおよそ46ポイント、76ポイントです。
• コーディングと長期的な作業 — Terminal-Bench 4.0 は 11.6% から 12.6% へ、SciCode は 53.6% から 54.6% へ上昇し、ここで上昇している2つの行です。それに対して、Coding Agent Index は 43 から 41 に低下し、SWE-style のエージェント型評価も同じ方向に動いています。
• AutomationBench-AA — 53.2% 対 50.2%。上昇しており、その上げ幅はこのセット内の他のどのエージェント指標よりも大きい。

その回帰は推論ではなく、成果物の中にある
最後の2行に見られるパターンは、名付ける価値がある。なぜなら、それが判断のすべてだからだ。新しいモデルは単一ステップのエージェント的行動は得意だが、完成した文書を返すのは苦手だ。Artificial Analysisは、ナレッジワークの低下を、事実や推論の失敗ではなく、プレゼンテーションの質と、要求されたルーブリック要素を飛ばした成果物に帰している——これはまさに、スモークテストは通過してもレビューでは落ちる種類の回帰だ。
二つの事実を合わせて考えると、移行は出力を消費する主体によってきれいに分かれる。あなたのパイプラインが構造化出力——JSON、分類、抽出フィールド、ルーティング判断——を読むのであれば、プレゼンテーションの退行は何のコストにもならず、棄権の改善は実質的な利益であり、タスクコストの62%削減はまるごと手に入る。成果物を人が読むのであれば——レポート、メモ、顧客向け文書——新しいモデルは、まさにあなたが対価を払っている当の能力において、測定可能なほど劣っており、その節約分はレビュー担当者を雇うために使われているだけだ。
棄権の数値も同じ扱いを受けるべきだ。自分が知らない事柄の93%ででっち上げていたモデルが77%ででっち上げるようになるのは、ガードレール、コンプライアンス・スクリーン、あるいは自信満々の誤答が伝播するあらゆるパイプラインにとって、実質的に別物である。この改善は本物であり、独立に測定されており、価格にまったく依存せずに作業を新モデルへ移すことを支持する最強の論拠だ。
あなたのコードで変わるものと、変わらないもの
この規模の値下げが示唆するほどには下がっていない——これが良い知らせだ。コンテキストウィンドウは同じクラスで、最大出力も128,000トークンと同一、そしてこのファミリーの長文コンテキスト再価格設定条項も変わっていない。272,000入力トークンを超えるリクエストは、入力とキャッシュのレートが2倍、出力が1.5倍で課金される。しかも、境界を超えた部分だけではなくリクエスト全体に対してだ。GPT-5.6 Lunaで300,000トークンでは高くついたリクエストは、GPT-6 Lunaでも高くつく。レートは半分でも、崖は同じ。つまり、7月に分割すべきだったワークロードは、今も分割すべきということだ。
エフォートのはしごは、コストではなく挙動が変わるところだ。GPT-6 Luna は none、low、medium(デフォルト)、high、xhigh、max を公開しており、デフォルトが重要だ。あるモデルのデフォルトのエフォートに合わせて調整されたパイプラインが、別のモデルに対しても自動的に調整済みになるわけではない。設定を明示的に固定したチームは影響を受けない。デフォルトを受け入れたチームは、7月とは異なる構成で実行しており、目に見える症状は品質ではなくトークン量になるだろう。
新しいモデルでも消えないため、もう一度言っておく価値のある罠が1つある。Chat Completions エンドポイントでは、関数呼び出しが機能するのは reasoning effort が `none` に設定されている場合だけであり、それ以外のすべての effort レベルと、すべての組み込みツールには Responses API が必要である。モデル文字列を変えるだけでツール呼び出しループを移行しようとするチームは、デフォルトの `medium` effort ではツールが黙って利用不可になっていることに気づくことになる。そしてその修正は、パラメータの変更ではなく呼び出しインターフェースの書き直しである。
現在ルーティングできるものと、できないもの
これは、ベンチマークとは何の関係もない移行の部分です。GPT-5.6 LunaはOrcaRouterで定価で提供されています — 入力トークン100万あたり$0.20、出力トークン100万あたり$1.20、1,000,000トークンのコンテキストウィンドウ、最大出力128,000トークン、そして当社自身のモデルページ上の実際のトラフィック全体で計測された、最初のトークンまでのp50時間は1.60秒です。当社はプロバイダーの定価をマークアップなしでそのまま提供していますそのため、OpenAIがこのファミリーの価格を改定した当日に、次の請求サイクルを待つことなく当社側でも変更が反映されました。

GPT-6 Luna は、2026年9月23日時点で OrcaRouter 経由ではルーティングできません。利用可能なのは OpenAI 自身の API と、このファミリーを扱うクラウドのカタログであり、当社は提供できないモデルを掲載することはありません。実務上の帰結として、この移行を計画しているチームは本日時点で価格設定は移行できても、ルーティングは移行できません。つまり、変更の二つの半分は異なる日に着地することになります。
それによって当面可能になるのは、どのチームも結局は望むことになるであろう構成だ。成果物そのものが製品である経路にはGPT-5.6 Lunaを残し、出力がコードに消費される場所にはGPT-6 Lunaを走らせ、その境界を書き換えではなく層として扱う。利用できるモデルは1つのエンドポイントの背後にあり、同じキーで200以上のモデルが使え、プロバイダー間の自動フェイルオーバーも効くため、層の追加も削除も2つ目の統合ではなく設定エントリ1つで済み、エスカレーション経路は特定の1つのモデルが利用可能であることに依存しなくなる。
移行の決断を率直に述べる
出力が機械に読み取られ、成功条件が検証可能な作業へ移してください。分類、抽出、ルーティング判断、ガードレール呼び出し、一括変換パス、単一ステップのエージェントアクションはすべて該当します。合成結果は変わらず、棄権行動は実質的に改善し、タスクコストは約62%削減されます。バッチが標準料金の半額、キャッシュ済み入力が半額ベースの10分の1になれば、7月にはぎりぎりだったパイプラインも今では容易に実現できます。
人が成果物を承認する作業を移すな。コーディングエージェントの経路も盲目的に移すな。46ポイントのAA-Briefcase低下と76ポイントのGDPval低下は、2ポイントのCoding Agent Index低下と同じ方向を指す小さな数字であり、Artificial Analysisが説明する失敗モード——ルーブリック要素の抜け落ち、プレゼンテーションの弱さ——は自動チェックでは見えない。磨き込みが成果物である場面では、以前のモデルを使い続けよ。
そして、0.07ポイントの指標同点を、それが持つ発見として扱いなさい。これは、より低い価格でより賢いモデルではない。より低い価格の、形の異なるモデルであり、移行計画が答えなければならない問いは、あなたのワークロードがどちらの形を消費するかであって、どちらのスコアが高いかではない。なぜなら、独立した記録では、その2つのスコアは同じ数値だからだ。
