
GPT-5.6 Luna Max: 開発者がCodexで実際にどう使っているか — そしてどこで壊れるか
- obsidianNEWQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 100万トークンあたり · 24 tok/s
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-1348 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokNEWSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 278 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
8月1日、4行の設定ファイルがX上で拡散し始めた。それはCodexエージェントを作成し、その名前はluna_workerであり、モデルをgpt-5.6-lunaに設定し、推論努力をmaxに設定し、そして、GPT-5.6 Solが計画を保持する間、退屈な仕事の半分をそれに任せる。数日のうちに、同じレシピは英語、中国語、日本語、韓国語、スペイン語、アラビア語で再投稿され、同じアイデアに基づくプラグインは4日間で1,300のGitHubスターを突破した。また、それがバイラルになったほぼその日に、この方法は間違った配線方法でもあった。すなわち、そのプラグインの作者は、同業者から「Codexサブエージェントとしては機能しない」と聞かされ、48時間以内に自分のプロジェクトからGPT-5.6 Lunaを公開の場で外した。そして2日後、完全に異なる配線方法でそれを戻した。
その一連の出来事はすべて1週間以内に起こった。そして、それはこのモデルについて誰かが公開した中で最も有用な内容だ。そこから分かるのは、安価なワーカーパターンが実在すること、それを接続する明白な方法が誤った方法であること、そしてその2つの差が価値の大部分を占めるということだ。この記事の技術に関する内容はすべて、2026年7月30日から8月5日までの間に実務家が自らの結果を投稿したものに基づいている。企業のドキュメントに基づくものではない。そのドキュメントはGPT-5.6 Lunaを「コスト重視の大量ワークロード」向けモデルとして説明しており、このような点については一切言及していない。数値が独立した第三者によって測定されたものであればその旨を明記し、ある開発者のセッションログに基づくものであればその旨も明記する。互いに矛盾する場合も同様だ。実際、矛盾は多々ある。
「Luna Max」とは何か、そしてなぜほとんどの人がそれを見たことがないのか
{{1}}「Luna Max」というモデルは存在しません。{{/1}} ダイヤルが2つあり、{{2}}Luna Maxはその組み合わせの1つです。{{/2}} GPT-5.6ファミリーの最も安価な層を、最も深い推論設定で実行したものです。{{3}}層ダイヤルは、GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Lunaのいずれかを選択します。{{/3}} {{4}}努力ダイヤルには、none、low、medium、high、xhigh、maxの6つの位置があり、{{/4}} {{5}}モデルが回答する前にどれだけ考えるかを制御します。{{/5}}
低価格ティアと深い設定を組み合わせていた人はほとんどいなかった。その理由は実にありふれたもので、max がデフォルトで非表示になっているからだ。ChatGPT/Codex デスクトップアプリでは、このオプションは「設定 → 構成 → 利用可能な推論努力」の奥にあり、そのリストでは先頭のオプションがデフォルトでオフになっている。8月の第1週に、6人の開発者がそれぞれ同じ「3クリックの修正」を投稿した。これは、どれほど多くの人が Luna をデフォルトの深さで実行し、その状態でモデルを評価していたかを示す良い指標だ。API 側には探すべきトグルはない。モデル ID にgpt-5.6-lunaを指定し、推論努力をmaxに設定する。リクエストボディでは、これが変更のすべてだ。
ベンチマークを読む前に心に留めておくべき結果が一つあります。Artificial Analysisがこのモデルの知能スコアを公開するとき、ページのタイトルはGPT-5.6 Luna (max)となります。Lunaについて皆が引用する独立した数値は、最大努力構成のものです。デフォルトで実行していて、自分の体験がリーダーボードと一致しないのはなぜかと疑問に思っているなら、それが理由です。
誰も説明しないダイヤル:努力はトークン数を変えるが、トークン価格は変えない
推論の労力を上げても、より高額な価格帯に移行することはありません。GPT-5.6 Luna は、すべての労力設定において、入力トークン100万個あたり0.20ドル、出力トークン100万個あたり1.20ドルです。変わるのは、モデルが回答に到達するまでに消費するトークン数です。最大設定では、その消費量は非常に多くなります。
Artificial Analysisは、Intelligence Indexの運用過程でこれを測定したが、その数字は、実務者たちが不満を述べていたことの最も明確な独立した裏付けである。
• スコア — Artificial Analysis Intelligence Index では、同クラスでベンチマークされるモデルの中央値 17 に対し、51。
• 冗長性 — インデックス実行中に生成された出力トークンは1億3000万で、中央値は6100万。Artificial Analysisはこのモデルを「非常に冗長」と評価しています。
• 生の速度 — 1秒あたり182.5出力トークン、163モデル中16位。1トークンあたりの処理が高速です。
• 最初のトークンまでの時間 — 最大努力で約136秒であり、Artificial Analysisによると、これはその価格帯の推論モデルの中でも高い部類に入る。
• 総支出 — モデルをインデックス全体で評価するための$174.06。
3行目と4行目はまとめて読んでください。その2行がユーザー体験のすべてだからです。Lunaは最大設定ではトークンを素早くストリーミングしますが、起動に数分かかり、同じ作業で典型的なモデルが生成するトークンの約2倍を生成します。だからこそ、現場からの報告で最も多い不満は「間違っている」ではなく「遅い」なのです。そして、安い価格が比例して安いセッションになるわけではない理由でもあります。あなたは高いトークン数に対して低いレートを買っているのです。
比較のために言うと、GPT-5.6 Lunaのモデルページで、7日間の実トラフィックで観測された最初のトークンまでの時間(time to first token)の中央値は1.78秒で、95パーセンタイルは9.26秒です。これは136秒という数字と矛盾するものではありません。同じモデルを、異なる推論努力(effort)設定を混在させて測定した結果であり、その大半は最大設定ではありません。得られるレイテンシは、呼び出すエンドポイントではなく、設定したダイヤル(effort設定)によって決まるのです。

Luna Maxは本当に「Sol Mediumの6分の1のコスト」なのか?
このパターンをバイラルにしたのはこの主張であり、その発端はDan McAteerである。彼は、最大推論設定のLunaはGPT-5.6 Solの中程度設定、またはClaude Opus 5の中程度設定あたりに落ち着き、コストはおよそ6分の1だと述べた。この主張は多くのアカウントによって繰り返され、時には慎重な言い回しが削り落とされた形で拡散された。そして、測定された事実と、単なる雰囲気による印象とを区別することは価値がある。
独立系スコアボードは、この主張のコスト面を明確に裏付ける一方、性能面は部分的にしか裏付けていない。Artificial Analysisが各層で最大限の努力を払って同じベンチマークスイートを実行したところ、Lunaはインデックス51で174ドル、Terraは55で1,403ドル、Kimi K3は57で2,437ドル、Solは59で2,824ドルと記録された。LunaはSolにインデックスポイントで8ポイント劣るが、同じ作業を実行するコストは約16分の1である。

独立系スコアボードは8月13日に精度を増した。DeepSWEがv1.1をリリースしたのだ。これは長期ホライズンのエンジニアリングベンチマークの改訂版で、5言語にわたる91のリポジトリから収集した113のオリジナルタスクを維持しつつ、各修正を隔離コンテナ内でコミット済みdiffを実行して評価するようになった。これにより、ごまかしが難しくなっている。更新されたボードでは、最大努力時のGPT-5.6の3つのティアすべてが、7月の記事と同じ位置に着地している。Luna Maxはpass@1で67.2%、タスクあたり0.61ドル、Terra Maxは約70%、Sol Maxは73%で8.39ドル——成功率で6ポイント差に対し、費用はおおよそ14倍だ。
見直す価値のある比較は、Lunaの上ではなく下に位置しています。Claude Sonnet 5 Maxは、同じ113タスクで54%のスコアを記録しており、Luna Maxに約13ポイント差をつけられています。1タスクあたりのコストは26.40ドルで、同じ問題を解くためにLunaが支払った額の約44倍です。Luna Maxはまた、Gemini 3.7 Flashを上回っています(同じボード上の高負荷設定では65%)。今回の結果を指摘したコミュニティ投稿では、Gemini 3.7 Flash Mediumとの差は約1.7ポイントとされています。DeepSWEはDatacurveの独立した評価ハーネスであり、企業による評価ではありません。GPT-5.6ファミリーがTerminal-Bench 2.1とDeepSWEで最先端の結果を達成したという同社の主張は、ベンダー報告による別の言明として残っています。
そして、現場での証拠については、見解が本当に分かれている。Pawel Huryn は独自のバグ修正ベンチマークを実施した——2つの実コードベースに105個のバグを仕込み、ブラインド判定、モデルごとに1ラウンドという条件で——その結果、Luna は最大設定で33個のバグを $1.80 で修正したのに対し、Claude Fable 5 は24個を $68 で修正したと報告している。逆に、Diego Haz は2日間かけて条件を揃えたセッションを実施し、この傾向に反する結果を出した。Luna は1セッションあたり平均 $1.20 だったのに対し、Sol は平均 $29 だったが、彼は Luna の出力のほとんどを作り直す必要があり、自分のユースケースでは出荷できる成果物が何も得られなかった。そのため、この節約は割引ではなく幻想に過ぎない。同じテストハーネスを使った別の開発者は、Sol を中設定で実行したところ、Luna を最大設定で実行した場合よりも明らかに良い結果が約半分の時間で得られたと報告している。単一の3Dシーンタスクにおける中国語での対決は、この傾向を数値で示した。Sol Medium は21分30秒で完了し、品質評価は最高、トークン数は最少だった。一方、Luna Max は40分55秒かかり、約13万トークンを消費し、品質評価は最低で、週間サブスクリプション枠の半分を使用した。
1週間後のコミュニティの立場の正直な要約: Luna Max は Sol Medium ではない。Sol Medium よりかなり安く、品質も劣る。そして、そのトレードオフが良いかどうかは、タスクが「劣る」ことが問題にならないほど厳密に定義されているかに完全に依存する。 それがまさに、以下の配線パターンの目的である。
「実践に耐えたパターン:Solが計画し、Lunaが実装し、新たなSolがレビューする」
Luna Maxを使い続けている人は、誰一人としてそれを汎用コーディングエージェントとしては使っていません。実践者が行き着いたすべてのバージョンで機能するセットアップには、4つの役割があります:
• オーケストレーター — 高努力のGPT-5.6 Solで、メインスレッドに留まる。要件、アーキテクチャ、タスク分解、最終承認を担当する。コードは書かない。
• ルーチン実装者 — 最大努力モードのGPT-5.6 Lunaが、範囲が限定され完全に仕様化された作業、すなわち機械的なリファクタリング、テスト作成、モジュール解析、ドキュメント整備といった、到達点が明確なタスクを担当します。
• ハード実装者 — 最大限の努力で動かすGPT-5.6 Terra。Lunaの命令ドリフトが高コストになる、コンテキスト量の多いビルド向け。
• レビュアー — 最終diffのみを参照し、それ以外は何も見ない、新しい読み取り専用のGPT-5.6 Solインスタンス。「fresh」の要点は、実装の文脈を保持したレビュアーは自分の推論を承認しがちだということです。
リファレンス実装はsol-advisorです。これはDan McAteerによるMITライセンスのCodexプラグインで、公開初週に約1,400スターを獲得しました。インストール方法は、CodexプラグインマーケットプレイスでDannyMac180/sol-advisorリポジトリを追加し、続けてsol-advisorプラグインを追加します。その現在の構成は参考になります。ネイティブレーンはTerra/High実装者と、それに続く新しいSol/Highレビューアーを固定しています。一方、Luna最大時は明示的なオプトインレーンであり、ユーザーに表示される別のタスクとして実行され、プライマリのSolセッションがその作業をネイティブのレビューアー経由ではなく直接レビューして受け入れます。
何もインストールしたくないなら、広くコピーされている最小バージョンは、~/.codex/agents/luna-worker.tomlに置かれたカスタムエージェント定義で、次の2つの設定を持ちます — model = "gpt-5.6-luna"とmodel_reasoning_effort = "max" — さらに、明確な境界を持つ委任作業に制限し、全体の目標を変更したり自身のスコープを広げたりすることを禁止し、アーキテクチャ上の決定や曖昧な要件をメインエージェントに送り返す説明と指示が含まれています。広まっているアドバイスは、Sol にこのファイルを書いてもらい、インストール済みの Codex バージョンに対して検証し、受け入れる前に差分を表示してもらうというもので、レシピを信頼するかどうかに関わらず、これは妥当です。
サブエージェントの罠、そしてコミュニティが辿り着いた解決策
ここが、このパターンのバイラル版と実用版が分かれるところです。
Codex のネイティブサブエージェントシステムは、GPT-5.6 Luna を第一級の市民として扱っていない。McAteer は「Luna はサブエージェントとして許可されない」というハードブロックに直面し、代わりにカスタムエージェントとして宣言することで回避した。そして、その回避策のコストを公に指摘した。カスタムエージェントは、ネイティブサブエージェントとは異なり、メインエージェントとコンテキストを共有しない。数日後、彼は Luna レーンをsol-advisorから完全に削除した。その際、Luna はサブエージェントの役割で動作が悪く、v2 マルチエージェントプロトコル向けにポストトレーニングされていないだろうという、別の Codex 専門開発者の見解を引用した。Diego Haz も独自に、同じ壁を反対側から説明した。Sol は Luna をサブエージェントとして生成できないため、Luna はトップレベルのスレッドに置くしかなく、それが連携を煩雑にしている。
現在、多数派の立場となっている解決策は、それと戦うのをやめることです:
• Luna Maxに専用のスレッドを与えること。サブエージェントグラフ内のスロットではなく。 Solオーケストレーターに指示して、Luna上で独立したトップレベルのCodexタスクを起動し、それを監視して結果を取得させること。これはMcAteerがsol-advisorに対して8月4日に再追加したものであり、他の数人も独自に同じ結論に達していた。
• コンテキスト分離を代償として受け入れる。別個のスレッドは別個の履歴を意味する。それはあなたが支払う代償であり、また、以下のハンドオフがネイティブのサブエージェント設定におけるよりもここでより重要である理由でもある。
• multi-agent v2 に無理やり入れる必要があるなら、カタログがその除外の理由です。ある開発者は、その除外が標準モデルカタログが Luna を v1 とマークしていることに起因すると突き止め、次の回避策を報告しました: ~/.codex/models_cache.json をコピーし、Luna の multi_agent_version を v2 に設定し、model_catalog_json をそのコピーに向け、Codex を再起動し、オーケストレーターに高速サービスティアで Luna を最大数で spawn させ、フォークをオフにします。これは内部ファイルに対する一人の非公式なハックとして扱ってください — まさに Codex アップデートが壊してしまう類のものです。
ハンドオフパケット:最も一般的な不満を解決する5つの質問
Luna Maxの最も多く報告されている失敗は、指示に忠実に従わないことです。特に、特定のワークフローや反復ループを実行するよう指示した場合にその傾向が顕著です。この不満は、このモデルを気に入っている開発者にも、使うのをやめた開発者にも見られます。実践者が最終的にたどり着く対策は、文体として優れたプロンプトではなく、より厳格な契約です。Lunaスレッドが始まる前に、5つの事柄に答えてください。
• このエージェントが完了すべき正確なタスクは何ですか?作業の領域ではなく、完了した状態です。
• 対象となるファイル、文書、またはシステムはどれですか? 列挙されたもののみが対象であり、暗黙のものを含みません。
• 何を変更してはいけないのか? 変更してはいけないのは、インターフェース、マイグレーション、設定、公開契約です。
• 完了を証明する証拠は何か?名前付きテスト、特定のコマンドの出力、リストされたファイルのみに変更を加えるdiff。
• どの欠けている決定が、それを停止させるべきでしょうか? 推測するのではなく戻るためのトリガー — これこそが、過剰に熱心な安価なモデルがアーキテクチャをでっち上げるのを防ぐものです。
ここはまた、同社自身のプロンプティング指針を、それにふさわしいラベルを付けて織り込む価値のある箇所でもある:{{1}}同社は、社内のコーディングエージェント評価において、より簡潔なシステムプロンプトが評価スコアを10〜15%向上させ、総トークンを41〜66%、コストを33〜67%削減したと報告しており、GPT-5.5またはGPT-5.4から引き継いだプロンプトをそのまま移植するのではなく監査するようアドバイスしている。{{/1}}これらはベンダー報告の数値である。しかし、その方向性はこの分野の知見と一致している:{{2}}目的地を正確に記述し、すべての足取りのナレーションを削除せよ。{{/2}}上記の段落との間に緊張関係があることに注意されたい — {{3}}スコープと制約に関する精密さは、冗長さと同じではない。そしてコミュニティのコンセンサスは、Luna Maxには前者がより多く、後者がより少なく必要だというものだ。{{/3}}
計画時に考慮すべき障害モード
• 指示の逸脱。 複数の開発者によって裏付けられている:当初のブリーフの一部を無視し、ブリーフが達成すべき成果ではなく従うべき手順である場合に最も悪化する。
• ウォールクロックの遅さ。繰り返し報告されており、Artificial Analysis が最大努力で測定した約136秒の初回トークンまでの時間と一致しています。放置して実行しておける作業には問題ありませんが、対話的なループでは苦痛です。
• コンテキスト消費。ある開発者は、Luna Maxが258kトークンのCodexスレッドウィンドウを驚くほど速く消費すると報告し、Codexが上限近くでコンパクションを開始するとクォータ消費が急増するのではないかと疑った。コンパクションの部分は彼の印象であり、測定された結果ではない。しかし、消費率はArtificial Analysisが独自に測定した冗長性から予想される結果である。API側では、ロングコンテキストの段階に注意が必要だ。このモデルのパススルー価格体系は、リクエストが約272kトークンを超えると、$0.20/$1.20から$0.40/$1.80に移行する。そのため、成長し続けるスレッドは、総額が高くなるだけでなく、トークンごとのコストも高くなる。
• 視覚的なものすべて。 これはフィールドレポートの中で最も明確な境界線だ。ある広く読まれている実践者は、Luna Maxを支持してKimi K3のコーディングサブスクリプションを解約し、そのLuna Maxを、解約したものと同等で、はるかに安いと評価した。ただし、フロントエンドには明確な例外を設けていた。別の実践者はもっと率直だった。Lunaをデザイン、グラフィック、フォーマット、スライド作業に使ってはいけない。Solで計画しLunaで実行するという分担は、美的なタスクではなく、段階的な指示を必要とするタスクのためのものだ。
• サブエージェントカタログ。 上で説明済み — マルチエージェント実行でLunaが静かに選ばれない場合、それはフィルタリングされているのであって、失敗しているわけではない。
• 見せかけの節約。 どのベンチマークにも現れない唯一の失敗モード:$29の代わりに$1.20で済んだセッションが、あなたが手で書き直すことになる成果物を生み出したなら、あなたにとってのコストは$1.20と午後の時間だ。
「maxを使うべきでない場合」
Maxは無料アップグレードではなく、これまで有効だった指針は設定ではなく梯子である:
• 明確な変換 — フィールドのリネーム、機械的な抽出、フォーマット処理。Lunaでの工数は低〜中程度。名前付きテストが通ることを条件とする。
• ルーチン実装 — high または xhigh。Luna ワーカーのコミュニティ既定値は max ではなく xhigh です。これは、max が決して難しくないタスクに時間とトークンを費やすからにほかなりません。
• 制約付きだが真に難しい — これがmaxの実際の仕事です。パケットは、追加の推論がより良い結果に変換されるように、難しくかつ厳密に指定されていなければなりません。
• 曖昧な調査 — 変えるべきはダイヤルではなくティアです。モデルが計画不足ではなく判断を誤っているのであれば、安いモデルで思考量を増やしても直りません。それはSolのタスクです。
• 曖昧なブリーフ — 直すべきはモデルではなく契約だ。いかなる努力設定も、明示されていない受け入れ基準を補うことはできない。
サードパーティのガイドによる、サブスクリプションに固有の注意点で、誤解しやすい点があります。Codexがモデルごとに請求するクレジット料金は、APIの定価と同じ比率ではないため、APIの価格比率をそのままサブスクリプションのルーティングルールとして使うことはできません。Plusティアで報告されている5時間あたりのメッセージ許容量がこの点を示しています。Solで約15〜90、Terraで20〜110、Lunaで50〜280のローカルメッセージです。これほど幅があるのは、「メッセージ」が固定された作業単位ではないためです。ルーティングの判断がインボイスではなくサブスクリプションの上限に基づく場合は、その上限に照らして測定してください。
Codexを超えて:人々がこれを他に何に向けているのか
安価で深い推論の組み合わせは、コーディングエージェント以外でも有用であることが判明しました。以下は証拠付きの用途です:
• ブラウザエージェント。ある開発者がGPT-5.6 Lunaでブラウザ自動化スタックを実行し、Hacker Newsの上位15件の投稿を開き、リンク先の全ページを読んでレポートを作成——総コストは3セント。長時間実行・低リスク・高トークンという、まさにこのモデルが価格設定された用途だ。
• スキルチェーン。2人の実践者がそれぞれ独立に、単一のLuna Maxのオブジェクティブから、画像生成を画像-to-Three.jsコンバータに投入するという2スキルのパイプラインを駆動し、インタラクティブなローポリ3Dオブジェクトを取得したと報告した。また、それぞれが、それが週次の使用量カウンタをほとんど動かさなかったと述べている。「Lunaをビジュアル作業に使わないでください」という警告と並べて読む価値がある。Lunaは、ビジュアル作業を実行するツールをオーケストレーションしていたのであって、美学自体を判断していたわけではない。
• 1つのセッションをホットに保つ。 このモデルでは、キャッシュされた入力は100万トークンあたり$0.02、キャッシュされていない入力は$0.20です。これは90%の割引に相当し、Artificial Analysisの料金パネルに記載されています。また、キャッシュウィンドウは約30分です。複数のガイドが独立に導き出している実際的な意味合いとしては、同じコードベースを繰り返し読み込む1つの長時間実行セッションを維持する方が、タスクごとに新しいセッションを開始するよりもはるかに安価です。
• クォータ・アービトラージ。このセット全体で最も過激な主張であり、明確に主張としてラベル付けされている。ある開発者は、エフォートがほぼ無料である一方でティア倍率が大きいため、安いティアで最大エフォートを実行し、200ドルのプランで3週間かけて49億トークンを処理できたと報告している。APIレートなら6桁の金額に相当する。また、彼はKimi K3、Grok、DeepSeekのモデルをローカルルーターの背後にある同じピッカーに保持し、あるプロバイダーの制限に達しても作業が止まらないようにしている。誰もこのトークン数を独自に再現していない。しかし、その背後にあるルーティング習慣は、取り入れる価値がある部分だ。
Codex サブスクリプションなしで同じスプリットを実行する
上記のすべてはサブスクリプション型のストーリーです。人々がLuna Maxを気にする理由は、それが週次の上限を拡張するからです。API側では、同じアーキテクチャのほうが構築が簡単で、理解もしやすくなります。なぜなら、アローワンスを管理するのではなくインボイスを支払うことになるからです。そして、オーケストレーター/ワーカーの分割はプラグインではなくなり、通常のルーティングになります。
GPT-5.6 LunaはOrcaRouterを通じて利用可能で、入力100万トークンあたり$0.20、出力100万トークンあたり$1.20です。これはプロバイダーの一覧価格を0%マークアップで透過したものであり、そのため7月30日の値下げは、同社が発表した当日に当社側でも反映され、請求サイクルが1つ後になることはありませんでした。互換性のあるAPIで提供されており、/v1/chat/completionsおよび/v1/responsesのエンドポイントで利用できるため、reasoning-effortフィールドは直接接続する場合とまったく同じようにリクエストボディに含まれ、モデルIDはopenai/gpt-5.6-lunaです。GPT-5.6 SolとGPT-5.6 Terraも同じキーでアクセスできます。このパターンで重要なのはこの点です。ある層にオーケストレーターを置き、別の層にワーカーを置くというのは、2つのベンダー契約ではなく、1つの統合における2つのモデルIDです。ルーティングDSLを使えば、その分割を手作業でスレッドを繋ぎ合わせるのではなく、1回の呼び出しとして表現できます。また、自動フェイルオーバーは、クォータ・アービトラージを狙う人々がローカルルーターで解決するケースもカバーします。あるプロバイダーが劣化した場合、リクエストは停止する代わりに別の場所にルーティングされます。

正直な注意点が2つあります。Codex固有の機構(サブエージェントグラフ、プラグインマーケットプレイス、モデルカタログ、週次アローワンス)は同社のものであり、それらのどれもAPIキーには付属しません。もしあなたが望むパターンがsol-advisor(Codexアプリ内のもの)であるなら、Codexサブスクリプションが必要です。そして、上記の障害モードはモデルの特性であり、トランスポートの特性ではありません。ルーティングは、呼び出しのコストやプロバイダーが停止したときに何が起こるかを変えますが、Lunaがあなたの指示に従うかどうかは変えません。
これをコピーすべき人と、そうでない人
作業が大量かつ機械的に仕様化できるもの——リファクタリング、テストの足場づくり、抽出、ドキュメント作成、大規模リポジトリに対する分析パス——なら、設定は最大にして、Lunaを専用スレッドに置き、5つの質問による引き継ぎを行い、その前に計画用のSolインスタンスを、後ろにレビュー用のSolインスタンスを配置すれば、1桁少ないコストで済むと見込める。最大の成果を報告している人々は皆、何らかの形でこれを実践している。また、独立したコストデータは、「Solと同等」という枠組みは裏付けるところまでいかなくても、その方向性自体は裏付けている。
あなたの作業が探索的・美的なものであったり、漠然とした依頼が進むにつれて明確になっていくようなものであれば、現場からの報告は、節約した分を出力のやり直しに二度費やすことになるとはっきり述べています。また、インタラクティブに使う場合——それを眺めながら待つ場合——最大努力での2分間のコールドスタートは、価格に満足する以上に気になるでしょう。
注目すべき点:企業がLunaをv2サブエージェントプロトコル向けにポストトレーニングするかどうかだ。現在のプレイブックのぎこちない部分——別スレッド、失われた共有コンテキスト、カタログハック、リトラクト&リワイアの一連の流れ——はすべて、そのひとつのギャップが原因で存在している。それを埋めれば、このパターンの最良の形は数段階シンプルになる。
本当に答える価値のある質問
推論努力を最大にした場合、デフォルトよりもトークンあたりのコストは高くなりますか?
いいえ、そしてこれがこの設定について最も一般的な誤解です。GPT-5.6 Lunaは、努力(エフォート)の度合いに関係なく、100万トークンあたり入力$0.20、出力$1.20で請求されます。maxが変えるのは消費されるトークン数です——モデルはより多くの計画を立て、自己チェックを行い、回答する前に修正を加えます。Artificial Analysisは、このモデルが、中央値のモデルが6100万トークンを出力するベンチマークスイートにおいて、1億3000万の出力トークンを生成したことを測定しました。つまり、同じタスクでも、maxエフォートのセッションは中程度のエフォートのセッションよりも、完全に量によってコストが高くなり、さらに最初のトークンを生成するのにも時間がかかります。エフォートとは、品質ラベルをまとったトークン数のダイヤルにすぎません。
GPT-5.6 LunaはもうネイティブのCodexサブエージェントとして実行できますか?
2026年8月5日時点では、いいえ——そしてコミュニティは試みるのをやめています。Codexのネイティブなサブエージェント経路はLunaを受け付けません。カスタムエージェントの回避策では動作しますが、メインエージェントとの共有コンテキストが失われます。また、このパターンで最もよく知られたプラグインの開発者は、Lunaを削除した後、それをオーケストレーターが監視する別途起動されたトップレベルタスクとして再追加しました。Lunaが一度も選択されないマルチエージェント実行を目にした場合、それはおそらくフィルタリングによるものです。標準のモデルカタログがLunaをv2ではなくv1としてマークしているためで、ある開発者は自己責任で手作業によるパッチを当てています。これは、Codexのアップデートに伴い変更される可能性がリストの中で最も高い項目です。したがって、このレシピを含め、いかなるレシピも盲信せず、インストールされているバージョンで確認してください。
ClaudeやKimi K3のコーディングサブスクリプションを置き換えるのに十分ですか?
まさにこの理由で、複数の開発者が月額200ドルのプランを公にキャンセルしました。この問題を公然と持ち出した投稿は、毎日コードを書く免疫学者によるものでした。彼はKimi K3のコーディングサブスクリプションを解約しましたが、それは悪かったからではなく、彼の経験ではGPT-5.6 Lunaが自分の仕事と同等に優れていて、はるかに安かったからです——フロントエンドを除いては。独立したコスト数値はこの主張を退け難くしています。同じベンチマークスイートで、Kimi K3は最大努力で57を獲得し費用は2,437ドル、一方GPT-5.6 Lunaは最大で51を獲得し費用は174ドルでした。しかし、何かをキャンセルする前に、異論も読んでください。一致したセッションを測定してマイナスと出た開発者たちは、別のモデルをテストしていたのではありません。彼らは別の種類のタスク——オープンエンド、視覚的、または曖昧に指定されたタスク——をテストしていたのです。そしてその種のタスクでは、安価なモデルは節約分を帳消しにするほど大きく負けました。合理的な答えは、Luna Maxがあなたのコーディング作業、必ずしもあなたの最良のコーディングモデル、そしてそれを最も活用している実践者たちは、計画と確認のために最先端のティアを維持している人々だ、というものです。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
