
GPT-6 SolとGPT-6 Luna:安いトークンが必ずしも安いタスクとは限らない
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ベンダーはGPT-6 SolとGPT-6 Lunaを2026年9月22日にリリースし、どこでも見出しを飾っているのは価格だ。Solは入力100万トークンあたり2.00ドル、出力10.00ドル、Lunaは0.10ドルと0.50ドルで、どちらもGPT-5.6 SolとGPT-5.6 Lunaが現在のプロモーション料金で請求する額のおよそ半額であり、どちらもフラッグシップのGPT-6 Astraの10.00ドル/50.00ドルを大きく下回っている。ベンダー自身の発表は「キャッシュと推論もより効率的にしました」を先頭に掲げている。それを割引の話として読むことの問題は、実際に請求書に載る単位がトークンではないことだ。それはタスクだ。そして同日に公表された最初の独立系測定は、まさにその単位において2つの新モデルが逆方向に漂流していることを示している——入力で20倍安いほうであるGPT-6 Lunaが、自らの前世代に対して2つのうち悪いほうの成績を残しているのだ。これらのモデルの一方は純粋なアップグレードであり、もう一方は本物のトレードオフだが、ベンダーの発表は両者を区別していない。
数字に入る前に、本稿の出典ルールを述べておく。ここには2つの証拠の山があり、両者にはまったく異なる重みを与えるべきだからだ。価格、コンテキストウィンドウ、キャッシュ料金、知識カットオフは、2026年9月23日に読んだOpenAI自身のAPIドキュメントと価格表に基づくもので、サービス階層とキャッシュ書き込みの行は、発表だけから取ったのではなく、サードパーティのコスト追跡ツールと照合して裏付けている。OpenAIのベンチマーク表——AutomationBench、DeepSWE 1.1、OSWorld 2.0、Agents' Last Exam、および社内の事実性評価——はベンダー報告であり再現されていないため、以下でそれらから引用するすべての数値にはその旨を明記している。独立した数値はArtificial Analysisによるもので、同社は提供開始日に両モデルを自社のIntelligence IndexとCoding Agent Indexで実行した。意思決定で信頼すべきなのはこちらだ。両者が食い違う場合は、平均化せず、その旨を記事で明記する。
ローンチを1段落で
SolとLunaはGPT-6ファミリーのミッドティアおよびローティアのモデルで、GPT-6 Astraの背後にある手法でトレーニングされ、その能力の大半により速く安く到達する手段として位置づけられている。OpenAIの打ち出し方は、生の能力ではなくタスクあたりのコストだ。同社によれば、GPT-6 Solは内部の事実性評価でGPT-5.6 Solの約半分しかミスをせず、GPT-6 Lunaはより高い推論エフォートで、タスクコスト約100分の1でGPT-5.6 Solの事実性に匹敵するという。両モデルともテキストと画像を入力として受け取りテキストを出力し、どちらも128Kの出力上限を伴う1,050,000トークンのコンテキストウィンドウを備え(Artificial Analysisは同じモデルについて872kと記載しているため、このウィンドウの上限はベンダー公称値として扱うべきだ)、また両モデルとも推論エフォートをnoneからmaxまで公開している。これはGPT-6 Astraが提供しないレベルだ。Astraにはnoneが存在しないためである。モデルIDはgpt-6-solとgpt-6-lunaだ。利用経路はAPI、Plus、Pro、Business、Enterprise、Eduアカウント向けのChatGPT WorkとCodex、そして同日に両モデルの一般提供を発表したAmazon Bedrockだ。FreeおよびGoユーザーはデスクトップアプリでLunaを利用できる。どちらのモデルもまだ通常のChatモードには入っていない。
4つの独立した数値が示すもの、そしてなぜそれらは食い違うのか
まずGPT-6 Solから見ていきましょう。その話は単純だからです。Artificial AnalysisはこれをIntelligence Indexで48、測定対象212モデル中18位と評価しています。インデックスタスクあたり$1.06で、GPT-5.6 Solの$1.99と比べると — 同じインデックススコアでおよそ半分のコストであり、タスクあたりのコスト改善は霧散せず持続します。そのCoding Agent Indexは55から57へ上昇し、Terminal-Bench 4.0は37%から43%、SWE-Atlas-QnAは54%から58%へと動き、パレートフロンティア上でタスクあたり$2.99です。そのハルシネーション率は92%から60%へ低下し、回答を控える挙動はまったく形を変えました。以前の世代が99%の質問に回答していたのに対し、今は83%に回答し、その代わりに誤答が4分の1減り、精度は59%から54%へ低下しています。これは、知らないときには黙るよう教えられたモデルであり、AA-Omniscience Indexが22から27へ動いたことは、同じ事実をスコアとして述べたものです。
さて、GPT-6 Lunaとなると、話は変わります。Artificial AnalysisのスコアはIntelligence Indexで37——GPT-5.6 Lunaのスコアとまったく同じ数字です。インデックスタスクあたりのコストは$0.18から$0.07へ下がり、約60%減で、その節約は本物です。しかし、そのCoding Agent Indexは43から41へ低下し、SWE-Atlas-QnAは49%から44%へ、DeepSWE 1.1は66%から64%へ低下しています。ハルシネーション率は93%から77%へ改善し、回答を差し控える行動はほとんど変わりません——精度は44%対43%、AA-Omniscienceは−10から1。まとめて読むと、測定された知能は同じで、タスクコストはおよそ40%、コーディングエージェントはより悪く、回答品質はほぼ変わらない、ということです。
それは矛盾ではない。そしてその理由は重要だ。安いトークンが得るものを減らすのは、モデルが同じ作業を終えるのにより多くのトークンを使う場合だけだ——そして独立したデータは、これらのモデルが使うトークンを減らすのではなく、増やすと示している。インデックスタスクあたりの出力は、Solでは29kから31kトークンに、Lunaでは41kから51kに増えた。GPT-6 Lunaの60%の節約は、完全に価格引き下げによるもので、より少ない消費で動くことによるものではない。タスクあたりのトークン数のずれは、ここでは計算がまだあなたに有利に働くほど小さい。しかし、カテゴリとして無視できるほど小さくはない。なぜなら、将来の値下げが、よりおしゃべりなモデルによって相殺されうる仕組みがそれだからだ。OpenAI自身の説明も、同じ理由でタスクあたりのコストへと移っている。
注目の2大指数の外側に、2つのリグレッションが横たわっている。どちらもOpenAIの発表には出てこないのだから、名前を挙げておく価値はある。知識労働の成果物を測るGDPval-AA v2.1では、GPT-6 Solが前世代に対しておよそ100 Eloを失い、GPT-6 Lunaもおよそ75を失っている。GPT-6 Lunaはさらに、Solが横ばいを保つAA-Briefcase v1.1でもおよそ45 Eloを落としている。この差についてArtificial Analysisは、プレゼンテーションの弱さとルーブリック項目の欠落を原因として挙げている。安価なティアを大量要約・抽出・分類に使っているなら、これらは一切あなたに影響しない。人が承認する文書の下書きに使っているなら、影響する。

キャッシュの変更こそが本当のAPIニュースだ
料金表の下に隠れているのは、見出しの値下げよりも本番環境の請求額にとって重要な変更であり、OpenAI自身の投稿が一節でほのめかしている部分だ。変わった点は三つあり、三つ目は二度読むべきものだ。
1つ目は割引そのものです。キャッシュされた入力の読み取りは入力レートの10%で課金されます。つまり90%の割引であり、これは新たな条件ではなく、このファミリーがすでに適用していたものと同じ条件です。Solのキャッシュ入力は100万あたり$0.20、Lunaは$0.01です。キャッシュ書き込みには1.25倍の割増が適用され、それぞれ$2.50と$0.125で、有効期限(TTL)は単一の30分です。
二つ目は制御です。明示的なキャッシュをprompt_cache_optionsとprompt_cache_breakpointで行う仕組み — つまり、再利用可能なプロンプトプレフィックスがどこで終わるのかをプロバイダーが推測するのに任せるのではなく、自分で宣言できるようにするパラメータ — は、両方のモデルで利用できます。これは新しい API サーフェスではありません。新しいのは、デフォルトのヒット率が上がったことで、使う価値が出てきたという点です。
三つ目はアーキテクチャを変えるものだ。推論エフォートを変えたり、ツールをオン・オフに切り替えたりしても、キャッシュされたプレフィックスが無効になることはもうない。これ以前は、難しいステップでエフォートを引き上げ、簡単なステップで引き下げるエージェントループは、ダイヤルを切り替えるたびにコンテキスト全体を再処理する代償を払っていた。会話の途中でツールを追加したり削除したりする場合も同様だった。そうした負担は、これら2つのモデルではもうなくなった。OpenAIはGitHubの報告を引用しており、それによると、この変更によって、数十億件のリクエスト全体で、新たな処理を必要とするプロンプトトークンの割合が半分以上削減されたという。これはベンダー提供の数値として扱うべきだ——信頼できるものではあるが、独立した監査は受けていない。
長いエージェントループで計算すると、2つの発表の優劣は逆転する。30,000トークンのシステムプロンプトとツールスキーマを200ターンにわたって持ち回るループは、600万トークン分のコンテキストを移動させる。キャッシュなしなら、GPT-6 Solでは入力に12.00ドルかかる。プレフィックスが100万トークンあたり0.20ドルでキャッシュされれば、1.20ドルに一度きりの書き込み分を加えた額になる——料金引き下げがまったく適用される前の時点で、パラメータ変更だけで桁違いだ。発表が売りにしたのは料金引き下げだった。実際に数字を動かすのはキャッシュの挙動であり、OpenAIがこれらのモデルを売り込んでいるワークロードでは、2.00ドルの見かけの料金がはるかに安いもののように振る舞う理由もそこにある。
発表が飛ばした部分も含めた料金表
見出しの料金は料金表のすべてではなく、3つの階層が特定のワークロードにおける判断を変える。
• ベース — GPT-6 Sol 入力 $2.00 / 出力 $10.00、GPT-6 Luna 入力 $0.10 / 出力 $0.50(100万トークンあたり、最大272K入力トークンのプロンプトの場合)
• ロングコンテキスト — 272K入力トークンを超えると、リクエスト全体が入力2倍、出力1.5倍で課金されます:Solは$4.00/$15.00、Lunaは$0.20/$0.75。これは緩やかな限界料率ではなく、崖のような急激な跳ね上がりです。プロンプトが300Kトークンに達する場合、境界を超えた28K分ではなく、リクエスト全体で2倍を支払うことになり、文書をしきい値未満の2回の呼び出しに分割する方が、しきい値を超えて一度に送るより安く済むことがよくあります。
• サービスティア — Flexは処理完了までの時間が長くなる代わりに請求額を半減させ(Solは$1.00/$5.00、Lunaは$0.05/$0.25)、Priorityは倍にする。どちらもservice_tierパラメータで選択する。Flexはバッチ的なジョブが置かれるべき場所であり、ほとんどそうなってはいない。
• キャッシュ済み入力 — Solでは100万あたり$0.20、Lunaでは$0.01で90%割引、TTLは30分、キャッシュ書き込みには1.25倍のプレミアムが付きます。
• コンテキストと出力 — 1,050,000トークンのウィンドウ、最大128Kの出力、テキストと画像を入力、テキストを出力、推論エフォートはnoneからmaxまで、デフォルトはmediumです。
• ナレッジカットオフ — GPT-6 Sol は 2026年4月20日、GPT-6 Luna は 2026年5月18日で、同じファミリー内でも1か月の開きがあります。両モデルが同じ世界観を共有していると想定する前に知っておく価値があります。
OpenAIのベンチマーク表が示すもの、そして示さないもの
OpenAIが公表した比較はすべてタスクあたりコストで、すべてAnthropicとの比較であり、すべてベンダーが実施したものだ。47ツールのエージェント評価であるAutomationBench 1.0.6では、同社は、xhigh effortのGPT-6 Solがタスクあたり$0.27で33.2%を記録し、これに対するClaude Opus 5は26.9%で、タスクあたりコストは約11倍だったと報告している。DeepSWE 1.1では、max effortのSolが68.8%を記録したのに対しClaude Fable 5は69.9%——スコアでは負けるがタスクあたりコストは約80%低い——で、Lunaは66.6%だと報告している。OSWorld 2.0では、xhighのSolが60.5%で、Opus 5の60.3%に対し、これもタスクあたり約80%低コストだ。Agents' Last Examでは、Solは56.4%に達し、OpenAIによればこれはタスクあたり60%低いコストでOpus 5の最高結果を上回る。
これらの数値はすべてベンダーによる申告であり、再現されたものではない。そして、2つの注意点は、片付けてしまうのではなく、今後も持ち続ける価値がある。第一に、OpenAIがベンチマークの比較対象としたのはClaude Opus 5であり、発表のわずか数時間前にリリースされたClaude Opus 5.5ではなかった。そのため、同一ハーネスでの比較はまだ存在せず、どちらのモデルが実際に成功したタスクあたりのコストをより低く実現するのかは、まだ確立していない。第二に、タスクあたりのコストは、正解したタスクあたりのコストではない。83%のケースで回答し、残りでは回答を控えるモデルは、棄権をタスクとして数えるベンチマーク上では、タスクあたりのコストが安く見えてしまう。それを正直に見積もることを可能にするのが、上記の独立した棄権データである。旧モデルが99%の質問に回答していたのに対し、GPT-6 Solが83%しか回答しないのは意図的なトレードオフであり、それが良い取引かどうかは、誤った回答があなたにどれだけのコストをもたらすかによって完全に決まる。
OpenAIは、高いエフォート設定のGPT-6 Lunaがタスクコスト約100分の1でGPT-5.6 Solの事実性に匹敵すると報告している。これは能力の比較ではなく事実性の比較であり、また独立系のCoding Agent Indexでは、GPT-6 Lunaは2ポイント低く、GPT-5.6 Lunaはもちろん、GPT-5.6 Solには遠く及ばない.

これで実際に何をすべきか
GPT-6 Solはわかりやすい選択肢だ。同等のインデックススコアでタスクコストが半分、より優れたコーディングエージェント、幻覚の大幅な減少、そして回答を控える行動の実質的な変化——これらが合わさって、賭けではなくスケジュールに沿って実行できるアップグレードになる。GPT-5.6 Solを使っているなら、これは移行であり、唯一の本当の疑問は、あなたのプロンプトのうちどれが旧モデルの何にでも答える姿勢に依存しているかだ。
GPT-6 Luna は、移行する前にテストすべきものだ。厳密に優れた GPT-5.6 Luna ではなく、形の異なるものだ — タスクあたりのコストは安く、自ら主張することについては安全側で、エージェント型コーディングでは測定可能なほど劣る。大量の分類、抽出、ルーティング、要約においては、このトレードはほぼタダ同然の利益に近い。コーディングエージェントに供給するもの、あるいは人が承認する文書を生成するものについては、Coding Agent の2ポイントの退行と GDPval の低下が、自分のタスクを両方で実行するまで GPT-5.6 Luna を経路に残しておく理由だ。
それは、どちらか一方をハードワイヤリングしないことの根拠でもある。現時点で両モデルはOpenAI専用であり、これらのティアが担うワークロード——ルーティング、抽出、低コストの分類——はまさに、同じエンドポイントの背後に第二のプロバイダーを置くことで、モデルのリグレッションを一大事ではなくしてくれる領域だ。OrcaRouterはプロバイダーの定価を0%のマークアップでそのまま通すため、ベンダーの料金改定はベンダー側に反映されたその同じ日に当社側にも反映される。そしてルーティングDSLを使えば、トラフィックの簡単な割合はより安価なモデルの背後にGPT-6 Lunaを置き、より難しい割合はGPT-6 Solに振り分けられる——どちらかの経路が劣化した場合には自動フェイルオーバーが働く。ローンチ初日に勝者を選ばなくても、そのローンチの恩恵は受けられる。
正直な注意点として、2026年9月23日時点では、GPT-6 SolとGPT-6 LunaはOrcaRouter経由でルーティングできません。当社はまだこれらをホストしておらず、上記のいずれも、当社がホストしているという主張として受け取られるべきではありません。本日当社側で利用可能なのは比較セットです。GPT-5.6 Solが$4.00/$20.00、GPT-5.6 Lunaが$0.20/$1.20、GPT-6 Astraが$10.00/$50.00で、これは移行を決断する前にそのコストを見積もるためにまさに必要なものです。

次に見るもの
このローンチが実際に何だったのかを決着させるには、3つのことが必要だ。第一は、GPT-5.6 Lunaの$0.20/$1.20という料金が四半期を生き延びるかどうかである。なぜなら、あるベンダーによる恒久的な価格は歴史的に、それの終わりではなく序盤の一手だったからだ——そして同日のClaude Opus 5.5のリリースは、この値下げを生んだ圧力が消えていないことを示唆している。第二は、回答留保への変化が実地で持ちこたえるかどうかである。GPT-6 Solが6問に1問の回答を辞退するのは、ラボでは改善と読めるが、回答があることを前提としたパイプラインでは壊れた製品と読める類の変化だ。第三は、キャッシュの挙動があなたのトラフィックで実際に起きているかどうかであり、これは今週測定可能で、測定によってのみ答えが出る——割引は十分に大きいので、最も長いプロンプトでキャッシュヒット率を計測するために費やす1時間は、もう1つのベンチマーク表よりも価値がある。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
