生成された2列の比較スコアボード。タイトルは「GPT-6.1 Sol vs GPT-6 Luna - スコアボード」。左列「GPT-6.1 Sol」: 行は「知能指数: 51.8」、「インデックスタスクあたりのコスト: $0.72」、「100万あたりの価格: $2.00 / $10.00」、「インデックス実行時の出力トークン: 67M」、「Terminal-Bench 4.0: 56.1%」、「エフォートフロア: 低」と表示。右列「GPT-6 Luna」: 行は「知能指数: 38.1」、「インデックスタスクあたりのコスト: $0.07」、「100万あたりの価格: $0.10 / $0.50」、「インデックス実行時の出力トークン: 144M」、「Terminal-Bench 4.0: 12.6%」、「エフォートフロア: なし」と表示。フッターには「Artificial Analysis v4.3.2による最大努力時の独立した数値、ベンダーの定価。」と表示。
Guides & Insights

GPT-6.1 Sol 対 GPT-6 Luna:インデックス13ポイント、10倍の費用、そしてそれが通用しない2つの評価

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

OpenAIはGPT-6.1 Solを2026年9月29日にリリースした。GPT-6 Lunaが同じ基調講演サイクルで9月22日に登場してから、ちょうど1週間後のことだった。両者は同じ世代の両端に位置する。Lunaは安価なティア、Solはその上のミッドティア、そしてGPT-6 Astraは両者の上に君臨する。両者の価格差は桁違いだ——100万トークンあたり$0.10と$0.50に対し$2.00と$10.00、キャッシュ入力は$0.01に対し$0.10——そして独立系ボードでの能力差はIntelligence Indexで13.7ポイント、最大推論努力時で51.8対38.1である。13ポイントのために10倍の金額を払うのは、現在のOpenAIラインナップにおいてほぼ最悪の為替レートだ。この比較をわざわざ書く価値のあるものにしているのは、その後に続く40ドルの問いである。どの13ポイントなのか?

2つのモデル、そしてその間の1週間

GPT-6 LunaはGPT-6世代の小型モデルです。Open​AIが、大量の処理と低遅延が求められる作業、つまり分類、抽出、ルーティング、一括要約、エージェントの内部ループ向けに作られたと説明するモデルです。1,050,000トークンのコンテキストウィンドウと128,000トークンの出力上限を備え、テキスト、画像、ファイルを入力として受け取り、以下を含む6段階のエフォートラダー全体を維持しています:なし。これは6.1ティアでは廃止されました。料金表がその存在理由です:100万トークンあたり入力$0.10、出力$0.50、キャッシュ入力$0.01、キャッシュ書き込み$0.125、さらに272,000入力トークンを超える長いコンテキストでは$0.20、$0.75、キャッシュ$0.02に段階が上がります。

GPT-6.1 Solは、1週間後にリリースされたミッドティアのリフレッシュ版です。同じウィンドウ、同じ出力上限、同じ入力モダリティ、Lunaのものに対する2026年4月30日の知識カットオフ、そしてエフォートラダーは低から始まります。なぜなら、なしと最小は完全に拒否されるからです。価格は$2.00と$10.00で、キャッシュ入力は$0.10です — Lunaの入力レートの20倍、出力レートの20倍で、キャッシュ行はヒットあたり10倍高価です。

どちらも販売中で、どちらもChatGPT WorkとCodex、さらにAPIで利用でき、当社側ではどちらも同じキーで呼び出せます。この組み合わせに関して、どちらかを選ぶ必要は一切ありません。

13の指数ポイントが実際に買うもの

総合スコアは、この比較で最も情報量の少ない数値だ。なぜなら、まったく異なる挙動をするタスクを平均しているからである。Artificial Analysis v4.3.2 で最大の推論エフォートのもと、評価ごとにスコア化すると、その形は傾斜ではなく分裂である:

• AA-LCR v1.1、長文コンテキスト推論 — GPT-6 Luna 0.833 対 GPT-6.1 Sol 0.830。Luna がわずかに先行しています。

• SciCode — GPT-6 Luna 0.546 対 GPT-6.1 Sol 0.542。ここでも実質的に互角で、今回も安価なモデルが名目上わずかに先行している。

• Terminal-Bench 4.0 — GPT-6 Luna 0.126 対 GPT-6.1 Sol 0.561。43ポイントの差。ターミナル作業において、この2つのモデルは別格の実力差がある。

• Humanity's Last Exam — GPT-6 Luna 0.385 対 GPT-6.1 Sol 0.529。

• AutomationBench-AA — GPT-6 Luna 0.532 対 GPT-6.1 Sol 0.649。

• GDPval-AA v2.1 — GPT-6 Luna の Elo 1437.1 対 GPT-6.1 Sol の Elo 1575.1、専門的な知識業務における 138 ポイントの Elo 差。

• GDP.pdf — GPT-6 Luna 0.228 対 GPT-6.1 Sol 0.310。

• CritPt — GPT-6 Luna 0.194 対 GPT-6.1 Sol 0.317。

• AA-Omniscience — GPT-6 Luna 0.65 対 GPT-6.1 Sol 41.5。0 が正答と誤答が同数であることを意味する尺度において、Luna はちょうど水面ぎりぎりにあり、Sol はそれを大きく上回っています。

• MMMU-Pro — GPT-6 Luna 0.797 対 GPT-6.1 Sol 0.860。

• インデックスタスク1件あたりのコスト(独立) — GPT-6 Luna $0.068 に対し GPT-6.1 Sol $0.72。安価なモデルが有利な約10倍の差

• インデックス実行における出力トークン — GPT-6 Luna 1億4,400万 対 GPT-6.1 Sol 6,700万、クラス中央値は Luna が1億、Sol が約8,100万

10件の評価のうち2件は、安価なモデルに有利な引き分けだ。8件は高価なモデルに軍配が上がり、その8件のうち6件では、その差は僅差ではない。これが13ポイントの正直な解釈だ。それは一様な品質の勾配ではなく、2つの能力——持続的なエージェント実行と事実の信頼性——であり、そこではLunaは単に同じクラスのモデルではない。そして広い中間領域では、差は実在するものの、あなた自身の評価セットでは見えないほど小さい。

AA-LCRの結果には一つ但し書きが必要だ。というのも、それはルナを最もよく見せる数字だからだ。長文脈推論の0.833は強いスコアであり、2つのモデルは0.5ポイント以内に収まっているが、このベンチマークが測定するのは長い入力に対する検索と推論であり、長いセッションを通じて行動する能力ではない。Terminal-Bench 4.0における差は、「長いセッションを通じて行動する」ことが採点されたときの姿であり、その開きは43ポイントに及ぶ。

A generated hero card for a GPT-6.1 Sol versus GPT-6 Luna comparison, headed 'Thirteen index points, ten times the money', with two badges reading 'GPT-6.1 Sol: 51.8 at $2.00 / $10.00 per 1M' and 'GPT-6 Luna: 38.1 at $0.10 / $0.50 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

タスク単価の計算、そしてそれが成り立たなくなる時

Artificial Analysisは各インデックス実行の価格を実測トークン消費量から算出しているため、このコスト数値は料金表からの推計ではない。GPT-6 Lunaの実行はタスクあたり0.068ドル、GPT-6.1 Solは0.72ドルだった。比率は10.7倍で、公称20倍の価格比率よりやや見劣りするのは、Lunaがその実行で1億4400万出力トークンを生成したのに対し、Solが6700万だったからにすぎない——安価なモデルは2倍以上おしゃべりで、自らの優位を食いつぶしている。それでも、優劣は僅差ではなく、短答ワークロードではさらに広がるだろう。出力量が少なければLunaのおしゃべりペナルティは小さくなり、価格優位は固定されたままだからだ。

その算術が成り立たなくなるのは、この指標が似ても似つかないあらゆるワークロードにおいてだ。あなたのタスクが、20回のツール呼び出しを首尾一貫させ続ける必要のあるリポジトリ規模の編集であれば、そのタスクに失敗する$0.07のモデルはリトライループ全体に加えて実時間まであなたから奪い、一度で終わらせる$0.72のモデルのほうが安くつく。GPT-6.1 Sol自身のローンチ時のフレーミングは、まさにこの考え——完了したタスクあたりのコスト——の上に完全に成り立っており、そしてそれは正しい枠組みだ。関連する比較はトークン単価ではなく、成果あたりの期待コストであり、Lunaが完了できないタスクにおいて、その期待値に上限はない。

2つの構造的な詳細が、この境界をより鮮明にする。第一に、ロングコンテキストの段階だ。両モデルとも272,000入力トークンを超えると再価格設定され、Lunaは$0.20と$0.75、Solは$4.00と$15.00となる。そのため境界では絶対的な差は縮まるどころか広がるが、それでもLunaの再価格後のレートはSolの標準レートより1桁低い。第二に、そして見落としやすい点として、effortのはしごは同じ形をしていない。Lunaはnoneを受け付けるが、Solは受け付けない。まずSolにルーティングし、エラーやタイムアウト時にLunaへフォールバックするカスケードは、リクエストのreasoning.effortをそのまま引き継いではならない。一方のモデルで合法な構成が、もう一方ではエラーを返すからだ。これはルーティング層の関心事であり、モデル品質の問題ではない。そしてまさに、ルーティングルールを備えた単一のエンドポイントが吸収すべき類のものなのである。

両方走らせることが要点であり、保険ではない

どちらのモデルも OrcaRouter 上で、Open​AI 自身の定価のまま、何も上乗せなしで提供されています。GPT-6 Luna は $0.10 と $0.50、キャッシュ入力は $0.01、GPT-6.1 Sol は $2.00 と $10.00、キャッシュ入力は $0.10 で、それぞれの 272,000 トークンの段階も、ベンダーが記載するとおりに正確にそのまま反映されます。プラットフォームはプロバイダーの定価を上乗せするのではなくそのまま通すため、本記事の20倍という比率は、入出力の両方で、実際に支払う比率です。

A screenshot of the OrcaRouter model page for openai/gpt-6-luna, showing the listing dated 2026-09-22, the model described as the fast, cost-efficient tier of OpenAI's GPT-6 series for high-volume and latency-sensitive workloads, a 1M-token context with 128K maximum output, text, image and file input, and the list price of $0.10 input and $0.50 output per million tokens with a 1.45 s median time to first token.

ここで特にそれが重要なのは、このペアがこれから書かれるカスケードだからだ。分類器、ルーター、一括抽出ジョブ、リポジトリ規模のコーディングエージェントは同じモデルに載せるべきではないし、価格差は十分に広く、どちらに間違えても高くつく——片方では呼び出し1回あたり20倍高く、もう片方ではタスクが失敗する。1つのキー、2つのモデル、そして易しいタスクはLunaに送り、タスククラスが難しい場合やLunaの出力がチェックに失敗した場合にはSolへエスカレーションする仕組みは、2つ目のベンダー契約ではなく、我々側の設定だ。自動フェイルオーバーは、2つのうち一方が劣化しているケースをカバーする。8日前にリリースされたばかりのモデルにとって、それは依然として現実的な可能性である。

A screenshot of OpenAI's GPT-6 Luna documentation page, showing the model ID gpt-6-luna, the effort ladder supporting none, low, medium, high, xhigh and max, a 1,050,000-token context window with 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and the pricing table listing input at $0.10, cached input at $0.01, cache writes at $0.125 and output at $0.50 per million tokens.

決断を、一気に

• 分類、抽出、ルーティング、一括要約、エージェントの内部ループ — GPT-6 Luna、そしてそこで読むのをやめよう。$0.10/$0.50、キャッシュ読み取りは1セント。一般的な能力の13インデックスポイントは、答えが短く検証可能な作業において、10倍の請求額に見合うものではない。

• リポジトリ規模のコーディング、ターミナルエージェント、マルチステップ実行 — GPT-6.1 Sol。Terminal-Bench 4.0の43ポイント差こそがすべての論拠であり、この価格が買っているのはまさにこの能力だ。

• 誤った回答が高くつくナレッジワークの質問 — AA-Omniscience と GDPval-AA のギャップについて、GPT-6.1 Sol が言及。Luna の事実的信頼性スコアは喫水線ぎりぎりだ。

• 長い入力に対する短い生成回答 — GPT-6 Luna。20倍のコストがかかるモデルと同等の精度で長いコンテキストを推論し、1億4,400万トークンの冗長性ペナルティが適用される余地は一切ありません。

• すでにnoneに設定されているもの — Luna にとどまるか、変更のためのコストを見込むか。その段階は GPT-6.1 Sol には存在しません。

• レイテンシに敏感な領域 — ボード自身の計測によれば、GPT-6 Luna は毎秒129.4出力トークン、最初のチャンクまで100秒。対する Sol は59.7と332。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新