生成された2列の比較スコアボード。タイトルは「GPT-6.1 Sol vs GPT-5.6 Sol - スコアボード」。左列「GPT-6.1 Sol」: 行は「インテリジェンス指数: 51.8」、「インデックスタスクあたりのコスト: $0.72」、「入力 / 出力: $2.00 / $10.00」、「キャッシュされた入力: $0.10」、「インデックス実行時の出力トークン: 67M」、「エフォートフロア: 低」。右列「GPT-5.6 Sol」: 行は「インテリジェンス指数: 47.0」、「インデックスタスクあたりのコスト: $1.99」、「入力 / 出力: $4.00 / $20.00」、「キャッシュされた入力: $0.40」、「インデックス実行時の出力トークン: 90M」、「エフォートフロア: なし」。フッターには「Artificial Analysis v4.3.2による最大エフォートでの独立した数値。ベンダーの定価。」と書かれています。
Guides & Insights

GPT-6.1 Sol 対 GPT-5.6 Sol:インデックス4.5ポイント、請求額は半分、2つのリグレッション

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

OpenAIはGPT-6.1 Solを2026年9月29日にリリースした。GPT-5.6 Solが前世代のフラッグシップとして2026年7月9日に登場してから11週間後のことだった。両モデルは今も販売中で、どちらも引き続き呼び出し可能であり、中立ボード上での両者の差は4.8ポイント——Artificial AnalysisのIntelligence Indexで51.8対47.0で、いずれも同じ10種類の評価スイートで最大推論エフォートで測定したものだ。価格差はスコア差よりはるかに大きい。完了したインデックスタスク1件あたり$0.72対$1.99、100万トークンあたり$2.00/$10.00対$4.00/$20.00である。これが短い説明だ。長い説明はこうだ——アップグレードは一様ではなく、2つの評価では後退した。

各モデルとは何か、そして何が何を置き換えたのか

GPT-5.6 Solは5.6ラインの頂点だった——クローズドでAPI専用のモデルで、1,050,000トークンのコンテキストウィンドウ、128,000トークンの出力上限、テキスト・画像・ファイル入力に対応し、推論のはしごはnoneからmaxまで。Open​AIはこれを、最も困難な作業のために作られたティアと説明していた。つまり、長期的なエージェント型ワークフロー、複数ファイルにわたるソフトウェアエンジニアリング、深い推論。そしてそれに見合った価格設定で、100万トークンあたり$4.00と$20.00、キャッシュ済み入力が$0.40、キャッシュ書き込みが$5.00だった。入力トークンが272,000を超えると$8.00と$30.00に再設定され、Batchティアは$2.50と$15.00だった。

GPT-6.1 Solは、その後に登場した世代の中間層です。GPT-6 Astraの下、GPT-6 Lunaの上に位置し、現在ではOpen​AIがコストに敏感な開発者に推奨するモデルとなっています。1,050,000トークンのウィンドウと128,000トークンの出力上限を維持し、知識カットオフを2026年4月20日から4月30日に延長し、エフォートラダーを6段から5段に削減しました——low、medium(デフォルト)、high、xhigh、max。none値は現在エラーを返します。そしてOpen​AIの移行ガイダンスは、置換はlowであり、サイレントアップグレードではないと明確に述べています。

これは少し立ち止まって考える価値がある。今回のリリースの中で、コストを節約するのではなく、むしろコストがかかる唯一の変更だからだ。安価で高速な非推論呼び出しを得るためにnoneを使っていたパイプラインは、どちらのモデルファミリーでも、もうその構成を持てない。GPT-6.1 Sol で最も安価な段階は推論段階であり、推論トークンは、目に見えるかどうかに関わらず出力トークンとして課金される。

はしごを、一段ずつ

独立した評価委員会は、両モデルのすべてのエフォート設定についてスコアと実行コストを公開しており、これにより直接対決は単一の比較よりも有用なものになる。同等の設定で並べると:

• エフォートのはしご、GPT-6.1 Sol — max 51.8でインデックスタスクあたり$0.72、xhigh 51.0で$0.39、high 50.2で$0.32、medium(デフォルト)47.8で$0.21 • 出力速度 — GPT-6.1 Solは毎秒59.7トークン、GPT-5.6 Solは87.8
• 最初のチャンクまでの時間 — GPT-6.1 Solは332秒、GPT-5.6 Solはさらに速い数値で、ボード中央値は約4秒
• インデックス実行の出力トークン — GPT-6.1 Solは6,720万、GPT-5.6 Solは9,000万
• 入力/出力価格 — $2.00 / $10.00 対 $4.00 / $20.00
• キャッシュ済み入力 — $0.10 対 $0.40、キャッシュ書き込み $2.50 対 $5.00
• バッチ料金 — GPT-6.1 Solは未公開、GPT-5.6 Solは$2.50 / $15.00
• 長コンテキスト段階 — 入力トークンが272,000を超えると、GPT-6.1 Solはリクエスト全体で$4.00 / $15.00に価格が切り替わり、GPT-5.6 Solは$8.00 / $30.00
• エフォートの下限 — low 対 none

そのリストからは2つのことが導き出される。第一に、この値下げはプロモーションではなく構造的なものだ。GPT-6.1 Solの標準料金である$2.00と$10.00は、GPT-5.6 Solのバッチ料金である$2.50と$15.00を下回っている。つまり旧モデルの割引料金でさえ、新モデルの定価より高い。第二に、このアップグレードはレイテンシーにおいて一直線の改善ではない。GPT-6.1 Solは出力生成が約3分の1遅く、ベンチマークの長文プロンプトテストでは最初のチャンクまで332秒を要した。これはGPT-6 Solの107秒と同じ桁であり、ベンチマーク中央値のおよそ80倍にあたる。GPT-5.6 Sol上でインタラクティブな製品を構築したのであれば、これはあらゆるベンチマークとは無関係な機能上のリグレッションであり、その修正はパラメータではなくアーキテクチャによるものだ。

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

2つの評価が間違った方向に動いた

総合ゲインは4.8ポイントである。構成要素は一様にプラスではなく、取締役会の評価単位のスコアもそのことを示している:

• SciCode — GPT-6.1 Sol 0.542 対 GPT-5.6 Sol 0.571。科学的コーディングにおける2.9ポイントの低下。
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 対 GPT-5.6 Sol Elo 1611.3。経済的に価値のある知識労働における36ポイントのElo低下。
• Humanity's Last Exam — GPT-6.1 Sol 0.529 対 GPT-5.6 Sol 0.495。3.4ポイントの上昇。
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 対 GPT-5.6 Sol 0.399。16ポイントの上昇で、このペアリングにおける最大の単一変動。
• AA-Omniscience — GPT-6.1 Sol 41.5 対 GPT-5.6 Sol 22.0。これは単純な想起力ではなく、知識の信頼性とハルシネーションに関するもの。
• AA-Briefcase v1.1、AutomationBench-AA、AA-LCR v1.1、GDP.pdf、CritPt — 残りの5つで、合成スコアを構成し、4.8ポイントの上昇の残りがそこで稼がれる。

ターミナル作業では実質的に優れ、事実の信頼性では大幅に優れ、科学的コーディングとプロフェッショナル業務のEloでは測定可能なほど劣るモデルは、厳密により優れたモデルではない。それはフロンティア上の別の点であり、意図的にそこに置かれた。Open​AI自身によるGPT-6.1 Solの発表時の位置づけは、最大スコアではなく、ほぼフラッグシップ品質での完了タスクあたりコストだ。あなたのワークロードがSciCode型またはGDPval型なら、総合スコアはあなたに当てはまる数字ではなく、当てはまるのはこの回帰だ。

GPT-5.6 Sol は依然として公開されている長文コンテキストの結果を有している

旧モデルが新モデルにはない数値を持っている唯一の点は、GPT-6.1 Solの料金表が切り替わるコンテキスト帯における検索精度です。GPT-5.6 Solは、256,000~512,000トークンの範囲で91.5%というMRCR v2の8ニードル結果を公開しています。GPT-6.1 Solには公開された対応する数値がなく、入力トークンが272,000を超えると、リクエスト全体が入力とキャッシュで2倍、出力で1.5倍に再価格設定されます。

この2つの事実を突き合わせると、新しいモデルの経済性が最も弱いセグメントは、まさに古いモデルが唯一文書化された強みを持つセグメントである。節約が消えるわけではない——再価格設定されたティアの$4.00と$15.00は、GPT-5.6 Sol自身のロングコンテキストティアの$8.00と$30.00に対して、依然として半額だ——しかし、半額という話は汎用ワークロードの話であり、ロングコンテキスト検索パイプラインはそうではない。それがあなたのワークロードなら、公表されている91.5%を伴う$4.00と$20.00のGPT-5.6 Solは、とどまることを正当化できる選択肢だ。

GPT-5.6 Solの他の公開済み結果はそのまま維持されており、一部のチームが移行しない理由でもある。ウェブリサーチエージェント向けBrowseComp 90.4、Terminal-Bench 2.1は88.8と88.0、SWE-Bench Pro 64.6、Agents' Last Exam 53.6、OSWorld 2.0は62.6。これらはOpen​AIが報告したもので、Open​AIのハーネス上で、7月に報告された。それ以降変わったのは、ボードが両モデルを単一のスイート、単一の設定で採点するようになり、古いモデルが総合スコアとコストで負けることだ。

移行自体は文字列の変更です。ただし1つ例外があります。

同じベンダー、同じAPIサーフェス、ランキングでも隣接、同じウィンドウと出力上限 — つまりほとんどのスタックにとって、これはモデル識別子と、半額になる価格にすぎません。例外は具体的で、切り替えを実行する前に名指しする価値があります。

コードでreasoning.effortをnoneまたはminimalに設定すると、劣化するのではなく失敗します。そして、lowが文書化された代替値です。トラフィックが272,000入力トークンを超える場合は、節約額をモデル化する前に再価格設定されたティアを確認してください。製品が初回トークンまでの時間に依存しているなら、出荷前に測定してください。ボードの332秒という数字は丸め誤差ではありません。また、評価セットにSciCode型やGDPval型のスライスが含まれている場合は、複合スコアを信用するのではなく、そのスライスを両方のモデルで実行してください。

両モデルはOrcaRouter上でOpenAI自身の定価で提供されています — GPT-6.1 Solは$2.00と$10.00、キャッシュ入力は$0.10、GPT-5.6 Solは$4.00と$20.00、キャッシュ入力は$0.40 — パススルーモデルの下では、OpenAIの価格変更がリセラーの再交渉後ではなく、適用された当日に当社側へ反映されます。価格表は値上げされるのではなくそのままパススルーされるため、本記事の計算はそのまま得られる計算です。同じタスクあたり$0.72のモデル、同じ半減、どちらの側にもプラットフォームの割増は上乗せされません。

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

両方を1つのエンドポイントの背後に置くことの実用的な利点は、比較が生きたまま保たれることにある。新しいトラフィックはGPT-6.1 Solに送り、GPT-5.6 Solは設定を1回変えるだけで切り替えられるフォールバックとして、また長いコンテキストを扱う経路として維持し、2か月前に登場したフラッグシップの可用性とEnterpriseの有効化がまだ固まりきっていない期間を自動フェイルオーバーでカバーする。請求額を半減させつつ2つのサブベンチマークを後退させる移行は、一度決めて忘れていい決定ではない。ルートごとに下す決定であり、それを安価にしてくれるのがルーティング層だ。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

それぞれの居場所

• 汎用的なエージェント作業およびターミナル作業 — GPT-6.1 Sol。Terminal-Bench 4.0で16ポイント、しかも半額となれば、迷う余地はない。
• 事実の信頼性、検索回答型プロダクト — GPT-6.1 Sol、AA-Omniscienceの差はほぼ20ポイント。
• 科学的コーディング — まず自社の評価を確認せよ。ボードは2.9ポイントの後退を示しており、総合スコアではそれが表面化しない。
• 経済的に価値のあるナレッジワーク — 同じ注意が必要。GDPval-AA Eloの後退は36ポイント。
• 272,000トークンを超える長文脈検索 — GPT-5.6 Sol。GPT-6.1 Solがその帯域で公表数値を持つまでは。
• 対話型でレイテンシに敏感なサーフェス — 移行前に測定せよ。出力は速いが、最初のトークンはかなり遅い。
• 最も安価な非推論呼び出し — どちらでもない。その構成はこのファミリーにはもはや存在しない。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新