
GPT-6 Sol Pro 対 Claude Opus 5:誰も表に載せない「努力のはしご」
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
GPT-6 Sol Pro と Claude Opus 5 は常に互いに比較され、しかもほとんどいつも間違った設定で比較されている。流布している比較は、Claude Opus 5 を推論エフォート最大にしたものと、GPT-6 Sol Pro を推論エフォート最大にしたものを突き合わせるもので、これは中立インデックスで 3 ポイント差、コストで 5 倍の差を生む。両モデルを、それぞれのベンダーがデフォルトとして出荷する構成に設定し — 前者の名前に含まれる「Pro」は推論構成であって、別個のモデルではないことを忘れずに — そうすれば、3 ポイント差は完全に消える。残るのはコスト差であり、それがこの話の中で、実際の本番請求書に触れても生き残る唯一の部分なのだ。
これは見せ方のトリックではない。互いに較正されていない2つのエフォートのはしご——互いの旧モデルをベンチマークとする2社のベンダーが公表したもの——が直接もたらした結果である。
比較する前に、2つのモデルが実際に何であるか
GPT-6 Solは、2026年9月22日から一般提供されているOpenAIの中位層推論モデルで、入力トークン100万個あたり2.00ドル、出力トークン100万個あたり10.00ドルです。OpenAIの開発者向けドキュメントには gpt-6-sol-pro というモデル識別子は存在しません — このページに掲載されているSolの項目は1つだけで、コンテキストウィンドウは1,050,000トークン、最大入力は922,000トークン、出力上限は128,000トークン、知識カットオフは2026年4月20日、推論エフォートの段階は none、low、medium、high、xhigh、max で、デフォルトは medium です。「Pro」は推論モードの値であり、GPT-5.6世代が確立してこの世代が継承したのと同じエイリアスパターンです。GPT-5.6 Sol Pro というサードパーティのカタログ登録は実在し、現在は2.00ドルと10.00ドル — GPT-6 Solの数字 — を記載していますが、これは命名上のアーティファクトであり、製品ではありません。
Claude Opus 5 は Anthropic の実在する個別価格のモデルで、2026年7月24日から一般提供されており、100万トークンあたり入力5.00ドル、出力25.00ドルです。コンテキストウィンドウは1,000,000トークン、同期出力の上限は128,000で、独自のエフォートラダー — output_config.effort — は low、medium、high、xhigh、max で、デフォルトは high です。思考は適応型でデフォルトで有効になっており、これは Opus ファミリーでは初めてです。
以下すべてを規定する、そして既存の比較ページのどれも載せていない事実がもう一つあります。Anthropic自身のライフサイクル表ではClaude Opus 5がActive(レガシー)とされており、Claude Opus 5.5への移行バナーが示されています。同モデルは2026年9月22日に一般提供が開始され、価格は4.00ドルと20.00ドルでした。OpenAIのローンチチャートは依然として5.5ではなくOpus 5をベンチマーク対象としています。この比較に登場するモデルは前世代のOpusです。
2つの価格ラインを、1行ずつ
どちらもベンダーリストだ——OpenAIとAnthropic自身が公表した数値であり、それらをホストするプラットフォームによってそのまま変更されずに渡されている。
• 入力 — GPT-6 Sol 100万トークンあたり$2.00 対 Claude Opus 5 100万トークンあたり$5.00
• 出力 — GPT-6 Sol 100万トークンあたり$10.00 対 Claude Opus 5 100万トークンあたり$25.00
• キャッシュ読み取り — GPT-6 Sol は100万トークンあたり $0.20、Claude Opus 5 は100万トークンあたり $0.50。どちらも非キャッシュ入力料金の一律10%です
• キャッシュ書き込み — GPT-6 Sol は単一のTTLで100万トークンあたり$2.50、Claude Opus 5 は5分のTTLで$6.25、1時間のTTLで$10.00。より長いTTLはOpenAIが提供していないオプションであり、ホスト型カタログカードに表示される階層であるため、ほとんどの比較表が誤って引用するのはこの階層だ
• 長文コンテキストの扱い — GPT-6 Sol は、リクエストが入力しきい値を超えると、そのリクエスト全体に対してより高いレートで再価格設定します。Claude Opus 5 は長文コンテキスト割増をまったく適用しないため、900,000トークンのリクエストも9,000トークンのリクエストと同じトークン単価で課金されます
• バッチ — GPT-6 Solは標準割引のバッチエンドポイントを備えているのに対し、Claude Opus 5のMessage Batches APIは双方向で50%オフであり、またAnthropicのバッチ割引はプロンプトキャッシングと併用できます
• コンテキストウィンドウ — GPT-6 Sol 1,050,000トークン 対 Claude Opus 5 1,000,000トークン
• 最大出力 — 両方で128,000トークン、Claude Opus 5では、output-300k-2026-03-24ベータヘッダーの下でMessage Batches APIにおいてそれが300,000に引き上げられます
バッチ+キャッシュのスタックは、このリストで最も議論されていない項目であり、最も計算を変えるものでもある。入力レートの10分の1でのキャッシュ読み取りと組み合わさる50%のバッチ割引は、50%のバッチ割引だけとは異なるオファーであり、長い合成ジョブ — Anthropicの300,000トークンのバッチ出力上限も適用される — では、定価では埋められないように見えるギャップの意味のある部分を埋める。

実際の比較となるのはエフォートラダーである
これが、こうした記事すべてに入れるべき数字だ。Artificial Analysisでは——両モデルの完全なeffortラダーを公開している唯一の中立的なハーネスだが——Claude Opus 5はmax effortで51を記録し、インデックスタスクあたり$5.86かかる。デフォルトのhigh設定では48で$3.61。GPT-6 Solはmax effortで48、$1.06——そしてhigh effortでは43で$0.37。
その2行を合わせて読んでほしい。Anthropicがデフォルトとして出荷しているeffort設定で動作するClaude Opus 5は、全力で走らせたGPT-6 Solとまったく同じインデックススコアに到達する。ローンチ時の報道が報じた差——3ポイント——は、各モデルをそれぞれのつまみの最大値で比較した場合にのみ存在し、そのつまみの最大値はどちらのモデルもデフォルトで動く場所ではない。最大effortでのOpus 5の優位性は本物だが、それを得るには完了したタスク1件あたりおよそ5.5倍のコストがかかる。
それらの数字には、正直さに関する2つの注意書きが添えられるべきであり、どちらもそれらを引用するページには欠けている。
• インデックスのバージョンは動く。Opus 5 のスコアは、7月以降の Artificial Analysis インデックスの改訂ごとに 61、63、54、51 として公表されてきた。そのいずれも間違いではない。だが、バージョン表記がなければ、そのどれもが間違いになる。上の 51 は現在のボードであり、発売日の記事から引用された 61 と比較できるものではない。
• エフォートラダーはベンダー間で較正されていない。あるモデルでの「高」は、別のモデルでの「高」と同じ思考量ではない。名目上異なる設定でスコアが一致することは、コストに関する証拠であり、能力の等価性に関する証拠ではない。
独立した記録が実際より薄いところ
Claude Opus 5には、8週間にわたる第三者による測定の蓄積と、ベンダーが報告したローンチ数値の一式があり、後者にはその旨が明確に明示されている——Frontier-Bench v0.1は43.3%、ARC-AGI-3は30.2%、GDPval-AA v2は1,861 Elo。これらのいずれもが、GPT-5.6 SolまたはClaude Fable 5に対して測定されたものであり、GPT-6 Solに対してではない。Opus 5とGPT-6 SolをAnthropic自身のベンチマークで直接対決させた共有ハーネスの結果はどこにも存在せず、Anthropicのシステムカードも、このモデルが総合的にClaude Fable 5よりも高性能であるわけではないと認めている。
独立した記録には、逆方向の注意点もある。Artificial AnalysisのAA-Omniscience評価では、Opus 5のハルシネーション率は50%で、Opus 4.8から14ポイント上昇している。記録されている原因は、拒否率が約23%から7%に下がったことであり、その結果モデルはより多くの質問に回答し、そのうちより多くで誤るようになった。Vals AIは別途、Opus 5とFable 5がTerminal-Benchの実行中にOpus 4.8を拒否時のフォールバックとして使用したことを開示している。影響を受けた9件の合格を不合格として再分類すると、Opus 5は84.64%から81.27%へと下がる。これらは失格とすべき所見ではないが、Opus 5のほうが信頼できる選択だと論じる記事には、これらを添えておく必要がある。

GPT-6 Solの独立した記録は、今週はたった一つの数字の幅しかない。すなわち上記のインデックススコアであり、最大努力で測定されたもので、その背後には18か月分のモデルリリースにわたって蓄積された第三者テストがある。この非対称性——8週間の精査対1日——こそ、買い手が依然として5倍の割高な価格を払うかもしれない誠実な理由であり、3ポイントという見出しの数字よりも優れた理由なのだ。
ルーティング層が判断を変える場合
Claude Opus 5はOrcaRouterのカタログに、入力$5.00、出力$25.00、キャッシュ読み取り$0.50、キャッシュ書き込み$10.00(いずれも100万トークンあたり)で掲載されています。コンテキストウィンドウは1,000,000トークン、出力上限は128,000トークン、/v1/chat/completionsと/v1/messagesの両エンドポイントに対応。プロバイダーのリスト価格を一切上乗せなしでそのまま反映しているため、Anthropic側で価格が変われば当社側でも同じ日に反映されます。モデルカードのキャッシュ書き込みの数値はTTL1時間の料金です。Anthropicの5分ティアは$6.25で、どちらのティアの数値かを明示せずに一方だけを引用すると、この2つの数字が矛盾しているように見えてしまうのです。
GPT-6 Solは当社のルートの一つではないため、ここにある内容は、当社を通じたその価格に関する主張ではありません。

この対決で単一のエンドポイントが実際にもたらすのは、両方の答えを同時に保持できることです。Opus 5を支持する理由とSolを支持する理由はどちらもエフォートに依存しており、エフォートは契約ではなくリクエストごとのパラメータです。1つのキーの背後に両モデルをルーティングするチームは、自動フェイルオーバーを備えており、Opus 5の最大エフォート上限を必要とする作業をOpus 5に、ボリューム層を中程度のエフォートでSolに送ることができます。2つ目の統合や2つ目のレート制限は不要です。そして、ルーティングDSLは、その決定を移行プロジェクトではなく呼び出しの中に組み込みます。これは特にここで重要です。なぜなら、このペアの正解は四半期ではなくリクエストによって変わるからです。
決定規則
• 既知の品質基準でのボリューム作業——GPT-6 Solをmediumまたはhigh effortで。タスクあたり0.25ドルで40インデックスポイントは、このボード上で最も安価な信頼できるラインであり、エフォートダイヤルは推測ではなく文書化されたパラメータです。
• 能力範囲の最上位を必要とし、それに見合うコストを払える作業 — Claude Opus 5をxhighまたはmaxで。Solの上限を3インデックスポイント上回り、タスクあたり$4.88~$5.86で、この2つのうち300,000トークンのバッチ出力上限を持つ唯一のものです。
• 大規模コーパスのバッチジョブ — Claude Opus 5、トークン単価ではなく構造上の論拠による。長文コンテキスト割増なし、キャッシュと重ねて適用できるバッチ割引、そして5分間のウィンドウを超えて存続するプレフィックス向けの1時間のキャッシュTTL。
• 誤った答えが高くつくあらゆる場面 — 現時点の記録では、どちらも当てはまらない。Opus 5のハルシネーション率はこのリリースで14ポイント上昇し、Solの第三者による記録はたった一つの数値の幅しかない。
• もしあなたが見せられた比較が「Opus 5 max 対 Sol max」だったなら — 判断を下す前に、デフォルトのエフォートでそれを再実行してください。実際に判断が下されるのはそこであり、既存のカバレッジが決して示してくれない唯一の構成なのです。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
