GPT-6.1 Sol 対 Claude Opus 5.5 の生成されたヒーローカード。見出しは「本物の差、だが不均等に分布」。2枚の情報カードにはそれぞれ「GPT-6.1 Sol: インテリジェンス指数 51.8、インデックスタスクあたり $0.72、長文コンテキスト想起率 83.0%」と「Claude Opus 5.5: インテリジェンス指数 57.6、インデックスタスクあたり $5.98、長文コンテキスト想起率 84.7%」と記載され、フッターには「数値は Artificial Analysis による。Intelligence Index v4.3.2、両モデルとも最大努力設定でチャート化。」と記され、右下隅に OrcaRouter のロゴが配置されている。
Guides & Insights

GPT-6.1 Sol 対 Claude Opus 5.5:実在する格差、不均等に分布

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

の間の5.8ポイントの差Claude Opus 5.5とGPT-6.1 Solは、Artificial Analysis Intelligence Indexにおいて、このセット内のどのペアよりも最大であり、そのほとんどとは異なり、設定変更では埋まらない。Claude Opus 5.5は、2026年9月22日にリリースされ、入力100万トークンあたり$4.00、出力100万トークンあたり$20.00で課金され、57.6を記録している。GPT-6.1 Solは、2026年9月29日にリリースされ、$2.00と$10.00で、51.8を記録している。Claude Opus 5.5は、ほとんどのフロンティアモデル同士を隔てる差よりも大きな差で、より高いスコアを出すモデルであり、そこに到達するためにタスクあたり8.3倍のコストがかかる — $5.98対$0.72。これまでのところ、高価なモデルが単純に勝っており、これはこの比較の最も面白くないバージョンである。これを読む価値があるのは、5.8ポイントがスイート全体に均等に分散しているわけではないという点である。ほとんどの長文書および長セッション作業を決定づける唯一の軸では、両モデルは2ポイント以内に収まっている。

どちらも同じ市場枠におけるフラッグシップモデルだ。100万クラスのコンテキストウィンドウ、128Kの出力上限、テキスト・画像・ファイル入力、一方には拡張思考、もう一方には5段階のエフォートラダーを備える。Claude Opus 5.5はClaude Opus 5の後継で、要求の厳しい推論、コーディング、長期的なエージェント作業向けに位置づけられている。GPT-6.1 SolはGPT-6 Astraの1段下に位置し、エージェント型コーディング、コンピュータ操作、文書中心のプロフェッショナル業務に位置づけられている。両者は同じ業務を狙っている。測定結果は、それらすべてにおいて同等に優れているわけではないことを示している。

5.8ポイントが実際にどこにあるのか

インデックスの合成値は、その構成要素を隠してしまう。個々の評価を引き出せば、そのギャップはギャップのようには見えなくなり、プロファイルのように見え始める。

• Humanity's Last Exam — Claude Opus 5.5 61.4% 対 GPT-6.1 Sol 52.9%、抽象的推論で8.5ポイント差

• SciCode — Claude Opus 5.5 の 66.9% 対 GPT-6.1 Sol の 54.2%、研究レベルのコードで 12.7 ポイントの差

• 長文コンテキストでの想起 — Claude Opus 5.5 84.7% 対 GPT-6.1 Sol 83.0%、長い入力から事実を引き出す際の1.7ポイント差

• Terminal-Bench 4.0 — Claude Opus 5.5 59.6%(同一リビジョンでは公開されていない Sol の数値との比較)

• コンテキストウィンドウ — GPT-6.1 Sol は 1,050,000 トークン、Claude Opus 5.5 は 1,000,000 トークンで、どちらも出力上限は 128,000 トークン

• インデックスタスクあたりのコスト — Claude Opus 5.5 $5.98 対 GPT-6.1 Sol $0.72

分布こそが物語っている。抽象的な推論が課題となる場面——難しい試験問題や、模倣できる既存の答えが存在しない研究水準のコーディング問題——では、Claude Opus 5.5 が決定的に先行しており、SciCode の12.7ポイント差はノイズではない。非常に長い入力の中から適切な箇所を見つけて利用することが課題となる場面では、両モデルは事実上互角であり、GPT-6.1 Sol は5万トークン多い容量でその地位を保っている。実運用のLLM作業の大部分は2番目の種類だ。検索拡張応答、契約書や提出書類のレビュー、ログと文字起こしの分析、大規模リポジトリ全体のコードレビュー。その作業を測るのは最初の2項目ではなく3番目の項目であり、その項目では、割増料金を払って得られるのは1.7ポイントだ。

インデックスの行を正直に読むこと

それら2つの注意点は、ページの末尾ではなく、その数字のすぐそばに置くべきです。

設定が異なります。Artificial AnalysisはClaude Opus 5.5を「Max, Default Fallback」構成で、GPT-6.1 Solを最大エフォートでチャート化しています。どちらも各モデルが公開されている中で最も強力な設定であり、それによって比較は公平になっていますが、これは2つの出荷時デフォルトではなく、2つの上限の比較です。Claude Opus 5.5自体のホスト型APIにおけるデフォルトは、チャート化された実行とは異なる可能性があり、GPT-6.1 Solのデフォルトのエフォートはmediumです。

Terminal-Benchの行は、片側が意図的に空欄になっている。Claude Opus 5.5の59.6%は、それが掲載されたArtificial Analysisのリビジョンに基づくものであり、対応するGPT-6.1 Solの数値は、一致するリビジョンでは利用できない。同じベンチマークの別の実行から数値を引用すれば誤った比較になるため、誠実な対応は、おおよそ正しい何かでセルを埋めるのではなく、空のままにしておくことだ。

冗長さはここでも、より安価な兄弟モデルに対する場合と同じ方向に働く。Claude Opus 5.5 は index スイートで 260M の出力トークンを生成するのに対し、GPT-6.1 Sol は 67M で、すでに 2 倍の料金でありながら 3.9 倍の差だ。レートカードが入力 2 倍、出力 2 倍を示しているときに、タスクあたり 8.3 倍の比率が生まれるのはここからだ。割高なのはモデルのコストが 8.3 倍だからではなく、コストが 2 倍で 3.9 倍長く考えるから 8.3 倍なのだ。

支払うべき理由

あなたの業務が最初の2つの箇条書きに当てはまるなら、計算は単純であり、Claude Opus 5.5 に軍配が上がる。研究グレードの科学コードにおける12.7ポイントの差、あるいは難解な抽象的推論における8.5ポイントの差は、チケットを無人でクローズできるエージェントと、3ステップごとに人間の手を必要とするエージェントとの違いである。大規模コードベースでのエージェント型コーディングは、両ベンダーが真っ先に挙げるワークロードであり、そして差が最も大きく開くワークロードでもある。エンジニアの20分を無駄にする失敗実行を避けるために、タスクあたり$0.72ではなく$5.98を支払うことは、僅差の判断ではない。

スコアとはまったく関係のない第2の論点がある。Claude Opus 5.5 は登場から15日が経過し、登場から8日のモデルにはない、第三者による評価、レビュー、導入経験の蓄積を生み出してきた。本番運用への道筋では、周辺知識の成熟度には、この指標が値付けしないだけの価値がある。

反対論、そしてそれを決める数字

反論となるのは、ロングコンテキストの行だ。あなたのトラフィックの支配的な形が「大きな入力、短い回答」であるなら——そして非常に多くのチームにとってそうだ——課金されている軸は、あなたが消費している軸ではない。ロングコンテキストの想起では、2つのモデルは8.3倍の価格比で1.7ポイント差があり、安い方のモデルがより大きなウィンドウを備えている。まさにその場合、上乗せ分は実在し、測定可能であり、ワークロードが決して使わない能力に費やされている。

したがって、決定的な数字はその指標ではない。それは、あなたのタスクのうち、想起のようなものではなくSciCodeのようなものの割合だ。自チームのログからその問いに答えられるチームは、自チームのログから答えるべきだ。ベンチマークスイートはさまざまなジョブの混在を代理するものであり、その混在こそが変数なのだ。

両方とも1つのキー上にあり、それによってこの問いは答えられるものになっている。

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

Claude Opus 5.5 は OrcaRouter で独自の $4.00 / $20.00、キャッシュ読み取りは $0.20 です。GPT-6.1 Sol は OrcaRouter で $2.00 / $10.00、272,000 プロンプトトークンを超えると $4.00 / $15.00 に上がり、キャッシュ読み取りは $0.10 です。どちらもプロバイダーの定価で、上乗せは一切なく、1つのキーと1つの請求で。

このペアリングでは、それが通常以上に重要になる。なぜなら、2つのモデルは代替品ではなく、ルーティングの判断だからだ。長文ドキュメントと大量処理の作業はGPT-6.1 Solに送り、難しい推論とコード変更の作業はClaude Opus 5.5に任せる。そして両方は、同じエンドポイントと同じ認証情報の背後で動作する。ルートが劣化した場合、自動フェイルオーバーが呼び出しを失敗させるのではなく移動させる。また、ルーティングは宣言的であるため、アプリケーション単位ではなくタスククラス単位で表現できる。この分割のテストは、移行ではなく設定変更だ。

最後に言及する価値があるのは、この比較の賞味期限についてだ。両モデルは登場から数日か数週間しか経っていない。{{GPT-6.1 Sol}} は独立した構成が1件公開されており、{{Claude Opus 5.5}} も1件ある。モデルごとに1回の実行はスナップショットにすぎず、興味深い失敗モードは、これらの数値のどれかが間違っていることではない——中程度のエフォート設定、あるいは第2の評価者が、このプロファイルを描き直すことだ。それまでは、擁護可能な読み方はコンポーネントが示すものだ。難度の高い推論と研究用コードでは決定的な差、ロングコンテキストの作業では小さな差、そして8.3×の請求額は、あなたのワークロードのうち前者に似た部分によって正当化されなければならない。

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新