
GPT-5 Codex vs GPT-5.6 Sol:コーディング専門モデル vs それを飲み込んだ最上位モデル
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0259知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0258知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0166知能82コーディング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
OpenAIは2026年7月9日にGPT-5.6ファミリーを出荷した際、スタンドアロンのCodexアプリを静かに廃止し、コーディングエージェントモードをChatGPTに統合しました。OpenAIが書いたモデルページは、GPT-5.6 Sol向けのもので、それはまるでコーディング専門家から引き出された職務記述書のように読めました。—「深い多段階推論、大規模ソフトウェアエンジニアリング、長期にわたるエージェント的ワークフロー。」 そして、GPT-5 CodexとGPT-5.6 Solは日常的なスペック比較ではない。それは、スペシャリストが、その製品カテゴリーを吸収したばかりの旗艦が、自分をも冗長にしたのかを問うているのだ。
短い答えは「ノー」です — しかし、その理由は「Codexは今でも優れている」というより興味深いものです。GPT-5 Codexは、API上で今も利用可能で、入力トークン100万件あたり1.25ドル、出力トークン100万件あたり10ドルです。これは、CLI、IDE、GitHub自動化向けに調整された専用設計のソフトウェアエンジニアリングエージェントであり、独立に測定されたスコアを備えています。GPT-5.6 Solは、入力が4倍、出力が3倍のコスト(5ドル / 30ドル)で、最新の汎用フラッグシップです。コーディングの数値はより高いものの、そのほとんどはベンダー報告によるものです。この2つの比較の要点は、価格、コンテキスト、そしてコードをうまく書けるスペシャリストとジェネラリストの違いです。以下のすべては、出典ごとにラベル付けされています。
各モデルの説明
GPT-5 Codex は、そのモデルページの説明どおり、「ソフトウェアエンジニアリングとコーディングワークフロー向けに最適化された GPT-5 の専門バージョン」です。2025年9月にリリースされたこのモデルは、OpenAI のコーディングエージェントを支える API モデルであり、ゼロからプロジェクトを構築し、機能開発を行い、大規模なリファクタリングを実行し、コードレビューを行い、調整可能な推論努力ノブを備えて複数ファイルにわたる変更を計画するエージェントです。テキストと画像入力(UI作業用のスクリーンショット)を受け付け、40万トークンのコンテキストと12万8000トークンの出力上限を持ち、CLI、IDE拡張機能、GitHub、クラウドタスクといったエージェンティックなコーディングアプリケーションを明確にターゲットとしています。
GPT-5.6 Solは、GPT-5.6シリーズのフラッグシップティアであり、2026年7月9日にリリースされました。知識カットオフは2026年2月です。これはOpenAIが最も困難な汎用作業を任せるモデルです。深い多段階推論、大規模ソフトウェアエンジニアリング、長期的なエージェント、コンピューター操作、そしてマルチエージェントの「ウルトラ」推論モードです。コンテキスト長は105万トークンで、GPT-5 Codexの2.6倍に相当し、出力上限は同じ128Kトークン。テキスト、画像、ファイルの入力に対応しています。SolはChatGPT内でも動作するため、現在OpenAIが製品として「Codex」について言及する場合、それは通常、エージェント型のコーディング作業を行うSolを指します。
価格:縮小するが決して埋まらない4x / 3xの格差
主要な数字は、いずれもプロバイダーのリスト価格をそのまま適用したものだ。GPT-5 Codex は100万トークンあたり $1.25 / $10(キャッシュ読み取りは $0.125)。GPT-5.6 Sol は $5 / $30(キャッシュ読み取りは $0.50)。これは入力価格の4倍、出力価格の3倍にあたる。1日1,000万トークンを入力/出力比 75/25 で使用する一般的なコーディング作業では、GPT-5 Codex の請求額はおよそ $34、GPT-5.6 Sol の請求額はおよそ $112 となる。この差は理論上のものではない。
その差を縮める要素は2つある。第一に、キャッシュだ。両モデルとも、キャッシュ済み入力の価格は新規入力よりもはるかに低く、エージェントループは同じリポジトリコンテキストを絶えず読み直すため、トークンの大部分を低価格帯で利用できる。第二に、効率性だ。OpenAIは、5.6世代は前世代と比べてエージェントタスクを約54%少ない出力トークンで完了すると主張している。Solが同じ作業に必要な出力トークンが半分だけで済むなら、タスクあたりの差は約3.3倍から約2倍へ縮まる。これは確かな節約だが、4倍の入力価格差を帳消しにするものではなく、しかもその効率性の主張はOpenAIが報告したものであって、独立に測定されたものではない。
Solもまた、段階的な入力価格を採用しています。OrcaRouterのモデルページでは、$5 / $30の基本料金が最大32K入力トークンまでのリクエストに適用され、それより大きなリクエストは$10 / $45の上位料金で請求されます。これがロングコンテキスト税であり、まさに大規模リポジトリのエージェントが行うリクエストが該当します。したがって、実際の価格比較は、見出しに示された3〜4倍という数字が示唆する以上にワークロードに依存します。

コンテキストとその呼び方
コンテキストギャップは、2つ目の本当の分岐点です。400Kトークンは相当な規模のコードベースをカバーでき、専門特化型であるCodexは、そのウィンドウ内で効率的に動作するよう作られています。しかし、1.05MトークンのSolコンテキストは、モデルに渡せるものを一変させます。モノレポ全体、長いエージェントトレース、オンボーディングWiki、そしてコードも。リポジトリ全体を1回のリクエストで投入するチームにとって、より大きなウィンドウは「モデルが関連ファイルを見られる」と「モデルが関連ファイルに加えて、それらをインポートするすべてのものを見られる」の違いを生みます。これはまた、入力トークン1個あたり1.25ドルと5ドルの違いでもあり、コンテキストの決定がコストの決定である理由です。
両モデルは、同じ2つのAPI形式(OpenAI Chat CompletionsとResponses API)に対応しており、どちらもツール/関数呼び出しと構造化出力をサポートしています。OrcaRouterでは、両モデルは1つのOpenAI互換エンドポイントの背後に配置されているため、切り替えはモデル名の変更であり、統合の変更ではありません。
ベンチマークが分岐する点 — そして正直さの注記
「興味深いのは、この2つのモデルがほとんど同じベンチマークを共有していない点だ。GPT-5 Codexは、真に独立したスコアを持つ。Artificial Analysisによると、Intelligence Indexは36.1、Coding Indexは38.9、Math Indexは98.7、LiveCodeBenchは84.0、SWE-Bench Verifiedは74.5%である。GPT-5.6 Solの看板となる数値(Terminal-Bench 2.1で88.8、max reasoning時のArtificial Analysis Coding Agent Indexで80、Agents' Last Examで53.6)は、OpenAIが発表時に公開したものであり、独立した評価機関による再現はまだない。「88.8対84.0」は公平な戦いではない。一方の数値は監査済みであり、もう一方はベンダーの主張にすぎないからだ。率直に言えば、Solは一世代新しく、その上限は明らかに高い。しかし、2つのモデルのうちどちらかが持つコーディングスコアで、独立した研究所によって検証された唯一のものは、より安価で旧世代のスペシャリストモデルのものだ。」

OpenAI自身が疑問視しているベンチマークもあります。SWE-Bench Proでは、GPT-5.6 Solが64.6%を記録し、Claude Fable 5が80%でトップですが、OpenAIはこのベンチマークの妥当性を公に疑問視しています。その点で興味深いのはスコアそのものではなく、一流ベンダーが自社の低い数字をベンチマークの問題にしているという事実です。コーディングチームにとって、これは、私たちのものを含め、いかなるスコアボードも信頼する前に、自分のリポジトリでモデルをテストすべきだという教訓になります。
速度:交通上の注意点
OrcaRouterの7日間テレメトリでは、GPT-5.6 Solは最初のトークンまでの中央値時間が3.82秒、毎秒約465トークンの出力を示し、3900万トークンのトラフィックを処理している。GPT-5 Codexのページはまだテレメトリを「収集」中のままだ。ルーター経由のトラフィックが少なすぎて、まだ平均を取れるほどのデータがないのだ。その薄いトラフィック自体が情報である。市場の目から見れば、コーディングエージェントAPIの利用はすでに新しいモデルへ移っている。これはGPT-5 Codexが遅いとか壊れているという意味ではない。「どちらが速いか」は、誰かが実際のボリュームでトラフィックを流すまで、ルーターのデータからは答えが出せないということだ。
どちらを選ぶべきでしょうか?
GPT-5 Codexを選ぶなら…
あなたのワークロードはまさにコーディング特化型です。コードの編集、プルリクエストのレビュー、リファクタリング、テスト作成、そしてIDEやCLI環境でのエージェント実行を行います。あなたが求めるのは、スペシャリストの集中力、4分の1の入力コスト、そしてこのマッチアップで唯一の独立検証済みコーディングスコアです。GPT-5 Codexは、使わない一般的な機能にフラッグシップ価格を払わずに、OpenAIのエージェンティックコーダーセマンティクス(推論努力の調整ノブ、ツール使用ループ)を手に入れたい場合にも最適な選択です。
GPT-5.6 Solを選ぶなら…
あなたの作業は、コーディングと高度な一般推論、長期的なエージェント、コンピュータ利用、またはファイル中心の入力を組み合わせたものかもしれません。あるいは、すべてを一手に引き受けるフラッグシップが欲しいだけかもしれません。1.05Mのコンテキスト、マルチエージェントのウルトラモード、新しいトレーニング、そしてChatGPTとCodexの製品統合は、すべてSolに有利に働きます。そのコーディングの数値は紙上では高く、ベンダーが信頼するベンチマークでは、OpenAIがこれまでに出荷した中で最高のコーディングエージェントです。その広さに対して、トークンあたり3〜4倍のコストを支払っていることになります。トークン効率の面では、Solが実際に勝つタスクにおいてその差は縮まります。
答えはしばしば両方 — タスクに応じて使い分ける
両方ともOrcaRouterでマークアップ0%で稼働しているため、最強の構成はそもそも選択肢ではありません。コーディング系のボリュームは$1.25 / $10のスペシャリストであるGPT-5 Codexに向け、フラッグシップ級の広さが必要なタスクだけを$5 / $30のGPT-5.6 Solにエスカレーションしてください。APIキーは1つ、OpenAI互換エンドポイントは1つで、ルーティング時にモデル名を変更するだけ。プロバイダーに不調の時間帯があれば自動フェイルオーバーします。ここでパススルーが特定の意味で重要です。予算化する$1.25 / $10と$5 / $30はプロバイダーのリスト価格なので、将来OpenAIが値下げを発表した日には、当社のエンドポイントでも同日に反映され、ルーティングロジックを変更する必要はありません。

これが提起する疑問
GPT-5.6 SolはGPT-5 Codexに取って代わったのですか?
製品では、その通りです。5.6のリリースで、スタンドアロンのCodexアプリはChatGPTに統合され、Solはそこでコーディングエージェントモードを実行するエンジンです。APIでは、そうではありません。GPT-5 Codexは今も提供中のライブモデルであり、独自の価格が設定されています。また、多くのエージェントパイプラインは、それが目的特化型で安価なため、今もそれを実行しています。
Solのコーディングは本当にCodexより優れているのか?
「OpenAIが公表した数値に関して言えば、その通りです — Terminal-Bench 2.1は88.8、CodexのLiveCodeBenchは84.0 — しかし、これらは異なるベンチマークです。Solの数値はベンダーによる申告ですが、Codexの数値は独立に測定されています。自分のリポジトリでテストしてください。それだけが報われるスコアです。」
なぜまだGPT-5 Codexを使う人がいるのでしょうか?
価格と適合性。Solの入力価格の4分の1で、汎用フラッグシップの広範さを必要としない専用コーディングエージェントパイプラインは、100万トークンあたりの実際の費用を節約し、専門特化型の焦点により、コーディング作業に留めておくためのプロンプト調整の手間も減ります。
このマッチアップを検討する価値がある理由は、OpenAIがその答えを自社製品に組み込んだからです。同社は1年間コーディング専門モデルを販売し、その後、専門モデルの王座を奪えるほど十分にコードを書ける汎用フラッグシップにそれを統合しました。ただし、専門モデルはAPI上に、価格をほんの一部に抑えた形で残されています。これは策略ではありません。「フラッグシップに料金を払わずにコーディングエージェントを手に入れたい」というニーズに対する価格の下限です。GPT-5 Codexは、安価で、特化した、独立に計測された専門モデルです。GPT-5.6 Solは、より新しく、より広範で、より高価なフラッグシップであり、そのコーディング性能の主張は自分の業務で検証すべきです。ほとんどの本番運用チームは、正直な答えが「両方」であると気づくでしょう。そして、両方が単一のパススルーエンドポイント上にあることで、それらの間のルーティングは移行ではなく設定の問題です。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
