
GPT-6.1 Sol 対 GPT-6 Sol:追加の1週間の作業で得られたもの、得られなかったもの
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 397 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2237知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 195 tok/s
- OrcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- xAISpaceXAI: Grok 4.62026-08-1244知能77コーディング
もしGPT-6 Solを現在本番環境で運用していて、GPT-6.1 Sol への移行に価値があるかどうかを判断しようとしているなら、その答えは、あなたのコストのどちらが大きいかによって完全に決まります。そして、この 2 つのモデルは、答えが「両方」になることがほとんどないように作られています。GPT-6 Sol は 2026 年 9 月 22 日に、入力 100 万トークンあたり 2.00 ドル、キャッシュ 0.20 ドル、出力 10.00 ドルで提供開始されました。GPT-6.1 Sol は 2026 年 9 月 29 日に、入力 2.00 ドル、キャッシュ 0.10 ドル、出力 10.00 ドルで提供開始され、より低い推論エフォートで複雑なソフトウェアエンジニアリングタスクにおいてベンダー報告で 6.4 パーセントポイントの改善を実現しています。入力と出力の価格は動きませんでした。キャッシュ料金は半額になりました。変わったのはその 1 行だけで、それが財務面の根拠のすべてであり、それ以外はすべて能力に関する議論で、リリースからこの時点では、その情報源はちょうど 1 つしかありません。
三つのことが変わりました。そのうちの一つは請求書です。
マーケティングを剥ぎ取れば、この2つのデプロイの差分は頭の中に収まるほど短い。
• キャッシュ入力 — GPT-6.1 Solでは100万トークンあたり$0.10、GPT-6 Solでは$0.20。主張ではなく実測であり、算術としてはっきり表れる唯一の変化です。
• ベンダーによる性能 — OpenAIの報告によれば、DeepSWE v1.1でより低い推論エフォートとコストで6.4ポイントのリード、Terminal-Bench Science 0.1では最大エフォートでスコアが2倍以上、OSWorld 2.0オフラインセットでは最大エフォートで7ポイント、AutomationBenchでは中程度のエフォートで4.8ポイント、そして意図的にエラーを誘発するプロンプトセットにおける事実誤り率は11.4%から7.7%へ低下しています。いずれも再現されていません。
• 推論ラダー — GPT-6.1 Solはlow、medium、high、xhigh、maxをサポートし、noneはサポートしません。GPT-6 Solは6つすべてをサポートします。これがコードを壊す差分であり、誰もローンチ記事には書かないものです。
それ以外はすべて同一か、ほぼ同じと言える。同じ1,050,000トークンのコンテキストウィンドウ、同じ128,000トークンの出力上限、同じ$2.50のキャッシュ書き込みレート、同じ272Kトークンの再価格設定しきい値(これを超えると、リクエスト全体が入力とキャッシュで2倍、出力で1.5倍で課金される)、ツール呼び出しに同じResponses APIが必要であること、そしてファインチューニング対応がないことも同じ。ナレッジカットオフは2026年4月20日から4月30日に移った — 10日間。これは、これが再構築ではなく、どれほど大掛かりな改修だったかを示す類の数字だ。
なぜキャッシュラインは見た目以上に価値があるのか

キャッシュ読み取りの半減を製品刷新の目玉に据えるのは奇妙な話だ——エージェントのトラフィックが実際にどのようなものかを見るまでは。エージェントループは毎ターン、システムプロンプト、ツールスキーマ、取得されたコンテキスト、会話履歴という安定したプレフィックスを再送信し、長いセッションでは同じプレフィックスが数十回、あるいは数百回も課金される。まさにそうしたトラフィックでは、キャッシュ率は誤差の範疇ではなくなり、請求書の主要な明細になる。
1回の長いエージェントセッションで数字を計算してみる。40ターンにわたって再利用される12万トークンのプレフィックスを想定すると、1セッションあたり480万のキャッシュ済み入力トークン、それに加えて控えめな15万の新規出力トークン。GPT-6 Solでは、キャッシュ読み取りの課金が0.96ドル、出力が1.50ドル——1セッションあたりおよそ2.46ドル。GPT-6.1 Solでは、同じセッションでキャッシュ読み取りが0.48ドル、出力は同じく1.50ドル:約1.98ドル。1セッションあたりの差は48セントで、これは判断材料にはならない。だがこれを月10万セッションに掛け合わせると48,000ドル——これなら判断材料になる。
2つの注意点が、その誠実さを保ちます。キャッシュされた読み取りは、プレフィックスが実際にヒットしたときにのみキャッシュ料金で請求されるため、実際に得られる節約額は「ヒット率 × 差額」であり、差額そのものではありません。また、標準料金が適用されるには、プレフィックスが272,000トークン未満でなければなりません。この線を超えると、リクエスト全体が、入力とキャッシュは2倍、出力は1.5倍で再計算され、プレフィックスの10セントの節約が吹き飛ぶ可能性があります。長いコンテキストのセッションでは、キャッシュの計算がパンフレット通りに見える可能性が最も低くなります。
ベンチマークの差は現実のものであり、それは一つの場所から来ている
OpenAIのローンチ投稿は、その評価について異例なほど具体的であり、それは有利な点である。そして、それらの数字はすべてベンダーが自社モデルを採点したものであり、それが不利な点である。それらに共通するパターンは一貫している。引き合いに出される比較は常にGPT-6 Astraに対するものであり、Astraとの比較は常にコスト比較である。DeepSWE v1.1では、約5分の1のコストでAstraに匹敵するという主張だ。GDP.pdfでは、タスクあたり約5分の1のコストでAstraの最先端に迫る。OSWorld 2.0では、タスクあたり約7分の1のコストでAstraまで2.1ポイント以内。事実性では、タスクあたり5分の1未満のコストでAstraまで1.9ポイント以内。それは起草上の偶然ではなく、製品のテーゼであり、価格についてのテーゼであって、能力のリーダーシップについてのものではない。
OpenAIが自社のフレーミングを拒んでいる唯一の箇所は、評価に値する。Terminal-Bench Science 0.1では、GPT-6 Astraがテストされたモデルの中で依然として最高スコア68.1%を保持しており、最も困難な科学研究に使うべきだと明白に述べている。より高価な兄弟モデルをいつ買うべきかを教えてくれるローンチ投稿は、多少の規律を備えたローンチ投稿だ。
特にGPT-6 Solに関して言えば、この構成における比較の正直な現状はこうだ。どちらのモデルにも独立したスコアは存在しない。Artificial Analysisは最大推論エフォートでのGPT-6 Solの完全な評価を保有している。Intelligence Indexは48、インデックスタスクあたり$1.06、生成された出力トークンは7,700万で、ボード中央値の8,800万に対してであり、Coding Agent Indexは57でタスクあたり$2.99だ。9月30日時点では、GPT-6.1 Solの項目はまったく存在しない。そのモデルのスラッグは404を返し、その文字列はライブリーダーボードに現れない。したがって、今日利用可能な唯一の測定済みの第三者比較は、GPT-6 Solと他のラボのモデルとの間のものであり、GPT-6 Solとその後継モデルとの間のものではない。今、6.1対6.0のチャートを見せている人は、OpenAIのスライドを見せているにすぎない。
移行は文字列の変更だ。ただし、そうでない場合を除く。
GPT-6ファミリーに関するOpenAI自身の移行ガイダンスは、識別子を切り替える前に読む価値がある。というのも、その中の2つの項目が動作中のコードを壊すからだ。1つ目は推論の階段(reasoning ladder)である。reasoning_effort: "none"を送るリクエストがあると、GPT-6.1 Solはそれを受け付けず、文書化された対処法はlowから始めて、最も低い設定が同等だと仮定するのではなく代表的なタスクで比較することだ。noneをレイテンシのベースラインとして使っていたワークフローは、そのベースラインを失う。2つ目はツール呼び出しである。GPT-6.1 SolはChat Completionsをサポートするが、それを介したツール呼び出しはサポートしない。ツールにはResponses APIが必要だ。あなたのスタックが/v1/chat/completionsで関数を呼び出しているなら、文字列を差し替えるのではなく、エンドポイントを移植することになる。すでにGPT-6 Solを使っている開発者に対するベンダー自身の指示は、切り替える前にそのガイダンスを確認することであり、これは1週間という間隔が示唆するようなドロップインの更新ではないという公正なシグナルである。
残りのパラメータの挙動は次のとおりです。reasoning effort、structured outputs、ストリーミング、prompt caching、およびツールセットはすべてそのまま引き継がれ、同一の 272K 再価格设定ルールが両モデルにまったく同じように適用されます。model を gpt-6.1-sol に設定し、effort 設定はサポートされていた場所のまま維持し、temperature、top_p および top_logprobs は effort が none でない場合は常に削除してください。この最後の点は両モデルに当てはまり、reasoning モデルの移行後によくある 400 エラーの原因です。
それに本番パスを賭けずに移行する

現実的な移行はカットオーバーではなく、シャドウランだ。本番トラフィックの一部を新しい識別子へ送り、古い識別子は応答を返す経路として残し、自分のタスク上で比較する。これはルーティングの問題であり、呼び出しに使うプラットフォームが仕事の形を変える唯一の場面でもある。OrcaRouter は GPT-6 Sol を本日、OpenAI の定価そのまま、マークアップゼロで提供している——$2.00 / $0.20 / $10.00 の価格カード、272K の再価格設定ルール込みで——。だから比較のベースライン側の腕は、ほかのすべてと同じキーで稼働しており、6.1 側の腕も呼び出し可能になり次第、二つ目の契約や二つ目の SDK なしにルートセットへ追加できる。それまでの正直な立場は、GPT-6 Sol が呼び出し可能なモデルだということであり、そうでないかのようにほのめかすよりも、はっきりそう言う価値がある:openai/gpt-6.1-sol は、本日の当社の公開カタログエンドポイントで「model not found」を返す。シャドウランが実際に動き出したときにそれを安全にしてくれるのが自動フェイルオーバーだ——新しいルートがエラーになれば、リクエストは古いルートで完了し、あなたはユーザーからではなくログからそれを知ることになる。
今すぐ移行すべきなのは、長いエージェントセッションでキャッシュされた入力がコストの大部分を占めるチームと、すでにResponses APIを使用していて決してnoneを送信しないチームです。彼らにとって、これはほぼ無料のアップグレードに等しいものです — ベンダーは機能面の向上を報告しており、キャッシュ率は半減し、移行は文字列1つの変更で済みます。待つべきなのは、noneをレイテンシが重視されるパスで使用しているチーム、ツール呼び出しがChat Completions経由で実行されるチーム、そしてコミットする前にOpenAI以外から数値を得る必要がある人たちです。その最後のグループにとって、待機に公表された終了日はなく、その時間を使ってすべき賢明なことは、比較に必要となる評価セットを構築することです — なぜなら、独立したスコアが届くとき、それは他人のトラフィックに対するものになるからです。

この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
