生成されたヒーローカードは、タイトルが「GPT-6.1 Sol 対 GPT-6世代」、見出しが「1世代でコスト48倍」で、4つの積み重なった段を示し、それぞれにGPT-6 Astra(インデックス52.7、タスクあたり3.26ドル)、GPT-6.1 Sol(インデックス51.8、タスクあたり0.72ドル)、GPT-6 Sol(インデックス47.6、タスクあたり1.05ドル)、GPT-6 Luna(インデックス38.1、タスクあたり0.07ドル)というラベルが付いており、フッターには「数値: Artificial Analysis v4.3.2.」と記載され、右下にOrcaRouterのロゴがある。
Engineering & Research

GPT-6.1 Sol 対 GPT-6世代:たった一つの世代

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ベンダーは2026年9月29日、自社のモデルラインに4つ目の名前を追加し、それをひとつの世代と呼んだ。そしてこのラインナップの算術こそが、この件で最も興味深い点である:GPT-6.1 Solがその世代のすべてだ。GPT-6 LunaとGPT-6 Solは、いずれも2026年9月22日にリリースされ、変更はない。GPT-6 Astraは2026年9月4日から提供されており、変更はない。6.1のリフレッシュが触れたのは、わずか1つのティアだけだった。一方、GPT-6.1 Solは、入力100万トークンあたり$2.00、出力$10.00で、Artificial Analysis Intelligence Indexで51.83を記録し、タスクあたり$0.724 — GPT-6 Astraとは0.84ポイント差で、後者は$10.00/$50.00でタスクあたり$3.2575かかる。ラベル上は同じ世代、その下の経済性は4つとも異なる。

そうなると、「GPT-6世代を使うべきか」という問いは間違った問いになる。このラインナップは、タスクあたりのコストで48倍の幅、測定された知能で14.6ポイントの幅に及び、答えはどのティアを指すかによって完全に左右される。これが、測定された段階だ。

測定された4つの段

A chart titled 'The GPT-6 ladder - measured', subtitle 'Artificial Analysis Intelligence Index, and the measured cost of one task', with four horizontal bars whose lengths are proportional to the Intelligence Index: GPT-6 Luna Index 38.1 / $0.068 per task, GPT-6 Sol Index 47.6 / $1.05 per task, GPT-6.1 Sol Index 51.8 / $0.72 per task, GPT-6 Astra Index 52.7 / $3.26 per task; footer 'Bar length is proportional to the Intelligence Index (0-60 scale). All figures: Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

• GPT-6 Luna — インデックス 38.12、100万トークンあたり $0.10 / $0.50、キャッシュ時 $0.01、タスクあたり $0.0678、出力トークン 50,012、最初のトークンまで 100.1 秒
• GPT-6 Sol — インデックス 47.63、$2.00 / $10.00、キャッシュ時 $0.20、タスクあたり $1.045、出力トークン 31,000、124.3 秒
• GPT-6.1 Sol — インデックス 51.83、$2.00 / $10.00、キャッシュ時 $0.10、タスクあたり $0.724、出力トークン 38,128、332.0 秒
• GPT-6 Astra — インデックス 52.67、$10.00 / $50.00、キャッシュ時 $1.00、タスクあたり $3.2575、出力トークン 27,206、400.4 秒

それらはすべて同じ 1,050,000 トークンのコンテキストウィンドウと同じ 128,000 トークンの最大出力を持ち、すべてがテキスト、画像、ファイルの入力に対応しています。これらの階層は、機能フラグによって区別されているのではありません。区別しているのは、どれだけの思考量に対して対価を払うかであり、そのはしごの両端はタスクあたり48倍の隔たりがあります。

6.1リフレッシュで実際に変わったこと

3つのこと、そしてそのうちスコアなのは1つだけ。

スコアは1週間で47.63から51.83へ動き、4.2ポイント上昇した。キャッシュ入力の料金は100万あたり$0.20から$0.10へ半減し、そのため定価が同一であるにもかかわらず、計測されたタスクあたりコストは$1.045から$0.724へ下がった——同じ料金表で、請求は別物だ。そして出力トークン数は31,000から38,128へ増え、一方でタスクあたりの実時間は321秒から640秒になった。これは今回の刷新が後退した唯一の点であり、どの仕様書でも最も見えにくいところだ。

Astraとの比較こそ、人々が驚く比較だ。GPT-6.1 Solはフラッグシップよりインデックススコアで0.84ポイント低いながら、タスクあたりのコストは4.5分の1だ。Astraに残る優位性はインデックススコアではない。それはAstraだけが測定される一連の評価であり、OpenAIがAstraに固有だと説明する1つの能力——新規のセキュリティ脆弱性の発見——である。だからこそこのモデルは、ベンダー自身のPreparedness Frameworkにおいて「critical」と評価されており、その最も高性能な設定は審査を通過したパートナーに限定されている。

GPT-6 Astra向けのOrcaRouterカードは、同じはしごの最上位に当たるフラッグシップです:$10.00 / $50.00、初回トークンまでのp50が1.64秒、7日間で4,070万トークン、そしてすべてのティアが共通で備える同じ1,050,000トークンのコンテキストウィンドウ。

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the $10.00 input and $50.00 output per-million prices, a 1.64 s p50 time to first token, 40.7M tokens over seven days, a 1,050,000-token context window and 128K max output with text/image/file input, above the OpenAI-compatible code sample.

6.0 Sol と比べると、今回のリフレッシュはほぼ純粋な改善だ——インデックスは増え、コストは下がる——ただし、6.1 モデルは別のモデルでありチェックポイントではないこと、また推論をより冗長に再出力する点には注意が必要だ。Luna と比べると、これは比較にならない。13.7 インデックスポイントのために 10.7 倍のコストがかかるので、難易度の高い作業には良い取引だが、大量処理の作業には最悪の取引だ。

当社独自のルーティングデータが示す、市場がすでに決めていたこと

この比較がスペックシートにないものを持っている点は、実際の使用状況が見えることです。2026年10月7日までの7日間、当社独自のルーティング層では、GPT-6.1 Solが2億8,420万トークンを処理し、それが置き換えたGPT-6 Solは95万トークンを処理しました。週齢が1週間しか違わない2つのモデルで300倍の差——これがティア交代を内側から見た姿です。低価格ティアのGPT-6 Lunaは6億4,160万トークンを処理し、両Solモデルを合計したよりも多くなっています。GPT-6 Astraは4,070万トークンを処理しました。

これを3つの別々の挙動として読むべきだ。大量の作業は、最も大量に安価なティアへ流れた。本格的な作業は、最新のSolがリリースされてから1週間以内にそこへ集約され、それが置き換えたモデルは放棄された。そしてフラッグシップはニッチにとどまった。最も高性能な段でありながら最も使われず、使うのは、その問題がそれだけにしか解けないチームだけだった。ラインナップは人が登るはしごではない。人が選び取る道具の一式であり、人々は世代ではなくティアで選ぶ。

だからこそ、その階層はアーキテクチャではなくリクエストに属するのです。

4つの階層からなる世代における実用上の問題は、正解がタスクごと、そして週ごとに変わることだ——上記のトラフィック数が示すように、市場は7日以内に再決定を下した。1つのモデル名をアプリケーションにハードコードすることこそが、ラインナップを確約へと変えてしまう。

4つすべては、1つのOrcaRouterエンドポイントから利用できます。200以上のモデルに対応する単一のAPIで、プロバイダーの定価が0%のマークアップでそのまま渡されます。この最後の点がここで特に効いてくるのは、4つのティアのうち3つが、すでに一度動いた定価またはキャッシュレートを共有しているからです。GPT-6.1 Solのキャッシュレートはローンチから1週間以内に半減しました。そして、パススルー方式のメーターが、それを自動的に請求書に反映させます。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample.

ルーティング層の2つの機能は、この特定のラインナップにとって特筆に値する。ルーティングDSLを使えば、ティアはデプロイではなくリクエストのパラメータにできる——抽出パスには安価なティア、推論パスには6.1 Sol、Astraにしかできないことが必要な呼び出しにだけAstraを。そしてモデルフュージョンを使えば、それらのパネルが1つの問いに一緒に答えることができる。これは、すべてをルーティングする余裕などないフラッグシップを誠実に使う方法だ。すなわち、請求額のすべてを背負うのではなく、パネルの中の1つの声になるのである。

一人だけの世代をどうするか

世代を買うな。一段を買い、段が動いたらそれを買い直せ。

大量処理と低レイテンシーが求められる作業には、1タスクあたり0.0678ドル、初回トークンまで100秒のGPT-6 Lunaが、すでに最も多くのトラフィックを担っているティアであり、その価格はこの階層の他のどの選択肢よりも1桁安い。汎用的な推論とコーディングには、GPT-6.1 Solが、かつて6.0モデルが担っていたデフォルトの座に就いている — 定価は同じ、指標はより良く、キャッシュコストは半分、そして640秒というタスク時間だけは、アップグレードが無償だと決めつける前に、自分のワークロードで検証すべき唯一の点だ。最先端の測定や、フラッグシップだけが担うセキュリティ作業を必要とするタスクには、GPT-6 Astraがそれらを行える唯一の段であり、そのコストは一つ下の段の4.5倍だ。

注目すべきは、6.1の刷新が他のティアにも及ぶかどうかだ。LunaやAstraが同じ扱いを受けるなら、ラダーの形が変わり、本記事のタスクごとの計算もそれに伴って変わる。それまでは「GPT-6.1」は1つのモデルを指すのであり、それをファミリーとして扱うと、チームは抽出のためにフラッグシップ料金を支払うことになる。