生成されたタイトルカードは、見出しが「Ultrafast vs Sol」、サブタイトルが「同じチェックポイント、2つの料金表、3つのワークロード」、3つのチップが「対話型エージェント:移行」「夜間スイープ:維持」「バッチ要約:維持」と表示され、下部のフッターには「価格はOpenAIのリスト料金(100万トークンあたり、ショートコンテキスト、2026年10月)」と記されている。
Engineering & Research

GPT-6.1 Ultrafast vs GPT-6.1 Sol:3つのタスク、それぞれに1つの判定

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

問うてみよう。GPT-6.1 UltrafastはGPT-6.1 Solの6倍の価格に見合うのか、と。そして正直な答えを言えば、あなたの3つのワークロードのうち2つは、まさに今ある場所に留まるべきだ。対話型コーディングエージェントは移行すべきだが、夜間の評価スイープは移すべきではないし、バッチ要約器も同様だ。理由はこのティアが割高だからではなく、そもそも彼らが買っていたのは、このティアが売っているものではなかったからだ。GPT-6.1 Solは2026年9月29日に出荷され、Ultrafastは2026年10月8日にその上のモードとして登場した。同じチェックポイント、同じ1,050,000トークンのコンテキストウィンドウ、同じ128,000トークンの出力上限、同じ2026年4月30日の知識カットオフ、同じ回答であり、価格は入力100万トークンあたり$12.00、出力100万トークンあたり$60.00で、これは$2.00と$10.00との対比である。スピードティアとは実時間の購入であり、実時間は、誰かが待っている仕事にしか価値を持たない。

その捉え直しこそがこの記事のすべてだ。残りは、あなたの仕事のどれが「待つ」タイプなのかを教えてくれる計算と、計画していようといまいと、その倍数とともにやってくる2つのコストだ。

実際に異なるのは、リクエストフィールド1つと請求1つだけです。

Ultrafast のチェックポイントは存在せず、別個のコンテキスト上限もなく、代替の知識カットオフもなく、固定すべきものも何もない。同じモデル識別子を service-tier フィールドを設定して送れば、OpenAI はリクエストを別の方法でスケジュールする。そのフィールドなしで送れば、Standard になる。開発者がコードで前提とするものはすべて同一であり、このリストについては機械的に扱う価値がある。なぜなら、リストの長さこそが論拠だからだ。

• モデル ID — どちらも同じ識別子で、デフォルトのスナップショットが 1 つだけ、固定できる日付付きのものは何もない。

• コンテキスト — 1,050,000トークンのウィンドウ、最大入力922,000トークン、最大出力128,000トークン(両方とも)。

• 推論ラダー — 両方で low、medium(デフォルト)、high、xhigh、max。両方で none と minimal は非対応。

• ツールサーフェス — ウェブ検索、ファイル検索、画像生成、コードインタープリター、ホステッドシェル、パッチ適用、スキル、コンピュータ操作、MCPとツール検索、Responses API 経由で、両方で。

• 料金 — Standard では100万トークンあたり入力 $2.00 / キャッシュ済み $0.10 / キャッシュ書き込み $2.50 / 出力 $10.00、それに対して Ultrafast では $12.00 / $0.60 / $15.00 / $60.00。

• 272,000入力トークンを超える場合 — リクエスト全体が、入力とキャッシュの料金は2倍、出力は1.5倍で再計算され、Ultrafastのロングコンテキストは$24.00 / $1.20 / $30.00 / $90.00になります。

• 速度 — Standardは定義上ベースラインであり、Ultrafastは最上位です。そして、O​penAIが公表している唯一のモデル固有の倍率は、このモデルではなくG​PT-6 Astraに属します。

その最後の一行は、ほかのすべての根底に流れる但し書きであり、さらに下でそれ独自のセクションが設けられている。まずは、仕事の話だ。

第一の仕事:インタラクティブエージェント。動くのはこれだ。

40回のツール呼び出しを連続して行うエージェントループこそ、このティアが対象として作られた買い手だ。なぜなら、各ターンの生成時間が次のターンを律速し、ユーザーはその様子を見ているからだ。1ターンあたり30,000入力トークンを送信し1,500出力トークンを受信するセッションを40ターンにわたって実行する場合を考えよう——合計1,200,000入力トークンと60,000出力トークンで、各リクエストは272,000トークンの再価格設定しきい値をはるかに下回る。

• スタンダード — 入力トークン120万×$2.00で$2.40、出力トークン60,000×$10.00で$0.60。1回の実行で3ドル。

• Ultrafast — 入力トークン120万個は$12.00のレートで$14.40、出力トークン60,000個は$60.00のレートで$3.60。この実行で18ドル。

• その差分 — それ以外は出力が同一のジョブから、生成レイテンシの大半を取り除くための$15.00

$15.00 が安いかどうかは、トークンではなく分の問題だ。Standard でそのセッションに20分、Ultrafast で4分かかるなら、15ドルで16分を買ったことになる — 1分あたり約$0.94 — そして重要な比較は、その16分があなたにとってどれだけのコストになるかとの比較だ。諸経費込みのレートで見た開発者は1分あたり1ドル以上の価値があるので、人間がループに入るケースでは答えは明白だ。人間のレビュー待ち行列で待つエージェントは1分あたり何の価値も生まず、そこでは同じ16分はタダの16分であり、そのティアは無駄だ。

適用すべきテストはそれであり、モデルとは何の関係もない。生成時間は誰の時計に乗っているのか、そしてその時計にはどれだけの価値があるのか? 答えが「人の時計で、価値は大きい」なら、Ultrafast は請求書の中で最も安いものだ。答えが「スケジューラの時計で、価値はゼロ」なら、それは最も高価なものだ。

A generated cost card headed 'One run, four configurations', listing Batch at half of Standard for $1.50, standard GPT-6.1 Sol at $3.00, GPT-6.1 Ultrafast at $18.00 and Ultrafast above 272,000 input tokens at $24.00 input and $90.00 output per 1M, with a note that all four describe the same 40-turn agent of 1,200,000 input and 60,000 output tokens and a footer reading that prices are OpenAI list rates and the arithmetic is ours.

ジョブ2:夜通しの評価スイープ。これはなしだ。

評価スイープは数千件のプロンプトをモデルに通し、結果をオブジェクトストレージに書き込み、朝には人間がそのテーブルを読む。そのレイテンシ予算は数分ではなく、一晩だ。パイプラインの中でモデルを待っているものは、キューの次のリクエスト以外に何もない。

Ultrafast はスイープのウォールクロック時間コストを取り除くわけではありません。スイープのウォールクロック時間コストは、あなたが抱えているレイテンシの問題ではなく、あなたが下したスケジューリング上の判断だからです。Ultrafast が行うのは、請求額を6倍にし、ジョブを、組織ごとの独自のレート制限を持つ予算枠へ移すことです。これは無人バッチでは実際のリスクです。レート制限の上限こそ、大規模なスイープがまさに遭遇する障害モードであり、ティアのページにはその数値が公開されていないからです。

そして、同じ料金表には、このジョブ向けに価格設定され、逆方向に価格設定されているレーンがあります。BatchとFlexはStandardの半額で提供され、APIのBatch処理はまさにこのような用途のために設計されています。大量のボリューム、対話型の締め切りなし、結果は非同期で返されます。上記の数値では、同じ40ターンのトークン合計はBatchでは$1.50であるのに対し、Ultrafastでは$18.00かかります。それは、違いを区別できないジョブにとって12倍の価格差です。

避けるべき間違いは、Ultrafastを汎用のアップグレードとして扱うことだ。それははしごの一番上にある——BatchとFlexが半分、Standardが1、Fastが2、Ultrafastが6——そして、はしごはより良いバージョンのメニューではない。間違った段を選ぶことは、間違ったモデルを選ぶことよりも金額面で影響が大きい。

仕事3:バッチ要約ツール。これもなし、理由は別。

ワークロードがドキュメントストアに対する夜間の一括処理で、入力が長く、出力が短く、人手を介さず、SLAが時間単位で測られる場合を考えよう。ここでは、トークンの構成がUltrafastにとって有利ではなく不利に働く。

272,000トークンのしきい値がその理由です。どちらのティアでも、それを超える単一のリクエストは、リクエスト全体を再価格設定します — すべての入力トークン、すべてのキャッシュ読み取り、すべての出力トークンが、入力とキャッシュのレートの2倍、出力の1.5倍になります。したがって、ロングコンテキストのUltrafastでは、100万入力トークンあたり$24.00、100万出力トークンあたり$90.00となり、再価格設定は、しきい値を超えた部分ではなく、リクエストによってトリガーされます。時折300,000入力トークンのリクエストを送信する文書要約ツールは、その300,000トークンすべてに対してロングコンテキスト料金を支払います。

キャッシュの挙動がそれをさらに悪化させます。キャッシュされた読み取りは、このモデルで最も安価なトークンであり、最も効果的なコストレバーです。そして、それらはティアによって吸収されるのではなく、ティアとともにスケールします — Standardでは100万キャッシュ入力あたり$0.10、Ultrafastでは$0.60で、どちらも非キャッシュ入力レートの5%です。キャッシュされたトークンと新規トークンのどのような組み合わせでも、その倍数を緩和することはできません。したがって、徹底的に最適化されたキャッシュパイプラインは、ファストレーンからの割引を得ることはありません。それは単に、より小さな数値の6倍を支払うだけです。

この2つを突き合わせると、要約器は、Ultrafastの割増が絶対額で最も大きく、その便益が最も小さいケースである。文書が本当に長く、締め切りが本当に数時間単位なのであれば、正しい構成はBatchまたは標準のStandardであり、Ultrafastの正しい使い方は、プロンプトを反復改良していて、改訂のたびに人が待っている開発途中のループである。

倍数に伴う2つのコスト

6倍のレートは価格の目に見える部分にすぎない。本番では、目に見えない2つの部分のほうがより重要になる。

1つ目はレート制限の許容量です。Ultrafastは独自の制限で動作し、StandardやFastのバジェットとは別です。そしてO​penAIはそれをティアページに公開するのではなく、組織ごとに設定します。ガイダンスでは、トラフィックを増やす前に自組織の制限を確認し、引き上げが必要ならアカウントチームに連絡するよう求められています。つまり、ワークロードをUltrafastに切り替えると同時に2つのことが起こります。請求額が何倍にも膨らみ、そのワークロードは自分では読み取れない可能性のある上限へと移されるのです。無人エージェントにとっては、まずその上限が制約となります。

第二は、節約の形である。Ultrafast が短縮するのはトークン間の時間であり、最初のトークンまでの時間でも、思考フェーズでもない。何かを出力する前にウォールクロック時間の大半を思考に費やすリクエストは、Ultrafast に切り替えても依然として遅く感じられる。なぜなら、そのティアが高速化するのは、そもそもボトルネックではなかった部分だからだ。これが「6倍払ったのに速度は同じ」という報告を生む失敗モードである。つまり、レイテンシがそのティアの届かない場所にあるアプリケーションを測定しているのだ。導入を決める前に、秒数が実際にどこで消費されているのか——最初のトークンまでの時間とトークン間の時間を比べて——を測るべきである。そのティアが担うのは、そのうちの片方だけなのだから。

なぜ「より速い」は、まだO​penAIを縛れる数字ではないのか

Ultrafast は「最大8倍」を売り文句にしているが、その表現の根拠となる測定値は別のモデルのものだ。公開されている文は、GPT-6 Astra Ultrafast が Codex の標準モードで GPT-6 Astra よりも最大8倍速くトークンを生成する、という内容だ。GPT-6.1 Sol について同等の公開された倍率はなく、Sol 版のトークン毎秒値を独立した第三者機関が公開したこともない。このティアのドキュメントでは、生成される出力トークン間の時間を短縮すると説明され、料金表を参照するようになっている。

倍数がそのまま通用するというのは妥当な事前想定だ——両モデルは同じサービングスタック上にあり、そのティアの仕組みも同じだから——。だが、その文で「最大」は実際に効いているし、異なるクライアントで兄弟モデルを測定したベンダー上限は、あなたのワークロードが目にする数値ではない。古い段階についても同じことが言える。GPT-5.6 Sol に対する Ultrafast は、2026年8月に限定プレビューで「Standard 処理より最大14倍高速」として発表され、ドキュメントには今もプレビューアクセスと記されており、Ultrafast のレート表はちょうど2行しかない。

OpenAIに確実に求めることができるのは価格です。なぜなら、価格は公開されており、すべてのトークンに適用されるからです。つまり、このページが扱っている判断は、ベンダーの速度に関する主張についての判断ではなく、あなた自身のレイテンシ予算についての判断なのです。

A generated decision card headed 'Which lane for which job' with three columns: 'Interactive agent' carrying the rows 'A person is waiting' and 'Ultrafast: yes', 'Overnight eval sweep' carrying 'Nobody is waiting' and 'Batch: half of Standard', and 'Long-document batch pass' carrying '272,000-token repricing line' and 'Standard: yes', footnoted to OpenAI's published per-million rates and tier documentation, October 2026.

コミットせずに試して、元に戻す

このティアはすべての API ユーザーが利用できるので、ウォールクロックに関する疑問に手っ取り早く答える方法は、同じプロンプトセットをフィールドをオンにした場合とオフにした場合の2回実行し、トークン数とタイミングを比較することです。そのテストで注意すべき点は2つあります。リクエストが 272,000 トークンのラインを超えるかどうかと、time-to-first-token が inter-token time を支配しているかどうかです。どちらか一方でも、ティアが宣伝どおりに機能しているときに、試行が「効果なし」という結果に見えてしまう可能性があります。

切り戻しは移行ではなくリクエストのフィールドであり、標準レーンは OrcaRouter を通じてベンダー自身の定価で提供されます。openai/gpt-6.1-sol — 入力トークン100万あたり2.00ドル、出力トークン100万あたり10.00ドル、マークアップは0%でプロバイダーの価格がそのまま反映されるため、ベンダーが値付けを変更すれば同日に当社側でも有効になります。Ultrafast 自体は当社が販売しているものではなく、お客様自身の OpenAI アカウントに請求されるサービスティアのフラグです。そう説明するほうが、そうではないかのように示唆するよりも有用です。1つのキーで実際に得られるのは、標準レーンと、1つの OpenAI 互換エンドポイントの背後にあるその他のカタログ、そしてプロバイダー間の自動フェイルオーバーです。これは、高価なティアを本番エージェントの手前に導入しようとしていて、標準レーンをコード変更ではなくルーティングの判断にしたい場合に、導入する価値があります。

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128,000 maximum output tokens, text and image input with text output, input price $2.00 and output price $10.00 per 1M tokens, with the page's code sample and EN language toggle visible in the header.

高速レーンについて、安価なレーンには当てはまらない実用的な注意点が1つあります。それはWebSocketsです。OpenAIはUltrafastには永続的なWebSocket接続を推奨しています。これは多数の逐次呼び出しを行うエージェントには適した形で、プロセスごとに1リクエストを出すバッチスクリプトには適さない形です。あなたのクライアントが後者なら、そのティア自体が推奨するトランスポートが、夜間ジョブは別の場所に属するもう1つの理由になります。

評決が変わるとき

3つの進展があれば、「stay」リストからジョブを外せるだろう。GPT-6.1 Sol 向けの Ultrafast レート制限が公開されれば、バッチのケースにおける上限到達リスクを取り除ける。Sol ティアについて公開された、または独立に再現された速度測定があれば、実時間の短縮分を仮定するのではなく、見積もりに組み込めるようになる。そして、ファストレーンの割引段階——Batch に相当する Ultrafast、つまりそのティアは依然として速いが価格は6倍ではない——があれば、ラダーの中間にあるあらゆるジョブの経済性を変えるだろう。

それらのどれも、今日は存在しない。存在するのは、名前のとおりのティアだ。同じGPT-6.1 Solを、スケジュールだけ変えて、どのラインでも6倍の価格で提供している。インタラクティブエージェントを移し、他の2つはそのままにして、自分の秒が実際にどこへ消えているかを測ってから、どれが自分に合うかを決めろ。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新