
GPT-6.1 Ultrafast vs GPT-6.1 Sol:3つのタスク、それぞれに1つの判定
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 378 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
問うてみよう。GPT-6.1 UltrafastはGPT-6.1 Solの6倍の価格に見合うのか、と。そして正直な答えを言えば、あなたの3つのワークロードのうち2つは、まさに今ある場所に留まるべきだ。対話型コーディングエージェントは移行すべきだが、夜間の評価スイープは移すべきではないし、バッチ要約器も同様だ。理由はこのティアが割高だからではなく、そもそも彼らが買っていたのは、このティアが売っているものではなかったからだ。GPT-6.1 Solは2026年9月29日に出荷され、Ultrafastは2026年10月8日にその上のモードとして登場した。同じチェックポイント、同じ1,050,000トークンのコンテキストウィンドウ、同じ128,000トークンの出力上限、同じ2026年4月30日の知識カットオフ、同じ回答であり、価格は入力100万トークンあたり$12.00、出力100万トークンあたり$60.00で、これは$2.00と$10.00との対比である。スピードティアとは実時間の購入であり、実時間は、誰かが待っている仕事にしか価値を持たない。
その捉え直しこそがこの記事のすべてだ。残りは、あなたの仕事のどれが「待つ」タイプなのかを教えてくれる計算と、計画していようといまいと、その倍数とともにやってくる2つのコストだ。
実際に異なるのは、リクエストフィールド1つと請求1つだけです。
Ultrafast のチェックポイントは存在せず、別個のコンテキスト上限もなく、代替の知識カットオフもなく、固定すべきものも何もない。同じモデル識別子を service-tier フィールドを設定して送れば、OpenAI はリクエストを別の方法でスケジュールする。そのフィールドなしで送れば、Standard になる。開発者がコードで前提とするものはすべて同一であり、このリストについては機械的に扱う価値がある。なぜなら、リストの長さこそが論拠だからだ。
• モデル ID — どちらも同じ識別子で、デフォルトのスナップショットが 1 つだけ、固定できる日付付きのものは何もない。
• コンテキスト — 1,050,000トークンのウィンドウ、最大入力922,000トークン、最大出力128,000トークン(両方とも)。
• 推論ラダー — 両方で low、medium(デフォルト)、high、xhigh、max。両方で none と minimal は非対応。
• ツールサーフェス — ウェブ検索、ファイル検索、画像生成、コードインタープリター、ホステッドシェル、パッチ適用、スキル、コンピュータ操作、MCPとツール検索、Responses API 経由で、両方で。
• 料金 — Standard では100万トークンあたり入力 $2.00 / キャッシュ済み $0.10 / キャッシュ書き込み $2.50 / 出力 $10.00、それに対して Ultrafast では $12.00 / $0.60 / $15.00 / $60.00。
• 272,000入力トークンを超える場合 — リクエスト全体が、入力とキャッシュの料金は2倍、出力は1.5倍で再計算され、Ultrafastのロングコンテキストは$24.00 / $1.20 / $30.00 / $90.00になります。
• 速度 — Standardは定義上ベースラインであり、Ultrafastは最上位です。そして、OpenAIが公表している唯一のモデル固有の倍率は、このモデルではなくGPT-6 Astraに属します。
その最後の一行は、ほかのすべての根底に流れる但し書きであり、さらに下でそれ独自のセクションが設けられている。まずは、仕事の話だ。
第一の仕事:インタラクティブエージェント。動くのはこれだ。
40回のツール呼び出しを連続して行うエージェントループこそ、このティアが対象として作られた買い手だ。なぜなら、各ターンの生成時間が次のターンを律速し、ユーザーはその様子を見ているからだ。1ターンあたり30,000入力トークンを送信し1,500出力トークンを受信するセッションを40ターンにわたって実行する場合を考えよう——合計1,200,000入力トークンと60,000出力トークンで、各リクエストは272,000トークンの再価格設定しきい値をはるかに下回る。
• スタンダード — 入力トークン120万×$2.00で$2.40、出力トークン60,000×$10.00で$0.60。1回の実行で3ドル。
• Ultrafast — 入力トークン120万個は$12.00のレートで$14.40、出力トークン60,000個は$60.00のレートで$3.60。この実行で18ドル。
• その差分 — それ以外は出力が同一のジョブから、生成レイテンシの大半を取り除くための$15.00
$15.00 が安いかどうかは、トークンではなく分の問題だ。Standard でそのセッションに20分、Ultrafast で4分かかるなら、15ドルで16分を買ったことになる — 1分あたり約$0.94 — そして重要な比較は、その16分があなたにとってどれだけのコストになるかとの比較だ。諸経費込みのレートで見た開発者は1分あたり1ドル以上の価値があるので、人間がループに入るケースでは答えは明白だ。人間のレビュー待ち行列で待つエージェントは1分あたり何の価値も生まず、そこでは同じ16分はタダの16分であり、そのティアは無駄だ。
適用すべきテストはそれであり、モデルとは何の関係もない。生成時間は誰の時計に乗っているのか、そしてその時計にはどれだけの価値があるのか? 答えが「人の時計で、価値は大きい」なら、Ultrafast は請求書の中で最も安いものだ。答えが「スケジューラの時計で、価値はゼロ」なら、それは最も高価なものだ。

ジョブ2:夜通しの評価スイープ。これはなしだ。
評価スイープは数千件のプロンプトをモデルに通し、結果をオブジェクトストレージに書き込み、朝には人間がそのテーブルを読む。そのレイテンシ予算は数分ではなく、一晩だ。パイプラインの中でモデルを待っているものは、キューの次のリクエスト以外に何もない。
Ultrafast はスイープのウォールクロック時間コストを取り除くわけではありません。スイープのウォールクロック時間コストは、あなたが抱えているレイテンシの問題ではなく、あなたが下したスケジューリング上の判断だからです。Ultrafast が行うのは、請求額を6倍にし、ジョブを、組織ごとの独自のレート制限を持つ予算枠へ移すことです。これは無人バッチでは実際のリスクです。レート制限の上限こそ、大規模なスイープがまさに遭遇する障害モードであり、ティアのページにはその数値が公開されていないからです。
そして、同じ料金表には、このジョブ向けに価格設定され、逆方向に価格設定されているレーンがあります。BatchとFlexはStandardの半額で提供され、APIのBatch処理はまさにこのような用途のために設計されています。大量のボリューム、対話型の締め切りなし、結果は非同期で返されます。上記の数値では、同じ40ターンのトークン合計はBatchでは$1.50であるのに対し、Ultrafastでは$18.00かかります。それは、違いを区別できないジョブにとって12倍の価格差です。
避けるべき間違いは、Ultrafastを汎用のアップグレードとして扱うことだ。それははしごの一番上にある——BatchとFlexが半分、Standardが1、Fastが2、Ultrafastが6——そして、はしごはより良いバージョンのメニューではない。間違った段を選ぶことは、間違ったモデルを選ぶことよりも金額面で影響が大きい。
仕事3:バッチ要約ツール。これもなし、理由は別。
ワークロードがドキュメントストアに対する夜間の一括処理で、入力が長く、出力が短く、人手を介さず、SLAが時間単位で測られる場合を考えよう。ここでは、トークンの構成がUltrafastにとって有利ではなく不利に働く。
272,000トークンのしきい値がその理由です。どちらのティアでも、それを超える単一のリクエストは、リクエスト全体を再価格設定します — すべての入力トークン、すべてのキャッシュ読み取り、すべての出力トークンが、入力とキャッシュのレートの2倍、出力の1.5倍になります。したがって、ロングコンテキストのUltrafastでは、100万入力トークンあたり$24.00、100万出力トークンあたり$90.00となり、再価格設定は、しきい値を超えた部分ではなく、リクエストによってトリガーされます。時折300,000入力トークンのリクエストを送信する文書要約ツールは、その300,000トークンすべてに対してロングコンテキスト料金を支払います。
キャッシュの挙動がそれをさらに悪化させます。キャッシュされた読み取りは、このモデルで最も安価なトークンであり、最も効果的なコストレバーです。そして、それらはティアによって吸収されるのではなく、ティアとともにスケールします — Standardでは100万キャッシュ入力あたり$0.10、Ultrafastでは$0.60で、どちらも非キャッシュ入力レートの5%です。キャッシュされたトークンと新規トークンのどのような組み合わせでも、その倍数を緩和することはできません。したがって、徹底的に最適化されたキャッシュパイプラインは、ファストレーンからの割引を得ることはありません。それは単に、より小さな数値の6倍を支払うだけです。
この2つを突き合わせると、要約器は、Ultrafastの割増が絶対額で最も大きく、その便益が最も小さいケースである。文書が本当に長く、締め切りが本当に数時間単位なのであれば、正しい構成はBatchまたは標準のStandardであり、Ultrafastの正しい使い方は、プロンプトを反復改良していて、改訂のたびに人が待っている開発途中のループである。
倍数に伴う2つのコスト
6倍のレートは価格の目に見える部分にすぎない。本番では、目に見えない2つの部分のほうがより重要になる。
1つ目はレート制限の許容量です。Ultrafastは独自の制限で動作し、StandardやFastのバジェットとは別です。そしてOpenAIはそれをティアページに公開するのではなく、組織ごとに設定します。ガイダンスでは、トラフィックを増やす前に自組織の制限を確認し、引き上げが必要ならアカウントチームに連絡するよう求められています。つまり、ワークロードをUltrafastに切り替えると同時に2つのことが起こります。請求額が何倍にも膨らみ、そのワークロードは自分では読み取れない可能性のある上限へと移されるのです。無人エージェントにとっては、まずその上限が制約となります。
第二は、節約の形である。Ultrafast が短縮するのはトークン間の時間であり、最初のトークンまでの時間でも、思考フェーズでもない。何かを出力する前にウォールクロック時間の大半を思考に費やすリクエストは、Ultrafast に切り替えても依然として遅く感じられる。なぜなら、そのティアが高速化するのは、そもそもボトルネックではなかった部分だからだ。これが「6倍払ったのに速度は同じ」という報告を生む失敗モードである。つまり、レイテンシがそのティアの届かない場所にあるアプリケーションを測定しているのだ。導入を決める前に、秒数が実際にどこで消費されているのか——最初のトークンまでの時間とトークン間の時間を比べて——を測るべきである。そのティアが担うのは、そのうちの片方だけなのだから。
なぜ「より速い」は、まだOpenAIを縛れる数字ではないのか
Ultrafast は「最大8倍」を売り文句にしているが、その表現の根拠となる測定値は別のモデルのものだ。公開されている文は、GPT-6 Astra Ultrafast が Codex の標準モードで GPT-6 Astra よりも最大8倍速くトークンを生成する、という内容だ。GPT-6.1 Sol について同等の公開された倍率はなく、Sol 版のトークン毎秒値を独立した第三者機関が公開したこともない。このティアのドキュメントでは、生成される出力トークン間の時間を短縮すると説明され、料金表を参照するようになっている。
倍数がそのまま通用するというのは妥当な事前想定だ——両モデルは同じサービングスタック上にあり、そのティアの仕組みも同じだから——。だが、その文で「最大」は実際に効いているし、異なるクライアントで兄弟モデルを測定したベンダー上限は、あなたのワークロードが目にする数値ではない。古い段階についても同じことが言える。GPT-5.6 Sol に対する Ultrafast は、2026年8月に限定プレビューで「Standard 処理より最大14倍高速」として発表され、ドキュメントには今もプレビューアクセスと記されており、Ultrafast のレート表はちょうど2行しかない。
OpenAIに確実に求めることができるのは価格です。なぜなら、価格は公開されており、すべてのトークンに適用されるからです。つまり、このページが扱っている判断は、ベンダーの速度に関する主張についての判断ではなく、あなた自身のレイテンシ予算についての判断なのです。

コミットせずに試して、元に戻す
このティアはすべての API ユーザーが利用できるので、ウォールクロックに関する疑問に手っ取り早く答える方法は、同じプロンプトセットをフィールドをオンにした場合とオフにした場合の2回実行し、トークン数とタイミングを比較することです。そのテストで注意すべき点は2つあります。リクエストが 272,000 トークンのラインを超えるかどうかと、time-to-first-token が inter-token time を支配しているかどうかです。どちらか一方でも、ティアが宣伝どおりに機能しているときに、試行が「効果なし」という結果に見えてしまう可能性があります。
切り戻しは移行ではなくリクエストのフィールドであり、標準レーンは OrcaRouter を通じてベンダー自身の定価で提供されます。openai/gpt-6.1-sol — 入力トークン100万あたり2.00ドル、出力トークン100万あたり10.00ドル、マークアップは0%でプロバイダーの価格がそのまま反映されるため、ベンダーが値付けを変更すれば同日に当社側でも有効になります。Ultrafast 自体は当社が販売しているものではなく、お客様自身の OpenAI アカウントに請求されるサービスティアのフラグです。そう説明するほうが、そうではないかのように示唆するよりも有用です。1つのキーで実際に得られるのは、標準レーンと、1つの OpenAI 互換エンドポイントの背後にあるその他のカタログ、そしてプロバイダー間の自動フェイルオーバーです。これは、高価なティアを本番エージェントの手前に導入しようとしていて、標準レーンをコード変更ではなくルーティングの判断にしたい場合に、導入する価値があります。

高速レーンについて、安価なレーンには当てはまらない実用的な注意点が1つあります。それはWebSocketsです。OpenAIはUltrafastには永続的なWebSocket接続を推奨しています。これは多数の逐次呼び出しを行うエージェントには適した形で、プロセスごとに1リクエストを出すバッチスクリプトには適さない形です。あなたのクライアントが後者なら、そのティア自体が推奨するトランスポートが、夜間ジョブは別の場所に属するもう1つの理由になります。
評決が変わるとき
3つの進展があれば、「stay」リストからジョブを外せるだろう。GPT-6.1 Sol 向けの Ultrafast レート制限が公開されれば、バッチのケースにおける上限到達リスクを取り除ける。Sol ティアについて公開された、または独立に再現された速度測定があれば、実時間の短縮分を仮定するのではなく、見積もりに組み込めるようになる。そして、ファストレーンの割引段階——Batch に相当する Ultrafast、つまりそのティアは依然として速いが価格は6倍ではない——があれば、ラダーの中間にあるあらゆるジョブの経済性を変えるだろう。
それらのどれも、今日は存在しない。存在するのは、名前のとおりのティアだ。同じGPT-6.1 Solを、スケジュールだけ変えて、どのラインでも6倍の価格で提供している。インタラクティブエージェントを移し、他の2つはそのままにして、自分の秒が実際にどこへ消えているかを測ってから、どれが自分に合うかを決めろ。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
