見出しを「Ultrafast vs Standard」、サブタイトルを「1つのチェックポイント、2つのサービス階層」、2つのバッジを「同じ重み、同じ回答」と「サービングパスだけが変わる」とする、生成されたタイトルカード。
Guides & Insights

GPT-6 Astra Ultrafast 対 GPT-6 Astra:同じチェックポイント、6倍の速度

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これは、両者が同じものであるという珍しい比較です。GPT-6 Astra Ultrafast はモデルではなく、2026年9月3日にリリースされた同社の旗艦 GPT-6 Astra に適用されるサービス階層です。そして同社のドキュメントには、次のように明記されています:model を gpt-6-astra に設定し、次の項目を追加します:service_tier: "ultrafast"。別個のモデル、別個のチェックポイント、別個のコンテキストウィンドウは存在しません。したがって、GPT-6 Astra Ultrafast vs GPT-6 Astra というタイトルのページは、ベンチマークの主張にはなり得ません。なぜなら、ベンチマークすべき第2の重みのセットが存在しないからです — そして、そうでないかのように装うことは、今週、誤解を招く記事を作る最も簡単な方法でしょう。

比較すべきものは、仕様表より狭く、より有用だ。ある料金表と別の料金表、ある可用性スタンスと別のスタンス、そしてOpenAIがその大きさを「最大8倍」と述べる実時間の差である。Ultrafast for GPT-6 Astraが2026年9月29日に一般提供されたことで、この比較の両側にようやく価格が付いた。8月にこのティアがプレビューのみだったときには当てはまらなかったことだ。つまり、問いの形は変わった。もはや「このティアは実在するのか」ではなく、「6倍の料金で、高速レーンが正しい購入となるには、自分のワークロードについて何が真でなければならないのか」である。

異なる列と、そうでないもの

2つのレーンを並べてみると、ほとんどすべての行は構造上同一になる。同一でない行だけが、この記事に唯一ある内容だ。

• チェックポイント — 完全に同一です。GPT-6 Astra Ultrafastは、標準のGPT-6 Astraの重みで動作します。サンプリング動作も推論動作も同じで、同じプロンプトに対して同じエフォート設定なら同じ回答を返します。

• コンテキスト、出力、入力 — 同一。両者とも1,050,000トークンの入力ウィンドウと128,000トークンの出力上限、テキスト・画像・ファイルの入力、テキスト出力、そしてティアに関係なく2026年4月30日の知識カットオフ。

• 推論の制御 — 同一です。エフォートは両側とも low、medium、high、xhigh、max で動作します。階層が変えるのはトークンの到着速度であり、モデルがどれだけ深く考えるかではありません。そのため、xhigh エフォートの Ultrafast リクエストは依然として xhigh エフォートのリクエストです。

• 料金表 — 異なる。そしてこれが判断のすべてだ。Standard は 100万トークンあたり、入力 $10.00、キャッシュ済み入力 $1.00、キャッシュ書き込み $12.50、出力 $50.00 を、入力トークン 272,000 まで請求する。Ultrafast は $60.00 / $6.00 / $75.00 / $300.00 を請求する。272K を超えると、リクエスト全体が再価格設定され、Standard では $20.00 / $2.00 / $25.00 / $75.00、Ultrafast では $120.00 / $12.00 / $150.00 / $450.00 になる。6 倍、4 つの料金行すべてで、両方のコンテキスト帯域で。

• アクセス — 異なります。Standardはデフォルトレーンであり、APIキーを持つ誰でも呼び出せます。Ultrafastはかつてウェイトリスト制でしたが、現在はすべてのAPIユーザーが利用可能です。ただし当初は低いレート制限での提供となります。OpenAIのドキュメントによると、APIティア1~3では毎分500,000トークン、ティア4では1,000,000トークン、ティア5では5,000,000トークンです。

• 地理的条件 — 制限がティアに付随するため、一方向にのみ異なります。Ultrafastは米国データレジデンシーとグローバル処理のみをサポートし、EUまたはその他の非米国地域の処理エンドポイントはサポートしていません。標準レーンには同等の制限はありません。

• スループット — これは別物であり、約束ではなく上限として示されています。OpenAIのUltrafastドキュメントでは、このティアについて「Standardモードの最大8倍の速度」を実現すると説明されています。

• ベンチマーク — 行ではありません。そこに載せるものは何もありません。2つのモデルを比較するページなら索引表を置くような箇所で、このページはどちら側も同じ数値になっています。それはデータの欠落ではなく、むしろ要点なのです。

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

クロスオーバーは、適切に処理された

倍率が一律6倍なので、判断は一つの不等式に帰着する。そしてそれは、漠然と示すのではなく書き出してみる価値がある。早く終えることの価値がトークン料金の6倍を上回るなら、Ultrafastを買うのが正しい。それ以外はすべて解説にすぎない。

具体的な形を考えてみよう:100,000トークンのリポジトリコンテキストを取り込み、5,000トークンのパッチを生成するエージェント的パスで、リポジトリの内容は試行間でキャッシュされる。標準サービスでは、キャッシュ読み取りが$0.10、新規入力が$0.10、出力が$0.25で、1回の試行あたり$0.45となる。Ultrafastでは、同じ試行で$0.60、$0.60、$1.50が課金され、$2.70となる。差分は1回の試行あたり$2.25だ。もし速度が各試行をより早く終わらせるだけで、試行回数が変わらないなら、あなたはレイテンシに対して1回の試行あたり$2.25を支払ったことになり、その唯一の正当化は待ち時間の価値である。

ここでスピードに働いてもらおう。高速レーンによって、遅いラウンドトリップと格闘しなくなるためにモデルの初回パスがより頻繁に成功し、パス回数が3回から1回に減るなら、このタスクのコストはstandardが1.35ドル、Ultrafastが2.70ドルだ。依然として割高だが、6倍ではなくわずか2倍であり、今問われるのは、1回のインタラクティブサイクルとそれを何度も繰り返すことの差に2ドル払う価値があるかどうかだ。

それはチームが見落としがちな算術であり、それを見落としたい誘惑は両方向に働く。すべての行に一律6倍を適用すると、そのティアは一律に高価に見える。ターンを削減する場合には、それは誤りだ。そして「最大8倍」という見出しは、一律に安く見せる。そうでない場合には、それは誤りだ。これを決める数値は、完了したタスクあたりの課金対象ターン数であり、自社のトレースで測定し、レートを掛け合わせたものだ。その比率が6に近づいていないなら、Ultrafastはレイテンシーの購入であり、そういうものとして承認されるべきだ。そして待ち時間の向こう側には、名前を明記した人間を置くべきだ。

「最大8倍」がカバーするものとそうでないもの

公表されている速度のうたい文句は出力スループットの上限であり、スループットとレイテンシを混同することは、このティアについて最もよくある誤解です。

スループットとは、生成が動き出した後の1秒あたりのトークン数だ。レイテンシとは、リクエストを送ってから答えを得るまでの時間だ。Ultrafastが改善するのは前者である。OpenAI自身のドキュメントは後者を別個の問題として指摘し、UltrafastにはWebSocketsを強く推奨している。まさにリクエストごとのネットワークオーバーヘッドがレイテンシの改善分を損ないうるからだ——もしこのティアがラウンドトリップを無償にしてくれるなら不要なはずの助言である。さらに2つの実時間の要素は、完全にこのティアの外側にある。自前のオーケストレーションが呼び出しと呼び出しの間に費やす時間と、ツール呼び出しが他者のサーバー上で要する時間だ。単一の長い生成なら、スループットが話の大半を占める。20ステップのエージェントループなら、それはごく一部にすぎず、そしてその一部であるからこそ、前述のターン数の計算が8倍という見出しよりも重要になるのである。

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

比較の目安として、下のティアを見てください。ファストモードは、2026年7月30日に「優先処理」から名称変更されたもので、価格は標準の2倍、最大2.5倍高速と記載されています。ウルトラファストは標準の6倍の価格で、最大8倍高速と記載されています。つまり、ファストからウルトラファストへのステップは、約3.2倍の速度に対して3倍の料金であり、線形に近い上昇です。標準に対する割増は超線形ではなく、単に大きいだけであり、しかもこの1つのモデルファミリーでのみ利用できます。OpenAIのウルトラファスト料金表には行が1つしかなく、それはgpt-6-astraです。これは、このティアが製品ライン全体で選べる一般的なサービスレベルではなく、現行モデルの機能であることを意味します。

2つのワークロード、1つのモデル

この比較を最も明快に行う方法は、Ultrafast のほうが優れているかどうかを問うのをやめ、あなたのリクエストが2つの形のどちらなのかを問い始めることだ。

最初のパターンは、人が待っている状況だ。障害が進行している最中のインシデントのトリアージ、顧客が電話口にいるサポートのエスカレーション、アナリストが一度の作業セッション内で反復して試行錯誤する作業——これらは、答えが2分ではなく20秒で届くことが、その人が次にできることを変えるワークロードであり、ターン数が少ないため総トークン請求額も小さい。数回のターンに対する6倍の料金は、そこに座っている人のコストに比べれば丸め誤差のようなものだ。ここではこのティアが明らかに正しく、OpenAI自身のプレビュー資料が述べていた形でもある。

2つ目の形は、スケジュールで動く機械です。夜間の再インデックス、一括分類パス、朝までに仕上げなければならないレポート、バックフィル。これらはいずれもレイテンシを感知できません。すべてトークン数に支配されています。そして、いずれも同じ料金表に載っている、より良い選択肢があります。Batch と Flex で、標準の50%価格、GPT-6 Astra なら 272K まで、100万トークンあたり入力 $5.00、出力 $25.00 です。誰も見ていないジョブを少しでも早く終わらせるために、半額のレーンが存在するのに6倍払うのは、この表で犯しうる最も高くつく間違いです。

三番目の形は曖昧なもので、ほとんどのエンジニアリングチームが実際に持っているものです:エージェントループです。そこでは、経験則ではなくクロスオーバー計算が決め手となり、測定が十分に安価なので推測する言い訳はありません — 両方のレーンで完了したタスクあたりのターン数を計測し、レートを掛けて、合計を比較します。GPT-6 Astraの回答は両側で同じなので、ターン数の違いは、モデルが何を生成したかではなく、どれだけ時間がかかったかの違いであり、これにより交絡した実験ではなくクリーンな実験になります。

標準レーンの購入

「Ultrafast pricing」という表現が曖昧にしがちな2つのこと、つまりティアの価格とモデルの価格は、分けて考える価値があります。標準のGPT-6 Astraはルーティング可能なモデルで、OrcaRouter上ではopenai/gpt-6-astraとしてプロバイダー自身のレートで稼働しています。100万トークンあたり入力$10.00、キャッシュ入力$1.00、出力$50.00で、文書化されている長コンテキストの段階では、入力トークンが272,000を超えると$20.00 / $2.00 / $75.00になります。0%のマークアップで提供されているため、プロバイダーの定価がそのまま適用され、ベンダーの料金変更は次回の契約更新時ではなく同日に請求へ反映されます。そして同じキーで200以上の他のモデルにアクセスできます。そのため、Astraから始めた評価は、2度目の統合なしで競合他社のモデルにまで広げられます。

Ultrafast ティアそのものは、当社がルーティングする対象ではありません。その理由は商業的なものではなく構造上のものです。つまり、それはモデルではありません。OpenAI が自社のモデル ID に適用し、あなたのアカウントに請求する、アクセス制御されたサービスティアフラグであり、呼び出し元がリクエストごとに有効化するものです。したがって切り分けは明確です。Ultrafast をオンにすると、それはあなたの直接の OpenAI 統合内に存在し、それと併用して流す標準ティアのトラフィックは、まさにパススルー型ゲートウェイが担うべき種類のものです。その境界を正確に述べることは、高速レーンが当社経由で利用可能であるかのように示唆する一段落よりも有用です。

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

ページより短い最下行

GPT-6 Astra Ultrafast と GPT-6 Astra は、1つのモデルに2つの料金体系を用意したものです。変わるのは、回答を得るタイミングであり、回答そのものではありません — 同じ重み、同じ 1,050,000 トークンのコンテキストウィンドウ、同じ 128,000 トークンの出力上限、同じエフォート制御、同じ知識カットオフを備え、出力スループットは最大 8 倍、価格はすべての料金項目でちょうど 6 倍です。ただし、初期の低いレート制限と、標準レーンにはない米国限定のデータレジデンシー制約が適用されます。人が待っている場面や、速度によって課金対象のターン数が明確に減る場面ではこれを選び、ジョブがスケジュールで実行され、Batch または Flex が標準料金の半額で利用できる場面では見送り、想定せずにターン数を測定してください。この比較で分からない唯一のことは、どちらのモデルが優れているかです。なぜなら、そこにはただ1つのモデルしか存在したことがないからです。