
GPT-6 Astra UltrafastはBlackwell上で動作:NVIDIAが8倍を支えるハードウェアを明らかに
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 223 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- xAINEWGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
2026年10月1日、NVIDIA は、ディオン・ハリスによる「NVIDIA GPU が OpenAI の GPT-6 Astra Ultrafast の高速化をどのように支援するか」と題した投稿を公開した。その中心となる一文は、両社のどちらかがこのサービス階層が何で動いているかを明かした初めてのものだった。「NVIDIA Blackwell GPU 上で動作する GPT-6 Astra Ultrafast は、現在 OpenAI API で、また対象となる ChatGPT Work および Codex ユーザー向けに利用可能です。」これがニュースであり、見出しが示唆するよりも範囲は狭い。モデルである GPT-6 Astra は、2026年9月3日にリリースされた。その上に載る Ultrafast サービス階層は、2026年9月29日に広く利用可能になった。Astra 標準モードより最大8倍高速なトークン生成という速度の主張は、NVIDIA がそれを繰り返した時点ですでに2日前のものだった。
そこで浮かび上がるのは、その投稿が本当に答えている問いだ——「どれほど速いのか」ではなく、「それは誰のシリコンなのか」という問い。

実際にその投稿が付け加えた3つのこと
繰り返しの記述を取り除けば、10月1日の投稿は3つの事実をもたらす。
• ハードウェア — Blackwell。9月30日に公開されたOpenAI自身のUltrafastドキュメントには、このティアの速度、構成、レート制限が記載されているが、GPUの名前は一切挙げられていない。したがって、シリコンの帰属はハードウェアベンダーへの単一情報源によるものである。それは虚偽であることを意味するものではないが、自社機器に関するベンダーの主張であることを意味しており、そのように明示する価値がある。
• 実名で語った2人のエンジニア — OpenAIの推論責任者フィリップ・ティエ氏と、OpenAIのコンピュート担当最高技術責任者ウダイ・ルダラジュ氏で、両者とも今回の高速化が何によるものかを記録に残る形で証言している。
• 対象となるオーディエンス — 「対象となるChatGPT WorkおよびCodexユーザー」であり、これはこのティアが開始された当初のAPI限定という枠組みより広い。OpenAI自身のドキュメントには今も、GPT-6 AstraのUltrafastは「低いレート制限のもとで全APIユーザーが利用可能」と記載されており、この低レート制限という但し書きは公式には撤回されていない。
その2つの引用と、なぜそこが面白い部分なのか
Tilletの貢献はベンチマークではなくループだ。NVIDIAのツールとドキュメントへの投資は「私たちのモデルをプログラミングにおいて極めて優れたものにすることを可能にした」と彼は言う。そしてAstraは「その知識を、NVIDIAハードウェアを魅力的にする高性能カーネルに変える」ことができる。Ruddarrajuはこの作業の方向性についてより率直だ。「私たちは自社の内部モデルを使い、NVIDIA GPU上の推論を最適化した」
まとめて読むと、これは能力ではなくデプロイに関する主張だ。OpenAIのフロンティアモデルは今やGPUカーネルを書くのに十分なほど優れており、OpenAIは自社のサービングスタックを最適化するためにそれらを使っている。これはまた、NVIDIAの投稿の中でローンチ週についてまったく触れていない唯一のセクションとも一致する——「Continually Improving Performance」という見出しで、OpenAIが自社モデルを、それが動作するNVIDIAソフトウェアに向け続けるため、デプロイされた推論は時間とともに速くなると論じている。
これはどれも測定ではない。GPUを販売した企業が公表した、2人のエンジニアによるプロセスの説明だ。正直に読めば、そのプロセスはもっともらしく、信じるのは容易で、外部からは反証不可能だ——この話に出てくるあらゆる速度の数字についても同じことが言える。
こちらにBlackwell、あちらにCerebras
この投稿の最も有用な点は、誰も説明してこなかった分断を明らかにしていることだ。2026年8月13日、OpenAIは別のモデル上で高速ティアを予告した——GPT-5.6 Solが「最大14倍」高速で動作する——そしてその背後にあるパートナーとしてCerebrasを挙げ、最大毎秒750個の出力トークンを生成するウェハスケールのハードウェアについて説明した。7週間後、Astra上の高速ティアはBlackwellで動作しており、その数値は8倍だ。
2つの高速ティア、2つのハードウェアの答え。一方は専門パートナーで、もう一方は同社自身の最大のサプライヤーだ。どちらのベンダーも、2つのサービング経路の比較を公開しておらず、独立した評価者もどちらも測定していない。もう一点、NVIDIAの投稿が2番目の名前をどう扱っているかにも注目してほしい。「Rubin」は、Tilletの引用の中に一度だけ登場し、そこではモデルが「Blackwell and Rubin GPUs」向けのカーネルを書くことについて述べられている。これはOpenAIのモデルが何をプログラムできるかについての記述であり、今日Rubin上で何かがサービングされているという記述ではない。
NVIDIAが公表しなかった数字
この話には、どちらの企業も8xの横に並べていない数字が1つあり、それこそがチームがそのティアをオンに切り替えるかどうかを決めるものである。OpenAIが公開しているUltrafastの料金表には、gpt-6-astraが入力トークン100万個あたり$60.00、キャッシュ済み入力$6.00、キャッシュ書き込み$75.00、出力$300.00と記載されている。同じモデルの標準ティアは$10.00と$50.00で、キャッシュ済み入力が$1.00、キャッシュ書き込みが$12.50である。各列はちょうど標準料金の6倍である。
• 倍率は — 入力、出力、キャッシュ入力、キャッシュ書き込みで6.00倍。「最大」ではない。6倍です。
• 上限 — 8倍、両ベンダーが「最大」を付けて引用し、条件を明示しない数字。
• これが意味するもの — 価格倍率は下回っている——この階層が自ら主張する最良ケースを基準にすると。上限ではこの取引は有利だが、あなたのトラフィックで6倍を下回るなら、節約できる時間1単位あたりに支払う額は宣伝文句が示すより多い。だからこそ、この階層の唯一意味のあるテストは、自分のリクエスト上で測定することだ。
• 長文コンテキスト段階 — 入力トークンが272,000を超えると、Ultrafastの料金は入力$120.00、出力$450.00となり、標準ティア自体の段階料金の6倍になります。
• 運用上の細則 — OpenAIは、使用量ティア1~3で500,000、ティア4で1,000,000、ティア5で5,000,000というUltrafastの毎分トークン数の段階を記載している。Ultrafastがサポートするのは米国データレジデンシーとグローバル処理のみで、EUやその他の非米国地域の処理エンドポイントはない。また、ドキュメントはUltrafastにWebSocketsを推奨しており、「特に短時間に多数のツール呼び出しを行うエージェント型アプリケーションにとって」重要だとし、「永続接続がないと、ネットワークオーバーヘッドによってレイテンシの利得が減少する可能性がある」と警告している。

最後の点こそが、実行に移すべきものです。その階層を有効にしながら、その下でリクエストごとのHTTPをそのままにしているチームは、6倍の料金を払いながら、速度向上の一部を接続の確立に返上しているのです — 文書化され、避けられる、金の無駄遣いです。
単一のエンドポイントから見るとこうなります
GPT-6 AstraはOrcaRouterでopenai/gpt-6-astraとして利用できます。1,050,000トークンのコンテキストウィンドウ、最大128,000出力トークン、テキスト・画像・ファイル入力に対応し、OpenAIの定価がそのまま適用されます。入力は100万トークンあたり$10.00、出力は$50.00で、入力トークンが272,000を超えると$20.00と$75.00に上がります。カタログの目玉ベンチマークはGPQA Diamondで96.1です。
Ultrafast ティアは OrcaRouter 上には存在せず、存在することもできません。それはモデル ID ではなく OpenAI アカウントのアクセス制御された属性であり、だからこそ openai/gpt-6-astra-ultrafast は model-not-found を返します。このティアを有効にすると、それはあなたの直接の OpenAI 統合内に存在します。では、200 以上のモデルを扱うエンドポイント付きの0% マークアップがこの状況であなたにもたらすのは、高速レーンではなく、コントロールです。プロバイダーの定価はマークアップされずにそのまま渡されるため、OpenAI の料金変更は先方に反映されたその日にこちら側にも反映されます。また、標準の Astra レーンがすでにあるため、この決定を決着させる実験は 1 行の設定です。同じプロンプト、標準ティア、そしてその横に安価なモデルを、同じキーで。それはほとんどのチームが実行するであろうレイテンシー ベンチマークに最も近いものであり、セットアップに費用はかかりません。

何がまだ測定されていないのか
今日、確認できることは3つある。そのティアは存在し、料金表では標準料金のちょうど6倍に設定されており、10月1日時点でNVIDIA Blackwell GPUsに公に帰属されている。
1つだけ、そうではないものがある。あなたのトラフィックに掛かる倍率だ。どのベンダーも、明示された同時実行レベルにおけるそのティアのレイテンシ分布を公開しておらず、第三者も8倍を再現していない。Ultrafast上のAstraと標準のAstraを比較したベンチマークも存在せず、都合のよいベンチマークなどあるべきでもない——それはより高速な経路上の同じチェックポイントであり、同じ設定なら速度が異なっても同じ回答が得られるはずだ。同じプロンプトで2つのレーンが異なる挙動を示すなら、それは機能ではなくバグ報告だ。
つまり、10月1日についての有益な要約は、発表を読んだ印象よりも小さい。同じティア、同じ価格、同じ未検証の速度上限のままで、今はハードウェアのラベルを身にまとっている。そのラベルは重要だ。OpenAIがこれをどのアクセラレータ系製品ラインでスケールさせているかを教えてくれるし、高速ティアをめぐる話が2か月足らずで専門パートナーから業界最大のGPUサプライヤーへ移ったことも教えてくれる。ただ、あなた自身のレイテンシ予算については何も教えてくれないし、どんな投稿も教えてはくれないだろう。
