生成されたタイトルカードは「Step 5 Preview vs GPT-6 Astra — 10倍の価格」。2列構成で、Step 5 Preview は AA Index 44、合計600B/アクティブ27B、価格 $1.00 / $2.70、ブレンド $0.51、99.8トークン/秒;GPT-6 Astra は AA Index 53、価格 $10.00 / $50.00、ブレンド $7.70、59.3トークン/秒。フッターには「数値はいずれも Artificial Analysis Intelligence Index によるもの;Astra の価格は入力トークン272K超で $20 / $75 に上がる」と表示される。
Guides & Insights

Step 5 Preview 対 GPT-6 Astra:入力価格10倍でインデックス9ポイント

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

これら2つのモデルは17日違いで発表され、まったく別の惑星向けの価格設定がなされていた。Step 5 Previewは、StepFunが2026年9月20日に発表した600Bパラメータのスパースな専門家混合(MoE)モデルで、入力トークン100万あたり1.00ドル、出力トークン100万あたり2.70ドルを課す。GPT-6 Astraは、同社が2026年9月3日にリリースしたフラッグシップモデルで、入力トークン272K未満のしきい値では同じ単位に対して10.00ドルと50.00ドル、それを超えると20.00ドルと75.00ドルを課す。これは、独立系のIntelligence Indexで9点高い(53対44)モデルに対して、入力価格が10倍、出力価格がおよそ18倍ということだ。Astraのほうが優れているかどうかは問題ではない。あなたのワークロードにおいて、出力トークン100万あたり30ドルの追加費用がその差に見合うかどうかが問題であり、その答えは本稿を読み進める途中で2度変わる。

各モデルの用途

Step 5 Previewはエージェント型業務のために作られ、販売されている:AIコーディング、ソフトウェアエンジニアリング、プロフェッショナルなナレッジワーク、金融。アーキテクチャはそれに合わせて調整されている — 総パラメータ600B、トークンあたり約27Bがアクティブ、100万トークンのコンテキスト、テキストと画像の入力、そして拡張思考を伴う推論。StepFunはここに至るまでStep 4.x系を丸ごと飛ばし、Step-3.7-FlashからStep 5へ直接移行した。

GPT-6 Astra は OpenAI の汎用フラッグシップです。100万トークンのコンテキスト、最大128Kの出力トークン、入力はテキスト・画像・ファイル、出力はテキスト、知識カットオフは2026年4月30日、そして推論・コーディング・エージェント型ワークフローをサポートします。正確な答えが求められ、トークン費用が制約条件にならない場面で企業が頼るモデルです。

• Intelligence Index — Step 5 Preview 44 対 GPT-6 Astra 53

• パラメータ — Step 5 Preview は総計600B / アクティブ27B、GPT-6 Astra は非公開

• コンテキストと出力上限 — どちらも100万トークンのコンテキスト。Astraは1,050,000トークンのコンテキストウィンドウと128Kの出力上限を記載しており、StepFunは出力上限を公表していない

• 入力モダリティ — テキストと画像 vs テキスト、画像、ファイル

• 出力速度 — Step 5 Preview 99.8 トークン/秒 対 GPT-6 Astra 59.3 トークン/秒

• 100万トークンあたりの料金 — 入力$1.00 / 出力$2.70 に対し、272K入力以下では入力$10.00 / 出力$50.00、それを超えると$20.00 / $75.00に上昇

• キャッシュ — Step 5 Preview は95%割引、GPT-6 Astra は90%の読み取り割引と100万あたり$12.50のキャッシュ書き込み料金

• Intelligence Indexタスクあたりのコスト — Step 5 Preview $0.71 対 GPT-6 Astra $3.26

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GPT-6 Astra — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71 and output speed 99.8 tokens/sec. The right column gives GPT-6 Astra the rows AA Index 53, parameters undisclosed, price $10.00 / $50.00, cache discount 90%, cost per index task $3.26 and output speed 59.3 tokens/sec. A footer reads 'Both figures per Artificial Analysis Intelligence Index; Astra pricing rises to $20 / $75 above 272K input tokens.'

請求書を、1行ずつ

Step 5 Previewの価格設定は一律で安価だ。入力$1.00、出力$2.70で、95%のキャッシュ割引により、キャッシュ済み入力は100万トークンあたり約$0.05になる。キャッシュヒット、入力、出力が7:2:1の混合 — このブログがエージェントトラフィックに用いる慣例 — では、混合レートは100万トークンあたり約$0.51となり、Intelligence Indexタスクあたりのコストは$0.71で、200中27位となる。注意点は冗長性だ。このモデルはそのIndexで1億6000万の出力トークンを生成し、中央値は9200万だった。そのため、生のトークン数は表示価格が示唆する値を上回る。

GPT-6 Astraの価格は段階制で、注意深く読む価値があるのはその段階の部分です。リクエストあたりの入力トークン数が272K未満なら$10.00と$50.00、それを超えると$20.00と$75.00です。段階は各リクエスト自身の入力トークン数によって選ばれます。これは、1Mトークンコンテキストを売りにするモデルにとって、聞こえ以上に重要です——大規模コンテキストの1回の呼び出しが境界を越えると、リクエスト全体の料金が倍になります。キャッシュ読み取りは100万あたり$1.00で90%割引、キャッシュ書き込みは100万あたり$12.50です。同じ7:2:1の構成では、混合レートは100万トークンあたり約$7.70になり、Indexタスクあたりのコストは$3.26で、200中71位です。

Astraは冗長性の面では逆方向に働き、ここでは簡潔なモデルだ。Indexでの出力トークン数は6,000万で、Step 5 Previewの1億6,000万に対してであり、その指標では200台中27位だ。より少ないトークンをより高いレートで使うことは、生の倍率が誇張する形で差を狭める。だがその差は埋まらない — タスクあたりコストの数字は冗長性、キャッシュ挙動、価格をすでにまとめて相殺しており、$3.26対$0.71は依然として4.6倍の差である。

9つの指数ポイントが何をもたらすのか

Astraの主要な数値はOpenAI自身によるもので、再現されていない:GPQA Diamondで96.1、OSWorld 2.0で72.6%、FrontierMath Tier 4で97.6%、ツール使用時のHumanity's Last Examで57.2%、Terminal-Bench 4.0で約57.9%。ARC-AGI-3の数値は慎重に扱うべきものだ——OpenAIは自社のプロバイダーアダプターハーネスでは99.9%、標準ハーネスでは62.7%と報告しており、ハーネス間で37ポイントの振れ幅があることは、少なくともモデルについてと同じくらいハーネスについての表明でもある。

Step 5 Previewの公表された数値は、それが作られたエージェントタスクにおいて同じ領域にあり、同じ注意事項を伴う:Terminal-Bench 4.0で33.3%、ProgramBenchで80.5、DeepSWE v1.1で67.7、StepCodeBenchで49.0、すべてStepFunによるもので、独立して再現されたものはない。異なるベンダー、異なるハーネス、共有された実行はない — まさにそのため、独立に測定された9ポイントの差が、これらのいずれよりも有用な数値なのである。

そのギャップは現実であり、小さくもない。200モデルが並ぶボードでは、53と44がそれぞれ3位と24位につけており、その隔たりは同じタスクでのスコア差というより、別の種類のタスクとして現れる。Astraが公表している勝利は、長期的な推論とコンピュータ操作に集中しており、そこはボードの上位が差を広げる領域だ。あなたのワークロードがそこにあるなら、その9ポイントは請求額以上の価値がある。

アストラのスコアに関する注意点が1つある。Artificial AnalysisはIntelligence Indexを改訂しており、同じモデルの数値は数週間隔で取得されたスナップショット間で変動する — 52.8、53、54.7はすべて、同じ月にこのモデルについて公開された資料に登場する。現在のモデルページにある53が使用すべき数値であり、古いAstraのスナップショットを現在のStep 5 Previewの数値と並べて比較するのは、2つの異なる物差しで測っていることになる。

Screenshot of the Artificial Analysis model page for GPT-6 Astra, showing OpenAI as the creator with a September 2026 release date, an Intelligence Index of 53 at rank 3 of 200, output speed 59.3 tokens per second at rank 101 of 200, cost per Intelligence Index task $3.26 at rank 71 of 200, verbosity 60M output tokens at rank 27 of 200, pricing of $10.00 per million input tokens and $50.00 per million output tokens with a 90% cache discount, and technical specifications listing reasoning, text and image input, a 1M-token context window and an April 30, 2026 knowledge cutoff.

速度とレイテンシは別の問題です

生成速度について、独立系のリーダーボードは明確だ。Step 5 Preview は毎秒99.8出力トークン、GPT-6 Astra は59.3で、これは測定対象モデル全体の平均である毎秒70トークンよりも遅い。インタラクティブなコーディングループにおいて、これは提案が即座に返るか、待たされるかの違いであり、キャッシュ割引がそうであるように、セッション全体で積み重なっていく。

レイテンシはより複雑な話であり、単一の数値では誤解を招く。Astra は出力する前に推論をルーティングするため、最初のトークンまでの時間と実用的な回答までの時間は同じ測定ではなく、公表されている数値は推論をカウントするかどうかによって大きくばらつく。過去7日間の当社自身のトラフィックでは、GPT-6 Astra の最初のトークンまでの時間の中央値は 6.72 秒、95パーセンタイルは 10.00 秒である — これは呼び出し元が当社のエンドポイントを通じて実際に体感する数値だ。Artificial Analysis は、独自のハーネス上で Step 5 Preview の最初のトークンまでの時間を 2.96 秒としているが、これら2つの数値は同じ方法で測定されたものではないため、互いに差し引くべきではない。

キャッシュの非対称性が実際にどこに帰着するのか

両モデルとも繰り返されるプレフィックスを大幅に割引し、両方ともそれを書き込む分を課金しており、両者の差は読み取りで20倍です。Step 5 Preview の95%のキャッシュ割引により、キャッシュされた入力は100万トークンあたり約$0.05になります。GPT-6 Astra はキャッシュを100万トークンあたり$1.00で読み取り—10倍高い基本料金からの90%割引—そして100万トークンあたり$12.50で書き込みます。

同じシステムプロンプトとリポジトリのコンテキストを毎ターン再送信するエージェントループでは、複利的に効いてくるのは読み取りレートであり、安価なモデルにおけるより大きな割引は、高価なモデルにおけるより小さな割引よりも価値がある。同じ 7:2:1 の配合では、Astra のブレンドは依然として 100 万トークンあたり約 $7.70 に落ち着き、Step 5 Preview の $0.51 と対照的だ——長いセッションでも縮まらず、むしろ広がる 15 倍の差である。

1つのキーから両方を実行

GPT-6 AstraがOrcaRouterで公開されました、モデルIDopenai/gpt-6-astraとして、OpenAIの定価 — 272Kの閾値未満では100万トークンあたり$10.00と$50.00、閾値以上では$20.00と$75.00 — でマークアップなしでそのまま提供されるため、ベンダーの価格変更は次回の請求サイクルではなく当日中に当社側で反映されます。当社独自のこのエンドポイントに関する7日間のテレメトリでは、上記の最初のトークンまでの時間の中央値6.72秒、95パーセンタイル10.00秒が示されており、さらに過去1週間で277.9Mトークンのトラフィックがこのエンドポイントを通過しています。

Step 5 Previewは当社のカタログにはなく、当社がルーティングすることもありません。それはStepFun自身のAPIとStudio上で動作し、10月15日のチェックポイントが登場するまで、そこでしか動作しません。この非対称性はこの比較の欠陥ではありません。それこそが比較そのものです。この対決の安い側の半分は、呼び出すためにわざわざ他所へ行かねばならない半分であり、今日から本番環境に投入できる半分は200以上のモデルを1つのAPIの背後に収められています:GPT-6 Astraは上記の料金で、GLM-5.3は$1.26と$3.96、DeepSeek V4 ProClaude Opus 5、そしてその他もろもろ、プロバイダーをまたぐ自動フェイルオーバーがプロバイダーのキャパシティが変動しても経路を安定に保ち、ルーティングDSLを使えばタスクを安く始めて必要なときだけエスカレートさせられます。そのエスカレーションルールこそが、10倍の価格差に対する本当の答えです。ワークロードの大半は最高峰を必要としませんし、ルーティング層とは、必要としない部分に支払い続けるのをやめるための仕組みなのです。

Screenshot of the OrcaRouter model page for GPT-6 Astra at www.orcarouter.ai/models/openai/gpt-6-astra, showing the model id openai/gpt-6-astra with NEW, FLAGSHIP and FEATURED badges, a 1M-token context and 128K max output, text, image and file input with text output, best-for tags for reasoning, coding and agentic work, input pricing of $10.00 and output pricing of $50.00 per million tokens, a seven-day median time to first token of 6.72 seconds and a 95th percentile of 10.00 seconds, 277.9M tokens of seven-day traffic, and the chat-completions and responses endpoints behind the OrcaRouter API.

誰がどれを選ぶべきか

ワークロードが、難しいタスクを確実に成し遂げなければならない長期的なエージェントであるなら — コンピュータ操作、多段階のリサーチ、誤った回答のコストがトークン代を上回る作業 — GPT-6 Astraの9ポイントのリードは、その判断の中で最も安価な部分にすぎず、請求書こそがその能力にかかるコストそのものだ。デフォルトではなくエスカレーション先として実行し、272Kのしきい値に注意せよ。たった1件の過大なリクエストで、その中身すべてのレートが2倍になる。

ワークロードが大量のエージェント型テキスト——コード生成、リファクタリング、構造化抽出、コーディングアシスタントの中核ループ——であるなら、Step 5 Preview は請求書と時計が気にするあらゆる点で優位に立ち、9インデックスポイントは、ボードの最上位に位置しないタスク分布に触れれば、おそらく持ちこたえられない。問題は性能ではない。このモデルはプロプライエタリで、公開ライセンスも、商用利用の許諾も、10月15日までのチェックポイントもない。呼び出すことはできるが、所有することも、ファインチューニングすることも、その派生を出荷することもできない。

答えが明白でないなら、それは選択ではなくティア分割というパターンだ。一般的なトラフィックは中間ティアのモデルにルーティングし、Astra はボードの最上位を必要とするリクエストのために取っておく——そのルールの両端は、こちら側では1つのキーの背後にあるので、この分割に必要なのは2つ目の契約ではなく1つのルーティングルールだ。中間ティアのモデルが正しく仕上げられる仕事にフラッグシップの料金を払うことこそ、この比較が本当に扱っている誤りだ。