生成されたタイトルカードのタイトルは「Step 5 Preview vs Claude Opus 5 — 価格差」。2つの列:Step 5 PreviewはAA Index 44、価格は入力$1.00 / 出力$2.70、インデックス実行コスト$922.84、出力速度99.8トークン/秒;Claude Opus 5はAA Index 51、価格は入力$5.00 / 出力$25.00、インデックス実行コスト$7,274.74、出力速度55.3トークン/秒。フッターには「7つのインデックスポイントに対して7.9倍のコスト。どちらも最大推論努力時のArtificial Analysis Intelligence Index v4.3.2によるもの。」と表示。
Guides & Insights

Step 5 Preview vs Claude Opus 5:7倍の請求に対する7つのインデックスポイント

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

StepFunのStep 5 Preview発表資料は、冒頭で一つの比較的主張を掲げている。それで単一のタスクを実行するコストは、同じタスクをClaude Opus 5で実行する場合の8分の1だという。両モデルは今や同じ独立系ボード上に並んでいるので、その主張は議論の種ではなく検証可能なものになった。Artificial Analysisは両モデルをIntelligence Index v4.3.2——10項目の評価——でそれぞれ実行し、各実行にかかったコストを公表した。Claude Opus 5は自身の最大推論エフォート設定でスコアリングされている。Step 5 Preview:インデックス44、実行完了までに922.84ドル。Claude Opus 5:インデックス51、7,274.74ドル。これは7ポイントのスコアのために7.9倍の金額であり、StepFunが引用した比率の方が正確だったことがわかる。この比率が隠しているものこそが興味深い。なぜなら、その差は主に価格の差ではないからだ。それは価格差の衣をまとった冗長性の差であり、この二つを切り分けると、どのモデルをどのワークロードの前に置くべきかが変わる。

2つの実行コスト、1枚のボード、そしてその実際の中身

総実行コストは、ここで利用できる最もクリーンな単一の比較です。なぜなら、両モデルが同じハーネスの下で同じ質問に回答しており、どちらのベンダーもその数値を算出していないからです。また、それは最も誤読されやすい数値でもあるため、詳しく掘り下げる価値があります。

• インデックススコア — Step 5 Preview 44 対 Claude Opus 5 51、Claude Opus 5 は推論エフォートを最大に設定してスコアを記録

• インデックスを完成させるための総コスト — Step 5 Preview $922.84 対 Claude Opus 5 $7,274.74

• 7:2:1のキャッシュヒット/入力/出力ミックスにおける混合価格 — Step 5 Previewは100万トークンあたり$0.51、Claude Opus 5は$3.85

• インデックス実行中に生成された出力トークン — Step 5 Preview 160M 対 Claude Opus 5 140M

• 定価 — Step 5 Preview $1.00 入力 / $2.70 出力 対 Claude Opus 5 $5.00 入力 / $25.00 出力

3行目と5行目を一緒に見ると、計算はもはや単純な価格比較ではなくなる。Step 5 Previewのブレンド料金は7.5倍安く、リスト料金は入力で5倍、出力で9.3倍安い——つまりブレンドは、入力価格が果たしていない役割を担っている。これはブレンドが出力に重み付けされているためで、出力こそ2つのモデルが最も大きく乖離する点だからだ。Claude Opus 5はStep 5 Previewの出力料金の9.3倍を請求しており、両モデルとも大量に生成する。Claude Opus 5の出力トークンは1億4000万で、これはインデックスが採点するモデル全体の中央値9200万に対してであり、Step 5 Previewは同じ中央値9200万に対して1億6000万だ。

したがって、正直な解釈は「安価なモデルはお買い得だ」よりも狭い。Step 5 Preview はあらゆる軸で安く、しかも倹約的なモデルではない——比較対象の中央値モデルより74%多く出力を書き、それはまさに価格が罰するはずの行動である。Claude Opus 5 は中央値より52%多く書き、それら各トークンに対して9.3倍の料金を課す。出力長を制約する呼び出し元は、そうしない呼び出し元とは異なる比率を得る。

問題はどちらがより優れているかではない。分岐点がどこにあるかだ

仮にインデックスが、あなたが実際に投げかける作業——長期的視野のエージェント型タスク、コード、多段階のツール使用——の妥当な代理指標だとしよう。すると、逆転点は簡単に言える。Claude Opus 5 は、その請求額に見合うためには、タスクあたり少なくとも7.9倍有用でなければならない。そしてインデックス上では、100点満点で7点優れている。この2つの事実は同じ方向を指す必要はない。7点のインデックス差は、あらゆる面で16%優れているという意味ではないからだ。それは10個の評価を集約したものであり、総計よりも構成のほうが重要だ。

それが、大見出しの数字ではなく、2つのスコアの形状を気にかけるべきだという主張だ。Step 5 PreviewのTerminal-Bench 4.0の数値は33.3%——DeepSeek V4.1 Flashの26.8%を上回る、真にエージェント的な結果だ——しかし、公表されている記録の中には、Anthropicのモデルが最も得意とする長期的視野の評価で、これがClaude Opus 5に匹敵することをまだ示すものは何もない。StepFun自身の資料も、その言い回しでこの点を認めている。ALE-CLI、FrontierFinance、DRACOでは、同社はStep 5 Previewを2位に置いており、GPT-6 AstraまたはClaude Opus 5のいずれかの後ろにあり、比較対象の他のオープンモデルより前にある。5分の1の価格で2位というのは、間違いなく良い結果だ。だがそれは1位ではない。そしてモデルが2位で終わるタスクは、たいてい1位を必要としていたタスクなのだ。

もう一つの非対称性は、誤った判断が下されたときに何が起こるかにある。4秒と2,000トークンで済んだ安価なモデルからの誤答で失うのは、リトライ分だけだ。100万出力トークンあたり25ドルのClaude Opus 5からの同じ誤答なら、失うのはリトライに加えて熟考の分でもある。パイプラインが失敗時にリトライするなら——ほとんどのエージェントループはそうしている——成功したタスクあたりの実効コストこそが重要な数字であり、それは定価と同じ比率にはならない。なぜなら、二つのモデルは同じ割合で失敗するわけではないからだ。Step 5 Previewについて、その数字を公表した者はまだいない。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

仕様の対比、次元ごとに

・インデックススコア — Step 5 Preview 44 対 Claude Opus 5 51、いずれも Intelligence Index v4.3.2 上、Claude Opus 5 は最大推論エフォート設定

• 100万トークンあたりの料金 — Step 5 Preview 入力$1.00 / 出力$2.70 対 Claude Opus 5 入力$5.00 / 出力$25.00

• キャッシュ割引 — Step 5 Preview 95% vs Claude Opus 5 90%

• コンテキスト — いずれも100万トークン。StepFunは出力上限を公表しておらず、Anthropicの上限は128K

• 入力 — どちらもテキストと画像を受け付けますが、出力はテキストのみです

• 出力速度 — Step 5 Preview 99.8トークン/秒 対 Claude Opus 5 55.3トークン/秒

• コントロールサーフェス — Step 5 Previewは拡張思考を公開。Claude Opus 5はtemperatureとtop_pを適応型推論エフォートダイヤルに置き換える

• 重み — Step 5 Preview は本日クローズ、BF16 チェックポイントは10月15日を予定、Claude Opus 5 は全編プロプライエタリ

• 独立した証拠 — どちらも Artificial Analysis によってスコアリングされている;StepFun のエージェント型ベンチマーク行はベンダー実施であり、再現されていない

2行には注記しておく価値がある。速度差は実在し、実際には表が示唆するより大きい。99.8トークン/秒 対 55.3 は、同じ出力を約2倍速く完了するモデルであり、同じボード上での Step 5 Preview の初回トークンまでの時間 2.96秒 対 Claude Opus 5 の 56.84秒 は、別次元のことだ。ただし、その2番目の数値は、モデルが何も出力する前に熟考する max-effort reasoning 構成を測定している。これは本番呼び出しが目にするレイテンシではない。標準エンドポイントに対して、当社自身のカタログは Claude Opus 5 の初回トークンまでの p50 時間を 6.73秒 と報告しており、最大限の熟考を意図的に求めていないのであれば、これが計画の基準にすべき数値だ。

キャッシュ割引の行は、繰り返し発生するワークロードを静かに左右する行であり、Step 5 Previewに有利で、95%対90%となっています。呼び出しのたびに同じシステムプロンプトとリポジトリコンテキストを再送信するエージェントループは、ほぼ完全にその割引に依存しているため、5ポイントの差が長いセッション全体で積み重なって大きくなります。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Claude Opus 5が依然として唯一の答えとなる場面

これまでの内容は Anthropic のモデルに反論するものではない。コストがかかるのは、この指標が測ろうとしていることを実際に成し遂げており、しかもボードのほぼ最上位でそれをやっているからだ — Intelligence Index v4.3.2 で 51、Step 5 Preview を 7 ポイント上回り、現行世代のトップ集団にも手が届く位置にある。集計上の 7 ポイント差が実際の違いを過小評価するようなワークロードとは、2 番手の答えを許容できないものだ。たとえば、数時間に及ぶリファクタリングで、失敗モードが微妙な挙動変化である場合、推論チェーンを監査可能にしなければならない財務モデル、誤った判断が 1 週間後に発覚する移行。そうした場面では、リトライは安上がりではなく、熟考そのものが成果物なのだ。

ギャップが問題にならないワークロードとは、多くの小さな判断から組み立てられるものだ。分類やルーティングのステップ、抽出、要約、テストの足場、そしてエージェントが、本当に重要な2回の呼び出しの間に挟む千回もの呼び出し。そうした場面では、44のモデルが半分の時間で、入力価格5分の1で答えることは妥協ではない。それが正しいデフォルトであり、高価なモデルは、確実に正しくなければならないステップのために取っておけばいい。

2つの統合を実行せずにスプリットを実行する

この比較の実用的な形は段階的なパイプラインであり、チームがそれを作らない理由はエンジニアリングではなく調達にある——2つのベンダー、2つの契約、2つのSDK、ローテーションすべき2つのキー。Claude Opus 5は当社のカタログに$5.00と$25.00で掲載されており、その前段に置く安価なテキストモデルも同じカタログにあり、プロバイダーの定価を0%のマークアップでそのまま適用した200以上のモデルを1つのキーの背後で利用できる。Step 5 Previewはそのリストには含まれていない——StepFun独自のAPI上で動作し、重みが公開されるまではそこが唯一の実行場所だ。当社が実際にルーティングするモデル群にまたがってこの階層化を組み立てるのは、コード変更ではなくルーティングDSLの式だ——定型的な呼び出しは小型モデルに送り、信頼度や複雑さの条件で高価なモデルへエスカレートし、両方の経路を同じエンドポイントの背後に保つ。

自動フェイルオーバーは、ここでは汎用的な機能としてではなく、ある特定の理由から重要です。Step 5 Preview は発表当日に API を公開しましたが、公開された重みも、開示されたサービングフリートもありませんでした。これは登場から数日しか経っていないプレビューエンドポイントであり、プレビューエンドポイントは成熟したものとは異なる形で容量が制約されます。Claude Opus 5 は多くの独立したプロバイダーによって提供されており、それがプレビューには提供できない冗長性です。実績のあるモデルをフォールバックの経路として維持すること――私たちの側では、それはプレビューではなくカタログにある本番モデルを意味します――が、本番経路をまだ規模を調整中のフリートに依存させることなく、自社のワークロードで真の品質シグナルを得る方法です。

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

決定規則

ワークロードがごく少数の非常に難しいタスクで構成されているなら、Claude Opus 5 は高価な選択肢ではありません — 安い選択肢です。なぜなら、次善の回答にはその差額以上のコストがかかるからです。ワークロードが多数の普通のタスクで、その中に少数の難しいタスクが含まれているなら、$1.00 と $2.70、95% のキャッシュ割引を伴う Step 5 Preview のほうが適切なデフォルトであり、7ポイントの差は、それを必要としなかった作業にとってはほとんど丸め誤差にすぎません。

その計算を変えるのは、失敗率と長期的なエージェント型項目に関する独立した証拠だ。StepFun自身の数値では、モデルはローンチの中心に据えた評価で2位だが、第三者による再現はない。10月15日のチェックポイントでは2点に注目してほしい。ライセンスが、自社データで7ポイントの差を埋められるファインチューニングを許可しているかどうか、そしてpreviewの接尾辞が外れた後も冗長さが保たれるかどうかだ。前者は比率を変えるだろう。後者はすでに一度それを動かした。