Step 5 Preview 用に生成されたタイトルカードは「Step 5 Preview — the leak so far」と表示され、6つの仕様をラベルと値の行として列挙している。総パラメータ数は約 600B、推論あたりのアクティベーションは約 27B、入力はテキストと画像、コンテキストウィンドウは 1M トークン、AA Intelligence Index は 44、価格は 1M トークンあたり入力 $1.00、出力 $2.70。フッターには「All figures third-party and unaudited - StepFun has not announced this model.」と記されている。OrcaRouter のロゴは右下隅に配置されている。
Guides & Insights

ステップ5プレビュー:StepFunの未発表600Bフラッグシップはすでにリーダーボードに載っている

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Step 5 Previewにはリーダーボードの順位があり、価格も公開され、出力速度も計測され、Intelligence Index スコアは44——Kimi K3と同じスコアで、それはおよそ5倍の規模のモデルだ。ただ、持っていないものがある。ローンチだ。StepFun はこれを発表しておらず、StepFun 自身のプラットフォームのドキュメントにも記載がなく、ダウンロードできる重みも存在しない。以下のすべての数値は、ベンダーが公に何も語る前にアクセスを得た第三者から出たものであり、そのためこれはレビューではなく、現時点で分かっていることをまとめた記事だ。数字は、これから来るものの証拠として読み、スペックシートとして読まないでほしい。

漏洩こそがニュースだ

Step 5 Previewの最初の公開痕跡は、評価実行です。Artificial Analysisにはこのモデルのライブモデルページがあり、StepFun自身のAPIを通じてテストタグstep-5-preview-bの下でスコアリングされており、プラットフォームはこのモデルを2026年9月18日付としています。この記事にある44、価格設定、速度測定、ベンチマークの行は、すべてそのページが出典です。

それに対して、ベンダー側は空白だ。StepFunの開発者向けドキュメントには Step 3.7 Flash と Step 3.5 Flash までのモデルが掲載されているだけで、そこで止まっている — step-5はなく、プレビュー項目もない。stepfun-aiのHugging Face組織にはStep 5のリポジトリがなく、これは見落としというより、クローズドウェイトのフラッグシップであることと整合する。中国の開発者フォーラムにおけるコミュニティの報告によれば、9月19日に上海で開催されるAGI Frontierイベントで公開される可能性が指摘されており、それは評価結果が表面化してからおよそ1日後のことになる。執筆時点で、StepFun以外に、出荷版の公式仕様、公式価格、公式名称を持つ者はいない。

この命名自体が、これが正式リリースではなくプレビューであることを示す最初の手がかりだ。StepFunはStep 4.x系を完全に飛ばしてStep 5へと進んだ。Previewという接尾辞でリリースされたモデルは、製品ページが存在する前にベンチマークが取られた段階のものであり、ベンダーがまだ調整中のモデルだ——価格、ルーティング、制限はすべて、一般提供の前に動きうる。

誰に分かる限りでは、仕様がどのようなものか

これらは出回っている数字であり、リークの中で最も繰り返されている主張だ——それは、最も確認されている主張と同じではない:

• 総パラメータ数 — 約600B、Kimi K3のおよそ2.8Tに対して

• 推論ごとに活性化 — 約27B、全体のおよそ4.5%、異例なほどスパースな Mixture-of-Experts 比率

• 入力モダリティ — テキストと画像、出力はテキストのみ

• 推論 — はい、拡張思考あり

・コンテキストウィンドウ — Artificial Analysisでは100万トークン。開発者ツールで出回っている別のサードパーティ構成では、350,000、最大出力64,000と記載されている

• 重みの入手可否 — 非公開、リポジトリなし

そのコンテキストウィンドウの矛盾は率直に指摘する価値がある。なぜなら、それは誰によっても解決されていないからだ。1Mトークンのウィンドウと350kトークンのウィンドウは、メモリコストの異なる別製品であり、後者の数字には64kの出力上限が伴うが、前者はそれについて何も述べていない。1Mという数字を頼りに長文ドキュメントのパイプラインを計画しているなら、350k構成こそが、ベンダーのページを待つべき理由である。パラメータ数にも同様の不確かさがある。DataLearnerのトラッカーは依然として、Step 5 PreviewのMoEアーキテクチャとパラメータ数を利用不可として記録している。つまり、このモデルについて最も頻繁に引用される単一の事実である600B/27Bという組み合わせも、公式に最も確認されていないものの一つである。

興味深い数字は27Bであり、600Bではない

スパースなMixture-of-Expertsモデルは、トークンが実際にルーティングされるエキスパートにのみ計算を費やすため、本番環境でのモデルの挙動を左右するのはアクティブなパラメータ数です。Step 5 Previewは、アクティブが約27Bで、トークンあたりの処理量は自身の何分の一かの規模のモデルと同程度のレンジにあり、一方、総計600Bは主にメモリフットプリントの問題です。

2つの帰結が続き、どちらも第三者による測定に現れている。提供コストは活性化パラメータ数に連動しており、価格がこの水準にある理由の一部でもある。また、トークンあたりの速度にも利点がある。Artificial Analysisの測定では毎秒99.8出力トークンで、200モデル中42位、中央値は64.6だ。初回トークンまでの時間は2.96秒で、中央値は約3.57秒となる。600B/27Bの分割が正確なら、これはホストするのが安いのではなく、提供するのが安いように設計されたモデルだ——トークンではなくGPUにお金を払う側なら、これは重要な違いである。

Intelligence Indexでどこに位置するか

Artificial Analysisは、Step 5 PreviewをIntelligence Index v4.3で44と採点している。この指数は10種類の評価を組み込んでいる。これはボード上の200モデル中25位であり、指数が採点するモデルの中央値である25を大きく上回っている。

• Intelligence Index — Step 5 Preview 44 対 Kimi K3 44

• すぐ上 — GLM-5.3Claude Opus 5、どちらも45

• すぐ下 — DeepSeek V4.1 Flashが40、DeepSeek V4 Proが36

• Terminal-Bench 4.0 — Step 5 Preview が 33.3% であるのに対し、Kimi K3 は約 12.6%、DeepSeek V4.1 Flash は 26.8%

• SciCode — Step 5 Previewで59%、Kimi K3と同等

• 出力速度 — 毎秒99.8トークン、同分野の中央値は64.6

見出しを飾るのはKimi K3との同点であり、率直に読み解けば、その意味は見出しが示唆するより狭い。総計600Bで2.8Tパラメータのモデルに総合指標で並ぶのは、確かな効率性の成果だが、その総合値は内訳の形を覆い隠している。Terminal-Bench 4.0でStep 5 Previewが優位に立つ差は劇的であり、一方でSciCodeの結果は完全な互角だ。ある指標における総合的な同等性は、すべての面での同等性ではない。しかもプレビュービルドは、その差が保たれると想定するには最も信頼できないタイミングだ。

さらに一つ、指摘しておく価値のある食い違いがある。Artificial Analysisは44と報告しているが、DataLearnerの独立系トラッカーは同じ実行を43.6と記録している。これは能力についての意見の相違というより丸めの差だが、このモデルの数字全般についての要点を際立たせる類のものだ——それらは未発表モデルに対する第三者による読み取りであり、わずかに異なる時点で取得されたもので、StepFunによって確認されたものは一つもない。これらのベンチマークはどれもベンダー報告ではない。これは諸刃の剣で、StepFunの誰もここで数字を主張しておらず、StepFunの誰も数字を支持しているわけでもない。

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

価格、そしてそれを蝕む冗長さ

価格設定は、このリークの中で最も早く予算に影響を与える部分です。StepFunのAPIを通じて、Artificial Analysisは次のように記録しています:

• 入力 — 100万トークンあたり$1.00、同等モデルの中央値$1.88に対して

• 出力 — 100万トークンあたり$2.70、中央値$10.00に対して

• キャッシュ — 95%のキャッシュ割引により、キャッシュヒットは100万トークンあたりおよそ$0.05になります

• ブレンド — キャッシュヒット対入力対出力の7:2:1の比率で、100万トークンあたり約$0.51

• Intelligence Indexタスクあたりのコスト — $0.71

• 完全なインデックス実行のコスト — 合計$918.34

$2.70での出力が最も重要な項目です。なぜならそれは、同じ100万トークンに対してKimi K3が$15.00で請求する額の5分の1未満だからです。しかし、トークン単位の比較では隠れてしまう落とし穴が1つあり、Artificial Analysisはそれを直接測定しています。それが冗長性です。Step 5 PreviewはIntelligence Indexを完了するために160Mの出力トークンを生成しましたが、これは同分野の中央値90Mに対してであり、その指標では200中65位です。

計算してみよう。100万トークンあたり$2.70なら、160M出力トークンは約$432——インデックス実行全体の総コスト$918.34のほぼ半分で、タスクではなくモデル自身の冗長さに費やされたものだ。同じ160MトークンをKimi K3の$15.00の出力レートで処理すると$2,400になり、ここに価格優位性の源がある。だが実用的な警告は、別のモデルからトークン数をそのまま流用してコストを見積もる人に向けたものだ。Step 5 Previewは中央値の約1.8倍を書き出すため、出力の多いワークロードでは、より安いレートとより多くのトークンを同時に買うことになる。割引は依然として効いているが、$1.00/$2.70 対 $3.00/$15.00 が見せるほど大きなものではなく、その大きさはプロンプトがモデルをどれだけおしゃべりにするかに完全に依存する。

95%のキャッシュ割引はもう一つのレバーであり、異常なほど積極的です。プロンプトの再利用が多いワークロード——長いシステムプロンプト、固定されたドキュメント、共有コードベース——では、$1.00の入力レートよりも、ブレンドされた$0.51にはるかに近い値になります。このブレンド数値は7:2:1の比率を前提としており、これは保証ではなくモデリング上の仮定ですが、自分のトラフィックに対して計算するには適切な形の算術です。

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

早期テスターが直面していること

これらはリーク前後の数日間における開発者フォーラムやSNS投稿からの個別の報告であり、測定値ではないため、それに応じて重み付けされるべきである:

• ツール呼び出しが最もよくある不満です — 誤ったツール名が選択され、対象ファイルを先に読むことなく編集が試みられます

• 約340,000トークンのコンテキストを超えると報告されるエラー。これは、1Mウィンドウが実際の数値であることが判明した場合に注視すべき障害モードです。

• 一部のプロンプトでコンテンツフィルタリングにより出力が切り詰められる

• 能力に関する評価は分かれている。一部のテスターはGLM-5.3 Flashより上と評価し、他のテスターはDeepSeek V4.1 Flashより下に位置づけている

未リリースのプレビュービルドがツール使用で失敗するのはスキャンダルではない——プレビューというラベルはまさにそのためにある。しかし、だからといって44をエージェントの信頼性に関する約束として受け取るべきではない。Intelligence Indexは、初期テスターが最も不満を述べている当のものをテストしていないからだ。

実際には何と呼ぶのか — そしてそれまでの間は何を使えばよいか

OrcaRouter は Step 5 Preview をルーティングしません。公開エンドポイントも重みも存在しないため、ルーティングするものは何もなく、サードパーティのプラットフォームがそれ以外のことを正直に主張することは、まだできません。今日どこで呼び出せるかを教えてくれる人は、製品ではなく評価用エンドポイントについて説明しているのです。

比較対象となっているモデルはまた別の話だ。Kimi K3、GLM-5.3、DeepSeek V4.1 Flash はいずれも OrcaRouter 経由で利用でき、15 社のプロバイダーによる 199 モデルと並んで、1 つの API キーと 1 つの請求書でまとめて使える。価格はプロバイダーの定価のままマークアップ 0% でパススルーされており、この種のモデルではそれが通常以上に重要になる。Step 5 Preview の $1.00/$2.70 が提供開始時に据え置かれ、その後変動したとしても、パススルーの経路なら他社の価格改定スケジュールを待たずにその日のうちに追随するからだ。

呼び出し可能になったとき、未リリースに近いモデルを実行する賢明な方法は、まだ信頼していないモデルを実行するのと同じやり方だ。つまり、自動フェイルオーバーを備えたルートの背後に置き、ツール呼び出しの失敗や長いコンテキストのエラーが、アプリケーションを道連れにするのではなく、正常に動作するモデルへフォールバックするようにする。初期の報告がここで特に主張しているのはまさにそのパターンである。ツール呼び出しの問題や長いコンテキストのエラーが報告されているプレビュービルドは、まさにフォールバックを背後に置きたいモデルであって、単独で本番パスに置きたいモデルではない。

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

何があればこれはリークではなくリリースになるのか

注目すべき3つの点を、決着をつける度合いが大きい順に挙げる。第一に、StepFun自身の開発者プラットフォーム上のモデルページと価格設定だ。step-5がモデル一覧に現れた瞬間、ベンダーの仕様書が本記事のあらゆる第三者の読み方を置き換える。600B/27Bの組み合わせや1Mコンテキストの主張も含めて。第二に、1M対350kのコンテキスト矛盾の決着だ。1Mのウィンドウに対して64kの出力上限というのは、長文書やエージェント型パイプラインを構築する者にとって意味のある違いであり、現時点では未解決である。第三に、その価格設定がローンチ時の姿勢なのか恒久的なラインなのか。中国のフラッグシップモデルのプレビュー価格は、容量が逼迫すると動くという前例があり、出力100万トークンあたり2.70ドルは、その疑問を招くのに十分なほど強気である。

少なくともそれらの最初のものが実現するまでは、正直な要約はこうだ。Step 5 Preview は真に効率的なモデルに見える——総計 600B で 2.8T クラスの集約作業をこなし、価格は業界を数倍下回る——が、未検証の仕様、実際の冗長性コスト、そしてまだ獲得されていないツール呼び出しの評判を抱えている。計画に織り込む価値はある。まだ本番運用の道を賭ける価値はない。

この記事で比較したモデル4

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新