Step 5 Preview vs NVIDIA Nemotron 3 Ultra 550B A55B の生成されたタイトルカードには「20セントで21インデックスポイント」と表示され、3つの統計チップが付いている。Artificial Analysis Intelligence Index は44対23、出力価格は100万トークンあたり$2.70対$2.50、インデックスタスクあたりのコストは$1.03対$0.60。OrcaRouter のロゴは右下の白い帯の中にある。
Guides & Insights

Step 5 Preview 対 Nemotron 3 Ultra:20セントで21インデックスポイント

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

このうち一方のモデルは今日の午後にもダウンロードでき、しかも21ポイント差で負けるのはそちらのほうだ。Step 5 Previewは、StepFunのクローズドなフラッグシップで、2026年9月20日にAPIを公開したが、手元に置けるライセンスファイルは存在しない。NVIDIA Nemotron 3 Ultra 550B A55Bは、2026年6月4日から寛容なライセンスのもと、学習レシピを添えてHugging Faceに公開されている。Artificial Analysis Intelligence Indexでは両者は44対23。出力価格では100万トークンあたり2.70ドル対2.50ドル。20セントのために21ポイント、という比較はどちらの方向にもきれいに決着がつくものではない。だからこそ、見出しの2列を流し読みしてどちらかに肩入れするのではなく、きちんと検証する価値がある。

どちらも今週登場したものではなく、そのことは以下の数値の読み方に影響する。どちらも数か月前から呼び出し可能で、同じ独立系ハーネスを通してきており、対象期間内に料金表の変更もない。変わったのはもっと小さく、より興味深い点だ。両者の評価に使われる指数が9月に再構築され、今では異なる2つの母集団から導かれた2つの異なる中央値と比較されている。この比較の結論は、実にそこで決まる。

大きく異なる2種類の製品

仕様書を横に並べて読んでみると、まず気づくのは、両者がとても同じカテゴリーのものとは言えないということだ。

• パラメータ — Step 5 Preview は、StepFun 自身のドキュメントによると、合計約6000億、トークンあたり270億がアクティブです。Nemotron 3 Ultra は、独立した委員会がその構成に対して記録している数値によると、合計5500億、アクティブが550億です。

• アーキテクチャ — StepFunはStep 5 Previewの内部構造に関する説明を公開していない。NVIDIAのモデルカードには、ハイブリッド構成が記載されている:インターリーブされたMamba-2層、選択されたアテンション層、LatentMoE配置、およびMulti-Token Predictionヘッド。

• コンテキストウィンドウ — Step 5 Preview の仕様表では 100万トークン、最大出力は 64,000 トークンで、これも StepFun によって文書化されています。Nemotron 3 Ultra は、それを実行した評価者によって 262,144 トークンと記録されています。ベンダーのカードは最大 100万トークンを宣伝していますが、これはデフォルトではなく、サービング構成を通じて到達可能です。

• 入力 — Step 5 Preview ではテキスト、画像、動画に対応し、1リクエストあたり最大60枚の画像、128MB未満のMP4ファイルを利用可能。Nemotron 3 Ultra ではテキストのみ。

• 推論制御 — StepFun 側では、文書化された low・medium・high のエフォート設定。NVIDIA 側では、思考トレースをオンまたはオフにするチャットテンプレートのフラグ。

• 重み — Step 5 Preview については何も公開されておらず、これはプロプライエタリかつ API 専用であり、StepFun は 2026 年 10 月 15 日に BF16 チェックポイントが続くと述べている。Nemotron 3 Ultra は、OpenMDW-1.1 の下で Hugging Face 上に BF16 および NVFP4 ビルドと GenRM 報酬モデルを提供している。

• 導入最低要件 — API モデルには該当せず、オープンな方では、ベンダーの最低ラインに従い、B200 クラスまたは GB200 クラスの GPU を 8 基、あるいは H100 を 16 基。

• 料金表 — Step 5 Preview は入力 $1.00、キャッシュヒット時 $0.10、出力 $2.70(StepFun の英語版料金ページより)。Nemotron 3 Ultra は入力約 $0.60、キャッシュヒット時 $0.16、出力 $2.50。そして、その数値ペアがどこから来ているのか注意深く押さえておいてください。NVIDIA は料金表を公表していないため、これは独立した委員会が記録した観測プロバイダー価格であり、ベンダーが公表した数値ではありません。

ほとんどの人が決定的だとみなす行は最初の行であり、それは8つの中で最も情報量が少ない。2つの合計は互いに9パーセント以内に収まっている一方、アクティブパラメータは2倍異なり、アクティブパラメータこそが生成される各トークンの計算コストを左右する。どちらの数値も21ポイントの差を予測しない。

Generated two-column comparison scoreboard for Step 5 Preview and NVIDIA Nemotron 3 Ultra 550B A55B across six shared rows: Artificial Analysis Intelligence Index 44 against 23; output price $2.70 against $2.50 per million tokens; cost per index task $1.03 against $0.60; output speed 87 against 135.6 tokens per second; weights, 'none, BF16 checkpoint promised 15 October' against 'BF16 and NVFP4 on Hugging Face today'; and input, 'text, image and video' against 'text only'. A footer reads that index, speed and cost-per-task figures are per Artificial Analysis and that the Nemotron rate is the recorded provider listing rather than a vendor rate card. The OrcaRouter logo sits in a white strip at the bottom right.

中央値は、スコアを読む前に下される選択である。

独立委員会は、モデルを単一の分野に照らして採点しているわけではない。モデルをバケットに振り分ける——そして、モデルがどのバケットに入るかによって、スコアは変えることなく、そのスコアの下に印刷される文が変わる。

Step 5 Previewは一般推論クラスに配置されており、このボードでは227モデルと数えられ、その比較可能モデルの中央値は26です。Nemotron 3 Ultraはオープンウェイトクラスに配置され、117モデルと数えられ、中央値は18です。したがって、同じボードが44を「平均を大幅に上回る」と表現し、23を「平均を上回る」と表現しており、どちらの記述も正しいです。なぜなら、44はその中央値より18ポイント上回っており、23は自身の中央値より5ポイント上回っているからです。

これは仕掛けでもなければ、評価ボードが不公平なわけでもない。これはオープンモデルを提示する正しい方法だ——ダウンロード可能なチェックポイントは、他のダウンロード可能なチェックポイントと比較する。ダウンロードしかできないチームは、227の中から選んでいるわけではないからだ。しかし、だからといって、Nemotron 3 Ultraについて「平均以上」と引用する人と、44について「平均以上」と言う人が、互いに異なる文を比較していることには変わりない。このペアに一つの数値が欲しいなら、生のインデックスを使って21ポイントの差を受け入れればよい。判断が欲しいなら、クラスを使って、自分がすでに分野を選んでいることを認めればよい。

Screenshot of the Artificial Analysis model page for Nemotron 3 Ultra 550B A55B (Reasoning), showing an Intelligence Index of 23 in a class of 117 open-weights models with a comparable-model median of 18, pricing of $0.60 per million input tokens and $2.50 per million output tokens with a 73 percent cache discount, an average cost of $0.60 per index task, 110 million output tokens generated during the run against a 140 million median, 135.6 output tokens per second, and a 262,144-token context window.

1つのハーネスが両方で測定したもの

ベンダーの表は互いに差し引くことはできない。なぜなら、StepFun と NVIDIA は異なる日に異なるスイートを実行しており、NVIDIA の資料には StepFun が報告するすべてのベンチマークが載っているわけではないからだ。誠実に比較できる土台は共通部分、すなわち単一の評価者が双方に対して実行したものにある。

Artificial Analysis Intelligence Index では、その交点は44対23です。完了したインデックスタスクあたりのコストでは、1.03ドル対0.60ドルです。出力速度では、それは逆転し、しかも急激です。Step 5 Preview は毎秒87トークン、Nemotron 3 Ultra は135.6トークンなので、ほぼ2倍のスコアを出すモデルのほうが、トークンあたりおよそ0.5秒生成が遅く応答することになります。

最も際立つ単一の行はTerminal-Bench 4.0だ。Step 5 Previewはそこで33.3パーセントを記録する。Nemotron 3 Ultraは0.5パーセントだ。それはどちら側の丸め誤差でもなく、微妙な差でもない――その特定のエージェント端末スイートでは、オープンウェイトのフラッグシップは事実上スコアに現れない。罠は、同じボードが同じモデルをTerminal-Bench 2.1で53.9パーセントとも記載していることだ。ほぼ同じ名前の2つのベンチマーク、同じタスクファミリーの異なる2世代、そして1つのモデルが古い方で53.9、新しい方で0.5に位置している。もしNemotronの50台の数字を引用されたことがあるなら、それはそこから来たのであり、現在のスイートではない。

ひとつの一致は、それがまれであるからこそ、言及に値する。NVIDIA 自身のカードは、ツールなしの GPQA で 87.0 パーセントを主張している。独立した実行では 86.7 パーセントだった。ベンダーの数値と外部の数値が 0.3 ポイント差で収まることこそ、信頼できる評価表の姿であり、それは Terminal-Bench 4.0 での 0.5 パーセントを、評価者の誤りとしてではなく実際のものとして受け入れやすくする。

インデックス運用で、お金は実際どこへ行くのか

トークン単位の価格は、ワークロードにかかるコストをほとんど予測できない。そしてこの2つは、その点をほとんどの例よりもよく示している。ボードは、各モデルのフルインデックス実行についてコスト内訳を公開しているが、この両方に関しては、支配的な費目は生成ではない。

Step 5 Preview のタスクあたり $1.03 は、入力の $0.85 と出力の $0.17 に分かれます。入力の内訳では、$0.62 がキャッシュ読み取り、$0.22 がキャッシュ書き込み、そしてわずか $0.014 が新規の、キャッシュされていない入力です。出力の内訳では、$0.12 が推論トレース、$0.06 が最終回答です。

Nemotron 3 Ultra のタスクあたり0.60ドルは、入力0.53ドルと出力0.07ドルに分かれ、入力の内訳はほぼ正反対で、キャッシュ書き込みが0.48ドルであるのに対し、キャッシュ読み取りはわずか0.04ドルです。

2つの結論が導かれる。1つ目は、プレフィックスの再利用が多い長期的な評価では、支払うもののおよそ80パーセントが台帳の入力側に載るということだ。つまり、最適化すべき数値は出力長ではなく、キャッシュヒット率とコンテキストの規律になる。2つ目は、2つのモデルが請求額に至る道筋は異なるということだ。Step 5 Preview は大きな共有プレフィックスを再読込するために支払っており、Nemotron 3 Ultra はそもそも別個のコンテンツをキャッシュに書き込むために支払っている。表向きのコストは似ていても、請求書は2枚ある。そして、あなたのワークロードがこれらのパターンの一方により似ているなら、$1.03 と $0.60 の順序は逆転しうる。

冗長性の数値は、出力行の残りを説明している。Step 5 Previewはインデックススイート全体で約1億6000万の出力トークンを生成し、中央値の8200万に対して、ボードはそれを率直に非常に冗長だと述べている。Nemotron 3 Ultraは1億1000万を生成し、中央値の1億4000万に対して、それをかなり簡潔だと評している。より安価なモデルのほうが簡潔であり、しかも請求額にとって重要な方向に簡潔である。

Screenshot of StepFun's English documentation page for Step 5 Preview showing the specification table - model ID step-5-preview, a 1M-token context window, text, image and video input with text output, a 1M maximum input and a 64k maximum output - together with the input and video format notes listing JPG, JPEG, PNG, WebP and static GIF at up to 60 images per request and MP4, QuickTime and Matroska video under 128MB per file.

ダウンロードがもたらすもの、そしてそれを保持するためにかかるコスト

Nemotron 3 Ultraの価格は、チェックポイントを取るなら、出力トークン100万あたり2.50ドルではない。それは、誰か他人のデプロイメントを借りる場合の価格だ。ダウンロードを取れば、別のコストと別の権利を買ったことになる。

その権利は具体的であり、API専用モデルがどんな価格でも太刀打ちできない部分です。OpenMDW-1.1には重みが付属し、NVIDIAは事前学習および事後学習のデータコレクションと学習レシピをそれらと併せて公開しています。同じモデルでサイズがおよそ半分のNVFP4ビルドがあり、Ultraの重みは後から量子化されたのではなくNVFP4レシピで事前学習されています — だからこそ、この小型ビルドはコミュニティの実験作ではなく、カード上のファーストクラスの成果物なのです。商用利用に関する立場は明快に示されています:商用利用にも非商用利用にも対応可能です。

コストも同じくらい具体的だ。最小構成はB200クラスのGPUを8基、またはH100を16基で、これは提案ではなくカードが明記している下限だ。実際に得られるコンテキストウィンドウはサービングの構成方法次第で、デフォルトは256K、1Mは明示的な設定によってのみ利用できる。ラックを確保できないチームは、入力$1.00と$0.60のこの2つのモデルから選んでいるのではない。1つのモデルと発注書のどちらかを選んでいるのだ。

この比較には、オープンモデルが、人々が気にしていると言いながらめったに値付けしない軸——依存性——で勝つバージョンがある。Step 5 Preview は、あなたが呼び出すエンドポイントであり、あなたが信頼するベンダーであり、チェックポイントは出荷済みではなく約束されている。StepFun が料金表を改定し、制限を厳しくし、ID を非推奨にするか、まずい週を過ごせば、あなたの唯一の手段は自前のエラーハンドリングだ。Nemotron 3 Ultra の重みはすでに誰かのクラスタのディスク上にあり、同じモデルがインデックスポイントで21ポイント負けている間でも、それは現実の価値がある。

「約束された」という言葉が相手側で何を意味するのかについては、正確を期す価値がある。なぜなら、事態はどちらの陣営が認めているよりも混沌としているからだ。9月20日、APIが公開された当日、BF16ビルドの複数のサードパーティ製ミラーがHugging Faceに現れ、そのうちいくつかは1テラバイトを優に超えるsafetensorsだった。これらはコミュニティによる再アップロードであり、ベンダーのリリースではない。そしてStepFunは、それらに併せてオープンウェイトに関する発表を一切行っていない。これらのものが示しているのは、重みがすでに流通しており、約束された10月15日のチェックポイントは開示というよりも形式化にすぎないだろうということだ。

私たちがそれを読んでいる間に動いた数字

この記事のある数値は、同じページを二度読むあいだに変わっていた。これは名指しする価値がある。なぜなら、比較が静かに古びていくのは、まさにそういうふうに起こるからだ。

独立したボードは、2026年10月9日付のカバレッジで、Step 5 Previewのインデックスタスクあたりのコストを$0.71と示していた。10月10日に再度読むと、同じページには$1.03と書かれている。その期間にモデルについて何も変わっていない。なぜなら、API専用モデルの重みは一晩で変わりようがないからだ。変わったのは評価の計算方法である。ベンダーのキャッシュ価格が動くとき、評価者がキャッシュ読み取りの前提を修正するとき、あるいは異なるトークン構成に対して実行が再計算されるとき、タスクあたりの数値は動くが、インデックススコアは動かない。

つまり、タスクあたりのコストはモデルの属性ではなく、日付が刻まれた生きた数値として扱いなさい。この記事のタスクあたりの各数値は10月10日時点の読み取り値であり、そのように表示されている。このページから予算を組むなら、コミットする当日に自分で取得した数値から組みなさい — そして、異なる週の2つの記事を比較しているなら、モデルが安くなったと結論づける前に、取得日を確認しなさい。

実際にあなたが呼ぶのはどれですか?

不快な部分を先に言います。OrcaRouter はこれら2つのモデルのどちらもルーティングしていません。Step 5 Preview には StepFun 自身の API と一握りのサードパーティプラットフォームを通じて到達でき、Nemotron 3 Ultra は NVIDIA 自身のエンドポイントおよび複数のプロバイダーによって提供されています。そして、どちらの主張も、あなたが読んでいるその同じ1分のうちに私たちのカタログに照らして確認できます。

残るのは、モデルの選択ではなく依存関係の形であり、ここでルーティング層がその真価を発揮する唯一の場面だ。単一ベンダー経路でのAPI専用プレビューは、まさにプロバイダー側のちょっとした不調があなたのサービス停止になる構成であり、安価な保険となるのは、プロバイダー経路が劣化した瞬間にリクエストを適格なフォールバックへ切り替えられるコントロールプレーンだ。それが自動フェイルオーバーの目的だ。Step 5 Previewの代替としてではなく、実際に呼び出せるモデルの前段に置くものとして。そうすれば、ベンダー固有のエンドポイントが本番への唯一の道になることは決してない。それを実現する同じカタログが1つのキーと1つの請求で200以上のモデルを提供し、プロバイダーの定価を0%のマークアップでそのまま渡している。これが議論のもう半分だ。なぜなら、上流のどこかで料金表が変わっても、次の契約更新時ではなくその日のうちに私たちの側で反映されるからだ。

どちらのモデルも、あなたが呼び出すモデルではないなら、短く言えばこうだ。スコア、動画と画像入力、90パーセントのキャッシュ割引が欲しいなら Step 5 Preview を選び、重みへのライセンスがなく、まだ見ていない10月のチェックポイントが付いたプレビューを借りていることを受け入れよ。重みがスコアより重要なとき——オンプレミスの制約のために、ファインチューニングのために、読めるライセンスのために——Nemotron 3 Ultra を選び、トークンの予算を取る前にラックの予算を取れ。なぜなら、入力トークン100万あたり$0.60では、5500億パラメータのデプロイは、他の誰かがすでにGPUの費用を払っていてこそ安いのだから。

注目すべきは10月15日だ。StepFunが約束したBF16チェックポイントを公開すれば、この記事の中心的な非対称性——この2つのうちダウンロードできるのは片方だけだという点——はもはや成り立たなくなり、21のインデックスポイントは議論で打ち消すのがかなり難しくなる。もし日付がずれれば、オープンウェイトモデルを支持する根拠は自動的に強まる。これは能力格差が埋まる方法としては奇妙であり、非常によくあるものでもある。