
Step 5 Preview 対 DeepSeek V4 Pro:一方は約束、もう一方は MIT ライセンス
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
この対決のすべては、ベンチマークとは何の関係もないある問いにかかっている。実際に何をダウンロードできるのか、ということだ。DeepSeek V4 Pro——ベンダーが2026年8月13日にDeepSeek-V4-Pro-0813としてリリースしたビルド——は、MITライセンスの1.6兆パラメータのMixture-of-Expertsモデルで、重みは今この瞬間Hugging Face上にある。Step 5 Previewは、StepFunが2026年9月20日に発表したもので、6000億パラメータのスパースMoEであり、同じ独立系ボードで8ポイント高いスコアを出しているが、そのHugging Faceリポジトリに入っているファイルはたった一つ、.gitattributesだけだ。StepFunはBF16チェックポイントが10月15日に登場すると述べている。つまり、この比較の正直な姿は「どちらのモデルが優れているか」ではない。「この四半期に実際に構築できるのはどちらで、どちらを待っているのか」なのだ。
その捉え方は、ベンチマーク対決ほど刺激的ではないが、はるかに役に立つ。8ポイントの差と25日間の待ち時間は、同じ種類の事実ではないからだ。そのうちの一方は、今日にでも計画に織り込める。
8つのポイント、そして本当に重要な4つ
Artificial Analysisは両モデルをIntelligence Index v4.3.2——10の評価——にかけており、この2つが同じ手によって測定された唯一の場はここだけだ。
• インテリジェンス指数 — Step 5 Preview 44 対 DeepSeek V4 Pro 36
• そのボードでの順位 — Step 5 Preview は200中24位 対 DeepSeek V4 Pro は同クラス113中7位
• Terminal-Bench 4.0 — Step 5 Preview 33.3%;DeepSeek V4 Pro は同じボードに掲載されていないため、同等条件で比較できるエージェント性能の行を示すことはできない
• 出力速度 — Step 5 Preview 99.8 トークン/秒 対 DeepSeek V4 Pro 88.8 トークン/秒
• 最初のトークンまでの時間 — Step 5 Preview 2.96秒 vs DeepSeek V4 Pro 1.69秒
• 100万トークンあたりの価格 — Step 5 Preview は入力 $1.00 / 出力 $2.70 に対し、DeepSeek V4 Pro は DeepSeek のピーク料金で入力 $1.32 / 出力 $3.96、オフピーク時には半額の $0.66 / $1.98
• キャッシュ割引 — Step 5 Preview 95% 対 DeepSeek V4 Pro 97%
• コンテキスト — 両方とも1Mトークン。DeepSeekは384,000トークンの出力上限を公表しているが、StepFunは公表していない
• 重み — Step 5 Preview は終了、BF16 チェックポイントは10月15日を予定;DeepSeek V4 Pro MIT、現在ダウンロード可能
2つの行がヘッドラインに反している。DeepSeek V4 Proは最初のトークンを1.69秒で返すのに対し、Step 5 Previewは2.96秒——呼び出しごとに43%の先行で、長いエージェントループではそれが実際のウォールクロック時間に積み重なる。さらに、そのキャッシュ割引は2ポイント優れており、これはまさにこの両モデルが売り込まれているワークロードで最も重要だ。エージェントが毎ターン同じシステムプロンプトとリポジトリコンテキストを再送信する場合、ほぼ完全にその割引の内側で動くことになる。
8ポイントの総合ギャップは実在するし、同時に、8ポイントという響きほど大きくもない。インデックスは10個の評価の合成であり、その構成こそが両モデルを分かつ点だ。Step 5 PreviewのTerminal-Bench 4.0における33.3%は紛れもないエージェント的成果であり、DeepSeek V4 Pro自身の看板となる強みは、オープンウェイト層では他に並ぶものがない価格での長期的推論にある。どちらのリーダーボードも、両者が真っ向から対立する行を公開していない。これが、この比較を単一の数字では決着できなかった正直な理由である。

ベンダーが気変わりしたとき、「オープン」があなたにもたらすもの
ここに、この対決でスペックシートには載せられない部分があります。そして、それはStep 5 Previewが発表される11日前に起きたことなので、実際の日付を挙げて述べておく価値があります。
DeepSeekはユーザーに対し、V4 Proを廃止すると伝えていた。9月9日、同社はリクエストをより新しいDeepSeek V4.1 Flashにルーティングすると発表。9月10日には日時を北京時間9月14日12:00に確定した。9月11日には一転し、DeepSeek自身の言葉によれば、V4 Pro APIサービスは9月14日以降も継続し、課金体系は変更されないとした。モデル文字列、100万トークンのコンテキスト、500リクエストの同時実行上限はいずれも従来どおりで、DeepSeekのModels & Pricingページではこの撤回がdeepseek-v4-pro行の脚注として掲載されている。
それを、オープンウェイトが実際には何からあなたを守るのか、そして何からは守らないのかの実証として読んでほしい。APIはスケジュール上の決定によって、危うく取り上げられるところだった。ウェイトのほうは、取り上げられようがなかった。自分のハードウェア上にあるMITライセンスのチェックポイントには、その引退を発表できるベンダーがいない。そしてそれは、価格の約束とは別種の保証だ——約束ですらないのだ。
まさにそれが、Step 5 Preview が置かれているギャップだ。StepFun は BF16 チェックポイントについて10月15日を確約しており、すでに確保したリポジトリ名——stepfun-ai/Step-5-Preview-BF16——は、作成時に命名され後から中身が埋められる、ファインチューニングや量子化の基にするフォーマットだ。それはスケジューリング上のシグナルであり、アーティファクトではない。リポジトリが .gitattributes 以外の何かを保持するまでは、Step 5 Preview は、あるベンダーの条件で借りるモデルであり、読むためのライセンスもなく、条件が変わったときのフォールバックもない。
安い選択肢になるための2つの方法
これらのモデルはどちらもクローズドなフロンティアを大きく下回る価格であり、その仕組みは同一ではない。このことは価格の持続性をどう考えるかに影響する。
DeepSeek V4 Proが安いのは、あるラボが重みを公開し、競争の激しいサービス市場が利益率を押し下げたからだ。これは構造的な下限である。誰でもチェックポイントを提供できるため、価格は企業の価格戦略ではなく、GPU時間のコストによって決まる。DeepSeek自身のAPIは2つの時間帯で価格を設定している——ピーク時は$1.32と$3.96、それ以外はその半額——そしてピークは狭く、UTCで平日朝の数時間に限られるため、ほとんどのトラフィックは安い料金に落ち着き、週末に高い料金が適用されることはない。
Step 5 Previewが安いのは、StepFunがそう価格設定すると決めたからだ。エンドポイントは1つ、料金表も1つで、別の情報源はない。それは非難ではない——600B/27Bのスパースモデルは、パラメータ数から想像されるよりも提供コストが実際に低く、その理由は有効パラメータ比率にある。それは単に別種の価格であり、その違いはStepFunがこのプレビューは役目を果たしたと判断する日に表面化する。
両者の価格差は小さすぎて、何かを決める要因にはならない。$1.00と$2.70 対 $1.32と$3.96 は、入力で24%、出力で32%の差だが、キャッシュ割引、出力長の違い、再試行率で消し飛ぶ範囲に十分収まっている。冗長性の点では両者は近い — Step 5 Preview はインデックス実行で160M出力トークンを生成し、中央値92Mに対して、DeepSeek V4 Pro 自身の実行も同じ帯域にある。どちらも倹約的なモデルではなく、両方ともタスクあたりの安さではなくトークンあたりの安さで売られている。

実際のスタックの中でそれぞれがどこに当てはまるのか
ファインチューニングや量子化をしたい、自社VPCでホストしたい、あるいは法務チームに読めるライセンスファイルを渡したいのであれば、これは僅差の話でも、ましてやベンチマークの話でもない。DeepSeek V4 Proは今日、MITの下で利用可能だ。Step 5 Previewにはライセンスも設定もパラメータファイルもなく、計画に組み込める最も早い時期は10月中旬だ。8ポイントの指数差はその算段を変えない。ダウンロードできないモデルはデプロイできないからだ。
入力100万トークンあたり1ドルで得られる最強のエージェント性能を求めるなら、Step 5 Previewは、両方を測定した唯一のベンチマークで先行しており、エージェントループの大部分を占める試行錯誤的な作業——抽出、分類、テストの足場作り、重要な2つの間の定型的な呼び出し——にとって、より良いデフォルトだ。その毎秒99.8トークンも、DeepSeek V4 Proの88.8より速く出力を完了させ、請求額だけでなくループそのものを短縮する。
厄介なのは、ほとんどのチームが実際に直面しているケースだ。Step 5 Preview の数値は欲しいが、ローンチ当日に公開されたばかりで、公表された出力上限もないプレビューエンドポイントを本番の経路に載せるわけにはいかない。これはルーティングの問題であり、この比較が最後に取り上げるのはまさにそれだ。DeepSeek V4 Pro は OrcaRouter 経由で、100万トークンあたり $0.66 と $1.98 で利用できる。これは DeepSeek の $1.32 と $3.96 という料金表のオフピーク半額にあたり、周辺のテキストモデルも同じく200以上のモデルが 0% のマークアップで1つのキーの背後にあり、そのため DeepSeek の価格改定は更新時ではなくその日のうちに請求へ反映される。探索的なトラフィックの一部はプレビューに向け、本番経路はライセンスに裏打ちされたモデルに据え置き、プロバイダー間の自動フェイルオーバーに、プレビューエンドポイントのキャパシティ曲線が必然的に要求する役割を担わせるのだ。

それを解決するものは何だろう
三つのこと、そしてその三つはすべて、議論の余地があるというより検証可能である。
最初はライセンスです。BF16チェックポイントが登場したとき、リポジトリは企業がそれを使って何をすることを許可していると述べているでしょうか? 寛容なライセンスは、このギャップの大半をそれだけで埋めます。なぜなら、8ポイントのリードを借りるものではなく、所有できるものにしてくれるからです。制限的なライセンスでは、実際に製品を構築できるペア内の唯一のモデルとしてDeepSeek V4 Proが残ります。
二つ目は出力上限だ。DeepSeekは384,000トークンと公表している。StepFunの発表では100万コンテキストとされており、出力上限には触れていない。また、リーク時に出回った別のサードパーティ構成では、350,000コンテキストと最大出力64,000が記載されていた。両モデルが売り込まれている長期的なエージェント作業にとって、その数字は脚注ではない。
第三は、プレビューの接尾辞が外れた後も価格が維持されるかどうかだ。プレビュー価格は顧客獲得のための数字であり、正式提供価格はビジネスモデルである。DeepSeek V4 Proの下限は競争の激しいサービス市場によって決まっており、大きく動くことはできない。Step 5 Previewの価格は、火曜日にも動き得る。
最初の2つに答えが出るまでは、実用的な見方はこうだ。実際にデプロイするのは DeepSeek V4 Pro で、比較ベンチマークを取る相手は Step 5 Preview である——ただし、公開から数日しか経っていないプレビューエンドポイントが、成熟した MIT ライセンスのフラッグシップを8ポイント上回っているのは紛れもない結果であり、10月15日が肩をすくめて流す日ではなくカレンダー登録に値する理由でもある。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
