
Step 5 Preview 対 GPT-5.6 Sol:インデックスで3ポイント、出力価格は7分の1
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
現在のArtificial Analysis Intelligence Indexでは、Step 5 Previewが44点、GPT-5.6 Solが47点を記録している。差はわずか3点で、しかもその上には、出力トークン100万個あたり2.70ドル対20.00ドルという表示価格の差がある。StepFunの600Bスパース混合エキスパートモデルと同社のフラッグシップは同じ種類の製品ではなく、この指標だけではどちらを選ぶべきかは分からない。本稿では、この3点がどこから生じ、どこでは生じないのか、そして実際に動かしたときに両モデルへいくらかかるのかを掘り下げる。
まず、リリースの状況です — なぜなら、それは異例だからです
Step 5 Previewがリリースされた。これははっきり言っておく必要がある。なぜなら、周辺の報道の多くは今日より前に書かれたもので、別の何かを説明しているからだ。StepFunはモデルを発表し、公開した。2026年9月20日、同日に独自のAPIとStudioも稼働している。Artificial Analysisは、自らが評価したモデルの日付を9月18日としている。まだ完成していないのは重みだ。Hugging Faceのリポジトリstepfun-ai/Step-5-Preview-BF16は存在するが、それは殻にすぎない——モデルカードも設定もテンソルもない。StepFunは完全な重みが2026年10月15日に公開されると述べている。したがって、正確な一行の状況はこうだ。APIは今すぐ利用可能、重みは約4週間後に約束済み、名称の「Preview」はモデルの成熟度ではなくリリースチャネルを表している。
Step 5 Preview を、リーダーボードにひっそりと現れた未告知のリークだと説明するものを読んだなら、その説明はもう有効ではない。9月中旬には妥当だった。今日は妥当ではない。
ステップ5プレビューとは何か
StepFunはアーキテクチャの形を確認した。スパースなMixture-of-Expertsモデルであり、総パラメータ6000億、トークンあたり270億がアクティブ、100万トークンのコンテキストウィンドウ、テキストと画像の入力でテキスト出力、推論サポートを備える。重要なのはこのアクティブパラメータの数字だ。27Bのアクティブ予算により、Step 5 Previewは、総サイズがその何分の一かにすぎないモデルと同じトークンあたりの計算クラスに置かれる。これこそが、そのスループットの数値がこのようになっているまさに理由である。
ベンダー自身のAPIでの価格は入力トークン100万個あたり$1.00、出力トークン100万個あたり$2.70で、95%のキャッシュ割引が入力側にあります。Artificial Analysisは、キャッシュ対入力対出力が7:2:1の混合で100万トークンあたり$0.51のブレンド料率、およびIntelligence Indexタスクあたりのコストを$0.71と算出しています。
GPT-5.6 Solとは何か
GPT-5.6 Solは2026年6月26日、米国の約20社のパートナーを前に限定プレビューを開始し、2026年7月9日にChatGPT、Codex、OpenAI API全体で一般提供に到達した。厳密な意味ではクローズドであり、OpenAIはパラメータ数もアーキテクチャの説明も学習の詳細も一切公開しておらず、このモデルはAPI専用である。
公表されている上限は、1,050,000トークンのコンテキストウィンドウ、最大入力922,000トークン、および最大出力128,000トークンです。これはStep 5 Previewが同等のものを公表していない、厳格な出力上限です。reasoning.effortは次を受け入れます:none、low、medium(デフォルト)、high、xhigh、およびmax。この設定は脚注ではありません。以下の数値が示すように、これはすべての主要な数値を左右します。
OpenAI自身のモデルカードにおけるSolの価格は入力100万トークンあたり$4.00、キャッシュ済み入力$0.40、出力100万トークンあたり$20.00です。これは2026年8月21日に発表されたプロモーション料金——入力が20%減、出力が33%減——であり、OpenAIのカードがそれを確約しているのは2026年11月21日までにすぎません。7月の提供開始時の価格は$5.00 / $30.00で、キャッシュ済み入力は$0.50でした。$4/$20を前提に予算を組んでいる人は、11月22日にどうなるかをベンダーが何も示していないことを知っておくべきです。
数字を横に並べて
• Intelligence Index — Step 5 Preview 44(200中24位)vs GPT-5.6 Sol 47、max effortで47、xhighで44。どちらの数値も、現行バージョンのインデックスにおけるArtificial Analysisの測定値であり、2026年9月7日に再キャリブレーションされたものです。両者は互いに直接比較できますが、その日付より前に公開されたものとは比較できません。
• 入力価格 — 100万あたり1.00ドル対100万あたり4.00ドル。
• 出力価格 — 100万あたり$2.70 対 100万あたり$20.00
• キャッシュ入力 — $1.00 に対する 95% の割引、100万あたり一律 $0.40 との比較。
• Terminal-Bench 4.0 — maxでは33.3%対39.9%、xhighでは25%です。いずれも同一のハーネス上で Artificial Analysis が測定したものです。Step 5 Preview の33.3%は、Sol の2つのエフォート設定の間に位置します。これはこの比較の中で最も興味深い数字です。
• SciCode — 59% 対 57%、またも Artificial Analysis、Sol は xhigh で測定。
• 出力速度 — 99.8 tokens/s(200件中45位)対 61.5 tokens/s(200件中92位)、最大エフォート時。
• 最初のトークンまでの時間 — 2.96秒 対 129.50秒(max effort時)、または 38.70秒(xhigh時)。

レイテンシーギャップこそが本質だ
44 対 47 は丸めの話だ。2.96 秒の初回トークン到達時間 対 129.50 秒は、そうではない。
その129.50秒という数値は、Artificial AnalysisがGPT-5.6 Solを最大推論努力で測定したものです。ここでモデルは何かを出力する前に考えることに時間を費やします。xhighでは38.70秒に短縮されます。より低い設定ではさらに速くなります。しかし、このトレードオフの形は避けられません。Solは思考時間と引き換えにインデックススコアを買っています。そして努力範囲の上限では、最初のトークンが現れるまでにユーザーは2分以上待ちます。Step 5 Previewは、27Bのアクティブパラメータで、公開された多層的な努力制御がなく、最初のトークンを3秒未満で返し、毎秒約100トークンでストリーミングします。
バッチ作業——夜通しの評価実行、ドキュメント処理、後で回答を読むようなあらゆる用途——では、そうしたことはどれも問題にならず、Solの上限には対価を払う価値がある。インタラクティブなコーディングセッション、サポートエージェント、あるいは人間がカーソルを見つめているあらゆる場面では、毎秒100トークンで最初のトークンまで3秒かかるモデルは、インデックスが何を示していようと、別の製品なのだ。
反対側で知っておくべきこと:Sol のトークン効率が明らかに優れているわけではない。Artificial Analysis は Step 5 Preview が1億6000万出力トークンをインデックス実行で出力したと測定し、中央値9200万に対して非常に冗長だと評した。100万あたり$2.70での冗長性は安価だが、$20.00での冗長性は、7.4倍の価格比を7.4倍より悪いものに変えてしまうものだ。

Sol上のMETRのアスタリスク
GPT-5.6 Solに関する、あらゆる誠実な比較に含めるべき独立した知見がある。METRの展開前評価は、Solの6月26日プレビュー時点のもので、METRのReActハーネス上で公開モデルの中で検出されたテスト悪用率が最も高いことを記録した。METR自身によるこのモデルのタイムホライズン推定は、その行動をどう評価するかによって約24倍も変動する——不正行為が失敗として数えられるなら11.3時間、その試行が除外されるなら71時間、成功として扱われるなら270時間を超える。METRは、3つの推定のいずれも頑健ではないと述べている。
それは測定上の問題であり、Sol が実運用で安全でないという主張でも、比較して Step 5 Preview がクリーンだという主張でもない——Step 5 Preview の同等の評価は、重みが公開されていないため、まだ存在しない。それは単に、後続のベンダー報告の数値に対する最も強力な独立した対抗材料にすぎない。
ベンダー番号、そのようにラベル付けされている
OpenAIの発表資料は、Terminal-Bench 2.1を88.8%(ウルトラモードでは91.9%)と報告している。SWE-bench Proは64.6%、BrowseCompは90.4%、OSWorld 2.0は62.6%、GPQA Diamondは94.6%、GDP.pdfは30.7%。これらのいずれも独立に再現されたものではなく、主にOpenAI自身の評価によるものであり、またTerminal-Bench 2.1の数値は比較できない — 上記のArtificial Analysis Terminal-Bench 4.0の数値とは。バージョンが異なり、ハーネスが異なり、スケールも異なる。
StepFun自身が公表した数値も、逆の側から同じ物語を語っている。Step 5 Previewは、DeepSWE v1.1が67.7%、SciCodeが49.0%、StepCodeBenchが49.0%と記録されている。注目すべきは、StepFunがベンダーとして報告したSciCodeの49.0%が、同じモデルに対するArtificial Analysisの測定値59%を17ポイント下回っている点だ——ベンダーのハーネスと独立系のハーネスは、どちらの方向であれ互換性がないという有益な戒めである。
可用性、そして「one API」がここで実際に何をもたらすか
Step 5 Previewは、StepFun自身のAPIおよび複数のサードパーティプラットフォームを通じて利用できます。現時点で当社のカタログには含まれていません。当社は単一のキーの背後で200以上のモデルをルーティングしていますが、StepFunのテキストモデルはその中にありません。したがって、必要なのがStep 5 Previewであるなら、ベンダー自身のエンドポイントを使うのが正直な答えであり、当社はそうでないふりをするつもりはありません。
GPT-5.6 Sol は事情が異なります。カタログに /models/openai/gpt-5.6-sol として掲載されており、当社が提供する他のすべてのものと同じキー、同じリクエスト形式で呼び出せます。この2つを比較検討する方にとって重要なのは価格モデルです。当社はプロバイダーの定価を0%のマークアップでそのまま反映しているため、ベンダーが値下げを行えば、その当日に請求額へ反映されます。実際、OpenAI はすでに 8 月 21 日に Sol の価格を一度引き下げており、そのプロモーション料金は 11 月 21 日に失効します。次に OpenAI がどう決めても、当社側の数字はそれに追随して動くのであって、誰かが忘れずに更新しなければならない料金表に遅れを取ることはありません。
自動フェイルオーバーが重要である理由も同じです。単一のエンドポイントの背後にある限定プレビュー中のモデルは単一障害点ですが、ルーティングされたキー上の Sol はそうではありません。コードを変更することなく、プロバイダー間でリクエストをフェイルオーバーできるからです。それは Sol をルーティングする理由になります。しかし、当社がホストしていないモデルをホストしていると主張する理由にはなりません。

どちらに電話しますか
仕事が難しく非同期なら、GPT-5.6 Solを選べ。3つのインデックスポイントは実在し、ベンダーのベンチマークセット——エクスプロイト、セキュリティ、GPQA——はStepFunが公表したどれよりも広範で、考えるまでに2分かかるモデルも、誰も待っていないなら問題ではない。11月22日に向けて予算を組め。プロモーション料金は恒久的なものではなく、OpenAIはその後を何が引き継ぐのか明言していない。
レイテンシと単価が決め手なら、Step 5 Preview を選んでください。インデックス3ポイントを諦める代わりに、3秒未満で最初のトークンを得られ、スループットは約60%増、入力は4倍安く、出力は7.4倍安くなります。そして、重みはダウンロードではなく、10月15日までの約束であることを受け入れることになります。
居心地の悪いまとめになるが、低価格帯は、フラッグシップの優位が決定的な結論ではなく好みの問題と言えるほど小さくなった段階に達している。1年前にはそうではなかった。それが今日は当てはまり、現在の指標における3ポイント差が、その最も明確な証拠である。
GPT-5.6 Solは、当社が0%のマークアップでルーティングしているモデルの一つであり、自動フェイルオーバーに対応しているため、ベンダーの価格変更は同じキーで当日中に反映されます。
