生成されたタイトルカードのタイトルは「Step 5 Preview vs Gemini 3.1 Pro — 7か月違いの2つのプレビュー」で、タイムラインには、Gemini 3.1 Pro Previewが2026年2月19日時点でまだプレビューであること、Step 5 Previewが2026年9月20日で、重みの公開が10月15日予定であることが示されている。その下に2つのカード:Step 5 PreviewはAA Index 44、入力はテキストと画像、最初のトークンまでの時間は2.96秒。Gemini 3.1 Pro PreviewはAA Index 30、入力はテキスト、画像、音声、動画、ファイル、最初のトークンまでの時間は35.72秒。フッターには「いずれもArtificial Analysis Intelligence Index v4.3.2によるもの。」とある。
Guides & Insights

Step 5 Preview vs Gemini 3.1 Pro:どちらも Preview と呼ばれる2つのモデル、7か月の隔たり

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

どちらもStep 5 PreviewGemini 3.1 Pro「preview」という語を含んでいるpreviewが、その語はどちらでも同じ意味ではない。StepFunは2026年9月20日にStep 5 Previewを発表し、APIは公開済み、重みは10月15日公開予定、Hugging FaceのBF16リポジトリには.gitattributesしか入っていない。もう一方は、gemini-3.1-pro-preview としてAPIで、そして「Gemini 3.1 Pro Preview」として2026年2月19日以降あらゆるリーダーボード上で提供され続けており、7か月間本番トラフィックを処理してきたが、そのラベルが外れることは一度もなかった。一方はまだ完成していないものの正真正銘のプレビューだ。もう一方は、完成した製品に付けられた命名慣習にすぎない。両者を同じ軸で比較するということは、自分が実際に買っているのはそのどちらなのかを決めるということだ。そして二次的な答え——7か月経ってもなおプレビューと呼ばれ続けているモデルのほうが、両者の中ではより予測可能である——こそが、調達の判断に持ち込む価値のある部分なのだ。

同じ委員会が言っていること

Artificial Analysisは両方をIntelligence Index v4.3.2で採点しており、評価は10項目です。同じ主体によってこの2つが測定された唯一の場所であり、その結果は、どちらのベンダー資料が示唆するよりも大きな隔たりがあります。

• Intelligence Index — Step 5 Preview 44 vs Gemini 3.1 Pro Preview 30

• ランク — Step 5 Preview は200モデル中24位、Gemini 3.1 Pro Preview は200モデル中69位

• 100万トークンあたりの料金 — Step 5 Preview 入力 $1.00 / 出力 $2.70 対 Gemini 3.1 Pro 入力 $2.00 / 出力 $12.00

• キャッシュ割引 — Step 5 Preview 95% 対 Gemini 3.1 Pro 90%

• 出力速度 — Step 5 Preview 99.8 トークン/秒 対 Gemini 3.1 Pro 118.9 トークン/秒

• 初回トークンまでの時間 — Step 5 Preview 2.96秒 対 Gemini 3.1 Pro 35.72秒

• 前提 — どちらも100万トークン。当社のカタログではGemini 3.1 Proを出力上限65Kとして掲載していますが、StepFunはそれを公表していません

• 入力モダリティ — Step 5 Preview: テキストと画像。Gemini 3.1 Pro: テキスト、画像、音声、動画、ファイル。両方ともテキストのみを出力。

• Weights — Step 5 Preview は本日クローズ、BF16 チェックポイントは 10 月 15 日予定、Gemini 3.1 Pro は全体を通じてプロプライエタリ

トップが53に位置するスケール上での14ポイントの差は大きく、それは、この数字を奇妙にしている事柄のすぐ隣に記されるべきだ。すなわち、Google自身が公開したこのモデルの評価数値は優れている。ベンダーはARC-AGI-2で77.1%、そのマルチモーダルスイートで82.8%、GPQA Diamondで94.1、Humanity's Last Examで47.0を報告している。これらは弱い数字ではない。また、Google自身による、Googleのハーネスで実行された数値であり、インデックスが採点する総合値ではなく、特定の能力を測っている。両方の数値群は同時に正確でありうる。ベンダーの主要な評価と独立した複合指標がこれほど鋭く食い違う場合、本番ワークロードを計画する際に基準にすべきは複合指標のほうだ。なぜならそれは、ベンダーが測定することを選ばなかった事柄についてモデルを減点するものだからだ。

速度の2行は、別々に読むより一緒に読む価値がある。Gemini 3.1 Proは、いったん生成が始まればトークンを19%高速に生成する(118.9対99.8)。一方、生成開始までに35.72秒かかり、これはStep 5 Previewの2.96秒に対する値だ。これは、出力する前に熟考するモデルの特徴である。人間が待たないバッチジョブでは、より高速な生成側がスループットで勝る。数十の依存呼び出しを行うエージェントループでは、初回トークンまでの時間における12倍の差は、対話型ツールと待ち行列の差になる。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Geminiが完全に勝利する唯一の軸

この比較において、モダリティは脚注ではありません。Gemini 3.1 Proはテキスト、画像、音声、動画、および任意のファイルを受け入れ、Step 5 Previewはテキストと画像を受け入れます。あなたのパイプラインが画面録画、通話録音、PDFバンドル、またはビデオフィードを扱う場合、これら2つのモデルのうち、そもそも入力を受け取れるのは片方だけであり、もう片方のモデルは質問に答えられないため、14ポイントのインデックス差は無関係です。

その非対称性は、ベンチマーク表よりも多くの実運用ワークロードを左右する。動画レビュー、会議分析、音声文字起こしと推論、スキャンしたファイルに基づくドキュメントワークフローはすべて、Gemini 3.1 Pro の広さによって、このページ上で唯一の候補となるケースだ。これはまた、このモデルがプレビューというラベルの下で7か月間本番環境にとどまっている理由でもある。このモデルが担っているワークロードは、より新しいテキスト・画像モデルでは取って代われないものなのだ。

テキストと画像の作業では、計算が逆転します。Step 5 Preview は総合で14ポイント上回り、入力価格では約2倍高速で、出力では4.4倍安く、応答時間は12分の1です。文書抽出やスクリーンショット上のチャットのワークロードでは、割増料金を払って、余分な11秒の熟考を待つ理由はありません。

料金体系が見た目ほど一律ではないところ

見出し価格はその差を実際より小さく見せている。その理由は料率ではなく、階層の境界線にある。

Gemini 3.1 Proの$2.00と$12.00は、最大200,000入力トークンまで適用されます。それを超えると、両方の料金は$4.00と$18.00に上がります — 出力は50%増で、これは境界を超えた部分だけでなく、リクエスト全体に適用されます。Step 5 Previewの$1.00と$2.70には公表された段階料金がなく、コンテキストウィンドウが許す長さであれば、価格はどの長さでも同じです。

どちらのモデルも1Mトークンのコンテキストをうたっているため、どちらも長いコンテキストのパイプライン構築へと誘います。一方のモデルでは、300,000トークンのリクエストに価格表が示す2倍のコストがかかりますが、もう一方ではかかりません。これは、StepFun が Step 5 Preview をまさにそのために作ったカテゴリ——大規模で繰り返し参照されるコンテキストを伴う長期的なエージェント作業——における構造的な優位性であり、さらにキャッシュ割引によって増幅されます。Step 5 Preview の95%対 Gemini 3.1 Pro の90%という差は、エージェントループが生み出す反復プレフィックスのパターンにおいて、その隔たりをいっそう広げます。

ざっくり計算したもので、引用された数値ではなく算術として示したものだ。40ターンのすべてで25万トークンのコンテキストを送るエージェントループは、入力トークン1,000万になる。Gemini 3.1 Proの20万超の料金では、キャッシュが繰り返されるプレフィックスを吸収するとしても、これは$2.00のリスト料金が示唆する水準から見て意味のある上振れになる。Step 5 Previewの一律$1.00とより深いキャッシュ割引では、同じループのコストはより低く、さらに重要なことに、最初に階層表を読まなくても料金表から予測できるコストになる。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

可用性こそが、静かな違い

Gemini 3.1 Pro は7か月にわたり、Google の API を通じて、そして計画立案にとってはさらに有用なことに、複数の独立系プロバイダーを通じて呼び出し可能でした。このことが、p50 レイテンシの数値を逸話ではなく意味のあるものにしています。Step 5 Preview は9月20日に API を公開し、ソースはちょうど1つだけです。数日前に登場したばかりの単一ソースのエンドポイントは、本番経路に置ける最も予測しにくいコンポーネントです。それはモデルが悪いからではなく、その容量曲線をまだ誰も知らないからです。

これが、選ぶことではなくルーティングすることの根拠です。Gemini 3.1 Pro Preview は当社のカタログに $2.00 と $12.00 で掲載されており ティアの段階もそのまま反映され、比較対象となるモデルもその隣に並んでいます。200 以上のモデルを 1 つのキーで利用でき、プロバイダーの定価が 0% のマークアップでそのまま適用されます。Step 5 Preview はそのリストにはありません — これは StepFun 自身の API で動作しており、重みが公開されるまではそこが唯一の実行場所です。自動フェイルオーバーがあるからこそ、登場して数日のプレビュー版を賭けではなく安心して試せるのです。本番パスは実績のあるモデルに維持し、テキストと画像の大量処理は自社のトラフィックで評価している間は Step 5 Preview に送り、プレビューのエンドポイントが劣化したときはフォールバックに任せる。当社がルーティングするモデルには二つ目の契約も別個の SDK もありません。そのため Google の価格改定は、更新時ではなく現在の金額として請求書に反映されます。

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

実際に購入しているのはどちらですか

あなたの作業が動画、音声、ファイルとして届くなら、このページでそれを受け取れる唯一のモデルは Gemini 3.1 Pro であり、インデックスの差は判断材料にはならない。プレビューのラベルが付いたまま本番運用に7か月入っていることは、警告ではなく安定性のシグナルだ。命名規則が続いているのは、Google がそれを変える必要を一度も感じてこなかったからであり、このモデルは本番環境の主力として期待どおりに機能する。

あなたの作業が大量のテキストと画像で、大きな繰り返しコンテキストを伴うものであるなら、Step 5 Preview は重要なあらゆる指標で先行しています——インデックススコアは14ポイント、入力価格は半分、出力レートは4.4倍安く、料金ティアの崖はなく、キャッシュ割引はより厚く、初回トークンまでの時間は30秒ではなく数秒単位です。そこで手に入るのは、数日前にできた単一ソースのエンドポイントで、公開されたライセンスも公開された出力上限もありません。これは現実のリスクであり、範囲の限られたリスクでもあります。

注目すべきは指標ではない。StepFunが1Mトークンのコンテキストウィンドウと併せて出力上限を公表するかどうかだ。というのも、ベンダーの発表はこの点に触れておらず、リーク中に出回った別のサードパーティ構成では、コンテキスト350,000、出力上限64,000が記載されていたからだ。それは価格表に載っているものとは実質的に別の製品である。当社のカタログに記載されているGemini 3.1 Proの65K上限も、決して余裕があるわけではないが、明記されている。明記された上限なら、それを前提に設計できる。