生成的标题卡,标题为“Step 5 Preview vs Gemini 3.1 Pro——相隔七个月的两个预览版”,时间线标注 Gemini 3.1 Pro Preview 为 2026年2月19日,仍为预览版;Step 5 Preview 为 2026年9月20日,权重预计于10月15日发布。下方有两张卡片:Step 5 Preview,AA Index 44,输入文本和图像,首个 token 时间 2.96s;Gemini 3.1 Pro Preview,AA Index 30,输入文本、图像、音频、视频和文件,首个 token 时间 35.72s。页脚写着“两者均依据 Artificial Analysis Intelligence Index v4.3.2。”
Guides & Insights

Step 5 Preview 对比 Gemini 3.1 Pro:两个名为 Preview 的模型,相隔七个月

作者

Alistair Wren

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

无论是Step 5 Preview还是Gemini 3.1 Pro都带有preview这个词,但这个词在两者身上的含义并不相同。StepFun 于 2026 年 9 月 20 日发布了 Step 5 Preview,API 已开放,权重计划于 10 月 15 日发布,而 Hugging Face 上的一个 BF16 仓库里除了一个 .gitattributes。另一个一直以gemini-3.1-pro-preview 的形式在 API 中提供,并在每个排行榜上以“Gemini 3.1 Pro Preview”出现,自 2026 年 2 月 19 日起,处理生产流量已有七个月,这个标签从未摘掉。一个是尚未完成之物的真正预览版。另一个是贴在成品上的命名惯例。在同一坐标轴上比较二者,意味着要判断你实际购买的究竟是这两种东西中的哪一种;而二阶答案——七个月后仍被称为预览版的模型,是两者中更可预测的那个——才是值得带入采购决策的部分。

同一块告示牌上写着什么

Artificial Analysis 在 Intelligence Index v4.3.2 上对两者进行评分,共十项评估。这是唯一由同一方衡量这两者的地方,而所得结果之间的差距比双方厂商材料所暗示的还要大。

• 智能指数 — Step 5 Preview 44 对比 Gemini 3.1 Pro Preview 30

• 排名 — Step 5 Preview 在200个模型中位列第24名,对比 Gemini 3.1 Pro Preview 位列第69名

• 每 100 万 tokens 价格 — Step 5 Preview 输入 $1.00 / 输出 $2.70,对比 Gemini 3.1 Pro 输入 $2.00 / 输出 $12.00

• 缓存折扣 — Step 5 Preview 95% 对比 Gemini 3.1 Pro 90%

• 输出速度 — Step 5 Preview 99.8 tokens/秒,对比 Gemini 3.1 Pro 118.9 tokens/秒

• 首 token 时间 — Step 5 Preview 2.96 秒 vs Gemini 3.1 Pro 35.72 秒

• 上下文——两者均为 1M token;我们的产品目录中列出的 Gemini 3.1 Pro 输出上限为 65K,而 StepFun 尚未公布相应上限

• 输入模态 — Step 5 Preview:文本和图像。Gemini 3.1 Pro:文本、图像、音频、视频和文件。两者均仅输出文本

• 权重 — Step 5 Preview 今日关闭,BF16 检查点定于 10 月 15 日;Gemini 3.1 Pro 全程闭源

在一个榜首为 53 分的量表上,14 分的差距是很大的,而且它应当与令其显得反常的那件事一并报道:Google 自己公布的该模型评估数据非常出色。该厂商报告称,其在 ARC-AGI-2 上达到 77.1%,在多模态套件上达到 82.8%,在 GPQA Diamond 上为 94.1,在 Humanity's Last Exam 上为 47.0。这些数字并不弱。它们也是 Google 自己的,运行在 Google 的测试框架上,衡量的是具体能力,而非该指数所评分的总体综合表现。两组数字可以同时都是准确的。当厂商主推的评估结果与独立综合评分出现如此悬殊的分歧时,应以综合评分为准来规划生产工作负载,因为正是它针对厂商未选择衡量的方面对该模型进行扣分。

这两项速度指标值得放在一起解读,而不是分开来看。Gemini 3.1 Pro 一旦开始生成,生成 token 的速度快 19%——118.9 对 99.8——而启动需要 35.72 秒,相比之下 Step 5 Preview 为 2.96 秒。这是一个先深思熟虑再输出的模型的特征。对于没有人等待的批处理任务,更快的生成器在吞吐量上胜出。对于要进行数十次依赖调用的智能体循环,首 token 时间相差十二倍,就是交互式工具与排队等待之间的差别。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Gemini 唯一完胜的一个维度

在这场比较中,模态绝不是脚注。Gemini 3.1 Pro 接受文本、图像、音频、视频和任意文件,而 Step 5 Preview 接受文本和图像。如果你的流水线涉及屏幕录制、通话录音、PDF 文件包或视频流,那么这两个模型中只有一个能够接收输入,14 分的指数差距无关紧要,因为另一个模型根本无法回答该问题。

这种不对称性所决定的真实工作负载,比基准测试表所决定的更多。视频审阅、会议分析、音频转写加推理,以及基于扫描文件的文档工作流,都属于 Gemini 3.1 Pro 凭借其广度成为本页唯一候选方案的场景。这也解释了为什么该模型在预览标签下仍留在生产环境中长达七个月:它所承载的工作负载,正是更新的文本与图像模型无法取代的那些。

对于文本和图像工作,这笔账就反过来了。Step 5 Preview 在综合指标上领先 14 分,输入价格上大约快一倍,输出上便宜 4.4 倍,而且回答用时只有其十二分之一。在文档提取或围绕截图聊天的工作负载中,没有理由支付溢价,还要多等那十一秒的思考时间。

定价在哪些地方并不像看上去那么统一

表面价格低估了差距,原因在于档位界限,而非费率。

Gemini 3.1 Pro 的 $2.00 和 $12.00 适用于最多 200,000 个输入 token。超过该上限后,两档费率分别升至 $4.00 和 $18.00 —— 输出价格上涨 50%,且适用于整个请求,而不仅仅是超出分界线的部分。Step 5 Preview 的 $1.00 和 $2.70 没有公布分层价格;在上下文窗口允许的任何长度下,价格都是这个价格。

两款模型都宣称支持 100 万 token 的上下文,因此都邀请你构建长上下文流水线。在其中一款上,一个 30 万 token 的请求成本是价目表所显示的两倍;在另一款上则不是。这对 Step 5 Preview 来说是一个结构性优势,恰好落在 StepFun 打造它所针对的类别中——具有庞大且被反复引用的上下文的长时程智能体工作——而缓存折扣进一步放大了这一优势:在智能体循环产生的重复前缀模式下,Step 5 Preview 的 95% 对比 Gemini 3.1 Pro 的 90%,使差距进一步拉大。

粗略估算,并标明这是算术推算而非引用的数字:一个智能体循环,如果在四十轮中的每一轮都发送 250,000 个 token 的上下文,那就是一千万个输入 token。按照 Gemini 3.1 Pro 超过 200K 的费率,缓存吸收了重复的前缀,这比 $2.00 的标价费率所暗示的要高出不少。按照 Step 5 Preview 统一的 $1.00 价格以及更深的缓存折扣,同样的循环成本更低,更重要的是,其成本可以直接从价目表预测,而无需先查看分层表格。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

现货是无声的差别

Gemini 3.1 Pro 已经可以通过 Google 的 API 调用长达七个月,而且对规划而言更有用的是,它还能通过多个独立供应商调用——这正是 p50 延迟数据之所以有意义而非仅属轶事的原因。Step 5 Preview 于 9 月 20 日开放了其 API,且只有一个来源。一个刚上线几天、仅有单一来源的端点,是你能放到生产路径上的最不可预测的组件——不是因为模型不好,而是因为还没有人了解它的容量曲线。

这就是主张路由、而非做单一选择的理由。Gemini 3.1 Pro Preview 已收录在我们的目录中,价格为 $2.00 和 $12.00,分级阶梯原样透传,与它同台对比评测的模型就列在它旁边,一个密钥即可访问 200 多个模型,供应商标价按 0% 加价透传。Step 5 Preview 不在那份名单上——它运行在 StepFun 自家的 API 上,在权重发布之前,那是它唯一能运行的地方。自动故障转移正是让一个才上线几天的预览版可以被放心试用、而非一场赌博的原因:让生产路径留在有实绩的模型上,把文本与图像的批量流量交给 Step 5 Preview,同时用你自己的流量对它做评估,当预览端点性能劣化时由回退兜住。对于我们实际路由的模型,没有第二份合同,也没有单独的 SDK,所以 Google 调价会以当前数字直接出现在你的账单上,而不是等到续约时才体现。

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

你实际买的是哪一个?

如果你的工作以视频、音频或文件形式呈现,Gemini 3.1 Pro 是本页唯一能接收它的模型,而索引差距并不会影响这一决定。在生产环境中运行七个月后仍保留预览标签,这是一种稳定性信号,而非警告:这种命名惯例之所以延续,是因为 Google 从未需要改变它,而该模型也正如其作为生产主力应有的表现。

如果你的工作是以大规模、带有大量重复上下文的文本和图像为主,那么 Step 5 Preview 在所有真正重要的指标上都领先——14 个指数点、输入价格只有一半、输出费率便宜 4.4 倍、没有档位断崖、更深的缓存折扣,以及以秒而非半分钟计的首 token 时间。你在那里买到的是一个仅上线数天、单一来源的端点,既没有公布许可证,也没有公布输出上限;这确实是风险,但是一种有边界的风险。

值得关注的并非指数。关键在于 StepFun 是否会在 100 万 token 上下文窗口之外同时公布输出上限,因为厂商公告对此只字未提,而泄露期间流传的一份第三方配置显示为 350,000 上下文加 64,000 输出上限——这与价目表上的产品有实质差异。按我们目录所列,Gemini 3.1 Pro 的 65K 上限也谈不上宽裕,但它是明示的,而明示的限制才是你可以据此设计的限制。