產生的標題卡標題為「Step 5 Preview 對比 Gemini 3.1 Pro —— 相隔七個月的兩個預覽版」,時間軸標示 Gemini 3.1 Pro Preview 於 2026 年 2 月 19 日,仍為預覽版,以及 Step 5 Preview 於 2026 年 9 月 20 日,權重預計 10 月 15 日發布。下方有兩張卡片:Step 5 Preview,AA 指數 44,輸入文字與圖像,首個 token 時間 2.96 秒;Gemini 3.1 Pro Preview,AA 指數 30,輸入文字、圖像、音訊、影片與檔案,首個 token 時間 35.72 秒。頁腳寫著「兩者均依據 Artificial Analysis Intelligence Index v4.3.2。」
Guides & Insights

Step 5 Preview 與 Gemini 3.1 Pro:兩款名為 Preview 的模型,相隔七個月

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩者Step 5 PreviewGemini 3.1 Pro都帶有preview 這個詞,而這個詞在兩者身上意思並不相同。StepFun 於 2026 年 9 月 20 日宣布 Step 5 Preview,API 已開放,權重預定於 10 月 15 日發布,而 Hugging Face 上的 BF16 儲存庫裡,除了 .gitattributes 之外空無一物。另一個自 2026 年 2 月 19 日起,就以 gemini-3.1-pro-preview 的形式在 API 中提供,並在每個排行榜上以「Gemini 3.1 Pro Preview」之名出現,處理正式流量長達七個月,標籤卻從未卸下。一個是對尚未完成之物的真正預覽。另一個則是附加在已完成產品上的命名慣例。在同一條軸線上比較兩者,意味著要決定你實際上買的是這兩者中的哪一種;而二階答案——那個在七個月後仍被稱為 preview 的模型,才是兩者中較可預測的一方——正是值得帶進採購決策的那部分。

同一個看板上寫著什麼

Artificial Analysis 以 Intelligence Index v4.3.2 對兩者進行評分,共十項評估。這裡是唯一由同一方衡量這兩者的地方,而結果的差距比雙方各自的廠商資料所暗示的還要大。

• 智慧指數 — Step 5 Preview 44 對比 Gemini 3.1 Pro Preview 30

• 排名 — Step 5 Preview 在 200 個模型中排名第 24,對比 Gemini 3.1 Pro Preview 在 200 個模型中排名第 69

• 每 100 萬個 token 的價格 — Step 5 Preview 輸入 $1.00 / 輸出 $2.70,相較於 Gemini 3.1 Pro 輸入 $2.00 / 輸出 $12.00

• 快取折扣 — Step 5 Preview 95% 對比 Gemini 3.1 Pro 90%

• 輸出速度 — {{1}}Step 5 Preview{{/1}} 每秒 99.8 個 token,對比 {{2}}Gemini 3.1 Pro{{/2}} 每秒 118.9 個 token

• 首個 token 時間 — Step 5 Preview 2.96 秒 vs Gemini 3.1 Pro 35.72 秒

• 上下文 — 兩者皆為 1M token;我們的目錄列出 Gemini 3.1 Pro 具有 65K 輸出上限,StepFun 尚未公布。

• 輸入模態 — Step 5 Preview:文字與圖像。Gemini 3.1 Pro:文字、圖像、音訊、影片與檔案。兩者皆僅輸出文字

• 權重 — Step 5 Preview 今日關閉,BF16 檢查點預定於 10 月 15 日;Gemini 3.1 Pro 則全程皆為專有。

在一個最高分為 53 分的量表上,14 分的差距很大,而且應該和讓這個差距顯得奇怪的那件事並列說明:Google 自己為這個模型公布的評測數字非常出色。該供應商報告的數字是:ARC-AGI-2 77.1%、其多模態套件 82.8%、GPQA Diamond 94.1 分,以及 Humanity's Last Exam 47.0 分。這些都不是疲弱的數字。它們同樣是 Google 自家的數字,是在 Google 的測試框架上跑出來的,而且衡量的是特定能力,而不是該指數所評分的總合分數。這兩組數字可以同時都是準確的。當供應商的重點評測與獨立綜合指標出現如此劇烈的分歧時,應該以這個綜合指標來規劃生產工作負載,因為它正是會因為供應商未選擇衡量的那些項目而對模型扣分的那一個。

這兩列速度數據值得一起看,而不是分開看。Gemini 3.1 Pro 一旦開始生成 token,速度就快 19%——118.9 對上 99.8——而且需要 35.72 秒才會開始,相較之下 Step 5 Preview 只需 2.96 秒。這正是模型會先反覆推敲再輸出的特徵。對於人類無須等待的批次工作,較快的生成器在吞吐量上勝出。對於會發出數十個相依呼叫的 agent 迴圈,首個 token 時間相差十二倍,就是互動式工具與佇列之間的差別。

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Gemini 唯一完勝的面向

模態在這項比較中並非註腳。Gemini 3.1 Pro 接受文字、圖像、音訊、影片與任意檔案,而 Step 5 Preview 只接受文字與圖像。如果你的流程涉及螢幕錄影、通話錄音、PDF 文件包或影片串流,這兩個模型中只有一個能接收這類輸入,而 14 分的指數差距也就無關緊要,因為另一個模型根本無法回答這個問題。

這種不對稱性能決定的真實工作負載,比基準測試表還多。影片審查、會議分析、音訊轉錄加推理,以及以掃描檔案為基礎的文件工作流程,都是 Gemini 3.1 Pro 的廣度讓它成為本頁唯一候選者的情況。這也是為什麼這個模型能在預覽標籤下留在生產環境長達七個月:它所承載的工作負載,正是較新的文字與圖像模型無法取代的。

對於文字與圖像工作,盤算會反轉。Step 5 Preview 在綜合評分上領先 14 分,在輸入方面約快兩倍,輸出價格則便宜 4.4 倍,而且回答時間只要十二分之一。在文件擷取或透過螢幕截圖聊天的工作負載中,沒有理由支付溢價,還要多等那十一秒的思索時間。

定價比表面上看起來更不均一的地方

表面價格低估了其中的差異,而原因在於級距分界,而非費率。

Gemini 3.1 Pro 的 $2.00 與 $12.00 費率適用於最多 200,000 個輸入 token。超過此上限後,兩種費率分別跳升至 $4.00 與 $18.00——輸出部分調漲 50%,且適用於整筆請求,不只是超過門檻的那一部分。Step 5 Preview 的 $1.00 與 $2.70 沒有公佈級距;在上下文視窗允許的任何長度下,價格都相同。

兩款模型都宣稱具備 100 萬 token 的上下文,因此都鼓勵你打造長上下文管線。在其中一款上,30 萬 token 的請求費用是指價表的兩倍;在另一款上則不會。這正是 Step 5 Preview 的一項結構性優勢,而且恰好落在 StepFun 為它打造的分類中——具備龐大且反覆引用上下文的長時程代理式工作——這項優勢還因快取折扣而進一步放大:Step 5 Preview 的 95% 對上 Gemini 3.1 Pro 的 90%,在代理迴圈產生的重複前綴模式下,使差距更加擴大。

粗略估算下來,並標明這是算術推算而非引用的數字:一個代理迴圈在四十輪中的每一輪都送出 250,000-token 的上下文,就是一千萬個輸入 token。以 Gemini 3.1 Pro 超過 200K 的費率計算,且由快取吸收重複的前綴,這比 $2.00 定價費率所暗示的金額明顯高出一截。在 Step 5 Preview 固定 $1.00 加上更深的快取折扣下,同一個迴圈成本更低,更重要的是,其成本可以直接從價目表預測,而不必先閱讀分級表。

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Gemini 3.1 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, time to first token 2.96s, context 1M tokens with no published output cap, and input text and image. The right column gives Gemini 3.1 Pro Preview the rows AA Index 30, price $2.00 / $12.00, $4.00 / $18.00 above 200K input, cache discount 90%, time to first token 35.72s, context 1M tokens with a max output of 65K, and input text, image, audio, video and file. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; Gemini ARC-AGI-2 and multimodal figures are vendor-reported.'

可用性,就是那無聲的差異

Gemini 3.1 Pro 已經可以透過 Google 的 API 呼叫長達七個月,而且對規劃來說更實用的是,還能透過多個獨立供應商取用——這正是讓 p50 延遲數據具有意義、而非只是軼事的原因。Step 5 Preview 於 9 月 20 日開放其 API,而且只有一個來源。一個才推出幾天、僅有單一來源的端點,會是你放到生產路徑上最難以預測的元件,這不是因為模型不好,而是因為還沒有人知道它的容量曲線。

這就是主張「路由」而非「挑選」的論點。 Gemini 3.1 Pro Preview 已在我們的目錄中,價格為 $2.00 與 $12.00,分級級距原樣轉嫁,而與它相互比較的模型就並列在旁,透過單一金鑰即可取用超過 200 個模型,並以供應商定價 0% 加成原樣轉嫁。Step 5 Preview 不在那份清單上——它跑在 StepFun 自家的 API 上,而在權重釋出之前,那是它唯一能運行的地方。自動容錯移轉正是讓推出僅數日的預覽版得以安全試用、而非一場賭注的關鍵:把正式環境路徑留在有實績的模型上,在你以自己的流量評估期間,將文字與影像的大量工作負載送往 Step 5 Preview,並在預覽端點效能退化時由備援接手。對於我們確實有路由的模型,沒有第二份合約,也沒有另立的 SDK,因此 Google 調整價格時,會以最新數字直接反映在你的帳單上,而不是等到續約時才變動。

Screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview at www.orcarouter.ai/models/google/gemini-3.1-pro-preview, showing the model id google/gemini-3.1-pro-preview with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context, a 65K max output and text output, input pricing of $2.00 and output pricing of $12.00 per million tokens, a p50 time to first token of 10.00 seconds, 109.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

你實際上買的是哪一個?

如果你的工作是以影片、音訊或檔案形式送達,Gemini 3.1 Pro 是這個頁面上唯一能接收這些內容的模型,而索引差距不會納入決策考量。在正式環境中運作七個月、仍掛著 preview 標籤,這是穩定性的訊號,而不是警訊:命名慣例之所以沿用,是因為 Google 從不需要改變它,而這款模型的表現,也正如它作為生產主力應有的樣子。

如果你的工作是大量文字與圖片,而且伴隨龐大且重複的上下文,那麼 Step 5 Preview 在每一項重要指標上都勝出——領先 14 個指數點、輸入價格只要一半、輸出費率便宜 4.4 倍、沒有級距斷崖、快取折扣更深,而且首個 token 的等待時間以秒計,而非半分鐘。你在那裡買到的,是一個才上線幾天、單一來源的端點,既沒有公布授權條款,也沒有公布輸出上限,這是真實存在的風險,但也是有明確範圍的風險。

需要注意的不是指數,而是 StepFun 是否會在公布 1M-token 上下文視窗的同時,也一併公布輸出上限,因為該供應商的公告對此隻字未提,而洩漏期間流傳的另一份獨立第三方配置列出 350,000 上下文與 64,000 輸出上限——這與價目表上的產品有實質上的不同。依我們目錄所列,Gemini 3.1 Pro 的 65K 上限也不算寬裕,但它是明確列出的;而明確列出的限制,才是你可以據以設計的限制。