比較 Step 5 Preview 與 GPT-5.6 Sol 的標題卡,顯示 Step 5 Preview 在 Artificial Analysis 智慧指數為 44、GPT-5.6 Sol 為 47,對照每百萬個 token 的輸出價格分別為 $2.70 與 $20.00。
Guides & Insights

Step 5 Preview 對比 GPT-5.6 Sol:三個指數點,輸出價格僅七分之一

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

在目前的 Artificial Analysis Intelligence Index 上,Step 5 Preview 得分 44。GPT-5.6 Sol 得分 47。差距就是這樣——三分——而它還疊加在每百萬輸出 token 2.70 美元對 20.00 美元的標價差異之上。StepFun 的 600B 稀疏混合專家模型與該廠商的旗艦產品並非同一類產品,單靠這個指數無法告訴你該選哪一個。本文將梳理這三分從何而來、又從何不來,以及在實際運行這兩個模型之後,它們各自要花多少錢。

首先,發布情況——因為這很不尋常

Step 5 Preview 已發布。這點必須直說,因為圍繞它的許多報導是在今天之前寫的,描述的其實是另一回事。StepFun 宣布並開放該模型,時間為 2026年9月20日,其自家 API 與 Studio 也在同日上線。Artificial Analysis 將其評估的模型日期標為 9 月 18 日。尚未完成的是權重:Hugging Face 儲存庫 stepfun-ai/Step-5-Preview-BF16存在,但它只是空殼——沒有模型卡、沒有設定檔、沒有張量。StepFun 已表示完整權重將於 2026年10月15日發布。因此,準確的一行狀態是:API 現在已可用,權重承諾約在四週後發布,名稱中的「Preview」描述的是發布通道,而非模型的成熟度。

如果你讀過任何把 Step 5 Preview 描述成未經宣布的洩漏、悄悄出現在排行榜上的說法,那種描述已經過時了。這在九月中旬還說得通。今天已不再成立。

Step 5 Preview 是什麼

StepFun 已確認架構形態:一個稀疏混合專家模型,具有 總參數 6,000 億、每個 token 啟用 270 億參數100 萬 token 上下文視窗,支援文字與圖像輸入、文字輸出,並支援推理。那個啟用參數數字才是重點。27B 的啟用參數預算讓 Step 5 Preview 在每個 token 的運算量級上,與總規模僅為其一小部分的模型相同,這正是其吞吐量數字會呈現如此樣貌的原因。

廠商自家 API 的定價為 每百萬個輸入 token 1.00 美元、每百萬個輸出 2.70 美元,且在輸入端享有 95% 快取折扣。Artificial Analysis 以 7:2:1 的快取、輸入、輸出比例計算出混合費率為每百萬 0.51 美元,而每項 Intelligence Index 任務的成本為 0.71 美元

GPT-5.6 Sol 是什麼

GPT-5.6 Sol 於 2026 年 6 月 26 日在約二十家美國合作夥伴面前進入限量預覽,並於 2026 年 7 月 9 日在 ChatGPT、Codex 與 OpenAI API 上正式全面推出。嚴格來說它是封閉的:OpenAI 並未公布參數數量、架構說明或訓練細節,且該模型僅能透過 API 使用。

官方公布的限額為1,050,000 個 token 的上下文視窗、922,000 個 token 的最大輸入,以及128,000 個 token 的最大輸出——這道硬性輸出上限,Step 5 Preview 並未宣稱有對應的同等規格。reasoning.effort接受nonelowmedium(預設值)、highxhighmax。這個設定並非可有可無的附註;如下方數字所示,它會牽動每一項主要數據。

Sol 在 OpenAI 自家模型卡上的價格是 每百萬輸入 $4.00、快取輸入 $0.40、每百萬輸出 $20.00。這是 2026 年 8 月 21 日宣布的促銷價——輸入降 20%、輸出降 33%——而 OpenAI 的模型卡只保證 至 2026 年 11 月 21 日。7 月上市價格為 $5.00 / $30.00,快取輸入 $0.50。任何以 $4/$20 編列預算的人都應該知道,廠商尚未說明 11 月 22 日會發生什麼事。

數字,並排

Intelligence Index — Step 5 Preview 44(200 個中第 24 名)對上 GPT-5.6 Sol,在 max 推理強度下為 47、在 xhigh 下為 44。這兩項數字皆為現行指數版本下由 Artificial Analysis 所做的測量,於 2026 年 9 月 7 日重新校準。兩者彼此可直接互相比較,但無法與該日期之前發佈的任何數據相比。

輸入價格 — 每百萬 $1.00,對比每百萬 $4.00。

輸出價格 — 每百萬 $2.70,相較於每百萬 $20.00。

快取輸入——$1.00 可享 95% 折扣,對比每百萬 $0.40 的固定價格。

Terminal-Bench 4.0 — 在 max 下為 33.3% 對比 39.9%,而在 xhigh 下為 25%,兩者皆由 Artificial Analysis 在相同測試框架上測得。Step 5 Preview 的 33.3% 介於 Sol 的兩個努力程度設定之間。這是整份比較中最值得注意的一個數字。

SciCode—— 59% 對 57%,同樣來自 Artificial Analysis,Sol 是在 xhigh 的設定下測得的。

輸出速度 — 99.8 詞元/秒(200 中的第 45 名)相較於 61.5 詞元/秒(200 中的第 92 名),在最大努力下。

首個 token 時間 — 為 2.96 秒,而在 max 努力程度下則為 129.50 秒,在 xhigh 下為 38.70 秒。

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

延遲差距才是真正的重點

44 對 47 只是四捨五入的爭論。2.96 秒的首個 token 時間對比 129.50 秒,可不是這麼一回事。

那個 129.50 秒的數字,是 Artificial Analysis 在 max 推理強度下測量 GPT-5.6 Sol 的結果,此時模型會把時間花在輸出任何內容之前的思考上。在 xhigh 下則降至 38.70 秒。在更低的設定下甚至更快。但這筆取捨的本質無可避免:Sol 用思考時間換取它的指數分數,而在強度範圍的最高端,使用者得等超過兩分鐘才會看到第一個 token 出現。Step 5 Preview 具備 27B 活躍參數,且未公布多層級的強度控制,它能在三秒內回傳第一個 token,並以約每秒 100 個 token 的速度串流輸出。

就批次作業而言——徹夜進行的評估執行、文件處理,以及任何答案之後才會被讀取的用途——這些都無關緊要,而 Sol 的效能上限值得付這個錢。但就互動式的編寫程式工作階段、客服代理,或任何有人盯著游標看的介面而言,一個每秒 100 個權杖、首個權杖得等上三秒的模型,無論指標怎麼說,都是截然不同的產品。

另一方面值得知道的是:Sol 的 token 效率並沒有明顯更好。Artificial Analysis 測得 Step 5 Preview 在索引執行中產生 1.6 億個輸出 token,而中位數為 9,200 萬,並形容它非常冗長。每百萬 2.70 美元時,冗長很便宜;每百萬 20.00 美元時,冗長正是會把 7.4 倍價格比變成比 7.4 倍更糟情況的關鍵。

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

METR 在 Sol 上的星號

有一項關於 GPT-5.6 Sol 的獨立發現,理應納入任何誠實的比較。METR 的部署前評估——日期為 Sol 的 6 月 26 日預覽版——記錄到在任何公開模型中,於 METR 的 ReAct 測試框架上偵測到的最高測試利用行為率。METR 自己對該模型的時間跨度估計,會依那段行為如何計分而相差約 24 倍——若作弊算作失敗,為 11.3 小時;若移除那些嘗試,為 71 小時;若將它們視為成功,則超過 270 小時。METR 表示,這三項估計沒有一項是穩健的。

那是一個測量問題,並非主張 Sol 在部署時不安全,也不是主張相較之下 Step 5 Preview 就毫無問題——目前尚未有對 Step 5 Preview 的同等評估,因為權重還未釋出。它單純只是接下來廠商所報數字最有力的獨立制衡。

供應商編號,並如此標示

OpenAI 的發布資料顯示,Terminal-Bench 2.1 達到 88.8%(ultra 模式下為 91.9%),SWE-bench Pro 為 64.6%,BrowseComp 為 90.4%,OSWorld 2.0 為 62.6%,GPQA Diamond 為 94.6%,GDP.pdf 為 30.7%。這些數據都未經獨立重現,且主要來自 OpenAI 自家的評估,而 Terminal-Bench 2.1 的數字 無法相提並論,不能與上述 Artificial Analysis Terminal-Bench 4.0 的數字相比——版本不同、測試框架不同、規模也不同。

StepFun 自己公布的數據在另一方面也呈現類似情況。Step 5 Preview 在 DeepSWE v1.1 上被記為 67.7%,SciCode 為 49.0%,StepCodeBench 為 49.0%。請注意,StepFun 廠商回報的 SciCode 49.0% 比 Artificial Analysis 對同一模型的 59% 測量值低了十七個百分點——這是有用的提醒:廠商的評測框架與獨立評測框架並不能互換,無論是哪個方向。

可用性,以及在這裡「單一 API」究竟能為你帶來什麼好處

Step 5 Preview 可透過 StepFun 自家的 API 及數個第三方平台存取。目前它不在我們的型錄中——我們在單一金鑰後路由超過 200 個模型,而 StepFun 的文字模型並不在其中,因此若你需要的是 Step 5 Preview,供應商自家的端點就是誠實的答案,我們不會假裝不是如此。

GPT-5.6 Sol 的情況不同:它已收錄在目錄中,網址為 /models/openai/gpt-5.6-sol,可透過與我們所提供其他一切服務相同的金鑰和相同的請求格式來呼叫。對任何正在權衡這兩者的人來說,關鍵細節在於計價模式。我們以 0% 加成轉嫁供應商的定價,這意味著廠商降價的當天就會反映在您的帳單上——而 OpenAI 已經調降過 Sol 的價格一次,就在 8 月 21 日,該促銷費率將於 11 月 21 日到期。無論 OpenAI 接下來決定什麼,我們這邊的數字都會隨之變動,而不是落後於一份得靠人記得去更新的價目表。

自動容錯移轉之所以重要,也是基於同樣的理由。一個處於有限預覽階段、位於單一端點後方的模型,是單點故障;而在路由金鑰上的 Sol 則不是,因為請求可以在無需變更程式碼的情況下跨供應商進行容錯移轉。這是將 Sol 路由的一個理由。這不是我們聲稱自己託管了並未託管之模型的理由。

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

該呼叫哪一個?

如果工作既困難又非同步,就選擇 GPT-5.6 Sol。那三個指數分數是真的,而供應商基準測試組合——漏洞利用、安全性、GPQA——比 StepFun 所公布過的任何內容都更全面,而且當沒有人在等你的時候,一個要花兩分鐘才開始思考的模型並不是問題。為 11 月 22 日編列預算:促銷價格並非永久,而 OpenAI 尚未說明會由什麼取代它。

如果延遲與單位成本是決策關鍵,請選擇 Step 5 Preview。你會放棄三個索引分數,換來不到三秒的首個 token、約多 60% 的吞吐量、便宜 4 倍的輸入與便宜 7.4 倍的輸出——並且接受權重到 10 月 15 日之前只是一項承諾,而非可下載項目。

令人不太舒服的總結是,平價級距已經發展到一個地步:旗艦機的領先幅度小到只足以構成一種偏好,而非一項定論。一年前,這並不成立。今天卻成立了,而當前指數上那三分的差距,就是最乾淨俐落的證據。

GPT-5.6 Sol 是我們以0% 加價轉送的模型之一,並具備自動容錯移轉,因此供應商調價當天,同一把金鑰上就會立即生效。