一張為「GPT-5.6 Sol Ultrafast 對比 GPT-5.6 Sol」生成的 Hero 標題卡,上方標語為「相同權重,不同服務層級」,並有兩張卡片:左側為「GPT-5.6 Sol Ultrafast」,列出硬體:Cerebras 晶圓、速度:最高 750 tok/s、價格:尚未公布;右側為「GPT-5.6 Sol」,列出硬體:GPU 叢集、速度:標準、價格:$4.00 / $20.00;頁腳為「兩者執行完全相同的 GPT-5.6 Sol 檢查點。」右下角為 OrcaRouter 標誌。
Guides & Insights

GPT-5.6 Sol Ultrafast 對比 GPT-5.6 Sol:相同權重,不同服務層級

作者

Alistair Wren

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-5.6 Sol Ultrafast 不是新模型,這也不是一則發表新聞。供應商在 2026 年 8 月 13 日宣布了這個模式,而同一天,值 ultrafast 就出現在該公司公開的 OpenAPI schema 中,位於規格的 ServiceTierResponses 說明裡——而該說明以其自身措辭,將這個層級限定於 gpt-5.6-sol 端點,並標示它受存取控管。真正讓這個頁面重新回到我們佇列的原因更小、也更具體:2026 年 9 月 25 日,提交 fe4f7a1 將該值擴展到另外兩個列舉中,分別是請求層級的 service-tier 參數與代理 service-tier 政策欄位。宣布六週之後,這個層級仍列在候補名單上,仍沒有公布價格,而如今它已被接進比它實際能服務的範圍更多的 API 介面。GPT-5.6 Sol Ultrafast 與 GPT-5.6 Sol 是同一個模型;這個比較唯一能決定的是:誰掌控那個指標,以及誰已經告訴你成本是多少。

所以標題裡的這場對決很不尋常。GPT-5.6 Sol Ultrafast 和 GPT-5.6 Sol 是同一個模型。相同的權重、相同的檢查點、相同的推理行為、相同的 105 萬 token 上下文視窗、相同的 128K 最大輸出、相同的答案。OpenAI 自己的說法是「每秒更有用的工作量」,而不是更聰明的模型。這項比較的兩欄之間唯一不同之處,在於 token 的產生方式,以及你的請求主體中這個層級叫什麼名稱——這讓它成為目前產品陣容中最乾淨的對照實驗,同時也是最難比價選購的一個,因為這兩個層級其中一個完全沒有公布價格。

這週究竟有什麼改變

9 月變更的證據是一筆提交,而不是一篇部落格文章。{{1}}OpenAI 維護 openai-openapi,這個儲存庫發布其 API 的機器可讀結構描述,而日期為 2026-09-25 的提交 fe4f7a1 將 ultrafast 加入兩個列舉:附加到 agents 的服務層級政策,以及規格描述為「用於模型請求的服務層級」的請求層級欄位。{{/1}}那是擴充,不是首次登場:在此提交之前,這兩個清單列的是 auto、default、flex、priority、fast,而且該層級自 8 月 13 日起就已經在結構描述中。這個提交值得注意,因為它觸及的是哪個欄位——{{2}}設定 agent 時所用的政策欄位,這與逐請求覆寫是不同的介面。{{/2}}

真正重要的說明可追溯至8月13日的提交,而不是這一個,而且它是OpenAI迄今在任何地方針對該層級所發表過最具體的說明。除了這個新值之外,規格中寫道:「若設為『ultrafast』,則請求將透過受存取控制的Ultrafast Processing服務層級來處理。此層級目前可供gpt-5.6-sol使用;透過它提供的回應會顯示service_tier=ultrafast。」

把那句話讀兩遍,因為它解決了這個比較頁面否則就必須含糊帶過的兩個問題。這個層級僅限於一個模型——GPT-5.6 Sol 旗艦版,產品陣容中再無其他——而且它受到存取控制,而非開放式,這與 OpenAI 將其定位為候補名單式預覽的說法相符。它也告訴你,你要如何知道自己取得了該層級:回應會回報實際由哪個層級處理該請求,因此,退回標準處理的情況會顯示在回應主體中,而不是你得從延遲推斷出來的事情。同樣的描述同時出現在標準與 Beta Responses 的結構定義中,而且自 8 月 13 日起便是如此。

A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."

隔天又出現了第二個較弱的訊號。9 月 26 日的一則報導描述了即將登陸 Responses API Playground 的新「速度」選擇器——Fast、Standard 與 Ultrafast——並預期在 OpenAI 的 DevDay 開發者大會之後,Ultrafast 將有更廣泛的可用性。我們本身並未見過該選擇器,OpenAI 也未發布任何推出說明,因此應將其視為單一來源的報導,而非已正式推出的功能。目前可查證的部分,是公開結構描述中的兩處,以及該層級至今仍未出現任何價目表這一事實。

哪些部分沒有改變,同樣重要。目前仍然沒有 Ultrafast 的價格。OpenAI 的定價頁面於 9 月 27 日檢視時,仍包含它先前就有的四個分頁——Standard、Batch、Flex 和 Fast——而「ultrafast」這個字串在該頁面上任何地方都沒有出現。存取權仍被描述為僅限特定客戶的限量預覽,並隨容量成長而擴大。這個層級同時存在於合約中,又不在價目表上,而這就是它真實的狀態。

兩個層級,並排

由於沒有一項能力能區分這兩者,比較幾乎完全集中在服務與計費上。以下每一行都將雙方放在同一列。

• 模型 — GPT-5.6 Sol Ultrafast 所執行的 GPT-5.6 Sol 檢查點,與 GPT-5.6 Sol 標準處理完全相同:相同檢查點、無蒸餾、無規模縮減。

• 輸出吞吐量——每秒最多 750 個輸出 token,最高可達標準的 14 倍;根據 OpenAI 8 月 13 日的公告,這是相較於在 GPU 叢集上進行的標準 GPT-5.6 Sol 處理,而後者正是 14 倍所依據的比較基準。

• 硬體——Cerebras 晶圓級晶片,權重常駐於晶片內建 SRAM,這是 OpenAI 於 2026 年 1 月與 Cerebras 展開運算合作後的首項產品,據報導該合作三年價值約 100 億美元;相較之下,傳統 GPU 推論有大部分時間都耗費在記憶體與運算單元之間搬移權重。

• 價格 —— 截至 2026 年 9 月 27 日尚未公布,對比 OpenAI 目前的促銷價:每百萬個 token 輸入 $4.00/輸出 $20.00,另加快取輸入每百萬個 token $0.40。

• 可用性 — 需排隊候補的限量預覽(僅限特定客戶),對比預設通道(任何持有 API 金鑰的人皆可呼叫)。

• 你收到的回覆 —— 原則上相同 vs 原則上相同;若它們在同一個提示上出現分歧,那是一項發現,不是一項功能。

A generated two-column scoreboard titled 'GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol — the scoreboard'. Left column 'GPT-5.6 Sol Ultrafast': Checkpoint same as Sol, Serving hardware Cerebras wafers, Output speed up to 750 tok/s, Speed vs standard up to 14x, Price not published, Access waitlisted preview. Right column 'GPT-5.6 Sol': Checkpoint same as Sol, Serving hardware GPU clusters, Output speed standard processing, Speed vs standard 1x baseline, Price $4.00 / $20.00, Access open to any API key. Footer sourcing line; OrcaRouter logo bottom-right.

速度宣稱,以及其上限

這個頭條數字是 14 倍,它值得和本頁其餘內容獲得同等程度的審慎對待。OpenAI 表示,相較於標準處理,最高可達每秒 750 個輸出 token——這是針對輸出 token 的吞吐量數字,而非聲稱每個請求都能提早 14 倍完成。端到端時間還包含輸入處理與模型本身的推理,而晶圓級硬體並不會以相同比例壓縮這兩者。這就是為什麼該公司將 14 倍標示為最大值,而非實測結果。

這些已發布的比較數據,表格兩邊都是廠商自行提報的,而且其中一項還橫跨兩家廠商的技術堆疊。一次包含 2,500 道題目的 Humanity's Last Exam 執行,據報導在 Ultrafast 上以 11 小時 11 分鐘完成,相較之下 Claude Fable 5 需 78 小時 27 分鐘,且準確度相當——這意味著是 OpenAI 與 Cerebras 在告訴我們一項包含競爭對手模型的基準測試結果,而針對該發布的獨立報導則引述了同一輪執行中較狹義、約 11× 的生成速度比較,同時 Cerebras 自己的數據暗示總測試時間約為 7×。14×、11× 與 7× 之間的落差並非矛盾;而是三方衡量同一項工作負載不同部分時會出現的結果。Cerebras 另外報告在 GDP-Val 上達到 5.6× 端到端加速,且無可量測的品質損失。這些結果都尚未被第三方重現。

價目表上有個洞。

這裡正是這兩個層級不再對稱的地方。GPT-5.6 Sol 有四份已公開的費率表,而 Ultrafast 不在其中。

• 標準 GPT-5.6 Sol — 每百萬個權杖 $4.00 / $20.00,快取輸入為 $0.40,且當輸入超過約 272K 個權杖後,適用長上下文級距 $8.00 / $30.00。

• 快速模式 — $8.00 / $40.00,正好是標準費率的兩倍。這是於 2026 年 7 月 30 日從優先處理重新命名的層級,而 API 接受 service_tier: "priority" 或 service_tier: "fast"。它能提升最高約 2.5 倍的輸出速度。

• Batch and Flex — $2.00 / $10.00,較標準方案一律五折,以換取較寬鬆的排程。

• 超高速 —— 沒有費率表。這不是我們用猜測填補的空白;而是 OpenAI 留下的空白。

那條 Fast-mode 的價格列,是任何人唯一能拿來替 Ultrafast 定價的真正先例,而對任何正在規劃預算的人來說,這先例令人警醒:OpenAI 唯一真正給出數字的效能等級,價格正好是標準費率的兩倍,換來兩倍半的速度。Ultrafast 是更大的速度承諾,卻建立在更稀缺的硬體上——Cerebras 的晶圓產能可不是隨處可得的大宗商品——因此最終溢價的方向毋庸置疑。有疑問的是幅度。在費率表問世之前,你在任何地方看到的任何「GPT-5.6 Sol Ultrafast 價格」數字,都是某人的推論,包括我們自己的推論在內。

你實際上會怎麼稱呼它

結構描述變更會告訴你最終呼叫的樣貌。如果這個層級遵循其他層級的模式,它會以你已經在發出的請求上一個額外欄位的形式出現:你保留 model gpt-5.6-sol、保留你的提示,並加入層級選擇器——就像今日選用 Fast 模式的方式,是把 priority 換成 fast。你的回應解析完全不用改變,因為模型本身完全沒變。這正是服務層級相較於更換模型的全部吸引力所在,也是像這樣的比較頁面幾乎沒什麼好比較的原因。

今天你無法做的是呼叫它。列舉值確實存在;但對大多數帳戶而言,它背後的容量並不存在。因此,接下來幾週的實際問題不是該選這兩層中的哪一層——而是在這項選擇尚不可用時,該執行什麼。

這個問題,閘道器比候補名單更能給你答案。該模型的標準層級現在已在 OrcaRouter 上線,代號 openai/gpt-5.6-sol,以供應商自家的價格提供服務,代幣零加成,並透過 api.orcarouter.ai/v1 這個相容於 OpenAI 的端點提供——因此 OpenAI 的促銷價 $4 / $20 及其長上下文階梯價 $8 / $30 都是直接轉嫁,而非由我們重新定價,而這些價格若有變動,OpenAI 端生效的當天就會反映到我們這裡。同一把金鑰還能存取200+ 個模型,這點在此比平時更為重要:因為你無法設定 service_tier: "ultrafast" 就得到回應,如今要買到低延遲的做法是改變工作路由的方式——把互動式呼叫送到型錄中能最快達到你品質門檻的模型,並讓夜間批次留在能通過標準的最便宜通道上。等到該層級真的開放時,路由器就是你切換開關的地方,而在那之前,這就是候補名單與一套計畫之間的差別。

A screenshot of OrcaRouter's own model page for OpenAI GPT-5.6 Sol at /models/openai/gpt-5.6-sol, showing the live catalogue entry with the openai/gpt-5.6-sol identifier, Vision, Tools, JSON and Reasoning capabilities, the byline 'by OpenAI - 2026-07-09', code samples, pricing, performance and public benchmark sections listed on-page.

哪一個屬於生產環境?

先暫時忽略「versus」這個字,因為這裡沒有需要做出品質取捨的地方。如果你優化的是每 token 成本,標準 GPT-5.6 Sol 就是答案,而對於任何等得起的工作,五折的 Batch 通道就是答案。如果你優化的是人類盯著載入轉圈畫面多久,那麼只要你拿得到 Ultrafast,它就是答案——而 OpenAI 為預覽版點名的那些工作負載,正好說明了原因:在線上故障發生時,一邊開著日誌與 diff 進行事件應變;針對持續變動的資料進行詐欺檢查;在半秒沉默就會被解讀成產品壞掉的支援對話;以及過去得跑整夜、如今被壓縮進一個工作時段的研究迴圈。

關鍵在於你的請求圖形狀,而不是你的提示詞有多大。單次長篇生成在紙面上能拿到 14 倍增益,實務上卻少得多,因為輸入處理與推理不會以那個比例壓縮。藏在單一使用者可見動作背後的四十次循序工具呼叫,所獲得的增益更接近完整的倍數,因為每一次往返都是使用者正在枯等的延遲。如果你的工作負載看起來像第二種,這個層級就是為你而設;如果看起來像第一種,標準車道本來就夠用了。

有兩件事值得留意,而這兩者都不是我們能從這裡釐清的傳聞。第一,價目表:沒有價格的高階方案無法編列預算,而 Fast-mode 的先例顯示它不會是小數目。第二,候補名單是否真如報導所述在 DevDay 前後解除——因為大多數帳號都無法使用的 service_tier 值只是文件,而非可用性,而兩者之間的差別,就是計畫與承諾之間的差別。