為關於超快速 AI 推論的科技部落格首頁主視覺所做的編輯式平面向量插圖:一枚深藍色的大型圓角模型晶片,在淺色背景上散發柔和的青色光暈;一旁有風格化的閃電符號,以及指針指向最大值的速度錶盤;快速 token 串沿著帶有運動線條的水平速度線奔馳;還有一個小型碼錶。白色背景點綴柔和的藍青色漸層與一抹細微的暖色高光;極簡平面線條圖示;乾淨的現代幾何無襯線字體排版;無可讀文字、無字母、無單詞、無浮水印、無第三方標誌;16:9 構圖。
Guides & Insights

GPT-5.6 Sol Ultrafast:14 倍速度,750 Tok/s — CS-4 據報導約 1,300,尚無定價

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-5.6 Sol Ultrafast 模式是旗艦模型的硬體加速服務層級——同樣是完整的 GPT-5.6 Sol 模型,但改為在 Cerebras 晶圓級晶片上運行,而非 GPU 叢集。這個 OpenAI 於八月公佈的層級,提供高達標準處理 14 倍的速度,以及每秒最多 750 個輸出 token。2026 年 8 月 18 日,Cerebras 推出了下一代 CS-4 系統,此層級將擴展至該系統上;一份早期且未經證實的報告宣稱,GPT-5.6 Sol 在 CS-4 上已能達到每秒約 1,300 個 token 的服務速度。它並非較小的模型,也不是蒸餾版本:改變的只有硬體與排程,智慧能力完整保留。它目前還缺少的是價格——截至 2026 年 8 月 19 日,Ultrafast 仍是限量 API 預覽,沒有公佈的定價表;因此你現階段實際可依賴的預算數字,是即時 GPT-5.6 Sol 模型頁面上的標準層級:每百萬輸入 token 5 美元,每百萬輸出 token 30 美元,零加成轉傳。本文將說明這個模式是什麼、這些數字實際有多快——包括新的 CS-4 硬體,以及尚未經證實的部分——它的成本(包括坦白的『尚無價格』答案),以及在正式上市前你該怎麼做。

Ultrafast mode 實際上是什麼

Ultrafast 是一個服務層級,而非新模型。OpenAI 於 2026 年 8 月 13 日宣布推出該服務,作為其與晶片製造商 Cerebras 於 2026 年 1 月達成的運算合作夥伴關係的首個產品——據報導這筆交易為期三年、金額約 100 億美元。標準 GPT-5.6 Sol 推論在 GPU 叢集上運行,且耗費大量時間在記憶體與運算單元之間搬移權重;而 Ultrafast 則是將模型權重載入 Cerebras 晶圓級晶片上 44 GB 的晶片內 SRAM 中。Sol 這種規模的模型會以分層方式橫跨數片晶圓,因此權重就位於運算單元所在之處。其結果是,吞吐量的上限由矽晶片本身決定,而非記憶體頻寬。

硬體領域在2026年8月18日迎來新進展。在Supernova活動上,Cerebras發表了CS-4,這是基於Nexus平台打造的下一代機架級系統——每個機架配備三顆Wafer-Scale Engine晶片,token生成速度最高達前代CS-3的2倍,且依Cerebras所言,在超過10兆參數的模型上,每秒可產生逾1,000個token。這些是Cerebras針對一款仍處於早期存取、尚未全面供應的系統所提出的數據。自發表以來,X上僅有一篇貼文聲稱CS-4已能以每秒約1,300個token的速度服務GPT-5.6 Sol——方向與Cerebras自家數字一致,但至今無人證實。請將其視為早期訊號:看似合理、未經驗證,若要以它為依據規劃容量,值得再行查證。

對你的程式碼而言,重點是:模型 ID、權重、推理行為和輸出皆與標準 GPT-5.6 Sol 一致。OpenAI 將 Ultrafast 定位為「每秒更有用的工作量」,而非品質等級,且預覽版運行的是完整旗艦模型——速度並非來自於換用較便宜的模型。改變的只是 token 產出的速度。

別把 Ultrafast 與現有的快速模式混為一談。快速模式是標準硬體上的獨立付費方案:輸出速度最高約為 2.5 倍,但每個 token 需支付 2 倍費用(每 1M 輸入 $10/輸出 $60),品質沒有改變。Ultrafast 則是另一回事——採用 Cerebras 硬體,速度最高可達 14 倍,目前完全不收費。

有多快 — 重要的數字

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

標題數字是14倍,而且需要定義。OpenAI表示,Ultrafast每秒最多可生成750個輸出token,相較於標準GPT-5.6 Sol處理。這是輸出token的吞吐量數字,而不是一個籠統的「一切運行速度快14倍」的說法——端到端的請求時間還包括輸入處理和模型自身的推理,這就是為什麼14倍被標記為最大值。

最大輸出吞吐量 — 每秒最多 750 個輸出 token,依據 OpenAI 於 2026-08-13 的公告。

相較於標準處理 — 依據同一公告,速度快達14倍;實際效能提升會因輸入長度與任務類型而異。

Humanity's Last Exam,2,500 道題目 — OpenAI/Cerebras 報告稱 GPT-5.6 Sol Ultrafast 以 11 小時 11 分鐘完成,而 Claude Fable 5 則花費 78 小時 27 分鐘,準確度相當。此為廠商自行報告,且比較橫跨兩家廠商的硬體堆疊——請視為方向性參考,而非最終定論。

GDP-Val,端對端 — Cerebras 報告整體快 5.6 倍,且沒有可測量的品質損失。同樣是供應商所報告的。

快速模式基準——現有的付費速度等級最高可達約 2.5 倍的輸出速度,但價格溢價為 2 倍。

• CS-4,下一代硬體——Cerebras 宣稱 CS-4 機架在超過 10 兆參數的模型上每秒可產生超過 1,000 個 token,token 生成速度最高可達 CS-3 的 2 倍。一份未經證實的社群報告指出,GPT-5.6 Sol 在 CS-4 上約為每秒 1,300 個 token——方向一致,但尚未獲得 OpenAI 或 Cerebras 證實。

在引用 14× 這個數字之前,有一點要提醒:獨立報導引用了與 Claude Fable 5 相比約 11× 的生成速度比較,而 Cerebras 自家的數據則暗示同一輪測試的總測試時間約為 7×——差異在於你衡量的是工作負載的哪一部分。同樣的嚴謹態度也適用於 CS-4 的速度訊號:約 1,300 token/s 的數字最初來自單一一則 X 貼文,OpenAI 和 Cerebras 都沒有證實。這些都是本週發布的廠商或社群數字,目前都尚未經過獨立驗證。請把它們視為說法,而非基準測試的定論。

要花多少錢——以及誠實的差距

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

截至2026-08-19,價格問題的狀態如下,直說分明:Ultrafast 沒有公布的價格。OpenAI 尚未宣布任何定價,預覽版也未出現在任何公開費率表上。有關早期使用名額被綑綁或免費的報導,只是臆測,並非官方政策——在 OpenAI 對該層級定價之前,你在其他地方找到的任何「GPT-5.6 Sol Ultrafast 成本」數字都只是猜測。

您今天可以定價的是 GPT-5.6 Sol 系列的其餘部分,已根據 OpenAI 於 2026-08-18 發布的費率進行驗證:

Standard GPT-5.6 Sol — 輸入每 1M tokens $5.00 / 輸出每 1M tokens $30.00。這是您現在就可以呼叫的基準模型。

快速模式 — $10.00 / $60.00,加價 2 倍,可獲得最高約 2.5 倍的輸出速度。這是最接近實際可購買的「速度等級」方案。

提示詞快取讀取 — 每 1M 0.50 美元(較全新輸入便宜 90%);快取寫入按每 1M 6.25 美元計費。

長上下文層級 — 超過約 272K tokens 的輸入按 $10.00 / $45.00 計費。

Batch API — $2.50 / $15.00,統一五折優惠,處理時間約24小時。

關於預期溢價的背景資訊:快速模式樹立了先例,以標準費率的2倍收費,提供2.5倍的速度。如果超快速模式循類似曲線定價,它會遠高於標準的5美元/30美元——而預覽版的相關評論也預期如此,因為Cerebras的晶圓產能既稀少又昂貴。但預期的溢價並非實際價格。在費率表出爐之前,請先以標準Sol或快速模式進行規劃。

如何使用它 — 預覽的實際情況

存取是第二個如實的差距。Ultrafast 可透過 OpenAI API 提供給等候名單上的特定客戶群,於 2026-08-13 公布,OpenAI 表示存取範圍將「隨著容量成長」而擴大。目前沒有一般開放日期。公布的預覽對象包括程式設計、商務、金融研究、支援及其他互動型工作負載——這些團隊的代理程式每次請求會進行多次呼叫,而回應延遲是瓶頸。Jane Street、Rogo 和 Podium 均名列早期測試者。

其設計用途包括:事件回應(在服務中斷期間檢視日誌、追蹤紀錄與差異)、對動態資料進行金融研究與詐欺偵測、即時客戶支援與語音(其中半秒的靜音就會被視為故障)、電子商務結帳,以及將隔夜研究批次壓縮為互動式會話。如果你的工作負載是單回合聊天,14× 的重要性遠低於 40 次呼叫的代理迴圈。

你今天能做什麼——務實的答案

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

在 Ultrafast 預覽期間,完整的 GPT-5.6 Sol 現已上線——而且在 OrcaRouter 上,標準層級以供應商費率提供,每個 token 零加成,其模型 ID 為 openai/gpt-5.6-sol,透過 OpenAI 相容端點 api.orcarouter.ai/v1。若你已經有 OpenAI 用戶端,遷移只需要變更 base-URL 和模型 ID;其他都不需要。同一組金鑰和端點可存取 200+ 個模型,因此 Sol 與 GPT-5.6 TerraGPT-5.6 LunaClaude Opus 5,以及你想拿來比較的開放權重模型並列——而且你可以根據難度進行路由,不必逐一重新整合。

在速度頁面上,有兩個 OrcaRouter 的特殊功能值得特別提及。BYOK:自備 OpenAI 金鑰,OpenAI 會依其自身費率直接向你收費——OrcaRouter 每個 token 加收 $0,並讓你的供應商速率限制與額度維持不變。防護機制:PII Shield 與內容政策會在計費前執行,因此被阻擋的請求會回傳乾淨的 400 回應,且絕不會被收費;Agent Firewall 則會在工具呼叫與 MCP 呼叫執行前先進行評級。當——且如果——Ultrafast 以可路由的價格正式上市,將它接入同一個端點只需變更模型 ID;你今天建立的設定會直接沿用。

誠實的界線——當Ultrafast不是答案時

「14倍的故事」在四個地方並不成立,所以你不應針對一個尚未定案的數字來設計架構或編列預算:

14 倍是上限,而非保證。這是 Cerebras 硬體上的輸出吞吐量上限;端到端延遲仍包含輸入處理、模型的推理時間,以及您自己的網路。推理密集的提示詞可能會將大部分實際時間花在思考上,而宣傳中的加速效果在此會縮水。

它沒有價格,也沒有正式發布日期。截至2026-08-19,你無法購買Ultrafast——只能申請預覽權限,而其背後的CS-4硬體仍處於搶先體驗階段,並非全面正式可用。請以標準Sol($5 / $30)或快速模式($10 / $60)為依據編列預算,並將網路上看到的任何Ultrafast價格視為未經證實的資訊。

這些基準測試皆為廠商自行通報。11 小時的 HLE 運行時間與 5.6 倍 GDP-Val 數值,來自公告中的 OpenAI/Cerebras 數據;獨立估算則約在 7 倍至 11 倍之間,視衡量項目而定。將 CS-4 的速度訊號也列入考量:GPT-5.6 Sol 在 CS-4 上約 1,300 token/s 的數據,僅出自單一 X 貼文,並無獨立確認。上述數據目前皆尚未獲得獨立驗證。

它不會解決你沒有的瓶頸。如果你的代理程式因為你自己的編排、工具延遲或大量輸入的提示而變慢,更快的輸出路徑只會稍微改善尾端延遲。分層匹配的決策——GPT-5.6 Sol 的 $5 / $30 對比 GPT-5.6 Terra 的 $2 / $12 對比 GPT-5.6 Luna 的 $0.20 / $1.20——仍然比任何速度等級更能影響你的帳單。

要點總結。GPT-5.6 Sol Ultrafast 是 OpenAI 迄今為其旗艦模型推出的最快服務層級——在 Cerebras 硬體上使用相同權重,公佈的層級吞吐量高達 14 倍,每秒輸出 750 個 tokens。Cerebras 新款 CS-4(2026-08-18 發佈)據稱可將 GPT-5.6 Sol 推向每秒約 1,300 tokens,但這個數字僅是一則未經證實的 X 貼文。截至 2026-08-19,Ultrafast 仍是候補名單預覽,沒有公開定價。如果你在尋找一個可編列預算的數字,老實說目前還沒有。標準版 GPT-5.6 Sol 定價 $5 / $30 是今天就能使用的方案,快速模式 $10 / $60 是可直接購買的速度層級,而 OrcaRouter 以 $0 加價將兩者都路由到你的自有金鑰。現在就建立路由——等 Ultrafast 有定價和日期時,只需更換一個 model-id 即可。

在 Ultrafast 定價之前,完整的 GPT-5.6 Sol 已上線於GPT-5.6 Sol on OrcaRouter,以每百萬 token $5 / $30 的價格收費,零加價,並可使用您自己的金鑰。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

providers@orcarouter.ai

加入我們的社區

Discordsupport@orcarouter.aiXGitHubYouTube