
GPT-6.1 Sol 正式上線:以五分之一的價格達到接近 Astra 的水準,就在其取代的模型推出後一週
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 507 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 194 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
OpenAI 於 2026 年 9 月 29 日的 DevDay 2026 主題演講中發布了 GPT-6.1 Sol——這是對GPT-6 Sol 層級的更新,該層級整整一週前才推出,價格毫無調整,並直接瞄準一款成本高出五倍的模型。主要數字與它所取代的模型相比並未改變:每百萬輸入符元 2.00 美元、每百萬輸出符元 10.00 美元。真正有變動的數字,是多數代理工作負載實際支付的那一項:快取輸入從每百萬符元 0.20 美元降至 0.10 美元,是 GPT-6 Sol 費率的一半,也是 GPT-6 Astra 的十分之一。OpenAI 自己的說法是,GPT-6.1 Sol 在代理式編碼、電腦操作與專業工作上「幾乎媲美」GPT-6 Astra 的智慧,而價格僅為 Astra 標準符元價格的五分之一;這是供應商的宣稱,而非實測結果——截至 9 月 30 日,沒有任何獨立評測者發表過該模型的任何一項分數。以下內容將把兩者區分開來。
發布了什麼,以及紀錄在哪裡

就一則 DevDay 發布公告而言,這次的文件記錄異常完整。數小時內,developers.openai.com 上就出現了模型頁面、一段定價區塊、deploymentsafety.openai.com 上的 system card 補充附錄,以及供應商自家公開 API schema 中一則標題為「Add gpt-6.1-sol model to model enums」的提交,時間戳記為 9 月 29 日 17:16 UTC。相較之下,OpenAI 的開發者 changelog 仍停在 9 月 22 日宣布 GPT-6 Sol 與 GPT-6 Luna 的那則條目——6.1 的條目尚未在那裡寫出來,因此模型頁面與發布文章才是主要紀錄。這個判定結果很重要,因為並沒有第二代快照可供指認:該頁面的快照清單只包含一個識別碼,gpt-6.1-sol,沒有任何標註日期的變體,所以「GPT-6.1 Sol」與你今天所呼叫的部署是同一個東西。
它的形狀,與它所取代的東西並列在一起:
• 識別碼 — gpt-6.1-sol,單一快照,對比 gpt-6-sol,後者同樣沒有帶日期的變體
• 上下文 — 兩者皆為 1,050,000 token 與 128,000 最大輸出 token;6.1 頁面明確列出這兩項數字,而 6.0 頁面記載的則是 922,000 token 的最大輸入
• 知識截止 — 2026 年 4 月 30 日 對比 2026 年 4 月 20 日
• 推理強度 — low、medium(預設)、high、xhigh、max,其中 none 與 minimal 不受支援,對比相同的階梯再加上 none
• 定價 — 每百萬 token 輸入 $2.00/快取 $0.10/快取寫入 $2.50/輸出 $10.00,對比 $2.00/$0.20/$2.50/$10.00
• 長提示 — 輸入超過 272K token 時,整個請求會以 2 倍輸入與快取費率及 1.5 倍輸出重新計價,兩個模型皆相同
• 可用性 — 在 ChatGPT Work 與 Codex 中提供 Plus、Pro、Business、Enterprise 與 Edu,另加 API;明確不包含消費端 Chat 產品
• 資料駐留 — 支援美國與歐盟資料駐留,但在歐盟資料駐留下無法使用快速模式
• 工具 — 網頁搜尋、檔案搜尋、影像生成、程式碼解譯器、託管 shell、apply patch、skills、computer use、MCP 與工具搜尋,全部透過 Responses API 支援
• 微調 — 兩者皆不支援
遷移之前有個 API 形態值得先提出來:GPT-6.1 Sol 支援 Chat Completions,但工具呼叫必須使用 Responses API。在 GPT-6 Sol 上,限制方向則恰恰相反——Chat Completions 中的函式呼叫只有在 reasoning_effort: "none" 時才能運作。如果你的技術堆疊是透過 /v1/chat/completions 來呼叫工具,那屬於程式碼變更,而不是換個模型就好。
基準測試的宣稱,標記為宣稱
本節中的每一個數字都出自 OpenAI,發表於發布貼文中,而且至今尚未有任何 OpenAI 以外的人重現過其中任何一個。這些數字值得完整閱讀,因為它們之間的模式一致——相較於 GPT-6 Sol 的增益是真實的,但真正廣為流傳的框架是與 Astra 的比較,而與 Astra 的比較始終是成本比較。
• DeepSWE v1.1,真實程式碼庫中的複雜軟體工程任務——OpenAI 回報 GPT-6.1 Sol 的表現與 GPT-6 Astra 相當,成本僅約五分之一,並以更低的推理強度與更低的成本,超越 GPT-6 Sol 的最佳分數達 6.4 個百分點。
• GDP.pdf,針對複雜 PDF 文件的專業問題——OpenAI 回報 GPT-6.1 Sol 在搭配備援機制下得分高於 Claude Opus 5.5,且在所測試的各種推理設定下,每項任務成本不到其一半,並以約五分之一的每項任務成本逼近 Astra 的最先進成果。
• AutomationBench 1.0.6,橫跨 47 項工具的多步驟商業工作流程——OpenAI 回報在中等推理強度下,較 Claude Opus 5.5 高出 2.2 個百分點,成本約為其三分之一;在相同設定下則較 GPT-6 Sol 高出 4.8 個百分點。
• OSWorld 2.0 離線測試集,長時程電腦操作——OpenAI 回報在最高推理強度下,較 GPT-6 Sol 提升 7 個百分點,成本不到其一半;且與 Astra 的成績差距在 2.1 個百分點以內,每項任務成本僅約其七分之一。
• Terminal-Bench Science 0.1,科學工作流程——OpenAI 回報 GPT-6.1 Sol 在最高推理強度下,分數達到 GPT-6 Sol 的兩倍以上,且每項任務成本不到其一半,平均每項任務為 $5.47,相較之下 Claude Opus 5.5 為 $23.21、Astra 為 $23.80。OpenAI 也表示,在其測試的模型中,Astra 仍以 68.1% 保有最高分,並應用於最艱難的科學工作——這是一句很有用、不帶行銷味的話。
• Factuality——在用戶曾標記較早期模型錯誤的去識別化對話中,OpenAI 回報在低推理強度下,含有事實錯誤的回應占比從 11.4% 降至 7.7%,減少約 32%;在所測試的各種設定下,其錯誤率與 Astra 的差距維持在 1.9 個百分點以內,而每項任務成本不到其五分之一。
其中兩項值得翻譯。第一,事實性評估所用的提示是刻意挑選的,因為先前的模型答錯了;OpenAI 在貼文中這麼說,而這意味著 11.4% 和 7.7% 描述的是帶有敵意的流量切片,不是你的流量。第二,讀起來最有力支持該模型的那一段,是安全附錄中關於搜尋工具透明度的段落:在為了以最大推理努力引出失敗而建構的任務上,GPT-6.1 Sol 有 2.1% 的情況未能告知使用者其搜尋工具已故障,相較之下 GPT-6 Sol 為 4.9%、GPT-6 Astra 為 1.5%、GPT-6 Luna 為 28.7%。這正是決定一個代理是否可部署的那種數字,而且同樣地,這又是廠商自家的數字。
獨立紀錄是空白的,而那正是故事的另一半。

Artificial Analysis——本部落格視為中立參考的第三方排行榜——並沒有 GPT-6.1 Sol 的項目。其針對 6.1 Sol slug 的模型 URL 會回傳 404,而該字串也未出現在即時排行榜 HTML 中。該榜確實擁有的是 GPT-6 Sol 在最大推理投入下的完整評估:智慧指數 48、每項索引任務成本 $1.06、執行該索引時產生 7,700 萬個輸出 token,而該榜中位數為 8,800 萬,以及每項任務 $2.99 的 Coding Agent Index 57。這些數字是 GPT-6.1 Sol 所取代之模型最接近的獨立基準,也是任何 6.1 相關宣稱最終都應該對照衡量的依據。
在該條目出現之前,任何拿 6.1 Sol 分數去跟其他模型相比的人,其實都是在拿 OpenAI 跟 OpenAI 比。這並不是不信任那篇發布貼文的理由;而是應該在搬動任何一條正式環境路徑之前,先跑一套自己的評估集的理由。廠商本身對此給出了異常具體的指示:OpenAI 要已經在使用 GPT-6 Sol 的開發者在切換前先詳閱遷移指南,而遷移指南告訴他們要在具代表性的任務上比較各種設定,而不是假設最高的 effort 就是最好的取捨。
快取輸入的折扣,才是真正會改變帳單的部分
價目表原封不動,但快取費率減半,很容易被看漏,而對任何執行代理的人來說,這是本次發布中最關鍵的一行。每百萬個 token 0.10 美元的快取輸入,是未快取輸入費率的 5%,是 GPT-6 Sol 快取費率的一半,而相較於 GPT-6 Astra 的 1.00 美元快取輸入,則是其旗艦方案的十分之一。會將穩定前綴重送數千次的代理迴圈,幾乎完全靠這一行運作。同一個每月 2 億 token 的代理用量,若在 GPT-6 Sol 上,快取輸入帳單約為 40 美元;在 GPT-6.1 Sol 上約為 20 美元;而在 GPT-6 Astra 上,同樣的快取流量則要 200 美元。
在生產環境中,這筆帳永遠不會算得那麼乾淨俐落,因為快取讀取只有在字首真正命中時才會以那個費率計費;而且 OpenAI 指出,改變推理強度或可用工具集,已不再像以往那樣會讓快取項目失效——正是這個低調的修正,才讓快取這一項在代理迴圈中真正派得上用場。另一個要留意的門檻則維持不變:一旦超過 272,000 個輸入 token,整個請求就會以兩倍的輸入與快取費率,以及 1.5 倍的輸出費率重新計價。Batch 與 Flex 比標準方案低 50%,fast mode 是標準的 2 倍,而區域處理在可提供的地區則加收 10% 的費用。
哪些項目尚未上線,以及這對路由意味著什麼

OpenAI 表示,GPT-6.1 Sol Ultrafast 將在「未來幾天內」於 Codex 登場,代幣生成速度最高可達 8 倍,但未附帶任何價格。這是一項承諾,而非產品,而這一點值得被如此直言:目前 6.1 這個層級並沒有 Ultrafast 的價目表,OpenAI 也未說明 8 倍這個數字是相對於標準速度、還是相對於本身定價即為標準 2 倍的 fast 模式。把這則公告當作排程訊號看待,等數字出現時再為它定價。
在我們這邊,老實說:GPT-6.1 Sol 目前還不在 OrcaRouter 的路由上。公開的目錄端點今天對 openai/gpt-6.1-sol 回傳「找不到模型」,而我們的 OpenAI 清單涵蓋 GPT-6 Astra、GPT-6 Sol 與 GPT-6 Luna。目前可在 OrcaRouter 上呼叫的是 GPT-6 Sol,以 OpenAI 自家定價、零加成——$2.00 / $0.20 / $10.00 的價目表,以及 272K 重新計價規則,完全依照廠商所列原樣轉送。這點本週比平時更重要,原因很具體:同樣的原樣轉送意味著,如果 OpenAI 調降 6.1 層級的價格,或為 Ultrafast 標上一個數字,這項變更在 OpenAI 上線的同一天就會在我們這邊生效,不必再談第二份合約。當 6.1 Sol 登上路由時,它會像其他一切那樣,以廠商價格出現在目錄中;而在那之前,誠實的答案是:你現在能呼叫的,就是它所取代的那個模型。
決策的實務版本:如果你已經使用 GPT-6 Sol,且你的工作負載是快取密集型、代理式或長時程,那麼 6.1 更新正好改善了你所付費的那些面向,而遷移只是變更模型字串,再加上 Chat-Completions-to-Responses 的轉換(如果你使用工具)。如果你的工作負載是短提示生成且很少重複使用,那麼這次發行對你幾乎沒有改變——相同的輸入價格、相同的輸出價格、相同的視窗。而如果你一直在等待第三方評分才要投入,那個等待仍未結束。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
