
GPT-6.1 Sol 對上 GPT-5.6 Sol:四個半指數點、帳單減半、兩項退步
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
OpenAI 發布了 GPT-6.1 Sol,時間是 2026 年 9 月 29 日,距離 GPT-5.6 Sol(於 2026 年 7 月 9 日推出,是前一代的旗艦)十一週之後。兩者目前仍在販售,也都仍可呼叫,而它們在中立排行榜上的差距是 4.8 分——在 Artificial Analysis 的 Intelligence Index 上分別是 51.8 對 47.0,兩者都是在相同的十項評估套件上以最大推理努力測得。價格差距遠大於分數差距:每完成一項 index 任務分別是 $0.72 對 $1.99,而每百萬 token 則是 $2.00/$10.00 對 $4.00/$20.00。這是簡短版本。長版本則是:這次升級並非全面一致,而且其中兩項評估反而退步了。
每個型號是什麼,以及什麼取代了什麼
GPT-5.6 Sol 是 5.6 系列中的頂尖之作——一款封閉、僅限 API 的模型,具備 1,050,000 個 token 的上下文視窗、128,000 個 token 的輸出上限,支援文字、圖像與檔案輸入,以及從 none 一路到 max 的推理階梯。OpenAI 將其描述為專為最艱鉅工作而打造的層級:長時程代理式工作流程、多檔案軟體工程、深度推理,因此定價也相應為每百萬 token 4.00 美元與 20.00 美元,快取輸入為 0.40 美元,快取寫入為 5.00 美元。當輸入超過 272,000 個 token 時,價格調整為 8.00 美元與 30.00 美元,並提供 Batch 層級,價格為 2.50 美元與 15.00 美元。
GPT-6.1 Sol 是後繼世代中的中階型號:低於 GPT-6 Astra,高於 GPT-6 Luna,如今更是 OpenAI 向成本敏感開發者推薦的模型。它保留 1,050,000 詞元的上下文視窗與 128,000 詞元的輸出上限,將知識截止日期從 2026 年 4 月 20 日延後至 4 月 30 日,並把費力等級從六級縮減為五級——low、medium(預設)、high、xhigh、max。至於 none 這個 GPT-5.6 Sol 過去接受的值,現在會回傳錯誤,而 OpenAI 的移轉指引明確指出,應以 low 取代,而非默默升級。
這一點值得停下來想一想,因為這是本次發布中唯一一項花錢、而非省錢的變更。一條以往會取用none來取得便宜、快速、非推理呼叫的管線,如今在兩個模型系列上都不再有這樣的組態設定。GPT-6.1 Sol 上最便宜的層級就是推理層級,而推理 token 會以輸出 token 計費,無論你是否看得見它們。
梯子,一階一階地
獨立評測委員會公布了兩款模型在每個 effort 設定下的分數與執行成本,這讓雙方的正面對決變得比單一比較更有用。在對等設定下並列來看:
• 努力階梯,GPT-6.1 Sol — max 51.8,每項索引任務 $0.72;xhigh 51.0,$0.39;high 50.2,$0.32;medium(預設)47.8,$0.21 • 輸出速度 — GPT-6.1 Sol 每秒 59.7 個 token,GPT-5.6 Sol 為 87.8
• 首個區塊時間 — GPT-6.1 Sol 為 332 秒,GPT-5.6 Sol 則更快,對照排行榜中位數約 4 秒
• 索引執行時的輸出 token 數 — GPT-6.1 Sol 為 6,720 萬,GPT-5.6 Sol 為 9,000 萬
• 輸入/輸出價格 — $2.00/$10.00 對比 $4.00/$20.00
• 快取輸入 — $0.10 對比 $0.40;快取寫入 $2.50 對比 $5.00
• 批次費率 — GPT-6.1 Sol 未公布,GPT-5.6 Sol 為 $2.50/$15.00
• 長上下文級距 — 當輸入超過 272,000 個 token 時,GPT-6.1 Sol 會將整個請求重新計價為 $4.00/$15.00,而 GPT-5.6 Sol 為 $8.00/$30.00
• 努力程度下限 — 低 對比 無
從那份清單可以得出兩件事。第一,這次降價是結構性的,而非促銷性的:GPT-6.1 Sol 的標準費率 $2.00 與 $10.00,低於 GPT-5.6 Sol 的 批次費率 $2.50 與 $15.00,因此即使是舊模型的折扣級別,也比新模型的定價還貴。第二,這次升級在延遲方面並非線性改善。GPT-6.1 Sol 產生輸出的速度約慢三分之一,且在該排行榜的長提示測試中,首個區塊耗時 332 秒——與 GPT-6 Sol 的 107 秒處於相同數量級,大約是該排行榜中位數的八十倍。如果你是在 GPT-5.6 Sol 上打造互動式產品,這都是與任何基準測試無關的功能性退化,而修正方法是架構層面的,不是參數調整。

兩項評估朝錯誤的方向發展
綜合增益為 4.8 分。各組成部分並非一致為正,而董事會的各項評估分數也說明了這一點:
• SciCode — GPT-6.1 Sol 0.542 對 GPT-5.6 Sol 0.571。在科學程式設計上退步 2.9 分。
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 對 GPT-5.6 Sol Elo 1611.3。在具經濟價值的知識工作上,Elo 退步 36 分。
• Humanity's Last Exam — GPT-6.1 Sol 0.529 對 GPT-5.6 Sol 0.495。進步 3.4 分。
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 對 GPT-5.6 Sol 0.399。進步 16 分,是這組比較中最大的單一變動。
• AA-Omniscience — GPT-6.1 Sol 41.5 對 GPT-5.6 Sol 22.0,這關乎知識可靠度與幻覺,而非原始召回。
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — 其餘五項,補足綜合指標,也是其餘 4.8 分進步的來源。
一個在終端機工作上明顯更好、在事實可靠性上大幅提升,但在科學程式編寫與專業工作 Elo 上可量測地更差的模型,並不是嚴格意義上更好的模型。它是在前沿上的另一個點,而且是被刻意放在那裡的:OpenAI 自己為 GPT-6.1 Sol 所做的發布定位,是接近旗艦品質下的每項完成任務成本,而非最高分數。如果你的工作負載是 SciCode 型或 GDPval 型,那麼對你適用的不是那個綜合分數,而是那個退步。
GPT-5.6 Sol 仍保有已發布的長上下文結果
較舊模型唯一擁有、而較新模型沒有的數字,是 GPT-6.1 Sol 費率表變動所在上下文區間的檢索準確度。GPT-5.6 Sol 有一項已公布的 MRCR v2 八針結果:在 256,000 至 512,000 詞元範圍內達到 91.5%。GPT-6.1 Sol 沒有已公布的對應結果,而且在超過 272,000 個輸入詞元時,其整個請求會按輸入與快取 2 倍、輸出 1.5 倍重新計價。
把這兩個事實放在一起看,新模型經濟效益最弱的區段,正好就是舊模型唯一有書面實證優勢的區段。省下的錢並沒有消失——重新定價級距的 $4.00 和 $15.00,對上 GPT-5.6 Sol 自家長上下文級距的 $8.00 和 $30.00,仍然等於減半——但半價這個說法是針對一般工作負載的說法,而長上下文檢索管線並不是那麼回事。如果你的工作負載正是如此,那麼以 $4.00 和 $20.00、公布達 91.5% 的 GPT-5.6 Sol,是個站得住腳、值得繼續留下的選擇。
GPT-5.6 Sol 的其他已公布結果仍維持不變,而這正是某些團隊不願轉換的原因:BrowseComp 90.4(網頁研究代理)、Terminal-Bench 2.1 為 88.8 與 88.0、SWE-Bench Pro 64.6、Agents' Last Exam 53.6、OSWorld 2.0 為 62.6。那些都是 OpenAI 回報的、在 OpenAI 的測試框架上,且是在七月回報的。此後改變的是,評測委員會現在以同一套設定、在同一個測試套件上為兩個模型評分,而較舊的模型在綜合分數與成本上都落居下風。
遷移本身只是字串變更,只有一個例外。
同一家供應商、相同的 API 介面、在排名中相鄰、相同的視窗與輸出上限——所以對大多數技術堆疊來說,這只是一個模型識別碼,以及價格直接砍半。例外情況則很具體,值得在你切換之前先點名。
如果你的程式碼將 reasoning.effort 設為 none 或 minimal,它會直接失敗,而不是降級,而且 low 是文件記載的替代方案。如果你的流量超過 272,000 個輸入 token,請先查看重新定價後的級距,再估算節省金額。如果你的產品取決於首個 token 的延遲,請在上線前先測量,因為排行榜上的 332 秒數字並非四捨五入誤差。如果你的評估中含有 SciCode 形狀或 GDPval 形狀的切片,請在兩個模型上分別執行那個切片,而不是信任綜合分數。
這兩款模型都在 OrcaRouter 上,以 OpenAI 自家的定價表提供——GPT-6.1 Sol 為 $2.00 與 $10.00,快取輸入為 $0.10;GPT-5.6 Sol 為 $4.00 與 $20.00,快取輸入為 $0.40——採用直通式模式,讓 OpenAI 的價格變動在生效當天就反映在我們這邊,而不是等經銷商重新議價之後。因為價格表是原樣直通,而非加價,所以本文中的計算就是你會得到的計算:同樣每項任務 $0.72 的模型、同樣的減半,兩側都沒有疊加平台溢價。

把兩者放在同一個端點後面的實際用途,在於比較能持續保持即時有效。把新流量導向 GPT-6.1 Sol,讓 GPT-5.6 Sol 只需改動一項設定就能隨時接手,作為備援以及長上下文路徑,並讓自動容錯移轉涵蓋這段空窗期——此時一款推出已兩個月的旗艦模型,其可用性與企業版啟用仍在逐步底定。一項能讓帳單減半、卻讓兩項子基準退步的遷移,不是做一次就能拋諸腦後的決定;而是必須逐條路由分別決定,而路由層正是讓這件事變得便宜的关键。

每個所屬之處
• 一般代理與終端機工作 — GPT-6.1 Sol。在 Terminal-Bench 4.0 上拿下十六分,價格只要一半,這不是一場拉鋸戰。
• 事實可靠性、檢索式答案產品 — GPT-6.1 Sol,在 AA-Omniscience 上有將近二十分的差距。
• 科學程式編寫 — 先檢查你自己的評測。排行榜顯示 2.9 分的退步,而綜合分數不會把它顯示出來。
• 具經濟價值的知識工作 — 同樣要謹慎。GDPval-AA Elo 退步了 36 分。
• 超過 272,000 個 token 的長上下文檢索 — GPT-5.6 Sol,直到 GPT-6.1 Sol 在該區間有公布數字為止。
• 互動式、對延遲敏感的介面 — 遷移前先測量。輸出更快,首個 token 慢得多。
• 最便宜的非推理呼叫 — 兩者皆非。這個配置在此系列上已不存在。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
