一個生成的雙欄比較計分板,標題為「GPT-6.1 Sol 對 GPT-5.6 Sol——計分板」。左欄「GPT-6.1 Sol」:各列顯示「智慧指數:51.8」、「每項指數任務成本:$0.72」、「輸入/輸出:$2.00/$10.00」、「快取輸入:$0.10」、「指數測試執行時的輸出 token 數:67M」、「努力下限:低」。右欄「GPT-5.6 Sol」:各列顯示「智慧指數:47.0」、「每項指數任務成本:$1.99」、「輸入/輸出:$4.00/$20.00」、「快取輸入:$0.40」、「指數測試執行時的輸出 token 數:90M」、「努力下限:無」。頁尾寫道「獨立數據依據 Artificial Analysis v4.3.2,在最大努力設定下取得;供應商牌價。」
Guides & Insights

GPT-6.1 Sol 對上 GPT-5.6 Sol:四個半指數點、帳單減半、兩項退步

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Open​AI 發布了 GPT-6.1 Sol,時間是 2026 年 9 月 29 日,距離 GPT-5.6 Sol(於 2026 年 7 月 9 日推出,是前一代的旗艦)十一週之後。兩者目前仍在販售,也都仍可呼叫,而它們在中立排行榜上的差距是 4.8 分——在 Artificial Analysis 的 Intelligence Index 上分別是 51.8 對 47.0,兩者都是在相同的十項評估套件上以最大推理努力測得。價格差距遠大於分數差距:每完成一項 index 任務分別是 $0.72 對 $1.99,而每百萬 token 則是 $2.00/$10.00 對 $4.00/$20.00。這是簡短版本。長版本則是:這次升級並非全面一致,而且其中兩項評估反而退步了。

每個型號是什麼,以及什麼取代了什麼

GPT-5.6 Sol 是 5.6 系列中的頂尖之作——一款封閉、僅限 API 的模型,具備 1,050,000 個 token 的上下文視窗、128,000 個 token 的輸出上限,支援文字、圖像與檔案輸入,以及從 none 一路到 max 的推理階梯。OpenAI 將其描述為專為最艱鉅工作而打造的層級:長時程代理式工作流程、多檔案軟體工程、深度推理,因此定價也相應為每百萬 token 4.00 美元與 20.00 美元,快取輸入為 0.40 美元,快取寫入為 5.00 美元。當輸入超過 272,000 個 token 時,價格調整為 8.00 美元與 30.00 美元,並提供 Batch 層級,價格為 2.50 美元與 15.00 美元。

GPT-6.1 Sol 是後繼世代中的中階型號:低於 GPT-6 Astra,高於 GPT-6 Luna,如今更是 OpenAI 向成本敏感開發者推薦的模型。它保留 1,050,000 詞元的上下文視窗與 128,000 詞元的輸出上限,將知識截止日期從 2026 年 4 月 20 日延後至 4 月 30 日,並把費力等級從六級縮減為五級——low、medium(預設)、high、xhigh、max。至於 none 這個 GPT-5.6 Sol 過去接受的值,現在會回傳錯誤,而 OpenAI 的移轉指引明確指出,應以 low 取代,而非默默升級。

這一點值得停下來想一想,因為這是本次發布中唯一一項花錢、而非省錢的變更。一條以往會取用none來取得便宜、快速、非推理呼叫的管線,如今在兩個模型系列上都不再有這樣的組態設定。GPT-6.1 Sol 上最便宜的層級就是推理層級,而推理 token 會以輸出 token 計費,無論你是否看得見它們。

梯子,一階一階地

獨立評測委員會公布了兩款模型在每個 effort 設定下的分數與執行成本,這讓雙方的正面對決變得比單一比較更有用。在對等設定下並列來看:

• 努力階梯,GPT-6.1 Sol — max 51.8,每項索引任務 $0.72;xhigh 51.0,$0.39;high 50.2,$0.32;medium(預設)47.8,$0.21 • 輸出速度 — GPT-6.1 Sol 每秒 59.7 個 token,GPT-5.6 Sol 為 87.8
• 首個區塊時間 — GPT-6.1 Sol 為 332 秒,GPT-5.6 Sol 則更快,對照排行榜中位數約 4 秒
• 索引執行時的輸出 token 數 — GPT-6.1 Sol 為 6,720 萬,GPT-5.6 Sol 為 9,000 萬
• 輸入/輸出價格 — $2.00/$10.00 對比 $4.00/$20.00
• 快取輸入 — $0.10 對比 $0.40;快取寫入 $2.50 對比 $5.00
• 批次費率 — GPT-6.1 Sol 未公布,GPT-5.6 Sol 為 $2.50/$15.00
• 長上下文級距 — 當輸入超過 272,000 個 token 時,GPT-6.1 Sol 會將整個請求重新計價為 $4.00/$15.00,而 GPT-5.6 Sol 為 $8.00/$30.00
• 努力程度下限 — 低 對比 無

從那份清單可以得出兩件事。第一,這次降價是結構性的,而非促銷性的:GPT-6.1 Sol 的標準費率 $2.00 與 $10.00,低於 GPT-5.6 Sol 的 批次費率 $2.50 與 $15.00,因此即使是舊模型的折扣級別,也比新模型的定價還貴。第二,這次升級在延遲方面並非線性改善。GPT-6.1 Sol 產生輸出的速度約慢三分之一,且在該排行榜的長提示測試中,首個區塊耗時 332 秒——與 GPT-6 Sol 的 107 秒處於相同數量級,大約是該排行榜中位數的八十倍。如果你是在 GPT-5.6 Sol 上打造互動式產品,這都是與任何基準測試無關的功能性退化,而修正方法是架構層面的,不是參數調整。

A generated hero card for a GPT-6.1 Sol versus GPT-5.6 Sol comparison, headed 'Four and a half index points, half the bill', with two badges reading 'GPT-6.1 Sol: $0.72 per index task' and 'GPT-5.6 Sol: $1.99 per index task', a footer reading 'Independent figures per Artificial Analysis v4.3.2 at max effort; vendor list prices.', and the OrcaRouter logo in the bottom-right corner.

兩項評估朝錯誤的方向發展

綜合增益為 4.8 分。各組成部分並非一致為正,而董事會的各項評估分數也說明了這一點:

• SciCode — GPT-6.1 Sol 0.542 對 GPT-5.6 Sol 0.571。在科學程式設計上退步 2.9 分。
• GDPval-AA v2.1 — GPT-6.1 Sol Elo 1575.1 對 GPT-5.6 Sol Elo 1611.3。在具經濟價值的知識工作上,Elo 退步 36 分。
• Humanity's Last Exam — GPT-6.1 Sol 0.529 對 GPT-5.6 Sol 0.495。進步 3.4 分。
• Terminal-Bench 4.0 — GPT-6.1 Sol 0.561 對 GPT-5.6 Sol 0.399。進步 16 分,是這組比較中最大的單一變動。
• AA-Omniscience — GPT-6.1 Sol 41.5 對 GPT-5.6 Sol 22.0,這關乎知識可靠度與幻覺,而非原始召回。
• AA-Briefcase v1.1, AutomationBench-AA, AA-LCR v1.1, GDP.pdf, CritPt — 其餘五項,補足綜合指標,也是其餘 4.8 分進步的來源。

一個在終端機工作上明顯更好、在事實可靠性上大幅提升,但在科學程式編寫與專業工作 Elo 上可量測地更差的模型,並不是嚴格意義上更好的模型。它是在前沿上的另一個點,而且是被刻意放在那裡的:Open​AI 自己為 GPT-6.1 Sol 所做的發布定位,是接近旗艦品質下的每項完成任務成本,而非最高分數。如果你的工作負載是 SciCode 型或 GDPval 型,那麼對你適用的不是那個綜合分數,而是那個退步。

GPT-5.6 Sol 仍保有已發布的長上下文結果

較舊模型唯一擁有、而較新模型沒有的數字,是 GPT-6.1 Sol 費率表變動所在上下文區間的檢索準確度。GPT-5.6 Sol 有一項已公布的 MRCR v2 八針結果:在 256,000 至 512,000 詞元範圍內達到 91.5%。GPT-6.1 Sol 沒有已公布的對應結果,而且在超過 272,000 個輸入詞元時,其整個請求會按輸入與快取 2 倍、輸出 1.5 倍重新計價。

把這兩個事實放在一起看,新模型經濟效益最弱的區段,正好就是舊模型唯一有書面實證優勢的區段。省下的錢並沒有消失——重新定價級距的 $4.00 和 $15.00,對上 GPT-5.6 Sol 自家長上下文級距的 $8.00 和 $30.00,仍然等於減半——但半價這個說法是針對一般工作負載的說法,而長上下文檢索管線並不是那麼回事。如果你的工作負載正是如此,那麼以 $4.00 和 $20.00、公布達 91.5% 的 GPT-5.6 Sol,是個站得住腳、值得繼續留下的選擇。

GPT-5.6 Sol 的其他已公布結果仍維持不變,而這正是某些團隊不願轉換的原因:BrowseComp 90.4(網頁研究代理)、Terminal-Bench 2.1 為 88.8 與 88.0、SWE-Bench Pro 64.6、Agents' Last Exam 53.6、OSWorld 2.0 為 62.6。那些都是 OpenAI 回報的、在 OpenAI 的測試框架上,且是在七月回報的。此後改變的是,評測委員會現在以同一套設定、在同一個測試套件上為兩個模型評分,而較舊的模型在綜合分數與成本上都落居下風。

遷移本身只是字串變更,只有一個例外。

同一家供應商、相同的 API 介面、在排名中相鄰、相同的視窗與輸出上限——所以對大多數技術堆疊來說,這只是一個模型識別碼,以及價格直接砍半。例外情況則很具體,值得在你切換之前先點名。

如果你的程式碼將 reasoning.effort 設為 none 或 minimal,它會直接失敗,而不是降級,而且 low 是文件記載的替代方案。如果你的流量超過 272,000 個輸入 token,請先查看重新定價後的級距,再估算節省金額。如果你的產品取決於首個 token 的延遲,請在上線前先測量,因為排行榜上的 332 秒數字並非四捨五入誤差。如果你的評估中含有 SciCode 形狀或 GDPval 形狀的切片,請在兩個模型上分別執行那個切片,而不是信任綜合分數。

這兩款模型都在 OrcaRouter 上,以 OpenAI 自家的定價表提供——GPT-6.1 Sol 為 $2.00 與 $10.00,快取輸入為 $0.10;GPT-5.6 Sol 為 $4.00 與 $20.00,快取輸入為 $0.40——採用直通式模式,讓 OpenAI 的價格變動在生效當天就反映在我們這邊,而不是等經銷商重新議價之後。因為價格表是原樣直通,而非加價,所以本文中的計算就是你會得到的計算:同樣每項任務 $0.72 的模型、同樣的減半,兩側都沒有疊加平台溢價。

A screenshot of the OrcaRouter model page for openai/gpt-5.6-sol, showing the listing dated 2026-07-09, the model described as the flagship of OpenAI's GPT-5.6 series for deep multi-step reasoning and long-horizon agentic workflows, a 1.05M-token context with 128K maximum output, text, image and file input, and the list price of $4.00 input and $20.00 output per million tokens.

把兩者放在同一個端點後面的實際用途,在於比較能持續保持即時有效。把新流量導向 GPT-6.1 Sol,讓 GPT-5.6 Sol 只需改動一項設定就能隨時接手,作為備援以及長上下文路徑,並讓自動容錯移轉涵蓋這段空窗期——此時一款推出已兩個月的旗艦模型,其可用性與企業版啟用仍在逐步底定。一項能讓帳單減半、卻讓兩項子基準退步的遷移,不是做一次就能拋諸腦後的決定;而是必須逐條路由分別決定,而路由層正是讓這件事變得便宜的关键。

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

每個所屬之處

• 一般代理與終端機工作 — GPT-6.1 Sol。在 Terminal-Bench 4.0 上拿下十六分,價格只要一半,這不是一場拉鋸戰。
• 事實可靠性、檢索式答案產品 — GPT-6.1 Sol,在 AA-Omniscience 上有將近二十分的差距。
• 科學程式編寫 — 先檢查你自己的評測。排行榜顯示 2.9 分的退步,而綜合分數不會把它顯示出來。
• 具經濟價值的知識工作 — 同樣要謹慎。GDPval-AA Elo 退步了 36 分。
• 超過 272,000 個 token 的長上下文檢索 — GPT-5.6 Sol,直到 GPT-6.1 Sol 在該區間有公布數字為止。
• 互動式、對延遲敏感的介面 — 遷移前先測量。輸出更快,首個 token 慢得多。
• 最便宜的非推理呼叫 — 兩者皆非。這個配置在此系列上已不存在。

本文中的比較1

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新