
GPT-6.1 Sol Pro 對比 GPT-5.6 Sol Pro:相隔一個世代,價目表減半
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 397 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
先把名稱放一邊,看看每一者在請求中實際解析成什麼,因為這場對決的勝負正是在那裡決定的。GPT-6.1 Sol Pro 就是 GPT-6.1 Sol——於 2026 年 9 月 29 日發布——在 Responses API 中將 reasoning.mode 設為 pro 來執行,並按該模型本身的每百萬個 token 輸入 $2.00、輸出 $10.00 來計費這份額外工作。GPT-5.6 Sol Pro 則是早一個世代的相同構成:GPT-5.6 Sol,於 2026 年 7 月 9 日推出,以 reasoning.mode: pro 執行,並按每百萬個 token 輸入 $4.00、輸出 $20.00 來計費其額外 token。兩家廠商都沒有為這兩個層級發布 -pro 識別碼,因此沒有 pro 費率表可比較,也沒有 pro 附加費可衡量。你實際上比較的是相隔三個月的兩份基本費率表,其標示價格相差兩倍——而快取費率相差四倍。模式完全相同。但它底下的計費錶並非如此。
為什麼較舊的 Pro 電表還會出現在這份比較裡
GPT-5.6 Sol Pro 之所以一直以同世代產品而非前代產品的身分被提起,是因為 OpenAI 在 GPT-5 時代確實把 Pro 當成一項產品來賣,而那些識別名稱至今仍列在價目表上,各自有專屬的加價費率:gpt-5.4-pro 與 gpt-5.5-pro 在短上下文下每百萬詞元輸入 $30.00、輸出 $180.00,輸入超過 272,000 詞元後則跳升至 $60.00 與 $270.00。這些都是真實存在、獨立定價的產品,也正是「Pro」這個字讀起來就等於昂貴的原因。GPT-5.6 世代改變了機制,卻沒有改變用語——pro 變成了旗艦模型的一種模式,而不是與它並列的加價模型,計價也改用旗艦本身的費率。因此,從 5.6 時代的 pro 組態轉到 6.1 時代的組態,實際效果並不是「更便宜的 pro 模型」,而是同一套組態,換到更便宜的基底上。
• 它在雙方眼中究竟是什麼——一個模型加上 reasoning.mode: "pro",並非另行訓練或另行定價的部署
• 您傳送的識別碼 — gpt-6.1-sol 與 gpt-5.6-sol 的比較,模式會夾帶在 reasoning 物件中
• 標準輸入價格——每百萬個 token 為 $2.00,而非 $4.00,因此 pro 模式的額外 token 在較新方案中的成本只要一半
• 標準輸出價格 — 每百萬個詞元 10.00 美元對比 20.00 美元,同樣的減半幅度也適用於 Pro 模式所推高的那部分帳單
• 快取輸入 — 在 6.1 Sol 上每百萬為 $0.10,而 5.6 Sol 為 $0.40,四倍差距最關鍵之處,正是在 pro 模式所專為打造的 agent 迴圈中
• 快取寫入 — 每百萬個詞元 $2.50 對比 $5.00,再次減半
• 長提示重新定價 — 兩者都會對超過 272,000 個輸入 token 的整個請求重新計價,輸入與快取費率為 2 倍,輸出為 1.5 倍
• 上下文與輸出上限——兩者的上下文皆為 1,050,000 個 token,最大輸出皆為 128,000 個 token,且各自記載的最大輸入為 922,000
• 知識截止日期 — 6.1 Sol 為 2026 年 4 月 30 日,5.6 Sol 則為 2026 年 2 月 16 日
• 推理強度 — 低、中、高、xhigh、max,其中 none 與 minimal 在 6.1 Sol 上不受支援;相較之下,5.6 Sol 支援相同的層級組合,外加 none
• Pro 模式文件 — 在 OpenAI 的推理指南中具名以 gpt-6.1-sol 作為示範,對比涵蓋 GPT-5.6 與 GPT-6 的家族層級聲明,且未提供逐一模型的適用資格清單
那份清單裡有兩列,加起來比其餘所有項目的總和還值錢,而這兩列都不是最顯眼的那個價格。
快取線正是這兩代不再能相提並論的地方
Pro 模式的成本是以用量形式出現,而不是以附加費形式:OpenAI 的文件說它「會彙總為產生最終答案所執行的模型工作,並依所選模型的標準 token 費率對那些 token 計費」,而供應商並未公布乘數。這使得 Pro 設定的成本取決於兩件你查不到的事——該模式在你的任務上會做多少額外工作,以及你的 token 成本是多少——而只有第二項是公開的。在這個軸線上,6.1 等級在每一列都以整整兩倍的差距勝出,而在快取輸入那一列則以四倍勝出。
來算一下一個客戶支援代理的帳:它在每一輪都會重複送出固定的指令與工具結構描述前綴。每月送出 2 億個輸入 token,其中 95% 是前綴命中,而快取部分在 6.1 Sol 上以每百萬 $0.10 計費,對比 5.6 Sol 的 $0.40——同樣的前綴是 $19 對 $76,而這還沒算到任何一個 Pro 模式 token。現在再把 Pro 模式加上去,差距只會擴大而不會縮小,因為該模式額外的推理會落在輸出端,每百萬 $10.00 對 $20.00。唯一沒有減半的那一列是長提示重定價規則,它在兩個層級上完全相同,並套用相同的 2× 與 1.5× 乘數——因此,經常超過 272,000 個輸入 token 的工作負載,在比較的兩邊都要支付溢價,只是在較新的層級上較小。
還有一個陷阱屬於這個模式本身,而不是屬於任一模型,而且會讓天真的成本估算器吃足苦頭。在 pro 模式開啟時把 reasoning.effort 設為 none,會傳回錯誤,而不是悄悄退回;此外,pro 模式燒掉的推理 token 會回報在 usage 物件的 output_tokens_details.reasoning_tokens 底下,卻永遠不會出現在回應主體中。任何根據回傳文字估算支出的用戶端,每一次都會低估 pro 組態。
在老一輩仍然站得住腳的地方

便宜不等於更好,而 5.6 世代有三項價格表看不出來的優勢。第一是成熟度:gpt-5.6-sol 自 2026 年 7 月 9 日起已正式全面推出,其行為已穩定,而且當 OpenAI 淘汰較舊的 Pro 計量方案時,其自家棄用頁面所指的正是這個模型——這表示從那些每百萬 $180 的計量方案移轉的路徑,會落在 5.6 層級,而不是 6.1 層級。第二是促銷:OpenAI 表示 GPT-5.6 Sol 的促銷定價至少提供到 2026 年 11 月 21 日,因此 $4.00 / $20.00 這組價格是附帶期限的下限價,而不是牌價。第三是獨立證據,而如果你無法自行執行評測,這一點最重要——Artificial Analysis 有 GPT-5.6 Sol 的完整評測,而對 6.1 層級則完全沒有頁面。
那份獨立解讀談的是成本,而非智慧,而這正是有用的部分。在該中立評測機構的 Intelligence Index 上,GPT-5.6 Sol 在最大推理投入(maximum reasoning effort)下得分 47,在 145 個模型的樣本中排名第 13,其 Coding Index 為 77.4、排名第 3,GPQA Diamond 則為 94.1%。在相同設定下,它每項索引任務的成本接近 2.00 美元,而 GPT-6 Sol 為 1.06 美元——大約是兩倍——而這個比例就是支持較新層級的全部論據,一個數字便道盡一切。截至 2026 年 9 月 30 日,6.1 世代尚未公布可比的數字:該評測機構針對 6.1 Sol slug 的模型頁面回傳 404,而該字串也未出現在即時排行榜上。因此,如今誠實的比較,是實測的 5.6 世代對上廠商自行描述的 6.1 世代,而再怎麼製作表格也無法弭平這道落差。
以單一按鍵執行兩種設定
這是少見的比較情境:實驗建置起來幾乎不花任何成本,因為兩組之間只差一個模型字串和一個參數。OrcaRouter 繞送 openai/gpt-5.6-sol,比照 OpenAI 自家的定價表、不額外加收任何費用——輸入 $4.00、快取 $0.40、輸出 $20.00,長提示詞級距公布為 $8.00 與 $30.00——並以 $2.00 / $0.20 / $10.00 繞送 openai/gpt-6-sol,其本身另有 272K 級距為 $4.00 與 $15.00。由於加成費用為零,且供應商的價目表按原文照實轉嫁,任一級距的促銷變動或降價,都會在 OpenAI 公布當天即反映在路由上,無需另簽第二份合約,也無需為個別模型重新上架。一個相容於 OpenAI 的端點和一組 API 金鑰即可涵蓋測試的兩組,因此唯一的工作就是挑選任務集並讀取 usage 物件。

用三種方式對你自己同一組高難度請求執行,並讓 reasoning.effort 保持固定,這樣就只有一個變數會變動:標準模式下的 gpt-5.6-sol、開啟 pro 模式的 gpt-5.6-sol,以及相同 effort 下的 gpt-6.1-sol。比較任務成功、實際耗時與總計費 token 數,並讀取 reasoning-token 欄位,而不是回應內文。pro 執行的 token 總數相對於其標準模式孿生版本,就是套用在你流量上的倍率——它不會和別人的相符,因為設計意圖是額外工作量會隨請求難度而擴展。6.1 那次執行是相同請求主體、只改了一個字串,所以決策後將它保留為迴歸測試不會有任何成本。
在下結論之前,有兩件事要謹記在心。如果 6.1 識別碼拒絕 pro 參數,而不是回傳結果,那本身就是一項發現,而且你在它觸及任何使用者可見的東西之前就先得知了。還有,如果你拿來比較的那個分支是目前已可路由的 gpt-6-sol,而不是某個 5.6 配置,請記住 6.0 與 6.1 之間的基礎費率卡完全相同——這兩者之間的差異在於快取輸入那一行以及供應商回報的任務結果,而 5.6 與 6.1 之間的差異則是整張費率卡。
常見問題
GPT-5.6 Sol Pro 是擁有自身高級定價的獨立模型嗎?不——而這正是這個名稱所設下的陷阱。OpenAI 的價目表上確實列有真正的高級 Pro 計費項目,但它們屬於較早的世代,每百萬個 token 輸入 $30.00、輸出 $180.00 以上。就 GPT-5.6 系列而言,供應商販售的是旗艦型號,並將 pro 作為 Responses API 中 reasoning.mode 的一個值提供,按該旗艦型號的普通費率計費。一個標註為 5.6 世代、並標價 $4.00 與 $20.00 的 pro 項目,引用的是旗艦型號的價目表,這正是你判斷沒有第二套計費方式的方法。
這兩者之中,我該把吃重、低量(low-volume)的工作負載交給哪一個?兩個答案都不是免費的,所以決定取決於你能測量什麼,而不是你能讀到什麼。較新的層級在每一條公布的價目上價格都只要一半,快取輸入更是便宜四倍,但它的 pro 模式背後沒有獨立評測,而且它的模型頁面完全沒提到這個模式。較舊的層級有穩定的 GA 紀錄與完整的第三方評測,但每 token 的成本是兩倍。如果你的任務集跑起來很便宜,答案就是在相同投入下,哪一方能在你自己的請求上勝出;如果不是,較舊的層級至少是那個你能拿別人的數字來核對其行為的選擇。
Pro 模式會改變模型擅長的事情嗎?不會。它會在回傳單一最終答案之前執行更多模型運算,這能提升處理困難任務時的可靠性,同時增加延遲與 token 用量——但不論哪一種,權重都相同。如果你想推動的指標是準確率或幻覺數字,而不是真正困難問題上的任務成功率,那麼這個模型家族上的獨立證據顯示,比較可靠的槓桿是模型世代與 effort 設定,而不是模式。

簡短版本,也是這場比較中值得帶走的一點:專業模式是不變的常數,費率表才是變數。在這兩種配置之間,這個模式的運作方式沒有任何改變——同樣的模型工作彙整、同樣的標準費率計費、同樣未公開的倍數,以及當你試圖將它與 effort 搭配時所得到的同樣錯誤:沒有。三個月內實際改變的是,它底下計價表上每一條已公布的項目都減半了,而快取輸入那一項則降為四分之一。這使得較新的層級成為已在運行專業配置者基於價格的預設選擇,也使得較舊的層級成為任何在轉換前需要第三方數據者在證據上的預設選擇。這兩者都不構成把這些名稱當成兩種產品的理由。
測試的兩個分支都透過一個與 OpenAI 相容的端點執行;該端點會將廠商價目表按原樣透傳、不額外加價,並在供應商之間自動容錯移轉。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
