
GPT-6.1 Sol 對決 GPT-6 Astra:指數只差一點,費率表卻貴五倍
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 397 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2237智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens · 195 tok/s
- Orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- xAISpaceXAI: Grok 4.62026-08-1244智能77程式
GPT-6.1 Sol 與 GPT-6 Astra是同一個家族的中階與旗艦型號,兩者相隔四週推出——Sol 於 2026 年 9 月 29 日、Astra 於 2026 年 9 月 3 日——而在本週之前,兩者之間的比較完全建立在 OpenAI 自家的數據上。現在不再是了。Artificial Analysis 已在同一個索引版本上,以最高推理強度對兩者進行評估,結果是 Astra 以 0.84 分的差距勝出,緊鄰其旁的卻是 GPT-6.1 Sol 在每次評估執行成本上 4.5 倍的差距。在價目表上,比例更為懸殊:Astra 的輸入與輸出是 GPT-6.1 Sol 的 5 倍,快取輸入則是 10 倍。本頁要回答的問題是:這筆溢價在哪裡買到了你能具體指出的東西,又在哪裡只是名號的代價。
這兩個模型是什麼,以及板子量測了什麼
兩者皆為文字與圖片輸入、文字輸出,具備 1,050,000 個 token 的上下文視窗,以及 128,000 個最大輸出 token;兩者也提供五級努力程度階梯——低、中、高、xhigh 與 max——但已移除 none 設定,而 GPT-6 Sol 仍接受該設定。兩者皆不支援微調。真正重要的差異,正是價目表所列出的那些:Astra 是旗艦層級,GPT-6.1 Sol 是其下層級的更新版,而 OpenAI 自己為這款較新模型所定的定位語是「為複雜工作提供接近 Astra 的效能,且成本更低」。
Artificial Analysis 在其 Intelligence Index 上為該宣稱評分——在 v4.3.2 版中共有十項評估,兩個模型使用相同版本——並記錄它為每個模型所持有的發布日期。它會以模型頁面在其標題中標示的最大努力組態來評估兩者。接下來是那項比較,外加該指數不會替你做的成本計算。
• GPT-6.1 Sol — 於 2026-09-29 發布,最高推理強度下 Intelligence Index 為 51.8,每百萬詞元 $2.00 輸入 / $0.10 快取 / $2.50 快取寫入 / $10.00 輸出。
• GPT-6 Astra — 於 2026-09-03 發布,最高推理強度下 Intelligence Index 為 52.7,每百萬詞元 $10.00 輸入 / $1.00 快取 / $12.50 快取寫入 / $50.00 輸出。
• 兩者皆不支援 — 不接受 none 推理強度;當輸入超過 272,000 詞元時,兩者都會將整個請求以 2 倍輸入與快取費率及 1.5 倍輸出費率重新計價。Astra 的長上下文級距為 $20.00 輸入 / $2.00 快取 / $75.00 輸出;GPT-6.1 Sol 的則為 $4.00 / $0.20 / $15.00。
• 兩者皆 — 透過 Responses API 支援網頁搜尋、檔案搜尋、影像生成、程式碼解譯器、託管 shell、套用修補、技能、電腦操作、MCP 及工具搜尋。
0.84 指數點,是評估帳單的 4.5 倍

兩個數字並排顯示在榜單上,合在一起便構成完整的論證。GPT-6 Astra 在最大努力下得分 52.7。GPT-6.1 Sol 在最大努力下得分 51.8。每個分數旁,榜單也公布了執行其背後指數所需的成本:Astra 每項任務 $3.26,GPT-6.1 Sol 為 $0.72。若讀成一句話——以 4.5 倍的費用換來 0.84 分——這是兩家公司針對這兩個模型所公布過、與決策最相關的數字。
兩個模型也都會公布努力階梯上每個點的分數,這讓比較能在相同支出下進行,而不是在相同設定下進行:
• 最大努力 — GPT-6.1 Sol 51.8(每次執行 $0.72)對比 GPT-6 Astra 52.7($3.26)。
• 極高 — 51.0($0.39)對比 52.4($2.31)。
• 高 — 50.2($0.32)對比 50.9($1.73)。
• 中 — 47.8($0.21)對比 49.6($1.54)。
• 低 — 42.1($0.13)對比 45.8($0.82)。

把各模型的不同等級並排比較,就會浮現一個兩家廠商都沒宣傳的事實:Astra 自身從 high 到 max 的差距是 1.8 個指數分,比 Astra 在 max 與 GPT-6.1 Sol 在 max 之間的整體差距還多出一倍以上。換句話說,選 Astra 而非 GPT-6.1 Sol 所換得的分數,還不如在 Astra 內從 high effort 改選 max effort 來得多——而後者的成本只是前者的一小部分。任何工作負載真的對那 1.8 分敏感的人,應該先檢查 effort 設定,再去看模型那一欄。
Astra 的溢價在何處仍能換來價值
綜合分數很接近;個別評估則不然。以最大努力逐列評分,GPT-6 Astra 在十項中佔有六項優勢,而它佔優勢的,正是那些涉及行動而非回答的項目。
• AutomationBench-AA,跨工具的多步驟工作流程——Astra 為 0.685,GPT-6.1 Sol 為 0.649。Astra 領先 3.6 分。
• Terminal-Bench 4.0,在真實環境中的終端機作業——0.591 對 0.561。Astra 領先 3.0 分。
• SciCode——0.565 對 0.542。Astra 領先 2.3 分。
• Humanity's Last Exam——0.547 對 0.529。Astra 領先 1.8 分。
• AA-Omniscience——43.4 對 41.5,而且在同一組題目上,Astra 的幻覺率為 0.513,GPT-6.1 Sol 則為 0.543。Astra 不僅更準確,也更願意承認自己不知道。
• AA-Briefcase v1.1,專業交付成果——Elo 1568.9 對 1564.2。Astra 領先 4.7。
這個模式足夠一致,足以據此規劃:當任務要求模型理清一長串動作——操作終端機、執行多工具工作流程、產出文件形式的交付成果——Astra 的優勢是真實的,而且在各種測試框架中都可重現。當任務是單回合就能回答的知識問題時,這項優勢就大致消失了。
在較便宜的模型勝出之處,包括快取行
GPT-6.1 Sol 並非只是各方面都略遜 Astra 一籌的版本。在那些看重長篇材料閱讀與推理的評測上,它領先;而在價目表上,它領先的幅度更是該指數從未看見的。
• GDPval-AA,以專家產出評分的專業工作——GPT-6.1 Sol 的 Elo 為 1575.1,Astra 為 1541.9。成本僅五分之一的那個模型領先 33 分,也是這一行中最大的單一獨立勝差。
• AA-LCR v1.1,長上下文推理——0.830 對 0.807。GPT-6.1 Sol 領先。
• GDP.pdf——以 0.310 完全打成平手,CritPt也一樣以 0.317 打成平手。
• 快取輸入——每百萬個 token 為 0.10 美元,Astra 則為 1.00 美元。這一行決定了代理經濟學,卻完全不在這個指數之中。
• 輸出速度——在同一輪評估中為每秒 66.8 個 token,對上 56.95,輸出 token 用量為 6,720 萬,Astra 則為 6,000 萬。兩個模型都不快;GPT-6.1 Sol 是兩者中較快的那個。
一個代理月,依兩份費率表計價
以一個會重新傳送穩定前綴的工作負載為例:每月 4,000 萬個輸入 token,其中 85% 由快取供應,再加上 400 萬個輸出 token。在 GPT-6.1 Sol 的費率表上,快取讀取為 $3.40、未快取輸入為 $12.00,輸出則為 $40.00——$55.40是當月費用。在 GPT-6 Astra 的費率表上,同樣的流量是 $34.00 的快取讀取、$60.00 的未快取輸入,以及 $200.00 的輸出——$294.00。工作負載完全相同;帳單卻是 5.3 倍。
有兩個門檻會讓這套計算出現變化,而兩者都值得在遷移決策之前就先估好價格,而不是等到決策之後。第一個是單一請求中達 272,000 個輸入 token:一旦超過,整個請求就會改以輸入與快取費率的兩倍、輸出費率的 1.5 倍重新計價,這會讓 GPT-6.1 Sol 變成 $4.00 / $0.20 / $15.00,Astra 變成 $20.00 / $2.00 / $75.00。第二個是 effort 階梯本身——把 GPT-6.1 Sol 從 max 降到 xhigh,能將其索引執行成本從 $0.72 降到 $0.39,代價是 0.8 分;把 Astra 從 max 降到 high,則能從 $3.26 降到 $1.73,代價是 1.8 分。在快取比重高的 agent 迴圈中,effort 設定是比模型欄位更大的成本槓桿,這與這兩個模型通常被比較的方式正好相反。
該執行哪個,以及你實際上能呼叫什麼
根據證據,這樣的分流比行銷宣傳所暗示的更清晰。把必須撐過一長串動作的工作——終端機工作階段、工具密集的自動化、幻覺段落代價高昂的文件交付成果——導向 GPT-6 Astra,並考慮以 high 而非 max 執行,除非你已實測那多出的 1.8 分會落在你的任務上。把所有知識密集、快取密集或以讀取為主的工作導向 GPT-6.1 Sol:它在專業工作評分上表現更好,在長脈絡推理上更強,速度更快,而且在真實帳單中占大宗的項目上便宜五到十倍。

今天能呼叫到的,才是誠實的部分。OrcaRouter 以 OpenAI 自家的定價提供 GPT-6 Astra——輸入 $10.00、輸出 $50.00、快取讀取 $1.00 與快取寫入 $12.50 的費率,而 272K 的重新計價規則也完全依照廠商公布的方式原樣傳遞——同時提供 GPT-6 Sol 與 GPT-6 Luna。它不提供 GPT-6.1 Sol:公開目錄回傳「找不到模型」給 openai/gpt-6.1-sol,而我們不會去描述一個我們無法路由的模型。由於供應商定價是原樣傳遞、不額外加價,哪天那個模型上線,在我們這邊就是直接採 OpenAI 的費率,不需要重新計價的步驟;今天這場對決中可用的那一半是旗艦模型,只要一組 API 金鑰,並可使用 路由 DSL,只要你想要把便宜的模型與昂貴的模型組成單一呼叫,而不是每次請求都得在兩者之間做選擇。
最該留意的是這份比較漏掉的那一列。不論是廠商數字還是獨立指標,都無法告訴你,你自己的流量在這兩個層級上會有什麼表現;而唯一便宜的驗證方法,就是在容錯移轉主導的情況下,讓同一組任務跑過這兩者。當兩半都可呼叫時,這是一鍵就能做的實驗;在它們都能呼叫之前,只能算是半套實驗。
