
GPT-6.1 Sol 對上 GPT-6 Luna:十三個指數點、十倍的價格,以及兩項它並不成立的評估
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
OpenAI released GPT-6.1 Sol on 29 September 2026, one week after GPT-6 Luna arrived on 22 September in the same keynote cycle. They are the two ends of the same generation: Luna is the cheap tier, Sol is the mid-tier above it, and GPT-6 Astra sits above both. The price difference between the two is an order of magnitude — $0.10 and $0.50 per million tokens against $2.00 and $10.00, cached input $0.01 against $0.10 — and the capability difference on the independent board is 13.7 Intelligence Index points, 51.8 against 38.1 at maximum reasoning effort. Ten times the money for thirteen points is roughly the worst exchange rate in the current OpenAI lineup. What makes the comparison worth writing about is the forty-dollar question that follows: which thirteen points?
這兩個模型,以及它們之間的那一週
GPT-6 Luna is the small model of the GPT-6 generation — the one OpenAI describes as built for high-volume, latency-sensitive work: classification, extraction, routing, bulk summarisation, the inner loop of an agent. It carries a 1,050,000-token context window and a 128,000-token output ceiling, takes text, images and files as input, and keeps the full six-rung effort ladder including none, which the 6.1 tier dropped. The rate card is the reason it exists: $0.10 in and $0.50 out per million tokens, cached input at $0.01 and cache writes at $0.125, with a long-context step above 272,000 input tokens to $0.20, $0.75 and $0.02 cached.
GPT-6.1 Sol 是晚一週推出的中階改版。相同的上下文視窗、相同的輸出上限、相同的輸入模態,知識截止日為 2026 年 4 月 30 日(Luna 的截止日則不同),以及一個努力程度階梯,其起始值為 low,因為none 和 minimal 都被直接駁回。其定價為 $2.00 與 $10.00,快取輸入為 $0.10——是 Luna 輸入費率的二十倍、輸出費率的二十倍,而每次快取命中的成本則高出十倍。
兩者都已開賣,兩者都可在 ChatGPT Work、Codex 及 API 中使用,而且在我們這邊,兩者都能透過同一把金鑰呼叫。這個組合完全不需要二選一。
十三個指數點實際上能買到什麼
綜合分數是這項比較中資訊量最低的數字,因為它平均了表現差異極大的各項任務。在 Artificial Analysis v4.3.2 上以最高推理強度逐項評估評分後,呈現出的形狀是分裂,而非斜坡:
• AA-LCR v1.1,長上下文推理 —— GPT-6 Luna 0.833 對 GPT-6.1 Sol 0.830。Luna 略勝一籌。
• SciCode — GPT-6 Luna 0.546 對 GPT-6.1 Sol 0.542。再次實質上勢均力敵,而較便宜的模型再次名義上領先。
• Terminal-Bench 4.0 — GPT-6 Luna 0.126 對上 GPT-6.1 Sol 0.561。43 分的差距;這兩個模型在終端機工作上的表現分屬不同檔次。
• Humanity's Last Exam — GPT-6 Luna 0.385 對上 GPT-6.1 Sol 0.529。
• AutomationBench-AA — GPT-6 Luna 0.532 對比 GPT-6.1 Sol 0.649。
• GDPval-AA v2.1 — GPT-6 Luna Elo 1437.1 對上 GPT-6.1 Sol Elo 1575.1,在專業知識型工作上差距達 138 分的 Elo。
• GDP.pdf — GPT-6 Luna 0.228 對比 GPT-6.1 Sol 0.310。
• CritPt — GPT-6 Luna 0.194 對比 GPT-6.1 Sol 0.317。
• AA-Omniscience — GPT-6 Luna 0.65 對比 GPT-6.1 Sol 41.5。在零代表答對與答錯數量一樣多的量表上,Luna 正好落在水線,而 Sol 則明顯高於水線。
• MMMU-Pro — GPT-6 Luna 0.797 對比 GPT-6.1 Sol 0.860。
• 每個索引任務的成本,獨立計算 — GPT-6 Luna $0.068 對 GPT-6.1 Sol $0.72;便宜模型約有十倍的差距優勢
• 索引執行時的輸出 token 數——GPT-6 Luna 為 1.44 億,GPT-6.1 Sol 為 6,700 萬;同級中位數為 Luna 的 1 億、Sol 的約 8,100 萬
十項評估中有兩項是平手,結果對便宜的那個模型有利。八項歸於昂貴的那一個,而在這八項當中,有六項的差距並非微不足道。這才是對這十三分的誠實解讀:這不是一條均勻的品質梯度,而是兩項能力——持續的代理式執行與事實可靠性——在這些方面,Luna 根本稱不上同一等級的模型,再加上一大片中間地帶,那裡的差異確實存在,卻小到在你自己的評估集中根本看不出來。
AA-LCR 的結果值得附帶一項但書,因為這是最能美化 Luna 的數字。長上下文推論拿到 0.833 是很強的成績,而且這兩個模型彼此差距不到半分,但這項基準衡量的是長輸入上的檢索與推論,而不是在長時間工作階段中採取行動的能力。Terminal-Bench 4.0 上的差距,就是「在長時間工作階段中採取行動」被計分時的樣子,而這差距寬達 43 分。

每項任務成本的計算,以及它在何時不再成立
Artificial Analysis 根據實測的 token 消耗量為每次指數運行定價,因此成本數字並非價目表推斷。GPT-6 Luna 的運行成本為每項任務 $0.068;GPT-6.1 Sol 的成本為 $0.72。比率為 10.7 倍,這僅因為 Luna 在運行中產生了 1.44 億個輸出 token,而 Sol 則產生了 6700 萬個,才略遜於名義上的二十倍價格比率——這個便宜模型的話量是對方的兩倍多,從而侵蝕了自身的優勢。即便如此,排名並不接近,而且在簡答題工作負載上,差距還會擴大:輸出量減少意味著 Luna 的冗長懲罰會縮小,而它的價格優勢保持不變。
這套算術不再成立的地方,是任何與該指數所反映的工作負載不相像的情況。如果你的任務是需要讓二十次工具呼叫保持連貫的儲存庫規模編輯,一個會讓任務失敗的 $0.07 模型,代價是你要付出整個重試迴圈再加上實際耗費的時間,而那個一次就能完成的 $0.72 模型反而更便宜。GPT-6.1 Sol 自己的發表論述完全建立在這個概念上——每個已完成任務的成本——而這是正確的框架:真正相關的比較不是 token 費率,而是每個結果的預期成本,而在 Luna 無法完成的任務上,那個預期值是無上限的。
兩個結構性細節讓這條界線更加分明。首先是長脈絡級距:兩個模型在輸入超過 272,000 個 token 後都會調整價格,Luna 調整為 $0.20、$0.75 及 $4.00,因此絕對差距在這條界線上是不縮反增,但 Luna 調整後的費率仍比 Sol 的標準費率低了一個數量級。第二,這點容易被忽略:effort 階梯的形狀並不相同。Luna 接受 none;Sol 則不接受。一個先路由至 Sol、並在發生錯誤或逾時時回退至 Luna 的串接流程,不能把請求的 reasoning.effort 原封不動地帶過去,因為在某個模型上合法的設定,在另一個模型上會回傳錯誤。這是路由層面的問題,而不是模型品質的問題,而這正是設有路由規則的單一端點應該要吸收的那類問題。
兩者並行才是重點,而非權宜之計
Both models are on OrcaRouter at OpenAI's own list prices with nothing added: GPT-6 Luna at $0.10 and $0.50 with cached input at $0.01, GPT-6.1 Sol at $2.00 and $10.00 with cached input at $0.10, and the 272,000-token step on each passed through exactly as the vendor lists it. Because the platform passes provider list price through rather than marking it up, the twenty-fold ratio in this article is the ratio you actually pay, on both sides.

這件事在這裡之所以特別重要,是因為這兩個模型的組合本身就是一組等著被寫出來的串接流程。分類器、路由器、大量擷取作業和儲存庫規模的編碼代理,本來就不該跑在同一個模型上,而兩者之間的價格差距大到無論往哪個方向選錯都很昂貴——一邊是每次呼叫貴上二十倍,另一邊則是任務失敗。一把金鑰、兩個模型,再加上一條規則:把簡單的流量送往 Luna,並在任務類別改變、或 Luna 的輸出未通過檢查時升級到 Sol——這對我們來說只是改個設定,而不是多簽一份供應商合約。自動容錯移轉則涵蓋了兩者之一效能劣化的情況;對一個八天前才推出的模型而言,這仍是可能實際發生的狀況。

決策,一次完成
• 分類、擷取、路由、批次摘要、代理內部迴圈 — GPT-6 Luna,然後別再讀下去了。在 $0.10/$0.50 加上一美分快取讀取的價格下,一般能力多出的十三個指數點,不值得在答案簡短且可檢查的工作上付出十倍的費用。
• 儲存庫規模的程式編寫、終端機代理、多步驟執行 —— GPT-6.1 Sol。Terminal-Bench 4.0 的 43 分差距就是全部的論據;這正是這個價格所換取的能力。
• 錯誤答案代價高昂的知識工作問題 — GPT-6.1 Sol,談 AA-Omniscience 與 GDPval-AA 的落差。Luna 的事實可靠性分數正處於吃水線。
• 長輸入搭配簡短的生成答案 — GPT-6 Luna。它能以與成本高出二十倍的模型同等的表現對長上下文進行推理,而其 1.44 億詞元的冗長懲罰根本無從生效。
• 任何已經設定為 無 的項目——留在 Luna,或為這項變更編列預算。GPT-6.1 Sol 上並不存在這個層級。
• 延遲敏感介面 — GPT-6 Luna,根據該排行榜自身的量測結果:每秒輸出 129.4 個 token、首個區塊耗時 100 秒,相較於 Sol 的 59.7 與 332。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
