
GPT-6 Sol 與 GPT-6 Luna:更便宜的 Token 未必等於更便宜的任務
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
廠商推出 GPT-6 Sol 與 GPT-6 Luna 於 2026 年 9 月 22 日,而各地新聞頭條都是價格:Sol 每百萬輸入符元 $2.00、輸出 $10.00,Luna 為 $0.10 與 $0.50,兩者大約是 GPT-5.6 Sol 與 GPT-5.6 Luna 在目前促銷費率下收費的一半,且兩者都遠低於旗艦款 GPT-6 Astra 的 $10.00/$50.00。廠商自家的公告開頭就說「我們也讓快取與推論更有效率了。」把這解讀成降價故事的問題在於,真正出現在你帳單上的單位不是符元,而是任務。而同日發布的第一批獨立測量顯示,這兩款新模型正是在這個單位上朝相反方向移動——其中 GPT-6 Luna 在輸入上便宜二十倍,對比自家前代時,表現卻是兩者中較差的。這兩款模型中,一款是單純升級,另一款則是真的取捨,而廠商的公告並未區分兩者。
在進入數字之前,先交代本文的取材規則,因為這裡的兩堆證據理應獲得截然不同的權重。價格、上下文視窗、快取費率與知識截止日期,來自 OpenAI 自家的 API 文件與定價表,查閱日期為 2026 年 9 月 23 日;其中服務層級與快取寫入的相關條目,是對照第三方成本追蹤工具佐證而得,而非僅採信官方發布內容。OpenAI 的基準測試表——AutomationBench、DeepSWE 1.1、OSWorld 2.0、Agents' Last Exam,以及一項內部的真實性評估——皆屬廠商自行提報且未經重現,下文凡取自這些表格的數字,都會如此標註。獨立數字則來自 Artificial Analysis,該機構在發布當天把兩個模型都放上其 Intelligence Index 與 Coding Agent Index 進行測試;要做決策,該信的是這些數字。兩者出現歧異時,本文會直接如實說明,而不是把它們平均掉。
這次發布,用一段文字說明
Sol 與 Luna 是 GPT-6 家族中的中階與低階成員,以 GPT-6 Astra 背後的訓練方法訓練而成,定位為更快、更便宜、且能達到其大部分能力的方式。OpenAI 的論述框架是每項任務的成本,而非原始能力:該公司表示,在其內部事實性評估中,GPT-6 Sol 的錯誤約為 GPT-5.6 Sol 的一半,而 GPT-6 Luna 在較高的推理強度下,能以大約百分之一的任務成本達到 GPT-5.6 Sol 的事實性水準。兩者皆接受文字與圖像輸入並產生文字,皆具備 1,050,000 個 token 的上下文視窗,輸出上限為 128K——Artificial Analysis 對同一模型列出的是 872k,因此該視窗的上限值應視為廠商自述——且兩者皆提供從 none 到 max 的推理強度,這是 GPT-6 Astra 未提供的等級,因為 Astra 沒有 none。模型 ID 為 gpt-6-sol 與 gpt-6-luna。可用性涵蓋 API,以及透過 ChatGPT Work 和 Codex 提供給 Plus、Pro、Business、Enterprise 與 Edu 帳戶,還有 Amazon Bedrock——後者於同日宣布兩者全面開放。Free 與 Go 使用者可在桌面應用程式中使用 Luna;目前兩款模型都還未在一般 Chat 模式中提供。
這四個獨立數字說明了什麼,以及它們為何彼此不一致
先從 GPT-6 Sol 說起,因為它的故事很簡單。Artificial Analysis 給它的分數是 智慧指數 48 分,在受測的 212 個模型中排名第 18,每項索引任務為 1.06 美元,相較於 GPT-5.6 Sol 的 1.99 美元——以同等的指數分數而言,成本大約只有一半,而且每項任務成本的改善能夠維持,不會憑空消失。它的 Coding Agent Index 上升到 57,高於 55,其中 Terminal-Bench 4.0 從 37% 進步到 43%,SWE-Atlas-QnA 從 54% 到 58%,在帕雷托前沿上每項任務成本為 2.99 美元。它的幻覺率從 92% 降到 60%,而它的棄答行為則徹底改變了樣貌:現在它會回答 83% 的問題,而前一代會回答 99%,換來的是錯誤答案少了四分之一,準確率則從 59% 微降至 54%。這是一個被教會在不確定時閉嘴的模型,而 AA-Omniscience Index 從 22 上升到 27,正是同一件事以分數的形式呈現。
現在輪到 GPT-6 Luna,情況就不同了。Artificial Analysis 在 Intelligence Index 上給它37 分 —— 與 GPT-5.6 Luna 拿到的分數完全相同。它每項索引任務的成本從$0.18 降至 $0.07,少了約 60%,而這項節省是真實的。但它的Coding Agent Index 卻下降,從 43 降到 41,SWE-Atlas-QnA 從 49% 跌至 44%,DeepSWE 1.1 則從 66% 跌至 64%。它的幻覺率從 93% 改善至 77%,而它的棄答行為幾乎沒有變動 —— 準確率 44% 對上 43%,AA-Omniscience 從 −10 到 1。綜合來看:相同的實測智慧,任務成本約為原來的 40%,但編碼代理表現更差,答案品質則基本上沒有改變。
那不是矛盾,而箇中原因很重要。只有在模型為了完成同一項工作而花費更多 token 時,較便宜的 token 才會讓你獲益更少——而獨立資料顯示,這些模型花費的是更多,而不是更少。Sol 每項索引任務的輸出從 29k 增加到 31k 個 token,Luna 則從 41k 增加到 51k。GPT-6 Luna 的 60% 節省完全來自降價,而不是來自更精簡的運作。每項任務的 token 用量漂移小到在這裡算術仍然對你有利;但它還沒有小到可以作為一個類別來忽略,因為這正是未來降價可能被更愛閒聊的模型抵銷的機制。OpenAI 自己的表述也出於同樣理由,轉向以每項任務成本來衡量。
有兩項退步落在兩個頭條指數之外,值得點名,因為兩者在 OpenAI 的公告中都未出現。在衡量知識工作交付成果的 GDPval-AA v2.1 中,GPT-6 Sol 相較前代損失約100 Elo,而 GPT-6 Luna 則損失約75。GPT-6 Luna 在 AA-Briefcase v1.1 中也掉了約45 Elo,而 Sol 則保持穩定——Artificial Analysis 將此差距歸因於呈現較弱以及缺少評分項目。若你使用廉價層級是為了大量摘要、擷取與分類,這些都不會影響到你。若是為了起草需要有人簽核的內容,那就會了。

快取變更才是真正的 API 新聞
藏在費率表底下的,是一項對生產帳單而言比頭條降幅更要緊的變動,而這正是 OpenAI 自家公告以一個子句隱約帶到的那個部分。有三件事變了,而第三件是值得讀兩遍的那一件。
第一項是折扣本身:快取輸入讀取以輸入價格的 10%計費,等於 90% 折扣,這是該系列原本就已採用的相同條件,而非新條件。Sol 的快取輸入為每百萬 $0.20,Luna 為 $0.01;快取寫入帶有 1.25 倍溢價,分別為 $2.50 與 $0.125,並具有單一 30 分鐘的存活時間。
第二點是控制權。透過prompt_cache_options 與 prompt_cache_breakpoint 進行的明確快取——這些參數讓你宣告可重複使用的提示前綴在哪裡結束,而不必指望供應商自行猜測——在兩個模型上皆可使用。這並非新的 API 介面;新的是它現在值得使用,因為預設的命中率提高了。
第三項是改變架構的那一項。調整推理投入程度,或開啟、關閉工具,都不再使快取前綴失效。在此之前,一個代理迴圈若為困難步驟調高投入程度、為簡單步驟調低,就得在每一次調整時重新處理整個上下文;同樣地,在對話中途新增或移除工具也會如此。如今在這兩款模型上,這筆成本已經消失。OpenAI 引述 GitHub 的說法,後者回報這些變更讓數十億次請求中需要重新處理的提示詞 token 佔比降低超過一半。請把這視為供應商提供的數字——它可信,但並未經過獨立審核。
對一個長時間運行的代理迴圈做點算術,那兩項公告的排名就會翻轉。一個迴圈若在 200 輪對話中扛著 30,000 個 token 的系統提示與工具結構描述,就會搬動 600 萬個 token 的上下文。若不快取,在 GPT-6 Sol 上,那是 $12.00 的輸入費用。若把前綴快取起來,每百萬 token 收 $0.20,那就是 $1.20 加上一次性的寫入費用——一個數量級的差距,只憑一個參數變更,而且降價根本還沒算進去。降價是那項公告所推銷的東西。快取行為才是真正改變數字的那一環,也正是為什麼 $2.00 的頭條費率,在 OpenAI 力推這些模型所瞄準的工作負載上,表現得像便宜得多的東西。
費率表,包括公告略過的部分
主打費率並不是完整的費率表,而三個層級會改變特定工作負載的決策。
• 基礎 — GPT-6 Sol 每百萬詞元輸入 $2.00/輸出 $10.00;GPT-6 Luna 每百萬詞元輸入 $0.10/輸出 $0.50,適用於輸入詞元上限為 272K 的提示。
• 長上下文 — 輸入權杖超過 272K 時,整筆請求都會以 2 倍輸入與 1.5 倍輸出計費:Sol 為 $4.00/$15.00,Luna 為 $0.20/$0.75。這是一道斷崖,而非邊際費率。若你的提示詞達到 300K 權杖,你是在為整筆請求付雙倍費用,而不是只為超出門檻的那 28K 付費;而把一份文件拆成兩次低於門檻的呼叫,往往比一次超過門檻送出更便宜。
• 服務層級 — Flex 會將費用減半(Sol 為 $1.00/$5.00,Luna 為 $0.05/$0.25),換取較慢的處理時間;Priority 則會使其加倍。兩者皆透過 service_tier 參數選取。Flex 是類似批次的工作應該採用、卻幾乎從未採用的層級。
• 快取輸入 — Sol 上每百萬個 $0.20,Luna 上 $0.01,折扣達 90%,TTL 為 30 分鐘,並有 1.25 倍快取寫入加成。
• 上下文與輸出 — 1,050,000 個 token 的視窗、128K 最大輸出、可輸入文字與圖像、輸出文字、推理強度 無 至 最大,並以 中 為預設值。
• 知識截止日期——GPT-6 Sol 為 2026 年 4 月 20 日,GPT-6 Luna 為 2026 年 5 月 18 日,兩者在同一系列中相差一個月,這點值得你在假設這兩個模型共享相同世界觀之前先了解。
OpenAI 的基準表說了什麼,以及它沒說什麼
OpenAI 公布的比較全都是每項任務成本、全都對比 Anthropic,而且全由廠商自行執行。在 AutomationBench 1.0.6 這項涵蓋 47 種工具的代理式評估中,該公司報告 GPT-6 Sol 在 xhigh 努力程度下得分 33.2%,每項任務成本 0.27 美元,而 Claude Opus 5 為 26.9%,每項任務成本約為其 11 倍。在 DeepSWE 1.1 上,報告指出 Sol 在 max 努力程度下得分 68.8%,對上 Claude Fable 5 的 69.9%——分數落敗,但每項任務成本約低 80%——而 Luna 為 66.6%。在 OSWorld 2.0 上,Sol 在 xhigh 下得分 60.5%,對上 Opus 5 的 60.3%,同樣每項任務成本約少 80%。在 Agents' Last Exam 上,Sol 達到 56.4%,OpenAI 稱這擊敗 Opus 5 的最佳結果,且每項任務成本低 60%。
那些數字全都是廠商自行報告、未經重現的,而其中有兩點但書值得繼續放在心上,而不是束之高閣。第一,OpenAI 的基準測試比較對象是 Claude Opus 5,而不是在發布消息前幾小時才推出的 Claude Opus 5.5,因此目前還沒有同一測試框架下的比較,能確立究竟哪個模型真正帶來較低的每成功任務成本。第二,每項任務的成本並不等於每項正確任務的成本:一個有 83% 的時候作答、其餘時候棄答的模型,在把棄答也算作任務的基準測試中,每項任務看起來都會很便宜。上面那份獨立的棄答資料,正是讓你誠實為此定價的依據——GPT-6 Sol 在舊模型能回答 99% 問題的情況下只回答 83%,這是刻意的取捨,而這取捨究竟好不好,完全取決於一個錯誤答案會讓你付出多大代價。
OpenAI 報告指出,GPT-6 Luna 在較高的推理投入下,能以大約僅為任務成本百分之一的代價,達到與 GPT-5.6 Sol 相同的事實準確度。這是事實準確度的比較,而非能力的比較,而獨立的 Coding Agent Index 則讓 GPT-6 Luna 以兩分之差落後 GPT-5.6 Luna,更遑論 GPT-5.6 Sol。

這個實際上該怎麼處理
GPT-6 Sol 是最直截了當的一款。在同等級指數分數下,任務成本減半、更出色的編碼代理、幻覺大幅減少,加上拒答行為出現實質改變,這些加總起來,是一次可以按表操課的升級,而不是一場賭博。如果你目前用的是 GPT-5.6 Sol,這就是一次遷移,而唯一真正的問題是:你的哪些提示詞依賴舊模型有問必答的意願。
GPT-6 Luna 是你採取行動前該測試的那一個。它並非嚴格意義上更好的 GPT-5.6 Luna;它是形狀不同的一個——每項任務更便宜、對自己會宣稱什麼更謹慎,而且在代理式編碼上明顯更差。對於大量進行的分類、擷取、路由與摘要而言,這個取捨幾乎等於白撿的錢。但對於任何餵給編碼代理的內容,或產出需要人工簽核的文件,兩點的 Coding Agent 退步與 GDPval 的下滑,就是把 GPT-5.6 Luna 留在流程中的理由,直到你用自己的任務跑過兩者為止。
這也是不把兩者任一方硬性綁死的理由。這兩款模型目前都僅限 OpenAI 使用,而這些層級所服務的工作負載——路由、擷取、低成本分類——正是那種情境:把第二家供應商放在同一個端點之後,就能讓模型退步變成無關緊要的小事。OrcaRouter 以0% 加成將供應商的定價原樣轉嫁,因此供應商的費率一旦變動,在他們那邊生效的同一天就會落到我們這邊,而路由 DSL讓你能把 GPT-6 Luna 放在較便宜的模型後方,負責較輕鬆的那部分流量,較吃重的部分則交由 GPT-6 Sol 處理——並具備自動容錯移轉,只要任一條路徑的效能劣化就會啟動。你不必在發布當天就選定贏家,也能從這次發布中受益。
誠實的但書:截至 2026 年 9 月 23 日,GPT-6 Sol 與 GPT-6 Luna 無法透過 OrcaRouter 路由。我們尚未代管它們,上述任何內容都不應被解讀為我們聲稱已提供。今天我們這邊有的是比較組合——GPT-5.6 Sol 為 $4.00/$20.00、GPT-5.6 Luna 為 $0.20/$1.20,以及 GPT-6 Astra 為 $10.00/$50.00——這正是你在決定投入遷移之前,為其估算成本所需的資訊。

接下來要看什麼
有三件事可以確定這次發布實際上究竟是什麼。第一是 GPT-5.6 Luna 的 $0.20/$1.20 費率能否撐過這一季,因為單一供應商祭出的永久價格,歷來都是開局的第一步,而不是終點——而且同日發布 Claude Opus 5.5,顯示促成這次降價的壓力並未消失。第二是拒答的轉變在實際場域能否站得住腳:GPT-6 Sol 每六題就有一題拒絕回答,這種改變在實驗室裡讀起來像改善,在假設一定會有答案的管線裡卻像產品壞掉。第三是快取行為在你的流量上是否為真,這點本週就能量測,也只能靠量測回答——折扣大到值得花一小時,在你最長的提示上埋點量測快取命中率,比再看一張基準測試表更有價值。
本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
