一張生成的主視覺標題卡,寫著「GPT-6 Sol 與 GPT-6 Luna」,上方眉標為「模型發布——2026 年 9 月」,副標題為「每 token 價格減半,不等於每項任務成本減半。」,並有四張標籤寫著「GPT-6 Sol:每 100 萬 token $2.00 / $10.00」、「GPT-6 Luna:每 100 萬 token $0.10 / $0.50」、「Sol:指數 48,每項任務 $1.06」與「Luna:指數 37,每項任務 $0.07」,另有一則註腳寫著「價格依 OpenAI;指數與每項任務成本依 Artificial Analysis,2026 年 9 月 22 日。」真正的 OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-6 Sol 與 GPT-6 Luna:更便宜的 Token 未必等於更便宜的任務

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

廠商推出 GPT-6 SolGPT-6 Luna 於 2026 年 9 月 22 日,而各地新聞頭條都是價格:Sol 每百萬輸入符元 $2.00、輸出 $10.00,Luna 為 $0.10 與 $0.50,兩者大約是 GPT-5.6 SolGPT-5.6 Luna 在目前促銷費率下收費的一半,且兩者都遠低於旗艦款 GPT-6 Astra 的 $10.00/$50.00。廠商自家的公告開頭就說「我們也讓快取與推論更有效率了。」把這解讀成降價故事的問題在於,真正出現在你帳單上的單位不是符元,而是任務。而同日發布的第一批獨立測量顯示,這兩款新模型正是在這個單位上朝相反方向移動——其中 GPT-6 Luna 在輸入上便宜二十倍,對比自家前代時,表現卻是兩者中較差的。這兩款模型中,一款是單純升級,另一款則是真的取捨,而廠商的公告並未區分兩者。

在進入數字之前,先交代本文的取材規則,因為這裡的兩堆證據理應獲得截然不同的權重。價格、上下文視窗、快取費率與知識截止日期,來自 OpenAI 自家的 API 文件與定價表,查閱日期為 2026 年 9 月 23 日;其中服務層級與快取寫入的相關條目,是對照第三方成本追蹤工具佐證而得,而非僅採信官方發布內容。OpenAI 的基準測試表——AutomationBench、DeepSWE 1.1、OSWorld 2.0、Agents' Last Exam,以及一項內部的真實性評估——皆屬廠商自行提報且未經重現,下文凡取自這些表格的數字,都會如此標註。獨立數字則來自 Artificial Analysis,該機構在發布當天把兩個模型都放上其 Intelligence Index 與 Coding Agent Index 進行測試;要做決策,該信的是這些數字。兩者出現歧異時,本文會直接如實說明,而不是把它們平均掉。

這次發布,用一段文字說明

Sol 與 Luna 是 GPT-6 家族中的中階與低階成員,以 GPT-6 Astra 背後的訓練方法訓練而成,定位為更快、更便宜、且能達到其大部分能力的方式。OpenAI 的論述框架是每項任務的成本,而非原始能力:該公司表示,在其內部事實性評估中,GPT-6 Sol 的錯誤約為 GPT-5.6 Sol 的一半,而 GPT-6 Luna 在較高的推理強度下,能以大約百分之一的任務成本達到 GPT-5.6 Sol 的事實性水準。兩者皆接受文字與圖像輸入並產生文字,皆具備 1,050,000 個 token 的上下文視窗,輸出上限為 128K——Artificial Analysis 對同一模型列出的是 872k,因此該視窗的上限值應視為廠商自述——且兩者皆提供從 nonemax 的推理強度,這是 GPT-6 Astra 未提供的等級,因為 Astra 沒有 none。模型 ID 為 gpt-6-solgpt-6-luna。可用性涵蓋 API,以及透過 ChatGPT Work 和 Codex 提供給 Plus、Pro、Business、Enterprise 與 Edu 帳戶,還有 Amazon Bedrock——後者於同日宣布兩者全面開放。Free 與 Go 使用者可在桌面應用程式中使用 Luna;目前兩款模型都還未在一般 Chat 模式中提供。

這四個獨立數字說明了什麼,以及它們為何彼此不一致

先從 GPT-6 Sol 說起,因為它的故事很簡單。Artificial Analysis 給它的分數是 智慧指數 48 分,在受測的 212 個模型中排名第 18,每項索引任務為 1.06 美元,相較於 GPT-5.6 Sol 的 1.99 美元——以同等的指數分數而言,成本大約只有一半,而且每項任務成本的改善能夠維持,不會憑空消失。它的 Coding Agent Index 上升到 57,高於 55,其中 Terminal-Bench 4.0 從 37% 進步到 43%,SWE-Atlas-QnA 從 54% 到 58%,在帕雷托前沿上每項任務成本為 2.99 美元。它的幻覺率從 92% 降到 60%,而它的棄答行為則徹底改變了樣貌:現在它會回答 83% 的問題,而前一代會回答 99%,換來的是錯誤答案少了四分之一,準確率則從 59% 微降至 54%。這是一個被教會在不確定時閉嘴的模型,而 AA-Omniscience Index 從 22 上升到 27,正是同一件事以分數的形式呈現。

現在輪到 GPT-6 Luna,情況就不同了。Artificial Analysis 在 Intelligence Index 上給它37 分 —— 與 GPT-5.6 Luna 拿到的分數完全相同。它每項索引任務的成本從$0.18 降至 $0.07,少了約 60%,而這項節省是真實的。但它的Coding Agent Index 卻下降,從 43 降到 41,SWE-Atlas-QnA 從 49% 跌至 44%,DeepSWE 1.1 則從 66% 跌至 64%。它的幻覺率從 93% 改善至 77%,而它的棄答行為幾乎沒有變動 —— 準確率 44% 對上 43%,AA-Omniscience 從 −10 到 1。綜合來看:相同的實測智慧,任務成本約為原來的 40%,但編碼代理表現更差,答案品質則基本上沒有改變。

那不是矛盾,而箇中原因很重要。只有在模型為了完成同一項工作而花費更多 token 時,較便宜的 token 才會讓你獲益更少——而獨立資料顯示,這些模型花費的是更多,而不是更少。Sol 每項索引任務的輸出從 29k 增加到 31k 個 token,Luna 則從 41k 增加到 51k。GPT-6 Luna 的 60% 節省完全來自降價,而不是來自更精簡的運作。每項任務的 token 用量漂移小到在這裡算術仍然對你有利;但它還沒有小到可以作為一個類別來忽略,因為這正是未來降價可能被更愛閒聊的模型抵銷的機制。OpenAI 自己的表述也出於同樣理由,轉向以每項任務成本來衡量。

有兩項退步落在兩個頭條指數之外,值得點名,因為兩者在 OpenAI 的公告中都未出現。在衡量知識工作交付成果的 GDPval-AA v2.1 中,GPT-6 Sol 相較前代損失約100 Elo,而 GPT-6 Luna 則損失約75。GPT-6 Luna 在 AA-Briefcase v1.1 中也掉了約45 Elo,而 Sol 則保持穩定——Artificial Analysis 將此差距歸因於呈現較弱以及缺少評分項目。若你使用廉價層級是為了大量摘要、擷取與分類,這些都不會影響到你。若是為了起草需要有人簽核的內容,那就會了。

A generated two-column scoreboard titled 'GPT-6 Sol vs GPT-6 Luna - the scoreboard'. The left column, GPT-6 Sol, lists Intelligence Index 48, cost per index task $1.06, Coding Agent Index 57, hallucination rate 60%, GDPval-AA about 100 Elo lower, and price per million tokens $2.00 / $10.00. The right column, GPT-6 Luna, lists Intelligence Index 37, cost per index task $0.07, Coding Agent Index 41, hallucination rate 77%, GDPval-AA about 75 Elo lower, and price per million tokens $0.10 / $0.50. A footer line credits Artificial Analysis for the index, cost and hallucination figures as of September 22, 2026 and OpenAI for the prices. The real OrcaRouter logo is composited in the bottom-right corner.

快取變更才是真正的 API 新聞

藏在費率表底下的,是一項對生產帳單而言比頭條降幅更要緊的變動,而這正是 OpenAI 自家公告以一個子句隱約帶到的那個部分。有三件事變了,而第三件是值得讀兩遍的那一件。

第一項是折扣本身:快取輸入讀取以輸入價格的 10%計費,等於 90% 折扣,這是該系列原本就已採用的相同條件,而非新條件。Sol 的快取輸入為每百萬 $0.20,Luna 為 $0.01;快取寫入帶有 1.25 倍溢價,分別為 $2.50 與 $0.125,並具有單一 30 分鐘的存活時間。

第二點是控制權。透過prompt_cache_optionsprompt_cache_breakpoint 進行的明確快取——這些參數讓你宣告可重複使用的提示前綴在哪裡結束,而不必指望供應商自行猜測——在兩個模型上皆可使用。這並非新的 API 介面;新的是它現在值得使用,因為預設的命中率提高了。

第三項是改變架構的那一項。調整推理投入程度,或開啟、關閉工具,都不再使快取前綴失效。在此之前,一個代理迴圈若為困難步驟調高投入程度、為簡單步驟調低,就得在每一次調整時重新處理整個上下文;同樣地,在對話中途新增或移除工具也會如此。如今在這兩款模型上,這筆成本已經消失。OpenAI 引述 GitHub 的說法,後者回報這些變更讓數十億次請求中需要重新處理的提示詞 token 佔比降低超過一半。請把這視為供應商提供的數字——它可信,但並未經過獨立審核。

對一個長時間運行的代理迴圈做點算術,那兩項公告的排名就會翻轉。一個迴圈若在 200 輪對話中扛著 30,000 個 token 的系統提示與工具結構描述,就會搬動 600 萬個 token 的上下文。若不快取,在 GPT-6 Sol 上,那是 $12.00 的輸入費用。若把前綴快取起來,每百萬 token 收 $0.20,那就是 $1.20 加上一次性的寫入費用——一個數量級的差距,只憑一個參數變更,而且降價根本還沒算進去。降價是那項公告所推銷的東西。快取行為才是真正改變數字的那一環,也正是為什麼 $2.00 的頭條費率,在 OpenAI 力推這些模型所瞄準的工作負載上,表現得像便宜得多的東西。

費率表,包括公告略過的部分

主打費率並不是完整的費率表,而三個層級會改變特定工作負載的決策。

基礎 — GPT-6 Sol 每百萬詞元輸入 $2.00/輸出 $10.00;GPT-6 Luna 每百萬詞元輸入 $0.10/輸出 $0.50,適用於輸入詞元上限為 272K 的提示。

長上下文 — 輸入權杖超過 272K 時,整筆請求都會以 2 倍輸入與 1.5 倍輸出計費:Sol 為 $4.00/$15.00,Luna 為 $0.20/$0.75。這是一道斷崖,而非邊際費率。若你的提示詞達到 300K 權杖,你是在為整筆請求付雙倍費用,而不是只為超出門檻的那 28K 付費;而把一份文件拆成兩次低於門檻的呼叫,往往比一次超過門檻送出更便宜。

服務層級 — Flex 會將費用減半(Sol 為 $1.00/$5.00,Luna 為 $0.05/$0.25),換取較慢的處理時間;Priority 則會使其加倍。兩者皆透過 service_tier 參數選取。Flex 是類似批次的工作應該採用、卻幾乎從未採用的層級。

快取輸入 — Sol 上每百萬個 $0.20,Luna 上 $0.01,折扣達 90%,TTL 為 30 分鐘,並有 1.25 倍快取寫入加成。

上下文與輸出 — 1,050,000 個 token 的視窗、128K 最大輸出、可輸入文字與圖像、輸出文字、推理強度 最大,並以 為預設值。

知識截止日期——GPT-6 Sol 為 2026 年 4 月 20 日,GPT-6 Luna 為 2026 年 5 月 18 日,兩者在同一系列中相差一個月,這點值得你在假設這兩個模型共享相同世界觀之前先了解。

OpenAI 的基準表說了什麼,以及它沒說什麼

OpenAI 公布的比較全都是每項任務成本、全都對比 Anthropic,而且全由廠商自行執行。在 AutomationBench 1.0.6 這項涵蓋 47 種工具的代理式評估中,該公司報告 GPT-6 Sol 在 xhigh 努力程度下得分 33.2%,每項任務成本 0.27 美元,而 Claude Opus 5 為 26.9%,每項任務成本約為其 11 倍。在 DeepSWE 1.1 上,報告指出 Sol 在 max 努力程度下得分 68.8%,對上 Claude Fable 5 的 69.9%——分數落敗,但每項任務成本約低 80%——而 Luna 為 66.6%。在 OSWorld 2.0 上,Sol 在 xhigh 下得分 60.5%,對上 Opus 5 的 60.3%,同樣每項任務成本約少 80%。在 Agents' Last Exam 上,Sol 達到 56.4%,OpenAI 稱這擊敗 Opus 5 的最佳結果,且每項任務成本低 60%。

那些數字全都是廠商自行報告、未經重現的,而其中有兩點但書值得繼續放在心上,而不是束之高閣。第一,OpenAI 的基準測試比較對象是 Claude Opus 5,而不是在發布消息前幾小時才推出的 Claude Opus 5.5,因此目前還沒有同一測試框架下的比較,能確立究竟哪個模型真正帶來較低的每成功任務成本。第二,每項任務的成本並不等於每項正確任務的成本:一個有 83% 的時候作答、其餘時候棄答的模型,在把棄答也算作任務的基準測試中,每項任務看起來都會很便宜。上面那份獨立的棄答資料,正是讓你誠實為此定價的依據——GPT-6 Sol 在舊模型能回答 99% 問題的情況下只回答 83%,這是刻意的取捨,而這取捨究竟好不好,完全取決於一個錯誤答案會讓你付出多大代價。

OpenAI 報告指出,GPT-6 Luna 在較高的推理投入下,能以大約僅為任務成本百分之一的代價,達到與 GPT-5.6 Sol 相同的事實準確度。這是事實準確度的比較,而非能力的比較,而獨立的 Coding Agent Index 則讓 GPT-6 Luna 以兩分之差落後 GPT-5.6 Luna,更遑論 GPT-5.6 Sol。

Screenshot of the Artificial Analysis model page for GPT-6 Sol, captured 23 September 2026, showing the model's Intelligence Index of 48 alongside its cost per task and its output-token and speed figures for the measured reasoning-effort settings.

這個實際上該怎麼處理

GPT-6 Sol 是最直截了當的一款。在同等級指數分數下,任務成本減半、更出色的編碼代理、幻覺大幅減少,加上拒答行為出現實質改變,這些加總起來,是一次可以按表操課的升級,而不是一場賭博。如果你目前用的是 GPT-5.6 Sol,這就是一次遷移,而唯一真正的問題是:你的哪些提示詞依賴舊模型有問必答的意願。

GPT-6 Luna 是你採取行動前該測試的那一個。它並非嚴格意義上更好的 GPT-5.6 Luna;它是形狀不同的一個——每項任務更便宜、對自己會宣稱什麼更謹慎,而且在代理式編碼上明顯更差。對於大量進行的分類、擷取、路由與摘要而言,這個取捨幾乎等於白撿的錢。但對於任何餵給編碼代理的內容,或產出需要人工簽核的文件,兩點的 Coding Agent 退步與 GDPval 的下滑,就是把 GPT-5.6 Luna 留在流程中的理由,直到你用自己的任務跑過兩者為止。

這也是不把兩者任一方硬性綁死的理由。這兩款模型目前都僅限 OpenAI 使用,而這些層級所服務的工作負載——路由、擷取、低成本分類——正是那種情境:把第二家供應商放在同一個端點之後,就能讓模型退步變成無關緊要的小事。OrcaRouter 以0% 加成將供應商的定價原樣轉嫁,因此供應商的費率一旦變動,在他們那邊生效的同一天就會落到我們這邊,而路由 DSL讓你能把 GPT-6 Luna 放在較便宜的模型後方,負責較輕鬆的那部分流量,較吃重的部分則交由 GPT-6 Sol 處理——並具備自動容錯移轉,只要任一條路徑的效能劣化就會啟動。你不必在發布當天就選定贏家,也能從這次發布中受益。

誠實的但書:截至 2026 年 9 月 23 日,GPT-6 Sol 與 GPT-6 Luna 無法透過 OrcaRouter 路由。我們尚未代管它們,上述任何內容都不應被解讀為我們聲稱已提供。今天我們這邊有的是比較組合——GPT-5.6 Sol 為 $4.00/$20.00、GPT-5.6 Luna 為 $0.20/$1.20,以及 GPT-6 Astra 為 $10.00/$50.00——這正是你在決定投入遷移之前,為其估算成本所需的資訊。

Screenshot of the OrcaRouter model page for GPT-5.6 Luna, captured 23 September 2026, showing the model id openai/gpt-5.6-luna with its context window, input and output pricing per million tokens, measured time to first token and recent traffic.

接下來要看什麼

有三件事可以確定這次發布實際上究竟是什麼。第一是 GPT-5.6 Luna 的 $0.20/$1.20 費率能否撐過這一季,因為單一供應商祭出的永久價格,歷來都是開局的第一步,而不是終點——而且同日發布 Claude Opus 5.5,顯示促成這次降價的壓力並未消失。第二是拒答的轉變在實際場域能否站得住腳:GPT-6 Sol 每六題就有一題拒絕回答,這種改變在實驗室裡讀起來像改善,在假設一定會有答案的管線裡卻像產品壞掉。第三是快取行為在你的流量上是否為真,這點本週就能量測,也只能靠量測回答——折扣大到值得花一小時,在你最長的提示上埋點量測快取命中率,比再看一張基準測試表更有價值。

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新