
GPT-6 Luna 對決 GPT-5.6 Luna:同名、半價,但交付成果更差
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
兩個模型,只共用一個詞,而一項獨立評分實際上完全相同。GPT-6 Luna在 Artificial Analysis Intelligence Index 上達到 37.26;GPT-5.6 Luna則達到 37.32。0.07 分的差異不是測量結果,而是雜訊,而這是關於這組配對最重要的一項事實。區分這兩個模型的並非能力——而是每完成一項指數任務的 $0.0681 對比 $0.1783,以及一組降價並未提及的知識工作退步。
日期對解讀這些數字很重要。GPT-5.6 Luna 於 2026 年 7 月 9 日推出,每百萬輸入符元 0.20 美元、每百萬輸出 1.20 美元。GPT-6 Luna 於 2026 年 9 月 22 日推出,價格為 0.10 美元與 0.50 美元——正好是輸入費率的一半,輸出費率則低了 58%,OpenAI 稱之為永久價格而非促銷價。這是貨真價實的降價,卻也是這個故事中較小的一半。較大的一半在於:較新的模型是不同的模型,而不是同一個模型重新定價。

從數字看,移轉究竟換來什麼
把兩者按決定遷移與否的各個維度並排比較,整體情況參差不齊。有些列有所改善,有些退步,而其中一列大幅改善。
• 價格 — GPT-6 Luna 每百萬個 token 為 $0.10 輸入 / $0.50 輸出,相較於 GPT-5.6 Luna 的 $0.20 / $1.20。輸入價格減半,輸出便宜 58%。
• 快取輸入 — 每百萬 $0.01,相較於 $0.02。在減半的基準上享有同樣的 90% 折扣,因此重複的前綴成本是七月時的一半。
• 每項已完成任務的成本 — 在同一套件中為 $0.0681,相較之下為 $0.1783。降低 62%,由於任務組合並不完全相同,這降幅大於 token 價格的調降。
• 每項任務的輸出 token 數 — 50,537 對比 41,235。新模型每完成一項工作,囉嗦了 23%,且其輸出中有 78% 是從未出現在回應中的推理。
• 上下文視窗 — 1,050,000 個 token 對上 1,000,000。相同的實際上限;兩者的輸出上限皆為 128,000 個 token。
• 拒答——在 AA-Omniscience 上的幻覺率為 76.7%,對比 92.6%。這是整組中單一幅度最大的進步,而這並非知識上的增益:準確率從 42.7% 變為 43.8%,基本上持平。較新的模型選擇婉拒而非憑空捏造,這是行為上的改變,而非能力上的改變。
• 知識型工作交付成果——AA-Briefcase v1.1 從 1,345.38 Elo 降至 1,299.23,而 GDPval-AA v2.1 從 1,443.14 降至 1,367.09。兩者皆下降,跌幅分別約為 46 點與 76 點。
• 程式編寫與長時程工作——Terminal-Bench 4.0 從 11.6% 升至 12.6%,SciCode 從 53.6% 升至 54.6%,是這裡唯二上升的兩列。相對地,Coding Agent Index 從 43 降至 41,而 SWE 風格的代理式評估也朝相同方向變動。
• AutomationBench-AA — 53.2%,相較於 50.2%。上升了,且升幅大於這組中任何其他代理式衡量指標。

迴歸問題出在產出物,而不是推理。
最後兩列的模式值得特別指出,因為那正是整個決策的關鍵。新模型較擅長單一步驟的代理式行動,卻較不擅長交回一份完成的文件。Artificial Analysis 將知識工作的下滑歸因於呈現品質,以及交付成果遺漏了必要的評分規準要素,而非事實或推理上的失誤——這正是那種能通過冒煙測試、卻過不了審查的迴歸。
把這兩個事實放在一起看,這次遷移就會依照「誰消費輸出」乾淨地一分為二。如果你的管線讀取的是結構化輸出——JSON、分類結果、擷取出的欄位、路由決策——那麼呈現品質的退步對你毫無成本,拒答表現的改善是實實在在的收益,而 62% 的任務成本削減則完整落袋。如果是由人來閱讀交付成果——報告、備忘錄、面向客戶的文件——那麼較新的模型恰恰在你付費購買的那件事上明顯更差,而省下的錢只是幫你買來一位審閱者。
拒答數字也值得同樣的對待。一個模型若從對自己不知道的內容有 93% 會捏造,變成只有 77% 會捏造,那麼對護欄、合規篩檢,或任何會讓自信錯誤答案傳播的流程來說,就是實質上不同的物件。那項改善是真實的、是獨立測量出來的,也是把工作轉移到新模型上的最強論據,而且完全與價格無關。
你的程式碼中,哪些會改變,哪些不會
降幅比如此規模的降價所暗示的還要小,而這是好消息。上下文窗口屬於同一級別,最大輸出同為 128,000 個 token,而該系列的長上下文重新計價條款維持不變:超過 272,000 個輸入 token 的請求,輸入與快取費率以 2 倍計、輸出以 1.5 倍計,且適用於整筆請求,而非僅限於超出界線的那部分。一筆在 GPT-5.6 Luna 上以 300,000 個 token 執行就已所費不貲的請求,在 GPT-6 Luna 上同樣所費不貲——費率減半,懸崖相同,因此七月時本該拆分的負載,如今依然應該拆分。
努力階梯改變的是行為,而不是成本。GPT-6 Luna 提供 none、low、medium(預設)、high、xhigh 和 max,而預設值很重要:針對某個模型預設努力程度調校過的管線,不會自動對另一個模型的預設值也調校妥當。明確固定設定的團隊不受影響。採用預設值的團隊,正運行著與七月時不同的組態,而可見的症狀將是 token 數量,而非品質。
有一個陷阱值得再次強調,因為它不會隨著新模型而消失。在 Chat Completions 端點上,函式呼叫只有在推理強度設為 none 時才能運作;其他每一個強度層級,以及每一個內建工具,都需要 Responses API。一個團隊若只透過變更模型字串來移植工具呼叫迴圈,會發現在預設的 medium 強度下,其工具會悄然無法使用,而解決之道並非調整參數,而是改寫呼叫介面。
你今天可以路由什麼,以及你不能路由什麼
這是這次搬遷中與基準測試無關的部分。GPT-5.6 Luna 已以定價上架 OrcaRouter —— 每百萬輸入 token 0.20 美元、每百萬輸出 1.20 美元、1,000,000 token 的上下文視窗、128,000 token 的最大輸出量,以及在我們自家模型頁面的實際流量中測得的 p50 首 token 時間 1.60 秒。我們以供應商定價原價轉售,不加收任何費用,因此 OpenAI 重新調整這個系列價格的當天,我們這邊就已同步生效,而不是等到下一個計費週期。

截至 2026 年 9 月 23 日,GPT-6 Luna 無法透過 OrcaRouter 進行路由。可取得此模型的途徑是 OpenAI 自家 API,以及收錄此系列模型的雲端目錄;我們不會列出我們無法提供服務的模型。實務上的結果是,規劃這項遷移的團隊今天可以遷移定價,卻無法今天遷移路由——這項變更的兩個部分會在不同日期到位。
這在過渡期間所促成的,正是大多數團隊最終無論如何都會想要的安排。把 GPT-5.6 Luna 留在交付成果本身就是產品的路徑上,在輸出會被程式碼取用的地方改用 GPT-6 Luna,並把這道界線當成一個層級,而不是一次重寫。由於你能取用的模型都位在同一個端點之後,同一把金鑰可存取 200 多個模型,且能跨供應商自動容錯移轉,因此新增或移除一個層級只是改一筆設定,而不是再做一次整合——升級途徑也不再取決於任何單一模型是否可用。
遷移決策,平實說明
把工作移到輸出由機器讀取、且成功條件可驗證的地方。分類、擷取、路由決策、護欄呼叫、批次轉換作業,以及單步代理動作全都符合條件:整體組合不變,棄答行為明顯更好,任務成本還下降約 62%。有了 Batch 以標準費率的一半計價、快取輸入只要減半後基準的十分之一,七月時還勉強可行的流程,現在可以輕鬆做到。
不要移轉由人簽核成品的工作,也不要盲目移轉 coding-agent 路徑。AA-Briefcase 下降 46 點與 GDPval 下降 76 點,這些小數字指向的方向,與 Coding Agent Index 下降兩點相同,而 Artificial Analysis 所描述的失效模式——略過評分規準要素、呈現較弱——是自動化檢查看不見的。在精緻度就是交付成果的情況下,保留先前的模型。
並把這個 0.07 分的指數平手,當作它本身就是一項發現來看待。這不是一個更聰明、但價格更低的模型。它是一個形狀不同、價格更低的模型,而遷移計畫必須回答的問題是:你的工作負載消耗的是哪一種形狀——不是哪個分數更高,因為在獨立紀錄上,那兩個分數是同一個數字。
