
GPT-6 Luna 對比 GPT-6 Sol:兩張形態相同、數字卻相差二十倍的費率卡
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-6 Luna的定價為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元。GPT-6 Sol的定價則是 2.00 美元與 10.00 美元。供應商在 2026 年 9 月 22 日同時推出這兩款,作為 GPT-6 世代中低於旗艦 GPT-6 Astra 的兩個較低層級,而兩者之間二十倍的差距,是任何人從頁面上首先讀到的資訊。更難看出、卻更有用的是,除此之外它們的差異何其少。相同的 1,050,000 token 上下文視窗。相同的 922,000 token 最大輸入。相同的 128,000 token 輸出上限。相同的推理階梯,從 none 到 low、medium、high、xhigh 與 max,並以 medium 為預設。相同的知識截止家族,相差一個月。相同的條款:一旦請求超過 272,000 輸入 token,整個請求就會重新計價。
兩個在價目表上共用每一條結構項目的模型,並非靠功能來區分。它們的區分在於一項分數,以及在於取得那個分數要你付出什麼代價。在那個同時衡量兩者的獨立排行榜上,在相同的最大努力設定下,GPT-6 Sol 比 GPT-6 Luna 高出十一分,而完成同一項評估的成本約為後者的十五倍。十一分與十五倍,和二十倍是不同的句子,而這兩句話之間的差異,正是這項比較真正所在之處。
這兩個各自的用途
GPT-6 Sol 是這個系列中的日常主力,也是 OpenAI 定位用來處理複雜程式編寫、代理式工作流程,以及人們會實際閱讀的專業工作的層級。它接受文字與圖像輸入、產出文字,任何擁有 API 金鑰的人都能使用。當團隊想要具備 GPT-6 等級的能力,卻不想負擔旗艦款的價目或受其存取門檻限制時,多數團隊預設會選用的就是這個模型。
GPT-6 Luna 是高用量層級。OpenAI 自家的描述狹隘且刻意不譁眾取寵:最有效率的模型,適合目標明確、數量龐大的任務。摘要、擷取、分類、路由,以及代理程式在完成單一任務途中發出上千次小型呼叫的內層迴圈。同樣的視窗、同樣的輸出上限、同樣的努力程度旋鈕——在相同的底盤中,搭載更便宜的引擎。
兩者都是以源自 GPT-6 Astra 的方法訓練而成,而非另外建構成一條獨立的產品線,這就是為什麼規格表會如此完全一致。價格是兩者唯一在設計上有所分歧的地方。
費率卡,逐行說明
每個維度一行,每一行兩側都要顯示:
• 每 1M 輸入 — GPT-6 Luna $0.10 對比 GPT-6 Sol $2.00
• 每 1M 輸出 — GPT-6 Luna $0.50 對比 GPT-6 Sol $10.00
• 每 1M 的快取輸入——GPT-6 Luna $0.01 對比 GPT-6 Sol $0.20;兩者皆為各自未快取輸入費率的十分之一,因此二十倍的比率在折扣後仍完整維持
• 每 100 萬次的快取寫入 — GPT-6 Luna $0.125 對比 GPT-6 Sol $2.50,在兩種情況下都比輸入費率高出 25%
• 長上下文層級 —— 兩張卡片上相同的條款:輸入超過 272,000 個 token 時,整個請求的輸入與快取以 2 倍計費,輸出以 1.5 倍計費,使 GPT-6 Luna 達到 $0.20 與 $0.75,GPT-6 Sol 達到 $4.00 與 $15.00
• 上下文視窗 — 兩者皆為 1,050,000 個符元,最大輸入為 922,000 個符元,輸出上限為 128,000 個符元
• 推理強度 — 兩者皆提供 none、low、medium(預設)、high、xhigh、max;這個旋鈕在兩個模型中都是同一個部件
• 服務層級 —— Flex 讓費用減半,Priority 則讓兩張卡的費用加倍,兩者皆透過相同的 service_tier 參數選擇
• 知識截止日期——GPT-6 Luna 為 2026 年 5 月 18 日,GPT-6 Sol 則為 2026 年 4 月 20 日;兩者同屬一個家族卻相隔一個月,在假設這兩個模型共享同一套世界觀之前,這點值得留意
• 智慧指數,獨立評測 — GPT-6 Luna 在最高強度下為 37,對上 GPT-6 Sol 在最高強度下為 48,相同指數版本
• 預設努力程度分數 — GPT-6 Luna 在其預設中等設定下為 29,對比 GPT-6 Sol 在最大設定下為 48,也就是 Artificial Analysis 測量它時所採用的設定
• 每個 Index 任務的成本,獨立計算——GPT-6 Luna 約 $0.07,GPT-6 Sol 則為 $1.06
• 索引執行中的輸出符元 — GPT-6 Luna 150M 對上 GPT-6 Sol 77M,相較於 88M 的看板中位數
• 編碼代理指數(獨立)— GPT-6 Luna 41,較 GPT-5.6 Luna 下降兩點;GPT-6 Sol 57,較 GPT-5.6 Sol 上升兩點
• 在 AA-Omniscience 上的幻覺率——GPT-6 Luna 為 77%,低於先前的 93%;相較之下,GPT-6 Sol 為 60%,低於先前的 92%;兩個模型變得更願意拒絕回答,而非知識更豐富,而 Sol 走得更遠
• 在 OrcaRouter 上——截至本文撰寫之時,GPT-6 Luna 和 GPT-6 Sol 都不在我們的目錄中;兩者皆須透過 OpenAI 自家的 API 才能使用

力度旋鈕在兩款機型中是相同的零件,而這會改變計算結果。
由於推理階梯完全相同,兩款模型的主要指數數字都是最大努力下的數字。GPT-6 Luna 的 37 是它在被允許想多久就想多久時所得到的分數。它的預設是中等,得分為 29。GPT-6 Sol 的 48 也是最大努力數字,而獨立委員會就是以這個設定來運行它。
這一點在這裡比在大多數比較中都更重要,因為這意味著這兩個模型是在同一個級距上被引用。一個部署 GPT-6 Luna 卻不做任何調整的團隊,並不是在拿 37 對 48;而是在拿 29 對 48。那是 19 分的差距,而不是 11 分的差距,而這個差距的大小是預設設定的一項屬性,不是模型本身的屬性。
同一個調節鈕也是兩張卡上所能取得最便宜的優化,而且可雙向調整。對需要人工審查的工作,把 GPT-6 Sol 從 max 降到 medium,省下的量比把你一小部分流量從 Sol 切換到 Luna 更大,而且只需要改一個參數,而不是做一次遷移。在每個任務中真正決定結果的那一次呼叫上,把 GPT-6 Luna 提高到 xhigh,相對於總量而言只是捨入誤差。這個調節鈕之所以同時存在於兩個模型上,正是為了讓層級選擇與投入程度選擇可以分開決定,而大多數團隊只做了其中一個。
懸崖一模一樣,而這正是重點
兩款模型都附帶相同的長上下文條款,而由於該條款是按比例計費,它並不會縮小兩者之間的差距——反而會讓差距的兩端都加倍。在 GPT-6 Luna 上,一個 300,000 token 的請求,全部 300,000 個 token 都按每百萬輸入 0.20 美元計費,而不是只對超出上限的 28,000 個計費。同樣的請求在 GPT-6 Sol 上則按 4.00 美元計費。把任一份文件拆成兩次低於門檻的呼叫,成本就會減半,而提示完全不變。
相同的條款真正改變的,是錯誤的代價。在按量方案中,一次規模誤判的請求,每千個 token 要價五分之一美分;在每日方案中,則是每百萬個 token 四美元。最可能擁有 30 萬 token 工作脈絡的團隊,正是運行這兩款模型所瞄準銷售的代理式流程的那些團隊,這意味著最負擔不起這個錯誤的方案層級,並非最常犯下這個錯誤的層級。
Sol 的十一點在何處,以及不在何處
這道落差確實存在,而且在你可能執行的各項任務之間,它的分布並不平均。
GPT-6 Sol 的優勢集中在程式編寫與代理式執行。其 Coding Agent Index 為 57,比 GPT-6 Luna 的 41 高出十六分;而在同一份排行榜上,前一代對應模型的成績分別是 55 與 43——因此這兩款模型在該指標上朝相反方向移動,在假定新一代在各方面都是舊一代的升級之前,這點值得留意。就廠商自行公布的數據而言,Sol 在最高運算強度下於 DeepSWE v1.1 達到 68.8%,Luna 則為 66.6%;在 Terminal-Bench 4.0 上約為 43%,對手為 37%。這些數據由 OpenAI 自行回報且未經重現,而它們所描述的差距比指數差距所暗示的還要窄。
Sol 拉開差距的地方,在於那些獎勵一長串正確決策的評估:GPT-6 Sol 在 AutomationBench-AA 上約為 62%,相較於 GPT-6 Luna 的 53%;而在同一份全知排行榜上,幻覺率為 60%,相較於 77%。模型憑空發明答案的頻率相差十七個百分點,並不是能力差距;對任何有下游消費者的應用來說,這就是決策的全部。
那十一點不適用的地方,就是一般文字工作。在擷取、分類、路由與摘要——這些 GPT-6 Luna 定價所針對的任務——上,兩個模型在絕大多數時候都會產生同樣可用的答案,而這差異不會在你的評估集上成立。Artificial Analysis 指出兩個模型在最大努力下都有一項退步:GPT-6 Sol 在 GDPval-AA v2.1 上相較於前代大約損失 100 Elo,而 GPT-6 Luna 大約損失 75。如果你的工作看起來像 GDPval,那麼兩個層級都不是你被承諾的升級,而那十一點是兩個都退步的模型之間的比較。
在您已擁有的兩個方案之間做選擇
這種搭配的不尋常之處在於,這不是一項採購決策。兩個模型都運行在同一個帳戶、同一個端點和同一個 SDK 上。沒有第二份合約,沒有第二次費率協商,也不需要進行整合工作來把流量從一個模型移到另一個。這使它成為一項路由決策,而路由決策正是值得每次請求都做、而非只做一次的決策。
截至本文撰寫之際,GPT-6 Luna 與 GPT-6 Sol 都還不在我們的目錄中——兩者都得透過 OpenAI 自家的 API 存取,因此這道分流必須在你的應用程式中表達,而不是在路由器設定裡。這正是必須審慎以對的理由,因為弄錯的代價是一次程式碼變更,而不是設定變更。分流的形式並不複雜:GPT-6 Luna 負責代理在完成任務途中發出的上千次小型呼叫,GPT-6 Sol 則負責產生人們會閱讀的成品的那一次呼叫。請在兩邊都明確設定 effort 參數,因為預設值是 medium,而這兩個模型所有已公布的數據都是最大 effort 的數字。
會跨供應商路由的團隊——而我們看到的大多數團隊都會這麼做——可以把GPT-6 Astra、Grok 4.6、Kimi K3 和 Qwen3.8-Max 放在同一把金鑰上,透過 OrcaRouter 以供應商定價使用,零加成,並在上游之間進行容錯移轉。把 GPT-6 Luna 和 GPT-6 Sol 加入同一張藍圖,意味著需要第二把金鑰,而不是第二套架構,而這是這種搭配所帶來的兩個問題中較小的一個。

哪一個,以及何時?
選擇 GPT-6 Luna,除非你能說出你花那二十倍價錢買到的是什麼能力。它在價目表的每一行都更便宜,包括快取輸入;它的視窗與輸出上限都相同;可以指示它完全停止推理;而且在獨立排行榜上,它每完成一項任務的成本大約是 GPT-6 Sol 的十五分之一。明確設定推理強度,讓長時間呼叫的輸入 token 維持在 272,000 以下,並且在你假定 Coding Agent Index 那十六點的差距適用於你之前,先拿它對照你自己的儲存庫檢查。
當任務本身就是產品,而失敗模式是悄悄答錯、而非答得慢時,就選 GPT-6 Sol。讓程式碼代理操作真實的儲存庫、進行長時程的專業分析,任何一個幻覺出來的事實,代價高於省下 token 的場合。接受你每完成一項任務要付十五倍代價,換來十一點指標分數,而且這十一點中有相當比例落在幻覺欄,而不是能力欄——對這特定一組而言,這是更值得付費的那一半。
要避免的錯誤,是把那張「二十倍」的標籤當成答案。它回答的是每個 token 要多少錢,卻完全沒說明完成一項任務要多少成本,也沒說明便宜模型的答案有多常以你不會察覺的方式出錯。

