產生了主視覺標題卡,大標為「GPT-6 Luna vs GPT-6 Sol」,副標為「兩張價目表,同一種形狀,二十倍的數字」,頁腳寫著「價格依 OpenAI;指數數據依 Artificial Analysis。」,並將 OrcaRouter 標誌合成於右下角。
Guides & Insights

GPT-6 Luna 對比 GPT-6 Sol:兩張形態相同、數字卻相差二十倍的費率卡

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

GPT-6 Luna的定價為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元。GPT-6 Sol的定價則是 2.00 美元與 10.00 美元。供應商在 2026 年 9 月 22 日同時推出這兩款,作為 GPT-6 世代中低於旗艦 GPT-6 Astra 的兩個較低層級,而兩者之間二十倍的差距,是任何人從頁面上首先讀到的資訊。更難看出、卻更有用的是,除此之外它們的差異何其少。相同的 1,050,000 token 上下文視窗。相同的 922,000 token 最大輸入。相同的 128,000 token 輸出上限。相同的推理階梯,從 none 到 low、medium、high、xhigh 與 max,並以 medium 為預設。相同的知識截止家族,相差一個月。相同的條款:一旦請求超過 272,000 輸入 token,整個請求就會重新計價。

兩個在價目表上共用每一條結構項目的模型,並非靠功能來區分。它們的區分在於一項分數,以及在於取得那個分數要你付出什麼代價。在那個同時衡量兩者的獨立排行榜上,在相同的最大努力設定下,GPT-6 Sol 比 GPT-6 Luna 高出十一分,而完成同一項評估的成本約為後者的十五倍。十一分與十五倍,和二十倍是不同的句子,而這兩句話之間的差異,正是這項比較真正所在之處。

這兩個各自的用途

GPT-6 Sol 是這個系列中的日常主力,也是 OpenAI 定位用來處理複雜程式編寫、代理式工作流程,以及人們會實際閱讀的專業工作的層級。它接受文字與圖像輸入、產出文字,任何擁有 API 金鑰的人都能使用。當團隊想要具備 GPT-6 等級的能力,卻不想負擔旗艦款的價目或受其存取門檻限制時,多數團隊預設會選用的就是這個模型。

GPT-6 Luna 是高用量層級。OpenAI 自家的描述狹隘且刻意不譁眾取寵:最有效率的模型,適合目標明確、數量龐大的任務。摘要、擷取、分類、路由,以及代理程式在完成單一任務途中發出上千次小型呼叫的內層迴圈。同樣的視窗、同樣的輸出上限、同樣的努力程度旋鈕——在相同的底盤中,搭載更便宜的引擎。

兩者都是以源自 GPT-6 Astra 的方法訓練而成,而非另外建構成一條獨立的產品線,這就是為什麼規格表會如此完全一致。價格是兩者唯一在設計上有所分歧的地方。

費率卡,逐行說明

每個維度一行,每一行兩側都要顯示:

• 每 1M 輸入 — GPT-6 Luna $0.10 對比 GPT-6 Sol $2.00

• 每 1M 輸出 — GPT-6 Luna $0.50 對比 GPT-6 Sol $10.00

• 每 1M 的快取輸入——GPT-6 Luna $0.01 對比 GPT-6 Sol $0.20;兩者皆為各自未快取輸入費率的十分之一,因此二十倍的比率在折扣後仍完整維持

• 每 100 萬次的快取寫入 — GPT-6 Luna $0.125 對比 GPT-6 Sol $2.50,在兩種情況下都比輸入費率高出 25%

• 長上下文層級 —— 兩張卡片上相同的條款:輸入超過 272,000 個 token 時,整個請求的輸入與快取以 2 倍計費,輸出以 1.5 倍計費,使 GPT-6 Luna 達到 $0.20 與 $0.75,GPT-6 Sol 達到 $4.00 與 $15.00

• 上下文視窗 — 兩者皆為 1,050,000 個符元,最大輸入為 922,000 個符元,輸出上限為 128,000 個符元

• 推理強度 — 兩者皆提供 none、low、medium(預設)、high、xhigh、max;這個旋鈕在兩個模型中都是同一個部件

• 服務層級 —— Flex 讓費用減半,Priority 則讓兩張卡的費用加倍,兩者皆透過相同的 service_tier 參數選擇

• 知識截止日期——GPT-6 Luna 為 2026 年 5 月 18 日,GPT-6 Sol 則為 2026 年 4 月 20 日;兩者同屬一個家族卻相隔一個月,在假設這兩個模型共享同一套世界觀之前,這點值得留意

• 智慧指數,獨立評測 — GPT-6 Luna 在最高強度下為 37,對上 GPT-6 Sol 在最高強度下為 48,相同指數版本

• 預設努力程度分數 — GPT-6 Luna 在其預設中等設定下為 29,對比 GPT-6 Sol 在最大設定下為 48,也就是 Artificial Analysis 測量它時所採用的設定

• 每個 Index 任務的成本,獨立計算——GPT-6 Luna 約 $0.07,GPT-6 Sol 則為 $1.06

• 索引執行中的輸出符元 — GPT-6 Luna 150M 對上 GPT-6 Sol 77M,相較於 88M 的看板中位數

• 編碼代理指數(獨立)— GPT-6 Luna 41,較 GPT-5.6 Luna 下降兩點;GPT-6 Sol 57,較 GPT-5.6 Sol 上升兩點

• 在 AA-Omniscience 上的幻覺率——GPT-6 Luna 為 77%,低於先前的 93%;相較之下,GPT-6 Sol 為 60%,低於先前的 92%;兩個模型變得更願意拒絕回答,而非知識更豐富,而 Sol 走得更遠

• 在 OrcaRouter 上——截至本文撰寫之時,GPT-6 Luna 和 GPT-6 Sol 都不在我們的目錄中;兩者皆須透過 OpenAI 自家的 API 才能使用

Generated two-column scoreboard titled 'GPT-6 Luna vs GPT-6 Sol - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index at max effort 37, Cost per index task $0.07, Context 1,050,000, Max output 128,000. Right column GPT-6 Sol rows: Price in/out $2.00 / $10.00, Cached input $0.20, AA Index at max effort 48, Cost per index task $1.06, Context 1,050,000, Max output 128,000. Footer: 'Prices per OpenAI; index figures per Artificial Analysis.'

力度旋鈕在兩款機型中是相同的零件,而這會改變計算結果。

由於推理階梯完全相同,兩款模型的主要指數數字都是最大努力下的數字。GPT-6 Luna 的 37 是它在被允許想多久就想多久時所得到的分數。它的預設是中等,得分為 29。GPT-6 Sol 的 48 也是最大努力數字,而獨立委員會就是以這個設定來運行它。

這一點在這裡比在大多數比較中都更重要,因為這意味著這兩個模型是在同一個級距上被引用。一個部署 GPT-6 Luna 卻不做任何調整的團隊,並不是在拿 37 對 48;而是在拿 29 對 48。那是 19 分的差距,而不是 11 分的差距,而這個差距的大小是預設設定的一項屬性,不是模型本身的屬性。

同一個調節鈕也是兩張卡上所能取得最便宜的優化,而且可雙向調整。對需要人工審查的工作,把 GPT-6 Sol 從 max 降到 medium,省下的量比把你一小部分流量從 Sol 切換到 Luna 更大,而且只需要改一個參數,而不是做一次遷移。在每個任務中真正決定結果的那一次呼叫上,把 GPT-6 Luna 提高到 xhigh,相對於總量而言只是捨入誤差。這個調節鈕之所以同時存在於兩個模型上,正是為了讓層級選擇與投入程度選擇可以分開決定,而大多數團隊只做了其中一個。

懸崖一模一樣,而這正是重點

兩款模型都附帶相同的長上下文條款,而由於該條款是按比例計費,它並不會縮小兩者之間的差距——反而會讓差距的兩端都加倍。在 GPT-6 Luna 上,一個 300,000 token 的請求,全部 300,000 個 token 都按每百萬輸入 0.20 美元計費,而不是只對超出上限的 28,000 個計費。同樣的請求在 GPT-6 Sol 上則按 4.00 美元計費。把任一份文件拆成兩次低於門檻的呼叫,成本就會減半,而提示完全不變。

相同的條款真正改變的,是錯誤的代價。在按量方案中,一次規模誤判的請求,每千個 token 要價五分之一美分;在每日方案中,則是每百萬個 token 四美元。最可能擁有 30 萬 token 工作脈絡的團隊,正是運行這兩款模型所瞄準銷售的代理式流程的那些團隊,這意味著最負擔不起這個錯誤的方案層級,並非最常犯下這個錯誤的層級。

Sol 的十一點在何處,以及不在何處

這道落差確實存在,而且在你可能執行的各項任務之間,它的分布並不平均。

GPT-6 Sol 的優勢集中在程式編寫與代理式執行。其 Coding Agent Index 為 57,比 GPT-6 Luna 的 41 高出十六分;而在同一份排行榜上,前一代對應模型的成績分別是 55 與 43——因此這兩款模型在該指標上朝相反方向移動,在假定新一代在各方面都是舊一代的升級之前,這點值得留意。就廠商自行公布的數據而言,Sol 在最高運算強度下於 DeepSWE v1.1 達到 68.8%,Luna 則為 66.6%;在 Terminal-Bench 4.0 上約為 43%,對手為 37%。這些數據由 OpenAI 自行回報且未經重現,而它們所描述的差距比指數差距所暗示的還要窄。

Sol 拉開差距的地方,在於那些獎勵一長串正確決策的評估:GPT-6 Sol 在 AutomationBench-AA 上約為 62%,相較於 GPT-6 Luna 的 53%;而在同一份全知排行榜上,幻覺率為 60%,相較於 77%。模型憑空發明答案的頻率相差十七個百分點,並不是能力差距;對任何有下游消費者的應用來說,這就是決策的全部。

那十一點不適用的地方,就是一般文字工作。在擷取、分類、路由與摘要——這些 GPT-6 Luna 定價所針對的任務——上,兩個模型在絕大多數時候都會產生同樣可用的答案,而這差異不會在你的評估集上成立。Artificial Analysis 指出兩個模型在最大努力下都有一項退步:GPT-6 Sol 在 GDPval-AA v2.1 上相較於前代大約損失 100 Elo,而 GPT-6 Luna 大約損失 75。如果你的工作看起來像 GDPval,那麼兩個層級都不是你被承諾的升級,而那十一點是兩個都退步的模型之間的比較。

在您已擁有的兩個方案之間做選擇

這種搭配的不尋常之處在於,這不是一項採購決策。兩個模型都運行在同一個帳戶、同一個端點和同一個 SDK 上。沒有第二份合約,沒有第二次費率協商,也不需要進行整合工作來把流量從一個模型移到另一個。這使它成為一項路由決策,而路由決策正是值得每次請求都做、而非只做一次的決策。

截至本文撰寫之際,GPT-6 Luna 與 GPT-6 Sol 都還不在我們的目錄中——兩者都得透過 OpenAI 自家的 API 存取,因此這道分流必須在你的應用程式中表達,而不是在路由器設定裡。這正是必須審慎以對的理由,因為弄錯的代價是一次程式碼變更,而不是設定變更。分流的形式並不複雜:GPT-6 Luna 負責代理在完成任務途中發出的上千次小型呼叫,GPT-6 Sol 則負責產生人們會閱讀的成品的那一次呼叫。請在兩邊都明確設定 effort 參數,因為預設值是 medium,而這兩個模型所有已公布的數據都是最大 effort 的數字。

會跨供應商路由的團隊——而我們看到的大多數團隊都會這麼做——可以把GPT-6 Astra、Grok 4.6、Kimi K3 和 Qwen3.8-Max 放在同一把金鑰上,透過 OrcaRouter 以供應商定價使用,零加成,並在上游之間進行容錯移轉。把 GPT-6 Luna 和 GPT-6 Sol 加入同一張藍圖,意味著需要第二把金鑰,而不是第二套架構,而這是這種搭配所帶來的兩個問題中較小的一個。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

哪一個,以及何時?

選擇 GPT-6 Luna,除非你能說出你花那二十倍價錢買到的是什麼能力。它在價目表的每一行都更便宜,包括快取輸入;它的視窗與輸出上限都相同;可以指示它完全停止推理;而且在獨立排行榜上,它每完成一項任務的成本大約是 GPT-6 Sol 的十五分之一。明確設定推理強度,讓長時間呼叫的輸入 token 維持在 272,000 以下,並且在你假定 Coding Agent Index 那十六點的差距適用於你之前,先拿它對照你自己的儲存庫檢查。

當任務本身就是產品,而失敗模式是悄悄答錯、而非答得慢時,就選 GPT-6 Sol。讓程式碼代理操作真實的儲存庫、進行長時程的專業分析,任何一個幻覺出來的事實,代價高於省下 token 的場合。接受你每完成一項任務要付十五倍代價,換來十一點指標分數,而且這十一點中有相當比例落在幻覺欄,而不是能力欄——對這特定一組而言,這是更值得付費的那一半。

要避免的錯誤,是把那張「二十倍」的標籤當成答案。它回答的是每個 token 要多少錢,卻完全沒說明完成一項任務要多少成本,也沒說明便宜模型的答案有多常以你不會察覺的方式出錯。

Screenshot of the Artificial Analysis comparison view for GPT-6 Luna and GPT-6 Sol, showing Luna's Intelligence Index of 37 at maximum effort against Sol's 48, pricing of $0.10/$0.50 per 1M against $2.00/$10.00, a 1,050,000-token context window and 128K maximum output for both, Luna's measured output speed of 153.9 tokens per second, and cost per index task of about $0.07 against $1.06.