
GPT-6 Luna 對比 GPT-6 Astra:價格高出百倍,只為十六個指數點
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 218 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
該廠商在同一個月內推出了這兩款模型。GPT-6 Astra於 2026 年 9 月 3 日推出,每百萬輸入符元 10.00 美元、每百萬輸出符元 50.00 美元,定位為該公司處理長時程專業工作最強大的系統。GPT-6 Luna於 2026 年 9 月 22 日跟進,價格為 0.10 美元與 0.50 美元——是輸入價格的百分之一、輸出價格的百分之一——作為該系列中的效率層級。在同時衡量兩者的獨立排行榜上,兩者相差十六個指數點。百倍價格換來十六點差距,這整段比較用一行就能概括,而這並不是有趣的部分。
有趣的地方在於,一旦考量各模型在任務上的實際行為,百倍標價就會縮水到接近四十六倍,而剩下的差距根本無關通用智慧。那是電腦操作能力、長時程自主性,以及決定你的組織是否獲准呼叫該模型的安全分級。最後那一項是任何基準測試表都捕捉不到的,而對許多團隊來說,它在提到價格之前就已決定了問題。
同一家族的兩個等級,相隔十九天
Astra 是 OpenAI 的旗艦模型,也是該公司形容為全球最聰明且最對齊的模型。它接受文字、圖像與檔案輸入,具備 1,050,000 個 token 的上下文視窗,輸出上限為 128,000 個 token,並具備常時開啟的推理功能,其投入程度可從最低一路設定到最高。它是首個在公司《準備框架》下跨越「關鍵」網路安全能力門檻的 OpenAI 模型,而此次推行是源於該分類,而非出於產能考量:先開放給有限組織,企業存取預設關閉,並自 9 月 9 日起可進行管理,之後防護層級再逐步擴大。
Luna 是同一家族的另一端。文字與圖像輸入、文字輸出,相同的 1,050,000-token 上下文視窗與相同的 128,000-token 輸出上限,以及一條從 none 到 low、medium、high、xhigh 和 max 的推理階梯,並以 medium 為預設。沒有分級限制、沒有企業專用開關、沒有必須符合資格才能使用的安全層級。任何擁有 API 金鑰的人都能一般使用,而 OpenAI 自家的描述狹隘且誠實:用於專注、高產量任務的最有效率模型。
這兩個模型共享一個上下文視窗、一個輸出上限、同一系列的知識截止時間,以及一項長上下文定價條款。除此之外,它們幾乎沒有其他共同點,而原因是它們是為同一項工作的不同部分而打造的。
費率表上寫的是一百倍。任務成本顯示四十六。
每個維度一行,每一行兩側都要顯示:
• 每 1M 輸入 — GPT-6 Luna $0.10 對比 GPT-6 Astra $10.00
• 每 1M 輸出 — GPT-6 Luna $0.50 vs GPT-6 Astra $50.00
• 快取輸入 — GPT-6 Luna 每 1M $0.01 對比 GPT-6 Astra 每 1M $1.00,兩者皆較各自未快取費率享有 90% 折扣
• 每項索引任務的成本 — GPT-6 Luna 約 $0.07,而 GPT-6 Astra 約 $3.26
• 執行完整索引的成本 — GPT-6 Luna $122.39 對比 GPT-6 Astra $5,324.10
• AA Intelligence Index — GPT-6 Luna 37(最高努力程度)對比 GPT-6 Astra 53(最高努力程度)
• 索引運行時的輸出 token 數 — GPT-6 Luna 150M 對比 GPT-6 Astra 60M,相較於排行榜中位數 88M
• 輸出速度 — 在 xhigh 下,GPT-6 Luna 為每秒 153.9 個 token,而 GPT-6 Astra 為每秒 51.4 個 token
• 首個 token 生成時間 —— GPT-6 Luna 夠快,足以支撐互動式介面,而 GPT-6 Astra 在 xhigh 下則需 208.73 秒
• 推理關閉開關 — GPT-6 Luna 提供從 none 到 max 的設定,並可選擇 none;對比 GPT-6 Astra 一律開啟,沒有非推理模式
• 電腦使用與自主性 — GPT-6 Luna 的工具呼叫與代理式迴圈 vs GPT-6 Astra,專為端對端操作電腦而打造
• 使用權 — GPT-6 Luna 一般開放給所有人,而 GPT-6 Astra 則有門檻限制、企業版預設關閉、需要管理員控制
• 在 OrcaRouter 上 — GPT-6 Luna 不在我們的目錄中,而 GPT-6 Astra 可依 OpenAI 的標價路由

把每項任務成本那一列對照費率表的比率來看,差距就會縮小超過一半。Luna 完成索引要耗費 1.5 億個輸出 token;Astra 則耗費 6,000 萬個。Astra 的精簡度是兩倍半,而在按輸出計價的模型上,這點價值極高——這正是為什麼費率表上 100 倍的差距會變成任務成本上 46 倍的差距,也是為什麼任何單憑標價建立的比較,都會把低價方案的優勢高估一倍。
速度列呈現相反走勢,而且差距不小。Luna 每秒產生的 token 數是 Astra 的三倍,回傳首個 token 的時間也短到讓使用者還等得下去。Astra 在 xhigh 下首個 token 耗時 208.73 秒,這不是一項延遲數字;而是在說明這款模型的用途。在那個設定下,任何有人正在觀看的東西,都無法在 Astra 上運行。
十六分實際上能換到什麼
指數差距確實存在,而這個有用的問題是它裡面是什麼,因為答案並不是「多百分之十六的智慧」。
Astra 已公布的能力集中在某個特定領域。OpenAI 在 OSWorld 2.0 上回報 72.6%,在 AutomationBench-AA 上則為 69%——這兩項指標衡量的都是模型能否像人一樣操作軟體,跨越許多步驟、歷經長時間。在知識方面,GPQA Diamond 為 96.1,FrontierMath Tier 4 為 97.6%,搭配工具使用的 Humanity's Last Exam 則為 57.2%;長上下文檢索是一大亮點:在 OpenAI 自家的八針(eight-needle)基準測試中,256K 至 512K token 區間達到 100%,512K 至 1M 區間則為 96.3%。這些數字都是廠商自行回報、未經重現,而且測試框架本身也很重要——同一個模型在 OpenAI 自訂的供應商轉接器下於 ARC-AGI-3 拿下 99.9%,在標準測試框架下卻只有 62.7%,這樣的落差既說明了模型,也同樣說明了測試框架。
綜合來看,那並非一種通用型優勢。這種優勢集中在耗時長、需要使用電腦,且具備可驗證終點的任務上。Astra 的競爭框架並非針對另一個聊天機器人,而是針對一次工作階段;而它在獨立評測榜上被並列比較的模型,是同層級的其他旗艦模型——它在 Intelligence Index 上以每項任務約 40% 的成本,與 Claude Fable 5.1 同以 53 分並列。
Luna 的十六個百分點落後並非平均分布。在一項簡短、規格明確、由程式取用的任務上,這兩個模型經常會產生同樣可用的答案,而差異將無從察覺。在一項需要在瀏覽器中執行四十個連續動作、並於最後設有檢查點的任務上,這項落後就是完成與否的差別——而這正是 Astra 被打造來處理、Luna 則非如此的任務。
沒有人納入定價的那道閘門
Astra 是 OpenAI 第一個在該公司《Preparedness Framework》下跨越「Critical」級網路安全門檻的模型,而其實際結果是:它對企業帳號出貨時處於關閉狀態。管理員必須依適用的費率卡與協議啟用它,使用者才能看到它。存取權限於 9 月 3 日開放給少數組織,之後逐步擴大;管理機制則於 9 月 9 日到位。
Luna 完全沒有這些。任何擁有 API 金鑰的人從第一天起就能使用,沒有資格審核步驟、沒有管理員開關,也沒有任何安全防護層級擋在開發者與首次呼叫之間。
對受監管產業的團隊、國防承包商,或任何採購流程中須經安全審查的組織而言,這就是整個決策本身。百倍價差只是一筆預算條目;存取關卡卻是一整項專案。而對不受這些限制的團隊來說,這道關卡無關緊要,Astra 就只是一款昂貴、首個 token 產生時間異常漫長的模型。
值得補充的是,這種設限是經過深思熟慮的立場,而非單純的不便。一個能自主操作電腦、又擅長找出漏洞的模型,是實驗室在釋出時應該謹慎以對的模型,而部署形式也取決於能力評估結果。這並不會讓採購變得更容易,但確實意味著這項限制不太可能因為一張支援工單而放寬。
同一座懸崖,同一家人,兩次
兩個模型都帶有相同的長上下文條款,而這是任一價目表上最昂貴、最容易忽略的一項。超過 272,000 個輸入 token 的請求,其輸入與快取費用將以兩倍計價,輸出費用則為 1.5 倍——而且是以整筆請求計費,並非只計算超出門檻的部分。在 Astra 上,這會讓原本 $10.00/$50.00 的呼叫變成 $20.00/$75.00。在 Luna 上,則會讓 $0.10/$0.50 變成 $0.20/$0.75。
因為該條款是按比例計算,所以不會改變兩個模型之間的比例——它會讓兩者都加倍。它改變的是錯誤的絕對規模,而這個錯誤更可能發生在 Astra 上,因為 Astra 存在的目的所服務的工作負載,正是那些帶有百萬 token 工作上下文的負載。單次長上下文 Astra 呼叫的費用是每百萬輸出 token $75;將同一項工作拆成兩次 sub-272K 呼叫,就能減半,且提示完全不變。對於一個整體價值主張就是長時程工作的模型而言,這筆算術值得在第一次正式環境呼叫之前就先算清楚,而不是之後才算。
該決定是一個路由決定
在這篇部落格的眾多比較中,這組配對之所以不尋常,在於這兩個模型屬於同一家供應商、在同一個帳戶上執行,並透過同一個端點存取。不需要簽第二份合約,也不需要學習第二套 SDK。在它們之間做選擇,完全不是採購決策——而是路由決策,而且對大多數團隊來說,這應該是每次請求都做的決定,而不是只做一次。
拆分的形式已經夠清楚了。Luna 用於代理在完成任務途中進行的一千次小型呼叫:分類、擷取、工具選擇、對中間結果的摘要。Astra 用於任務本身,一次,在最後,答案就是成果。那是在單一應用程式內的雙層管線,而在 Astra 上執行整個流程與在 Luna 上執行內迴圈之間的成本差異,就是可行單位經濟與不可行單位經濟之間的差異。
GPT-6 Astra 已在 OrcaRouter 上架,採 OpenAI 的定價,在直通定價模式下,這表示 OpenAI 一調價,我們這邊當天就會同步生效。截至本文撰寫時,GPT-6 Luna 尚未收錄於我們的目錄中,須透過 OpenAI 自家的 API 才能使用,因此想同時使用兩者的團隊,可用同一組金鑰取用 GPT-6 Astra,並搭配他們原本用於 OpenAI 的任何服務。這也是模型融合發揮價值的搭配:由一個便宜、高吞吐量的模型和一個昂貴、謹慎的模型組成小組共同回答,便宜的成員負責大部分工作,昂貴的成員負責裁決,這是路由層能表達的一種配置,而應用程式無須知道這兩個模型的存在。

哪一個,以及何時?
除非你有特定理由不這麼做,否則就選用 GPT-6 Luna。它在價目表上的價格是百分之一,每完成一項任務的價格是四十六分之一,速度快三倍,其第一個 token 會在使用者等得起的時間內送達,而且可以指示它完全停止推理——這正是讓它能用作分類器的原因。請明確設定 effort 參數,因為預設值是 medium,而標題數字 37 是最大 effort 的數值。將長時間呼叫的輸入 token 數保持在 272,000 以下。請用你自己的評測來檢查 Coding Agent Index 的兩點退步,而不是看供應商的圖表。
在任務是長期任務、而答案本身就是成果時,就採用 GPT-6 Astra。跨越多個步驟的電腦操作、具備可驗證終點的專業分析,任何十六個指數點就是完成與默默停下之間差別的任務。接受首個權杖的時間——在 xhigh 下 208 秒不是你能讓人類乾等的數字——如果你的組織有採購關卡,也接受它。然後把導向該任務的一切前置作業都跑在便宜層級上,因為內迴圈才是燒錢的地方。
這種比較容易招致的錯誤,是把它當成在兩個模型之間二選一。它其實是在選擇每一個在流程中位居何處,而答案幾乎總是兩者並用。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
