
GPT-6 Luna 對上 Grok 4.6:價格差距達二十倍,而視窗才是真正的差異
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
把 GPT-6 Luna與Grok 4.6放在同一頁面上,第一個比較自然就成形了。Luna 的定價是每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元。Grok 4.6 的定價則是 2.00 美元與 6.00 美元,快取讀取為 0.50 美元。輸入貴二十倍、輸出貴十二倍,而快取輸入費率在該廠商的模型上更是高出五十倍。這是牌價,而單看牌價,答案毫無懸念。
之所以值得把這篇的其餘部分寫完,是因為這兩個模型在某件事上的分歧,比價格更具結構性。Grok 4.6 具備 500,000 個 token 的上下文視窗,一旦提示超過 200,000 個 token,就會將整筆請求重新計價。GPT-6 Luna 則具備 1,050,000 個 token,並在 272,000 個 token 時重新計價。這兩個門檻都是斷崖式門檻,而非邊際費率——一旦跨過其中一個,整筆請求都會以較高的數字計費,而不是只對超過門檻的那一部分計費。這兩個斷崖落在哪裡,以及長上下文工作負載落在各自門檻的不利一側時會發生什麼事,對這場比較的決定性影響,遠比二十倍的頭條數字更大。
兩個模型,兩種截然不同的姿態
Grok 4.6 是 xAI 於 2026 年 8 月 12 日推出的模型,屬於通用型前沿發布:文字進、文字出、500,000 個符元(token)的上下文視窗,在獨立評測排行榜上以高強度模式執行時,每項任務成本公佈為 1.86 美元,實測輸出速度為每秒 57.7 個符元。這是團隊會採用的那類模型,因為它在許多方面都表現出色,而且廠商推出新版本的速度很快。
GPT-6 Luna 則是截然相反的姿態。OpenAI 於 2026 年 9 月 22 日發布這款模型,作為 GPT-6 家族中的大量吞吐層級,位階低於每百萬 token 輸入 $2.00/輸出 $10.00 的 GPT-6 Sol,以及 $10.00/$50.00 的旗艦款 GPT-6 Astra。文字與圖像輸入、文字輸出,1,050,000 token 視窗,最大輸入 922,000 token,輸出上限 128,000 token,並提供從 none、low、medium、high、xhigh 到 max 的推理等級階梯,預設為 medium。它不是那種因為功能廣泛而被人採用的模型。它是你會墊在工作負載底下的模型。
所以誠實的說法不是「這幾者之中哪一個比較好」,而是「這幾者之中哪一個是為你手上工作的樣貌定價的」,而這兩種樣貌確實截然不同。
卡片,逐行
每個維度一行,每一行兩側都要顯示:
• 每 1M 輸入 — GPT-6 Luna $0.10 對比 Grok 4.6 $2.00
• 每 1M 輸出 — GPT-6 Luna $0.50 對比 Grok 4.6 $6.00
• 每 1M 快取輸入 — GPT-6 Luna $0.01 對比 Grok 4.6 $0.50,前者是其自身輸入費率的十分之一,後者則是 xAI 輸入費率的四分之一
• 長上下文閾值 — GPT-6 Luna 272,000 個輸入 token,相較於 Grok 4.6 200,000 個提示 token
• 長上下文費率 — GPT-6 Luna 將整個請求重新定價為輸入 $0.20、輸出 $0.75、快取 $0.02,而 Grok 4.6 將整個請求重新定價為輸入 $4.00、輸出 $12.00、快取 $1.00
• 上下文視窗 — GPT-6 Luna 1,050,000 tokens 對比 Grok 4.6 500,000 tokens
• 最大輸出 — GPT-6 Luna 為 128,000 個 token,相較之下 Grok 4.6 並未在規格卡上另行公布上限
• 智慧指數,獨立評測——在指數修訂版 v4.3.2 上,GPT-6 Luna 以最高投入運行得 37 分,對比 Grok 4.6 以高投入運行得 44 分
• 預設努力程度分數——GPT-6 Luna 在其預設中等設定下為 29,對比 Grok 4.6 在中等設定下為 43,而排行榜也正是據此衡量
• 每個 Index 任務的成本,獨立計算 —— GPT-6 Luna 約 $0.07,相較之下 Grok 4.6 在高強度模式下為 $1.86
• 索引執行時的輸出 token 數 —— GPT-6 Luna 150M 對比 Grok 4.6 94M,而排行榜中位數為 88M
• 輸出速度,獨立 — GPT-6 Luna 153.9 token/秒,對比 Grok 4.6 57.7 token/秒(高模式下)
• 首個 token 延遲,獨立——Grok 4.6 為 38.63 秒,端到端為 47.31 秒;GPT-6 Luna 回傳首個 token 的時間,足以讓使用者願意等待
• 網路能力,獨立評估 — Grok 4.6 在該評測機構的網路評估中獲得 57 分;目前未公布可相比較的 GPT-6 Luna 數據
• 在 OrcaRouter 上 — GPT-6 Luna 不在我們的目錄中,而 Grok 4.6 可依 xAI 的標價路由

20萬對27萬就是全部的論據
讀取兩個視窗旁的兩個閾值,比較便會自行重新組織。
Grok 4.6 的斷崖點落在 500,000 token 視窗內的 200,000 token 處——也就是走到 40% 的位置。GPT-6 Luna 的斷崖點則落在 1,050,000 內的 272,000 處——也就是走到 26% 的位置。因此,較便宜的模型不僅較晚才開始重新計價,而且在跨過門檻之後、直到完全用完視窗前,還擁有超過兩倍的空間。
具體來說:一個 450,000 詞元的請求在兩個模型中都放得下。在 GPT-6 Luna 上,它按長上下文層級計費,價格為 $0.20 和 $0.75。在 Grok 4.6 上,則按 $4.00 和 $12.00 計費。同一個提示,輸入端差了二十倍,輸出端差了十六倍——而且這是 Grok 4.6 能夠服務的請求,所以這個選擇是真實存在的,而非理論上的。
反過來的情況才是最容易讓人栽跟頭的那一種。一個 190,000 個 token 的請求低於兩者的門檻,因此在兩邊都按標準費率計費:$0.10/$0.50 對上 $2.00/$6.00,正好是二十倍與十二倍。一個 210,000 個 token 的請求高於 Grok 4.6 的門檻,但低於 GPT-6 Luna 的門檻。它在 Grok 4.6 上按 $4.00/$12.00 計費,在 Luna 上則按 $0.10/$0.50 計費——這個四十倍與二十四倍的差距,完全是由提示長度差了 20,000 個 token 所造成,而兩個模型本身都沒有任何改變。
那不是避開 Grok 4.6 的理由。那是要了解你的提示實際上落在哪個範圍的理由,因為平均 180,000 個 token、偶爾飆升到 220,000 個 token 的工作負載,會按兩套不同的費率表計費,而且在發生的第一個月看起來就會像帳單錯誤。
價差在獨立董事會上換來了什麼
Grok 4.6 在高強度模式下於 Artificial Analysis Intelligence Index 拿下 44 分。GPT-6 Luna 在最高強度模式下得分 37 分。七分之差——而在這項綜合指標上,單一分差就落在重跑一次的雜訊範圍內——且這兩個模型每完成一項任務的成本相差約二十六倍:1.86 美元對上約 0.07 美元。
關於那對數字,有兩件事值得分開來看。
第一個是投入強度的預設值。GPT-6 Luna 的 37 是最大投入強度的數字,而它的預設是中,得分為 29。Grok 4.6 的 44 是高投入強度的數字,而排行榜也在中強度下測量它,得分為 43。因此,在預設設定下同條件的比較是 29 對 43——十四分,而非七分,而十四分的版本才是同時部署兩者、不做任何更動的團隊實際會體驗到的情況。Grok 4.6 從高降到中損失一分。GPT-6 Luna 損失八分。投入強度旋鈕對便宜模型造成的代價,遠高於它對昂貴模型造成的代價,而這種不對稱在頭條指數數字中完全看不出來。
第二個是冗長程度,而這裡的方向與價格比所暗示的相反。GPT-6 Luna 完成該索引時產生了 1.5 億個輸出 token;Grok 4.6 則產生了 9,400 萬個。每輸出 token 成本只有十二分之一的模型,卻多花了 60% 的 token,換來更低的分數。在以輸出計價的比較表上,這就是每項任務成本差距究竟是二十六倍,還是較小差距的差別;也正是這個原因,任何僅以標價為基礎的比較,都會誇大低價層級的優勢。
Grok 4.6 也在同一份排行榜上公布資安能力分數 57。沒有可相比的 GPT-6 Luna 數據,因此這個維度只有單邊資料——但如果你手上的工作負載會觸及資安工具,這正是那種重要的指標;而較便宜的模型缺少這項資料,本身就是一項資訊,而不是可用假設填補的缺口。
延遲,其中兩者不接近且方向不同
Grok 4.6 的獨立延遲數據為:在高強度模式下,首個 token 需 38.63 秒,端到端需 47.31 秒。這是一個模型在開口前進行嚴謹推理的數據,與一個人盯著游標等待的體驗並不相容。我們自己為該模型列出的資料則記錄,在七天窗口內,首個 token 的 p50 時間為 6.71 秒,p95 為 10.00 秒;這量測的是回應中的另一個時間點,無法與該獨立數據相比——這兩個數字並非互相矛盾,而是在回答不同的問題。
GPT-6 Luna 每秒可輸出 153.9 個 token,且首個 token 的回傳速度快到足以支撐互動式介面。在高強度運算下,其吞吐量將近是 Grok 4.6 的三倍。對批次工作而言,這樣的差距只是節省實際時間的便利;但對於任何使用者正在等待的應用來說,這卻是產品與原型之間的差別。
這種組合並不尋常,值得直白地點明:便宜的模型速度飛快,昂貴的模型速度緩慢,而且在同等投入下,昂貴模型在綜合指標上領先七分。這正是為了一次深入思考而打造的模型,以及為了快速回答無數次而打造的模型,各自呈現的樣貌。如果你的工作負載是每項任務呼叫一次,Grok 4.6 的延遲還負擔得起。如果是每項任務呼叫一千次,那就不是了。
你在 xAI 這邊真正買到的是什麼
Grok 4.6 每完成一項任務的成本大約是 GPT-6 Luna 的二十六倍,且在相同投入程度下領先七個指數點。對一般用途的工作負載來說,這是個不划算的交換率;但對特定類型的工作而言,則是合理的。
有三件事足以證明其合理性。57 分的 cyber 分數,是一項 GPT-6 Luna 並未公布對應數據的能力。9,400 萬 token 的索引執行量,對比 Luna 的 1.5 億,在任何輸出是由人、而非解析器取用的任務上,都是實實在在的精簡優勢。而且這款模型自 8 月 12 日起就已投入生產,比 GPT-6 Luna 至今存在的時間還多六週——這不是基準測試,而是一份實績紀錄;而對於已經在其之上開發的團隊來說,離開的遷移成本,本身就是離開代價的一部分。
相對而言,GPT-6 Luna 的論點主要不在於二十倍的費率。它是在百萬 token 視窗內的 272,000-token 門檻、能夠被要求完全停止推理、每百萬 token 一分錢的快取輸入費率,以及讓它能作為元件而非端點使用的吞吐量數據。這些是廉價層級的結構性特性,而另一方再多的指標優勢也無法取代它們。
執行其中一個,或兩者都執行
Grok 4.6 已在 OrcaRouter 上架,採 xAI 的官方定價,並以直通定價模式運作:供應商一調整費率,我們當天就同步反映,不必等經銷商重新議價。對這個模型而言,真正讓自動容錯移轉顯得不可或缺的是:50 萬個 token 的脈絡視窗卻存在 20 萬個 token 的斷崖,這種工作負載偶爾會有請求落在界線的錯誤一側,而一條能在上游之間切換、無須重新部署的路由,價值遠高於每 token 的小數點後幾美分。
截至本文撰寫時,GPT-6 Luna 尚未收錄在我們的目錄中,必須透過 OpenAI 自家的 API 才能存取。因此,想同時使用兩者的團隊,會為 Grok 4.6 使用一組金鑰,並搭配它原本用於 OpenAI 的任何金鑰。路由 DSL 正是適合這種搭配的部分:一條規則會把超過某個 token 門檻的提示詞,送往它們已跨越其價格斷崖的模型;並把低於該門檻的一切,送往價格只要十二分之一的模型。這種規則可以用設定來表達,而不是在你的應用程式中寫成分支——當這些門檻像這兩個模型一樣,與常見提示詞大小如此接近時,這一點就很重要。

哪一個,以及何時?
如果你的工作負載是高流量、由程式取用且簡短,就選 GPT-6 Luna。分類、擷取、路由、大量摘要、代理的內層迴圈。以 $0.10/$0.50 的價格、快取讀取只要一分錢,對上一個在相同投入下、每個完成任務成本高出二十六倍、卻只換來七個指數點的模型,這筆帳根本不用算。明確設定 effort 參數——預設是 medium,而標題上的 37 是最大 effort 的數字——並讓你的長呼叫保持在 272,000 個 token 以下。
如果需要網路安全能力,就選用 Grok 4.6;如果你的輸出是給真人閱讀,而且其簡潔性值得付費;或者你有 30 萬到 50 萬 token 的工作負載,GPT-6 Luna 雖然能處理,但你寧願不要成為第一個發現它在這種長度下表現如何的團隊。請明確為 20 萬 token 的斷崖編列預算,也不要把它放在高投入程度的互動介面之後——首個 token 要等 38 秒並不是一個延遲數字,而是關於這個模型存在目的的一種表態。
這個比較容易招致的錯誤,是把那二十倍的費率當成決策本身。對某一種工作負載型態來說,它確實就是決策。但對另一種型態而言,決策是在 200,000 與 272,000 個 token 時做出的,而價格比只是你事後才讀到的細節。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
