
GPT-6 Luna 與 Gemini 3.1 Pro:一款已推出七個月的預覽版,輸入價格卻達二十倍
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
這款前沿推理模型自Gemini 3.1 Pro於 2026 年 2 月 19 日推出以來,就一直被標示為「Preview」。七個月後,它仍是預覽版,價格仍是每百萬輸入詞元 2.00 美元、每百萬輸出詞元 12.00 美元,也仍是產品頁面所稱該公司的前沿推理模型。2026 年 9 月 22 日,該廠商推出了GPT-6 Luna,作為正式推出(GA)的小型層級,價格為 0.10 美元與 0.50 美元。把兩張價目表並排一看,這款較新、較便宜、已正式推出的模型,輸入便宜二十倍、輸出便宜二十四倍——而且它的得分更高,就在兩家廠商行銷部門都關心的那個獨立指數上。
最後那個子句,正是值得放慢速度細看的部分。GPT-6 Luna 在最高強度設定下,於 Artificial Analysis Intelligence Index 上測得 37 分。Gemini 3.1 Pro Preview 在同一版本上測得 30 分。一款主打高吞吐效率的模型,領先一款主打尖端推理系統的模型達七分,而輸入價格只有後者的二十分之一。這並不是便宜模型追上昂貴模型的情況。在這個特定的衡量軸上,便宜的那款就是單純領先,而昂貴的那款已經處於預覽階段七個月了。
自然而然得出的結論——Gemini 3.1 Pro 定價過高——也並不完全正確;本文接下來要談的,則是 Google 這款模型之所以值得其定價的三個地方,因為它們確實存在,而且不容小覷。
決定它的五件事
在細節之前,先說簡短版本:
• GPT-6 Luna 在價格上勝出:輸入約便宜 20 倍、輸出約便宜 24 倍,在快取輸入方面以大幅差距領先,並在相同最高推理強度設定下的通用指標上領先七分。
• Gemini 3.1 Pro 在輸入模態上勝出——它能接受音訊與視訊,GPT-6 Luna 則不能——也在於它已開放取用七個月,對預覽版而言,這已是相當長的正式環境實績。
• 輸出上限無論從哪個方向來看都相差甚遠:GPT-6 Luna 最高可輸出 128,000 個詞元,Gemini 3.1 Pro 則最高為 65,000 個。
• 兩者都設有長上下文中間級距邊界,會重新計算整個請求的費用:GPT-6 Luna 為 272,000 個輸入詞元,Gemini 3.1 Pro 則約為 200,000 個。
• 預設投入陷阱僅適用於 Luna:其 37 分是最大投入下的分數,而預設的中等設定得分為 29,低於 Gemini 3.1 Pro 的 30。
兩份費率表及其之間的計算
每個維度一行,每一行兩側都要顯示:
• 每 100 萬輸入 — GPT-6 Luna $0.10 對比 Gemini 3.1 Pro $2.00
• 每 1M 輸出 — GPT-6 Luna $0.50 對比 Gemini 3.1 Pro $12.00
• 快取輸入 — GPT-6 Luna 每 1M $0.01,相較於 Gemini 3.1 Pro 每 1M $0.20,享 90% 折扣,90% 折扣
• 長上下文邊界 — GPT-6 Luna 超過 272K 輸入 token,對比 Gemini 3.1 Pro 超過約 200K 輸入 token
• 長上下文效應 — GPT-6 Luna 的輸入與快取為 2 倍、輸出為 1.5 倍,以整個請求計算;對比 Gemini 3.1 Pro 的 $4.00 輸入 / $18.00 輸出,同樣以整個請求計算
• 上下文視窗 — GPT-6 Luna 為 1,050,000 個 token,Gemini 3.1 Pro 則為 100 萬個 token
• 最大輸出 — GPT-6 Luna 128,000 tokens 對比 Gemini 3.1 Pro 65,000 tokens
輸入模態 — GPT-6 Luna 的文字與圖像,對比 Gemini 3.1 Pro 的文字、圖像、音訊、視訊與檔案
• AA Intelligence Index — GPT-6 Luna 在最高強度下為 37,預設設定下為 29,對比 Gemini 3.1 Pro 的 30
• 輸出速度 — GPT-6 Luna 每秒 153.9 個 token,對比 Gemini 3.1 Pro 約每秒 115-143 個 token,視快照而定
• 關閉推理的開關 — GPT-6 Luna 從無到最大,對比 Gemini 3.1 Pro 以推理優先,未提供非推理模式
• 狀態 — GPT-6 Luna 自 2026-09-22 起全面開放使用,而 Gemini 3.1 Pro 則自 2026-02-19 起處於預覽階段

真正有意思的那一列並不是價格,而是最底下的那兩列。Gemini 3.1 Pro 的 Preview 標籤不是什麼技術細節——它會改變 Google 對你負有的義務。預覽版模型可以被變更、重新定價或撤下,而不必發出 GA 模型會收到的淘汰通知;而且價格七個月來維持不變,這是一項沒有人白紙黑字許下的承諾。以下所有關於 Google 的模型是更安全的正式環境押注的說法,都必須對照這項但書來理解,因為「七個月的穩定」和「七個月沒有穩定保證」是同樣的七個月。
Google 的模型在哪裡賺取額外二十倍
三個地方,而第一個對某些隊伍來說,就直接終結了這場比較。
模態。Gemini 3.1 Pro 支援音訊與視訊輸入。GPT-6 Luna 支援文字與圖像。如果你的流程需要處理通話錄音、螢幕截圖或視訊,那麼在這場較量中,價格差異根本不重要,因為這兩個模型其中一個根本做不到。這不是那種能靠某個小版本更新縮小的效能差距;這是能力的有無之別,也是 Google 的價目表在面對真實採購流程時依然站得住腳的最強理由。
輸出上限,方向則相反。 輸出上限的削減方向與輸入模態正好相反,而這一項有利於 OpenAI。GPT-6 Luna 單次回應最多可輸出 128,000 個 token;Gemini 3.1 Pro 則可達 65,000 個。如果你要生成冗長的結構化產物——一份完整文件、一次大規模重構、一個跨多檔案的修補——Google 的上限大約只有 OpenAI 的一半,而一條在 65,000 個 token 就截斷的管線,無論每個 token 付多少錢,都已經壞了。
多模態前沿工作。Gemini 3.1 Pro 的定位是一款恰好多模態的推理模型,而實際結果是,需要在圖表、圖形或螢幕錄影上進行推理的任務會落在它身上,而不是落在以文字為先的小型層級上。GPT-6 Luna 接受圖片,因此界線並非僅在於音訊與影片——而在於 Google 的模型是以視覺與音訊推理作為主要使用情境而打造,OpenAI 的模型則是為吞吐量而打造。
低價方案真正輸在哪裡,而且不是在你預期的地方
在這組對比中,努力程度的預設值才是陷阱,而且它在這裡造成的傷害,比對上較弱的對手時更大。GPT-6 Luna 的頭條指數分數 37,是在最高推理投入程度下測得的。它的預設值是中等,而在中等之下它得分 29——僅以一分之差低於 Gemini 3.1 Pro 的 30 分。因此,本文開頭所說的那七分領先,其實是拿一個模型的上限與另一個模型的上限相比;而一個安裝了 GPT-6 Luna 卻不改設定的團隊,實際運行的是一個略微落後於 Google、推出時間早了七個月、仍處於預覽階段,價格卻只有二十分之一的模型。
對大多數工作負載而言,這仍然是正確的取捨——指數上的一分並不是能力差異,而 20 倍的價格差距才是。但這與費率表所宣傳的取捨不同,而且除非你特地去尋找 effort 參數,否則根本看不見。
低價層級第二個吃虧的地方,是長上下文算術。兩個模型一旦跨過門檻,就會將整筆請求重新計價,而不是只對超出部分加收費用,而且兩道門檻都低到足以造成影響:GPT-6 Luna 為 272,000 個輸入 token,Gemini 3.1 Pro 則約 200,000 個。GPT-6 Luna 的條款會讓輸入與快取費用加倍,並使輸出費用提高一半。Gemini 3.1 Pro 的條款則把整筆呼叫變成輸入 $4.00、輸出 $18.00。兩者都不是邊際附加費,而對一個以價格為賣點的模型來說,這項條款就是價格本身。
第三項是冗長程度,這是永遠不會出現在價目表上的成本項目。Artificial Analysis 測得 GPT-6 Luna 在整次指數測試中產生了 1.5 億個輸出 token,而中位數為 8,500 萬個——這個模型很愛說話,以每百萬個輸出 token 0.50 美元計算,那就是 75 美元的 token 費用,而精簡的模型只會花 42.50 美元。它仍然比另一種選擇便宜一個數量級。這也是為什麼每任務成本數字和每 token 成本數字會說出不同的故事,也是為什麼在推算節省金額之前,該先量測自己的輸出量。
它們之間的遷移是什麼樣子
Google 的模型可透過該廠商自家的 API 以及數個第三方平台存取;GPT-6 Luna 則可透過 OpenAI 自家的 API 存取,而截至本文撰寫之際,這兩者都不是這組配對中較容易標準化的一方。兩者都提供與 OpenAI 相容的 chat completions 介面,這意味著呼叫的形狀不是問題所在——參數才是。GPT-6 Luna 的 effort 階梯、其 272,000 個 token 的條款,以及它要求在 Chat Completions 上進行函式呼叫時必須將 reasoning effort 設為 none,這些全都是 Gemini 3.1 Pro 所沒有的行為,而只更動模型字串的移植,會產生一個能運作、但成本結構錯誤的呼叫。
Gemini 3.1 Pro Preview 已在 OrcaRouter 上以 Google 的定價提供,在轉嫁定價模式下,這意味著 Google 的價格調整當天就會在我們這邊生效。截至本文撰寫之時,GPT-6 Luna 尚未納入我們的型錄。對於同時使用兩者的團隊——需要音訊或視訊時用 Google 的模型,處理大量文字時用 OpenAI 的——這代表用一把金鑰即可同時取用 Gemini 3.1 Pro 與你原本用於 OpenAI 的任何模型,而路由決策以設定表達,而非兩條程式碼路徑。這正是這種搭配最要緊的地方,因為這兩個模型根本無法互換:一條必須在多模態預覽版與純文字 GA 小型級別之間做選擇的路由,就是每當任一供應商推出新版時都得重新決定的路由。

什麼會改變這個
目前的這項比較,是一個不尋常時刻的縮影:一款九月的 GA 模型在通用指數上,以輸入價格的二十分之一,擊敗一款二月的預覽模型,卻在模態以及預覽版始終無法真正取得的成熟度上落敗。有三件事會改變這個局面,而每一件都值得觀察,而非憑空猜測。
首先,是 Gemini 3.1 Pro 結束預覽階段。GA 正式發行版會帶來棄用政策、穩定的價目表,而且很可能會有價格調整——Google 在七個月的預覽期間一直維持 $2.00/$12.00,而市場其他部分卻在它周圍腰斬;這種克制更符合一個等待 GA 日期到來的上市價格,而非一個經過深思熟慮的定位。
第二點是 OpenAI 究竟會擴展 Luna 的努力階梯,還是改變其預設值。GPT-6 Luna 在最高努力分數與預設努力分數之間的二十二分差距,是本文中最大的組態敏感度,而變更預設值將會改變每一位從未碰過該參數的呼叫者所獲得的模型有效能力。
第三點是模態差距。這是這裡唯一一個並非程度問題的維度,也正是它讓這件事無法成為單純的價格比較。除非這些模型的其中一個能做到另一個做不到的事,否則這二十倍的差距就是一個實實在在的數字,指向兩種不同的任務。

本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
