一張生成的主視覺標題卡,寫著「GPT-6 Luna vs DeepSeek V4 Pro」,副標題為「只差一個指數點。價格卻是五倍。其中一款是你可直接下載的檔案。」,並以標籤顯示 Luna 為每 1M $0.10/$0.50、權重封閉,V4 Pro 為離峰時段 $0.66/$1.98、採 MIT 授權,以及在最大努力下指數分數為 37 對 36,OrcaRouter 標誌位於右下角。
Guides & Insights

GPT-6 Luna 對決 DeepSeek V4 Pro:一個指數點、五倍價格,以及自己擁有權重的理由

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這個數字本應決定這場對決,卻沒有:GPT-6 Luna 在最大努力下,於 Artificial Analysis Intelligence Index 上獲得 37 分。DeepSeek V4 Pro 在同一版本的該指數上,同樣以最大努力獲得 36 分。兩者只差一分,而在這項綜合指標上,一分的差距就落在重跑一次的雜訊範圍內——而這兩款模型的價格卻相差約五倍。GPT-6 Luna 的定價為每百萬輸入 token 0.10 美元、每百萬輸出 token 0.50 美元。DeepSeek V4 Pro 0813 的定價為離峰時段的 0.66 美元與 1.98 美元,在其尖峰時段則翻倍至 1.32 美元與 3.96 美元。

如果這就是故事的全貌,那本文只會有一個段落長,而且會以「就用 GPT-6 Luna」作結。但這並不是全貌,原因就在那個比較徹底逆轉的單一面向:DeepSeek V4 Pro 的權重是開放且採 MIT 授權的。每 token 成本高出五倍的那個模型,反而是你被允許下載、修改、微調,並永久在自己的硬體上運行的那個模型。這可不是價格論述的附註——對某一特定類型的買家而言,這就是全部的論據,而 9 月 22 日 GPT-6 Luna 的發布只是讓這一點更加鮮明,而非塵埃落定。

發布了什麼,以及何時發布

GPT-6 Luna 是 OpenAI 的小型層級,於 2026 年 9 月 22 日發布,與 GPT-6 Sol 一同推出,價格為 $2.00/$10.00,並位於旗艦級 GPT-6 Astra($10.00/$50.00)之下。OpenAI 將其描述為該公司針對專注、高流量任務最有效率的模型。它具備 1,050,000 個詞元(token)的上下文視窗,最大輸入為 922,000,輸出上限為 128,000 個詞元,可接受文字與圖像,並提供從 none 到 low、medium、high、xhigh 及 max 的推理強度設定——預設為 medium。

DeepSeek V4 Pro 0813 是 DeepSeek 第四代旗艦模型的 GA 正式版,於 2026 年 8 月 13 日發布,在同一組 deepseek-v4-pro 識別碼下取代了 4 月的預覽版。它是一款純文字專家混合(MoE)模型,總參數達 1.6 兆、啟用參數 490 億,具備 100 萬詞元的上下文視窗,以及異常寬裕的 384,000 詞元輸出上限——是 GPT-6 Luna 的三倍。權重在 API 上線約半天後以 deepseek-ai/DeepSeek-V4-Pro-0813 之名上傳至 Hugging Face:66 個 fp8 分片、無須申請審核、MIT 授權。我們自家網站上該模型的型錄頁面至今仍標示 4 月預覽版的日期,而非 8 月的 GA 日期;如果你習慣從產品頁面而非發布說明中讀取日期,這一點值得留意。

兩者皆以推理為先,並具備長上下文。但兩者之中,只有一個是你手上拿得到的檔案。

費率表,老實說

每個維度一行,每一行兩側都要顯示:

• 每 1M 輸入 — GPT-6 Luna $0.10 對比 DeepSeek V4 Pro $0.66 離峰 / $1.32 尖峰

• 每 1M 輸出 — GPT-6 Luna $0.50 對比 DeepSeek V4 Pro 離峰 $1.98 / 尖峰 $3.96

• 快取輸入 — GPT-6 Luna 每 1M 為 $0.01,較其自身費率有 90% 折扣;相較之下,DeepSeek V4 Pro 有 97% 的快取折扣,折扣百分比更深,但基準更高

• 尖峰時段 — GPT-6 Luna 無,全天持平;DeepSeek V4 Pro 則在 UTC 01:00-04:00 與 06:00-10:00 之間倍增

• 長上下文條款 — GPT-6 Luna 在輸入超過 272K 時,輸入與快取加倍,並將輸出提高 1.5 倍,且套用於整筆請求;相較之下,DeepSeek V4 Pro 在其價目卡上未公布長上下文附加費

• 上下文與輸出 — GPT-6 Luna 1,050,000 輸入 / 128,000 輸出,對比 DeepSeek V4 Pro 1,048,576 輸入 / 384,000 輸出

• AA Intelligence Index — GPT-6 Luna 以最高推理強度取得 37,對上 DeepSeek V4 Pro 以最高推理強度取得 36,相同的指數版本

• 預設努力分數 — GPT-6 Luna 在中等設定下為 29,對比 DeepSeek V4 Pro 在其最大設定下為 36,即 Artificial Analysis 所測量的努力程度

推理關閉開關 — GPT-6 Luna 的 none 到 max,對比 DeepSeek V4 Pro 僅有 low、high 與 max

• {{1}}執行索引的成本{{/1}} — {{2}}GPT-6 Luna{{/2}} $122.39 對比 {{3}}DeepSeek V4 Pro{{/3}} $1,122.27

• 權重 — GPT-6 Luna 封閉、僅提供 API,對比之下 DeepSeek V4 Pro 開放、採 MIT 授權、可自行架設

• 在 OrcaRouter 上 — GPT-6 Luna 不在我們的目錄中,對比 DeepSeek V4 Pro 可依 DeepSeek 的定價進行路由

A generated single-panel scoreboard card headed 'One index point, five times the price' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; DeepSeek V4 Pro $0.66 in / $1.98 out per 1M off-peak doubling at peak with index 36 at max effort; maximum output Luna 128K tokens against V4 Pro's 384K; long context, Luna doubling its rates above 272K input against V4 Pro carrying no published surcharge clause; weights, Luna closed and API-only against V4 Pro open and MIT licensed; and reasoning off switch, Luna none through max against V4 Pro's low, high and max only. Footer: 'Index figures per Artificial Analysis; prices per OpenAI and DeepSeek.'

把這些數字並排來看,整體樣貌很不尋常:封閉模型在每一項以 token 計價的項目上都更便宜,唯有快取輸入例外;而開放模型則在輸出長度、長脈絡行為,以及那件根本無法以 token 計價的事上勝出。

為什麼一分之差不是重點

綜合指數上的一分差距,並不是你能據以行動的能力差異,而且值得直言,這是本文中最不有趣的數字。不過,關於它,有兩件事確實要緊。

第一點是,指數修訂會變動。同一項評估較早的快照顯示,DeepSeek V4 Pro 在最高努力設定下的分數明顯高於我們今天擷取到的 36,而 GPT-6 Astra 的數字在單一個月內發布的資料中游移於 52.8、53 和 54.7 之間。任何倚賴滾動指數上兩個模型之間精確差距的比較,都是在倚賴某個不會固定不變的東西。誠實的解讀是,這兩個模型在各自上限時處於相同的能力區間,而該指數無法告訴你哪一個更適合你的任務。

第二點是努力程度的預設值,而這裡的差距確實存在。GPT-6 Luna 的 37 是最高努力程度下的數字。它的預設值是 medium,得分為 29。DeepSeek V4 Pro 的 36 也是其最高努力程度下的數字,而且這同樣是 Artificial Analysis 測試它時採用的設定。一個部署 GPT-6 Luna 卻不做任何調整的團隊,等於是用 29 去對上 36——往錯誤方向差了七分,而這種情況在生產事故檢討中會以「便宜模型比較差」的形式浮現,但真正的問題其實是預設值。

開放權重究竟價值幾何

價格比較到此為止,不再是算術問題,而是關於你自身業務的課題。MIT 授權的模型權重能為你換來四樣東西,而每一樣都附帶著永遠不會出現在價目表上的代價。

首先是成本下限。按 token 計價是一種租用;權重則是一項資產。如果你的用量大到足以讓固定的 GPU 配置勝過按量計費的帳單,那麼在這兩個模型中,DeepSeek V4 Pro 是唯一一個提供這種選項的。以 GPT-6 Luna 的費率而言,損益平衡點還很遙遠——每百萬 token 一分錢的快取輸入費率,用租來的晶片著實難以匹敵——但「遙遠」和「不可能」是不同的說法,而且這是一道單向門:你隨時可以從自架轉向 API,卻無法走另一個方向。

第二點是擺脫對廠商發展藍圖的依賴。GPT-5.6 Luna 的優惠費率附有明確的到期日。根據 OpenAI 的說法,GPT-6 Luna 的費率則是永久有效——但所謂永久,是對一個廠商隨時能在推出後繼模型時予以淘汰的模型所做的承諾。你自己架設的模型,不可能被從你腳下默默終止支援。對於任何經歷過封閉模型強制遷移的人來說,這比 token 價格便宜五倍更有價值。

第三個是資料。如果提示中包含無法離開你的基礎設施的素材,比較就到此為止,GPT-6 Luna 的成本是多少也無關緊要了。

第四點是你可以對它進行微調。GPT-6 Luna 完全無法微調——它只有 Chat Completions、Responses 和 Batch,就這些。DeepSeek V4 Pro 的權重可以針對你自己的資料分布進行訓練,而對於狹窄且高流量的任務來說,這往往比任何通用型指標分數帶來更大的效益。

相較於這一切,GPT-6 Luna 的論點是:在離峰時段,以 3:1 的輸入輸出混合比例計算,它大約便宜五倍,而在 DeepSeek 的尖峰時段則接近便宜十倍;其快取輸入的費率是其已經很低的輸入費率的十分之一;它可以被指示完全停止推理;而且其定價不會一天內翻倍兩次。對於沒有資料駐留限制、沒有微調需求,且無意願自行營運推論基礎設施的工作負載而言,這是一個直接了當的答案。

遷移規模比價差所顯示的還小

在這兩者之間切換,更接近於變更設定,而不是移植。兩者都採用 OpenAI 相容的聊天補全格式,都具備百萬級別的上下文視窗,而且失敗模式都是預期中的類型,而非結構性問題。

在你轉移流量之前,其中有兩點值得提出來。GPT-6 Luna 的長上下文條款是昂貴的那一項:一旦超過 272,000 個輸入 token,整個請求就會重新計價,輸入與快取變成兩倍、輸出變成 1.5 倍,因此一次 300,000 token 的呼叫,成本是同一呼叫拆成兩次時的兩倍。DeepSeek V4 Pro 沒有這類條款,這意味著對於真正龐大的單一請求,五倍的價差比表面上看起來更小,而且可能在一通尖峰時段的呼叫中翻轉過來。而輸出上限是硬性限制,而非偏好設定:128,000 token 對上 384,000。一條會產生長篇結構化成品的管線,可能根本塞不進 GPT-6 Luna,而再大的價格優勢也無法解決這件事。

DeepSeek V4 Pro 已在 OrcaRouter 上以 DeepSeek 的定價提供,並採用直接轉嫁的定價方式,供應商的費率變動當天就在我們這邊生效——這對一個費率本來就會在尖峰與離峰時段之間變動的模型來說尤其重要。截至本文撰寫時,GPT-6 Luna 尚未收錄於我們的目錄中,需透過 OpenAI 自家的 API 才能存取,因此想同時使用兩者的團隊,只需一把 DeepSeek V4 Pro 的金鑰,搭配他們原本用於 OpenAI 的任何設定即可。 自動容錯移轉正是在這組特定搭配中最具價值的一環:自架或第三方的 DeepSeek 端點效能下降,正是你會希望路由能在無需部署的情況下轉移的情境。

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

該由誰來選擇哪一個

如果下列任一情況成立,就選擇 DeepSeek V4 Pro。提示詞不能離開你的基礎架構。你需要進行微調。你產生的輸出超過 128,000 個 token。你的請求經常超過 272,000 個輸入 token。或者你的用量大到讓你寧願購買 GPU 而不是租用 token,而且你希望之後能選擇這樣切換,而不必改寫應用程式。

如果上述情況都不適用,而且你的工作負載是高流量、由程式取用、且短小,那就選 GPT-6 Luna。分類、擷取、路由、大量摘要、代理的內層迴圈。在 $0.10/$0.50、快取輸入每單位一美分,加上 Batch 半價的情況下,這筆帳根本不用比,而在最大 effort 下那一點的指數差距在你的評估中根本看不出來。用 medium 執行它,兩點的 Coding Agent Index 退步要拿你自己的測試來驗證,而不是看供應商的圖表,並讓你的長呼叫保持在 272,000-token 這條線的正確一側。

要避免的錯誤,是把五倍的價格差距當成答案。它只是某個問題的答案——一個 token 要多少錢——但對於決定你兩年後是否還能執行這套工作負載的四個問題,卻隻字未提。

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the Tools, JSON and Reasoning badges, list pricing of $0.66 input and $1.98 output per 1M tokens, a p50 time to first token of 3.56s, 4033.0M tokens of traffic, and the description of the model as DeepSeek's flagship text-generation model processing up to 1,048,576 tokens of context and generating up to 384,000 tokens of output.

本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新