產生了主視覺標題卡,主標題為「GPT-6 Luna vs Qwen3.8-Max」,副標題為「這裡最便宜的模型並不是那個會看影片的」,頁尾寫著「價格依據 OpenAI 與阿里雲;指數數據依據 Artificial Analysis。」,並在右下角合成 OrcaRouter 標誌。
Guides & Insights

GPT-6 Luna 與 Qwen3.8-Max:這項比較中最便宜的模型,也是唯一會看影片的模型

作者

Gideon Frost

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

這組配對最直觀的框架其實是錯的。Qwen3.8-Max每百萬輸入 token 定價 2.00 美元,每百萬輸出 6.00 美元,快取讀取為 0.25 美元。GPT-6 Luna定價則是 0.10 美元與 0.50 美元,快取讀取為 0.01 美元。輸入貴二十倍、輸出貴十二倍、快取輸入貴五十倍——價格差距如此懸殊,讓這場比較在開始之前就看似已成定局。

這還沒有定論,因為這兩個模型並非競爭同一個需求。Qwen3.8-Max 接受文字、圖像和影片,其 131,072 個 token 的輸出上限略高於 GPT-6 Luna 的 128,000。GPT-6 Luna 僅接受文字和圖像。阿里巴巴的模型在獨立的 Intelligence Index 上得分 58——在 agentic 排行榜上同類第一——而 GPT-6 Luna 在最大努力下得分 37,預設下得分 29。一個是擁有開放權重血統和影片輸入模態的旗艦。另一個是具有速度指標和一分錢快取費率的批量層級。價格差距並不是同一事物的折扣;而是對兩種不同事物的描述。

這兩者各自是什麼

Qwen3.8-Max 是阿里巴巴 3.8 世代的旗艦模型,屬於 Max 級別的檢查點,其底層模型——Qwen3.8-2.4T-A95B——於 2026 年 8 月 12 日以自訂授權公開發布,使其成為史上首個擁有開放權重的 Max 級 Qwen。代管的旗艦本體本身仍被獨立榜單列為專有模型。它具備 1,000,000 個詞元的上下文視窗、131,072 個詞元的輸出上限,可輸入文字、圖像與影片,推理強度則可在低、中與極高之間選擇。釘選的 Qwen3.8-Max-0902 修訂版以相同價格提供,這是個看似微小卻具備實際營運價值的細節。

GPT-6 Luna 是 OpenAI 於 2026 年 9 月 22 日推出的效率等級,位居定價 $2.00/$10.00 的 GPT-6 Sol,以及旗艦款 GPT-6 Astra($10.00/$50.00)之下。支援文字與圖像輸入、文字輸出,具備 1,050,000 個 token 的上下文視窗、922,000 的最大輸入量、128,000 個 token 的輸出上限,effort 等級涵蓋 none、low、medium、high、xhigh 到 max,預設為 medium。封閉式、單一識別碼,任何擁有 API 金鑰的人皆可使用。

一個接受影片,且可以其基礎形式下載。一個接受圖像,而且速度快。兩者的定價都是為了大量使用。這兩段敘述之間的重疊,比價格比例所暗示的還要小。

卡片,逐行

每個維度一行,每一行兩側都要顯示:

• 每 1M 輸入 — GPT-6 Luna $0.10 vs Qwen3.8-Max $2.00

• 每 1M 輸出 — GPT-6 Luna $0.50 對比 Qwen3.8-Max $6.00

• 每 100 萬快取輸入 — GPT-6 Luna $0.01 對比 Qwen3.8-Max $0.25(隱式快取讀取),顯式快取讀取為 $0.17,顯式快取寫入為 $2.50

• 長上下文條款 — GPT-6 Luna 會將輸入與快取加倍,並在超過 272,000 個輸入 token 時將輸出提高 1.5×,且套用於整筆請求;相較之下,Qwen3.8-Max 在完整視窗內採用單一費率級距,而這是 Qwen 方案在結構上更佳、而非只是略便宜的唯一一處

• 上下文視窗 — GPT-6 Luna 1,050,000 個 token,對比 Qwen3.8-Max 的 1,000,000 個 token

• 最大輸出 — GPT-6 Luna 128,000 tokens 對比 Qwen3.8-Max 131,072 tokens

• 輸入模態 — GPT-6 Luna 文字與圖像 vs Qwen3.8-Max 文字、圖像與影片

• 推理投入程度 — GPT-6 Luna:無、低、中(預設)、高、xhigh、最大 對比 Qwen3.8-Max:低、中與超高

• 智慧指數,獨立評測 — GPT-6 Luna 最高投入下為 37,對比 Qwen3.8-Max 為 58

• Agentic Index,獨立 — Qwen3.8-Max 58,同類第一;尚無可比的 GPT-6 Luna 數據發布

• 預設努力程度分數 — GPT-6 Luna 29 在其預設的中等設定下,對比 Qwen3.8-Max 在其最高設定下所測得的結果

• 每個 Index 任務的成本,獨立執行 — GPT-6 Luna 約 $0.07,Qwen3.8-Max 則為 $5.41

• GDPval,獨立評測——Qwen3.8-Max 在每項任務 64 回合下取得 1,739 Elo,換算下來在該評測中每完成一項任務約需 1.14 美元;目前並未公布可相比的 GPT-6 Luna 測試結果

• 在 AA-Omniscience 上的幻覺率——Qwen3.8-Max 為 40%,相較前一代的 23% 是一大退步;GPT-6 Luna 為 77%,較 93% 下降

• 具日期標記的快照 — GPT-6 Luna 是單一滾動式識別碼,而 Qwen3.8-Max-0902 則以相同價格提供可釘選的 2026 年 9 月 2 日修訂版

• 權重 — GPT-6 Luna 封閉,僅提供 API;相較之下,Qwen3.8-Max 的基礎 Qwen3.8-2.4T-A95B 檢查點自 2026 年 8 月 12 日起以自訂授權公開,而託管的旗艦版本則列為專有。

• 在 OrcaRouter 上 — GPT-6 Luna 不在我們的型錄中,而 Qwen3.8-Max 可依阿里巴巴的定價進行路由

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

視訊不是功能線,而是一種不同的工作負載

模態那一列比價格那一列決定了更多真正的比較,而且它通常被當成核取方塊來解讀。

Qwen3.8-Max 接受影片。GPT-6 Luna 不接受。如果你的流程需要對螢幕錄影、產品示範、講座錄影、監視器片段或 UI 操作導覽進行推理,那麼比較就止於那條界線,二十倍的價差也變得無關緊要——你選的不是昂貴選項與便宜選項,而是有選項與沒有選項。擷取影格再以圖片送入只是變通做法,並非等價方案,任何親手打造過這種方案的人都清楚,兩者在成本與品質上的差別有多大。

如果你的 pipeline 處理的是文字與圖像,模態那條線是沉默的,而價格那條線則會說話。這是誠實的分野,而在閱讀本頁其他任何內容之前,值得直白地表明你站在它的哪一側。

智慧代理落差確實存在,而且它正是價格差距中昂貴的那一半。

Qwen3.8-Max 在獨立的 Intelligence Index 上獲得 58 分。GPT-6 Luna 在最大努力設定下獲得 37 分,在其預設中等設定下則為 29 分。相同設定下相差二十一分,預設設定下相差二十九分——在一個連單一分差距都仍落在重跑雜訊範圍內的綜合指標上,這樣的差距絕非雜訊。

Qwen3.8-Max 的定位集中在代理式工作上。它在獨立的 Agentic Index 上得分 58,為同類第一,並在 GDPval 上、每項任務 64 輪的設定下取得 1,739 Elo。最後那個數字才真正具有參考價值,因為它衡量的是模型能否在六十四個連續決策中維持一項任務的完整性,而這個數字還附帶一個價格標籤:在該評測中,每完成一項任務約需 1.14 美元。相較之下,GPT-6 Luna 在該指數上每項任務的成本約為 0.07 美元,而誠實的說法並不是 Qwen 很貴,而是 Qwen 被要求去做一件難得多的事,而它做到了。

推論是,GPT-6 Luna 那二十一分的落後,在你的工作負載中也並非平均分布。在簡短、規格明確、由程式消費的任務上——擷取這個欄位、分類這張工單、路由這個請求——兩個模型幾乎每次都會產生相同的可用答案,而這項指標差距在你的評估中根本看不出來。在需要六十四個連續動作、並在最後設有檢查點的任務上,這項差距就是完成任務與默默半途停下的差別,而那正是 Qwen3.8-Max 專為其打造、GPT-6 Luna 卻非如此的任務。

有一個數字則指向相反方向,值得被說出來,而不是被埋沒。Qwen3.8-Max 在全知排行榜上的幻覺率為 40%,高於前一代的 23%——這是相當大的退步,而且是那種在生產環境中會以自信的錯誤答案現身、而非只是評測分數上一行數字的退步。GPT-6 Luna 的則是 77%,低於 93%。這兩個數字以絕對值來看都偏高,而在這項衡量上,較便宜的模型仍是兩者中較差的一個。這兩個數字都不是偏好某一款模型的理由;兩者都是理由,說明只要捏造事實的代價高昂,就該讓人類或驗證者留在流程中。

長上下文條款是 Qwen 在結構上勝出的唯一一行。

GPT-6 Luna 帶有一項 Qwen3.8-Max 沒有的條款:輸入 token 超過 272,000 的請求,其輸入與快取費率以兩倍計,輸出費率以 1.5 倍計,且適用於整個請求,而非僅限超過門檻的部分。在 GPT-6 Luna 上,一次 300,000 token 的呼叫,全部 300,000 個 token 都按每百萬輸入 token $0.20 計費,因為它超出了 28,000。把同一份文件拆成兩次呼叫,成本就會減半,而提示完全不變。

Qwen3.8-Max 在其完整的 1,000,000 個 token 視窗中維持均一價格。對於真正龐大的單一請求,這使得十二倍的輸出價格差距比表面上看起來更小,甚至可能逆轉:當輸入 token 超過 272,000 時,GPT-6 Luna 的有效輸入費率翻倍至 $0.20,輸出費率升至 $0.75,而 Qwen 則維持 $2.00 與 $6.00 的均一價格。輸入方面的差距從二十倍縮小至十倍,輸出方面則從十二倍縮小至八倍。差距仍然很大——但最有可能擁有 300,000 個 token 工作情境的工作負載,正是兩家廠商都在積極推銷的代理式工作負載,而運行這些工作負載的團隊,正是會注意到這一點的團隊。

另一條結構性分界是固定修訂版。Qwen3.8-Max-0902 以與滾動識別碼相同的價格提供,這意味著需要在模型更新時仍保持可重現行為的團隊,不必支付溢價就能取得。GPT-6 Luna 沒有提供對等方案。這在價目表上只是小小一行,在事後檢討中卻是一大重點。

執行其中一個,或兩者都執行

Qwen3.8-Max 已在 OrcaRouter 上以阿里巴巴的定價提供,而在轉嫁定價模式下,這代表供應商的費率一旦變動,我們這邊當天就會同步生效。我們的繞送層有兩項特點,對這個特定模型特別有價值:自動容錯移轉,因為一個有公開發布開放權重基礎的託管旗艦模型,其上游來源比單一供應商的閉源模型更多,也更容易出現其中某個上游效能劣化的情況;以及固定修訂版本的處理機制,讓路由能明確鎖定 Qwen3.8-Max-0902,而不是繼承滾動式識別碼下週解析出的任何版本。

截至本文撰寫時,GPT-6 Luna 並不在我們的產品目錄中,且須透過 OpenAI 自家的 API 才能使用,因此若團隊想同時使用兩者,就要為 Qwen3.8-Max 準備一把金鑰,並搭配他們原先用於 OpenAI 的任何金鑰。這也是這樣的搭配:路由 DSL 比靜態拆分更有價值,因為這兩個模型之間的界線是模態檢查與長度檢查,而不是偏好:帶有影片的請求會送往 Qwen3.8-Max,因為沒有其他模型能處理它們;輸入超過 272,000 個 token 的請求會送往 Qwen3.8-Max,因為另一個模型的斷崖會讓這些請求在那裡更昂貴;其餘所有請求則送往價格只要二十分之一的那個模型。這是一條規則,應該放在設定中,而不是放在應用程式的分支裡。

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

哪一個,以及何時?

若下列任一情況成立,就選 Qwen3.8-Max。你的管線需要影片輸入。你的請求經常超過 272,000 個輸入 token,此時它的固定費率方案勝過 GPT-6 Luna 的重新定價。你的輸出超過 128,000 個 token。你的工作是長時程的代理式執行,且有可驗證的終點,此時它在代理排行榜上的 58 分,以及在每項任務 64 回合下 GDPval 的 1,739 Elo,才是真正關鍵的證據。或者你需要固定版本以確保可重現性,而且願意為此付費——但既然它與滾動識別碼的價格相同,那就表示你並不願意。

如果以上皆非,而你的工作負載屬於高流量、由程式取用、圖文並用且簡短,就選 GPT-6 Luna。分類、擷取、路由、大量摘要,以及需要快速而非縝密答案的代理內迴圈。以每百萬詞元 $0.10/$0.50、快取讀取一分錢,以及每項完成任務成本約為 Qwen3.8-Max 十五分之一的價格來看,這筆帳怎麼算都差得遠。請明確設定 effort 參數——預設值是 medium,而宣傳中的 37 是最大 effort 的數值——並讓長時間的呼叫保持在 272,000 詞元這條線的正確一側。

這項比較容易招致的錯誤,是把二十倍的輸入價格讀成一種定論。它只是針對某一種工作負載型態的定論,而對決定另一種型態的三條關鍵線索卻隻字未提:請求是否夾帶影片、是否突破 272,000 個 token,以及答案是否必須撐過六十四個循序步驟。

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

本文中的比較3

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新