
Grok 4.7 對比 Qwen 3.8 Max:價格相同,僅差一分,形態卻相反
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百萬 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77程式
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0345智能76程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
兩款封閉式旗艦模型,皆為每百萬輸入詞元2美元、每百萬輸出詞元6美元,在同一項獨立基準測試中彼此得分僅差一分,相隔十九天發布。Grok 4.7於2026年9月21日由SpaceXAI推出;Qwen 3.8 Max則由廠商於2026年8月3日發布,並於2026年9月2日更新。在現行的Artificial Analysis Intelligence Index v4.3.2版中,Grok 4.7得分46,Qwen 3.8 Max得分45。就價格與實測能力而言,這兩款模型是同一筆交易。但在其他所有方面——上下文、模態、服務速度、開放程度,以及各廠商選擇最佳化的項目——它們再不同也不過了,而這正是讓這項比較值得進行而非跳過的原因。
首先,時間軸的部分,因為 Qwen 3.8 Max 有兩個日期
這點讓許多報導出錯,所以值得在文章開頭先釐清。Qwen 3.8 Max 於 2026 年 8 月 3 日推出,是 Alibaba 最大且能力最強的模型,以 Qwen 3.5 視覺語言架構為基礎,採用稀疏專家混合(sparse mixture-of-experts)設計,據報導總參數達 2.4 兆,每個 token 啟用 950 億個參數。2026 年 9 月 2 日,Alibaba 發布了更新版——0902 修訂版,這是帶有目前模型 ID 的版本,也是 Artificial Analysis 將自家頁面日期標定為此的版本。如果你看過 Qwen 3.8 Max 同時有 8 月和 9 月兩個日期,原因就在這裡:一個是發布日,另一個則是現今多數人實際上所稱的修訂版。
Grok 4.7 有一段較乾淨的歷史,而其背後則有一段更混亂的過去。SpaceXAI 於 2026 年 9 月 21 日發布它,此前發布多次推遲——馬斯克曾先後點出 8 月下旬、9 月上旬與 9 月中旬的時間窗口,但該模型直到之後才真正推出。這次發布本身的範圍很窄:比 Grok 4.6 更大的基礎模型、針對多小時任務所進行的更長強化學習訓練,以及 $2/$6 費率表維持不變——Grok 4.6 自 8 月 12 日以來一直沿用該費率表。
各家廠商各自優化的重點
把這兩則發布公告成對地讀,設計上的押注幾乎完全對立。
SpaceXAI 針對代理式執行進行了最佳化。Grok 4.7 的供應商自報數據集中在終端機與儲存庫相關工作上:Terminal-Bench 4.0 為 38.0%,對比 Grok 4.6 的 20.3%;CursorBench 4.0 為 46.3%;DeepSWE v1.1 在高推理強度下為 71.0%;EEBench 為 64.0%。該公司對這次發布的說明指出,其目標是在 Grok Bot 環境中實現自我驗證與長脈絡處理。Grok 4.7 支援 500,000 詞元的上下文窗口,可輸入文字與圖像、輸出文字,並提供從低到 xhigh 的推理強度。這是一款為完成任務而打造的模型。
阿里巴巴以廣度為優化方向。Qwen 3.8 Max 提供約 984,000 個詞元的上下文視窗——實際上就是一百萬——而其公布的強項在於廣度,而非單一領域的深度:Terminal Bench 2.1 得分 86.6、SWE-bench Pro 67.7、PaperBench 93.0、GPQA Diamond 92.6、MMMU-Pro 82.3、OSWorld-Verified 86.1。它接受文字、圖像與影片輸入並輸出文字,支援推理投入程度等級,預設為 xhigh,而公布數據中較弱的一環是 Humanity's Last Exam 的 43.6。這是一個為了處理你交給它的任何任務而打造的模型。
那段文字裡的每一個數字都是廠商自行報告的。這兩組數據都沒有經過獨立複現,而且這兩組數據本來就無法直接比較——Terminal-Bench 2.1 與 Terminal-Bench 4.0 是不同的基準測試,因此 Qwen 的 86.6 與 Grok 的 38.0 絕不該被並列在一起。
• 獨立綜合評分 — Grok 4.7 在 AA Intelligence Index v4.3.2 上獲得 46 分,相較於 Qwen 3.8 Max 在同一版本上獲得 45 分。統計上的平手。
• 每百萬個詞元價格——兩者皆為 $2.00 輸入 / $6.00 輸出。Qwen 的快取折扣列為 88%,換算後混合費率為每百萬 $1.18;Grok 4.7 的快取條款並未以相同基準公布。
• 上下文視窗——Grok 4.7 為 500,000 個 token,Qwen 3.8 Max 則約為 984,000 個。Qwen 以近兩倍的差距勝出,而這是兩者之間最大的一項規格差異。
• 輸入模態 — Grok 4.7 文字與圖像 vs Qwen 3.8 Max 文字、圖像與影片。
• 權重 — 兩者皆為專有。兩個模型都無法下載,這使得此比較中常見的開放權重論點完全不再適用。
• 參數 — Grok 4.7 未在任何 SpaceXAI 規格表中披露(約 2.1T 的數字是馬斯克的說法);相較之下,Qwen 3.8 Max 據報導總計 2.4T、其中 95B 為活躍參數,而 Alibaba 也未在規格表中確認。
• 服務速度 — 根據 Artificial Analysis,Qwen 3.8 Max 的輸出速度為每秒 38.8 個詞元,首個詞元耗時 3.08 秒;SpaceXAI 將 Grok 4.7 定位為速度約為同類模型的兩倍,此為廠商自行提供的數據,目前尚未公布任何獨立的吞吐量數據。

情境差異才是真正的決定
當價格與能力完全相同時,決定就取決於其他所有不同之處,而在這裡,那就是上下文。將視窗從 500,000 個 token 加倍到約 984,000 個 token,並不是規格表上好看的小細節——而是將儲存庫分塊處理,與把它完整保留在上下文中的差別。
Qwen 3.8 Max 更長的視窗伴隨著一項對買家而言很重要的明文但書:阿里巴巴宣布將於 2026 年 8 月 10 日當週推出的開放權重版本僅支援文字,且未包含完整的百萬 token 上下文。這並不影響本次比較所關注的託管端點,但如果你原本是依開放版本發布來做規劃,這點值得了解。
Grok 這邊還有第二個考量。Grok 系列歷來在 200,000 個輸入 token 設有定價斷崖,一旦請求跨過該門檻,整個請求就會以雙倍費率重新計價——輸入 4 美元、輸出 12 美元。在 500,000 token 的視窗下,該門檻遠落在模型的工作範圍之內。在將長上下文工作路由到 Grok 4.7 之前,請確認所部署模型的最新價目表,因為大視窗與重新計價斷崖之間的交互作用,正是長上下文帳單容易出錯的地方。
每一項的一個月工作成本
由於標示費率完全相同,成本比較必須從 token 行為著手,而非依據價目表,而正是在這一點上,兩個模型出現了可量化的分歧。
Artificial Analysis 在執行其 Intelligence Index 時,測得 Grok 4.7 產生了 2.4 億個輸出 token,而排行榜上各模型的中位數為 9,200 萬個——它是個冗長的推理模型。Qwen 3.8 Max 在同一項指數測試中產生了 1.9 億個輸出 token,總評估成本為 4,934.79 美元,實測速度為每秒 38.8 個 token。兩者的冗長程度都遠高於中位數,而 Grok 4.7 是兩者中較為冗長的那一個。
因此,在相同的每百萬輸出 $6 下,每項任務產生更多 token 的模型,每項任務成本就更高。已公布的冗長度數據顯示,Grok 4.7 在等效的索引工作上會消耗更多輸出 token,這意味著價格上的平手,其實是 Qwen 3.8 Max 在每項任務成本上小幅勝出——但被 Grok 4.7 宣稱的速度優勢抵銷,該優勢縮短實際耗時,因而降低等待 agent 執行的人力成本。這兩項抵銷因素都不會顯示在費率表上,而且兩者都值得在你自己的流量上實測,而非憑假設。
唯一沒有爭議的不對稱在於快取。Qwen 3.8 Max 公布 88% 的快取折扣,以及在快取命中/輸入/輸出為 7:2:1 的混合比例下,1.18 美元的混合費率。對於帶有大量穩定前綴的工作負載——例如系統提示、程式碼庫標頭、文件集——真正的節省就在這項折扣;因此在你投入大量用量之前,值得先比較 Grok 4.7 的快取條件。

當數字拒絕為你做出選擇時,做出選擇
在同一項指數上拿到 46 和 45,而且價格相同,這已是這個部落格可能發布的結果中最接近真正平手的一次。這表示應該從兩款機型真正有所不同的面向來做決定,而這樣的面向共有四個。
如果你的工作是代理式編碼與終端機執行,就選 Grok 4.7;如果長時間執行時的實際速度比上下文餘裕更重要,而且你想要每次請求的推理調節鈕來讓簡單流量保持低成本,也選它。若你經常處理超過五十萬個 token 的輸入、影片輸入已列在你的發展藍圖上、想要針對前綴密集型工作負載的 88% 快取折扣,或者想要一個其供應商會公布廣泛評估矩陣(而非僅集中於單一領域)的模型,就選 Qwen 3.8 Max。
如果誠實的答案是「兩者都有一點」,那很正常,而這正是這對組合所為而生的情況。Qwen 3.8 Max 已在 OrcaRouter 上以阿里巴巴的定價提供,且 OrcaRouter 以 0% 加成直接轉嫁供應商的定價,所以上述的 $2/$6 就是你實際支付的價格,而供應商費率變更會在同日於此生效,而非等到續約時才生效。一個 API 金鑰即可涵蓋 Qwen 3.8 Max 以及200 多個其他模型,這表示上下文決策會變成每次請求的路由規則,而不是平台層級的綁定:將過大的輸入送往 984k 視窗,其餘一切則留在對該任務而言最快且最便宜的端點上;若供應商效能下降,還會自動容錯移轉。當某項任務確實需要兩種型態時——先進行長上下文讀取,隨後進行代理式執行階段——路由 DSL 會將模型組合成單一呼叫,而不是迫使你選邊站。
有一點值得先說清楚:由於這兩個模型都不是開放的,這項比較完全不涉及可下載的權重。兩者都是託管端點,而且對雙方來說,自行架設都不是選項。
唯一要記住的數字
四十六比四十五,不是挑選模型的理由,也不該是。決定這場比較的是上下文視窗——五十萬個 token 對上大約九十八萬四千個——以及各家廠商所選擇的形態:Grok 4.7 為了快速完成艱難的代理式任務而最佳化,Qwen 3.8 Max 則為了處理你交給它的任何東西而最佳化。同樣的價格,同樣實測出來的能力,不同的工作。那是個路由決策,而且是那種該花一個下午測試、而不是花一季採購的決策。

本文中的比較3
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
