
Qwen3.8-Max 評測:阿里巴巴 2.4T 旗艦,$2/$6 定價 — 0902 版本稱霸 Code Arena WebDev
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
阿里巴巴Qwen於2026年7月19日在上海世界人工智慧大會上預覽了Qwen3.8-Max;接下來兩週,它成了大家談論最多、卻無人能真正估價的模型。沒有價目表、沒有基準測試表、沒有模型卡、沒有授權條款,也沒有啟用參數數量——只有一個2.4兆參數的宣傳標題,以及該模型「僅次於Claude Fable 5」的說法。
2026年8月3日,情況改變了。Qwen3.8-Max 正式發布:一份已公開的費率表(每百萬輸入 tokens 收費 2 美元,每百萬輸出收費 6 美元)、一個相容 OpenAI 與 DashScope 的端點、完整的基準測試表,以及於8月12日釋出的開放權重。一週後的8月14日,它以阿里巴巴「Day 0 發布合作夥伴」的身分在 DigitalOcean Serverless Inference 上線——這是第一個提供該模型的主要西方雲端服務。9月2日,阿里巴巴推出了命名為 Qwen3.8-Max-0902 的更新版本,進一步在 Coding 與 Cowork 上進行後續訓練。Qwen 表示,這能強化其在複雜企業與科學工作中的表現。本篇評測是依據 GA(正式發布)事實撰寫,並納入該首日上線與 0902 版本;它回答了團隊在模型如今已可購買時實際會問的問題:Qwen3.8-Max 是否已經準備好承載正式營運流量,或者仍屬於觀察清單上的模型?
簡短的回答是,它的進展比大多數人預期的還要更進一步——尤其是定價策略相當激進,等於重新為前沿重新定價,而9月2日的更新則更加強化了該模型原本就擅長的兩件事:程式編寫與協作工作。隨後發布的獨立評分卡確實表現出色,但在你投入流量之前,有一項警告值得細讀。
TL;DR。Qwen3.8-Max 現已正式上市(GA),每 100 萬 tokens 收費 $2 / $6,且在整個 100 萬 token 上下文中價格維持不變,沒有長提示附加費——在輸出價格上低於 Kimi K3($3/$15)與 Claude Opus 5($5/$25),而輸出正是推理工作負載的主要成本驅動因素。阿里巴巴發布了一份亮眼的基準成績表(Terminal-Bench 2.1 86.6、GPQA Diamond 92.6、OSWorld-Verified 86.1),而編碼能力相對前代的躍進也相當驚人:FrontierSWE 從 40.7 躍升至 73.5。但這份品質成績表出自阿里巴巴自家,而第一位獨立裁判——Artificial Analysis Intelligence Index——如今也已表態:Qwen3.8-Max 得分 56,每項任務成本 $1.14,與 Claude Opus 4.8(56 分)持平,落後開源權重領先者 Kimi K3(57 分)1 分,但每項任務成本高出 25%。活躍參數數量不再是未知數:官方模型卡已證實總參數 2.4T 中有 95B 為活躍參數,這終於讓外界得以推估其服務成本與經濟效益。自本評測首次發布以來,第二條受管途徑也已開通:8 月 14 日,Qwen3.8-Max 以阿里巴巴 Day 0 合作夥伴之姿登上 DigitalOcean Serverless Inference;DigitalOcean 發布的服務數據顯示——在 256 個並發請求下,預填充可擴展至約每秒 16,000 tokens,輸出約每秒 1,937 tokens,且零錯誤——這是阿里巴巴之外首家服務商公布的確切延遲數據。9 月 2 日,阿里巴巴將旗艦版本更新為 Qwen3.8-Max-0902,進一步針對 Coding 與 Cowork 進行後訓練;Qwen 表示新版快照在複雜企業級與科學工作負載上表現更強——但這是供應商的說法,目前尚無企業級或科學任務的獨立數據。0902 版本的編碼能力如今也有了自己的獨立競技場成績:根據阿里巴巴引用的第三方競技場即時榜單,Qwen3.8-Max-0902 在 Code Arena: WebDev 以 1,691 分首秀即位居第一——比前一版本高出 22 分,並領先 Claude Opus 5 與 Kimi K3。同一週,代理式商務的相關進展也迎來了記分板:在 CommerceAgentBench 上——這是阿里巴巴 Accio 團隊基於真實商務軟體狀態化副本打造的新基準——Qwen3.8-Max 繳出開源權重模型最強成績:三套測試框架合計 156 次通過,領先 DeepSeek V4 Pro 兩次——但這是供應商自行發布的成績表,並非獨立裁判。結論:如今確實已可真正購買使用,而且價格夠低,足以進行一次正規評估——但應有策略地分流,而非全面改用。
關鍵要點
• 自2026年8月3日起正式發布(GA)。預覽與贈點活動的時代已經結束;現在有真實的費率表和真實的端點。
• 每100萬個token收費2美元/6美元,在100萬上下文長度內採單一固定費率。多數競爭對手會對長提示詞額外收費,阿里巴巴則不會,這對長文件與大型程式碼庫處理至關重要。
• 阿里巴巴的基準測試成績亮眼,但未經審計:Terminal-Bench 2.1 86.6、GPQA Diamond 92.6、PaperBench 93.0、IFBench 82.8、OSWorld-Verified 86.1、OmniDocBench 1.5 92.1。
• 程式開發的世代躍進才是真正的重點:FrontierSWE 73.5(從 40.7)和 DeepSWE 1.1 56.6(從 21.6)——兩者都幾乎翻倍。
• 第一份獨立評分出爐:Qwen3.8-Max 的得分為56 分(AA Intelligence Index,每項任務 $1.14)——比 Qwen3.7-Max(46)高 10 分,與 Claude Opus 4.8(56)持平,落後 Kimi K3(57)一分。LMArena 的綜合排行榜仍沒有公開分數。
• 活躍參數確認為 95B — 官方模型卡標示總參數 2.4T、啟動參數 95B,為服務成本計算中最大的未解問題畫下句點。
• 開放權重已發布 — Qwen3.8-2.4T-A95B(BF16)與 Qwen3.8-2.4T-A95B-FP8 已於 8 月 12 日上架 Hugging Face,採用自訂的 Qwen3.8-Max 授權,而非 Apache 2.0。Qwen3.8-27B 本地部署版本則於 8 月 14 日以 Apache 2.0 授權發布。
• 第二條託管路徑已於8月14日上線。 Qwen3.8-Max 已在 DigitalOcean Serverless Inference 上線,作為阿里巴巴的「Day 0 上線合作夥伴」— 採用 NVIDIA HGX B300 上的 NVFP4,定價 $2/$6,快取輸入 $0.20,並以開放檢查點的原始 262K 上下文長度提供服務。DigitalOcean 的實測數據(prefill 約每秒 16K tokens,256 並發下零錯誤)是阿里巴巴之外託管平台上首次取得的服務效能數據。
• 9月2日更新:Qwen3.8-Max-0902。阿里巴巴進一步在Coding和Cowork上對這款旗艦模型進行後訓練,並以同樣的$2/$6價格和1M上下文在QwenCloud上提供服務。Qwen表示其企業與科學性能更強——這仍是廠商的說法——而程式碼方面同日也獲得了一個獨立的競技場結果:該版本在Code Arena: WebDev以1,691分首次登場即排名第一(見下方Code Arena項目)。
• CommerceAgentBench:開放權重模型居首,但屬廠商自辦評測。阿里巴巴的 Accio 團隊本週發布了 CommerceAgentBench——在真實商業與企業軟體的具狀態複本中執行 107 項長程任務,並透過 Accio、OpenClaw 和 Pi 測試框架進行基於狀態的評分。Qwen3.8-Max 以 156 次總通過數領先開放權重模型,比 DeepSeek V4 Pro 多二次;封閉模型 Claude Opus 5 以 191 次總體領先。而這份榜單來自阿里巴巴自家,並非獨立評測機構。
• Code Arena: WebDev #1 — 0902 版在獨立競技場中的結果。 Qwen3.8-Max-0902 以 1,691 分首度登上 Code Arena: WebDev 排行榜榜首——比前一版提高 22 分,並領先 Claude Opus 5 與 Kimi K3——同時以綜合約 ~$5/MToken 的價格,在該榜的性價比 Pareto 前沿居於領先,約為 Claude Opus 5 綜合價格的四分之一。Qwen 官方 QwenCloud 帳號確認了這項排名。與 CommerceAgentBench 不同,該榜單是第三方:一個盲測人工投票競技場,而非阿里巴巴的表格;不過,「以第一名首次登場」是阿里巴巴對某個時間點排名的公告。
準確性說明:本篇評測中的 Qwen3.8-Max 基準測試表由阿里巴巴自行公布,尚未經獨立重現驗證。Artificial Analysis Intelligence Index 分數(56 分,每項任務 $1.14)由 AA 在阿里巴巴官方 API 上獨立量測——AA 是該模型的第一個獨立裁判。定價來自 Alibaba Model Studio 的正式發布(GA)價目表。開放權重儲存庫(Qwen3.8-2.4T-A95B 與 Qwen3.8-2.4T-A95B-FP8)、95B 活躍參數的數字,以及授權條款文字,均為第一方資料:它們來自 Qwen 自家在 Hugging Face 的官方組織,於 2026 年 8 月 13 日完成驗證。DigitalOcean 上架的資訊、其價目表、服務效能量測數據,以及量化版本 GPQA 抽查的 88 分,皆出自 DigitalOcean 自己的文件與社群教學,並與 8 月 14 日的公告一同發布;「Day 0 上線合作夥伴」的稱呼則是阿里巴巴公告中的用語。我們所引用的競爭對手數字,不是來自 Artificial Analysis,就是來自文中點名的廠商。9 月 2 日宣布的 Qwen3.8-Max-0902 改版,其內容全數為廠商說法:它的規格、Coding-and-Cowork 後訓練(post-training)的描述,以及所宣稱的企業與科學領域增益,均來自 Qwen 自己的公告及其 QwenCloud 模型頁面;其中沒有任何數字經過獨立重現。基準測試章節提到的 Code Arena: WebDev 名次是唯一的例外:那是第三方盲選投票制的競技場,而非阿里巴巴的榜單——儘管「以 1,691 分空降第一名」是阿里巴巴針對某個時間點榜單的公告,而競技場分數會隨著票數累積持續變動。下文提到的 CommerceAgentBench 結果也屬同類:該基準由阿里巴巴國際(Alibaba International)旗下團隊 Accio 建置並發布,因此其榜單同樣是阿里巴巴自行公布的——雖是開源基準,卻不像 Artificial Analysis 那樣扮演獨立裁判的角色。廠商的基準榜單向來傾向樂觀——請把它們當作一份有待你用自身工作負載去驗證的假說,而非已成定局的排名。

什麼是Qwen3.8-Max?
Qwen3.8-Max 是阿里巴巴 Qwen 家族的旗艦模型:這是一個稀疏混合專家(MoE)模型,總參數達 2.4 兆,具備 1M token 的上下文視窗,以及原生多模態輸入。它接受文字、圖片與影片,並回傳文字。它支援思考模式、函式呼叫、內建工具與結構化輸出,並透過 OpenAI 相容的 /v1/chat/completions 端點提供服務,這表示多數現有整合僅需變更 base-URL,而無需改寫。目前的正式版本快照(9 月 2 日釋出)為 Qwen3.8-Max-0902,並進一步針對 Coding 與 Cowork 進行了後續訓練。
實際的上下文數字比行銷上的「1M」更精確一些。阿里巴巴的雲端後設資料列出983,616 token 的視窗(啟用思考功能時)、最大輸入約 991K token,以及最大輸出為 131,072 token。這個輸出上限異常寬裕,對於全檔案程式碼生成或長篇報告撰寫等任務很重要,因為較低的上限會迫使你分段後再拼接。DigitalOcean 目前提供的開放檢查點是不同配置:其模型卡列出原生 262,144 token,可擴展至約 1,010,000,因此運行開放基礎模型的第三方服務通常會落在較小的原生數字上。
活躍參數的數量現在已公開,儲存庫名稱也直接承載了這個數字:A95B 表示激活 950 億個參數。Qwen3.8-2.4T-A95B 的官方模型卡標明「總計 2.4T,激活 95B」,這是一個細粒度的混合專家(Mixture-of-Experts)模型,共有 512 個專家,其中每個 token 會激活 10 個路由專家加上 1 個共享專家。這個數字比 2.4T 這個宣傳標題更為重要。對稠密模型而言,總參數量大致能告訴你推論成本;但對 MoE 模型而言,總參數量幾乎說明不了任何事——只有激活數量才有意義,因為每個 token 實際執行的正是激活的那一部分。一個激活 30B 的 2.4T 模型,與一個激活 200B 的模型,在延遲表現與服務成本上截然不同。在激活 95B 的條件下,每個 token 的計算量落在約 90B 規模稠密模型的同一數量級——僅是稠密 2.4T 模型所需的一小部分——而正是這個數字,讓下方關於自架設的問題終於有了明確答案。
9月2日更新:Qwen3.8-Max-0902
2026年9月2日,Qwen推出了其首個具名的生產更新。Qwen3.8-Max-0902保留了相同的2.4T參數稀疏MoE架構、相同的950億活躍參數,以及相同的100萬token上下文視窗,但它在兩項能力——Coding與Cowork——上進一步進行了後續訓練,並且已在QwenCloud的API上以qwen3.8-max-0902(也列為qwen3.8-max-2026-09-02)上線。這是目前推薦的版本,而非側支:阿里巴巴的無日期qwen3.8-max端點現在服務於0902快照,因此呼叫標準模型名稱會命中此更新版本,而有日期的ID則供希望固定到確切版本的團隊使用。自9月3日起,該快照也已在第三方受管API上被列為其自身的可路由模型ID。價格表沒有變動:每100萬輸入tokens收費2美元,每100萬輸出tokens收費6美元,快取計價相同。
效能宣稱出自 Qwen 官方。公告與 QwenCloud 模型頁面描述其 Coding 能力在工程規模專案與長時程自主開發上「開創全新局面」、協作 Agent 體驗在多工具編排與端到端任務交付上「顯著增強」,以及——依該公司說法——在複雜企業任務、科學研究與長週期工作流程上擁有更強大的表現。首個獨立驗證於同日登場。Qwen3.8-Max-0902 在 Code Arena: WebDev 排行榜(原 WebDev Arena,為第三方盲測投票的代理式網頁開發競技場)以 1,691 分首度登上第一名,較前一版本高出 22 分,並領先 Claude Opus 5 與 Kimi K3——此為阿里巴巴引述即時排行榜的數據,Qwen 官方帳號亦於同日確認此排名,並指向 QwenCloud API。這項結果能證明什麼、不能證明什麼,將在下方基準測試章節詳細剖析。本次更新的其餘宣稱——企業推理、科學工作與一般長時程自主能力——仍屬廠商自述,因此請保持八月表格所適用的嚴謹態度:在 Artificial Analysis 的評測或真實工作負載確認之前,一律視為假設。
「Cowork」在實際操作中的意義,才是這次更新真正有趣的地方。正式發布(GA)時期的 Qwen3.8-Max 已著重長期任務自主性——包括為期 16 天的 oh-my-cli 建置專案,以及超過 2,000 輪的虛擬商業運作——而 0902 版本則是阿里巴巴在此一方向上加碼:讓代理人(agent)能協調多種工具、端到端交付任務,而非僅提供一次性回答。同一週,阿里巴巴的 Accio 團隊發表了 CommerceAgentBench,這是一個專門直接衡量該能力的基準:在真實商業與商務軟體的有狀態副本中執行 107 項長期任務,而 Qwen3.8-Max 在其中領先開放權重模型——詳見下方基準章節。對於正在評估該模型是否適用於企業工作的團隊而言,這是最應優先測試的主張,因為它也是最難僅從基準表就加以驗證的一點。
定價:這次發布中最激進的部分
Alibaba Model Studio 將 Qwen3.8-Max 列為每 1M 輸入 token 收費 $2.00,每 1M 輸出 token 收費 $6.00。輸出包含思考 token,這點很重要,因為推理密集的配置會以輸出費率收取其內部思考的費用。快取經濟:快取輸入命中費用為$0.25每 1M,明確快取建立費用為$2.50,明確快取讀取費用為$0.17。
結構上耐人尋味之處不在於標題數字,而在於單一價格等級。無論你的提示詞是 5,000 個 token 還是 900,000 個,阿里巴巴都收取相同的 $2/$6。大多數競爭對手會對長上下文收取附加費,正是因為服務近百萬 token 的提示詞成本高昂。阿里巴巴吸收這項成本,是一場刻意的圈地行動,目標正是那些以長上下文為關鍵的工作負載:整個程式庫的程式碼審查、合約與申報文件分析、多文件研究綜整。
實作範例。假設你執行一個 repo 分析代理程式:每次呼叫輸入 200,000 個 token(程式碼上下文),輸出 8,000 個 token。
• 每次呼叫:0.2M × $2 = $0.40 輸入,加上 0.008M × $6 = $0.048 輸出。每次呼叫 ≈ $0.45。
• 以每天1,000通電話計算: ≈ $448/天,或約 $13,400/月。
• 以 $5/$25 對 Claude Opus 5 進行的相同調用: $1.00 + $0.20 = $1.20 — 約為 2.7 倍。
• 在穩定的程式碼上下文上使用提示快取時,快取輸入的價格為 $0.25,將輸入端費用從 $0.40 降至 $0.05,使每次呼叫的成本降至 ≈ $0.10 — 這對重複流量而言幾乎減少了 4.5 倍。
真正的預算空間就在於快取價差。如果你的代理程式每輪都重新讀取幾乎未變更的上下文——多數程式設計與支援代理程式皆是如此——實際價格會更接近 $0.25/$6,而非 $2/$6。跳過快取配置的團隊,在此模型上通常會多付 3–4 倍的費用。
以定價比較:Qwen3.8-Max $2/$6;其前代 Qwen3.7-Max $2.50/$7.50;Kimi K3 $3/$15;GPT-5.6 Terra $2/$12;Claude Opus 5 $5/$25。就輸入而言,Qwen 僅具競爭力。就輸出——即推理與智能體工作中主導支出的部分——而言,它是該清單上最便宜的自稱前沿模型。
Artificial Analysis 的獨立測量揭露了那些廉價 token 的另一面。在其 Intelligence Index 上,Qwen3.8-Max 的費用為$1.14 每項任務 — 是前代產品 $0.53 的兩倍多,且比 Kimi K3 的 $0.86 高出 25%儘管 Kimi K3 的牌價是每 token $3/$15。這個差距是行為上的,而非漲價:該模型平均每個 GDPval-AA 任務需要 64 步,而 Qwen3.7-Max 只需 14 步,且由於測試框架在每一步都會重新發送完整對話,輸入 token 增加約 15 倍,輸出則約增加 45%。廉價的 token 不等於廉價的 agent——預覽測試者所指出的冗長問題,如今有了可量化的價格標籤。由於 OrcaRouter 在單一 OpenAI 相容端點背後以 0% 加價傳遞牌價,因此 $1.14 對比 $0.86 的問題,你可以用相同的提示詞來衡量,無需另簽合約。

基準測試表,以及每個數字實際衡量的內容
在GA發布時,阿里巴巴公開了預覽階段暫未公布的表格。報告的分數:
• Terminal-Bench 2.1 — 86.6.衡量模型能否操作真實的 shell 直至完成:執行命令、讀取輸出、從錯誤中恢復。這是最接近「它能作為編碼代理而非程式碼建議者運作」的指標。
• GPQA Diamond — 92.6.研究所層級的物理、化學與生物問題,撰寫時刻意設計為難以透過檢索取得答案。高分表示具備真正的科學推理能力,而非單憑記憶。92.6 位居當前領域頂尖。
• PaperBench — 93.0.重現研究論文的結果 — 閱讀方法論並重新實作。獎勵持續的多步驟理解能力。
• IFBench — 82.8。在約束條件下遵循指令:格式、長度和否定指令。值得注意的是,這是阿里巴巴自家表格中最低的分數,與預覽時期「模型過於詳盡以至於忽略範圍限制」的批評一致。
• OSWorld-Verified — 86.1.電腦操作:透過操控真實的桌面圖形介面來完成任務。此處的強勁表現支持了代理式(agentic)定位。
• OmniDocBench 1.5 — 92.1.文件解析——表格、版面、混合文字與圖形。與 1M 固定費率上下文搭配,為文件處理管線提供了有力的實際案例。
• FrontierSWE — 73.5,高於其前身的 40.7。 DeepSWE 1.1 — 56.6,高於 21.6。
最後這兩點值得強調。在困難的軟體工程基準測試上,單一世代內接近翻倍的表現並非正常的漸進式提升,而這與阿里巴巴決定將此模型定位於開發者而非聊天用戶的策略一致。如果 FrontierSWE 的數據能經得起獨立複現,Qwen3.8-Max 就是一個嚴肅的編碼模型,而不只是一個大型模型。
預覽時的警示已縮小,但尚未消失。上表由阿里巴巴在其自家測試框架上、於旁人無法檢視的條件下產生。廠商公布的數據表是挑選出來的,並非抽樣而得——各家實驗室只會發布自己表現良好的基準測試。但截至8月6日,現在有了一位真正的獨立裁判:Artificial Analysis 對 Qwen3.8-Max 的評分是:在 Intelligence Index 上取得 56 分,每個任務成本 1.14 美元,此成績基於阿里巴巴官方 API 測得——比前代的 46 分高出 10 分,與 Claude Opus 4.8(56 分)持平,落後 Kimi K3(57 分)1 分。在 AA 的 agentic GDPval-AA 排行榜上,該模型達到1,739 Elo,超越 Kimi K3(1,685)與 GPT-5.6 Sol(1,730),僅有 Claude Opus 5(1,852)領先。AA 自己的警示同樣值得重視:在端點問題解決前的一次測試為 53 分,官方 API 複測後為 56 分;AA-Omniscience 在幻覺率從 23% 升至 40% 之際下跌了 10 分;而每個任務的成本偏高,正是因為該模型會執行遠多於其他步驟的處理。LMArena 的通用排行榜仍沒有公開分數。
DigitalOcean 的發布新增了第三個數據點,這次是針對量化版本,而非旗艦版。DigitalOcean 對其提供的 NVFP4 權重所做的內部抽查顯示,在 GPQA Diamond 上取得 88 分,對比 Alibaba 公布的未量化旗艦版 92.6。DigitalOcean 自己也強調,這項比較「是一個參考性數據點,而非受控比較」——差異存在於三個面向(以開放權重為基礎而非代管的旗艦版、採用 NVFP4 而非 BF16,以及使用不同的評測堆疊)——但這是對這些權重在真實服務部署中的首次獨立檢驗,也提醒我們:開放檢查點並非與 Alibaba 表格上的數字逐位元組相同。
CommerceAgentBench:代理商務排行榜
伴隨著這次更新,阿里巴巴國際的 Accio 團隊釋出了 CommerceAgentBench——這是一個專門用來評測 Qwen 一直宣傳的長時程任務的基準。Agent 會在全新的容器中開始每項任務,容器位於 14 個真實商業與業務軟體的離線副本之一——包含產品發布、貨運預訂、店面管理、支付操作與供應商分析——且評分以狀態為基礎:只有當底層 mock 服務與產生的檔案實際發生變更時,任務才算通過;因此,若 agent 只是描述看似合理的工作流程而沒有改變狀態,就不會獲得任何分數。該套件透過 CLI、瀏覽器、檔案/文件及 API/MCP 介面執行 107 項任務,並以三個測試框架——Accio、OpenClaw 和 Pi——來執行;框架程式碼(Apache 2.0)與任務資料(CC BY 4.0)皆開放供檢視或重新執行。
在已發布的表格上,Qwen3.8-Max 取得了開放權重(open-weight)模型中最強的成績:在 Accio 評測框架上 107 項任務通過 56 項、OpenClaw 上通過 47 項、Pi 上通過 53 項——合計 156 次通過,領先 DeepSeek V4 Pro 的 154 次兩項。開放權重模型的全部優勢都來自 Accio 框架;這兩個模型在 OpenClaw 與 Pi 上打成平手。開放權重榜首並非整體榜首:閉源模型 Claude Opus 5 以 191 次合計通過橫掃全場,領先 35 次。而且這張表是阿里巴巴自家發布的——Accio 是阿里巴巴團隊的框架,該儲存庫本身也標明瞭稽核限制:Accio 僅供參考,無法從一份 checkout 重現(OpenClaw 才是可重跑的路徑);任務層級的結果缺乏不可篡改的公開校驗和;Qwen 的列別是依賴推理內容重放(reasoning-content replay)協定才得以維持可比。請把它當作廠商自述的數據點,與 OSWorld-Verified 及 AA 的 GDPval-AA 從不同角度切入同一條 agentic 軸線——值得用你自己的 workflow 去檢驗,而非一份已成定局的排名。
Code Arena WebDev:0902 版本的獨立裁判
Code Arena 正是這次更新所缺少的獨立證據。它是一個第三方排行榜,用於評估代理式網頁開發——即先前名為 WebDev Arena 的專案——將「使用者會比較願意採用哪個模型的輸出」的盲測、成對人工投票,轉換為 Elo 風格的評分。在它的 WebDev 榜單上,Qwen3.8-Max-0902 以 1,691 分首度登場即位居榜首,比前一個版本高出 22 分,並領先 Claude Opus 5 和 Kimi K3。這個名次還兼具成本效益優勢:以混合後約每百萬 token 5 美元的價格——即依照網頁應用程式生成實際會產生的輸出密集型組合所加權的 2/6 美元牌價——0902 版本是該榜單 Pareto 前沿上得分最高的模型,成本約為 Claude Opus 5 混合價格(約 20 美元/百萬 token)的四分之一,也遠低於 Kimi K3 的約 12 美元/百萬 token,因此後兩者儘管在分數上排名第 2 和第 3,卻落在前沿之外。阿里巴巴於 9 月 2 日宣布了這個名次,Qwen 的官方帳號也予以證實,並引導使用者前往 QwenCloud;這項衡量並非阿里巴巴自家數據:與上述的基準測試表或緊鄰其上的 CommerceAgentBench 測試不同,這個分數是由第三方競技場根據人類偏好投票所產生的。
有兩個但書,讓這項評比維持可信。首先,競技場評分是時點性的:阿里巴巴宣布發布之時,排行榜停在1,691,之後會隨票數累積而漂移;因此應把它視為網頁開發編碼能力的一項強烈訊號,而非永久桂冠。其次,它只涵蓋單一軸線。此次新版在企業級、科學與一般長程任務上的宣稱,仍無獨立裁判,這正是廠商比較表與基礎模型上的AA Index 56,之所以繼續作為代理式前端開發之外一切項目參考基準的原因。第三,前沿價格是一種建模選擇,而不是新的價目表:約$5/MToken這個數字,是依輸出密集的使用假設,把未變動的$2/$6牌價混合計算而來;所以應把它視為以競技場自身規則衡量的成本效率排名,而非阿里巴巴的重新定價。

開放權重、Qwen3.8-27B,以及本地部署的問題
阿里巴巴的開放權重承諾現在兌現了。2026年8月12日,Qwen在Hugging Face上發布了兩個倉庫——BF16格式的Qwen3.8-2.4T-A95B和Qwen3.8-2.4T-A95B-FP8——各含213個權重檔案。授權條款是自訂的Qwen3.8-Max授權,不是Apache 2.0;Hugging Face的授權欄位顯示為「other」。條款允許使用、修改、散布和微調,包括商業用途,但須標示出處,另外還有兩個以規模為門檻的條件:月活躍用戶超過1億或月營收超過2000萬美元的產品,必須顯著顯示模型名稱;而總計過去十二個月營收超過5000萬美元的Model-as-a-Service或AI-Work-Assistant業務,則需另行向Qwen取得授權。大多數團隊都在這些門檻之內;若你的業務超過門檻,請在開始建置之前閱讀授權全文。下載計數器也佐證了其新近性——截至撰寫本文時,BF16倉庫有978次下載,FP8倉庫有3851次,對前沿發布來說偏低,且與8月8日建立、8月12日才轉為公開的倉庫一致,而非已公開可見一週的倉庫。還有一點誠實說明:開放檢查點是基礎模型,僅文字且思維模式永遠開啟;而託管的Qwen3.8-Max API則增加了視覺輸入、可選的非思維模式,以及完整的100萬上下文——下載權重得到的是模型,而非所有API功能。
自行託管旗艦模型對大多數團隊而言仍遙不可及,但如今這份遙不可及有了明確的數學依據。完整的 2.4T 參數權重集在 BF16 格式下約為 4.9TB,在 FP8 格式下約為 2.4TB,因為儘管每個 token 只啟動 95B 個參數,所有專家都必須常駐記憶體。在 4-bit 量化下,這大約是 1.2TB,而每張 H200 約有 141GB 記憶體,因此在服務第一個 token 之前,你至少需要八顆以上的頂級加速器。如今公開的啟動參數數量補上了吞吐量這塊拼圖:每個 token 啟動 95B 參數,每個 token 的運算量相當於約 90B 等級的密集模型——僅是密集 2.4T 模型所需成本的一小部分——因此一旦權重常駐記憶體,每個 token 的成本並不像總參數量所暗示的那麼可怕。這種大記憶體佔用與適中每-token 運算量的組合,正是阿里巴巴能將輸出定價為每 1M token 6 美元的原因,也指引自行託管團隊朝向運行 FP8 檢查點的多 GPU 節點,而非任何單 GPU 方案。
DigitalOcean 的服務選擇正是這套數學在生產環境中的實際範例。它特意以 NVFP4 量化格式在 NVIDIA HGX B300 GPU 上運行模型,好讓 2.4T 的權重能裝進單一節點,避免跨節點的專家路由——這是本節紙上演算的 4-bit 經濟學的實際部署。其中的取捨正是上述 GPQA 抽檢所量化的結果:以更小的佔用空間,換來相較於未量化旗艦模型在品質上可量測的折損。
這正是讓 Qwen3.8-27B 對大多數讀者而言更具影響力的發布——而且與旗艦版不同,它的權重如期上線。2026 年 8 月 14 日,Qwen 在 Hugging Face 與 ModelScope 上以 Apache 2.0 授權發布了 Qwen/Qwen3.8-27B:這是一個密集的 27B 模型,原生多模態,原生 262K token 上下文可擴展至 1M,並具備可設定的 reasoning_effort 模式。Unsloth 的 Daniel Han 曾估計它大約只需約 17GB VRAM 即可運行——即單張專業級消費顯卡——而如今這已可實際測試:官方 repo 提供 BF16 safetensors(共 18 個分片,約 55.6GB),社群 repo 隨後也提供 GGUF 量化版本。因此,這一代的發布模式已然完整:2.4T 旗艦版的權重於 8 月 12 日先行登場,而小型本地部署路徑的模型則在兩天後跟上。我們已在 Qwen3.8-27B 發布日期文章中追蹤了這次發布。
Qwen3.8-Max 的定位:四種使用情境
1. 長文件與合約分析。這是最契合的場景。固定費率涵蓋 1M tokens,加上 OmniDocBench 92.1 的表現,代表你可以一次呼叫就處理完一份 400 頁的申報文件,無需附加費用,也無需分塊。競爭對手對長上下文收取溢價,使同樣的工作成本明顯更高。在 DigitalOcean 路徑上,請記住該路徑提供的是 262K 上下文的開放基礎——仍是大型文件,但不是完整的百萬。
2. 倉庫級編碼代理。Terminal-Bench 86.6 和 FrontierSWE 73.5 支持了這一點,而且緩存定價使得在穩定代碼庫上的迭代工作成本低廉。首先要測試的是在你自己並發條件下的延遲,因為預覽時代的評測者發現該模型在長時間的代理運行中雖然全面但速度較慢,而且正式發布(GA)服務與預覽服務是截然不同的。AA 的 GDPval-AA 結果——以每個任務 64 步為代價取得領先的 1,739 Elo——是對這種取捨兩個方面的獨立確認。DigitalOcean 於 8 月 12 日的測量結果——在 256 個並發請求下,總吞吐量近乎線性擴展至每秒約 1,937 個輸出 token,零錯誤且未發現飽和——是關於該問題的第一個託管平台數據點,儘管這些是 DigitalOcean 在其自身服務上的數據,而非與阿里巴巴的正面對比。
3. 文件與截圖管線。 影片與圖像輸入,加上 OSWorld-Verified 86.1,使其對於讀取螢幕的工作流程具有可信度——QA 自動化、從截圖進行支援分類、RPA 周邊任務。再者,多模態輸入是託管 API 的功能;DigitalOcean 開放基礎路徑僅限文字。
4. 我們暫時還不會將它應用的地方。延遲至關重要的互動式 UX,以及任何需要可重現評估的受監管工作負載。對於前者,你需要能自己掌控的實測吞吐量。對於後者,可重現性如今有了模型卡和可引用的授權,但阿里巴巴的基準測試表仍然未被複現——而 AA 的 Omniscience 回歸(幻覺率高達 40%)提醒我們,獨立評分是一把雙面刃。

如何存取 Qwen3.8-Max
有幾條實際可行的路徑。直接透過 Alibaba Model Studio / DashScope——或是 Qwen 自家的 QwenCloud API——可以取得上述費率表,並最早使用到新的日期快照版本——例如 9 月 2 日的 Qwen3.8-Max-0902 版本,就是先在該處出現,之後才陸續部署到其他端點——但代價是要導入新的供應商並管理另一組金鑰。Qwen Chat 與 Qwen App 是在撰寫程式碼前快速觀察行為最快的方式。從 Hugging Face 下載開放權重是第四條路徑,適合想要自行架設基礎設施的團隊——不過需注意上述大小與授權限制。透過路由器存取則是大多數生產環境團隊應考慮的選項,因為它能將「遷移決策」與「評測決策」分開處理。
自2026年8月14日起,出現了一個真正的新選項:Qwen3.8-Max已在DigitalOcean Serverless Inference上線,阿里巴巴宣稱其為「Day 0 launch partner」——這是阿里巴巴自己的說法,儘管該上架是DigitalOcean的且獨立成立。DigitalOcean提供開放權重檢查點(平台模型ID qwen3.8-max),經NVFP4量化,運行於NVIDIA HGX B300 GPU上,這是在與Inferact的技術合作下完成,以完全託管的無伺服器API形式提供:單一端點、按使用量計價、無需管理基礎設施。其價格表與阿里巴巴的定價一致——輸入$2.00 / 輸出$6.00每1M,快取輸入為$0.20——且提供開放基礎模型原生的262K上下文,思考功能始終開啟,而非託管旗艦版的約1M token多模態模式。如果你的工作負載偏向長上下文,這個上下文上限就至關重要:完整的百萬token模式仍僅限阿里巴巴API使用。
DigitalOcean 這條路徑除了地理優勢之外,還帶來了首個來自阿里巴巴以外提供者的實際營運數據。DigitalOcean 針對其生產端點於 8 月 12 日進行的量測顯示,prefill 擴展大致呈線性,約為每秒 16,000 個 token——經驗法則 TTFT ≈(輸入 ÷ 16,000)+ 0.7 秒,因此在約 1,080 個 token 時約 1.1 秒,在約 254K 時約 15.8 秒——而聚合吞吐量可達256 個並發請求下約每秒 1,937 個輸出 token,且零錯誤、未發現飽和點。這些是 DigitalOcean 在其自身部署上的數字,並非受控的對比測試,但這是該模型在阿里巴巴雲端以外首份延遲與並發數據,也直接回應了預覽時代「全面但緩慢」的擔憂。
Qwen3.8-Max 已在 OrcaRouter 上以 qwen/qwen3.8-max 上線,而 9 月 2 日的更新版本也可透過其專屬的日期 ID——qwen/qwen3.8-max-0902——進行路由,兩者定價同為 $2.00 / $6.00 的牌價。OrcaRouter 不加價(0% 加價),直接以供應商定價轉傳,因此兩種路由的費用都與直連相同。我們自己的服務遙測資料目前顯示,在 7 天期間內,p50 首個 token 延遲(time-to-first-token)為 1.64 秒。這是第一方的延遲測量結果,而非廠商宣稱;這點值得與預覽時期「我用過最慢的模型」的報導並列權衡:那些報導來自單一評測者在預覽基礎設施上執行長達一小時的代理式建置(agentic builds),應針對 GA 服務重新測試,而不該當作當前的既定事實重複流傳。
路由路徑的實際價值在於:Qwen3.8-Max 與您已執行的模型共用同一個 OpenAI 相容端點,因此進行評估只是一次模型字串的變更。您可以將 5% 的生產流量導向它,在完全相同的提示詞下與現有模型比較,並保留備援方案——這正是擁有未複寫供應商表格的模型應有的姿態。同樣的姿態也是測試 DigitalOcean 部署的正確方式:在備援就位的情況下,將一部分流量切片導向它,而不是將生產路徑押在一個僅上線兩週的服務堆疊上。

限制與誠實風險
• 供應商表格仍未經稽核。獨立評分已出爐(AA 指數 56),但阿里巴巴自身的基準表格仍未被複現,且 AA 的測量標記出 Omniscience 的衰退,幻覺率高達 40%。獨立評分有所幫助,但並不能使供應商表格具備可稽核性。
• DigitalOcean 路徑是開放的基礎,而非旗艦產品。它以 262K 上下文提供檢查點,純文字、始終開啟思考、NVFP4 量化——而 DigitalOcean 自家的抽查得分在 GPQA Diamond 上為 88,對比阿里巴巴公布的 92.6,DigitalOcean 稱這個差距僅具參考性,而非嚴謹對照下的結果。如果您需要完整的百萬 token 多模態 API,那仍由阿里巴巴託管。
• Qwen3.8-27B 已推出,但型號編號為廠商自訂。27B 的權重已於 8 月 14 日在 Apache 2.0 授權下釋出,填補了地端部署的缺口;但其基準測試數據僅為阿里巴巴自行公布、未獲複現,且截至本次更新,社群量化版本仍在陸續推出。
• 自訂授權,並非 Apache 2.0。Qwen3.8-Max 授權允許商業使用並需註明出處,但設有兩道規模門檻——每月活躍用戶超過 1 億或月營收超過 2,000 萬美元時,須顯著標示模型名稱;此外,若 MaaS/AI 工作助理業務近十二個月營收超過 5,000 萬美元,則需另行取得授權。在業務規模跨越這些門檻之前,請先詳閱授權條款。
• 冗長性與指令漂移。IFBench 82.8 是阿里巴巴自家表格中最弱的數字,預覽測試者屢次看到模型超出範圍——加入未要求的功能。AA 自己的數據如今為此給出了具體數字:每個 GDPval-AA 任務 64 步,將成本推高至 $1.14,比 Kimi K3 高出 25%。在演示中令人驚豔,但當輸出按 $6/1M 計費時就顯得昂貴,而當你需要精確格式時則會造成不穩定。
• 內容護欄。與其他在中國託管的前沿模型一樣,涉及政治敏感話題的回應會受到限制。若您的產品提供開放式查詢,這點便值得留意。
• 思考 token 按輸出計費。啟用推理功能後,實際成本會超出粗略估算。請按照實際發布時的推理配置進行測量。

常見問題
Qwen3.8-Max 現在已經可用了嗎?
是的。它已於 2026 年 8 月 3 日正式推出(GA),並公布了價目表,同時提供相容 OpenAI 與 DashScope 的 API。目前的生產版本快照 — Qwen3.8-Max-0902(於 9 月 2 日發布)— 已上線於 QwenCloud 的 API,也是標準 qwen3.8-max 端點目前所提供的版本。這與其 7 月 19 日的預覽狀態有所不同,當時僅限於 Qwen Chat、Qwen App 與 Qoder 的 credits 活動中開放使用。
什麼是 Qwen3.8-Max-0902?
Qwen3.8-Max-0902 是 Qwen3.8-Max 於 2026 年 9 月 2 日推出的生產版更新:沿用相同的 2.4T 參數稀疏 MoE 旗艦架構與 1M token 上下文,並進一步針對 Coding 和 Cowork 進行後訓練,同時以相同的 $2/$6 價格上線 QwenCloud 的 API。Qwen 表示,新版快照在複雜的企業級與科學任務上表現更強——這是廠商的說法,尚未經過獨立基準測試——而在程式設計這個軸向上,它已經擁有一項獨立成果:在 Code Arena: WebDev 排行榜上以 1,691 分位居第一,並以綜合約 $5/MToken 的價格位居其性價比帕累托前沿的頂端。此消息來自阿里巴巴對即時競技場上榜的公告,並經 Qwen 自家的 QwenCloud 帳號確認。
Qwen3.8-Max 的價格是多少?
每100萬個輸入Token收費$2.00,每100萬個輸出Token收費$6.00,在完整的100萬Token上下文範圍內均一價格,且無長提示詞附加費。快取輸入命中每100萬個收費$0.25,明確建立快取收費$2.50,快取讀取每100萬個收費$0.17。思考Token按輸出費率計費。在Artificial Analysis的Intelligence Index上,該模型每項任務的實測成本為$1.14——請參閱定價章節,了解為何此費用高於單純依Token計算的結果。DigitalOcean的無伺服器方案列出相同的$2/$6費率,快取輸入則為$0.20。
Qwen3.8-Max 有多少個參數?
2.4 兆總參數,採用稀疏混合專家(Mixture-of-Experts)配置。活躍參數數量——即實際決定服務成本與延遲的指標——現已根據 Qwen3.8-2.4T-A95B 官方模型卡確認為 950 億啟動參數(512 個專家;每個 token 啟動 10 個路由專家加上 1 個共享專家)。
Qwen3.8-Max 的權重是開放的嗎?
是的——自2026年8月12日起。Qwen在Hugging Face上發布了Qwen3.8-2.4T-A95B(BF16)與Qwen3.8-2.4T-A95B-FP8,各有213個權重檔案。其授權為自訂的Qwen3.8-Max授權(Hugging Face標示為「other」),而非Apache 2.0:它允許商業使用並須標示出處,同時設有兩道依規模而定的門檻。開放檢查點僅含文字,且思考模式恆常開啟;託管API則加入視覺能力、可選的非思考模式,以及完整的100萬上下文長度。
Qwen3.8-Max 是否已經過獨立基準測試?
是的——截至 2026 年 8 月 6 日。Artificial Analysis 以阿里巴巴官方 API 進行測量,在其 Intelligence Index(智慧指數)上為它打出 56 分,每個任務成本為 1.14 美元:比 Qwen3.7-Max(46 分)高出 10 分,與 Claude Opus 4.8(56 分)持平,落後 Kimi K3(57 分)1 分。不過,上述基準測試表仍是阿里巴巴自行報告、未經複現的結果,LMArena 的綜合排行榜也依然沒有公開分數。獨立競技場的情況在 9 月 2 日出現變化:0902 更新版在同一平台的 Code Arena: WebDev 排行榜上以 1,691 分首次登場即拿下第一——這是第三方盲測投票的結果,並非阿里巴巴的榜單;而 Code Arena 的成本效能前緣也將其列為該榜上綜合成本約為每百萬 Token 5 美元的得分最高之價值選擇。DigitalOcean 對其量化版本的抽查(GPQA Diamond 得分 88)是第一個針對實際服務部署的第三方檢驗,且該團隊明確表示此結果僅供參考,並非受控實驗。針對「獨立」欄位有一點提醒:CommerceAgentBench——Qwen3.8-Max 在此基準中領先所有開放權重模型——並非第二個獨立裁判,因為建置並發布該基準的 Accio 正是阿里巴巴自家的團隊。
Qwen3.8-Max 比 Qwen3.7-Max 更好嗎?
依據阿里巴巴自身的數據,幅度相當顯著——在艱難的軟體工程任務上,FrontierSWE 73.5 對比 40.7,以及 DeepSWE 1.1 的 56.6 對比 21.6,幾乎都是翻倍成長。{{1}}其價格也比前代的 $2.50/$7.50 更便宜。{{/1}}獨立來看,AA 在其 Intelligence Index 上將這次世代躍進評為 10 個百分點(56 對比 46)。{{2}}兩家廠商的說法都仍應在你的工作負載上進行驗證。{{/2}}
我可以自托管Qwen3.8-Max嗎?
實際上並不可行。完整的 2.4T 權重集合在 BF16 下約為 4.9TB,在 FP8 下約為 2.4TB,在 4-bit 下約為 1.2TB——對照每個 H200 約 141GB,這需要八顆以上的頂級 GPU。每個 token 有 95B 參數被啟用,單 token 的運算量相對不大,但記憶體佔用才是關鍵限制。DigitalOcean 在 B300 上以 NVFP4 提供服務,就是 4-bit 能將模型放入單一節點的有力證明。Qwen3.8-27B——據稱約需 17GB VRAM——是實際可行的本地部署選項;其權重已於 2026 年 8 月 14 日以 Apache 2.0 授權釋出,現在可下載,而非空頭承諾。
什麼是 Qwen3.8-27B?
與旗艦機型同步發表的更小模型,定位為務實的在地端部署路徑。這是一個密集的 27B 模型,原生支援多模態,原生上下文長度達 262K tokens,可擴展至 1M,並以 Apache 2.0 授權發布。其權重已於 2026 年 8 月 14 日上架 Hugging Face 與 ModelScope;Unsloth 的 Daniel Han 回報,該模型僅需約 17GB 的 VRAM 即可執行——相當於一張高階消費級顯示卡。其效能數據由阿里巴巴自行宣稱,尚未經獨立重現驗證。
Qwen3.8-Max 是多模態的嗎?
是的——它接受文字、影像和影片輸入,並回傳文字。它也支援思考模式、函式呼叫、內建工具和結構化輸出。開放權重的檢查點僅限文字;多模態輸入是託管 API 的功能,而 DigitalOcean 路徑並不包含此功能。
Qwen3.8-Max 是否可在 DigitalOcean 上使用?
是的——自2026年8月14日起。DigitalOcean Serverless Inference 提供開放權重檢查點(NVIDIA HGX B300 上的 NVFP4),定價為每百萬 tokens $2.00/$6.00,快取輸入 $0.20,上下文長度 262K tokens,僅限文字,思考模式始終開啟。阿里巴巴稱 DigitalOcean 為其「Day 0 發布合作夥伴」;該上架項目本身屬於 DigitalOcean,且獨立於該說法。DigitalOcean 的實測數據:在 256 個並發請求下,prefill 約 16K tokens/秒,輸出約 1,937 tokens/秒,零錯誤。
我可以透過 OrcaRouter 使用 Qwen3.8-Max 嗎?
是的。它已以 qwen/qwen3.8-max 之名上線,9 月 2 日的快照則以自有的日期識別碼 — qwen/qwen3.8-max-0902 — 提供,定價同樣為 $2.00/$6.00 牌價,加成 0%。路由成本與直接連線相同,位於您已使用的 OpenAI 相容端點之後。我們的 7 日遙測資料顯示,p50 的首個 token 延遲(time-to-first-token)為 1.64 秒。
我今天應該將生產流量轉移到它上面嗎?
不是全面更換。定價和首次獨立評分使得現在進行嚴肅評估既便宜又值得,但由於每項任務成本比 Kimi K3 高出 25%,合乎紀律的做法是在相同提示詞上,對現有方案進行流量拆分測試,並保留後備方案——而不是直接遷移。DigitalOcean 這條路線增加第二個受管部署作為對照測試,從而讓評估成本更低。
底線
Qwen3.8-Max 曾有兩週時間是最有趣、卻沒人買得到的模型。如今正式發布(GA),它的價值主張已截然不同:每百萬 token 一律 $2/$6 的定價相當激進,快取費率讓疊代式 agent 作業變得很便宜,而 FrontierSWE 與 DeepSWE 上的世代級躍進——倘若能複現——更使它成為真正的程式碼模型,而非單純的規模炫技。8 月 12 日以正式授權條款釋出的開放權重,把「開放權重即將推出」從承諾變成了事實;8 月 14 日宣布的 DigitalOcean 首日方案——附上實測的服務數據與 $0.20 快取讀取——則讓「低成本試一試」的論點更具說服力,也讓團隊擁有一個受管理的第三方部署,能拿來與阿里巴巴自家 API 相互比較。9 月 2 日的 Qwen3.8-Max-0902 更新讓上述論點依然成立:維持同樣的 $2/$6 定價與 1M 上下文,並在該模型原本就主打的程式碼與協作工作上追加更多後訓練。這次更新也為其程式碼訴求增添了一份獨立的人工偏好排行榜:Qwen3.8-Max-0902 初次登場便在 Code Arena 的 WebDev 排行榜上以 1,691 分位居第一,領先 Claude Opus 5 與 Kimi K3;以混合約 ~$5/MToken 的價格計算,它也是該排行榜成本效益 Pareto 前緣上得分最高的模型。阿里巴巴 Accio 團隊同一週發布的 CommerceAgentBench 結果——Qwen3.8-Max 在一個以真實商務工作流程打造的基準上領先所有開放權重模型——也為「協作工作」論述提供了專屬的具體成績單,儘管這份成績單是由廠商自行營運的。
改變的是:裁判與權重雙雙落地——而判決大致是正面的,不過確有實質的但書。AA 將 Qwen3.8-Max 在 Intelligence Index 上評為 56 分,名副其實的世代級躍進,與 Claude Opus 4.8 同級;但同一份評分卡也顯示,Kimi K3 領先 1 分,每任務成本低了 25%,並在幻覺率上升的背景下標出 Omniscience 下滑 10 分。啟用參數之謎已解——模型卡證實啟用 95B——授權也已公布,是客製授權而非 Apache 2.0。未曾改變的是:阿里巴巴自家的基準測試表仍未被外界複現;每任務成本依然偏高,因為模型需要耗費大量步驟運算;部署在 DigitalOcean 的開源基礎版,其實是與旗艦版頭條數字略有出入的版本(262K 上下文、NVFP4、GPQA 抽檢 88 對比 92.6);Qwen3.8-27B 的基準宣稱也仍屬原廠自行申報,儘管其權重已經釋出。這些加在一起並不會讓 Qwen3.8-Max 成為一筆壞賭注——以這個價位而言,它幾乎是不得不做的實驗——但確實代表正確的姿態是:積極評估、審慎路由、保留備援。接下來值得關注的是:每任務 1.14 美元成本背後的 agentic 步驟數,你的工作負載是否承受得起;0902 版在 Code Arena: WebDev 的領先能否隨票數累積而維持;它在 Coding 與 Cowork 的增益能否在真實工作負載上複現;CommerceAgentBench 開源權重版的領先——在阿里巴巴自家測試框架上的兩次綜合通過——能否挺過獨立執行;27B 的基準宣稱是否經得起檢驗;DigitalOcean 部署版的實測吞吐量在真實流量下又表現如何——這些將決定「僅次於 Fable 5」究竟是定位之詞,還是預言。

本文中的比較2
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
