
Qwen3.8-27B 基準測試:完整表格與附帶注意事項
- obsidian新Qwen3.8 27B Uncensored (Aggressive)2026-08-1552智能68程式
- qwen新Qwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseek新DeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69程式
- grok新SpaceXAI: Grok 4.62026-08-1261智能77程式
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
Qwen3.8-27B在 Terminal-Bench 2.1 獲得 73.0 分、SWE-bench Pro 獲得 61.7 分、LiveCodeBench v6 獲得 90.3 分、OSWorld-Verified 獲得 84.3 分——而這些數字全部是阿里巴巴自行測得。這個擁有 270 億參數的開放權重模型已於 2026 年 8 月 14 日以 Apache 2.0 授權登上 Hugging Face;截至 8 月 15 日,阿里巴巴之外尚無任何人獨立評測過其品質。本頁提供完整且附有來源的彙整:模型卡上全部 25 項官方基準測試、與前代 Qwen3.6-27B 的差異、獨立 AMD 吞吐量測試的測量結果,以及哪些說法你應視為暫時性資料。
閱讀數字前先看說明:「官方」在此指阿里巴巴在模型卡上印出的評測結果,位於Qwen/Qwen3.8-27B。該結果由供應商自行報告,尚未經獨立重現。「獨立」則指實驗室以外的人員所測量——目前僅適用於硬體吞吐量,而非任何品質分數。評測框架會影響結果的基準測試,已在文中標示。
模型,每個規格一行。
• 27B 密集參數(包含視覺編碼器則為 28B),64 層,隱藏層大小 5120。
• 混合注意力 — 48 個 Gated DeltaNet 線性注意力層,加上 16 個全注意力層,比例為 3:1 — 這正是讓 262K token 的上下文窗口得以低成本運行的原因。
• 262,144 tokens 原生上下文,可透過 YaRN 擴展至 1,000,000。
• 原生影像和影片輸入(文字輸出),Apache 2.0 權重,約 55.6GB(BF16 格式)
簡而言之:這個模型旨在吸收阿里巴巴在構建2.4萬億參數的Qwen3.8-Max時所學到的經驗,並將其壓縮成單一GPU即可運行的東西。
記分卡:模型卡上的每一項基準測試
以下所有分數均為阿里巴巴在8月14日模型卡上報告的數據,括號內為該模型所取代的Qwen3.6-27B分數。
程式設計。Terminal-Bench 2.1(代理式終端編碼)73.0(63.4);SWE-bench Pro 61.7(53.5);QwenSWEBench 79.0(49.3);DeepSWE 1.1 42.2(13.3);NL2Repo-Bench 42.3(36.2);LiveCodeBench v6 90.3(83.9)。根據模型卡片的註腳,SWE-bench Pro 和 QwenSWEBench 的測試執行使用了 Claude Code 測試框架——在與以不同測試框架評分的模型進行比較之前,值得牢記這一點。
長時程代理器與辦公室工作。 CoWorkBench 70.7 (61.0);JobBench 33.4 (21.8);Agents' Last Exam Pass@1 20.4 / 分數 42.9 (10.6 / 27.3)。
推理與知識。 GPQA Diamond 89.2 (87.8);Humanity's Last Exam 30.8 (24.0);IFBench 指令遵循 79.5 (69.1)。HLE 由 GPT-4o 評分,依據模型卡片。
視覺與電腦使用。 OSWorld-Verified 84.3 (63.9);WebArena-Verified 64.8 (48.8);AndroidWorld 81.9 (70.3);MathVision 94.6 (使用 CI)/90.0 (未使用) (85.1);BabyVision 85.6 (使用 CI)/65.7 (未使用) (28.9);OmniDocBench 1.5 91.1 (89.4);RealWorldQA 85.9 (84.1)。「CI」是阿里巴巴的推論時增強技術;其開啟與關閉狀態之間的差距,是這張卡上最能說明你能用額外推論算力換取多少分數的單一數字。

與 Qwen3.6-27B 相比,實際上有什麼改變?
該評測卡上的每一項基準測試成績都有所提升,但變化幅度並不一致——而改善的形態才是重點所在。這些提升集中在代理式編碼和電腦使用上,而不是知識檢索:
• DeepSWE 1.1(代理式編碼)13.3 → 42.2,約為 3 倍的躍進。
• QwenSWEBench 49.3 → 79.0
• Agents 的 Last Exam 成績 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 以及 AndroidWorld 70.3 → 81.9
• BabyVision(含CI)28.9 → 85.6 — 卡片上最大的相對增幅
同時,GPQA Diamond 從 87.8 升至 89.2,RealWorldQA 則從 84.1 升至 85.9:確實有進步,但幅度不大。這不是一個「各方面都更聰明」的版本,而是一個明確鎖定能讀取螢幕、使用工具,並跨多個步驟編寫程式碼之代理(agents)的版本。

誠實的差距:它仍然不足之處,以及方法論上的注意事項
與前沿模型相比,情況看起來很有利,但並非一面倒。在 Qwen3.8-27B 與 Claude Opus 4.6 Max 重疊的項目中,Qwen 贏得大多數——包括 SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench,以及整個視覺區塊。對上 Meta 的 Muse Glimmer-30B,也就是自然的本地等級競爭對手,它直接贏得全部八個重疊基準。但它仍然輸給 Claude Opus 4.6 Max,分別是 Terminal-Bench 2.1(73.0 對 78.2)、GPQA Diamond(89.2 對 91.3)、Humanity's Last Exam(30.8 對 40.0)和 NL2Repo-Bench(42.3 對 47.6)。如果你的工作負載是最艱難的前沿推理——前沿數學、大規模跨學科問題——那 27B 還不到那個水準。
在引用這些內容之前,有三點注意事項。第一,這些內容均未經獨立驗證;截至8月15日,27B模型既沒有Artificial Analysis指數,也沒有LMArena評測,而且阿里巴巴自己的測試框架並非第三方會使用的。第二,模型卡片使用Claude Code框架進行SWE-bench Pro和QwenSWEBench評測,並使用GPT-4o裁判來評判Humanity's Last Exam——與在其他設置下評分的模型進行比較,數字會有所變動。第三,阿里巴巴的MathVision測試使用了固定的提示詞,而競爭對手則使用了兩個變體中較高的一個。這些都不代表結果是錯的;而是意味著,在其他人運行該模型之前,這些數字是上限,而非下限。
運行它所需要的一切
Qwen3.8-27B 是一個本地模型,這改變了「效能」的含義:它指的是在你自家硬體上的吞吐量,而不是價格表上的數字。BF16 權重約為 55.6GB;量化到 4 位元後可放進 24GB 的顯示卡,例如 RTX 3090 或 4090。AMD 在發布當天就提供了首日支援,其自家的 llama.cpp/Vulkan 測量數據(2026年8月,三次或更多次運行取平均)顯示,在 Ryzen AI Max+ 395 上為 24.5 tokens/秒,在配備 32GB 的 Radeon AI PRO R9700 上為 51.8 tokens/秒,測試系統具備超過約 24GB 的可變圖形記憶體或 VRAM。社群對 NVIDIA GH200 上 FP8 版本的測試顯示,可同時維持 10 個 262K 上下文的請求,且首個 token 延遲低於 10 毫秒。你自己的數字會有所不同——那些是別人的 GPU——但整體輪廓是真實的:這是 Qwen 在此級別中首次發布的版本,不僅能在評測中運行,也能在單一台工作站上實際運行。
自由重量,還是付費 API?
這個模型迫使你做出的決定,正是劃分本地部署與託管服務的那道界線:權重本身免費,但你的 GPU 並非免費。自行託管意味著擁有實體硬體——若你接受 4-bit 量化與較慢的生成速度,一張 24GB 顯示卡便足夠;若想以全品質使用完整的 262K 上下文,則需要更大的卡。OrcaRouter 上的託管替代方案為每百萬輸入 tokens 0.33 美元、每百萬輸出 tokens 2.40 美元,同樣具備 262K 上下文與圖片加影片輸入,且過去七天測得的 p50 首 token 延遲為 225 毫秒——無需購買 GPU,也無需費心看管 VRAM。這道算術正是你面對開放權重時始終要做的:你實際需要的 token 吞吐量乘以每個 token 的成本,對比一張卡的固定價格。在高持續流量的情況下,自行託管勝出;在突發或適度流量的情況下,支付 0.33/2.40 美元比購買你大多閒置的硬體更划算。

底線
「根據阿里巴巴自己的數據,Qwen3.8-27B 是阿里巴巴在這個尺寸等級中推出過最強大的開放權重模型:在代理式編碼、電腦使用與視覺推理方面均為表內最佳,並具備 262K 上下文視窗與 Apache 2.0 權重。正確解讀這份成績單必須有所保留——每一項數字皆由廠商申報、依特定測試框架而定,且尚未經獨立重現;而在最困難的推理基準上,前沿模型仍舊勝出。如果你正在決定要自行部署它,還是以 API 方式呼叫,請把基準測試表視為承諾,而 AMD 的吞吐量數據則是目前唯一存在的獨立測量結果。一旦有獨立實驗室發布分數,我們就會更新本頁。
