Qwen3.8-27B 基準測試綜述的標題卡,顯示一張基準測試報告卡,上面有一個寫著 OPEN WEIGHTS 的印章,以及程式設計、吞吐量、視覺、長上下文和本地硬體的圖示,並帶有寫著 27B DENSE、262K CONTEXT 和 APACHE 2.0 的標籤。
Guides & Insights

Qwen3.8-27B 基準測試:完整表格與附帶注意事項

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Qwen/Qwen3.8-27B 在 {{1}}Terminal-Bench 2.1 取得 73.0、SWE-bench Pro 取得 61.7、LiveCodeBench v6 取得 90.3、OSWorld-Verified 取得 84.3{{/1}}——而這些數字全都是阿里巴巴自己公布的。這款擁有 270 億參數的開放權重模型於 2026 年 8 月 14 日以 Apache 2.0 授權上架 Hugging Face,並在發布後的頭兩週內就取得了 {{2}}三項獨立的第三方測試結果:在由法律 AI 公司 Harvey 與記憶體公司 Engram 所執行的研究中,於 Harvey 的 Legal Agent 基準上拿下開放權重第一名;在 Code Arena 的 WebDev 排行榜上名列總排名第九,是該尺寸級別中唯一進入前十名的模型,此結果根據阿里巴巴於 8 月 25 日的公告;以及 8 月 26 日公布的 Arena.ai 的 Image-to-WebDev 排行榜開放權重第一名,總排名第七,據報分數為 1,574{{/2}}。本頁是完整且附出處的詳細彙整:{{3}}模型卡上的全部 25 項官方基準、與前代 Qwen3.6-27B 相比的變化、獨立 AMD 吞吐量測試的實測結果、上述 Legal Agent 與 WebDev Arena 的結果,以及哪些說法你仍應視為暫時性的{{/3}}。

在讀取這些數字之前,先說明一下:這裡的「官方」指的是阿里巴巴印在 Qwen/Qwen3.8-27B 模型卡上的評測數據,屬於廠商自行申報、未經再現驗證的結果。「獨立」則指由實驗室外部的人員所量測——目前涵蓋了一項硬體吞吐量測試、一項法律領域的 AI 代理研究,以及在 Arena.ai 兩個網頁開發排行榜上的名次:Code Arena 的 WebDev 與 Image-to-WebDev 競技場。凡是評測框架(harness)會影響結果的基準測試,都會以行內標註標示。

模型,每個規格一行。

• 27B 密集參數(包含視覺編碼器則為 28B),64 層,隱藏層大小 5120。

• 混合注意力 — 48 個 Gated DeltaNet 線性注意力層,加上 16 個全注意力層,比例為 3:1 — 這正是讓 262K token 的上下文窗口得以低成本運行的原因。

• 262,144 tokens 原生上下文,可透過 YaRN 擴展至 1,000,000。

• 原生影像和影片輸入(文字輸出),Apache 2.0 權重,約 55.6GB(BF16 格式)

簡而言之:這個模型旨在吸收阿里巴巴在構建2.4萬億參數的Qwen3.8-Max時所學到的經驗,並將其壓縮成單一GPU即可運行的東西。

記分卡:模型卡上的每一項基準測試

以下所有分數均為阿里巴巴在8月14日模型卡上報告的數據,括號內為該模型所取代的Qwen3.6-27B分數。

程式設計。Terminal-Bench 2.1(代理式終端編碼)73.0(63.4);SWE-bench Pro 61.7(53.5);QwenSWEBench 79.0(49.3);DeepSWE 1.1 42.2(13.3);NL2Repo-Bench 42.3(36.2);LiveCodeBench v6 90.3(83.9)。根據模型卡片的註腳,SWE-bench Pro 和 QwenSWEBench 的測試執行使用了 Claude Code 測試框架——在與以不同測試框架評分的模型進行比較之前,值得牢記這一點。

長時程代理器與辦公室工作。 CoWorkBench 70.7 (61.0);JobBench 33.4 (21.8);Agents' Last Exam Pass@1 20.4 / 分數 42.9 (10.6 / 27.3)。

推理與知識。 GPQA Diamond 89.2 (87.8);Humanity's Last Exam 30.8 (24.0);IFBench 指令遵循 79.5 (69.1)。HLE 由 GPT-4o 評分,依據模型卡片。

視覺與電腦使用。 OSWorld-Verified 84.3 (63.9);WebArena-Verified 64.8 (48.8);AndroidWorld 81.9 (70.3);MathVision 94.6 (使用 CI)/90.0 (未使用) (85.1);BabyVision 85.6 (使用 CI)/65.7 (未使用) (28.9);OmniDocBench 1.5 91.1 (89.4);RealWorldQA 85.9 (84.1)。「CI」是阿里巴巴的推論時增強技術;其開啟與關閉狀態之間的差距,是這張卡上最能說明你能用額外推論算力換取多少分數的單一數字。

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

與 Qwen3.6-27B 相比,實際上有什麼改變?

該評測卡上的每一項基準測試成績都有所提升,但變化幅度並不一致——而改善的形態才是重點所在。這些提升集中在代理式編碼和電腦使用上,而不是知識檢索:

• DeepSWE 1.1(代理式編碼)13.3 → 42.2,約為 3 倍的躍進。

• QwenSWEBench 49.3 → 79.0

• Agents 的 Last Exam 成績 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 以及 AndroidWorld 70.3 → 81.9

• BabyVision(含CI)28.9 → 85.6 — 卡片上最大的相對增幅

同時,GPQA Diamond 從 87.8 升至 89.2,RealWorldQA 則從 84.1 升至 85.9:確實有進步,但幅度不大。這不是一個「各方面都更聰明」的版本,而是一個明確鎖定能讀取螢幕、使用工具,並跨多個步驟編寫程式碼之代理(agents)的版本。

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

自這個頁面上線以來,最重要的進展是在法律方面,而非技術方面。阿里巴巴宣布 Qw​en3.8-27B 在 Harvey 的 Legal Agent 基準測試中成為排名第一的開放權重模型——這項排名主張出自供應商自己的帳號,因此應視為阿里巴巴的官方說法。其背後的成果來自一項並非阿里巴巴所做的研究:法律AI公司 Harvey 與 AI 記憶新創 Engram 聯手打造了一家名為 Calderwood & Harkness 的合成律師事務所,由超過1億個 token 組成,涵蓋約1萬份文件與266個案件,接著利用參數化記憶、壓縮筆記及檢索工具,將 Qw​en3.8-27B 調適到該事務所的情境中。

在250項法律任務中,經過調整的27B模型平均得分67%,領先該研究測試的所有模型——包括Claude Opus 4.8——而在嚴格的全對或全錯正確性方面,它以30%對25%領先Opus 4.8,每次查詢成本約為0.13美元,相較於Opus 4.8的1.32美元。這些數據由Harvey/Engram報告,尚未被獨立重現。在同一模型接受該事務所自身文件訓練之前,針對事務所特定問題的得分僅為4.7%;在研讀這些文件後,得分達到72.6%。

閱讀第一名時有一個重大但書:在該基準測試中奪冠的模型,事先研究過測試語料庫,在評估之前已針對該公司的 1 億個 token 進行了適應性調整。這使得此結果成為對 27B 在特定領域調校下能吸收多少知識的展示,而非在中立測試框架中對原始 Apache-2.0 權重的評分——而且它只涵蓋一個領域,即法律,而非整體品質。它確實支持的,是那則推文背後的主張:一個小到能在本機機器上執行的 27B 模型,一旦具備正確的知識,就足以勝任專業級的工作。

第二個獨立結果:在 Code Arena 的 WebDev 中總排名第9

第二個獨立的結果是關於程式設計的,而這就是這個頁面在8月25日變更的原因。Code Arena 是 Arena.ai 的網頁開發排行榜——這個專案以前名為 WebDev Arena,位於以前名為 LMArena 的網站上——使用者可以使用匿名配對的模型來建立真實應用程式,並投票選出他們比較想發布的輸出。在那個公開排行榜上,Qw​en3.8-27B 整體排名第9,分數為1595,是前十名中唯一屬於其尺寸級別的模型。

這個排名是獨立的事實——它位於任何人都能開啟的第三方排行榜上。圍繞此排名的頭條說法出自阿里巴巴:「唯一進入前十名的小型模型」這一框架,以及配套的排名,皆來自 Qw​en 於 8 月 25 日的公告。這些內容值得在標明出處的情況下重複提及。27B 的排名比規模大得多的 Qwen3.8-Max(該公告將其列為總排名第 3 名)低六個名次,並遠高於規模相近的 Gemma 4-31B(同一公告將其列為第 80 名)。重點不在於一個 27B 模型在建構 Web 應用程式方面擊敗了前沿模型;而在於一個小到足以在單張 GPU 上運行的模型,竟能躋身盲測程式設計競技場的前十名,而該競技場中的其他參與者都是規模大得多的模型。

第三個獨立結果:在 Arena.ai 的 Image-to-WebDev 上排名第一的開放模型

第三項獨立結果於8月26日出爐,而且是迄今為止對這個尺寸的模型來說最強勁的表現。Image-to-WebDev 是 Arena.ai 上 Code Arena 的 WebDev 的姊妹榜——在這個競技場中,模型會獲得一張截圖或其他視覺參考,並必須將其轉換成可運作的網頁介面,由盲測的真人投票者選出他們較想推出的輸出。在那個公開排行榜上,Qw​en3.8-27B 在開放模型中排名第1、整體排名第7,回報的競技場分數為1,574。

排名本身是獨立的部分——它位於任何人都能開啟的第三方排行榜上。圍繞它的標題是由阿里巴巴發布的:Qwen 團隊在 8 月 26 日的公告中,稱 27B 在此測試中「與規模大 100 倍的模型相當」,這是排行榜並未記載的比較。此外,偏好排名並非程式碼品質的判定——Image-to-WebDev 的投票衡量的是人類會比較願意發布哪個輸出,而非 HTML 是否安全、無障礙或易於維護。這個結果真正確立的是:一款 27B 開源權重模型,目前在將圖片變成網頁這項能力上領先整個開源領域,而這正是日益成長的「截圖轉網站」產品類別所賴以建立的基礎。

誠實的差距:它仍然不足之處,以及方法論上的注意事項

相對於前沿模型,整體情況雖令人滿意,但並非一面倒。在 Qw​en3.8-27B 與 Claude Opus 4.6 Max 重疊的項目中,Qw​en 贏得了大多數——SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench,以及整個視覺區塊。對上 Meta 的 Muse Glimmer-30B(本地同級的自然對手),它直接贏得了全部八個重疊基準測試。但它仍然在 Terminal-Bench 2.1(73.0 對 78.2)、GPQA Diamond(89.2 對 91.3)、Humanity's Last Exam(30.8 對 40.0)和 NL2Repo-Bench(42.3 對 47.6)輸給 Claude Opus 4.6 Max。如果你的工作負載屬於最艱難的前沿推理——前沿數學、大規模跨學科問題——那 27B 尚未達到那個水準。

在引用任何這些內容之前,有三點需要注意。首先,上方的模型卡表格仍完全是阿里巴巴自行申報的——目前還沒有針對 27B 的 Artificial Analysis 指數。目前已有三個獨立的第三方結果,但每個都範圍狹窄:Code Arena 排行榜衡量的是根據文字提示建構 Web 應用程式的能力,Image-to-WebDev 排行榜衡量的是將截圖轉換成可用網頁的能力,兩者皆由對匿名輸出進行盲選投票來評判;而 Harvey 法律代理研究則僅涵蓋單一領域,且使用為該測試訓練的模型。這些都不是在通用型測試基準上運行原始權重的結果。其次,模型卡對 SWE-bench Pro 和 QwenSWEBench 使用了 Claude Code 測試框架,並以 GPT-4o 作為 Humanity's Last Exam 的評判者——與在其他設定下評分的模型進行比較時,數字會有所變動。第三,阿里巴巴的 MathVision 測試使用了固定提示詞,而競爭對手則採用了兩個變體中較高的一個。這些都不代表結果有誤;而是表示在獨立實驗室於中立的通用型測試基準上運行該模型之前,這些數字是上限,而非下限。

運行它所需要的一切

Qw​en3.8-27B 是一個本地端模型,這改變了「效能」的意義:吞吐量取決於你自己的硬體,而不是價格表上的數字。BF16 權重大約 55.6GB;量化至 4-bit 後,可放入 24GB 的顯示卡,例如 RTX 3090 或 4090。AMD 在發表當天就提供 Day-0 支援,其自家的 llama.cpp/Vulkan 量測——2026 年 8 月,三次以上取平均——在 Ryzen AI Max+ 395 上為 24.5 tokens/s,在配備 32GB 的 Radeon AI PRO R9700 上為 51.8 tokens/s,這些系統具備超過約 24GB 的可變顯示記憶體或 VRAM。社群對 NVIDIA GH200 上 FP8 版本的測試,可同時應付 10 個 262K 上下文的請求,且首次輸出時間(time-to-first-token)低於 10 毫秒。你自己的數字會有所不同——那些是別人的 GPU——但整體輪廓是真實的:這是 Qw​en 同級產品中第一個能在單一工作站上運行、而不只是出現在評測中的版本。

自由重量,還是付費 API?

這個模型迫使你做出的決定,正是劃分本地部署與託管服務的那道界線:權重本身免費,但你的 GPU 並非免費。自行託管意味著擁有實體硬體——若你接受 4-bit 量化與較慢的生成速度,一張 24GB 顯示卡便足夠;若想以全品質使用完整的 262K 上下文,則需要更大的卡。OrcaRouter 上的託管替代方案為每百萬輸入 tokens 0.33 美元、每百萬輸出 tokens 2.40 美元,同樣具備 262K 上下文與圖片加影片輸入,且過去七天測得的 p50 首 token 延遲為 225 毫秒——無需購買 GPU,也無需費心看管 VRAM。這道算術正是你面對開放權重時始終要做的:你實際需要的 token 吞吐量乘以每個 token 的成本,對比一張卡的固定價格。在高持續流量的情況下,自行託管勝出;在突發或適度流量的情況下,支付 0.33/2.40 美元比購買你大多閒置的硬體更划算。

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

底線

Qw​en3.8-27B 是阿里巴巴在此尺寸等級中推出的最強開源權重模型,根據阿里巴巴自身的數據:在代理式編碼、電腦使用與視覺推理方面均為表中最佳,具備 262K 上下文視窗與 Apache 2.0 權重。對這份成績單的正確解讀是有條件的——每一項模型卡數據皆為廠商自行回報、依特定測試框架而定,且尚未經獨立重現,而最先進模型在最困難的推理基準上仍居領先。如果你正在決定要自行部署它還是以 API 呼叫,請將基準測試表視為承諾,將 AMD 吞吐量數據視為第一份獨立的硬體量測,將 Harvey 法律代理測試結果視為第一個獨立跡象,顯示該模型的能力在阿里巴巴自家測試框架之外依然成立,並將兩個 WebDev 競技場排名——Code Arena 的 WebDev 整體第 9 名,以及 Arena.ai 的 Image-to-WebDev 開源模型第 1 名——視為該能力在獨立程式碼排行榜上的首批確認。隨著更多獨立實驗室公布分數,我們將持續更新此頁面。