Qwen3.8-27B基准测试汇总的标题卡片,展示一张基准测试报告卡,上面有刻有OPEN WEIGHTS的印章,以及编码、吞吐量、视觉、长上下文和本地硬件的图标,芯片上写着27B DENSE、262K CONTEXT和APACHE 2.0。
Guides & Insights

Qwen3.8-27B 基准测试:完整数据表及附带注意事项

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8-27B在 Terminal-Bench 2.1 上得分 73.0,在 SWE-bench Pro 上得分 61.7,在 LiveCodeBench v6 上得分 90.3,在 OSWorld-Verified 上得分 84.3——而这些数字全部出自阿里巴巴自身。这款拥有 270 亿参数的开源权重模型于 2026 年 8 月 14 日以 Apache 2.0 许可证上架 Hugging Face;截至 8 月 15 日,阿里巴巴以外尚无任何人独立评测过其质量。本页面提供完整且注明出处的汇总:模型卡中的全部 25 项官方基准测试、与上一代 Qwen3.6-27B 相比的变化、独立 AMD 吞吐量测试的实测结果,以及哪些说法应视为暂定结论。

在看这些数字之前先说一条阅读指南:这里的"官方"指的是Alibaba印在模型卡上的评测数据,位于Qwen/Qwen3.8-27B。该数据由厂商自行报告,且未经复现。"独立"则指由实验室以外的人进行的测量——目前这只适用于硬件吞吐量,而不适用于任何质量分数。那些评测框架(harness)的选择会影响结果的基准测试,已在文中相应位置标注。

模型,每个规范一行

• 27B 密集参数(含视觉编码器为 28B),64 层,隐藏维度 5120。

• 混合注意力——48 层 Gated DeltaNet 线性注意力层加 16 层全注意力层,比例为 3:1——这正是 262K token 窗口运行成本可负担的原因。

• 262,144 词元原生上下文,通过 YaRN 缩放可扩展至 1,000,000。

• 原生图像和视频输入(文本输出),Apache 2.0 权重,BF16 格式下约 55.6GB。

简而言之:这个模型旨在将阿里巴巴在构建 2.4 万亿参数的 Qwen3.8-Max 时学到的经验,压缩成单个 GPU 就能运行的东西。

评分卡:模型卡上的每项基准测试

以下所有分数均来自阿里巴巴8月14日的模型卡,括号内为被该模型取代的Qwen3.6-27B的分数。

编码。Terminal-Bench 2.1(智能体终端编码)73.0(63.4);SWE-bench Pro 61.7(53.5);QwenSWEBench 79.0(49.3);DeepSWE 1.1 42.2(13.3);NL2Repo-Bench 42.3(36.2);LiveCodeBench v6 90.3(83.9)。根据模型卡脚注,SWE-bench Pro 和 QwenSWEBench 的运行使用了 Claude Code 测试框架——在与其他使用不同测试框架评分的模型进行比较之前,值得牢记这一点。

长时程智能体与办公工作。 CoWorkBench 70.7 (61.0);JobBench 33.4 (21.8);Agents' Last Exam Pass@1 20.4 / 得分 42.9 (10.6 / 27.3)。

推理与知识。 GPQA Diamond 89.2(87.8);Humanity's Last Exam 30.8(24.0);IFBench 指令遵循 79.5(69.1)。HLE 由 GPT-4o 评判,如模型卡所述。

视觉与计算机使用。 OSWorld-Verified 84.3 (63.9);WebArena-Verified 64.8 (48.8);AndroidWorld 81.9 (70.3);MathVision 94.6(开启CI)/ 90.0(关闭CI)(85.1);BabyVision 85.6(开启CI)/ 65.7(关闭CI)(28.9);OmniDocBench 1.5 91.1 (89.4);RealWorldQA 85.9 (84.1)。“CI”是 Alibaba 的推理时增强技术;其开启与关闭状态之间的差距,是卡片上最能说明你能用额外推理算力换取多少分数的单一数字。

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

相比 Qwen3.6-27B,实际有哪些变化?

卡片上的每一项基准测试都上涨了,但增量并不均匀——而改进的形态才是关键。收益集中在智能体编码和计算机使用方面,而非知识召回:

• DeepSWE 1.1(智能体编码)13.3 → 42.2,约 3 倍提升。

• QwenSWEBench 49.3 → 79.0

• Agents' Last Exam 得分 27.3 → 42.9

• OSWorld-Verified 63.9 → 84.3 和 AndroidWorld 70.3 → 81.9

• BabyVision(含置信区间)28.9 → 85.6 — 该卡片上最大的相对提升

与此同时,GPQA Diamond 从 87.8 升至 89.2,RealWorldQA 从 84.1 升至 85.9:确有提升,但幅度很小。这不是一次“事事皆更聪明”的发布,而是明确面向那些读取屏幕、使用工具并跨多步骤编写代码的智能体的发布。

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

坦诚的差距:它仍然失败的地方,以及方法论上的注意事项

面对前沿模型,表现令人欣喜,但也并非一边倒。在 Qwen3.8-27B 与 Claude Opus 4.6 Max 重叠的基准测试中,Qwen 赢下了大多数——SWE-bench Pro、QwenSWEBench、CoWorkBench、LiveCodeBench v6、OSWorld-Verified、AndroidWorld、IFBench,以及整个视觉板块。面对 Meta 的 Muse Glimmer-30B——这个自然而然的本土同类对手——它在全部八项重叠基准测试中取得完胜。不过,在 Terminal-Bench 2.1(73.0 对 78.2)、GPQA Diamond(89.2 对 91.3)、Humanity's Last Exam(30.8 对 40.0)和 NL2Repo-Bench(42.3 对 47.6)上,它仍然输给了 Claude Opus 4.6 Max。如果你的工作负载属于最艰难的前沿推理——前沿数学、大规模多学科问题——27B 还达不到那个水平。

在你引用这些内容之前,有三个注意事项。首先,这些内容都没有经过独立验证;截至8月15日,27B模型没有Artificial Analysis指数,也没有LMArena跑分,而阿里巴巴自己的测试框架并不是第三方会使用的。其次,模型卡对SWE-bench Pro和QwenSWEBench使用了Claude Code测试框架,对Humanity's Last Exam使用了GPT-4o裁判——与其他设置下评分的模型进行比较会改变数字。第三,阿里巴巴的MathVision运行使用了固定提示词,而竞争对手使用的是两个变体中较高的那个。这些都不意味着结果是错误的;而是意味着在其他人运行该模型之前,这些结果是上限,而不是下限。

运行它需要什么

Qwen3.8-27B 是一个本地模型,这改变了{{1}}性能{{/1}}的含义:{{2}}是在你自己硬件上的吞吐量,而不是价格表上的数字{{/2}}。BF16 权重大约 55.6GB;量化为 4-bit 后可以装进 24GB 的显卡,例如 RTX 3090 或 4090。AMD 在发布当天提供了 Day-0 支持,其自己的 llama.cpp/Vulkan 测量结果——{{3}}2026 年 8 月,三次及以上运行的平均值{{/3}}——显示:在配备{{4}}超过约 24GB 可变图形内存或 VRAM{{/4}}的系统上,Ryzen AI Max+ 395 达到 24.5 tokens/s,配备 32GB 显存的 Radeon AI PRO R9700 达到 51.8 tokens/s。社区对 NVIDIA GH200 上 FP8 版本的测试显示,它能够维持 10 个并发 262K 上下文请求,首个 token 的生成时间低于 10 毫秒。你自己的数字会有所不同——{{5}}那些是别人的 GPU{{/5}}——但整体趋势是真实的:这是同类中第一个 Qwen 版本,它{{6}}不只是能在评测中运行,而是能在单台工作站上运行{{/6}}。

免费权重,还是付费API?

这个模型迫使你做出的决定,正是本地部署与托管部署之间的分水岭:权重本身免费,但你的GPU并不是免费的。自托管意味着你要拥有芯片——如果能接受4位量化和较慢的生成速度,一块24GB的显卡就够;如果想要完整262K上下文且保持全质量,则需要更大的显卡。OrcaRouter上的托管方案是每百万输入token 0.33美元、每百万输出token 2.40美元,同样支持262K上下文和图像+视频输入,过去七天内测得的p50首token延迟为225毫秒——无需购买GPU,也无需操心VRAM。这笔账就是你面对开放权重时总要算的那笔账:用你实际需要的token吞吐量乘以每token成本,再对比一张显卡的固定价格。在持续高吞吐量下,自托管更胜一筹;而在突发性或中等规模的用量下,按0.33/2.40美元付费比买一块大部分时间闲置的显卡更划算。

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

底线

Qwen3.8-27B 是阿里巴巴在该尺寸级别中发布的最强开源权重模型——根据阿里巴巴自己的数据:在智能体编码、计算机使用和视觉推理方面均名列前茅,拥有 262K 上下文窗口和 Apache 2.0 权重。正确解读这份成绩单需要附加条件:所有数据均由厂商自行报告、依赖特定测试框架,且尚未得到复现;同时,前沿模型在最具挑战性的推理基准上仍然胜出。如果你正在决定是自行部署还是通过 API 调用它,请将基准测试表视为其承诺,而 AMD 的吞吐量数据则是目前唯一存在的独立测量结果。一旦有独立实验室公布分数,我们将在当天更新此页面。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube